Theoretical foundations of large language models — LLM-এর তাত্ত্বিক ভিত্তি
বৃহৎ ভাষা মডেলের তাত্ত্বিক ভিত্তি (Transformer আর্কিটেকচারের উপর ভিত্তি করে) — এটি গাণিতিক, পরিসংখ্যানগত এবং তথ্য-তাত্ত্বিক নীতিসমূহের একটি সমষ্টি, যা আধুনিক বৃহৎ ভাষা মডেলের (LLM) কার্যকারিতা, প্রশিক্ষণ এবং সক্ষমতার ভিত্তি গঠন করে। এই ভিত্তিগুলি ব্যাখ্যা করে যে কীভাবে Transformer আর্কিটেকচারের উপর নির্মিত মডেলগুলি উচ্চ মাত্রার সংহতি (coherence) সহকারে মানব ভাষা বুঝতে এবং তৈরি করতে সক্ষম।
আর্কিটেকচারগত ভিত্তি: Transformer আর্কিটেকচার
আধুনিক LLM প্রায় সম্পূর্ণরূপে Transformer আর্কিটেকচারের উপর ভিত্তি করে গড়ে উঠেছে, যা ২০১৭ সালে «Attention Is All You Need» গবেষণাপত্রে উপস্থাপিত হয়েছিল। এই আর্কিটেকচার পুনরাবৃত্তিমূলক স্তরগুলি (RNN এবং LSTM-এর মতো) পরিত্যাগ করে attention প্রক্রিয়ার উপর নির্ভর করে, যা দীর্ঘ ক্রম কার্যকরভাবে প্রক্রিয়া করতে এবং গণনা সমান্তরালভাবে চালাতে সক্ষম করে।
Self-Attention - স্ব-মনোযোগ প্রক্রিয়া
এটি Transformer আর্কিটেকচারের মূল অংশ। Self-attention প্রক্রিয়া মডেলকে একটি ক্রমের প্রতিটি শব্দের (token) গুরুত্ব একই ক্রমের অন্য সমস্ত শব্দের সাপেক্ষে নির্ধারণ করতে সক্ষম করে। প্রতিটি token-এর জন্য তিনটি ভেক্টর তৈরি করা হয়:
- Query (Q, প্রশ্ন): বর্তমান শব্দটিকে উপস্থাপনকারী ভেক্টর।
- Key (K, চাবি): ভেক্টর, যার সাথে অন্য শব্দগুলির প্রশ্নগুলি তুলনা করা হয়।
- Value (V, মান): ভেক্টর, যাতে শব্দটি সম্পর্কিত তথ্য থাকে এবং যা পরবর্তীতে প্রেরণ করা হবে।
Attention স্কোর স্কেল করা ডট প্রোডাক্ট হিসেবে গণনা করা হয়:
যেখানে হল Key ভেক্টরের মাত্রা। এই প্রক্রিয়া মডেলকে শব্দগুলির মধ্যবর্তী দূরত্ব নির্বিশেষে জটিল প্রাসঙ্গিক নির্ভরতা ধারণ করতে সক্ষম করে।
Multi-Head Attention — এটি বিভিন্ন প্রজেকশন ম্যাট্রিক্স সহ এই ধরনের একাধিক গণনা সমান্তরালভাবে সম্পাদন করা, যা মডেলকে একই সাথে সিনট্যাক্স এবং সিমান্টিক্সের বিভিন্ন দিকে মনোযোগ কেন্দ্রীভূত করতে সক্ষম করে।
Transformer-ভিত্তিক আর্কিটেকচারের ধরন
Transformer উপাদানগুলি ব্যবহারের তিনটি মূল রূপ রয়েছে:
- Encoder-Decoder (এনকোডার-ডিকোডার): ক্রম-থেকে-ক্রম রূপান্তরের কাজের জন্য ক্লাসিক আর্কিটেকচার (যেমন, মেশিন অনুবাদ)। Encoder ইনপুট ক্রম প্রক্রিয়া করে, আর Decoder আউটপুট তৈরি করে। উদাহরণ: T5, BART।
- Encoder-Only (শুধুমাত্র এনকোডার): শুধুমাত্র Encoder স্ট্যাক ব্যবহারকারী মডেল। এগুলি সম্পূর্ণ ক্রমের গভীর প্রাসঙ্গিক বোঝাপড়া প্রয়োজন এমন কাজের জন্য উপযুক্ত (টেক্সট শ্রেণীবিভাগ, নামযুক্ত সত্তা শনাক্তকরণ)। উদাহরণ: BERT।
- Decoder-Only (শুধুমাত্র ডিকোডার): শুধুমাত্র Decoder স্ট্যাক ব্যবহারকারী মডেল। এগুলি autoregressive পদ্ধতিতে কাজ করে, পূর্ববর্তী token-এর উপর ভিত্তি করে পরবর্তী token পূর্বাভাস দেয়। এটি generative মডেলের মান। উদাহরণ: GPT, LLaMA, Claude।
Positional Encoding - অবস্থানগত কোডিং
যেহেতু Self-attention প্রক্রিয়া শব্দের ক্রম বিবেচনা করে না, তাই আর্কিটেকচারে positional encoding যোগ করা হয়। Token embedding-এ তাদের ক্রমের মধ্যে অবস্থান কোড করা ভেক্টর যোগ করা হয়। মূল মডেলে sinusoidal ফাংশন ব্যবহার করা হয়েছিল:
আধুনিক মডেলগুলিতে শিক্ষণযোগ্য এবং ঘূর্ণনশীল (Rotary Position Embeddings, RoPE) positional encoding-ও ব্যবহার করা হয়।
প্রশিক্ষণের নীতি: সম্ভাব্যতা থেকে অপ্টিমাইজেশন পর্যন্ত
সম্ভাব্যতাগত কাজ হিসেবে ভাষা মডেলিং
LLM-এর ভিত্তিতে রয়েছে ভাষা মডেলিং কাজ — টেক্সটের একটি ক্রমের সম্ভাব্যতা পূর্বাভাস দেওয়া। আনুষ্ঠানিকভাবে, ক্রমের জন্য মডেল সম্ভাব্যতা অনুমান করে। শৃঙ্খল নিয়ম ব্যবহার করে এটি শর্তাধীন সম্ভাব্যতার গুণফলে বিভক্ত করা হয়:
এইভাবে, মডেলের প্রশিক্ষণ পূর্ববর্তী token-এর প্রেক্ষাপটের উপর ভিত্তি করে পরবর্তী token পূর্বাভাস দেওয়ার কাজে পরিণত হয়।
ক্ষতি ফাংশন এবং তথ্য তত্ত্ব
পূর্বাভাসের মান মূল্যায়ন এবং মডেল প্রশিক্ষণের জন্য cross-entropy ক্ষতি ফাংশন ব্যবহার করা হয়। এটি মডেলের দ্বারা পূর্বাভাসিত সম্ভাব্যতা বিতরণ () এবং প্রকৃত বিতরণ () এর মধ্যে পার্থক্য পরিমাপ করে, যেখানে সঠিক পরবর্তী token-এর সম্ভাব্যতা ১ এবং বাকিগুলির ০।
Cross-entropy হ্রাস করা প্রশিক্ষণ ডেটার likelihood সর্বাধিক করার সমতুল্য।
মানের একটি সম্পর্কিত মেট্রিক হল perplexity, যা cross-entropy-এর ঘাতক হিসেবে সংজ্ঞায়িত: । স্বজ্ঞাতভাবে, perplexity প্রতিটি ধাপে মডেল যে বিকল্পগুলির মধ্য থেকে «নির্বাচন করে» তার গড় সংখ্যা দেখায়। perplexity যত কম হয়, মডেল তত আত্মবিশ্বাসী এবং নির্ভুল।
অপ্টিমাইজেশন
LLM প্রশিক্ষণ হল মডেলের কোটি কোটি প্যারামিটার সংশোধনের মাধ্যমে ক্ষতি ফাংশন হ্রাস করার প্রক্রিয়া। এর জন্য gradient descent-ভিত্তিক পদ্ধতি ব্যবহার করা হয়। সবচেয়ে সাধারণ হল Adam (Adaptive Moment Estimation) অপ্টিমাইজার এবং এর রূপভেদ (যেমন, AdamW), যা প্রতিটি প্যারামিটারের জন্য শিক্ষণ হার অভিযোজিতভাবে নির্ধারণ করে।
প্রশিক্ষণ পদ্ধতি
- Pre-training (পূর্ব-প্রশিক্ষণ): মডেলকে বিশাল অচিহ্নিত টেক্সট কর্পাসে (Common Crawl, The Pile, C4) self-supervised কাজ ব্যবহার করে প্রশিক্ষণ দেওয়া হয়, যেমন:
- Causal Language Modeling (CLM): পরবর্তী token পূর্বাভাস (GPT-তে ব্যবহৃত)।
- Masked Language Modeling (MLM): টেক্সটে এলোমেলোভাবে মুখোশ করা token পুনরুদ্ধার (BERT-এ ব্যবহৃত)।
- Fine-tuning (সূক্ষ্ম-সুর): পূর্ব-প্রশিক্ষণের পরে মডেলকে ছোট চিহ্নিত dataset-এ নির্দিষ্ট কাজের জন্য অভিযোজিত করা হয়।
- Alignment (সংরেখণ): একটি বিশেষ fine-tuning পর্যায়, যা মানব পছন্দ এবং মূল্যবোধের সাথে মডেলের আচরণ সামঞ্জস্য করার লক্ষ্যে পরিচালিত হয়। মূল পদ্ধতি হল RLHF (Reinforcement Learning from Human Feedback), যেখানে মডেলটি মানব পছন্দ পূর্বাভাসকারী মডেল থেকে পুরস্কার সংকেত ব্যবহার করে fine-tuned করা হয়।
Scaling Laws - স্কেলিং আইন এবং উদ্ভূত সক্ষমতা
অভিজ্ঞতামূলক গবেষণা দেখিয়েছে যে LLM-এর কর্মক্ষমতা তিনটি কারণ বৃদ্ধির সাথে পূর্বাভাসযোগ্যভাবে উন্নত হয়: মডেলের আকার (প্যারামিটারের সংখ্যা, ), প্রশিক্ষণ dataset-এর আকার () এবং গণনার পরিমাণ ()। এই নির্ভরতা power laws (scaling laws) দ্বারা বর্ণিত হয়।
OpenAI-এর গবেষণায় (Kaplan et al., 2020) প্রস্তাবিত আইন দেখায় যে ক্ষতি ফাংশন , এবং এর power function হিসেবে হ্রাস পায়। পরবর্তী DeepMind-এর গবেষণা (Hoffmann et al., 2022) এই আইনগুলি পরিমার্জন করে (Chinchilla laws), দেখিয়ে যে সর্বোত্তম প্রশিক্ষণের জন্য মডেলের আকার এবং ডেটার পরিমাণ উভয়ই ভারসাম্যভাবে বাড়ানো প্রয়োজন।
স্কেলিংয়ের একটি গুরুত্বপূর্ণ পরিণতি হল উদ্ভূত সক্ষমতা (emergent abilities) — কর্মক্ষমতায় গুণগত লাফ, যখন মডেল এমন কাজ সমাধান করতে শুরু করে যা এটিকে স্পষ্টভাবে শেখানো হয়নি (যেমন, গাণিতিক হিসাব, যৌক্তিক যুক্তি, কোড লেখা)। এই সক্ষমতাগুলি সাধারণত ছোট আকারের মডেলে অনুপস্থিত থাকে এবং একটি নির্দিষ্ট স্কেল সীমা অতিক্রম করার পরেই প্রকাশ পায়।
টেক্সট তৈরি: Decoding কৌশল
প্রশিক্ষণের পরে মডেল পুনরাবৃত্তিমূলকভাবে পরবর্তী token পূর্বাভাস দিয়ে টেক্সট তৈরি করে। মডেলের দেওয়া সম্ভাব্যতা বিতরণ থেকে পরবর্তী token নির্বাচন বিভিন্ন decoding কৌশল ব্যবহার করে করা হয়:
- Greedy Search (লোভী অনুসন্ধান): সর্বদা সবচেয়ে সম্ভাব্য token নির্বাচন করা হয়। দ্রুত, কিন্তু প্রায়ই পুনরাবৃত্তিমূলক এবং নিরস টেক্সট তৈরি করে।
- Beam Search (রশ্মি অনুসন্ধান): প্রতিটি ধাপে সবচেয়ে সম্ভাব্য ক্রম সংরক্ষণ করা হয়, যা আরও সর্বোত্তম বৈশ্বিক সমাধান খুঁজে পেতে সক্ষম করে।
- তাপমাত্রা সহ sampling: Token সম্ভাব্যতাগুলি temperature () প্যারামিটার দ্বারা সংশোধিত হয়। -এ বিতরণ আরও সমান হয়ে যায় (বেশি সৃজনশীলতা), -এ আরও তীক্ষ্ণ হয় (কম এলোমেলোতা)।
- Top-k sampling: প্রতিটি ধাপে নমুনা সবচেয়ে সম্ভাব্য token-এ সীমাবদ্ধ।
- Top-p (Nucleus) sampling: নমুনা token-এর ন্যূনতম সেটে সীমাবদ্ধ, যাদের মোট সম্ভাব্যতা সীমা অতিক্রম করে। এটি প্রার্থীদের পুলের আকার গতিশীলভাবে অভিযোজিত করতে সক্ষম করে।
তাত্ত্বিক সমস্যা এবং সীমাবদ্ধতা
- Hallucination (মতিভ্রম): মডেলগুলির প্রবণতা যে তথ্যতঃ ভুল কিন্তু বিশ্বাসযোগ্যভাবে শোনায় এমন তথ্য তৈরি করার। এটি এই কারণে যে মডেলগুলি টেক্সটের সম্ভাব্যতা অপ্টিমাইজ করে, তার সত্যতা নয়।
- Bias (পক্ষপাত): LLM প্রশিক্ষণ ডেটায় উপস্থিত সামাজিক, সাংস্কৃতিক এবং অন্যান্য পক্ষপাত উত্তরাধিকার সূত্রে গ্রহণ করে এবং বিবর্ধিত করে।
- ব্যাখ্যাযোগ্যতা («কালো বাক্স»): অসংখ্য প্যারামিটারের কারণে মডেল কীভাবে সিদ্ধান্ত নেয় তা বোঝা অত্যন্ত কঠিন, যা ডিবাগিং জটিল করে এবং ঝুঁকি তৈরি করে।
- গণনাগত জটিলতা: Self-attention প্রক্রিয়ার ক্রমের দৈর্ঘ্যের সাথে দ্বিঘাত জটিলতা () রয়েছে, যা প্রক্রিয়াযোগ্য প্রেক্ষাপটের সর্বোচ্চ দৈর্ঘ্য সীমিত করে।
আরও দেখুন
- বৃহৎ ভাষা মডেল
- BERT
- GPT
সাহিত্য
- Vaswani, A. et al. (2017). Attention Is All You Need. arXiv:1706.03762.
- Devlin, J. et al. (2019). BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. arXiv:1810.04805.
- Brown, T. B. et al. (2020). Language Models Are Few-Shot Learners. arXiv:2005.14165.
- Kaplan, J. et al. (2020). Scaling Laws for Neural Language Models. arXiv:2001.08361.
- Hoffmann, J. et al. (2022). Training Compute-Optimal Large Language Models. arXiv:2203.15556.
- Wei, J. et al. (2022). Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. arXiv:2201.11903.
- Ouyang, L. et al. (2022). Training Language Models to Follow Instructions with Human Feedback. arXiv:2203.02155.
- Bai, Y. et al. (2022). Constitutional AI: Harmlessness from AI Feedback. arXiv:2212.08073.
- Bubeck, S. et al. (2023). Sparks of Artificial General Intelligence: Early Experiments with GPT-4. arXiv:2303.12712.
- Touvron, H. et al. (2024). The Llama 3 Herd of Models. arXiv:2407.21783.
- Bender, E. M. et al. (2021). On the Dangers of Stochastic Parrots: Can Language Models Be Too Big?. DOI:10.1145/3442188.3445922.