Theoretical foundations of large language models — الأسس النظرية لنماذج اللغة الكبيرة
الأسس النظرية لنماذج اللغة الكبيرة (القائمة على بنية الترانسفورمر) — هي مجموعة من المبادئ الرياضية والإحصائية والمعلوماتية التي تكمن وراء عمل وتدريب وقدرات نماذج اللغة الكبيرة (LLM) الحديثة. تشرح هذه الأسس كيف تتمكن النماذج المبنية على بنية الترانسفورمر من فهم وتوليد اللغة البشرية بدرجة عالية من التماسك.
الأسس البنيوية: بنية الترانسفورمر
تعتمد نماذج اللغة الكبيرة الحديثة بشكل شبه كامل على بنية الترانسفورمر، التي قُدمت عام 2017 في ورقة بحثية بعنوان «Attention Is All You Need». تخلت هذه البنية عن الطبقات المتكررة (كما في RNN و LSTM)، واعتمدت بدلاً من ذلك على آلية الانتباه (attention)، مما سمح بمعالجة التسلسلات الطويلة بكفاءة وموازاة العمليات الحسابية.
Self-Attention - آلية الانتباه الذاتي
هذا هو جوهر بنية الترانسفورمر. تسمح آلية الانتباه الذاتي للنموذج بتقدير أهمية كل كلمة (رمز) في التسلسل مقارنة بجميع الكلمات الأخرى في نفس التسلسل. لكل رمز، يتم إنشاء ثلاثة متجهات:
- Query (Q, استعلام): متجه يمثل الكلمة الحالية.
- Key (K, مفتاح): متجه تُقارن به الاستعلامات من الكلمات الأخرى.
- Value (V, قيمة): متجه يحتوي على معلومات حول الكلمة سيتم تمريرها لاحقًا.
يتم حساب درجة الانتباه كجداء قياسي مُقاس:
حيث هو بُعد متجهات المفاتيح. تسمح هذه الآلية للنموذج بالتقاط العلاقات السياقية المعقدة، بغض النظر عن المسافة بين الكلمات.
الانتباه متعدد الرؤوس (Multi-Head Attention) — هو تنفيذ موازٍ لعدة عمليات حسابية من هذا النوع بمصفوفات إسقاط مختلفة، مما يسمح للنموذج بالتركيز على جوانب مختلفة من بناء الجملة والدلالات في آن واحد.
أنواع البنى القائمة على الترانسفورمر
توجد ثلاثة أنواع رئيسية لاستخدام مكونات الترانسفورمر:
- المُشفِّر-فاكّ التشفير (Encoder-Decoder): البنية الكلاسيكية لمهام تحويل تسلسل إلى تسلسل (مثل الترجمة الآلية). يقوم المُشفِّر بمعالجة تسلسل الإدخال، بينما يقوم فاكّ التشفير بتوليد تسلسل الإخراج. أمثلة: T5, BART.
- المُشفِّر فقط (Encoder-Only): نماذج تستخدم مكدس المُشفِّرات فقط. وهي ممتازة للمهام التي تتطلب فهمًا عميقًا لسياق التسلسل بأكمله (مثل تصنيف النصوص، والتعرف على الكيانات المسماة). مثال: BERT.
- فاكّ التشفير فقط (Decoder-Only): نماذج تستخدم مكدس فاكّات التشفير فقط. وهي تعمل بشكل توليدي ذاتي (autoregressively)، حيث تتنبأ بالرمز التالي بناءً على الرموز السابقة. هذا هو المعيار للنماذج التوليدية. أمثلة: GPT, LLaMA, Claude.
الترميز الموضعي
نظرًا لأن آلية الانتباه الذاتي لا تأخذ ترتيب الكلمات في الاعتبار، تتم إضافة الترميز الموضعي إلى البنية. تُضاف متجهات تشفر موضع الرموز في التسلسل إلى تضمينات الرموز. في النموذج الأصلي، استُخدمت دوال جيبية:
في النماذج الحديثة، تُستخدم أيضًا ترميزات موضعية قابلة للتعلم ودورانية (Rotary Position Embeddings, RoPE).
مبادئ التدريب: من الاحتمالية إلى التحسين
نمذجة اللغة كمهمة احتمالية
في جوهر نماذج اللغة الكبيرة تكمن مهمة نمذجة اللغة — وهي التنبؤ باحتمالية تسلسل نصي. رسميًا، لتسلسل ، يقدّر النموذج الاحتمال . باستخدام قاعدة السلسلة في الاحتمالات، يتم تفكيك ذلك إلى جداء الاحتمالات الشرطية:
وهكذا، يتمحور تدريب النموذج حول التنبؤ بالرمز التالي بناءً على سياق الرموز السابقة.
دالة الخسارة ونظرية المعلومات
لتقييم جودة التنبؤات وتدريب النموذج، تُستخدم دالة الخسارة بالإنتروبيا المتقاطعة. تقيس هذه الدالة التباين بين التوزيع الاحتمالي الذي توقعه النموذج () والتوزيع الحقيقي ()، حيث يكون للرمز التالي الصحيح احتمال 1، والباقي 0.
إن تقليل الإنتروبيا المتقاطعة يعادل تعظيم إمكانية حدوث بيانات التدريب.
من المقاييس المرتبطة بالجودة الحيرة (perplexity)، والتي تُعرَّف بأنها القوة الأسية للإنتروبيا المتقاطعة: . بشكل بديهي، تُظهر الحيرة متوسط عدد الخيارات التي "يختار" النموذج من بينها في كل خطوة. كلما انخفضت الحيرة، كان النموذج أكثر ثقة ودقة.
التحسين (Optimization)
تدريب نماذج اللغة الكبيرة هو عملية تقليل دالة الخسارة عن طريق تعديل مليارات المعلمات في النموذج. لهذا الغرض، تُستخدم طرق قائمة على الانحدار التدرجي. المحسِّن الأكثر شيوعًا هو Adam (Adaptive Moment Estimation) ومتغيراته (مثل AdamW)، التي تقوم بتكييف معدل التعلم لكل معلمة بشكل فردي.
نماذج التدريب
- التدريب المسبق (Pre-training): يُدرَّب النموذج على مجموعات نصية ضخمة غير مصنفة (مثل Common Crawl, The Pile, C4) باستخدام مهام ذاتية الإشراف، مثل:
- نمذجة اللغة السببية (CLM): التنبؤ بالرمز التالي (تُستخدم في GPT).
- نمذجة اللغة المقنَّعة (MLM): استعادة الرموز المقنَّعة عشوائيًا في النص (تُستخدم في BERT).
- الضبط الدقيق (Fine-tuning): بعد التدريب المسبق، يتم تكييف النموذج لمهام محددة على مجموعات بيانات صغيرة مصنفة.
- المواءمة (Alignment): مرحلة خاصة من الضبط الدقيق تهدف إلى مواءمة سلوك النموذج مع التفضيلات والقيم البشرية. الطريقة الرئيسية هي RLHF (Reinforcement Learning from Human Feedback)، حيث يتم ضبط النموذج باستخدام إشارة مكافأة من نموذج يتنبأ بالتفضيلات البشرية.
قوانين التوسع والقدرات الناشئة
أظهرت الدراسات التجريبية أن أداء نماذج اللغة الكبيرة يتحسن بشكل متوقع مع زيادة ثلاثة عوامل: حجم النموذج (عدد المعلمات، )، وحجم مجموعة بيانات التدريب ()، وحجم العمليات الحسابية (). توصف هذه العلاقة بـقوانين القوة (scaling laws).
القانون الذي اقترحته OpenAI في ورقة بحثية (Kaplan et al., 2020) يوضح أن دالة الخسارة تتناقص كدالة قوة لـ و و . وفي ورقة بحثية لاحقة من DeepMind (Hoffmann et al., 2022)، تم تحسين هذه القوانين (قوانين Chinchilla)، حيث أظهرت أنه لتحقيق التدريب الأمثل، يجب زيادة حجم النموذج وحجم البيانات بشكل متوازن.
إحدى النتائج المهمة للتوسع هي ظهور القدرات الناشئة — وهي قفزات نوعية في الأداء حيث يبدأ النموذج في حل مهام لم يُدرَّب عليها صراحةً (مثل العمليات الحسابية، والاستدلال المنطقي، وكتابة الأكواد البرمجية). هذه القدرات عادة ما تكون غائبة في النماذج الأصغر حجمًا وتظهر فقط بعد الوصول إلى عتبة معينة من الحجم.
توليد النصوص: استراتيجيات فك التشفير
بعد التدريب، يقوم النموذج بتوليد النص عن طريق التنبؤ التكراري بالرمز التالي. يتم اختيار الرمز التالي من التوزيع الاحتمالي الذي يوفره النموذج باستخدام استراتيجيات فك تشفير مختلفة:
- البحث الجشع (Greedy Search): يتم دائمًا اختيار الرمز الأكثر احتمالاً. هذه الطريقة سريعة، لكنها غالبًا ما تؤدي إلى نصوص متكررة ومملة.
- البحث الشعاعي (Beam Search): في كل خطوة، يتم الاحتفاظ بـ من التسلسلات الأكثر احتمالاً، مما يسمح بالعثور على حلول شاملة أفضل.
- أخذ العينات مع درجة الحرارة: يتم تعديل احتمالات الرموز باستخدام معامل درجة الحرارة (). عندما تكون ، يصبح التوزيع أكثر انتظامًا (مما يزيد من الإبداع)، وعندما تكون ، يصبح أكثر تركيزًا (مما يقلل من العشوائية).
- أخذ عينات Top-k: في كل خطوة، تقتصر عملية الاختيار على من الرموز الأكثر احتمالاً.
- أخذ عينات Top-p (Nucleus): يقتصر الاختيار على أصغر مجموعة من الرموز التي يتجاوز مجموع احتمالاتها عتبة . وهذا يسمح بتكييف حجم مجموعة المرشحين ديناميكيًا.
المشكلات النظرية والقيود
- الهلوسة (Hallucinations): ميل النماذج إلى توليد معلومات غير صحيحة من حيث الوقائع، ولكنها تبدو مقنعة. يرتبط هذا بأن النماذج تعمل على تحسين احتمالية النص، وليس حقيقته.
- التحيز (Bias): ترث نماذج اللغة الكبيرة وتعزز التحيزات الاجتماعية والثقافية وغيرها الموجودة في بيانات التدريب.
- القابلية للتفسير ("الصندوق الأسود"): بسبب العدد الهائل من المعلمات، من الصعب للغاية فهم كيفية اتخاذ النموذج لقراراته، مما يعقد عملية تصحيح الأخطاء ويخلق مخاطر.
- التعقيد الحسابي: تتمتع آلية الانتباه الذاتي بتعقيد تربيعي بالنسبة لطول التسلسل ()، مما يحد من أقصى طول للسياق الذي يمكن معالجته.
انظر أيضًا
- Large language models
- BERT
- GPT
المراجع
- Vaswani, A. et al. (2017). Attention Is All You Need. arXiv:1706.03762.
- Devlin, J. et al. (2019). BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. arXiv:1810.04805.
- Brown, T. B. et al. (2020). Language Models Are Few-Shot Learners. arXiv:2005.14165.
- Kaplan, J. et al. (2020). Scaling Laws for Neural Language Models. arXiv:2001.08361.
- Hoffmann, J. et al. (2022). Training Compute-Optimal Large Language Models. arXiv:2203.15556.
- Wei, J. et al. (2022). Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. arXiv:2201.11903.
- Ouyang, L. et al. (2022). Training Language Models to Follow Instructions with Human Feedback. arXiv:2203.02155.
- Bai, Y. et al. (2022). Constitutional AI: Harmlessness from AI Feedback. arXiv:2212.08073.
- Bubeck, S. et al. (2023). Sparks of Artificial General Intelligence: Early Experiments with GPT-4. arXiv:2303.12712.
- Touvron, H. et al. (2024). The Llama 3 Herd of Models. arXiv:2407.21783.
- Bender, E. M. et al. (2021). On the Dangers of Stochastic Parrots: Can Language Models Be Too Big?. DOI:10.1145/3442188.3445922.