LLM evaluation — הערכת LLM
הערכת מודלי שפה גדולים (LLM) — היא דיסציפלינה בתחום הבינה המלאכותית המספקת שיטות סטנדרטיות למדידת היכולות, המגבלות והסיכונים של מודלי שפה[1]. ככל שה-LLM משתלבים בתחומים מרכזיים כגון בריאות ופיננסים, הערכתם האובייקטיבית הופכת הכרחית להבטחת בטיחות, אמינות והגינות[2].
הערכת LLM ממלאת מספר תפקידים יסודיים:
- מדידת יכולות: השוואה אובייקטיבית של ביצועי מודלים שונים על משימות סטנדרטיות.
- מעקב אחר התקדמות: תיעוד הישגים וזיהוי תחומים הדורשים שיפור נוסף.
- מזעור סיכונים: זיהוי תוצאות שעלולות להיות מזיקות, כגון הטיה, הזיות ובעיות בטיחות.
- הדרכת מפתחים ומשתמשים: מתן מידע שקוף לבחירת המודל המתאים ביותר לאפליקציה ספציפית.
גישות ומתודולוגיות עיקריות
הערכת LLM המודרנית החלה עם הופעתם של benchmark-ים מקיפים כגון GLUE (General Language Understanding Evaluation), שקבע את הסטנדרט להערכת הבנת שפה כללית[3]. ככל שמודלים החלו לעלות על תוצאות אנושיות ב-GLUE, פותחו יורשים מורכבים יותר כגון SuperGLUE[4].
שינוי יסודי התרחש עם הכנסת benchmark-ים רב-משימתיים כגון MMLU ו-BIG-bench, הבוחנים מודלים על מגוון רחב של ידע ויכולות הסקה, מעבר למשימות לשוניות גרידא[1].
מדדים ו-benchmark-ים מרכזיים
מדדים אוטומטיים
- Perplexity (פרפלקסיות): מדד יסודי המודד עד כמה המודל מנבא טקסט היטב. פרפלקסיות נמוכה יותר מצביעה על ביטחון גבוה יותר של המודל בניבויים שלו.
- BLEU ו-ROUGE: מדדים מבוססי n-gram המודדים חפיפה לקסיקלית בין טקסט שנוצר לטקסט ייחוס. BLEU מתמקד בדיוק, ROUGE — בהיקף[2].
- BERTScore: מדד סמנטי המשתמש ב-embedding-ים מ-BERT לחישוב דמיון סמנטי. הוא מסוגל לתפוס מילים נרדפות וניסוחים מחדש, מה שהופך אותו לדיוק יותר ממדדים מבוססי n-gram[5].
benchmark-ים מתמחים
לצורך הערכת יכולות ספציפיות פותחו benchmark-ים ייעודיים:
- יצירת קוד: HumanEval מעריך את יכולת המודל לייצר קוד תוכנה תקין לפי תיאור טקסטואלי, ובוחן את פונקציונליותו באמצעות unit tests[6].
- שכל ישר: HellaSwag בוחן את הבנת המודל של העולם הפיזי ויחסי סיבה-ומסובב באמצעות ניבוי הסיום הסביר ביותר של מצב יומיומי[7].
- ידע אקדמי: MMLU (Massive Multitask Language Understanding) מכסה 57 מקצועות, ממתמטיקה בסיסית ועד למשפט ורפואה, ובוחן את רוחב הידע של המודל[8].
- גבולות יכולות: BIG-bench (Beyond the Imitation Game) — הוא פרויקט שיתופי המאגד 204 משימות שפותחו לזיהוי יכולות emergent — מיומנויות המופיעות בפתאומיות כאשר המודל מגיע לסדרי גודל קריטיים[9].
הערכת היבטי בטיחות ואתיקה
- הטיה: להערכת דעות קדומות חברתיות ודמוגרפיות משתמשים ב-dataset-ים כגון BBQ (Bias Benchmark for Question Answering) ו-BOLD (Bias in Open-ended Language generation Dataset).
- רעילות: benchmark-ים כגון RealToxicityPrompts מספקים prompt-ים המעודדים יצירת תוכן רעיל, להערכת עמידות המודל.
- Robustness: מוערכת באמצעות מתקפות adversarial. הפריימוורק PromptRobust מספק מערכת מקיפה של prompt-ים לבדיקת עמידות המודל ברמות התו, המילה והמשפט.
סטנדרטים ופריימוורקים עכשוויים
- HELM (Holistic Evaluation of Language Models): יוזמה של אוניברסיטת סטנפורד המציעה מתודולוגיה "הוליסטית". HELM מעריך מודלים על פי מימדים רבים: דיוק, robustness, הגינות, הטיה, רעילות ויעילות[10].
- ISO/IEC 42001:2023: הסטנדרט הבינלאומי הראשון למערכות ניהול בינה מלאכותית, הקובע דרישות לניהול AI לאורך כל מחזור החיים.
- תקנת האיחוד האירופי 2024/1689 (EU AI Act): הרגולציה המקיפה הראשונה של AI, המחייבת הערכות סטנדרטיות עבור מודלים למטרות כלליות בעלי סיכונים מערכתיים.
- NIST AI Risk Management Framework 1.0: פריימוורק וולונטרי לפיתוח ופריסה של AI אמין, שפותח על ידי המכון הלאומי לסטנדרטים וטכנולוגיה של ארצות הברית.
בעיות ומגבלות של השיטות הקיימות
- רוויית benchmark-ים: מודלים רבים משיגים ציונים כמעט מושלמים ב-benchmark-ים פופולריים, מה שמוביל לתופעת "ריצה אחרי benchmark-ים", שבה מודלים מותאמים לבדיקות ספציפיות ולא ליכולות כלליות.
- זיהום נתונים: בעיה קריטית שבה נתוני הבדיקה של ה-benchmark נכנסים בטעות לסט האימון, מה שמוביל לתוצאות הערכה מנופחות ולא הוגנות.
- מתאם נמוך עם שיפוט אנושי: מדדים אוטומטיים כגון BLEU ו-ROUGE לרוב מתואמים בצורה גרועה עם הערכת איכות על ידי אנשים, במיוחד במשימות יצירתיות ופתוחות.
מחקרים עכשוויים ומגמות
- פרדיגמת LLM-as-a-Judge: שימוש ב-LLM עוצמתיים (כגון GPT-4) כ"שופטים" להערכת תשובות של מודלים אחרים. גישה זו מספקת חלופה מדרגית להערכה אנושית יקרה.
- הערכה דינמית ואדפטיבית: פלטפורמות כגון LMArena מציגות מערכת crowdsourcing עם דירוגי Elo להערכת מודלים בזמן אמת באינטראקציה חיה עם משתמשים.
- גישות היברידיות: שילוב של מדדים אוטומטיים עם שיפוט אנושי והערכת LLM לקבלת תמונה מלאה ואמינה יותר של ביצועי המודל.
נוף הערכת ה-LLM ממשיך להתפתח, ונע לעבר יצירת פריימוורקים רב-ממדיים, סטנדרטיים וניתנים לשחזור, המתחשבים לא רק בדיוק אלא גם בהיבטים חברתיים ואתיים של יישום טכנולוגיות AI[1].
קישורים
- Stanford HELM — האתר הרשמי של פרויקט Holistic Evaluation of Language Models.
- Chatbot Arena — פלטפורמה להערכה השוואתית של chatbot-ים על בסיס העדפות אנושיות.
ספרות
- Wang, A. et al. (2018). GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding. arXiv:1804.07461.
- Zhang, T. et al. (2019). BERTScore: Evaluating Text Generation with BERT. arXiv:1904.09675.
- Wang, A. et al. (2019). SuperGLUE: A Stickier Benchmark for General-Purpose Language Understanding Systems. arXiv:1905.00537.
- Zellers, R. et al. (2019). HellaSwag: Can a Machine Really Finish Your Sentence?. arXiv:1905.07830.
- Hendrycks, D. et al. (2020). Measuring Massive Multitask Language Understanding. arXiv:2009.03300.
- Gehman, S. et al. (2020). RealToxicityPrompts: Evaluating Neural Toxic Degeneration in Language Models. arXiv:2009.11462.
- Chen, M. et al. (2021). Evaluating Large Language Models Trained on Code. arXiv:2107.03374.
- Parrish, A. et al. (2021). BBQ: A Hand-Built Bias Benchmark for Question Answering. arXiv:2110.08193.
- Dhamala, J. et al. (2021). BOLD: Dataset and Metrics for Measuring Biases in Open-Ended Language Generation. arXiv:2101.11718.
- Srivastava, A. et al. (2022). Beyond the Imitation Game: Quantifying and Extrapolating the Capabilities of Language Models. arXiv:2206.04615.
- Bommasani, R. et al. (2022). Holistic Evaluation of Language Models. arXiv:2211.09110.
- Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
- Zhuang, Y. et al. (2023). Through the Lens of Core Competency: Survey on Evaluation of Large Language Models. ACL Anthology:2023.ccl-2.8.
- Zhu, K. et al. (2023). PromptRobust: Towards Evaluating the Robustness of Large Language Models on Adversarial Prompts. arXiv:2306.04528.
הערות
- ↑ 1.0 1.1 1.2 Chang, Y., et al. (2023). «A Survey on Evaluation of Large Language Models». arXiv. [1]
- ↑ 2.0 2.1 Zhuang, Y., et al. (2023). «Through the Lens of Core Competency: Survey on Evaluation of Large Language Models». ACL Anthology. [2]
- ↑ Wang, A., et al. (2018). «GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding». arXiv.[3]
- ↑ Kumar, Pradosh. «Understanding Benchmarking in NLP: GLUE, SuperGLUE, HELM, MMLU, and BIG-Bench». Medium.
- ↑ Zhang, T., et al. (2019). «BERTScore: Evaluating Text Generation with BERT». arXiv.
- ↑ Chen, M., et al. (2021). «Evaluating Large Language Models Trained on Code». arXiv.
- ↑ Zellers, R., et al. (2019). «HellaSwag: Can a Machine Really Finish Your Sentence?». arXiv.
- ↑ Hendrycks, D., et al. (2020). «Measuring Massive Multitask Language Understanding». arXiv.
- ↑ Srivastava, A., et al. (2022). «Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models». arXiv.
- ↑ Bommasani, R., et al. (2022). «Holistic Evaluation of Language Models». arXiv. [4]