LLM evaluation — הערכת LLM

From Systems analysis wiki
Jump to navigation Jump to search

הערכת מודלי שפה גדולים (LLM) — היא דיסציפלינה בתחום הבינה המלאכותית המספקת שיטות סטנדרטיות למדידת היכולות, המגבלות והסיכונים של מודלי שפה[1]. ככל שה-LLM משתלבים בתחומים מרכזיים כגון בריאות ופיננסים, הערכתם האובייקטיבית הופכת הכרחית להבטחת בטיחות, אמינות והגינות[2].

הערכת LLM ממלאת מספר תפקידים יסודיים:

  • מדידת יכולות: השוואה אובייקטיבית של ביצועי מודלים שונים על משימות סטנדרטיות.
  • מעקב אחר התקדמות: תיעוד הישגים וזיהוי תחומים הדורשים שיפור נוסף.
  • מזעור סיכונים: זיהוי תוצאות שעלולות להיות מזיקות, כגון הטיה, הזיות ובעיות בטיחות.
  • הדרכת מפתחים ומשתמשים: מתן מידע שקוף לבחירת המודל המתאים ביותר לאפליקציה ספציפית.

גישות ומתודולוגיות עיקריות

הערכת LLM המודרנית החלה עם הופעתם של benchmark-ים מקיפים כגון GLUE (General Language Understanding Evaluation), שקבע את הסטנדרט להערכת הבנת שפה כללית[3]. ככל שמודלים החלו לעלות על תוצאות אנושיות ב-GLUE, פותחו יורשים מורכבים יותר כגון SuperGLUE[4].

שינוי יסודי התרחש עם הכנסת benchmark-ים רב-משימתיים כגון MMLU ו-BIG-bench, הבוחנים מודלים על מגוון רחב של ידע ויכולות הסקה, מעבר למשימות לשוניות גרידא[1].

מדדים ו-benchmark-ים מרכזיים

מדדים אוטומטיים

  • Perplexity (פרפלקסיות): מדד יסודי המודד עד כמה המודל מנבא טקסט היטב. פרפלקסיות נמוכה יותר מצביעה על ביטחון גבוה יותר של המודל בניבויים שלו.
  • BLEU ו-ROUGE: מדדים מבוססי n-gram המודדים חפיפה לקסיקלית בין טקסט שנוצר לטקסט ייחוס. BLEU מתמקד בדיוק, ROUGE — בהיקף[2].
  • BERTScore: מדד סמנטי המשתמש ב-embedding-ים מ-BERT לחישוב דמיון סמנטי. הוא מסוגל לתפוס מילים נרדפות וניסוחים מחדש, מה שהופך אותו לדיוק יותר ממדדים מבוססי n-gram[5].

benchmark-ים מתמחים

לצורך הערכת יכולות ספציפיות פותחו benchmark-ים ייעודיים:

  • יצירת קוד: HumanEval מעריך את יכולת המודל לייצר קוד תוכנה תקין לפי תיאור טקסטואלי, ובוחן את פונקציונליותו באמצעות unit tests[6].
  • שכל ישר: HellaSwag בוחן את הבנת המודל של העולם הפיזי ויחסי סיבה-ומסובב באמצעות ניבוי הסיום הסביר ביותר של מצב יומיומי[7].
  • ידע אקדמי: MMLU (Massive Multitask Language Understanding) מכסה 57 מקצועות, ממתמטיקה בסיסית ועד למשפט ורפואה, ובוחן את רוחב הידע של המודל[8].
  • גבולות יכולות: BIG-bench (Beyond the Imitation Game) — הוא פרויקט שיתופי המאגד 204 משימות שפותחו לזיהוי יכולות emergent — מיומנויות המופיעות בפתאומיות כאשר המודל מגיע לסדרי גודל קריטיים[9].

הערכת היבטי בטיחות ואתיקה

  • הטיה: להערכת דעות קדומות חברתיות ודמוגרפיות משתמשים ב-dataset-ים כגון BBQ (Bias Benchmark for Question Answering) ו-BOLD (Bias in Open-ended Language generation Dataset).
  • רעילות: benchmark-ים כגון RealToxicityPrompts מספקים prompt-ים המעודדים יצירת תוכן רעיל, להערכת עמידות המודל.
  • Robustness: מוערכת באמצעות מתקפות adversarial. הפריימוורק PromptRobust מספק מערכת מקיפה של prompt-ים לבדיקת עמידות המודל ברמות התו, המילה והמשפט.

סטנדרטים ופריימוורקים עכשוויים

  • HELM (Holistic Evaluation of Language Models): יוזמה של אוניברסיטת סטנפורד המציעה מתודולוגיה "הוליסטית". HELM מעריך מודלים על פי מימדים רבים: דיוק, robustness, הגינות, הטיה, רעילות ויעילות[10].
  • ISO/IEC 42001:2023: הסטנדרט הבינלאומי הראשון למערכות ניהול בינה מלאכותית, הקובע דרישות לניהול AI לאורך כל מחזור החיים.
  • תקנת האיחוד האירופי 2024/1689 (EU AI Act): הרגולציה המקיפה הראשונה של AI, המחייבת הערכות סטנדרטיות עבור מודלים למטרות כלליות בעלי סיכונים מערכתיים.
  • NIST AI Risk Management Framework 1.0: פריימוורק וולונטרי לפיתוח ופריסה של AI אמין, שפותח על ידי המכון הלאומי לסטנדרטים וטכנולוגיה של ארצות הברית.

בעיות ומגבלות של השיטות הקיימות

  • רוויית benchmark-ים: מודלים רבים משיגים ציונים כמעט מושלמים ב-benchmark-ים פופולריים, מה שמוביל לתופעת "ריצה אחרי benchmark-ים", שבה מודלים מותאמים לבדיקות ספציפיות ולא ליכולות כלליות.
  • זיהום נתונים: בעיה קריטית שבה נתוני הבדיקה של ה-benchmark נכנסים בטעות לסט האימון, מה שמוביל לתוצאות הערכה מנופחות ולא הוגנות.
  • מתאם נמוך עם שיפוט אנושי: מדדים אוטומטיים כגון BLEU ו-ROUGE לרוב מתואמים בצורה גרועה עם הערכת איכות על ידי אנשים, במיוחד במשימות יצירתיות ופתוחות.

מחקרים עכשוויים ומגמות

  • פרדיגמת LLM-as-a-Judge: שימוש ב-LLM עוצמתיים (כגון GPT-4) כ"שופטים" להערכת תשובות של מודלים אחרים. גישה זו מספקת חלופה מדרגית להערכה אנושית יקרה.
  • הערכה דינמית ואדפטיבית: פלטפורמות כגון LMArena מציגות מערכת crowdsourcing עם דירוגי Elo להערכת מודלים בזמן אמת באינטראקציה חיה עם משתמשים.
  • גישות היברידיות: שילוב של מדדים אוטומטיים עם שיפוט אנושי והערכת LLM לקבלת תמונה מלאה ואמינה יותר של ביצועי המודל.

נוף הערכת ה-LLM ממשיך להתפתח, ונע לעבר יצירת פריימוורקים רב-ממדיים, סטנדרטיים וניתנים לשחזור, המתחשבים לא רק בדיוק אלא גם בהיבטים חברתיים ואתיים של יישום טכנולוגיות AI[1].

קישורים

  • Stanford HELM — האתר הרשמי של פרויקט Holistic Evaluation of Language Models.
  • Chatbot Arena — פלטפורמה להערכה השוואתית של chatbot-ים על בסיס העדפות אנושיות.

ספרות

  • Wang, A. et al. (2018). GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding. arXiv:1804.07461.
  • Zhang, T. et al. (2019). BERTScore: Evaluating Text Generation with BERT. arXiv:1904.09675.
  • Wang, A. et al. (2019). SuperGLUE: A Stickier Benchmark for General-Purpose Language Understanding Systems. arXiv:1905.00537.
  • Zellers, R. et al. (2019). HellaSwag: Can a Machine Really Finish Your Sentence?. arXiv:1905.07830.
  • Hendrycks, D. et al. (2020). Measuring Massive Multitask Language Understanding. arXiv:2009.03300.
  • Gehman, S. et al. (2020). RealToxicityPrompts: Evaluating Neural Toxic Degeneration in Language Models. arXiv:2009.11462.
  • Chen, M. et al. (2021). Evaluating Large Language Models Trained on Code. arXiv:2107.03374.
  • Parrish, A. et al. (2021). BBQ: A Hand-Built Bias Benchmark for Question Answering. arXiv:2110.08193.
  • Dhamala, J. et al. (2021). BOLD: Dataset and Metrics for Measuring Biases in Open-Ended Language Generation. arXiv:2101.11718.
  • Srivastava, A. et al. (2022). Beyond the Imitation Game: Quantifying and Extrapolating the Capabilities of Language Models. arXiv:2206.04615.
  • Bommasani, R. et al. (2022). Holistic Evaluation of Language Models. arXiv:2211.09110.
  • Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
  • Zhuang, Y. et al. (2023). Through the Lens of Core Competency: Survey on Evaluation of Large Language Models. ACL Anthology:2023.ccl-2.8.
  • Zhu, K. et al. (2023). PromptRobust: Towards Evaluating the Robustness of Large Language Models on Adversarial Prompts. arXiv:2306.04528.

הערות

  1. 1.0 1.1 1.2 Chang, Y., et al. (2023). «A Survey on Evaluation of Large Language Models». arXiv. [1]
  2. 2.0 2.1 Zhuang, Y., et al. (2023). «Through the Lens of Core Competency: Survey on Evaluation of Large Language Models». ACL Anthology. [2]
  3. Wang, A., et al. (2018). «GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding». arXiv.[3]
  4. Kumar, Pradosh. «Understanding Benchmarking in NLP: GLUE, SuperGLUE, HELM, MMLU, and BIG-Bench». Medium.
  5. Zhang, T., et al. (2019). «BERTScore: Evaluating Text Generation with BERT». arXiv.
  6. Chen, M., et al. (2021). «Evaluating Large Language Models Trained on Code». arXiv.
  7. Zellers, R., et al. (2019). «HellaSwag: Can a Machine Really Finish Your Sentence?». arXiv.
  8. Hendrycks, D., et al. (2020). «Measuring Massive Multitask Language Understanding». arXiv.
  9. Srivastava, A., et al. (2022). «Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models». arXiv.
  10. Bommasani, R., et al. (2022). «Holistic Evaluation of Language Models». arXiv. [4]