LLM benchmarks — מדדי ביצועים של LLM
בנצ'מרקים של מודלי שפה גדולים הם מערכות בדיקה סטנדרטיות המיועדות למדידה, השוואה והערכה של איכות ויכולות מודלי שפה גדולים (LLM)[1]. בדרך כלל כל benchmark מהווה מערכת קבועה של משימות (לדוגמה, שאלות, טקסטים או הוראות), שעבורן ידועות מראש התשובות הנכונות או קריטריוני ההערכה. גישה זו מבטיחה השוואה אובייקטיבית בין מודלים שונים בתנאים זהים, ומאפשרת מעקב אחר ההתקדמות בתחום וזיהוי חוזקות וחולשות של המודלים[2].
שימוש סדיר ב-benchmarks ממלא תפקיד מרכזי בפיתוח LLM, מעודד מפתחים לשפר מודלים ומבטיח שקיפות והשוואתיות של תוצאות בקהילה המדעית. האבולוציה של ה-benchmarks משקפת את התפתחות ה-LLM עצמם: ממשימות פשוטות של הבנת שפה ועד בדיקות מורכבות הבוחנות חשיבה רב-שלבית, שכל ישר, אתיקה ובטיחות[3].
קטגוריות עיקריות ודוגמאות
בנצ'מרקים של LLM охватывают מגוון רחב של מיומנויות ותחומי שימוש. להלן הקטגוריות העיקריות ומערכות המשימות הידועות ביותר בכל אחת מהן.
הבנת שפה כללית
קטגוריה זו מעריכה את יכולות הבסיס של המודל להבנה ופרשנות של שפה טבעית.
- GLUE (General Language Understanding Evaluation, 2019) — אחד ה-benchmarks המורכבים הראשונים, הכולל מספר משימות מגוונות: מזיהוי טון ועד הערכת קוהרנטיות לוגית של טקסט. התוצאות בכל המשימות מצטברות לציון אחד, מה שאפשר להשוות מודלים מוקדמים לפי יעילותם הכוללת[4].
- SuperGLUE (2019) — יורשו ה"מחוזק" של GLUE, שפותח בתגובה לכך שמודלים השיגו במהירות רמה הקרובה לרמה האנושית. SuperGLUE כולל משימות קשות יותר הדורשות הבנה עמוקה של הקשר ויכולת הסקת מסקנות[5].
- WinoGrande (2019) — גרסה מורחבת של חידת Winograd Schema. מכיל 44 אלף משימות לפתרון כינויי גוף דו-משמעיים במשפטים הדורשים שכל ישר לבחירת הפרשנות הנכונה[6].
Benchmarks רב-משימתיים ומורכבים
מערכות אלו בוחנות מודלים על מגוון רחב של ידע ומיומנויות, מעבר למשימות לשוניות בלבד.
- MMLU (Massive Multitask Language Understanding, 2020) — אוסף משימות בפורמט חידון המכסה 57 תחומי נושא: מדיסציפלינות בית-ספריות ועד ידע מקצועי מתמחה (משפטים, רפואה). MMLU מודד את רוחב הידע הכללי של המודל[7].
- BIG-bench (Beyond the Imitation Game Benchmark, 2022) — ה-benchmark השיתופי הגדול ביותר בעת יצירתו, שפותח על ידי יותר מ-400 מחברים. הוא כולל למעלה מ-200 משימות בנושאים המגוונים ביותר, מבלשנות ועד פיזיקה, במטרה לבחון מודלים מחוץ להתאמה לתבניות ולאתר את גבולותיהם במצבים לא שגרתיים[8].
שכל ישר ואמינות
בנצ'מרקים אלו מעריכים את יכולת המודל להסיק מסקנות הגיוניות על מצבי יומיום ולהימנע מהפצת מידע שגוי.
- HellaSwag (2019) — בוחן שכל ישר באמצעות משימת בחירת ההמשך הסביר ביותר לתיאור מצב. המאפיין של ה-benchmark הוא קיום "מלכודות": התשובות השגויות מיוצרות אוטומטית ונראות משכנעות מאוד, מה שדורש מהמודל הבנה עמוקה של ההקשר[9].
- TruthfulQA (2021) — מודד את נטיית המודל להפיץ מיתוסים ואמונות שגויות נפוצות. מכיל שאלות שבהן התשובה הנפוצה באינטרנט היא שגויה (לדוגמה, "האם חיסונים גורמים לאוטיזם?"). מהמודל נדרש לא להיכנע לסטריאוטיפים שגויים ולתת תשובה עובדתית נכונה[10].
משימות מתמטיות
- GSM8K (2021) — כולל אלפי בעיות מילוליות במתמטיקה ברמת בית ספר יסודי. כל בעיה דורשת ביצוע רצף של 2–8 שלבים אריתמטיים לקבלת התשובה, מה שבוחן את יכולת המודל לחשיבה רב-שלבית[11].
- MATH (2021) — מערכת מורכבת יותר הכוללת בעיות מאולימפיאדות ותחרויות מתמטיקה. היא כוללת פרקים של אלגברה, גיאומטריה ותורת המספרים, ודורשת מהמודל שליטה בשיטות פתרון לא טריוויאליות[12].
יצירת קוד תוכנה
- HumanEval (2021) — מבחן סטנדרטי להערכת יכולת LLM לכתוב קוד. מכיל 164 משימות תכנות שבהן המודל צריך לייצר קוד Python נכון לפי תיאור נתון. הנכונות מוערכת באמצעות unit tests[13].
- SWE-bench (2023) — benchmark ריאליסטי יותר, האוסף תיאורים של בעיות אמיתיות (issues) מ-GitHub. המודל צריך לייצר patch (קטע קוד) המתקן את הבעיה. הדבר דורש הבנת נפח גדול של קוד של אחרים ותהליך חשיבה מורכב ושלב-אחר-שלב[14].
הערכת מודלים דיאלוגיים
- Chatbot Arena (2024) — פלטפורמה מקוונת פתוחה שבה שני מודלים אנונימיים משתתפים בדיאלוג זוגי עם משתמש. לאחר הדיאלוג המשתמש מצביע על מי שענה טוב יותר. על בסיס אלפי "דו-קרבות" כאלה נוצר דירוג Elo של העדפות המשתמשים, המשקף את איכות המודלים בתקשורת חיה[15].
- MT-Bench (2023) — benchmark אוטומטי לבדיקת עמידות במתח של יכולות דיאלוגיות. הוא מכיל 80 זוגות שאלות המדמות דיאלוג רב-סיבובי. תשובות המודלים מוערכות על ידי LLM אחר וחזק יותר ("LLM-as-a-judge", לדוגמה GPT-4) לפי סולם שנקבע מראש[16].
בטיחות ואמינות
- AgentHarm (2024) — benchmark המעריך את נטיית סוכני LLM לבצע הוראות מסוכנות. הוא כולל 110 תרחישים המייצגים משימות זדוניות (מהונאה ועד פשעי סייבר). מודל טוב צריך לסרב לבצע בקשות כאלה[17].
- SafetyBench (2023) — מערכת רחבה של למעלה מ-11 אלף שאלות הבוחנות עד כמה המודל עקבי בהימנעות מייצור תוכן פסול ועצות מזיקות, כולל בתגובה לבקשות פרובוקטיביות[18].
מגבלות ובעיות עכשוויות
- זיהום נתונים: האיום העיקרי על אמינות ההערכה הוא דליפת נתוני הבדיקה למערכי האימון. המודל עלול פשוט לשנן תשובות, מה שמנפח באופן מלאכותי את תוצאתו[2].
- רוויה של benchmarks: ככל שהמודלים מתפתחים, ביצועיהם ב-benchmarks ישנים (כגון GLUE) מגיעים לתקרה, והמבחן מפסיק להיות שימושי להבחנה בין מודלים חדשים וחזקים יותר. הדבר מחייב פיתוח מתמיד של אמות מידה מורכבות יותר[2].
- פער מהמציאות: תוצאות גבוהות ב-benchmarks אינן מבטיחות תמיד עבודה אמינה של המודל בתרחישים אמיתיים ולא מובנים. הסביבה האמיתית לרוב עשירה ובלתי צפויה יותר מכל מערכת משימות קבועה[1].
קישורים
- Open LLM Leaderboard — דירוג פתוח של מודלים מקהילת Hugging Face
- Chatbot Arena Leaderboard — דירוג מודלי שיחה על בסיס העדפות אנושיות
הערות
- ↑ 1.0 1.1 «What Are LLM Benchmarks?». IBM. [1]
- ↑ 2.0 2.1 2.2 «20 LLM evaluation benchmarks and how they work». Evidently AI. [2]
- ↑ «Самые популярные LLM бенчмарки». Хабр. [3]
- ↑ Wang, Alex; Singh, Amanpreet; Michael, Julian; et al. «GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding». arXiv. [4]
- ↑ Wang, Alex; Pruksachatkun, Yada; Nangia, Nikita; et al. «SuperGLUE: A Stickier Benchmark for General-Purpose Language Understanding Systems». arXiv. [5]
- ↑ Sakaguchi, Keisuke; Le Bras, Ronan; Bhagavatula, Chandra; Choi, Yejin. «WinoGrande: An Adversarial Winograd Schema Challenge at Scale». arXiv. [6]
- ↑ Hendrycks, Dan; Burns, Collin; Basart, Steven; et al. «Measuring Massive Multitask Language Understanding». arXiv. [7]
- ↑ Srivastava, Aarohi; et al. «Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models». arXiv. [8]
- ↑ Zellers, Rowan; Holtzman, Ari; Bisk, Yonatan; et al. «HellaSwag: Can a Machine Really Finish Your Sentence?». arXiv. [9]
- ↑ Lin, Stephanie; Hilton, Jacob; Evans, Owain. «TruthfulQA: Measuring How Models Mimic Human Falsehoods». arXiv. [10]
- ↑ Cobbe, Karl; Kosaraju, Vineet; Bavarian, Mohammad; et al. «Training Verifiers to Solve Math Word Problems». arXiv. [11]
- ↑ Hendrycks, Dan; Burns, Collin; Saund, Saurav; et al. «Measuring Mathematical Problem Solving With the MATH Dataset». arXiv. [12]
- ↑ Chen, Mark; Tworek, Jerry; Jun, Heewoo; et al. «Evaluating Large Language Models Trained on Code». arXiv. [13]
- ↑ Jimenez, Carlos E.; et al. «SWE-bench: Can Language Models Resolve Real-World GitHub Issues?». arXiv. [14]
- ↑ Chiang, Wei-Lin; et al. «Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preferences». lmsys.org. [15]
- ↑ Zheng, Lianmin; et al. «Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena». arXiv. [16]
- ↑ Andriushchenko, Maksym; et al. «AgentHarm: A Benchmark for Asessing Agentic AI Harm». arXiv. [17]
- ↑ Zhang, Zhexin; et al. «SafetyBench: A Comprehensive Benchmark for Evaluating the Safety of Large Language Models». arXiv. [18]