LMArena (Chatbot Arena) (HE)
Arena (עד 28 בינואר 2026 — LMArena (Large Model Arena), לשעבר — Chatbot Arena) — פלטפורמת אינטרנט קראודסורסינג פתוחה להערכה ודירוג השוואתי של מודלי שפה גדולים (LLM) ומודלים מולטי-מודליים (טקסט, תמונה, וידאו) על בסיס העדפות אנושיות אמיתיות. הבסיס של הפלטפורמה הוא השוואות זוגיות אנונימיות (blind battles) בין מודלים ומערכת דירוג Elo; על בסיסן מתפרסמות לידרבורדים ציבוריים שקופים, הנחשבים לאחד ה-benchmark-ים העצמאיים המוסמכים ביותר של מודלי AI מסוג frontier.[1][2]
הפלטפורמה נוצרה בשנת 2023 כפרויקט מחקר אקדמי של ארגון LMSYS Org (Large Model Systems Organization) באוניברסיטת קליפורניה בברקלי (Sky Computing Lab). בספטמבר 2024 הפרויקט «סיים את לימודיו» ועבר לדומיין עצמאי lmarena.ai («Graduation»)[3]. באפריל 2025 הוקמה חברה עצמאית Arena Intelligence Inc., וב-21 במאי 2025 גויס סבב זרע בסך $100 מיליון (שווי $600 מיליון, משקיעים עיקריים — a16z ו-UC Investments)[4][5]. ב-6 בינואר 2026 החברה סגרה סבב Series A בהיקף $150 מיליון עם שווי פוסט-מאני של $1.7 מיליארד[6]. ב-28 בינואר 2026 בוצע מיתוג מחדש סופי — הפלטפורמה קיבלה את השם Arena ועברה לדומיין arena.ai[7][8].
היסטוריה
הפלטפורמה הושקה באפריל 2023 תחת השם Chatbot Arena כפרויקט מחקר של ארגון LMSYS Org (Large Model Systems Organization) באוניברסיטת קליפורניה בברקלי (Sky Computing Lab). היא הייתה אחת הכלים הראשונים להערכת קראודסורסינג של מודלי שפה גדולים באמצעות השוואות זוגיות אנונימיות (blind battles) ומערכת דירוג Elo על בסיס העדפות משתמשים אמיתיות.
- 24 באפריל 2023 — השקה טכנית של Chatbot Arena.
- 3 במאי 2023 — יציאה רשמית לציבור ופרסום הלידרבורד הראשון.
- 2023 — שחרור ה-dataset-ים הפתוחים הראשונים: 33 אלף דיאלוגים זוגיים (יולי) ו-LMSYS‑Chat‑1M (ספטמבר, כ-1 מיליון דיאלוגים אמיתיים).
- 1 במרץ 2024 — פרסום המדיניות הרשמית של הפלטפורמה, פורמליזציה של המשימה כמערכת הערכה פתוחה מונעת-קהילה.
- 27 ביוני 2024 — הוספת תמיכה בתמונות ותחילת ההרחבה למשימות מולטי-מודליות.
- 20 בספטמבר 2024 — «Graduation»: מעבר לדומיין עצמאי lmarena.ai.
- סוף 2024 — אביב 2025 — השקת ארנות מתמחות (Arena-Hard, WebDev Arena, RepoChat Arena, Style/Sentiment Control ועוד).
- 17 באפריל 2025 — אינקורפורציה רשמית כחברה עצמאית Arena Intelligence Inc., השקת גרסת בטא של הפלטפורמה המעודכנת תחת המותג LMArena.
- 21 במאי 2025 — הכרזה על הקמת החברה וגיוס סבב זרע של $100 מיליון (שווי — $600 מיליון).
- 31 ביולי 2025 — פרסום dataset פתוח של 140 אלף דיאלוגים אחרונים מ-Text Arena.
- 6 בינואר 2026 — גיוס סבב Series A של $150 מיליון עם שווי פוסט-מאני של $1.7 מיליארד.
- ינואר 2026 — השקת Video Arena (תמיכה מלאה במודליות וידאו).
- 28 בינואר 2026 — מיתוג מחדש סופי: הפלטפורמה קיבלה את השם Arena ועברה לדומיין arena.ai.
נכון למרץ 2026, Arena (arena.ai) משרתת יותר מ-5 מיליון משתמשים פעילים חודשיים מ-150 מדינות ומעלה, צברה עשרות מיליוני הצבעות ונשארת אחד הכלים העצמאיים המוסמכים ביותר להערכת מודלי AI מסוג frontier על בסיס העדפות אנושיות אמיתיות.
כיצד עובדת ההערכה
המשתמש מזין שאילתה ומקבל שתי תשובות ממודלים אנונימיים שנבחרו באקראי («A» ו-«B»), ולאחר מכן מצביע על התשובה הטובה יותר (או מציין תיקו/אי-שביעות רצון). הדירוג מבוסס על מודל סטטיסטי של Bradley–Terry (רגרסיה לוגיסטית על פי העדפות זוגיות), הקרוב באינטואיציה ל-Elo[1]. הפלטפורמה מפרסמת Arena Score ורווחי סמך, וכן מיישמת תיקוני דגימה (re‑weighting) כדי לשמור על חוסר-הטיה בדגימה לא-אחידה[9].
שקיפות ופתיחות. צינורות ההערכה והדירוג המקוריים פתוחים במאגר FastChat[10]; מדי פעם מתפרסמים חלקים מהנתונים הגולמיים לצורך אימות ומחקר (למשל, שחרור 140K דיאלוגים ביולי 2025)[9][11]. על פי ה-FAQ והאזהרות בדף הבית, שאילתות משתמשים עשויות להיחשף לספקי מודלים ולהתפרסם חלקית למטרות מחקר — אין לשלוח נתונים רגישים[12][13].
כללי סינון ודגימה. לידרבורדים כוללים מודלים בגישה ציבורית (משקלות פתוחים/API ציבורי/שירות ציבורי). לייצוב ההערכה נדרשים בדרך כלל ≥1000 הצבעות; לא פחות מ-20% מהקרבות — רק בין מודלים ציבוריים; הסתברות הדגימה עולה עם הדירוג ואי-הוודאות, ורגרסיה עם שקלול-מחדש מבטיחה חוסר-הטיה של הציונים הסופיים[9].
מטריקות אוטומטיות ובקרת סגנון. למיהור ההערכה ולהפחתת אפקטי העדפות «סגנוניות» מיושמות מתודולוגיות עזר: MT‑Bench (LLM‑as‑a‑judge)[14], Arena‑Hard (יצירה אוטומטית של שאלות קשות)[15], וכן Style/Sentiment Control (מידול ו«ריפוי» של אפקט הטון/רגשות על ההעדפות)[16]. עבור Arena‑Hard‑Auto דווח על הסכמה גבוהה מאוד עם הצבעות אנושיות «חיות» (עד ≈98.6% בתנאים מבוקרים)[17].
ארנות ותחומי הערכה
הפלטפורמה התפתחה לאוסף של «ארנות» לפי סוגי משימות:
- Text Arena — דיאלוגים/משימות כלליות, הטבלה הראשית[18].
- Vision Arena — מודלים מולטי-מודליים «טקסט←תמונה/וידאו/ניתוח תמונות»[19].
- Text‑to‑Image ו-Image Edit — יצירה ועריכה של תמונות (כולל מקרה nano‑banana)[20][21].
- Text‑/Image‑to‑Video — יצירת וידאו[22].
- WebDev Arena — בניית יישומי אינטרנט מתיאורים[23].
- RepoChat Arena — משימות הנדסת AI על קוד/מאגרים[24].
- Search Arena — מודלים עם חיבור לחיפוש אינטרנט; הושקה תחילה באפריל 2025 (legacy), לאחר מכן הועברה לאתר הראשי, מלווה ב-dataset ופרסום[25][26][27].
- BiomedArena.AI — הערכה ספציפית-תחום למשימות ביו-רפואיות (שותפות עם DataTecnica)[28].
שימוש והשפעה
- ויטרינה תעשייתית. ספקים מובילים (OpenAI, Anthropic, Google ואחרים) בוחנים ומציגים מודלים על LMArena באופן קבוע; מדיה תעשייתית מתארת את הפלטפורמה כציון דרך חשוב[5][29]. בפרסום תעשייתי של NAACL‑2025 כונה ציון Elo של Chatbot Arena «gold industry‑standard»[30].
- בדיקות טרום-שחרור. המדיניות מאפשרת תצוגות מקדימות אנונימיות של מודלים «שטרם שוחררו» עם הודעה לקהילה ופרסום ציונים ציבוריים לאחר השחרור; מינימום ≈1000 הצבעות לייצוב[9].
- אפיזודות ידועות. באביב 2025 נדונה מודל אנונימי Llama‑4 Maverick‑03‑26‑Experimental (אירוע סביב השוואה עם גרסאות ציבוריות), מה שמשך תשומת לב תקשורתית נרחבת ועורר עדכוני כללים ותקשורת[31][32]. באוגוסט 2025 «nano‑banana» התגלה כ-Gemini 2.5 Flash Image ותפס עמדות מובילות בארנות הויזואליות[21][20].
מגבלות וביקורת
למרות הקנה-מידה והפופולריות, הגישה סובלת ממגבלות:
- סובייקטיביות ואפקטים סגנוניים. העדפות ההצבעה תלויות בטון ובאופן התשובה; הצוות מטמיע Style/Sentiment Control לניתוק «סגנון» מ«תוכן»[16].
- אי-ייצוגיות הקהל. גרעין הפעילים הוא חובבי-טכנולוגיה/מפתחים; לתרחישים תחומיים נוצרות ארנות מתמחות (Search, WebDev, Biomed ועוד)[33].
- פגיעות למניפולציות ולהטיות. מחקרים משנת 2025 מראים שבהיעדר הגנות קפדניות ניתן לנקוט אסטרטגיות «זיוף הצבעות» עם מאות עד אלפי הצבעות; עם זאת, שיתוף הפעולה בין חוקרים ל-LMArena הוביל להטמעת אמצעי הגנה (CAPTCHA/כניסה/הגנת בוטים/זיהוי חריגות) ולעלייה ב«עלות ההתקפה»[34][35][36].
- ביקורת מתודולוגית. העבודה The Leaderboard Illusion (אפריל 2025) מצביעה על גורמים שיטתיים ומוסדיים שעלולים לעוות את שדה התחרות; LMArena פרסמה תגובה מפורטת ומנהלת changelog ציבורי של המתודולוגיה[37][38][39].
קישורים חיצוניים
- האתר הרשמי של LMArena
- הבלוג/מדיניות ועדכונים של LMArena
- אתר קבוצת המחקר LMSYS (מקורות הגידול המקורי של הפרויקט)
ספרות
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Zheng, L. et al. (2023). Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena. arXiv:2306.05685.
- Li, T. et al. (2024). From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline. arXiv:2406.11939.
- Ameli, S.; Zhuang, S.; Stoica, I.; Mahoney, M. W. (2024). A Statistical Framework for Ranking LLM-Based Chatbots. arXiv:2412.18407.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Huang, J. Y.; Shen, Y.; Wei, D.; Broderick, T. (2025). Dropping Just a Handful of Preferences Can Change Top Large Language Model Rankings. arXiv:2508.11847.
- Xu, Y.; Ruis, L.; Rocktäschel, T.; Kirk, R. (2025). Investigating Non-Transitivity in LLM-as-a-Judge. arXiv:2502.14074.
- Li, H. et al. (2024). LLMs-as-Judges: A Comprehensive Survey on LLM-based Evaluation Methods. arXiv:2412.05579.
- Zheng, L. et al. (2024). LMSYS-Chat-1M: A Large-Scale Real-World LLM Conversation Dataset. arXiv:2309.11998.
- Dubois, Y. et al. (2024). Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators. arXiv:2404.04475.
- Singh, S. et al. (2025). The Leaderboard Illusion. arXiv:2504.20879.
- Min, R.; Pang, T.; Du, C.; Liu, Q.; Cheng, M.; Lin, M. (2025). Improving Your Model Ranking on Chatbot Arena by Vote Rigging. arXiv:2501.17858.
הערות
- ↑ 1.0 1.1 Chiang, W.-L. et al. «Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference». arXiv:2403.04132, 2024.
- ↑ «Hello from LMArena: The Community Platform for Exploring Frontier AI». LMArena Blog, 23 июня 2025.
- ↑ «Announcing a New Site for Chatbot Arena». LMSYS Blog, 20 сентября 2024.
- ↑ «Arena Intelligence Raises $100M Seed Round to Build the Standard for AI Evaluation». PR Newswire / Arena Intelligence, 21 мая 2025. [1]
- ↑ 5.0 5.1 Wiggers, K. «LMArena, the Chatbot Arena spinoff, raises $100M seed at a $600M valuation». TechCrunch, 21 мая 2025. [2]
- ↑ «Arena Intelligence Closes $150M Series A at $1.7B Valuation». Arena Intelligence Blog, 6 января 2026. [3]
- ↑ «We Are Now Arena». Arena Blog, 28 января 2026. [4]
- ↑ «LMArena is Growing to Support our Community Platform». LMArena Blog, 17 апреля 2025.
- ↑ 9.0 9.1 9.2 9.3 LMArena Leaderboard Policy. LMArena Blog, ред. 8 сентября 2025. [5]
- ↑ lm‑sys/FastChat (GitHub). [6]
- ↑ «Releasing 140K Text Arena Conversations». LMArena Blog, 31 июля 2025. [7]
- ↑ FAQ. LMArena. [8]
- ↑ Главная страница LMArena (дисклеймер о возможной публикации данных и передачи провайдерам). [9]
- ↑ Zheng, L. et al. «Judging LLM‑as‑a‑Judge with MT‑Bench and Chatbot Arena». arXiv:2306.05685, 2023. [10]
- ↑ Li, T. et al. «From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline». arXiv:2406.11939, 2024. [11]
- ↑ 16.0 16.1 «Style and Sentiment Control in the Arena». LMArena Blog, 2025. [12]
- ↑ Li, T. et al. «From Crowdsourced Data…» arXiv:2406.11939 (таблицы согласованности). [13]
- ↑ Text Arena (English). LMArena. [14]
- ↑ Vision Arena. LMArena, обновлено 2 сентября 2025. [15]
- ↑ 20.0 20.1 Text-to-Image Leaderboard. LMArena. [16]
- ↑ 21.0 21.1 «The nano-banana Story: Gemini 2.5 Flash Image Tops the Visual Arena». LMArena Blog, август 2025. [17]
- ↑ Text‑to‑Video и Image‑to‑Video Leaderboards. LMArena, август 2025. [18] [19]
- ↑ «Introducing WebDev Arena». LMArena Blog, 2025. [20]
- ↑ «Introducing RepoChat Arena». LMArena Blog, 2025. [21]
- ↑ «Introducing the Search Arena». LMArena Blog, 14 апреля 2025. [22]
- ↑ «Search Arena & What We're Learning About Human Preference». LMArena Blog, 23 июля 2025. [23]
- ↑ Frick, E. et al. «Search Arena: Analyzing Search‑Augmented LLMs». arXiv:2506.05334, 2025. [24]
- ↑ «Introducing BiomedArena.AI». LMArena Blog, 19 августа 2025. [25]
- ↑ Google. «Gemma 3…», 12 марта 2025 (ссылка на результаты LMArena). [26]
- ↑ Spangher, L. et al. «Chatbot Arena Estimate…». NAACL Industry, 2025. [27]
- ↑ «Meta's experimental Llama 4 model briefly topped AI leaderboard…». The Register, 7 апреля 2025. [28]
- ↑ Официальные разъяснения/посты LMArena в X по инциденту (апрель 2025). [29]
- ↑ «Search Arena & What We're Learning…». LMArena Blog, 23 июля 2025. [30]
- ↑ Min, R. et al. «Improving Your Model Ranking on Chatbot Arena by Vote Rigging». arXiv:2501.17858, 2025. [31]
- ↑ Huang, Y. et al. «Exploring and Mitigating Adversarial Manipulation of Voting‑Based Leaderboards». arXiv:2501.07493, 2025. [32]
- ↑ «Hundreds of rigged votes can skew…». Fast Company, 6 февраля 2025. [33]
- ↑ Singh, S. et al. «The Leaderboard Illusion». arXiv:2504.20879, 2025. [34]
- ↑ «Our Response to 'The Leaderboard Illusion'». LMArena Blog, 9 мая 2025. [35]
- ↑ «Methodology Changelog». LMArena Blog. [36]