LMArena (Chatbot Arena) — 大規模モデルアリーナ

From Systems analysis wiki
Jump to navigation Jump to search

Arena(2026年1月28日までは LMArenaLarge Model Arena)、それ以前は Chatbot Arena)は、大規模言語モデル(LLM)およびマルチモーダルモデル(テキスト・画像・動画)を実世界の人間の選好に基づいてクラウドソーシングで評価・比較する、オープンなウェブプラットフォームである。中核となるのはモデル同士の匿名のペアワイズ比較(blind battles)と Elo レーティングシステムであり、これらに基づいて公開かつ透明性のあるリーダーボードを公表している。このリーダーボードは、フロンティア AI モデルに関する最も認知された独立系ベンチマークの一つとされている。[1][2]

このプラットフォームは、2023年にカリフォルニア大学バークレー校(Sky Computing Lab)の研究組織 LMSYS Org(Large Model Systems Organization)の学術研究プロジェクトとして誕生した。2024年9月、プロジェクトは独自ドメイン lmarena.ai へ「卒業(Graduation)」した[3]。2025年4月には独立企業 Arena Intelligence Inc. が設立され、2025年5月21日に評価額6億ドルで 1億ドル のシードラウンドを調達した(主要投資家は a16z と UC Investments)[4][5]。2026年1月6日、同社はポストマネー評価額 17億ドル1億5000万ドル のシリーズ A ラウンドを完了した(Felicis と UC Investments が主導)[6][7]。2026年1月28日には最終的なリブランディングが行われ、プラットフォームは Arena に改称し、ドメインを arena.ai へ移行した[8][9]

歴史

このプラットフォームは、2023年4月に Chatbot Arena という名称で、カリフォルニア大学バークレー校(Sky Computing Lab)の研究組織 LMSYS Org(Large Model Systems Organization)の研究プロジェクトとして公開された。実際の利用者の選好に基づき、匿名のペアワイズ比較(blind battles)と Elo レーティングシステムによって大規模言語モデルをクラウドソーシングで評価する、最初期のツールの一つであった。

  • 2023年4月24日 — Chatbot Arena の技術的なローンチ。
  • 2023年5月3日 — 正式な一般公開と最初のリーダーボードの公表。
  • 2023年 — 最初のオープンデータセットの公開:3万3000件のペア対話(7月)と LMSYS-Chat-1M(9月、約100万件の実対話)。
  • 2024年3月1日 — プラットフォームの公式ポリシーの公表と、オープンでコミュニティ主導の評価システムとしての使命の明文化。
  • 2024年6月27日 — 画像対応の追加と、マルチモーダルタスクへの拡張の開始。
  • 2024年9月20日 — 「Graduation」:独立ドメイン lmarena.ai への移行。
  • 2024年後半〜2025年春 — 専門アリーナ(Arena-Hard、WebDev Arena、RepoChat Arena、Style/Sentiment Control など)の立ち上げ。
  • 2025年4月17日 — 独立企業 Arena Intelligence Inc. としての正式な法人化と、LMArena ブランドの下での刷新版プラットフォームのベータ版公開。
  • 2025年5月21日 — 企業設立の発表と 1億ドル のシードラウンド(評価額6億ドル)。
  • 2025年7月31日 — Text Arena の直近の対話 14万件 からなるオープンデータセットの公開。
  • 2025年12月18日 — ランキング手法を実装したオープンソースパッケージ Arena-Rank の公開。
  • 2026年1月6日 — ポストマネー評価額 17億ドル での 1億5000万ドル のシリーズ A ラウンドの完了。
  • 2026年1月Video Arena(動画モダリティの完全対応)の立ち上げ。
  • 2026年1月28日 — 最終的なリブランディング:プラットフォームを Arena に改称し、ドメインを arena.ai へ移行。

2026年3月時点で、Arena(arena.ai)は150か国以上にわたる500万人を超える月間アクティブユーザーにサービスを提供し、数千万件の投票を蓄積しており、実世界の人間の選好に基づいてフロンティア AI モデルを評価する、最も認知された独立系ツールの一つであり続けている。

評価の仕組み

利用者はクエリ(プロンプト)を入力し、ランダムに選ばれた匿名の2つのモデル(「A」と「B」)から回答を受け取り、より優れた回答に投票する(または引き分け、もしくはどちらも満足できないと表明する)。ランキングは、Elo に概念的に近い Bradley–Terry 統計モデル(ペアワイズの選好に対するロジスティック回帰)に基づく[1]。プラットフォームは Arena Score と信頼区間を公表し、不均一なサンプリングの下でも不偏性を保つためにサンプリング補正(再重み付け, re-weighting)を適用している[10]

透明性と公開性。 評価とランキングのパイプラインはオープンソースである。元のインフラはリポジトリ FastChat にあり[11]、2025年12月にはリーダーボードの手法が独立した Python パッケージ Arena-Rank として公開された。これは現在サイト上のすべてのリーダーボードを動かしており、FastChat ベースの版よりおよそ30倍高速である[12]。さらに、検証や研究のために生データの一部が定期的に公開されている(例:2025年7月の14万件の会話の公開)[10][13]。FAQ およびトップページの注意書きによれば、利用者のクエリはモデルプロバイダーと共有され、研究目的で一部公開されることがあるため、機微なデータを送信すべきではない[14][15]

選定とサンプリングの規則。 リーダーボードには、一般に利用可能なモデル(オープンウェイト、公開 API、または公開サービス)が含まれる。スコアを安定させるには通常 1000票 以上が必要であり、バトルの少なくとも 20% は公開モデル同士のみで行われる。サンプリング確率はレーティングと不確実性とともに高まり、再重み付けを行う回帰によって最終的なスコアの不偏性が保証される[10]

自動評価指標とスタイル制御。 評価を高速化し、「スタイル」の選好による影響を低減するために、補助的な手法が用いられている。すなわち、MT-Bench(LLM-as-a-judge)[16]Arena-Hard(難問の自動生成)[17]、および Style/Sentiment Control(口調・感情が選好に与える影響のモデル化と補正)[18]である。Arena-Hard-Auto では、リアルタイムの人間による投票との非常に高い一致率(制御された条件下で最大約 98.6%)が報告されている[19]

アリーナと評価領域

プラットフォームは、タスクの種類に応じた「アリーナ」の集合へと発展してきた。

  • Text Arena — 一般的な会話とタスク。主要なリーダーボード[20]
  • Vision Arena — 「テキスト→画像/動画/画像分析」のマルチモーダルモデル[21]
  • Text-to-ImageImage Edit — 画像の生成と編集(nano-banana の事例を含む)[22][23]
  • Text-/Image-to-Video — 動画生成[24]
  • WebDev Arena — 説明文からのウェブアプリケーションの構築[25]
  • RepoChat Arena — コードやリポジトリに関わる AI エンジニアリングのタスク[26]
  • Search Arena — ウェブ検索に接続したモデル。2025年4月に当初(legacy として)公開され、その後メインサイトへ移行し、データセットと論文を伴う[27][28][29]
  • BiomedArena.AI — 生物医学タスク向けのドメイン特化型評価(DataTecnica との提携)[30]

活用と影響

  • 業界のショーケース。 主要なプロバイダー(OpenAI、Anthropic、Google など)は、自社モデルを定期的にこのプラットフォームでテストし紹介している。業界メディアは本プラットフォームを重要なベンチマークとして評している[5][31]。NAACL-2025 の業界論文では、Chatbot Arena の Elo スコアが「gold industry-standard(業界のゴールドスタンダード)」と評されている[32]
  • リリース前テスト。 ポリシーは「未公開」モデルの匿名プレビューを認めており、コミュニティへの通知と、リリース後の公開評価の事後公表を伴う。安定化には最低でも約1000票が必要である[10]
  • 注目すべき出来事。 2025年春、匿名モデル Llama-4 Maverick-03-26-Experimental が議論を呼んだ(公開版との比較に関わる一件)。これは報道で大きく取り上げられ、規則やコミュニケーションの更新を促した[33][34]。2025年8月には「nano-banana」が Gemini 2.5 Flash Image であると明らかになり、ビジュアル系アリーナで首位を占めた[23][22]

限界と批判

規模と人気にもかかわらず、この手法には限界がある。

  • 主観性とスタイルの影響。 投票の選好は回答の口調や形式に左右される。チームは「スタイル」と「コンテンツ」を切り離すために Style/Sentiment Control を導入している[18]
  • 利用者層の代表性の欠如。 中心的に活動しているのは技術愛好家や開発者であり、ドメイン特化のシナリオ向けには専門アリーナ(Search、WebDev、Biomed など)が作られている[35]
  • 操作と偏りへの脆弱性。 2025年の研究は、厳格な防御がなければ、数百〜数千票による投票操作(vote rigging)が可能であることを示した。もっとも、研究者と LMArena の協力により、保護策(CAPTCHA、ログイン、ボット対策、異常検知)が導入され、「攻撃コスト」が引き上げられた[36][37][38]
  • 方法論的批判。 論文 The Leaderboard Illusion(2025年4月)は、競争環境を歪めうる体系的・制度的な要因を指摘している。LMArena は詳細な反論を公表し、手法の変更履歴(changelog)を公開し続けている[39][40][41]

外部リンク

参考文献

  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Zheng, L. et al. (2023). Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena. arXiv:2306.05685.
  • Li, T. et al. (2024). From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline. arXiv:2406.11939.
  • Ameli, S.; Zhuang, S.; Stoica, I.; Mahoney, M. W. (2024). A Statistical Framework for Ranking LLM-Based Chatbots. arXiv:2412.18407.
  • Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
  • Huang, J. Y.; Shen, Y.; Wei, D.; Broderick, T. (2025). Dropping Just a Handful of Preferences Can Change Top Large Language Model Rankings. arXiv:2508.11847.
  • Xu, Y.; Ruis, L.; Rocktäschel, T.; Kirk, R. (2025). Investigating Non-Transitivity in LLM-as-a-Judge. arXiv:2502.14074.
  • Li, H. et al. (2024). LLMs-as-Judges: A Comprehensive Survey on LLM-based Evaluation Methods. arXiv:2412.05579.
  • Zheng, L. et al. (2024). LMSYS-Chat-1M: A Large-Scale Real-World LLM Conversation Dataset. arXiv:2309.11998.
  • Dubois, Y. et al. (2024). Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators. arXiv:2404.04475.
  • Singh, S. et al. (2025). The Leaderboard Illusion. arXiv:2504.20879.
  • Min, R.; Pang, T.; Du, C.; Liu, Q.; Cheng, M.; Lin, M. (2025). Improving Your Model Ranking on Chatbot Arena by Vote Rigging. arXiv:2501.17858.

脚注

  1. 1.0 1.1 Chiang, W.-L. et al. "Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference." arXiv:2403.04132、2024年。arXiv
  2. "Hello from LMArena: The Community Platform for Exploring Frontier AI." LMArena Blog、2025年6月23日。[1]
  3. "Announcing a New Site for Chatbot Arena." LMSYS Blog、2024年9月20日。[2]
  4. "LMArena Secures $100M in Seed Funding to Bring Scientific Rigor to AI Reliability." PR Newswire、2025年5月21日。[3]
  5. 5.0 5.1 Wiggers, K. "LM Arena, the organization behind popular AI leaderboards, lands $100M." TechCrunch、2025年5月21日。[4]
  6. "LMArena Raises $150 Million to Build the World's Most Trusted AI Evaluation Platform." PR Newswire、2026年1月6日。[5]
  7. "LMArena lands $1.7B valuation four months after launching its product." TechCrunch、2026年1月6日。[6]
  8. "LMArena is now Arena." Arena Blog、2026年1月28日。[7]
  9. "LMArena is Growing to Support our Community Platform." LMArena Blog、2025年4月17日。
  10. 10.0 10.1 10.2 10.3 Arena Leaderboard PolicyArena Blog、最終更新:2026年4月30日。[8]
  11. lm-sys/FastChat (GitHub)。[9]
  12. "Arena-Rank: Open Sourcing the Leaderboard Methodology." Arena Blog、2025年12月18日。[10]。リポジトリ:lmarena/arena-rank
  13. Y. Song. "A Deep Dive into Recent Arena Data." LMArena Blog、2025年7月31日。[11]
  14. FAQArena[12]
  15. Arena トップページ(データ公開とプロバイダーへの提供に関する免責事項)。[13]
  16. Zheng, L. et al. "Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena." arXiv:2306.05685、2023年。[14]
  17. Li, T. et al. "From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline." arXiv:2406.11939、2024年。[15]
  18. 18.0 18.1 "Does Sentiment Matter Too? Introducing Sentiment Control." LMArena Blog、2025年4月22日。[16]
  19. Li, T. et al. "From Crowdsourced Data…" arXiv:2406.11939(一致率の表)。[17]
  20. Text Arena (English)Arena[18]
  21. Vision ArenaArena[19]
  22. 22.0 22.1 Text-to-Image ArenaArena[20]
  23. 23.0 23.1 "Nano-Banana (Gemini 2.5 Flash Image): Try it on LMArena." LMArena Blog、2025年8月27日。[21]
  24. Text-to-Video および Image-to-Video LeaderboardsArena[22] [23]
  25. "WebDev Arena: A Live LLM Leaderboard for Web App Development." LMArena Blog、2025年3月10日。[24]
  26. "RepoChat Arena: A Live Benchmark for AI Software Engineers." LMArena Blog、2025年4月9日。[25]
  27. "Introducing the Search Arena." LMArena Blog、2025年4月14日。[26]
  28. "Search Arena & What We're Learning About Human Preference." LMArena Blog、2025年7月23日。[27]
  29. Frick, E. et al. "Search Arena: Analyzing Search-Augmented LLMs." arXiv:2506.05334、2025年。[28]
  30. "Introducing BiomedArena.AI." LMArena Blog、2025年8月19日。[29]
  31. Google. "Gemma 3…"、2025年3月12日(LMArena の結果へのリンク)。[30]
  32. Spangher, L. et al. "Chatbot Arena Estimate…." NAACL Industry、2025年。[31]
  33. "Meta's experimental Llama 4 model briefly topped AI leaderboard…." The Register、2025年4月7日。[32]
  34. 本件に関する LMArena の公式説明および X での投稿(2025年4月)。[33]
  35. "Search Arena & What We're Learning…." LMArena Blog、2025年7月23日。[34]
  36. Min, R. et al. "Improving Your Model Ranking on Chatbot Arena by Vote Rigging." arXiv:2501.17858、2025年。[35]
  37. Huang, Y. et al. "Exploring and Mitigating Adversarial Manipulation of Voting-Based Leaderboards." arXiv:2501.07493、2025年。[36]
  38. "Hundreds of rigged votes can skew…." Fast Company、2025年2月6日。[37]
  39. Singh, S. et al. "The Leaderboard Illusion." arXiv:2504.20879、2025年。[38]
  40. "Our Response to 'The Leaderboard Illusion'." LMArena Blog、2025年5月9日。[39]
  41. Leaderboard ChangelogArena Blog[40]