LMArena (Chatbot Arena) (ES)

From Systems analysis wiki
Jump to navigation Jump to search

Arena (hasta el 28 de enero de 2026, LMArena (Large Model Arena); anteriormente, Chatbot Arena) es una plataforma web abierta de evaluación colaborativa (crowdsourcing) y comparación de grandes modelos de lenguaje (LLM) y modelos multimodales (texto, imagen, vídeo) basada en preferencias humanas reales. Su núcleo son las comparaciones anónimas por pares (blind battles) de modelos y el sistema de puntuación Elo; sobre ellas se publican tablas de clasificación públicas y transparentes, consideradas uno de los referentes independientes más reconocidos para los modelos de IA de frontera (frontier).[1][2]

La plataforma surgió en 2023 como un proyecto académico de investigación de la organización LMSYS Org (Large Model Systems Organization) de la Universidad de California en Berkeley (Sky Computing Lab). En septiembre de 2024, el proyecto «se graduó» a su propio dominio, lmarena.ai («Graduation»)[3]. En abril de 2025 se constituyó la compañía independiente Arena Intelligence Inc., y el 21 de mayo de 2025 cerró una ronda semilla de 100 millones de dólares (valoración de 600 millones; inversores principales: a16z y UC Investments)[4][5]. El 6 de enero de 2026, la empresa cerró una ronda de Series A de 150 millones de dólares con una valoración post-money de 1700 millones, liderada por Felicis y UC Investments[6][7]. El 28 de enero de 2026 se produjo el cambio de marca definitivo: la plataforma pasó a llamarse Arena y se trasladó al dominio arena.ai[8][9].

Historia

La plataforma se lanzó en abril de 2023 con el nombre de Chatbot Arena, como proyecto de investigación de la organización LMSYS Org (Large Model Systems Organization) en la Universidad de California en Berkeley (Sky Computing Lab). Fue una de las primeras herramientas de evaluación colaborativa de grandes modelos de lenguaje mediante comparaciones anónimas por pares (blind battles) y el sistema de puntuación Elo a partir de las preferencias reales de los usuarios.

  • 24 de abril de 2023 — lanzamiento técnico de Chatbot Arena.
  • 3 de mayo de 2023 — lanzamiento público oficial y publicación de la primera tabla de clasificación.
  • 2023 — publicación de los primeros conjuntos de datos abiertos: 33 mil diálogos por pares (julio) y LMSYS-Chat-1M (septiembre, alrededor de 1 millón de diálogos reales).
  • 1 de marzo de 2024 — publicación de la política oficial de la plataforma y formalización de su misión como sistema de evaluación abierto y dirigido por la comunidad.
  • 27 de junio de 2024 — incorporación del soporte de imágenes e inicio de la expansión hacia tareas multimodales.
  • 20 de septiembre de 2024 — «Graduation»: traslado al dominio independiente lmarena.ai.
  • Finales de 2024 – primavera de 2025 — lanzamiento de arenas especializadas (Arena-Hard, WebDev Arena, RepoChat Arena, Style/Sentiment Control, etc.).
  • 17 de abril de 2025 — incorporación oficial como compañía independiente Arena Intelligence Inc. y lanzamiento de la versión beta de la plataforma renovada bajo la marca LMArena.
  • 21 de mayo de 2025 — anuncio de la constitución de la empresa y cierre de la ronda semilla de 100 millones de dólares (valoración: 600 millones).
  • 31 de julio de 2025 — publicación de un conjunto de datos abierto con 140 mil diálogos recientes de la Text Arena.
  • 18 de diciembre de 2025 — publicación de Arena-Rank, el paquete de código abierto que implementa la metodología de clasificación.
  • 6 de enero de 2026 — cierre de la ronda de Series A de 150 millones de dólares con una valoración post-money de 1700 millones.
  • Enero de 2026 — lanzamiento de Video Arena (soporte completo de la modalidad de vídeo).
  • 28 de enero de 2026 — cambio de marca definitivo: la plataforma pasó a llamarse Arena y se trasladó al dominio arena.ai.

Para marzo de 2026, Arena (arena.ai) da servicio a más de 5 millones de usuarios activos mensuales de más de 150 países, ha acumulado decenas de millones de votos y sigue siendo una de las herramientas independientes más reconocidas para evaluar modelos de IA de frontera según las preferencias humanas reales.

Cómo funciona la evaluación

El usuario introduce una consulta (prompt) y recibe dos respuestas de modelos anónimos seleccionados al azar («A» y «B»), tras lo cual vota por la mejor respuesta (o declara un empate o que ninguna es satisfactoria). La clasificación se basa en el modelo estadístico de Bradley-Terry (una regresión logística sobre preferencias por pares), conceptualmente próximo al sistema Elo[1]. La plataforma publica el Arena Score y los intervalos de confianza, y aplica correcciones de muestreo (re-weighting) para mantener la imparcialidad ante un muestreo no uniforme[10].

Transparencia y apertura. Los pipelines de evaluación y clasificación son de código abierto: la infraestructura original reside en el repositorio FastChat[11], y en diciembre de 2025 la metodología de las tablas se publicó como un paquete de Python independiente, Arena-Rank —que alimenta hoy todas las clasificaciones del sitio y es unas 30 veces más rápido que la versión basada en FastChat—[12]. Además, periódicamente se publican fragmentos de los datos brutos para verificación e investigación (por ejemplo, la publicación de 140K conversaciones en julio de 2025)[10][13]. Según las FAQ y las advertencias en la página principal, las consultas de los usuarios pueden compartirse con los proveedores de los modelos y publicarse parcialmente con fines de investigación, por lo que no se deben enviar datos sensibles[14][15].

Reglas de selección y muestreo. En las tablas de clasificación se incluyen modelos de acceso público (pesos abiertos, API pública o servicio público). Para estabilizar la puntuación se requieren habitualmente ≥1000 votos; al menos el 20% de las batallas se libran solo entre modelos públicos; la probabilidad de muestreo aumenta con la calificación y la incertidumbre, y la regresión con reponderación garantiza la imparcialidad de las puntuaciones finales[10].

Métricas automáticas y control de estilo. Para acelerar la evaluación y reducir los efectos de las preferencias de «estilo» se emplean metodologías auxiliares: MT-Bench (LLM-as-a-judge)[16], Arena-Hard (generación automática de preguntas difíciles)[17] y Style/Sentiment Control (modelado y corrección del efecto del tono/emoción sobre las preferencias)[18]. Para Arena-Hard-Auto se ha reportado una concordancia muy alta con los votos humanos en tiempo real (hasta aproximadamente un 98,6% en condiciones controladas)[19].

Arenas y dominios de evaluación

La plataforma ha evolucionado hasta convertirse en un conjunto de «arenas» según el tipo de tarea:

  • Text Arena — conversaciones y tareas generales; es la tabla principal[20].
  • Vision Arena — modelos multimodales «texto→imagen/vídeo/análisis de imágenes»[21].
  • Text-to-Image e Image Edit — generación y edición de imágenes (incluido el caso de nano-banana)[22][23].
  • Text-/Image-to-Video — generación de vídeo[24].
  • WebDev Arena — construcción de aplicaciones web a partir de descripciones[25].
  • RepoChat Arena — tareas de ingeniería de IA sobre código y repositorios[26].
  • Search Arena — modelos con conexión a búsqueda web; lanzada inicialmente en abril de 2025 (legacy), luego migrada al sitio principal, acompañada de un conjunto de datos y una publicación[27][28][29].
  • BiomedArena.AI — evaluación específica de dominio para tareas biomédicas (en colaboración con DataTecnica)[30].

Aplicación e impacto

  • Escaparate para la industria. Los principales proveedores (OpenAI, Anthropic, Google, etc.) prueban y presentan regularmente sus modelos en la plataforma; los medios del sector la describen como un referente importante[5][31]. En una publicación de la industria de NAACL-2025, la puntuación Elo de Chatbot Arena se describe como el «gold industry-standard»[32].
  • Pruebas de prelanzamiento. La política permite vistas previas anónimas de modelos «no lanzados», con notificación a la comunidad y posterior publicación de las evaluaciones públicas tras el lanzamiento; se requiere un mínimo de ≈1000 votos para la estabilización[10].
  • Episodios notables. En la primavera de 2025 se discutió el modelo anónimo Llama-4 Maverick-03-26-Experimental (un incidente relacionado con su comparación con las versiones públicas), lo que atrajo una amplia atención de la prensa y motivó actualizaciones en las reglas y la comunicación[33][34]. En agosto de 2025, «nano-banana» se reveló como Gemini 2.5 Flash Image y ocupó las primeras posiciones en las arenas visuales[23][22].

Limitaciones y críticas

A pesar de su escala y popularidad, el enfoque tiene limitaciones:

  • Subjetividad y efectos de estilo. Las preferencias en la votación dependen del tono y la manera de la respuesta; el equipo está implementando Style/Sentiment Control para desacoplar el «estilo» del «contenido»[18].
  • Falta de representatividad de la audiencia. El núcleo activo está formado por entusiastas de la tecnología y desarrolladores; para los escenarios de dominio específico se crean arenas especializadas (Search, WebDev, Biomed, etc.)[35].
  • Vulnerabilidad a la manipulación y los sesgos. Investigaciones de 2025 demuestran que, sin defensas estrictas, son posibles estrategias de manipulación de votos (vote rigging) con cientos o miles de votos; no obstante, la colaboración entre investigadores y LMArena ha llevado a implementar medidas de protección (CAPTCHA, inicio de sesión, protección contra bots, detección de anomalías) y a aumentar el «coste del ataque»[36][37][38].
  • Críticas metodológicas. El trabajo The Leaderboard Illusion (abril de 2025) señala factores sistemáticos e institucionales que pueden distorsionar el campo competitivo; LMArena publicó una respuesta detallada y mantiene un changelog público de su metodología[39][40][41].

Enlaces externos

Bibliografía

  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Zheng, L. et al. (2023). Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena. arXiv:2306.05685.
  • Li, T. et al. (2024). From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline. arXiv:2406.11939.
  • Ameli, S.; Zhuang, S.; Stoica, I.; Mahoney, M. W. (2024). A Statistical Framework for Ranking LLM-Based Chatbots. arXiv:2412.18407.
  • Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
  • Huang, J. Y.; Shen, Y.; Wei, D.; Broderick, T. (2025). Dropping Just a Handful of Preferences Can Change Top Large Language Model Rankings. arXiv:2508.11847.
  • Xu, Y.; Ruis, L.; Rocktäschel, T.; Kirk, R. (2025). Investigating Non-Transitivity in LLM-as-a-Judge. arXiv:2502.14074.
  • Li, H. et al. (2024). LLMs-as-Judges: A Comprehensive Survey on LLM-based Evaluation Methods. arXiv:2412.05579.
  • Zheng, L. et al. (2024). LMSYS-Chat-1M: A Large-Scale Real-World LLM Conversation Dataset. arXiv:2309.11998.
  • Dubois, Y. et al. (2024). Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators. arXiv:2404.04475.
  • Singh, S. et al. (2025). The Leaderboard Illusion. arXiv:2504.20879.
  • Min, R.; Pang, T.; Du, C.; Liu, Q.; Cheng, M.; Lin, M. (2025). Improving Your Model Ranking on Chatbot Arena by Vote Rigging. arXiv:2501.17858.

Referencias

  1. 1.0 1.1 Chiang, W.-L. et al. «Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference». arXiv:2403.04132, 2024. arXiv
  2. «Hello from LMArena: The Community Platform for Exploring Frontier AI». LMArena Blog, 23 de junio de 2025. [1]
  3. «Announcing a New Site for Chatbot Arena». LMSYS Blog, 20 de septiembre de 2024. [2]
  4. «LMArena Secures $100M in Seed Funding to Bring Scientific Rigor to AI Reliability». PR Newswire, 21 de mayo de 2025. [3]
  5. 5.0 5.1 Wiggers, K. «LM Arena, the organization behind popular AI leaderboards, lands $100M». TechCrunch, 21 de mayo de 2025. [4]
  6. «LMArena Raises $150 Million to Build the World's Most Trusted AI Evaluation Platform». PR Newswire, 6 de enero de 2026. [5]
  7. «LMArena lands $1.7B valuation four months after launching its product». TechCrunch, 6 de enero de 2026. [6]
  8. «LMArena is now Arena». Arena Blog, 28 de enero de 2026. [7]
  9. «LMArena is Growing to Support our Community Platform». LMArena Blog, 17 de abril de 2025.
  10. 10.0 10.1 10.2 10.3 Arena Leaderboard Policy. Arena Blog, última actualización: 30 de abril de 2026. [8]
  11. lm-sys/FastChat (GitHub). [9]
  12. «Arena-Rank: Open Sourcing the Leaderboard Methodology». Arena Blog, 18 de diciembre de 2025. [10]. Repositorio: lmarena/arena-rank.
  13. Y. Song. «A Deep Dive into Recent Arena Data». LMArena Blog, 31 de julio de 2025. [11]
  14. FAQ. Arena. [12]
  15. Página principal de Arena (descargo de responsabilidad sobre la posible publicación de datos y su transferencia a los proveedores). [13]
  16. Zheng, L. et al. «Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena». arXiv:2306.05685, 2023. [14]
  17. Li, T. et al. «From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline». arXiv:2406.11939, 2024. [15]
  18. 18.0 18.1 «Does Sentiment Matter Too? Introducing Sentiment Control». LMArena Blog, 22 de abril de 2025. [16]
  19. Li, T. et al. «From Crowdsourced Data…» arXiv:2406.11939 (tablas de concordancia). [17]
  20. Text Arena (English). Arena. [18]
  21. Vision Arena. Arena. [19]
  22. 22.0 22.1 Text-to-Image Arena. Arena. [20]
  23. 23.0 23.1 «Nano-Banana (Gemini 2.5 Flash Image): Try it on LMArena». LMArena Blog, 27 de agosto de 2025. [21]
  24. Text-to-Video e Image-to-Video Leaderboards. Arena. [22] [23]
  25. «WebDev Arena: A Live LLM Leaderboard for Web App Development». LMArena Blog, 10 de marzo de 2025. [24]
  26. «RepoChat Arena: A Live Benchmark for AI Software Engineers». LMArena Blog, 9 de abril de 2025. [25]
  27. «Introducing the Search Arena». LMArena Blog, 14 de abril de 2025. [26]
  28. «Search Arena & What We're Learning About Human Preference». LMArena Blog, 23 de julio de 2025. [27]
  29. Frick, E. et al. «Search Arena: Analyzing Search-Augmented LLMs». arXiv:2506.05334, 2025. [28]
  30. «Introducing BiomedArena.AI». LMArena Blog, 19 de agosto de 2025. [29]
  31. Google. «Gemma 3…», 12 de marzo de 2025 (enlace a los resultados de LMArena). [30]
  32. Spangher, L. et al. «Chatbot Arena Estimate…». NAACL Industry, 2025. [31]
  33. «Meta's experimental Llama 4 model briefly topped AI leaderboard…». The Register, 7 de abril de 2025. [32]
  34. Aclaraciones y publicaciones oficiales de LMArena en X sobre el incidente (abril de 2025). [33]
  35. «Search Arena & What We're Learning…». LMArena Blog, 23 de julio de 2025. [34]
  36. Min, R. et al. «Improving Your Model Ranking on Chatbot Arena by Vote Rigging». arXiv:2501.17858, 2025. [35]
  37. Huang, Y. et al. «Exploring and Mitigating Adversarial Manipulation of Voting-Based Leaderboards». arXiv:2501.07493, 2025. [36]
  38. «Hundreds of rigged votes can skew…». Fast Company, 6 de febrero de 2025. [37]
  39. Singh, S. et al. «The Leaderboard Illusion». arXiv:2504.20879, 2025. [38]
  40. «Our Response to 'The Leaderboard Illusion'». LMArena Blog, 9 de mayo de 2025. [39]
  41. Leaderboard Changelog. Arena Blog. [40]