LMArena (Chatbot Arena) (BN)
Arena (২০২৬ সালের ২৮ জানুয়ারির আগে — LMArena (Large Model Arena), পূর্বে — Chatbot Arena) — বৃহৎ ভাষা মডেল (LLM) এবং মাল্টিমোডাল মডেল (টেক্সট, ছবি, ভিডিও) মূল্যায়ন ও তুলনামূলক র্যাঙ্কিংয়ের জন্য একটি মুক্ত ক্রাউডসোর্সিং ওয়েব-প্ল্যাটফর্ম, যা বাস্তব মানবিক পছন্দের ভিত্তিতে পরিচালিত হয়। প্ল্যাটফর্মের মূল ভিত্তি হলো মডেলগুলোর মধ্যে বেনামী যুগল তুলনা (blind battles) এবং Elo রেটিং পদ্ধতি; এগুলোর ভিত্তিতে স্বচ্ছ পাবলিক লিডারবোর্ড প্রকাশিত হয়, যা কৃত্রিম বুদ্ধিমত্তার frontier মডেলগুলোর অন্যতম নির্ভরযোগ্য স্বাধীন benchmark হিসেবে বিবেচিত।[1][2]
প্ল্যাটফর্মটি ২০২৩ সালে ক্যালিফোর্নিয়া বিশ্ববিদ্যালয়, বার্কলির (Sky Computing Lab) LMSYS Org (Large Model Systems Organization) সংস্থার একটি একাডেমিক গবেষণা প্রকল্প হিসেবে আত্মপ্রকাশ করে। ২০২৪ সালের সেপ্টেম্বরে প্রকল্পটি স্বাধীন ডোমেন lmarena.ai-তে «স্নাতক» হয় («Graduation»)[3]। ২০২৫ সালের এপ্রিলে স্বাধীন কোম্পানি Arena Intelligence Inc. প্রতিষ্ঠিত হয়, এবং ২০২৫ সালের ২১ মে $১০০ মিলিয়ন সিড রাউন্ড সংগ্রহ করা হয় (মূল্যায়ন $৬০০ মিলিয়ন, প্রধান বিনিয়োগকারী — a16z এবং UC Investments)[4][5]। ২০২৬ সালের ৬ জানুয়ারি কোম্পানি $১৫০ মিলিয়ন Series A রাউন্ড সম্পন্ন করে, পোস্ট-মানি মূল্যায়ন $১.৭ বিলিয়ন[6]। ২০২৬ সালের ২৮ জানুয়ারি চূড়ান্ত রিব্র্যান্ডিং হয় — প্ল্যাটফর্মটির নাম হয় Arena এবং এটি arena.ai ডোমেনে স্থানান্তরিত হয়[7][8]।
ইতিহাস
প্ল্যাটফর্মটি ২০২৩ সালের এপ্রিলে Chatbot Arena নামে চালু হয়, ক্যালিফোর্নিয়া বিশ্ববিদ্যালয়, বার্কলির (Sky Computing Lab) LMSYS Org (Large Model Systems Organization) সংস্থার একটি গবেষণা প্রকল্প হিসেবে। এটি বেনামী যুগল তুলনা (blind battles) এবং ব্যবহারকারীদের বাস্তব পছন্দের ভিত্তিতে Elo রেটিং পদ্ধতির মাধ্যমে বৃহৎ ভাষা মডেলের ক্রাউডসোর্সিং মূল্যায়নের প্রথম হাতিয়ারগুলোর মধ্যে একটি হয়ে ওঠে।
- ২৪ এপ্রিল ২০২৩ — Chatbot Arena-এর প্রযুক্তিগত সূচনা।
- ৩ মে ২০২৩ — আনুষ্ঠানিক পাবলিক রিলিজ এবং প্রথম লিডারবোর্ড প্রকাশ।
- ২০২৩ — প্রথম মুক্ত dataset রিলিজ: ৩৩ হাজার যুগল সংলাপ (জুলাই) এবং LMSYS‑Chat‑1M (সেপ্টেম্বর, প্রায় ১ মিলিয়ন বাস্তব সংলাপ)।
- ১ মার্চ ২০২৪ — প্ল্যাটফর্মের আনুষ্ঠানিক নীতি প্রকাশ, মুক্ত community-driven মূল্যায়ন পদ্ধতি হিসেবে মিশনের আনুষ্ঠানিকীকরণ।
- ২৭ জুন ২০২৪ — ছবি সমর্থন যোগ এবং মাল্টিমোডাল কার্যক্রমে সম্প্রসারণ শুরু।
- ২০ সেপ্টেম্বর ২০২৪ — «Graduation»: স্বাধীন ডোমেন lmarena.ai-তে স্থানান্তর।
- ২০২৪ সালের শেষ — ২০২৫ সালের বসন্ত — বিশেষায়িত arena চালু (Arena-Hard, WebDev Arena, RepoChat Arena, Style/Sentiment Control প্রভৃতি)।
- ১৭ এপ্রিল ২০২৫ — স্বাধীন কোম্পানি Arena Intelligence Inc. হিসেবে আনুষ্ঠানিক নিবন্ধন, LMArena ব্র্যান্ডের অধীনে আপডেট করা প্ল্যাটফর্মের বেটা সংস্করণ চালু।
- ২১ মে ২০২৫ — কোম্পানি প্রতিষ্ঠার ঘোষণা এবং $১০০ মিলিয়ন সিড রাউন্ড সংগ্রহ (মূল্যায়ন — $৬০০ মিলিয়ন)।
- ৩১ জুলাই ২০২৫ — Text Arena-এর ১৪০ হাজার সাম্প্রতিক সংলাপের মুক্ত dataset প্রকাশ।
- ৬ জানুয়ারি ২০২৬ — পোস্ট-মানি মূল্যায়ন $১.৭ বিলিয়ার সহ $১৫০ মিলিয়ন Series A রাউন্ড সংগ্রহ।
- জানুয়ারি ২০২৬ — Video Arena চালু (ভিডিও-মোডালিটির সম্পূর্ণ সমর্থন)।
- ২৮ জানুয়ারি ২০২৬ — চূড়ান্ত রিব্র্যান্ডিং: প্ল্যাটফর্মটির নাম হয় Arena এবং এটি arena.ai ডোমেনে স্থানান্তরিত হয়।
২০২৬ সালের মার্চ নাগাদ Arena (arena.ai) ১৫০টিরও বেশি দেশ থেকে মাসে ৫০ লক্ষেরও বেশি সক্রিয় ব্যবহারকারীকে সেবা দিচ্ছে, কোটি কোটি ভোট সংগ্রহ করেছে এবং বাস্তব মানবিক পছন্দের ভিত্তিতে AI-এর frontier মডেল মূল্যায়নের অন্যতম নির্ভরযোগ্য স্বাধীন হাতিয়ার হিসেবে রয়ে গেছে।
মূল্যায়ন পদ্ধতি
ব্যবহারকারী একটি প্রশ্ন লেখেন এবং দৈবচয়নে নির্বাচিত দুটি বেনামী মডেল («A» ও «B») থেকে দুটি উত্তর পান, তারপর সেরা উত্তরের পক্ষে ভোট দেন (অথবা ড্র/অসন্তোষজনক চিহ্নিত করেন)। র্যাঙ্কিং ব্র্যাডলি—টেরি পরিসংখ্যান মডেলের (যুগল পছন্দের উপর লজিস্টিক রিগ্রেশন) উপর ভিত্তি করে তৈরি, যা স্বজ্ঞাতভাবে Elo-এর কাছাকাছি[1]। প্ল্যাটফর্মটি Arena Score এবং আস্থা ব্যবধান প্রকাশ করে, এবং অসম নমুনায়নের ক্ষেত্রে নিরপেক্ষতা বজায় রাখতে নমুনা সংশোধন (re‑weighting) প্রয়োগ করে[9]।
স্বচ্ছতা ও উন্মুক্ততা। মূল্যায়ন ও র্যাঙ্কিংয়ের pipeline FastChat রিপোজিটরিতে উন্মুক্ত[10]; যাচাই ও গবেষণার জন্য কাঁচা ডেটার অংশবিশেষ পর্যায়ক্রমে প্রকাশিত হয় (যেমন, জুলাই ২০২৫-এ ১৪০K সংলাপের রিলিজ)[9][11]। FAQ এবং প্রধান পাতার সতর্কতা অনুযায়ী, ব্যবহারকারীর প্রশ্নগুলো মডেল প্রদানকারীদের কাছে প্রকাশ করা এবং গবেষণার উদ্দেশ্যে আংশিকভাবে প্রকাশিত হতে পারে — সংবেদনশীল তথ্য পাঠানো উচিত নয়[12][13]।
নির্বাচন ও নমুনায়নের নিয়ম। লিডারবোর্ডে সর্বসাধারণের অ্যাক্সেসযোগ্য মডেল (মুক্ত ওজন/পাবলিক API/পাবলিক সেবা) অন্তর্ভুক্ত হয়। রেটিং স্থিতিশীল করতে সাধারণত ≥১০০০ ভোট প্রয়োজন; কমপক্ষে ২০% ব্যাটল শুধুমাত্র পাবলিক মডেলের মধ্যে হয়; রেটিং ও অনিশ্চয়তার সাথে নমুনায়নের সম্ভাবনা বাড়ে, এবং পুনর্ভারিত রিগ্রেশন চূড়ান্ত মূল্যায়নের নিরপেক্ষতা নিশ্চিত করে[9]।
অটো-মেট্রিক্স ও স্টাইল নিয়ন্ত্রণ। দ্রুত মূল্যায়ন এবং «স্টাইলগত» পছন্দের প্রভাব কমাতে সহায়ক পদ্ধতি ব্যবহার করা হয়: MT‑Bench (LLM‑as‑a‑judge)[14], Arena‑Hard (কঠিন প্রশ্নের স্বয়ংক্রিয় তৈরি)[15], এবং Style/Sentiment Control (পছন্দের উপর টোন/আবেগের প্রভাব মডেলিং ও প্রশমন)[16]। Arena‑Hard‑Auto-এর জন্য নিয়ন্ত্রিত পরিস্থিতিতে «সরাসরি» মানবিক ভোটের সাথে অত্যন্ত উচ্চ সামঞ্জস্য (≈৯৮.৬% পর্যন্ত) রিপোর্ট করা হয়েছে[17]।
Arena ও মূল্যায়নের ডোমেইনসমূহ
প্ল্যাটফর্মটি কার্যক্রমের ধরন অনুযায়ী বিভিন্ন «arena»-এর সমন্বয়ে বিকশিত হয়েছে:
- Text Arena — সাধারণ সংলাপ/কার্যক্রম, প্রধান সারণি[18]।
- Vision Arena — মাল্টিমোডাল মডেল «টেক্সট→ছবি/ভিডিও/ছবি বিশ্লেষণ»[19]।
- Text‑to‑Image ও Image Edit — ছবি তৈরি ও সম্পাদনা (যেমন nano‑banana কেস)[20][21]।
- Text‑/Image‑to‑Video — ভিডিও তৈরি[22]।
- WebDev Arena — বিবরণ থেকে ওয়েব অ্যাপ্লিকেশন তৈরি[23]।
- RepoChat Arena — কোড/রিপোজিটরি বিষয়ক AI ইঞ্জিনিয়ারিং কার্যক্রম[24]।
- Search Arena — ওয়েব সার্চ সংযুক্ত মডেল; প্রথমে এপ্রিল ২০২৫-এ (legacy) চালু হয়, পরে মূল সাইটে আনা হয়, dataset ও প্রকাশনাসহ[25][26][27]।
- BiomedArena.AI — বায়োমেডিকেল কার্যক্রমের জন্য ডোমেইন-নির্দিষ্ট মূল্যায়ন (DataTecnica-এর সাথে অংশীদারিত্বে)[28]।
প্রয়োগ ও প্রভাব
- শিল্প প্রদর্শনী। শীর্ষ বিক্রেতারা (OpenAI, Anthropic, Google প্রভৃতি) নিয়মিত LMArena-তে মডেল পরীক্ষা ও প্রদর্শন করেন; শিল্প-সংক্রান্ত মিডিয়া প্ল্যাটফর্মটিকে একটি গুরুত্বপূর্ণ মানদণ্ড হিসেবে বর্ণনা করে[5][29]। NAACL‑2025-এর একটি শিল্প প্রকাশনায় Chatbot Arena-এর Elo মূল্যায়নকে «gold industry‑standard» বলা হয়েছে[30]।
- প্রি-রিলিজ পরীক্ষা। নীতি অনুযায়ী, সম্প্রদায়কে অবহিত করে «অপ্রকাশিত» মডেলের বেনামী পূর্বদর্শন এবং রিলিজের পর পাবলিক মূল্যায়ন প্রকাশের অনুমতি রয়েছে; স্থিতিশীলতার জন্য কমপক্ষে ≈১০০০ ভোট প্রয়োজন[9]।
- উল্লেখযোগ্য ঘটনা। ২০২৫ সালের বসন্তে বেনামী মডেল Llama‑4 Maverick‑03‑26‑Experimental নিয়ে আলোচনা হয় (পাবলিক সংস্করণের সাথে তুলনার বিতর্ক), যা ব্যাপক গণমাধ্যমের দৃষ্টি আকর্ষণ করে এবং নিয়ম/যোগাযোগ আপডেটের সূচনা করে[31][32]। ২০২৫ সালের আগস্টে «nano‑banana» Gemini 2.5 Flash Image হিসেবে পরিচয় পায় এবং ভিজ্যুয়াল arena-গুলোতে শীর্ষস্থান দখল করে[21][20]।
সীমাবদ্ধতা ও সমালোচনা
ব্যাপক পরিধি ও জনপ্রিয়তা সত্ত্বেও, পদ্ধতিটির সীমাবদ্ধতা রয়েছে:
- বিষয়গততা ও স্টাইলগত প্রভাব। ভোটের পছন্দ উত্তরের টোন/ধরনের উপর নির্ভরশীল; দল «স্টাইল» ও «বিষয়বস্তু»-কে আলাদা করতে Style/Sentiment Control প্রয়োগ করছে[16]।
- শ্রোতার অ-প্রতিনিধিত্বশীলতা। মূল ব্যবহারকারীরা প্রযুক্তি-উৎসাহী/ডেভেলপার; ডোমেইন-নির্দিষ্ট পরিস্থিতির জন্য বিশেষায়িত arena (Search, WebDev, Biomed প্রভৃতি) তৈরি করা হচ্ছে[33]।
- কারসাজি ও পক্ষপাতের প্রতি ঝুঁকি। ২০২৫ সালের গবেষণায় দেখা গেছে, কঠোর সুরক্ষা না থাকলে শত থেকে হাজার ভোটের «কারসাজি» কৌশল সম্ভব; তবে গবেষকদের সাথে LMArena-এর সহযোগিতায় সুরক্ষামূলক ব্যবস্থা (CAPTCHA/লগইন/বট সুরক্ষা/অনিয়মতা সনাক্তকরণ) প্রয়োগ এবং «আক্রমণের খরচ» বৃদ্ধি পেয়েছে[34][35][36]।
- পদ্ধতিগত সমালোচনা। The Leaderboard Illusion (এপ্রিল ২০২৫) প্রবন্ধে পদ্ধতিগত ও প্রাতিষ্ঠানিক কারণ চিহ্নিত করা হয়েছে যা প্রতিযোগিতার ক্ষেত্র বিকৃত করতে পারে; LMArena বিস্তারিত প্রতিক্রিয়া প্রকাশ করেছে এবং পদ্ধতির পাবলিক changelog বজায় রাখছে[37][38][39]।
বাহ্যিক সংযোগ
- LMArena-এর আনুষ্ঠানিক ওয়েবসাইট
- LMArena-এর ব্লগ/নীতি ও আপডেট
- LMSYS গবেষণা দলের ওয়েবসাইট (প্রকল্পের মূল ইনকিউবেটর)
সাহিত্য
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Zheng, L. et al. (2023). Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena. arXiv:2306.05685.
- Li, T. et al. (2024). From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline. arXiv:2406.11939.
- Ameli, S.; Zhuang, S.; Stoica, I.; Mahoney, M. W. (2024). A Statistical Framework for Ranking LLM-Based Chatbots. arXiv:2412.18407.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Huang, J. Y.; Shen, Y.; Wei, D.; Broderick, T. (2025). Dropping Just a Handful of Preferences Can Change Top Large Language Model Rankings. arXiv:2508.11847.
- Xu, Y.; Ruis, L.; Rocktäschel, T.; Kirk, R. (2025). Investigating Non-Transitivity in LLM-as-a-Judge. arXiv:2502.14074.
- Li, H. et al. (2024). LLMs-as-Judges: A Comprehensive Survey on LLM-based Evaluation Methods. arXiv:2412.05579.
- Zheng, L. et al. (2024). LMSYS-Chat-1M: A Large-Scale Real-World LLM Conversation Dataset. arXiv:2309.11998.
- Dubois, Y. et al. (2024). Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators. arXiv:2404.04475.
- Singh, S. et al. (2025). The Leaderboard Illusion. arXiv:2504.20879.
- Min, R.; Pang, T.; Du, C.; Liu, Q.; Cheng, M.; Lin, M. (2025). Improving Your Model Ranking on Chatbot Arena by Vote Rigging. arXiv:2501.17858.
তথ্যসূত্র
- ↑ 1.0 1.1 Chiang, W.-L. et al. «Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference». arXiv:2403.04132, 2024.
- ↑ «Hello from LMArena: The Community Platform for Exploring Frontier AI». LMArena Blog, 23 июня 2025.
- ↑ «Announcing a New Site for Chatbot Arena». LMSYS Blog, 20 сентября 2024.
- ↑ «Arena Intelligence Raises $100M Seed Round to Build the Standard for AI Evaluation». PR Newswire / Arena Intelligence, 21 мая 2025. [১]
- ↑ 5.0 5.1 Wiggers, K. «LMArena, the Chatbot Arena spinoff, raises $100M seed at a $600M valuation». TechCrunch, 21 мая 2025. [২]
- ↑ «Arena Intelligence Closes $150M Series A at $1.7B Valuation». Arena Intelligence Blog, 6 января 2026. [৩]
- ↑ «We Are Now Arena». Arena Blog, 28 января 2026. [৪]
- ↑ «LMArena is Growing to Support our Community Platform». LMArena Blog, 17 апреля 2025.
- ↑ 9.0 9.1 9.2 9.3 LMArena Leaderboard Policy. LMArena Blog, ред. 8 сентября 2025. [৫]
- ↑ lm‑sys/FastChat (GitHub). [৬]
- ↑ «Releasing 140K Text Arena Conversations». LMArena Blog, 31 июля 2025. [৭]
- ↑ FAQ. LMArena. [৮]
- ↑ Главная страница LMArena (дисклеймер о возможной публикации данных и передачи провайдерам). [৯]
- ↑ Zheng, L. et al. «Judging LLM‑as‑a‑Judge with MT‑Bench and Chatbot Arena». arXiv:2306.05685, 2023. [১০]
- ↑ Li, T. et al. «From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline». arXiv:2406.11939, 2024. [১১]
- ↑ 16.0 16.1 «Style and Sentiment Control in the Arena». LMArena Blog, 2025. [১২]
- ↑ Li, T. et al. «From Crowdsourced Data…» arXiv:2406.11939 (таблицы согласованности). [১৩]
- ↑ Text Arena (English). LMArena. [১৪]
- ↑ Vision Arena. LMArena, обновлено 2 сентября 2025. [১৫]
- ↑ 20.0 20.1 Text-to-Image Leaderboard. LMArena. [১৬]
- ↑ 21.0 21.1 «The nano-banana Story: Gemini 2.5 Flash Image Tops the Visual Arena». LMArena Blog, август 2025. [১৭]
- ↑ Text‑to‑Video и Image‑to‑Video Leaderboards. LMArena, август 2025. [১৮] [১৯]
- ↑ «Introducing WebDev Arena». LMArena Blog, 2025. [২০]
- ↑ «Introducing RepoChat Arena». LMArena Blog, 2025. [২১]
- ↑ «Introducing the Search Arena». LMArena Blog, 14 апреля 2025. [২২]
- ↑ «Search Arena & What We're Learning About Human Preference». LMArena Blog, 23 июля 2025. [২৩]
- ↑ Frick, E. et al. «Search Arena: Analyzing Search‑Augmented LLMs». arXiv:2506.05334, 2025. [২৪]
- ↑ «Introducing BiomedArena.AI». LMArena Blog, 19 августа 2025. [২৫]
- ↑ Google. «Gemma 3…», 12 марта 2025 (ссылка на результаты LMArena). [২৬]
- ↑ Spangher, L. et al. «Chatbot Arena Estimate…». NAACL Industry, 2025. [২৭]
- ↑ «Meta's experimental Llama 4 model briefly topped AI leaderboard…». The Register, 7 апреля 2025. [২৮]
- ↑ Официальные разъяснения/посты LMArena в X по инциденту (апрель 2025). [২৯]
- ↑ «Search Arena & What We're Learning…». LMArena Blog, 23 июля 2025. [৩০]
- ↑ Min, R. et al. «Improving Your Model Ranking on Chatbot Arena by Vote Rigging». arXiv:2501.17858, 2025. [৩১]
- ↑ Huang, Y. et al. «Exploring and Mitigating Adversarial Manipulation of Voting‑Based Leaderboards». arXiv:2501.07493, 2025. [৩২]
- ↑ «Hundreds of rigged votes can skew…». Fast Company, 6 февраля 2025. [৩৩]
- ↑ Singh, S. et al. «The Leaderboard Illusion». arXiv:2504.20879, 2025. [৩৪]
- ↑ «Our Response to 'The Leaderboard Illusion'». LMArena Blog, 9 мая 2025. [৩৫]
- ↑ «Methodology Changelog». LMArena Blog. [৩৬]