Elo ranking of language models — زبان کے ماڈلز کی درجہ بندی

From Systems analysis wiki
Jump to navigation Jump to search

ELO زبان کے ماڈلز کی درجہ بندی — یہ بڑے زبانی ماڈلز (LLM) کی جانچ اور موازنہ کا ایک طریقہ ہے، جو Elo کے درجہ بندی کے نظام کی موافق شکل پر مبنی ہے، جسے اصل میں شطرنج کے لیے تیار کیا گیا تھا۔ یہ طریقہ کار ماڈلز کے ایک مشترک درجہ بندی کی تشکیل کے لیے انسانی ترجیحات کی بنیاد پر ماڈلز کے جوڑوں میں موازنے کا استعمال کرتا ہے، جو ماڈلز کی نسبتی کارکردگی کو ظاہر کرتا ہے[1]۔

روایتی benchmarks کے برعکس، جو مخصوص کاموں میں مطلق اشاریے ناپتے ہیں، ELO نظام انسانی جائزہ کاروں کے ذریعے ان کے جوابات کے براہِ راست موازنے کی بنیاد پر ماڈلز کی نسبتی صلاحیتوں کا تعین کرتا ہے۔ بنیادی اصول یہ ہے کہ صارفین ایک ہی سوال پر دو گمنام ماڈلز کے جوابات کا موازنہ کرتے ہیں اور بہترین متبادل کا انتخاب کرتے ہیں۔ انہی ترجیحات کی بنیاد پر ہر ماڈل کی درجہ بندی کا حساب لگایا جاتا ہے، جہاں زیادہ درجہ بندی انسانی جائزوں میں برتری کی نشاندہی کرتی ہے[2]۔

ترقی کی تاریخ

ELO نظام کی ابتدا

ELO درجہ بندی کا نظام ہنگری نژاد امریکی طبیعیات دان Arpad Elo (Arpad Emrick Elo، 1903–1992) نے 1960 کی دہائی میں شطرنج کے کھلاڑیوں کی مہارت کی جانچ کے لیے تیار کیا۔ Elo، جو طبیعیات کے پروفیسر تھے، نے یہ نظام Harkness کے موجودہ نظام کی بہتری کے طور پر بنایا، جو درجہ بندی کی درستی میں سنگین خامیاں رکھتا تھا[3]۔

  • 1960: امریکی شطرنج فیڈریشن (USCF) نے باضابطہ طور پر Elo نظام کو اپنایا۔
  • 1970: عالمی شطرنج فیڈریشن (FIDE) نے اس نظام کا استعمال شروع کیا[4]۔

زبانی ماڈلز کے لیے موافقت

LLM کی جانچ کے لیے ELO کا اطلاق LMSYS Chatbot Arena پلیٹ فارم کے آغاز کے ساتھ 3 مئی 2023 کو شروع ہوا۔ یہ پلیٹ فارم LMSYS (Large Model Systems Organization) — UC Berkeley SkyLab، UC San Diego اور Carnegie Mellon University کے محققین کے اشتراک — نے تشکیل دیا[5]۔

طریقہ کار

ریاضیاتی بنیادیں

ELO کا کلاسیکی فارمولا

ماڈل A کے ماڈل B پر جیت کے متوقع امکان کے حساب کے لیے ELO کا کلاسیکی فارمولا: `P(A > B) = 1 / (1 + 10^((R_B - R_A) / 400))` جہاں `R_A` اور `R_B` ماڈلز کی موجودہ درجہ بندیاں ہیں۔

موازنے کے بعد درجہ بندی کی تجدید اس فارمولے کے مطابق ہوتی ہے: `R'_A = R_A + K × (S_A - E_A)` جہاں `K` — ترقیاتی گتانک (K-factor)، `S_A` — اصل نتیجہ (جیت کے لیے 1، برابری کے لیے 0.5، ہار کے لیے 0)، اور `E_A` — متوقع نتیجہ ہے[4]۔

Bradley-Terry ماڈل

جدید پلیٹ فارمز، بشمول LMSYS Chatbot Arena، Bradley-Terry ماڈل پر منتقل ہو گئے ہیں، جو اعداد و شمار کے لحاظ سے زیادہ مستحکم طریقہ ہے۔ ماڈل `i` کو ماڈل `j` پر ترجیح دینے کا امکان اس طرح حساب کیا جاتا ہے:

`P(i > j) = e^(β_i) / (e^(β_i) + e^(β_j))` جہاں `β_i` اور `β_j` — ماڈلز کے گتانک (درجہ بندیاں) ہیں، جن کا اندازہ زیادہ سے زیادہ امکان کے طریقے سے لگایا جاتا ہے[2]۔ یہ طریقہ زیادہ مستحکم ہے اور انسانی ترجیحات سے بہتر ہم آہنگی ظاہر کرتا ہے[6]۔

Chatbot Arena میں جانچ کا عمل

  1. گمنام موازنہ: صارفین ایک ساتھ دو گمنام ماڈلز سے تعامل کرتے ہیں۔
  2. رائے دہی: جوابات ملنے کے بعد صارفین پسندیدہ متبادل کا انتخاب کرتے ہیں۔
  3. شناخت کا اظہار: ماڈلز کے نام صرف رائے دہی کے بعد ظاہر کیے جاتے ہیں۔
  4. درجہ بندی کی تجدید: درجہ بندیاں رائے دہی کے نتائج کی بنیاد پر اپ ڈیٹ ہوتی ہیں، عام طور پر زیادہ استحکام کے لیے batch processing کے ذریعے[2]۔

فوائد اور نقصانات

فوائد

  • سادگی اور قابلِ فہم ہونا: نظام سمجھنے اور نافذ کرنے میں آسان ہے۔
  • توسیع پذیری: مکمل جوڑوں کے موازنے کی ضرورت کے بغیر بڑی تعداد میں ماڈلز کی جانچ ممکن بناتا ہے۔
  • انسانی ترجیحات سے ہم آہنگی: درجہ بندی براہِ راست صارفین کی حقیقی ترجیحات کی عکاسی کرتی ہے، نہ کہ تجریدی معیاروں کی۔

نقصانات اور حدود

  • قابلِ اعتماد ہونے کے مسائل: ELO کے انفرادی حسابات نمایاں اتار چڑھاؤ ظاہر کر سکتے ہیں۔
  • تعدیتی قاعدے کی خلاف ورزیاں: نظام ہمیشہ اس شرط کو پورا نہیں کرتا کہ A>B اور B>C → A>C، جو ایک بنیادی حد ہے۔
  • نمونے کے حجم پر انحصار: مستحکم درجہ بندیاں حاصل کرنے کے لیے بڑا نمونہ (سینکڑوں اور ہزاروں موازنے) درکار ہے[6]۔
  • جانچ میں تعصبات: نتائج اس لیے متاثر ہو سکتے ہیں کہ صارف طویل یا اسلوباتی طور پر مرتب شدہ جوابات کو ترجیح دیتے ہیں، نیز جائزہ کاروں کے ثقافتی فرق کی وجہ سے بھی۔

خلاصہ

ELO درجہ بندی زبانی ماڈلز کی جانچ کے نظام میں ایک اہم ذریعہ ہے، جو انسانی ترجیحات کی بنیاد پر ان کے موازنے کا ایک آسانی سے سمجھ میں آنے والا طریقہ فراہم کرتا ہے۔ LMSYS Chatbot Arena جیسے پلیٹ فارمز کی کامیابی کے باوجود، اس طریقے کی بنیادی حدیں ہیں، جن میں تعدیتی قاعدے اور قابلِ اعتماد ہونے کے مسائل شامل ہیں۔ کلاسیکی ELO سے Bradley-Terry ماڈل کی طرف منتقلی ایک اہم بہتری ہے، لیکن LLM کی جانچ کا مستقبل ممکنہ طور پر متعدد طریقوں کے امتزاج میں ہے تاکہ ماڈلز کی صلاحیتوں کی زیادہ مکمل تصویر حاصل ہو سکے۔

حوالہ جات

  • LMSYS Chatbot Arena کی سرکاری ویب سائٹ
  • LMSYS Chatbot Arena لیڈر بورڈ

کتابیات

  • Elo, A. E. (1978). The Rating of Chessplayers, Past and Present. Arco Publishing. archive.org.
  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
  • Daynauth, R. et al. (2025). Ranking Unraveled: Recipes for LLM Rankings in Head-to-Head AI Combat. arXiv:2411.14483.
  • Liu, Y. et al. (2024). Aligning with Human Judgement: The Role of Pairwise Preference in Large Language Model Evaluators. arXiv:2403.16950.
  • Chatzi, I.; Straitouri, E.; Thejaswi, S.; Gomez‑Rodriguez, M. (2024). Prediction‑Powered Ranking of Large Language Models. arXiv:2402.17826.
  • Xu, Y.; Ruis, L.; Rocktäschel, T.; Kirk, R. (2025). Investigating Non‑Transitivity in LLM‑as‑a‑Judge. arXiv:2502.14074.
  • Liu, Z. et al. (2025). am‑ELO: A Stable Framework for Arena‑based LLM Evaluation. arXiv:2505.03475.
  • Tang, S.; Wang, Y.; Jin, C. (2025). Is Elo Rating Reliable? A Study Under Model Misspecification. arXiv:2502.10985.
  • Nair, A. et al. (2025). Tournament of Prompts: Evolving LLM Instructions Through Structured Debates and Elo Ratings. arXiv:2506.00178.
  • Ameli, S. et al. (2024). A Statistical Framework for Ranking LLM‑Based Chatbots. arXiv:2412.18407.
  • Huang, J. Y.; Shen, Y.; Wei, D.; Broderick, T. (2025). Dropping Just a Handful of Preferences Can Change Top LLM Rankings. arXiv:2508.11847.
  • Sun, H.; Shen, Y.; Ton, J.‑F. (2024). Rethinking Bradley‑Terry Models in Preference‑Based Reward Modeling: Foundations, Theory, and Alternatives. arXiv:2411.04991.
  • Glickman, M. E. (2025). Paired Comparison Models with Strength‑Dependent Ties and Order Effects. arXiv:2505.24783.
  • Glickman, M. E. (2025). Rating Competitors in Games with Strength‑Dependent Tie Probabilities. arXiv:2506.11354.
  • Hua, H.-F.; Dong, J.; Liu, Z. (2023). Rating of Players by Laplace Approximation and Dynamic Bradley–Terry Model. arXiv:2310.10386.


حواشی

  1. «Elo Rating for LLMs: A Deep Dive». Medium. [1]
  2. 2.0 2.1 2.2 «Chatbot Arena: Benchmarking LLMs in the Wild with Elo Ratings». LMSYS Org. [2]
  3. «Elo rating system». В Wikipedia, The Free Encyclopedia. [3]
  4. 4.0 4.1 «How Does the Elo Rating System Work?». History Hit. [4]
  5. «LMSYS Chatbot Arena: The Ultimate LLM Leaderboard». Originality.AI. [5]
  6. 6.0 6.1 Boubdir, N., et al. «Elo Uncovered: Robustness and Best Practices in Language Model Evaluation». arXiv:2310.09277. [6]