Xếp hạng ELO các mô hình
Xếp hạng ELO các mô hình ngôn ngữ — đây là phương pháp đánh giá và so sánh các mô hình ngôn ngữ lớn (LLM), dựa trên hệ thống xếp hạng Elo được điều chỉnh, vốn được phát triển ban đầu cho cờ vua. Phương pháp này sử dụng các so sánh theo cặp giữa các mô hình dựa trên sở thích của con người để tạo ra một bảng xếp hạng thống nhất, phản ánh hiệu suất tương đối của các mô hình[1].
Khác với các benchmark truyền thống đo lường các chỉ số tuyệt đối trên các nhiệm vụ cụ thể, các hệ thống ELO xác định năng lực tương đối của các mô hình dựa trên việc so sánh trực tiếp các câu trả lời của chúng bởi những người đánh giá là con người. Nguyên tắc cơ bản là người dùng so sánh câu trả lời của hai mô hình ẩn danh cho cùng một yêu cầu và chọn phương án tốt hơn. Dựa trên những sở thích này, xếp hạng của mỗi mô hình được tính toán, trong đó xếp hạng cao hơn cho thấy sự vượt trội trong các đánh giá của con người[2].
Lịch sử phát triển
Nguồn gốc của hệ thống ELO
Hệ thống xếp hạng ELO được phát triển bởi nhà vật lý người Mỹ gốc Hungary Arpad Elo (Arpad Emrick Elo, 1903–1992) vào những năm 1960 để đánh giá trình độ của các kỳ thủ cờ vua. Elo, một giáo sư vật lý, đã tạo ra hệ thống như một sự cải tiến so với hệ thống Harkness đang tồn tại, vốn có những thiếu sót đáng kể về độ chính xác trong đánh giá[3].
- 1960: Liên đoàn Cờ vua Hoa Kỳ (USCF) chính thức chấp nhận hệ thống Elo.
- 1970: Liên đoàn Cờ vua Thế giới (FIDE) bắt đầu sử dụng hệ thống[4].
Điều chỉnh cho các mô hình ngôn ngữ
Việc áp dụng ELO để đánh giá LLM bắt đầu từ khi ra mắt nền tảng LMSYS Chatbot Arena vào ngày 3 tháng 5 năm 2023. Nền tảng này được tạo ra bởi tổ chức LMSYS (Large Model Systems Organization) — một sự hợp tác giữa các nhà nghiên cứu từ UC Berkeley SkyLab, UC San Diego và Carnegie Mellon University[5].
Phương pháp luận
Nền tảng toán học
Công thức ELO cổ điển
Công thức ELO cổ điển để tính xác suất kỳ vọng mô hình A thắng mô hình B: `P(A > B) = 1 / (1 + 10^((R_B - R_A) / 400))` trong đó `R_A` và `R_B` — là xếp hạng hiện tại của các mô hình.
Cập nhật xếp hạng sau khi so sánh được thực hiện theo công thức: `R'_A = R_A + K × (S_A - E_A)` trong đó `K` — là hệ số phát triển (K-factor), `S_A` — là kết quả thực tế (1 cho chiến thắng, 0.5 cho hòa, 0 cho thua), còn `E_A` — là kết quả kỳ vọng[4].
Mô hình Bradley-Terry
Các nền tảng hiện đại, bao gồm LMSYS Chatbot Arena, đã chuyển sang mô hình Bradley-Terry, đây là một phương pháp có cơ sở thống kê vững chắc hơn. Xác suất ưu tiên mô hình `i` hơn mô hình `j` được tính như sau:
`P(i > j) = e^(β_i) / (e^(β_i) + e^(β_j))` trong đó `β_i` và `β_j` — là các hệ số (xếp hạng) của các mô hình, được ước tính bằng phương pháp hợp lý cực đại[2]. Phương pháp này ổn định hơn và cho thấy sự phù hợp tốt hơn với sở thích của con người[6].
Quy trình đánh giá trong Chatbot Arena
- So sánh ẩn danh: Người dùng tương tác với hai mô hình ẩn danh song song.
- Bỏ phiếu: Sau khi nhận được câu trả lời, người dùng chọn phương án ưa thích.
- Tiết lộ danh tính: Tên của các mô hình chỉ được hiển thị sau khi bỏ phiếu.
- Cập nhật xếp hạng: Xếp hạng được cập nhật dựa trên kết quả bỏ phiếu, thường bằng cách xử lý theo lô để tăng độ ổn định[2].
Ưu điểm và nhược điểm
Ưu điểm
- Đơn giản và dễ diễn giải: Hệ thống dễ hiểu và dễ triển khai.
- Khả năng mở rộng: Cho phép đánh giá số lượng lớn các mô hình mà không cần so sánh theo cặp đầy đủ.
- Phù hợp với sở thích của con người: Xếp hạng trực tiếp phản ánh sở thích thực tế của người dùng, chứ không phải các chỉ số trừu tượng.
Nhược điểm và hạn chế
- Vấn đề độ tin cậy: Các tính toán ELO riêng lẻ có thể cho thấy sự biến động đáng kể.
- Vi phạm tính bắc cầu: Hệ thống không phải lúc nào cũng thỏa mãn điều kiện A>B và B>C → A>C, đây là một hạn chế cơ bản.
- Phụ thuộc vào kích thước mẫu: Để có được xếp hạng ổn định, cần có mẫu lớn (hàng trăm và hàng nghìn so sánh)[6].
- Sai lệch trong đánh giá: Kết quả có thể bị lệch do người dùng ưu tiên các câu trả lời dài hơn hoặc được định dạng theo phong cách nhất định, cũng như do sự khác biệt văn hóa của những người đánh giá.
Kết luận
Xếp hạng ELO là một công cụ quan trọng trong hệ sinh thái đánh giá các mô hình ngôn ngữ, cung cấp một cách trực quan để so sánh chúng dựa trên sở thích của con người. Mặc dù các nền tảng như LMSYS Chatbot Arena đã thành công, phương pháp này có những hạn chế cơ bản, bao gồm các vấn đề về tính bắc cầu và độ tin cậy. Việc chuyển từ ELO cổ điển sang mô hình Bradley-Terry là một cải tiến quan trọng, nhưng tương lai của việc đánh giá LLM có thể sẽ nằm ở việc kết hợp nhiều phương pháp để có được bức tranh toàn diện hơn về khả năng của các mô hình.
Liên kết
- Trang web chính thức của LMSYS Chatbot Arena
- Bảng xếp hạng LMSYS Chatbot Arena
Tài liệu tham khảo
- Elo, A. E. (1978). The Rating of Chessplayers, Past and Present. Arco Publishing. archive.org.
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Daynauth, R. et al. (2025). Ranking Unraveled: Recipes for LLM Rankings in Head-to-Head AI Combat. arXiv:2411.14483.
- Liu, Y. et al. (2024). Aligning with Human Judgement: The Role of Pairwise Preference in Large Language Model Evaluators. arXiv:2403.16950.
- Chatzi, I.; Straitouri, E.; Thejaswi, S.; Gomez‑Rodriguez, M. (2024). Prediction‑Powered Ranking of Large Language Models. arXiv:2402.17826.
- Xu, Y.; Ruis, L.; Rocktäschel, T.; Kirk, R. (2025). Investigating Non‑Transitivity in LLM‑as‑a‑Judge. arXiv:2502.14074.
- Liu, Z. et al. (2025). am‑ELO: A Stable Framework for Arena‑based LLM Evaluation. arXiv:2505.03475.
- Tang, S.; Wang, Y.; Jin, C. (2025). Is Elo Rating Reliable? A Study Under Model Misspecification. arXiv:2502.10985.
- Nair, A. et al. (2025). Tournament of Prompts: Evolving LLM Instructions Through Structured Debates and Elo Ratings. arXiv:2506.00178.
- Ameli, S. et al. (2024). A Statistical Framework for Ranking LLM‑Based Chatbots. arXiv:2412.18407.
- Huang, J. Y.; Shen, Y.; Wei, D.; Broderick, T. (2025). Dropping Just a Handful of Preferences Can Change Top LLM Rankings. arXiv:2508.11847.
- Sun, H.; Shen, Y.; Ton, J.‑F. (2024). Rethinking Bradley‑Terry Models in Preference‑Based Reward Modeling: Foundations, Theory, and Alternatives. arXiv:2411.04991.
- Glickman, M. E. (2025). Paired Comparison Models with Strength‑Dependent Ties and Order Effects. arXiv:2505.24783.
- Glickman, M. E. (2025). Rating Competitors in Games with Strength‑Dependent Tie Probabilities. arXiv:2506.11354.
- Hua, H.-F.; Dong, J.; Liu, Z. (2023). Rating of Players by Laplace Approximation and Dynamic Bradley–Terry Model. arXiv:2310.10386.
Ghi chú
- ↑ «Elo Rating for LLMs: A Deep Dive». Medium. [1]
- ↑ 2.0 2.1 2.2 «Chatbot Arena: Benchmarking LLMs in the Wild with Elo Ratings». LMSYS Org. [2]
- ↑ «Elo rating system». В Wikipedia, The Free Encyclopedia. [3]
- ↑ 4.0 4.1 «How Does the Elo Rating System Work?». History Hit. [4]
- ↑ «LMSYS Chatbot Arena: The Ultimate LLM Leaderboard». Originality.AI. [5]
- ↑ 6.0 6.1 Boubdir, N., et al. «Elo Uncovered: Robustness and Best Practices in Language Model Evaluation». arXiv:2310.09277. [6]