MMLU Benchmark (VI)

From Systems analysis wiki
Jump to navigation Jump to search

MMLU (viết tắt của Measuring Massive Multitask Language Understanding) — là một bộ bài kiểm tra chuẩn (benchmark), được thiết kế để đánh giá năng lực của các mô hình ngôn ngữ lớn (LLM) trên nhiều lĩnh vực chủ đề khác nhau. Benchmark này được phát triển vào năm 2020 bởi nhóm nghiên cứu do Dan Hendrycks dẫn đầu từ UC Berkeley và được công bố tại hội nghị ICLR năm 2021[1].

Mục tiêu của MMLU là kiểm tra mức độ tiếp thu kiến thức và kỹ năng đa dạng của mô hình — những kiến thức được tích lũy trong giai đoạn tiền huấn luyện — thông qua việc kiểm tra theo chế độ zero-shot hoặc few-shot mà không cần fine-tuning bổ sung. MMLU được tạo ra như một lựa chọn thay thế khó hơn cho các bài kiểm tra trước đó (chẳng hạn như GLUE và SuperGLUE), vốn đã bị nhiều mô hình vượt qua ở mức độ con người vào năm 2020[2].

Mô tả và nội dung

MMU bao gồm 15.908 câu hỏi trắc nghiệm nhiều lựa chọn, trải dài trên 57 lĩnh vực khác nhau. Chủ đề của các bài tập bao gồm:

  • Các môn thuộc khối STEM (toán học, vật lý, sinh học, tin học).
  • Khoa học nhân văn và xã hội (lịch sử, văn học, luật, quản lý).
  • Các lĩnh vực ứng dụng và chuyên nghiệp (y học, luật pháp, kinh doanh)[1].

Mức độ khó dao động từ cấp độ tiểu học đến trình độ chuyên nghiệp nâng cao. Các câu hỏi dựa trên tài liệu thi thực tế dành cho trường phổ thông, đại học và các bài kiểm tra nghề nghiệp như GRE và USMLE[1]. Định dạng bài tập gồm bốn lựa chọn trả lời cho mỗi câu hỏi, nghĩa là khi chọn ngẫu nhiên, độ chính xác đạt 25%. Để đạt kết quả cao, mô hình cần có kiến thức bách khoa sâu rộng và khả năng suy luận.

Kết quả và sự phát triển

Khi MMLU được phát hành vào năm 2020, hầu hết các LLM chỉ cho thấy kết quả nhỉnh hơn không đáng kể so với việc đoán ngẫu nhiên. Mô hình cho kết quả tốt nhất là GPT-3 (175 tỷ tham số), đạt ~43,9% câu trả lời đúng. Để so sánh, một chuyên gia con người trung bình đạt ~90%[1]. Khoảng cách này đã xác nhận độ khó và tiêu chuẩn cao của benchmark mới.

Theo thời gian, MMLU trở thành một trong những bài kiểm tra phổ biến nhất dành cho LLM, được công nhận là "tiêu chuẩn vàng" trong các báo cáo của các công ty AI hàng đầu[3]. Đến năm 2023–2024, các mô hình mới nhất như GPT-4, Gemini Ultra của Google và Claude 3.5 của Anthropic đã tiệm cận mức độ con người, đạt độ chính xác ~85–90%[2][3].

Tiến bộ nhanh chóng đã dẫn đến tình trạng "bão hòa" dần dần của benchmark: các mô hình hàng đầu bắt đầu đạt điểm số gần mức tối đa, làm giảm khả năng của MMLU trong việc phân biệt năng lực trí tuệ giữa các mô hình. Điều này đã thúc đẩy cộng đồng phát triển các bài kiểm tra mới khó hơn[3].

Hạn chế và chỉ trích

Mặc dù được sử dụng rộng rãi, MMLU có một số hạn chế đáng kể.

Chất lượng và độ chính xác của dữ liệu

Vào tháng 6 năm 2024, các nhà nghiên cứu đã tiến hành phân tích thủ công một mẫu gồm 5.700 câu hỏi MMLU và phát hiện ra một số lượng đáng kể các lỗi[4].

  • Khoảng 6,5% tổng số câu hỏi MMLU chứa lỗi trong việc gán nhãn hoặc diễn đạt.
  • Ở một số danh mục cụ thể, tỷ lệ bài tập không chính xác rất cao. Ví dụ, trong phần "Virus học", 57% bài tập chứa lỗi (nhiều câu trả lời đúng, diễn đạt không chính xác hoặc đáp án tham chiếu được chỉ định sai).

Điều này có nghĩa là ngay cả một mô hình hoàn hảo cũng không thể đạt 100% trên dataset gốc, và một phần cải thiện trong các chỉ số có thể liên quan đến việc mô hình ghi nhớ các lỗi hệ thống của bộ dữ liệu[4].

Phương pháp đánh giá và rò rỉ dữ liệu

  • Thiếu tiêu chuẩn kiểm tra. Các nhà phát triển khác nhau có thể sử dụng các prompt và chế độ few-shot khác nhau, khiến việc so sánh trực tiếp kết quả của các mô hình trở nên khó khăn.
  • Rò rỉ dữ liệu (data contamination). Tồn tại nguy cơ các câu hỏi và câu trả lời từ các benchmark công khai lọt vào tập huấn luyện của LLM. Trong trường hợp đó, mô hình thực chất "biết" các câu trả lời đúng, khiến việc đánh giá trở nên không công bằng[3].

Các phiên bản phái sinh và mở rộng

Để giải quyết các vấn đề của MMLU gốc, một số biến thể của nó đã được tạo ra.

  • MMLU-Redux. Phiên bản được sửa chữa và tinh chỉnh của bộ dữ liệu, được giới thiệu vào tháng 6 năm 2024. Nó bao gồm 3.000 câu hỏi được gán nhãn lại từ 30 danh mục và được thiết kế để đánh giá các mô hình đáng tin cậy hơn mà không bị méo mó do lỗi trong dữ liệu[4].
  • MMLU-Pro. Biến thể mở rộng và nâng cao của bài kiểm tra, được giới thiệu vào cuối năm 2024. Nó chứa hơn 12.000 câu hỏi, mỗi câu có 10 lựa chọn trả lời thay vì bốn. Điều này làm giảm xác suất đoán ngẫu nhiên xuống còn 10%. Các câu hỏi đã được chuyên gia kiểm tra và bao gồm các bài tập mới từ các nguồn khó hơn[5].
  • MMMLU (Multilingual MMLU). Phiên bản đa ngôn ngữ, được OpenAI phát hành vào năm 2023. Toàn bộ bộ dữ liệu MMLU đã được các dịch giả chuyên nghiệp dịch sang 14 ngôn ngữ, bao gồm cả các ngôn ngữ phổ biến (tiếng Tây Ban Nha, tiếng Trung, tiếng Nga) lẫn các ngôn ngữ ít tài nguyên (ví dụ: tiếng Yoruba). Điều này cho phép đánh giá và so sánh khả năng của các mô hình trên các ngôn ngữ khác nhau[6].

Liên kết

  • Kho lưu trữ chính thức của MMLU trên GitHub
  • Trang MMLU trên Papers with Code với kết quả của các mô hình

Tài liệu tham khảo

  • Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
  • Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
  • Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
  • Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
  • Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
  • Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
  • Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
  • Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
  • Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
  • Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.


Chú thích

  1. 1.0 1.1 1.2 1.3 Hendrycks, D. et al. «Measuring Massive Multitask Language Understanding». arXiv:2009.03300, 2021. [1]
  2. 2.0 2.1 «MMLU». In Wikipedia. [2]
  3. 3.0 3.1 3.2 3.3 «NEW SAVANNA: The AI industry lacks useful ways of measuring performance». New Savanna Blog, 2024. [3]
  4. 4.0 4.1 4.2 Gema, A. P. et al. «Are We Done with MMLU?». arXiv:2406.04127, 2024. [4]
  5. «MMLU Pro». Vals.ai, 2025. [5]
  6. «openai/MMMLU». Hugging Face Datasets. [6]