Humanity's Last Exam (benchmark) (VI)
Humanity's Last Exam (HLE, tiếng Việt: «Kỳ thi cuối cùng của nhân loại») — là một bộ kiểm tra benchmark toàn diện, được thiết kế để đánh giá năng lực của các hệ thống trí tuệ nhân tạo (AI) tiên tiến trên các bài toán đòi hỏi trình độ kiến thức và kỹ năng suy luận tương đương với những chuyên gia hàng đầu của con người. Benchmark này được phát triển trong giai đoạn 2024–2025 bởi tổ chức phi lợi nhuận Center for AI Safety (CAIS) phối hợp với công ty Scale AI[1].
Dự án HLE được hình thành như một «kỳ thi học thuật cuối cùng» dành cho các mô hình AI — một bài kiểm tra cực kỳ khó, cho phép xác định liệu các mô hình hiện đại có đang tiệm cận trình độ chuyên gia hay không, và khoảng cách còn lại trong năng lực của chúng nằm ở đâu[1]. Benchmark bao gồm 2500 câu hỏi cực kỳ phức tạp, trải rộng trên hơn một trăm lĩnh vực khác nhau[2].
Lịch sử hình thành
Vào giữa những năm 2020, các mô hình ngôn ngữ lớn như GPT-4 và Claude đã đạt được kết quả cao đến mức trong các bộ kiểm tra phổ biến (ví dụ MMLU), nhiều benchmark không còn là thước đo đáng tin cậy của sự tiến bộ nữa. Các kỳ thi chuẩn ở trình độ đại học gần như đã bị các mô hình «đánh bại hoàn toàn», khiến việc đánh giá khách quan những cải tiến tiếp theo trở nên bất khả thi[3].
Trong bối cảnh đó, Dan Hendrycks (Dan Hendrycks), giám đốc CAIS và nhà nghiên cứu AI nổi tiếng, đã đề xuất khái niệm «Kỳ thi cuối cùng của nhân loại» — một bộ câu hỏi có độ khó tối đa, có thể phân biệt năng lực của AI với trình độ của một chuyên gia thực sự. Động lực xuất phát từ cuộc trò chuyện với doanh nhân Elon Musk, người bày tỏ quan điểm rằng các bài kiểm tra hiện có đã trở nên quá dễ[2].
Để hiện thực hóa ý tưởng, CAIS đã hợp lực cùng Scale AI. Ngày 15 tháng 9 năm 2024, chương trình thu thập toàn cầu các câu hỏi khó nhất cho kỳ thi trong tương lai đã chính thức được công bố. Ban tổ chức kêu gọi các nhà khoa học và chuyên gia trên toàn thế giới gửi những bài toán có khả năng khiến ngay cả các mô hình AI tiên tiến nhất cũng bó tay. Để khuyến khích sự tham gia, một giải thưởng trị giá 500.000 đô la Mỹ đã được thiết lập[3].
Quy trình tuyển chọn bài toán diễn ra qua nhiều giai đoạn. Đầu tiên, các câu hỏi được gửi đến sẽ được lọc thông qua các mô hình AI tiên tiến: nếu thuật toán giải được bài toán một cách tự tin, bài đó sẽ bị loại vì chưa đủ độ khó. Những bài mà AI không giải được sẽ trải qua quá trình kiểm tra chuyên gia để đánh giá tính chính xác và sự tồn tại của một đáp án đúng duy nhất. Cuối cùng, gần 1000 chuyên gia từ hơn 500 cơ sở khoa học và giáo dục đã tham gia vào việc xây dựng bộ câu hỏi[4].
Phiên bản cuối cùng của benchmark, bao gồm 2500 câu hỏi, đã được ra mắt vào đầu năm 2025. Một phần bài tập được giữ trong kho dự phòng bí mật để kiểm tra đối chiếu và ngăn chặn việc các mô hình được tinh chỉnh theo một bộ câu hỏi cố định[2].
Cấu trúc và nội dung benchmark
Bộ câu hỏi HLE bao phủ một phổ cực kỳ rộng các lĩnh vực tri thức học thuật. Các bài tập được phân bổ theo chủ đề như sau:
- Toán học: ~41%
- Sinh học và y học: ~11%
- Khoa học máy tính và AI: ~10%
- Vật lý: ~9%
- Khoa học nhân văn và xã hội: ~9%
- Hóa học: ~7%
- Kỹ thuật: ~4%
- Các lĩnh vực khác: ~9%
Khoảng 14% tổng số bài tập là đa phương thức (multimodal), tức là để giải chúng cần phân tích hình ảnh (hình vẽ, sơ đồ, chú thích)[2]. Phần lớn (khoảng 3/4) bài tập là câu hỏi mở với câu trả lời ngắn, trong đó mô hình phải tự tạo ra đáp án chính xác (số, thuật ngữ, tên gọi). Phần còn lại là câu hỏi trắc nghiệm nhiều lựa chọn.
Tất cả bài toán trong HLE đều có các đặc điểm chung:
- Độ khó cực cao: Mỗi bài toán đòi hỏi trình độ kiến thức và kỹ năng tương đương với một chuyên gia có trình độ trong lĩnh vực đó[5].
- Đáp án có thể kiểm chứng: Mỗi câu hỏi có một đáp án đúng xác định và có thể chứng minh được.
- Khả năng chống tìm kiếm: Các bài tập được chọn lọc sao cho không thể tìm thấy đáp án bằng một truy vấn tìm kiếm đơn giản; để thành công cần có sự hiểu biết sâu sắc về chủ đề và khả năng suy luận[1].
Kết quả kiểm tra các mô hình
Humanity's Last Exam ngay lập tức khẳng định danh tiếng là một bài kiểm tra cực kỳ khó: không một mô hình AI hiện đại nào có thể đạt kết quả gần với trình độ con người trên đó. Các mô hình ngôn ngữ hàng đầu năm 2025 cho thấy độ chính xác rất thấp.
- Các phiên bản khác nhau của GPT-4 từ OpenAI và Claude từ Anthropic đạt kết quả dưới 10%[4].
- Kết quả cao nhất trong số các LLM tiêu chuẩn thuộc về mô hình Gemini 2.5 Pro (Google DeepMind) với độ chính xác khoảng 21,6%[4].
- Ngay cả các mô hình tốt nhất cũng thất bại ở khoảng 4/5 câu hỏi HLE, điều này nhấn mạnh khoảng cách lớn giữa năng lực AI hiện tại và trình độ chuyên gia của con người[1].
Đặc biệt đáng chú ý là kết quả của tác nhân thực nghiệm ChatGPT Deep Research từ OpenAI, được phép tự động thực hiện các truy vấn tìm kiếm. Mô phỏng công việc của một nhà nghiên cứu, tác nhân này đã giải đúng 26,6% bài tập — kết quả cao hơn gấp đôi so với bất kỳ mô hình nào không có công cụ như vậy, nhưng vẫn còn rất xa so với ngưỡng đạt yêu cầu[6].
Ý nghĩa và triển vọng
Sự xuất hiện của HLE là một sự kiện quan trọng trong cộng đồng AI, vì benchmark này lấp đầy nhu cầu cấp thiết về một thước đo tiến bộ mới, khó hơn.
- Điểm tham chiếu chung. HLE cung cấp cho các nhà nghiên cứu và nhà hoạch định chính sách một công cụ khách quan để đánh giá năng lực AI, cho phép theo dõi động lực cải tiến và hiểu mức độ các máy móc đang tiệm cận trình độ con người.
- Công cụ phục vụ hoạch định chính sách. Sự tồn tại của bài kiểm tra chuẩn này thúc đẩy các cuộc thảo luận thực chất hơn về hướng phát triển AI, các rủi ro tiềm ẩn và các biện pháp quản lý cần thiết.
- Ranh giới cuối cùng của các bài kiểm tra học thuật. Chính tên gọi «Kỳ thi cuối cùng» phản ánh ý tưởng rằng bộ bài toán này có thể trở thành kỳ thi kín cuối cùng để đánh giá AI. Việc vượt qua HLE một cách tự tin sẽ có nghĩa là, về mặt kiến thức hình thức và kỹ năng suy luận có thể kiểm chứng nghiêm ngặt, máy móc đã đạt đến trình độ của những chuyên gia hàng đầu của con người[4].
Quan trọng cần lưu ý rằng ngay cả khi vượt qua hoàn toàn HLE cũng không đồng nghĩa với việc đạt được trí tuệ nhân tạo tổng quát (AGI), vì bài kiểm tra không đánh giá năng lực sáng tạo, tính chủ động hay khả năng đặt ra những câu hỏi khoa học mới[4].
Xét đến tốc độ tiến bộ nhanh chóng, các nhà nghiên cứu dự đoán rằng các mô hình có thể vượt ngưỡng 50% độ chính xác trên HLE vào cuối năm 2025. Điều này sẽ có nghĩa là máy móc đã tiệm cận sát trình độ con người theo một chỉ số hẹp nhưng quan trọng về kiến thức học thuật[4].
Liên kết
- Trang web chính thức của Humanity's Last Exam
- Bài báo khoa học giới thiệu benchmark
Tài liệu tham khảo
- Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
- Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
- Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
- Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
- Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
- Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
- Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
- Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
- Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.
Ghi chú
- ↑ 1.0 1.1 1.2 1.3 Fan, L. et al. «Humanity's Last Exam: A New Benchmark for AI Alignment». arXiv:2501.14249, 2025. [1]
- ↑ 2.0 2.1 2.2 2.3 «Humanity's Last Exam». In Wikipedia. [2]
- ↑ 3.0 3.1 Dastin, J. & Paul, K. «AI experts ready 'Humanity's Last Exam' to stump powerful tech». Reuters, 2024. [3]
- ↑ 4.0 4.1 4.2 4.3 4.4 4.5 «Humanity's Last Exam». Center for AI Safety. [4]
- ↑ «Could you pass 'Humanity's Last Exam'? Probably not, but neither can AI». TechRadar. [5]
- ↑ «OpenAI's deep research can complete 26% of 'Humanity's Last Exam': What is it and what does it mean?». Hindustan Times. [6]