Humanity's Last Exam

Материал из Systems analysis wiki
Перейти к навигации Перейти к поиску

Humanity's Last Exam (HLE, «Последний экзамен человечества») — набор тестовых заданий (бенчмарк) для оценки способностей передовых систем искусственного интеллекта (ИИ) на закрытых академических задачах, которые требуют знаний и рассуждений на уровне ведущих экспертов. Бенчмарк создан в 2024–2025 годах некоммерческой организацией Center for AI Safety (CAIS) совместно с компанией Scale AI[1]. Рецензируемая версия работы позднее вышла в журнале Nature в январе 2026 года под названием «A benchmark of expert-level academic questions to assess AI capabilities»[2].

HLE задуман как «финальный академический экзамен» для моделей ИИ — предельно трудный тест с закрытыми ответами, призванный показать, насколько современные модели приблизились к экспертному уровню и где сохраняются пробелы в их возможностях[1]. Бенчмарк состоит из открыто опубликованного набора в 2500 вопросов более чем по сотне дисциплин и закрытого контрольного набора (holdout), по которому выявляют переобучение[1].

Предыстория

К середине 2020-х годов ведущие языковые модели, такие как GPT-4 и Claude, достигли на популярных наборах тестов (например, MMLU) столь высоких результатов, что многие бенчмарки перестали быть надёжной мерой прогресса. Там, где эти тесты когда-то были трудным рубежом, передовые модели стали превышать 90 % точности, и объективно оценивать дальнейшие улучшения оказалось сложно[3]. В отчёте AI Index 2025 Стэнфордского института HAI (Human-Centered AI) Humanity's Last Exam позднее упомянут среди «более трудных бенчмарков», созданных именно потому, что популярные тесты достигли насыщения[4].

В этих условиях Дэн Хендрикс — директор CAIS и автор более раннего бенчмарка MMLU — предложил идею «последнего экзамена»: набора предельно трудных вопросов, способных отделить возможности ИИ от уровня настоящего эксперта. По словам Хендрикса, непосредственным толчком стал разговор с предпринимателем Илоном Маском, который считал существующие тесты слишком лёгкими и заметил, что вопросы MMLU «уровня студента-бакалавра», а ему хотелось задач, «которые под силу эксперту мирового класса»[5]. Первоначально у проекта было рабочее название в духе «The Last Stand» («Последний рубеж»), которое перед публичным запуском сменили на «Humanity's Last Exam» — менее апокалиптичное и точнее отражающее закрытый, экзаменационный формат вопросов[5].

Создание бенчмарка

Для реализации идеи CAIS объединился со Scale AI; её глава Александр Ван и директор по исследованиям Саммер Юэ помогали вести работу вместе с Хендриксом. 16 сентября 2024 года был объявлен глобальный сбор самых трудных вопросов для будущего экзамена. Учёных и специалистов по всему миру пригласили присылать задачи, способные поставить в тупик самые продвинутые модели ИИ, а для привлечения участников учредили призовой фонд в 500 000 долларов[3]. По условиям выплачивали 5000 долларов за каждый из 50 лучших вопросов и 500 долларов — за следующие 500; авторам принятых вопросов также предлагали соавторство в итоговой статье[6]. Срок подачи, изначально назначенный на 1 ноября 2024 года, позднее продлили до 15 ноября 2024 года.

Отбор задач шёл в несколько этапов. Сначала присланные вопросы фильтровали передовыми моделями ИИ: если модель отвечала верно (а для заданий с выбором ответа — лучше случайного угадывания), вопрос отбраковывали как недостаточно трудный. Вопросы, с которыми модели не справлялись, передавали экспертам, и те в два круга проверяли корректность и добивались единственного, однозначного и проверяемого ответа, который нельзя получить простым поиском в интернете. Из первоначального пула в десятки тысяч заявок вклад в итоговый набор внесли почти 1000 экспертов из более чем 500 учреждений в 50 странах — в основном профессора, исследователи и обладатели учёных степеней[7].

Впервые о бенчмарке объявили в конце января 2025 года; препринт на arXiv был подан 24 января 2025 года[1]. После выхода до 21 марта 2025 года действовала открытая программа «отлова ошибок» (bug bounty) по отзывам сообщества — чтобы выявить и удалить ошибочные или находимые через поиск вопросы; 3 апреля 2025 года набор зафиксировали в объёме 2500 опубликованных вопросов, удалив и заменив помеченные задания[7]. Часть вопросов удерживается в закрытом контрольном наборе — для контрольных проверок и защиты от переобучения под фиксированный набор[6]. Рецензируемая версия работы вышла в Nature 28 января 2026 года[2].

Структура и содержание бенчмарка

Набор вопросов HLE охватывает широкий спектр академических дисциплин. Распределение по предметным областям следующее[2]:

  • Математика — около 41 %
  • Биология и медицина — около 11 %
  • Информатика и ИИ — около 10 %
  • Физика — около 9 %
  • Гуманитарные и социальные науки — около 9 %
  • Химия — около 7 %
  • Инженерные дисциплины — около 4 %
  • Прочие области — около 9 %

Около 14 % всех заданий мультимодальны: помимо текста они требуют анализа сопровождающего изображения — схемы, рисунка или надписи[2]. Около 76 % вопросов — задания с точным (кратким) ответом, где модель должна сама выдать точный ответ: число, термин или строку; остальные 24 % — вопросы с выбором ответа из пяти и более вариантов[2]. Тематика намеренно узкоспециальна: от перевода древних пальмирских надписей до определения микроанатомических структур у птиц или анализа особенностей произношения библейского иврита[2].

Все задания HLE обладают общими свойствами:

  • Крайне высокая трудность: каждая задача требует знаний и навыков на уровне квалифицированного специалиста в своей области[8].
  • Проверяемый ответ: у каждого вопроса есть конкретный, доказуемо верный ответ, пригодный для автоматической проверки.
  • Устойчивость к поиску: задания составлены так, что ответ нельзя найти простым поисковым запросом; для успеха нужны глубокое понимание и рассуждение[1].

Для автоматической проверки сопровождающие бенчмарк используют отдельную модель (o3-mini) как экстрактор и «судью», сопоставляющего ответ модели с эталонным, и отмечают, что результаты могут немного меняться при других моделях-судьях и формулировках запроса[7].

Результаты моделей

Humanity's Last Exam сразу подтвердил репутацию крайне трудного теста: на момент выхода ни одна из современных моделей ИИ не приблизилась к экспертному уровню, и разрыв сокращался лишь постепенно, по мере совершенствования моделей. Поскольку результаты сильно зависят от даты и от того, разрешены ли внешние инструменты, приведённые ниже цифры стоит читать как временной ряд, а не как фиксированный рейтинг.

  • Первый выпуск (начало 2025 года, без инструментов). Ведущие модели набирали единицы процентов. GPT-4o вышла примерно на 3 %, а сильнейшие на тот момент модели с рассуждением — OpenAI o1 и DeepSeek-R1 — верно отвечали лишь примерно на 9 % вопросов[7].
  • Агенты с инструментами (февраль 2025 года). Экспериментальный агент OpenAI Deep Research на базе модели o3, которому разрешили автоматический поиск в интернете, верно решил 26,6 % заданий — примерно втрое больше лучшего результата без инструментов на тот момент, хотя и это далеко от проходного балла. Доступ к поиску делает прямое сравнение с моделями без инструментов неравноценным[9].
  • В течение 2025 года (без инструментов). Новые модели с рассуждением подняли точность без инструментов до низких двадцатых процентов. Gemini 2.5 Pro от Google на запуске в марте 2025 года показала около 18,8 %, а позднее — чуть больше двадцати процентов; Grok 4 от xAI к середине года достигла примерно 25 %[7].
  • Текущее состояние (2026 год). Передовой рубеж продолжил круто расти. К началу 2026 года лучшие модели в официальном рейтинге вышли на середину тридцатых процентов; к середине 2026 года публичные рейтинги ставили лидеров на уровень середины сороковых и выше. Среди приводимых результатов для текстового набора — середина сороковых у линейки Gemini 3.x Pro от Google и низкие-средние сороковые у сильнейших вариантов GPT-5; при этом на площадке Artificial Analysis верхние позиции занимали Claude Fable 5 и Claude Opus 4.8 от Anthropic (около 53 % и 46 % соответственно) — одни из первых результатов выше отметки в 50 % на публичном рейтинге[7][10].

Отдельное побочное наблюдение касается калибровки. На момент первой публикации модели сочетали низкую точность (менее 10 %) с очень высокой заявленной уверенностью (ошибка калибровки выше 80 %) — веский признак того, что системы скорее «конфабулируют», чем осознают границы собственного знания[7].

Критика и ограничения

Несмотря на своё влияние, HLE вызвал предметную критику.

  • Эрудиция против интеллекта. Часть авторов и наблюдателей сомневается, что ответы на узкоспециальные вопросы уровня аспирантуры — осмысленная мера общего интеллекта. Кевин Чжоу, исследователь теоретической физики из Калифорнийского университета в Беркли, участвовавший в составлении вопросов, отметил большой разрыв между результатом на экзамене и подлинной исследовательской способностью[6]. (В рецензируемой версии Nature использовано более описательное название — «A benchmark of expert-level academic questions to assess AI capabilities».)
  • Точность ответов. В июле 2025 года исследовательская организация FutureHouse опубликовала разбор, согласно которому примерно у 29 % (95-процентный доверительный интервал ±3,7 процентного пункта) из 321 текстового вопроса по биологии/медицине и химии, которые она проверила, ответы противоречили рецензируемой литературе. Проверка сознательно охватывала только эти подмножества, а не весь бенчмарк, и опиралась на исследовательского агента FutureHouse PaperQA2, сверявшего обоснование каждого ответа с опубликованными данными[11]. В ответ команда HLE провела собственную целевую перепроверку подмножества по биологии, химии и медицине и сообщила о доле экспертных расхождений около 18 %, указав, что часть разрыва отражает подлинные разногласия экспертов в очень трудных вопросах, а не прямые ошибки; отдельно FutureHouse выпустила выверенное подмножество «HLE Bio/Chem Gold»[12].
  • Систематическая ревизия. К 2026 году опасения о надёжности привели к систематической переверке набора. Проект «HLE-Verified» (2026) заново проверил открытый набор с помощью экспертной оценки и перекрёстных проверок моделями, сертифицировав 1811 из 2500 вопросов (либо подтверждённых как верные, либо исправленных с сохранением исходного замысла оценки) и выпустив оставшиеся 689 как задокументированный «неопределённый» набор; авторы сообщают, что проверка и исправление ощутимо сдвигают итоговые оценки моделей — то есть часть измеренной результативности отражала артефакты разметки, а не различия в способностях[13].
  • Оплата и процесс. Некоторые участники сообщали о неясной схеме выплат и смещавшихся сроках в ходе разработки; ряд экспертов с учёными степенями выражал недовольство неопределёнными ожиданиями вокруг призового фонда в 500 000 долларов[6].
  • Не тест общего интеллекта. По замыслу HLE измеряет структурированные, закрытые академические знания и рассуждение. Он не оценивает творчество, инициативу, способность к открытому исследованию или умение ставить новые научные вопросы, поэтому даже идеальный результат сам по себе не означал бы наличия общего искусственного интеллекта (AGI)[7].

Значение и перспективы

Появление HLE стало заметным событием в сообществе ИИ: бенчмарк закрыл насущную потребность в новой, более трудной мере прогресса.

  • Общая точка отсчёта. HLE даёт исследователям и регуляторам стандартизированный — хотя и чувствительный к методике — ориентир для оценки возможностей ИИ, позволяя отслеживать улучшения во времени и судить, насколько машины приблизились к уровню экспертов-людей.
  • Опора для выработки политики. Общий эталонный тест поддерживает более содержательное обсуждение траекторий развития ИИ, потенциальных рисков и возможных мер регулирования.
  • Последний рубеж академического тестирования. Название «последний экзамен» отражает мысль, что этот набор задач может стать финальным закрытым экзаменом, нужным для оценки ИИ. Прохождение HLE означало бы, что по формальным знаниям и строго проверяемым рассуждениям машина достигла уровня лучших экспертов-людей[7].

Авторы предполагали, что при таком темпе прогресса модели могут превысить 50 % точности на HLE к концу 2025 года[7]. На практике к этому сроку порог взят не был — на исходе 2025 года сильнейшие модели держались в официальном рейтинге примерно в диапазоне от середины двадцатых до высоких тридцатых процентов, — и публичные рейтинги не показывали уверенного преодоления отметки в 50 % вплоть до 2026 года, примерно на полгода позже прогноза. Преодоление этого порога означает, что машины вплотную приблизились к экспертному уровню по узкой, но важной мере академических знаний, оставляя при этом открытую научную и творческую работу отдельным, неизмеренным рубежом.

Результаты моделей по источникам

Оценки HLE не абсолютны: они зависят от даты, от модели-судьи и формулировки запроса при проверке, от того, разрешены ли внешние инструменты (например, веб-поиск), и от того, включены ли мультимодальные вопросы или берётся только текстовое подмножество. Поэтому разные рейтинги дают для одной и той же модели разные числа, и цифры лучше сравнивать внутри одного источника, а не между источниками. Два рейтинга ниже — собственный рейтинг бенчмарка (Scale AI / SEAL) и независимый оценщик (Artificial Analysis) — это показывают: Gemini 3.1 Pro Preview на текстовом рейтинге Scale приводится с 47,3 %, а у Artificial Analysis — с 44,7 %, и два рейтинга даже не сходятся в том, кто сейчас лидер. Обе таблицы — срезы на конкретный момент, которые часто меняются; у каждой ниже указана дата, а за текущим положением дел стоит обращаться к «живым» рейтингам.

Scale AI / SEAL — официальный рейтинг (только текст)

Собственный рейтинг бенчмарка, который ведётся вместе с Center for AI Safety. Модели оцениваются на текстовом подмножестве (около 86 % набора) при температуре 0; проверку выполняет o3-mini как автоматический экстрактор и судья. Ранг — статистическая верхняя граница (модель ставится выше другой лишь тогда, когда её нижняя 95-процентная доверительная граница превышает верхнюю границу другой), поэтому модели могут делить ранг. «Ошибка калибр.» — среднеквадратичная ошибка калибровки, то есть насколько заявленная уверенность модели расходится с фактической точностью; высокие значения указывают на самоуверенность. Приведённые ниже позиции — срез середины 2026 года, они часто меняются[14].

Ранг (ВГ) Модель Точность, % (±95 % ДИ) Ошибка калибр.
1 Gemini 3.1 Pro Preview (thinking high) 47,3 ±2,1 50
1 GPT-5.4 Pro 45,3 ±2,1 37
3 Muse Spark 40,9 ±2,1 51
3 Gemini 3 Pro Preview 37,7 ±2,0 57
4 GPT-5.4 (xhigh thinking) 36,5 ±2,0 42
4 Claude Opus 4.6 Thinking Max 36,2 ±2,0 46
5 GPT-5 Pro 33,3 ±2,0 49
8 GPT-5.2 28,5 ±1,9 45
8 Claude Opus 4.5 Thinking 26,3 ±1,9 55
8 GPT-5 26,3 ±1,9 50
9 GPT-5.1 Thinking 24,7 ±1,8 54
11 Gemini 2.5 Pro Preview (06-05) 22,1 ±1,8 72
Для сравнения — модели ранней эпохи (конец 2024 / начало 2025):
34 o1 (декабрь 2024) 7,8 ±1,1 84
48 Claude 3.5 Sonnet (октябрь 2024) 4,3 ±0,9 83
59 GPT-4o (ноябрь 2024) 2,3 ±0,6 88

Artificial Analysis — независимый рейтинг

Независимый оценщик, который прогоняет модели через собственную оценочную обвязку на текстовом подмножестве HLE (2158 вопросов), исключая мультимодальные вопросы для сопоставимости между моделями. Его цифры прямо несравнимы с рейтингом Scale выше из-за различий в методике, модели-судье и составе вопросов. Топ-10 ниже взят напрямую с рейтинга Artificial Analysis по состоянию на 1 июля 2026 года (положение часто меняется)[10].

Модель Точность, %
1 Claude Fable 5 (with fallback) 53,3
2 Claude Opus 4.8 (max) 45,7
3 Gemini 3.1 Pro Preview 44,7
4 GPT-5.5 (xhigh) 44,3
5 GPT-5.5 (high) 43,0
6 Gemini 3.5 Flash 41,0
7 GLM-5.2 (max) 40,1
8 Muse Spark 39,9
9 Claude Sonnet 5 (max) 39,6
10 Qwen3.7 Max 38,1

Ссылки

Литература

  • Liang P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
  • Chang Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
  • Ni S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
  • Biderman S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
  • Kiela D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
  • Ma Z. et al. (2021). Dynaboard: An Evaluation-As-A-Service Platform for Holistic Next-Generation Benchmarking. arXiv:2106.06052.
  • Goel K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
  • Xu C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
  • Liu S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
  • Chiang W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Boubdir M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
  • Huang L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.

Примечания

  1. 1,0 1,1 1,2 1,3 1,4 Phan L., Gatti A., Han Z. и др. «Humanity's Last Exam». arXiv:2501.14249, 2025. [1]
  2. 2,0 2,1 2,2 2,3 2,4 2,5 «A benchmark of expert-level academic questions to assess AI capabilities» // Nature. 2026. Т. 649. С. 1139–1146. DOI: 10.1038/s41586-025-09962-4. [2]
  3. 3,0 3,1 Dastin J., Paul K. «AI experts ready ‘Humanity's Last Exam' to stump powerful tech» // Reuters, 2024. [3]
  4. Maslej N. и др. The AI Index 2025 Annual Report. Stanford Institute for Human-Centered AI, апрель 2025. С. 141–142.
  5. 5,0 5,1 Roose K. «When A.I. Passes This Test, Look Out» // The New York Times, 23 января 2025.
  6. 6,0 6,1 6,2 6,3 «Humanity's Last Exam» // Wikipedia. [4]
  7. 7,00 7,01 7,02 7,03 7,04 7,05 7,06 7,07 7,08 7,09 «Humanity's Last Exam» // Center for AI Safety. [5]
  8. «Could you pass ‘Humanity's Last Exam'? Probably not, but neither can AI» // TechRadar. [6]
  9. «OpenAI's deep research can complete 26% of ‘Humanity's Last Exam': What is it and what does it mean?» // Hindustan Times. [7]
  10. 10,0 10,1 «Humanity's Last Exam Benchmark Leaderboard» // Artificial Analysis. [8]
  11. FutureHouse. «About 30% of Humanity's Last Exam chemistry/biology answers are likely wrong», 2025. [9]
  12. Команда-организатор HLE пересмотрела препринт в ответ на разбор FutureHouse и при перепроверке подмножества по биологии, химии и медицине (сентябрь 2025 года) сообщила о доле экспертных расхождений около 18 %. См. arXiv:2501.14249 (пересмотренная версия) и обновление FutureHouse: [10].
  13. Zhai W., Wang Z., Wang J. и др. «HLE-Verified: A Systematic Verification and Structured Revision of Humanity's Last Exam». arXiv:2602.13964, 2026. [11]
  14. «Humanity's Last Exam (Text Only)» // Scale AI / SEAL Leaderboards. [12]