Humanity's Last Exam (benchmark) (CS)
Humanity's Last Exam (HLE, česky „Poslední zkouška lidstva") — je komplexní testovací benchmark určený k hodnocení schopností pokročilých systémů umělé inteligence (AI) na úlohách vyžadujících úroveň znalostí a schopností uvažování srovnatelnou s nejlepšími lidskými odborníky. Benchmark byl vytvořen v letech 2024–2025 neziskovou organizací Center for AI Safety (CAIS) ve spolupráci se společností Scale AI[1].
Projekt HLE je koncipován jako „poslední akademická zkouška" pro modely AI — nesmírně obtížná zkouška, která umožní určit, zda se současné modely blíží expertní úrovni a kde přetrvává mezera v jejich schopnostech[1]. Benchmark obsahuje 2 500 mimořádně složitých otázek pokrývajících více než sto různých disciplín[2].
Historie vzniku
V polovině 20. let 21. století dosáhly velké jazykové modely, jako jsou GPT-4 a Claude, natolik vysokých výsledků v populárních testovacích sadách (například MMLU), že mnohé benchmarky přestaly sloužit jako spolehlivá míra pokroku. Standardní zkoušky na úrovni bakalářského studia byly modely prakticky „zdolány", což znemožnilo objektivní hodnocení dalšího zlepšování[3].
V této situaci Dan Hendrycks (Dan Hendrycks), ředitel CAIS a uznávaný výzkumník v oblasti AI, navrhl koncept „Poslední zkoušky lidstva" — souboru otázek maximální obtížnosti, který by dokázal odlišit schopnosti AI od úrovně skutečného odborníka. Impulzem byl rozhovor s podnikatelem Elonem Muskem, který vyjádřil názor, že stávající testy jsou příliš snadné[2].
K realizaci myšlenky se CAIS spojil se Scale AI. Dne 15. září 2024 byl oficiálně vyhlášen globální sběr nejobtížnějších otázek pro budoucí zkoušku. Organizátoři oslovili vědce a odborníky z celého světa s výzvou, aby zaslali úlohy schopné přivést do slepé uličky i nejpokročilejší modely AI. K motivaci účastníků byl zřízen peněžní fond ve výši 500 000 USD[3].
Výběr úloh probíhal ve více etapách. Nejprve byly zaslané otázky filtrovány pomocí pokročilých modelů AI: pokud algoritmy úlohu spolehlivě vyřešily, byla vyřazena jako nedostatečně obtížná. Zadání, s nimiž si AI neporadila, prošla odbornou kontrolou za účelem ověření správnosti a existence jediné správné odpovědi. Celkem se na sestavení sady podílelo téměř 1 000 odborníků z více než 500 vědeckých a vzdělávacích institucí[4].
Finální verze benchmarku obsahující 2 500 otázek byla představena na začátku roku 2025. Část zadání zůstává v uzavřené záloze pro kontrolní testování a předcházení přizpůsobení modelů konkrétní fixní sadě[2].
Struktura a obsah benchmarku
Soubor otázek HLE pokrývá nejširší spektrum oborů akademického vědění. Zadání jsou tematicky rozdělena následovně:
- Matematika: ~41 %
- Biologie a medicína: ~11 %
- Informatika a AI: ~10 %
- Fyzika: ~9 %
- Humanitní a společenské vědy: ~9 %
- Chemie: ~7 %
- Inženýrské vědy: ~4 %
- Ostatní oblasti: ~9 %
Přibližně 14 % všech zadání je multimodálních, tedy k jejich řešení je nutná analýza obrázků (kreseb, diagramů, popisků)[2]. Většina (přibližně 3/4) zadání jsou otevřené otázky s krátkou odpovědí, kde musí model samostatně vygenerovat přesnou odpověď (číslo, termín, jméno). Zbylá zadání jsou otázky s výběrem z více možností.
Všechny úlohy v HLE sdílejí společné vlastnosti:
- Mimořádně vysoká obtížnost: Každý problém vyžaduje úroveň znalostí a dovedností srovnatelnou s kvalifikovaným odborníkem v daném oboru[5].
- Ověřitelná odpověď: Každá otázka má určitou a prokazatelnou správnou odpověď.
- Odolnost vůči vyhledávání: Zadání jsou vybrána tak, aby odpověď nebylo možné nalézt prostým vyhledávacím dotazem; k úspěchu je nutné hluboké porozumění předmětu a schopnost uvažování[1].
Výsledky testování modelů
Humanity's Last Exam okamžitě potvrdil pověst nesmírně obtížné zkoušky: žádný ze současných modelů AI nedokázal na něm dosáhnout výsledku blížícího se lidskému. Nejlepší jazykové modely roku 2025 vykázaly velmi nízkou přesnost.
- Různé verze GPT-4 od OpenAI a Claude od Anthropic dosáhly výsledku méně než 10 %[4].
- Nejvyššího výsledku mezi standardními LLM dosáhl model Gemini 2.5 Pro (Google DeepMind) s přesností přibližně 21,6 %[4].
- I nejlepší modely neúspěšně odpověděly přibližně na 4/5 otázek HLE, což zdůrazňuje rozsah mezery mezi současnými schopnostmi AI a úrovní lidského odborníka[1].
Zvláštní zájem představuje výsledek experimentálního agenta ChatGPT Deep Research od OpenAI, jemuž bylo povoleno automaticky provádět vyhledávací dotazy. Napodobující práci výzkumníka, tento agent dokázal správně vyřešit 26,6 % zadání — výsledek více než 2× vyšší než u jakéhokoli modelu bez takových nástrojů, přesto stále velmi vzdálený od hranice úspěšnosti[6].
Význam a perspektivy
Vznik HLE se stal významnou událostí v komunitě AI, neboť benchmark zaplnil naléhavou potřebu po nové, náročnější míře pokroku.
- Společný výchozí bod. HLE nabízí výzkumníkům a tvůrcům politik objektivní nástroj pro hodnocení schopností AI, který umožňuje sledovat dynamiku zlepšování a chápat, nakolik se stroje přibližují lidské úrovni.
- Nástroj pro informování politiky. Existence takového referenčního testu přispívá k věcnějším diskusím o směrech rozvoje AI, potenciálních rizicích a nezbytných regulačních opatřeních.
- Finální hranice akademických zkoušek. Samotný název „Poslední zkouška" odráží myšlenku, že tento soubor úloh může být poslední uzavřenou zkouškou pro hodnocení AI. Úspěšné absolvování HLE bude znamenat, že z hlediska formálních znalostí a přísně ověřitelných schopností uvažování stroj dosáhl úrovně nejlepších lidských odborníků[4].
Je důležité poznamenat, že ani úplné absolvování HLE nebude znamenat dosažení obecné umělé inteligence (AGI), protože test neověřuje tvůrčí schopnosti, iniciativu ani schopnost klást nové vědecké otázky[4].
S přihlédnutím k rychlému pokroku výzkumníci předpokládají, že modely by mohly překročit 50% přesnost na HLE do konce roku 2025. To by znamenalo, že stroje se těsně přiblížily lidské úrovni v úzké, avšak důležité metrice akademických znalostí[4].
Odkazy
- Oficiální stránka Humanity's Last Exam
- Vědecký článek představující benchmark
Literatura
- Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
- Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
- Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
- Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
- Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
- Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
- Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
- Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
- Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.
Poznámky
- ↑ 1.0 1.1 1.2 1.3 Fan, L. et al. «Humanity's Last Exam: A New Benchmark for AI Alignment». arXiv:2501.14249, 2025. [1]
- ↑ 2.0 2.1 2.2 2.3 «Humanity's Last Exam». In Wikipedia. [2]
- ↑ 3.0 3.1 Dastin, J. & Paul, K. «AI experts ready 'Humanity's Last Exam' to stump powerful tech». Reuters, 2024. [3]
- ↑ 4.0 4.1 4.2 4.3 4.4 4.5 «Humanity's Last Exam». Center for AI Safety. [4]
- ↑ «Could you pass 'Humanity's Last Exam'? Probably not, but neither can AI». TechRadar. [5]
- ↑ «OpenAI's deep research can complete 26% of 'Humanity's Last Exam': What is it and what does it mean?». Hindustan Times. [6]