Humanity's Last Exam (benchmark) (RO)
Humanity's Last Exam (HLE, rom. «Ultimul examen al umanității») — este un test-benchmark complex, destinat evaluării capacităților sistemelor avansate de inteligență artificială (IA) pe sarcini care necesită un nivel de cunoștințe și abilități de raționament comparabil cu cel al celor mai buni experți umani. Benchmark-ul a fost dezvoltat în 2024–2025 de organizația non-profit Center for AI Safety (CAIS) în colaborare cu compania Scale AI[1].
Proiectul HLE este conceput ca un «ultim examen academic» pentru modelele de IA — o probă extrem de dificilă, care va permite determinarea măsurii în care modelele actuale se apropie de nivelul expertului și unde rămâne un decalaj în capacitățile lor[1]. Benchmark-ul include 2500 de întrebări extrem de complexe, acoperind peste o sută de discipline diferite[2].
Istoricul creării
Până la mijlocul anilor 2020, modelele lingvistice de mari dimensiuni, precum GPT-4 și Claude, au demonstrat rezultate atât de înalte pe seturile de teste populare (de exemplu, MMLU), încât multe benchmark-uri au încetat să mai constituie o măsură fiabilă a progresului. Examenele standard de nivel licență au fost practic «demolate» de modele, ceea ce a făcut imposibilă evaluarea obiectivă a îmbunătățirilor ulterioare[3].
În această situație, Dan Hendrycks (Dan Hendrycks), directorul CAIS și cunoscut cercetător în domeniul IA, a propus conceptul «Ultimului examen al umanității» — un set de întrebări de complexitate maximă, capabil să distingă capacitățile IA de nivelul unui expert autentic. Impulsul a venit dintr-o conversație cu antreprenorul Elon Musk, care și-a exprimat opinia că testele existente au devenit prea ușoare[2].
Pentru realizarea ideii, CAIS și-a unit forțele cu Scale AI. Pe 15 septembrie 2024 a fost anunțată oficial o colectare globală a celor mai dificile întrebări pentru viitorul examen. Organizatorii s-au adresat oamenilor de știință și specialiștilor din întreaga lume cu invitația de a trimite probleme capabile să pună în dificultate chiar și cele mai avansate modele de IA. Pentru motivarea participanților a fost instituit un fond de premii în valoare de 500.000 USD[3].
Selecția sarcinilor a avut loc în mai multe etape. Mai întâi, întrebările trimise erau filtrate cu ajutorul modelelor avansate de IA: dacă algoritmii rezolvau sarcina cu încredere, aceasta era eliminată ca insuficient de dificilă. Sarcinile cu care IA nu se descurca treceau printr-o verificare expertă pentru evaluarea corectitudinii și a existenței unui singur răspuns corect. În final, la alcătuirea setului au participat aproape 1000 de experți din peste 500 de instituții științifice și de învățământ[4].
Versionea finală a benchmark-ului, incluzând 2500 de întrebări, a fost prezentată la începutul anului 2025. O parte dintre sarcini a fost păstrată în rezervă închisă pentru testarea de control și prevenirea ajustării modelelor la un set fix[2].
Structura și conținutul benchmark-ului
Setul de întrebări HLE acoperă un spectru extrem de larg de discipline ale cunoașterii academice. Sarcinile sunt distribuite tematic după cum urmează:
- Matematică: ~41%
- Biologie și medicină: ~11%
- Informatică și IA: ~10%
- Fizică: ~9%
- Științe umaniste și sociale: ~9%
- Chimie: ~7%
- Științe inginerești: ~4%
- Alte domenii: ~9%
Aproximativ 14% din toate sarcinile sunt multimodale, adică pentru rezolvarea lor este necesară analiza imaginilor (desene, diagrame, inscripții)[2]. Majoritatea (aproximativ 3/4) sarcinilor sunt întrebări deschise cu răspuns scurt, în care modelul trebuie să genereze independent un răspuns precis (număr, termen, nume). Restul sunt întrebări cu variante multiple de răspuns.
Toate sarcinile din HLE au proprietăți comune:
- Complexitate extrem de ridicată: Fiecare problemă necesită un nivel de cunoștințe și abilități comparabil cu cel al unui specialist calificat în domeniul respectiv[5].
- Răspuns verificabil: Fiecare întrebare are un răspuns corect definit și demonstrabil.
- Rezistență la căutare: Sarcinile sunt selectate astfel încât răspunsul să nu poată fi găsit printr-o simplă interogare de căutare; succesul necesită înțelegere profundă a subiectului și raționament[1].
Rezultatele evaluării modelelor
Humanity's Last Exam și-a confirmat imediat reputația de probă extrem de dificilă: niciun model de IA actual nu a reușit să obțină pe acesta un rezultat apropiat de cel uman. Cele mai bune modele lingvistice din 2025 au demonstrat o acuratețe foarte scăzută.
- Diverse versiuni ale GPT-4 de la OpenAI și Claude de la Anthropic au obținut rezultate sub 10%[4].
- Cel mai înalt rezultat dintre LLM-urile standard a fost obținut de modelul Gemini 2.5 Pro (Google DeepMind), cu o acuratețe de aproximativ 21,6%[4].
- Chiar și cele mai bune modele au eșuat la aproximativ 4/5 din întrebările HLE, ceea ce subliniază amploarea decalajului dintre capacitățile actuale ale IA și nivelul expertului uman[1].
De un interes special este rezultatul agentului experimental ChatGPT Deep Research de la OpenAI, căruia i se permitea să efectueze automat interogări de căutare. Simulând activitatea unui cercetător, acest agent a reușit să rezolve corect 26,6% din sarcini — un rezultat de peste 2 ori mai mare decât al oricărui model fără astfel de instrumente, dar încă foarte departe de nota de trecere[6].
Semnificație și perspective
Apariția HLE a reprezentat un eveniment semnificativ în comunitatea IA, deoarece benchmark-ul a umplut o nevoie acută de o nouă măsură mai complexă a progresului.
- Punct de referință comun. HLE oferă cercetătorilor și factorilor de decizie un instrument obiectiv pentru evaluarea capacităților IA, permițând urmărirea dinamicii îmbunătățirilor și înțelegerea măsurii în care mașinile se apropie de nivelul uman.
- Instrument pentru informarea politicilor. Existența unui astfel de test de referință contribuie la dezbateri mai substanțiale privind direcțiile de dezvoltare a IA, riscurile potențiale și măsurile de reglementare necesare.
- Ultima frontieră a probelor academice. Chiar numele «Ultimul examen» reflectă ideea că acest set de sarcini ar putea deveni ultimul examen închis pentru evaluarea IA. Promovarea cu succes a HLE va însemna că, din perspectiva cunoștințelor formale și a abilităților de raționament strict verificabile, mașina a atins nivelul celor mai buni experți umani[4].
Este important de menționat că nici măcar promovarea integrală a HLE nu va însemna atingerea inteligenței artificiale generale (AGI), deoarece testul nu verifică abilitățile creative, inițiativa sau capacitatea de a formula noi întrebări științifice[4].
Ținând cont de progresul rapid, cercetătorii estimează că modelele ar putea depăși 50% acuratețe pe HLE până la sfârșitul anului 2025. Aceasta va însemna că mașinile s-au apropiat considerabil de nivelul uman pe o metrică restrânsă, dar importantă, a cunoștințelor academice[4].
Referințe
- Site-ul oficial Humanity's Last Exam
- Articolul științific care prezintă benchmark-ul
Bibliografie
- Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
- Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
- Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
- Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
- Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
- Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
- Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
- Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
- Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.
Note
- ↑ 1.0 1.1 1.2 1.3 Fan, L. et al. «Humanity's Last Exam: A New Benchmark for AI Alignment». arXiv:2501.14249, 2025. [1]
- ↑ 2.0 2.1 2.2 2.3 «Humanity's Last Exam». In Wikipedia. [2]
- ↑ 3.0 3.1 Dastin, J. & Paul, K. «AI experts ready 'Humanity's Last Exam' to stump powerful tech». Reuters, 2024. [3]
- ↑ 4.0 4.1 4.2 4.3 4.4 4.5 «Humanity's Last Exam». Center for AI Safety. [4]
- ↑ «Could you pass 'Humanity's Last Exam'? Probably not, but neither can AI». TechRadar. [5]
- ↑ «OpenAI's deep research can complete 26% of 'Humanity's Last Exam': What is it and what does it mean?». Hindustan Times. [6]