Humanity's Last Exam (benchmark) (EL)

From Systems analysis wiki
Jump to navigation Jump to search

Humanity's Last Exam (HLE, ελλ. «Η Τελευταία Εξέταση της Ανθρωπότητας») — είναι ένα σύνθετο benchmark αξιολόγησης, σχεδιασμένο για την εκτίμηση των δυνατοτήτων προηγμένων συστημάτων τεχνητής νοημοσύνης (ΤΝ) σε εργασίες που απαιτούν επίπεδο γνώσεων και ικανοτήτων συλλογισμού συγκρίσιμο με τους κορυφαίους ανθρώπους-εμπειρογνώμονες. Το benchmark αναπτύχθηκε το 2024–2025 από τον μη κερδοσκοπικό οργανισμό Center for AI Safety (CAIS) σε συνεργασία με την εταιρεία Scale AI[1].

Το έργο HLE συνελήφθη ως «η τελευταία ακαδημαϊκή εξέταση» για τα μοντέλα ΤΝ — μια εξαιρετικά δύσκολη δοκιμασία που θα επιτρέψει να προσδιοριστεί κατά πόσον τα σύγχρονα μοντέλα πλησιάζουν το επίπεδο εμπειρογνωμόνων και πού παραμένει το χάσμα στις ικανότητές τους[1]. Το benchmark περιλαμβάνει 2500 εξαιρετικά δύσκολες ερωτήσεις που καλύπτουν περισσότερες από εκατό διαφορετικές επιστημονικές κλάδους[2].

Ιστορία δημιουργίας

Μέχρι τα μέσα της δεκαετίας του 2020, τα μεγάλα γλωσσικά μοντέλα, όπως το GPT-4 και το Claude, είχαν επιδείξει τόσο υψηλές επιδόσεις σε δημοφιλείς σειρές δοκιμών (π.χ. MMLU), ώστε πολλά benchmark είχαν παύσει να αποτελούν αξιόπιστο μέτρο προόδου. Τα τυπικά εξετάσεις επιπέδου πτυχίου είχαν κυριολεκτικά «κατακτηθεί» από τα μοντέλα, γεγονός που καθιστούσε αδύνατη την αντικειμενική αξιολόγηση περαιτέρω βελτιώσεων[3].

Σε αυτή την κατάσταση, ο Νταν Χέντρικς (Dan Hendrycks), διευθυντής του CAIS και γνωστός ερευνητής ΤΝ, πρότεινε την ιδέα της «Τελευταίας Εξέτασης της Ανθρωπότητας» — ενός συνόλου ερωτήσεων μέγιστης δυσκολίας, ικανού να διακρίνει τις δυνατότητες της ΤΝ από το επίπεδο πραγματικού εμπειρογνώμονα. Ερέθισμα υπήρξε μια συνομιλία με τον επιχειρηματία Ίλον Μασκ, ο οποίος εξέφρασε την άποψη ότι οι υπάρχουσες δοκιμασίες είχαν γίνει υπερβολικά εύκολες[2].

Για την υλοποίηση της ιδέας, το CAIS ένωσε τις δυνάμεις του με το Scale AI. Στις 15 Σεπτεμβρίου 2024 ανακοινώθηκε επίσημα μια παγκόσμια συλλογή των πιο δύσκολων ερωτήσεων για τη μελλοντική εξέταση. Οι διοργανωτές απευθύνθηκαν σε επιστήμονες και ειδικούς σε όλο τον κόσμο με πρόσκληση να υποβάλουν προβλήματα ικανά να αποπροσανατολίσουν ακόμα και τα πιο προηγμένα μοντέλα ΤΝ. Για την παρακίνηση των συμμετεχόντων ιδρύθηκε ταμείο βραβείων ύψους $500.000[3].

Η επιλογή των εργασιών πραγματοποιήθηκε σε διάφορα στάδια. Αρχικά, οι υποβληθείσες ερωτήσεις περνούσαν από ένα φίλτρο με τη βοήθεια προηγμένων μοντέλων ΤΝ: εάν οι αλγόριθμοι έλυναν με σιγουριά ένα πρόβλημα, αυτό απορριπτόταν ως ανεπαρκώς δύσκολο. Οι εργασίες με τις οποίες η ΤΝ δεν τα κατάφερνε υπόκειντο σε εμπειρογνωμονική εξέταση για αξιολόγηση της ορθότητας και της ύπαρξης μοναδικής σωστής απάντησης. Τελικά, στη διαμόρφωση του συνόλου συμμετείχαν σχεδόν 1000 εμπειρογνώμονες από περισσότερα από 500 επιστημονικά και εκπαιδευτικά ιδρύματα[4].

Η τελική έκδοση του benchmark, που περιλαμβάνει 2500 ερωτήσεις, παρουσιάστηκε στις αρχές του 2025. Μέρος των εργασιών παραμένει σε κλειστό αποθεματικό για έλεγχο και αποφυγή προσαρμογής των μοντέλων σε ένα σταθερό σύνολο[2].

Δομή και περιεχόμενο του benchmark

Το σύνολο ερωτήσεων HLE καλύπτει ένα ευρύτατο φάσμα ακαδημαϊκών επιστημονικών κλάδων. Οι εργασίες κατανέμονται θεματικά ως εξής:

  • Μαθηματικά: ~41%
  • Βιολογία και ιατρική: ~11%
  • Πληροφορική και ΤΝ: ~10%
  • Φυσική: ~9%
  • Ανθρωπιστικές και κοινωνικές επιστήμες: ~9%
  • Χημεία: ~7%
  • Μηχανολογία: ~4%
  • Λοιπές περιοχές: ~9%

Περίπου το 14% όλων των εργασιών είναι πολυτροπικές (multimodal), δηλαδή για την επίλυσή τους απαιτείται ανάλυση εικόνων (σχεδίων, διαγραμμάτων, επιγραφών)[2]. Η πλειονότητα (περίπου τα 3/4) των εργασιών είναι ανοικτές ερωτήσεις με σύντομη απάντηση, όπου το μοντέλο πρέπει να παράγει αυτόνομα μια ακριβή απάντηση (αριθμός, όρος, όνομα). Οι υπόλοιπες είναι ερωτήσεις πολλαπλής επιλογής.

Όλα τα προβλήματα του HLE έχουν κοινές ιδιότητες:

  • Εξαιρετικά υψηλή δυσκολία: Κάθε πρόβλημα απαιτεί επίπεδο γνώσεων και δεξιοτήτων συγκρίσιμο με αυτό ενός εξειδικευμένου επαγγελματία στον αντίστοιχο τομέα[5].
  • Επαληθεύσιμη απάντηση: Κάθε ερώτηση έχει μια συγκεκριμένη και αποδείξιμη σωστή απάντηση.
  • Ανθεκτικότητα στην αναζήτηση: Οι εργασίες έχουν επιλεγεί ώστε η απάντηση να μην μπορεί να βρεθεί με μια απλή αναζήτηση στο διαδίκτυο· για επιτυχία απαιτείται βαθιά κατανόηση του αντικειμένου και συλλογισμός[1].

Αποτελέσματα αξιολόγησης μοντέλων

Το Humanity's Last Exam επιβεβαίωσε αμέσως τη φήμη του ως εξαιρετικά δύσκολης δοκιμασίας: κανένα από τα σύγχρονα μοντέλα ΤΝ δεν κατόρθωσε να σημειώσει επίδοση κοντά στο ανθρώπινο επίπεδο. Τα κορυφαία γλωσσικά μοντέλα του 2025 επέδειξαν πολύ χαμηλή ακρίβεια.

  • Διάφορες εκδόσεις του GPT-4 της OpenAI και του Claude της Anthropic σημείωσαν επίδοση κάτω από 10%[4].
  • Το υψηλότερο αποτέλεσμα μεταξύ των τυπικών LLM επέτυχε το μοντέλο Gemini 2.5 Pro (Google DeepMind) με ακρίβεια περίπου 21,6%[4].
  • Ακόμα και τα καλύτερα μοντέλα απέτυχαν σε περίπου τα 4/5 των ερωτήσεων HLE, γεγονός που υπογραμμίζει την έκταση του χάσματος μεταξύ των τρεχουσών δυνατοτήτων της ΤΝ και του επιπέδου ανθρώπινου εμπειρογνώμονα[1].

Ιδιαίτερο ενδιαφέρον παρουσιάζει το αποτέλεσμα του πειραματικού agent ChatGPT Deep Research της OpenAI, στον οποίο επιτρεπόταν να εκτελεί αυτόματα αναζητήσεις στο διαδίκτυο. Μιμούμενος τη δουλειά ερευνητή, αυτός ο agent κατάφερε να λύσει σωστά το 26,6% των εργασιών — αποτέλεσμα περισσότερο από 2 φορές υψηλότερο από οποιοδήποτε μοντέλο χωρίς τέτοια εργαλεία, αλλά ακόμα πολύ μακριά από τη βάση επιτυχίας[6].

Σημασία και προοπτικές

Η εμφάνιση του HLE αποτέλεσε σημαντικό γεγονός στην κοινότητα ΤΝ, καθώς το benchmark κάλυψε μια επιτακτική ανάγκη για ένα νέο, πιο απαιτητικό μέτρο προόδου.

  • Κοινό σημείο αναφοράς. Το HLE προσφέρει στους ερευνητές και στους υπεύθυνους χάραξης πολιτικής ένα αντικειμενικό εργαλείο για την αξιολόγηση των δυνατοτήτων της ΤΝ, επιτρέποντας την παρακολούθηση της δυναμικής βελτίωσης και την κατανόηση του πόσο πλησιάζουν οι μηχανές στο ανθρώπινο επίπεδο.
  • Εργαλείο για την ενημέρωση πολιτικής. Η ύπαρξη μιας τέτοιας δοκιμής αναφοράς συμβάλλει σε πιο ουσιαστικές συζητήσεις σχετικά με τις κατευθύνσεις ανάπτυξης της ΤΝ, τους πιθανούς κινδύνους και τα αναγκαία ρυθμιστικά μέτρα.
  • Τελικό όριο ακαδημαϊκών δοκιμασιών. Η ίδια η ονομασία «Τελευταία Εξέταση» αντικατοπτρίζει την ιδέα ότι αυτό το σύνολο εργασιών μπορεί να αποτελέσει την τελευταία κλειστή εξέταση για την αξιολόγηση της ΤΝ. Η αποφασιστική επιτυχία στο HLE θα σημαίνει ότι, από την άποψη τυπικών γνώσεων και αυστηρά επαληθεύσιμων δεξιοτήτων συλλογισμού, η μηχανή έχει φτάσει το επίπεδο των κορυφαίων ανθρώπινων εμπειρογνωμόνων[4].

Είναι σημαντικό να σημειωθεί ότι ακόμα και η πλήρης επιτυχία στο HLE δεν θα σημαίνει επίτευξη γενικής τεχνητής νοημοσύνης (AGI), καθώς η δοκιμασία δεν ελέγχει τις δημιουργικές ικανότητες, την πρωτοβουλία ή την ικανότητα διατύπωσης νέων επιστημονικών ερωτημάτων[4].

Λαμβάνοντας υπόψη τη ραγδαία πρόοδο, οι ερευνητές εκτιμούν ότι τα μοντέλα μπορεί να ξεπεράσουν το 50% ακρίβειας στο HLE έως τα τέλη του 2025. Αυτό θα σημαίνει ότι οι μηχανές έχουν πλησιάσει αισθητά το ανθρώπινο επίπεδο σε μια στενή αλλά σημαντική μετρική ακαδημαϊκών γνώσεων[4].

Σύνδεσμοι

  • Επίσημος ιστότοπος Humanity's Last Exam
  • Επιστημονικό άρθρο που παρουσιάζει το benchmark

Βιβλιογραφία

  • Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
  • Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
  • Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
  • Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
  • Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
  • Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
  • Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
  • Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
  • Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
  • Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.

Παραπομπές

  1. 1.0 1.1 1.2 1.3 Fan, L. et al. «Humanity's Last Exam: A New Benchmark for AI Alignment». arXiv:2501.14249, 2025. [1]
  2. 2.0 2.1 2.2 2.3 «Humanity's Last Exam». In Wikipedia. [2]
  3. 3.0 3.1 Dastin, J. & Paul, K. «AI experts ready 'Humanity's Last Exam' to stump powerful tech». Reuters, 2024. [3]
  4. 4.0 4.1 4.2 4.3 4.4 4.5 «Humanity's Last Exam». Center for AI Safety. [4]
  5. «Could you pass 'Humanity's Last Exam'? Probably not, but neither can AI». TechRadar. [5]
  6. «OpenAI's deep research can complete 26% of 'Humanity's Last Exam': What is it and what does it mean?». Hindustan Times. [6]