LLM benchmarks — Δείκτες αξιολόγησης LLM

From Systems analysis wiki
Jump to navigation Jump to search

Τα benchmarks μεγάλων γλωσσικών μοντέλων είναι τυποποιημένα σύνολα δοκιμών, σχεδιασμένα για τη μέτρηση, σύγκριση και αξιολόγηση της ποιότητας και των δυνατοτήτων των μεγάλων γλωσσικών μοντέλων (LLM)[1]. Συνήθως κάθε benchmark αποτελείται από ένα σταθερό σύνολο εργασιών (π.χ. ερωτήσεις, κείμενα ή οδηγίες), για τις οποίες είναι εκ των προτέρων γνωστές οι σωστές απαντήσεις ή τα κριτήρια αξιολόγησης. Αυτή η προσέγγιση εξασφαλίζει αντικειμενική σύγκριση διαφορετικών μοντέλων υπό ίδιες συνθήκες, επιτρέποντας την παρακολούθηση της προόδου στον τομέα και τον εντοπισμό των δυνατών και αδύνατων πλευρών των μοντέλων[2].

Η τακτική χρήση benchmarks διαδραματίζει καθοριστικό ρόλο στην ανάπτυξη των LLM, παρακινώντας τους προγραμματιστές να βελτιώνουν τα μοντέλα και εξασφαλίζοντας διαφάνεια και συγκρισιμότητα αποτελεσμάτων στην επιστημονική κοινότητα. Η εξέλιξη των benchmarks αντικατοπτρίζει την ανάπτυξη των ίδιων των LLM: από απλές εργασίες κατανόησης γλώσσας έως σύνθετες δοκιμές που ελέγχουν πολυβηματική συλλογιστική, κοινή λογική, ηθική και ασφάλεια[3].

Κύριες κατηγορίες και παραδείγματα

Τα benchmarks LLM καλύπτουν ποικίλες δεξιότητες και τομείς εφαρμογής. Παρακάτω παρουσιάζονται οι κύριες κατηγορίες και τα πιο γνωστά σύνολα εργασιών σε καθεμία από αυτές.

Γενική γλωσσική κατανόηση

Αυτή η κατηγορία αξιολογεί τις βασικές ικανότητες του μοντέλου για κατανόηση και ερμηνεία φυσικής γλώσσας.

  • GLUE (General Language Understanding Evaluation, 2019) — ένα από τα πρώτα σύνθετα benchmarks, που περιλαμβάνει μια σειρά από ποικίλες εργασίες: από τον προσδιορισμό τόνου έως την αξιολόγηση της λογικής συνοχής κειμένου. Τα αποτελέσματα όλων των εργασιών συναθροίζονται σε μια ενιαία βαθμολογία, γεγονός που επέτρεπε τη σύγκριση πρώιμων μοντέλων βάσει της συνολικής τους απόδοσης[4].
  • SuperGLUE (2019) — ο «ενισχυμένος» διάδοχος του GLUE, που αναπτύχθηκε ως απάντηση στο γεγονός ότι τα μοντέλα επέτυχαν γρήγορα σε αυτό επίδοση κοντά στο ανθρώπινο επίπεδο. Το SuperGLUE περιλαμβάνει πιο δύσκολες εργασίες που απαιτούν βαθιά κατανόηση πλαισίου και ικανότητα εξαγωγής συμπερασμάτων[5].
  • WinoGrande (2019) — διευρυμένη παραλλαγή του κουίζ Winograd Schema. Περιέχει 44 χιλιάδες εργασίες για την επίλυση ασαφών αντωνυμιών σε προτάσεις που απαιτούν κοινή λογική για την επιλογή της σωστής ερμηνείας[6].

Πολυεργασιακά και σύνθετα benchmarks

Αυτά τα σύνολα ελέγχουν τα μοντέλα σε ένα ευρύ φάσμα γνώσεων και δεξιοτήτων, ξεπερνώντας τα όρια των καθαρά γλωσσικών εργασιών.

  • MMLU (Massive Multitask Language Understanding, 2020) — συλλογή εργασιών σε μορφή κουίζ, που καλύπτει 57 θεματικούς τομείς: από σχολικά μαθήματα έως εξειδικευμένες επαγγελματικές γνώσεις (νομική, ιατρική). Το MMLU μετρά το εύρος της γενικής παιδείας του μοντέλου[7].
  • BIG-bench (Beyond the Imitation Game Benchmark, 2022) — το μεγαλύτερο συνεργατικό benchmark κατά τη στιγμή δημιουργίας του, που αναπτύχθηκε από περισσότερους από 400 συγγραφείς. Περιλαμβάνει πάνω από 200 εργασίες σε πολύ διαφορετικά θέματα, από γλωσσολογία έως φυσική, για να ελεγχθούν τα μοντέλα πέρα από την απλή αντιστοίχιση προτύπων και να εντοπιστούν τα όριά τους σε μη τυπικές καταστάσεις[8].

Κοινή λογική και αλήθεια

Αυτά τα benchmarks αξιολογούν την ικανότητα του μοντέλου να εξάγει λογικά συμπεράσματα για καθημερινές καταστάσεις και να αποφεύγει τη διάδοση ψευδών πληροφοριών.

  • HellaSwag (2019) — ελέγχει την κοινή λογική μέσω εργασίας επιλογής της πιο αληθοφανούς συνέχειας για μια περιγραφή κατάστασης. Το ιδιαίτερο χαρακτηριστικό του benchmark είναι η παρουσία «παγίδων»: οι λανθασμένες απαντήσεις δημιουργούνται αυτόματα και μοιάζουν πολύ αληθοφανείς, γεγονός που απαιτεί από το μοντέλο βαθιά κατανόηση του πλαισίου[9].
  • TruthfulQA (2021) — μετρά την τάση του μοντέλου να διαδίδει δημοφιλείς μύθους και παρανοήσεις. Περιέχει ερωτήσεις όπου η κοινή απάντηση στο διαδίκτυο είναι λανθασμένη (π.χ. «Προκαλούν τα εμβόλια αυτισμό;»). Από το μοντέλο απαιτείται να μην υποκύψει σε ψευδά στερεότυπα και να δώσει πραγματικά σωστή απάντηση[10].

Μαθηματικές εργασίες

  • GSM8K (2021) — περιλαμβάνει χιλιάδες προφορικές μαθηματικές εργασίες επιπέδου δημοτικού σχολείου. Κάθε εργασία απαιτεί την εκτέλεση μιας ακολουθίας 2–8 αριθμητικών βημάτων για την εξαγωγή της απάντησης, ελέγχοντας έτσι την ικανότητα του μοντέλου για πολυβηματική συλλογιστική[11].
  • MATH (2021) — πιο σύνθετο σύνολο, αποτελούμενο από εργασίες μαθηματικών ολυμπιάδων και διαγωνισμών. Περιλαμβάνει ενότητες άλγεβρας, γεωμετρίας και θεωρίας αριθμών, απαιτώντας από το μοντέλο την εφαρμογή μη τετριμμένων μεθόδων επίλυσης[12].

Δημιουργία κώδικα προγράμματος

  • HumanEval (2021) — τυποποιημένη δοκιμή για την αξιολόγηση της ικανότητας των LLM να γράφουν κώδικα. Περιέχει 164 εργασίες προγραμματισμού, όπου το μοντέλο πρέπει να δημιουργήσει σωστό κώδικα Python βάσει δεδομένης περιγραφής. Η ορθότητα αξιολογείται με τη βοήθεια unit tests[13].
  • SWE-bench (2023) — πιο ρεαλιστικό benchmark, που συλλέγει περιγραφές πραγματικών προβλημάτων (issues) από το GitHub. Το μοντέλο πρέπει να δημιουργήσει ένα patch (τμήμα κώδικα) που επιλύει το πρόβλημα. Αυτό απαιτεί κατανόηση μεγάλου όγκου κώδικα τρίτων και σύνθετη βηματική συλλογιστική[14].

Αξιολόγηση διαλογικών μοντέλων

  • Chatbot Arena (2024) — ανοιχτή διαδικτυακή πλατφόρμα, όπου δύο ανώνυμα μοντέλα συμμετέχουν σε παρεμπίπτοντα διάλογο με τον χρήστη. Μετά τον διάλογο, ο χρήστης ψηφίζει ποια απάντηση ήταν καλύτερη. Βάσει χιλιάδων τέτοιων «μονομαχιών» διαμορφώνεται μια κατάταξη Elo προτιμήσεων χρηστών, που αντικατοπτρίζει την ποιότητα των μοντέλων στη ζωντανή επικοινωνία[15].
  • MT-Bench (2023) — αυτοματοποιημένο benchmark για stress testing διαλογικών ικανοτήτων. Περιέχει 80 ζεύγη ερωτήσεων που προσομοιώνουν πολυβηματικό διάλογο. Οι απαντήσεις των μοντέλων αξιολογούνται από ένα άλλο, πιο ισχυρό LLM («LLM-as-a-judge», π.χ. GPT-4) βάσει προκαθορισμένης κλίμακας[16].

Ασφάλεια και αξιοπιστία

  • AgentHarm (2024) — benchmark που αξιολογεί την τάση των LLM-agents να εκτελούν επικίνδυνες οδηγίες. Περιλαμβάνει 110 σενάρια που αντιπροσωπεύουν κακόβουλες εργασίες (από απάτη έως εγκλήματα στον κυβερνοχώρο). Ένα καλό μοντέλο πρέπει να αρνείται την εκτέλεση τέτοιων αιτημάτων[17].
  • SafetyBench (2023) — ευρύ σύνολο από περισσότερες από 11 χιλιάδες ερωτήσεις, που ελέγχουν πόσο συνεπώς το μοντέλο αποφεύγει τη δημιουργία απαράδεκτου περιεχομένου και επιβλαβών συμβουλών, συμπεριλαμβανομένων των προκλητικών αιτημάτων[18].

Περιορισμοί και τρέχοντα προβλήματα

  • Μόλυνση δεδομένων: Η κύρια απειλή για την αξιοπιστία της αξιολόγησης — η διαρροή δεδομένων δοκιμών στα σύνολα εκπαίδευσης. Το μοντέλο μπορεί απλώς να αποστηθίσει τις απαντήσεις, γεγονός που τεχνητά ανεβάζει το αποτέλεσμά του[2].
  • Κορεσμός benchmarks: Καθώς τα μοντέλα αναπτύσσονται, η απόδοσή τους σε παλαιά benchmarks (όπως το GLUE) φτάνει σε οροφή, και η δοκιμή παύει να είναι χρήσιμη για τη διάκριση νέων, πιο ισχυρών μοντέλων. Αυτό απαιτεί συνεχή ανάπτυξη πιο σύνθετων προτύπων αξιολόγησης[2].
  • Χάσμα με την πραγματικότητα: Τα υψηλά αποτελέσματα σε benchmarks δεν εγγυώνται πάντα αξιόπιστη λειτουργία του μοντέλου σε πραγματικά, μη δομημένα σενάρια. Το πραγματικό περιβάλλον είναι συχνά πλουσιότερο και πιο απρόβλεπτο από οποιοδήποτε σταθερό σύνολο εργασιών[1].

Σύνδεσμοι

  • Open LLM Leaderboard — ανοιχτή κατάταξη μοντέλων από την κοινότητα Hugging Face
  • Chatbot Arena Leaderboard — κατάταξη μοντέλων συνομιλίας βάσει ανθρώπινων προτιμήσεων

Παραπομπές

  1. 1.0 1.1 «What Are LLM Benchmarks?». IBM. [1]
  2. 2.0 2.1 2.2 «20 LLM evaluation benchmarks and how they work». Evidently AI. [2]
  3. Wang, Alex; Singh, Amanpreet; Michael, Julian; et al. «GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding». arXiv. [4]
  4. Wang, Alex; Pruksachatkun, Yada; Nangia, Nikita; et al. «SuperGLUE: A Stickier Benchmark for General-Purpose Language Understanding Systems». arXiv. [5]
  5. Sakaguchi, Keisuke; Le Bras, Ronan; Bhagavatula, Chandra; Choi, Yejin. «WinoGrande: An Adversarial Winograd Schema Challenge at Scale». arXiv. [6]
  6. Hendrycks, Dan; Burns, Collin; Basart, Steven; et al. «Measuring Massive Multitask Language Understanding». arXiv. [7]
  7. Srivastava, Aarohi; et al. «Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models». arXiv. [8]
  8. Zellers, Rowan; Holtzman, Ari; Bisk, Yonatan; et al. «HellaSwag: Can a Machine Really Finish Your Sentence?». arXiv. [9]
  9. Lin, Stephanie; Hilton, Jacob; Evans, Owain. «TruthfulQA: Measuring How Models Mimic Human Falsehoods». arXiv. [10]
  10. Cobbe, Karl; Kosaraju, Vineet; Bavarian, Mohammad; et al. «Training Verifiers to Solve Math Word Problems». arXiv. [11]
  11. Hendrycks, Dan; Burns, Collin; Saund, Saurav; et al. «Measuring Mathematical Problem Solving With the MATH Dataset». arXiv. [12]
  12. Chen, Mark; Tworek, Jerry; Jun, Heewoo; et al. «Evaluating Large Language Models Trained on Code». arXiv. [13]
  13. Jimenez, Carlos E.; et al. «SWE-bench: Can Language Models Resolve Real-World GitHub Issues?». arXiv. [14]
  14. Chiang, Wei-Lin; et al. «Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preferences». lmsys.org. [15]
  15. Zheng, Lianmin; et al. «Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena». arXiv. [16]
  16. Andriushchenko, Maksym; et al. «AgentHarm: A Benchmark for Asessing Agentic AI Harm». arXiv. [17]
  17. Zhang, Zhexin; et al. «SafetyBench: A Comprehensive Benchmark for Evaluating the Safety of Large Language Models». arXiv. [18]