LLM evaluation — Αξιολόγηση LLM
Αξιολόγηση μεγάλων γλωσσικών μοντέλων (LLM) — είναι ένας κλάδος της τεχνητής νοημοσύνης που παρέχει τυποποιημένες μεθόδους για τη μέτρηση των δυνατοτήτων, των περιορισμών και των κινδύνων των γλωσσικών μοντέλων[1]. Καθώς τα LLM ενσωματώνονται σε κρίσιμους τομείς, όπως η υγειονομική περίθαλψη και τα χρηματοοικονομικά, η αντικειμενική αξιολόγησή τους καθίσταται αναγκαία για τη διασφάλιση της ασφάλειας, της αξιοπιστίας και της δικαιοσύνης[2].
Η αξιολόγηση LLM επιτελεί αρκετές θεμελιώδεις λειτουργίες:
- Μέτρηση δυνατοτήτων: Αντικειμενική σύγκριση της απόδοσης διαφόρων μοντέλων σε τυποποιημένες εργασίες.
- Παρακολούθηση προόδου: Καταγραφή επιτευγμάτων και εντοπισμός τομέων που απαιτούν περαιτέρω βελτίωση.
- Ελαχιστοποίηση κινδύνων: Εντοπισμός δυνητικά επιβλαβών αποτελεσμάτων, όπως προκατάληψη, ψευδαισθήσεις και ζητήματα ασφάλειας.
- Ενημέρωση προγραμματιστών και χρηστών: Παροχή διαφανών πληροφοριών για την επιλογή του πλέον κατάλληλου μοντέλου για μια συγκεκριμένη εφαρμογή.
Βασικές προσεγγίσεις και μεθοδολογίες
Η σύγχρονη αξιολόγηση LLM ξεκίνησε με την εμφάνιση ολοκληρωμένων benchmark, όπως το GLUE (General Language Understanding Evaluation), το οποίο καθόρισε το πρότυπο για την αξιολόγηση της γενικής κατανόησης γλώσσας[3]. Καθώς τα μοντέλα άρχισαν να υπερβαίνουν τα ανθρώπινα αποτελέσματα στο GLUE, αναπτύχθηκαν πιο σύνθετοι διάδοχοι, όπως το SuperGLUE[4].
Μια θεμελιώδης αλλαγή παραδείγματος συνέβη με την εισαγωγή πολυεργασιακών benchmark, όπως τα MMLU και BIG-bench, τα οποία δοκιμάζουν τα μοντέλα σε ένα ευρύ φάσμα γνώσεων και ικανοτήτων συλλογισμού, υπερβαίνοντας τα αμιγώς γλωσσολογικά καθήκοντα[1].
Βασικές μετρικές και benchmark
Αυτόματες μετρικές
- Αμηχανία (Perplexity): Θεμελιώδης μετρική που μετρά πόσο καλά ένα μοντέλο προβλέπει κείμενο. Χαμηλότερη αμηχανία υποδηλώνει μεγαλύτερη εμπιστοσύνη του μοντέλου στις προβλέψεις του.
- BLEU και ROUGE: Μετρικές βασισμένες σε n-gram που μετρούν τη λεξιλογική αντιστοίχιση μεταξύ παραγόμενου και κειμένου αναφοράς. Το BLEU εστιάζει στην ακρίβεια, το ROUGE στην ανάκληση[2].
- BERTScore: Σημασιολογική μετρική που χρησιμοποιεί embedding από το BERT για τον υπολογισμό σημασιολογικής ομοιότητας. Είναι ικανή να συλλαμβάνει συνωνυμία και παράφραση, καθιστώντας την πιο ακριβή από τις μετρικές βασισμένες σε n-gram[5].
Εξειδικευμένα benchmark
Για την αξιολόγηση συγκεκριμένων ικανοτήτων έχουν αναπτυχθεί στοχευμένα benchmark:
- Δημιουργία κώδικα: Το HumanEval αξιολογεί την ικανότητα του μοντέλου να παράγει σωστό κώδικα από κειμενική περιγραφή, ελέγχοντας τη λειτουργικότητά του με unit tests[6].
- Κοινή λογική: Το HellaSwag δοκιμάζει την κατανόηση του μοντέλου για τον φυσικό κόσμο και τις αιτιώδεις σχέσεις μέσω πρόβλεψης της πιθανότερης συνέχειας μιας καθημερινής κατάστασης[7].
- Ακαδημαϊκές γνώσεις: Το MMLU (Massive Multitask Language Understanding) καλύπτει 57 θέματα, από στοιχειώδη μαθηματικά έως δίκαιο και ιατρική, ελέγχοντας το εύρος της ερυδίτευσης του μοντέλου[8].
- Όρια δυνατοτήτων: Το BIG-bench (Beyond the Imitation Game) είναι ένα συνεργατικό έργο που συγκεντρώνει 204 εργασίες σχεδιασμένες για τον εντοπισμό αναδυόμενων ικανοτήτων — δεξιοτήτων που εμφανίζονται ξαφνικά όταν το μοντέλο φτάνει κρίσιμη κλίμακα[9].
Αξιολόγηση ασφάλειας και ηθικών πτυχών
- Προκατάληψη: Για την αξιολόγηση κοινωνικών και δημογραφικών προκαταλήψεων χρησιμοποιούνται dataset όπως τα BBQ (Bias Benchmark for Question Answering) και BOLD (Bias in Open-ended Language generation Dataset).
- Τοξικότητα: Benchmark όπως το RealToxicityPrompts παρέχουν ερωτήματα που προκαλούν τη δημιουργία τοξικού περιεχομένου, για την αξιολόγηση της ανθεκτικότητας του μοντέλου.
- Ευρωστία: Αξιολογείται με τη χρήση αντίπαλων επιθέσεων. Το framework PromptRobust παρέχει ένα ολοκληρωμένο σύνολο ερωτημάτων για τον έλεγχο της ανθεκτικότητας του μοντέλου σε επίπεδο χαρακτήρων, λέξεων και προτάσεων.
Σύγχρονα πρότυπα και framework
- HELM (Holistic Evaluation of Language Models): Πρωτοβουλία του Πανεπιστημίου Stanford που προτείνει μια «ολιστική» μεθοδολογία. Το HELM αξιολογεί τα μοντέλα σε πολλαπλές διαστάσεις: ακρίβεια, ευρωστία, δικαιοσύνη, προκατάληψη, τοξικότητα και αποτελεσματικότητα[10].
- ISO/IEC 42001:2023: Το πρώτο διεθνές πρότυπο για συστήματα διαχείρισης ΤΝ, που θεσπίζει απαιτήσεις για τη διακυβέρνηση της ΤΝ καθ' όλον τον κύκλο ζωής της.
- Κανονισμός ΕΕ 2024/1689 (EU AI Act): Η πρώτη ολοκληρωμένη νομοθεσία για την ΤΝ, που απαιτεί τυποποιημένες αξιολογήσεις για μοντέλα γενικού σκοπού με συστημικούς κινδύνους.
- NIST AI Risk Management Framework 1.0: Εθελοντικό framework για την ανάπτυξη και την ανάπτυξη αξιόπιστης ΤΝ, που εκπονήθηκε από το Εθνικό Ινστιτούτο Προτύπων και Τεχνολογίας των ΗΠΑ.
Προβλήματα και περιορισμοί των υφιστάμενων μεθόδων
- Κορεσμός benchmark: Πολλά μοντέλα επιτυγχάνουν σχεδόν τέλειες επιδόσεις σε δημοφιλή benchmark, γεγονός που οδηγεί στο φαινόμενο «κυνήγι benchmark», κατά το οποίο τα μοντέλα βελτιστοποιούνται για συγκεκριμένες δοκιμές και όχι για γενικές ικανότητες.
- Μόλυνση δεδομένων: Κρίσιμο πρόβλημα κατά το οποίο τα δεδομένα δοκιμής ενός benchmark εισχωρούν τυχαία στο σύνολο εκπαίδευσης, οδηγώντας σε υπερεκτιμημένα και αναξιόπιστα αποτελέσματα αξιολόγησης.
- Χαμηλή συσχέτιση με ανθρώπινες κρίσεις: Οι αυτόματες μετρικές, όπως το BLEU και το ROUGE, συχνά συσχετίζονται ελάχιστα με την ανθρώπινη αξιολόγηση ποιότητας, ιδίως σε δημιουργικές και ανοιχτού τύπου εργασίες.
Τρέχουσες έρευνες και τάσεις
- Παράδειγμα LLM-as-a-Judge: Χρήση ισχυρών LLM (π.χ. GPT-4) ως «κριτών» για την αξιολόγηση των απαντήσεων άλλων μοντέλων. Αυτή η προσέγγιση παρέχει μια επεκτάσιμη εναλλακτική στη δαπανηρή ανθρώπινη αξιολόγηση.
- Δυναμική και προσαρμοστική αξιολόγηση: Πλατφόρμες όπως το LMArena παρουσιάζουν ένα σύστημα crowdsourcing με βαθμολογίες Elo για πραγματική αξιολόγηση μοντέλων σε ζωντανή αλληλεπίδραση με χρήστες.
- Υβριδικές προσεγγίσεις: Συνδυασμός αυτοματοποιημένων μετρικών με ανθρώπινη κρίση και αξιολόγηση LLM για την απόκτηση πιο πλήρους και αξιόπιστης εικόνας της απόδοσης του μοντέλου.
Το τοπίο της αξιολόγησης LLM συνεχίζει να εξελίσσεται, κινούμενο προς τη δημιουργία πολυδιάστατων, τυποποιημένων και αναπαράξιμων framework που λαμβάνουν υπόψη όχι μόνο την ακρίβεια, αλλά και τις κοινωνικές και ηθικές πτυχές της εφαρμογής των τεχνολογιών ΤΝ[1].
Αναφορές
- Stanford HELM — επίσημος ιστότοπος του έργου Holistic Evaluation of Language Models.
- Chatbot Arena — πλατφόρμα για συγκριτική αξιολόγηση chatbot βάσει ανθρώπινων προτιμήσεων.
Βιβλιογραφία
- Wang, A. et al. (2018). GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding. arXiv:1804.07461.
- Zhang, T. et al. (2019). BERTScore: Evaluating Text Generation with BERT. arXiv:1904.09675.
- Wang, A. et al. (2019). SuperGLUE: A Stickier Benchmark for General-Purpose Language Understanding Systems. arXiv:1905.00537.
- Zellers, R. et al. (2019). HellaSwag: Can a Machine Really Finish Your Sentence?. arXiv:1905.07830.
- Hendrycks, D. et al. (2020). Measuring Massive Multitask Language Understanding. arXiv:2009.03300.
- Gehman, S. et al. (2020). RealToxicityPrompts: Evaluating Neural Toxic Degeneration in Language Models. arXiv:2009.11462.
- Chen, M. et al. (2021). Evaluating Large Language Models Trained on Code. arXiv:2107.03374.
- Parrish, A. et al. (2021). BBQ: A Hand-Built Bias Benchmark for Question Answering. arXiv:2110.08193.
- Dhamala, J. et al. (2021). BOLD: Dataset and Metrics for Measuring Biases in Open-Ended Language Generation. arXiv:2101.11718.
- Srivastava, A. et al. (2022). Beyond the Imitation Game: Quantifying and Extrapolating the Capabilities of Language Models. arXiv:2206.04615.
- Bommasani, R. et al. (2022). Holistic Evaluation of Language Models. arXiv:2211.09110.
- Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
- Zhuang, Y. et al. (2023). Through the Lens of Core Competency: Survey on Evaluation of Large Language Models. ACL Anthology:2023.ccl-2.8.
- Zhu, K. et al. (2023). PromptRobust: Towards Evaluating the Robustness of Large Language Models on Adversarial Prompts. arXiv:2306.04528.
Σημειώσεις
- ↑ 1.0 1.1 1.2 Chang, Y., et al. (2023). «A Survey on Evaluation of Large Language Models». arXiv. [1]
- ↑ 2.0 2.1 Zhuang, Y., et al. (2023). «Through the Lens of Core Competency: Survey on Evaluation of Large Language Models». ACL Anthology. [2]
- ↑ Wang, A., et al. (2018). «GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding». arXiv.[3]
- ↑ Kumar, Pradosh. «Understanding Benchmarking in NLP: GLUE, SuperGLUE, HELM, MMLU, and BIG-Bench». Medium.
- ↑ Zhang, T., et al. (2019). «BERTScore: Evaluating Text Generation with BERT». arXiv.
- ↑ Chen, M., et al. (2021). «Evaluating Large Language Models Trained on Code». arXiv.
- ↑ Zellers, R., et al. (2019). «HellaSwag: Can a Machine Really Finish Your Sentence?». arXiv.
- ↑ Hendrycks, D., et al. (2020). «Measuring Massive Multitask Language Understanding». arXiv.
- ↑ Srivastava, A., et al. (2022). «Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models». arXiv.
- ↑ Bommasani, R., et al. (2022). «Holistic Evaluation of Language Models». arXiv. [4]