Đánh giá LLM
Đánh giá các mô hình ngôn ngữ lớn (LLM) — là một lĩnh vực trong trí tuệ nhân tạo cung cấp các phương pháp chuẩn hóa để đo lường khả năng, hạn chế và rủi ro của các mô hình ngôn ngữ[1]. Khi LLM được tích hợp vào các lĩnh vực quan trọng như y tế và tài chính, việc đánh giá khách quan chúng trở nên cần thiết để đảm bảo tính an toàn, độ tin cậy và sự công bằng[2].
Đánh giá LLM thực hiện một số chức năng cơ bản:
- Đo lường khả năng: So sánh khách quan hiệu suất của các mô hình khác nhau trên các tác vụ chuẩn hóa.
- Theo dõi tiến độ: Ghi nhận các thành tựu và xác định các lĩnh vực cần cải thiện thêm.
- Giảm thiểu rủi ro: Phát hiện các kết quả có thể gây hại, chẳng hạn như định kiến, ảo giác và các vấn đề về an toàn.
- Cung cấp thông tin cho nhà phát triển và người dùng: Đưa ra thông tin minh bạch để lựa chọn mô hình phù hợp nhất cho một ứng dụng cụ thể.
Các phương pháp tiếp cận và phương pháp luận chính
Việc đánh giá LLM hiện đại bắt đầu với sự xuất hiện của các benchmark toàn diện như GLUE (General Language Understanding Evaluation), vốn đã thiết lập tiêu chuẩn để đánh giá khả năng hiểu ngôn ngữ tổng quát[3]. Khi các mô hình bắt đầu vượt qua kết quả của con người trên GLUE, các phiên bản kế nhiệm phức tạp hơn đã được phát triển, chẳng hạn như SuperGLUE[4].
Một bước ngoặt cơ bản đã xảy ra với sự ra đời của các benchmark đa nhiệm vụ như MMLU và BIG-bench, vốn kiểm tra các mô hình trên một phổ rộng các kiến thức và khả năng suy luận, vượt ra ngoài các tác vụ thuần túy ngôn ngữ học[1].
Các metric và benchmark chính
Metric tự động
- Perplexity (Độ phức tạp): Một metric cơ bản đo lường mức độ mô hình dự đoán văn bản tốt như thế nào. Perplexity thấp hơn cho thấy mô hình có độ tự tin cao hơn trong các dự đoán của mình.
- BLEU và ROUGE: Các metric dựa trên n-gram, đo lường sự trùng khớp từ vựng giữa văn bản được tạo ra và văn bản tham chiếu. BLEU tập trung vào độ chính xác, ROUGE tập trung vào độ thu hồi[2].
- BERTScore: Một metric ngữ nghĩa sử dụng embedding từ BERT để tính toán độ tương đồng ngữ nghĩa. Nó có khả năng nắm bắt hiện tượng đồng nghĩa và diễn giải lại, khiến nó chính xác hơn các metric dựa trên n-gram[5].
Benchmark chuyên biệt
Để đánh giá các khả năng cụ thể, các benchmark mục tiêu đã được phát triển:
- Tạo mã: HumanEval đánh giá khả năng của mô hình trong việc tạo ra mã chương trình chính xác dựa trên mô tả văn bản, kiểm tra tính năng của nó bằng các unit test[6].
- Lẽ thường: HellaSwag kiểm tra khả năng hiểu của mô hình về thế giới vật lý và các mối quan hệ nhân quả thông qua việc dự đoán phần kết thúc có khả năng nhất của một tình huống thường ngày[7].
- Kiến thức học thuật: MMLU (Massive Multitask Language Understanding) bao gồm 57 môn học, từ toán học cơ bản đến luật và y học, kiểm tra chiều rộng kiến thức của mô hình[8].
- Giới hạn khả năng: BIG-bench (Beyond the Imitation Game) — là một dự án cộng tác tập hợp 204 tác vụ được thiết kế để phát hiện các khả năng nổi lên — những kỹ năng xuất hiện đột ngột khi mô hình đạt đến quy mô tới hạn[9].
Đánh giá an toàn và các khía cạnh đạo đức
- Định kiến: Để đánh giá các thành kiến xã hội và nhân khẩu học, các dataset như BBQ (Bias Benchmark for Question Answering) và BOLD (Bias in Open-ended Language generation Dataset) được sử dụng.
- Độc hại: Các benchmark như RealToxicityPrompts cung cấp các câu lệnh kích thích việc tạo ra nội dung độc hại để đánh giá khả năng chống chịu của mô hình.
- Tính bền vững: Được đánh giá bằng các cuộc tấn công đối nghịch. Framework PromptRobust cung cấp một bộ câu lệnh toàn diện để kiểm tra khả năng chống chịu của mô hình ở cấp độ ký tự, từ và câu.
Các tiêu chuẩn và framework hiện đại
- HELM (Holistic Evaluation of Language Models): Sáng kiến của Đại học Stanford, đề xuất một phương pháp luận "toàn diện". HELM đánh giá các mô hình theo nhiều chiều: độ chính xác, tính bền vững, sự công bằng, định kiến, độ độc hại và hiệu quả[10].
- ISO/IEC 42001:2023: Tiêu chuẩn quốc tế đầu tiên cho các hệ thống quản lý AI, thiết lập các yêu cầu quản trị AI trong suốt vòng đời của nó.
- Quy định EU 2024/1689 (EU AI Act): Quy định AI toàn diện đầu tiên, yêu cầu các đánh giá chuẩn hóa cho các mô hình mục đích chung có rủi ro hệ thống.
- NIST AI Risk Management Framework 1.0: Một framework tự nguyện để phát triển và triển khai AI đáng tin cậy, được xây dựng bởi Viện Tiêu chuẩn và Công nghệ Quốc gia Hoa Kỳ.
Các vấn đề và hạn chế của các phương pháp hiện tại
- Bão hòa benchmark: Nhiều mô hình đạt được điểm số gần như hoàn hảo trên các benchmark phổ biến, dẫn đến hiện tượng "đuổi theo benchmark", khi các mô hình được tối ưu hóa cho các bài kiểm tra cụ thể thay vì các khả năng tổng quát.
- Ô nhiễm dữ liệu: Một vấn đề nghiêm trọng, khi dữ liệu kiểm tra của benchmark vô tình lọt vào tập huấn luyện, dẫn đến kết quả đánh giá bị thổi phồng và không trung thực.
- Tương quan thấp với đánh giá của con người: Các metric tự động như BLEU và ROUGE thường tương quan kém với đánh giá chất lượng của con người, đặc biệt trong các tác vụ sáng tạo và mở.
Các nghiên cứu và xu hướng hiện tại
- Mô hình LLM-as-a-Judge: Sử dụng các LLM mạnh mẽ (ví dụ: GPT-4) như những "thẩm phán" để đánh giá các câu trả lời của các mô hình khác. Cách tiếp cận này cung cấp một giải pháp thay thế có thể mở rộng so với việc đánh giá bằng con người tốn kém.
- Đánh giá động và thích ứng: Các nền tảng như LMArena giới thiệu hệ thống đám đông với xếp hạng Elo để đánh giá mô hình thực tế trong tương tác trực tiếp với người dùng.
- Các phương pháp lai: Kết hợp các metric tự động với đánh giá của con người và đánh giá LLM để có được bức tranh toàn diện và đáng tin cậy hơn về hiệu suất của mô hình.
Bức tranh đánh giá LLM tiếp tục phát triển, hướng tới việc tạo ra các framework đa chiều, chuẩn hóa và có thể tái tạo, không chỉ tính đến độ chính xác mà còn cả các khía cạnh xã hội và đạo đức trong việc áp dụng công nghệ AI[1].
Tham khảo
- Stanford HELM — trang web chính thức của dự án Holistic Evaluation of Language Models.
- Chatbot Arena — nền tảng đánh giá so sánh các chatbot dựa trên sở thích của con người.
Tài liệu
- Wang, A. et al. (2018). GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding. arXiv:1804.07461.
- Zhang, T. et al. (2019). BERTScore: Evaluating Text Generation with BERT. arXiv:1904.09675.
- Wang, A. et al. (2019). SuperGLUE: A Stickier Benchmark for General-Purpose Language Understanding Systems. arXiv:1905.00537.
- Zellers, R. et al. (2019). HellaSwag: Can a Machine Really Finish Your Sentence?. arXiv:1905.07830.
- Hendrycks, D. et al. (2020). Measuring Massive Multitask Language Understanding. arXiv:2009.03300.
- Gehman, S. et al. (2020). RealToxicityPrompts: Evaluating Neural Toxic Degeneration in Language Models. arXiv:2009.11462.
- Chen, M. et al. (2021). Evaluating Large Language Models Trained on Code. arXiv:2107.03374.
- Parrish, A. et al. (2021). BBQ: A Hand-Built Bias Benchmark for Question Answering. arXiv:2110.08193.
- Dhamala, J. et al. (2021). BOLD: Dataset and Metrics for Measuring Biases in Open-Ended Language Generation. arXiv:2101.11718.
- Srivastava, A. et al. (2022). Beyond the Imitation Game: Quantifying and Extrapolating the Capabilities of Language Models. arXiv:2206.04615.
- Bommasani, R. et al. (2022). Holistic Evaluation of Language Models. arXiv:2211.09110.
- Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
- Zhuang, Y. et al. (2023). Through the Lens of Core Competency: Survey on Evaluation of Large Language Models. ACL Anthology:2023.ccl-2.8.
- Zhu, K. et al. (2023). PromptRobust: Towards Evaluating the Robustness of Large Language Models on Adversarial Prompts. arXiv:2306.04528.
Ghi chú
- ↑ 1.0 1.1 1.2 Chang, Y., et al. (2023). «A Survey on Evaluation of Large Language Models». arXiv. [1]
- ↑ 2.0 2.1 Zhuang, Y., et al. (2023). «Through the Lens of Core Competency: Survey on Evaluation of Large Language Models». ACL Anthology. [2]
- ↑ Wang, A., et al. (2018). «GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding». arXiv.[3]
- ↑ Kumar, Pradosh. «Understanding Benchmarking in NLP: GLUE, SuperGLUE, HELM, MMLU, and BIG-Bench». Medium.
- ↑ Zhang, T., et al. (2019). «BERTScore: Evaluating Text Generation with BERT». arXiv.
- ↑ Chen, M., et al. (2021). «Evaluating Large Language Models Trained on Code». arXiv.
- ↑ Zellers, R., et al. (2019). «HellaSwag: Can a Machine Really Finish Your Sentence?». arXiv.
- ↑ Hendrycks, D., et al. (2020). «Measuring Massive Multitask Language Understanding». arXiv.
- ↑ Srivastava, A., et al. (2022). «Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models». arXiv.
- ↑ Bommasani, R., et al. (2022). «Holistic Evaluation of Language Models». arXiv. [4]