GLUE Benchmark — GLUE基准
GLUE(General Language Understanding Evaluation,即“通用语言理解评估”的缩写)是一个多任务基准,用于评估自然语言理解(NLU)模型的质量。该基准由纽约大学、华盛顿大学和DeepMind的一组研究人员(包括Alex Wang和Samuel Bowman)于2018年提出,并在研究界得到广泛应用[1]。
GLUE的主要目标是提供一个统一、中立且具有挑战性的测试套件,用于在超出单一特定领域的各种任务上对NLU模型的能力进行比较评估。该基准包括一个带有排行榜(leaderboard)的在线平台,可确保对模型进行客观比较,并防止针对测试数据进行过拟合,因为部分测试的真实标签并未公开,只能通过评估服务器获取。其理念是,要取得高分,模型必须能够提取通用的语言表示,并有效地在不同类型的任务之间迁移知识。
基准的构成与任务
GLUE基准整合了九项不同的语言理解任务,这些任务基于现有的、对AI而言具有挑战性的数据集。所有任务都被设计为对单个句子或句子对的分类或回归问题[1]。
- CoLA (Corpus of Linguistic Acceptability) — 判断一个句子在语法上是否可接受的任务。评价指标是马修斯相关系数。
- SST-2 (Stanford Sentiment Treebank) — 判断电影评论情感(正面/负面)的任务。评价指标是准确率(accuracy)。
- MRPC (Microsoft Research Paraphrase Corpus) — 判断来自新闻来源的一对句子是否为释义的任务。评价指标是准确率和F1分数。
- QQP (Quora Question Pairs) — 判断来自Quora社区的问题对是否重复的任务。评价指标是准确率和F1分数。
- STS-B (Semantic Textual Similarity Benchmark) — 对两个句子进行语义相似度匹配的任务。模型需要预测其语义相似度得分(1到5分)。评价指标是皮尔逊和斯皮尔曼相关系数。
- MNLI (Multi-Genre Natural Language Inference) — 识别来自不同类型来源的句子对之间的文本蕴含关系(蕴含、矛盾、中立)的任务。在匹配(matched)和不匹配(mismatched)的子集上分别进行评估。
- QNLI (Question Natural Language Inference) — 由SQuAD数据集转换而来的任务。需要判断一个段落中的句子是否包含给定问题的答案。
- RTE (Recognizing Textual Entailment) — 一个综合了多个小型数据集的文本蕴含任务。任务是对句子之间的关系进行二元分类。
- WNLI (Winograd NLI) — 维诺格拉德模式挑战的修改版,调整为NLI格式。这是一个指代消解任务:系统需要判断一个句子中含糊不清的代词指向两个实体中的哪一个。
评估方法
为了在GLUE上进行评估,研究人员将其模型的预测结果提交到一个专用服务器,随后自动计算出每个任务的指标和总分。
- GLUE分数 — 最终指标,计算为所有九个核心任务得分的平均值。
- 排行榜 — 公开的表格,反映了当前的技术水平,并展示了哪些模型在NLU任务上表现更佳。使用隐藏的测试集可确保公平比较。
- 诊断集 — 一个由专家手动标注的包含1100个样本的特殊数据集,用于进行细致的语言学分析。它不影响排名,而是作为一种定性分析工具,用于检验模型能够识别哪些语言现象(如词汇语义、逻辑、常识),以及在哪些方面存在困难[1]。
结果与行业影响
在2018年GLUE刚推出时,当时最先进的模型(例如带有ELMo的BiLSTM)的综合得分约为70分(0-100分制),远低于人类水平(约87分)[2]。
GLUE及其公开排行榜的出现,极大地推动了NLP领域迁移学习的快速发展。
- 到2019年5月,在不到一年的时间里,基于Transformer的新一代模型(主要是BERT)将state-of-the-art的水平提升至83.9分。
- 2019年下半年,GLUE基准实际上被“攻克”:顶级系统已非常接近人类水平,在某些任务上甚至超越了人类[3]。
GLUE作为语言理解模型发展过程中的统一参考基点,发挥了巨大作用。借助它,研究人员能够在复杂的任务集上直接比较不同的架构,识别各种方法的优缺点,并通过公开排行榜快速分享研究成果。
SuperGLUE: Subsequent Development - SuperGLUE:后续发展
GLUE的迅速成功促使原作者团队在一年后与Facebook AI的同事合作,推出了一个名为SuperGLUE的更难的新基准[4]。
SuperGLUE于2019年底发布,被称为“更具粘性”(stickier)的测试集,旨在再次拉开顶尖模型与人类能力之间的差距。它包含了八项需要更深层次语言理解的任务,并改进了工具和参赛规则。尽管GLUE仍被用作基础测试,但竞争性研究的焦点已转移到SuperGLUE及其他更专业的基准上。
外部链接
参考文献
- Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
- Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
- Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
- Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
- Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
- Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
- Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
- Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
- Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.
注释
- ↑ 1.0 1.1 1.2 Wang, A. et al. «GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding». arXiv:1804.07461, 2019. [1]
- ↑ Bowman, S. R. et al. «Human vs. Muppet: A Conservative Estimate of Human Performance on the GLUE Benchmark». arXiv:1905.10425, 2019. [2]
- ↑ Wang, A. et al. «SuperGLUE: A Stickier Benchmark for General-Purpose Language Understanding Systems». NeurIPS 2019. [3]
- ↑ «AI models from Microsoft and Google already surpass human performance on the SuperGLUE language benchmark». VentureBeat. [4]