WinoGrande Benchmark (BG)
WinoGrande — това е мащабен еталонен набор от данни, предназначен за оценка на способността на системите за изкуствен интелект да разсъждават въз основа на здравия разум. Той съдържа около 44 000 задачи, основани на формата Winograd Schema Challenge (WSC), но значително разширени и усложнени чрез „адверсариален" метод на филтриране за премахване на статистически подсказки[1].
Наборът от данни е разработен през 2019 година от група изследователи от Allen Institute for AI и Университета на Вашингтон. Всяка задача представлява изречение с пропуск, който трябва да бъде попълнен с един от два варианта, като правилният се избира въз основа на контекста и разбирането на ситуацията. WinoGrande се превърна в един от ключовите benchmark-ове в областта на обработката на естествен език (NLP)[2].
Предпоставки за създаването: остаряване на WSC
Оригиналният Winograd Schema Challenge (WSC), предложен през 2011 година, съдържаше само 273 задачи и дълго време се считаше за надежден тест за здрав разум. Задачите в него бяха конструирани така, че да изискват разбиране на света, а не просто съпоставяне на думи[3].
Обаче към 2018–2019 година, с появата на големи езикови модели с архитектура Transformer, като BERT, ситуацията се промени. Моделите се научиха да „разбиват" теста, постигайки точност от около 90% чрез използване на непреднамерени статистически закономерности (артефакти) в данните, а не чрез реално разбиране[4]. WSC престана да бъде надежден индикатор, което наложи създаването на нов, по-сложен и мащабен benchmark — WinoGrande.
Разработка и метод adversarial filtering
Създаването на WinoGrande премина през два основни етапа: масово генериране на задачи и последващото им филтриране.
Краудсорсинг
На първия етап с помощта на платформата Amazon Mechanical Turk беше събрана голяма база от повече от 47 000 изречения. Работниците в краудсорсинга създаваха двойки изречения по схемата на Winograd, което осигури езиково разнообразие и „шум", характерен за естествената реч, за разлика от задачи, написани от малка група експерти[1].
Алгоритъм AfLite
Ключовата иновация на WinoGrande беше алгоритъмът AfLite (Adversarial Filtering Lite). Този метод беше разработен за автоматично отсяване на задачи, които могат да бъдат решени с помощта на прости статистически подсказки, без да е необходим здрав разум. Алгоритъмът използваше прости модели за идентифициране и премахване на онези примери, при които един от отговорите беше твърде очевидно свързан с другите думи в изречението. Например, задачата „Лъвовете изядоха зебрите, защото те са хищници\" би била филтрирана, тъй като думата „хищници" статистически е тясно свързана с „лъвовете".
В резултат на филтрирането бяха отхвърлени около 14% от събраните данни. Финалната версия на набора от данни включва 43 972 задачи, което го прави значително по-надежден и по-сложен тест[1].
Резултати на моделите и напредък
При публикуването на WinoGrande най-добрите по онова време модели показаха резултати, значително отстъпващи на човешките.
- RoBERTa (подобрена версия на BERT) постигна точност от ~79%.
- Човек в средното решава задачите с точност от ~94%[1].
Тази разлика потвърди, че AfLite-филтрирането успешно е премахнало много „лесни" пътища за моделите. Обаче с развитието на LLM тази разлика започна да се стеснява.
- До 2022 година моделът ST-MoE-32B постигна точност от 96,1%, надминавайки човешкото ниво[5].
- GPT-3 показа резултат от около 88%[6].
- GPT-4, без специално fine-tuning, решава задачите с точност от ~87,5%[7].
Влияние и критика
WinoGrande се превърна в един от ключовите benchmark-ове за оценка на здравия разум и редовно се използва за тестване на нови модели. Резултатите му се публикуват в технически доклади на водещи ИИ компании и на платформи за сравнение на модели[8].
В същото време методологията за създаване на набора от данни стана предмет на научна дискусия. Някои изследователи отбелязват, че масовият краудсорсинг може да е довел до появата на неестествени или двусмислени фрази. Изказваха се и съмнения относно това дали автоматичната AfLite-филтрация е в състояние напълно да елиминира всички скрити артефакти[5]. Въпреки това WinoGrande стимулира не само напредъка в метриките, но и важна дискусия относно създаването на по-устойчиви и надеждни методи за оценка на ИИ.
Връзки
- Официален сайт на WinoGrande
- Dataset на платформата Hugging Face
Литература
- Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
- Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
- Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
- Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
- Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
- Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
- Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
- Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
- Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.
Бележки
- ↑ 1.0 1.1 1.2 1.3 Sakaguchi, K., Le Bras, R., Bhagavatula, C., Choi, Y. «WinoGrande: An Adversarial Winograd Schema Challenge at Scale». arXiv:1907.10641. [1]
- ↑ «allenai/winogrande». Hugging Face. [2]
- ↑ «Winograd schema challenge». In Wikipedia. [3]
- ↑ Kocijan, V. et al. «The defeat of the Winograd Schema Challenge». Artificial Intelligence. [4]
- ↑ 5.0 5.1 Lepore, J. «AI Has Been Surprising for Years». Carnegie Endowment for International Peace. [5]
- ↑ Brown, T. et al. «Language Models are Few-Shot Learners». arXiv:2005.14165. [6]
- ↑ OpenAI. «GPT-4 Technical Report». arXiv:2303.08774. [7]
- ↑ «Common Sense Reasoning On Winogrande». HyperAI. [8]