LLM benchmarks — LLM बेंचमार्क
बड़े भाषा मॉडलों के बेंचमार्क — ये मानकीकृत परीक्षण सेट हैं, जो बड़े भाषा मॉडलों (LLM) की गुणवत्ता और क्षमताओं को मापने, तुलना करने और मूल्यांकन करने के लिए बनाए गए हैं[1]। आमतौर पर प्रत्येक benchmark एक निश्चित कार्य-समूह (जैसे प्रश्न, पाठ या निर्देश) होता है, जिसके लिए सही उत्तर या मूल्यांकन मानदंड पहले से ज्ञात होते हैं। यह दृष्टिकोण विभिन्न मॉडलों की एकसमान परिस्थितियों में वस्तुनिष्ठ तुलना सुनिश्चित करता है, जिससे क्षेत्र में प्रगति को ट्रैक किया जा सकता है और मॉडलों की शक्तियों एवं कमज़ोरियों की पहचान की जा सकती है[2]।
बेंचमार्क का नियमित उपयोग LLM के विकास में महत्वपूर्ण भूमिका निभाता है — यह डेवलपर्स को मॉडल सुधारने के लिए प्रेरित करता है और वैज्ञानिक समुदाय में परिणामों की पारदर्शिता और तुलनीयता सुनिश्चित करता है। बेंचमार्क का विकास LLM के विकास को ही दर्शाता है: भाषा-समझ के सरल कार्यों से लेकर बहु-चरणीय तर्क, सामान्य ज्ञान, नैतिकता और सुरक्षा को परखने वाले जटिल परीक्षणों तक[3]।
मुख्य श्रेणियाँ और उदाहरण
LLM बेंचमार्क विविध कौशलों और उपयोग के क्षेत्रों को समाहित करते हैं। नीचे मुख्य श्रेणियाँ और उनमें सबसे प्रसिद्ध कार्य-समूहों पर चर्चा की गई है।
सामान्य भाषा समझ
यह श्रेणी प्राकृतिक भाषा को समझने और व्याख्या करने की मॉडल की बुनियादी क्षमताओं का मूल्यांकन करती है।
- GLUE (General Language Understanding Evaluation, 2019) — पहले व्यापक बेंचमार्कों में से एक, जिसमें भावना-निर्धारण से लेकर पाठ की तार्किक संगति के मूल्यांकन तक विविध कार्य शामिल हैं। सभी कार्यों के परिणामों को एक समग्र अंक में एकत्रित किया जाता है, जिससे प्रारंभिक मॉडलों की कुल दक्षता की तुलना संभव हुई[4]।
- SuperGLUE (2019) — GLUE का "उन्नत" उत्तराधिकारी, जिसे इसलिए विकसित किया गया क्योंकि मॉडल जल्दी ही GLUE पर मानवीय स्तर के निकट पहुँच गए। SuperGLUE में अधिक कठिन कार्य शामिल हैं, जिनमें गहरी संदर्भ-समझ और निष्कर्ष निकालने की क्षमता आवश्यक है[5]।
- WinoGrande (2019) — Winograd Schema प्रश्नोत्तरी का विस्तारित संस्करण। इसमें वाक्यों में अस्पष्ट सर्वनामों के समाधान के लिए 44 हजार कार्य हैं, जिनमें सही व्याख्या चुनने के लिए सामान्य बुद्धि आवश्यक है[6]।
बहु-कार्य और जटिल बेंचमार्क
ये सेट मॉडलों को ज्ञान और कौशल की विस्तृत श्रृंखला पर परखते हैं, जो विशुद्ध भाषाई कार्यों से परे जाते हैं।
- MMLU (Massive Multitask Language Understanding, 2020) — प्रश्नोत्तरी रूप में कार्यों का संग्रह, जो 57 विषय क्षेत्रों को समाहित करता है: विद्यालयी विषयों से लेकर अत्यधिक विशिष्ट व्यावसायिक ज्ञान (कानून, चिकित्सा) तक। MMLU मॉडल की ज्ञान-विस्तार को मापता है[7]।
- BIG-bench (Beyond the Imitation Game Benchmark, 2022) — निर्माण के समय सबसे बड़ा सहयोगी benchmark, जिसे 400 से अधिक लेखकों ने विकसित किया। इसमें भाषाविज्ञान से लेकर भौतिकी तक विविध विषयों पर 200 से अधिक कार्य शामिल हैं, ताकि मॉडलों को सांचेबद्ध उत्तरों से परे परखा जा सके और असामान्य परिस्थितियों में उनकी सीमाओं की पहचान की जा सके[8]।
सामान्य बुद्धि और सत्यता
ये बेंचमार्क मॉडल की रोज़मर्रा की परिस्थितियों के बारे में तार्किक निष्कर्ष निकालने और झूठी जानकारी फैलाने से बचने की क्षमता का मूल्यांकन करते हैं।
- HellaSwag (2019) — किसी परिस्थिति के विवरण के लिए सबसे प्रशंसनीय समापन चुनने के कार्य के माध्यम से सामान्य बुद्धि की जाँच करता है। इस benchmark की विशेषता "जाल" का होना है: गलत उत्तर स्वचालित रूप से उत्पन्न किए जाते हैं और बहुत प्रशंसनीय लगते हैं, जिससे मॉडल को संदर्भ की गहरी समझ की आवश्यकता होती है[9]।
- TruthfulQA (2021) — प्रचलित मिथकों और भ्रांतियों को फैलाने की मॉडल की प्रवृत्ति को मापता है। इसमें ऐसे प्रश्न हैं जिनका इंटरनेट पर प्रचलित उत्तर गलत है (उदाहरण के लिए, "क्या टीके ऑटिज्म का कारण बनते हैं?")। मॉडल से अपेक्षा की जाती है कि वह झूठे रूढ़िवादी विचारों के प्रभाव में न आए और तथ्यात्मक रूप से सही उत्तर दे[10]।
गणितीय समस्याएँ
- GSM8K (2021) — प्राथमिक विद्यालय स्तर की गणित की हजारों पाठ्य-समस्याएँ शामिल हैं। प्रत्येक समस्या को हल करने के लिए 2–8 अंकगणितीय चरणों की एक श्रृंखला की आवश्यकता होती है, जो मॉडल की बहु-चरणीय तर्क क्षमता की जाँच करती है[11]।
- MATH (2021) — एक अधिक जटिल सेट, जिसमें गणितीय ओलंपियाड और प्रतियोगिताओं की समस्याएँ शामिल हैं। इसमें बीजगणित, ज्यामिति और संख्या सिद्धांत के खंड हैं, जिनके लिए मॉडल को गैर-तुच्छ समाधान विधियों में दक्षता आवश्यक है[12]।
प्रोग्राम कोड निर्माण
- HumanEval (2021) — LLM की कोड लिखने की क्षमता के मूल्यांकन के लिए मानक परीक्षण। इसमें प्रोग्रामिंग की 164 समस्याएँ हैं, जहाँ मॉडल को दिए गए विवरण के अनुसार Python में सही कोड उत्पन्न करना होता है। शुद्धता का मूल्यांकन unit tests के माध्यम से किया जाता है[13]।
- SWE-bench (2023) — एक अधिक यथार्थवादी benchmark, जो GitHub से वास्तविक समस्याओं (issues) का विवरण एकत्रित करता है। मॉडल को समस्या को दूर करने वाला एक patch (कोड का टुकड़ा) उत्पन्न करना होता है। इसके लिए दूसरों के बड़ी मात्रा के कोड की समझ और जटिल चरण-दर-चरण तर्क की आवश्यकता होती है[14]।
संवाद मॉडलों का मूल्यांकन
- Chatbot Arena (2024) — एक खुला ऑनलाइन प्लेटफ़ॉर्म, जहाँ दो अनाम मॉडल उपयोगकर्ता के साथ युगल संवाद में भाग लेते हैं। संवाद के बाद उपयोगकर्ता मतदान करता है कि किसका उत्तर बेहतर था। हजारों ऐसी "द्वंद्वों" के आधार पर उपयोगकर्ता प्राथमिकताओं की Elo रेटिंग बनाई जाती है, जो लाइव संचार में मॉडलों की गुणवत्ता को दर्शाती है[15]।
- MT-Bench (2023) — संवाद कौशल के तनाव-परीक्षण के लिए स्वचालित benchmark। इसमें बहु-चरणीय संवाद का अनुकरण करने वाले 80 प्रश्न-युगल हैं। मॉडलों के उत्तरों का मूल्यांकन एक अन्य, अधिक शक्तिशाली LLM द्वारा पूर्व-निर्धारित पैमाने पर किया जाता है ("LLM-as-a-judge", उदाहरण के लिए GPT-4)[16]।
सुरक्षा और विश्वसनीयता
- AgentHarm (2024) — LLM एजेंटों की खतरनाक निर्देशों का पालन करने की प्रवृत्ति का मूल्यांकन करने वाला benchmark। इसमें 110 परिदृश्य शामिल हैं जो दुर्भावनापूर्ण कार्यों का प्रतिनिधित्व करते हैं (धोखाधड़ी से लेकर साइबर अपराध तक)। एक अच्छे मॉडल को ऐसे अनुरोधों को अस्वीकार करना चाहिए[17]।
- SafetyBench (2023) — 11 हजार से अधिक प्रश्नों का व्यापक सेट, जो यह जाँचता है कि मॉडल अस्वीकार्य सामग्री और हानिकारक सलाह उत्पन्न करने से कितनी निरंतरता से बचता है, जिसमें उकसावे वाले अनुरोध भी शामिल हैं[18]।
सीमाएँ और वर्तमान समस्याएँ
- डेटा संदूषण: मूल्यांकन की विश्वसनीयता के लिए सबसे बड़ा खतरा — प्रशिक्षण सेट में परीक्षण डेटा का रिसाव। मॉडल केवल उत्तरों को याद कर सकता है, जिससे उसका परिणाम कृत्रिम रूप से बढ़ जाता है[2]।
- बेंचमार्क संतृप्ति: जैसे-जैसे मॉडल विकसित होते हैं, पुराने बेंचमार्क (जैसे GLUE) पर उनका प्रदर्शन अधिकतम सीमा तक पहुँच जाता है, और परीक्षण नए, अधिक शक्तिशाली मॉडलों में अंतर करने के लिए उपयोगी नहीं रह जाता। इसके लिए अधिक जटिल मानकों के निरंतर विकास की आवश्यकता होती है[2]।
- वास्तविकता से अंतर: बेंचमार्क पर उच्च परिणाम हमेशा वास्तविक, असंरचित परिदृश्यों में मॉडल के विश्वसनीय प्रदर्शन की गारंटी नहीं देते। वास्तविक वातावरण अक्सर किसी भी निश्चित कार्य-समूह से अधिक समृद्ध और अप्रत्याशित होता है[1]।
संदर्भ
- Open LLM Leaderboard — Hugging Face समुदाय द्वारा मॉडलों की खुली रेटिंग
- Chatbot Arena Leaderboard — मानवीय प्राथमिकताओं के आधार पर चैट मॉडलों की रेटिंग
टिप्पणियाँ
- ↑ 1.0 1.1 «What Are LLM Benchmarks?». IBM. [१]
- ↑ 2.0 2.1 2.2 «20 LLM evaluation benchmarks and how they work». Evidently AI. [२]
- ↑ «Самые популярные LLM бенчмарки». Хабр. [३]
- ↑ Wang, Alex; Singh, Amanpreet; Michael, Julian; et al. «GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding». arXiv. [४]
- ↑ Wang, Alex; Pruksachatkun, Yada; Nangia, Nikita; et al. «SuperGLUE: A Stickier Benchmark for General-Purpose Language Understanding Systems». arXiv. [५]
- ↑ Sakaguchi, Keisuke; Le Bras, Ronan; Bhagavatula, Chandra; Choi, Yejin. «WinoGrande: An Adversarial Winograd Schema Challenge at Scale». arXiv. [६]
- ↑ Hendrycks, Dan; Burns, Collin; Basart, Steven; et al. «Measuring Massive Multitask Language Understanding». arXiv. [७]
- ↑ Srivastava, Aarohi; et al. «Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models». arXiv. [८]
- ↑ Zellers, Rowan; Holtzman, Ari; Bisk, Yonatan; et al. «HellaSwag: Can a Machine Really Finish Your Sentence?». arXiv. [९]
- ↑ Lin, Stephanie; Hilton, Jacob; Evans, Owain. «TruthfulQA: Measuring How Models Mimic Human Falsehoods». arXiv. [१०]
- ↑ Cobbe, Karl; Kosaraju, Vineet; Bavarian, Mohammad; et al. «Training Verifiers to Solve Math Word Problems». arXiv. [११]
- ↑ Hendrycks, Dan; Burns, Collin; Saund, Saurav; et al. «Measuring Mathematical Problem Solving With the MATH Dataset». arXiv. [१२]
- ↑ Chen, Mark; Tworek, Jerry; Jun, Heewoo; et al. «Evaluating Large Language Models Trained on Code». arXiv. [१३]
- ↑ Jimenez, Carlos E.; et al. «SWE-bench: Can Language Models Resolve Real-World GitHub Issues?». arXiv. [१४]
- ↑ Chiang, Wei-Lin; et al. «Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preferences». lmsys.org. [१५]
- ↑ Zheng, Lianmin; et al. «Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena». arXiv. [१६]
- ↑ Andriushchenko, Maksym; et al. «AgentHarm: A Benchmark for Asessing Agentic AI Harm». arXiv. [१७]
- ↑ Zhang, Zhexin; et al. «SafetyBench: A Comprehensive Benchmark for Evaluating the Safety of Large Language Models». arXiv. [१८]