Vysvětlitelná umělá inteligence
Vysvětlitelná umělá inteligence (Explainable AI, XAI) — je směr výzkumu a soubor metod v oblasti umělé inteligence, které umožňují učinit rozhodnutí a chování modelů strojového učení srozumitelnými pro člověka[1]. Hlavním cílem XAI je přeměnit složité, neprůhledné modely, často nazývané „černé skříňky", v „průhledné" nebo „skleněné skříňky", které dokáží vysvětlit, jakým způsobem přijímají rozhodnutí.
Potřeba vysvětlitelnosti výrazně vzrostla s rozvojem složitých modelů, zejména velkých jazykových modelů (LLM), které navzdory vysoké přesnosti mají vnitřní mechanismy nezřejmé pro vývojáře ani uživatele. Nedostatek průhlednosti přináší rizika, protože model může vykazovat skryté chyby, projevovat předpojatost nebo generovat nespolehlivé informace, jejichž příčiny nelze pochopit bez odpovídajících vysvětlení[2].
Význam a nezbytnost XAI
Nezbytnost vysvětlitelné umělé inteligence je uznávána jak vědeckou komunitou, tak regulátory. Rozvoj XAI je kriticky důležitý pro pochopení chování, omezení a společenských dopadů složitých AI systémů.
- Důvěra a přijetí technologií. Uživatelé, zejména v kritických oblastech, jako je medicína a finance, mají tendenci důvěřovat systémům, které dokážou svá zjištění zdůvodnit. Vysvětlení zvyšují průhlednost a jistotu, že model pracuje správně a eticky[3].
- Odhalování a zmírňování předpojatosti. Vysvětlitelnost pomáhá zjistit, zda se model neopírá o nežádoucí nebo neetické korelace v datech (například spojené s rasou, pohlavím nebo věkem). To umožňuje vývojářům odhalovat a opravovat algoritmickou předpojatost[1].
- Spolehlivost a robustnost. Interpretovatelnost pomáhá odhalovat zranitelnosti modelu, včetně zranitelnosti vůči adversarial attacks, a zvyšovat jeho odolnost vůči malým perturbacím vstupních dat.
- Soulad s normativními požadavky. Legislativa, jako je GDPR v Evropské unii, zakotvuje právo člověka na vysvětlení rozhodnutí přijatých automatizovanými systémy. Program XAI agentury DARPA (Agentury pro pokročilé obranné výzkumné projekty Ministerstva obrany USA), spuštěný v roce 2017, byl také zaměřen na vytváření AI systémů schopných poskytovat uživatelům interpretovatelná vysvětlení[4].
Přístupy k vysvětlitelnosti modelů
Metody XAI lze podmíněně rozdělit do dvou velkých kategorií: interpretovatelné modely, průhledné „ze své konstrukce", a post-hoc metody, které vysvětlují modely typu „černá skříňka" po jejich natrénování.
Interpretovatelné modely („průhledné skříňky")
Jde o algoritmy, jejichž vnitřní struktura je ze své podstaty jednoduchá a člověku srozumitelná. Patří mezi ně:
- Lineární regrese
- Logistická regrese
- Rozhodovací stromy s malou hloubkou
- Modely na základě pravidel (Rule-based systems)
Takové modely jsou snadno interpretovatelné, avšak často zaostávají v přesnosti za složitějšími modely (například hlubokými neuronovými sítěmi) na komplexních datech. Existuje kompromis mezi přesností a interpretovatelností[1].
Post-hoc metody vysvětlení („černé skříňky")
Tyto metody se aplikují na již natrénované, složité modely, aniž by měnily jejich vnitřní strukturu. Vytvářejí doplňující informace, které pomáhají pochopit logiku predikcí. Post-hoc vysvětlení se dělí na lokální a globální.
Lokální vysvětlení
Lokální metody vysvětlují jednotlivou predikci modelu pro konkrétní vstupní příklad.
- LIME (Local Interpretable Model-agnostic Explanations): Jedna z nejpopulárnějších metod. LIME sestavuje jednoduchý, interpretovatelný surrogátní model (například lineární regresi) v lokálním okolí konkrétní predikce, aproximujíc chování složitého modelu „černé skříňky"[1].
- SHAP (SHapley Additive exPlanations): Vychází ze Shapleyových hodnot z kooperativní teorie her. SHAP vypočítává příspěvek každého příznaku k výsledné predikci, přičemž spravedlivě rozděluje „výhru" (rozdíl mezi predikcí a průměrnou hodnotou) mezi příznaky. Tato metoda poskytuje teoreticky podložená a konzistentní vysvětlení[5].
- Kontrafaktuální vysvětlení: Generují scénáře typu „co kdyby?". Ukazují, jaké minimální změny ve vstupních datech by vedly k jinému výsledku (například „Váš úvěr by byl schválen, kdyby váš roční příjem byl o 5 000 $ vyšší")[1].
Globální vysvětlení
Globální metody jsou zaměřeny na vysvětlení celkové logiky modelu nebo jeho znalostí jako celku. Patří mezi ně analýza důležitosti příznaků napříč celou datovou sadou, jakož i vizualizace vnitřních reprezentací modelu.
Vysvětlitelnost pro velké jazykové modely (LLM)
Velké jazykové modely představují zvláštní výzvu a zároveň nové možnosti pro XAI. Jejich obrovská velikost a složitost ztěžují použití tradičních metod, avšak jejich schopnost pracovat s přirozeným jazykem otevírá nové cesty pro vysvětlení.
Analýza mechanismů pozornosti (Attention Visualization)
Mechanismus self-attention v architektuře Transformer umožňuje vizualizovat, na které části vstupního textu (tokeny) model „obrací pozornost" při generování odpovědi. Ačkoliv to poskytuje intuitivní představu o fungování modelu, ve vědecké komunitě probíhá diskuse o tom, zda je pozornost plnohodnotným vysvětlením, neboť vysoká důležitost podle attention vah nemusí vždy znamenat příčinnou souvislost[6].
Mechanistická interpretovatelnost
Nejhlubší úroveň vysvětlitelnosti, zaměřená na úplný reverzní inženýring fungování neuronové sítě. Výzkumníci se pokoušejí identifikovat a pochopit konkrétní „obvody" (circuits) — skupiny neuronů a jejich spojení, která realizují určité algoritmické funkce (například rozpoznávání syntaktické konstrukce nebo vyhledávání faktů)[7].
Vysvětlení prostřednictvím přirozeného jazyka
Jedineční schopností LLM je vysvětlovat samy sebe. Pomocí technik promptingu, jako je Chain-of-Thought, lze model přimět ke generování postupných úvah, které vedly k jeho závěru. To činí proces přijímání rozhodnutí průhledným pro uživatele. Taková vysvětlení však mohou být nedůvěryhodná (unfaithful) — model může vygenerovat přesvědčivé, ale nepravdivé zdůvodnění, které nereflektuje jeho skutečný vnitřní proces[8].
Odkazy
- Oficiální stránka programu DARPA XAI
- Přehled Explainable AI od IBM
Poznámky
- ↑ 1.0 1.1 1.2 1.3 1.4 Arrieta, A. B. et al. «Explainable Artificial Intelligence (XAI): Concepts, Taxonomies, Opportunities and Challenges toward Responsible AI». Information Fusion, 2020. [1]
- ↑ Zhao, H. et al. «Explainability for Large Language Models: A Survey». arXiv:2309.01512, 2023. [2]
- ↑ «What is Explainable AI (XAI)?». IBM. [3]
- ↑ «Explainable Artificial Intelligence». DARPA. [4]
- ↑ Linardatos, P. et al. «Explainable AI: A Review of Machine Learning Interpretability Methods». Entropy, 2021. [5]
- ↑ Jain, S. & Wallace, B. C. «Attention is not Explanation». arXiv:1902.10186, 2019. [6]
- ↑ Lan, Q. et al. «Towards Interpretable Sequence Continuation: Analyzing Shared Circuits in Large Language Models». arXiv:2311.04131, 2023. [7]
- ↑ Singh, C. et al. «Rethinking Interpretability in the Era of Large Language Models». arXiv:2402.01761, 2024. [8]