Принятие решений в условиях конфликта
Принятие решений в условиях конфликта — раздел теории принятия решений, исследующий выбор в ситуациях, в которых исход зависит не только от действий самого лица, принимающего решение (ЛПР), и состояний внешней среды, но и от сознательного поведения одного или нескольких рациональных участников, преследующих собственные цели. Основным формальным аппаратом этой области является теория игр, дополняемая методами многоагентного анализа, теории торга, механизм-дизайна и поведенческой теории игр.
В аналитической традиции, опирающейся на различение определённости, риска и неопределённости (Ф. Найт, 1921; систематизация — Р. Д. Льюс, Г. Райффа, 1957), стратегический конфликт рассматривается как особый тип среды. Его отличительная черта состоит в том, что источником неопределённости является не «природа» — пассивное внешнее окружение, — а рациональный агент, который, в свою очередь, учитывает возможные действия ЛПР. Это порождает структуру взаимной рефлексии и требует выхода за рамки одноагентных моделей максимизации ожидаемой полезности.
Нормативное, дескриптивное и прескриптивное направления
Анализ принятия решений в условиях конфликта, как и общая теория принятия решений (Д. Белл, Г. Райффа, А. Тверски, 1988), развивается по трём взаимодополняющим направлениям, каждому из которых в последующих разделах статьи соответствует свой круг моделей и результатов.
Нормативное направление исследует, как должны взаимодействовать идеально рациональные агенты, обладающие общим знанием рациональности и неограниченными вычислительными ресурсами. Его формальный аппарат составляет классическая теория игр: аксиоматика функции полезности, минимаксная теорема фон Неймана, равновесие Нэша и его уточнения (совершенное по подыграм, последовательное, совершенное по дрожащей руке), байесовское равновесие в играх с неполной информацией, кооперативные концепции решения — ядро, нуклеол, значение Шепли, решения задачи торга Нэша и Калаи–Смородинского. Нормативные результаты формулируются как теоремы существования, единственности или характеризации.
Дескриптивное направление фиксирует, как люди фактически ведут себя в стратегических взаимодействиях. Экспериментальные результаты — игра ультиматум, турниры Аксельрода, координационные эксперименты с фокальными точками — обнаружили устойчивые отклонения от нормативных предсказаний: ограниченную глубину стратегической рефлексии, социальные предпочтения (справедливость, взаимность), чувствительность к фреймингу и точке отсчёта. Формальные модели направления — иерархия уровней мышления (level-k, cognitive hierarchy), квантальное отклик-равновесие, модели неприятия неравенства (Фера–Шмидта, Болтона–Окенфельса) и взаимности (Рабина), эволюционная теория игр с её репликаторной динамикой.
Прескриптивное направление разрабатывает процедуры и институты, помогающие реальному ЛПР достигать лучших результатов в пределах его когнитивных и информационных ограничений. К нему относятся теория принципиальных переговоров и анализ BATNA, методологии посредничества и арбитража, институционализация повторяющихся взаимодействий (через долгосрочные контракты, репутационные реестры, международные режимы), конструкция достоверных обязательств по Шеллингу, а на системном уровне — механизм-дизайн, «обратная теория игр», проектирующая правила взаимодействия с заранее заданными стратегическими свойствами (совместимость со стимулами, индивидуальная рациональность, Парето-эффективность).
Три направления не конкурируют, а образуют замкнутый методологический цикл: нормативные модели задают эталон рациональности; дескриптивные исследования выявляют систематические отклонения от него; прескриптивные разработки возвращают ЛПР инструменты приближения к эталону с учётом выявленных ограничений. Именно этот цикл превращает принятие решений в условиях конфликта из изолированной математической дисциплины в область, в которой сходятся теория игр, экспериментальная экономика, когнитивная психология и практический менеджмент.
Исторические истоки
Первые формальные рассуждения о стратегическом поведении относятся к XVIII веку: Дж. Вальдгрейв в 1713 году предложил решение в смешанных стратегиях для карточной игры «Ле-Гер», что принято считать первым применением идеи минимакса. В XIX веке А. Курно (1838) и Ж. Бертран (1883) разработали модели олигополистической конкуренции, а Ф. Эджуорт (1881) исследовал задачи торга. Э. Цермело (1913) доказал теорему о детерминированности конечных игр двух лиц с нулевой суммой и совершенной информацией — первый результат такого класса. Э. Борель в работах 1921–1927 годов ввёл понятие смешанной стратегии и стратегическое нормирование — представление многошаговой игры в нормальной форме; его гипотеза о невыполнимости минимаксного равенства в общем случае была впоследствии опровергнута фон Нейманом.
Современное оформление теории игр связано со статьёй Дж. фон Неймана «К теории стратегических игр» (1928), в которой была доказана теорема о минимаксе для антагонистических игр двух лиц. Самостоятельной дисциплиной теория игр стала с выходом монографии Дж. фон Неймана и О. Моргенштерна «Теория игр и экономическое поведение» (1944), где были введены стратегическая форма игры, аксиоматика функции полезности и заложены основы кооперативной теории.
Ключевым событием послевоенного этапа стали работы Дж. Нэша 1950–1951 годов: введение равновесия Нэша — универсальной концепции решения для произвольной некооперативной игры — и доказательство теоремы его существования в смешанных стратегиях для любой конечной игры (Нобелевская премия по экономике 1994 года, совместно с Р. Зельтеном и Дж. Харсаньи — за основополагающий вклад в анализ равновесий в теории некооперативных игр). Параллельно в кооперативной теории Л. Шепли (1953) предложил одноимённое значение, аксиоматически характеризующее распределение выигрыша в коалиционной игре. Дальнейшее развитие шло по нескольким основным линиям: уточнение равновесных концепций (Р. Зельтен, 1965, 1975; Д. Крепс, Р. Уилсон, 1982); включение неполноты информации (Дж. Харсаньи, 1967–1968); построение коррелированного равновесия (Р. Ауманн, 1974); создание эволюционной теории игр (Дж. Мейнард Смит, Дж. Прайс, 1973). Параллельно с формальным направлением Т. Шеллинг («Стратегия конфликта», 1960; «Вооружение и влияние», 1966) разработал содержательную теорию стратегического поведения — анализ достоверных обязательств, угроз, фокальных точек и управления эскалацией, — оказавшую решающее влияние на политическую науку, теорию сдерживания и переговорный анализ (Нобелевская премия по экономике 2005 года, совместно с Р. Ауманном).
Формальный аппарат
Конфликтная ситуация формализуется в теории игр через четыре базовых элемента:
- игроки (агенты) — множество лиц, коалиций или организаций, принимающих решения;
- стратегии — полные планы действий, предписывающие выбор в любой ситуации, в которой игрок может оказаться;
- информационная структура — распределение знаний о правилах игры, истории ходов и характеристиках участников к моменту каждого решения;
- выигрыши (полезности) — численные оценки исходов, выражающие предпочтения игроков с учётом затраченных ресурсов и достигнутых целей.
На основе этих элементов строятся три основные формы представления игры, связанные между собой, но различающиеся по уровню абстракции: нормальная и экстенсивная формы тесно соответствуют друг другу (любую экстенсивную игру можно привести к нормальной), тогда как коалиционная форма является более грубой редукцией, абстрагирующейся от стратегий, порядка ходов и информационной структуры.
Нормальная форма
Игрой в нормальной (стратегической) форме называется тройка , где — множество игроков, — множество чистых стратегий игрока , а — функция выигрыша, определённая на декартовом произведении . Стратегия — правило, предписывающее действие в каждой возможной ситуации. Смешанная стратегия — распределение вероятностей на ; ожидаемый выигрыш определяется как математическое ожидание по совместному распределению смешанных стратегий.
Развёрнутая форма
Развёрнутая (экстенсивная) форма — построенное Х. Куном (1953) на основе более ранней схемы фон Неймана представление игры в виде дерева, в узлах которого указан либо очередной игрок, принимающий решение, либо случайный ход природы. Особую роль играет понятие информационного множества — совокупности узлов, неразличимых для игрока в момент принятия решения. Стратегия в экстенсивной игре — полный план действий, предписывающий выбор в каждом информационном множестве данного игрока. Любую экстенсивную игру можно привести к нормальной форме процедурой стратегического нормирования, хотя при этом теряется часть структурной информации о последовательности ходов. Классический результат об играх этого класса — теорема Цермело (1913): в любой конечной игре двух лиц с нулевой суммой и совершенной информацией один из игроков имеет выигрышную стратегию; если правила допускают ничью (как в шахматах), возможен третий вариант — оба игрока могут её гарантировать. Развёрнутая форма позволяет моделировать последовательные ходы, асимметрию информации и допускает строгое определение подыгр и эволюции игры во времени. Важнейшим связующим результатом является теорема Куна (1953) о поведенческих стратегиях: в конечных играх с совершенной памятью (perfect recall — каждый игрок помнит все свои прежние действия и наблюдения) любая смешанная стратегия (глобальная рандомизация по полным планам) порождает то же распределение исходов, что и некоторая поведенческая стратегия (локальная рандомизация в каждом информационном множестве), и наоборот. Этот результат обосновывает работу с поведенческими стратегиями при определении последовательного и совершенного байесовского равновесий.
Коалиционная форма
Коалиционная форма в простейшем варианте (игры с трансферабельной полезностью, TU) характеризуется парой , где — характеристическая функция, сопоставляющая каждой коалиции её гарантированный суммарный выигрыш. В более общем случае (игры с нетрансферабельной полезностью, NTU) характеристическая функция задаётся как множество достижимых векторов выплат для каждой коалиции, что позволяет учитывать ситуации, в которых полезность не может свободно перераспределяться между участниками. Коалиционная форма лежит в основании кооперативной теории игр и абстрагируется от конкретных стратегий, фокусируясь на возможностях коалиций.
Классификация игр
Игры классифицируются по нескольким независимым основаниям:
- по числу участников — игры двух лиц и игры лиц;
- по сумме выигрышей — с нулевой суммой (антагонистические), с постоянной суммой, с ненулевой суммой (общего вида);
- по характеру взаимодействия — некооперативные (индивидуальные решения без обязывающих соглашений) и кооперативные (допускающие формирование коалиций с обязывающими договорённостями);
- по информации — с совершенной информацией (в момент хода известна вся история игры) и несовершенной; с полной информацией (структура игры и функции выигрышей являются общим знанием) и неполной;
- по порядку ходов — одновременные (игроки выбирают стратегии независимо) и последовательные;
- по повторяемости — одноразовые, конечно повторяющиеся, бесконечно повторяющиеся, стохастические;
- по модели рациональности — классические (игроки неограниченно рациональны), поведенческие (с ограничениями рациональности), эволюционные (стратегии распространяются по механизму отбора).
Эта классификация имеет не только описательное, но и содержательное значение: каждому классу игр отвечают свои понятия рациональности, свои концепции решения и свои критерии устойчивости. Так, в конечных двухличных антагонистических играх базовой концепцией служит минимаксный принцип, в играх общего вида — равновесия Нэша и его уточнений, в кооперативных — распределений из ядра или значения Шепли, в эволюционных — эволюционно устойчивой стратегии, в поведенческих — квантального отклик-равновесия или уровневой иерархии. Переход между классами не сводим к подстановке параметров: он меняет сам тип вопроса, который задаёт теория.
Концепции решения в некооперативных играх
Доминирование и рационализуемость
Простейшим принципом является исключение строго доминируемых стратегий: стратегия строго доминируется, если существует другая (чистая или смешанная) стратегия, дающая строго больший выигрыш при любых действиях оппонентов. В конечных играх рационализуемыми (Б. Бернхайм, Д. Пирс, 1984) являются стратегии, переживающие итеративное исключение стратегий, строго доминируемых смешанными стратегиями; эквивалентно — стратегий, не являющихся наилучшим ответом ни на какое допустимое (в том числе коррелированное) убеждение о совместном поведении оппонентов. Рационализуемость соответствует предположению об общем знании рациональности игроков.
Гарантирующие стратегии и минимакс
В антагонистических играх двух лиц ключевой концепцией является гарантирующая (минимаксная) стратегия. Конечная антагонистическая игра удобно задаётся платёжной матрицей , , , где — выплата первому игроку (максимизирующему) при выборе им стратегии и стратегии противником (минимизирующим); второй игрок при этом получает . Нижняя цена игры — гарантированный выигрыш первого игрока в чистых стратегиях:
верхняя цена игры — гарантированная защита второго:
Всегда выполняется фундаментальное неравенство . Элемент является седловой точкой матрицы, если он одновременно минимален в своей строке и максимален в своём столбце: . Существование седловой точки эквивалентно равенству ; общее значение называется ценой игры, а пара соответствующих стратегий — оптимальной в чистых стратегиях. В общем случае седловая точка в чистых стратегиях не существует, и гарантированное решение достигается лишь после расширения пространства допустимых стратегий до вероятностных распределений.
Согласно теореме о минимаксе (Дж. фон Нейман, 1928), в конечной антагонистической игре при допущении смешанных стратегий (вероятностных распределений , на симплексах чистых стратегий) цена игры всегда существует и единственна, а оптимальные смешанные стратегии образуют седловую точку ожидаемой выплаты:
Таким образом, стратегия гарантирует первому игроку выигрыш не менее , а стратегия гарантирует второму потерю не более при любой ответной игре противника. На этой основе разработан ряд практических методов решения матричных игр: алгебраический метод даёт замкнутые формулы оптимальных смешанных стратегий для игр без седловой точки; графический метод применим к играм и и сводит их к построению нижней (для максимизирующего игрока) или верхней (для минимизирующего) огибающей семейства линейных функций вероятности; в общем случае вычисление минимаксных стратегий сводится к паре двойственных задач линейного программирования (Дж. Данциг, 1951). Эквивалентность теоремы о минимаксе и теоремы сильной двойственности линейного программирования превращает матричные игры в канонический класс задач исследования операций.
Равновесие Нэша
Ядром некооперативной теории игр служит равновесие Нэша (Дж. Нэш, 1950): профиль стратегий , при котором ни одному игроку не выгодно в одностороннем порядке изменить свою стратегию:
Теорема Нэша гарантирует существование равновесия в смешанных стратегиях для любой конечной игры; исходное доказательство в краткой заметке в *PNAS* (1950) опирается на теорему Какутани о неподвижной точке для многозначных отображений, а в развёрнутой статье в *Annals of Mathematics* (1951) Нэш дал альтернативное, более элементарное доказательство через теорему Брауэра. В антагонистических играх двух лиц равновесие Нэша совпадает с минимаксным решением, что объединяет теорию Нэша с теорией фон Неймана.
Равновесие Нэша, однако, не является безупречной концепцией. Во многих играх существует множество равновесий (проблема отбора равновесия); равновесие не обязательно эффективно по Парето (дилемма заключённого); оно не учитывает структуру последовательных ходов. Это стимулировало разработку уточнений (refinements) равновесия Нэша:
- совершенное по подыграм равновесие (Р. Зельтен, 1965) требует, чтобы стратегии образовывали равновесие Нэша в каждой подыгре, что исключает неправдоподобные угрозы. В конечных играх с совершенной информацией такое равновесие находится методом обратной индукции (восходит к Э. Цермело, 1913; Х. Куну, 1953): анализ начинается с терминальных узлов и последовательно поднимается к корню, на каждом шаге заменяя подыгру её оптимальным продолжением;
- совершенное байесовское равновесие (Д. Фуденберг, Ж. Тироль, 1991) — пара (стратегии, убеждения), в которой стратегии последовательно рациональны (оптимальны в каждом информационном множестве при данных убеждениях), а убеждения согласованы с правилом Байеса везде, где оно применимо;
- равновесие дрожащей руки (trembling-hand perfect equilibrium, Р. Зельтен, 1975) устойчиво к малым ошибкам исполнения — «дрожаниям руки» игроков;
- последовательное равновесие (Д. Крепс, Р. Уилсон, 1982) — такая пара (стратегии, убеждения), в которой стратегии последовательно рациональны, а убеждения являются пределом убеждений, порождаемых последовательностью полностью смешанных стратегий, что дисциплинирует убеждения и вне равновесного пути;
- собственное равновесие (proper equilibrium, Р. Майерсон, 1978) накладывает дополнительное условие на вероятности ошибочных действий.
Коррелированное равновесие
Р. Ауманн (1974) ввёл обобщение равновесия Нэша — коррелированное равновесие, предполагающее наличие внешнего коррелирующего устройства, которое генерирует совместный случайный сигнал и выдаёт каждому игроку частную рекомендацию; равновесие достигается, если каждому игроку оптимально следовать полученной рекомендации при условии, что остальные делают то же. Множество коррелированных равновесий содержит все равновесия Нэша и, как правило, шире их. Коррелированное равновесие естественным образом связано с концепцией общего знания и играет ключевую роль в алгоритмической теории игр: в отличие от равновесия Нэша, для конечной игры в явном представлении оно вычислимо за полиномиальное время. Ауманн (1987) показал, что коррелированное равновесие получается как следствие общего знания байесовской рациональности участников при общем априорном распределении.
Классическим результатом той же эпистемической традиции является теорема Ауманна о согласии («agreeing to disagree», 1976): если у двух агентов имеется общее априорное распределение и их апостериорные вероятности некоторого события стали общим знанием, эти вероятности не могут различаться. Рациональным агентам «невозможно согласиться не соглашаться»: любое устойчивое различие в оценках означает, что какой-то факт остался вне общего знания. Теорема имеет далеко идущие следствия для моделей торговли активами, переговоров и пересмотра убеждений: там, где на практике агенты действительно расходятся, нарушено либо условие общего знания, либо общего априорного распределения.
Кооперативные игры и теория торга
В следующих трёх подразделах речь идёт о кооперативных играх с трансферабельной полезностью (TU), в рамках которых задаются стандартные определения ядра, значения Шепли и нуклеола.
Ядро и его свойства
В кооперативной TU-игре центральной задачей является распределение суммарного выигрыша между участниками. Ядро (core, Д. Гиллис, 1959) — множество распределений , удовлетворяющих коллективной рациональности и устойчивых относительно отклонений коалиций: для всех . Ядро может быть пустым; условия его непустоты даёт теорема Бондаревой–Шепли (О.Н. Бондарева, 1963; Л. Шепли, 1967): ядро непусто тогда и только тогда, когда игра сбалансирована.
Значение Шепли
Значение Шепли (Л. Шепли, 1953) — единственное распределение, удовлетворяющее аксиомам эффективности, симметрии, аддитивности и нулевого игрока:
Содержательно значение Шепли соответствует среднему предельному вкладу игрока по всем возможным порядкам присоединения к коалиции. Оно нашло применение в анализе политических коалиций (индексы влияния Шепли–Шубика и Банцафа), в корпоративном управлении — при оценке реального распределения контроля между акционерами в условиях перекрёстного и многоуровневого владения, когда формальная доля в капитале не совпадает с голосующей силой, — в распределении издержек в логистике, а в последние годы — в интерпретируемом машинном обучении (SHAP-значения).
Нуклеол и другие решения
Нуклеол (Д. Шмейдлер, 1969) — решение, лексикографически минимизирующее максимальное «недовольство» коалиций. В отличие от ядра, нуклеол всегда существует и единствен; в отличие от значения Шепли, он всегда принадлежит ядру, если ядро непусто.
Исторически первой концепцией решения кооперативной игры были устойчивые множества фон Неймана–Моргенштерна (1944) — множества импутаций, обладающие внутренней устойчивостью (никакой элемент не доминирует другой) и внешней устойчивостью (каждая внешняя импутация доминируется внутренней). Устойчивое множество может существовать одновременно с непустым ядром и не быть единственным. У. Лукас (1969) построил пример десятиличной игры, не имеющей ни одного устойчивого множества, что продемонстрировало принципиальные ограничения этой концепции и сместило фокус последующих исследований на ядро, значение Шепли и нуклеол.
Теория торга
Задача торга (bargaining problem) формализует ситуацию, в которой участники выбирают точку из допустимого множества исходов при условии, что в случае несогласия реализуется фиксированная точка разногласий (disagreement point). В классическом двухличном случае Дж. Нэш (1950) показал, что единственным решением, удовлетворяющим аксиомам Парето-оптимальности, симметрии, инвариантности к аффинным преобразованиям полезности и независимости от посторонних альтернатив, является решение Нэша по торгу — точка, максимизирующая произведение приростов полезностей при условиях и . Альтернативы включают решение Калаи–Смородинского (1975), заменяющее аксиому независимости на монотонность относительно идеальной точки, и эгалитарное решение. Динамическая модель торга А. Рубинштейна (1982) выводит решение Нэша как предел равновесия стратегической игры с попеременными предложениями.
Теория переговоров и практика разрешения конфликтов
Значительная часть прикладной работы с конфликтами ведётся в режиме переговоров — явного обмена предложениями и информацией с целью достижения взаимоприемлемого соглашения. Формальным ядром области служит изложенная выше теория торга (решения Нэша, Калаи–Смородинского, модель Рубинштейна); в практике, однако, используется более широкий инструментарий, объединяющий аксиоматические результаты, процедурные методики и институциональные формы посредничества.
Принципиальные переговоры
Прескриптивная методика принципиальных переговоров разработана Р. Фишером и У. Юри в рамках Гарвардского переговорного проекта («Путь к согласию», 1981; дополнение В. Ури и Б. Паттона в 1991 году). В её основе — четыре принципа: отделение людей от проблемы; концентрация на интересах, а не на позициях; поиск взаимовыгодных вариантов; использование объективных критериев. Методика противопоставляется позиционному торгу, в котором стороны движутся от крайних исходных требований к компромиссу посередине, часто оставляя нереализованным потенциал совместной выгоды.
BATNA и зона возможного соглашения
Ключевым аналитическим инструментом переговорного анализа выступает BATNA (Best Alternative to a Negotiated Agreement) — наилучшая альтернатива стороны в случае срыва переговоров. BATNA задаёт резервную полезность участника: никакое соглашение хуже BATNA принято не будет. Пересечение допустимых множеств, ограниченных BATNA обеих сторон, формирует зону возможного соглашения (ZOPA, Zone of Possible Agreement). Укрепление собственной BATNA и корректная оценка BATNA противника составляют стратегическую подготовку переговоров. Формально BATNA соответствует точке разногласий в нэшевской задаче торга и индивидуально-рациональному уровню в кооперативной теории игр, что связывает переговорную аналитику с кооперативными концепциями решения.
Многомерные переговоры и логроллинг
Переговоры по нескольким вопросам допускают пакетирование и логроллинг (log-rolling) — обмен уступками по разноценным для сторон вопросам. Асимметрия предпочтений по отдельным измерениям создаёт потенциал Парето-улучшений, недоступных при раздельном рассмотрении каждого вопроса. В теоретико-игровой терминологии это отражает то, что при расширении пространства альтернатив граница Парето смещается наружу, а симметризация по измерениям, где уступки сторонам недороги, приближает результат к Парето-оптимальному.
Посредничество и институциональные процедуры
При срыве прямых переговоров применяются процедурные формы посредничества. Медиация — неформальное привлечение третьей стороны, не обладающей правом решения, но содействующей сторонам в поиске соглашения через управление информационным обменом и переформулирование позиций. Арбитраж — делегирование решения обязывающей третьей стороне; специальным классом служит арбитраж по финальным предложениям (final-offer arbitration, К. Стивенс, 1966), в котором арбитр обязан выбрать одно из итоговых предложений сторон без права компромисса. Процедура была задумана как механизм, уменьшающий стимулы к крайним предложениям: в ряде моделей экстремальное предложение повышает вероятность принятия предложения противной стороны, что побуждает к умеренности (хотя результаты зависят от предпосылок об арбитральной неопределённости).
Связь прикладной переговорной практики с нормативной теорией проявляется в том, что аксиоматические решения задачи торга задают формальный эталон справедливого и эффективного исхода, к которому методики принципиальных переговоров и институты посредничества стремятся в условиях ограниченной рациональности и асимметричной информации.
Игры с неполной информацией
В реальных конфликтах игроки, как правило, не обладают полным знанием о предпочтениях и возможностях партнёров. Дж. Харсаньи (1967–1968) предложил формальный приём — байесовскую игру (игру с неполной информацией), в которой каждый игрок имеет скрытый тип, задающий его характеристики, и обладает общим априорным распределением типов. Байесовское равновесие Нэша — профиль стратегий, при котором стратегия каждого типа максимизирует его ожидаемый выигрыш при условии его убеждений о типах остальных. Преобразование Харсаньи сводит задачу с неполной информацией к игре с несовершенной, но полной информацией, включающей ход природы, выбирающий типы.
Игры с неполной информацией составляют основу механизм-дизайна и теории контрактов. Принцип откровения (А. Гиббард, 1973 — для доминантных стратегий; Р. Майерсон, 1979 — для байесовского равновесия; параллельно Д. Дасгупта, П. Хаммонд, Э. Маскин, 1979) утверждает, что для любого равновесия произвольного механизма существует прямой механизм, в котором правдивое сообщение типа образует соответствующее равновесие (доминантных стратегий или байесовское, в зависимости от версии). На этой основе построены теория оптимальных аукционов (У. Викри, 1961; Р. Майерсон, 1981) и теория стимулирующих контрактов при асимметричной информации, с содержательным истоком в работе Дж. Миррлиса об оптимальном налогообложении при асимметрии информации (1971).
Стратегические обязательства, угрозы и сигналы
Одним из наиболее влиятельных направлений содержательного приложения теории игр к реальным конфликтам стала теория стратегического поведения, развитая Т. Шеллингом в книгах «Стратегия конфликта» (1960) и «Вооружение и влияние» (1966). В отличие от формальной теории равновесий, Шеллинг исследовал механизмы, с помощью которых рациональные участники изменяют структуру самой игры в свою пользу.
Достоверные обязательства
Шеллинг показал, что в конфликте способность ограничить собственный выбор может быть стратегическим преимуществом. Если игрок способен достоверно обязаться к определённому действию — так, что отклонение от него становится для него самого невозможным или запретительно дорогим, — он может сместить равновесие игры в свою пользу. Классический пример — полководец, сжигающий за собой мосты: демонстративное исключение отступления заставляет противника пересмотреть ожидаемую цену атаки. В формальной теории это часто моделируется как преобразование симультанной игры в последовательную с правом первого хода у игрока, принявшего обязательство, что в соответствующих играх может создавать преимущество первого хода. Структурным прототипом служит модель Штакельберга (1934), первоначально разработанная для дуополистической конкуренции по объёмам выпуска; в современной теории она обобщена до общего класса игр с лидерством, в которых один игрок заранее и наблюдаемо выбирает стратегию, а остальные рационально реагируют.
Достоверность обязательства требует, чтобы отказ от него был явно невыгоден: простая декларация намерения таковой не является. Инструментами достоверности служат репутационные издержки, правовые санкции, делегирование решения третьей стороне, публичность, автоматические триггеры, а также специально устроенные «руки-вяжущие» (commitment devices). Проблематика достоверных обязательств составляет сердцевину теории сдерживания, анализа переговорных позиций и институционального проектирования.
Сигналы и скрининг
В играх с неполной информацией сформировались парные направления анализа. В сигнальной игре (М. Спенс, 1973) информированный игрок первым выбирает наблюдаемое действие, косвенно раскрывающее его тип; равновесия делятся на разделяющие (типы выбирают разные сигналы и становятся различимыми), объединяющие (типы неразличимы) и полуразделяющие. Решение сигнальной игры требует совершенного байесовского равновесия с согласованными убеждениями вне равновесного пути, а отбор среди множественных равновесий — применения критериев типа интуитивного критерия Чо–Крепса (In-Koo Cho, Д. Крепс, 1987). Скрининг (М. Ротшильд, Дж. Стиглиц, 1976) — зеркальная ситуация, в которой неинформированная сторона первой предлагает меню контрактов, устроенное так, что выбор одного из них сам раскрывает тип оппонента. Классическая иллюстративная среда этих моделей — рынок товаров с асимметричной информацией (Дж. Акерлоф, 1970); за этот цикл работ Акерлоф, Спенс и Стиглиц удостоены Нобелевской премии по экономике 2001 года.
Сдерживание, эскалация и фокальные точки
Прикладной синтез этих идей — теория сдерживания, развитая применительно к ядерной стратегии и международным конфликтам (Т. Шеллинг, Г. Кан, А. Рапопорт). К её центральным понятиям относятся угроза, оставляющая нечто на волю случая (threat that leaves something to chance) — сознательное привнесение остаточной неопределённости исхода для повышения рисковой стоимости провокации; управление эскалацией — выстраивание лестницы ответных действий с понятными точками остановки; фокальные точки — выделенные решения, к которым стороны тяготеют в задачах координации без явной связи (в игре «встретиться в Нью-Йорке в известный день» большинство независимо называют Центральный вокзал в полдень). Фокальные точки представляют собой существенно внелогический компонент решения, опирающийся на культурный и контекстный фон участников, и указывают на границы чисто формальных теорий равновесия.
Повторяющиеся игры
При многократном взаимодействии стратегическое поведение существенно меняется за счёт возможности наказания и формирования репутации. Бесконечно повторяющаяся игра с дисконтированием характеризуется стратегиями-функциями от истории игры. Народная теорема (folk theorem; название отражает то, что основная идея была широко известна в сообществе теоретиков игр до появления стандартных публикаций; ранние формальные результаты такого типа — Р. Ауманн, 1959; Дж. Фридман, 1971) утверждает, что при достаточно высоком коэффициенте дисконтирования любой индивидуально рациональный и достижимый вектор средних выигрышей реализуется как равновесие Нэша повторяющейся игры. Более сильная версия для совершенных по подыграм равновесий — теорема Фуденберга–Маскина (1986) — распространяет этот результат на концепцию решения, устойчивую к невыполнимым угрозам, и составляет стандартное обоснование долгосрочной кооперации в некооперативных играх общего вида. Оба результата объясняют, почему кооперация может быть устойчива в долгосрочных отношениях, несмотря на неэффективность однократного равновесия.
Эмпирический турнир Р. Аксельрода (1980, 1984) показал, что в повторяющейся дилемме заключённого стратегия «око за око» (tit-for-tat) — начинать с кооперации и повторять последнее действие оппонента — выиграла оба турнира Аксельрода и стала канонической стратегией взаимности. Условия её эффективности: вежливость (кооперация в первом ходе), ответность, прощение и прозрачность. К числу теоретически исследуемых поддерживающих кооперацию стратегий относится также «мрачный курок» (grim trigger) — бессрочное наказание после первого же отклонения от кооперации, — дающий формально наиболее жёсткий механизм дисциплинирования в духе народной теоремы, но, в отличие от «око за око», нетерпимый к случайным ошибкам.
Существенное ограничение кооперативного потенциала повторяющихся игр проявляется в парадоксе цепного магазина (Р. Зельтен, 1978). Монополист — сеть магазинов — последовательно сталкивается с потенциальными конкурентами, каждый из которых решает, входить ли на местный рынок; в случае входа монополист выбирает между агрессивным сопротивлением (fight, затратным для обеих сторон) и уступкой (accommodate, делением рынка). Обратная индукция с последнего рынка показывает, что угроза борьбы неправдоподобна: в последнем раунде монополисту выгоднее уступить, следовательно, последний конкурент входит; зная это, предпоследний тоже входит, и так до первого рынка. Единственное совершенное по подыграм равновесие — уступка во всех раундах, — что противоречит интуитивно рациональной репутационной стратегии «борись вначале, чтобы отпугнуть остальных». Разрешение парадокса дали модели репутации с неполной информацией (Д. Крепс, Р. Уилсон, 1982; П. Милгром, Дж. Робертс, 1982): даже малая вероятность того, что монополист является «жёстким» типом, всегда выбирающим борьбу, заставляет рационального «мягкого» монополиста имитировать жёсткость в ранних раундах, восстанавливая сдерживание в конечном горизонте. Этот результат демонстрирует, что репутация есть полноценный стратегический актив, формирующийся в равновесиях байесовских повторяющихся игр, и объясняет, почему конечность горизонта не всегда разрушает кооперацию или сдерживание.
В прескриптивном плане народная теорема интерпретируется как обоснование институционализации повторяемости: сознательный перевод однократного конфликта в режим продолжительного взаимодействия (долгосрочные контракты, периодические переговоры, встроенные процедуры пересмотра, репутационные реестры) расширяет множество реализуемых кооперативных исходов. Этот принцип лежит в основе устойчивости коммерческих отношений, работы рейтинговых и сертификационных систем и архитектуры многих международных режимов.
Эволюционная теория игр
Эволюционная теория игр (Дж. Мейнард Смит, Дж. Прайс, 1973) переосмысляет стратегическое взаимодействие как процесс отбора в популяции, где стратегии «наследуются», а успешные стратегии размножаются пропорционально выигрышу. В симметричных популяционных играх центральным понятием является эволюционно устойчивая стратегия (ESS): стратегия, которая, будучи принятой большинством популяции, не может быть вытеснена малой группой мутантов. Формально является ESS, если для любой либо , либо и .
Динамический аналог ESS — репликаторная динамика (П. Тейлор, Л. Йонкер, 1978), описывающая изменение долей стратегий в популяции дифференциальным уравнением, в котором скорость роста доли стратегии пропорциональна разности её приспособленности и среднего по популяции. Всякая ESS является устойчивой неподвижной точкой репликаторной динамики, но обратное неверно. Эволюционный подход иногда даёт критерии отбора равновесий Нэша, особенно в симметричных играх, и служит мостом между теорией игр, биологией и моделями обучения в многоагентных системах.
Канонические примеры
Ряд игр приобрёл статус парадигмальных, служа эталонными иллюстрациями структурных свойств конфликта:
- Дилемма заключённого — формализована М. Фладом и М. Дрешером в RAND Corporation в 1950 году, нарратив с задержанными предложен А. Такером; двое задержанных независимо выбирают, признаваться ли. Единственное равновесие Нэша (взаимное признание) Парето-доминируется взаимным молчанием. Демонстрирует фундаментальное расхождение индивидуальной и коллективной рациональности, обсуждаемое во всех общественных науках — от политологии до эволюционной биологии;
- Битва полов (Battle of the Sexes) — партнёры предпочитают быть вместе, но расходятся в оценке способа провести время; игра имеет два равновесия Нэша в чистых стратегиях и иллюстрирует проблему координации;
- Охота на оленя (Stag Hunt) — притча, восходящая к Ж.-Ж. Руссо («Рассуждение о неравенстве», 1755): коллективная охота на оленя приносит больший выигрыш, но требует доверия; индивидуальная охота на зайца гарантирует меньший, но надёжный результат. Два равновесия — Парето-доминирующее (кооперативное) и риск-доминирующее (безопасное). Концепция риск-доминирования (Дж. Харсаньи, Р. Зельтен, 1988) формализует предпочтение менее рискованного равновесия при ограниченной уверенности в рациональности партнёра и объясняет эмпирическую устойчивость «безопасного» исхода в координационных экспериментах;
- Ястреб и голубь (Chicken, Hawk–Dove) — конфликт интересов с катастрофическим исходом при взаимной агрессии; базовая модель эскалации, сдерживания, бринкманства;
- Сопоставление монет (Matching Pennies) — строго антагонистическая игра без равновесия в чистых стратегиях; единственное равновесие — в смешанных, что мотивирует необходимость рандомизации;
- Игра ультиматум (В. Гют, Р. Шмиттбергер, Б. Шварце, 1982) — эмпирически демонстрирует значительные отклонения от предсказаний стандартной теории, свидетельствуя о роли соображений справедливости.
Поведенческая теория игр
Экспериментальные исследования (К. Камерер и др.) выявили систематические отклонения реального поведения от предсказаний равновесной теории. В ответ были разработаны модели ограниченной стратегической рациональности:
- Иерархия уровней мышления (level-k, cognitive hierarchy; Д. Сталь, П. Уилсон, 1994; К. Камерер, Т. Хо, Ц. Чонг, 2004) — игроки отличаются глубиной рефлексии: игрок уровня 0 выбирает случайно, игрок уровня — наилучший ответ на действия игроков уровня ;
- Квантальное отклик-равновесие (Quantal Response Equilibrium, QRE; Р. Маккелви, Т. Палфри, 1995) — вероятность выбора стратегии возрастает вместе с её ожидаемым выигрышем, что отражает ошибки принятия решений;
- Модели неприятия неравенства (Э. Фер, К. Шмидт, 1999; Г. Болтон, А. Окенфельс, 2000) — учитывают предпочтение справедливого распределения выигрышей. Близкую, но самостоятельную линию составляют модели взаимности (reciprocity; М. Рабин, 1993; М. Дуфвенберг, Г. Кирхштайгер, 2004), в которых полезность зависит не только от распределения, но и от приписываемых партнёру намерений: участник готов нести издержки, чтобы вознаградить доброжелательное и наказать враждебное поведение независимо от материальных последствий.
Поведенческая теория игр сближает теоретико-игровой и когнитивно-психологический анализ, встраивая эвристики и искажения, описанные в дескриптивной теории принятия решений, в классическую формальную схему стратегического выбора. В частности, теория перспектив (Д. Канеман, А. Тверски, 1979) объясняет существенные асимметрии конфликтного поведения: угроза, поданная в рамке потерь, воздействует сильнее эквивалентного по ожидаемой стоимости обещания, поданного в рамке выигрыша, в силу неприятия потерь; переговорщик, воспринимающий уступку как потерю относительно точки отсчёта, требует за неё значительно большей компенсации, чем за эквивалентный отказ от приобретения (эффект наделённости). Эти закономерности имеют устойчивые следствия в переговорном анализе, экономике поведения и дипломатической практике.
Игра против природы и игра против противника
Методологическая связь теории игр с теорией принятия решений заключается в соотношении игры против природы (один ЛПР, пассивная среда) и игры против рационального противника. В первом случае применимы классические критерии выбора в условиях неопределённости — Вальда, Гурвица, Сэвиджа, Лапласа. Во втором предположение о пассивности среды неверно: противник стратегически приспосабливается к выбору ЛПР, что превращает минимаксный критерий из выражения пессимизма в обоснованную стратегию безопасности. Исторически этот мост был наведён А. Вальдом, строившим свою статистическую теорию решений (1945, 1950) в прямой опоре на минимаксный принцип фон Неймана: статистик рассматривается как игрок, а «природа» — как его противник, выбирающий наихудшее для статистика значение параметра. Как позднее показал Дж. Милнор в статье «Games Against Nature» (1954), критерий Вальда в игре против природы эквивалентен допущению, что природа максимизирует потери ЛПР, то есть трактуется как рациональный противник; его аксиоматическая характеризация критериев выбора (Вальда, Гурвица, Сэвиджа, Лапласа) выявляет, какие неявные предположения о «природе» скрыты за каждым из правил. Принципиальное различие остаётся в том, что реальный рациональный противник в теории игр обладает собственными целями, и на его ожидания можно стратегически воздействовать — через соглашения, обязательства и репутацию, — тогда как «противник-природа» не поддаётся стратегическому воздействию.
Это порождает принципиальный вопрос: моделировать ли внешнюю среду как «природу» или как игрока. Ответ зависит от наличия у системы собственных целей, антагонистичных или согласованных с целями ЛПР. Конкурентные рынки, военные конфликты, переговоры и политические кампании безусловно требуют теоретико-игровой трактовки; задачи логистики, управления запасами, инженерного проектирования в большинстве случаев допускают трактовку в терминах одноагентной теории решений. Промежуточные ситуации — регулирование, безопасность критической инфраструктуры, экологический менеджмент — требуют гибридного подхода, сочетающего вероятностный анализ с теоретико-игровым моделированием возможных намеренных воздействий.
Современные направления
К числу активно развивающихся направлений относятся:
- Алгоритмическая теория игр (Н. Нисан, Т. Рафгарден и др.) — изучение вычислительной сложности равновесных концепций и конструирование механизмов для многоагентных вычислительных сред. Ключевой результат о границах равновесного анализа: задача нахождения равновесия Нэша в конечных играх общего вида является PPAD-полной, причём уже для двухличных биматричных игр (К. Даскалакис, П. Голдберг, Х. Пападимитриу, 2006 — для трёх и более игроков; Х. Чен, С. Дэн, 2006 — для двух игроков), то есть предположительно не решается за полиномиальное время. Напротив, для двухличных антагонистических игр с нулевой суммой задача решается за полиномиальное время через линейное программирование (Данциг, 1951), а коррелированное равновесие по Ауманну вычислимо за полиномиальное время для конечной игры в явном представлении (К. Пападимитриу, Т. Рафгарден, 2008). Другое центральное понятие — цена анархии (price of anarchy; Э. Кутсупиас, Х. Пападимитриу, 1999) — отношение социальной стоимости наихудшего равновесия к оптимальному исходу; введённая для задач маршрутизации в сетях, она стала стандартной мерой неэффективности децентрализованного поведения;
- Механизм-дизайн (Л. Гурвиц — тот же учёный, чей критерий неопределённости фигурирует среди правил выбора «против природы»; Э. Маскин; Р. Майерсон — Нобелевская премия по экономике 2007), нередко характеризуемый как «обратная теория игр»: проектирование институтов и правил взаимодействия таким образом, чтобы равновесное поведение рациональных участников приводило к заранее заданному социально желаемому исходу, в том числе к правдивому раскрытию частной информации (условие совместимости со стимулами, incentive compatibility). Основание направления — уже упомянутый принцип откровения, позволяющий без потери общности ограничиться прямыми стимульно-совместимыми механизмами. Каноническим классом служат механизмы Викри–Кларка–Гровса (VCG; У. Викри, 1961; Э. Кларк, 1971; Т. Гровс, 1973), выбирающие социально эффективный исход; в наиболее употребительной версии Кларка–пивота платёж участника равен внешнему эффекту его участия на остальных, что делает правдивое сообщение оценок доминантной стратегией. Принципиальные границы ставит теорема Майерсона–Саттертуэйта (1983): в задаче двусторонней торговли с приватными оценками не существует механизма, одновременно эффективного, стимульно-совместимого, индивидуально-рационального и балансирующего бюджет;
- Теория паросочетаний (Д. Гейл, Л. Шепли, 1962; Э. Рот — Нобелевская премия 2012) — распределение студентов по школам, врачей-интернов по клиникам, донорских органов по пациентам;
- Теория аукционов (У. Викри — Нобелевская премия 1996 года, совместно с Дж. Миррлисом, «за фундаментальный вклад в экономическую теорию стимулов в условиях асимметричной информации»; Р. Уилсон и П. Милгром — Нобелевская премия 2020 года, «за усовершенствование теории аукционов и изобретение новых аукционных форматов») — проектирование оптимальных механизмов продажи, включая канонический аукцион Викри второй цены, в котором доминантной стратегией каждого участника служит честное сообщение собственной оценки предмета. Теорема эквивалентности выручки (Викри, 1961; формализация — Р. Майерсон, 1981) утверждает, что при независимых симметричных оценках и риск-нейтральности все стандартные форматы аукционов (первой цены, второй цены, английский, голландский) приносят продавцу одинаковую ожидаемую выручку в байесовском равновесии; прикладное значение теории проявилось в проектировании аукционов частотного спектра и других крупных общественных торгов;
- Многоагентное обучение с подкреплением — интеграция теории игр с машинным обучением, включая самообучающиеся системы для игр с полной (AlphaZero, MuZero) и неполной информацией. Канонические результаты в последнем классе — системы Н. Брауна и Т. Сандхольма: Libratus (Carnegie Mellon, 2017) обыграл профессионалов в безлимитном техасском холдеме один на один, Pluribus (Carnegie Mellon и Facebook AI, 2019) — в безлимитном холдеме на шесть игроков; до этого многопользовательский безлимитный покер считался практически недосягаемым для ИИ из-за сочетания скрытой информации, блефа и колоссального размера пространства состояний. Методологическую основу составляют контрафактическая минимизация сожаления, абстракция состояний и нейросетевая аппроксимация функций ценности;
- Теория игр безопасности (Stackelberg security games, М. Тамбе) — модели взаимодействия защитника и нападающего с применением в охране объектов, кибербезопасности и борьбе с браконьерством;
- Адверсариальный анализ рисков (Adversarial Risk Analysis, ARA; Д. Риос Инсуа, Д. Бэнкс и соавторы, 2009–2015) — байесовский анализ решений в условиях конфликта, трактующий задачу выбора против стратегического противника как одноагентную задачу максимизации ожидаемой полезности, в которой действия противника моделируются априорным распределением, согласованным с предполагаемой структурой его целей, ресурсов и убеждений. В отличие от равновесного подхода, ARA не требует общего знания рациональности и допускает каскадное моделирование «я думаю, что он думает, что я думаю» до заданного конечного уровня. Направление активно применяется в анализе антитеррористических мероприятий, защите критической инфраструктуры и кибербезопасности.
Применения
Принятие решений в условиях конфликта охватывает обширный спектр предметных областей:
- в экономике — модели олигополии (Курно, Бертран, Стакельберг), теория контрактов, промышленная организация, финансовые рынки;
- в политологии — формирование коалиций, модели голосования, теория избирательных систем;
- в международных отношениях — сдерживание, контроль над вооружениями, торговые переговоры;
- в биологии — эволюция альтруизма, брачное поведение, территориальные конфликты;
- в менеджменте — конкурентная стратегия, ценообразование, стратегические альянсы;
- в военной науке — оперативное планирование, теория сдерживания, моделирование боевых действий;
- в анализе стейкхолдеров — моделирование переговорных позиций, коалиционных структур и распределения влияния, включая количественную оценку силы участников с помощью индексов Шепли–Шубика и Банцафа;
- в искусственном интеллекте — многоагентные системы, автоматизированные переговоры, аукционы вычислительных ресурсов.
В каждой из этих областей теоретико-игровой аппарат дополняется специфическими предметными моделями, но общая методология — выделение игроков, стратегий и функций выигрыша, поиск равновесных или кооперативных решений, анализ устойчивости — остаётся инвариантной.
Место в структуре теории принятия решений
Принятие решений в условиях конфликта занимает особое положение в общей теории принятия решений. С одной стороны, оно является естественным расширением классической схемы выбора: когда исход зависит не от «природы», а от других агентов, необходимо учитывать их рациональность и собственные цели. С другой стороны, теория игр радикально меняет характер задачи выбора. Здесь отсутствует единое «рациональное решение» в том смысле, в каком оно существует в одноагентной теории; вместо этого появляется множество конкурирующих концепций — от минимакса и равновесия Нэша до значения Шепли и эволюционно устойчивой стратегии. Эта многозначность отражает принципиальную сложность понятия рациональности в многоагентных системах: оптимальное поведение одного игрока зависит от предположений о рациональности остальных, что порождает проблему общего знания рациональности (Р. Ауманн, А. Бранденбургер, 1995).
Различие между одноагентной и многоагентной теориями решений иногда формулируется как противопоставление параметрической и стратегической рациональности (Й. Эльстер, 1979, 1983). Параметрическое мышление предполагает оптимизацию в заданных внешних условиях, которые не зависят от выбора ЛПР; задача сводится к максимизации целевой функции при ограничениях. Стратегическое мышление требует учёта того, что «условия» формируются действиями других оптимизирующих агентов, которые, в свою очередь, учитывают выбор ЛПР; максимизация становится функцией от ожиданий об ожиданиях. Переход от параметрического к стратегическому анализу знаменует содержательную границу между задачами, решаемыми средствами классической теории решений, и задачами, требующими теоретико-игрового аппарата.
Интеграция теории игр и теории принятия решений прослеживается в нескольких направлениях. Во-первых, байесовская теория игр синтезирует субъективно-вероятностное рассуждение Сэвиджа с анализом стратегического поведения. Во-вторых, анализ решений распространяется на многосторонние ситуации через декомпозицию задачи и выявление предпочтений всех участников. В-третьих, методы многокритериального анализа решений обогащаются теоретико-игровыми инструментами для задач с несколькими ЛПР. Наконец, поведенческая теория игр устанавливает связь между дескриптивной теорией принятия решений (когнитивные искажения, ограниченная рациональность) и стратегическим выбором, обосновывая необходимость учёта реальных когнитивных характеристик участников при моделировании конфликтов. Таким образом, принятие решений в условиях конфликта выступает не как изолированный раздел, а как область, в которой сходятся и взаимно обогащают друг друга нормативная, дескриптивная и прескриптивная ветви теории принятия решений.
См. также
Литература
- von Neumann J. Zur Theorie der Gesellschaftsspiele // Mathematische Annalen. — 1928. — Bd. 100. — S. 295–320.
- Фон Нейман Дж., Моргенштерн О. Теория игр и экономическое поведение. — М.: Наука, 1970. — (Оригинал: 1944).
- Kuhn H.W. Extensive Games and the Problem of Information // Contributions to the Theory of Games. Vol. II / H.W. Kuhn, A.W. Tucker (eds.). — Princeton University Press, 1953. — P. 193–216.
- Luce R.D., Raiffa H. Games and Decisions: Introduction and Critical Survey. — New York: Wiley, 1957.
- Milnor J. Games Against Nature // Decision Processes / R.M. Thrall, C.H. Coombs, R.L. Davis (eds.). — New York: Wiley, 1954. — P. 49–59.
- Dantzig G.B. A Proof of the Equivalence of the Programming Problem and the Game Problem // Activity Analysis of Production and Allocation / T.C. Koopmans (ed.). — New York: Wiley, 1951. — P. 330–335.
- Nash J.F. Equilibrium Points in N-Person Games // Proceedings of the National Academy of Sciences. — 1950. — Vol. 36, No. 1. — P. 48–49.
- Nash J.F. Non-Cooperative Games // Annals of Mathematics. — 1951. — Vol. 54, No. 2. — P. 286–295.
- Nash J.F. The Bargaining Problem // Econometrica. — 1950. — Vol. 18, No. 2. — P. 155–162.
- Shapley L.S. A Value for N-Person Games // Contributions to the Theory of Games. Vol. II / H.W. Kuhn, A.W. Tucker (eds.). — Princeton University Press, 1953. — P. 307–317.
- Shapley L.S., Shubik M. A Method for Evaluating the Distribution of Power in a Committee System // American Political Science Review. — 1954. — Vol. 48, No. 3. — P. 787–792.
- Banzhaf J.F. III. Weighted Voting Doesn't Work: A Mathematical Analysis // Rutgers Law Review. — 1965. — Vol. 19, No. 2. — P. 317–343.
- Lundberg S.M., Lee S.-I. A Unified Approach to Interpreting Model Predictions // Advances in Neural Information Processing Systems. — 2017. — Vol. 30.
- Selten R. Spieltheoretische Behandlung eines Oligopolmodells mit Nachfrageträgheit // Zeitschrift für die gesamte Staatswissenschaft. — 1965. — Bd. 121. — S. 301–324, 667–689.
- Selten R. Reexamination of the Perfectness Concept for Equilibrium Points in Extensive Games // International Journal of Game Theory. — 1975. — Vol. 4, No. 1. — P. 25–55.
- Harsanyi J.C. Games with Incomplete Information Played by Bayesian Players. Parts I–III // Management Science. — 1967–1968. — Vol. 14, No. 3, 5, 7.
- Aumann R.J. Subjectivity and Correlation in Randomized Strategies // Journal of Mathematical Economics. — 1974. — Vol. 1, No. 1. — P. 67–96.
- Aumann R.J. Acceptable Points in General Cooperative N-Person Games // Contributions to the Theory of Games. Vol. IV / A.W. Tucker, R.D. Luce (eds.). — Princeton University Press, 1959. — P. 287–324.
- Aumann R., Brandenburger A. Epistemic Conditions for Nash Equilibrium // Econometrica. — 1995. — Vol. 63, No. 5. — P. 1161–1180.
- Kreps D.M., Wilson R. Sequential Equilibria // Econometrica. — 1982. — Vol. 50, No. 4. — P. 863–894.
- Myerson R.B. Refinements of the Nash Equilibrium Concept // International Journal of Game Theory. — 1978. — Vol. 7, No. 2. — P. 73–80.
- Maynard Smith J., Price G.R. The Logic of Animal Conflict // Nature. — 1973. — Vol. 246. — P. 15–18.
- Maynard Smith J. Evolution and the Theory of Games. — Cambridge University Press, 1982.
- Rubinstein A. Perfect Equilibrium in a Bargaining Model // Econometrica. — 1982. — Vol. 50, No. 1. — P. 97–109.
- Kalai E., Smorodinsky M. Other Solutions to Nash's Bargaining Problem // Econometrica. — 1975. — Vol. 43, No. 3. — P. 513–518.
- Schmeidler D. The Nucleolus of a Characteristic Function Game // SIAM Journal on Applied Mathematics. — 1969. — Vol. 17, No. 6. — P. 1163–1170.
- Bondareva O.N. Some applications of linear programming methods to the theory of cooperative games // Проблемы кибернетики. — 1963. — Вып. 10. — С. 119–139.
- Gillies D.B. Solutions to General Non-Zero-Sum Games // Contributions to the Theory of Games. Vol. IV. — Princeton University Press, 1959. — P. 47–85.
- Schelling T.C. The Strategy of Conflict. — Harvard University Press, 1960.
- Schelling T.C. Arms and Influence. — Yale University Press, 1966.
- Spence M. Job Market Signaling // Quarterly Journal of Economics. — 1973. — Vol. 87, No. 3. — P. 355–374.
- Akerlof G.A. The Market for "Lemons": Quality Uncertainty and the Market Mechanism // Quarterly Journal of Economics. — 1970. — Vol. 84, No. 3. — P. 488–500.
- Rothschild M., Stiglitz J. Equilibrium in Competitive Insurance Markets: An Essay on the Economics of Imperfect Information // Quarterly Journal of Economics. — 1976. — Vol. 90, No. 4. — P. 629–649.
- Cho I.-K., Kreps D.M. Signaling Games and Stable Equilibria // Quarterly Journal of Economics. — 1987. — Vol. 102, No. 2. — P. 179–221.
- Bernheim B.D. Rationalizable Strategic Behavior // Econometrica. — 1984. — Vol. 52, No. 4. — P. 1007–1028.
- Pearce D.G. Rationalizable Strategic Behavior and the Problem of Perfection // Econometrica. — 1984. — Vol. 52, No. 4. — P. 1029–1050.
- Mirrlees J.A. An Exploration in the Theory of Optimum Income Taxation // Review of Economic Studies. — 1971. — Vol. 38, No. 2. — P. 175–208.
- Shapley L.S. On Balanced Sets and Cores // Naval Research Logistics Quarterly. — 1967. — Vol. 14, No. 4. — P. 453–460.
- Crawford V.P. On Compulsory-Arbitration Schemes // Journal of Political Economy. — 1979. — Vol. 87, No. 1. — P. 131–159.
- Stackelberg H. von. Marktform und Gleichgewicht. — Wien; Berlin: Julius Springer, 1934.
- Elster J. Ulysses and the Sirens: Studies in Rationality and Irrationality. — Cambridge University Press, 1979.
- Elster J. Sour Grapes: Studies in the Subversion of Rationality. — Cambridge University Press, 1983.
- Axelrod R. The Evolution of Cooperation. — Basic Books, 1984.
- Fudenberg D., Maskin E. The Folk Theorem in Repeated Games with Discounting or with Incomplete Information // Econometrica. — 1986. — Vol. 54, No. 3. — P. 533–554.
- Vickrey W. Counterspeculation, Auctions, and Competitive Sealed Tenders // Journal of Finance. — 1961. — Vol. 16, No. 1. — P. 8–37.
- Myerson R.B. Optimal Auction Design // Mathematics of Operations Research. — 1981. — Vol. 6, No. 1. — P. 58–73.
- Myerson R.B. Incentive Compatibility and the Bargaining Problem // Econometrica. — 1979. — Vol. 47, No. 1. — P. 61–73.
- Gibbard A. Manipulation of Voting Schemes: A General Result // Econometrica. — 1973. — Vol. 41, No. 4. — P. 587–601.
- Dasgupta P., Hammond P., Maskin E. The Implementation of Social Choice Rules: Some General Results on Incentive Compatibility // Review of Economic Studies. — 1979. — Vol. 46, No. 2. — P. 185–216.
- Myerson R.B., Satterthwaite M.A. Efficient Mechanisms for Bilateral Trading // Journal of Economic Theory. — 1983. — Vol. 29, No. 2. — P. 265–281.
- Clarke E.H. Multipart Pricing of Public Goods // Public Choice. — 1971. — Vol. 11. — P. 17–33.
- Groves T. Incentives in Teams // Econometrica. — 1973. — Vol. 41, No. 4. — P. 617–631.
- Selten R. The Chain Store Paradox // Theory and Decision. — 1978. — Vol. 9, No. 2. — P. 127–159.
- Kreps D.M., Wilson R. Reputation and Imperfect Information // Journal of Economic Theory. — 1982. — Vol. 27, No. 2. — P. 253–279.
- Milgrom P., Roberts J. Predation, Reputation, and Entry Deterrence // Journal of Economic Theory. — 1982. — Vol. 27, No. 2. — P. 280–312.
- Aumann R.J. Agreeing to Disagree // Annals of Statistics. — 1976. — Vol. 4, No. 6. — P. 1236–1239.
- Aumann R.J. Correlated Equilibrium as an Expression of Bayesian Rationality // Econometrica. — 1987. — Vol. 55, No. 1. — P. 1–18.
- Wald A. Statistical Decision Functions which Minimize the Maximum Risk // Annals of Mathematics. — 1945. — Vol. 46, No. 2. — P. 265–280.
- Wald A. Statistical Decision Functions. — New York: Wiley, 1950.
- Harsanyi J.C., Selten R. A General Theory of Equilibrium Selection in Games. — MIT Press, 1988.
- Lucas W.F. The Proof That a Game May Not Have a Solution // Transactions of the American Mathematical Society. — 1969. — Vol. 137. — P. 219–229.
- Flood M.M. Some Experimental Games. — RAND Corporation Research Memorandum RM-789, 1952. — (Первое изложение дилеммы заключённого по экспериментам М. Флада и М. Дрешера 1950 г.)
- McKelvey R.D., Palfrey T.R. Quantal Response Equilibria for Normal Form Games // Games and Economic Behavior. — 1995. — Vol. 10, No. 1. — P. 6–38.
- Camerer C.F. Behavioral Game Theory: Experiments in Strategic Interaction. — Princeton University Press, 2003.
- Camerer C.F., Ho T.H., Chong J.K. A Cognitive Hierarchy Model of Games // Quarterly Journal of Economics. — 2004. — Vol. 119, No. 3. — P. 861–898.
- Stahl D.O., Wilson P.W. Experimental Evidence on Players' Models of Other Players // Journal of Economic Behavior and Organization. — 1994. — Vol. 25, No. 3. — P. 309–327.
- Bolton G.E., Ockenfels A. ERC: A Theory of Equity, Reciprocity, and Competition // American Economic Review. — 2000. — Vol. 90, No. 1. — P. 166–193.
- Güth W., Schmittberger R., Schwarze B. An Experimental Analysis of Ultimatum Bargaining // Journal of Economic Behavior and Organization. — 1982. — Vol. 3, No. 4. — P. 367–388.
- Dufwenberg M., Kirchsteiger G. A Theory of Sequential Reciprocity // Games and Economic Behavior. — 2004. — Vol. 47, No. 2. — P. 268–298.
- Kahneman D., Tversky A. Prospect Theory: An Analysis of Decision under Risk // Econometrica. — 1979. — Vol. 47, No. 2. — P. 263–291.
- Gale D., Shapley L.S. College Admissions and the Stability of Marriage // American Mathematical Monthly. — 1962. — Vol. 69, No. 1. — P. 9–15.
- Friedman J.W. A Non-Cooperative Equilibrium for Supergames // Review of Economic Studies. — 1971. — Vol. 38, No. 1. — P. 1–12.
- Taylor P.D., Jonker L.B. Evolutionarily Stable Strategies and Game Dynamics // Mathematical Biosciences. — 1978. — Vol. 40, No. 1–2. — P. 145–156.
- Fehr E., Schmidt K.M. A Theory of Fairness, Competition, and Cooperation // Quarterly Journal of Economics. — 1999. — Vol. 114, No. 3. — P. 817–868.
- Rabin M. Incorporating Fairness into Game Theory and Economics // American Economic Review. — 1993. — Vol. 83, No. 5. — P. 1281–1302.
- Fisher R., Ury W.L., Patton B. Getting to Yes: Negotiating Agreement Without Giving In. — 2nd ed. — Penguin, 1991. — (Первое изд.: Houghton Mifflin, 1981). — Рус. пер.: Фишер Р., Юри У. Путь к согласию, или Переговоры без поражения. — М.: Наука, 1992.
- Raiffa H. The Art and Science of Negotiation. — Harvard University Press, 1982.
- Stevens C.M. Is Compulsory Arbitration Compatible with Bargaining? // Industrial Relations. — 1966. — Vol. 5, No. 2. — P. 38–52.
- Fudenberg D., Tirole J. Perfect Bayesian Equilibrium and Sequential Equilibrium // Journal of Economic Theory. — 1991. — Vol. 53, No. 2. — P. 236–260.
- Bell D.E., Raiffa H., Tversky A. (eds.) Decision Making: Descriptive, Normative, and Prescriptive Interactions. — Cambridge University Press, 1988.
- Nisan N., Roughgarden T., Tardos E., Vazirani V.V. (eds.) Algorithmic Game Theory. — Cambridge University Press, 2007.
- Daskalakis C., Goldberg P.W., Papadimitriou C.H. The Complexity of Computing a Nash Equilibrium // SIAM Journal on Computing. — 2009. — Vol. 39, No. 1. — P. 195–259. — (Предварит. версия: STOC, 2006).
- Chen X., Deng X. Settling the Complexity of Two-Player Nash Equilibrium // Proc. 47th FOCS. — 2006. — P. 261–272.
- Koutsoupias E., Papadimitriou C.H. Worst-Case Equilibria // STACS 1999. — Lecture Notes in Computer Science. — Vol. 1563. — Springer, 1999. — P. 404–413.
- Papadimitriou C.H., Roughgarden T. Computing Correlated Equilibria in Multi-Player Games // Journal of the ACM. — 2008. — Vol. 55, No. 3. — Art. 14.
- Tambe M. Security and Game Theory: Algorithms, Deployed Systems, Lessons Learned. — Cambridge University Press, 2011.
- Ríos Insua D., Rios J., Banks D. Adversarial Risk Analysis // Journal of the American Statistical Association. — 2009. — Vol. 104, No. 486. — P. 841–854.
- Banks D.L., Ríos Aliaga J.M., Ríos Insua D. Adversarial Risk Analysis. — Boca Raton: CRC Press, 2015.
- Brown N., Sandholm T. Superhuman AI for Heads-up No-limit Poker: Libratus Beats Top Professionals // Science. — 2018. — Vol. 359, No. 6374. — P. 418–424.
- Brown N., Sandholm T. Superhuman AI for Multiplayer Poker // Science. — 2019. — Vol. 365, No. 6456. — P. 885–890.