1. ВВЕДЕНИЕ
Дельфи — это название набора процедур для выявления и уточнения мнений группы людей. На практике эти процедуры используются с группой экспертов или особенно осведомленных лиц.
Значение техники Дельфи следует рассматривать в контексте того, что я называю Сообществом Консультантов (Advice Community). Как промышленность, так и правительство обслуживаются большой группой консультантов, которые предоставляют информацию, прогнозы и анализы для помощи в формировании политики и принятии решений. Это сообщество представляет собой весьма разнородный набор «внутренних» советников и внешних консультантов из академических кругов, других отраслей, некоммерческих корпораций и, конечно, любых других сфер жизни, которые кажутся релевантными проблеме, стоящей перед лицом, принимающим решения. Часть этих советов основана на твердых обобщениях из наблюдений, будь то «грубого» эмпирического характера или несколько более престижных выводов из устоявшихся научных принципов. Значительная часть из них является «мнением».
Понятие мнения чрезвычайно расплывчато, но, с вашего позволения, я предпочту не пытаться его уточнять. Что касается интересов этой конференции, я полагаю, вы согласитесь, что в области долгосрочного прогнозирования технологического и социального развития присутствует особенно большая примесь мнения. Для этой области создание техник уточнения мнения представляет особый интерес.
Прагматически, основная характеристика мнения, в отличие от более твердого знания, заключается в том, что если вы опросите нескольких одинаково компетентных лиц, вы, вероятно, получите расхождение в ответах. Это, очевидно, не является определяющей характеристикой, поскольку единообразие ответа не гарантирует его надежности. С точки зрения лица, принимающего решения, расхождение оценок создает проблему, как использовать эти оценки при формировании своей политики. Существует несколько эвристических приемов, которые традиционно используются в сообществе консультантов. Один из них — выбрать одного советника по каким-либо основаниям (начиная от личной дружбы и заканчивая блеском в сообществе). Обычно это гарантирует определенное единообразие. Другой — привлечь нескольких осведомленных лиц и использовать какой-либо метод группового взаимодействия для выработки общего мнения. Самым популярным из таких методов является комитет или комиссия с различными неформальными способами достижения «общего мнения комитета».
Выбор одного советника в «мягких» областях явно чреват опасностью; с другой стороны, комитеты имеют определенные недостатки, которые были ярко продемонстрированы большим количеством исследований психологов и социологов малых групп за последние два десятилетия (1). Одним из главных недостатков является влияние доминирующей личности. Весьма убедительная группа исследований показала, что групповое мнение, вероятно, будет сильно зависеть, если не определяться, от взглядов члена группы, который больше всех говорит, и что нет значительной корреляции между успехом во влиянии на группу и компетентностью в обсуждаемой проблеме. Другая трудность, которой не уделялось столько внимания в литературе, — это «шум» — нерелевантный или избыточный материал, который затеняет непосредственно релевантный материал, предлагаемый участниками. Третья трудность — это групповое давление, которое поощряет компромисс.
2. ПРОЦЕДУРЫ ДЕЛЬФИ
Процедуры Дельфи были разработаны для уменьшения влияния этих нежелательных аспектов группового взаимодействия. Процедура имеет три отличительные характеристики:
- Анонимность.
- Контролируемая обратная связь.
- Статистический «групповой ответ».
Анонимность — это средство для уменьшения влияния социально доминирующей личности. Она поддерживается путем получения отдельных и частных ответов на подготовленные вопросы. Обычно процедура проводится с помощью письменного опросника; для некоторых упражнений использовались онлайн-компьютеры. Все остальные взаимодействия между респондентами осуществляются через формальные каналы связи, контролируемые экспериментаторами.
Контролируемая обратная связь — это средство для уменьшения шума (среди прочего). Упражнение Дельфи обычно состоит из нескольких итераций, где результаты предыдущей итерации «возвращаются» респондентам, обычно в обобщенной форме.
В качестве представителя группового мнения сообщается некоторый вид статистического индекса. В случаях, когда групповая задача заключается в оценке числовой величины, медиана индивидуальных оценок оказалась наиболее полезным индексом из опробованных на сегодняшний день. Таким образом, нет особой попытки достичь единодушия среди респондентов, и разброс мнений в последнем раунде является нормальным результатом. Это еще одно средство для уменьшения группового давления к конформизму.
Типичное упражнение начинается с опросника, который запрашивает оценки набора числовых величин, например, дат, когда будут реализованы технологические возможности, или вероятностей реализации к заданным датам, уровней производительности и тому подобное. Результаты первого раунда будут обобщены, например, как медиана и межквартильный размах ответов, и возвращены с просьбой пересмотреть первые оценки там, где это уместно. В последующих раундах тем лицам, чьи ответы заметно отклоняются от медианы (например, находятся за пределами межквартильного размаха), предлагается обосновать свои оценки. Эти обоснования обобщаются, возвращаются, и запрашиваются контраргументы. Контраргументы, в свою очередь, возвращаются, и собираются дополнительные переоценки. Этот базовый шаблон, конечно, имеет множество возможных вариантов, лишь немногие из которых были опробованы.
Процедура применялась как с материалом, где нет немедленного способа оценить результаты — например, долгосрочные технологические и социальные разработки, — так и с материалом, где есть возможность проверки, таким как краткосрочные экономические прогнозы и оценки величин, где фактические цифры доступны, обычно материал типа «альманаха». Для материала, где подтверждение возможно, типичными результатами являются то, что мнения имеют тенденцию сходиться во время эксперимента, и чаще всего медианный ответ движется в направлении истинного ответа. В случае материала, где подтверждение невозможно, все, что мы можем сказать, это то, что мнения действительно сходятся во время упражнения (2) (3).
Следует упомянуть еще одну дополнительную особенность текущих процедур Дельфи. Респондентам предлагается сделать некоторую форму самооценки по отношению к вопросам. Было опробовано несколько различных видов самооценок — ранжирование вопросов в порядке суждения респондентов об их компетентности в ответах на них; предоставление абсолютной оценки уверенности респондента в своем ответе; оценка относительной самоуверенности по отношению к некоторой референтной группе. В целом, не было обнаружено значимой корреляции между такими самооценками и индивидуальной производительностью для подтверждаемых оценок. Однако обычно удавалось использовать самооценки для выбора подгруппы относительно более уверенных лиц, где производительность подгруппы была немного, но последовательно лучше, чем у группы в целом. В одном очень тщательном исследовании улучшение было достигнуто только путем объединения двух индексов самооценки — ранжирования вопросов и абсолютных оценок уверенности (4).
3. РЕЗУЛЬТАТЫ ЭКСПЕРИМЕНТОВ
Есть много вещей, которые мы еще не понимаем в обработке информации, происходящей во время упражнения Дельфи. Так, мы пока не можем определить, какая часть сходимости обусловлена тремя различными факторами, которые явно действуют: (1) социальное давление, (2) «переосмысление» проблемы, (3) передача информации во время обратной связи. Было проведено несколько упражнений, которые проливают некоторый свет на это. В одном (5), набор из двадцати вопросов типа альманаха был предложен группе из 23 респондентов. Контрольной группе из 11 респондентов были заданы те же вопросы, но во втором раунде их просто попросили пересмотреть свои ответы, без какой-либо обратной связи. Им даже не сказали, какими были их предыдущие ответы. В целом, за исключением двух вопросов, степень сходимости была сопоставима для обеих групп, а точность ответов контрольной группы была так же хороша, как и точность ответов второго раунда экспериментальной группы. Это, по-видимому, указывает на то, что основным фактором в этом упражнении было «переосмысление». Однако влияние социального давления и/или передачи информации также указывается тем фактом, что для экспериментальной группы межквартильные размахи ответов второго раунда были единообразно содержались в межквартильных размахах первоначальных ответов, тогда как для контрольной группы диапазоны второго раунда содержались в первоначальных диапазонах только для тринадцати из двадцати вопросов.
Чтобы попытаться немного точнее определить задействованные факторы, этим летом мы провели эксперимент, сравнивающий производительность структурированных групп очного обсуждения и анонимной анкетной техники. Эксперимент руководствовался двумя предположениями. (Гипотезы — слишком претенциозное понятие в этой довольно неструктурированной теме.) Первое предположение заключалось в том, что в ситуации очного общения передача информации, вероятно, будет намного больше, чем в ситуации анонимной контролируемой коммуникации. Это предположительно должно было привести к большей точности оценок конференции. Второе предположение заключалось в том, что эффект нежелательных социальных взаимодействий можно смягчить, наложив определенный формат на обсуждения. Использовался следующий формат: для каждого вопроса случайным образом выбирался новый ведущий обсуждения; ведущий записывал на доске всю релевантную информацию (включая «мнения»), предложенную членами группы; затем он перечислял столько различных подходов (маленьких «моделей») для ответа на вопрос, сколько могла придумать группа; оценки делались по каждому подходу; и, наконец, групповой консенсус достигался путем неформального соглашения.
Предположение, которое предстояло проверить, заключалось в том, что структурированная конференция такого рода даст более точные оценки, чем анкетная техника. Эксперимент проводился с использованием группы аспирантов, занимавшихся летней консультационной деятельностью в RAND. Было десять участников, разделенных на две группы по пять человек. Было двадцать вопросов типа альманаха, разделенных на четыре набора по пять. Каждая группа участников ответила на десять вопросов с помощью анкеты и на десять — путем структурированного обсуждения. Единственным нововведением в процедуре Дельфи было введение чисто информационного раунда между первым и вторым раундами оценки. Каждому респонденту было разрешено задать группе два вопроса, и ответы группы были возвращены до того, как была сделана вторая оценка.
Основным итогом эксперимента стало то, что предположение о том, что структурированное обсуждение покажет лучшую производительность, не подтвердилось; фактически, ответы по анкете были, если уж на то пошло, несколько точнее, чем ответы структурированной конференции. Разница не была значительной, за исключением одного показателя, а именно сумм рангов стандартных оценок*, по которому анкетная техника показала себя лучше.
Для групп обсуждения не было получено адекватной меры роли доминирующих членов, шума и давления к консенсусу; но из наблюдения за обсуждениями было ясно, что наложенная структура была недостаточной для устранения этих эффектов.
Интересная аномалия проявилась в производительности анкетных групп; а именно, ответы во втором раунде были более точными, чем ответы в четвертом (и последнем) раунде. Было ли это связано с усталостью — для каждого набора из пяти вопросов весь набор ответов был получен за одну дневную сессию — или с эффектом насыщения (вся релевантная информация была получена ко второму раунду, и оценки просто «блуждали» с тех пор), определить по данным невозможно.
4. ОБСУЖДЕНИЕ
Процедуры Дельфи все еще находятся на экспериментальной стадии в отношении приложений к процессу консультирования. Накапливаются доказательства того, что систематическая обработка экспертного мнения может привести к значительным улучшениям как в точности, так и в надежности (используя понятие надежности для обозначения диапазона оценок). Однако роль процедур Дельфи в корпусе методов прогнозирования — экстраполяции, симуляции, анализа спроса, игр и т. д. — еще не установлена. В частности, нет известных мне случаев, когда процедуры Дельфи были бы явно использованы для поддержки конкретных политических решений. Следовательно, нет прямых сравнений относительной эффективности процедур по сравнению с другими, более традиционными формами консультирования. Исследования, с которыми я знаком в областях, имеющих отношение к политике, были скорее похожи на исследовательские упражнения для проверки осуществимости и «управляемости» процедур с обширными предметными областями и географически разбросанными экспертами. В этом отношении процедуры оказались управляемыми, но часто довольно громоздкими.
Распространенная реакция — представить Дельфи как метод получения входных данных для некоторой формальной структуры оценки — например, входных данных для симуляционной модели. Должен признаться, что временами я нахожу эту идею привлекательной, но она не может быть всей историей. Чаще всего, для тех областей, где данных не хватает, формальная модель также отсутствует. Фактически, процедура Дельфи — одна из самых эффективных из известных мне для «раскрытия» неявных моделей, лежащих в основе мнений в «мягких» областях. Одним из самых ценных побочных продуктов упражнения Дельфи, посвященного стратегическим бомбардировкам, был скелет модели, который позже был детально проработан (2).
Существует несколько тавтологий, которые непосредственно относятся к процессу групповой оценки: (а) Общий объем информации, доступной группе, по крайней мере, так же велик, как и доступный любому члену. (б) Медианный ответ на числовую оценку по крайней мере так же хорош, как и у половины респондентов. (в) Объем дезинформации, доступной группе, по крайней мере, так же велик, как и доступный любому члену. (Этот пункт обычно упускается из виду при обсуждении преимуществ групп перед индивидуумами.) (г) Количество подходов (или неформальных моделей) для получения оценки по крайней мере так же велико для группы, как и для любого члена. (д) Соответствующий пункт для подходов аналогичен (в) для информации. Для простоты я включил шум в дезинформацию и плохие подходы.
Эти тавтологии не складываются во что-то вроде «теории» процесса групповой оценки, но они наводят на размышления. Например, (в) и (д) намекают, что может существовать оптимальный размер группы для данного вида оценки. Это соответствовало бы некоторым экспериментальным результатам с малыми дискуссионными группами. Они также предполагают, что часть процесса групповой оценки должна быть связана с активным подавлением дезинформации, а также с «заполнением пробелов» в информации.
В настоящее время у нас нет способа определить, является ли процедура анкетирования-обратной связи чем-то вроде оптимального использования информации, доступной группе, или включает ли она механизм для снижения эффекта дезинформации. Мы также не можем сказать, используется ли она наиболее эффективно изолированно или в контексте других методологий. Короче говоря, перед нами очень большое поле, ожидающее вспашки.
* Любые мнения, выраженные в этом документе, принадлежат автору. Их не следует интерпретировать как отражение взглядов Корпорации RAND или официального мнения или политики какого-либо из ее правительственных или частных исследовательских спонсоров. Документы воспроизводятся Корпорацией RAND в качестве любезности для членов ее персонала. Этот документ был подготовлен для представления на Втором симпозиуме по долгосрочному прогнозированию и планированию, Алмагордо, Нью-Мексико, 11-12 октября 1967 г.
(1) Ссылки на литературу по малым группам можно найти в: Hare, A. P., Handbook of Small Group Research, John Wiley & Sons, New York, 1962.
(2) Dalkey, N. C., and O. Helmer, "An Experimental Application of the Delphi Method to the Use of Experts," Management Science 9 (1963).
(3) Helmer, O., Convergence of Expert Consensus Through Feedback, P-2973, The RAND Corporation, Santa Monica, California, September 1964.
(4) Brown, B., and O. Helmer, Improving the Reliability of Estimates Obtained from a Consensus of Experts, P-2986, The RAND Corporation, Santa Monica, California, September 1964.
(5) Campbell, R. M., A Methodological Study of the Utilization of Experts in Business Forecasting, Ph.D. Dissertation, University of California, Los Angeles, 1966.
* Стандартные оценки вычислялись путем деления групповой оценки на истинный ответ. 40 ответов были ранжированы по точности, и суммы этих рангов взяты для каждой конфигурации (группа, метод, набор вопросов). Анализ дисперсии для сумм рангов показал разницу между двумя методами, значимую на уровне .05.