Со времени появления системы MYCIN было предложено множество разнообразных подходов к построению моделей КД. Один из теоретических принципов был разработан Демпстером и реализован на практике Шейфером. Преимущество этого теоретического принципа состоит в моделировании процесса отбрасывания гипотез по мере накопления оценок КД. Именно такой характер носит процесс логических рассуждений при постановке медицинского диагноза, поиске неисправностей электронного оборудования и вообще при решении проблемы экспертом. Часто эксперт должен использовать факты, которые фокусируют ход его мыслей на расширенном подмножестве возможных событий, а не на единственной гипотезе. Например, в задаче идентификации инфекции выявление в препарате наличия грам-отрицательных микроорганизмов сужает множество гипотез относительно возможных инфекций до конкретного подмножества. Байесовский подход в данном случае мог бы привести к предположению о равной вероятности инфекций и дать равномерное распределение весов соответствующих фактов. Шейфер отмечает, что в подобном случае не делается никакого различия между неопределенностью (или недостаточностью знаний) и равной степенью доверия. В конечном итоге теория Демпстера-Шейфера позволяет присваивать уровни доверия как подмножествам гипотез, так и всем их отдельным элементам.
Приводится простой пример, объясняющий теоретический принцип Демпстера-Шейфера. Предположим, что Страна Х убеждена в том, что подводная лодка S, принадлежащая Стране Y, укрывается в территориальных водах Страны X. Министерство обороны Страны Х призывает своих экспертов E1, E2, … En и просит каждого из них указать возможные места пребывания S. Первые m экспертов E1, E2, … Em, m?n, называют районы L1, L2, … Lm. Каждое местоположение лодки Li при i=l,…m, есть подмножество акватории территориальных вод. Остальные эксперты Em+1, … En утверждают, что подводной лодки в территориальных водах страны Х нет, что эквивалентно высказыванию Lm+1=?,…,Ln=?.
Если министр обороны задает вопрос: “Присутствует ли S в конкретном подмножестве А акватории территориальных вод?», то возможны два случая.
Случай 1) Ei есть член подмножества А,. откуда следует, что эксперт Ei уверен в присутствии S в А.
Случай 2) Ei,?А?? откуда следует, что возможно или правдоподобно присутствие S в А.
Очевидно, что случай 1) автоматически влечет за собой случай 2).
Допустим, что министр обороны агрегирует мнения экспертов путем усреднения Тогда, если k из n экспертов проголосовали за случай 1), то средняя оценка степени уверенности (или очевидности) будет равна k/n. а если q экспертов проголосовали за случай 2). то средняя возможность будет равна q/n Если точка зрения тех экспертов, которые убеждены в отсутствии подводной лодки в территориальных водах, отвергается, то средняя степень уверенности будет равна k/m, а средняя возможность, или правдоподобность. примет значение q/m. Отклонение мнения тex экспертов, которые утверждали, что лодки в территориальных водах нет, называется нормализацией оценок
Нормализация может приводить к результатам, противоречащим интуитивным представлениям, так как эта процедура подавляет важный элемент индивидуальности мнений экспертов
Теория Демпстера — Шейфера, указывая путь к совместному определению взвешенного мнения экспертов. Например, если мнению эксперта Ei, присваивается вес Wi, то средняя нормализованная степень уверенности Рc равна
для Ej принадлежащих подмножеству A,
а средняя нормализованная возможность Рp, имеет величину
для Ej, которые могут принадлежать подмножеству A , где
для Ej , не принадлежащих A
Средняя нормализованная степень уверенности представляет собой функцию доверия по Демпстеру – Шейферу, средняя нормализованная функция возможности — правдоподобность по Демпстеру — Шейферу, а веса w1, …. wn, являются базовыми функциями вероятностей в теории Демпстера—Шейфера. Если далее министр обороны захотел бы узнать, какова вероятность Р(A) пребывания S в A, нормализованный результат имел бы вид
Pc ? P(A) ? Pp
Базовыми компонентами теории Демпстера—Шейфера являются форма представления и правило комбинирования фактов или уровней доверия к фактам. Основное ее отличие состоит в том, что коэффициент доверия не просто присваивается изолированным гипотезам, а относится также к совокупноcтям гипотез; в результате какая-то часть суммарной оценки достоверности остается не использованной применительно к какой-то отдельной гипотезе, но может быть тем не менее присвоена какой-то совокупности гипотез, возможно, содержащей в том числе и правильную. Процедура распределения уровней доверия состоит в конструировании доверительных функции на множестве гипотез?. (Это множество гипотез -взаимоисключающих и составляющих полную систему событий — называется различающим фреймом.) Доверительные функции (ДФ) представляют собой отображения мощного множества ? на единичный интервал, причем доверие к пустому множеству оценивается значением 0, а доверие к полному множеству — значением 1.
В рамках системы обнаружения и предупреждения ? может представлять собой множество наблюдаемых советских баллистических ракет, которое включает в себя подмножество стратегических оборонительных ракет и расширяющееся семейство советских мобильных ракетных установок. Классификация их может продолжаться вплоть до получения множеств, состоящих из одного элемента, соответствующих ракетам типа СС-16. СС-20. СС-25. СС-Х-24 .и т. д. Подмножества, входящие в ? образуют своего рода дерево принадлежности, в вершине которого располагается само подмножество ?, а далее оно расширяется вниз до получения одноэлементных множеств в основании В теории Демпстера—Шейфера алгоритм т назначения базовых вероятностей (НБВ) присваивает количественную оценку уровня доверия каждому элементу дерева Алгоритм НБВ соответствует ранее рассмотренному механнизму назначении весов w. Доверительная функция Ве1 (от слова belief), отвечающая усредненной при нормализации степени доверия, отражает степень достоверности подмножества. Доверительная функция Bel определяет степень доверия ко всем подмножествам гипотез А, входящий в множество ?, путем комбинирования значений m(А). Доверительная функция, относящаяся к подмножеству мобильных ракетных установок СС-16. СС-Х-24 и СС-25, будет представляться суммой базовых значений вероятностей всех подмножеств этого подмножества:
Веl({СС-16 СС-Х-24 CC-25})=m({CC-16 СС-Х-24 СС-25})+m({СС-16 СС-Х-24})+ m({СС-16 СC-25))+m({СС-Х-24 СС-25})+m({СС-16})+ m({СС-25}) m({СС-X-24})
«Неиспользованная» часть доверительной оценки образует ту ее составляющую m(?), которая относится ко всему множеству ?. Суммарный уровень незнания представляется так называемой остаточной доверительной функцией, для которой m(?)=1 и m(А)==0 по всем подмножествам А множества ?. Интервал дискретных значений доверительной функции подмножества А равен [Ве1(А), 1-Ве1(Аc)]. Ширина этого интервала характеризует степень неопределенности наших убеждений в справедливости гипотез, содержащихся в А. Например, мы могли бы связать интервал [0.5, 2] значений доверительной функции с фактом, адресующим к записанному выше подмножеству гипотез Это означало бы нашу 50% -ную уверенность в том, что наблюдаемая цель принадлежит именно этому подмножеству, и 20%-ную уверенность в обратном. При получении нового интервала значений доверительной функции от другого источника знаний мы должны будем воспользоваться правилом Демпстера для вычисления комбинированной оценки. Схема этого вычисления такова, что обновлению подлежат сразу и оценка доверия, и оценка недоверия. Такой пересчет может оказаться трудной задачей, поскольку при сочетании фактов из различных источников предполагается их независимость, а на практике это предположение может не подтверждаться.
Заде затрагивает одну серьезную проблему, связанную с использованием теории Демпстера — Шейфера: он показывает, что комбинирование фактов из различных источников может вести к выводам противоречащим интуиции. Чтобы видоизменить приведенный пример применительно к нашей военной предметной области, предположим, что сенсорное устройство А подает сигнал о принадлежности цели к классу ракет СС-16 с коэффициентом доверия 0.99 и к классу СС-20 с КД, равным 0.01, однако с вероятностью 0.99 свидетельствует о принадлежности цели к классу СС-24 Применение ортогональной суммы Демпстера—Шейфера дает нам несправедливое заключение, что коэффициент доверия. соответствующий утверждению о принадлежности цели к классу СС-20. равен 1.0. Совершенно очевидно, что здесь имеется какая-то неувязка, а источником ее служит главным образом тот факт. что в рамках теории Демпстера—Шейфера нулевые значения не подсчитываются, а относятся на счет нехватки знаний.
В той же самой статье Заде предлагает, вероятно, одну из наиболее осуществимых реализации теории Демпстера-Шейфера. Он рассматривает ее применительно к реляционным базам данных как реализацию логического вывода на множестве отношений второго порядка. Заде соотносит меры уверенности и правдоподобия со степенью достоверности (или очевидности) и возможностью появления данного запросного множества Q с целью извлечения требуемой информации из отношения второго порядка, в котором элементами данных являются распределения возможностей.
В качестве примера Заде демонстрирует базу данных о работающих сотрудниках ЕМР2. содержащую следующую информацию:
База данных ЕМР2
Категория Возраст
1 [22, 26]
2 [20, 22]
3 [30, 35]
4 [20, 22]
5 [28, 30]
В этой базе данных в случае категории 1 диапазон значений возраста определяется множеством {22, 23, 24, 25, 26). Это множество включает в себя возможные значения переменной ВОЗРАСТ (1) или, что эквивалентно, распределение возможностей для переменной ВОЗРАСТ (1). Запрос Q к этой базе данных может предусматривать получение ответа на вопрос: «Какая часть работающих удовлетворяет условию ВОЗРАСТ(i) ? Q для i=l,…,5. где Q — указываемое в запросе множество[20, 25]. Заде отмечает, что запросное множество Q и элементы данных в графе ВОЗРАСТ могут трактоваться как распределения возможностей. В этом контексте Заде утверждает, что информация, содержащаяся в базе данных, и запросы к ней могут описываться как «гранулированные объекты» с размерами «гранул», определяемыми структурой данных и запросов.
В ситуациях, когда значения атрибутов базы данных не известны со всей определенностью, удобно считать, что возможность запроса Q задается распределением возможностей. В качестве примера можно привести запрос Q вида [20, 25] и переменную ВОЗРАСТ (1) в виде [22. 26]; в этом случае возможно что B03PACT(l) ?Q; достоверно (или очевидно) что ВОЗРАСТ (4) ? О н невозможно; чтобы ВОЗРАСТ (5) ?Q. В общем виде имеем:
a) ВОЗРАСТ (i) ?Q возможен, если Di ?Q??, где ? — пустое множество, a Di распределение возможностей
b) Q достоверно (или очевидно), -если Q?D,
c) Q невозможно, если Di ?Q=?
Пересчитывая значения приведенной выше таблицы соответственно результатам ответа на запрос Q вида [20, 25]. получим:
КАТЕГОРИЯ ВОЗРАСТ ЗНАЧЕНИЕ КРИТЕРИЯ
1 [22, 26] возможно
2 [20. 22] достоверно
3 [30, 35] невозможно
4 [20, 22] достоверно
5 [28, 30] невозможно
Теперь мы можем сформулировать ответ на вопрос: «Какая часть работающих попадает по возрасту в диапазон значений 20, 21, 22, 23, 24, 25?» Ответ этот, Resp(Q), будет состоять из двух частей, одна из которых характеризует степень уверенности или очевидности N (Q), а другая — возможность ?(Q):
Resp(Q) = (N(Q); ? (Q)). В нашем случае
Resp([20, 25]) = (N([20, 25])= 2/5; ?([20, 25]) = 3/5).
Здесь достоверность тоже исчисляется как возможность. поскольку достоверность включает в себя понятие возможности. Первый элемент ответа N(Q) рассматривается в рамках теории Демпстера—Шейфера как мера доверия, а второй элемент ? (Q) — как мера правдоподобия. Если база данных ЕМР2 представлена отношением, в котором значения возраста являются одноэлементными множествами, выбранными соответственно распределениям возможностей в ЕМР2, то ответы N(Q) и P(Q) на запрос Q будут являться соответственно нижней и верхней границами.
Далее Заде показывает, что N(Q) и P(Q) могут вычисляться на основе сведений из ЕМР2, которые определяют долю работающих в возрасте, задаваемом интервальными значениями элементов в графе ВОЗРАСТ Пусть, например, ЕМР2 образуется п строками, в которых для i=1, . . ., n задается возраст Di, и Di образуется k различными множествами A1,…,Ak так, что каждое D есть одно из подмножеств Аs, s=1,…,k Тогда для рассматриваемого нами случая:
n= 5 k = 4
D1 =[22, 26] A1= [22, 26]
D2 =[20, 22] А2 =[20, 22]
D3 =[30,35] A3 = [30, 35]
D4 =[20. 22] A4 = [28, 30]
D5 = [28, 30]
Если база данных ЕМР2 представляется отношением с родительским и дочерними элементами, то получаемая сводка может быть выражена в виде гранулированного распределения ?, имеющего вид:
?={(A1,p1), (A2,p2),…,(Ak,pk)}
Здесь рs, s= 1. . . k,- это доля объектов D. которые есть Аs В нашем случае
? = {([22, 26], 1/5), ([20, 22], 2/5), ([30, 35], 1/5), ([26, 30], 1/5)}.
В конечном итоге мы можем выразить N(Q) и ?(Q) через гранулированное распределение D в виде:
Доверительная функция= N(Q)=
при этом (Q?As, s=l. . …k)
Возможность ==?(Q)= .
при этом (As?Q??, s=1,…,k).
заметим, что эта интерпретация совместима с проверенным обсуждением теории Демпстера-Шенфера и что рs, соответствуют весам w, задавая базовые функции распределения.
Можно показать, что Р(Q)=1-N(Qc), где Qc- дополнение Q. Объясняя таким образом теорию Демпстера-Шейфера, Заде вскрывает причинный механизм того, что нормализация приводит к выводам, противоречащим интуиции. Он показывает также, что в случае детерминированных атрибутов правило Демпстера-Шейфера для комбинирования фактов неприменимо, если лежащие в основе этого правила гранулированные распределения нельзя рассматривать совместно, т. е. для них должно существовать, по крайней мере, одно непротиворечивое родительское отношение. Отсюда следует, что различные законы распределения вероятностей несовместны и к ним теория Демпстера-Шейфера неприменима.
Однако несмотря на все отмеченные проблемы, эта теория все же дает целый ряд преимуществ. Но прежде чем эти преимущества можно будет извлечь, предстоит выполнить большую работу по расширению диапазона проблемных областей подобно рассмотренным нами реализациям ЭС. И все-таки даже при свойственных ему ограничениях метод Демпстера-Шейфера играет положительную роль в разработке ЭС, оперирующих неопределенностями.
В рамках большинства методов искусственного интеллекта, ориентированных на манипулирование неопределенностями, не предпринимается никаких попыток воспроизвести те механизмы, которыми пользуется человек, обрабатывая неопределенную или неточную информацию. Заде, основал отрасль теории искусственного интеллекта, названную нечеткой логикой. Цель ее создания — скомпенсировать недостаток выразительных средств, свойственный классической теории вероятностей. Делается это с помощью языка нечетких (размытых) понятий, используемых людьми для описания событий, с которыми им приходится иметь дело, и оценок вероятности их появления. Это особенно актуально применительно к неопределенностям, с которыми приходится сталкиваться в ЭС.
Аппарат теории вероятностей не позволяет формулировать высказывания, содержащие размытые понятия:
— нечеткие предикаты: высокий, старый, вспыльчивый
— нечеткие количественные характеристики: большинство, несколько, мало, обычно
— нечетко определенные события: шеф будет в несоответствующем настроении, эта статья, получит признание широкой общественности, осень своей жизни он проведет в добром здравии
— нечеткие факты: пожилые люди выглядят более солидно
— нечеткие вероятности: возможно, маловероятно, почти невероятно
— нечеткие правила: если вы хотите преуспеть в бизнесе, вам необходимо быть знакомым с широким кругом людей.
Язык нечетких категорий окружает нас всюду. Он естественен для наших рассуждений и мыслительного процесса. Мы просто думаем на этом языке. Мир делится не только на черное и белое и не всегда — только на черное, белое и серое. Иногда он приобретает оттенки пепельно-серого, голубовато-серого, графитово-серого или сажисто-серого. С целью более адекватного отображения таких когнитивных представлений Заде и придумал нечеткую логику, построенную на основе обычной теории множеств и ориентированную на преодоление еще одного ограничения классической теории вероятностей — двузначности используемой ею логики. В теории вероятностей описательный язык признает только черное и белок событие происходит или не происходит, объект принадлежит множеству или не принадлежит, элемент обладает каким-то свойством или не обладает. Что же касается теории нечетких множеств, то здесь объект не просто принадлежит или не принадлежит множеству, а характеризуется соответствующей степенью принадлежности, выражаемой единичным интервалом (0, 1), где 0 означает отсутствие принадлежности, а 1 соответствует явной принадлежности.
Рассмотрим один фундаментальный пример представления ситуации языком нечетких множеств:
Пусть В- мешок с картошкой. Какова вероятность того, что извлеченная наугад картофелина, которую вы хотите испечь, окажется очень крупной?;
Если имеется всего n картофелин р1 р1 . . ., рn то на этом множестве могут быть определена понятие ОЧЕНЬ КРУПНЫЙ (HUGE) и функция принадлежности ?huge(PI), I=1,…,N которая будет характеризовать степень крупности каждого клубня. Так, например, клубень рx, весом 430 г может иметь ?huge(PX), =0.78, В тo время как клубню рy, весом 90 г может соответствовать ?huge(PY), =0.2
Заде определил также способ выражения числа очень крупных картофелин в мешке B с использованием концепции сигма-исчисления, согласно которой это число будет равно сумме степеней принадлежности, округленной до ближайшего подходящего целого числа. Кроме того, если в мешке много мелких клубней, нежелательно, чтобы они доминировали при подсчете степени крупности, приводя к очень небольшим значениям степени принадлежности, не позволяющим проводить округление значений атрибута ОЧЕНЬ КРУПНЫЙ до целого числа. Возможно установление минимального весового порога, за которым клубни будут просто игнорироваться. Пусть для определенности в мешке находится 10 клубней н мы хотим узнать, сколько среди них очень крупных. Установим для этого порог 0,3 и все клубни, для которых ?huge меньше 0.3будут исключаться из расчета в сигма-исчислении. Если при этом значения степени принадлежности ?huge(pi)={0.78, 0.2,0.5, 0.43, 0.25, 0.64, 0.27, 0.3, 0.19, 0.8} то при установленном пороге сигма-число будет давать 3.15, или просто 3 очень крупных клубня. При отсутствии порога сигма-число было бы равно 5.08, или 5 очень крупным клубням. что говорило бы о расширении понятия «очень крупный» и включении в него клубней средних размеров.
Заде пошел дальше понятий нечеткой логики с целью разработки теории возможностей с теми же самыми конструкциями, которые присутствуют в теории вероятностей. В предыдущем примере можно построить распределение возможностей для подсчета возможности выбора очень крупного картофельного клубня. Это распределение может оказаться аналогичным распределению вероятностей Разница будет состоять лишь в интерпретации переменных и их значений.
Ну, а теперь вернемся к нашему более давнему примеру. Пусть Х — враждебная мобильная ракетная установка, принадлежащая А= {СС-20, СС-16, СС-25, СС-Х-24}. В результате наблюдений мы можем найти распределение вероятностей Pr(X?A)={0.7, 0.1, 0, 0.2} Это значит, что Х — вполне возможно, ракета ОС-20 и крайне маловероятно, что это ОС-25, поскольку иначе данный факт означал бы вопиющее нарушение договора об ограничении стратегических вооружений На основе наблюдений мы можем также установить распределение возможностей Р(X?A )={1, 1, 0.7,1} говорящее о том, что объект Х вполне может быть любой из четырех ракет, но менее всего возможно, что это СС-25 В теории возможностей каждый элемент множества может характеризоваться показателем возможности, равным 1 Одно очевидное различие между распределением возможностей и распределением вероятностей заключается в том, что сумма вероятностей должна быть равна единице, а значения возможностей могут интерпретироваться как максимальные значения вероятностей.
Заде утверждает, что теория возможностей включает в себя классическую теорию вероятностей как частный случай. Он утверждает также, что теория возможностей с ее системой аксиом и функций дает ответы на все вопросы, ставящиеся в теории вероятностей, а, кроме того, позволяет представлять нечеткую логику и нечеткие логические выводы языком теории нечетких множеств. Однако несмотря на столь очевидные потенциальные выгоды, нечеткая логика и теория возможностей пока не нашли широкого применения в экспертных системах.
