Как мы уже убедились, любые методы математического моделирования требуют предварительного создания той или иной матрицы со статистически несовпадающими строками. И если при активном эксперименте такие матрицы (планы эксперимента) создаются в ходе самой работы, то для пассивного эксперимента создание такой матрицы представляет определенные трудности. Покажем один из методов разбиения многомерных пассивных экспериментальных данных на статистически однородные группы для гарантированного получения матрицы данных со статистически несовпадающими строками.
Под статистической группировкой принято понимать сведение анализируемых статистических данных в однородные группы на основе существенных для них признаков. Если группа одна – это просто однородная статистическая совокупность, а если число групп две и более – мы говорим о группировке. Понятно, что сами группы между собой (одна по отношению к другой) разнородны. Однородность же рассматривается как критерий образования каждой отдельной группы, то есть критерий, на основе которого элементы статистической совокупности объединяются в одну группу.
Однородность следует понимать как совокупность качественных и количественных характеристик. Однородность группы статистических наблюдений, определяемую на основе количественного признака, будем называть количественной (или просто статистической) однородностью, а на основе качественного признака – качественной однородностью (однотипностью). Качественная и количественная однородность являются необходимым и достаточным условиями однородности статистических наблюдений. На первом этапе проверки однородности следует доказывать необходимое условие – однокачественность анализируемых явлений, а затем уже решается задача проверки количественной однородности. Количественная однородность только тогда имеет смысл, когда отражает единство качества и количества, то есть является мерой такого единства. Отклонения от неё свидетельствуют о переходе одного качества в другое на основе накопленных качественных и количественных изменений.
Рассмотрим процедуру определения количественной однородности. Пусть имеется одномерная выборка случайной величины X объемом n. Разобьем исходную выборку случайным образом на две с объемами n1 и n2, причём n1+n2=n. Тогда для любых n1=1, 2,…, (n-1) и n2=(n-1), (n-2),…, 1, образующих множество всевозможных разбиений исходной совокупности P2, можно найти функцию
где r2 — подмножество разбиений статистической совокупности на всем множестве P2.
Эта функция позволяет проверить нулевую гипотезу
против альтернативной гипотезы
Такой подход использован в t-статистике Стьюдента при проверке равенства центров распределения двух выборок (см. раздел 1.4)
где
— средневзвешенная дисперсия.
В реальных исследованиях статистические наблюдения, как правило, проводятся не по одному, а по нескольким признакам одновременно. Если обозначить число таких признаков m, то статистическая совокупность предстанет исходной матрицей порядка n?m, где каждая i-я строка может быть записана в виде {Xi1, Xi2, …, Xim}. Тогда критерием для проверки гипотезы об однородности двух m-мерных выборок, образованных по тому же принципу, что и для (9.20), можно принять функцию
где
,
— средние арифметическое j-го признака выборок с объемами n1 и n2 соответственно;
Произведя соответствующие преобразования и заменив для удобства расчетов
, а
, получим формулу функции
Если при формировании исходной матрицы данных соблюдаются некоторые ограничения, а именно: имеет место независимость случайных величин {Xij}, образующих i-ю вектор-строку, и равенство дисперсий одномерных случайных величин, соответствующих j-му признаку, для любых подмножеств r2 (то есть, для любых сочетаний объемов выборок l и n — l), то функция (9.22) распределена по закону c2 с m степенями свободы. Тогда нулевая гипотеза об однородности всех строк матрицы может быть принята при выполнении неравенств
где q — желаемый уровень значимости (в табл. П1 Приложения величина q в данном случае совпадает с P(c2)). В противном случае принимается альтернативная гипотеза о существенной неоднородности хотя бы одной строки исходной матрицы данных.
Таким образом, алгоритм расчета – проверки однородности m-мерной статистической совокупности – заключается в следующем. Исходный статистический материал ранжируется (упорядочивается) по наиболее существенному из набора m признаку. Затем в соответствии с выражениями (9.22) и (9.23) осуществляется последовательный расчет критерия U(r2) для последовательностей l и n—l (l=1, 2, …, n-1) и сравнение его с критическим значением c2 при уровне значимости q и m степени свободы. Если выполняется условие (9.23), то совокупность признается однородной (принимается нулевая гипотеза). Если условие (9.23) не выполняется, то совокупность признается неоднородной (принимается альтернативная гипотеза) и должна быть разбита по крайней мере на две группы.
Разбиение (разграничение) неоднородной статистической совокупности на однородные отличающиеся друг от друга группы должно базироваться на том варианте разбиения m-мерной совокупности, при котором достигается максимальное различие в комплексе признаков. Тогда исходная матрица разбивается на две группы по строке с U(r2)=max. Каждая из полученных таким образом групп m-мерных наблюдений снова проверяется на однородность.
Если обе группы окажутся однородными, то интервал группировки (граница разбиения исходного пространства) только один, процесс группировки на этом заканчивается. Если же гипотеза об однородности отвергается хотя бы для одной из групп, то эту группу нужно разделить на две части по максимальному значению критерия (9.22) и каждую из частей в отдельности снова подвергнуть проверке на однородность. Процедура такого деления неоднородной статистической совокупности продолжается до тех пор, пока все образованные группы не будут признаны однородными.
Критерий (9.22) приспособлен для деления неоднородной совокупности только на две части. Поэтому, когда число однородных групп больше двух, процесс последовательного дробления исходной совокупности может привести к появлению статистически неустойчивых границ между однородными группами. Выявление таких межгрупповых границ и их устранение из первоначально полученной группировки приводит к определению ее действительных интервалов.
