СОДЕРЖАНИЕ
| Задача | Количественные переменные, имеющие нормальное распределение | Количественные и порядковые переменные | Качественные переменные |
| Описательные статистики | MS или Mm | Me, 25 и 75 персентиль | % |
| Сравнение двух независимых выборок | Т критерий | U критерий Манна-Уитни | Тест Фишера, 2 |
| Сравнение более двух независимых выборок | Дисперсионный анализ Фишера | Дисперсионный анализ Краскел-Уоллиса | 2 |
| Сравнение двух зависимых выборок | Парный Т критерий | Критерий Вилкоксона | Тест Мак-Немара |
| Изучение взаимосвязи между признаками | Коэффициент корреляции Пирсона | Коэффициент корреляции Спирмена | 2 |
| Предсказать изменение одного значения, если было измерено другое значение | Простая линейная или нелинейная регрессия | Непараметрическая регрессия | Простая логистическая регрессия |
| х | х1 | х2 | .... | xk |
| р | p1 | p2 | ..... | pk |
равно нулю. Очевидно, что чем больше отличаются эмпирические и теоретические частоты, тем χ2 больше; если расхождение несущественно, то χ2 должно быть малым.
Гипотезы -
Н0: Различия между двумя распределениями недостоверны.
H1: Различия между двумя распределениями достоверны.
Существуют табличные значения (см. приложение) для соответствующего числа степеней свободы К и уровня значимости
. По таблице находятся
K=k-1-r, где r - число общих характеристик теоретического распределения, принятых равными соответствующим эмпирическим.
λ - критерий Колмогорова-Смирнова
Назначение критерия
Критерий λпредназначен для сопоставления двух распределений:
а) эмпирического с теоретическим, например, равномерным или нормальным;
б) одного эмпирического распределения с другим эмпирическим распределением.
Критерий позволяет найти точку, в которой сумма накопленных расхождений между двумя распределениями является наибольшей, и оценить достоверность этого расхождения.
Если в методе χ2 мы сопоставляли частоты двух распределений отдельно по каждому разряду, то здесь мы сопоставляем сначала частоты по первому разряду, потом по сумме первого и второго разрядов, потом по сумме первого, второго и третьего разрядов и т. д. Таким образом, мы сопоставляем всякий раз накопленные к данному разряду частоты.
Гипотезы -
Н0: Различия между двумя распределениями недостоверны (судя по точке максимального накопленного расхождения между ними).
H1: Различия между двумя распределениями достоверны (судя по точке максимального накопленного расхождения между ними).
Если различия между двумя распределениями существенны, то в какой-то момент разность накопленных частот достигнет критического значения, и мы сможем признать различия статистически достоверными. В формулу критерия λ включается эта разность. Чем больше эмпирическое значение λ, тем более существенны различия.
Описательные статистики
Концепция сжатия экспериментальных данных
Графическое представление всей совокупности экспериментальных данных позволяет многими способами осмыслить длинные ряды наблюдений. Тем не менее, построение графиков и таблиц представляет собой только первый шаг при статистическом анализе данных. Следующий шаг — представление результатов в компактной форме, удобной для хранения, сопоставления с другими данными и т. д. При
этом желательно, чтобы характерные особенности распределения численностей выражались небольшим числом показателей.
Графические представления распределения численностей, рассмотренные нами ранее, очень существенно отличаются друг от друга. Однако у всех этих графиков существуют и общие характерные особенности, которые позволяют их сравнивать между coбой.
Прежде всего, видно, что все распределения группируются относительно некоторого центра. Для измерения положения этого центра существует группа показателей, носящих название мер центральной тенденции. К ним относятся средние (среднее арифметически среднее геометрическое, среднее гармоническое), мода и медиана.
Другой характерной особенностью распределений численностей является разброс экспериментальных значений относительно центра распределения. Количественная оценка этого разброса осуществляется с помощью мер рассеяния, важнейшими из которых являются размах, дисперсия, среднеквадратическое отклонение и коэффициент вариации.
Визуальный анализ графических изображений показывает, что некоторые распределения асимметричны, т. е. по обе стороны от центра расположено неравное количество значений, причем асимметрия может быть как право-, так и левосторонней. Наконец, графики некоторых распределений более заострены, а других — уплощены. Эти характерные особенности распределений экспериментальных данных — скошенность и островершинность — также могут быть описаны с помощью показателей асимметрии и эксцесса (островершинности).
Оказывается, что для описания практически любого встречающегося на практике распределения численностей достаточно этих четырех групп мер: показателей центральной тенденции, показателей рассеяния (вариации), показателей асимметрии, показателей эксцесса, вся совокупность которых получила название «статистик свертки».
Показатели центральной тенденции. Средние.
В отличие от индивидуальных числовых характеристик средние величины обладают большей устойчивостью, способностью характеризовать целую группу одним (средним) числом.
В зависимости от того, как распределены исходные данные - в равно- или неравноинтервальный вариационный ряд, для их характеристики применяют разные средние величины. Именно при распределении собранных данных в неравноинтервальный вариационный ряд более подходящей обобщающей характеристикой изучаемого объекта служит так называемая плотность распределения, т. е. отношение частот или частостей к ширине классовых интервалов. Кроме того, числовыми характеристиками таких рядов могут служить средние из абсолютных или относительных показателей плотности распределения. Средняя плотность показывает, сколько единиц данной совокупности приходится в среднем на интервал, равный единице измерения учитываемого признака.
| Число косуль | 0 | 1 | 2 | 3 | 4 | 5 | Итого 30 |
| Число учетов | 3 | 7 | 10 | 4 | 3 | 3 | |