Оцифровывая значения частот из таблицы 2 и
заменяя пробелы нулями, получаем статистический ряд (см. таблицу 3).
Таблица 3
Статистический ряд по данным из таблицы 2
|
Хi |
mi |
Хi |
mi |
Хi |
mi |
|||||
|
30 |
1 |
50 |
4 |
70 |
4 |
|||||
|
31 |
0 |
51 |
2 |
71 |
5 |
|||||
|
32 |
0 |
52 |
4 |
72 |
6 |
|||||
|
33 |
1 |
53 |
4 |
73 |
3 |
|||||
|
34 |
0 |
54 |
7 |
74 |
4 |
|||||
|
35 |
1 |
55 |
2 |
75 |
1 |
|||||
|
36 |
0 |
56 |
7 |
76 |
2 |
0 |
57 |
4 |
77 |
1 |
|
38 |
0 |
58 |
6 |
78 |
0 |
|||||
|
39 |
1 |
59 |
4 |
79 |
3 |
|||||
|
40 |
0 |
60 |
5 |
80 |
1 |
|||||
|
41 |
0 |
61 |
6 |
81 |
0 |
|||||
|
42 |
2 |
62 |
6 |
82 |
1 |
|||||
|
43 |
0 |
63 |
6 |
83 |
1 |
|||||
|
44 |
1 |
64 |
9 |
84 |
1 |
|||||
|
45 |
2 |
65 |
2 |
85 |
0 |
|||||
|
46 |
3 |
66 |
3 |
86 |
1 |
|||||
|
47 |
3 |
67 |
5 |
87 |
0 |
|||||
|
48 |
2 |
68 |
7 |
88 |
0 |
|||||
|
49 |
2 |
69 |
3 |
89 |
1 |
Полученная картина остаётся всё ещё недостаточно
наглядной и компактной для эффективного визуального анализа. Компактность может
быть достигнута соответствующей группировкой данных, то есть разбиением всех
значений Хi признака Х из таблицы 3 на
интервалов
длиной ∆Х = (хmах - хmin)/S, где n - объём выборки.
Из таблицы десятичных логарифмов из Приложения
1, находим S = 8,229 ≈ 8.
∆Х = 7,4 ≈ 8,
Таким образом, разбиваем все значения НСВ Х из
таблицы 3 на восемь интервалов (групп) длиной 8 каждый, причём правая граница
предыдущего интервала служит левой границей следующего. Получаем частичные интервалы
по схеме:
Х1 ÷ Х1 + ∆Х = Х2,
Х2 ÷ Х2 + ∆Х = Х3,
…
Х8 ÷
Х8 + ∆Х = Х9.
Таблица 4
Сгруппированное распределение частот по данным рассматриваемого примера
|
Группа |
Середина группы Хс |
Фактическая частота mi |
Накопленная частота nX |
|
26 ÷ 34 |
30 |
2 |
2 |
|
34 ÷ 42 |
38 |
4 |
6 |
|
42 ÷ 50 |
46 |
17 |
23 |
|
50 ÷ 58 |
54 |
37 |
60 |
|
58 ÷ 66 |
62 |
40 |
100 |
|
66 ÷ 74 |
70 |
37 |
137 |
|
74 ÷ 82 |
78 |
9 |
146 |
|
82 ÷ 90 |
86 |
4 |
150 |
|
|
|
150 |
|
4. Графическое представление распределения
частот полученных наблюдений
Полигоном частот называют ломаную, отрезки
которой соединяют точки (Хс;mi), где Хс - середина интервала группировки, mi -
соответствующая данному интервалу частота.
Рис. А. Полигон частот
Рис. Б. Гистограмма частот
Гистограммой частот называют ступенчатую фигуру, состоящую из прямоугольников с основаниями длиной ΔХ и высотами mi.
Откладывая по оси ординат соответствующие
интервалам группировки накопленные частоты nx, получают так называемую огиву.
Нормальное распределение принимает на диаграмме огивы форму s-образной кривой.
Рис. В. Огива
5. Вычисление числовых характеристик
распределения выборочных частот
После осуществления выборки дальнейшая работа с данными строится на принципе свёртки информации - получения числовых характеристик распределения.
Одной из основных характеристик распределения, как видно из нашего примера, является тенденция наблюденных значений признака группироваться вокруг центра этого распределения. Эта характеристика называется центральной тенденцией.
Центральная тенденция обычно выражается тремя величинами:
) средней величиной, именуемой средней арифметической выборки или выборочной средней;
) средней величиной, именуемой медианой;
) наиболее часто повторяющейся величиной, именуемой модой.
Эти величины также называют характеристиками положения, так как они показывают расположение полигона частот относительно оси абсцисс.
Когда ряд наблюденных значений хотят
охарактеризовать одним значением, целесообразно бывает использовать выборочное
среднее арифметическое
.
Формула определения выборочной средней на основе
данных о распределении частот (таблица 4).
,
- число интервалов разбиения (частичных интервалов),
Хс - середина частичного интервала,- частота частичного интервала.
При некоторых формах распределения (речь идёт об эмпирическом распределении в отличие от теоретического распределения генеральной совокупности) более хорошей характеристикой положения является медиана. К таким распределениям относятся распределения, обладающие значительной асимметрией или очень удлинёнными краями.
Медиана Mе представляет собой значение признака, которое делит пополам распределение всех наблюденных значений, то есть является той точкой, выше и ниже которой лежит равное число наблюдений.
Формула определения медианы на основе распределения частот, т.е. для интервальных статистических рядов:
е =
,
- начало медианного интервала,
ΔХ - длина частичного интервала,- накопленная частота предмедианного интервала,- частота медианного интервала.
Для интервального статистического ряда под модой Мо понимается значение признака в наиболее плотном интервале (так называемом модальном интервале).
Формула определения моды на основе распределения
частот
Мо =
,
- начало модального интервала,- частота модального интервала,- частота предмодального интервала,+1 - частота постмодального интервала.
В нашем примере
=
=
60,72.
Для определения медианы интервального статистического ряда (таблица 4), по определению, необходимо выбрать интервал, в котором находится варианта, делящая ряд пополам. Это легко сделать, используя последний столбец (накопленные частоты).
Медианным интервалом нашего ряда является интервал (58 ÷ 66). Значит,
.
Значение моды
Мо = 58 + 8×
= 62.
Рассмотренные выше числовые характеристики служат для описания распределения с точки зрения тенденции наблюденных значений признака группироваться вокруг некоторого их среднего значения.
Наряду с этим всякое распределение
характеризуется также рассеянием - отклонением значений наблюденного признака
от его среднего значения. Для оценки варьирования (колеблемости) наблюденных
значений будем пользоваться только стандартным отклонением.
Таблица 5
Вспомогательная таблица для вычисления числовых характеристик распределения таблицы 4
|
Хс |
mi |
Хс mi |
Хс
- |
|
|
|
|
30 |
2 |
60 |
-30,72 |
1887,4368 |
-57982,05850 |
1781208,83700 |
|
38 |
4 |
152 |
-22,72 |
2064,7936 |
-46912,11059 |
1065843,15265 |
|
46 |
17 |
782 |
-14,72 |
3683,5328 |
-54221,60282 |
798141,99345 |
|
54 |
37 |
1998 |
-6,72 |
1670,8608 |
-11228,18458 |
75453,40035 |
|
62 |
40 |
2480 |
1,28 |
65,5360 |
83,88608 |
107,37418 |
|
70 |
37 |
2590 |
9,28 |
3186,3808 |
29569,61382 |
274406,01629 |
|
78 |
9 |
702 |
17,28 |
2687,3856 |
46438,02317 |
802449,04034 |
|
86 |
4 |
344 |
25,28 |
2556,3136 |
64623,60781 |
1633684,80539 |
|
Σ |
150 |
9108 |
… |
17802,2400 |
-29628,82560 |
6431294,61965 |
Формула определения стандартного отклонения на
основе распределения частот:
.
Для рассматриваемого интервального статистического ряда:
= 10,89.
Форма распределения обычно описывается с помощью характеристик, получивших название асимметрии и эксцесса. Вероятность получения значений, лежащих в пределах некоторого заданного интервала, частично зависит от асимметрии и эксцесса распределения.
Асимметрия, как явствует из названия, показывает, насколько несимметрично распределение, в то время как эксцесс характеризует островершинность или плосковершинность распределения (в точке максимальной частоты). Кривая может обладать большой крутизной и называться в этом случае островершинной, характеризоваться небольшой крутизной и называться плосковершинной или, наконец, иметь среднюю крутизну. Нормальная кривая обладает средней крутизной.
Коэффициент скошенности, или асимметрии, характеризует тенденцию к рассеянию в одном направлении больше, чем в другом.
Коэффициент относительной скошенности, или
выборочный коэффициент асимметрии определяется для сгруппированных данных:
.
Разумеется, для симметричного распределения sk = 0. Если значение sk меньше нуля, то большая часть ряда распределения располагается слева от оси ординат; если sk больше нуля, то справа от неё.
В нашем случае=
=
- 0,15,
что подтверждает сделанный выше вывод.
Эксцесс, напомним, характеризует
островершинность распределения. Относительный эксцесс, или выборочный
коэффициент эксцесса определяется:
.
Имеем:=
-
3 = 0,05.
Для теоретического нормального распределения
коэффициенты асимметрии и эксцесса равны нулю.
6. Проверка степени соответствия полученного
распределения выборочных частот нормальному распределению
Исчислив на основе данных нашего примера
соответствующие им числовые характеристики, мы можем сопоставить полученные
значения с параметрами нормально распределённой генеральной совокупности (см.
табл. 6). Результаты такого сопоставления говорят о том, что фактические данные
близки к теоретическим. Поскольку сопоставление основывалось на выборочных
данных, естественно было ожидать некоторого их расхождения с теоретическими.
Таблица 6
Функции результатов наблюдений и приближённые оценки нормально распределённой генеральной совокупности
|
Выборочная совокупность |
Генеральная совокупность |
||
|
|
60,72 |
μ |
60 |
|
s |
10,89 |
σ |
10 |
|
sk |
-0,15 |
α3 |
00 |
|
ex |
00,05 |
α4-3 |
00 |