Построение статистического ряда. Дискретный статистический ряд

Цель: научиться составлять статистические распределения выборок, строить полигоны, гистограммы, строить эмпирические функции распределения.

Математическая статистика – это раздел прикладной математики, посвящённый методам сбора, группировки и анализа статистических сведений, полученных в результате наблюдений или экспериментов.

Генеральной совокупностью называют множество объектов, однородных относительно некоторого признака.

Выборочной совокупностью (выборкой) называется совокупность случайно отобранных объектов.

Повторной называют выборку, при которой отобранный объект (перед отбором следующего) возвращается в генеральную совокупность.

Бесповторной называют выборку, при которой отобранный объект в генеральную совокупность не возвращается.

Число объектов совокупности называется её объёмом.

Выборка называется репрезентативной , если каждый объект выборки отобран случайно из генеральной совокупности, и если все объекты имеют одинаковую вероятность попасть в выборку.

Численное значение количественного признака называется вариантой .

Статистическим распределением выборки называют перечень вариант и соответствующих им частот или относительных частот .

Вариационным рядом называется ранжированный в порядке возрастания (или убывания) ряд вариант с соответствующими им частотами.

Вариационный ряд называется дискретным , если любые его варианты отличаются на постоянную величину, и – интервальным , если варианты могут отличаться одна от другой на сколь угодно малую величину.

Дискретный статистический ряд задается таблицей, в которой указываются варианты, частоты или относительные частоты их встречаемости. Графическое изображение дискретного статистического ряда называетсяполигоном частот (относительных частот). Это ломаная, в которой концы отрезков имеют координаты или , .

Пример . Закон распределения дискретного статистического рядя и полигон частот.

Интервальный статистический ряд для случайных непрерывных величин и для случайных дискретных величин при больших объемах выборок. Интервальный ряд представляет собой таблицу, в которой указаны частичные интервалы, плотности частот или плотности относительных частот. Графическое изображение интервального статистического ряда называетсягистограммой. Представляет собой ступенчатую фигуру из прямоугольников с основаниями, равными интервалам значений признака, и высотами, равными частотам интервалов.

Пример . Закон распределения интервального статистического ряда и гистограмма.

(55;60) (60;65) (65;70) (70;75) (75;80) (80;85) (85;90)

Алгоритм построения интервального ряда:

Пусть дана выборка с объёмом .

1) находим размах выборки ,

2) определяем число классов разбиения по формулам:

(формула Стерджесса для )

(формула Брукса для ),

3) находим величину классового интервала ,

4) границы частичных интервалов находим по формулам:

, , , .



5) подсчитываем частоты попадания вариант в каждый интервал.

Кумулятивная кривая (кумулята) – кривая накопленных частот. Для дискретного ряда кумулята представляет собой ломаную, соединяющую точки или , . Для интервального вариационного ряда ломаная начинается с точки, абсцисса которой равна началу первого интервала, а ордината накопленной частоте, равной 0. Другие точки соответствуют концам интервалов.

Эмпирической функцией распределения называется относительная частота того, что признак примет значение, меньшее заданного , то есть .

Для дискретного вариационного ряда эмпирическая функция представляет собой разрывную ступенчатую функцию, для интервального – совпадает с кумулятой.

Основные числовые характеристики вариационного ряда :

Среднее арифметическое вариационного ряда , где - варианты дискретного ряда или середины интервалов интервального, - соответствующие им частоты.

Основные свойства средней арифметической :

6) , где - общая средняя, - групповая средняя -той группы с объёмом , - число групп.

Дисперсия вариационного ряда .

Основные свойства дисперсии :

2) ,

3) ,

4) ,

5) , где - общая дисперсия, - групповая дисперсия, - средняя арифметическая групповых дисперсий, - межгрупповая дисперсия.

6) - дисперсия среднего значения.

Среднее квадратическое отклонение .

Коэффициент вариации .

Медиана вариационного ряда , где - начало медианного интервала, - его длина, - объём выборки, - сумма частот интервалов, предшествующих медианному, - частота медианного интервала. Для дискретного ряда медиана - значение признака, приходящееся на середину ранжированного ряда наблюдений.

Мода , где - начало модального интервала, - его длина, - частота модального интервала, и - частоты соответственно предшествующего и последующего за модальным интервалов. Для дискретного ряда мода - варианта, которой соответствует наибольшая частота.

Начальный момент -го порядка .

Центральный момент -го порядка .

Коэффициент асимметрии .

Эксцесс .

Контрольные вопросы:

1. Генеральная и выборочная совокупности, их объём.

2. Статистическое распределение выборки. Вариационный ряд.

3. Дискретный статистический ряд. Полигон частот.

4. Интервальный статистический ряд. Гистограмма.

5. Алгоритм построения интервального статистического ряда.

6. Эмпирическая функция распределения. Кумулятивная кривая.

7. Среднее арифметическое вариационного ряда и его свойства.

8. Дисперсия и её свойства. СКО.

Контрольные задания:

1.Как известно, почерк человека, в том числе наклон букв, тесно связан с его характером. Низкий наклон (30 – 40 град.) свидетельствует о вспыльчивости и возбудимости человека, излишней прямоте и торопливости в поступках; наклон 40 – 50 град. характеризует гармоническое развитие натуры; наклон 50 – 90 град. свидетельствует о самообладании, узком диапазоне увлечений.

Среди студентов института выборочно был исследован почерк 50 человек. Оказалось, что почерк у 30% присутствующих имеет низкий наклон, у 50% - наклон 40 – 50 и у 20% - наклон 50 – 90 град.

Найти распределение частот, относительных частот, построить полигон и гистограмму.

2. Дано распределение признака , полученное по наблюдениям. Необходимо:

4. Изучался рост (см) мужчин возраста 25 лет. По случайной выборке объема 35: 175, 167, 168, 169, 168, 170, 174, 173, 177, 172, 174, 167, 173, 172, 171, 171, 170, 167, 174, 177, 171, 172, 173, 169, 171, 173, 173, 168, 173, 172, 166, 164, 168, 172, 174, найти статистический интервальный ряд распределения и построить гистограмму частот.

Задания для домашней работы:

Дано распределение признака , полученное по наблюдениям. Необходимо:

1) построить (полигон) гистограмму, кумуляту и эмпирическую функцию распределения;

2) найти: среднюю арифметическую, моду и медиану, дисперсию, СКО и коэффициент вариации, начальные и центральные моменты -го порядка.

5-10 10-15 15-20 20-25 25-30 30-35 35-40

Тема №12 «Нахождение точечных и интервальных оценок параметров распределения»

Цель: научиться определять точечные и интервальные статистические оценки генеральных параметров нормального распределения по выборочным данным генеральной совокупности.

Краткие теоретические сведения:

Статистической оценкой (статистикой) неизвестного параметра q распределения генеральной совокупности называют функцию результатов наблюдений q* .

Статистическая оценка q* является случайной величиной.

Оценка, определяемая одним числом, зависящим от выборочных данных, называется точечной .

Требования, предъявляемые к точечным статистическим оценкам:

1) состоятельность (стремление по вероятности к оцениваемому параметру при ),

2) несмещённость (отсутствие систематических ошибок при любом объёме выборки (q*) = q ),

3) эффективность (среди всех возможных оценок эффективная оценка обладает наименьшей дисперсией).

Точечные оценки генеральных параметров нормально распределённой совокупности:

Интервальной оценкой называют оценку, которая определяется двумя числами – концами интервала.

Интервальные оценки позволяют установить точность и надёжность точечной оценки.

Точностью оценки называется отклонение по модулю q* от q.

Предельной ошибкой выборки называется максимально допустимое по модулю отклонение q* от q .

Надёжностью (доверительной вероятностью) оценки q* называют вероятность , с которой осуществляется неравенство |q - q*|< . Обычно = 0,95; 0,99; 0,999…

Вероятность того, что неизвестный параметр не попадёт в интервал |q - q*|< , равна - уровню значимости .

Доверительным называется интервал (q*- ;q*+ ), который покрывает неизвестный параметр с заданной надёжностью .

Интервальные оценки параметров нормального распределения:

1) Доверительный интервал для математического ожидания при известной дисперсии .

, где находят из таблицы функции Лапласа, учитывая .

2) Доверительный интервал для математического ожидания при неизвестной дисперсии .

Рис.:
, где находят из таблицы коэффициентов Стьюдента.

3) Доверительный интервал для дисперсии при известном .

< < , где , - находят при с числом степеней свободы .

4) Доверительный интервал для дисперсии при неизвестном .

, где - находят из таблицы распределения при 1- , - находят при с числом степеней свободы .

Пример 1 . Вычислить несмещённые оценки параметров генеральной совокупности по выборочным данным: 64 63 71 68 73 71 74 73 70 75 68 67 73.

,

,

.

Пример 2 . Найти доверительные интервалы для математического ожидания, дисперсии и стандартного отклонения при уровне значимости 0,05, если из генеральной совокупности сделана выборка, используемая в примере 1.

Решение. Используем данные из примера 1 для нахождения доверительного интервала для математического ожидания при неизвестной дисперсии:

,

.

Используем данные из примера 1 для нахождения доверительного интервала для дисперсии при неизвестном математическом ожидании:

,

где = ()= =4,4 и =

,

Контрольные вопросы:

1. Статистическая оценка неизвестного параметра теоретического распределения.

2. Точечная оценка.

3. Требования к точечным оценкам: несмещённость, состоятельность, эффективность.

4. Генеральная и выборочная средняя.

5. Генеральная и выборочная дисперсии.

6. Поправочный коэффициент. Исправленная выборочная дисперсия.

7. Генеральное среднеквадратическое отклонение и его точечная оценка.

8. Оценка дисперсии и СКО выборочной средней.

9. Интервальная оценка неизвестного параметра генеральной совокупности.

10. Доверительная вероятность и уровень значимости.

11. Доверительный интервал.

12. Правило нахождения доверительного интервала.

13. Доверительный интервал для математического ожидания при известной дисперсии .

14. Доверительный интервал для математического ожидания при неизвестной дисперсии .

15. Доверительный интервал для дисперсии при известном .

16. Доверительный интервал для дисперсии при неизвестном .

Контрольные задания:

1. При проверке успеваемости факультета были выборочно протестированы 50 обучаемых, распределившихся по результатам тестирования следующим образом ( - балл, - количество обучаемых с данным баллом):

Найти выборочную среднюю дистанции общения.

3. Найти разброс среднего балла в задании 1 тестирования 50 студентов.

4. Найти оценку разброса скорости чтения, распределение, которой представлено в таблице, предварительно определив относительную частоту средней скорости чтения.

5. Найти несмещённые оценки генеральной средней, дисперсии и среднеквадратического отклонения генеральной совокупности по выборке объема 12, описывающей продолжительность в секундах физической нагрузки до развития приступа стенокардии: 289, 208, 259, 243, 232, 210, 251, 246, 224, 239, 220, 211.

6. Имеется выборка объема – это значения систолического давления у мужчин в начальной стадии шока: 127, 124, 155, 129, 77, 147, 65, 109, 145, 141. Определить дисперсию и среднеквадратическое отклонение выборочной средней.

7. По схеме бесповторной выборки из 400 испытуемых в опытах Францена и Оффенлоха с применением вызванных потенциалов отобраны 100 человек и проведены замеры латентных периодов. Результаты испытаний приведены в таблице:

Задано среднее квадратическое отклонение . Найти:

а) вероятность того, что средний латентный период всех 400 человек отличается от среднего периода в выборке не более чем на 0,31 мс (по абсолютной величине),

б) границы, в которых с вероятностью заключено среднее значение латентного периода,

в) объём выборки, для которой доверительные границы с предельной ошибкой имели бы место с доверительной вероятностью .

8. Распределение ежедневных визитов Карлсона к Малышу в течение месяца показано в таблице:

Определить границы, в которых с вероятностью заключено среднее количество визитов.

9. Случайная величина имеет нормальное распределение с известным средним квадратическим отклонением =3. Найти доверительные интервалы для оценки неизвестного математического ожидания а по выборочным средним =24,5, если объём выборки и задана надёжность оценки .

10. Количественный признак генеральной совокупности распределён нормально. По выборке объёма найдены выборочная средняя =20,2 и исправленное среднее квадратическое отклонение . Оценить неизвестное математическое ожидание при помощи доверительного интервала с надёжностью 0,95.

11. Для 9 претендентов на должность руководителя была проведена оценка профессионального показателя , характеризующего способность руководить людьми. Считая показатель распределённым по нормальному закону со средним квадратическим отклонением усл. ед., определить с надёжностью доверительный интервал для истинного среднего квадратического отклонения показателя .

Задания для домашней работы:

1. Найти оценки генеральных средней, дисперсии и среднего квадратического отклонения, если совокупность задана таблицей распределения:

Оценить с надежностью 0,95 математическое ожидание нормально распределённого признака генеральной совокупности с помощью доверительного интервала.

4. Найти доверительные интервалы для математического ожидания, дисперсии и среднего квадратического отклонения при доверительной вероятности 0,95, если из генеральной совокупности сделана выборка:

67 70 69 68 74 72 66 66 74 69 72 78 67

Тема №13 «Проверка статистических гипотез о равенстве дисперсий и математических ожиданий»

Цель: научиться проверять статистические гипотезы о равенстве дисперсий и математических ожиданий нормальных генеральных совокупностей.

Краткие теоретические сведения:

Статистической называют гипотезу о виде неизвестного распределения, или о параметрах известных распределений.

Нулевой (основной) называют выдвинутую гипотезу .

Конкурирующей (альтернативной) называют гипотезу , которая противоречит нулевой.

Ошибка первого рода состоит в том, что будет отвергнута правильная гипотеза.

Ошибка второго рода состоит в том, что будет принята неправильная гипотеза.

Вероятность совершить ошибку второго рода – уровень значимости .

Статистическим критерием называют случайную величину , которая служит для проверки нулевой гипотезы.

Наблюдаемым значением называют значение критерия, вычисленное по выборкам.

Критической областью называют совокупность значений критерия, при которой нулевую гипотезу отвергают.

Область принятия гипотезы – совокупность значений критерия, при котором гипотезу принимают.

Если принадлежит критической области – гипотезу отвергают, если принадлежит области принятия гипотезы – гипотезу принимают.

Критическими точками называют точки, отделяющие критическую область от области принятия гипотезы.

Критические точки ищут, исходя из требования, что при условии справедливости нулевой гипотезы, вероятность того, что критерий попадет в критическую область, была равна принятому уровню значимости.

Для каждого критерия имеются соответствующие таблицы, по которым находят критическую точку, удовлетворяющую этому требованию.

Когда найдена, вычисляют по данным выборок и, если > (правосторонняя критическая область), < (левосторонняя), < < , < (двусторонняя), то отвергается.

Сравнение двух дисперсий нормальных генеральных совокупностей:

Пусть и распространены нормально. По независимым выборкам с объемами, соответственно равными и , извлеченным из этих совокупностей, найдены исправленные выборочные дисперсии и . Требуется по исправленным дисперсиям при заданном уровне значимости проверить нулевую гипотезу .

1) выдвигаем конкурирующую гипотезу (),

2) находим ,

3) по таблице критических точек Фишера –Снедекора находим (), где , и - объём выборки, которой соответствует , - ,

4) если , то принимаем нулевую гипотезу, в противном случае – альтернативную.

Ряды распределения

Статистические ряды распределения представляют собой упорядоченное распределение единиц совокупности по группам и группировкам. Ряды распределения изучают структуру совокупности, позволяют изучить ее однородность, размах и границы. Ряды распределения, образованные по качественным признакам, называют атрибутивными . При группировке по количественному признаку выделяются вариационные ряды. Вариационные ряды – ряды распределения единиц совокупности по признакам, имеющим количественное выражение, т. е. образованы численными значениями.

Вариационные ряды по строению делятся на:

  1. Дискретные (прерывные) – основаны на прерывных вариациях признака. Это такие ряды, где значения вариант имеют значения целых чисел (т. е. не могут принимать дробные значения). Дискретные признаки отличаются друг от друга на некоторую конкретную величину.
  2. Интервальные (непрерывные) – имеют любые, в том числе и дробные количественные выражения и представлены в виде интервалов. Непрерывные признаки могут отличаться один от другого на сколь угодно малую величину.

Вариационные ряды имеют два элемента:

  1. варианта (x)
  2. частота (f)

Варианта – отдельное значение варьируемого признака, которое он принимает в ряду распределения.

Частота – численность отдельных вариант или каждой группы вариационного ряда. В некоторых случаях применяется частость . Частоты, выраженные в % или долях процента, называются частостями и рссчитываются как отношение локальной частоты варианты к сумме накопленных частот.

В свою очередь, частота бывает:

  • локальной
  • накопленной (кумулятивная — нарастающим итогом)

Если вариационный ряд имеет неравные интервалы, то частоты в отдельных интервалах не сопоставимы, т. к. зависят от ширины интервала. В этих случаях рассчитывают плотность распределения, которая дает правильное представление о характере распределения вариант (единиц совокупности). Плотность распределения, в свою очередь, бывает:

  • абсолютная плотность распределения – отношение частоты к величине (ширине) интервала
  • относительная плотность распределения — отношение частости к ширине интервала

Интервалы

Локальная частота (f)

Накопленная частота (Σf)

Частость (ω)

Плотность распределения (φ)

20-30

0,03

30-40

0,05

40-50

0,01

50-60

0,01

Для характеристики рядов распределения применяются следующие показатели:

  • средняя степенная
  • мода
  • медиана

Пример:

Условие

Известно распределение 20 однотипных торговых точек по величине ежедневной прибыли (тыс. руб.):

11,3; 10,2; 13,9; 10,7; 11,8; 8,2; 12,4; 9,6; 13,1; 10,6; 6,3; 11,3; 10,2; 15,1; 10,5; 11,0; 15,1; 11,6; 10,4; 11,7.

  1. Составить интервальный ряд распределения.
  2. Построить гистограмму распределения плотности относительных частот.

Решение

Запишем исходные данные в виде ранжированного ряда:

6,3; 8,2; 9,6; 10,2; 10,2; 10,4; 10,5; 10,6; 10,7; 11,0; 11,3; 11,3; 11,6; 11,7; 11,8; 12,4; 13,1; 13,9; 15,1; 15,1.

Диапазон изменения вариант в выборке составляет 6–16. Этот диапазон разобьем на несколько интервалов. Ширину (шаг) интервала рассчитаем по формуле:

Следует иметь в виду, что чем меньше интервал, тем точнее результаты. В нашем случае принимаем размер интервала равным 2 единицам, то есть h=2. Зависимость между количеством групп (n) и численностью единиц совокупности (N) выражается формулой Стерджесса при условии, что данное распределение подчиняется закону нормального распределения (ЗНР) и применяются равные интервалы:

В практической работе можно использовать данные таблицы:

N 15-24 25-44 45-89 90-179 180-359 360-719 720-1439
n 5 6 7 8 9 10 11

Получаем пять интервалов: первый 6–8, второй 8–10, третий 10–12, четвертый 12–14, пятый 14–16.

Определим частоту попадания вариант выборки в каждый интервал.

В первый интервал попадает одно значение ряда: 6,3, поэтому f 1 =1. Во второй интервал попадают два значения: 8,2 и 9,6, поэтому f 2 =2. Аналогично находим f 3 =12, f 4 =3, f 5 =2. Определим относительные частоты попадания вариант выборки в каждый интервал:

в 1 интервал

во 2 интервал

в 3 интервал

в 4 интервал

в 5 интервал

Сумма относительных частот

Следовательно, вычисления выполнены верно.

Определим плотность относительных частот вариант как отношение относительной частоты (ω i) к ширине интервала (h):

для первого интервала

для второго интервала

для третьего интервала

для четвертого интервала

для пятого интервала

Результаты выполненных расчетов сводим в таблицу.

Интервальный ряд распределения прибыли предприятий

Интервал значений прибыли (h) 6 — 8 8 – 10 10 — 12 12 — 14 14 — 16
Частоты вариант (f i) 1 2 12 3 2
Относительные частоты (ω i) 0,05 0,10 0,60 0,15 0,10
Плотность относительных частот (φ i) 0,025 0,050 0,300 0,075 0,050

Гистограмма распределения

Построим гистограмму, показывающую зависимость плотности относительных частот от значения вариант. По горизонтальной оси наносим шкалу возможных значений вариант, по вертикальной оси – плотность относительных частот; величину относительной плотности считаем постоянной внутри соответствующего интервала. Получаем столбчатую диаграмму, называемую гистограммой распределения плотности относительных частот.

Смотри также

Статистический ряд распределения - упорядоченное распределение единиц совокупности на группы по определенному признаку. Он характеризует состав (структуру) изучаемого явления, позволяет судить об однородности совокупности, закономерности распределения и границах варьирования единиц совокупности.

Ряды распределения, построенные по атрибутивным (качественным) признакам, называются атрибутивными (распределение населения по полу, занятости, национальности, профессии и т.д.).

Ряды распределения, построенные по количественному признаку, называются вариационными (распределение населения по возрасту, рабочих – по стажу работы, зарплате и т.д.). Вариационные ряды распределения состоят из двух элементов: вариантов и частот. Варианты – отдельные значения признака, которые он принимает в ряду. Частоты – это численность отдельных вариантов или каждой группы вариационного ряда, т.е. это числа, показывающие, как часто встречаются те или иные варианты в ряду распределения. Сумма всех частот называется объемом совокупности и определяет число элементов всей совокупности. Частости – это частоты, выраженные в долях единиц или в % к итогу.

Вариационные ряды в зависимости от характера вариации подразделяются на дискретные и интервальные. Дискретные вариационные ряды основаны на дискретных (прерывных) признаках, имеющих только целые значения, на дискретных признаках, представленных в виде интервалов. Интервальные вариационные ряды основаны на непрерывных признаках (имеющих любые значения, даже дробные).

7. Табличное и графическое представление статистических данных.

Результаты сводки и группировки излагаются в виде таблиц. Таблица – рациональная, наглядная и компактная форма стат.материала.

Статистическая таблица – таблица, содержащая результаты подсчета практических данных и является итогом сводки первоначальной информации.

Таблица характеризует совокупность по одному или нескольким признакам, взаимосвязанным логикой.

Статистическая таблица имеет свое подлежащее и сказуемое. Подлежащее – объект, характеризующийся цифрами. Сказуемое таблицы - система показателей.

Таблицы бывают простые и сложные. В простой таблице дается простой перечень объектов. Сложная таблица содержит группировку единиц совокупности одновременно по 2-м и более признакам. Таблица д/б компактной, заголовки краткими, информация в столбцах и графах должна завершаться итоговой строкой. Графы и строки должны иметь единицы измерения, затем необходимо провести четную и логическую проверку таблицы.

Статистический график – чертеж, на котором стат.совокупности, характеризуемые определенными показателями описываются с помощью условных геометрических образов или знаков. При построении графика необходимо соблюдать требования: наглядность, выразительность, понятность. Поле графика – часть плоскости, где расположены графические образы. Виды графиков: линейные, столбиковые, полосовые, круговые, секторные, фигурные, точечные, объемные, применяются диаграммы и стат.карты. Картограмма – схематическая географическая карта, на которой выделены отрасли промышленности или структура состава населения.

Что такое группировка статистических данных, и как она связана с рядами распределения, было рассмотрено этой лекции, там же можно узнать, о том что такое дискретный и вариационный ряд распределения.

Ряды распределения одна из разновидностей статистических рядов (кроме них в статистике используются ряды динамики), используются для анализа данных о явлениях общественной жизни. Построение вариационных рядов вполне посильная задача для каждого. Однако есть правила, которые необходимо помнить.

Как построить дискретный вариационный ряд распределения

Пример 1. Имеются данные о количестве детей в 20 обследованных семьях. Построить дискретный вариационный ряд распределения семей по числу детей .

0 1 2 3 1
2 1 2 1 0
4 3 2 1 1
1 0 1 0 2

Решение:

  1. Начнем с макета таблицы, в которую затем мы внесем данные. Так как ряды распределения имеют два элемента, то таблица состоять будет из двух колонок. Первая колонка это всегда варианта – то, что мы изучаем – ее название берем из задания (конец предложения с заданием в условиях) — по числу детей – значит наша варианта это число детей.

Вторая колонка это частота – как часто встречается наша варианта в исследуемом явление – название колонки так же берем из задания — распределения семей – значит наша частота это число семей с соответствующим количеством детей.

  1. Теперь из исходных данных выберем те значения, которые встречаются хотя бы один раз. В нашем случае это

И расставим эти данные в первой колонке нашей таблицы в логическом порядке, в данном случае возрастающем от 0 до 4. Получаем

И в заключение подсчитаем, сколько же раз встречается каждое значение варианты.

0 1 2 3 1

2 1 2 1 0

4 3 2 1 1

1 0 1 0 2

В результате получаем законченную табличку или требуемый ряд распределения семей по количеству детей.

Задание . Имеются данные о тарифных разрядах 30 рабочих предприятия. Построить дискретный вариационный ряд распределения рабочих по тарифному разряду. 2 3 2 4 4 5 5 4 6 3

1 4 4 5 5 6 4 3 2 3

4 5 4 5 5 6 6 3 3 4

Как построить интервальный вариационный ряд распределения

Построим интервальный ряд распределения, и посмотрим чем же его построение отличается от дискретного ряда.

Пример 2. Имеются данные о величине полученной прибыли 16 предприятий, млн. руб. — 23 48 57 12 118 9 16 22 27 48 56 87 45 98 88 63. Построить интервальный вариационный ряд распределения предприятий по объему прибыли, выделив 3 группы с равными интервалами.

Общий принцип построения ряда, конечно же, сохраниться, те же две колонки, те же варианта и частота, но в здесь варианта будет располагаться в интервале и подсчет частот будет вестись иначе.

Решение:

  1. Начнем аналогично предыдущей задачи с построения макета таблицы, в которую затем мы внесем данные. Так как ряды распределения имеют два элемента, то таблица состоять будет из двух колонок. Первая колонка это всегда варианта – то, что мы изучаем – ее название берем из задания (конец предложения с заданием в условиях) — по объему прибыли – значит, наша варианта это объем полученной прибыли.

Вторая колонка это частота – как часто встречается наша варианта в исследуемом явление – название колонки так же берем из задания — распределения предприятий – значит наша частота это число предприятий с соответствующей прибылью, в данном случае попадающие в интервал.

В итоге макет нашей таблицы будет выглядеть так:

где i – величина или длинна интервала,

Хmax и Xmin – максимальное и минимальное значение признака,

n – требуемое число групп по условию задачи.

Рассчитаем величину интервала для нашего примера. Для этого среди исходных данных найдем самое большое и самое маленькое

23 48 57 12 118 9 16 22 27 48 56 87 45 98 88 63 – максимальное значение 118 млн. руб., и минимальное 9 млн. руб. Проведем расчет по формуле.

В расчете получили число 36,(3) три в периоде, в таких ситуациях величину интервала нужно округлить до большего, чтобы после подсчетов не потерялось максимальное данное, именно поэтому в расчете величина интервала 36,4 млн. руб.

  1. Теперь построим интервалы – наши варианты в данной задаче. Первый интервал начинают строить от минимального значения к нему добавляется величина интервала и получается верхняя граница первого интервала. Затем верхняя граница первого интервала становится нижней границей второго интервала, к ней добавляется величина интервала и получается второй интервал. И так далее столько раз сколько требуется построить интервалов по условию.

Обратим внимание если бы мы не округлили величину интервала до 36,4, а оставили бы ее 36,3, то последнее значение у нас бы получилось 117,9. Именно для того чтобы не было потери данных необходимо округлять величину интервала до большего значения.

  1. Проведем подсчет количества предприятий попавших в каждый конкретный интервал. При обработке данных необходимо помнить, что верхнее значение интервала в данном интервале не учитывается (не включается в этот интервал), а учитывается в следующем интервале (нижняя граница интервала включается в данный интервал, а верхняя не включается), за исключением последнего интервала.

При проведении обработки данных лучше всего отобранные данные обозначить условными значками или цветом, для упрощения обработки.

23 48 57 12 118 9 16 22

27 48 56 87 45 98 88 63

Первый интервал обозначим желтым цветом – и определим сколько данных попадает в интервал от 9 до 45,4, при этом данное 45,4 будет учитываться во втором интервале (при условии что оно есть в данных) – в итоге получаем 7 предприятий в первом интервале. И так дальше по всем интервалам.

  1. (дополнительное действие ) Проведем подсчет общего объема прибыли полученного предприятиями по каждому интервалу и в целом. Для этого сложим данные отмеченные разными цветами и получим суммарное значение прибыли.

По первому интервалу — 23 + 12 + 9 + 16 + 22 + 27 + 45 = 154 млн. руб.

По второму интервалу — 48 + 57 + 48 + 56 + 63 = 272 млн. руб.

По третьему интервалу — 118 + 87 + 98 + 88 = 391 млн. руб.

Задание . Имеются данные о величине вклада в банке 30 вкладчиков, тыс. руб. 150, 120, 300, 650, 1500, 900, 450, 500, 380, 440,

600, 80, 150, 180, 250, 350, 90, 470, 1100, 800,

500, 520, 480, 630, 650, 670, 220, 140, 680, 320

Построить интервальный вариационный ряд распределения вкладчиков, по размеру вклада выделив 4 группы с равными интервалами. По каждой группе подсчитать общий размер вкладов.

Пусть из генеральной совокупности извлечена выборка, причем х 1 наблюдалось п 1 раз, х 2 - п 2 раз, х к - п к раз и - объем выборки. Наблюдаемые значения х 1 называют вариантами, а последовательность вариант, записанных в возрастающем порядке - вариационным рядом .

Число наблюдений варианты называют частотой, а ее отношение к объему выборки - относительной частотой .

Определение. Статистическим (эмпирическим) законом распределения выборки, или просто статистическим распределением выборки называют последовательность вариант и соответствующих им частот п i или относительных частот .

Статистическое распределение выборки удобно представлять в форме таблицы распределения частот, называемой статистическим дискретным рядом распределения:

(сумма всех относительных частот равна единице ).

Пример 1 . При измерениях в однородных группах обследуемых получены следующие выборки: 71, 72, 74, 70, 70, 72, 71, 74, 71, 72, 71, 73, 72, 72, 72, 74, 72, 73, 72,74 (частота пульса). Составить по этим результатам статистический ряд распределения частот и относительных частот.

Решение. 1) Статистический ряд распределения частот:

Контроль: 0,1 + 0,2 + 0,4 + 0,1 + 0,2 = 1.

Полигоном частот называют ломаную, отрезки, которой соединяют точки Для построения полигона частот на оси абсцисс откладывают варианты х 2 , а на оси ординат - соответствующие им частоты п i . Точки соединяют отрезками и получают полигон частот.

Полигоном относительных частот называют ломаную, отрезки, которой соединяют точки . Для построения полигона относительных частот на оси абсцисс откладывают варианты х i , а на оси ординат соответствующие им частоты w i . Точки соединяют отрезками и получают полигон относительных частот

Пример 2. Постройте полигон частот и полигон относительных частот по данным примера 1.

Решение: Используя дискретный статистический ряд распределения, составленный в примере 1 построим полигон частот и полигон относительных частот:


2. Статистический интервальный ряд распределения. Гистограмма .

Статистическим дискретным рядом (или эмпирической функцией распределения) обычно пользуются в том случае, когда отличных друг от друга вариант в выборке не слишком много, или тогда, когда дискретность по тем или иным причинам существенна для исследователя. Если же интерисующий нас признак генеральной совокупности Х распределен непрерывно или его дискретность нецелесообразно (или невозможно) учитывать, то варианты группируются в интервалы.


Статистическое распределение можно задать также в виде последовательности интервалов и соответствующих им частот (в качестве частоты, соответствующей интервалу, принимают сумму частот, попавших в этот интервал).

1. R(размах) = X max -X min

2. k- число групп

3. (формула Стерджеса)

4. a = x min , b = x max

Полученную группировку удобно представить в форме частотной таблицы, которая носит название статистический интервальный ряд распределения:

Интервалы группировки ...
Частоты ...

Аналогическую таблицу можно образовать, заменяя частоты n i относительными частотами.