Измерьте одну и ту же величину двадцать раз, и вы не получите одинаковый результат двадцать раз. Двадцать студентов измеряют один и тот же стол. Значения различаются. Это не…
Английское озвучивание · Английский + китайские субтитры (встроенные)
1.1
Введение в статистику: Что мы можем узнать из данных?
Программа
Вечная идея (VAR-1): Поскольку вариация может быть случайной или нет, выводы остаются неопределенными.
Цель обучения VAR-1.A: Сформулировать вопросы для ответа на основе вариации в одномерных данных. [Навык 1.A]
VAR-1.A.1 Числа могут передавать значимую информацию, когда помещены в контекст.
Источник: Описание курса и экзамена College Board AP
Статистика — это наука получения знаний из данных — чисел или меток, собранных в реальном мире. Данные варьируются, поэтому мы описываем паттерны и учитываем вариацию, а не ожидаем совпадения каждого значения. Статистический вопрос предполагает ответ, основанный на данных, которые варьируются.
Два различения проходят через весь курс. Параметр — это числовое обобщение всей популяции; статистика (statistic) — это числовое обобщение выборки — мы используем статистику для оценки параметра, который не можем измерить напрямую. И описательная статистика только резюмирует имеющийся набор данных, тогда как инференциальная статистика использует выборку для выдвижения и проверки заявлений о большей популяции.
Вечная идея (VAR-1): Поскольку вариация может быть случайной или нет, выводы остаются неопределенными.
Цель обучения VAR-1.B: Идентифицировать переменные в наборе данных. [Навык 2.A]
VAR-1.B.1 Переменная — это характеристика, которая меняется от одного индивида к другому.
Цель обучения VAR-1.C: Классифицировать типы переменных. [Навык 2.A]
VAR-1.C.1 Категориальная переменная принимает значения, являющиеся названиями категорий или метками групп.
VAR-1.C.2 Количественная переменная — это та, которая принимает числовые значения для измеренного или подсчитанного количества.
Иллюстративные примеры для VAR-1.C:
Категориальные переменные:
Доминирующая рука
Возрастная группа (молодая или старая)
Высшая полученная степень
Количественные переменные:
Возраст сооружения
Рост ребенка
Концентрация образца
Источник: Описание курса и экзамена College Board AP
Переменная — это характеристика, которая может отличаться между людьми. Два вида:
Категориальная (качественная): значения являются метками/группами (цвет глаз, бренд).
Количественная: значения — это числа, с которыми можно выполнять арифметические операции (рост, возраст). Количественные переменные бывают дискретными (подсчитываются) или непрерывными (измеряются).
Выбор правильного графика и сводной таблицы зависит от того, какой вид переменной у вас есть.
Исследовать
Категориальная или количественная?
Каждая переменная либо категориальная (она присваивает каждому элементу группу), либо количественная (измеряемое число, которое можно усреднить). То, какой она является, определяет графики и сводки, которые вы можете использовать.
1.3
Представление категориальной переменной с помощью таблиц
Программа
Постоянное понимание (UNC-1): Графические представления и статистика позволяют нам выявлять и отображать ключевые особенности данных.
Цель обучения UNC-1.A: Представлять категориальные данные с помощью таблиц частот или относительных частот. [Навык 2.B]
UNC-1.A.1 Таблица частот показывает количество случаев, попадающих в каждую категорию. Таблица относительных частот показывает долю случаев, попадающих в каждую категорию.
Цель обучения UNC-1.B: Описывать категориальные данные, представленные в таблицах частот или относительных частот. [Навык 2.A]
UNC-1.B.1 Проценты, относительные частоты и ставки предоставляют ту же информацию, что и пропорции.
UNC-1.B.2 Количество и относительные частоты категориальных данных раскрывают информацию, которая может быть использована для обоснования утверждений о данных в контексте.
Источник: Описание курса и экзамена College Board AP
Частотная таблица перечисляет счетчик (частоту) каждой категории; таблица относительных частот перечисляет пропорцию каждой категории (счетчик ÷ всего). Относительные частоты позволяют справедливо сравнивать группы разного размера.
1.4
Представление категориальной переменной с помощью графиков
Программа
Постоянное понимание (UNC-1): Графические представления и статистика позволяют нам выявлять и отображать ключевые особенности данных.
Цель обучения UNC-1.C: Представлять категориальные данные графически. [Навык 2.B]
UNC-1.C.1 Столбчатые диаграммы (или гистограммы) используются для отображения частот (количеств) или относительных частот (пропорций) для категориальных данных.
UNC-1.C.2 Высота или длина каждого столбца на столбчатой диаграмме соответствует либо количеству, либо доле наблюдений, попадающих в каждую категорию.
UNC-1.C.3 Существует множество дополнительных способов представления частот (количеств) или относительных частот (пропорций) для категориальных данных.
Цель обучения UNC-1.D: Описывать категориальные данные, представленные графически. [Навык 2.A]
UNC-1.D.1 Графические представления категориальной переменной раскрывают информацию, которая может быть использована для обоснования утверждений о данных в контексте.
Цель обучения UNC-1.E: Сравнивать несколько наборов категориальных данных. [Навык 2.D]
UNC-1.E.1 Таблицы частот, столбчатые диаграммы или другие представления могут использоваться для сравнения двух или более наборов данных по одной и той же категориальной переменной.
Источник: Описание курса и экзамена College Board AP
Столбчатая диаграмма показывает счетчик или пропорцию каждой категории в виде отдельных столбцов; круговая диаграмма показывает долю каждой категории от целого. Высота столбцов (или секторов) позволяет сравнить категории одним взглядом. Столбцы могут быть упорядочены по размеру или по естественному порядку категорий.
Исследовать
Покажите категориальную переменную в виде круговой диаграммы
Круговая диаграмма превращает долю каждой категории в целое в кусок пирога: большая доля — большой кусок, и все куски вместе составляют 100%. Это изображение таблицы относительной частоты.
1.5
Представление количественной переменной с помощью графиков
Программа
Постоянное понимание (UNC-1): Графические представления и статистика позволяют нам выявлять и отображать ключевые особенности данных.
Цель обучения UNC-1.F: Классифицировать типы количественных переменных. [Навык 2.A]
UNC-1.F.1 Дискретная переменная может принимать конечное или счетно-бесконечное число значений, например, натуральные числа при подсчете.
UNC-1.F.2 Непрерывная переменная может принимать бесконечно много значений, но эти значения нельзя пересчитать. Как бы мал ни был интервал между двумя значениями непрерывной переменной, всегда можно определить другое значение между ними.
Иллюстративные примеры для UNC-1.F:
Дискретная переменная:
Количество студентов в классе
Непрерывная переменная:
Рост ребенка
Цель обучения UNC-1.G: Представлять количественные данные графически. [Навык 2.B]
UNC-1.G.1 На гистограмме высота каждого столбца показывает количество или долю наблюдений, попадающих в интервал, соответствующий этому столбцу. Изменение ширины интервалов может изменить внешний вид гистограммы.
UNC-1.G.2 В диаграмме «стебель и листья» каждое значение данных разделяется на «стебель» (первая цифра или цифры) и «лист» (обычно последняя цифра).
UNC-1.G.3 Точечная диаграмма представляет каждое наблюдение точкой, положение которой на горизонтальной оси соответствует значению данных этого наблюдения; почти идентичные значения располагаются друг над другом.
UNC-1.G.4 Кумулятивный график представляет количество или долю набора данных, меньших или равных заданному числу.
UNC-1.G.5 Существует множество дополнительных способов графического представления распределения количественных данных.
Источник: Описание курса и экзамена College Board AP
Для чисел используйте точечный график, стебель-листья или гистограмму (столбцы над интервалами значений, называемыми бинами). Они показывают распределение — как значения разбросаны. Ширина бина гистограммы меняет картину, поэтому выбирайте её так, чтобы раскрыть форму.
На гистограмме с неравными классами площадь столбца равна частоте
Исследовать
Исследуйте, как ширина интервала формирует гистограмму
Гистограмма группирует данные в равные интервалы и рисует столбец над каждым. Измените интервалы и заметьте, как одни и те же данные могут выглядеть рваными (слишком узкие) или гладкими (слишком широкие) — форма является выбором.
Постоянное понимание (UNC-1): Графические представления и статистика позволяют нам выявлять и отображать ключевые особенности данных.
Цель обучения UNC-1.H: Описывать характеристики распределений количественных данных. [Навык 2.A]
UNC-1.H.1 Описание распределения количественных данных включает форму, центр и изменчивость (разброс), а также любые необычные особенности, такие как выбросы, разрывы, скопления или множественные пики.
UNC-1.H.2 Выбросы для одномерных данных — это точки данных, которые являются необычно маленькими или большими по сравнению с остальными данными.
UNC-1.H.3 Распределение имеет правый скос (положительный скос), если правый хвост длиннее левого. Распределение имеет левый скос (отрицательный скос), если левый хвост длиннее правого. Распределение является симметричным, если левая половина является зеркальным отражением правой половины.
UNC-1.H.4 Одномерные графики с одним основным пиком называются унимодальными. Графики с двумя выраженными пиками — бимодальными. График, где высота каждого столбца примерно одинакова (нет выраженных пиков), называется приблизительно равномерным.
UNC-1.H.5 Разрыв — это область распределения между двумя значениями данных, где нет наблюдаемых данных.
UNC-1.H.6 Скопления — это концентрации данных, обычно разделенные разрывами.
UNC-1.H.7 Описательная статистика не приписывает свойства выборки большей совокупности, но может служить основой для выдвижения гипотез для последующей проверки.
Источник: Описание курса и экзамена College Board AP
Опишите четыре вещи (запомните SOCS):
Форма: симметричная или асимметричная влево/вправо (длинный хвост с этой стороны) и количество пиков — один основной пик является унимодальным, два выраженных пика — бимодальным, а примерно равные столбцы — равномерным.
Аномалии (outliers): необычные значения, далеко от остальных.
Центр: типичное значение (среднее или медиана).
Разброс: насколько значения различаются (размах, межквартильный размах, стандартное отклонение).
Всегда описывайте форму/центр/разброс в контексте, указывая единицы измерения.
Форма распределения: симметричное, скошенное вправо (длинный правый хвост) или скошенное влево
UNC-1
Graphical representations and statistics allow us to identify and represent key features of data.
UNC-1.I
Calculate measures of center and position for quantitative data. [Skill 2.C]
UNC-1.I.1 A statistic is a numerical summary of sample data.
UNC-1.I.2 The mean is the sum of all the data values divided by the number of values. For a sample, the mean is denoted by $x$-bar: $\bar{x} = \dfrac{1}{n}\sum_{i=1}^{n} x_i$, where $x_i$ represents the $i^{\text{th}}$ data point in the sample and $n$ represents the number of data values in the sample.
UNC-1.I.3 The median of a data set is the middle value when data are ordered. When the number of data points is even, the median can take on any value between the two middle values. In AP Statistics, the most commonly used value for the median of a data set with an even number of values is the average of the two middle values.
UNC-1.I.4 The first quartile, Q1, is the median of the half of the ordered data set from the minimum to the position of the median. The third quartile, Q3, is the median of the half of the ordered data set from the position of the median to the maximum. Q1 and Q3 form the boundaries for the middle 50% of values in an ordered data set.
UNC-1.I.5 The $p^{\text{th}}$ percentile is interpreted as the value that has $p\%$ of the data less than or equal to it.
UNC-1.J
Calculate measures of variability for quantitative data. [Skill 2.C]
UNC-1.J.1 Three commonly used measures of variability (or spread) in a distribution are the range, interquartile range, and standard deviation.
UNC-1.J.2 The range is defined as the difference between the maximum data value and the minimum data value. The interquartile range (IQR) is defined as the difference between the third and first quartiles: $Q3 - Q1$. Both the range and the interquartile range are possible ways of measuring variability of the distribution of a quantitative variable.
UNC-1.J.3 Standard deviation is a way to measure variability of the distribution of a quantitative variable. For a sample, the standard deviation is denoted by $s$: $s_x = \sqrt{\dfrac{1}{n-1}\sum(x_i - \bar{x})^2}$. The square of the sample standard deviation, $s^2$, is called the sample variance.
UNC-1.J.4 Changing units of measurement affects the values of the calculated statistics.
UNC-1.K
Explain the selection of a particular measure of center and/or variability for describing a set of quantitative data. [Skill 4.B]
UNC-1.K.1 There are many methods for determining outliers. Two methods frequently used in this course are:
UNC-1.K.1.i An outlier is a value greater than $1.5 \times \text{IQR}$ above the third quartile or more than $1.5 \times \text{IQR}$ below the first quartile.
UNC-1.K.1.ii An outlier is a value located 2 or more standard deviations above, or below, the mean.
UNC-1.K.2 The mean, standard deviation, and range are considered nonresistant (or non-robust) because they are influenced by outliers. The median and IQR are considered resistant (or robust), because outliers do not greatly (if at all) affect their value.
Источник: Описание курса и экзамена College Board AP
Стандартное отклонение: разброс вокруг среднего
Центр:среднее$\bar{x}=\dfrac{\sum x_i}{n}$ (среднее арифметическое) и медиана (центральное значение). Медиана устойчива к выбросам; среднее смещается в сторону скоса.
Разброс:размах, межквартильный размах$\text{IQR}=Q_3-Q_1$ (средние 50%) и стандартное отклонение$s_x=\sqrt{\dfrac{\sum(x_i-\bar{x})^2}{n-1}}$ (типичное расстояние от среднего; его квадрат — это дисперсия).
Для скошенных данных используйте устойчивые показатели (медиану, IQR); для примерно симметричных данных — среднее и стандартное отклонение.
Перцентиль значения — это процент данных, равных или меньших данного значения, поэтому медиана является 50-м перцентилем, а $Q_1$ — 25-м. График кумулятивной относительной частоты позволяет легко считывать перцентили: для каждого значения он отображает долю данных равных или меньших ему, возрастая от 0 до 1. Поднимитесь вверх от значения до кривой и перейдите горизонтально к соответствующему перцентилю, или выполните обратные действия, чтобы найти значение при заданном перцентиле (то же самое чтение работает и по таблице кумулятивной частоты).
Разобранный пример. Для данных $4, 8, 6, 10, 7$: среднее равно $\bar{x}=\dfrac{4+8+6+10+7}{5}=\dfrac{35}{5}=7$. После сортировки до $4,6,7,8,10$ медиана является центральным значением, $7$. Среднее и медиана совпадают здесь, так как данные примерно симметричны.
cumulative relative frequency graph/ˈkjuːmjʊlətɪv ˈrelətɪv ˈfriːkwənsi ɡræf/
график кумулятивной относительной частоты
1.8
Графические представления сводной статистики
Программа
Постоянное понимание (UNC-1): Графические представления и статистика позволяют нам выявлять и отображать ключевые особенности данных.
Учебная цель UNC-1.L: Графически представлять сводную статистику для количественных данных. [Навык 2.B]
UNC-1.L.1 Совокупность минимального значения данных, первого квартиля (Q1), медианы, третьего квартиля (Q3) и максимального значения данных составляет пятичисловую сводку.
UNC-1.L.2 Ящик с усами — это графическое представление пятичисловой сводки (минимум, первый квартиль, медиана, третий квартиль, максимум). Ящик представляет средние 50% данных, линия проходит через медиану, а концы ящика соответствуют квартилям. Линии («усы») тянутся от квартилей к наиболее экстремальной точке, которая не является выбросом, а выбросы обозначаются собственным символом за пределами этого диапазона.
Учебная цель UNC-1.M: Описывать сводную статистику количественных данных, представленную графически. [Навык 2.A]
UNC-1.M.1 Сводная статистика количественных данных или наборов количественных данных может использоваться для обоснования утверждений о данных в контексте.
UNC-1.M.2 Если распределение относительно симметрично, то среднее и медиана находятся относительно близко друг к другу. Если распределение скошено вправо, то среднее обычно находится правее медианы. Если распределение скошено влево, то среднее обычно находится левее медианы.
Источник: Описание курса и экзамена College Board AP
Ящик с усами отображает пятизначную сводку: ящик от $Q_1$ до $Q_3$ с медианой внутри, и усы до наиболее экстремальных значений, не являющихся выбросами. Точка считается выбросом, если она находится более чем на $1.5\times\text{IQR}$ за пределами квартиля — правило, которое может потребоваться применить. Ящики с усами идеальны для сравнения нескольких групп рядом друг с другом.
Разобранный пример. Набор данных имеет $Q_1=20$ и $Q_3=32$, следовательно, $\text{IQR}=12$. Границы выбросов составляют $Q_1-1.5(12)=2$ и $Q_3+1.5(12)=50$. Любое значение ниже $2$ или выше $50$ помечается как выброс.
График «ящик с усами» показывает квартили и размахЯщик с усами отображает пятизначную сводку; ящик охватывает IQR
Исследовать
Исследуйте пятичисловое описание как точечный график
Перетащите $Q_1$, медиану, и $Q_3$, чтобы увидеть коробку (её длина — IQR) и то, как положение медианы внутри коробки раскрывает асимметрию — медиана, близкая к $Q_1$, сигнализирует о правосторонней асимметрии распределения.
Постоянное понимание (UNC-1): Графические представления и статистика позволяют нам выявлять и отображать ключевые особенности данных.
Учебная цель UNC-1.N: Сравнивать графические представления для нескольких наборов количественных данных. [Навык 2.D]
UNC-1.N.1 Любое из графических представлений, например гистограммы, боковые ящики с усами и т. д., может быть использовано для сравнения двух или более независимых выборок по центру, изменчивости, кластерам, пробелам, выбросам и другим характеристикам.
Учебная цель UNC-1.O: Сравнивать сводную статистику для нескольких наборов количественных данных. [Навык 2.D]
UNC-1.O.1 Любое из числовых сводок (например, среднее, стандартное отклонение, относительная частота и т. д.) может быть использовано для сравнения двух или более независимых выборок.
Источник: Описание курса и экзамена College Board AP
Чтобы сравнить две или более группы, сравнивайте форму, центр и разброс, а также упоминайте выбросы — всегда используя сравнительные слова («Группа A имеет более высокое медианное значение, чем Группа B») и в контексте. Не просто описывайте каждую группу отдельно; проводите явное сравнение.
Исследовать
Сравните распределения с помощью точечных графиков
Точечный график отображает пятичисловое описание. Размещение двух точечных графиков на одной шкале позволяет сравнить их центр (медиану), разброс (IQR = ширина коробки) и асимметрию одним взглядом — это справедливый способ сравнения групп.
1.10
Нормальное распределение
Программа
Enduring Understanding
Learning Objective
Essential Knowledge
VAR-2
The normal distribution can be used to represent some population distributions.
VAR-2.A
Compare a data distribution to the normal distribution model. [Skill 2.D]
VAR-2.A.1 A parameter is a numerical summary of a population.
VAR-2.A.2 Some sets of data may be described as approximately normally distributed. A normal curve is mound-shaped and symmetric. The parameters of a normal distribution are the population mean, $\mu$, and the population standard deviation, $\sigma$.
VAR-2.A.3 For a normal distribution, approximately 68% of the observations are within 1 standard deviation of the mean, approximately 95% of observations are within 2 standard deviations of the mean, and approximately 99.7% of observations are within 3 standard deviations of the mean. This is called the empirical rule.
VAR-2.A.4 Many variables can be modeled by a normal distribution.
Illustrative examples for VAR-2.A:
Variables that can be modeled by a normal distribution:
Body temperature
Weight of a loaf of bread
VAR-2.B
Determine proportions and percentiles from a normal distribution. [Skill 3.A]
VAR-2.B.1 A standardized score for a particular data value is calculated as (data value − mean)/(standard deviation), and measures the number of standard deviations a data value falls above or below the mean.
VAR-2.B.2 One example of a standardized score is a $z$-score, which is calculated as $z\text{-score} = \left(\dfrac{x_i - \mu}{\sigma}\right)$. A $z$-score measures how many standard deviations a data value is from the mean.
VAR-2.B.3 Technology, such as a calculator, a standard normal table, or computer-generated output, can be used to find the proportion of data values located on a given interval of a normally distributed random variable.
VAR-2.B.4 Given the area of a region under the graph of the normal distribution curve, it is possible to use technology, such as a calculator, a standard normal table, or computer-generated output, to estimate parameters for some populations.
VAR-2.C
Compare measures of relative position in data sets. [Skill 2.D]
VAR-2.C.1 Percentiles and $z$-scores may be used to compare relative positions of points within a data set or between data sets.
Источник: Описание курса и экзамена College Board AP
Нормальное распределение — это симметричная колоколообразная модель, описываемая своим средним $\mu$ и стандартным отклонением $\sigma$. Эмпирическое правило (68–95–99,7): около 68% значений лежат в пределах $1\sigma$ от среднего, 95% — в пределах $2\sigma$, и 99,7% — в пределах $3\sigma$.
Нормальная кривая: вероятность равна площади под ней, центрированной относительно среднего
Z-оценка ($z$-score) измеряет, на сколько стандартных отклонений значение отличается от среднего:
$$z=\frac{x-\mu}{\sigma}.$$
Переведите значения в $z$-оценки, затем используйте таблицу нормального распределения или вычислительные инструменты для нахождения доли (площади) ниже, выше или между значениями — и обратную процедуру для определения значения по заданному процентильному рангу.
Разобранный пример. Оценки тестов имеют нормальное распределение со средним $\mu=500$ и стандартным отклонением $\sigma=100$. Оценка $700$ соответствует Z-оценке $z=\dfrac{700-500}{100}=2$. Согласно эмпирическому правилу, $95\%$ оценок лежат в пределах $2\sigma$, значит, $2.5\%$ находятся выше $700$ — это означает, что оценка $700$ находится примерно на уровне $97.5$-го перцентиля.
Нормальная кривая и эмпирическое правило 68-95-99,7
Исследовать
Исследуйте площадь под нормальным распределением
"Пропорция" данных ниже значения равна "площади" под кривой слева от него. Выделите хвост или центральную полосу, чтобы увидеть эмпирическое правило «68–95–99,7» и считать $z$-балл как площадь.