Skip to content · ⁨Перейти к содержанию⁩

Exploring Two-Variable Data · ⁨Исследование данных двух переменных⁩

AP Statistics · Topic 2 · ⁨Тема 2⁩

Video lesson for this topic · ⁨Видеоурок по этой теме⁩ Open the video page · ⁨Открыть страницу видео⁩
7:49

Исследование данных двух переменных

Тридцать детей из одной начальной школы. Для каждого ребенка два числа: размер обуви и результат теста на чтение. Отметьте одну точку на графиках для каждого ребенка. Паттерн трудно…

English narration · English + 中文 subtitles burned in · ⁨Английское озвучивание · Английский + китайские субтитры (встроенные)⁩

2.1

Are Two Variables Related? · ⁨Связаны ли две переменные?⁩

Syllabus · ⁨Программа⁩
English

Enduring Understanding (VAR-1): Given that variation may be random or not, conclusions are uncertain.

Learning Objective VAR-1.D: Identify questions to be answered about possible relationships in data. [Skill 1.A]

  • VAR-1.D.1 Apparent patterns and associations in data may be random or not.
Русский

Вечная идея (VAR-1): Поскольку вариация может быть случайной или нет, выводы остаются неопределенными.

Учебная цель VAR-1.D: Определять вопросы для ответа о возможных связях в данных. [Навык 1.A]

  • VAR-1.D.1 Видимые закономерности и ассоциации в данных могут быть случайными или нет.

Source: College Board AP Course and Exam Description · ⁨Источник: Описание курса и экзамена College Board AP⁩

English

Two-variable data let us ask whether two characteristics are associated 关联 – whether knowing one tells you something about the other. An explanatory variable 解释变量 (the "input") may help predict a response variable 响应变量 (the "output"). Association is not the same as causation.

Русский

Двухпеременные данные позволяют задать вопрос о том, связаны ли два признака ассоциированы ли они — говорит ли знание одной переменной о другой. Объясняющая переменная («входные данные») может помогать предсказать отзывчивую переменную («выходные данные»). Ассоциация не тождественна причинно-следственной связи.

2.2

Two Categorical Variables · ⁨Две категориальные переменные⁩

Syllabus · ⁨Программа⁩
English

Enduring Understanding (UNC-1): Graphical representations and statistics allow us to identify and represent key features of data.

Learning Objective UNC-1.P: Compare numerical and graphical representations for two categorical variables. [Skill 2.D]

  • UNC-1.P.1 Side-by-side bar graphs, segmented bar graphs, and mosaic plots are examples of bar graphs for one categorical variable, broken down by categories of another categorical variable.
  • UNC-1.P.2 Graphical representations of two categorical variables can be used to compare distributions and/or determine if variables are associated.
  • UNC-1.P.3 A two-way table, also called a contingency table, is used to summarize two categorical variables. The entries in the cells can be frequency counts or relative frequencies.
  • UNC-1.P.4 A joint relative frequency is a cell frequency divided by the total for the entire table.
Русский

Постоянное понимание (UNC-1): Графические представления и статистика позволяют нам выявлять и отображать ключевые особенности данных.

Учебная цель UNC-1.P: Сравнивать числовые и графические представления для двух категориальных переменных. [Навык 2.D]

  • UNC-1.P.1 Боковые столбчатые диаграммы, сегментированные столбчатые диаграммы и мозаичные диаграммы являются примерами столбчатых диаграмм для одной категориальной переменной, разбитой по категориям другой категориальной переменной.
  • UNC-1.P.2 Графические представления двух категориальных переменных могут использоваться для сравнения распределений и/или определения того, связаны ли переменные.
  • UNC-1.P.3 Двусторонняя таблица, также называемая таблицей сопряженности, используется для обобщения двух категориальных переменных. Значения в ячейках могут быть подсчетами частот или относительными частотами.
  • UNC-1.P.4 Совместная относительная частота — это частота ячейки, деленная на общую сумму по всей таблице.

Source: College Board AP Course and Exam Description · ⁨Источник: Описание курса и экзамена College Board AP⁩

English

A two-way table 双向表 (contingency table) counts individuals by two categorical variables at once. A marginal distribution 边缘分布 is a row or column total written as a fraction of the grand total (the totals themselves are just counts). Comparing the inside cells shows whether the variables are related.

Русский

Кросс-таблица (таблица сопряженности) подсчитывает количество индивидов по двум категориальным переменным одновременно. Маргинальное распределение — это итоговая сумма строки или столбца, выраженная в виде доли от общего итога (сами итоги — это просто подсчеты). Сравнение внутренних ячеек показывает, связаны ли переменные.

2.3

Comparing Groups with Conditional Distributions · ⁨Сравнение групп с условными распределениями⁩

Syllabus · ⁨Программа⁩
English

Enduring Understanding (UNC-1): Graphical representations and statistics allow us to identify and represent key features of data.

Learning Objective UNC-1.Q: Calculate statistics for two categorical variables. [Skill 2.C]

  • UNC-1.Q.1 The marginal relative frequencies are the row and column totals in a two-way table divided by the total for the entire table.
  • UNC-1.Q.2 A conditional relative frequency is a relative frequency for a specific part of the contingency table (e.g., cell frequencies in a row divided by the total for that row).

Learning Objective UNC-1.R: Compare statistics for two categorical variables. [Skill 2.D]

  • UNC-1.R.1 Summary statistics for two categorical variables can be used to compare distributions and/or determine if variables are associated.
Русский

Постоянное понимание (UNC-1): Графические представления и статистика позволяют нам выявлять и отображать ключевые особенности данных.

Цель обучения UNC-1.Q: Вычислять статистику для двух категориальных переменных. [Навык 2.C]

  • UNC-1.Q.1 Маргинальные относительные частоты — это суммы строк и столбцов в двусторонней таблице, деленные на общую сумму по всей таблице.
  • UNC-1.Q.2 Условная относительная частота — это относительная частота для конкретной части таблицы сопряженности (например, частоты ячеек в строке, деленные на итоговую сумму этой строки).

Цель обучения UNC-1.R: Сравнивать статистику для двух категориальных переменных. [Навык 2.D]

  • UNC-1.R.1 Сводную статистику для двух категориальных переменных можно использовать для сравнения распределений и/или определения наличия связи между переменными.

Source: College Board AP Course and Exam Description · ⁨Источник: Описание курса и экзамена College Board AP⁩

English

A conditional distribution 条件分布 is the distribution of one variable within a fixed category of the other (found by dividing each cell by its row or column total). If the conditional distributions differ across groups, the two variables are associated; if they are the same, there is no association. Segmented bar charts 分段条形图 or mosaic plots display them.

Русский

Условное распределение — это распределение одной переменной внутри фиксированной категории другой (находится путем деления каждой ячейки на итоговую сумму ее строки или столбца). Если условные распределения различаются между группами, две переменные ассоциированы; если они одинаковы, ассоциации нет. Сегментированные столбчатые диаграммы или мозаичные графики визуализируют их.

2.4

Scatterplots for Two Quantitative Variables · ⁨Диаграммы рассеяния для двух количественных переменных⁩

Syllabus · ⁨Программа⁩
English

Enduring Understanding (UNC-1): Graphical representations and statistics allow us to identify and represent key features of data.

Learning Objective UNC-1.S: Represent bivariate quantitative data using scatterplots. [Skill 2.B]

  • UNC-1.S.1 A bivariate quantitative data set consists of observations of two different quantitative variables made on individuals in a sample or population.
  • UNC-1.S.2 A scatterplot shows two numeric values for each observation, one corresponding to the value on the $x$-axis and one corresponding to the value on the $y$-axis.
  • UNC-1.S.3 An explanatory variable is a variable whose values are used to explain or predict corresponding values for the response variable.

Enduring Understanding (DAT-1): Regression models may allow us to predict responses to changes in an explanatory variable.

Learning Objective DAT-1.A: Describe the characteristics of a scatter plot. [Skill 2.A]

  • DAT-1.A.1 A description of a scatter plot includes form, direction, strength, and unusual features.
  • DAT-1.A.2 The direction of the association shown in a scatterplot, if any, can be described as positive or negative.
  • DAT-1.A.3 A positive association means that as values of one variable increase, the values of the other variable tend to increase. A negative association means that as values of one variable increase, values of the other variable tend to decrease.
  • DAT-1.A.4 The form of the association shown in a scatterplot, if any, can be described as linear or non-linear to varying degrees.
  • DAT-1.A.5 The strength of the association is how closely the individual points follow a specific pattern, e.g., linear, and can be shown in a scatterplot. Strength can be described as strong, moderate, or weak.
  • DAT-1.A.6 Unusual features of a scatter plot include clusters of points or points with relatively large discrepancies between the value of the response variable and a predicted value for the response variable.
Русский

Постоянное понимание (UNC-1): Графические представления и статистика позволяют нам выявлять и отображать ключевые особенности данных.

Цель обучения UNC-1.S: Представлять бивариантные количественные данные с помощью точечных диаграмм. [Навык 2.B]

  • UNC-1.S.1 Набор бивариантных количественных данных состоит из наблюдений двух различных количественных переменных, полученных на индивидах из выборки или генеральной совокупности.
  • UNC-1.S.2 Точечная диаграмма показывает два числовых значения для каждого наблюдения: одно соответствует значению на оси $x$, а другое — значению на оси $y$.
  • UNC-1.S.3 Объясняющая переменная — это переменная, значения которой используются для объяснения или прогнозирования соответствующих значений откликающей переменной.

Важное понимание (DAT-1): Модели регрессии могут позволить нам прогнозировать отклики на изменения объясняющей переменной.

Цель обучения DAT-1.A: Описывать характеристики точечной диаграммы. [Навык 2.A]

  • DAT-1.A.1 Описание точечной диаграммы включает форму, направление, силу и необычные особенности.
  • DAT-1.A.2 Направление связи, показанной на точечной диаграмме (если оно есть), можно описать как положительное или отрицательное.
  • DAT-1.A.3 Положительная связь означает, что при увеличении значений одной переменной значения другой переменной имеют тенденцию к увеличению. Отрицательная связь означает, что при увеличении значений одной переменной значения другой переменной имеют тенденцию к уменьшению.
  • DAT-1.A.4 Форму связи, показанной на точечной диаграмме (если она есть), можно описать как линейную или нелинейную в той или иной степени.
  • DAT-1.A.5 Сила связи — это то, насколько близко отдельные точки следуют определенному шаблону, например, линейному, и может быть представлена на точечной диаграмме. Силу можно описать как сильную, умеренную или слабую.
  • DAT-1.A.6 Необычные особенности точечной диаграммы включают скопления точек или точки с относительно большими расхождениями между значением откликающей переменной и предсказанным значением для этой переменной.

Source: College Board AP Course and Exam Description · ⁨Источник: Описание курса и экзамена College Board AP⁩

English

A scatterplot 散点图 plots each individual as a point, explanatory variable on the $x$-axis and response on the $y$-axis. Describe it with DUFS: Direction (positive/negative), Unusual features (outliers, clusters), Form (linear or curved), and Strength (how tightly the points follow the pattern) – always in context.

Русский

На диаграмме рассеяния каждый отдельный элемент отображается точкой, объясняющая переменная откладывается по оси $x$, а отклика — по оси $y$. Опишите её с помощью DUFS: Направление (положительное/отрицательное), Необычные особенности (выбросы, скопления), Форма (линейная или криволинейная) и Сила (насколько плотно точки следуют за узором) — всегда в контексте.

Линия тренда проходит через центр рассеянных точек
Линия тренда проходит через центр рассеянных точек
2.5

Correlation · ⁨Корреляция⁩

Syllabus · ⁨Программа⁩
English

Enduring Understanding (DAT-1): Regression models may allow us to predict responses to changes in an explanatory variable.

Learning Objective DAT-1.B: Determine the correlation for a linear relationship. [Skill 2.C]

  • DAT-1.B.1 The correlation, $r$, gives the direction and quantifies the strength of the linear association between two quantitative variables.
  • DAT-1.B.2 The correlation coefficient can be calculated by: $r = \dfrac{1}{n-1} \sum \left( \dfrac{x_i - \bar{x}}{s_x} \right) \left( \dfrac{y_i - \bar{y}}{s_y} \right)$. However, the most common way to determine $r$ is by using technology.
  • DAT-1.B.3 A correlation coefficient close to 1 or $-1$ does not necessarily mean that a linear model is appropriate.

Learning Objective DAT-1.C: Interpret the correlation for a linear relationship. [Skill 4.B]

  • DAT-1.C.1 The correlation, $r$, is unit-free, and always between $-1$ and 1, inclusive. A value of $r = 0$ indicates that there is no linear association. A value of $r = 1$ or $r = -1$ indicates that there is a perfect linear association.
  • DAT-1.C.2 A perceived or real relationship between two variables does not mean that changes in one variable cause changes in the other. That is, correlation does not necessarily imply causation.
Русский

Важное понимание (DAT-1): Модели регрессии могут позволить нам прогнозировать отклики на изменения объясняющей переменной.

Цель обучения DAT-1.B: Определять корреляцию для линейной зависимости. [Навык 2.C]

  • DAT-1.B.1 Коэффициент корреляции, $r$, указывает направление и количественно оценивает силу линейной связи между двумя количественными переменными.
  • DAT-1.B.2 Коэффициент корреляции можно вычислить по формуле: $r = \dfrac{1}{n-1} \sum \left( \dfrac{x_i - \bar{x}}{s_x} \right) \left( \dfrac{y_i - \bar{y}}{s_y} \right)$. Однако наиболее распространенный способ определения $r$ — использование программного обеспечения.
  • DAT-1.B.3 Коэффициент корреляции, близкий к 1 или $-1$, не обязательно означает, что линейная модель является подходящей.

Цель обучения DAT-1.C: Интерпретировать корреляцию для линейной зависимости. [Навык 4.B]

  • DAT-1.C.1 Коэффициент корреляции, $r$, безразмерен и всегда находится между $-1$ и 1 включительно. Значение $r = 0$ указывает на отсутствие линейной связи. Значение $r = 1$ или $r = -1$ указывает на идеальную линейную связь.
  • DAT-1.C.2 Воспринимаемая или реальная связь между двумя переменными не означает, что изменения одной переменной вызывают изменения другой. То есть корреляция не обязательно подразумевает причинно-следственную связь.

Source: College Board AP Course and Exam Description · ⁨Источник: Описание курса и экзамена College Board AP⁩

English
What r actually measures

The correlation coefficient 相关系数 $r$ measures the strength and direction of a linear relationship. It runs from $-1$ to $1$: near $\pm 1$ is strong linear, near $0$ is weak linear. $r$ has no units and does not change if you swap the variables. Warnings: $r$ only measures linear strength, it is not resistant to outliers, and a strong $r$ does not prove causation.

Русский
Что на самом деле измеряет r

Коэффициент корреляции $r$ измеряет силу и направление линейной зависимости. Он изменяется от $-1$ до $1$: значение, близкое к $\pm 1$, указывает на сильную линейную связь, близкое к $0$ — на слабую. $r$ не имеет единиц измерения и не меняется при замене переменных местами. Предупреждения: $r$ измеряет линейную силу связи, она не устойчива к выбросам, и сильная $r$ не доказывает причинно-следственную связь.

Положительная корреляция растет вместе; отрицательная движется в противоположных направлениях
Положительная корреляция растет вместе; отрицательная движется в противоположных направлениях
Explore · ⁨Исследовать⁩

Strength of a linear relationship · ⁨Сила линейной связи⁩

Correlation $r$ runs from $-1$ to $1$: near $\pm1$ the points hug a line, near 0 they scatter. Change it and watch the cloud tighten or spread. · ⁨Корреляция $r$ варьируется от $-1$ до $1$: близко к $\pm1$ точки лежат на прямой линии, близко к 0 они рассеяны. Измените коэффициент и наблюдайте, как облако точек сжимается или расширяется.⁩

2.6

Linear Regression Models · ⁨Линейные регрессионные модели⁩

Syllabus · ⁨Программа⁩
English

Enduring Understanding (DAT-1): Regression models may allow us to predict responses to changes in an explanatory variable.

Learning Objective DAT-1.D: Calculate a predicted response value using a linear regression model. [Skill 2.C]

  • DAT-1.D.1 A simple linear regression model is an equation that uses an explanatory variable, $x$, to predict the response variable, $y$.
  • DAT-1.D.2 The predicted response value, denoted by $\hat{y}$, is calculated as $\hat{y} = a + bx$, where $a$ is the $y$-intercept and $b$ is the slope of the regression line, and $x$ is the value of the explanatory variable.
  • DAT-1.D.3 Extrapolation is predicting a response value using a value for the explanatory variable that is beyond the interval of $x$-values used to determine the regression line. The predicted value is less reliable as an estimate the further we extrapolate.
Русский

Важное понимание (DAT-1): Модели регрессии могут позволить нам прогнозировать отклики на изменения объясняющей переменной.

Цель обучения DAT-1.D: Вычислять предсказанное значение отклика с использованием модели линейной регрессии. [Навык 2.C]

  • DAT-1.D.1 Простая линейная модель регрессии — это уравнение, которое использует объясняющую переменную, $x$, для прогнозирования откликающей переменной, $y$.
  • DAT-1.D.2 Предсказанное значение отклика, обозначаемое как $\hat{y}$, рассчитывается по формуле $\hat{y} = a + bx$, где $a$ — точка пересечения с осью $y$, $b$ — угловой коэффициент линии регрессии, а $x$ — значение объясняющей переменной.
  • DAT-1.D.3 Экстраполяция — это предсказание значения отклика с использованием значения объясняющей переменной, выходящего за пределы интервала значений $x$, использованных для построения линии регрессии. Предсказанное значение становится менее надежным как оценка по мере того, как мы экстраполируем дальше.

Source: College Board AP Course and Exam Description · ⁨Источник: Описание курса и экзамена College Board AP⁩

English

The least-squares regression line 最小二乘回归线 predicts the response: $\hat{y}=a+bx$, where $\hat{y}$ is the predicted response. The slope 斜率 $b$ is the predicted change in $y$ per one-unit increase in $x$; the $y$-intercept 截距 $a$ is the predicted $y$ when $x=0$. Interpret both in context and with units – a graded skill. Avoid extrapolation 外推 (predicting far outside the data).

Worked example. A study of hours studied ($x$) and test score ($y$) gives $\hat{y}=20+3x$. The slope means each extra hour of study is associated with a predicted $3$-point increase. A student who studies $5$ hours is predicted to score $\hat{y}=20+3(5)=35$.

Русский

Метод наименьших квадратов предсказывает отклик: $\hat{y}=a+bx$, где $\hat{y}$ — предсказанный отклик. Угол наклона $b$ означает предсказанное изменение $y$ при увеличении $x$ на одну единицу; $y$-пересечение (точка пересечения с осью y) $a$ — это предсказанный $y$ при $x=0$. Интерпретируйте оба параметра в контексте и с указанием единиц — это навык, требующий оценки. Избегайте экстраполяции (предсказания далеко за пределами имеющихся данных).

Разобранный пример. Исследование часов учебы ($x$) и балла за тест ($y$) дало результат $\hat{y}=20+3x$. Угол наклона означает, что каждый дополнительный час учебы связан с предсказанным увеличением на $3$ баллов. Студент, который учился $5$ часа, по прогнозу получит $\hat{y}=20+3(5)=35$ баллов.

Explore · ⁨Исследовать⁩

Fit a least-squares line · ⁨Постройте линию наименьших квадратов⁩

A regression line is the best straight-line fit, minimising the squared vertical distances. Its slope predicts how $y$ changes per unit of $x$. · ⁨Регрессионная прямая — это лучшая прямая линия, минимизирующая квадрат вертикальных расстояний. Её наклон предсказывает, как $y$ изменяется за единицу $x$.⁩

2.7

Residuals · ⁨Остатки⁩

Syllabus · ⁨Программа⁩
English

Enduring Understanding (DAT-1): Regression models may allow us to predict responses to changes in an explanatory variable.

Learning Objective DAT-1.E: Represent differences between measured and predicted responses using residual plots. [Skill 2.B]

  • DAT-1.E.1 The residual is the difference between the actual value and the predicted value: $\text{residual} = y - \hat{y}$.
  • DAT-1.E.2 A residual plot is a plot of residuals versus explanatory variable values or predicted response values.

Learning Objective DAT-1.F: Describe the form of association of bivariate data using residual plots. [Skill 2.A]

  • DAT-1.F.1 Apparent randomness in a residual plot for a linear model is evidence of a linear form to the association between the variables.
  • DAT-1.F.2 Residual plots can be used to investigate the appropriateness of a selected model.
Русский

Важное понимание (DAT-1): Модели регрессии могут позволить нам прогнозировать отклики на изменения объясняющей переменной.

Цель обучения DAT-1.E: Представлять разницы между измеренными и предсказанными откликами с помощью графиков остатков. [Навык 2.B]

  • DAT-1.E.1 Остаток — это разница между фактическим значением и предсказанным значением: $\text{residual} = y - \hat{y}$.
  • DAT-1.E.2 График остатков — это график остатков по значениям объясняющей переменной или предсказанным значениям отклика.

Цель обучения DAT-1.F: Описывать форму связи бивариантных данных с помощью графиков остатков. [Навык 2.A]

  • DAT-1.F.1 Визуальная случайность на графике остатков для линейной модели является доказательством линейной формы связи между переменными.
  • DAT-1.F.2 Графики остатков могут использоваться для проверки уместности выбранной модели.

Source: College Board AP Course and Exam Description · ⁨Источник: Описание курса и экзамена College Board AP⁩

English
Least-squares regression

A residual 残差 is actual minus predicted, $y-\hat{y}$: how far a point sits above (+) or below (−) the line. A residual plot 残差图 graphs residuals against $x$. If it shows no pattern (random scatter), a linear model is appropriate; a curved or fanning pattern means the linear model is a poor fit.

Worked example. Continuing the study above, a student who studied $5$ hours actually scored $40$. The residual is $y-\hat{y}=40-35=+5$: the line under-predicted by $5$ points, so this point sits above the line.

Русский
Метод наименьших квадратов

Остаток — это фактическое значение минус предсказанное, $y-\hat{y}$: расстояние, на которое точка находится выше (+) или ниже (−) линии. График остатков строит остатки по отношению к $x$. Если на графике нет закономерности (случайное рассеяние), линейная модель подходит; изогнутая или расширяющаяся форма указывает на плохое соответствие линейной модели.

Разобранный пример. Продолжая исследование выше, студент, изучавший $5$ часов, фактически получил $40$ балл. Остаток составляет $y-\hat{y}=40-35=+5$: линия недооценила результат на $5$ баллов, поэтому эта точка находится выше линии.

Четыре набора данных с одинаковым r и линией регрессии, но четырьмя разными формами
Предостережение относительно $r$ и линии: все четыре набора данных имеют одинаковый $r=0.82$ и одинаковую $\hat{y}=3.0+0.5x$, однако только первый является действительно линейным. Диаграммы рассеяния почти не отличаются — именно график остатков под каждой из них выявляет кривизну, выброс и точку с высоким влиянием.
2.8

Least-Squares Regression and Its Fit · ⁨Метод наименьших квадратов и его качество подгонки⁩

Syllabus · ⁨Программа⁩
English

Enduring Understanding (DAT-1): Regression models may allow us to predict responses to changes in an explanatory variable.

Learning Objective DAT-1.G: Estimate parameters for the least-squares regression line model. [Skill 2.C]

  • DAT-1.G.1 The least-squares regression model minimizes the sum of the squares of the residuals and contains the point $(\bar{x}, \bar{y})$.
  • DAT-1.G.2 The slope, $b$, of the regression line can be calculated as $b = r \left( \dfrac{s_y}{s_x} \right)$ where $r$ is the correlation between $x$ and $y$, $s_y$ is the sample standard deviation of the response variable, $y$, and $s_x$ is the sample standard deviation of the explanatory variable, $x$.
  • DAT-1.G.3 Sometimes, the $y$-intercept of the line does not have a logical interpretation in context.
  • DAT-1.G.4 In simple linear regression, $r^2$ is the square of the correlation, $r$. It is also called the coefficient of determination. $r^2$ is the proportion of variation in the response variable that is explained by the explanatory variable in the model.

Learning Objective DAT-1.H: Interpret coefficients for the least-squares regression line model. [Skill 4.B]

  • DAT-1.H.1 The coefficients of the least-squares regression model are the estimated slope and $y$-intercept.
  • DAT-1.H.2 The slope is the amount that the predicted $y$-value changes for every unit increase in $x$.
  • DAT-1.H.3 The $y$-intercept value is the predicted value of the response variable when the explanatory variable is equal to $0$. The formula for the $y$-intercept, $a$, is $a = \bar{y} - b\bar{x}$.
Русский

Важное понимание (DAT-1): Модели регрессии могут позволить нам прогнозировать отклики на изменения объясняющей переменной.

Цель обучения DAT-1.G: Оценивать параметры модели линии наименьших квадратов. [Навык 2.C]

  • DAT-1.G.1 Модель регрессии наименьших квадратов минимизирует сумму квадратов остатков и содержит точку $(\bar{x}, \bar{y})$.
  • DAT-1.G.2 Угловой коэффициент $b$ линии регрессии можно рассчитать как $b = r \left( \dfrac{s_y}{s_x} \right)$, где $r$ — корреляция между $x$ и $y$, $s_y$ — выборочное стандартное отклонение ответственной переменной, $y$, а $s_x$ — выборочное стандартное отклонение объясняющей переменной, $x$.
  • DAT-1.G.3 Иногда пересечение с осью $y$ (свободный член) не имеет логического толкования в контексте задачи.
  • DAT-1.G.4 В простой линейной регрессии $r^2$ является квадратом коэффициента корреляции, $r$. Он также называется коэффициентом детерминации. $r^2$ представляет собой долю вариации переменной отклика, которая объясняется объясняющей переменной в модели.

Цель обучения DAT-1.H: Интерпретировать коэффициенты модели линии наименьших квадратов. [Навык 4.B]

  • DAT-1.H.1 Коэффициенты модели регрессии наименьших квадратов — это оцененный угловой коэффициент и пересечение с осью $y$.
  • DAT-1.H.2 Угловой коэффициент показывает величину изменения предсказанного значения по оси $y$ при увеличении переменной $x$ на одну единицу.
  • DAT-1.H.3 Значение пересечения с осью $y$ равно предсказанному значению переменной отклика, когда объясняющая переменная равна $0$. Формула для пересечения с осью $y$, $a$, имеет вид $a = \bar{y} - b\bar{x}$.

Source: College Board AP Course and Exam Description · ⁨Источник: Описание курса и экзамена College Board AP⁩

English

The line minimizes the sum of squared residuals. Its fit is measured by:

  • $s$, the standard deviation of the residuals – the typical prediction error, in the response's units.
  • $r^2$, the coefficient of determination 决定系数 – the proportion of the variation in $y$ that the linear model explains (a value between $0$ and $1$; multiply by $100$ to state it as a percent). Report it in context: "$r^2 = 0.81$ means 81% of the variation in $y$ is explained by the linear relationship with $x$."
Русский
Линия наименьших квадратов минимизирует сумму квадратов остатков
Линия наименьших квадратов минимизирует сумму квадратов остатков

Линия минимизирует сумму квадратов остатков. Качество её подгонки оценивается следующим образом:

  • $s$, стандартное отклонение остатков — типичная ошибка предсказания, выраженная в единицах отклика.
  • $r^2$, коэффициент детерминации — доля вариации в $y$, объясненная линейной моделью (значение от $0$ до $1$; умножьте на $100$, чтобы выразить в процентах). Отчитывайте его в контексте: "$r^2 = 0.81$ означает, что 81% вариации в $y$ объясняется линейной зависимостью от $x$.""
Vocabulary · ⁨Словарь⁩ Train · ⁨Тренировать⁩
English Русский
associated/əˈsəʊsɪeɪtɪd/ связаны
explanatory variable/ekˈsplænətəri ˈveərɪəbl/ объясняющей переменной
response variable/rɪˈspɒns ˈveərɪəbl/ переменной отклика
two-way table/tuː weɪ ˈteɪbl/ двумерная таблица
marginal distributions/ˈmɑːdʒɪnl ˌdɪstrɪˈbjuːʃnz/ маргинальные распределения
conditional distribution/kənˈdɪʃənl ˌdɪstrɪˈbjuːʃn/ условное распределение
Segmented bar charts/seɡˈmentɪd bɑː tʃɑːts/ Сегментированные столбчатые диаграммы
scatterplot/ˈskætəplɒt/ диаграмма рассеяния
correlation coefficient/ˌkɒrɪˈleɪʃn ˌkəʊɪˈfɪʃənt/ коэффициент корреляции
least-squares regression line/liːst skweəz rɪˈɡreʃn laɪn/ метод наименьших квадратов (линия регрессии)
slope/sləʊp/ наклоне графика
y-intercept/waɪ ˌɪntəˈsept/ пересечение с осью y
extrapolation/ekˈstræpəleɪʃn/ экстраполяция
residual/rɪˈsɪdʒuːəl/ остатком
residual plot/rɪˈsɪdʒuːəl plɒt/ график остатков
coefficient of determination/ˌkəʊɪˈfɪʃənt ɒv dɪˌtɜːmɪˈneɪʃn/ коэффициент детерминации
high-leverage/haɪ ˈliːvərɪdʒ/ высокая чувствительность (high-leverage)
influential/ˌɪnfluːˈenʃl/ влияющий
2.9

Departures from Linearity · ⁨Отклонения от линейности⁩

Syllabus · ⁨Программа⁩
English

Enduring Understanding (DAT-1): Regression models may allow us to predict responses to changes in an explanatory variable.

Learning Objective DAT-1.I: Identify influential points in regression. [Skill 2.A]

  • DAT-1.I.1 An outlier in regression is a point that does not follow the general trend shown in the rest of the data and has a large residual when the Least Squares Regression Line (LSRL) is calculated.
  • DAT-1.I.2 A high-leverage point in regression has a substantially larger or smaller $x$-value than the other observations have.
  • DAT-1.I.3 An influential point in regression is any point that, if removed, changes the relationship substantially. Examples include much different slope, $y$-intercept, and/or correlation. Outliers and high leverage points are often influential.

Learning Objective DAT-1.J: Calculate a predicted response using a least-squares regression line for a transformed data set. [Skill 2.C]

  • DAT-1.J.1 Transformations of variables, such as evaluating the natural logarithm of each value of the response variable or squaring each value of the explanatory variable, can be used to create transformed data sets, which may be more linear in form than the untransformed data.
  • DAT-1.J.2 Increased randomness in residual plots after transformation of data and/or movement of $r^2$ to a value closer to 1 offers evidence that the least-squares regression line for the transformed data is a more appropriate model to use to predict responses to the explanatory variable than the regression line for the untransformed data.
Русский

Важное понимание (DAT-1): Модели регрессии могут позволить нам прогнозировать отклики на изменения объясняющей переменной.

Цель обучения DAT-1.I: Определять влияющие точки в регрессии. [Навык 2.A]

  • DAT-1.I.1 Выбросом в регрессии является точка, которая не следует общему тренду, наблюдаемому в остальных данных, и имеет большой остаток при расчете линии регрессии наименьших квадратов (LSRL).
  • DAT-1.I.2 Точка с высоким уровнем влияния (high-leverage point) в регрессии имеет значение по оси $x$, которое существенно больше или меньше значений у других наблюдений.
  • DAT-1.I.3 Влияющей точкой в регрессии является любая точка, удаление которой существенно изменяет зависимость. Примерами могут служить значительно отличающиеся угловые коэффициенты, пересечения с осью $y$ и/или коэффициенты корреляции. Выбросы и точки с высоким уровнем влияния часто являются влияющими.

Цель обучения DAT-1.J: Рассчитывать предсказанный ответ с использованием линии наименьших квадратов для преобразованного набора данных. [Навык 2.C]

  • DAT-1.J.1 Преобразования переменных, такие как вычисление натурального логарифма каждого значения переменной отклика или возведение в квадрат каждого значения объясняющей переменной, могут использоваться для создания преобразованных наборов данных, которые могут быть более линейными по форме, чем исходные данные.
  • DAT-1.J.2 Увеличение случайности на графиках остатков после преобразования данных и/или приближение значения $r^2$ к значению, близкому к 1, свидетельствует о том, что линия регрессии наименьших квадратов для преобразованных данных является более подходящей моделью для предсказания ответов на объясняющую переменную, чем линия регрессии для исходных данных.

Source: College Board AP Course and Exam Description · ⁨Источник: Описание курса и экзамена College Board AP⁩

English

Some points strongly affect the line. A high-leverage 高杠杆 point has an extreme $x$-value; an influential 有影响的 point noticeably changes the slope or $r$ when removed; an outlier here is a point with a large residual. When the pattern is curved, transform a variable (e.g. take a log) to straighten it, then fit a line to the transformed data.

Русский

Некоторые точки сильно влияют на линию. Точка с высоким влиянием имеет экстремальное значение по оси $x$; влияющая точка заметно меняет угол наклона или $r$ при удалении; выбросом здесь называется точка с большим остатком. Когда паттерн изогнут, преобразуйте переменную (например, возьмите логарифм), чтобы сделать зависимость линейной, затем подберите прямую к преобразованным данным.

2.9

Exam tips · ⁨Советы для экзамена⁩

English
  • On a scatterplot describe direction, form, strength, and outliers; $r$ ranges $-1$ to $1$.
  • Correlation is not causation — a lurking variable can drive both.
  • Interpret the slope of the least-squares line in context ("per one unit of $x$, predicted $y$ changes by $b$").
  • Check a residual plot: no pattern means a line fits; a curve means it does not. Avoid extrapolation.
  • $r^2$ is the fraction of variation in $y$ explained by the model.
Русский
  • На диаграмме рассеяния описывайте направление, форму, силу и выбросы; $r$ варьируется от $-1$ до $1$.
  • Корреляция не есть причинность — скрытая переменная может быть причиной обеих величин.
  • Интерпретируйте угол наклона линии наименьших квадратов в контексте ("при увеличении $x$ на одну единицу предсказанное значение $y$ изменяется на $b$").
  • Проверьте график остатков: отсутствие закономерности говорит о том, что прямая подходит; наличие кривой — что нет. Избегайте экстраполяции.
  • $r^2$ — доля вариации в $y$, объясненная моделью.

Interactive lessons on this topic · ⁨Интерактивные уроки по этой теме⁩

Work through it step by step, with instant-check exercises. · ⁨Пройдите его шаг за шагом с упражнениями мгновенной проверки.⁩

Past Papers · ⁨Архив экзаменационных работ⁩

More topics in AP Statistics · ⁨Больше тем в AP Statistics⁩

Log in or create account · ⁨Войти или создать аккаунт⁩

IGCSE, A-Level & AP