Treinta niños de una escuela primaria. Para cada niño, dos números: talla de zapato, y una puntuación de prueba de lectura. Grafica un punto por niño. El patrón es difícil de…
Narración en inglés · Subtítulos en inglés + 中文 quemados en pantalla
2.1
¿Están relacionadas dos variables?
Syllabus
Comprensión duradera (VAR-1): Dado que la variación puede ser aleatoria o no, las conclusiones son inciertas.
Objetivo de aprendizaje VAR-1.D: Identificar preguntas para responder sobre posibles relaciones en los datos. [Habilidad 1.A]
VAR-1.D.1 Los patrones y asociaciones aparentes en los datos pueden ser aleatorios o no.
Fuente: College Board AP Course and Exam Description
Los datos de dos variables nos permiten preguntarnos si dos características están asociadas – saber una nos dice algo sobre la otra. Una variable explicativa (la "entrada") puede ayudar a predecir una variable de respuesta (la "salida"). La asociación no es lo mismo que la causalidad.
2.2
Dos variables categóricas
Syllabus
Comprensión Duradera (UNC-1): Las representaciones gráficas y las estadísticas nos permiten identificar y representar características clave de los datos.
Objetivo de Aprendizaje UNC-1.P: Comparar representaciones numéricas y gráficas para dos variables categóricas. [Habilidad 2.D]
UNC-1.P.1 Los gráficos de barras lado a lado, los gráficos de barras segmentadas y los diagramas de mosaico son ejemplos de gráficos de barras para una variable categórica, desglosados por categorías de otra variable categórica.
UNC-1.P.2 Las representaciones gráficas de dos variables categóricas se pueden utilizar para comparar distribuciones y/o determinar si las variables están asociadas.
UNC-1.P.3 Una tabla de contingencia, también llamada tabla de doble entrada, se utiliza para resumir dos variables categóricas. Las entradas en las celdas pueden ser recuentos de frecuencia o frecuencias relativas.
UNC-1.P.4 Una frecuencia relativa conjunta es la frecuencia de una celda dividida por el total de toda la tabla.
Fuente: College Board AP Course and Exam Description
Una tabla bidireccional (tabla de contingencia) cuenta individuos según dos variables categóricas al mismo tiempo. Una distribución marginal es el total de una fila o columna expresado como fracción del total general (los totales en sí mismos son solo conteos). Comparar las celdas internas muestra si las variables están relacionadas.
2.3
Comparación de grupos con distribuciones condicionales
Syllabus
Comprensión perdurable (UNC-1): Las representaciones gráficas y las estadísticas nos permiten identificar y representar las características clave de los datos.
Objetivo de aprendizaje UNC-1.Q: Calcular estadísticas para dos variables categóricas. [Habilidad 2.C]
UNC-1.Q.1 Las frecuencias relativas marginales son los totales de filas y columnas en una tabla de doble entrada divididos por el total de toda la tabla.
UNC-1.Q.2 Una frecuencia relativa condicional es una frecuencia relativa correspondiente a una parte específica de la tabla de contingencia (por ejemplo, las frecuencias de las celdas en una fila divididas por el total de esa fila).
Objetivo de aprendizaje UNC-1.R: Comparar estadísticas para dos variables categóricas. [Habilidad 2.D]
UNC-1.R.1 Las estadísticas descriptivas para dos variables categóricas pueden utilizarse para comparar distribuciones y/o determinar si las variables están asociadas.
Fuente: College Board AP Course and Exam Description
Una distribución condicional es la distribución de una variable dentro de una categoría fija de la otra (se obtiene dividiendo cada celda por su total de fila o columna). Si las distribuciones condicionales difieren entre grupos, las dos variables están asociadas; si son iguales, no hay asociación. Los gráficos de barras segmentadas o los diagramas mosaico las muestran.
2.4
Diagramas de dispersión para dos variables cuantitativas
Syllabus
Comprensión duradera (UNC-1): Las representaciones gráficas y las estadísticas nos permiten identificar y representar características clave de los datos.
Objetivo de aprendizaje UNC-1.S: Representar datos cuantitivos bivariados mediante diagramas de dispersión. [Habilidad 2.B]
UNC-1.S.1 Un conjunto de datos cuantitativos bivariados consiste en observaciones de dos variables cuantitativas diferentes realizadas sobre individuos en una muestra o población.
UNC-1.S.2 Un diagrama de dispersión muestra dos valores numéricos para cada observación, uno correspondiente al valor en el eje $x$ y otro correspondiente al valor en el eje $y$.
UNC-1.S.3 Una variable explicativa es una variable cuyos valores se utilizan para explicar o predecir valores correspondientes en la variable de respuesta.
Comprensión duradera (DAT-1): Los modelos de regresión pueden permitirnos predecir respuestas ante cambios en una variable explicativa.
Objetivo de aprendizaje DAT-1.A: Describir las características de un diagrama de dispersión. [Habilidad 2.A]
DAT-1.A.1 Una descripción de un diagrama de dispersión incluye forma, dirección, fuerza y características inusuales.
DAT-1.A.2 La dirección de la asociación mostrada en un diagrama de dispersión, si existe, puede describirse como positiva o negativa.
DAT-1.A.3 Una asociación positiva significa que a medida que aumentan los valores de una variable, los valores de la otra variable tienden a aumentar. Una asociación negativa significa que a medida que aumentan los valores de una variable, los valores de la otra variable tienden a disminuir.
DAT-1.A.4 La forma de la asociación mostrada en un diagrama de dispersión, si existe, puede describirse como lineal o no lineal en diversos grados.
DAT-1.A.5 La fuerza de la asociación indica qué tan cerca siguen los puntos individuales un patrón específico, p. ej., lineal, y puede mostrarse en un diagrama de dispersión. La fuerza puede describirse como fuerte, moderada o débil.
DAT-1.A.6 Las características inusuales de un diagrama de dispersión incluyen agrupaciones de puntos o puntos con discrepancias relativamente grandes entre el valor de la variable de respuesta y un valor predicho para dicha variable.
Fuente: College Board AP Course and Exam Description
Un diagrama de dispersión representa a cada individuo como un punto, con la variable explicativa en el eje $x$ y la variable de respuesta en el eje $y$. Describirlo mediante DUFS: Dirección (positiva/negativa), Inusuales (valores atípicos, agrupamientos), Forma (lineal o curva) y Fuerza (qué tan estrechamente siguen los puntos el patrón) – siempre contextualizado.
Una línea de ajuste óptimo pasa por el centro de los puntos dispersos
2.5
Correlación
Syllabus
Comprensión Duradera (DAT-1): Los modelos de regresión pueden permitirnos predecir respuestas ante cambios en una variable explicativa.
Objetivo de Aprendizaje DAT-1.B: Determinar la correlación para una relación lineal. [Habilidad 2.C]
DAT-1.B.1 La correlación, $r$, indica la dirección y cuantifica la fuerza de la asociación lineal entre dos variables cuantitativas.
DAT-1.B.2 El coeficiente de correlación se puede calcular mediante: $r = \dfrac{1}{n-1} \sum \left( \dfrac{x_i - \bar{x}}{s_x} \right) \left( \dfrac{y_i - \bar{y}}{s_y} \right)$. Sin embargo, la forma más común de determinar $r$ es utilizando tecnología.
DAT-1.B.3 Un coeficiente de correlación cercano a 1 o $-1$ no significa necesariamente que un modelo lineal sea apropiado.
Objetivo de Aprendizaje DAT-1.C: Interpretar la correlación para una relación lineal. [Habilidad 4.B]
DAT-1.C.1 La correlación, $r$, es adimensional y siempre está comprendida entre $-1$ y 1, inclusive. Un valor de $r = 0$ indica que no existe asociación lineal. Un valor de $r = 1$ o $r = -1$ indica que existe una asociación lineal perfecta.
DAT-1.C.2 Una relación percibida o real entre dos variables no implica que los cambios en una variable causen cambios en la otra. Es decir, la correlación no necesariamente implica causalidad.
Fuente: College Board AP Course and Exam Description
Lo que mide realmente r
El coeficiente de correlación$r$ mide la fuerza y dirección de una relación lineal. Varía desde $-1$ hasta $1$: cerca de $\pm 1$ indica una fuerte relación lineal, cerca de $0$ indica una débil relación lineal. $r$ no tiene unidades y no cambia si se intercambian las variables. Advertencias: $r$ solo mide la fuerza lineal, no es robusto ante valores atípicos y una fuerte $r$ no prueba causalidad.
La correlación positiva aumenta conjuntamente; la correlación negativa se mueve en direcciones opuestas
Explorar
Fuerza de una relación lineal
Correlación$r$ va de $-1$ a $1$: cerca de $\pm1$ los puntos abrazan una línea, cerca de 0 se dispersan. Cámbielo y vea cómo la nube se ajusta o expande.
2.6
Modelos de Regresión Lineal
Syllabus
Comprensión Duradera (DAT-1): Los modelos de regresión pueden permitirnos predecir respuestas ante cambios en una variable explicativa.
Objetivo de Aprendizaje DAT-1.D: Calcular un valor de respuesta predicho utilizando un modelo de regresión lineal. [Habilidad 2.C]
DAT-1.D.1 Un modelo de regresión lineal simple es una ecuación que utiliza una variable explicativa, $x$, para predecir la variable de respuesta, $y$.
DAT-1.D.2 El valor de respuesta predicho, denotado por $\hat{y}$, se calcula como $\hat{y} = a + bx$, donde $a$ es la intersección con el eje $y$, $b$ es la pendiente de la recta de regresión y $x$ es el valor de la variable explicativa.
DAT-1.D.3 La extrapolación es predecir un valor de respuesta utilizando un valor para la variable explicativa que está fuera del intervalo de valores de $x$ utilizados para determinar la recta de regresión. El valor predicho es menos confiable como estimación cuanto más nos alejamos en la extrapolación.
Fuente: College Board AP Course and Exam Description
La línea de regresión por mínimos cuadrados 最小二乘回归线 predice la respuesta: $\hat{y}=a+bx$, donde $\hat{y}$ es la respuesta predicha. La pendiente 斜率$b$ es el cambio previsto en $y$ por cada aumento de una unidad en $x$; la intersección en el eje $y$ 截距$a$ es la respuesta prevista en $y$ cuando $x=0$. Interpreta ambos en contexto y con unidades – una habilidad evaluada. Evita la extrapolación 外推 (predecir muy lejos fuera de los datos).
Ejemplo resuelto. Un estudio de las horas estudiadas ($x$) y la nota del examen ($y$) arroja $\hat{y}=20+3x$. La pendiente indica que cada hora adicional de estudio se asocia con un aumento previsto de $3$ puntos en la nota. Se predice que un estudiante que estudia $5$ horas obtendrá una nota de $\hat{y}=20+3(5)=35$.
Explorar
Ajustar una línea de mínimos cuadrados
Una línea de regresión es el mejor ajuste de línea recta, minimizando las distancias verticales al cuadrado. Su pendiente predice cómo $y$ cambia por unidad de $x$.
2.7
Residuos
Syllabus
Comprensión Duradera (DAT-1): Los modelos de regresión pueden permitirnos predecir las respuestas a los cambios en una variable explicativa.
Objetivo de Aprendizaje DAT-1.E: Representar las diferencias entre las respuestas medidas y las predichas mediante gráficos de residuos. [Habilidad 2.B]
DAT-1.E.1 El residuo es la diferencia entre el valor real y el valor predicho: $\text{residual} = y - \hat{y}$.
DAT-1.E.2 Un gráfico de residuos es un gráfico de los residuos frente a los valores de la variable explicativa o de los valores de respuesta predicha.
Objetivo de Aprendizaje DAT-1.F: Describir la forma de asociación de los datos bivariados utilizando gráficos de residuos. [Habilidad 2.A]
DAT-1.F.1 La aleatoriedad aparente en un gráfico de residuos para un modelo lineal es evidencia de una forma lineal en la asociación entre las variables.
DAT-1.F.2 Los gráficos de residuos pueden utilizarse para investigar la idoneidad de un modelo seleccionado.
Fuente: College Board AP Course and Exam Description
Regresión de mínimos cuadrados
Una residual 残差 es la diferencia entre el valor real y el predicho, $y-\hat{y}$: qué tan lejos se sitúa un punto por encima (+) o por debajo (−) de la línea. Un gráfico de residuos 残差图 grafica los residuos en función de $x$. Si no muestra ningún patrón (dispersión aleatoria), un modelo lineal es apropiado; un patrón curvo o en abanico indica que el modelo lineal es un ajuste deficiente.
Ejemplo resuelto. Continuando con el estudio anterior, un estudiante que estudió $5$ horas obtuvo realmente una puntuación de $40$. El residuo es $y-\hat{y}=40-35=+5$: la línea subestimó en $5$ puntos, por lo que este punto se sitúa por encima de la línea.
Una advertencia sobre $r$ y la recta: los cuatro conjuntos de datos tienen el mismo $r=0.82$ y el mismo $\hat{y}=3.0+0.5x$, pero solo el primero es genuinamente lineal. Los diagramas de dispersión apenas difieren — lo que revela la curvatura, el valor atípico y el punto de alta influencia es el diagrama de residuos debajo de cada uno.
coefficient of determination/ˌkəʊɪˈfɪʃənt ɒv dɪˌtɜːmɪˈneɪʃn/
决定系数
jué dìng xì shù
high-leverage/haɪ ˈliːvərɪdʒ/
高杠杆
gāo gàng gǎn
influential/ˌɪnfluːˈenʃl/
有影响的
yǒu yǐng xiǎng de
2.8
Regresión por Mínimos Cuadrados y su Ajuste
Syllabus
Comprensión Duradera (DAT-1): Los modelos de regresión pueden permitirnos predecir respuestas ante cambios en una variable explicativa.
Objetivo de Aprendizaje DAT-1.G: Estimar parámetros para el modelo de la recta de regresión de mínimos cuadrados. [Habilidad 2.C]
DAT-1.G.1 El modelo de regresión de mínimos cuadrados minimiza la suma de los cuadrados de los residuos y contiene el punto $(\bar{x}, \bar{y})$.
DAT-1.G.2 La pendiente, $b$, de la recta de regresión se puede calcular como $b = r \left( \dfrac{s_y}{s_x} \right)$, donde $r$ es la correlación entre $x$ e $y$, $s_y$ es la desviación estándar muestral de la variable de respuesta, $y$, y $s_x$ es la desviación estándar muestral de la variable explicativa, $x$.
DAT-1.G.3 A veces, la intersección con el eje $y$ de la recta no tiene una interpretación lógica en el contexto.
DAT-1.G.4 En la regresión lineal simple, $r^2$ es el cuadrado de la correlación, $r$. También se le llama coeficiente de determinación. $r^2$ representa la proporción de variación en la variable de respuesta que es explicada por la variable explicativa en el modelo.
Objetivo de Aprendizaje DAT-1.H: Interpretar coeficientes para el modelo de la recta de regresión de mínimos cuadrados. [Habilidad 4.B]
DAT-1.H.1 Los coeficientes del modelo de regresión de mínimos cuadrados son la pendiente estimada y la intersección con el eje $y$.
DAT-1.H.2 La pendiente es la cantidad que cambia el valor predicho de $y$ por cada aumento unitario en $x$.
DAT-1.H.3 El valor de la intersección con el eje $y$ es el valor predicho de la variable de respuesta cuando la variable explicativa es igual a $0$. La fórmula para la intersección con el eje $y$, $a$, es $a = \bar{y} - b\bar{x}$.
Fuente: College Board AP Course and Exam Description
La recta de mínimos cuadrados minimiza la suma de los residuos al cuadrado
La recta minimiza la suma de los residuos al cuadrado. Su ajuste se mide mediante:
$s$, la desviación estándar de los residuos: el error típico de predicción, en las unidades de la variable respuesta.
$r^2$, el coeficiente de determinación 决定系数 – la proporción de la variación en $y$ que el modelo lineal explica (un valor entre $0$ y $1$; multiplique por $100$ para expresarlo como porcentaje). Indíquelo en contexto: "$r^2 = 0.81$ significa que el 81% de la variación en $y$ es explicada por la relación lineal con $x$."
2.9
Desviaciones de la Linealidad
Syllabus
Comprensión perdurable (DAT-1): Los modelos de regresión pueden permitirnos predecir respuestas ante cambios en una variable explicativa.
Objetivo de aprendizaje DAT-1.I: Identificar puntos influyentes en la regresión. [Habilidad 2.A]
DAT-1.I.1 Un valor atípico en la regresión es un punto que no sigue la tendencia general mostrada en el resto de los datos y tiene un residuo grande cuando se calcula la Recta de Regresión por Mínimos Cuadrados (LSRL, por sus siglas en inglés).
DAT-1.I.2 Un punto de alta apalancamiento (high-leverage point) en la regresión tiene un valor de $x$ considerablemente mayor o menor que el resto de las observaciones.
DAT-1.I.3 Un punto influyente en la regresión es cualquier punto que, si se elimina, cambia sustancialmente la relación. Ejemplos incluyen una pendiente diferente, un intercepto en $y$ diferente y/o una correlación diferente. Los valores atípicos y los puntos de alta apalancamiento suelen ser influyentes.
Objetivo de aprendizaje DAT-1.J: Calcular una respuesta predicha utilizando una recta de regresión por mínimos cuadrados para un conjunto de datos transformados. [Habilidad 2.C]
DAT-1.J.1 Las transformaciones de variables, como evaluar el logaritmo natural de cada valor de la variable de respuesta o elevar al cuadrado cada valor de la variable explicativa, pueden utilizarse para crear conjuntos de datos transformados, que pueden tener una forma más lineal que los datos sin transformar.
DAT-1.J.2 El aumento de aleatoriedad en los gráficos de residuos después de la transformación de los datos y/o el movimiento de $r^2$ hacia un valor más cercano a 1 ofrece evidencia de que la recta de regresión por mínimos cuadrados para los datos transformados es un modelo más apropiado para usar en la predicción de respuestas ante la variable explicativa que la recta de regresión para los datos sin transformar.
Fuente: College Board AP Course and Exam Description
Algunos puntos afectan fuertemente a la recta. Un punto de alta apalancamiento 高杠杆 tiene un valor extremo de $x$; un punto influyente 有影响的 cambia notablemente la pendiente o el $r$ al ser eliminado; aquí, un punto atípico es aquel con un residuo grande. Cuando el patrón es curvo, transforme una variable (p. ej., tome un logaritmo) para linearizarla, luego ajuste una recta a los datos transformados.
2.9
Consejos para el examen
En un diagrama de dispersión describa la dirección, forma, intensidad y valores atípicos; $r$ oscila entre $-1$ y $1$.
La correlación no implica causalidad: una variable oculta puede influir en ambas.
Interprete la pendiente de la recta de mínimos cuadrados en contexto ("por cada unidad de $x$, la predicción de $y$ cambia en $b$").
Revise un gráfico de residuos: ausencia de patrones indica que la recta se ajusta bien; un patrón curvo indica que no. Evite la extrapolación.
$r^2$ es la fracción de variación en $y$ explicada por el modelo.
Lecciones interactivas sobre este tema
Trátalo paso a paso, con ejercicios de verificación instantánea.