Saltar al contenido

Exploración de datos de una variable

AP Estadística · Tema 1

Entrenar
Lección de video para este tema Abrir la página de video
9:03

Exploración de Datos de Una Variable

Mide lo mismo veinte veces y no obtendrás la misma respuesta veinte veces. Veinte estudiantes miden la misma mesa. Los valores varían. Eso no es un…

Narración en inglés · Subtítulos en inglés + 中文 quemados en pantalla

1.1

Introduciendo la estadística: ¿Qué podemos aprender de los datos?

Syllabus

Comprensión perdurable (VAR-1): Dado que la variación puede ser aleatoria o no, las conclusiones son inciertas.

Objetivo de aprendizaje VAR-1.A: Identificar preguntas para responder, basándose en la variación en datos de una variable. [Habilidad 1.A]

  • VAR-1.A.1 Los números pueden transmitir información significativa cuando se colocan en contexto.

Fuente: College Board AP Course and Exam Description

Estadística 统计学 es la ciencia de aprender a partir de datos 数据 – números o etiquetas recopilados del mundo real. Los datos varían, por lo que describimos patrones y tenemos en cuenta la variación 变异 en lugar de esperar que cada valor coincida. Una pregunta estadística anticipa una respuesta basada en datos que varían.

Dos distinciones atraviesan todo el curso. Un parámetro 参数 es un resumen numérico de toda una población; una estadística 统计量 es un resumen numérico de una muestra - usamos la estadística para estimar el parámetro que no podemos medir directamente. Y la estadística descriptiva 描述统计 solo resume el conjunto de datos a mano, mientras que la estadística inferencial 推断统计 usa una muestra para hacer y contrastar afirmaciones sobre la población más grande.

1.2

El lenguaje de la variación: Variables

Syllabus

Comprensión perdurable (VAR-1): Dado que la variación puede ser aleatoria o no, las conclusiones son inciertas.

Objetivo de aprendizaje VAR-1.B: Identificar variables en un conjunto de datos. [Habilidad 2.A]

  • VAR-1.B.1 Una variable es una característica que cambia de un individuo a otro.

Objetivo de aprendizaje VAR-1.C: Clasificar los tipos de variables. [Habilidad 2.A]

  • VAR-1.C.1 Una variable categórica toma valores que son nombres de categorías o etiquetas de grupos.
  • VAR-1.C.2 Una variable cuantitativa es aquella que toma valores numéricos para una cantidad medida o contada.
    • Ejemplos ilustrativos para VAR-1.C:
      • Variables categóricas:
        • Mano dominante
        • Grupo de edad (joven o mayor)
        • Título académico más alto obtenido
      • Variables cuantitativas:
        • Edad de una estructura
        • Altura de un niño
        • Concentración de una muestra

Fuente: College Board AP Course and Exam Description

Una variable 变量 es una característica que puede diferir entre individuos. Dos tipos:

  • Categorica 分类 (cualitativa): los valores son etiquetas/grupos (color de ojos, marca).
  • Cuantitativa 定量: los valores son números con los que se puede hacer aritmética (altura, edad). Las variables cuantitativas son discretas (contables) o continuas (medidas).

Elegir el gráfico y el resumen adecuados depende del tipo que tengas.

Explorar

¿Cualitativa o cuantitativa?

Cada variable es ya sea categórica (etiqueta cada unidad con un grupo) o cuantitativa (un número medido que puedes promediar). Qué tipo es decide los gráficos y resúmenes que tienes permitido usar.

Vocabulario Entrenar
Inglés Chino Pinyin
variable/ˈveərɪəbl/ 变量 biàn liàng
Categorical/ˌkætɪˈɡɒrɪkl/ 分类 fēn lèi
Quantitative/ˈkwɒntɪteɪtɪv/ 定量 dìng liàng
frequency table/ˈfriːkwənsi ˈteɪbl/ 频数表 pín shuò biǎo
relative frequency/ˈrelətɪv ˈfriːkwənsi/ 相对频率 xiāng duì pín lǜ
proportion/prəˈpɔːʃn/ 比例 bǐ lì
Bar charts/bɑː tʃɑːts/ 条形图 tiáo xíng tú
dotplot/ˈdɒtplɒt/ 点图 diǎn tú
stem-and-leaf plot/stem ænd liːf plɒt/ 茎叶图 jīng yè tú
1.3

Representando una variable categorica con tablas

Syllabus

Comprensión duradera (UNC-1): Las representaciones gráficas y las estadísticas nos permiten identificar y representar características clave de los datos.

Objetivo de aprendizaje UNC-1.A: Representar datos categóricos utilizando tablas de frecuencia o frecuencia relativa. [Habilidad 2.B]

  • UNC-1.A.1 Una tabla de frecuencia proporciona el número de casos que caen en cada categoría. Una tabla de frecuencia relativa proporciona la proporción de casos que caen en cada categoría.

Objetivo de aprendizaje UNC-1.B: Describir datos categóricos representados en tablas de frecuencia o frecuencia relativa. [Habilidad 2.A]

  • UNC-1.B.1 Los porcentajes, las frecuencias relativas y las tasas proporcionan la misma información que las proporciones.
  • UNC-1.B.2 Los conteos y las frecuencias relativas de los datos categóricos revelan información que puede utilizarse para justificar afirmaciones sobre los datos en su contexto.

Fuente: College Board AP Course and Exam Description

Una tabla de frecuencias 频数表 enumera el recuento (frecuencia) de cada categoría; una tabla de frecuencia relativa 相对频率 enumera la proporción 比例 de cada categoría (recuento ÷ total). Las frecuencias relativas te permiten comparar grupos de diferentes tamaños de manera justa.

1.4

Representando una variable categorica con gráficos

Syllabus

Comprensión duradera (UNC-1): Las representaciones gráficas y las estadísticas nos permiten identificar y representar características clave de los datos.

Objetivo de aprendizaje UNC-1.C: Representar datos categóricos gráficamente. [Habilidad 2.B]

  • UNC-1.C.1 Los diagramas de barras (o gráficos de barras) se utilizan para mostrar frecuencias (conteos) o frecuencias relativas (proporciones) en datos categóricos.
  • UNC-1.C.2 La altura o longitud de cada barra en un gráfico de barras corresponde al número o proporción de observaciones que caen dentro de cada categoría.
  • UNC-1.C.3 Existen muchas formas adicionales de representar frecuencias (conteos) o frecuencias relativas (proporciones) para datos categóricos.

Objetivo de aprendizaje UNC-1.D: Describir datos categóricos representados gráficamente. [Habilidad 2.A]

  • UNC-1.D.1 Las representaciones gráficas de una variable categórica revelan información que puede utilizarse para justificar afirmaciones sobre los datos en su contexto.

Objetivo de aprendizaje UNC-1.E: Comparar múltiples conjuntos de datos categóricos. [Habilidad 2.D]

  • UNC-1.E.1 Las tablas de frecuencias, los gráficos de barras u otras representaciones pueden utilizarse para comparar dos o más conjuntos de datos en términos de la misma variable categórica.

Fuente: College Board AP Course and Exam Description

Los gráficos de barras 条形图 muestran el recuento o proporción de cada categoría como barras separadas; un gráfico circular muestra la participación de cada categoría en el total. Las alturas de las barras (o rebanadas) te permiten comparar categorías de un vistazo. Las barras pueden ordenarse por tamaño o por un orden natural de categorías.

Explorar

Mostrar una variable categórica como un gráfico circular

Un gráfico circular convierte la participación de cada categoría del total en una porción: una participación mayor es una porción mayor, y todas las porciones juntas hacen el 100%. Es una imagen de una tabla de frecuencia relativa.

1.5

Representando una variable cuantitativa con gráficos

Syllabus

Comprensión perdurable (UNC-1): Las representaciones gráficas y las estadísticas nos permiten identificar y representar características clave de los datos.

Objetivo de aprendizaje UNC-1.F: Clasificar tipos de variables cuantitativas. [Habilidad 2.A]

  • UNC-1.F.1 Una variable discreta puede asumir un número contable de valores. El número de valores puede ser finito o infinitamente contable, como ocurre con los números naturales.
  • UNC-1.F.2 Una variable continua puede asumir infinitos valores, pero estos no pueden contarse. Independientemente de lo pequeño que sea el intervalo entre dos valores de una variable continua, siempre es posible determinar otro valor intermedio.
    • Ejemplos ilustrativos para UNC-1.F:
      • Una variable discreta:
        • Número de estudiantes en una clase
      • Una variable continua:
        • Altura de un niño

Objetivo de aprendizaje UNC-1.G: Representar datos cuantitativos gráficamente. [Habilidad 2.B]

  • UNC-1.G.1 En un histograma, la altura de cada barra indica el número o proporción de observaciones que caen dentro del intervalo correspondiente a dicha barra. Modificar los anchos de los intervalos puede alterar la apariencia del histograma.
  • UNC-1.G.2 En un diagrama de tallo y hoja, cada valor de dato se divide en un "tallo" (el primer dígito o dígitos) y una "hoja" (usualmente el último dígito).
  • UNC-1.G.3 Un gráfico de puntos representa cada observación mediante un punto, donde la posición en el eje horizontal corresponde al valor de dato de esa observación, apilándose casi valores idénticos unos sobre otros.
  • UNC-1.G.4 Un gráfico acumulativo representa el número o proporción de un conjunto de datos menor o igual a un número dado.
  • UNC-1.G.5 Existen muchas formas adicionales de representar gráficamente distribuciones de datos cuantitativos.

Fuente: College Board AP Course and Exam Description

Para números, usa un gráfico de puntos 点图, un diagrama de tallo y hoja 茎叶图, o un histograma 直方图 (barras sobre intervalos de valores llamados clases). Estos muestran la distribución 分布 – cómo se dispersan los valores. El ancho de clase de un histograma cambia la imagen, así que elígelo para revelar la forma.

En un histograma con anchos de clase desiguales, el área de la barra es la frecuencia
En un histograma con anchos de clase desiguales, el área de la barra es la frecuencia
Explorar

Explorar cómo el ancho de clase moldea un histograma

Un histograma agrupa datos en clases de ancho igual y dibuja una barra sobre cada una. Cambie las clases y note cómo los mismos datos pueden verse escalonados (demasiado estrechos) o suaves (demasiado anchos) — la forma es una elección.

Vocabulario Entrenar
Inglés Chino Pinyin
Statistics/stəˈtɪstɪks/ 统计学 tǒng jì xué
data/ˈdeɪtə/ 数据 shù jù
variation/ˌveərɪˈeɪʃn/ 变异 biàn yì
parameter/pəˈræmɪtə/ 参数 cān shù
statistic/stəˈtɪstɪk/ 统计量 tǒng jì liàng
descriptive statistics/dɪˈskrɪptɪv stəˈtɪstɪks/ 描述统计 miáo shù tǒng jì
inferential statistics/ɪnfəˈrenʃl stəˈtɪstɪks/ 推断统计 tuī duàn tǒng jì
histogram/ˈhɪstəɡræm/ 直方图 zhí fāng tú
1.6

Describiendo la distribución de una variable cuantitativa

Syllabus

Comprensión Duradera (UNC-1): Las representaciones gráficas y las estadísticas nos permiten identificar y representar características clave de los datos.

Objetivo de Aprendizaje UNC-1.H: Describir las características de las distribuciones de datos cuantitativos. [Habilidad 2.A]

  • UNC-1.H.1 Las descripciones de la distribución de datos cuantitativos incluyen la forma, el centro y la variabilidad (dispersión), así como cualquier característica inusual como valores atípicos, lagunas, agrupaciones o múltiples picos.
  • UNC-1.H.2 Los valores atípicos para datos de una sola variable son puntos de datos que son inusualmente pequeños o grandes en relación con el resto de los datos.
  • UNC-1.H.3 Una distribución está sesgada a la derecha (sesgo positivo) si la cola derecha es más larga que la izquierda. Una distribución está sesgada a la izquierda (sesgo negativo) si la cola izquierda es más larga que la derecha. Una distribución es simétrica si la mitad izquierda es la imagen especular de la mitad derecha.
  • UNC-1.H.4 Los gráficos univariados con un pico principal se denominan unimodales. Los gráficos con dos picos prominentes son bimodales. Un gráfico donde la altura de cada barra es aproximadamente la misma (sin picos prominentes) es aproximadamente uniforme.
  • UNC-1.H.5 Una laguna es una región de la distribución entre dos valores de datos donde no hay datos observados.
  • UNC-1.H.6 Las agrupaciones son concentraciones de datos generalmente separadas por lagunas.
  • UNC-1.H.7 La estadística descriptiva no atribuye propiedades de un conjunto de datos a una población más grande, pero puede proporcionar la base para conjeturas destinadas a pruebas posteriores.

Fuente: College Board AP Course and Exam Description

Describe cuatro cosas (recuerda SOCS):

  • Forma 形状: simétrica, o sesgada 偏斜 izquierda/derecha (una cola larga en ese lado), y cuántos picos tiene - un pico principal es unimodal 单峰, dos picos prominentes bimodal 双峰, y barras aproximadamente iguales uniforme 均匀.
  • Valores atípicos 离群值: valores inusuales muy alejados del resto.
  • Centro: un valor típico (media o mediana).
  • Dispersión: cuánto varían los valores (rango, IQR, desviación estándar).

Siempre describe la forma/centro/dispersión en contexto, con unidades.

La forma de una distribución: simétrica, sesgada a la derecha (cola larga a la derecha) o sesgada a la izquierda
La forma de una distribución: simétrica, sesgada a la derecha (cola larga a la derecha) o sesgada a la izquierda
Vocabulario Entrenar
Inglés Chino Pinyin
distribution/ˌdɪstrɪˈbjuːʃn/ 分布 fēn bù
Shape/ʃeɪp/ 形状 xíng zhuàng
skewed/skjuːd/ 偏斜 piān xié
unimodal/ˌʌnɪˈmɒdl/ 单峰 dān fēng
bimodal/baɪˈmɒdl/ 双峰 shuāng fēng
uniform/ˈjuːnɪfɔːm/ 均匀 jūn yún
Outliers/ˈaʊtlaɪəz/ 离群值 lí qún zhí
1.7

Estadísticas resumidas para una variable cuantitativa

Syllabus

Comprensión duradera (UNC-1): Las representaciones gráficas y las estadísticas nos permiten identificar y representar las características clave de los datos.

Objetivo de aprendizaje UNC-1.I: Calcular medidas de tendencia central y de posición para datos cuantitativos. [Habilidad 2.C]

  • UNC-1.I.1 Una estadística es un resumen numérico de los datos de la muestra.
  • UNC-1.I.2 La media es la suma de todos los valores de datos dividida por el número de valores. Para una muestra, la media se denota con la barra de $x$: $\bar{x} = \dfrac{1}{n}\sum_{i=1}^{n} x_i$, donde $x_i$ representa el $i^{\text{th}}$ punto de datos en la muestra y $n$ representa el número de valores de datos en la muestra.
  • UNC-1.I.3 La mediana de un conjunto de datos es el valor central cuando los datos están ordenados. Cuando el número de puntos de datos es par, la mediana puede tomar cualquier valor entre los dos valores centrales. En Estadística AP, el valor más comúnmente utilizado para la mediana de un conjunto de datos con un número par de valores es el promedio de los dos valores centrales.
  • UNC-1.I.4 El primer cuartil, Q1, es la mediana de la mitad del conjunto de datos ordenado desde el mínimo hasta la posición de la mediana. El tercer cuartil, Q3, es la mediana de la mitad del conjunto de datos ordenado desde la posición de la mediana hasta el máximo. Q1 y Q3 forman los límites para el 50% central de valores en un conjunto de datos ordenado.
  • UNC-1.I.5 El $p^{\text{th}}$ percentil se interpreta como el valor que tiene $p\%$ de los datos menores o iguales a él.

Objetivo de aprendizaje UNC-1.J: Calcular medidas de variabilidad para datos cuantitativos. [Habilidad 2.C]

  • UNC-1.J.1 Tres medidas comúnmente utilizadas de variabilidad (o dispersión) en una distribución son el rango, el rango intercuartílico y la desviación estándar.
  • UNC-1.J.2 El rango se define como la diferencia entre el valor máximo de datos y el valor mínimo de datos. El rango intercuartílico (IQR) se define como la diferencia entre el tercer y el primer cuartil: $Q3 - Q1$. Tanto el rango como el rango intercuartílico son formas posibles de medir la variabilidad de la distribución de una variable cuantitativa.
  • UNC-1.J.3 La desviación estándar es una forma de medir la variabilidad de la distribución de una variable cuantitativa. Para una muestra, la desviación estándar se denota con $s$: $s_x = \sqrt{\dfrac{1}{n-1}\sum(x_i - \bar{x})^2}$. El cuadrado de la desviación estándar de la muestra, $s^2$, se denomina varianza de la muestra.
  • UNC-1.J.4 Cambiar las unidades de medida afecta los valores de las estadísticas calculadas.

Objetivo de aprendizaje UNC-1.K: Explicar la selección de una medida particular de tendencia central y/o variabilidad para describir un conjunto de datos cuantitativos. [Habilidad 4.B]

  • UNC-1.K.1 Existen muchos métodos para determinar valores atípicos. Dos métodos utilizados frecuentemente en este curso son:
    • UNC-1.K.1.i Un valor atípico es un valor mayor que $1.5 \times \text{IQR}$ por encima del tercer cuartil o más de $1.5 \times \text{IQR}$ por debajo del primer cuartil.
    • UNC-1.K.1.ii Un valor atípico es un valor ubicado 2 o más desviaciones estándar por encima o por debajo de la media.
  • UNC-1.K.2 La media, la desviación estándar y el rango se consideran no resistentes (o no robustas) porque se ven influenciadas por los valores atípicos. La mediana y el IQR se consideran resistentes (o robustas), porque los valores atípicos no afectan significativamente (si acaso) su valor.

Fuente: College Board AP Course and Exam Description

Desviación estándar: dispersión alrededor de la media
  • Centro: la media 均值 $\bar{x}=\dfrac{\sum x_i}{n}$ (promedio) y la mediana 中位数 (valor medio). La mediana resiste a los valores atípicos; la media es arrastrada hacia un sesgo.
  • Dispersión: el rango, el rango intercuartílico 四分位距 $\text{IQR}=Q_3-Q_1$ (el 50% central) y la desviación estándar 标准差 $s_x=\sqrt{\dfrac{\sum(x_i-\bar{x})^2}{n-1}}$ (distancia típica desde la media; su cuadrado es la varianza 方差).
  • El resumen de cinco números 五数概括: mínimo, $Q_1$, mediana, $Q_3$, máximo.

Usa medidas resistentes (mediana, IQR) para datos sesgados; media y desviación estándar para datos aproximadamente simétricos.

El percentil 百分位数 de un valor es el porcentaje de datos en o por debajo de él – por lo tanto, la mediana es el percentil 50 y $Q_1$ el percentil 25. Un gráfico de frecuencia relativa acumulada 累积相对频率 hace fácil leer los percentiles: para cada valor traza la proporción de datos en o por debajo de él, subiendo de 0 a 1. Sube desde un valor hasta la curva y luego horizontalmente hacia su percentil, o invierte los pasos para encontrar el valor en un percentil dado (la misma lectura funciona desde una tabla de frecuencia acumulada).

Ejemplo resuelto. Para los datos $4, 8, 6, 10, 7$: la media es $\bar{x}=\dfrac{4+8+6+10+7}{5}=\dfrac{35}{5}=7$. Ordenando a $4,6,7,8,10$, la mediana es el valor central, $7$. La media y la mediana coinciden aquí porque los datos son aproximadamente simétricos.

Vocabulario Entrenar
Inglés Chino Pinyin
mean/miːn/ 均值 jūn zhí
median/ˈmiːdiːən/ 中位数 zhōng wèi shù
interquartile range/ˌɪntəˈkwɔːtaɪl reɪndʒ/ 四分位距 sì fēn wèi jù
standard deviation/ˈstændəd ˌdiːvɪˈeɪʃn/ 标准差 biāo zhǔn chà
variance/ˈveərɪəns/ 方差 fāng chà
five-number summary/faɪv ˈnʌmbə ˈsʌməri/ 五数概括 wǔ shù gài kuò
percentile/pəˈsentaɪl/ 百分位数 bǎi fēn wèi shù
cumulative relative frequency graph/ˈkjuːmjʊlətɪv ˈrelətɪv ˈfriːkwənsi ɡræf/ 累积相对频率图 lěi jī xiāng duì pín lǜ tú
1.8

Representaciones gráficas de estadísticas resumidas

Syllabus

Comprensión Duradera (UNC-1): Las representaciones gráficas y las estadísticas nos permiten identificar y representar las características clave de los datos.

Objetivo de Aprendizaje UNC-1.L: Representar estadísticas resumidas para datos cuantitativos de forma gráfica. [Habilidad 2.B]

  • UNC-1.L.1 Juntos, el valor mínimo de los datos, el primer cuartil (Q1), la mediana, el tercer cuartil (Q3) y el valor máximo de los datos conforman el resumen de cinco números.
  • UNC-1.L.2 Un diagrama de caja es una representación gráfica del resumen de cinco números (mínimo, primer cuartil, mediana, tercer cuartil, máximo). La caja representa el 50% central de los datos, con una línea en la mediana y los extremos de la caja correspondientes a los cuartiles. Las líneas ("bigotes") se extienden desde los cuartiles hasta el punto más extremo que no sea un valor atípico, y los valores atípicos se indican con su propio símbolo más allá de este.

Objetivo de Aprendizaje UNC-1.M: Describir estadísticas resumidas de datos cuantitados representadas gráficamente. [Habilidad 2.A]

  • UNC-1.M.1 Las estadísticas resumidas de datos cuantitativos, o de conjuntos de datos cuantitativos, pueden utilizarse para justificar afirmaciones sobre los datos en contexto.
  • UNC-1.M.2 Si una distribución es relativamente simétrica, entonces la media y la mediana están relativamente cerca una de la otra. Si una distribución está sesgada hacia la derecha, entonces la media suele estar a la derecha de la mediana. Si la distribución está sesgada hacia la izquierda, entonces la media suele estar a la izquierda de la mediana.

Fuente: College Board AP Course and Exam Description

Un diagrama de caja 箱线图 dibuja el resumen de cinco números: una caja de $Q_1$ a $Q_3$ con la mediana dentro, y bigotes hacia los valores extremos no atípicos. Un punto es un valor atípico si se encuentra más allá de $1.5\times\text{IQR}$ de un cuartil – una regla que podrías ser solicitado a aplicar. Los diagramas de caja son ideales para comparar varios grupos uno al lado del otro.

Ejemplo resuelto. Un conjunto de datos tiene $Q_1=20$ y $Q_3=32$, por lo tanto $\text{IQR}=12$. Los límites de valores atípicos son $Q_1-1.5(12)=2$ y $Q_3+1.5(12)=50$. Cualquier valor por debajo de $2$ o por encima de $50$ se marca como un valor atípico.

Un diagrama de caja y bigotes muestra los cuartiles y el rango
Un diagrama de caja y bigotes muestra los cuartiles y el rango
Un diagrama de caja y bigotes representa el resumen de cinco números; la caja abarca el RIC
Un diagrama de caja dibuja el resumen de cinco números; la caja abarca el IQR
Explorar

Explorar el resumen de cinco números como un diagrama de caja

Arrastre $Q_1$, la mediana, y $Q_3$ para ver la caja (su longitud es la RIC) y cómo la posición de la mediana dentro de la caja revela la asimetría — una mediana cercana a $Q_1$ señala una distribución sesgada a la derecha.

Vocabulario Entrenar
Inglés Chino Pinyin
boxplot/ˈbɒksplɒt/ 箱线图 xiāng xiàn tú
normal distribution/ˈnɔːml ˌdɪstrɪˈbjuːʃn/ 正态分布 zhèng tài fēn bù
1.9

Comparando distribuciones de una variable cuantitativa

Syllabus

Comprensión perdurable (UNC-1): Las representaciones gráficas y las estadísticas nos permiten identificar y representar las características clave de los datos.

Objetivo de aprendizaje UNC-1.N: Comparar representaciones gráficas para múltiples conjuntos de datos cuantitativos. [Habilidad 2.D]

  • UNC-1.N.1 Cualquier tipo de representación gráfica, p. ej., histogramas, diagramas de caja lado a lado, etc., puede utilizarse para comparar dos o más muestras independientes en cuanto a la medida de tendencia central, variabilidad, agrupamientos, vacíos, valores atípicos y otras características.

Objetivo de aprendizaje UNC-1.O: Comparar estadísticas descriptivas para múltiples conjuntos de datos cuantitativos. [Habilidad 2.D]

  • UNC-1.O.1 Cualquier resumen numérico (p. ej., media, desviación estándar, frecuencia relativa, etc.) puede utilizarse para comparar dos o más muestras independientes.

Fuente: College Board AP Course and Exam Description

Para comparar dos o más grupos, compara forma, centro y dispersión, y menciona los valores atípicos – siempre con palabras comparativas ("El Grupo A tiene una mediana más alta que el Grupo B") y en contexto. No simplemente describa cada grupo por separado; haga la comparación explícita.

Explorar

Comparar distribuciones con diagramas de caja

Un diagrama de caja dibuja el resumen de cinco números. Colocar dos diagramas de caja en la misma escala compara su centro (mediana), dispersión (RIC = ancho de la caja) y asimetría de un vistazo — la forma justa de comparar grupos.

1.10

La distribución normal

Syllabus

Comprensión duradera (VAR-2): La distribución normal puede utilizarse para representar algunas distribuciones poblacionales.

Objetivo de aprendizaje VAR-2.A: Comparar una distribución de datos con el modelo de distribución normal. [Habilidad 2.D]

  • VAR-2.A.1 Un parámetro es un resumen numérico de una población.
  • VAR-2.A.2 Algunos conjuntos de datos pueden describirse como aproximadamente normalmente distribuidos. Una curva normal tiene forma de montículo y es simétrica. Los parámetros de una distribución normal son la media poblacional, $\mu$, y la desviación estándar poblacional, $\sigma$.
  • VAR-2.A.3 Para una distribución normal, aproximadamente el 68 % de las observaciones se encuentran dentro de 1 desviación estándar de la media, aproximadamente el 95 % de las observaciones se encuentran dentro de 2 desviaciones estándar de la media y aproximadamente el 99,7 % de las observaciones se encuentran dentro de 3 desviaciones estándar de la media. Esto se conoce como la regla empírica.
  • VAR-2.A.4 Muchas variables pueden modelarse mediante una distribución normal.
    • Ejemplos ilustrativos para VAR-2.A:
      • Variables que pueden modelarse mediante una distribución normal:
        • Temperatura corporal
        • Peso de una hogaza de pan

Objetivo de aprendizaje VAR-2.B: Determinar proporciones y percentiles a partir de una distribución normal. [Habilidad 3.A]

  • VAR-2.B.1 Una puntuación estandarizada para un valor de dato determinado se calcula como (valor de dato − media)/(desviación estándar) y mide el número de desviaciones estándar que un valor de dato está por encima o por debajo de la media.
  • VAR-2.B.2 Un ejemplo de puntuación estandarizada es una puntuación $z$, que se calcula como $z\text{-score} = \left(\dfrac{x_i - \mu}{\sigma}\right)$. Una puntuación $z$ mide cuántas desviaciones estándar está un valor de dato de la media.
  • VAR-2.B.3 Se puede utilizar tecnología, como una calculadora, una tabla normal estándar o salidas generadas por computadora, para encontrar la proporción de valores de datos ubicados en un intervalo dado de una variable aleatoria normalmente distribuida.
  • VAR-2.B.4 Dada el área de una región bajo la gráfica de la curva de la distribución normal, es posible utilizar tecnología, como una calculadora, una tabla normal estándar o salidas generadas por computadora, para estimar parámetros de algunas poblaciones.

Objetivo de aprendizaje VAR-2.C: Comparar medidas de posición relativa en conjuntos de datos. [Habilidad 2.D]

  • VAR-2.C.1 Los percentiles y las puntuaciones $z$ pueden utilizarse para comparar las posiciones relativas de puntos dentro de un conjunto de datos o entre conjuntos de datos.

Fuente: College Board AP Course and Exam Description

Una distribución normal 正态分布 es un modelo simétrico en forma de campana descrito por su media $\mu$ y desviación estándar $\sigma$. La regla empírica 经验法则 (68–95–99.7): aproximadamente el 68% de los valores están dentro de $1\sigma$ de la media, el 95% dentro de $2\sigma$, y el 99.7% dentro de $3\sigma$.

La curva normal: una probabilidad es el área bajo ella, centrada en la media
La curva normal: una probabilidad es el área bajo ella, centrada en la media

Un $z$-score 标准分数 mide cuántas desviaciones estándar está un valor de la media:

$$z=\frac{x-\mu}{\sigma}.$$
Convierte a un $z$-score, luego usa la tabla normal o tecnología para encontrar la proporción (área) por debajo, por encima o entre valores – e invierte el proceso para encontrar un valor a partir de un percentil dado.

Ejemplo resuelto. Las puntuaciones de examen son normales con $\mu=500$ y $\sigma=100$. Una puntuación de $700$ tiene $z=\dfrac{700-500}{100}=2$. Por la regla empírica, $95\%$ de las puntuaciones se encuentran dentro de $2\sigma$, por lo que $2.5\%$ están por encima de $700$ – lo que significa que una $700$ está aproximadamente en el percentil $97.5$.

The normal curve and the 68-95-99.7 empirical rule
La curva normal y la regla empírica 68-95-99.7
Explorar

Explorar el área bajo la curva normal

La proporción de datos por debajo de un valor igual al área bajo la curva a su izquierda. Sombree una cola o una banda central para ver la regla empírica 68–95–99.7 y lea una puntuación-z $z$ como un área.

Vocabulario Entrenar
Inglés Chino Pinyin
empirical rule/emˈpɪrɪkl ruːl/ 经验法则 jīng yàn fǎ zé
$z$-score/ˈzed skɔː/ 标准分数 biāo zhǔn fēn shù
1.10

Consejos para el examen

  • Describa una distribución mediante forma, centro, dispersión y valores atípicos (SOCS), siempre en contexto.
  • La media es afectada por los valores atípicos; la mediana es resistente a ellos, por lo que prefiera la mediana para datos sesgados.
  • Para una distribución normal, utilice la regla 68–95–99.7 y los puntajes z $z=\tfrac{x-\mu}{\sigma}$.
  • Compare distribuciones usando diagramas de caja lado a lado y comente sobre el centro, la dispersión y la forma.
  • La desviación estándar mide una distancia típica respecto a la media; el RCI se asocia con la mediana.

Lecciones interactivas sobre este tema

Trátalo paso a paso, con ejercicios de verificación instantánea.

Exámenes Anteriores

Más temas en AP Estadística

Iniciar sesión o crear cuenta

IGCSE, A-Level & AP