Saltar al contenido

Inferencia para datos categóricos: proporciones

AP Estadística · Tema 6

Entrenar
Lección de video para este tema Abrir la página de video
7:52

Inferencia para Datos Categóricos: Proporciones

Una ciudad quiere saber cuántas personas apoyan una nueva política. No podemos preguntar a todos, así que preguntamos a doscientos al azar. Ciento veintidichos dicen que sí — sesenta…

Narración en inglés · Subtítulos en inglés + 中文 quemados en pantalla

6.1

¿Por qué ser normal?

Syllabus

Comprensión perdurable (VAR-1): Dado que la variación puede ser aleatoria o no, las conclusiones son inciertas.

Objetivo de aprendizaje VAR-1.H: Identificar preguntas sugeridas por la variación en las formas de las distribuciones de muestras extraídas de la misma población. [Habilidad 1.A]

  • VAR-1.H.1 La variación en las formas de las distribuciones de datos puede ser aleatoria o no.

Fuente: College Board AP Course and Exam Description

Debido a que una proporción muestral $\hat{p}$ se distribuye aproximadamente de forma normal (cuando se cumplen las condiciones), podemos medir qué tan lejos está un resultado muestral de un valor afirmado en errores estándar y convertirlo en una probabilidad. Esto es lo que hace posible la inferencia 推断 – sacar conclusiones sobre una población a partir de una muestra.

6.2

Intervalo de confianza para una proporción

Syllabus

Comprensión Duradera (UNC-4): Se debe utilizar un intervalo de valores para estimar parámetros, con el fin de tener en cuenta la incertidumbre.

Objetivo de Aprendizaje UNC-4.A: Identificar un procedimiento de intervalo de confianza apropiado para una proporción poblacional. [Habilidad 1.D]

  • UNC-4.A.1 El procedimiento de intervalo de confianza apropiado para una proporción de una sola muestra para una variable categórica es un intervalo $z$ de una sola muestra para una proporción.

Objetivo de Aprendizaje UNC-4.B: Verificar las condiciones para calcular intervalos de confianza para una proporción poblacional. [Habilidad 4.C]

  • UNC-4.B.1 Para hacer supuestos necesarios para inferencias sobre proporciones poblacionales, medias y pendientes, debemos verificar la independencia en los métodos de recolección de datos y la selección de la distribución muestral adecuada.
  • UNC-4.B.2 Para calcular un intervalo de confianza que estime una proporción poblacional, $p$, debemos verificar la independencia y que la distribución muestral sea aproximadamente normal.
    • a. Para verificar la independencia:
      • i. Los datos deben recolectarse mediante una muestra aleatoria o un experimento aleatorizado.
      • ii. Cuando se muestree sin reemplazo, verifique que $n \leq 10\%N$, donde $N$ es el tamaño de la población.
    • b. Para verificar que la distribución muestral de $\hat{p}$ es aproximadamente normal (forma):
      • i. Para variables categóricas, verifique que tanto el número de éxitos, $n\hat{p}$, como el número de fracasos, $n(1-\hat{p})$, sean al menos 10, de modo que el tamaño de la muestra sea lo suficientemente grande para respaldar un supuesto de normalidad.

Objetivo de Aprendizaje UNC-4.C: Determinar el margen de error para un tamaño de muestra dado y una estimación para el tamaño de muestra que resultará en un margen de error específico para una proporción poblacional. [Habilidad 3.D]

  • UNC-4.C.1 Basado en los datos de la muestra, el error estándar de una estadística es una estimación para la desviación estándar de dicha estadística. El error estándar de $\hat{p}$ es $SE_{\hat{p}} = \sqrt{\dfrac{\hat{p}(1-\hat{p})}{n}}$.
  • UNC-4.C.2 Un margen de error indica cuánto es probable que varíe un valor de una estadística muestral respecto al valor del correspondiente parámetro poblacional.
  • UNC-4.C.3 Para variables categóricas, el margen de error es igual al valor crítico ($z^*$) multiplicado por el error estándar (SE) de la estadística relevante, lo cual equivale a $z^* \sqrt{\dfrac{\hat{p}(1-\hat{p})}{n}}$ para una proporción de una sola muestra.
  • UNC-4.C.4 La fórmula del margen de error puede reordenarse para despejar $n$, el tamaño mínimo de muestra necesario para lograr un margen de error dado. Para este propósito, utilice un valor estimado para $\hat{p}$ o use $\hat{p} = 0.5$ a fin de encontrar un límite superior para el tamaño de muestra que resultará en un margen de error dado.

Objetivo de Aprendizaje UNC-4.D: Calcular un intervalo de confianza apropiado para una proporción poblacional. [Habilidad 3.D]

  • UNC-4.D.1 En general, un intervalo estimado puede construirse como estimación puntual ± (margen de error). Para una proporción de una sola muestra, el intervalo estimado es $\hat{p} \pm z^* \sqrt{\dfrac{\hat{p}(1-\hat{p})}{n}}$.
    • Aclaración: Las fórmulas para intervalos estimados no aparecen explícitamente en la Hoja de Fórmulas de Estadística AP proporcionada con el Examen de Estadística AP. Sin embargo, estas fórmulas no necesitan memorizarse, ya que pueden construirse basándose en la fórmula general de la estadística de prueba y las fórmulas relevantes de error estándar que se encuentran en la hoja de fórmulas.
  • UNC-4.D.2 Los valores críticos representan los límites que abarcan el C% central de la distribución normal estándar, donde C% es un nivel de confianza aproximado para una proporción.

Objetivo de Aprendizaje UNC-4.E: Calcular un intervalo estimado basado en un intervalo de confianza para una proporción poblacional. [Habilidad 3.D]

  • UNC-4.E.1 Los intervalos de confianza para proporciones poblacionales pueden utilizarse para calcular intervalos estimados con unidades especificadas.

Fuente: College Board AP Course and Exam Description

Qué significa un intervalo de confianza

Un intervalo de confianza 置信区间 estima el parámetro como un rango: estadístico $\pm$ margen de error 误差幅度.

$$\hat{p}\pm z^{*}\sqrt{\frac{\hat{p}(1-\hat{p})}{n}}.$$
$z^{*}$ es el valor crítico para el nivel de confianza 置信水平 (por ejemplo, $1.96$ para un 95%). Condiciones: muestra aleatoria, Grandes Recuentos ($n\hat p\ge 10$ y $n(1-\hat p)\ge 10$) y la condición del 10%. Interpreta esto: "Estamos 95% seguros de que la proporción verdadera de... está entre... y...". Interpreta el nivel: "En el 95% de las muestras, este método produce un intervalo que captura la proporción verdadera."

A lo largo de muchas muestras, aproximadamente el 95% de los intervalos de confianza del 95% capturan la proporción verdadera
En muchas muestras, aproximadamente el 95% de los intervalos de confianza del 95% capturan la proporción verdadera

Ejemplo resuelto. En una muestra aleatoria de $200$ personas, $120$ apoyan una política, por lo que $\hat{p}=0.60$. Un intervalo $95\%$ utiliza $z^*=1.96$:

$$0.60\pm1.96\sqrt{\frac{0.60(0.40)}{200}}=0.60\pm0.068=(0.532,\ 0.668).$$
Estamos $95\%$ seguros de que la proporción verdadera de partidarios se encuentra entre $53.2\%$ y $66.8\%$.

Un intervalo de confianza 95% alcanza 1.96 errores estándar en cada lado de la estimación
Un intervalo de confianza 95% se extiende 1.96 errores estándar a cada lado de la estimación

Elegir el tamaño de la muestra. Para mantener el margen de error no mayor que un objetivo $m$, establezca $z^{*}\sqrt{\dfrac{\hat p(1-\hat p)}{n}}\le m$ y resuelva para $n$. Cuando no tiene una estimación de $\hat p$, use $\hat p=0.5$: esto hace que $\hat p(1-\hat p)$ sea lo más grande posible, proporcionando el tamaño de muestra requerido más seguro (más grande). Siempre redondee el resultado hacia arriba al siguiente número entero de personas.

Ejemplo resuelto. ¿Cuántas personas debe encuestar para un intervalo $95\%$ con un margen de error de a lo sumo $0.03$? Usando $\hat p=0.5$ y $z^*=1.96$:

$$n=\frac{(z^*)^2\,\hat p(1-\hat p)}{m^2}=\frac{1.96^2(0.5)(0.5)}{0.03^2}=\frac{0.9604}{0.0009}\approx1067.1,$$
por lo que encuestará a $1068$ personas (redondee siempre hacia arriba, ya que $1067$ dejaría el margen ligeramente demasiado grande).

Vocabulario Entrenar
Inglés Chino Pinyin
inference/ˈɪnfərəns/ 推断 tuī duàn
confidence interval/ˈkɒnfɪdəns ˈɪntəvl/ 置信区间 zhì xìn qū jiān
margin of error/ˈmɑːdʒɪn ɒv ˈerə/ 误差幅度 wù chā fú dù
confidence level/ˈkɒnfɪdəns ˈlevl/ 置信水平 zhì xìn shuǐ píng
significance test/sɪɡˈnɪfɪkəns test/ 显著性检验 xiǎn zhù xìng jiǎn yàn
null hypothesis/nʌl haɪˈpɒθəsɪs/ 原假设 yuán jiǎ shè
alternative hypothesis/ɔːlˈtɜːnətɪv haɪˈpɒθəsɪs/ 备择假设 bèi zé jiǎ shè
test statistic/test stəˈtɪstɪk/ 检验统计量 jiǎn yàn tǒng jì liàng
significance level/sɪɡˈnɪfɪkəns ˈlevl/ 显著性水平 xiǎn zhù xìng shuǐ píng
Type I error/taɪp aɪ ˈerə/ 第一类错误 dì yī lèi cuò wù
6.3

Justificar una afirmación a partir de un intervalo

Syllabus

Comprensión perdurable (UNC-4): Se debe utilizar un intervalo de valores para estimar parámetros, a fin de tener en cuenta la incertidumbre.

Objetivo de aprendizaje UNC-4.F: Interpretar un intervalo de confianza para una proporción poblacional. [Habilidad 4.B]

  • UNC-4.F.1 Un intervalo de confianza para una proporción poblacional contiene o no la proporción poblacional, ya que cada intervalo se basa en datos de una muestra aleatoria, los cuales varían de una muestra a otra.
  • UNC-4.F.2 Tenemos un C% de confianza de que el intervalo de confianza para una proporción poblacional captura la proporción poblacional.
  • UNC-4.F.3 En muestreo aleatorio repetido con el mismo tamaño de muestra, aproximadamente el C% de los intervalos de confianza creados capturarán la proporción poblacional.
  • UNC-4.F.4 La interpretación de un intervalo de confianza para una proporción de una sola muestra debe incluir una referencia a la muestra tomada y detalles sobre la población que representa.
    • Ejemplos ilustrativos para UNC-4.F.4: Para interpretar un intervalo de confianza del 99% de (0,268, 0,292), basado en la proporción de una muestra representativa a nivel nacional de estudiantes de último año de secundaria que respondieron correctamente una pregunta de opción múltiple específica: "Tenemos un 99% de confianza de que el intervalo de 0,268 a 0,292 contiene la proporción poblacional de todos los estudiantes de último año de secundaria de Estados Unidos que responderían correctamente a esta pregunta" (Pregunta libre de examen 2011, 6(a)).

Objetivo de aprendizaje UNC-4.G: Justificar una afirmación basada en un intervalo de confianza para una proporción poblacional. [Habilidad 4.D]

  • UNC-4.G.1 Un intervalo de confianza para una proporción poblacional proporciona un intervalo de valores que puede ofrecer evidencia suficiente para respaldar una afirmación particular en contexto.

Objetivo de aprendizaje UNC-4.H: Identificar las relaciones entre el tamaño de la muestra, el ancho de un intervalo de confianza, el nivel de confianza y el margen de error para una proporción poblacional. [Habilidad 4.A]

  • UNC-4.H.1 Cuando todo lo demás permanece igual, el ancho del intervalo de confianza para una proporción poblacional tiende a disminuir a medida que aumenta el tamaño de la muestra. Para una proporción poblacional, el ancho del intervalo es proporcional a $\dfrac{1}{\sqrt{n}}$.
  • UNC-4.H.2 Para una muestra dada, el ancho del intervalo de confianza para una proporción poblacional aumenta a medida que aumenta el nivel de confianza.
  • UNC-4.H.3 El ancho de un intervalo de confianza para una proporción poblacional es exactamente el doble del margen de error.

Fuente: College Board AP Course and Exam Description

Para juzgar un valor afirmado: si se encuentra dentro del intervalo, los datos son consistentes con él; si se encuentra fuera, los datos proporcionan evidencia en contra. Fundamente la conclusión en si los valores plausibles incluyen la afirmación, en contexto.

6.4

Preparar una prueba para una proporción

Syllabus

Comprensión duradera (VAR-6): La distribución normal puede utilizarse para modelar la variación.

Objetivo de aprendizaje VAR-6.D: Identificar las hipótesis nula y alternativa para una proporción poblacional. [Habilidad 1.F]

  • VAR-6.D.1 La hipótesis nula es la situación que se asume correcta a menos que la evidencia sugiera lo contrario, y la hipótesis alternativa es la situación para la cual se está recolectando evidencia.
  • VAR-6.D.2 Para hipótesis sobre parámetros, la hipótesis nula contiene una referencia de igualdad (=, ≥ o ≤), mientras que la hipótesis alternativa contiene una desigualdad estricta (<, > o ≠). El tipo de desigualdad en la hipótesis alternativa se basa en la pregunta de interés. Las hipótesis alternativas con < o > se llaman unilaterales, y las hipótesis alternativas con ≠ se llaman bilaterales. Aunque la hipótesis nula para una prueba unilateral puede incluir un símbolo de desigualdad, todavía se prueba en el límite de igualdad.
  • VAR-6.D.3 La hipótesis nula para una proporción poblacional es: $H_0 : p = p_0$, donde $p_0$ es el valor hipotetizado nulo para la proporción poblacional.
  • VAR-6.D.4 Una hipótesis alternativa unilateral para una proporción es ya sea $H_a : p < p_0$ o $H_a : p > p_0$. Una hipótesis alternativa bilateral es $H_a : p_1 \neq p_2$.
  • VAR-6.D.5 Para una prueba $z$ de una muestra para una proporción poblacional, la hipótesis nula especifica un valor para la proporción poblacional, usualmente uno que indica ausencia de diferencia o efecto.

Objetivo de aprendizaje VAR-6.E: Identificar un método de prueba apropiado para una proporción poblacional. [Habilidad 1.E]

  • VAR-6.E.1 Para una sola variable categórica, el método de prueba apropiado para una proporción poblacional es una prueba $z$ de una muestra para una proporción poblacional.

Objetivo de aprendizaje VAR-6.F: Verificar las condiciones para realizar inferencias estadísticas al probar una proporción poblacional. [Habilidad 4.C]

  • VAR-6.F.1 Con el fin de realizar inferencias estadísticas al probar una proporción poblacional, debemos verificar la independencia y que la distribución muestral sea aproximadamente normal:
    • a. Para verificar la independencia:
      • i. Los datos deben recolectarse mediante una muestra aleatoria o un experimento aleatorizado.
      • ii. Al muestrear sin reemplazo, verifique que $n \leq 10\%N$.
    • b. Para verificar que la distribución muestral de $\hat{p}$ sea aproximadamente normal (forma):
      • i. Asumiendo que $H_0$ es verdadera $(p = p_0)$, verifique que tanto el número de éxitos, $np_0$, como el número de fracasos, $n(1-p_0)$, sean al menos 10, de modo que el tamaño de la muestra sea lo suficientemente grande para apoyar la suposición de normalidad.

Fuente: College Board AP Course and Exam Description

Una prueba de significancia 显著性检验 pondera la evidencia contra una afirmación. Enuncie una hipótesis nula 原假设 $H_0$ y una hipótesis alternativa 备择假设 $H_a$ sobre el parámetro $p$:

$$H_0: p=p_0 \qquad H_a: p\neq p_0 \ (\text{or } <,\, >).$$
Verifique las mismas condiciones (aleatoriedad, Grandes Conteos usando $p_0$, 10%). La estadística de prueba 检验统计量 cuenta los errores estándar desde $p_0$:
$$z=\frac{\hat p-p_0}{\sqrt{p_0(1-p_0)/n}}.$$

Ejemplo resuelto. Una empresa afirma $90\%$ satisfacción ($p_0=0.90$); una muestra de $100$ encuentra $84$ satisfechos ($\hat{p}=0.84$). Pruebe $H_0:p=0.90$ contra $H_a:p\neq0.90$ al nivel $\alpha=0.05$:

$$z=\frac{0.84-0.90}{\sqrt{0.90(0.10)/100}}=\frac{-0.06}{0.03}=-2.0,$$
lo que da un valor $p$ de dos colas de aproximadamente $2(0.023)=0.046$. Dado que $0.046<0.05$, rechazar $H_0$ – hay evidencia de que la tasa de satisfacción verdadera difiere de (es menor que) $90\%$.

Una prueba bilateral del 5% rechaza la hipótesis nula en las colas sombreadas
Una prueba de dos colas al 5% rechaza la hipótesis nula en las colas sombreadas
6.5

Interpretación de los valores p

Syllabus

Comprensión duradera (VAR-6): La distribución normal puede utilizarse para modelar la variación.

Objetivo de aprendizaje VAR-6.G: Calcular una estadística de prueba adecuada y un valor $p$ para una proporción poblacional. [Habilidad 3.E]

  • VAR-6.G.1 La distribución de la estadística de prueba asumiendo que la hipótesis nula es verdadera (distribución nula) puede ser ya sea una distribución de aleatorización o, cuando se asume que un modelo de probabilidad es verdadero, una distribución teórica ($z$).
  • VAR-6.G.2 Al utilizar una prueba $z$, la estadística de prueba estandarizada puede escribirse: $\text{test statistic} = \dfrac{\text{sample statistic} - \text{null value of the parameter}}{\text{standard deviation of the statistic}}$. Esto se denomina estadística $z$ para proporciones.
  • VAR-6.G.3 La estadística de prueba para una proporción poblacional es: $z = \dfrac{\hat{p} - p_0}{\sqrt{\dfrac{p_0(1-p_0)}{n}}}$.
    • Declaración aclaratoria: Las fórmulas para las estadísticas de prueba no aparecen explícitamente en la Hoja de Fórmulas de Estadística AP proporcionada con el Examen de Estadística AP. Sin embargo, estas fórmulas no necesitan memorizarse, ya que pueden construirse basándose en la fórmula general de la estadística de prueba y las fórmulas relevantes del error estándar que se proporcionan en la hoja de fórmulas.
  • VAR-6.G.4 Un valor $p$ es la probabilidad de obtener una estadística de prueba tan extrema o más extrema que la estadística de prueba observada cuando se asume que la hipótesis nula y el modelo de probabilidad son verdaderos. El nivel de significancia puede estar dado o determinado por el investigador.

Comprensión duradera (DAT-3): Las pruebas de significancia nos permiten tomar decisiones sobre hipótesis dentro de un contexto particular.

Objetivo de aprendizaje DAT-3.A: Interpretar el valor $p$ de una prueba de significancia para una proporción poblacional. [Habilidad 4.B]

  • DAT-3.A.1 El valor $p$ es la proporción de valores para la distribución nula que son tan extremos o más extremos que el valor observado de la estadística de prueba. Esto es:
    • a. La proporción igual o superior al valor observado de la estadística de prueba, si la alternativa es >.
    • b. La proporción igual o inferior al valor observado de la estadística de prueba, si la alternativa es <.
    • c. La proporción menor o igual al negativo del valor absoluto de la estadística de prueba más la proporción mayor o igual al valor absoluto de la estadística de prueba, si la alternativa es ≠.
  • DAT-3.A.2 Una interpretación del valor $p$ de una prueba de significancia para una proporción de una muestra debe reconocer que el valor $p$ se calcula asumiendo que el modelo de probabilidad y la hipótesis nula son verdaderos, es decir, asumiendo que la proporción poblacional verdadera es igual al valor particular indicado en la hipótesis nula.

Fuente: College Board AP Course and Exam Description

Qué significa un valor p

El $p$-valor P es la probabilidad de obtener un resultado muestral tan extremo o más extremo que el observado, asumiendo que $H_0$ es verdadera. Un valor $p$ pequeño indica que los datos serían sorprendentes si $H_0$ se mantuviera – evidencia en contra de $H_0$. No es la probabilidad de que $H_0$ sea verdadera.

Explorar

Un valor p como área de cola

Un valor p es la probabilidad, si la hipótesis nula fuera verdadera, de obtener un resultado al menos tan extremo: el área sombreada de la cola. Los valores p pequeños cuestionan la hipótesis nula.

Vocabulario Entrenar
Inglés Chino Pinyin
p-value/piː ˈvæljuː/ P值 P zhí
6.6

Concluir una Prueba

Syllabus

Comprensión perdurable (DAT-3): Las pruebas de significancia nos permiten tomar decisiones sobre hipótesis dentro de un contexto particular.

Objetivo de aprendizaje DAT-3.B: Justificar una afirmación sobre la población basada en los resultados de una prueba de significancia para la proporción de una población. [Habilidad 4.E]

  • DAT-3.B.1 El nivel de significancia, $\alpha$, es la probabilidad predeterminada de rechazar la hipótesis nula dado que esta es verdadera.
  • DAT-3.B.2 Una decisión formal compara explícitamente el valor $p$ con el nivel de significancia, $\alpha$. Si el valor $p$ $\leq \alpha$, rechazar la hipótesis nula. Si el valor $p$ $> \alpha$, no rechazar la hipótesis nula.
  • DAT-3.B.3 Rechazar la hipótesis nula significa que existe suficiente evidencia estadística para apoyar la hipótesis alternativa. No rechazar la hipótesis nula significa que hay insuficiente evidencia estadística para apoyar la hipótesis alternativa.
  • DAT-3.B.4 La conclusión sobre la hipótesis alternativa debe expresarse en el contexto del problema.
  • DAT-3.B.5 Una prueba de significancia puede llevar a rechazar o no rechazar la hipótesis nula, pero nunca puede llevar a concluir o probar que la hipótesis nula es verdadera. La falta de evidencia estadística para la hipótesis alternativa no es lo mismo que evidencia a favor de la hipótesis nula.
  • DAT-3.B.6 Los valores $p$ pequeños indican que el valor observado del estadístico de prueba sería inusual si la hipótesis nula y el modelo de probabilidad fueran verdaderos, por lo que proporcionan evidencia a favor de la hipótesis alternativa. Cuanto menor sea el valor $p$, más convincente será la evidencia estadística para la hipótesis alternativa.
  • DAT-3.B.7 Los valores $p$ que no son pequeños indican que el valor observado del estadístico de prueba no sería inusual si la hipótesis nula y el modelo de probabilidad fueran verdaderos; por lo tanto, no proporcionan evidencia estadística convincente para la hipótesis alternativa ni tampoco ofrecen evidencia de que la hipótesis nula sea verdadera.
  • DAT-3.B.8 Una decisión formal compara explícitamente el valor $p$ con la significancia $\alpha$. Si el valor $p$ $\leq \alpha$, entonces rechazar la hipótesis nula, $H_0 : p = p_0$. Si el valor $p$ $> \alpha$, entonces no rechazar la hipótesis nula.
  • DAT-3.B.9 Los resultados de una prueba de significancia para la proporción de una población pueden servir como razonamiento estadístico para respaldar la respuesta a una pregunta de investigación sobre la población que fue muestreada.

Fuente: College Board AP Course and Exam Description

Compare el valor $p$ con el nivel de significancia 显著性水平 $\alpha$ (a menudo $0.05$):

  • $p\le\alpha$: rechazar $H_0$ – hay evidencia convincente a favor de $H_a$.
  • $p>\alpha$: no rechazar $H_0$ – no hay suficiente evidencia para $H_a$ (nunca "aceptar $H_0$").

Siempre escribe la conclusión en contexto, vinculándola de nuevo a la afirmación.

6.7

Errores Tipo I y Tipo II

Syllabus

Comprensión Duradera (UNC-5): Las probabilidades de los errores de Tipo I y Tipo II influyen en la inferencia.

Objetivo de Aprendizaje UNC-5.A: Identificar errores de Tipo I y Tipo II. [Habilidad 1.B]

  • UNC-5.A.1 Un error de Tipo I ocurre cuando la hipótesis nula es verdadera y se rechaza (falso positivo).
  • UNC-5.A.2 Un error de Tipo II ocurre cuando la hipótesis nula es falsa y no se rechaza (falso negativo).
    • Tabla de Errores: Con el Valor Verdadero de la Población en la parte superior ($H_0$ verdadera; $H_a$ verdadera) y la Decisión a lo largo del lado (Rechazar $H_0$; No Rechazar $H_0$): Rechazar $H_0$ cuando $H_0$ verdadera = Error de Tipo I; Rechazar $H_0$ cuando $H_a$ verdadera = Decisión Correcta; No Rechazar $H_0$ cuando $H_0$ verdadera = Decisión Correcta; No Rechazar $H_0$ cuando $H_a$ verdadera = Error de Tipo II.

Objetivo de Aprendizaje UNC-5.B: Calcular la probabilidad de errores de Tipo I y Tipo II. [Habilidad 3.A]

  • UNC-5.B.1 El nivel de significancia, $\alpha$, es la probabilidad de cometer un error de Tipo I, si la hipótesis nula es verdadera.
  • UNC-5.B.2 La potencia de una prueba es la probabilidad de que una prueba rechace correctamente una hipótesis nula falsa.
  • UNC-5.B.3 La probabilidad de cometer un error de Tipo II es $= 1 - power$.

Objetivo de Aprendizaje UNC-5.C: Identificar factores que afectan la probabilidad de errores en las pruebas de significancia. [Habilidad 4.A]

  • UNC-5.C.1 La probabilidad de un error de Tipo II disminuye cuando ocurre cualquiera de lo siguiente, siempre que los demás no cambien:
    • i. Aumenta el tamaño de la muestra(s).
    • ii. Aumenta el nivel de significancia ($\alpha$) de una prueba.
    • iii. Disminuye el error estándar.
    • iv. El valor verdadero del parámetro está más lejos de la hipótesis nula.

Objetivo de Aprendizaje UNC-5.D: Interpretar errores de Tipo I y Tipo II. [Habilidad 4.B]

  • UNC-5.D.1 Si un error de Tipo I o uno de Tipo II es más trascendental depende de la situación.
  • UNC-5.D.2 Dado que el nivel de significancia, $\alpha$, es la probabilidad de un error de Tipo I, las consecuencias de un error de Tipo I influyen en las decisiones sobre un nivel de significancia.

Fuente: College Board AP Course and Exam Description

Errores Tipo I y Tipo II
  • Un error Tipo I 第一类错误: rechazar un $H_0$ verdadero (una falsa alarma). Su probabilidad es $\alpha$.
  • Un error de Tipo II 第二类错误: no rechazar una hipótesis nula $H_0$ falsa (una detección fallida). Su probabilidad es $\beta$.
  • La potencia 检验效能 $=1-\beta$ es la probabilidad de detectar correctamente un efecto real. La potencia aumenta con una muestra más grande, un efecto más grande o un $\alpha$ más grande.

Describa cada error y su consecuencia en el contexto del problema.

Explorar

Dos formas en que una prueba puede ser incorrecta

Un error Tipo I rechaza una hipótesis nula verdadera (falsa alarma); un error Tipo II mantiene una hipótesis nula falsa (una omisión). Reducir uno generalmente aumenta el otro.

Vocabulario Entrenar
Inglés Chino Pinyin
Type II error/taɪp ˈtuː ˈerə/ 第二类错误 dì èr lèi cuò wù
power/ˈpaʊə/ 检验效能 jiǎn yàn xiào néng
combined (pooled)/kəmˈbaɪnd/ 合并 hé bìng
6.8

Intervalo de confianza para la diferencia de proporciones

Syllabus

Comprensión perdurable (UNC-4): Se debe utilizar un intervalo de valores para estimar parámetros, con el fin de tener en cuenta la incertidumbre.

Objetivo de aprendizaje UNC-4.I: Identificar un procedimiento de intervalo de confianza apropiado para una comparación de proporciones poblacionales. [Habilidad 1.D]

  • UNC-4.I.1 El procedimiento de intervalo de confianza apropiado para una comparación de dos muestras de proporciones de una variable categórica es un intervalo $z$ de dos muestras para una diferencia entre proporciones poblacionales.

Objetivo de aprendizaje UNC-4.J: Verificar las condiciones para calcular intervalos de confianza para una diferencia entre proporciones poblacionales. [Habilidad 4.C]

  • UNC-4.J.1 Para calcular intervalos de confianza que estimen una diferencia entre proporciones, debemos verificar la independencia y que la distribución muestral sea aproximadamente normal:
    • a. Para verificar la independencia:
      • i. Los datos deben recolectarse utilizando dos muestras aleatorias independientes o un experimento aleatorizado.
      • ii. Cuando se muestree sin reemplazo, verifique que $n_1 \leq 10\%N_1$ y $n_2 \leq 10\%N_2$.
    • b. Para verificar que la distribución muestral de $\hat{p}_1 - \hat{p}_2$ sea aproximadamente normal (forma).
      • i. Para variables categóricas, verifique que $n_1\hat{p}_1$, $n_1(1-\hat{p}_1)$, $n_2\hat{p}_2$ y $n_2\left(1-\hat{p}_2\right)$ sean todos mayores o iguales a algún valor predeterminado, típicamente 5 o 10.

Objetivo de aprendizaje UNC-4.K: Calcular un intervalo de confianza apropiado para una comparación de proporciones poblacionales. [Habilidad 3.D]

  • UNC-4.K.1 Para una comparación de proporciones, la estimación del intervalo es $(\hat{p}_1 - \hat{p}_2) \pm z^* \sqrt{\dfrac{\hat{p}_1(1-\hat{p}_1)}{n_1} + \dfrac{\hat{p}_2(1-\hat{p}_2)}{n_2}}$.
    • Aclaración: Las fórmulas para las estimaciones del intervalo no aparecen explícitamente en la Hoja de fórmulas de Estadística AP proporcionada con el Examen de Estadística AP. Sin embargo, estas fórmulas no necesitan memorizarse, ya que pueden construirse basándose en la fórmula general del estadístico de prueba y las fórmulas de error estándar relevantes que se proporcionan en la hoja de fórmulas.

Objetivo de aprendizaje UNC-4.L: Calcular una estimación de intervalo basada en un intervalo de confianza para una diferencia de proporciones. [Habilidad 3.D]

  • UNC-4.L.1 Los intervalos de confianza para una diferencia en proporciones pueden utilizarse para calcular estimaciones de intervalo con unidades especificadas.

Fuente: College Board AP Course and Exam Description

Para comparar dos proporciones, estimar $p_1-p_2$:

$$(\hat p_1-\hat p_2)\pm z^{*}\sqrt{\frac{\hat p_1(1-\hat p_1)}{n_1}+\frac{\hat p_2(1-\hat p_2)}{n_2}}.$$
Las condiciones deben cumplirse en ambas muestras, y las muestras deben ser independientes.

6.9

Justificar una afirmación sobre dos proporciones

Syllabus

Comprensión duradera (UNC-4): Se debe utilizar un intervalo de valores para estimar parámetros, con el fin de tener en cuenta la incertidumbre.

Objetivo de aprendizaje UNC-4.M: Interpretar un intervalo de confianza para la diferencia de proporciones. [Habilidad 4.B]

  • UNC-4.M.1 En muestreo aleatorio repetido con el mismo tamaño muestral, aproximadamente C% de los intervalos de confianza creados capturarán la diferencia en las proporciones poblacionales.
  • UNC-4.M.2 La interpretación de un intervalo de confianza para la diferencia entre proporciones poblacionales debe incluir una referencia a la muestra tomada y detalles sobre la población que representa.

Objetivo de aprendizaje UNC-4.N: Justificar una afirmación basada en un intervalo de confianza para la diferencia de proporciones. [Habilidad 4.D]

  • UNC-4.N.1 Un intervalo de confianza para la diferencia en proporciones poblacionales proporciona un intervalo de valores que puede ofrecer evidencia suficiente para respaldar una afirmación particular en su contexto.

Fuente: College Board AP Course and Exam Description

Si el intervalo para $p_1-p_2$ contiene $0$, los datos son consistentes con no haber diferencia; si está completamente por encima o por debajo de $0$, hay evidencia de una diferencia (en esa dirección). Indicar la dirección y el contexto.

6.10

Preparar una prueba para una diferencia

Syllabus

Comprensión duradera (VAR-6): La distribución normal puede utilizarse para modelar la variación.

Objetivo de aprendizaje VAR-6.H: Identificar las hipótesis nula y alternativa para una diferencia de dos proporciones poblacionales. [Habilidad 1.F]

  • VAR-6.H.1 Para una prueba de dos muestras para una diferencia de dos proporciones, la hipótesis nula especifica un valor de $0$ para la diferencia en las proporciones poblacionales, lo que indica que no hay diferencia ni efecto.
  • VAR-6.H.2 La hipótesis nula para una diferencia en las proporciones es: $H_0 : p_1 = p_2$, o $H_0 : p_1 - p_2 = 0$.
  • VAR-6.H.3 Una hipótesis alternativa unilateral para una diferencia en las proporciones es $H_a : p_1 < p_2$, o, $H_a : p_1 > p_2$. Una hipótesis alternativa bilateral para una diferencia de proporciones es $H_a : p_1 \neq p_2$.

Objetivo de aprendizaje VAR-6.I: Identificar un método de prueba adecuado para la diferencia de dos proporciones poblacionales. [Habilidad 1.E]

  • VAR-6.I.1 Para una única variable categórica, el método de prueba adecuado para la diferencia de dos proporciones poblacionales es una prueba de chi-cuadrado de dos muestras $z$ para una diferencia entre dos proporciones poblacionales.

Objetivo de aprendizaje VAR-6.J: Verificar las condiciones para realizar inferencias estadísticas al probar una diferencia de dos proporciones poblacionales. [Habilidad 4.C]

  • VAR-6.J.1 Con el fin de realizar inferencias estadísticas al probar una diferencia entre proporciones poblacionales, debemos verificar la independencia y que la distribución muestral sea aproximadamente normal:
    • a. Para verificar la independencia:
      • i. Los datos deben recopilarse utilizando dos muestras aleatorias independientes o un experimento aleatorizado.
      • ii. Al muestrear sin reemplazo, verifique que $n_1 \leq 10\%N_1$ y $n_2 \leq 10\%N_2$.
    • b. Para verificar que la distribución muestral de $\hat{p}_1 - \hat{p}_2$ sea aproximadamente normal (forma):
      • i. Para la muestra combinada, defina la proporción combinada (o agrupada), $\hat{p}_c = \dfrac{n_1\hat{p}_1 + n_2\hat{p}_2}{n_1 + n_2}$. Asumiendo que $H_0$ es verdadera $(p_1 - p_2 = 0$ o $p_1 = p_2)$, verifique que $n_1\hat{p}_c$, $n_1\left(1-\hat{p}_c\right)$, $n_2\hat{p}_c$ y $n_2\left(1-\hat{p}_c\right)$ sean todos mayores o iguales a algún valor predeterminado, típicamente 5 o 10.

Fuente: College Board AP Course and Exam Description

Las hipótesis comparan las dos proporciones: $H_0: p_1=p_2$ frente a $H_a: p_1\neq p_2$ (o $<,>$). Dado que $H_0$ establece que las proporciones son iguales, se utiliza una proporción muestral combinada (agrupada) $\hat p_c=\dfrac{\text{total successes}}{\text{total sample size}}$ para estimar la proporción común $p$.

6.11

Realización de una prueba para una diferencia

Syllabus

Comprensión duradera (VAR-6): La distribución normal puede utilizarse para modelar la variación.

Objetivo de aprendizaje VAR-6.K: Calcular una estadística de prueba adecuada para la diferencia de dos proporciones poblacionales. [Habilidad 3.E]

  • VAR-6.K.1 La estadística de prueba para una diferencia en las proporciones es: $z = \dfrac{(\hat{p}_1 - \hat{p}_2) - 0}{\sqrt{\hat{p}_c(1-\hat{p}_c)}\sqrt{\dfrac{1}{n_1} + \dfrac{1}{n_2}}}$, donde $\hat{p}_c = \dfrac{n_1\hat{p}_1 + n_2\hat{p}_2}{n_1 + n_2}$.
    • Declaración aclaratoria: Las fórmulas para las estadísticas de prueba no aparecen explícitamente en la Hoja de Fórmulas de Estadística AP proporcionada con el Examen de Estadística AP. Sin embargo, estas fórmulas no necesitan memorizarse, ya que pueden construirse basándose en la fórmula general de la estadística de prueba y las fórmulas del error estándar para cada una de las estadísticas de prueba relevantes que se proporcionan en la hoja de fórmulas.

Comprensión duradera (DAT-3): El análisis de significancia nos permite tomar decisiones sobre hipótesis dentro de un contexto particular.

Objetivo de aprendizaje DAT-3.C: Interpretar el valor $p$ de una prueba de significancia para una diferencia de proporciones poblacionales. [Habilidad 4.B]

  • DAT-3.C.1 Una interpretación del valor $p$ de una prueba de significancia para una diferencia de dos proporciones poblacionales debe reconocer que el valor $p$ se calcula asumiendo que la hipótesis nula es verdadera, es decir, asumiendo que las verdaderas proporciones poblacionales son iguales entre sí.

Objetivo de aprendizaje DAT-3.D: Justificar una afirmación sobre la población basada en los resultados de una prueba de significancia para una diferencia de proporciones poblacionales. [Habilidad 4.E]

  • DAT-3.D.1 Una decisión formal compara explícitamente el valor $p$ con la significancia $\alpha$. Si el $p\text{-value} \leq \alpha$, entonces rechazar la hipótesis nula, $H_0 : p_1 = p_2$, o $H_0 : p_1 - p_2 = 0$. Si el valor $p$ $> \alpha$, entonces no rechazar la hipótesis nula.
  • DAT-3.D.2 Los resultados de una prueba de significancia para una diferencia de dos proporciones poblacionales pueden servir como razonamiento estadístico para respaldar la respuesta a una pregunta de investigación sobre las dos poblaciones que fueron muestreadas.

Fuente: College Board AP Course and Exam Description

La estadística de dos proporciones agrupadas $z$:

$$z=\frac{\hat p_1-\hat p_2}{\sqrt{\hat p_c(1-\hat p_c)\left(\frac{1}{n_1}+\frac{1}{n_2}\right)}}.$$
Encuentre el valor $p$ del modelo normal, compárelo con $\alpha$ y concluya en contexto: la misma lógica de cuatro pasos que la de la prueba de una proporción.

6.11

Consejos para el examen

  • Enuncie las condiciones (aleatoriedad, 10 %, conteos grandes $np,\,nq\ge10$) antes de cualquier inferencia sobre proporciones.
  • Un intervalo de confianza = estimación $\pm$ margen de error; "95 % de confianza" se refiere a la tasa de captura a largo plazo del método.
  • Para una prueba, escribe $H_0$ y $H_a$, calcula la estadística de prueba, encuentra el valor p y compáralo con $\alpha$.
  • Un valor p pequeño es evidencia en contra de $H_0$; no rechazar no prueba $H_0$.
  • Muestras más grandes reducen el margen de error; un nivel de confianza más alto lo amplía.

Lecciones interactivas sobre este tema

Trátalo paso a paso, con ejercicios de verificación instantánea.

Exámenes Anteriores

Más temas en AP Estadística

Iniciar sesión o crear cuenta

IGCSE, A-Level & AP