Saltar al contenido

Recopilación de datos

AP Estadística · Tema 3

Entrenar
Lección de video para este tema Abrir la página de video
7:31

Recopilación de Datos

Una encuesta en línea recoge treinta mil respuestas. Una encuesta cuidadosa pregunta solo a mil personas. ¿Cuál está más cerca de la verdad? La pequeña, casi cada…

Narración en inglés · Subtítulos en inglés + 中文 quemados en pantalla

3.1

¿Podemos Confiar en los Datos que Recopilamos?

Syllabus

Comprensión duradera (VAR-1): Dado que la variación puede ser aleatoria o no, las conclusiones son inciertas.

Objetivo de aprendizaje VAR-1.E: Identificar preguntas sobre los métodos de recolección de datos. [Habilidad 1.A]

  • VAR-1.E.1: Los métodos de recolección de datos que no se basan en el azar dan lugar a conclusiones poco fiables.

Fuente: College Board AP Course and Exam Description

Una conclusión es tan buena como los datos que la respaldan. Cómo se recopilan los datos determina lo que puedes concluir: si puedes generalizar a una población, y si puedes afirmar causa y efecto. Los datos mal recopilados pueden ser peores que no tener datos.

3.2

Estudios Observacionales y Experimentos

Syllabus

Comprensión perdurable (DAT-2): La forma en que se recopila la datos influye en lo que podemos y no podemos afirmar sobre una población.

Objetivo de aprendizaje DAT-2.A: Identificar el tipo de un estudio. [Habilidad 1.C]

  • DAT-2.A.1 Una población consiste en todos los elementos o sujetos de interés.
  • DAT-2.A.2 Una muestra seleccionada para un estudio es un subconjunto de la población.
  • DAT-2.A.3 En un estudio observacional, no se imponen tratamientos. Los investigadores examinan datos de una muestra de individuos (retrospectivo) o siguen a una muestra de individuos hacia el futuro recolectando datos (prospectivo) con el fin de investigar un tema de interés sobre la población. Una encuesta muestral es un tipo de estudio observacional que recolecta datos de una muestra con el propósito de aprender sobre la población de la cual se tomó la muestra.
  • DAT-2.A.4 En un experimento, diferentes condiciones (tratamientos) se asignan a unidades experimentales (participantes o sujetos).

Objetivo de aprendizaje DAT-2.B: Identificar generalizaciones y conclusiones apropiadas basadas en estudios observacionales. [Habilidad 4.A]

  • DAT-2.B.1 Solo es apropiado hacer generalizaciones sobre una población basándose en muestras que han sido seleccionadas al azar o que de otra manera sean representativas de dicha población.
  • DAT-2.B.2 Una muestra solo es extrapolable a la población de la cual fue seleccionada.
  • DAT-2.B.3 No es posible determinar relaciones causales entre variables utilizando datos recopilados en un estudio observacional.

Fuente: College Board AP Course and Exam Description

  • En un estudio observacional, mides individuos sin intentar influir en ellos. Puede mostrar una asociación, pero no causalidad, porque variables latentes podrían explicar el vínculo.
  • En un experimento, impones deliberadamente un tratamiento y comparas las respuestas. Un experimento bien diseñado puede establecer causa y efecto.
Explorar

¿Estudio observacional o experimento?

En un experimento el investigador impone un tratamiento (y puede mostrar causalidad); un estudio observacional solo registra lo que ya sucede (y puede mostrar asociación, no causalidad).

Vocabulario Entrenar
Inglés Chino Pinyin
population/ˌpɒpjʊˈleɪʃn/ 总体 zǒng tǐ
observational study/ɒbzəˈveɪʃənl ˈstʌdi/ 观察性研究 guān chá xìng yán jiū
experiment/ekˈsperɪmənt/ 实验 shí yàn
treatment/ˈtriːtmənt/ 处理 chǔ lǐ
sample/ˈsæmpl/ 样本 yàng běn
Random sampling/ˈrændəm ˈsæmplɪŋ/ 随机抽样 suí jī chōu yàng
3.3

Muestreo Aleatorio

Syllabus

Comprensión Duradera (DAT-2): La forma en que se recopilan los datos influye en lo que podemos y no podemos afirmar sobre una población.

Objetivo de Aprendizaje DAT-2.C: Identificar un método de muestreo, dada la descripción de un estudio. [Habilidad 1.C]

  • DAT-2.C.1 Cuando un elemento de una población puede ser seleccionado solo una vez, esto se denomina muestreo sin reemplazo. Cuando un elemento de la población puede ser seleccionado más de una vez, esto se denomina muestreo con reemplazo.
  • DAT-2.C.2 Una muestra aleatoria simple (MAS) es una muestra en la que cada grupo de un tamaño dado tiene la misma probabilidad de ser elegido. Este método es la base para muchos tipos de mecanismos de muestreo. Algunos ejemplos de mecanismos utilizados para obtener MAS incluyen numerar a los individuos y usar un generador de números aleatorios para seleccionar cuáles incluir en la muestra, ignorando repeticiones; usar una tabla de números aleatorios; o extraer una carta de una baraja sin reemplazo.
  • DAT-2.C.3 Un muestreo aleatorio estratificado implica la división de una población en grupos separados, llamados estratos, basándose en atributos o características compartidas (agrupación homogénea). Dentro de cada estrato se selecciona una muestra aleatoria simple, y las unidades seleccionadas se combinan para formar la muestra.
  • DAT-2.C.4 Un muestreo por conglomerados implica la división de una población en grupos más pequeños, llamados conglomerados. Idealmente, debe haber heterogeneidad dentro de cada conglomerado, y los conglomerados deben ser similares entre sí en su composición. Se selecciona una muestra aleatoria simple de conglomerados de la población para formar la muestra de conglomerados. Los datos se recopilan de todas las observaciones en los conglomerados seleccionados.
  • DAT-2.C.5 Un muestreo aleatorio sistemático es un método mediante el cual los miembros de la muestra de una población se seleccionan según un punto de inicio aleatorio y un intervalo fijo y periódico.
  • DAT-2.C.6 Un censo selecciona todos los elementos/sujetos de una población.

Objetivo de Aprendizaje DAT-2.D: Explicar por qué un método de muestreo en particular es o no es apropiado para una situación dada. [Habilidad 1.C]

  • DAT-2.D.1 Cada método de muestreo tiene ventajas y desventajas dependiendo de la pregunta que se deba responder y de la población de la cual se extraerá la muestra.

Fuente: College Board AP Course and Exam Description

Para aprender sobre una población, tomas una muestra. El muestreo aleatorio protege contra el sesgo de selección y permite generalizar (no puede corregir la cobertura insuficiente, la falta de respuesta o el sesgo de respuesta; vea abajo). Diseños comunes:

  • Muestra aleatoria simple (MAS): cada grupo del tamaño seleccionado tiene igual probabilidad de ser elegido.
  • Estratificado: divide la población en estratos similares y luego muestra dentro de cada uno.
  • Por conglomerados: divide en conglomerados y selecciona aleatoriamente conglomerados completos.
  • Sistemático: selecciona cada $k$-ésimo individuo a partir de un inicio aleatorio.
Cuatro diseños de muestreo aleatorio: quién es seleccionado y cómo
Cuatro diseños de muestreo aleatorio: quién es seleccionado y cómo

Una muestra por conveniencia o de respuesta voluntaria no es aleatoria y está sesgada.

Ejemplo resuelto. Para encuestar a una escuela, un administrador lista a todos los estudiantes por grado y selecciona aleatoriamente $20$ de cada grado. Esta es una muestra estratificada —los grados son los estratos—, lo que garantiza que todos los grados estén representados, a diferencia de una MAS que podría tener por azar fewer estudiantes de un grado.

Resultados aleatorios: los dados hacen que cada cara sea equally probable bajo condiciones justas
Resultados aleatorios: los dados hacen que cada cara sea equally probable bajo condiciones justas
3.4

Cuando el Muestreo Sale Mal

Syllabus

Comprensión duradera (DAT-2): La forma en que se recopila la datos influye en lo que podemos y no podemos afirmar sobre una población.

Objetivo de aprendizaje DAT-2.E: Identificar posibles fuentes de sesgo en los métodos de muestreo. [Habilidad 1.C]

  • DAT-2.E.1 El sesgo ocurre cuando ciertas respuestas son sistemáticamente favorecidas sobre otras.
  • DAT-2.E.2 Cuando una muestra está compuesta exclusivamente por voluntarios o personas que optan por participar, la muestra típicamente no será representativa de la población (sesgo de respuesta voluntaria).
  • DAT-2.E.3 Cuando una parte de la población tiene una probabilidad reducida de ser incluida en la muestra, la muestra típicamente no será representativa de la población (sesgo de cobertura insuficiente).
  • DAT-2.E.4 Los individuos seleccionados para la muestra para quienes no se puede obtener datos (o que se niegan a responder) pueden diferir de aquellos para quienes sí se pueden obtener datos (sesgo de no respuesta).
  • DAT-2.E.5 Problemas en el instrumento o proceso de recolección de datos dan lugar a un sesgo de respuesta. Ejemplos incluyen preguntas confusas o sugerentes (sesgo en la redacción de las preguntas) y respuestas autoinformadas.
  • DAT-2.E.6 Los métodos de muestreo no aleatorios (por ejemplo, muestras elegidas por conveniencia o respuesta voluntaria) introducen potencial de sesgo porque no utilizan el azar para seleccionar a los individuos.

Fuente: College Board AP Course and Exam Description

El sesgo hace que las estimaciones fallen sistemáticamente respecto a la verdad:

  • Cobertura insuficiente: algunos grupos quedan excluidos del marco muestral.
  • Falta de respuesta: las personas seleccionadas no contestan.
  • Sesgo de respuesta: las personas responden inexactamente (mala redacción, temas sensibles).

El sesgo se refiere a un error constante en una dirección; aumentar el tamaño de la muestra no lo corrige.

Las muestras por conveniencia no representan a la población: el sesgo se filtra cuando la selección no es aleatoria
Muestras por conveniencia no representan a la población: el sesgo se filtra cuando la selección no es aleatoria
Vocabulario Entrenar
Inglés Chino Pinyin
bias/ˈbaɪəs/ 偏差 piān chā
Simple random sample (SRS)/ˈsɪmpl ˈrændəm ˈsæmpl/ 简单随机样本 jiǎn dān suí jī yàng běn
Stratified/ˈstrætɪfaɪd/ 分层 fēn céng
Cluster/ˈklʌstə/ 整群 zhěng qún
Systematic/ˌsɪstəˈmætɪk/ 系统 xì tǒng
convenience sample/kənˈviːnɪəns ˈsæmpl/ 方便样本 fāng biàn yàng běn
Undercoverage/ˌʌndəˈkʌvərɪdʒ/ 覆盖不足 fù gài bù zú
Nonresponse/ˌnɒnrɪˈspɒns/ 无回应 wú huí yìng
Response bias/rɪˈspɒns ˈbaɪəs/ 回应偏差 huí yìng piān chā
control group/kənˈtrəʊl ɡruːp/ 对照组 duì zhào zǔ
3.5

Diseño de un Experimento

Syllabus

Comprensión duradera (VAR-3): Los experimentos bien diseñados pueden establecer evidencia de relaciones causales.

Objetivo de aprendizaje VAR-3.A: Identificar los componentes de un experimento. [Habilidad 1.C]

  • VAR-3.A.1 Las unidades experimentales son las unidades individuales (que pueden ser personas u otros objetos de estudio) a las que se les asignan tratamientos. Cuando las unidades experimentales consisten en personas, a veces se les denomina participantes o sujetos.
  • VAR-3.A.2 Una variable explicativa (o factor) en un experimento es una variable cuyos niveles se manipulan intencionalmente. Los niveles o la combinación de niveles de la(s) variable(s) explicativa(s) se denominan tratamientos.
  • VAR-3.A.3 Una variable de respuesta en un experimento es un resultado de las unidades experimentales que se mide después de haber administrado los tratamientos.
  • VAR-3.A.4 Una variable de confusión en un experimento es una variable que está relacionada con la variable explicativa e influye en la variable de respuesta y puede crear una falsa percepción de asociación entre las dos.

Objetivo de aprendizaje VAR-3.B: Describir elementos de un experimento bien diseñado. [Habilidad 1.B]

  • VAR-3.B.1 Un experimento bien diseñado debe incluir lo siguiente:
    • a. Comparaciones de al menos dos grupos de tratamiento, uno de los cuales podría ser un grupo control.
    • b. Asignación/alocación aleatoria de tratamientos a las unidades experimentales.
    • c. Replicación (más de una unidad experimental en cada grupo de tratamiento).
    • d. Control de variables de confusión potenciales donde sea apropiado.

Objetivo de aprendizaje VAR-3.C: Comparar diseños y métodos experimentales. [Habilidad 1.C]

  • VAR-3.C.1 En un diseño completamente aleatorizado, los tratamientos se asignan a las unidades experimentales completamente al azar. La asignación aleatoria tiende a equilibrar los efectos de las variables no controladas (de confusión) para que las diferencias en las respuestas puedan atribuirse a los tratamientos.
  • VAR-3.C.2 Los métodos para asignar treatments aleatoriamente a las unidades experimentales en un diseño completamente aleatorizado incluyen el uso de un generador de números aleatorios, una tabla de valores aleatorios, extraer fichas sin reemplazo, etc.
  • VAR-3.C.3 En un experimento de doble ciego, los sujetos no saben qué tratamiento están recibiendo, pero los miembros del equipo de investigación sí, o viceversa.
  • VAR-3.C.4 En un experimento doble ciego ni los sujetos ni los miembros del equipo de investigación que interactúan con ellos saben qué tratamiento está recibiendo un sujeto.
  • VAR-3.C.5 Un grupo control es un conjunto de unidades experimentales que no reciben un tratamiento de interés o que reciben un tratamiento con una sustancia inactiva (placebo) con el fin de determinar si el tratamiento de interés tiene algún efecto.
  • VAR-3.C.6 El efecto placebo ocurre cuando las unidades experimentales tienen una respuesta a un placebo.
  • VAR-3.C.7 Para los diseños de bloques completos aleatorizados, los tratamientos se asignan completamente al azar dentro de cada bloque.
  • VAR-3.C.8 El bloqueo asegura que al inicio del experimento las unidades dentro de cada bloque sean similares entre sí respecto a al menos una variable de bloqueo. Un diseño de bloques aleatorizados ayuda a separar la variabilidad natural de las diferencias debidas a la variable de bloqueo.
  • VAR-3.C.9 Un diseño de pares emparejados es un caso especial de un diseño de bloques aleatorizados. Utilizando una variable de bloqueo, los sujetos (ya sean personas o no) se organizan en parejas coincidentes en factores relevantes. Los pares emparejados pueden formarse de manera natural o por parte del experimentador. Cada par recibe ambos tratamientos asignando aleatoriamente un tratamiento a un miembro del par y posteriormente asignando el tratamiento restante al segundo miembro del par. Alternativamente, cada sujeto puede recibir ambos tratamientos.

Fuente: College Board AP Course and Exam Description

Los buenos experimentos siguen tres principios:

  • Comparación con un grupo control (a menudo un placebo).
  • Asignación aleatoria de sujetos a tratamientos, para equilibrar otras variables.
  • Replicación: suficientes sujetos por tratamiento para observar un efecto real.
Un experimento completamente aleatorio compara un grupo de tratamiento con un grupo control
Un experimento completamente aleatorio compara un grupo de tratamiento con un grupo control

El confundimiento ocurre cuando otra variable está ligada al tratamiento de tal manera que sus efectos no pueden separarse; la asignación aleatoria lo previene. El ceguero oculta quién recibe qué tratamiento para evitar efectos de expectativa: en un estudio simple ciego, solo una parte permanece sin saberlo (usualmente los sujetos, o solo las personas que evalúan el resultado), mientras que en un estudio doble ciego, ni los sujetos ni los investigadores que interactúan con ellos saben, bloqueando tanto el efecto placebo como la evaluación sesgada. El bloqueo agrupa sujetos similares y realiza la aleatorización dentro de cada bloque para reducir la variabilidad.

Un ensayo clínico: la asignación aleatoria separa el tratamiento del control
Un ensayo clínico: la asignación aleatoria separa el tratamiento del control
Vocabulario Entrenar
Inglés Chino Pinyin
placebo/pləˈsiːbəʊ/ 安慰剂 ān wèi jì
Random assignment/ˈrændəm əˈsaɪnmənt/ 随机分配 suí jī fēn pèi
Replication/ˌreplɪˈkeɪʃn/ 重复 chóng fù
Confounding/kənˈfaʊndɪŋ/ 混杂 hùn zá
Blinding/ˈblaɪndɪŋ/ 盲法 máng fǎ
single-blind/ˈsɪŋɡl blaɪnd/ 单盲 dān máng
double-blind/ˈdʌbl blaɪnd/ 双盲 shuāng máng
Blocking/ˈblɒkɪŋ/ 区组 qū zǔ
3.6

Elegir el Diseño Adecuado

Syllabus

Comprensión duradera (VAR-3): Los experimentos bien diseñados pueden establecer evidencia de relaciones causales.

Objetivo de aprendizaje VAR-3.D: Explicar por qué un diseño experimental particular es apropiado. [Habilidad 1.C]

  • VAR-3.D.1 Cada diseño experimental tiene ventajas y desventajas que dependen de la pregunta de interés, los recursos disponibles y la naturaleza de las unidades experimentales.

Fuente: College Board AP Course and Exam Description

Ajusta el diseño al objetivo: usa un diseño completamente aleatorio para sujetos uniformes; un diseño de bloques aleatorizados cuando una variable conocida (sexo, edad) afecta la respuesta; un diseño de pares pareados cuando cada sujeto puede servir como su propio control. Establece cómo llevarías a cabo la aleatorización.

3.7

Lo Que un Experimento Te Permite Concluir

Syllabus

Comprensión duradera (VAR-3): Los experimentos bien diseñados pueden establecer evidencia de relaciones causales.

Objetivo de aprendizaje VAR-3.E: Interpretar los resultados de un experimento bien diseñado. [Habilidad 4.B]

  • VAR-3.E.1 La inferencia estadística atribuye conclusiones basadas en datos a la distribución de la cual se recopilaron los datos.
  • VAR-3.E.2 La asignación aleatoria de tratamientos a las unidades experimentales permite a los investigadores concluir que algunos cambios observados son tan grandes que es poco probable que hayan ocurrido por azar. A tales cambios se les dice que son estadísticamente significativos.
  • VAR-3.E.3 Las diferencias estadísticamente significativas entre o entre grupos de tratamiento experimental constituyen evidencia de que los tratamientos causaron el efecto.
  • VAR-3.E.4 Si las unidades experimentales utilizadas en un experimento son representativas de un grupo más grande de unidades, los resultados del experimento pueden generalizarse a dicho grupo más amplio. La selección aleatoria de unidades experimentales ofrece mayores probabilidades de que sean representativas.

Fuente: College Board AP Course and Exam Description

Dos preguntas determinan el alcance de una conclusión:

  • ¿Se usó asignación aleatoria? Entonces una diferencia significativa puede atribuirse al tratamiento (causalidad) —para estos sujetos—.
  • ¿Se hizo muestreo aleatorio de una población? Entonces los resultados se generalizan a esa población.

Solo un experimento con asignación aleatoria respalda una afirmación de causa y efecto; solo el muestreo aleatorio respalda la generalización. Di exactamente cuál tienes.

Ejemplo resuelto. Los investigadores asignan aleatoriamente a $100$ voluntarios a un nuevo medicamento o a un placebo, y el grupo del medicamento mejora significativamente más. Debido a la asignación aleatoria, la mejora puede atribuirse al medicamento (causalidad); pero como los sujetos no fueron muestreados aleatoriamente, la conclusión aplica solo a estos voluntarios y no se generaliza automáticamente a todos.

3.7

Consejos para exámenes

  • Diferencia un estudio observacional (encuentra asociación) de un experimento (puede mostrar causalidad).
  • Una buena muestra es aleatoria (MAS, estratificada, por conglomerados) —ten cuidado con el sesgo (respuesta voluntaria, cobertura insuficiente, falta de respuesta).
  • Los buenos experimentos usan control, aleatorización y replicación; el bloqueo maneja una variable molesta conocida.
  • Solo un experimento aleatorizado respalda una conclusión de causa y efecto.
  • Nombra claramente la población, la muestra y cualquier variable confundente.

Lecciones interactivas sobre este tema

Trátalo paso a paso, con ejercicios de verificación instantánea.

Exámenes Anteriores

Más temas en AP Estadística

Iniciar sesión o crear cuenta

IGCSE, A-Level & AP