Passer au contenu

Collecte de données

AP Statistiques · Sujet 3

Entrainer
Leçon vidéo pour ce sujet Ouvrir la page vidéo
7:31

Collecte de données

Un sondage en ligne recueille trente mille réponses. Un sondage méticuleux n'interroge que mille personnes. Lequel est plus proche de la vérité ? Le petit, presque chaque…

Narration en anglais · Sous-titres anglais + 中文 incrustés

3.1

Peut-on faire confiance aux données collectées ?

Programme

Compréhension durable (VAR-1) : Étant donné que la variation peut être aléatoire ou non, les conclusions sont incertaines.

Objectif d'apprentissage VAR-1.E : Identifier les questions à répondre concernant les méthodes de collecte de données. [Compétence 1.A]

  • VAR-1.E.1 Les méthodes de collecte de données qui ne reposent pas sur le hasard aboutissent à des conclusions non fiables.

Source : Description du cours et de l'examen AP College Board

Une conclusion n'est aussi bonne que les données qui la sous-tendent. Comment les données sont collectées dicte ce que vous pouvez conclure – si vous pouvez généraliser à une population 总体, et si vous pouvez affirmer une cause et effet. De mauvaises données peuvent être pires qu'aucune donnée.

Vocabulaire Entrainer
Anglais Chinois Pinyin
population/ˌpɒpjʊˈleɪʃn/ 总体 zǒng tǐ
observational study/ɒbzəˈveɪʃənl ˈstʌdi/ 观察性研究 guān chá xìng yán jiū
3.2

Études observationnelles et expériences

Programme

Compréhension essentielle (DAT-2) : La façon dont nous collectons les données influence ce que nous pouvons et ne pouvons pas dire sur une population.

Objectif d'apprentissage DAT-2.A : Identifier le type d'étude. [Compétence 1.C]

  • DAT-2.A.1 Une population consiste en tous les éléments ou sujets d'intérêt.
  • DAT-2.A.2 Un échantillon sélectionné pour l'étude est un sous-ensemble de la population.
  • DAT-2.A.3 Dans une étude observationnelle, les traitements ne sont pas imposés. Les enquêteurs examinent les données pour un échantillon d'individus (rétrospectif) ou suivent un échantillon d'individus vers l'avenir en collectant des données (prospectif) afin d'enquêter sur un sujet d'intérêt concernant la population. Un sondage est un type d'étude observationnelle qui collecte des données auprès d'un échantillon dans le but d'en apprendre davantage sur la population dont l'échantillon provient.
  • DAT-2.A.4 Dans une expérience, différentes conditions (traitements) sont assignées aux unités expérimentales (participants ou sujets).

Objectif d'apprentissage DAT-2.B : Identifier les généralisations et déterminations appropriées basées sur des études observationnelles. [Compétence 4.A]

  • DAT-2.B.1 Il n'est approprié de faire des généralisations sur une population que sur la base d'échantillons sélectionnés aléatoirement ou autrement représentatifs de cette population.
  • DAT-2.B.2 Un échantillon n'est généralisable que vers la population à partir de laquelle il a été sélectionné.
  • DAT-2.B.3 Il n'est pas possible de déterminer des relations causales entre les variables en utilisant des données collectées dans une étude observationnelle.

Source : Description du cours et de l'examen AP College Board

  • Dans une étude observationnelle 观察性研究, vous mesurez des individus sans essayer de les influencer. Elle peut montrer une association, mais pas la causalité, car des variables cachées peuvent expliquer le lien.
  • Dans une expérience 实验, vous imposez délibérément un traitement 处理 et comparez les réponses. Une expérience bien conçue peut établir la cause et l'effet.
Explorer

Étude observationnelle ou expérience ?

Dans une expérience, le chercheur impose un traitement (et peut montrer la causalité) ; une étude observationnelle enregistre seulement ce qui arrive déjà (et peut montrer une association, pas la causalité).

3.3

Échantillonnage aléatoire

Programme

Compréhension essentielle (DAT-2) : La façon dont nous collectons les données influence ce que nous pouvons et ne pouvons pas dire sur une population.

Objectif d'apprentissage DAT-2.C : Identifier une méthode d'échantillonnage, étant donné une description d'une étude. [Compétence 1.C]

  • DAT-2.C.1 Lorsqu'un élément d'une population ne peut être sélectionné qu'une seule fois, on parle d'échantillonnage sans remise. Lorsqu'un élément de la population peut être sélectionné plus d'une fois, on parle d'échantillonnage avec remise.
  • DAT-2.C.2 Un échantillon aléatoire simple (EAS) est un échantillon dans lequel chaque groupe de taille donnée a une chance égale d'être choisi. Cette méthode est la base de nombreux types de mécanismes d'échantillonnage. Quelques exemples de mécanismes utilisés pour obtenir des EAS incluent la numérotation des individus et l'utilisation d'un générateur de nombres aléatoires pour sélectionner lesquels inclure dans l'échantillon, en ignorant les répétitions, l'utilisation d'une table de nombres aléatoires, ou le tirage d'une carte d'un jeu de cartes sans remise.
  • DAT-2.C.3 Un échantillon aléatoire stratifié implique la division d'une population en groupes séparés, appelés strates, basés sur des attributs ou caractéristiques partagées (groupement homogène). À l'intérieur de chaque strate, un échantillon aléatoire simple est sélectionné, et les unités sélectionnées sont combinées pour former l'échantillon.
  • DAT-2.C.4 Un échantillon par grappes implique la division d'une population en petits groupes, appelés grappes. Idéalement, il y a de l'hétérogénéité au sein de chaque grappe, et les grappes sont similaires les unes aux autres dans leur composition. Un échantillon aléatoire simple de grappes est sélectionné à partir de la population pour former l'échantillon de grappes. Les données sont collectées auprès de toutes les observations dans les grappes sélectionnées.
  • DAT-2.C.5 Un échantillon aléatoire systématique est une méthode selon laquelle les membres de l'échantillon d'une population sont sélectionnés selon un point de départ aléatoire et un intervalle fixe et périodique.
  • DAT-2.C.6 Un recensement sélectionne tous les éléments/sujets d'une population.

Objectif d'apprentissage DAT-2.D : Expliquer pourquoi une méthode d'échantillonnage particulière est ou n'est pas appropriée pour une situation donnée. [Compétence 1.C]

  • DAT-2.D.1 Il y a des avantages et des inconvénients pour chaque méthode d'échantillonnage dépendant de la question à répondre et de la population à partir de laquelle l'échantillon sera tiré.

Source : Description du cours et de l'examen AP College Board

Pour apprendre sur une population, vous prenez un échantillon 样本. L'échantillonnage aléatoire 随机抽样 protège contre le biais de sélection bias et permet de généraliser (il ne corrige pas la couverture insuffisante, le non-réponse ou le biais de réponse – voir ci-dessous). Conceptions courantes :

  • Échantillon aléatoire simple (EAS) 简单随机样本 : tout groupe de la taille choisie a autant de chances d'être tiré.
  • Stratifié 分层 : diviser la population en strates similaires, puis échantillonner dans chacune.
  • Par grappes 整群 : diviser en grappes, choisir aléatoirement des grappes entières.
  • Systématique 系统 : choisir tous les $k$e individus depuis un départ aléatoire.
Quatre designs d'échantillonnage aléatoire : qui est sélectionné, et comment
Quatre conceptions d'échantillonnage aléatoire : qui est sélectionné, et comment

Un échantillon de commodité 方便样本 ou un échantillon à réponse volontaire n'est pas aléatoire et est biaisé.

Exemple résolu. Pour enquêter dans un établissement scolaire, un administrateur liste tous les élèves par niveau et tire aléatoirement $20$ de chaque niveau. C'est un échantillon stratifié – les niveaux sont les strates – ce qui garantit que chaque niveau est représenté, contrairement à un EAS qui pourrait tirer par hasard peu d'élèves d'un niveau.

Issues aléatoires : les dés rendent chaque face également probable dans des conditions équitables
Résultats aléatoires : les dés rendent chaque face également probable dans des conditions justes
Vocabulaire Entrainer
Anglais Chinois Pinyin
bias/ˈbaɪəs/ 偏差 piān chā
Simple random sample (SRS)/ˈsɪmpl ˈrændəm ˈsæmpl/ 简单随机样本 jiǎn dān suí jī yàng běn
Stratified/ˈstrætɪfaɪd/ 分层 fēn céng
Cluster/ˈklʌstə/ 整群 zhěng qún
Systematic/ˌsɪstəˈmætɪk/ 系统 xì tǒng
convenience sample/kənˈviːnɪəns ˈsæmpl/ 方便样本 fāng biàn yàng běn
Undercoverage/ˌʌndəˈkʌvərɪdʒ/ 覆盖不足 fù gài bù zú
Nonresponse/ˌnɒnrɪˈspɒns/ 无回应 wú huí yìng
Response bias/rɪˈspɒns ˈbaɪəs/ 回应偏差 huí yìng piān chā
control group/kənˈtrəʊl ɡruːp/ 对照组 duì zhào zǔ
3.4

Quand l'échantillonnage échoue

Programme

Compréhension essentielle (DAT-2) : La façon dont nous collectons les données influence ce que nous pouvons et ne pouvons pas dire sur une population.

Objectif d'apprentissage DAT-2.E : Identifier les sources potentielles de biais dans les méthodes d'échantillonnage. [Compétence 1.C]

  • DAT-2.E.1 Le biais se produit lorsque certaines réponses sont systématiquement favorisées par rapport à d'autres.
  • DAT-2.E.2 Lorsqu'un échantillon est composé entièrement de volontaires ou de personnes qui choisissent de participer, l'échantillon ne sera généralement pas représentatif de la population (biais de réponse volontaire).
  • DAT-2.E.3 Lorsqu'une partie de la population a une probabilité réduite d'être incluse dans l'échantillon, celui-ci ne sera généralement pas représentatif de la population (biais de sous-couverture).
  • DAT-2.E.4 Les individus sélectionnés pour l'échantillon pour lesquels les données ne peuvent être obtenues (ou qui refusent de répondre) peuvent différer de ceux pour lesquels les données peuvent être obtenues (biais de non-réponse).
  • DAT-2.E.5 Des problèmes dans l'instrument ou le processus de collecte des données entraînent un biais de réponse. Exemples : questions confuses ou orientantes (biais de formulation des questions) et réponses auto-déclarées.
  • DAT-2.E.6 Les méthodes d'échantillonnage non aléatoires (par exemple, échantillons choisis par commodité ou par réponse volontaire) introduisent un potentiel de biais car elles n'utilisent pas le hasard pour sélectionner les individus.

Source : Description du cours et de l'examen AP College Board

Le biais fait que les estimations manquent systématiquement la vérité :

  • Couverture insuffisante 覆盖不足 : certains groupes sont exclus de la liste d'échantillonnage.
  • Non-réponse 无回应 : les personnes sélectionnées ne répondent pas.
  • Biais de réponse 回应偏差 : les répondants répondent de manière inexacte (mauvaise formulation, sujets sensibles).

Le biais concerne une erreur constante dans une direction – augmenter la taille de l'échantillon ne le corrige pas.

Les échantillons de commodité manquent la population : le biais s'infiltre lorsque la sélection n'est pas aléatoire
Les échantillons de commodité manquent la population : le biais s'infiltre quand la sélection n'est pas aléatoire
3.5

Concevoir une expérience

Programme

Compréhension durable (VAR-3) : Une expérience bien conçue peut établir des preuves de relations causales.

Objectif d'apprentissage VAR-3.A : Identifier les composantes d'une expérience. [Compétence 1.C]

  • VAR-3.A.1 Les unités expérimentales sont les individus (qui peuvent être des personnes ou d'autres objets d'étude) auxquels des traitements sont assignés. Lorsque les unités expérimentales consistent en des personnes, elles sont parfois désignées comme participants ou sujets.
  • VAR-3.A.2 Une variable explicative (ou facteur) dans une expérience est une variable dont les niveaux sont manipulés intentionnellement. Les niveaux ou combinaisons de niveaux de la variable explicative(s) sont appelés traitements.
  • VAR-3.A.3 Une variable réponse dans une expérience est un résultat provenant des unités expérimentales qui est mesuré après l'administration des traitements.
  • VAR-3.A.4 Une variable de confusion dans une expérience est une variable liée à la variable explicative et influençant la variable réponse, pouvant créer une fausse perception d'association entre les deux.

Objectif d'apprentissage VAR-3.B : Décrire les éléments d'une expérience bien conçue. [Compétence 1.B]

  • VAR-3.B.1 Une expérience bien conçue doit comprendre ce qui suit :
    • a. Comparaisons d'au moins deux groupes de traitement, dont l'un pourrait être un groupe témoin.
    • b. Affectation/allocation aléatoire des traitements aux unités expérimentales.
    • c. Réplication (plus d'une unité expérimentale dans chaque groupe de traitement).
    • d. Contrôle des variables de confusion potentielles lorsque cela est approprié.

Objectif d'apprentissage VAR-3.C : Comparer les conceptions et méthodes expérimentales. [Compétence 1.C]

  • VAR-3.C.1 Dans une conception entièrement randomisée, les traitements sont assignés aux unités expérimentales complètement au hasard. L'affectation aléatoire tend à équilibrer les effets des variables non contrôlées (de confusion) afin que les différences dans les réponses puissent être attribuées aux traitements.
  • VAR-3.C.2 Les méthodes pour affecter aléatoirement des traitements aux unités expérimentales dans une conception entièrement randomisée incluent l'utilisation d'un générateur de nombres aléatoires, d'une table de valeurs aléatoires, du tirage de jetons sans remise, etc.
  • VAR-3.C.3 Dans une expérience simple-aveugle, les sujets ne savent pas quel traitement ils reçoivent, mais les membres de l'équipe de recherche le savent, ou vice versa.
  • VAR-3.C.4 Dans une expérience double-aveugle, ni les sujets ni les membres de l'équipe de recherche interagissant avec eux ne savent quel traitement un sujet reçoit.
  • VAR-3.C.5 Un groupe témoin est un ensemble d'unités expérimentales ne recevant ni un traitement d'intérêt ni un traitement contenant une substance inactive (placebo), afin de déterminer si le traitement d'intérêt a un effet.
  • VAR-3.C.6 L'effet placebo se produit lorsque les unités expérimentales ont une réponse à un placebo.
  • VAR-3.C.7 Pour les conceptions à blocs complets randomisés, les traitements sont assignés complètement au hasard au sein de chaque bloc.
  • VAR-3.C.8 Le blocage garantit qu'au début de l'expérience, les unités au sein de chaque bloc sont similaires les unes aux autres concernant au moins une variable de blocage. Une conception à blocs randomisés aide à séparer la variabilité naturelle des différences dues à la variable de blocage.
  • VAR-3.C.9 Une conception par paires appariées est un cas particulier d'une conception à blocs randomisés. En utilisant une variable de blocage, les sujets (qu'ils soient des personnes ou non) sont disposés en paires appariées sur des facteurs pertinents. Les paires appariées peuvent se former naturellement ou par l'expérimentateur. Chaque paire reçoit les deux traitements en assignant aléatoirement un traitement à un membre de la paire et en attribuant ultérieurement le traitement restant au second membre de la paire. Alternativement, chaque sujet peut recevoir les deux traitements.

Source : Description du cours et de l'examen AP College Board

Les bonnes expériences suivent trois principes :

  • Comparaison avec un groupe témoin 对照组 (souvent un placebo 安慰剂).
  • Affectation aléatoire 随机分配 des sujets aux traitements, pour équilibrer les autres variables.
  • Réplication 重复 : assez de sujets par traitement pour observer un effet réel.
Une expérience entièrement randomisée compare un groupe témoin à un groupe contrôle
Une expérience entièrement randomisée compare un groupe traité avec un groupe témoin

La confusion se produit lorsqu'une autre variable est liée au traitement de sorte que leurs effets ne puissent pas être séparés ; l'affectation aléatoire protège contre cela. Le masquage cache qui reçoit quel traitement pour empêcher les effets d'attente : dans une étude simple aveugle, seule une partie est tenue ignorante (généralement les sujets, ou seulement ceux qui évaluent le résultat), tandis que dans une étude double aveugle, ni les sujets ni les chercheurs qui interagissent avec eux ne savent, bloquant à la fois l'effet placebo et l'évaluation biaisée. Le blocage regroupe des sujets similaires et randomise au sein de chaque bloc pour réduire la variabilité.

Un essai clinique : l'assignation aléatoire sépare le traitement du groupe témoin
Un essai clinique : l'assignation aléatoire sépare le traitement du groupe témoin
Vocabulaire Entrainer
Anglais Chinois Pinyin
experiment/ekˈsperɪmənt/ 实验 shí yàn
treatment/ˈtriːtmənt/ 处理 chǔ lǐ
placebo/pləˈsiːbəʊ/ 安慰剂 ān wèi jì
Random assignment/ˈrændəm əˈsaɪnmənt/ 随机分配 suí jī fēn pèi
Replication/ˌreplɪˈkeɪʃn/ 重复 chóng fù
3.6

Choosing the Right Design

Programme

Compréhension durable (VAR-3) : Une expérience bien conçue peut établir des preuves de relations causales.

Objectif d'apprentissage VAR-3.D : Expliquer pourquoi une conception expérimentale particulière est appropriée. [Compétence 1.C]

  • VAR-3.D.1 Il y a des avantages et des inconvénients pour chaque conception expérimentale selon la question d'intérêt, les ressources disponibles et la nature des unités expérimentales.

Source : Description du cours et de l'examen AP College Board

Correspondez la conception à l'objectif : utilisez une conception entièrement randomisée pour des sujets uniformes ; une conception à blocs randomisés lorsqu'une variable connue (sexe, âge) affecte la réponse ; une conception paires appariées lorsque chaque sujet peut servir de son propre contrôle. Indiquez comment vous procéderiez à la randomisation.

3.7

What an Experiment Lets You Conclude

Programme

Compréhension durable (VAR-3) : Une expérience bien conçue peut établir des preuves de relations causales.

Objectif d'apprentissage VAR-3.E : Interpréter les résultats d'une expérience bien conçue. [Compétence 4.B]

  • VAR-3.E.1 L'inférence statistique attribue des conclusions basées sur des données à la distribution d'où proviennent ces données.
  • VAR-3.E.2 L'affectation aléatoire des traitements aux unités expérimentales permet aux chercheurs de conclure que certains changements observés sont si importants qu'il est peu probable qu'ils soient dus au hasard. De tels changements sont dits statistiquement significatifs.
  • VAR-3.E.3 Des différences statistiquement significatives entre ou parmi les groupes de traitement expérimental constituent des preuves que les traitements ont causé l'effet.
  • VAR-3.E.4 Si les unités expérimentales utilisées dans une expérience sont représentatives d'un plus grand groupe d'unités, les résultats d'une expérience peuvent être généralisés à ce plus grand groupe. Une sélection aléatoire des unités expérimentales offre de meilleures chances que celles-ci soient représentatives.

Source : Description du cours et de l'examen AP College Board

Two questions decide the scope of a conclusion:

  • Assignation aléatoire utilisée ? Alors une différence significative peut être attribuée au traitement (causalité) – pour ces sujets.
  • Échantillonnage aléatoire tiré d'une population ? Alors les résultats se généralisent à cette population.

Seul un实验 avec assignation aléatoire soutient une affirmation de cause à effet ; seul un échantillonnage aléatoire soutient la généralisation. Dites exactement lequel vous avez.

Exemple résolu. Les chercheurs assignent aléatoirement $100$ bénévoles à un nouveau médicament ou un placebo, et le groupe du médicament s'améliore significativement plus. En raison de l'affectation aléatoire, l'amélioration peut être attribuée au médicament (causalité) – mais parce que les sujets n'étaient pas échantillonnés aléatoirement, la conclusion ne s'applique qu'à ces bénévoles et ne se généralise pas automatiquement à tout le monde.

3.7

Conseils d'examen

  • Distinguez une étude observationnelle (trouve une association) d'un experiment (peut montrer une causalité).
  • Un bon échantillonnage est aléatoire (SRS, stratifié, en grappes) — méfiez-vous des biais (réponse volontaire, sous-couverture, non-réponse).
  • Les bons experiments utilisent le contrôle, la randomisation et la réplication ; le blocage gère une variable nuisible connue.
  • Seul un experiment randomisé soutient une conclusion de cause à effet.
  • Name the population, sample, and any confounding clearly.
Vocabulaire Entrainer
Anglais Chinois Pinyin
sample/ˈsæmpl/ 样本 yàng běn
Random sampling/ˈrændəm ˈsæmplɪŋ/ 随机抽样 suí jī chōu yàng
Confounding/kənˈfaʊndɪŋ/ 混杂 hùn zá
Blinding/ˈblaɪndɪŋ/ 盲法 máng fǎ
single-blind/ˈsɪŋɡl blaɪnd/ 单盲 dān máng
double-blind/ˈdʌbl blaɪnd/ 双盲 shuāng máng
Blocking/ˈblɒkɪŋ/ 区组 qū zǔ

Leçons interactives sur ce sujet

Traversez-le étape par étape, avec des exercices à vérification instantanée.

Épreuves Passées

Plus de sujets dans AP Statistiques

Se connecter ou créer un compte

IGCSE, A-Level & AP