Passer au contenu

Explorer les données à une variable

AP Statistiques · Sujet 1

Entrainer
Leçon vidéo pour ce sujet Ouvrir la page vidéo
9:03

Explorer les données à une variable

Mesurez la même chose vingt fois et vous n'aurez pas la même réponse vingt fois. Vingt étudiants mesurent la même table. Les valeurs varient. Ce n'est pas un…

Narration en anglais · Sous-titres anglais + 中文 incrustés

1.1

Introduction aux statistiques : Que pouvons-nous apprendre des données ?

Programme

Compréhension durable (VAR-1) : Étant donné que la variation peut être aléatoire ou non, les conclusions sont incertaines.

Objectif d'apprentissage VAR-1.A : Identifier les questions à répondre, basé sur la variation dans des données à une variable. [Compétence 1.A]

  • VAR-1.A.1 Les nombres peuvent transmettre des informations significatives lorsqu'ils sont placés dans un contexte.

Source : Description du cours et de l'examen AP College Board

La statistique est la science qui consiste à apprendre à partir de données – des nombres ou des étiquettes collectés dans le monde réel. Les données varient, nous décrivons donc des modèles et tenons compte de la variation plutôt que de nous attendre à ce que chaque valeur corresponde. Une question statistique anticipe une réponse basée sur des données qui varient.

Deux distinctions traversent tout le cours. Un paramètre est un résumé numérique d'une population entière ; une statistique est un résumé numérique d'un échantillon – nous utilisons la statistique pour estimer le paramètre que nous ne pouvons pas mesurer directement. Et les statistiques descriptives ne font que résumer l'ensemble de données en main, tandis que les statistiques inférentielles utilisent un échantillon pour formuler et tester des affirmations concernant la population plus large.

Vocabulaire Entrainer
Anglais Chinois Pinyin
variation/ˌveərɪˈeɪʃn/ 变异 biàn yì
parameter/pəˈræmɪtə/ 参数 cān shù
1.2

Le langage de la variation : Variables

Programme

Compréhension durable (VAR-1) : Étant donné que la variation peut être aléatoire ou non, les conclusions sont incertaines.

Objectif d'apprentissage VAR-1.B : Identifier les variables dans un ensemble de données. [Compétence 2.A]

  • VAR-1.B.1 Une variable est une caractéristique qui change d'un individu à l'autre.

Objectif d'apprentissage VAR-1.C : Classer les types de variables. [Compétence 2.A]

  • VAR-1.C.1 Une variable catégorielle prend des valeurs qui sont des noms de catégories ou des étiquettes de groupes.
  • VAR-1.C.2 Une variable quantitative est celle qui prend des valeurs numériques pour une quantité mesurée ou comptée.
    • Exemples illustratifs pour VAR-1.C :
      • Variables catégorielles :
        • Main dominante
        • Groupe d'âge (jeune ou vieux)
        • Diplôme le plus élevé obtenu
      • Variables quantitatives :
        • Âge d'une structure
        • Taille d'un enfant
        • Concentration d'un échantillon

Source : Description du cours et de l'examen AP College Board

Une variable est une caractéristique qui peut différer entre les individus. Deux sortes :

  • Catégorielle (qualitative) : les valeurs sont des étiquettes/groupes (couleur des yeux, marque).
  • Quantitative : les valeurs sont des nombres sur lesquels on peut effectuer des calculs (taille, âge). Les variables quantitatives sont discrètes (comptables) ou continues (mesurées).

Choisir le bon graphique et le bon résumé dépend du type dont vous disposez.

Explorer

Catégorielle ou quantitative ?

Chaque variable est soit catégorielle (elle étiquette chaque unité avec un groupe) soit quantitative (un nombre mesuré que vous pouvez moyenne). Le type de variable décide des graphiques et résumés que vous avez le droit d'utiliser.

Vocabulaire Entrainer
Anglais Chinois Pinyin
variable/ˈveərɪəbl/ 变量 biàn liàng
Categorical/ˌkætɪˈɡɒrɪkl/ 分类 fēn lèi
Quantitative/ˈkwɒntɪteɪtɪv/ 定量 dìng liàng
frequency table/ˈfriːkwənsi ˈteɪbl/ 频数表 pín shuò biǎo
relative frequency/ˈrelətɪv ˈfriːkwənsi/ 相对频率 xiāng duì pín lǜ
1.3

Représenter une variable catégorielle avec des tableaux

Programme

Compréhension durable (UNC-1) : Les représentations graphiques et statistiques nous permettent d'identifier et de représenter les caractéristiques clés des données.

Objectif d'apprentissage UNC-1.A : Représenter des données catégorielles à l'aide de tableaux de fréquences ou de fréquences relatives. [Compétence 2.B]

  • UNC-1.A.1 Un tableau de fréquences donne le nombre de cas tombant dans chaque catégorie. Un tableau de fréquences relatives donne la proportion de cas tombant dans chaque catégorie.

Objectif d'apprentissage UNC-1.B : Décrire des données catégorielles représentées dans des tableaux de fréquences ou relatives. [Compétence 2.A]

  • UNC-1.B.1 Les pourcentages, les fréquences relatives et les taux fournissent toutes les mêmes informations que les proportions.
  • UNC-1.B.2 Les effectifs et les fréquences relatives des données catégorielles révèlent des informations qui peuvent être utilisées pour justifier des affirmations sur les données dans leur contexte.

Source : Description du cours et de l'examen AP College Board

Un tableau de fréquence liste le comptage (fréquence) de chaque catégorie ; un tableau de fréquence relative liste la proportion (comptage ÷ total) de chaque catégorie. Les fréquences relatives permettent de comparer équitablement des groupes de tailles différentes.

Vocabulaire Entrainer
Anglais Chinois Pinyin
proportion/prəˈpɔːʃn/ 比例 bǐ lì
Bar charts/bɑː tʃɑːts/ 条形图 tiáo xíng tú
1.4

Représenter une variable catégorielle avec des graphiques

Programme

Compréhension durable (UNC-1) : Les représentations graphiques et statistiques nous permettent d'identifier et de représenter les caractéristiques clés des données.

Objectif d'apprentissage UNC-1.C : Représenter graphiquement des données catégorielles. [Compétence 2.B]

  • UNC-1.C.1 Les diagrammes en barres (ou graphiques en barres) sont utilisés pour afficher les fréquences (effectifs) ou les fréquences relatives (proportions) pour des données catégorielles.
  • UNC-1.C.2 La hauteur ou la longueur de chaque barre dans un graphique en barres correspond soit au nombre, soit à la proportion d'observations tombant dans chaque catégorie.
  • UNC-1.C.3 Il existe de nombreuses autres façons de représenter les fréquences (effectifs) ou les fréquences relatives (proportions) pour des données catégorielles.

Objectif d'apprentissage UNC-1.D : Décrire des données catégorielles représentées graphiquement. [Compétence 2.A]

  • UNC-1.D.1 Les représentations graphiques d'une variable catégorielle révèlent des informations qui peuvent être utilisées pour justifier des affirmations sur les données dans leur contexte.

Objectif d'apprentissage UNC-1.E : Comparer plusieurs ensembles de données catégorielles. [Compétence 2.D]

  • UNC-1.E.1 Des tableaux de fréquences, des diagrammes en barres ou d'autres représentations peuvent être utilisés pour comparer deux ensembles de données ou plus concernant la même variable catégorielle.

Source : Description du cours et de l'examen AP College Board

Les diagrammes en barres montrent le comptage ou la proportion de chaque catégorie sous forme de barres séparées ; un diagramme circulaire montre la part de chaque catégorie dans l'ensemble. La hauteur des barres (ou des parts) permet de comparer les catégories d'un coup d'œil. Les barres peuvent être triées par taille ou selon un ordre naturel de catégorie.

Explorer

Montrer une variable catégorielle comme un diagramme circulaire

Un diagramme circulaire transforme la part de chaque catégorie dans le total en une tranche : une part plus grande est une tranche plus grande, et toutes les tranches ensemble font 100 %. C'est une image d'un tableau de fréquence relative.

1.5

Représenter une variable quantitative avec des graphiques

Programme

Compréhension durable (UNC-1) : Les représentations graphiques et statistiques nous permettent d'identifier et de représenter les caractéristiques clés des données.

Objectif d'apprentissage UNC-1.F : Classer les types de variables quantitatives. [Compétence 2.A]

  • UNC-1.F.1 Une variable discrète peut prendre un nombre dénombrable de valeurs. Le nombre de valeurs peut être fini ou infiniment dénombrable, comme avec les nombres entiers.
  • UNC-1.F.2 Une variable continue peut prendre infiniment de valeurs, mais ces valeurs ne peuvent pas être comptées. Peu importe à quel point l'intervalle entre deux valeurs d'une variable continue est petit, il est toujours possible de déterminer une autre valeur entre elles.
    • Exemples illustratifs pour UNC-1.F :
      • Une variable discrète :
        • Nombre d'étudiants dans une classe
      • Une variable continue :
        • Taille d'un enfant

Objectif d'apprentissage UNC-1.G : Représenter graphiquement des données quantitatives. [Compétence 2.B]

  • UNC-1.G.1 Dans un histogramme, la hauteur de chaque barre indique le nombre ou la proportion d'observations qui tombent dans l'intervalle correspondant à cette barre. Modifier les largeurs d'intervalle peut changer l'apparence de l'histogramme.
  • UNC-1.G.2 Dans un diagramme tiges et feuilles, chaque valeur de données est divisée en une « tige » (le premier chiffre ou les premiers chiffres) et une « feuille » (généralement le dernier chiffre).
  • UNC-1.G.3 Un nuage de points représente chaque observation par un point, dont la position sur l'axe horizontal correspond à la valeur de données de cette observation, avec des valeurs presque identiques empilées les unes sur les autres.
  • UNC-1.G.4 Un graphique cumulatif représente le nombre ou la proportion d'un ensemble de données inférieur ou égal à un nombre donné.
  • UNC-1.G.5 Il existe de nombreuses autres façons de représenter graphiquement les distributions de données quantitatives.

Source : Description du cours et de l'examen AP College Board

Pour les nombres, utilisez un nuage de points (dotplot), un diagramme tiges-feuilles ou un histogramme (barres sur des intervalles de valeurs appelés classes). Ceux-ci montrent la distribution – comment les valeurs se dispersent. La largeur de classe d'un histogramme change l'image, choisissez-la donc pour révéler la forme.

Sur un histogramme avec des largeurs de classe inégales, l'aire des barres représente la fréquence
Sur un histogramme avec des largeurs de classe inégales, l'aire des barres représente la fréquence
Explorer

Explorer comment la largeur des classes façonne un histogramme

Un histogramme regroupe les données en classes de largeur égale et dessine une barre au-dessus de chacune. Changez les classes et remarquez comment les mêmes données peuvent paraître irrégulières (trop étroites) ou lisses (trop larges) — la forme est un choix.

Vocabulaire Entrainer
Anglais Chinois Pinyin
Statistics/stəˈtɪstɪks/ 统计学 tǒng jì xué
data/ˈdeɪtə/ 数据 shù jù
statistic/stəˈtɪstɪk/ 统计量 tǒng jì liàng
descriptive statistics/dɪˈskrɪptɪv stəˈtɪstɪks/ 描述统计 miáo shù tǒng jì
inferential statistics/ɪnfəˈrenʃl stəˈtɪstɪks/ 推断统计 tuī duàn tǒng jì
dotplot/ˈdɒtplɒt/ 点图 diǎn tú
stem-and-leaf plot/stem ænd liːf plɒt/ 茎叶图 jīng yè tú
histogram/ˈhɪstəɡræm/ 直方图 zhí fāng tú
distribution/ˌdɪstrɪˈbjuːʃn/ 分布 fēn bù
1.6

Décrire la distribution d'une variable quantitative

Programme

Compréhension durable (UNC-1) : Les représentations graphiques et statistiques nous permettent d'identifier et de représenter les caractéristiques clés des données.

Objectif d'apprentissage UNC-1.H : Décrire les caractéristiques des distributions de données quantitatives. [Compétence 2.A]

  • UNC-1.H.1 Les descriptions de la distribution de données quantitatives incluent la forme, le centre et la variabilité (dispersion), ainsi que toute caractéristique inhabituelle telle que des valeurs aberrantes, des intervalles, des amas ou plusieurs pics.
  • UNC-1.H.2 Pour les données à une variable, les valeurs aberrantes sont des points de données anormalement petits ou grands par rapport au reste des données.
  • UNC-1.H.3 Une distribution est asymétrique vers la droite (asymétrie positive) si la queue droite est plus longue que la gauche. Une distribution est asymétrique vers la gauche (asymétrie négative) si la queue gauche est plus longue que la droite. Une distribution est symétrique si la moitié gauche est l'image miroir de la moitié droite.
  • UNC-1.H.4 Les graphiques univariés avec un seul pic principal sont appelés unimodaux. Les graphiques avec deux pics proéminents sont bimodaux. Un graphique où chaque hauteur de barre est approximativement la même (pas de pics proéminents) est approximativement uniforme.
  • UNC-1.H.5 Un intervalle est une région d'une distribution entre deux valeurs de données où il n'y a pas de données observées.
  • UNC-1.H.6 Les amas sont des concentrations de données généralement séparées par des intervalles.
  • UNC-1.H.7 La statistique descriptive n'attribue pas les propriétés d'un ensemble de données à une population plus large, mais peut fournir la base pour des conjectures destinées à être testées ultérieurement.

Source : Description du cours et de l'examen AP College Board

Décrivez quatre éléments (rappelez-vous SOCS) :

  • Forme : symétrique, ou asymétrique gauche/droite (une longue queue de ce côté), et nombre de pics – un pic principal est unimodal, deux pics proéminents bimodal, et des barres approximativement égales uniforme.
  • Valeurs aberrantes : des valeurs inhabituelles loin du reste.
  • Centre : une valeur typique (moyenne ou médiane).
  • Dispersion : l'étendue de variation des valeurs (étendue, IQR, écart-type).

Décrivez toujours la forme/centre/dispersion dans le contexte, avec les unités.

La forme d'une distribution : symétrique, asymétrique droite (longue queue droite) ou asymétrique gauche
La forme d'une distribution : symétrique, asymétrique droite (longue queue droite) ou asymétrique gauche
Vocabulaire Entrainer
Anglais Chinois Pinyin
Shape/ʃeɪp/ 形状 xíng zhuàng
skewed/skjuːd/ 偏斜 piān xié
unimodal/ˌʌnɪˈmɒdl/ 单峰 dān fēng
bimodal/baɪˈmɒdl/ 双峰 shuāng fēng
uniform/ˈjuːnɪfɔːm/ 均匀 jūn yún
Outliers/ˈaʊtlaɪəz/ 离群值 lí qún zhí
mean/miːn/ 均值 jūn zhí
median/ˈmiːdiːən/ 中位数 zhōng wèi shù
interquartile range/ˌɪntəˈkwɔːtaɪl reɪndʒ/ 四分位距 sì fēn wèi jù
1.7

Statistiques récapitulatives pour une variable quantitative

Programme

Compréhension durable (UNC-1) : Les représentations graphiques et statistiques nous permettent d'identifier et de représenter les caractéristiques clés des données.

Objectif d'apprentissage UNC-1.I : Calculer les mesures de centre et de position pour les données quantitatives. [Compétence 2.C]

  • UNC-1.I.1 Une statistique est un résumé numérique de données d'échantillon.
  • UNC-1.I.2 La moyenne est la somme de toutes les valeurs de données divisée par le nombre de valeurs. Pour un échantillon, la moyenne est notée $x$-barre : $\bar{x} = \dfrac{1}{n}\sum_{i=1}^{n} x_i$, où $x_i$ représente le $i^{\text{th}}$ point de données dans l'échantillon et $n$ représente le nombre de valeurs de données dans l'échantillon.
  • UNC-1.I.3 La médiane d'un ensemble de données est la valeur centrale lorsque les données sont ordonnées. Lorsque le nombre de points de données est pair, la médiane peut prendre n'importe quelle valeur entre les deux valeurs centrales. En statistiques AP, la valeur la plus couramment utilisée pour la médiane d'un ensemble de données avec un nombre pair de valeurs est la moyenne des deux valeurs centrales.
  • UNC-1.I.4 Le premier quartile, Q1, est la médiane de la moitié de l'ensemble de données ordonnées allant du minimum à la position de la médiane. Le troisième quartile, Q3, est la médiane de la moitié de l'ensemble de données ordonnées allant de la position de la médiane au maximum. Q1 et Q3 forment les limites pour les 50 % centraux des valeurs dans un ensemble de données ordonné.
  • UNC-1.I.5 Le $p^{\text{th}}$ percentile est interprété comme la valeur qui a $p\%$ des données inférieures ou égales à elle.

Objectif d'apprentissage UNC-1.J : Calculer les mesures de variabilité pour les données quantitatives. [Compétence 2.C]

  • UNC-1.J.1 Trois mesures de variabilité (ou dispersion) couramment utilisées dans une distribution sont l'étendue, l'étendue interquartile et l'écart-type.
  • UNC-1.J.2 L'étendue est définie comme la différence entre la valeur maximale de données et la valeur minimale de données. L'étendue interquartile (EIQ) est définie comme la différence entre le troisième et le premier quartile : $Q3 - Q1$. À la fois l'étendue et l'étendue interquartile sont des moyens possibles de mesurer la variabilité de la distribution d'une variable quantitative.
  • UNC-1.J.3 L'écart-type est un moyen de mesurer la variabilité de la distribution d'une variable quantitative. Pour un échantillon, l'écart-type est noté $s$ : $s_x = \sqrt{\dfrac{1}{n-1}\sum(x_i - \bar{x})^2}$. Le carré de l'écart-type de l'échantillon, $s^2$, est appelé la variance de l'échantillon.
  • UNC-1.J.4 Changer les unités de mesure affecte les valeurs des statistiques calculées.

Objectif d'apprentissage UNC-1.K : Expliquer le choix d'une mesure particulière de centre et/ou de variabilité pour décrire un ensemble de données quantitatives. [Compétence 4.B]

  • UNC-1.K.1 Il existe de nombreuses méthodes pour déterminer les valeurs aberrantes. Deux méthodes fréquemment utilisées dans ce cours sont :
    • UNC-1.K.1.i Une valeur aberrante est une valeur supérieure à $1.5 \times \text{IQR}$ au-dessus du troisième quartile ou inférieure à $1.5 \times \text{IQR}$ en dessous du premier quartile.
    • UNC-1.K.1.ii Une valeur aberrante est une valeur située à 2 écarts-types ou plus au-dessus, ou en dessous, de la moyenne.
  • UNC-1.K.2 La moyenne, l'écart-type et l'étendue sont considérés comme non résistants (ou non robustes) car ils sont influencés par les valeurs aberrantes. La médiane et l'EIQ sont considérés comme résistants (ou robustes), car les valeurs aberrantes ne modifient pas grandement (si du tout) leur valeur.

Source : Description du cours et de l'examen AP College Board

Écart-type : dispersion autour de la moyenne
  • Centre : la moyenne $\bar{x}=\dfrac{\sum x_i}{n}$ (moyenne arithmétique) et la médiane (valeur centrale). La médiane résiste aux valeurs aberrantes ; la moyenne est tirée vers une asymétrie.
  • Dispersion : l'étendue, l'intervalle interquartile $\text{IQR}=Q_3-Q_1$ (50 % centra), et l'écart-type $s_x=\sqrt{\dfrac{\sum(x_i-\bar{x})^2}{n-1}}$ (distance typique par rapport à la moyenne ; son carré est la variance).
  • Le résumé à cinq nombres : min, $Q_1$, médiane, $Q_3$, max.

Utilisez des mesures résistantes (médiane, IQR) pour les données asymétriques ; la moyenne et l'écart-type pour les données approximativement symétriques.

Le percentile d'une valeur est le pourcentage de données situées à cette valeur ou en dessous – ainsi la médiane est le 50e percentile et $Q_1$ le 25e. Un graphique de fréquence relative cumulative rend les percentiles faciles à lire : pour chaque valeur, il trace la proportion de données à cette valeur ou en dessous, montant de 0 à 1. Montez depuis une valeur jusqu'à la courbe puis traversez jusqu'à son percentile, ou inversez les étapes pour trouver la valeur à un percentile donné (la même lecture fonctionne à partir d'un tableau de fréquence cumulative).

Exemple résolu. Pour les données $4, 8, 6, 10, 7$ : la moyenne est $\bar{x}=\dfrac{4+8+6+10+7}{5}=\dfrac{35}{5}=7$. En les triant vers $4,6,7,8,10$, la médiane est la valeur centrale, $7$. La moyenne et la médiane coïncident ici car les données sont approximativement symétriques.

Vocabulaire Entrainer
Anglais Chinois Pinyin
standard deviation/ˈstændəd ˌdiːvɪˈeɪʃn/ 标准差 biāo zhǔn chà
variance/ˈveərɪəns/ 方差 fāng chà
five-number summary/faɪv ˈnʌmbə ˈsʌməri/ 五数概括 wǔ shù gài kuò
percentile/pəˈsentaɪl/ 百分位数 bǎi fēn wèi shù
cumulative relative frequency graph/ˈkjuːmjʊlətɪv ˈrelətɪv ˈfriːkwənsi ɡræf/ 累积相对频率图 lěi jī xiāng duì pín lǜ tú
1.8

Représentations graphiques des statistiques récapitulatives

Programme

Compréhension durable (UNC-1) : Les représentations graphiques et statistiques nous permettent d'identifier et de représenter les caractéristiques clés des données.

Objectif d'apprentissage UNC-1.L : Représenter graphiquement les statistiques récapitulatives pour les données quantitatives. [Compétence 2.B]

  • UNC-1.L.1 Ensemble, la valeur minimale de données, le premier quartile (Q1), la médiane, le troisième quartile (Q3) et la valeur maximale de données constituent le résumé à cinq nombres.
  • UNC-1.L.2 Un diagramme en boîte est une représentation graphique du résumé à cinq nombres (minimum, premier quartile, médiane, troisième quartile, maximum). La boîte représente les 50 % centraux des données, avec une ligne à la médiane et les extrémités de la boîte correspondant aux quartiles. Des lignes (« moustaches ») s'étendent des quartiles vers le point le plus extrême qui n'est pas une valeur aberrante, et les valeurs aberrantes sont indiquées par leur propre symbole au-delà de celui-ci.

Objectif d'apprentissage UNC-1.M : Décrire les statistiques récapitulatives des données quantitatives représentées graphiquement. [Compétence 2.A]

  • UNC-1.M.1 Les statistiques récapitulatives des données quantitatives, ou d'ensembles de données quantitatives, peuvent être utilisées pour justifier des affirmations sur les données dans leur contexte.
  • UNC-1.M.2 Si une distribution est relativement symétrique, alors la moyenne et la médiane sont relativement proches l'une de l'autre. Si une distribution est asymétrique vers la droite, alors la moyenne est généralement à droite de la médiane. Si la distribution est asymétrique vers la gauche, alors la moyenne est généralement à gauche de la médiane.

Source : Description du cours et de l'examen AP College Board

Un boxplot (boîte à moustaches) dessine le résumé à cinq nombres : une boîte de $Q_1$ à $Q_3$ avec la médiane à l'intérieur, et des moustaches jusqu'aux valeurs extrêmes non aberrantes. Un point est une valeur aberrante s'il se trouve à plus de $1.5\times\text{IQR}$ au-delà d'un quartile – une règle que vous pouvez être amené à appliquer. Les boxplots sont idéaux pour comparer plusieurs groupes côte à côte.

Exemple résolu. Un jeu de données a $Q_1=20$ et $Q_3=32$, donc $\text{IQR}=12$. Les seuils de valeurs aberrantes sont $Q_1-1.5(12)=2$ et $Q_3+1.5(12)=50$. Toute valeur inférieure à $2$ ou supérieure à $50$ est signalée comme une valeur aberrante.

Un diagramme boîte à moustaches montre les quartiles et l'étendue
Un diagramme boîte à moustaches montre les quartiles et l'étendue
Un boxplot dessine le résumé à cinq nombres ; la boîte couvre l'IQR
Un boxplot dessine le résumé à cinq nombres ; la boîte couvre l'IQR
Explorer

Explorer la résumé à cinq nombres comme diagramme en boîte

Faites glisser $Q_1$, la médiane, et $Q_3$ pour voir la boîte (sa longueur est l'étendue interquartile) et comment la position de la médiane à l'intérieur de la boîte révèle la asymétrie — une médiane proche de $Q_1$ signale une distribution asymétrique à droite.

Vocabulaire Entrainer
Anglais Chinois Pinyin
boxplot/ˈbɒksplɒt/ 箱线图 xiāng xiàn tú
normal distribution/ˈnɔːml ˌdɪstrɪˈbjuːʃn/ 正态分布 zhèng tài fēn bù
1.9

Comparer les distributions d'une variable quantitative

Programme

Compréhension durable (UNC-1) : Les représentations graphiques et statistiques nous permettent d'identifier et de représenter les caractéristiques clés des données.

Objectif d'apprentissage UNC-1.N : Comparer les représentations graphiques pour plusieurs ensembles de données quantitatives. [Compétence 2.D]

  • UNC-1.N.1 N'importe quelle représentation graphique, p. ex., histogrammes, diagrammes en boîte côte à côte, etc., peut être utilisée pour comparer deux ou plusieurs échantillons indépendants sur le centre, la variabilité, les amas, les intervalles, les valeurs aberrantes et d'autres caractéristiques.

Objectif d'apprentissage UNC-1.O : Comparer les statistiques récapitulatives pour plusieurs ensembles de données quantitatives. [Compétence 2.D]

  • UNC-1.O.1 N'importe quelles résumés numériques (p. ex., moyenne, écart-type, fréquence relative, etc.) peuvent être utilisés pour comparer deux ou plusieurs échantillons indépendants.

Source : Description du cours et de l'examen AP College Board

Pour comparer deux groupes ou plus, comparez la forme, le centre et la dispersion, et mentionnez les valeurs aberrantes – toujours avec des termes comparatifs (« Le groupe A a une médiane plus élevée que le groupe B ») et dans le contexte. Ne décrivez pas simplement chaque groupe séparément ; explicitez la comparaison.

Explorer

Comparer les distributions avec des diagrammes en boîte

Un diagramme en boîte dessine le résumé à cinq nombres. Placer deux diagrammes en boîte sur la même échelle compare leur centre (médiane), leur dispersion (écart interquartile = largeur de la boîte) et leur asymétrie d'un coup d'œil — la manière juste de comparer des groupes.

1.10

La distribution normale

Programme

Compréhension durable (VAR-2) : La distribution normale peut être utilisée pour représenter certaines distributions de population.

Objectif d'apprentissage VAR-2.A : Comparer une distribution de données au modèle de distribution normale. [Compétence 2.D]

  • VAR-2.A.1 Un paramètre est une synthèse numérique d'une population.
  • VAR-2.A.2 Certains ensembles de données peuvent être décrits comme approximativement normalement distribués. Une courbe normale a une forme de cloche et est symétrique. Les paramètres d'une distribution normale sont la moyenne de la population, $\mu$, et l'écart-type de la population, $\sigma$.
  • VAR-2.A.3 Pour une distribution normale, environ 68% des observations se trouvent dans 1 écart-type de la moyenne, environ 95% des observations se trouvent dans 2 écarts-types de la moyenne, et environ 99.7% des observations se trouvent dans 3 écarts-types de la moyenne. C'est ce qu'on appelle la règle empirique.
  • VAR-2.A.4 De nombreuses variables peuvent être modélisées par une distribution normale.
    • Exemples illustratifs pour VAR-2.A :
      • Variables qui peuvent être modélisées par une distribution normale :
        • Température corporelle
        • Poids d'une tranche de pain

Objectif d'apprentissage VAR-2.B : Déterminer des proportions et des percentiles à partir d'une distribution normale. [Compétence 3.A]

  • VAR-2.B.1 Une score standardisé pour une valeur de données particulière est calculé comme (valeur de données − moyenne)/(écart-type), et mesure le nombre d'écarts-types qu'une valeur de données se trouve au-dessus ou en dessous de la moyenne.
  • VAR-2.B.2 Un exemple de score standardisé est un score $z$, qui est calculé comme $z\text{-score} = \left(\dfrac{x_i - \mu}{\sigma}\right)$. Un score $z$ mesure combien d'écarts-types une valeur de données est éloignée de la moyenne.
  • VAR-2.B.3 La technologie, telle qu'une calculatrice, une table de loi normale standardisée ou une sortie générée par ordinateur, peut être utilisée pour trouver la proportion de valeurs de données situées sur un intervalle donné d'une variable aléatoire normalement distribuée.
  • VAR-2.B.4 Étant donné l'aire d'une région sous la courbe de la distribution normale, il est possible d'utiliser la technologie, telle qu'une calculatrice, une table de loi normale standardisée ou une sortie générée par ordinateur, pour estimer les paramètres de certaines populations.

Objectif d'apprentissage VAR-2.C : Comparer les mesures de position relative dans des ensembles de données. [Compétence 2.D]

  • VAR-2.C.1 Les percentiles et les scores $z$ peuvent être utilisés pour comparer les positions relatives de points au sein d'un ensemble de données ou entre des ensembles de données.

Source : Description du cours et de l'examen AP College Board

Une distribution normale 正态分布 est un modèle symétrique en forme de cloche, défini par sa moyenne $\mu$ et son écart-type $\sigma$. La règle empirique 经验法则 (68–95–99.7) : environ 68 % des valeurs se situent dans l'intervalle $1\sigma$ autour de la moyenne, 95 % dans $2\sigma$, et 99.7 % dans $3\sigma$.

La courbe normale : une probabilité est l'aire sous elle, centrée sur la moyenne
La courbe normale : une probabilité est l'aire sous celle-ci, centrée sur la moyenne

Un $z$-score mesure combien d'écart-types une valeur est éloignée de la moyenne :

$$z=\frac{x-\mu}{\sigma}.$$
Convertissez en un $z$-score, puis utilisez la table normale ou la technologie pour trouver la proportion (aire) en dessous, au-dessus ou entre les valeurs – et inversez le processus pour trouver une valeur à partir d'un percentile donné.

Exemple résolu. Les scores de test sont normaux avec $\mu=500$ et $\sigma=100$. Un score de $700$ correspond à $z=\dfrac{700-500}{100}=2$. Selon la règle empirique, $95\%$ des scores se situent dans $2\sigma$, donc $2.5\%$ se trouvent au-dessus de $700$ – ce qui signifie qu'un $700$ est environ au $97.5$e percentile.

La courbe normale et la règle empirique 68-95-99.7
La courbe normale et la règle empirique 68-95-99.7
Explorer

Explorer l'aire sous la courbe normale

La proportion des données inférieures à une valeur correspond à l'aire sous la courbe à sa gauche. Mettez en évidence une queue ou une bande centrale pour visualiser la règle empirique 68–95–99.7 et interpréter un score $z$ comme une aire.

Vocabulaire Entrainer
Anglais Chinois Pinyin
empirical rule/emˈpɪrɪkl ruːl/ 经验法则 jīng yàn fǎ zé
$z$-score/ˈzed skɔː/ 标准分数 biāo zhǔn fēn shù
1.10

Conseils d'examen

  • Décrire une distribution par sa forme, son centre, sa dispersion et ses valeurs aberrantes (SOCS) – toujours en contexte.
  • La moyenne est influencée par les valeurs aberrantes ; la médiane y résiste, ainsi on préfère la médiane pour les données asymétriques.
  • Pour une distribution normale, utilisez la règle 68–95–99.7 et les scores z $z=\tfrac{x-\mu}{\sigma}$.
  • Comparer les distributions avec des diagrammes en boîte côte à côte et commenter le centre, la dispersion et la forme.
  • L'écart-type mesure une distance typique par rapport à la moyenne ; l'IQR s'associe à la médiane.

Leçons interactives sur ce sujet

Traversez-le étape par étape, avec des exercices à vérification instantanée.

Épreuves Passées

Plus de sujets dans AP Statistiques

Se connecter ou créer un compte

IGCSE, A-Level & AP