Summary Statistics for a Quantitative Variable · Estatísticas Descritivas para uma Variável Quantitativa
| English | Português |
|---|---|
| mean/miːn/ | média |
| median/ˈmiːdiːən/ | mediana |
| Range/reɪndʒ/ | Amplitude |
| Standard deviation/ˈstændəd ˌdiːvɪˈeɪʃn/ | Desvio padrão |
| resistant/rɪˈzɪstənt/ | resistente |
Numbers that summarize the data
- A graph shows the shape; summary statistics boil a distribution down to a few key numbers.
- Two jobs: measure the center (a typical value) and the spread (how variable).
- Which numbers you use depends on the shape — especially whether there are outliers.
- These summaries are the backbone of every later inference.
Números que resumem os dados
- Um gráfico mostra a forma; estatísticas de resumo condensam uma distribuição em poucos números-chave.
- Duas funções: medir o centro (um valor típico) e a dispersão (quão variável).
- Quais números usar depende da forma — especialmente se há outliers.
- Esses resumos são a espinha dorsal de toda inferência posterior.
Measures of center
- The mean 均值 $\bar{x}$ is the arithmetic average: add all values, divide by how many.
- The median 中位数 is the middle value when the data are sorted (average the two middle if even).
- For a symmetric distribution they're close; for a skewed one they differ.
- The mean gets pulled toward a long tail; the median stays put.
Medidas de centro
- A média 均值 $\bar{x}$ é a média aritmética: some todos os valores e divida pela quantidade.
- A mediana 中位数 é o valor do meio quando os dados estão ordenados (faça a média dos dois do meio se for par).
- Para uma distribuição simétrica elas são próximas; para uma assimétrica divergem.
- A média é puxada em direção a uma cauda longa; a mediana permanece firme.
Center and spread of data · Centro e dispersão dos dados
The mean and median mark the center; the range, IQR, and standard deviation measure the spread. · A média e a mediana marcam o centro; o intervalo, IQR e o desvio padrão medem a dispersão.
Find the median of $4, 5, 6, 7, 100$. · Encontre a mediana de $4, 5, 6, 7, 100$.
The middle value of the sorted data is $6$. · O valor central dos dados ordenados é $6$.
In $4,5,6,7,100$, the mean ($24.4$) is dragged upward by the value $100$. · Em $4,5,6,7,100$, a média ($24.4$) é puxada para cima pelo valor $100$.
The mean is sensitive to extreme values. · A média é sensível a valores extremos.
Measures of spread
- Range 极差 = maximum − minimum (simple, but sensitive to extremes).
- IQR (interquartile range) $=Q_3-Q_1$ — the spread of the middle $50\%$.
- Standard deviation 标准差 $s_x$ — the typical distance of values from the mean.
- Bigger spread numbers mean more variability.
Medidas de dispersão
- Amplitude 极差 = máximo − mínimo (simples, mas sensível a extremos).
- QIR (intervalo interquartil) $=Q_3-Q_1$ — a dispersão do meio $50\%$.
- Desvio padrão 标准差 $s_x$ — a distância típica dos valores em relação à média.
- Números de dispersão maiores indicam maior variabilidade.
For a data set with $Q_1=5$ and · e $Q_3=7$, find the IQR. · Para um conjunto de dados com $Q_1=5$ e $Q_3=7$, encontre o IQR.
$\text{IQR}=Q_3-Q_1=7-5=2$.
Resistant vs. sensitive
- Median and IQR are resistant 稳健 — outliers barely move them.
- Mean and standard deviation are sensitive — one extreme value can shift them a lot.
- So for skewed data or data with outliers, report the median and IQR.
- Outlier rule: a value is an outlier if it's below $Q_1-1.5\times\text{IQR}$ or above $Q_3+1.5\times\text{IQR}$.
Resistente vs. sensível
- Mediana e QIR são robustos 稳健 — outliers mal os alteram.
- Média e desvio padrão são sensíveis — um único valor extremo pode mudá-los bastante.
- Então, para dados assimétricos ou com outliers, relate a mediana e o QIR.
- Regra do outlier: um valor é outlier se estiver abaixo de $Q_1-1.5\times\text{IQR}$ ou acima de $Q_3+1.5\times\text{IQR}$.
Which measures are resistant to outliers? · Quais medidas são resistentes a outliers?
Median and IQR resist outliers; mean and SD do not. · Mediana e IQR resistem a outliers; média e DP não resistem.
By the $1.5\times\text{IQR}$ rule, a high outlier is any value above... · Pela regra do $1.5\times\text{IQR}$, um outlier alto é qualquer valor acima de...
Measure from the quartile: $Q_3+1.5\,\text{IQR}$. · Medida derivada do quartil: $Q_3+1.5\,\text{IQR}$.
For strongly skewed data, the best center/spread summary is... · Para dados fortemente assimétricos, a melhor resumo de centro/dispersão é...
Resistant measures suit skewed data. · Medidas resistentes adequam-se a dados assimétricos.
Match the summary to the shape: for skewed data or outliers, use the resistant median and IQR — the mean and standard deviation get dragged by extremes. And the $1.5\times\text{IQR}$ rule measures from the quartiles ($Q_1,Q_3$), not the mean: flag values below $Q_1-1.5\,\text{IQR}$ or above $Q_3+1.5\,\text{IQR}$.
Combine o resumo com a forma: para dados assimétricos ou outliers, use a mediana e o QIR robustos — a média e o desvio padrão são arrastados pelos extremos. E a regra do $1.5\times\text{IQR}$ mede a partir dos quartis ($Q_1,Q_3$), não da média: marque valores abaixo de $Q_1-1.5\,\text{IQR}$ ou acima de $Q_3+1.5\,\text{IQR}$.
Data: $4, 5, 6, 7, 100$.
- Mean $=\tfrac{4+5+6+7+100}{5}=24.4$ (dragged up by $100$). Median $=6$ (unaffected).
- The median ($6$) better represents the typical value here.
- With $Q_1=5$, $Q_3=7$, $\text{IQR}=2$: $100>7+1.5(2)=10$, so $100$ is an outlier.
Dados: $4, 5, 6, 7, 100$.
- Média $=\tfrac{4+5+6+7+100}{5}=24.4$ (arrastada para cima por $100$). Mediana $=6$ (não afetada).
- A mediana ($6$) representa melhor o valor típico aqui.
- Com $Q_1=5$, $Q_3=7$, $\text{IQR}=2$: $100>7+1.5(2)=10$, então $100$ é um outlier.
Summarize center with the mean $\bar{x}$ or median, and spread with the range, IQR $=Q_3-Q_1$, or standard deviation $s_x$. The median and IQR are resistant to outliers; the mean and SD are not — so prefer them for skewed data. Flag outliers with the $1.5\times\text{IQR}$ rule.
Resuma o centro com a média $\bar{x}$ ou mediana, e a dispersão com a amplitude, QIR $=Q_3-Q_1$ ou desvio padrão $s_x$. A mediana e o QIR são robustos contra outliers; a média e o DP não são — prefira-os para dados assimétricos. Marque outliers com a regra do $1.5\times\text{IQR}$.