词汇
| English | 中文 | 拼音 |
|---|---|---|
| bias/ˈbaɪəs/ | 偏差 | piān chā |
| representative/ˌreprɪˈzentətɪv/ | 有代表性的 | yǒu dài biǎo xìng de |
| population/ˌpɒpjʊˈleɪʃn/ | 总体 | zǒng tǐ |
| generalization/ˌdʒenərəlaɪˈzeɪʃn/ | 推广 | tuī guǎng |
我们能相信这些数据吗?
- 在任何作图或计算之前,先问:数据是否诚实、良好地收集到的?
- 收集的方法决定了哪些结论才有可能成立。
- 糟糕的数据无法靠巧妙的分析拯救——“垃圾进,垃圾出”。
- 第 3 单元讲的是获取好数据,好让第 4–9 单元能信任它们。
偏倚:一个偏斜的方法
- 偏倚是一种系统性的、朝同一方向偏离真相的倾向。
- 有偏的方法总偏向某些结果,不管你收集了多少数据。
- 它不同于随机误差——随机误差会互相抵消;偏倚不会抵消。
- 危险在于:样本对总体不有代表性。
什么时候可以推广?
- 推广是把样本的发现扩展到整个总体。
- 只有当样本是无偏(理想情况下随机)收集的,这才有依据。
- 来自偏斜方法的数据只描述那个偏斜的群体——而非所有人。
- “实际上触及了谁?”决定了一个结论能走多远。
先规划,再收集
- 好的数据收集是事先规划的,不是事后打补丁。
- 在收集之前就定好总体、抽样方法和问题。
- 周密的计划是避免日后无法修复的偏倚的最省钱办法。
- 分析的可信度,不会超过喂给它的那份收集。
注意
更大的样本并不能修复偏倚。如果方法系统性地漏掉了总体的一部分,用同样有缺陷的方式收集更多回应,只会给你一个更精确的错误答案。样本量对抗的是随机误差;只有更好的方法才能对抗偏倚。信任任何结论之前,先问数据是怎么收集的。
例子
一位电台主持人请听众打电话说是否支持一项新法律。
- 只有积极、有强烈意见的听众才会打进来——不是有代表性的样本。
- 结果是有偏的;它描述的是打电话的人,而非总体。
- 得到 $10{,}000$ 个来电而不是 $100$ 个,也丝毫不会减少偏倚。
关键点
数据收集的方法决定了我们能得出什么结论。偏倚是一种系统性误差,使样本对总体不有代表性,而且它不会随样本增大而缩小。只有无偏(理想情况随机)的收集才能为推广提供依据——所以在分析之前就要仔细规划收集。
探索
有偏样本过度代表了某一组
当某一块占据主导时,样本就不能代表总体。
练习
用同样有缺陷的方法收集大得多的样本,就能消除偏倚。
样本量对抗随机误差,而非偏倚——有缺陷的方法在任何规模下都仍有偏。
练习
一个电台来电投票主要触及积极的听众。它的结果是……
自我选择的来电者不具代表性——这个投票有偏。
练习
一种系统性地朝同一方向偏离真相的倾向叫做 ___(填英文一词)。
偏倚是系统性、有方向的误差,不会互相抵消。
练习
只有当样本……时,把样本的发现推广到整个总体才有依据。
只有无偏的收集才支持推广。
练习
数据收集的方法决定了哪些结论有可能成立。
好的结论需要好的收集——在分析前就要规划。