การสุ่มตัวอย่างและการประมาณค่า
| English | ไทย |
|---|---|
| sample/ˈsæmpl/ | ตัวอย่าง |
| population/ˌpɒpjʊˈleɪʃn/ | ประชากร |
| stratified/ˈstrætɪfaɪd/ | แบบแบ่งชั้น |
| systematic/ˌsɪstəˈmætɪk/ | แบบมีระบบ |
| cluster/ˈklʌstə/ | กลุ่ม |
| sampling distribution/ˈsæmplɪŋ ˌdɪstrɪˈbjuːʃn/ | การแจกแจงตัวอย่าง |
| standard error/ˈstændəd ˈerə/ | ความคลาดเคลื่อนมาตรฐาน |
| Central Limit Theorem/ˈsentrəl ˈlɪmɪt ˈθɪərəm/ | ทฤษฎีบทحدกลาง |
| confidence interval/ˈkɒnfɪdəns ˈɪntəvl/ | confidence interval |
การสำรวจที่คาดการณ์ผลการเลือกตั้ง
- การสำรวจ 1000 คน สามารถทำนายพฤติกรรมการลงคะแนนของ 60 ล้านคนได้ อย่างไร?
- การสุ่มตัวอย่าง ช่วยให้คุณสรุปเกี่ยวกับประชากรทั้งหมดจากกลุ่มย่อยขนาดเล็กที่ถูกเลือกมาอย่างระมัดระวัง คณิตศาสตร์เบื้องหลังมันคือรากฐานของการอนุมานทางสถิติทั้งหมด
ประชากรและตัวอย่าง
- ประชากร คือกลุ่มทั้งหมดที่คุณต้องการศึกษา ตัวอย่าง คือกลุ่มเล็ก ๆ จากประชากรนั้น
- การสุ่มตัวอย่างที่ดีต้องใช้ ความเป็นสุ่ม — สมาชิกทุกคนต้องมีโอกาสถูกเลือกที่ทราบได้
- วิธีการสุ่มตัวอย่าง: สุ่มง่าย, สุ่มแบ่งชั้น (สัดส่วนจากแต่ละกลุ่มย่อย), สุ่มระบบ (ทุก $k$-ที่), สุ่มกลุ่ม
การสุ่มแบ่งชั้น. โรงเรียนมีนักเรียนชาย 600 คนและนักเรียนหญิง 400 คน ตัวอย่างแบ่งชั้นขนาด 50 คน: $\dfrac{600}{1000} \times 50 = 30$ คนชายและ $\dfrac{400}{1000} \times 50 = 20$ คนหญิง

ค่าเฉลี่ยจากตัวอย่างมีลักษณะเกือบเป็นปกติไม่ว่ารูปร่างของประชากรจะเป็นอย่างไร
การแจกแจงของตัวอย่าง
X̄ ~ N(μ, σ²/n)
โดย ทฤษฎีบทحدกลาง ค่าเฉลี่ยตัวอย่างจะปฏิบัติตามรูปทรง ปกติ — จะแคบลงเมื่อขนาดตัวอย่างใหญ่ขึ้น
โรงเรียนมีนักเรียนชาย 600 คนและนักเรียนหญิง 400 คน การสุ่มตัวอย่างแบบแบ่งชั้นจำนวน 50 ต้องเลือกนักเรียนชายกี่คน?
(600/1000) × 50 = 30 คนชาย
การกระจายตัวของค่าเฉลี่ยจากการสุ่ม
- ค่าเฉลี่ยจากตัวอย่าง $\bar{X}$ เป็นตัวแปรสุ่มในตัวเอง:
- ความคลาดเคลื่อนมาตรฐานของค่าเฉลี่ยคือ $\dfrac{\sigma}{\sqrt{n}}$ —它会随着 $n$ 的增加而减小。

สถิติศึกษาจากตัวอย่างเพื่อเรียนรู้เกี่ยวกับประชากรทั้งหมด
ประชากรมี σ = 8 สำหรับตัวอย่าง n = 64, Var(X̄) = σ²/n คือเท่าไหร่?
Var(X̄) = σ²/n = 64/64 = 1
ประชากรมี σ = 10 และ n = 25. ส่วนเบี่ยงเบนมาตรฐาน σ/√n คือเท่าไหร่?
σ/√n = 10/√25 = 10/5 = 2.
จับคู่แนวคิดการสุ่มตัวอย่างแต่ละอย่างกับความหมาย
THTทำให้ค่าเฉลี่ยตัวอย่างเป็นปกติ; ขนาดการกระจายคือ σ²/n ซึ่งให้ช่วงความเชื่อมั่น
ทฤษฎีบทحدกลาง (Central Limit Theorem)
- ตาม ทฤษฎีบทحدกลาง สำหรับตัวอย่างที่มีขนาดใหญ่ ($n \geq 30$), $\bar{X}$ จะมีความเป็นปกติโดยประมาณ ไม่ว่ารูปร่างของประชากรจะเป็นอย่างไร.
- นี่คือผลลัพธ์ที่ทรงพลังที่สุดในคณิตศาสตร์ทั้งหมด — มันช่วยให้เราสามารถใช้การแจกแจงแบบปกติได้แม้ว่าข้อมูลจะไม่ใช่แบบปกติก็ตาม
CLT ใช้กับค่าเฉลี่ย ไม่ใช่ข้อมูล ทฤษฎีบทحدกลางบอกว่า การแจกแจงของ $\bar{X}$ จะกลายเป็นปกติ — ไม่ใช่จุดข้อมูลแต่ละจุด ข้อมูลดิบสามารถมีรูปร่างใดก็ได้

ช่วงความเชื่อมั่น 95% มีระยะถึง 1.96 ความคลาดเคลื่อนมาตรฐานทั้งสองข้างของค่าเฉลี่ยจากตัวอย่าง
โดยทฤษฎีบทحدกลาง ค่าเฉลี่ยตัวอย่างจะประมาณเป็นปกติสำหรับตัวอย่างขนาดใหญ่ ไม่ว่ารูปร่างของประชากรจะเป็นอย่างไรก็ตาม
THT ทำให้ X̄ ประมาณเป็นปกติเมื่อขนาดตัวอย่างเพิ่มขึ้น
THTระบุว่าข้อมูลรายบุคคลจะเข้าใกล้การแจกแจงปกติสำหรับตัวอย่างขนาดใหญ่
THTใช้กับค่าเฉลี่ยตัวอย่าง X̄ ไม่ใช่ข้อมูลรายบุคคล ข้อมูลดิบสามารถมีรูปร่างใดก็ได้
ช่วงความเชื่อมั่น (Confidence intervals)
- ช่วงความเชื่อมั่น ให้ขอบเขตที่คาดว่าจะมีค่าเฉลี่ยจริงอยู่ภายใน
- สำหรับประชากรแบบปกติที่มี $\sigma$ ที่ทราบ (หรือตัวอย่างขนาดใหญ่) ช่วง 95% คือ:
- จาก ตัวอย่างสุ่ม หา ค่าประมาณที่ไม่เอียง ของค่าเฉลี่ยและ ความแปรปรวน ('ไม่เอียง' = ถูกต้อง ตามเฉลี่ย) และช่วงความเชื่อมั่นสำหรับ สัดส่วนประชากร; ตัวเลขสุ่ม ช่วยในการเลือกตัวอย่าง
ตัวอย่าง n = 64 มี σ = 8. ค่าส่วนต่าง 1.96 × σ/√n สำหรับช่วงความเชื่อมั่น 95% คือเท่าไหร่? (ทศนิยม 2 ตำแหน่ง)
1.96 × 8/√64 = 1.96 × 8/8 = 1.96.
คุณเข้าใจแล้ว
- $E(\bar{X}) = \mu$, $\text{Var}(\bar{X}) = \dfrac{\sigma^2}{n}$; CLT ทำให้ $\bar X$ ≈ ปกติสำหรับ $n$ ที่มีขนาดใหญ่
- ช่วงความเชื่อมั่น 95%: $\bar{x} \pm 1.96\dfrac{\sigma}{\sqrt{n}}$
- การสุ่มที่ดีต้องใช้ ความเป็นสุ่ม