Skip to content · ⁨Bỏ qua nội dung⁩

Further Probability & Statistics · ⁨Xác suất & Thống kê Nâng cao⁩

A-Level Further Mathematics · ⁨Toán nâng cao A-Level⁩ · Topic 4 · ⁨Chủ đề 4⁩

Video lesson for this topic · ⁨Bài học video cho chủ đề này⁩ Open the video page · ⁨Mở trang video⁩
8:08

Xác suất & Thống kê Nâng cao

Dublin, năm nghìn chín trăm零八. Bên trong nhà máy bia Guinness, một nhà hóa học trẻ tên William Gosset đối mặt với một vấn đề rất thực tiễn. Anh ấy chỉ có thể thử nghiệm vài lô…

English narration · English + 中文 subtitles burned in · ⁨Giọng đọc tiếng Anh · phụ đề tiếng Anh + 中文 được ghi trực tiếp⁩

English

This handout covers Topic 4: Further Probability & Statistics 进阶概率统计. It adds continuous distributions, small-sample inference, the chi-squared and non-parametric tests, and probability generating functions.

Tiếng Việt

Tài liệu này bao gồm Chủ đề 4: Xác suất & Thống kê Nâng cao. Nội dung bổ sung các phân phối liên tục, suy luận mẫu nhỏ, kiểm định chi-squared và kiểm định phi tham số, cũng như hàm sinh xác suất.

4.1

Continuous random variables · ⁨Biến ngẫu nhiên liên tục⁩

Syllabus · ⁨Chương trình⁩
English
Candidates should be able to: Notes and examples
use a probability density function which may be defined piecewise
use the general result $\text{E}(g(X)) = \int f(x)g(x) \, \mathrm{d}x$ where $f(x)$ is the probability density function of the continuous random variable $X$ and $g(X)$ is a function of $X$
understand and use the relationship between the probability density function (PDF) and the cumulative distribution function (CDF), and use either to evaluate probabilities or percentiles
use cumulative distribution functions (CDFs) of related variables in simple cases. e.g. given the CDF of a variable $X$, find the CDF of a related variable $Y$, and hence its PDF, e.g. where $Y = X^3$.
Tiếng Việt
thí sinh có khả năng: Ghi chú và ví dụ
• sử dụng hàm mật độ xác suất có thể được xác định theo đoạn
• sử dụng kết quả tổng quát $\text{E}(g(X)) = \int f(x)g(x) \, \mathrm{d}x$ trong đó $f(x)$ là hàm mật độ xác suất của biến ngẫu nhiên liên tục $X$ và $g(X)$ là một hàm của $X$
• hiểu và sử dụng mối quan hệ giữa hàm mật độ xác suất (PDF) và hàm phân bố lũy tích (CDF), và sử dụng một trong hai để tính xác suất hoặc percentil
• sử dụng hàm phân bố lũy tích (CDFs) của các biến liên quan trong các trường hợp đơn giản. Ví dụ: cho CDF của biến $X$, tìm CDF của biến liên quan $Y$, và từ đó suy ra PDF của nó, ví dụ khi $Y = X^3$.

Source: Cambridge International syllabus · ⁨Nguồn: Chương trình Cambridge International⁩

English

A continuous variable $X$ is described by a probability density function 概率密度函数 $f(x)$, which may be defined piecewise. The probability over a range is the area under $f$, and the mean of any function of $X$ is

$$E(g(X)) = \int g(x)\,f(x)\,dx.$$

The cumulative distribution function 累积分布函数 $F(x) = P(X \leqslant x)$ is the running total: $F(x) = \displaystyle\int_{-\infty}^{x} f(t)\,dt$, and $f(x) = F'(x)$. Use $F$ to find probabilities and percentiles 百分位数 (for example, the median 中位数 solves $F(x) = 0.5$).

Worked example. A variable has $f(x) = \tfrac12 x$ for $0 \leqslant x \leqslant 2$. Find the median.

The cumulative distribution function is $F(x) = \displaystyle\int_0^x \tfrac12 t\,dt = \tfrac14 x^2$. Set $F(m) = 0.5$:

$$\tfrac14 m^2 = 0.5 \;\Rightarrow\; m^2 = 2 \;\Rightarrow\; m = \sqrt{2} = 1.41.$$

The distribution of a related variable. If $Y=g(X)$, find $Y$'s distribution through its cumulative function. For $Y=X^2$: $F_Y(y)=P(X^2\leqslant y)=P(-\sqrt y\leqslant X\leqslant\sqrt y)=F_X(\sqrt y)-F_X(-\sqrt y)$, then differentiate for $f_Y=F_Y'$. When $g$ is monotonic increasing there is a shortcut, $F_Y(y)=F_X\big(g^{-1}(y)\big)$.

Worked example. With $f_X(x)=\tfrac12 x$ on $[0,2]$ (so $F_X(x)=\tfrac14 x^2$), let $Y=X^2$. For $0\leqslant y\leqslant 4$, $F_Y(y)=F_X(\sqrt y)=\tfrac14 y$, so $f_Y(y)=F_Y'(y)=\tfrac14$ – that is, $Y$ is uniform on $[0,4]$.

Tiếng Việt

Một biến liên tục $X$ được mô tả bởi hàm mật độ xác suất $f(x)$, hàm này có thể được xác định từng đoạn. Xác suất trong một khoảng giá trị là diện tích dưới $f$, và kỳ vọng của bất kỳ hàm nào của $X$ là

$$E(g(X)) = \int g(x)\,f(x)\,dx.$$

Hàm mật độ với diện tích bên trái trung vị được tô màu bằng một nửa tổng diện tích
Trung vị nằm tại nơi diện tích dưới $f(x)$ về phía bên trái chính xác bằng $0.5$.

Hàm phân bố lũy tiến $F(x) = P(X \leqslant x)$ là tổng cộng dồn: $F(x) = \displaystyle\int_{-\infty}^{x} f(t)\,dt$, và $f(x) = F'(x)$. Sử dụng $F$ để tìm xác suất và phân vị (ví dụ, trung vị giải phương trình $F(x) = 0.5$).

Đường cong tích lũy tăng dần từ 0 đến 1, đọc giá trị trung vị tại độ cao 0.5
Biểu đồ lũy tiến $F(x)$ tăng từ $0$ đến $1$; độ cao $0.5$ đạt được tại trung vị.

Ví dụ minh họa. Một biến có $f(x) = \tfrac12 x$ cho $0 \leqslant x \leqslant 2$. Tìm trung vị.

Hàm phân bố lũy tiến là $F(x) = \displaystyle\int_0^x \tfrac12 t\,dt = \tfrac14 x^2$. Đặt $F(m) = 0.5$:

$$\tfrac14 m^2 = 0.5 \;\Rightarrow\; m^2 = 2 \;\Rightarrow\; m = \sqrt{2} = 1.41.$$

Phân phối của một biến liên quan. Nếu $Y=g(X)$, tìm phân phối của $Y$ thông qua hàm lũy tiến của nó. Với $Y=X^2$: $F_Y(y)=P(X^2\leqslant y)=P(-\sqrt y\leqslant X\leqslant\sqrt y)=F_X(\sqrt y)-F_X(-\sqrt y)$, sau đó đạo hàm để tìm $f_Y=F_Y'$. Khi $g$ đồng biến thì có cách rút gọn, $F_Y(y)=F_X\big(g^{-1}(y)\big)$.

Ví dụ minh họa. Với $f_X(x)=\tfrac12 x$ trên $[0,2]$ (nên $F_X(x)=\tfrac14 x^2$), đặt $Y=X^2$. Với $0\leqslant y\leqslant 4$, $F_Y(y)=F_X(\sqrt y)=\tfrac14 y$, nên $f_Y(y)=F_Y'(y)=\tfrac14$ – tức là, $Y$ là phân phối đều trên $[0,4]$.

Explore · ⁨Khám phá⁩

Continuous random variables · ⁨Biến ngẫu nhiên liên tục⁩

P(a < X < b) = ∫ f(x) dx

For a continuous variable, probability is the area under the density curve. · ⁨Đối với biến liên tục, xác suất chính là diện tích dưới đường cong mật độ.⁩

Vocabulary · ⁨Từ vựng⁩ Train · ⁨Luyện tập⁩
English Tiếng Việt
probability density function/ˌprɒbəˈbɪlɪti ˈdensɪti ˈfʌŋkʃn/ hàm mật độ xác suất
cumulative distribution function/ˈkjuːmjʊlətɪv ˌdɪstrɪˈbjuːʃn ˈfʌŋkʃn/ hàm phân bố lũy tích
percentiles/pəˈsentaɪlz/ percentiles
median/ˈmiːdiːən/ trung vị
hypothesis test/haɪˈpɒθəsɪs test/ kiểm định giả thuyết
confidence interval/ˈkɒnfɪdəns ˈɪntəvl/ khoảng tin cậy
pooled estimate/puːld ˈestɪmət/ ước lượng gộp
chi-squared test/kaɪ skweəd test/ kiểm định chi-squared
theoretical distribution/θɪəˈretɪkl ˌdɪstrɪˈbjuːʃn/ phân bố lý thuyết
degrees of freedom/dɪˈɡriːz ɒv ˈfriːdəm/ bậc tự do
goodness of fit/ˈɡʊdnəs ɒv fɪt/ tính phù hợp
independence/ˌɪndɪˈpendəns/ độc lập
contingency table/kənˈtɪndʒənsi ˈteɪbl/ bảng liên kết
non-parametric test/nɒn ˌpærəˈmetrɪk test/ kiểm định phi tham số
4.2

Inference using normal and t-distributions · ⁨Suy luận sử dụng phân phối chuẩn và t⁩

Syllabus · ⁨Chương trình⁩
English
Candidates should be able to: Notes and examples
formulate hypotheses and apply a hypothesis test concerning the population mean using a small sample drawn from a normal population of unknown variance, using a t-test
calculate a pooled estimate of a population variance from two samples Calculations based on either raw or summarised data may be required.
formulate hypotheses concerning the difference of population means, and apply, as appropriate: - a 2-sample t-test - a paired sample t-test - a test using a normal distribution The ability to select the test appropriate to the circumstances of a problem is expected.
determine a confidence interval for a population mean, based on a small sample from a normal population with unknown variance, using a t-distribution
determine a confidence interval for a difference of population means, using a t-distribution or a normal distribution, as appropriate.
Tiếng Việt
thí sinh có khả năng: Ghi chú và ví dụ
• xây dựng giả thuyết và áp dụng kiểm định giả thuyết về trung bình tổng thể bằng mẫu nhỏ lấy từ tổng thể phân phối chuẩn có phương sai chưa biết, sử dụng kiểm định t
• tính ước lượng gộp của phương sai tổng thể từ hai mẫu Các phép tính dựa trên dữ liệu thô hoặc dữ liệu tóm tắt có thể được yêu cầu.
• xây dựng giả thuyết về sự chênh lệch trung bình tổng thể, và áp dụng, tùy tình huống: - kiểm định t 2 mẫu - kiểm định t mẫu ghép đôi - kiểm định sử dụng phân phối chuẩn Khả năng chọn kiểm định phù hợp với tình huống của bài toán là yêu cầu.
• xác định khoảng tin cậy cho trung bình tổng thể, dựa trên mẫu nhỏ từ tổng thể phân phối chuẩn có phương sai chưa known, sử dụng phân phối t
• xác định khoảng tin cậy cho sự chênh lệch trung bình tổng thể, sử dụng phân phối t hoặc phân phối chuẩn, tùy tình huống.

Source: Cambridge International syllabus · ⁨Nguồn: Chương trình Cambridge International⁩

English

When a sample is small and the population variance is unknown, base your hypothesis test 假设检验 on the $t$-distribution instead of the normal. The same idea gives a confidence interval 置信区间 for the mean:

$$\bar{x} \pm t\,\frac{s}{\sqrt{n}},$$
where $t$ comes from the $t$-tables with $n - 1$ degrees of freedom. To compare two populations, use a two-sample (2-sample) or paired-sample $t$-test, after finding a pooled estimate 合并估计 of the shared variance when appropriate.

Worked example. A sample of $n = 10$ has mean $\bar{x} = 50$ and standard deviation $s = 4$. Find a $95\%$ confidence interval for the mean (use $t = 2.262$ for $9$ degrees of freedom).

$$50 \pm 2.262\times\frac{4}{\sqrt{10}} = 50 \pm 2.86 \;\Rightarrow\; (47.1,\ 52.9).$$

Tiếng Việt
Bảng Galton với các quả bóng được chất thành hình chuông
Bảng Galton: những quả bóng rơi qua các chốt tạo thành phân phối chuẩn hình chuông.

Khi mẫu nhỏ và phương sai tổng thể chưa biết, hãy dựa vào kiểm định giả thuyết của phân phối $t$ thay vì phân phối chuẩn. Ý tưởng tương tự cho ra khoảng tin cậy cho trung bình:

$$\bar{x} \pm t\,\frac{s}{\sqrt{n}},$$
trong đó $t$ lấy từ bảng $t$ với $n - 1$ bậc tự do. Để so sánh hai tổng thể, sử dụng kiểm định t hai mẫu (2-sample) hoặc mẫu ghép đôi $t$, sau khi tìm ước lượng gộp cho phương sai chung khi phù hợp.

Đường cong phân phối t nằm thấp hơn và rộng hơn so với phân phối chuẩn tiêu chuẩn
Đối với mẫu nhỏ, phân phối $t$ phẳng hơn với đuôi nặng hơn, nên giá trị tới hạn của nó lớn hơn.

Ví dụ minh họa. Một mẫu $n = 10$ có trung bình $\bar{x} = 50$ và độ lệch chuẩn $s = 4$. Tìm khoảng tin cậy $95\%$ cho trung bình (sử dụng $t = 2.262$ cho $9$ bậc tự do).

$$50 \pm 2.262\times\frac{4}{\sqrt{10}} = 50 \pm 2.86 \;\Rightarrow\; (47.1,\ 52.9).$$

Explore · ⁨Khám phá⁩

Why small samples need t instead of z · ⁨Tại sao mẫu nhỏ cần dùng t thay vì z⁩

With $\sigma$ unknown you use $t$, and $t$ has heavier tails than the normal (drawn dashed behind it) — so its critical values are larger and the interval is wider. At the worked example's $9$ degrees of freedom the widget reads $t^* = 2.262$, exactly the table value used above. Sweep df up and $t$ collapses onto the normal. · ⁨Khi $\sigma$ chưa biết bạn phải dùng $t$, và $t$ có đuôi nặng hơn phân phối chuẩn (vẽ nét đứt phía sau) — nên các giá trị tới hạn của nó lớn hơn và khoảng tin cậy rộng hơn. Tại $9$ bậc tự do của ví dụ mẫu, widget hiển thị $t^* = 2.262$, đúng bằng giá trị bảng đã dùng ở trên. Kéo df lên và $t$ sẽ chồng khít lên phân phối chuẩn.⁩

Explore · ⁨Khám phá⁩

The normal distribution · ⁨Phân phối chuẩn⁩

Shade a tail to find a probability — the basis of confidence intervals and hypothesis tests. · ⁨Tô bóng một đuôi để tìm xác suất — cơ sở của khoảng tin cậy và kiểm định giả thuyết.⁩

4.3

Chi-squared tests · ⁨Kiểm định Chi-squared⁩

Syllabus · ⁨Chương trình⁩
English
Candidates should be able to: Notes and examples
fit a theoretical distribution, as prescribed by a given hypothesis, to given data Questions will not involve lengthy calculations.
use a $\chi^2$-test, with the appropriate number of degrees of freedom, to carry out the corresponding goodness of fit analysis Classes should be combined so that each expected frequency is at least 5.
use a $\chi^2$-test, with the appropriate number of degrees of freedom, for independence in a contingency table. Yates’ correction is not required. Where appropriate, either rows or columns should be combined so that the expected frequency in each cell is at least 5.
Tiếng Việt
thí sinh có khả năng: Ghi chú và ví dụ
điều chỉnh một phân phối lý thuyết, theo quy định của một giả thuyết cho trước, vào dữ liệu đã cho Các câu hỏi sẽ không yêu cầu tính toán phức tạp.
sử dụng kiểm tra $\chi^2$, với số bậc tự do phù hợp, để thực hiện phân tích tương thích (goodness of fit) tương ứng Các lớp nên được gộp lại sao cho tần suất kỳ vọng trong mỗi lớp là ít nhất 5.
sử dụng kiểm định $\chi^2$-test, với số bậc tự do thích hợp, để kiểm tra sự độc lập trong bảng tần suất. Không yêu cầu điều chỉnh Yates. Khi cần thiết, nên gộp hàng hoặc cột sao cho tần suất dự kiến trong mỗi ô là ít nhất 5.

Source: Cambridge International syllabus · ⁨Nguồn: Chương trình Cambridge International⁩

English

A $\chi^2$-test (chi-squared test 卡方检验) compares observed counts $O$ with expected counts $E$ from a theoretical distribution 理论分布:

$$\chi^2 = \sum \frac{(O - E)^2}{E}.$$
Compare this with a table value for the right number of degrees of freedom 自由度. Two uses: a goodness of fit 拟合优度 test (does the data follow the proposed model?), and a test for independence 独立性 of two variables in a contingency table 列联表.

Worked example. Four equally likely categories give observed counts $20, 30, 25, 25$ (so each expected count is $25$). Test the fit at the $5\%$ level.

$$\chi^2 = \frac{(20-25)^2 + (30-25)^2 + 0 + 0}{25} = \frac{25 + 25}{25} = 2.$$
With $4 - 1 = 3$ degrees of freedom the table value is $7.815$. Since $2 < 7.815$, do not reject the model.

Tiếng Việt

Kiểm định $\chi^2$ (kiểm định chi-squared) so sánh số quan sát được $O$ với số mong đợi $E$ từ một phân phối lý thuyết:

$$\chi^2 = \sum \frac{(O - E)^2}{E}.$$
So sánh giá trị này với giá trị bảng cho đúng số bậc tự do. Hai ứng dụng: kiểm định tương thích (dữ liệu có tuân theo mô hình đề xuất không?), và kiểm định độc lập của hai biến trong bảng đối chiếu.

Đường cong chi-squared lệch phải với phần đuôi trên 5% được tô màu vượt qua giá trị tới hạn
Kiểm định bác bỏ mô hình khi $\chi^2$ vượt quá giá trị tới hạn,落入 được vùng đuôi được tô màu $5\%$.

Ví dụ minh họa. Bốn danh mục có xác suất như nhau cho số quan sát $20, 30, 25, 25$ (nên mỗi số mong đợi là $25$). Kiểm tra sự tương thích ở mức $5\%$.

$$\chi^2 = \frac{(20-25)^2 + (30-25)^2 + 0 + 0}{25} = \frac{25 + 25}{25} = 2.$$
Với $4 - 1 = 3$ bậc tự do, giá trị trong bảng là $7.815$. Vì $2 < 7.815$, không bác bỏ mô hình.

Explore · ⁨Khám phá⁩

The chi-squared distribution and its 5% tail · ⁨Phân phối chi-squared và đuôi 5%⁩

The worked example on this page gives $\chi^2 = 2$ with $3$ degrees of freedom against a table value of $7.815$ — the widget reproduces both. Drag df to see why the critical value changes with the number of categories. · ⁨Ví dụ mẫu giải trên trang này đưa ra $\chi^2 = 2$ với $3$ bậc tự do so với giá trị bảng là $7.815$ — widget tái tạo cả hai. Kéo df để thấy tại sao giá trị tới hạn thay đổi theo số lượng phân loại.⁩

Explore · ⁨Khám phá⁩

Chi-squared test route · ⁨Quy trình kiểm định Chi-squared⁩

Follow observed and expected counts to a test decision. · ⁨Theo dõi số quan sát và số mong đợi để đưa ra quyết định kiểm định.⁩

4.4

Non-parametric tests · ⁨Kiểm định phi tham số⁩

Syllabus · ⁨Chương trình⁩
English
Candidates should be able to: Notes and examples
understand the idea of a non-parametric test and appreciate situations in which such a test might be useful e.g. when sampling from a population which cannot be assumed to be normally distributed.
understand the basis of the sign test, the Wilcoxon signed-rank test and the Wilcoxon rank-sum test Including knowledge that Wilcoxon tests are valid only for symmetrical distributions.
use a single-sample sign test and a single-sample Wilcoxon signed-rank test to test a hypothesis concerning a population median Including the use of normal approximations where appropriate. Questions will not involve tied ranks or observations equal to the population median value being tested.
use a paired-sample sign test, a Wilcoxon matched-pairs signed-rank test and a Wilcoxon rank-sum test, as appropriate, to test for identity of populations. Including the use of normal approximations where appropriate. Questions will not involve tied ranks or zero‑difference pairs.
Tiếng Việt
thí sinh có khả năng: Ghi chú và ví dụ
hiểu khái niệm về kiểm tra phi tham số và nhận biết các tình huống mà loại kiểm tra này có thể hữu ích Ví dụ: khi lấy mẫu từ một tổng thể không thể giả định là phân phối chuẩn.
hiểu cơ sở của kiểm tra dấu, kiểm tra Wilcoxon xếp hạng có dấu và kiểm tra Wilcoxon tổng xếp hạng Bao gồm việc nắm vững rằng các kiểm tra Wilcoxon chỉ hợp lệ đối với các phân phối đối xứng.
sử dụng kiểm tra dấu một mẫu và kiểm tra Wilcoxon xếp hạng có dấu một mẫu để kiểm tra giả thuyết về trung vị của tổng thể Bao gồm việc sử dụng xấp xỉ chuẩn khi phù hợp. Các câu hỏi sẽ không涉及 các hạng bằng nhau (tied ranks) hay các quan sát bằng giá trị trung vị của tổng thể đang được kiểm tra.
sử dụng kiểm tra dấu cặp mẫu, kiểm tra Wilcoxon xếp hạng có dấu cặp mẫu và kiểm tra Wilcoxon tổng xếp hạng, tùy thuộc vào trường hợp, để kiểm tra sự đồng nhất của các tổng thể. Bao gồm việc sử dụng xấp xỉ chuẩn khi phù hợp. Các câu hỏi sẽ không涉及 các hạng bằng nhau hay các cặp có hiệu bằng 0.

Source: Cambridge International syllabus · ⁨Nguồn: Chương trình Cambridge International⁩

English

A non-parametric test 非参数检验 makes no assumption that the data is normal, so it is useful when that assumption fails. The basic ones are:

  • the sign test 符号检验: count how many values fall above and below a proposed median, and test those counts with a binomial model;
  • the Wilcoxon signed-rank test 威尔科克森符号秩检验 (the matched-pairs test for paired data), which also uses the sizes of the differences, not just their signs;
  • the Wilcoxon rank-sum test 威尔科克森秩和检验, for comparing two separate samples.

Worked example. Test whether a median is $5$. In a sample of $10$ values (none equal to $5$), $9$ lie above $5$ and $1$ lies below. Test at the $5\%$ level (two-tailed).

Under $H_0$ (median $= 5$) the number above follows $B(10, 0.5)$. The observed result ($9$ above) is extreme, so find $P(X \geq 9) = \binom{10}{9}(0.5)^{10} + (0.5)^{10} = \dfrac{11}{1024} = 0.0107$. For a two-tailed test compare with $\tfrac{1}{2}(5\%) = 0.025$. Since $0.0107 < 0.025$, reject $H_0$: there is evidence the median is not $5$.

Tiếng Việt

Một kiểm định phi tham số không đưa ra giả thuyết rằng dữ liệu tuân theo phân phối chuẩn, do đó hữu ích khi giả thuyết đó không đúng. Các kiểm định cơ bản bao gồm:

  • kiểm định dấu: đếm số giá trị nằm trên và dưới một trung vị được đề xuất, sau đó kiểm tra các phép đếm này bằng mô hình nhị thức;
  • kiểm định Wilcoxon signed-rank (kiểm định cặp ghép) dành cho dữ liệu có cặp, sử dụng cả độ lớn của các hiệu số chứ không chỉ dấu của chúng;
  • kiểm định Wilcoxon rank-sum, dùng để so sánh hai mẫu độc lập.
Trục số với đường trung vị nét đứt: ba điểm bên dưới được đánh dấu trừ và bốn điểm bên trên được đánh dấu cộng
Kiểm định dấu đếm số giá trị nằm trên và dưới trung vị được đề xuất, sau đó kiểm tra các phép đếm này bằng mô hình nhị thức

Ví dụ minh họa. Kiểm định xem trung vị có phải là $5$ hay không. Trong một mẫu gồm $10$ giá trị (không có giá trị nào bằng $5$), có $9$ giá trị nằm trên $5$ và $1$ giá trị nằm bên dưới. Thực hiện kiểm định ở mức ý nghĩa $5\%$ (hai phía).

Dưới giả thuyết $H_0$ (trung vị $= 5$), số giá trị nằm trên tuân theo $B(10, 0.5)$. Kết quả quan sát được ($9$ giá trị nằm trên) là cực đoan, nên cần tìm $P(X \geq 9) = \binom{10}{9}(0.5)^{10} + (0.5)^{10} = \dfrac{11}{1024} = 0.0107$. Đối với kiểm định hai phía, hãy so sánh với $\tfrac{1}{2}(5\%) = 0.025$. Vì $0.0107 < 0.025$, từ chối $H_0$: có bằng chứng cho thấy trung vị không phải là $5$.

Explore · ⁨Khám phá⁩

Non-parametric test chooser · ⁨Công cụ chọn kiểm định phi tham số⁩

Choose the rank-based test that matches the data situation. · ⁨Chọn kiểm định dựa trên thứ hạng phù hợp với tình huống dữ liệu.⁩

Vocabulary · ⁨Từ vựng⁩ Train · ⁨Luyện tập⁩
English Tiếng Việt
sign test/saɪn test/ kiểm định dấu
Wilcoxon signed-rank test/ˈwɪlkɒksn saɪnd ræŋk test/ kiểm định Wilcoxon signed-rank
Wilcoxon rank-sum test/ˈwɪlkɒksn ræŋk sʌm test/ kiểm định Wilcoxon rank-sum
probability generating function/ˌprɒbəˈbɪlɪti ˈdʒenəreɪtɪŋ ˈfʌŋkʃn/ hàm sinh xác suất
Further Probability & Statistics/ˈfɜːðə ˌprɒbəˈbɪlɪti ænd stəˈtɪstɪks/ Xác suất & Thống kê Nâng cao
4.5

Probability generating functions · ⁨Hàm sinh xác suất⁩

Syllabus · ⁨Chương trình⁩
English
Candidates should be able to: Notes and examples
understand the concept of a probability generating function (PGF) and construct and use the PGF for given distributions Including the discrete uniform, binomial, geometric and Poisson distributions.
use formulae for the mean and variance of a discrete random variable in terms of its PGF, and use these formulae to calculate the mean and variance of a given probability distribution
use the result that the PGF of the sum of independent random variables is the product of the PGFs of those random variables.
Tiếng Việt
thí sinh có khả năng: Ghi chú và ví dụ
hiểu khái niệm về hàm sinh xác suất (PGF) và xây dựng cũng như sử dụng PGF cho các phân phối đã cho Bao gồm các phân phối đều rời rạc, nhị thức, hình học và Poisson.
sử dụng các công thức cho kỳ vọng và phương sai của biến ngẫu nhiên rời rạc theo PGF, và áp dụng các công thức này để tính kỳ vọng và phương sai của một phân phối xác suất đã cho
sử dụng kết quả rằng PGF của tổng các biến ngẫu nhiên độc lập là tích của các PGF của những biến ngẫu nhiên đó.

Source: Cambridge International syllabus · ⁨Nguồn: Chương trình Cambridge International⁩

English

The probability generating function 概率母函数 of a discrete variable $X$ is

$$G(t) = E(t^X) = \sum_x P(X = x)\,t^x.$$
It packs the whole distribution into one function. The mean and variance come from its derivatives at $t = 1$: $E(X) = G'(1)$ and $\mathrm{Var}(X) = G''(1) + G'(1) - \big(G'(1)\big)^2$. Also, the PGF of a sum of independent variables is the product of their PGFs.

Worked example. $X$ has $P(X=0) = 0.5$, $P(X=1) = 0.3$, $P(X=2) = 0.2$. Find $E(X)$ using the PGF.

Here $G(t) = 0.5 + 0.3t + 0.2t^2$, so $G'(t) = 0.3 + 0.4t$ and

$$E(X) = G'(1) = 0.3 + 0.4 = 0.7.$$

Tiếng Việt
Sự kết hợp đa dạng của các xúc xắc đa diện
Xúc xắc: điểm bắt đầu cho xác suất và biến ngẫu nhiên rời rạc.

Hàm sinh xác suất của biến rời rạc $X$ là

$$G(t) = E(t^X) = \sum_x P(X = x)\,t^x.$$
Nó nén toàn bộ phân phối vào trong một hàm duy nhất. Trung bình và phương sai lấy từ đạo hàm của nó tại $t = 1$: $E(X) = G'(1)$ và $\mathrm{Var}(X) = G''(1) + G'(1) - \big(G'(1)\big)^2$. Ngoài ra, PGF của tổng các biến độc lập là tích các PGF của chúng.

Ví dụ minh họa. $X$ có $P(X=0) = 0.5$, $P(X=1) = 0.3$, $P(X=2) = 0.2$. Tìm $E(X)$ bằng cách sử dụng PGF.

Ở đây $G(t) = 0.5 + 0.3t + 0.2t^2$, nên $G'(t) = 0.3 + 0.4t$ và

$$E(X) = G'(1) = 0.3 + 0.4 = 0.7.$$

Hàm phát sinh xác suất của xúc xắc công bằng đóng gói các khối lượng bằng nhau tại 1 đến 6 vào G(t)
PGF của xúc xắc công bằng gom các khối lượng bằng nhau tại 1 đến 6 vào G(t)
Explore · ⁨Khám phá⁩

Probability generating function lab · ⁨Phòng thí nghiệm hàm sinh xác suất⁩

G(x) = p0 + p1 x + p2 x^2 + ...

Change x and see how a PGF stores probabilities in powers of x. · ⁨Thay đổi x và xem cách một PGF lưu trữ xác suất theo lũy thừa của x.⁩

4.5

Exam tips · ⁨Mẹo làm bài thi⁩

English
  • For a continuous random variable, the pdf integrates to $1$ over its range, and $E(X) = \int x f(x)\,dx$.
  • Use the $t$-distribution when the sample is small and the population variance is unknown; state the degrees of freedom.
  • For a chi-squared test compute $\sum (O-E)^2/E$, compare with the critical value at the right degrees of freedom, and combine classes with $E < 5$.
  • State $H_0$ and $H_1$ and give the conclusion in context for every test.
Tiếng Việt
  • Đối với biến ngẫu nhiên liên tục, pdf tích phân theo $1$ trên miền xác định, và $E(X) = \int x f(x)\,dx$.
  • Sử dụng phân phối $t$ khi mẫu nhỏ và phương sai tổng thể chưa biết; nêu rõ bậc tự do.
  • Đối với kiểm định chi-squared, tính $\sum (O-E)^2/E$, so sánh với giá trị tới hạn ở bậc tự do tương ứng, và gộp các lớp có $E < 5$.
  • Nêu $H_0$ và $H_1$ và đưa ra kết luận trong ngữ cảnh cho mỗi bài kiểm định.

Interactive lessons on this topic · ⁨Bài học tương tác về chủ đề này⁩

Work through it step by step, with instant-check exercises. · ⁨Làm theo từng bước, kèm theo bài tập kiểm tra ngay lập tức.⁩

Past Papers · ⁨Đề thi cũ⁩

More topics in A-Level Further Mathematics · ⁨Toán nâng cao A-Level⁩ · ⁨Nhiều chủ đề hơn trong A-Level Further Mathematics · ⁨Toán nâng cao A-Level⁩⁩

Log in or create account · ⁨Đăng nhập hoặc tạo tài khoản⁩

IGCSE, A-Level & AP