Mục lục bài họcĐang ở d07-b3
Two-Sample t Intervals and Reading t Output
The interval for a difference in means
With two independent random samples, the confidence interval for $\mu_1-\mu_2$ is
$$(\bar x_1-\bar x_2)\pm t^*\sqrt{\frac{s_1^2}{n_1}+\frac{s_2^2}{n_2}}$$Conditions: both samples random; independent of each other; each population normal or each sample size at least $30$ (check a dotplot of each sample for strong skew or outliers when $n$ is small); and the $10\%$ condition for each. AP Statistics does not pool the two variances — the formula above is the only one used.
Which degrees of freedom?
Technology computes a fractional $df$ (the Welch formula), typically between $\min(n_1-1,n_2-1)$ and $n_1+n_2-2$. By hand, the conservative choice is $df=\min(n_1-1,\,n_2-1)$: it gives a slightly larger $t^*$ and a slightly wider interval, which is acceptable on the exam as long as you state it. Never use $df=n_1+n_2-2$; that belongs to the pooled procedure.
Reading output and interpreting
Calculator or software output lists the difference, the standard error, $df$, and either an interval or a $t$ with its P-value. Example: $n_1=25$, $\bar x_1=72$, $s_1=8$; $n_2=30$, $\bar x_2=66$, $s_2=10$. The standard error is $\sqrt{64/25+100/30}=\sqrt{5{,}89}\approx2{,}43$; with $df=24$, $t^*=2{,}064$ for $95\%$, giving $6\pm5{,}0$, or $(1{,}0;\,11{,}0)$. Interpretation: "we are $95\%$ confident that the true mean of group 1 exceeds that of group 2 by between $1{,}0$ and $11{,}0$ units". An interval that excludes $0$ is evidence of a difference; one that includes $0$ is not.
Khoảng tin cậy cho $\mu_1-\mu_2$ với hai mẫu ngẫu nhiên độc lập: $(\bar x_1-\bar x_2)\pm t^*\sqrt{\dfrac{s_1^2}{n_1}+\dfrac{s_2^2}{n_2}}$. Điều kiện: hai mẫu ngẫu nhiên, độc lập nhau; mỗi tổng thể chuẩn hoặc mỗi mẫu $\ge30$ (mẫu nhỏ thì vẽ dotplot từng mẫu để xem lệch mạnh hay ngoại lai); điều kiện $10\%$ cho từng mẫu. AP không gộp phương sai — chỉ có một công thức trên.
Bậc tự do: máy tính cho $df$ lẻ (công thức Welch), nằm giữa $\min(n_1-1,n_2-1)$ và $n_1+n_2-2$. Làm tay thì chọn bảo thủ $df=\min(n_1-1,n_2-1)$: $t^*$ hơi lớn, khoảng hơi rộng, được chấp nhận miễn là ghi rõ. Không dùng $n_1+n_2-2$ vì đó là của thủ tục gộp.
Đọc kết xuất và diễn giải: bảng in hiệu, sai số chuẩn, $df$, rồi khoảng hoặc $t$ kèm giá trị $P$. Ví dụ $n_1=25$, $\bar x_1=72$, $s_1=8$; $n_2=30$, $\bar x_2=66$, $s_2=10$: sai số chuẩn $\sqrt{64/25+100/30}\approx2{,}43$; $df=24$, $t^*=2{,}064$; khoảng $6\pm5{,}0=(1{,}0;\,11{,}0)$. Diễn giải: "tin cậy $95\%$ rằng trung bình thật nhóm 1 cao hơn nhóm 2 từ $1{,}0$ đến $11{,}0$ đơn vị". Khoảng không chứa $0$ là bằng chứng có khác biệt.
Một trường thử hai phương pháp ôn tập. Nhóm A ($n=25$, phân nhóm ngẫu nhiên) có điểm trung bình $72$, độ lệch chuẩn $8$; nhóm B ($n=30$) có trung bình $66$, độ lệch chuẩn $10$. Dotplot hai nhóm gần đối xứng, không ngoại lai. Dựng khoảng tin cậy $95\%$ cho $\mu_A-\mu_B$ và cho biết có bằng chứng hai phương pháp khác nhau không.
Nêu: $\mu_A-\mu_B$ là hiệu điểm trung bình thật của hai phương pháp; ước lượng bằng khoảng $t$ hai mẫu $95\%$.
Kiểm: phân nhóm ngẫu nhiên nên hai nhóm độc lập; $n_A=25$ và $n_B=30$: nhóm A dưới $30$ nhưng dotplot gần đối xứng, không ngoại lai, nên dùng $t$ được; nhóm B $\ge30$.
Tính: sai số chuẩn $\sqrt{\dfrac{8^2}{25}+\dfrac{10^2}{30}}=\sqrt{2{,}56+3{,}33}\approx2{,}43$. Bảo thủ $df=\min(24,29)=24$, $t^*=2{,}064$.
$$(72-66)\pm2{,}064\cdot2{,}43=6\pm5{,}0\ \Rightarrow\ (1{,}0;\,11{,}0)$$Kết luận: tin cậy $95\%$ rằng phương pháp A cho điểm trung bình thật cao hơn B từ $1{,}0$ đến $11{,}0$ điểm. Khoảng không chứa $0$ nên có bằng chứng thuyết phục hai phương pháp khác nhau; vì có phân nhóm ngẫu nhiên, khác biệt này có thể quy cho phương pháp.
Đọc xong rồi — làm thử ngay
Bài tập của chương Unit 7 — Inference for Quantitative Data: Means gồm 14 câu trắc nghiệm và 3 đề tự luận. Đáp án hiện ngay khi chọn, miễn phí.