Mục lục khoá họcĐang ở M3-07
← Khoá Math
0/46 bài đã học xong
Xử lý số liệu · Bài M3-07 · Bài 7/10 của chương · bài 35/46 của Toán

Scatterplots and Lines of Best Fit

Scatterplot, đường khớp nhất và dự đoán

Học xong bài này bạn làm được gì
Đọc được một đường khớp nhất như đọc một câu tiếng Anh: hệ số góc nói mỗi đơn vị của $x$ thì $y$ được dự đoán đổi bao nhiêu, hệ số tự do nói giá trị dự đoán khi $x=0$ — kèm đúng đơn vị, kể cả khi đề đổi đơn vị giữa chừng. Dự đoán được cả hai chiều: cho $x$ tìm $y$, và cho $y$ tìm $x$; đồng thời biết khi nào một dự đoán nằm ngoài vùng dữ liệu nên không đáng tin. Tính và đọc được dấu của phần dư. Và quan trọng nhất: phân biệt kết luận nào được phép rút ra từ một biểu đồ phân tán và kết luận nào không.

Bài này gỡ cho bạn chuyện gì

Đây là chỗ mất điểm nhiều nhất của học sinh Việt Nam ở nhóm Xử lý số liệu, vì chương trình phổ thông không dạy. Học thuộc hai câu này là gỡ được cả nhóm:

Chỉ quan sát thì chỉ được nói "có liên hệ". Muốn nói "gây ra" thì phải có phân nhóm ngẫu nhiên. Muốn nói về cả tổng thể thì phải có mẫu ngẫu nhiên.

Và một chi tiết nhỏ mà đề khai thác liên tục: đơn vị của trục hầu như luôn khác đơn vị trong câu hỏi — gam với kilôgam, tháng với năm, nghìn người với người.

Cần nắm trước khi vào bài

Thuật ngữ của bài — cầm sẵn rồi hãy đọc

Thuật ngữ trong đềTiếng ViệtNhớ thế này
scatterplotbiểu đồ tán xạmỗi chấm là một cá thể, hai thuộc tính
line of best fitđường khớp nhấtđường dự đoán, không đi qua mọi điểm
predicted valuegiá trị dự đoán$\hat y$ — luôn dùng chữ predicted
residualphần dưthực tế trừ dự đoán
interpolationnội suydự đoán trong vùng dữ liệu — đáng tin
extrapolationngoại suydự đoán ngoài vùng dữ liệu — kém tin cậy
associationliên hệmức kết luận của nghiên cứu quan sát
causationnhân quảchỉ nói được khi có phân nhóm ngẫu nhiên
observational studynghiên cứu quan sátchỉ ghi lại điều đang xảy ra

What a line of best fit is — and is not

A scatterplot shows one point for each individual in a data set. The line of best fit is the straight line that comes closest to those points overall; it is a model, not a rule the data obeys. Almost no point lies exactly on it, and that is expected.

61116212631Subscribers (thousands)Years since 2010012345678910
Ví dụ mẫu

For the scatterplot above, the line of best fit is $\hat y=8.5+2.4x$, where $x$ is the number of years since $2010$ and $\hat y$ is the predicted number of subscribers, in thousands. Interpret both numbers.

Thử tự làm ra giấy trước đã.
Giải thích tiếng Việt

Đơn vị của hệ số góc luôn là “đơn vị của $y$ trên mỗi đơn vị của $x$”. Ở nhóm Xử lý số liệu, câu hỏi hay nhất không phải “hệ số góc bằng bao nhiêu” mà “hệ số góc nghĩa là gì” — và bốn phương án thường chỉ khác nhau ở đơn vị hoặc ở chỗ đảo vai trò $x$ với $y$. Đọc kỹ trục trước khi đọc phương án.

Predicting inside the data, and outside it

Substituting a value of $x$ gives a predicted $y$; solving the equation for $x$ works just as well in the other direction.

Ví dụ mẫu

A line of best fit passes through the points $(2,15)$ and $(10,39)$ on a scatterplot. Write its equation, then predict $y$ when $x=15$.

Thử tự làm ra giấy trước đã.
Ví dụ mẫu

Using the same model $\hat y=9+3x$, for what value of $x$ does the model predict $y=60$? The scatterplot's data covered $x$ from $1$ to $12$ only. Comment on the prediction.

Thử tự làm ra giấy trước đã.
Giải thích tiếng Việt

Dự đoán trong vùng dữ liệu gọi là nội suy, dự đoán ngoài vùng dữ liệu gọi là ngoại suy. Đề SAT rất hay hỏi “vì sao dự đoán này có thể không đáng tin” và đáp án đúng gần như luôn là “giá trị $x$ nằm ngoài khoảng dữ liệu đã dùng để dựng đường thẳng”. Các phương án nhiễu thường nói về độ dốc hoặc về việc đường thẳng không đi qua mọi điểm — đúng nhưng không phải lý do.

Units, and the two-step slope question

The slope is stated in the units of the axes; the question is often asked in different units. Convert after using the model, never before.

Ví dụ mẫu

A scatterplot shows a subscription's cost $y$, in dollars, against time $x$, in months, and the line of best fit has slope $3$. According to the model, by how many dollars does the cost increase over $4$ years?

Thử tự làm ra giấy trước đã.
Lỗi thường gặp

Nhân hệ số góc với $4$ vì đề nói “4 năm” trong khi trục $x$ tính bằng tháng. Ở nhóm này, đề gần như luôn cố tình cho đơn vị trục khác đơn vị câu hỏi — gam với kilôgam, giây với phút, tháng với năm. Ghi rõ đơn vị của trục ra bên cạnh trước khi tính.

Residuals

For a data point $(x,y)$, the residual is \[ \text{residual}=\text{actual }y-\text{predicted }\hat y . \]

Residual $>0$: the point lies above the line (the model under-predicts). Residual $<0$: the point lies below the line (the model over-predicts). Residual $=0$: the point is exactly on the line.

Ví dụ mẫu

For the model $\hat y=8.5+2.4x$ of the first section, the data point at $x=7$ has an actual value of $27.1$ thousand subscribers. Find the residual and say what it means.

Thử tự làm ra giấy trước đã.
Lỗi thường gặp

Tính ngược thành “dự đoán trừ thực tế”. Dấu sẽ lật, và câu hỏi “điểm nằm trên hay dưới đường thẳng” sẽ trả lời sai. Thứ tự đúng là thực tế trừ dự đoán — đọc theo nghĩa “dữ liệu vượt mô hình bao nhiêu”.

What a scatterplot licenses you to conclude

A scatterplot shows that two quantities move together. It does not show why.

Ba thiết kế nghiên cứu, ba loại kết luận khác nhau
  • Observational study — the researcher only records what already happens. Conclusion allowed: an association between the two quantities, for the group studied. A cause-and-effect claim is not allowed.
  • Randomly selected sample — individuals are chosen at random from a population. Conclusion allowed: the finding may be generalised to that population.
  • Random assignment to treatment groups — the researcher decides who gets what. Conclusion allowed: a cause-and-effect claim, for the individuals in the study.

Random selection buys generalisation; random assignment buys causation. They are different words and they buy different things.

Ví dụ mẫu

Researchers recorded the weekly hours of exercise and the resting heart rate of $500$ adults who volunteered for a health screening. The scatterplot shows lower resting heart rates for adults who exercise more. Which conclusion is supported?

Thử tự làm ra giấy trước đã.
Giải thích tiếng Việt

Đây là chỗ mất điểm nhiều nhất của học sinh Việt Nam ở nhóm này, vì chương trình phổ thông không dạy. Học thuộc hai câu: chỉ quan sát thì chỉ được nói “có liên hệ”; phải có phân nhóm ngẫu nhiên mới được nói “gây ra”. Và một câu thứ ba: muốn suy rộng cho cả tổng thể thì mẫu phải được chọn ngẫu nhiên từ tổng thể đó — người tình nguyện không phải mẫu ngẫu nhiên.

When a line is the wrong model

A straight line encodes constant change per unit. Data that grow by a constant percentage per unit curve upward and need an exponential model $\hat y=a\,b^{x}$.

Ví dụ mẫu

At $x=0,1,2,3,4$ a quantity takes the values $5,\;15,\;45,\;135,\;405$. Is a linear or an exponential model appropriate?

Thử tự làm ra giấy trước đã.
Ví dụ mẫu

A quantity is modelled by $\hat y=40(1.15)^{x}$, where $x$ is measured in years. What percentage increase does the model predict from $x=0$ to $x=2$?

Thử tự làm ra giấy trước đã.
Giải thích tiếng Việt

Phần trăm cộng dồn không phải phép cộng. Tăng $15\%$ hai lần cho hệ số $1.15\times 1.15=1.3225$, tức $32.25\%$, chứ không phải $30\%$. Mọi câu “phần trăm của phần trăm” ở nhóm này đều xử lý bằng cách nhân các hệ số rồi trừ $1$.

Ba chỗ mất điểm của dạng này

Nhân hệ số góc với con số trong câu hỏi mà không xét đơn vị trục

Đề nói "sau 4 năm" trong khi trục $x$ tính bằng tháng. Ở nhóm này, đề gần như luôn cố tình cho đơn vị trục khác đơn vị câu hỏi. Đọc nhãn trục trước khi nhân.

Tính phần dư ngược chiều

Thứ tự đúng là thực tế trừ dự đoán. Đảo chiều thì dấu lật, và câu hỏi "điểm nằm trên hay dưới đường thẳng" trả lời sai.

Kết luận nhân quả từ một nghiên cứu quan sát

Thấy hai đại lượng đi cùng chiều rồi nói cái này gây ra cái kia. Nếu người nghiên cứu chỉ ghi lại những gì đã xảy ra thì kết luận duy nhất được phép là "có liên hệ", và chỉ trong nhóm đã khảo sát.

Tự kiểm tra — chữa ngay tại chỗ

Câu 1
For a scatterplot of years since $2010$ ($x$) against the number of subscribers in thousands ($y$), the line of best fit is $\hat y = 8.5 + 2.4x$. Which is the best interpretation of the number $2.4$ in this context?
  1. There were about $2{,}400$ subscribers in $2010$.
  2. The number of subscribers is predicted to increase by about $2{,}400$ each year.
  3. The number of subscribers increased by $2.4$ over the whole period.
  4. It takes about $2.4$ years to gain one thousand subscribers.
Chọn một phương án rồi bấm Kiểm tra.
Câu 2
For the line of best fit $\hat y = 8.5 + 2.4x$ described above, one data point on the scatterplot is $(5,\ 24)$. What is the residual for this data point?
Gõ đáp số rồi bấm Kiểm tra.
Câu 3
A researcher records the number of hours of sleep and the test scores of $200$ students who volunteered for the study, and finds a positive association between the two. Which conclusion is most appropriate?
  1. Getting more sleep causes students to earn higher test scores.
  2. Among the students studied, there is an association between hours of sleep and test scores.
  3. The results can be generalized to all students in the country.
  4. Earning higher test scores causes students to sleep more.
Chọn một phương án rồi bấm Kiểm tra.

Tóm tắt bỏ túi

  • Đường khớp nhất cho giá trị dự đoán, không cho số liệu thật. Luôn dùng chữ predicted.
  • Viết đơn vị của hệ số góc ra lề trước khi đọc phương án: đơn vị $y$ trên mỗi đơn vị $x$.
  • Đơn vị trục hầu như luôn khác đơn vị câu hỏi — đọc nhãn trục trước khi nhân.
  • Phần dư $=$ thực tế $-$ dự đoán. Dương → điểm trên đường, mô hình dự đoán thiếu.
  • Nội suy (trong vùng dữ liệu) đáng tin; ngoại suy (ngoài vùng) kém tin cậy — đây là lý do chuẩn cho câu "vì sao dự đoán này có thể không đáng tin".
  • Quan sát → chỉ nói "có liên hệ". Phân nhóm ngẫu nhiên → mới nói "gây ra". Mẫu ngẫu nhiên → mới nói về tổng thể.
  • Các điểm cong theo một chiều rõ rệt quanh đường thẳng $\Rightarrow$ mô hình tuyến tính là sai mô hình.

Làm bài tập của bài này

Bộ M3-07 — 18 câu, chấm ngay trên máy, có đáp án từng câu. Vài câu đầu ở mức nền tảng để chắc tay, phần còn lại từ mức đề thật trở lên.

4 dễ7 khó7 rất khó