기출 해설기본 개념 잡기 › 통계

통계 — 기본 개념 잡기

기본 개념 27개 · 교과서 흐름 순 · 개념마다 정의·공식·예시와 기출 해설 연결
확률과 통계(선택) · 먼저 볼 단원: 확률

이 개념이 왜 생겼나 — 국가를 운영하고 측정 오차를 다루기 위해서다. 통계(statistics)라는 이름부터가 국가(state)의 인구·세금·병력을 조사해 기록하던 일에서 왔다. 한편 18~19세기 천문학자들은 같은 별을 여러 번 관측해도 값이 조금씩 다르다는 문제와 싸웠는데, 가우스는 이 오차가 참값 주위에 종 모양으로 흩어진다는 사실에서 정규분포를 끌어냈고, 라플라스는 이를 확률론과 결합했다. 흩어진 자료에서 참값을 읽어 내는 학문이 이렇게 시작됐다.

지금 어디에 쓰이나 — 일부를 보고 전체를 말하는 모든 곳에서다. 여론조사는 유권자 천여 명의 응답으로 전체의 지지율을 추정하고, 그때 함께 발표되는 '오차범위'가 바로 신뢰구간이다. 공장의 품질 검사는 제품 몇 개를 뽑아 전체 불량률을 판단하고, 신약의 임상시험은 수백 명의 결과로 약효를 판정한다. 키·성적·측정값처럼 평균 주위에 몰리는 자료는 정규분포로 다뤄지고, AI가 데이터에서 규칙을 배우는 과정도 통계적 추정의 한 형태다.

수능은 무엇을 묻나 — 확률변수의 평균·분산 계산, 정규분포를 표준화해 표에서 확률을 읽는 일, 그리고 표본평균의 분포와 모평균의 신뢰구간이다. 아래 개념들을 순서대로 읽으면 이에 대한 대비를 갖출 수 있다.

확률변수와 이산확률변수의 확률분포

확률변수

최근 5개년 직접 출제 없음
시행의 결과에 따라 값이 정해지는 변수 — 표본공간의 각 원소에 하나의 실수를 대응시키는 함수를 확률변수라 한다. 확률변수가 가질 수 있는 값이 유한개이거나 셀 수 있으면 이산확률변수라 한다.
예시동전 2개를 던져 나오는 앞면의 개수 $X$ 는 $0,\,1,\,2$ 의 값을 갖는 이산확률변수

이산확률변수의 확률분포

기출 3회
이산확률변수 $X$ 가 갖는 각 값 $x_{i}$ 에 그 확률 $p_{i}=P(X=x_{i})$ 를 대응시킨 것. 표로 나타낸 것이 확률분포표이고, 모든 확률의 합은 반드시 1이다 — 미지의 확률이 있으면 이 조건으로 먼저 구한다.
$p_{i}\ge 0$, $\ p_{1}+p_{2}+\cdots+p_{n}=1$
예시동전 2개의 앞면 개수 $X$: $P(X=0)=\dfrac{1}{4}$, $P(X=1)=\dfrac{1}{2}$, $P(X=2)=\dfrac{1}{4}$

이산확률변수의 평균

기출 2회
확률변수 $X$가 갖는 각 값에 그 확률을 곱해 모두 더한 것을 $X$의 평균 $E(X)$라 한다. 시행을 아주 많이 반복했을 때 $X$의 값이 평균적으로 어디에 놓이는가를 나타낸다.
$E(X)=x_{1}p_{1}+x_{2}p_{2}+\cdots+x_{n}p_{n}$
예시동전 2개의 앞면 개수 $X$의 평균은 $0\times\dfrac{1}{4}+1\times\dfrac{1}{2}+2\times\dfrac{1}{4}=1$
이 개념이 쓰인 기출 — 눌러서 해설 보기2025 9월 모평 확률과 통계 27번2026 9월 모평 확률과 통계 27번

이산확률변수의 분산과 표준편차

기출 5회
분산 $V(X)$는 $X$가 평균 $m$에서 흩어진 정도로, 편차의 제곱의 평균이다. 계산할 때는 $E(X^{2})-\{E(X)\}^{2}$ 꼴이 빠르다. 분산의 양의 제곱근이 표준편차 $\sigma(X)$다.
$V(X)=E((X-m)^{2})=E(X^{2})-\{E(X)\}^{2}$, $\ \sigma(X)=\sqrt{V(X)}$
예시동전 2개의 앞면 개수 $X$: $E(X^{2})=0+\dfrac{1}{2}+4\times\dfrac{1}{4}=\dfrac{3}{2}$ 이므로 $V(X)=\dfrac{3}{2}-1^{2}=\dfrac{1}{2}$

확률변수 aX+b의 평균과 분산

기출 4회
확률변수를 $a$ 배 하고 $b$ 를 더하면 평균은 그대로 따라가지만, 분산은 더한 상수 $b$ 의 영향을 받지 않고 $a^{2}$ 배가 된다. 표준화가 이 성질 위에 서 있다.
$E(aX+b)=aE(X)+b$, $\ V(aX+b)=a^{2}V(X)$, $\ \sigma(aX+b)=|a|\,\sigma(X)$
예시$E(X)=1,\ V(X)=\dfrac{1}{2}$ 이면 $E(2X+3)=5$, $V(2X+3)=4\times\dfrac{1}{2}=2$

이항분포

이항분포

기출 2회
한 번의 시행에서 사건이 일어날 확률이 $p$ 인 독립시행을 $n$ 회 반복할 때, 그 사건이 일어나는 횟수 $X$ 의 확률분포를 이항분포라 하고 $\mathrm{B}(n,\,p)$ 로 나타낸다. 각 확률이 독립시행의 확률 공식으로 주어진다.
$P(X=r)={}_{n}\mathrm{C}_{r}\,p^{r}(1-p)^{n-r}$ $(r=0,\,1,\,\cdots,\,n)$
예시주사위를 3번 던져 6의 눈이 나오는 횟수 $X$ 는 $\mathrm{B}\!\left(3,\,\dfrac{1}{6}\right)$ 을 따르고 $P(X=1)={}_{3}\mathrm{C}_{1}\cdot\dfrac{1}{6}\cdot\left(\dfrac{5}{6}\right)^{2}=\dfrac{25}{72}$
이 개념이 쓰인 기출 — 눌러서 해설 보기2022 9월 모평 확률과 통계 23번2024 9월 모평 확률과 통계 23번

이항분포의 평균과 분산

기출 4회
$X$ 가 이항분포 $\mathrm{B}(n,\,p)$ 를 따르면 평균은 $np$, 분산은 $np(1-p)$ 다. 정의대로 합을 계산할 필요 없이 이 공식으로 바로 얻는다.
$E(X)=np$, $\ V(X)=np(1-p)$, $\ \sigma(X)=\sqrt{np(1-p)}$
예시$\mathrm{B}\!\left(100,\,\dfrac{1}{2}\right)$ 이면 $E(X)=50$, $V(X)=25$, $\sigma(X)=5$

큰 수의 법칙

최근 5개년 직접 출제 없음
한 번의 시행에서 사건이 일어날 확률이 $p$ 일 때, 시행 횟수 $n$ 이 커질수록 상대도수 $\dfrac{X}{n}$ 이 $p$ 에 가까워질 가능성이 1에 가까워진다는 법칙. 통계적 확률을 수학적 확률처럼 다룰 수 있는 근거이며, 보험료 산정처럼 많은 사례를 모으는 일이 성립하는 이유다.
예시동전을 10번 던지면 앞면의 비율이 $\dfrac{1}{2}$ 에서 꽤 벗어날 수 있지만, 10000번 던지면 $\dfrac{1}{2}$ 에 매우 가까워진다

연속확률변수와 확률밀도함수

연속확률변수

기출 1회
키·시간·무게처럼 어떤 범위의 모든 실수 값을 가질 수 있는 확률변수. 특정한 한 값을 가질 확률은 0이므로 $P(X=a)=0$ 이고, 따라서 확률을 구할 때 등호가 있든 없든 결과가 같다.
이 개념이 쓰인 기출 — 눌러서 해설 보기2023 수능 확률과 통계 28번

확률밀도함수

기출 1회
연속확률변수 $X$ 의 확률을 넓이로 나타내는 함수 $f(x)$. 함숫값은 0 이상이고, 그래프와 $x$축 사이의 전체 넓이는 1이며, $P(a\le X\le b)$ 는 구간 $[a,\,b]$ 에서 그래프와 $x$축 사이의 넓이다.
$f(x)\ge 0$, 전체 넓이 $=1$, $\ P(a\le X\le b)=$ 구간 $[a,\,b]$ 의 넓이
예시$0\le x\le 2$ 에서 $f(x)=\dfrac{1}{2}$ 이면 전체 넓이는 $2\times\dfrac{1}{2}=1$ 이고 $P(0\le X\le 1)=\dfrac{1}{2}$
이 개념이 쓰인 기출 — 눌러서 해설 보기2023 수능 확률과 통계 28번

정규분포

정규분포

기출 1회
평균 $m$, 표준편차 $\sigma$ 에 의해 정해지는 종 모양의 연속확률분포로, $\mathrm{N}(m,\,\sigma^{2})$ 으로 나타낸다. 측정 오차, 키, 성적처럼 평균 주위에 대칭으로 몰리는 자연·사회 현상의 표준 모형이다.
확률밀도함수 $f(x)=\dfrac{1}{\sigma\sqrt{2\pi}}\,e^{-\frac{(x-m)^{2}}{2\sigma^{2}}}$
이 개념이 쓰인 기출 — 눌러서 해설 보기2024 9월 모평 확률과 통계 26번

정규분포 곡선의 성질

기출 4회
정규분포 곡선은 직선 $x=m$ 에 대하여 대칭인 종 모양이고, $x=m$ 에서 최댓값을 가지며, 곡선과 $x$축 사이의 전체 넓이는 1이다. $\sigma$ 가 클수록 낮고 넓게 퍼지고, $\sigma$ 가 작을수록 높고 뾰족해진다 — $m$ 은 위치를, $\sigma$ 는 퍼짐을 정한다.
예시대칭성에 의해 $P(X\le m)=P(X\ge m)=0.5$

표준정규분포

기출 2회
평균 0, 표준편차 1인 정규분포 $\mathrm{N}(0,\,1)$. 이 분포를 따르는 확률변수는 보통 $Z$ 로 쓰고, $P(0\le Z\le z)$ 의 값이 표준정규분포표로 주어진다. 모든 정규분포의 확률 계산이 이 표 하나로 귀결된다.
예시표준정규분포표에서 $P(0\le Z\le 1)=0.3413$, 대칭성에 의해 $P(-1\le Z\le 1)=0.6826$
이 개념이 쓰인 기출 — 눌러서 해설 보기2024 9월 모평 확률과 통계 26번2024 수능 확률과 통계 30번

정규분포의 표준화

기출 7회
$X$ 가 $\mathrm{N}(m,\,\sigma^{2})$ 을 따를 때 $Z=\dfrac{X-m}{\sigma}$ 으로 놓으면 $Z$ 는 표준정규분포 $\mathrm{N}(0,\,1)$ 을 따른다. 평균을 빼서 중심을 0으로 옮기고 표준편차로 나눠 퍼짐을 1로 맞추는 것으로, 어떤 정규분포의 확률도 표준정규분포표에서 읽을 수 있게 된다.
$Z=\dfrac{X-m}{\sigma}$
예시$X$ 가 $\mathrm{N}(70,\,10^{2})$ 을 따르면 $P(70\le X\le 80)=P(0\le Z\le 1)=0.3413$

이항분포의 정규분포 근사

기출 3회
$X$ 가 이항분포 $\mathrm{B}(n,\,p)$ 를 따르고 $n$ 이 충분히 크면, $X$ 는 근사적으로 정규분포 $\mathrm{N}(np,\,np(1-p))$ 를 따른다. 항이 너무 많아 직접 더할 수 없는 이항분포의 확률을 표준화해 표로 구하게 해 준다.
$n$ 이 충분히 클 때 $\mathrm{B}(n,\,p)\ \approx\ \mathrm{N}(np,\,np(1-p))$
예시동전 100번의 앞면 횟수 $X$ 는 $\mathrm{B}\!\left(100,\,\dfrac{1}{2}\right)$ → 근사적으로 $\mathrm{N}(50,\,5^{2})$

통계적 추정

모집단과 표본

최근 5개년 직접 출제 없음
조사의 대상 전체의 집합을 모집단, 조사를 위해 모집단에서 뽑은 일부를 표본이라 하고, 표본의 원소의 개수를 표본의 크기라 한다. 전체를 조사하는 것이 전수조사, 표본만 조사해 전체를 추측하는 것이 표본조사다.
예시전국 유권자 전체가 모집단, 여론조사에 응답한 1000명이 크기 1000인 표본

임의추출

기출 1회
모집단의 각 원소가 뽑힐 확률이 모두 같도록 표본을 뽑는 방법. 뽑은 것을 되돌려 놓고 다시 뽑으면 복원추출, 되돌려 놓지 않으면 비복원추출이며, 표본평균의 분포는 복원추출을 전제로 한다.
이 개념이 쓰인 기출 — 눌러서 해설 보기2023 9월 모평 확률과 통계 29번

모평균과 모분산

기출 1회
모집단 전체의 분포가 갖는 평균·분산·표준편차를 각각 모평균 $m$, 모분산 $\sigma^{2}$, 모표준편차 $\sigma$ 라 한다. 통계적 추정은 표본에서 계산한 값으로 이 모수들을 추측하는 일이다.
이 개념이 쓰인 기출 — 눌러서 해설 보기2025 수능 확률과 통계 27번

표본평균

기출 2회
모집단에서 임의추출한 크기 $n$ 의 표본 $X_{1},\,X_{2},\,\cdots,\,X_{n}$ 의 평균을 표본평균 $\overline{X}$ 라 한다. 어떤 표본이 뽑히느냐에 따라 값이 달라지므로 $\overline{X}$ 자체가 하나의 확률변수다.
$\overline{X}=\dfrac{X_{1}+X_{2}+\cdots+X_{n}}{n}$
이 개념이 쓰인 기출 — 눌러서 해설 보기2023 9월 모평 확률과 통계 29번2024 9월 모평 확률과 통계 28번

표본평균의 평균과 분산

기출 1회
표본평균 $\overline{X}$ 의 평균은 모평균과 같고, 분산은 모분산을 표본의 크기로 나눈 것이다. 표본을 크게 뽑을수록 $\overline{X}$ 가 모평균 가까이에 몰린다는 뜻이다.
$E(\overline{X})=m$, $\ V(\overline{X})=\dfrac{\sigma^{2}}{n}$, $\ \sigma(\overline{X})=\dfrac{\sigma}{\sqrt{n}}$
예시$m=50,\ \sigma=10$ 인 모집단에서 크기 25인 표본을 뽑으면 $E(\overline{X})=50$, $\sigma(\overline{X})=\dfrac{10}{5}=2$
이 개념이 쓰인 기출 — 눌러서 해설 보기2025 수능 확률과 통계 27번

표본평균의 분포

기출 2회
모집단이 정규분포 $\mathrm{N}(m,\,\sigma^{2})$ 을 따르면 표본평균 $\overline{X}$ 는 정규분포 $\mathrm{N}\!\left(m,\,\dfrac{\sigma^{2}}{n}\right)$ 을 따른다. 모집단이 정규분포가 아니어도 표본의 크기 $n$ 이 충분히 크면 근사적으로 이 정규분포를 따른다.
$\overline{X}\ \sim\ \mathrm{N}\!\left(m,\,\dfrac{\sigma^{2}}{n}\right)$
예시$\mathrm{N}(50,\,10^{2})$ 인 모집단에서 크기 25인 표본의 $\overline{X}$ 는 $\mathrm{N}(50,\,2^{2})$ 을 따른다
이 개념이 쓰인 기출 — 눌러서 해설 보기2022 9월 모평 확률과 통계 27번2025 9월 모평 확률과 통계 26번

모평균의 추정

기출 6회
표본평균의 값으로 모평균이 있을 만한 범위를 구하는 것. 표본평균의 분포가 정규분포임을 이용해, 모평균이 표본평균에서 일정 거리 안에 있다고 일정한 신뢰도로 말한다.
예시표본 1000명의 평균 지지율로 전체 유권자의 지지율 범위를 '신뢰도 95%'와 함께 발표하는 것

신뢰구간

기출 5회
모평균 $m$ 이 속할 것으로 기대되는 구간을 신뢰도와 함께 나타낸 것. 표본평균이 $\overline{x}$ 일 때 신뢰도 95%는 $1.96$, 99%는 $2.58$ 을 쓴다. 구간의 길이는 신뢰도가 높을수록, 표본이 작을수록 길어진다.
신뢰도 95% : $\overline{x}-1.96\dfrac{\sigma}{\sqrt{n}}\le m\le \overline{x}+1.96\dfrac{\sigma}{\sqrt{n}}$ (99%는 $1.96$ 대신 $2.58$), 구간의 길이는 $2\times 1.96\dfrac{\sigma}{\sqrt{n}}$
예시$\overline{x}=100,\ \sigma=10,\ n=25$ 이면 신뢰도 95% 신뢰구간은 $100\pm 1.96\times 2$, 즉 $96.08\le m\le 103.92$

함께 쓰이는 다른 단원·기초 개념

수학적 확률

기출 1회
근원사건이 일어날 가능성이 모두 같을 때, 사건 $A$ 의 확률은 전체 경우의 수에 대한 $A$ 의 경우의 수의 비율이다. 확률분포표의 각 확률이 이 셈으로 채워진다.
$P(A)=\dfrac{n(A)}{n(S)}$
이 개념이 쓰인 기출 — 눌러서 해설 보기2026 9월 모평 확률과 통계 29번

확률의 곱셈정리

기출 1회
두 사건이 잇달아 일어날 확률은 앞 사건의 확률에 조건부확률을 곱한 것이고, 두 사건이 독립이면 각 확률의 곱이다.
$P(A\cap B)=P(A)\,P(B\,|\,A)$, 독립이면 $P(A\cap B)=P(A)\,P(B)$
이 개념이 쓰인 기출 — 눌러서 해설 보기2024 9월 모평 확률과 통계 28번

독립시행의 확률

기출 3회
확률 $p$ 인 사건이 $n$ 회의 독립시행에서 꼭 $r$ 회 일어날 확률. 이항분포의 각 확률이 바로 이 식이다.
$P={}_{n}\mathrm{C}_{r}\,p^{r}(1-p)^{n-r}$

경우의 수

기출 1회
동시에 일어나지 않는 두 사건의 경우의 수는 더하고(합의 법칙), 잇달아 일어나는 사건은 곱한다(곱의 법칙). 확률분포표를 만들 때 각 값의 확률을 세는 바탕이다.
합의 법칙 $m+n$, 곱의 법칙 $m\times n$
이 개념이 쓰인 기출 — 눌러서 해설 보기2023 9월 모평 확률과 통계 29번