사전 표본
개념

표본

gabury1고친 사람 github-actions[bot]

표본은 전체를 다 재지 않고도 전체의 모습을 짐작하게 해 주는 일부입니다. 한 달 치 요청 전부를 보는 대신 천 건만 골라 응답 시간을 재는 식입니다. 고르게 뽑은 일부는 전체를 닮아서 적은 비용으로 전체를 알려 줍니다. 신호 처리에서도 같은 이름을 씁니다. 이 항목은 통계에서 쓰는 뜻을 다룹니다.

쉽고 빠른 이해

표본은 전체를 다 보지 않고도 전체를 짐작하게 해 주는 일부입니다. 한 달 동안 들어온 요청 가운데 천 건만 골라 응답 시간을 재면, 그 천 건의 평균으로 한 달 치 전체의 평균을 짐작합니다.

전부 재는 일은 비싸거나 아예 할 수 없을 때가 많습니다. 다음 달 요청은 아직 들어오지 않아서 잴 수조차 없습니다. 이럴 때는 일부만 재고 전체를 짐작하는 길밖에 없습니다.

  1. 전체에서 골고루, 무작위로 일부를 뽑습니다
  2. 뽑은 것만 재서 평균 같은 수를 계산합니다
  3. 그 수로 전체의 값을 짐작합니다

대가는 짐작이 빗나갈 수 있다는 것입니다. 뽑을 때마다 결과가 조금씩 다릅니다. 한쪽으로 치우치게 뽑으면 아무리 많이 뽑아도 전체와 딴판인 답이 나옵니다.

상세

국을 끓이다 간을 볼 때 냄비를 다 마셔 보지 않습니다. 국을 잘 저은 다음 한 숟가락만 떠서 맛을 봅니다. 그 한 숟가락으로 냄비 전체의 간을 압니다.

알고 싶은 대상 전체를 모집단이라고 부릅니다. 표본은 그 모집단에서 뽑아 낸 일부입니다. 한 달 동안 들어온 요청 전부가 모집단이면, 그중 골라 낸 천 건이 표본입니다.

표본은 값 하나가 아니라 뽑은 것들의 묶음입니다. 천 건을 뽑았으면 천 건 전체가 표본 하나입니다. 표본에 든 개수를 표본 크기라고 합니다. 흔히 n 으로 적습니다.

이 절은 먼저 왜 전체 대신 일부를 재는지 봅니다. 이어서 표본으로 계산한 수가 전체를 얼마나 잘 짐작하는지를 응답 시간 여덟 건으로 따라갑니다. 마지막으로 표본을 망치는 뽑는 방식과, 표본을 안 쓰는 편이 나은 때를 봅니다.

전체 대신 일부를 재는 이유

모집단을 전부 잴 수 있으면 표본이 필요 없습니다. 전부 재면 짐작할 것 없이 답이 바로 나옵니다. 표본은 전부 재기가 어려울 때 꺼내는 수단입니다.

전부 재기 어려운 까닭은 대개 넷 가운데 하나입니다.

까닭 예
너무 많다 초당 수만 건 들어오는 요청마다 상세한 기록을 남기면 저장하고 옮기는 비용이 감당 못 할 만큼 커집니다
아직 없다 다음 달 요청은 아직 안 들어왔습니다. 지금까지 들어온 요청을 표본 삼아 앞으로를 짐작합니다
재면 없어진다 부품이 얼마나 버티는지 알려면 부숴 봐야 합니다. 전부 부수면 팔 물건이 남지 않습니다
사람에게 물어야 한다 사용자 전원에게 설문을 돌릴 수 없어서 일부에게만 묻습니다

백엔드에서 만나는 표본은 대개 첫째 경우입니다. 그 예가 분산 추적 시스템입니다. 이 시스템은 여러 서버를 거치는 요청의 경로를 기록합니다. 그런데 요청 전부가 아니라 일부만 골라 기록을 남깁니다.

모집단에서 일부를 골라 내는 일은 샘플링이라고 부릅니다. 표본은 샘플링을 해서 얻은 결과물입니다.

표본으로 짐작하는 수

표본을 뽑는 목적은 모집단의 어떤 수를 알아내는 것입니다. 모집단 전체의 평균 응답 시간 같은 수입니다.

모집단 전체로 계산한 참값을 모수라고 부릅니다. 모집단 평균이 모수의 하나입니다. 모수는 모집단을 전부 재야 나오므로 대개 모르는 채로 남습니다.

표본으로 계산한 수는 통계량이라고 부릅니다. 표본 평균이 통계량의 하나입니다. 모수와 달리 통계량은 뽑은 것만 재면 바로 나옵니다.

flowchart TD
    A["모집단 · 요청 전부"] -->|"일부를 뽑는다"| B["표본 · 뽑은 천 건"]
    B -->|"계산한다"| C["통계량 · 표본 평균"]
    C -->|"짐작한다"| D["모수 · 모집단 평균"]
    A -.->|"전부 재야 갈 수 있다"| D

표본으로 하는 일은 그림의 실선을 따라 위에서 아래로 한 번 내려가는 것입니다. 모집단에서 모수로 바로 가는 점선은 전부 재야 지나갈 수 있습니다. 그 길이 막혀 있어서 표본을 거쳐 돌아갑니다.

실선의 마지막 화살표, 곧 통계량으로 모수를 짐작하는 일을 추정이라고 합니다. 뽑은 천 건의 평균으로 한 달 치 요청 전체의 평균을 짐작하는 것이 추정입니다.

뽑을 때마다 달라지는 답

같은 모집단에서 표본을 두 번 뽑으면 두 표본의 평균이 서로 다릅니다. 무엇이 뽑히느냐가 매번 달라서입니다. 작은 예로 따라가 봅니다.

요청 여덟 건이 모집단 전부라고 해 봅시다. 응답 시간은 밀리초로 10, 12, 11, 13, 40, 12, 10, 12 입니다. 여덟 값을 더하면 120 입니다. 모집단 평균은 15 입니다.

이 모집단에서 세 건씩 표본을 두 번 뽑았습니다.

뽑힌 값 표본 평균
표본 A 12 · 10 · 11 11
표본 B 40 · 12 · 11 21

모집단 평균 15 를 두고 표본 A 는 4 만큼 낮게, 표본 B 는 6 만큼 높게 짐작했습니다. 값이 40 인 요청이 뽑혔느냐가 둘을 갈랐습니다.

표본 오차는 이렇게 한 번 뽑은 표본의 통계량이 모수에서 벗어나는 크기입니다. 표본 오차는 잘못 뽑아서 생기는 것이 아닙니다. 공정하게 뽑아도 무엇이 걸리느냐는 우연입니다. 그 우연이 표본 오차를 만듭니다.

표본 크기와 흔들림

앞 절의 표본 A 는 4 만큼, 표본 B 는 6 만큼 빗나갔습니다. 표본을 다시 뽑을 때마다 표본 평균은 이렇게 모집단 평균 둘레에서 흔들립니다. 이 흔들림은 표본을 크게 뽑을수록 작아집니다.

여덟 건 가운데 여섯 건을 뽑으면 40 이 섞여도 나머지 다섯 건이 평균을 붙잡아 줍니다. 여덟 건을 다 뽑으면 표본이 곧 모집단입니다. 그때는 흔들림이 없습니다. 표본 오차도 0 입니다.

흔들림의 크기를 수 하나로 나타낸 것이 표준 오차입니다. 표본을 여러 번 뽑을 때 표본 오차가 보통 어느 정도 크기로 나오는지를 나타내는 폭입니다. 표본 A·B 의 4 와 6 이 한 번씩 빗나간 크기라면, 표준 오차는 그런 빗나감이 대개 얼마쯤인지를 말합니다.

늘린 만큼 흔들림이 줄지는 않습니다. 모집단이 표본보다 훨씬 크면, 표준 오차는 표본 크기의 제곱근에 반비례합니다. 흔들림을 절반으로 줄이려면 표본을 네 배로 늘려야 합니다.

표본 크기를 정할 때 이 수를 봅니다. 천 건에서 사천 건으로 늘려야 흔들림이 절반이 됩니다. 그래서 어느 크기를 넘으면 늘려도 얻는 것이 적어집니다.

표본으로 흩어짐을 잴 때

값들이 평균에서 얼마나 흩어져 있는지도 표본으로 짐작합니다. 흩어진 정도를 재는 대표적인 수가 분산입니다. 앞에 나온 분산 추적의 「분산」과는 뜻이 다릅니다. 여기서는 값이 흩어진다는 뜻입니다.

분산은 값마다 평균과의 차이를 제곱해 모두 더한 뒤 값의 개수로 나눈 것입니다. 앞의 여덟 건이면 각 값에서 평균 15 를 빼서 제곱하고, 그 여덟 개를 더한 합을 8 로 나눕니다.

분산은 차이를 제곱해서 구합니다. 그래서 단위도 밀리초의 제곱이 됩니다. 분산의 제곱근을 구해 단위를 밀리초로 되돌린 수가 표준편차입니다.

표본으로 이 둘을 구할 때는 나누는 수가 달라집니다. 값의 개수 n 대신 n−1 로 나눕니다. 이 보정이 베셀 보정입니다.

이유는 표본 평균이 바로 그 표본 값들로 계산한 수라는 데 있습니다. 그래서 표본 평균은 모집단 평균보다 표본 값들 가까이에 놓입니다. 그 평균에서 잰 흩어짐은 실제보다 작게 나옵니다. 조금 작은 수로 나누는 것은 이 모자람을 메우려는 것입니다.

치우쳐 뽑은 표본

표본을 아무리 크게 뽑아도 줄지 않는 오차가 있습니다. 뽑는 방식이 한쪽으로 기울어서 생기는 오차입니다. 이것을 표본 편향이라고 부릅니다.

응답 시간을 새벽 세 시에만 잰다고 해 봅시다. 요청이 적은 시간이라 서버가 한가합니다. 이렇게 모은 표본은 천 건이든 만 건이든 낮 시간의 붐비는 응답 시간을 모릅니다.

성공한 요청만 남기는 기록도 같습니다. 타임아웃으로 끊긴 요청은 기록에 없습니다. 남은 기록만 보면 서비스가 실제보다 빨라 보입니다. 살아남은 것만 보고 판단해서 생기는 이 치우침을 생존 편향이라고 부릅니다.

치우침을 막는 기본은 무작위로 뽑는 것입니다. 모집단의 모든 구성원이 똑같은 확률로 뽑히게 하면 특정 부류만 몰려 뽑히지 않습니다. 이렇게 뽑은 표본을 무작위 표본이라고 합니다.

드문 일과 작은 표본

드물게 일어나는 일은 작은 표본에 잘 걸리지 않습니다. 만 건에 한 번 나는 오류는 천 건짜리 표본에 대개 한 번도 나타나지 않습니다. 표본에 없다고 모집단에 없는 것은 아닙니다.

값을 작은 것부터 줄 세운 뒤 몇 퍼센트 지점에 있는 값을 읽습니다. 그 값이 백분위수입니다. 오래 걸린 쪽 끝을 볼 때 씁니다.

99.9 백분위수, 곧 가장 오래 걸린 천분의 일이 어디서 시작하는지를 봅시다. 이 값을 알려면 천 건마다 한 건꼴로 나오는 값을 봐야 합니다.

표본이 천 건이면 그 끝값이 단 한 건으로 정해집니다. 어느 한 건이 뽑히느냐에 따라 값이 크게 흔들립니다. 그래서 끝을 보는 수일수록 표본이 커야 합니다.

표본을 안 쓰는 때

전부 재는 비용이 작으면 표본이 필요 없습니다. 데이터베이스에 이미 다 쌓인 한 달 치 주문의 합계는 전부 더하면 됩니다. 전부 재면 답이 나옵니다. 짐작할 이유가 없습니다.

한 건 한 건이 다 중요할 때도 표본으로 대신하지 않습니다. 과금 내역이나 감사 기록은 한 건만 빠져도 틀린 결과가 됩니다. 표본은 전체의 모습을 짐작하는 데 쓰지 낱낱을 대신 세는 데 쓰지 않습니다.

같은 이름을 쓰는 다른 분야

표본이라는 말은 통계 밖에서도 씁니다. 전체 가운데 일부를 집는다는 뿌리는 같습니다. 가리키는 범위가 다릅니다.

분야 표본이 가리키는 것
통계 모집단에서 뽑은 값들의 묶음입니다. 천 건을 뽑았으면 천 건이 표본 하나입니다
신호 처리 계속 변하는 소리나 전압을 한 순간에 찍은 값 하나입니다. 소리를 초당 수만 번 찍으면 표본도 초당 수만 개 생깁니다

신호 처리 쪽의 표본은 흔히 영어 그대로 샘플이라고 부릅니다. 초당 찍는 표본의 개수가 샘플링 레이트입니다.

관련 항목

표본을 뽑아 오는 전체를 가리키는 개념

모집단 · 모수 · 전수 조사 · 표본 틀

표본으로 계산하는 통계량

통계량 · 표본 평균 · 표본 분산 · 평균 · 중앙값 · 분산 · 표준편차 · 백분위수 · 요약 통계

표본으로 모집단을 짐작하는 추론 도구

추정 · 표준 오차 · 신뢰 구간 · 가설 검정 · 대수의 법칙 · 중심극한정리 · 베셀 보정 · 자유도 · 불편 추정량

표본을 뽑는 방법

샘플링 · 무작위 표본 · 층화 표본 추출 · 계통 표본 추출 · 군집 표본 추출 · 복원 추출 · 비복원 추출 · 부트스트랩

표본을 모집단과 어긋나게 만드는 오차

표본 오차 · 표본 편향 · 생존 편향 · 선택 편향 · 무응답 편향 · 대표성 · 표본 크기

표본으로 양을 줄이는 백엔드 기법

분산 추적 · 텔레메트리 · 프로파일링 · A-B 테스트 · 부하 테스트 · 다운샘플링

이름이 겹치는 신호 처리 용어

샘플링 레이트 · 표본화 정리 · 나이퀴스트 주파수 · 에일리어싱

표본이 속하는 상위 분류

통계 · 기술 통계 · 추론 통계 · 확률

다른 이름: sample · 샘플 · 표본 집단