사전 모수
개념

모수

gabury1고친 사람 github-actions[bot]

모수는 알고 싶은 대상 전체를 수 하나로 요약해 주는 참값입니다. 오늘 들어온 모든 요청의 평균 응답 시간이 그런 수입니다. 전체를 다 재야 나오는 값이라서 보통은 일부만 재서 짐작합니다. 실무 대화에서 건수를 모수라고 부르는 것은 이와 다른 쓰임입니다.

쉽고 빠른 이해

모수는 전체를 다 재면 나올 참값입니다. 한 달 동안 들어온 요청 전부의 평균 응답 시간이 모수입니다.

전체를 다 재기는 어렵거나 아예 못 할 때가 많습니다. 그래도 알고 싶은 것은 일부의 값이 아니라 전체의 값입니다. 둘을 구분하지 않으면 요청 다섯 건에 실패가 없었다는 이유로 서버에 실패가 없다고 믿게 됩니다.

  1. 알고 싶은 전체와, 그 전체에서 알고 싶은 값을 정합니다
  2. 전체에서 일부를 뽑아 같은 방식으로 계산합니다
  3. 그 계산값으로 전체의 값을 짐작합니다

대가는 모수를 끝내 모른다는 것입니다. 짐작한 값은 뽑을 때마다 달라집니다. 그래서 짐작에는 늘 오차가 따라붙습니다.

상세

투표 전날 밤에도 한 후보의 지지율은 이미 하나로 정해져 있습니다. 유권자 모두에게 묻기 전에는 그 값을 아무도 모릅니다. 여론조사는 천 명쯤에게만 묻습니다. 그 답으로 전체의 지지율을 짐작합니다.

알고 싶은 대상 전체를 모집단이라고 합니다. 모수는 모집단 전체로 계산한 수입니다. 앞의 예에서는 유권자 전부가 모집단입니다. 전체 지지율이 모수입니다.

백엔드로 옮기면 한 달 동안 들어온 요청 전부가 모집단이 됩니다. 그 요청들의 평균 응답 시간이 모수입니다. 같은 요청들의 실패율도 모수입니다. 모집단 하나에 모수는 여럿 있을 수 있습니다.

아래 소절들은 모수가 어떤 수들인지에서 출발합니다. 이어서 결제 요청 열 건으로 모수와 표본 값의 차이를 따라갑니다. 그다음 모수를 짐작하는 방법을 봅니다. 끝으로 확률 분포와 실무 대화에서 같은 이름이 무엇을 가리키는지 가립니다.

자주 쓰는 모수

모집단을 요약하는 방법만큼 모수의 종류가 있습니다. 자주 쓰는 것은 아래 넷입니다. 이름 앞의 「모」는 모집단의 첫 글자입니다.

모수 무엇을 요약하나 백엔드에서 만나는 예
모평균 값들의 한가운데 전체 요청의 평균 응답 시간
모분산 · 모표준편차 값들이 평균에서 흩어진 정도 응답 시간이 들쭉날쭉한 정도
모비율 어떤 성질을 가진 것이 차지하는 몫 전체 결제 요청 가운데 실패한 몫
모집단의 백분위수 값을 작은 것부터 줄 세웠을 때 특정 지점의 값 전체 요청의 99 백분위수 응답 시간

모평균은 모집단의 평균입니다. 모든 값을 더해 값의 개수로 나눈 수입니다.

모분산은 모집단의 분산입니다. 값마다 평균과의 차이를 제곱한 뒤 그 제곱들의 평균을 낸 수입니다. 흩어짐이 클수록 커집니다.

분산은 차이를 제곱해서 구합니다. 그래서 단위도 밀리초의 제곱이 됩니다. 분산에 제곱근을 씌워 단위를 밀리초로 되돌린 수가 표준편차입니다. 모집단의 표준편차가 모표준편차입니다.

모수와 통계량

모집단을 전부 재기 어려우면 일부만 뽑아서 잽니다. 뽑아 낸 일부가 표본입니다. 한 달 치 요청 가운데 고른 천 건이 표본입니다.

표본으로 계산한 수는 통계량입니다. 천 건의 평균 응답 시간인 표본 평균이 통계량의 하나입니다. 모수 하나마다 같은 방식으로 계산한 통계량이 짝으로 있습니다.

둘을 가르는 것은 값을 아느냐 모르느냐입니다. 통계량은 손에 든 값으로 계산합니다. 언제나 값이 나옵니다. 모수는 모집단을 다 재야 나옵니다. 대개 끝까지 모릅니다.

flowchart TD
    P["모집단 · 한 달 치 요청 전부"] -->|"일부를 뽑는다"| S["표본 · 고른 천 건"]
    S -->|"계산한다"| T["통계량 · 표본 평균"]
    T -->|"짐작한다"| M["모수 · 모평균"]
    P -.->|"전부 재야 계산된다"| M

그림에서 모집단에서 모수로 바로 가는 점선은 전부 재야 지나갈 수 있습니다. 그 길이 막혀 있어서 표본과 통계량을 거쳐 돌아갑니다. 실선을 따라 위에서 아래로 한 번 내려가는 것이 표본으로 하는 일입니다.

결제 요청 열 건으로 보는 차이

모집단을 아주 작게 잡으면 모수를 직접 계산해 볼 수 있습니다. 어느 날 들어온 결제 요청이 열 건뿐이었다고 해 봅시다. 이 열 건이 모집단입니다.

열 건 가운데 두 건이 실패했습니다. 이날 결제 요청의 실패율, 곧 모비율은 10 분의 2 인 0.2 입니다. 그날의 요청이 바뀌지 않는 한 이 값은 하나로 정해져 있습니다.

같은 열 건에서 다섯 건씩 표본을 세 번 뽑았습니다. 표본마다 실패율을 계산하면 이렇습니다.

표본 다섯 건 중 실패 표본의 실패율
A 1 0.2
B 0 0
C 2 0.4

표본 A 는 모비율과 같은 값을 냈습니다. 표본 B 는 실패가 한 건도 없다고 말합니다. 표본 C 는 실패율을 두 배로 봅니다.

세 번 뽑는 동안 모비율 0.2 는 한 번도 바뀌지 않았습니다. 바뀐 것은 통계량뿐입니다. 모수는 고정된 값 하나입니다. 통계량은 뽑을 때마다 달라지는 값입니다.

이 차이를 잊으면 표본 B 하나만 보고 「이 결제 서버는 실패가 없다」고 믿게 됩니다. 표본에서 나온 값은 모수를 짐작한 값입니다. 모수 자신이 아닙니다.

모수를 적는 기호

수식에서는 모수와 통계량을 기호로 구분합니다. 모수는 흔히 그리스 문자로 적습니다. 통계량은 로마자로 적습니다.

무엇을 모수 통계량
평균 μ (뮤) x̄ (엑스 바)
표준편차 σ (시그마) s
비율 p p̂ (피 햇)

비율은 모수에도 로마자 p 를 씁니다. 그 대신 통계량 쪽에 모자 기호를 씌워 구분합니다. 문서에서 μ 나 σ 를 만나면 모집단의 값을 말하는 중이라고 읽으면 됩니다.

모수를 짐작하는 방법

통계량으로 모수를 짐작하는 일을 추정이라고 합니다. 짐작한 결과를 내놓는 방식은 크게 둘입니다. 값 하나를 내놓거나, 범위를 내놓습니다.

점 추정은 값 하나를 내놓습니다. 표본의 실패율이 0.2 로 나오면 모비율도 0.2 쯤이라고 말하는 방식입니다. 간단합니다. 대신 이 값이 얼마나 빗나갔을지는 말해 주지 않습니다.

구간 추정은 범위를 내놓습니다. 「모비율은 0.1 에서 0.3 사이에 있을 것이다」처럼 말합니다. 범위의 폭이 짐작이 얼마나 흔들리는지를 함께 알려 줍니다.

구간 추정이 내놓는 범위를 신뢰 구간이라고 부릅니다. 이름의 「신뢰」는 같은 방법으로 표본을 거듭 뽑아 범위를 만들 때, 그 범위들이 모수를 품는 비율을 가리킵니다. 이 비율이 높을수록 그 방법으로 만든 범위를 믿을 만하다고 봅니다.

표본에 든 개수를 표본 크기라고 합니다. 표본 크기가 클수록 신뢰 구간의 폭이 좁아집니다. 표본이 모집단 전부가 되면 통계량이 곧 모수입니다. 그때는 짐작할 것이 없습니다.

분포의 모양을 정하는 수

모수라는 이름은 확률 분포에서도 씁니다. 확률 분포는 어떤 값이 얼마나 자주 나오는지를 나타냅니다. 응답 시간이 대개 0.1초 근처에 몰려 있고 가끔은 1초를 넘긴다고 해 봅시다. 그 몰림과 퍼짐이 분포입니다.

자주 나오는 분포 가운데에는 모양이 미리 정해진 묶음이 있습니다. 모양은 같고 몇 개의 수만 바꿔 끼우는 분포 묶음입니다. 이런 묶음을 분포의 틀이라고 부릅니다.

정규 분포가 그런 틀의 하나입니다. 평균을 가운데 둔 좌우 대칭의 종 모양입니다. 이 틀은 수 두 개만 정하면 분포 하나가 정해집니다. 가운데를 정하는 평균과, 퍼짐을 정하는 표준편차입니다.

이렇게 틀 안에서 분포 하나를 골라 정해 주는 수도 모수라고 부릅니다. 틀이 같아도 모수가 바뀌면 분포가 달라집니다. 평균이 바뀌면 종이 옆으로 옮겨 갑니다. 표준편차가 커지면 종이 납작하게 넓어집니다.

포아송 분포는 정해진 시간 동안 어떤 일이 몇 번 일어나는지를 나타냅니다. 초당 들어오는 요청 수를 어림할 때 흔히 씁니다. 이 분포의 모수는 하나뿐입니다. 단위 시간에 평균 몇 번 일어나는지를 나타내는 수입니다.

두 뜻은 따로 놀지 않습니다. 모집단이 정규 분포를 따른다고 보면, 그 분포의 평균이 곧 모평균입니다. 분포의 모수를 짐작하는 일이 모집단의 모수를 짐작하는 일이 됩니다.

모수적 방법과 비모수적 방법

응답 시간을 요약할 때도 분포에 틀을 가정하느냐로 방법이 갈립니다. 가정하면 짐작할 것이 틀의 모수 몇 개로 줄어듭니다. 가정하지 않으면 값 자체에서 답을 끌어냅니다.

두 방법의 이름에 든 「모수」는 앞 소절의 뜻, 곧 분포의 틀을 정하는 수입니다. 비모수적 방법도 모집단의 모수를 짐작합니다. 모집단의 백분위수가 그런 모수입니다. 쓰지 않는 것은 틀의 모수뿐입니다.

모수적 방법은 모집단이 어떤 틀의 분포를 따른다고 먼저 가정합니다. 그러면 틀의 모수 몇 개만 짐작해도 분포 전체를 안다고 봅니다. 가정이 맞으면 적은 표본으로도 좁은 범위를 얻습니다. 가정이 틀리면 결과가 크게 빗나갑니다.

비모수적 방법은 틀을 가정하지 않습니다. 값들을 줄 세운 순서나 개수 같은 것만으로 판단합니다. 가정이 틀릴 걱정이 적습니다. 대신 같은 표본으로 얻는 범위가 대개 더 넓습니다.

응답 시간은 대개 한쪽 꼬리가 깁니다. 대부분은 빠릅니다. 드물게 아주 오래 걸리는 요청이 섞입니다. 이런 값에 좌우 대칭인 정규 분포를 가정하면 오래 걸리는 쪽 끝을 작게 봅니다.

그래서 응답 시간은 평균과 표준편차보다 백분위수로 요약하는 일이 많습니다. 표본의 백분위수는 틀을 가정하지 않고 줄 세운 값에서 바로 읽습니다. 그 값으로 모집단의 백분위수를 짐작합니다.

통계 밖에서 쓰는 「모수」

모수라는 낱말은 통계 교과서 밖에서 다른 뜻으로도 씁니다. 글자는 같습니다. 가리키는 것이 다릅니다.

쓰는 곳 모수가 가리키는 것 통계 용어로 옮기면
통계 모집단 전체의 참값 모수
실무 대화의 「전환율 모수가 적다」 비율을 계산할 때 분모에 든 건수 표본 크기
실무 대화의 「타깃 모수를 늘린다」 대상으로 삼는 사람이나 건의 수 모집단의 크기

실무 대화의 쓰임은 모두 개수를 가리킵니다. 통계의 모수는 개수가 아니라 모집단이 가진 값입니다. 「모수가 적어서 믿기 어렵다」를 통계 용어로 옮기면 「표본 크기가 작아서 추정이 흔들린다」가 됩니다.

영어로는 모수를 parameter 라고 합니다. 코드에서 함수에 넘기는 매개변수와 같은 낱말입니다. 통계 문서에서 parameter 를 만나면 대개 모수로 읽습니다.

관련 항목

모수를 가진 전체와 거기서 뽑는 표본

모집단 · 표본 · 표본 크기 · 전수 조사 · 샘플링 · 모집단 분포

모수의 하위 종류

모평균 · 모분산 · 모표준편차 · 모비율

모수와 짝을 이루는 통계량

통계량 · 표본 평균 · 표본 분산 · 표본 비율 · 평균 · 분산 · 표준편차 · 백분위수 · 요약 통계

모수를 짐작하는 추론 도구

추정 · 점 추정 · 구간 추정 · 신뢰 구간 · 추정량 · 불편 추정량 · 최대 가능도 추정 · 표준 오차 · 표본 오차 · 가설 검정

모수가 모양을 정하는 확률 분포

확률 분포 · 분포 · 정규 분포 · 포아송 분포 · 지수 분포 · 이항 분포

모수 가정 여부로 갈리는 분석 방법

모수적 방법 · 비모수적 방법 · 부트스트랩 · 순위 검정

모수와 이름이 겹치는 이웃 낱말

매개변수 · 하이퍼파라미터 · 인자 · 전환율

모수가 속하는 상위 분류

통계 · 추론 통계 · 기술 통계 · 확률

다른 이름: parameter · population parameter · 모수치