데이터 분석
데이터를 놓고 그것이 무엇을 말하는지 알아내는 일입니다. 사람이 판단에 쓸 수 있는 형태로 바꿔 내놓습니다. 이 일이 이뤄지는 구역은 한 문장 정의로 닫히기보다 여러 활동의 묶음으로 열립니다.
쉽고 빠른 이해
데이터 분석은 이미 쌓여 있는 데이터를 놓고 그것이 무엇을 말하는지 판정해서, 사람이 판단에 쓸 수 있는 형태로 내놓는 일을 하는 사람들의 구역입니다. 예를 들어 쌓인 주문 로그를 보고 어떤 상품이 잘 팔리는지 알아내는 일이 여기 있습니다. 무엇을 물을지 정하는 일, 데이터를 손보는 일, 요약해서 들여다보는 일, 견주어 판정하는 일, 결과를 전하는 일이 전부 여기 안에서 일어납니다.
이 자리가 없으면 쌓인 데이터는 쌓인 채로 남습니다. 사람이 판단에 쓸 형태로는 안 바뀝니다.
한 문장 정의가 안 서는 이유는 이 구역이 성격이 다른 여러 활동을 한데 묶은 자리이기 때문입니다. 데이터를 손보는 일과 결과를 견주어 판정하는 일은 서로 다른 일입니다. 그래도 둘 다 같은 구역 안에서 벌어집니다.
안에서는 일하는 순서로도 갈립니다. 모델(데이터가 따른다고 미리 세우는 규칙)을 먼저 세우고 나서 분석하는 쪽과, 먼저 데이터를 들여다보고 나중에 모델을 세우는 쪽이 함께 있습니다.
상세
데이터는 이미 어딘가에 쌓여 있습니다. 이 구역은 그 쌓인 것을 놓고 무엇을 말하는지 판정해 내놓는 자리입니다. 예를 들어 쌓인 주문 로그를 보고 어떤 상품이 잘 팔리는지 알아내는 일이 여기 있습니다. 이 자리가 없으면 쌓인 데이터는 쌓인 채로 남습니다. 사람이 판단에 쓸 형태로는 안 바뀝니다. 무엇을 물을지 정하는 일, 데이터를 손보는 일, 요약해 들여다보는 일, 견주어 판정하는 일, 결과를 전하는 일을 이 자리에서 마주칩니다.
그래서 한 문장 정의가 잘 안 섭니다. 통계학자 존 튜키는 1962년 글에서 자기 중심 관심사가 데이터 분석에 있다고 적으면서, 거기에 무엇이 든다고 보는지를 늘어놓았습니다. 그가 든 것은 여러 가지 가운데 일부입니다. 데이터를 분석하는 절차, 그런 절차의 결과를 해석하는 기법, 데이터 분석을 더 쉽거나 더 정밀하거나 더 정확하게 만들도록 데이터 수집을 계획하는 방법, 그리고 데이터 분석에 적용되는 통계학의 도구와 성과 전부입니다. 정의라기보다 범위 선언에 가깝습니다.
튜키는 이 일이 그중 어느 하나로 좁혀지지 않는다고도 적었습니다. 데이터 분석의 큰 부분은 표본에서 본 것을 모집단 전체로 넓혀 말하는 추론입니다. 다만 그것은 부분일 뿐 전부가 아닙니다. 큰 부분은 날카롭게 파고드는 일이기도 합니다. 원자료를 그냥 눈으로 훑어서는 알아채지 못할 조짐을 찾아내는 것을 말합니다. 이것도 부분일 뿐입니다. 어떤 부분은 자원을 배분하는 일이기도 합니다. 관찰과 실험과 분석 중 어디에 노력과 그 밖의 자원을 얼마나 쓸지 정하는 것을 말합니다. 튜키는 데이터 분석이라는 이 구역이 추론보다도, 날카롭게 파고드는 일보다도, 자원을 배분하는 일보다도 크고 다양한 분야라고 적었습니다.
일을 진행하는 순서도 한 가지가 아닙니다. 미국 국립표준기술연구소(NIST, National Institute of Standards and Technology)와 세마테크(SEMATECH)가 함께 낸 통계 방법 편람은 널리 쓰이는 데이터 분석 접근법 셋을 고전적 방식, 탐색적 자료 분석(EDA, Exploratory Data Analysis), 베이즈 방식으로 적습니다. 셋은 모두 일반적인 과학·공학 문제에서 출발해 과학·공학 결론으로 끝납니다. 갈리는 것은 중간 단계의 순서와 초점입니다.
여기서 모델은 데이터가 따른다고 미리 세워 두는 규칙을 말합니다. 베이즈 방식이 쓰는 사전분포는 그 규칙의 값을 데이터를 보기 전에 미리 정해 두는 확률 분포입니다. 그리고 이 순서 안에서 「분석」은 표제어인 데이터 분석 전체가 아니라, 결과를 뜯어보는 한 단계를 가리키는 이름입니다.
flowchart TD
subgraph 고전적["고전적 방식"]
C1[문제] --> C2[데이터] --> C3[모델] --> C4[분석] --> C5[결론]
end
subgraph EDA방식["탐색적 자료 분석(EDA)"]
E1[문제] --> E2[데이터] --> E3[분석] --> E4[모델] --> E5[결론]
end
subgraph 베이즈["베이즈 방식"]
B1[문제] --> B2[데이터] --> B3[모델] --> B4[사전분포] --> B5[분석] --> B6[결론]
end
모델을 세우는 단계가 분석 앞이냐 뒤냐가 갈립니다. 베이즈 방식에만 사전분포를 놓는 단계가 하나 더 있습니다.
경계
데이터 엔지니어링과의 선
매일 도는 집계 테이블을 만들어 두는 일은 이 구역인가. 아닙니다. 데이터 엔지니어링 쪽입니다.
AWS(Amazon Web Services, 아마존 웹 서비스) 문서는 데이터 엔지니어링이 하는 일을, 구조화·비구조화 데이터에 맞는 저장 방식을 골라 그 데이터를 담아 둘 기반을 갖추는 것으로 적습니다. 그렇게 갖춘 기반 덕에 여러 원천에서 데이터를 모아 저장할 수 있고, 그 데이터를 이후의 처리와 분석에 쓸 수 있게 된다고 적습니다. 분석은 그렇게 갖춰진 데이터를 나중에 갖다 쓰는 일로 적혀 있을 뿐, 데이터 엔지니어링 자신이 하는 일에는 들지 않습니다. 그 집계 테이블을 읽고 무엇을 말하는지 판정하는 자리부터가 이 구역입니다.
머신러닝과의 선
예측 모델을 붙이는 순간 머신러닝으로 넘어가는가. 그 모델을 학습시키고 굴리는 자리는 넘어갑니다.
미국 국립표준기술연구소의 컴퓨터보안리소스센터(CSRC, Computer Security Resource Center) 용어집은 머신러닝 항목이 NIST가 낸 다른 특별간행물(SP, Special Publication) 「NIST SP 800-55v1」의 정의를 그대로 옮겨 적은 것이라고 밝혀 둡니다. 보안 문서 안에 실렸어도 그 안에서 새로 지은 정의가 아니라 NIST가 이미 공식으로 쓰던 정의라는 뜻입니다. 그 정의는 머신러닝을 정확도를 높이는 것을 목표로 데이터에서 적응하고 배우는 컴퓨터 시스템의 개발과 사용이라고 적습니다. 가르는 것은 데이터를 쓰느냐가 아닙니다. 컴퓨터 시스템이 데이터에서 스스로 적응하고 배우느냐입니다. 데이터를 놓고 사람이 해석해 결론에 이르는 자리는 그 정의에 안 듭니다.
통계학과의 선
수학적 통계학의 도구를 꺼내 쓰면 그건 통계학이지 이 구역이 아닌가. 아닙니다.
튜키의 정의는 데이터 분석에 적용되는 통계학의 도구와 성과 전부를 이 구역 안에 넣습니다. 검정이나 추정 절차를 꺼내 썼다는 이유만으로 자리가 옮겨가지 않습니다. 튜키 자신도 데이터 분석의 큰 부분이 추론이라고 적으면서 그것을 부분으로 두었습니다.
여담
튜키는 같은 1962년 글에서 수학을 과학이 아니라고 적었습니다. 수학의 궁극적 타당성 기준이 합의된 종류의 논리적 일관성과 증명 가능성이기 때문이라는 것입니다. 반면 데이터 분석은 자신이 세운 기준을 모두 통과한다고 보아 과학으로 인정했습니다. 튜키는 이렇게 수학과는 다른 기준으로 데이터 분석에 과학이라는 이름을 준 것입니다.
관련 항목
물음을 정하는 개념
지표 · 차원 · 세그먼트 · 코호트 · 모집단 · 표본 · 무작위 표본 · 필터
데이터를 손보는 개념
요약하고 들여다보는 개념
요약 통계 · 평균 · 표준편차 · 확률 분포 · 탐색적 자료 분석 · 데이터 시각화 · 산점도
견주어 판정하는 개념
통계 검정 · 귀무가설 · p값 · 통계적 유의성 · 신뢰구간 · 점추정 · 모수 · 다중 비교 · A/B 테스트 · 상관과 인과 · 사전분포
적어 가는 도구
노트북 · 대시보드 · 문학적 프로그래밍
자주 걸리는 함정
생존 편향 · 심슨의 역설 · 표본 편향 · 대표성 편향
다른 이름: data analysis · 자료 분석 · 데이터분석