데이터 분석의
이해
데이터를 설명하고, 예측하고, 더 나은 판단으로 연결하기
데이터 분석의 유형
무슨 일이 일어났는지부터, 무엇을 해야 하는지까지

데이터 분석이 중요한 이유
데이터의 가치는
보유량이 아니라
의사결정에 주는 도움으로 판단합니다.
기업과 조직은 현재의 분석 수준을 점검하고, 더 높은 가치의 분석으로 발전하기 위해 데이터 분석 성숙도를 활용합니다.
데이터 분석 성숙도
조직이 데이터를 얼마나 체계적으로 분석하고, 그 결과를 의사결정에 얼마나 효과적으로 활용하는지를 단계로 나타낸 개념
현재 수준 파악
개선 과제 발견
미래 역량 설계
분석은 설명에서 행동 제안으로 발전합니다
Gartner Analytic Ascendancy Model을 바탕으로 재구성
레모네이드 가게라면 어떤 질문을 할까요?

서술 — 지난달 판매량은 얼마였나?
진단 — 비 오는 날 판매가 줄어든 이유는?
예측 — 내일 기온이면 몇 잔이 팔릴까?
처방 — 가격과 재고를 어떻게 조정할까?
핵심: 같은 데이터도 질문이 달라지면 필요한 분석 방법이 달라집니다.
분석 목적에 따라 주로 쓰는 기술이 달라집니다
서술 분석
기술통계
집계·요약
데이터 시각화
진단 분석
비교 분석
상관·회귀 분석
원인 탐색
예측 분석
지도학습
시계열 분석
확률 예측
처방 분석
최적화
시뮬레이션
순차적 의사결정
주의: 실제 프로젝트에서는 한 가지 기법만 고정해 쓰기보다, 목적과 데이터에 맞춰 여러 방법을 조합합니다.
전통적 통계 데이터 분석
표본을 요약하고, 모집단에 대해 신중하게 추론하기

기술통계와 추론통계는 답하는 질문이 다릅니다
기술통계 분석
수집한 데이터의 중심, 퍼짐, 분포를 효과적으로 요약하고 설명합니다.
- 평균·중앙값·표준편차
- 도수분포표와 시각화
이어지는 범위: 9–18번
추론통계 분석
표본을 바탕으로 모집단의 특성을 추정하고 가설을 검정합니다.
- 신뢰구간과 추정
- 가설검정과 유의성 판단
이어지는 범위: 19–24번
도수분포표: 값이 얼마나 자주 나타나는지 정리합니다
복잡한 원자료를
범주별 빈도로 바꾸기
데이터를 몇 개의 범주나 구간으로 나눈 뒤, 각 구간에 속하는 관측값의 개수를 표로 정리합니다.
활용: 설문 응답, 점수 구간, 제품별 판매 건수처럼 분포를 빠르게 파악할 때 유용합니다.

도수분포표의 예
히스토그램: 연속형 데이터의 분포를 봅니다

연속형 값을 일정한 구간으로 나눈 예
막대의 높이는 각 구간의 빈도
가로축은 연속된 값의 구간, 세로축은 각 구간에 속한 데이터의 빈도를 나타냅니다.
- 구간 순서는 수치 순서대로 고정됩니다.
- 인접 구간의 연속성을 보여주기 위해 막대는 보통 붙여 그립니다.
- 분포의 중심, 퍼짐, 치우침을 한눈에 볼 수 있습니다.
막대그래프: 범주별 크기를 비교합니다
범주는 떨어져 있고,
순서를 바꿀 수도 있습니다
서로 구분되는 범주의 값을 막대 길이로 표현합니다. 범주가 연속적인 수치일 필요는 없습니다.
히스토그램과 구별: 막대그래프는 범주 사이를 띄우며, 목적에 따라 순서를 재배열할 수 있습니다.

18세 미만 응답자의 코딩 학습 경로
파이 차트: 전체와 부분의 비율을 봅니다

전체 합이 100%인 구성비의 예
‘부분 대 전체’가 핵심
각 조각의 각도와 면적이 전체에서 차지하는 비율을 나타냅니다.
- 범주 수가 적을 때 가장 읽기 쉽습니다.
- 비슷한 크기의 조각을 정밀하게 비교할 때는 막대그래프가 더 적합합니다.
- 조각의 합은 하나의 전체를 의미해야 합니다.
선 그래프: 시간에 따른 변화와 추세를 봅니다
점의 연결이 변화의 방향을 보여줍니다
시간 순서로 관측된 값을 점으로 표시하고 선으로 연결해 증가·감소·변곡점을 파악합니다.
적합한 데이터: 주가, 기온, 방문자 수, 실험 측정값처럼 시간 순서가 중요한 시계열 데이터

시간에 따른 두 시계열의 변화
상자수염그림: 다섯 수치로 분포를 압축합니다

여러 시점의 분포를 한 공간에서 비교
최솟값 · Q1 · 중앙값 · Q3 · 최댓값
여러 수치 자료의 중심과 퍼짐, 이상치를 간결하게 비교할 수 있습니다.
- 상자: 가운데 50%의 데이터
- 상자 안 선: 중앙값
- 수염 바깥 점: 일반적으로 이상치 후보
산점도: 두 변수의 관계를 점으로 탐색합니다
방향 · 강도 · 군집 · 이상치
각 관측값을 좌표의 한 점으로 표시해 두 변수 사이의 패턴을 살펴봅니다.
주의: 산점도에서 관계가 보여도 한 변수가 다른 변수의 원인이라고 단정할 수는 없습니다.

두 변수의 관계와 군집이 나타난 산점도
히트맵: 값의 크기를 색의 차이로 읽습니다

공간 분포와 행렬 데이터를 색으로 표현한 예
많은 값을 빠르게 훑는 시각화
행·열 또는 공간의 각 위치에 대응하는 값을 색상이나 명도로 나타냅니다.
- 시간대별 지하철 혼잡도
- 변수 간 상관계수 행렬
- 지역별 온도·밀도 분포
트리맵: 계층과 구성비를 직사각형 안에 담습니다
큰 범주 안의 작은 범주
전체 사각형을 계층에 따라 나누고, 각 항목의 크기를 면적으로 표현합니다.
적합한 상황: 파일 용량, 예산 구성, 제품군별 매출처럼 계층 구조와 비중을 함께 보여줄 때

프로그래밍 언어 비중을 나타낸 트리맵
워드클라우드: 단어 빈도를 글자 크기로 표현합니다

프로그래밍 언어 빈도를 나타낸 워드클라우드
핵심어를 빠르게 보여주는 요약
텍스트에서 자주 나타나는 단어를 크게 표시해 관심 주제나 빈도를 직관적으로 보여줍니다.
한계: 정확한 크기 비교와 맥락 파악에는 적합하지 않습니다. 정밀 비교에는 막대그래프를 함께 사용합니다.
통계는 왜 표본만 보고 전체를 말할 수 있을까요?
전체를 모두 조사하기 어렵다면,
대표성 있는 일부를 살펴봅니다.
무작위 표본을 사용하면 표본에서 발견한 패턴을 바탕으로 모집단의 특성을 추정할 수 있습니다.
● ● ● ● ●
● ● ● ● ●
300 → 30
모집단 300명 중 30명을 무작위로 추출
알고 싶은 것은 모집단, 손에 있는 것은 표본입니다
사례: 우리 학교 2학년 300명의 평균 수학 점수는 70점보다 높은가?
300명
알고 싶은 값
모집단 평균 μ = ?
30명
관찰한 값
표본평균 x̄ = 72점
표본에서 얻은 정보를 이용해 모집단을 추론합니다.
기술통계는 먼저 표본의 모습을 요약합니다
평균
72
점
표준편차
10
점
표본평균 72점은 조사한 30명의 중심을, 표준편차 10점은 점수의 흩어진 정도를 설명합니다.
점수 분포 예시
반복 표본추출은 표본평균의 변동을 보여줍니다
같은 모집단에서 같은 크기의 표본을 뽑아도 평균은 조금씩 달라집니다.
추정은 하나의 숫자보다 범위로 말합니다
모집단 평균의 추정 범위
앞에서 확인한 표본평균의 변동(표본오차)을 반영하면, 이 표본의 95% 신뢰구간은 68.3점에서 75.7점입니다. 모집단 평균의 가능한 범위를 제시합니다.
95%는 같은 절차로 표본추출과 구간 계산을 반복할 때, 만들어진 구간의 약 95%가 참값을 포함한다는 의미입니다.
가설검정은 ‘70점보다 높다’는 주장을 판단합니다
단측 t검정 · n=30 · 표본평균=72점 · 표준편차=10점
가설
H₀ : μ = 70점
모집단 평균은 기준값과 같다.
H₁ : μ > 70점
모집단 평균은 기준값보다 높다.
검정 결과
p = 0.14
유의수준 5%에서 “전체 평균이 70점보다 높다”는 근거가 충분하지 않습니다.
※ 모집단 평균이 정확히 70점이라고 증명한 것은 아닙니다.
기술통계는 표본을 요약하고, 추론통계는 표본오차를 고려해 모집단을 추정·검정합니다.
인공지능
예측을 가능하게 하는 기술의 큰 그림 이해하기

예측 분석은 미관측 결과의 가능성을 추정합니다
과거의 패턴으로
미래 또는 미관측 결과를 예측합니다.
- 내일의 제품 수요
- 고객의 이탈 가능성
- 설비의 고장 위험
인공지능 AI
인간의 지능적 행동—학습, 추론, 인식, 언어 이해, 문제 해결—을 컴퓨터 시스템으로 구현하는 폭넓은 분야입니다.
기계학습, 패턴 인식, 인공신경망, 딥러닝은 AI를 구현하는 대표적인 접근과 기술입니다.
AI는 여러 접근과 기술을 포괄하는 큰 개념입니다

인공지능의 개념 및 범위
인공지능 — 지능적 과업을 수행하는 시스템
기계학습 — 데이터에서 규칙을 학습하는 방법
딥러닝 — 여러 층의 신경망을 활용하는 기계학습 기술
용어는 서로 완전히 나뉘기보다 포함·중첩 관계를 이룹니다.
인공지능은 기대와 한계를 반복하며 발전해 왔습니다
튜링 테스트
첫 번째 침체
두 번째 침체
빅데이터·GPU
대규모 기반모델
핵심 변화: 더 많은 데이터, 향상된 컴퓨팅 성능, 새로운 학습 알고리즘이 함께 발전했습니다.
AI는 규칙에서 데이터·기반모델 중심으로 발전했습니다
규칙 기반
사람이 규칙을 설계
전문가 시스템
지식베이스와 추론
기계학습
데이터에서 패턴 학습
딥러닝·기반모델
표현 학습과 생성
이 구분은 역사를 단순화한 대표 흐름입니다. 실제 기술들은 서로 공존하며 결합됩니다.
기계학습과 딥러닝
데이터에서 배우는 세 가지 방식과 신경망의 발전

기계학습은 데이터로부터 규칙을 학습합니다
명시적인 모든 규칙을 사람이 코딩하는 대신, 데이터와 경험을 통해 성능을 개선합니다.
지도학습
입력과 정답으로
예측 규칙 학습
비지도학습
정답 없이
구조와 패턴 발견
강화학습
행동과 보상으로
좋은 전략 학습

지도학습: 정답이 있는 데이터로 예측합니다
분류 Classification
결과가 범주일 때
예: 개/고양이, 정상/불량
회귀 Regression
결과가 연속적인 수치일 때
예: 판매량, 온도, 가격

회귀, 결정트리, 베이즈, 신경망 알고리즘
비지도학습: 정답 없이 데이터의 구조를 찾습니다

군집, 연관규칙, 차원축소, 딥러닝 알고리즘
군집화
서로 비슷한 고객이나 사례를 묶습니다.
연관규칙 학습
장바구니에서 함께 구매되는 품목처럼 동시 발생 패턴을 찾습니다.
차원축소
많은 변수의 핵심 구조를 더 적은 차원으로 요약합니다.
강화학습: 행동의 결과로부터 전략을 개선합니다
상태를 보고 행동하고,
보상을 통해 더 나은 정책을 배웁니다.
게임 플레이, 로봇 제어, 자원 배분처럼 연속적인 의사결정 문제에 활용됩니다.

에이전트가 환경과 상호작용하며 정책을 학습
딥러닝은 여러 층의 신경망을 활용합니다
데이터의 복잡한 특징을 사람이 일일이 설계하지 않아도, 여러 층을 거치며 계층적으로 학습할 수 있습니다.
분류 축이 다릅니다
지도·비지도·강화학습은 학습 방식, 딥러닝은 모델을 구성하는 기술입니다. 딥러닝 모델은 세 학습 방식 모두에 활용될 수 있습니다.
포함 관계와 학습 방식은 서로 다른 분류 축입니다.
퍼셉트론은 뉴런을 단순화한 계산 모델입니다

생물학적 뉴런에서 영감을 얻은 인공 뉴런
입력의 가중합이 기준을 넘으면 출력
입력값 × 가중치를 모두 더한 뒤, 편향과 활성화 함수를 적용해 출력값을 만듭니다.
- 가중치: 입력의 중요도
- 편향: 활성화 기준을 조정
- 활성화 함수: 출력을 비선형으로 변환
깊은 신경망은 표현력과 학습 난이도가 함께 커집니다

표현력 증가
복잡한 비선형 패턴과 계층적 특징을 학습
기울기 문제
초기 심층망은 기울기 소실·폭주로 학습이 어려웠음
계산·데이터 부담
더 많은 연산 자원과 충분한 학습 데이터가 필요
세 가지 발전이 딥러닝을 현실로 만들었습니다
01
학습 방법
역전파, 활성화 함수,
정규화·최적화
02
데이터
대규모 데이터셋과
효율적 데이터 처리
03
컴퓨팅
GPU·가속기와
분산 학습
합성곱 신경망
이미지·영상 분석
순환 신경망
문장·음성·시계열
생성적 적대 신경망
새로운 데이터 생성
딥러닝은 인식·생성·제어의 성능을 크게 높였습니다

다양한 신경망 구조의 예
음성 — 음성 인식, 합성, 번역
이미지 — 분류, 탐지, 생성
텍스트 — 질의응답, 요약, 생성
제어 — 자율주행, 로봇, 게임
기계학습 기법은 ‘문제와 데이터’를 보고 고릅니다
복잡한 모델보다 먼저,
세 가지 질문을 확인하세요.
무엇을 알고 싶은가?
분류 · 수치 예측 · 군집 · 규칙 발견
정답 데이터가 있는가?
입력과 함께 목표값이 제공되는가?
행동의 보상이 있는가?
행동 결과를 평가하고 반복할 수 있는가?
다음 슬라이드에서 질문에 차례로 답하며 기법을 선택합니다.
세 가지 질문으로 기계학습 기법을 고릅니다
데이터와 목적이 달라지면 같은 문제라도 선택하는 기법이 달라질 수 있습니다.
데이터 분석가가 갖춰야 할 역량
기술·통계·도메인 지식을 연결해 의미 있는 판단 만들기

데이터 사이언스는 세 역량이 만나는 지점입니다
사이언스
컴퓨팅 — 데이터를 다루고 구현하는 힘
수학·통계 — 불확실성을 정량적으로 판단하는 힘
도메인 — 결과를 맥락 속에서 해석하는 힘
Drew Conway의 Data Science Venn Diagram(2010)을 바탕으로 재구성
컴퓨팅·프로그래밍 역량은 분석을 구현합니다
데이터를 수집하고,
정리하고, 분석하고,
반복 가능한 코드로 만듭니다.
- 프로그래밍과 데이터 처리
- 알고리즘과 컴퓨팅 사고
- 결과 재현과 자동화

기본적인 프로그래밍 능력 확보
수학·통계는 타당한 결론을 이끌어냅니다

수치 자료를 분석하고 해석하는 과정
계산보다 중요한 것은
적절한 방법을 선택하는 판단
- 기본 통계 용어와 확률 이해
- 분석 가정과 한계 점검
- 그래프와 수치의 올바른 해석
- 불확실성을 포함한 결과 전달
도메인 전문성은 숫자를 현실의 의미로 번역합니다
분석 대상이 놓인
업무·현장·과학적 맥락을 이해해야 합니다.
도메인 지식은 어떤 데이터를 모아야 하는지, 어떤 패턴이 중요한지, 결과가 실제로 가능한지를 판단하게 합니다.
예: 발전기 고장 예측
- 어떤 센서가 고장 징후를 담는가?
- 정상 변동과 이상 신호는 어떻게 다른가?
- 점검·정비 기록과 센서값을 어떻게 연결할까?
- 잘못된 경보의 현장 비용은 얼마인가?
좋은 모델만으로는 부족합니다. 올바른 문제 정의와 해석이 함께 필요합니다.
‘위험구역’은 도메인 맥락을 놓칠 때 생깁니다
결석 15일
과제 미제출 증가
“학업중단 위험이 높다”
장기 치료로 인한
불가피한 결석
④ 더 나은 판단
예측값만으로 학생을 낙인찍지 않습니다. 교사·상담사와 함께 맥락을 확인한 뒤, 학생에게 필요한 지원을 결정합니다.
분석 결과는 의사결정을 돕는 근거이지, 맥락을 대신하는 판결이 아닙니다.
좋은 데이터 분석은
세 가지 역량의 협업에서 완성됩니다.
관심 있는 한 영역에서 시작하되, 다른 분야의 전문가와 협력하며 역량의 폭을 넓혀 갑니다.
