1 / 48
◀ 이전 슬라이드
▶ 다음 슬라이드
↗ 슬라이드 이동...
✏️ 펜
🖊 형광펜
🧹 지우개
🗑 그리기 초기화
🖱 포인터 모드
⛶ 전체화면
PEN
WEEK 2

데이터 분석의
이해

데이터를 설명하고, 예측하고, 더 나은 판단으로 연결하기

생활 속 예제로 배우는 생생 데이터 분석 교재 표지
SECTION 01

데이터 분석의 유형

무슨 일이 일어났는지부터, 무엇을 해야 하는지까지

데이터 분석 일러스트
01

데이터 분석이 중요한 이유

DATA → DECISION

데이터의 가치는
보유량이 아니라
의사결정에 주는 도움으로 판단합니다.

기업과 조직은 현재의 분석 수준을 점검하고, 더 높은 가치의 분석으로 발전하기 위해 데이터 분석 성숙도를 활용합니다.

데이터 분석 성숙도

조직이 데이터를 얼마나 체계적으로 분석하고, 그 결과를 의사결정에 얼마나 효과적으로 활용하는지를 단계로 나타낸 개념

1

현재 수준 파악

2

개선 과제 발견

3

미래 역량 설계

3 / 48
01

분석은 설명에서 행동 제안으로 발전합니다

서술 분석무슨 일이 일어났는가?
진단 분석왜 일어났는가?
예측 분석앞으로 무엇이 일어날까?
처방 분석그렇다면 무엇을 해야 할까?

Gartner Analytic Ascendancy Model을 바탕으로 재구성

4 / 48
01

레모네이드 가게라면 어떤 질문을 할까요?

노상 음료 판매에 분석 성숙도 모델을 적용한 사례
1

서술 — 지난달 판매량은 얼마였나?

2

진단 — 비 오는 날 판매가 줄어든 이유는?

3

예측 — 내일 기온이면 몇 잔이 팔릴까?

4

처방 — 가격과 재고를 어떻게 조정할까?

핵심: 같은 데이터도 질문이 달라지면 필요한 분석 방법이 달라집니다.

5 / 48
01

분석 목적에 따라 주로 쓰는 기술이 달라집니다

DESCRIBE

서술 분석

기술통계
집계·요약
데이터 시각화

DIAGNOSE

진단 분석

비교 분석
상관·회귀 분석
원인 탐색

PREDICT

예측 분석

지도학습
시계열 분석
확률 예측

PRESCRIBE

처방 분석

최적화
시뮬레이션
순차적 의사결정

주의: 실제 프로젝트에서는 한 가지 기법만 고정해 쓰기보다, 목적과 데이터에 맞춰 여러 방법을 조합합니다.

6 / 48
SECTION 02

전통적 통계 데이터 분석

표본을 요약하고, 모집단에 대해 신중하게 추론하기

통계 분석 일러스트
02

기술통계와 추론통계는 답하는 질문이 다릅니다

DESCRIPTIVE

기술통계 분석

수집한 데이터의 중심, 퍼짐, 분포를 효과적으로 요약하고 설명합니다.

  • 평균·중앙값·표준편차
  • 도수분포표와 시각화

이어지는 범위: 9–18번

INFERENTIAL

추론통계 분석

표본을 바탕으로 모집단의 특성을 추정하고 가설을 검정합니다.

  • 신뢰구간과 추정
  • 가설검정과 유의성 판단

이어지는 범위: 19–24번

8 / 48
02

도수분포표: 값이 얼마나 자주 나타나는지 정리합니다

FREQUENCY TABLE

복잡한 원자료를
범주별 빈도로 바꾸기

데이터를 몇 개의 범주나 구간으로 나눈 뒤, 각 구간에 속하는 관측값의 개수를 표로 정리합니다.

활용: 설문 응답, 점수 구간, 제품별 판매 건수처럼 분포를 빠르게 파악할 때 유용합니다.

도수분포표 예시

도수분포표의 예

9 / 48
02

히스토그램: 연속형 데이터의 분포를 봅니다

히스토그램 예시

연속형 값을 일정한 구간으로 나눈 예

HISTOGRAM

막대의 높이는 각 구간의 빈도

가로축은 연속된 값의 구간, 세로축은 각 구간에 속한 데이터의 빈도를 나타냅니다.

  • 구간 순서는 수치 순서대로 고정됩니다.
  • 인접 구간의 연속성을 보여주기 위해 막대는 보통 붙여 그립니다.
  • 분포의 중심, 퍼짐, 치우침을 한눈에 볼 수 있습니다.
10 / 48
02

막대그래프: 범주별 크기를 비교합니다

BAR GRAPH

범주는 떨어져 있고,
순서를 바꿀 수도 있습니다

서로 구분되는 범주의 값을 막대 길이로 표현합니다. 범주가 연속적인 수치일 필요는 없습니다.

히스토그램과 구별: 막대그래프는 범주 사이를 띄우며, 목적에 따라 순서를 재배열할 수 있습니다.

막대그래프 예시

18세 미만 응답자의 코딩 학습 경로

11 / 48
02

파이 차트: 전체와 부분의 비율을 봅니다

파이 차트 예시

전체 합이 100%인 구성비의 예

PIE CHART

‘부분 대 전체’가 핵심

각 조각의 각도와 면적이 전체에서 차지하는 비율을 나타냅니다.

  • 범주 수가 적을 때 가장 읽기 쉽습니다.
  • 비슷한 크기의 조각을 정밀하게 비교할 때는 막대그래프가 더 적합합니다.
  • 조각의 합은 하나의 전체를 의미해야 합니다.
12 / 48
02

선 그래프: 시간에 따른 변화와 추세를 봅니다

LINE PLOT

점의 연결이 변화의 방향을 보여줍니다

시간 순서로 관측된 값을 점으로 표시하고 선으로 연결해 증가·감소·변곡점을 파악합니다.

적합한 데이터: 주가, 기온, 방문자 수, 실험 측정값처럼 시간 순서가 중요한 시계열 데이터

선 그래프 예시

시간에 따른 두 시계열의 변화

13 / 48
02

상자수염그림: 다섯 수치로 분포를 압축합니다

상자수염그림 예시

여러 시점의 분포를 한 공간에서 비교

BOX-AND-WHISKER PLOT

최솟값 · Q1 · 중앙값 · Q3 · 최댓값

여러 수치 자료의 중심과 퍼짐, 이상치를 간결하게 비교할 수 있습니다.

  • 상자: 가운데 50%의 데이터
  • 상자 안 선: 중앙값
  • 수염 바깥 점: 일반적으로 이상치 후보
14 / 48
02

산점도: 두 변수의 관계를 점으로 탐색합니다

SCATTER PLOT

방향 · 강도 · 군집 · 이상치

각 관측값을 좌표의 한 점으로 표시해 두 변수 사이의 패턴을 살펴봅니다.

주의: 산점도에서 관계가 보여도 한 변수가 다른 변수의 원인이라고 단정할 수는 없습니다.

산점도 예시

두 변수의 관계와 군집이 나타난 산점도

15 / 48
02

히트맵: 값의 크기를 색의 차이로 읽습니다

히트맵 예시

공간 분포와 행렬 데이터를 색으로 표현한 예

HEATMAP

많은 값을 빠르게 훑는 시각화

행·열 또는 공간의 각 위치에 대응하는 값을 색상이나 명도로 나타냅니다.

  • 시간대별 지하철 혼잡도
  • 변수 간 상관계수 행렬
  • 지역별 온도·밀도 분포
16 / 48
02

트리맵: 계층과 구성비를 직사각형 안에 담습니다

TREEMAP

큰 범주 안의 작은 범주

전체 사각형을 계층에 따라 나누고, 각 항목의 크기를 면적으로 표현합니다.

적합한 상황: 파일 용량, 예산 구성, 제품군별 매출처럼 계층 구조와 비중을 함께 보여줄 때

트리맵 예시

프로그래밍 언어 비중을 나타낸 트리맵

17 / 48
02

워드클라우드: 단어 빈도를 글자 크기로 표현합니다

워드클라우드 예시

프로그래밍 언어 빈도를 나타낸 워드클라우드

WORD CLOUD

핵심어를 빠르게 보여주는 요약

텍스트에서 자주 나타나는 단어를 크게 표시해 관심 주제나 빈도를 직관적으로 보여줍니다.

한계: 정확한 크기 비교와 맥락 파악에는 적합하지 않습니다. 정밀 비교에는 막대그래프를 함께 사용합니다.

18 / 48
02

통계는 왜 표본만 보고 전체를 말할 수 있을까요?

INFERENTIAL STATISTICS

전체를 모두 조사하기 어렵다면,
대표성 있는 일부를 살펴봅니다.

무작위 표본을 사용하면 표본에서 발견한 패턴을 바탕으로 모집단의 특성을 추정할 수 있습니다.

● ● ● ● ●
● ● ● ● ●
● ● ● ● ●

300 → 30

모집단 300명 중 30명을 무작위로 추출

19 / 48
02

알고 싶은 것은 모집단, 손에 있는 것은 표본입니다

사례: 우리 학교 2학년 300명의 평균 수학 점수는 70점보다 높은가?

모집단

300명

알고 싶은 값
모집단 평균 μ = ?

표본

30명

관찰한 값
표본평균 x̄ = 72점

표본에서 얻은 정보를 이용해 모집단을 추론합니다.

20 / 48
02

기술통계는 먼저 표본의 모습을 요약합니다

표본 30명

평균

72

표준편차

10

표본평균 72점은 조사한 30명의 중심을, 표준편차 10점은 점수의 흩어진 정도를 설명합니다.

5060708085

점수 분포 예시

21 / 48
02

반복 표본추출은 표본평균의 변동을 보여줍니다

한 모집단에서 여러 표본을 추출할 때 표본평균이 달라지고, 그 변동을 신뢰구간에 반영하는 흐름

같은 모집단에서 같은 크기의 표본을 뽑아도 평균은 조금씩 달라집니다.

22 / 48
02

추정은 하나의 숫자보다 범위로 말합니다

95% 신뢰구간

모집단 평균의 추정 범위

68.37275.7

앞에서 확인한 표본평균의 변동(표본오차)을 반영하면, 이 표본의 95% 신뢰구간은 68.3점에서 75.7점입니다. 모집단 평균의 가능한 범위를 제시합니다.

95%는 같은 절차로 표본추출과 구간 계산을 반복할 때, 만들어진 구간의 약 95%가 참값을 포함한다는 의미입니다.

23 / 48
02

가설검정은 ‘70점보다 높다’는 주장을 판단합니다

단측 t검정 · n=30 · 표본평균=72점 · 표준편차=10점

가설

H₀ : μ = 70점
모집단 평균은 기준값과 같다.

H₁ : μ > 70점
모집단 평균은 기준값보다 높다.

검정 결과

p = 0.14

유의수준 5%에서 “전체 평균이 70점보다 높다”는 근거가 충분하지 않습니다.

※ 모집단 평균이 정확히 70점이라고 증명한 것은 아닙니다.

기술통계는 표본을 요약하고, 추론통계는 표본오차를 고려해 모집단을 추정·검정합니다.

24 / 48
SECTION 03

인공지능

예측을 가능하게 하는 기술의 큰 그림 이해하기

인공지능 일러스트
03

예측 분석은 미관측 결과의 가능성을 추정합니다

PREDICTIVE ANALYTICS

과거의 패턴으로
미래 또는 미관측 결과를 예측합니다.

  • 내일의 제품 수요
  • 고객의 이탈 가능성
  • 설비의 고장 위험

인공지능 AI

인간의 지능적 행동—학습, 추론, 인식, 언어 이해, 문제 해결—을 컴퓨터 시스템으로 구현하는 폭넓은 분야입니다.

기계학습, 패턴 인식, 인공신경망, 딥러닝은 AI를 구현하는 대표적인 접근과 기술입니다.

26 / 48
03

AI는 여러 접근과 기술을 포괄하는 큰 개념입니다

인공지능의 개념과 범위

인공지능의 개념 및 범위

AI

인공지능 — 지능적 과업을 수행하는 시스템

ML

기계학습 — 데이터에서 규칙을 학습하는 방법

DL

딥러닝 — 여러 층의 신경망을 활용하는 기계학습 기술

용어는 서로 완전히 나뉘기보다 포함·중첩 관계를 이룹니다.

27 / 48
03

인공지능은 기대와 한계를 반복하며 발전해 왔습니다

1950sAI 개념 정립
튜링 테스트
1960–70s초기 탐색·추론
첫 번째 침체
1980s전문가 시스템
두 번째 침체
1990–2010s통계적 학습
빅데이터·GPU
2020s생성형 AI
대규모 기반모델

핵심 변화: 더 많은 데이터, 향상된 컴퓨팅 성능, 새로운 학습 알고리즘이 함께 발전했습니다.

28 / 48
03

AI는 규칙에서 데이터·기반모델 중심으로 발전했습니다

1세대

규칙 기반

사람이 규칙을 설계

2세대

전문가 시스템

지식베이스와 추론

3세대

기계학습

데이터에서 패턴 학습

4세대

딥러닝·기반모델

표현 학습과 생성

이 구분은 역사를 단순화한 대표 흐름입니다. 실제 기술들은 서로 공존하며 결합됩니다.

29 / 48
SECTION 04

기계학습과 딥러닝

데이터에서 배우는 세 가지 방식과 신경망의 발전

기계학습 일러스트
04

기계학습은 데이터로부터 규칙을 학습합니다

명시적인 모든 규칙을 사람이 코딩하는 대신, 데이터와 경험을 통해 성능을 개선합니다.

SUPERVISED

지도학습

입력과 정답으로
예측 규칙 학습

UNSUPERVISED

비지도학습

정답 없이
구조와 패턴 발견

REINFORCEMENT

강화학습

행동과 보상으로
좋은 전략 학습

기계학습 분야 다이어그램
31 / 48
04

지도학습: 정답이 있는 데이터로 예측합니다

SUPERVISED LEARNING

분류 Classification

결과가 범주일 때
예: 개/고양이, 정상/불량

회귀 Regression

결과가 연속적인 수치일 때
예: 판매량, 온도, 가격

지도학습 알고리즘 예시

회귀, 결정트리, 베이즈, 신경망 알고리즘

32 / 48
04

비지도학습: 정답 없이 데이터의 구조를 찾습니다

비지도학습 알고리즘 예시

군집, 연관규칙, 차원축소, 딥러닝 알고리즘

UNSUPERVISED LEARNING

군집화

서로 비슷한 고객이나 사례를 묶습니다.

연관규칙 학습

장바구니에서 함께 구매되는 품목처럼 동시 발생 패턴을 찾습니다.

차원축소

많은 변수의 핵심 구조를 더 적은 차원으로 요약합니다.

33 / 48
04

강화학습: 행동의 결과로부터 전략을 개선합니다

REINFORCEMENT LEARNING

상태를 보고 행동하고,
보상을 통해 더 나은 정책을 배웁니다.

상태
행동
보상

게임 플레이, 로봇 제어, 자원 배분처럼 연속적인 의사결정 문제에 활용됩니다.

강화학습 개념

에이전트가 환경과 상호작용하며 정책을 학습

34 / 48
04

딥러닝은 여러 층의 신경망을 활용합니다

DEEP LEARNING

데이터의 복잡한 특징을 사람이 일일이 설계하지 않아도, 여러 층을 거치며 계층적으로 학습할 수 있습니다.

분류 축이 다릅니다

지도·비지도·강화학습은 학습 방식, 딥러닝은 모델을 구성하는 기술입니다. 딥러닝 모델은 세 학습 방식 모두에 활용될 수 있습니다.

인공지능, 기계학습, 딥러닝의 포함 관계와 별도의 학습 방식

포함 관계와 학습 방식은 서로 다른 분류 축입니다.

35 / 48
04

퍼셉트론은 뉴런을 단순화한 계산 모델입니다

생물학적 뉴런과 인공신경망 뉴런 모델

생물학적 뉴런에서 영감을 얻은 인공 뉴런

PERCEPTRON

입력의 가중합이 기준을 넘으면 출력

입력값 × 가중치를 모두 더한 뒤, 편향과 활성화 함수를 적용해 출력값을 만듭니다.

  • 가중치: 입력의 중요도
  • 편향: 활성화 기준을 조정
  • 활성화 함수: 출력을 비선형으로 변환
36 / 48
04

깊은 신경망은 표현력과 학습 난이도가 함께 커집니다

신경망이 여러 층으로 발전하는 모습

표현력 증가

복잡한 비선형 패턴과 계층적 특징을 학습

기울기 문제

초기 심층망은 기울기 소실·폭주로 학습이 어려웠음

계산·데이터 부담

더 많은 연산 자원과 충분한 학습 데이터가 필요

37 / 48
04

세 가지 발전이 딥러닝을 현실로 만들었습니다

01

학습 방법

역전파, 활성화 함수,
정규화·최적화

02

데이터

대규모 데이터셋과
효율적 데이터 처리

03

컴퓨팅

GPU·가속기와
분산 학습

CNN

합성곱 신경망
이미지·영상 분석

RNN

순환 신경망
문장·음성·시계열

GAN

생성적 적대 신경망
새로운 데이터 생성

38 / 48
04

딥러닝은 인식·생성·제어의 성능을 크게 높였습니다

다양한 신경망 알고리즘

다양한 신경망 구조의 예

1

음성 — 음성 인식, 합성, 번역

2

이미지 — 분류, 탐지, 생성

3

텍스트 — 질의응답, 요약, 생성

4

제어 — 자율주행, 로봇, 게임

39 / 48
04

기계학습 기법은 ‘문제와 데이터’를 보고 고릅니다

복잡한 모델보다 먼저,
세 가지 질문을 확인하세요.

1

무엇을 알고 싶은가?

분류 · 수치 예측 · 군집 · 규칙 발견

2

정답 데이터가 있는가?

입력과 함께 목표값이 제공되는가?

3

행동의 보상이 있는가?

행동 결과를 평가하고 반복할 수 있는가?

다음 슬라이드에서 질문에 차례로 답하며 기법을 선택합니다.

40 / 48
04

세 가지 질문으로 기계학습 기법을 고릅니다

정답 데이터와 보상 여부에 따라 지도학습, 강화학습, 비지도학습을 선택하는 흐름도

데이터와 목적이 달라지면 같은 문제라도 선택하는 기법이 달라질 수 있습니다.

41 / 48
SECTION 05

데이터 분석가가 갖춰야 할 역량

기술·통계·도메인 지식을 연결해 의미 있는 판단 만들기

협업하는 전문가 일러스트
05

데이터 사이언스는 세 역량이 만나는 지점입니다

컴퓨팅·프로그래밍
수학·통계
도메인 전문성
데이터
사이언스
위험구역
1

컴퓨팅 — 데이터를 다루고 구현하는 힘

2

수학·통계 — 불확실성을 정량적으로 판단하는 힘

3

도메인 — 결과를 맥락 속에서 해석하는 힘

Drew Conway의 Data Science Venn Diagram(2010)을 바탕으로 재구성

43 / 48
05

컴퓨팅·프로그래밍 역량은 분석을 구현합니다

COMPUTING

데이터를 수집하고,
정리하고, 분석하고,
반복 가능한 코드로 만듭니다.

  • 프로그래밍과 데이터 처리
  • 알고리즘과 컴퓨팅 사고
  • 결과 재현과 자동화
프로그래밍하는 분석가

기본적인 프로그래밍 능력 확보

44 / 48
05

수학·통계는 타당한 결론을 이끌어냅니다

수학 및 통계 기반 그래프

수치 자료를 분석하고 해석하는 과정

MATH & STATISTICS

계산보다 중요한 것은
적절한 방법을 선택하는 판단

  • 기본 통계 용어와 확률 이해
  • 분석 가정과 한계 점검
  • 그래프와 수치의 올바른 해석
  • 불확실성을 포함한 결과 전달
45 / 48
05

도메인 전문성은 숫자를 현실의 의미로 번역합니다

DOMAIN EXPERTISE

분석 대상이 놓인
업무·현장·과학적 맥락을 이해해야 합니다.

도메인 지식은 어떤 데이터를 모아야 하는지, 어떤 패턴이 중요한지, 결과가 실제로 가능한지를 판단하게 합니다.

예: 발전기 고장 예측

  • 어떤 센서가 고장 징후를 담는가?
  • 정상 변동과 이상 신호는 어떻게 다른가?
  • 점검·정비 기록과 센서값을 어떻게 연결할까?
  • 잘못된 경보의 현장 비용은 얼마인가?

좋은 모델만으로는 부족합니다. 올바른 문제 정의와 해석이 함께 필요합니다.

46 / 48
05

‘위험구역’은 도메인 맥락을 놓칠 때 생깁니다

① 데이터

결석 15일
과제 미제출 증가

② 분석 결과

“학업중단 위험이 높다”

③ 놓친 맥락

장기 치료로 인한
불가피한 결석

④ 더 나은 판단

예측값만으로 학생을 낙인찍지 않습니다. 교사·상담사와 함께 맥락을 확인한 뒤, 학생에게 필요한 지원을 결정합니다.

분석 결과는 의사결정을 돕는 근거이지, 맥락을 대신하는 판결이 아닙니다.

47 / 48
WRAP-UP

좋은 데이터 분석은
세 가지 역량의 협업에서 완성됩니다.

관심 있는 한 영역에서 시작하되, 다른 분야의 전문가와 협력하며 역량의 폭을 넓혀 갑니다.

컴퓨팅수학·통계도메인 전문성
데이터 분석가들의 협업