1데이터리포트
2특징 공간
3결정 경계
4혼동행렬 네 칸
5정밀도 × 재현율
6과적합
SCORE0

경계선을 찾아라!혼동행렬 네 칸 미션

MISSION BRIEFING

금요일 오후, 지호의 동아리 발표회 초대 메일이 스팸함에 갇혔다.
스팸 필터는 무엇을 기준으로 메일을 나누었을까? 그 기준은 누가 정했을까?
6개의 미션을 통과하며 분류 모델이 경계를 배우는 과정과,
그 성능을 제대로 평가하는 방법을 파헤쳐 보자.

MISSION 1 · DEEP READ

데이터리포트 「경계선을 어디에 그을 것인가」

숫자 카드를 클릭해 리드 수치를 공개하라. 그리고 짝과 30초, 이유를 추측하라.

DATA REPORT

같은 스팸 분류 과제, 성적표는 왜 이렇게 다른가

※ 특정 제품의 순위가 아니라, 조건에 따라 성능이 벌어진다는 사실을 보여 주는 자료
정확도 (같은 과제)
80.0% ~ 99.2%
최고와 최저의 격차 19.2%p
클릭해서 수치 공개
거짓 양성률 (정상을 스팸으로 오판)
1.6% ~ 12.0%
최대 7.5배 차이
클릭해서 수치 공개
정확도 80.0%─ 같은 과제인데 19.2%p 차이 ─99.2%
짝과 30초 추측!
"왜 이렇게 벌어질까?"
30
Q. 같은 과제인데 성능이 이렇게 벌어지는 가장 근본적인 이유는?
MISSION 2 · 개념 짚기 ①

특징 공간 : 데이터를 좌표 위의 점으로

과일 카드의 특징값(당도 × 무게)을 읽고, 특징 공간의 올바른 위치를 클릭하라!

CONCEPT

색·무게·당도처럼 데이터를 설명하는 값을 특징(feature)이라 한다. 당도를 x축, 무게를 y축으로 삼으면 과일 하나하나가 평면 위의 점이 된다.
이렇게 특징값을 좌표로 나타낸 공간이 특징 공간이다.
사과 1호
당도 (Brix)
14
무게 (g)
260
이 과일은 특징 공간의 어느 점일까?
MISSION 3 · 개념 짚기 ②

결정 경계 : 오류를 줄이는 경계를 찾아가라

슬라이더로 경계선을 움직여 오분류를 줄여라. 학습이란 바로 이 과정이다! (목표: 정확도 88% 이상)

경계선 기울기 -0.30
경계선 위치(높이) 55
현재 경계의 정확도
62.5%
오분류 15개 / 전체 40개
겹침 구간 때문에 완벽한 경계는 불가능하다. 그것이 실제 데이터다!
최고 기록에 도전해 보자. (이 데이터의 최고치는 90%)
MISSION 4 · 개념 짚기 ③ (핵심 미션)

혼동행렬의 네 칸을 채워라

메일 카드를 알맞은 칸으로 끌어다 놓아라. (카드를 클릭한 뒤 칸을 눌러도 된다 · 양성 = 스팸)

오늘 도착한 메일 8통

남은 카드 8
지호의 초대 메일이 바로 거짓 양성(FP)! 정상 메일인데 스팸으로 판정되어 스팸함에 갇혔다.
두 오류(FP·FN) 중 어느 쪽이 더 나쁜지는 상황에 따라 다르다. 다음 미션에서 확인하자.
실제 ↓ \ 판정 →
스팸으로 판정필터: "스팸함으로!"
정상으로 판정필터: "받은편지함으로!"
실제 스팸진짜 광고·피싱
TP
참 양성
스팸을 스팸이라고, 정답!
FN
거짓 음성
스팸을 정상으로, 스팸이 통과!
실제 정상진짜 필요한 메일
FP
거짓 양성
정상을 스팸으로, 소중한 메일이 갇힘!
TN
참 음성
정상을 정상이라고, 정답!
MISSION 5 · 개념 짚기 ④

정확도만으로 부족한 이유 : 정밀도 × 재현율

임계값 슬라이더를 움직여 보라. 한쪽을 올리면 다른 쪽이 내려간다. 이것이 상충 관계다!

스팸 판정 임계값

얼마나 의심스러워야 스팸함으로 보낼까?
왼쪽일수록 조금만 의심돼도 스팸 판정(느슨), 오른쪽일수록 확실할 때만 스팸 판정(엄격)
느슨하게 판정 ─ ─ ─ 엄격하게 판정
정밀도스팸 판정 중 진짜 스팸 비율,
FP가 적을수록 ↑
88%
재현율실제 스팸 중 잡아낸 비율,
FN이 적을수록 ↑
88%
임계값정밀도재현율무슨 일이?

WHY NOT ACCURACY?

정확도는 하나의 숫자로 전체를 뭉뚱그린다. 하지만 오류에는 두 종류(FP·FN)가 있고, 정밀도와 재현율은 한쪽을 올리면 다른 쪽이 내려가는 상충 관계다.
그래서 성능은 과제의 성격에 맞는 지표로 읽어야 한다.
Q1. 임계값을 엄격하게 올리면?
Q2. 암 진단처럼 "놓치면 안 되는" 과제에서 더 중요한 지표는?
MISSION 6 · 개념 짚기 ⑤

훈련 데이터 vs 평가 데이터 : 최고의 모델을 뽑아라

세 모델 중 병원에 실제로 배치할 모델 하나를 클릭하라. 성적표를 잘 읽을 것!

"본 문제만 잘 푸는 학생". 문제집을 통째로 외운 학생은 새 문제 앞에서 무너진다.
경계가 훈련 데이터를 따라 지나치게 구불구불해지면, 학습에 쓰지 않은 평가 데이터에서 성능이 무너진다. 이것이 과적합이다.

미션 완료!

등급 산정 중…
0
WRAP-UP   좋은 모델은 새 데이터(평가 데이터)에서도 잘 맞는 모델이다.
성능 수치는 데이터의 구성과 함께 읽어야 한다.