방송대 인공지능 10강: 머신러닝 유형과 결정트리 학습
레이블이 없는 사진, 보상만 주어지는 게임, 양성과 음성이 섞인 표본은 같은 방식으로 학습할 수 없습니다. 이 글은 주어진 정보에 맞는 학습 유형을 고르고, 정밀도·재현율로 일반화 결과를 평가하며, 지니 불순도를 계산해 결정트리의 분할을 선택하는 데 필요한 판단 절차를 연결합니다.
학습 방법을 고르기 전에 시스템이 받는 신호부터 확인한다
어떤 과일 사진 모음에는 이름표가 모두 붙어 있고, 다른 모음에는 이름표가 하나도 없다고 하자. 두 데이터의 입력 형식은 사진으로 같지만 시스템이 받는 학습 신호는 다르다. 앞의 데이터는 예측해야 할 답을 직접 알려 주지만, 뒤의 데이터는 입력 사이의 유사한 구조를 스스로 찾아야 한다. 여기에 행동 뒤 보상만 받는 상황까지 더하면 학습 문제의 성격은 완전히 달라진다.
머신러닝은 외부 환경의 정보를 이용해 시스템 내부에 지식을 형성하고 저장하며, 같은 종류의 과제를 다음에는 더 효율적이고 효과적으로 수행하도록 시스템을 적응시키는 과정이다. 따라서 단순히 데이터를 보관했다고 학습이 완료되는 것은 아니다. 데이터에서 얻은 결과가 이후 입력에 대한 수행을 바꾸어야 한다.
판단 핵심: 알고리즘 이름보다 먼저 네 가지를 묻는다. 정답 레이블이 있는가, 레이블을 데이터 자체에서 만들 수 있는가, 이전 과제의 학습 결과가 있는가, 행동의 결과를 보상으로 받는가? 이 답이 학습 유형을 가르는 출발점이다.
레이블·데이터·보상의 조합이 학습 유형을 가른다
| 학습 유형 | 제공되는 정보 | 학습의 초점 | 이 유형을 선택하는 상황 |
|---|---|---|---|
| 지도학습 | 입력과 기대 출력 레이블 | 예측과 레이블의 차이가 줄도록 파라미터 수정 | 정답이 붙은 표본으로 분류·예측 규칙을 학습할 때 |
| 비지도학습 | 입력만 제공 | 유사한 입력에 같은 출력을 주도록 구조 발견 | 정답 없이 군집이나 데이터 구조를 찾을 때 |
| 준지도학습 | 소량의 레이블 표본과 대량의 무레이블 표본 | 두 종류의 데이터를 함께 이용해 경계 개선 | 레이블 작성 비용이 크지만 무레이블 데이터는 많을 때 |
| 자기지도학습 | 무레이블 데이터에서 자동 생성한 레이블 | 데이터 일부를 가리거나 변형해 예측 과제 구성 | 원자료 자체에서 학습 목표를 만들 수 있을 때 |
| 전이학습 | 유사 과제에서 얻은 사전학습 결과 | 필요한 요소를 추가하고 목표 과제에 맞게 미세조정 | 새 과제의 데이터가 적고 관련 사전학습 모델이 있을 때 |
| 강화학습 | 상태, 행동 뒤의 환경 변화와 보상 | 일련의 행동이 만드는 누적 보상을 크게 하는 정책 학습 | 정답 행동을 매번 주기보다 결과의 좋고 나쁨을 알려 줄 때 |
비슷해 보이는 세 유형은 레이블의 출처가 다르다
준지도학습, 자기지도학습, 전이학습은 모두 레이블 부족 문제와 관련될 수 있지만 해결 자원이 다르다. 준지도학습은 실제 레이블이 붙은 소량의 표본을 무레이블 표본과 함께 사용한다. 자기지도학습은 무레이블 데이터에서 일부 단어 가리기처럼 예측 목표를 자동으로 만든다. 전이학습은 이미 다른 데이터와 과제로 학습된 결과를 가져와 목표 시스템에 맞게 조정한다.
강의의 전이학습 사례에서는 ImageNet으로 사전학습한 결과에 객체 검출 요소를 추가하고 PASCAL VOC로 학습한 YOLO를 제시한다. 핵심은 특정 데이터셋 이름을 외우는 데 있지 않다. 이전 과제에서 형성한 표현을 유사한 목표 과제에 재사용한 뒤 미세조정한다는 흐름을 파악해야 한다.
잘못된 판단과 교정: “레이블이 없으면 모두 비지도학습”이라고 보면 자기지도학습을 놓친다. 원래 데이터에 사람이 붙인 레이블은 없어도 알고리즘이 데이터 일부로 예측 목표를 만들면 자기지도학습이다. 반대로 군집처럼 별도의 정답 목표를 만들지 않고 입력 구조를 찾으면 비지도학습이다.
암기보다 일반화가 필요한 이유는 처음 보는 입력 때문이다
기계적 학습 또는 암기식 학습은 문제와 풀이를 그대로 저장해 동일한 상황에서 다시 사용한다. 저장된 입력과 똑같은 문제가 반복된다면 유용하지만, 조금이라도 다른 입력에는 저장된 답을 그대로 적용하기 어렵다. 머신러닝에서는 관찰한 표본 (xᵢ, yᵢ)들로부터 학습 대상 시스템 f를 근사하는 가설 h를 만들어 새로운 입력에도 적용하는 귀납적 학습이 필요하다.
강의의 스카우터 사례는 투수의 구속과 제구력이 각각 임계치보다 높은지 검사해 스카우트 여부를 정하는 규칙을 학습한다. 그러나 학습표본은 실제 가능한 모든 투수의 일부에 불과하다. 어떤 표본을 골랐는지에 따라 임계치와 판단 경계가 달라질 수 있고, 학습에서 보지 못한 사례를 틀리게 분류할 수도 있다.
판단 핵심: 훈련표본을 잘 맞혔다는 사실과 일반화를 잘한다는 사실은 같지 않다. 새 입력에 대한 품질을 판단하려면 정답 레이블과 예측을 비교해 오류의 종류를 구분해야 한다.
학습 데이터의 결함은 규칙의 한계가 아니라 재료의 문제일 수 있다
학습 품질이 낮을 때 모델 구조만 바꾸기 전에 데이터의 세 가지 결함을 점검한다.
- 입력 속성값의 오류: 센서값이나 기록이 부정확하면 잘못된 위치에 표본이 놓인다.
- 레이블 오류: 실제 양성을 음성으로 표시하면 모델은 모순된 경계를 배우게 된다.
- 주요 속성 누락: 판단에 필요한 변수가 빠지면 서로 다른 사례가 같은 입력처럼 보인다.
이 세 결함은 해결책도 다르다. 입력 오류는 측정·정제 과정을 확인하고, 레이블 오류는 판정 기준과 검수 과정을 점검하며, 속성 누락은 어떤 정보가 결과를 구분하는지 다시 설계해야 한다.
분할표는 맞힌 개수보다 어떤 오류를 냈는지 보여 준다
이진 분류에서는 실제 레이블과 분류기의 예측을 교차해 네 경우를 만든다. 양성으로 예측한 표본 중 실제 양성은 참 양성(TP), 실제 음성은 거짓 양성(FP)이다. 음성으로 예측한 표본 중 실제 양성은 거짓 음성(FN), 실제 음성은 참 음성(TN)이다.
| 실제 레이블 | 양성으로 예측 | 음성으로 예측 |
|---|---|---|
| 양성 | TP: 찾아낸 양성 | FN: 놓친 양성 |
| 음성 | FP: 잘못 경보한 음성 | TN: 올바르게 제외한 음성 |
강의 분할표 한 곳에는 True Positive의 약어가 TF로 표시되어 있지만, 이어지는 정밀도·재현율·F1 수식은 모두 TP를 사용합니다. 이 글은 수식과 일반적인 분할표 표기에 맞춰 TP로 통일합니다.
분모가 무엇인지 알면 지표를 선택할 수 있다
| 지표 | 식 | 질문 | 우선하는 상황 |
|---|---|---|---|
| 정밀도 | TP/(TP+FP) | 양성이라고 고른 것 중 실제 양성은 얼마나 되는가? | 거짓 경보 FP의 비용이 클 때 |
| 재현율 | TP/(TP+FN) | 실제 양성 중 얼마나 찾아냈는가? | 놓침 FN의 비용이 클 때 |
| F1 점수 | 2TP/(2TP+FP+FN) | 정밀도와 재현율을 함께 얼마나 확보했는가? | 두 지표의 균형이 필요할 때 |
| 정확도 | (TP+TN)/(TP+TN+FP+FN) | 전체 중 몇 개를 맞혔는가? | 네 경우의 전체 적중률을 볼 때 |
강의 사례의 TP=18, FP=1이면 정밀도는 18/19≈0.95다. TP=18, FN=2이면 재현율은 18/20=0.9다. 임계치를 엄격하게 잡으면 양성 예측 수가 줄어 정밀도가 1.0이면서 재현율이 0.35가 될 수 있고, 임계치를 완화하면 재현율 1.0과 정밀도 0.71이 될 수 있다. 어느 쪽이 무조건 우수한 것이 아니라 오류 비용에 따라 선택이 달라진다.
직접 구성한 성능 계산으로 지표의 분모를 추적한다
학습을 위해 100건을 판정한 분류기를 가정하자. 실제 양성을 맞힌 TP가 24건, 음성을 양성으로 잘못 고른 FP가 6건, 양성을 놓친 FN이 8건, 음성을 맞힌 TN이 62건이라고 하자.
- 정밀도: 양성 예측은 TP+FP=30건이므로 24/30=0.80이다.
- 재현율: 실제 양성은 TP+FN=32건이므로 24/32=0.75이다.
- F1 점수: 2×24/(2×24+6+8)=48/62≈0.774이다.
- 정확도: 맞힌 것은 TP+TN=86건이므로 86/100=0.86이다.
검산은 분할표의 네 칸을 더하는 것부터 시작한다. 24+6+8+62=100이므로 전체 건수와 일치한다. 만약 놓친 양성을 줄이기 위해 임계치를 낮추면 FN은 줄 수 있지만 일부 음성이 양성 영역에 들어와 FP가 늘 수 있다. 그 결과 재현율은 오르고 정밀도는 내려갈 가능성이 있다.
오개념 교정: 정확도 0.86만 보고 이 분류기가 모든 목적에 좋다고 결론 내리면 안 된다. 실제 양성을 놓치는 비용이 큰 문제에서는 FN이 들어가는 재현율을 먼저 보고, 잘못된 양성 경보의 비용이 큰 문제에서는 FP가 들어가는 정밀도를 먼저 봐야 한다.
결정트리는 특징공간을 질문으로 나누어 답에 도달한다
결정트리는 특징공간을 분할정복 방식으로 나누는 지도학습 모델이다. 분류트리는 잎에서 클래스를 출력하고, 회귀트리는 수치 예측값을 출력한다. 루트와 내부노드는 “구속이 θS보다 큰가?”처럼 공간을 나누는 조건을 검사하는 결정노드이고, 잎 노드는 최종 분할영역의 출력을 갖는다.
강의의 스카우트 규칙은 먼저 구속을 검사하고, 참인 표본에 대해 제구력을 다시 검사하는 트리로 바꿀 수 있다. 구속 조건이 거짓이면 즉시 “스카우트 제외” 잎으로 가고, 두 조건이 모두 참일 때만 “스카우트 대상” 잎에 도달한다. 규칙의 AND가 트리에서는 연속된 두 질문으로 구현된 것이다.
학습은 불순한 노드에 더 좋은 질문을 추가하는 과정이다
- 현재 노드에 도달한 학습표본 부분집합의 클래스 구성을 확인한다.
- 불순도가 0이거나 정해진 임계치보다 낮으면 클래스 또는 다수 클래스를 출력하는 잎을 만든다.
- 불순도가 높으면 후보 속성별로 표본을 자식노드에 나눈다.
- 자식노드들의 불순도를 표본 수 비율로 가중해 분할비용을 구한다.
- 가중 불순도가 가장 낮은 속성으로 결정노드를 만들고 각 자식에서 과정을 반복한다.
판단 핵심: 부모노드의 불순도만 낮은 특징을 고르는 것이 아니다. 후보 분할 뒤 만들어지는 모든 자식노드의 불순도를 표본 수로 가중해 비교해야 한다.
엔트로피와 지니 불순도는 클래스가 섞인 정도를 수치화한다
노드에 m개의 표본이 있고 i번째 클래스 표본이 mi개라면 클래스 비율은 pi=mi/m이다. 엔트로피와 지니 불순도는 이 비율로 노드가 얼마나 섞여 있는지 계산한다.
- 엔트로피: φE=−Σ pilog2pi
- 지니 불순도: φG=1−Σ pi2
한 클래스만 있는 노드는 해당 클래스 비율이 1이고 나머지는 0이므로 두 불순도 모두 0이다. 이진 분류에서 두 클래스가 1/2씩 섞이면 지니 불순도는 1−(1/2)2−(1/2)2=0.5로 가장 높다. 강의의 16개 표본 노드는 클래스가 7개와 9개이므로 1−(7/16)2−(9/16)2=1−130/256≈0.492다.
j번째 속성으로 K개의 자식노드를 만들었을 때 분할비용은 C(j)=Σ[mk(j)/m]φk(j)이다. 강의 예에서 첫 번째 특징은 C(1)=(6/16)×0.278+(10/16)×0.32=0.304, 두 번째 특징은 C(2)=(8/16)×0.469+(8/16)×0.5=0.485다. 0.304가 더 낮으므로 첫 번째 특징을 선택한다.
새 표본 12개로 후보 분할을 끝까지 비교해 본다
직접 구성한 예로, 양성 6개와 음성 6개가 섞인 노드에서 특징 A와 특징 B를 후보로 비교한다고 가정하자.
| 후보 | 첫 자식의 클래스 수 | 둘째 자식의 클래스 수 | 가중 지니 불순도 |
|---|---|---|---|
| 특징 A | 4개: 양성 3, 음성 1 | 8개: 양성 3, 음성 5 | (4/12)×0.375+(8/12)×0.469≈0.438 |
| 특징 B | 6개: 양성 5, 음성 1 | 6개: 양성 1, 음성 5 | (6/12)×0.278+(6/12)×0.278=0.278 |
중간 계산을 확인해 보자. 특징 A의 첫 자식은 1−(3/4)2−(1/4)2=0.375이고, 둘째 자식은 1−(3/8)2−(5/8)2=30/64≈0.469다. 따라서 가중값은 약 0.438이다. 특징 B의 각 자식은 5:1로 나뉘므로 1−(5/6)2−(1/6)2=10/36≈0.278이다.
특징 A의 한 자식만 보면 3:1이라 꽤 순수해 보이지만, 다른 큰 자식이 3:5로 섞여 있다. 자식 크기를 무시하고 가장 좋아 보이는 한 노드만 고르면 잘못된 선택을 한다. 전체 표본을 반영한 가중 불순도가 더 낮은 특징 B를 선택해야 한다.
자가 점검: 두 후보의 가중치 합이 각각 1인지 확인해 보자. 특징 A는 4/12+8/12=1, 특징 B는 6/12+6/12=1이다. 가중치가 표본 비율이 아니라 단순히 1/2씩이라면 자식 크기가 다른 특징 A의 실제 분할 품질을 왜곡한다.
핵심 개념 정리
| 판단 단계 | 확인할 정보 | 선택 기준 |
|---|---|---|
| 학습 유형 | 레이블, 자동 목표, 사전학습 결과, 보상 | 시스템이 실제로 받는 학습 신호에 맞춘다. |
| 일반화 평가 | TP, FP, FN, TN과 오류 비용 | 거짓 경보가 중요하면 정밀도, 놓침이 중요하면 재현율을 우선한다. |
| 트리 계속 분할 여부 | 현재 노드의 클래스 혼합 정도 | 불순도가 충분히 낮으면 잎, 높으면 결정노드를 검토한다. |
| 분할 속성 | 각 자식의 크기와 불순도 | 표본 비율로 가중한 분할 불순도가 가장 낮은 후보를 고른다. |
새 머신러닝 문제를 만나면 먼저 “무엇이 학습 신호인가?”로 유형을 정하고, 다음으로 “어떤 오류가 더 비싼가?”로 평가 지표를 고릅니다. 결정트리라면 “현재 노드가 충분히 순수한가?”를 확인한 뒤, 모든 후보에 대해 자식별 클래스 비율 → 불순도 → 표본 수 가중합을 같은 순서로 계산합니다. 이 흐름은 다음 차시의 다른 머신러닝 방법을 배울 때도 입력 정보, 학습 목표, 평가 기준을 분리해 이해하는 기준이 됩니다.
예상문제 10선
1. 머신러닝이 이루어졌다고 판단할 수 있는 변화로 가장 적절한 것은?
정답입니다.
오답입니다. 답안을 다시 선택해 보세요.
정답 및 해설 보기
정답: ④
- ① 오답: 데이터 저장만으로 이후 과제의 수행 방식이 적응적으로 달라졌다고 볼 수 없다.
- ② 오답: 단일 실행의 출력은 학습 결과가 다음 수행을 개선했다는 증거가 아니다.
- ③ 오답: 형성된 지식을 제거하면 경험에 따른 적응적 변화가 남지 않는다.
- ④ 정답: 외부 정보가 내부 지식과 이후 수행의 개선으로 이어지는 머신러닝의 핵심을 충족한다.
2. 소량의 실제 레이블 표본과 대량의 무레이블 표본을 함께 사용하는 학습은?
정답입니다.
오답입니다. 답안을 다시 선택해 보세요.
정답 및 해설 보기
정답: ①
- ① 정답: 실제 레이블이 있는 소량 표본과 없는 대량 표본의 결합이 준지도학습의 조건이다.
- ② 오답: 자기지도학습은 데이터 자체에서 예측 목표를 자동 생성하며 실제 레이블의 혼합이 핵심이 아니다.
- ③ 오답: 전이학습은 유사한 이전 과제에서 얻은 학습 결과를 재사용하고 조정한다.
- ④ 오답: 강화학습의 중심 신호는 행동 뒤에 주어지는 보상이다.
3. 자기지도학습과 비지도학습을 구분하는 기준으로 가장 적절한 것은?
정답입니다.
오답입니다. 답안을 다시 선택해 보세요.
정답 및 해설 보기
정답: ③
- ① 오답: 데이터의 저장 형식은 두 학습 유형의 목표 생성 방식을 구분하지 못한다.
- ② 오답: 두 유형 모두 사람이 붙인 레이블 없이 시작할 수 있어 결정적 기준이 아니다.
- ③ 정답: 가린 단어 예측처럼 원자료에서 레이블 역할의 목표를 만드는 것이 자기지도학습의 특징이다.
- ④ 오답: 행동과 보상을 연결하는 것은 강화학습을 판별하는 기준이다.
4. 훈련표본을 모두 맞힌 가설이면 처음 보는 입력도 반드시 맞힌다는 주장에 대한 판단은?
정답입니다.
오답입니다. 답안을 다시 선택해 보세요.
정답 및 해설 보기
정답: ②
- ① 오답: 강의는 학습 예가 실제 가능한 모든 경우 중 일부임을 전제로 한다.
- ② 정답: 제한된 관찰에서 만든 가설이므로 미관찰 입력에서 오류가 날 수 있고 표본 선택도 결과에 영향을 준다.
- ③ 오답: 귀납은 일반화된 가설을 만들지만 모든 새 사례의 참을 연역적으로 보장하지 않는다.
- ④ 오답: 동일 입력에만 저장 답을 쓰는 것은 암기식 학습이며 일반화의 목적은 유사한 새 입력까지 다루는 것이다.
5. TP=24, FP=6, FN=8일 때 F1 점수에 가장 가까운 값은?
정답입니다.
오답입니다. 답안을 다시 선택해 보세요.
정답 및 해설 보기
정답: ④
- ① 오답: 24/(24+8)=0.75로 계산한 재현율이며 FP가 반영되지 않았다.
- ② 오답: 24/(24+6)=0.80으로 계산한 정밀도이며 FN이 반영되지 않았다.
- ③ 오답: TN=62까지 포함한 정확도 값으로 F1의 분모와 다르다.
- ④ 정답: 2TP/(2TP+FP+FN)=48/(48+6+8)=48/62≈0.774이다.
6. 실제 양성을 놓치는 비용이 특히 큰 분류 문제에서 먼저 확인할 지표는?
정답입니다.
오답입니다. 답안을 다시 선택해 보세요.
정답 및 해설 보기
정답: ②
- ① 오답: 양성 놓침은 FN이므로 TN만 보는 값으로는 핵심 오류를 평가할 수 없다.
- ② 정답: 실제 양성 TP+FN 중 찾아낸 비율을 측정해 FN이 늘면 직접 낮아진다.
- ③ 오답: 정밀도는 양성 예측 중 FP를 얼마나 억제했는지에 초점을 둔다.
- ④ 오답: 전체 건수는 어떤 종류의 오류가 발생했는지 알려 주지 않는다.
7. 결정트리의 잎 노드에 대한 설명으로 옳은 것은?
정답입니다.
오답입니다. 답안을 다시 선택해 보세요.
정답 및 해설 보기
정답: ①
- ① 정답: 더 분할하지 않는 최종 영역에서 분류 클래스나 회귀값을 출력하는 노드다.
- ② 오답: 공간을 나누는 조건과 분할 판단은 루트 또는 내부 결정노드의 역할이다.
- ③ 오답: 전체 표본에서 시작하는 노드는 루트이며 잎은 경로의 끝에 있다.
- ④ 오답: 불순도가 충분히 낮으면 자식을 만들지 않고 잎으로 종료한다.
8. 이진 클래스가 7개와 9개로 섞인 16개 표본 노드의 지니 불순도는?
정답입니다.
오답입니다. 답안을 다시 선택해 보세요.
정답 및 해설 보기
정답: ④
- ① 오답: 강의의 첫 번째 특징으로 분할한 뒤 자식 불순도를 가중한 C(1) 값이다.
- ② 오답: 3:1로 나뉜 4개 표본의 지니 불순도이며 현재 7:9 비율과 다르다.
- ③ 오답: 강의의 두 번째 특징 분할비용 C(2)이며 분할 전 노드의 불순도가 아니다.
- ④ 정답: 1−(7/16)²−(9/16)²=1−130/256≈0.492로 계산한다.
9. 불순도가 높은 결정트리 노드에서 다음 분할을 선택하는 올바른 절차는?
정답입니다.
오답입니다. 답안을 다시 선택해 보세요.
정답 및 해설 보기
정답: ③
- ① 오답: 한 자식만 보면 나머지 표본이 얼마나 섞였는지와 전체 분할 품질을 놓친다.
- ② 오답: 후보 간 차이는 분할 뒤 자식 구성에서 생기므로 부모 불순도만으로 비교할 수 없다.
- ③ 정답: 모든 자식의 불순도를 해당 표본 비율로 반영한 C(j)를 최소화하는 것이 분할 기준이다.
- ④ 오답: 불순도가 높다면 종료보다 적절한 결정노드를 만들어 분할할지 검토해야 한다.
10. 직접 구성한 12개 표본 예에서 특징 A의 가중 지니 불순도는 약 0.438, 특징 B는 0.278이다. 선택과 이유는?
정답입니다.
오답입니다. 답안을 다시 선택해 보세요.
정답 및 해설 보기
정답: ②
- ① 오답: 자식 크기가 다르다는 사실만으로 분할 품질이 좋아지지 않으며 가중 불순도는 A가 더 높다.
- ② 정답: 같은 기준으로 계산한 C(j)가 0.278로 더 작아 클래스가 덜 섞인 자식들을 만든다.
- ③ 오답: 결정트리는 후보 중 가중 불순도가 낮아지는 분할을 선택한다.
- ④ 오답: 같은 크기의 자식도 각 자식 안에서 클래스가 반반이면 불순도가 높을 수 있다.
참고 자료와 작성 기준
이 글은 해당 차시 강의자료를 바탕으로 학습 목적에 맞게 재구성한 비공식 학습자료입니다. 학습 유형의 선택 기준, 직접 구성한 분류 성능·지니 불순도 계산, 오류 원인과 문제 해설은 학습자가 같은 절차를 재현하도록 구성하고 검토했습니다.
- 작성·편집: 올에이클래스 학습연구팀
- 주요 근거: 한국방송통신대학교 컴퓨터과학과 「인공지능」 10강 ‘머신러닝(1)’ 강의록(2025)
- 보충 자료: 외부 보충 자료를 사용하지 않음
- 편집 원칙: 올에이클래스 편집 정책
- 최종 내용 검토: 2026-08-17
댓글
댓글 쓰기