방송대 인공지능 11강: 선형·로지스틱 회귀와 k-평균 군집화
공부 시간을 입력받아 점수를 예측할 때, 합격 확률을 계산할 때, 정답표 없이 비슷한 학생을 묶을 때는 무엇이 달라질까? 세 문제는 모두 수치 벡터를 다루지만 출력의 의미, 비용함수, 갱신 대상이 다르다. 이 차이를 계산으로 추적하면 선형회귀·로지스틱 회귀·k-평균을 이름이 아니라 작동 원리로 구분할 수 있다.
먼저 출력이 숫자인지 확률인지 군집인지 확인한다
입력 x가 같아도 원하는 답에 따라 학습 문제는 달라진다. 공부 시간에서 시험 점수처럼 연속적인 수치를 예측하려면 회귀가 알맞다. 합격·불합격처럼 두 범주를 나누려면 클래스 1의 확률을 계산하는 로지스틱 회귀를 사용할 수 있다. 정답 레이블 없이 비슷한 표본끼리 묶으려면 군집화를 검토한다.
| 질문 | 원하는 출력 | 대표 방법 | 학습에서 움직이는 값 |
|---|---|---|---|
| 예상 점수는 얼마인가? | 연속적인 수치 | 선형회귀 | 직선·초평면의 가중치 w |
| 합격일 확률은 얼마인가? | 0과 1 사이 확률과 클래스 | 로지스틱 회귀 | 확률 경계를 만드는 가중치 w |
| 어떤 표본끼리 비슷한가? | 레이블 없는 군집 번호 | k-평균 군집화 | k개의 평균벡터 |
판단 핵심: 알고리즘 이름보다 목표 출력과 레이블의 존재를 먼저 본다. 로지스틱 ‘회귀’는 이름에 회귀가 들어가지만 강의 범위에서는 0·1 분류에 쓰인다.
선형회귀는 입력과 연속 출력의 관계를 직선으로 근사한다
회귀분석(regression analysis)은 입력인 독립변수와 그에 따라 달라지는 종속변수의 관계를 추정한다. 선형회귀는 이 관계를 선형함수로 모델링한다. 독립변수가 하나이면 HL(x)=w0+w1x인 단순 선형회귀이고, 독립변수가 d개이면 HL(x)=w0+w1x1+…+wdxd인 다중 선형회귀다.
w0는 모든 입력이 0일 때의 절편이고 wj는 다른 조건이 같을 때 xj가 한 단위 변할 때 예측값이 얼마나 변하는지를 나타낸다. 편향 항을 포함한 x=(1,x1,…,xd)T, w=(w0,w1,…,wd)T로 쓰면 두 경우 모두 HL(x)=wTx로 정리된다.
해석 경계: 선형회귀가 찾는 것은 표본에 가장 잘 맞는 선형 관계다. 상관관계를 모델링했다고 해서 입력이 출력의 원인이라는 사실까지 자동으로 증명되는 것은 아니다.
오차를 제곱해 평균내면 좋은 직선의 기준이 생긴다
i번째 표본 (x(i),y(i))에서 예측과 실제값의 차이 HL(x(i))-y(i)를 잔차라고 하자. 평균제곱오차(MSE)는 잔차를 제곱해 모두 더한 뒤 표본 수 m으로 나눈다.
CMSE(w)=(1/m)Σ[HL(x(i))-y(i)]2
제곱하기 때문에 양·음 오차가 서로 상쇄되지 않고 큰 오차에는 더 큰 비용이 부여된다. 학습 목표는 표본의 MSE를 가장 작게 만드는 가중치 w를 찾는 것이다. 한 점만 정확히 통과하는 직선이 아니라 모든 표본의 잔차를 함께 평가한다.
경사하강법 한 번을 직접 계산하면 부호가 보인다
경사하강법은 현재 가중치에서 비용이 가장 빠르게 커지는 기울기를 구하고, 그 반대 방향으로 학습률 η만큼 이동한다. 단순 선형회귀에서는 다음 두 기울기를 사용한다.
- ∂CMSE/∂w0=(2/m)Σ[HL(x(i))-y(i)]
- ∂CMSE/∂w1=(2/m)Σ[HL(x(i))-y(i)]x(i)
직접 구성한 표본 (1,3), (2,5), 초기값 w0=0, w1=1, 학습률 η=0.1을 사용해 한 번 갱신해 보자.
- 현재 예측은 HL(1)=1, HL(2)=2이고 잔차는 -2, -3이다.
- 초기 MSE는 [(-2)²+(-3)²]/2=6.5다.
- w0 기울기는 (2/2)(-2-3)=-5다.
- w1 기울기는 (2/2)[(-2)×1+(-3)×2]=-8이다.
- 새 가중치는 w0=0-0.1×(-5)=0.5, w1=1-0.1×(-8)=1.8이다.
- 새 예측은 2.3과 4.1, 새 MSE는 [(-0.7)²+(-0.9)²]/2=0.65다.
기울기가 음수일 때 빼기 연산을 하면 가중치는 증가한다. ‘항상 가중치를 줄인다’가 아니라 비용이 내려가는 방향으로 이동한다고 이해해야 한다. 한 반복의 새 w0와 w1은 모두 같은 이전 가중치에서 계산하며, w0를 먼저 바꾼 뒤 그 새 값을 w1 계산에 섞지 않는다.
학습률은 방향이 아니라 한 번에 움직일 거리를 정한다
업데이트는 w(k+1)=w(k)-η∇C(w(k))로 쓴다. 기울기는 어느 방향으로 이동할지를 결정하고, η는 이동 크기를 조절한다. η가 너무 크면 최소점을 지나쳐 비용이 진동하거나 커질 수 있고, 너무 작으면 안정적이어도 수렴이 느리다.
강의의 세 표본 (1,2), (2,3), (3,4)에서는 반복할수록 w0와 w1이 약 1에 가까워지고 가설이 HL(x)≈1+x로 수렴한다. 0회 비용 3.0567이 500회 0.0021, 3000회에는 거의 0으로 감소한다. 반복 횟수만 보는 것이 아니라 비용이 실제로 줄고 있는지 함께 확인해야 한다.
검산 기준: 한 번 갱신한 뒤 같은 표본으로 비용을 다시 계산한다. 비용이 늘었다면 미분 부호, 학습률, 동시 업데이트 여부를 먼저 확인한다.
다중 선형회귀도 벡터 하나로 같은 학습을 수행한다
독립변수가 둘 이상이어도 원리는 바뀌지 않는다. x=(1,x1,…,xd)T와 w를 사용하면 예측은 HL(x)=wTx이고 MSE 기울기는 다음처럼 한 벡터로 표현된다.
∇CMSE(w)=(2/m)Σ[HL(x(i))-y(i)]x(i)
업데이트 w(k+1)=w(k)-η∇CMSE(w(k))는 절편과 모든 특징 가중치를 함께 바꾼다. 단순 선형회귀의 두 식이 다중 선형회귀에서 사라진 것이 아니라 벡터의 각 성분으로 묶인 것이다.
로지스틱 회귀는 선형점수를 확률로 눌러 담는다
선형함수 wTx는 음수부터 큰 양수까지 제한 없이 출력한다. 이를 합격 확률처럼 0과 1 사이 값으로 해석할 수는 없다. 로지스틱 함수 S(z)=1/(1+e-z)는 선형점수 z=HL(x)를 0과 1 사이로 변환한다.
로지스틱 가설은 HS(x)=S(HL(x))=1/(1+e-(wTx))이다. z=0이면 HS=0.5이고, z가 양수로 커질수록 1에, 음수로 작아질수록 0에 가까워진다. 따라서 임계값을 0.5로 둘 때 결정경계는 HS(x)=0.5와 같은 HL(x)=0이다.
오개념 교정: 로지스틱 회귀가 선형회귀의 예측값을 0 또는 1로 잘라 쓰는 것은 아니다. 선형점수를 시그모이드로 확률화하고, 그 확률을 기준으로 클래스를 정한다.
같은 선형점수도 임계값에서 클래스가 갈린다
학습용으로 w=(-3,1,1), x=(1,x1,x2)T를 가정하자. 선형점수는 z=-3+x1+x2다.
| 입력 (x1,x2) | z 계산 | HS(x) | 0.5 기준 판정 |
|---|---|---|---|
| (2,2) | -3+2+2=1 | 약 0.731 | 클래스 1 |
| (1,1) | -3+1+1=-1 | 약 0.269 | 클래스 0 |
| (1,2) | -3+1+2=0 | 0.5 | 결정경계 |
결정경계 -3+x1+x2=0은 직선이다. 시그모이드 곡선은 확률을 비선형으로 바꾸지만, 입력공간에서 경계 자체는 선형점수가 0인 초평면이다.
교차 엔트로피는 자신 있게 틀린 예측을 크게 벌준다
이진 로지스틱 회귀의 비용은 이진 교차 엔트로피를 사용한다.
CCE(w)=(1/m)Σ[-y(i)ln HS(x(i))-(1-y(i))ln(1-HS(x(i)))]
정답 y=1인 한 표본에서 예측확률이 0.8이면 손실은 -ln(0.8)≈0.223이다. 같은 정답에 0.2를 예측하면 -ln(0.2)≈1.609로 훨씬 커진다. y=0일 때는 반대로 1-HS의 로그를 본다. 실제 클래스에 높은 확률을 줄수록 손실이 작아진다.
기울기는 ∇CCE(w)=(1/m)Σ[HS(x(i))-y(i)]x(i)이고 w(k+1)=w(k)-η∇CCE(w(k))로 갱신한다. 선형회귀와 업데이트 뼈대는 같지만 예측함수와 비용함수가 다르다.
다항 로지스틱 회귀는 여러 점수를 하나의 확률분포로 만든다
클래스가 세 개 이상이면 클래스마다 선형점수 HLi(x)를 계산하고 소프트맥스로 확률을 만든다.
ŷi=eHLi(x)/Σj eHLj(x)
직접 구성한 로짓이 (2,1,0)이라고 하자. 지수값은 약 (7.389,2.718,1)이고 합은 11.107이다. 소프트맥스 확률은 약 (0.665,0.245,0.090)이며 합은 1이다. 첫 번째 클래스의 확률이 가장 크므로 첫 번째 클래스(클래스 1)로 분류한다.
학습표본의 정답은 (1,0,0), (0,1,0)처럼 원-핫 벡터로 표현할 수 있다. 다중 클래스 교차 엔트로피는 정답 클래스에 부여한 확률의 로그를 중심으로 비용을 계산하고, 각 클래스의 가중치를 경사하강법으로 갱신한다.
세 회귀 모형은 출력과 비용을 함께 맞춰야 한다
| 판단축 | 선형회귀 | 이진 로지스틱 회귀 | 다항 로지스틱 회귀 |
|---|---|---|---|
| 목표 | 연속값 예측 | 두 클래스 확률·분류 | 세 클래스 이상 확률·분류 |
| 마지막 함수 | 선형점수 그대로 | 시그모이드 | 소프트맥스 |
| 대표 비용 | MSE | 이진 교차 엔트로피 | 다중 클래스 교차 엔트로피 |
| 결정 | 수치 예측값 사용 | 확률 임계값 적용 | 가장 큰 확률의 클래스 선택 |
‘경사하강법을 쓴다’는 공통점만으로 같은 모델이라고 판단하면 안 된다. 무엇을 예측하는지에 맞춰 가설과 비용함수를 함께 선택해야 한다.
군집화는 정답표 없이 데이터의 내부 묶음을 찾는다
군집화(clustering)는 패턴 집합을 같은 종류라고 볼 수 있는 몇 개의 부분집합으로 나누는 비지도학습이다. 분류는 학습표본에 클래스 레이블이 있지만, 군집화는 레이블 없이 거리와 분포 구조를 이용한다. 만들어진 군집 번호는 기존의 의미 있는 클래스 이름과 자동으로 같아지는 것이 아니다.
k-평균 군집화는 표본을 대표할 k개의 평균벡터를 찾는다. k를 먼저 지정하고 초기 평균벡터를 정한 뒤, 표본 배정과 평균 재계산을 반복한다.
k-평균은 배정과 평균 갱신을 번갈아 수행한다
- k개의 평균벡터 m1,…,mk의 초기 위치를 선택한다.
- 각 표본을 가장 가까운 평균벡터의 군집에 배정한다.
- 군집별 표본 합 mSum[j]와 개수 c[j]를 누적한다.
- c[j]가 0이 아니면 m[j]=mSum[j]/c[j]로 평균벡터를 바꾼다.
- 평균벡터가 더 이상 변하지 않을 때까지 반복한다.
c[j]≠0 조건은 중요한 방어 장치다. 어떤 군집에도 표본이 배정되지 않으면 0으로 나눌 수 없으므로 그 중심을 평균으로 갱신할 수 없다. 따라서 c[j]=0인 경우에는 해당 중심을 평균으로 갱신할 수 없으므로 별도의 처리가 필요하다.
네 점을 두 군집으로 묶어 수렴을 확인한다
직접 구성한 1차원 표본 {1,2,8,9}, k=2, 초기 평균 m1=1, m2=8을 가정한다.
- 거리 비교 결과 1과 2는 m1, 8과 9는 m2에 더 가깝다.
- 첫 군집의 새 평균은 (1+2)/2=1.5다.
- 둘째 군집의 새 평균은 (8+9)/2=8.5다.
- 새 평균으로 다시 배정해도 {1,2}와 {8,9}가 유지된다.
- 평균도 1.5와 8.5로 변하지 않으므로 수렴한다.
이 예에서는 분리가 뚜렷하지만 실제 자료에서는 초기 평균의 위치에 따라 서로 다른 군집 결과에 수렴할 수 있다. k-평균은 k를 스스로 정하지 않으며 초기값에 독립적인 단 하나의 답을 항상 보장하지도 않는다.
오류 원인: 평균벡터를 갱신한 뒤에도 이전 배정을 그대로 쓰면 반복의 의미가 없다. 매 반복마다 새 평균에 대한 최근접 군집을 다시 계산해야 한다.
새 문제에서는 네 가지 선택을 순서대로 점검한다
- 목표 출력: 연속값, 이진 확률, 다중 클래스 확률, 레이블 없는 군집 중 무엇인가?
- 가설: 선형점수 그대로 쓸지, 시그모이드나 소프트맥스를 적용할지 정한다.
- 비용과 갱신: MSE 또는 교차 엔트로피를 선택하고 기울기·학습률·비용 감소를 확인한다.
- 비지도 여부: 레이블이 없다면 분류 손실을 억지로 만들지 말고 k와 거리, 초기 중심, 수렴 조건을 점검한다.
모델이 실패하면 마지막 결과만 보지 않는다. 선형회귀는 잔차와 MSE, 로지스틱 회귀는 확률과 교차 엔트로피, k-평균은 배정과 중심 이동을 추적하면 어느 단계에서 잘못되었는지 찾을 수 있다.
핵심 개념 정리
- 연속값: 선형회귀는 wTx로 예측하고 MSE가 작아지도록 가중치를 갱신한다.
- 이진 확률: 로지스틱 회귀는 선형점수를 시그모이드에 넣고 교차 엔트로피로 학습한다.
- 다중 확률: 클래스별 선형점수를 소프트맥스로 정규화하고 가장 큰 확률을 선택한다.
- 경사하강: 기울기의 음의 방향으로 이동하며 학습률은 한 번의 이동 크기를 정한다.
- 레이블 없는 묶음: k-평균은 최근접 중심 배정과 군집 평균 재계산을 중심이 멈출 때까지 반복한다.
- 오류 점검: 출력의 의미와 가설·비용함수·갱신 대상이 서로 맞는지 확인한다.
문제를 받으면 먼저 답의 형태와 레이블 유무를 확인한다. 연속값이면 선형가설과 MSE, 이진·다중 분류이면 시그모이드·소프트맥스와 교차 엔트로피를 연결한다. 학습에서는 예측→오차→기울기→가중치 갱신→비용 재검산을 반복하고, 레이블이 없다면 표본 배정→평균 갱신→재배정의 군집화 흐름으로 전환한다. 다음 차시의 신경망에서도 이 가설·비용·갱신의 연결이 기본 골격이 된다.
예상문제 10선
1. 공부 시간으로 시험 점수와 합격 여부를 각각 예측하려 할 때 알맞은 방법의 조합은?
정답입니다.
오답입니다. 답안을 다시 선택해 보세요.
정답 및 해설 보기
정답: ②
- ① 오답: k-평균은 정답 없는 묶음을 찾는 방법이고 합격 여부 같은 이진 출력을 선형회귀로 직접 제한하지 못한다.
- ② 정답: 연속 점수에는 선형회귀, 0·1 클래스 확률에는 로지스틱 회귀가 목표 출력과 맞는다.
- ③ 오답: 두 방법의 출력 역할을 바꾸었고 k-평균은 합격 레이블을 학습하지 않는다.
- ④ 오답: 점수와 합격 여부라는 목표값이 주어지므로 두 문제 모두 비지도 군집화가 아니다.
2. 선형회귀의 평균제곱오차를 올바르게 설명한 것은?
정답입니다.
오답입니다. 답안을 다시 선택해 보세요.
정답 및 해설 보기
정답: ④
- ① 오답: 가장 큰 클래스 확률 선택은 다항 분류의 결정 과정이지 MSE 정의가 아니다.
- ② 오답: MSE는 학습표본의 회귀 예측 오차를 평가하며 군집 중심끼리만 비교하지 않는다.
- ③ 오답: 잔차를 제곱하지 않으면 양과 음이 상쇄되어 큰 오차를 숨길 수 있다.
- ④ 정답: 모든 표본의 잔차 제곱을 합하고 표본 수로 나눈 값이 MSE다.
3. 표본 (1,3), (2,5), 초기 w0=0, w1=1일 때 초기 MSE는?
정답입니다.
오답입니다. 답안을 다시 선택해 보세요.
정답 및 해설 보기
정답: ①
- ① 정답: 예측 1과 2의 잔차가 -2와 -3이므로 제곱합 13을 표본 수 2로 나누면 6.5다.
- ② 오답: 13은 잔차 제곱의 합이며 평균을 내지 않은 값이다.
- ③ 오답: 5는 잔차 절댓값의 합으로 MSE의 제곱 연산을 적용하지 않았다.
- ④ 오답: 잔차 절댓값 합을 평균낸 값이며 비용함수 정의와 다르다.
4. 경사하강법의 한 반복을 올바른 순서로 나타낸 것은?
정답입니다.
오답입니다. 답안을 다시 선택해 보세요.
정답 및 해설 보기
정답: ③
- ① 오답: 레이블과 군집 배정은 회귀 경사하강의 가중치 업데이트 단계가 아니다.
- ② 오답: 최소점을 미리 아는 것이 아니라 현재 기울기와 학습률로 반복해 접근한다.
- ③ 정답: 현재 상태에서 기울기를 구해 이동하고 비용 감소를 검산하는 흐름이 경사하강의 핵심이다.
- ④ 오답: 앞부분은 k-평균 과정이고 뒤의 가중치 미분과 연결되지 않는다.
5. 로지스틱 가설에서 선형점수 z=0일 때 HS(x)는?
정답입니다.
오답입니다. 답안을 다시 선택해 보세요.
정답 및 해설 보기
정답: ①
- ① 정답: S(0)=1/(1+e⁰)=1/2이며 0.5 임계값을 쓸 때 결정경계에 해당한다.
- ② 오답: 시그모이드는 유한한 z에서 정확히 0이 되지 않고 z가 매우 작을 때 0에 가까워진다.
- ③ 오답: z가 매우 큰 양수일 때 1에 가까워질 뿐 z=0의 값은 아니다.
- ④ 오답: e는 지수 계산의 밑이며 시그모이드의 확률 출력이 아니다.
6. 로지스틱 회귀에 대한 설명 중 잘못된 것은?
정답입니다.
오답입니다. 답안을 다시 선택해 보세요.
정답 및 해설 보기
정답: ④
- ① 오답: 시그모이드로 확률 범위에 매핑하는 것은 로지스틱 가설의 정확한 구조다.
- ② 오답: 실제 클래스 확률을 높이도록 이진 교차 엔트로피를 최소화한다.
- ③ 오답: S(0)=0.5이므로 해당 임계값에서 선형점수 0이 경계가 된다.
- ④ 정답: 로지스틱 회귀는 시그모이드 가설과 교차 엔트로피를 함께 학습하며 선형회귀 결과의 단순 반올림이 아니다.
7. 다항 로지스틱 회귀의 로짓이 (2,1,0)일 때 소프트맥스 결과에 대한 설명은?
정답입니다.
오답입니다. 답안을 다시 선택해 보세요.
정답 및 해설 보기
정답: ②
- ① 오답: 로짓은 확률이 아니며 지수화 후 전체 지수합으로 나눠야 한다.
- ② 정답: e², e¹, e⁰을 그 합으로 나누면 해당 근삿값이 되고 첫 항이 가장 크다.
- ③ 오답: 소프트맥스 뒤 가장 큰 확률을 선택하며 로짓 순위도 클래스 1이 가장 높다.
- ④ 오답: 독립 시그모이드 값들의 합은 일반적으로 1이 아니며 소프트맥스가 공동 정규화를 수행한다.
8. k-평균 군집화의 한 반복을 올바르게 설명한 것은?
정답입니다.
오답입니다. 답안을 다시 선택해 보세요.
정답 및 해설 보기
정답: ③
- ① 오답: k-평균은 레이블 없이 수행하며 교차 엔트로피 경사학습이 기본 절차가 아니다.
- ② 오답: 표본 배정 뒤 중심을 새 군집 평균으로 갱신해야 다음 반복의 경계가 달라진다.
- ③ 정답: 배정과 평균 갱신을 번갈아 수행하는 것이 알고리즘의 핵심 골격이다.
- ④ 오답: 가장 가까운 중심을 선택하며 중심도 배정 결과에 맞춰 변경한다.
9. 표본 {1,2,8,9}, k=2, 초기 중심 1과 8에서 첫 배정 후 새 중심은?
정답입니다.
오답입니다. 답안을 다시 선택해 보세요.
정답 및 해설 보기
정답: ④
- ① 오답: 1과 8은 초기 중심이며 첫 배정 뒤 군집 평균으로 갱신해야 한다.
- ② 오답: 전체 평균을 쓰면 서로 다른 두 군집을 대표하지 못하고 군집별 계산도 무시한다.
- ③ 오답: k-평균은 극단값을 중심으로 고정하는 방법이 아니라 배정된 표본의 산술평균을 쓴다.
- ④ 정답: 각 군집의 두 값을 평균내면 (1+2)/2=1.5, (8+9)/2=8.5다.
10. 모델 선택과 검산을 함께 올바르게 수행한 것은?
정답입니다.
오답입니다. 답안을 다시 선택해 보세요.
정답 및 해설 보기
정답: ②
- ① 오답: 연속값 예측은 선형회귀의 수치 출력과 MSE가 맞으며 소프트맥스는 다중 클래스 확률에 사용한다.
- ② 정답: 목표 출력·가설·비용함수가 일치하고 비용 감소와 결정경계까지 검산한다.
- ③ 오답: 군집화는 정답 레이블 없이 최근접 배정과 평균 갱신으로 구조를 찾는다.
- ④ 오답: 로짓은 확률이 아니므로 소프트맥스로 변환하고 확률합이 1인지 확인해야 한다.
참고 자료와 작성 기준
이 글은 해당 차시 강의자료를 바탕으로 학습 목적에 맞게 재구성한 비공식 학습자료입니다. 경사하강 업데이트, 로지스틱 확률, 소프트맥스와 k-평균 계산 예제는 학습자가 과정을 직접 재현하도록 별도로 구성하고 검토했습니다.
- 작성·편집: 올에이클래스 학습연구팀
- 주요 근거: 한국방송통신대학교 컴퓨터과학과 「인공지능」 11강 ‘머신러닝(2)’ 강의자료(2025년 제작본)
- 보충 자료: 별도의 외부 자료를 사용하지 않고 해당 차시 강의 범위 안에서 재구성
- 편집 원칙: 올에이클래스 편집 정책
- 최종 내용 검토: 2026-08-17
댓글
댓글 쓰기