기본 콘텐츠로 건너뛰기

방송대 인공지능 12강: 인공 뉴런과 퍼셉트론 학습

0-썸네일-요약노트-인공지능-12강

방송대 인공지능 12강: 인공 뉴런과 퍼셉트론 학습

퍼셉트론이 한 표본을 0으로 잘못 분류했다면 어떤 가중치를 어느 방향으로 바꿔야 할까요? 이 글은 입력의 가중합이 출력으로 변환되는 과정을 추적하고, 오차로 가중치를 한 번 직접 갱신하며, 단층 퍼셉트론이 XOR에서 막히는 이유와 2단계 표현이 이를 바꾸는 원리까지 계산합니다.

오분류 한 번을 고치는 과정에 신경망 학습의 핵심이 들어 있다

입력 x=(2,-1), 정답 y=1인 학습용 표본을 직접 가정하자. 현재 가중치가 w=(0.2,0.1), 바이어스가 b=-0.5이고 활성함수가 0 이상이면 1, 0 미만이면 0을 내는 단위 계단함수라면 뉴런의 내부값은 다음과 같다.

z=w₁x₁+w₂x₂+b=(0.2×2)+(0.1×-1)-0.5=-0.2

z<0이므로 예측 ŷ=0이다. 정답 1과 다르므로 이 뉴런은 연결 가중치를 수정해야 한다. 즉, 신경망의 학습은 막연히 데이터를 기억하는 과정이 아니라 입력 → 가중합 → 활성화 → 예측 → 오차 → 가중치 수정이라는 피드백 과정이다.

판단 핵심: 뉴런 계산에서는 먼저 활성함수에 들어가기 전 값 z=Σxᵢwᵢ+b를 구하고, 그다음 ŷ=f(z)를 계산한다. 가중합과 활성함수 출력을 한 단계로 섞으면 오분류 원인과 결정경계를 추적하기 어렵다.

생물학적 연결은 가중치·합산·출력이라는 계산 구조로 바뀐다

인공 신경망은 신경세포가 많은 연결을 통해 신호를 전달하는 구조를 계산 모델로 옮긴 것이다. 생물학적 뉴런은 수상돌기로 신호를 받고, 신경연접의 특성에 따라 신호가 증폭되거나 감쇄되며, 신경세포체의 처리를 거쳐 축삭돌기로 신호를 보낸다. 인공 뉴런에서는 입력 xᵢ에 연결 가중치 wᵢ를 곱하고 모두 합한 뒤 바이어스 b를 더해 활성함수 f에 넣는다.

ŷ=f(Σi=1dxᵢwᵢ+b)

생물학적 관점인공 뉴런의 대응계산에서 확인할 역할
수상돌기로 들어오는 신호입력 x₁,…,xd현재 표본의 특징값
신경연접의 증폭·감쇄가중치 w₁,…,wd입력별 영향의 크기와 방향
발화 임계 수준바이어스 b결정경계의 위치 조정
뉴런의 반응활성함수 f와 출력 ŷ가중합을 최종 출력으로 변환

CPU는 나열된 명령을 매우 빠르게 순차 수행하는 데 강하고, 신경계는 개별 뉴런의 처리는 상대적으로 느리지만 많은 뉴런이 동시에 작동하는 대규모 병렬처리를 한다. 인공 신경망은 단순한 연산을 수행하는 많은 뉴런을 방대하게 연결하고, 지식을 하나의 위치가 아니라 연결 가중치 벡터에 분산해 저장한다.

가중치는 학습 데이터에 따라 자동 조정되며, 정보가 여러 연결에 분산되므로 일부 뉴런의 고장이 전체 성능을 즉시 무너뜨리지 않는 결함내성을 기대할 수 있다. 다만 결함내성은 “어떤 뉴런이 고장 나도 성능이 그대로”라는 뜻이 아니라 일부 손상에 대해 성능 저하가 급격하지 않다는 뜻이다.

활성함수는 같은 가중합을 서로 다른 출력 언어로 바꾼다

활성함수는 뉴런의 내부값 z를 출력으로 변환하며 신경망에 비선형성을 제공한다. 함수 이름만 외우기보다 출력 범위, 경계에서의 동작, 미분 가능성을 함께 본다.

함수정의출력 특성강의에서 확인할 기준
단위 계단함수z<0이면 0, z≥0이면 1두 값으로 단번에 판정퍼셉트론의 이진 출력과 선형 경계
시그모이드1/(1+e-z)0과 1 사이의 부드러운 출력전 구간 미분 가능, f′=f(1-f)
TanHtanh(z)-1과 1 사이의 부드러운 출력전 구간 미분 가능, f′=1-f²
ReLUmax(0,z)음수는 0, 양수는 그대로양의 구간에서 입력 크기 보존

예를 들어 z=-2, 0, 2를 넣으면 단위 계단함수는 각각 0, 1, 1을 출력하고 ReLU는 0, 0, 2를 출력한다. 둘 다 음수를 0으로 만들지만 0에서의 정의와 양수 영역의 출력이 다르다. 단위 계단함수를 ReLU와 같은 함수로 보면 퍼셉트론의 이진 판정이 사라진다.

잘못된 판단과 교정: “활성함수는 입력이 양수인지 검사하는 장치”라고만 이해하면 시그모이드와 TanH의 연속적인 변화, ReLU가 양수값을 그대로 전달하는 성질을 놓친다. 함수 선택은 필요한 출력 범위와 학습에 필요한 미분 특성을 기준으로 구분한다.

연결 방향을 읽으면 정보가 어디로 흐르고 되돌아오는지 보인다

뉴런 연결은 하나의 기준으로만 분류되지 않는다. 가중치의 효과, 같은 층인지 다른 층인지, 신호가 되돌아오는지에 따라 서로 다른 이름을 사용한다.

비교축첫 형태둘째 형태판단 질문
활성에 미치는 효과흥분성 연결: 다음 뉴런의 활성을 높임억제성 연결: 다음 뉴런의 활성을 낮춤가중 신호가 활성을 높이는가 낮추는가?
층의 위치층내연결: 같은 층 뉴런 사이층간연결: 서로 다른 층 사이연결 양끝이 같은 층인가?
시간적 흐름피드포워드: 입력에서 출력 방향순환연결: 이전 출력·상태가 다시 입력에 영향되먹임 경로가 존재하는가?

흥분성과 금지를 피드포워드와 순환의 반대말로 두면 안 된다. 하나는 연결이 활성에 주는 효과를, 다른 하나는 신호 경로의 방향을 말한다. 따라서 순환연결도 가중치에 따라 흥분성 또는 금지 효과를 가질 수 있다.

학습은 훈련만이 아니라 목적 설정부터 테스트까지 포함한다

신경망의 학습은 주어진 목적에 맞게 동작하도록 연결 가중치 값을 결정하는 전체 과정이다. 손실함수를 정의하고, 학습률 같은 하이퍼파라미터를 설정하며, 가중치를 초기화한 뒤 반복적으로 훈련한다. 훈련 결과는 검증하고 최종 모델은 테스트한다.

데이터 집합주요 역할섞어 쓰면 생기는 문제
훈련용가중치 등 학습 대상 파라미터를 갱신검증·테스트 정보까지 학습하면 새 데이터 성능을 공정하게 보기 어려움
검증용훈련 중 모델과 설정을 점검최종 테스트를 대신하면 설정 선택의 영향이 평가에 섞임
테스트용결정된 모델의 최종 성능 확인훈련에 사용하면 독립적인 최종 평가가 사라짐

판단 핵심: 파라미터는 훈련 과정에서 데이터로부터 업데이트되는 값이고, 하이퍼파라미터는 학습률처럼 훈련 방식을 정하기 위해 설정하는 값이다. 둘 다 숫자라고 같은 종류로 묶지 않는다.

가중치를 언제 바꾸는지가 SGD·배치·미니배치를 구분한다

훈련 진행 단위는 각 표본이 제안하는 파라미터 변화량을 몇 개 모아 한 번 갱신할지로 구분한다.

  • 개별 표본 단위 SGD: 표본 하나를 처리할 때마다 파라미터를 업데이트한다. 일반적으로 각 에포크에서 학습표본의 순서를 섞어 사용한다.
  • 배치 학습: 전체 학습표본의 변화량을 누적하고 평균을 낸 뒤 한 번 업데이트한다.
  • 미니배치 SGD: 전체 집합을 작은 부분집합으로 나누고, 각 미니배치의 변화량 평균으로 업데이트한다.

표본이 120개라면 개별 표본 단위는 한 번의 전체 순회 동안 120번, 전체 배치는 1번 갱신한다. 미니배치 크기가 20이면 6개 미니배치가 생기므로 6번 갱신한다. 이 예는 진행 단위의 차이를 보여 주기 위한 가정이며, 실제 마지막 미니배치의 크기는 전체 표본 수가 배치 크기로 나누어떨어지는지에 따라 달라질 수 있다.

경계 사례: 미니배치 크기가 1이면 개별 표본 단위와 같아지고, 미니배치가 전체 데이터 크기라면 배치 학습과 같은 진행 단위가 된다. 세 방법은 전혀 분리된 이름이 아니라 갱신에 사용하는 표본 수의 연속선 위에 있다.

퍼셉트론은 예측 오차의 부호로 결정경계를 움직인다

퍼셉트론은 단위 계단함수를 사용하는 인공 뉴런이며 지도학습으로 선형 결정경계를 학습한다. 입력 x=(x₁,…,xd)에 대해 ŷ=f(w₁x₁+…+wdxd+b)를 계산하고, 오차를 δ=ŷ-y로 둔다. 바이어스 입력을 x₀=1로 보면 모든 가중치는 같은 규칙으로 갱신할 수 있다.

wᵢ(n+1)=wᵢ(n)-ηδxᵢ, i=0,1,…,d

앞에서 직접 구성한 표본으로 계산을 이어 가자. 예측은 0, 정답은 1이므로 δ=0-1=-1이고 학습률을 η=0.1로 둔다.

  1. w₁′=0.2-0.1×(-1)×2=0.4
  2. w₂′=0.1-0.1×(-1)×(-1)=0
  3. b′=-0.5-0.1×(-1)×1=-0.4

새 내부값은 z′=(0.4×2)+(0×-1)-0.4=0.4이고 단위 계단함수의 출력은 1이다. 한 번의 갱신으로 이 표본은 올바르게 분류된다. 반대로 처음부터 예측과 정답이 같아 δ=0이면 모든 변화량이 0이므로 가중치를 바꾸지 않는다.

강의의 첫 갱신도 같은 순서로 검산할 수 있다

강의 예의 초기값은 w₁=0.1, w₂=-0.3, b=-1, 학습률은 0.1이다. 표본 (0.25,0.75)의 정답이 1일 때 내부값은 0.1×0.25-0.3×0.75-1=-1.2이므로 예측은 0, δ=-1이다. 따라서 새 값은 w₁=0.125, w₂=-0.225, b=-0.9가 된다. 강의자료의 해당 단계에서는 상태값 w₁=0.15와 판별식의 계수가 서로 다르게 표시되어 있다. 앞뒤 계산의 상태값을 기준으로 하면 0.15x₁로 해석할 수 있다.

직선 하나로 나뉘지 않는 XOR은 표현 공간을 바꿔야 한다

퍼셉트론의 결정경계는 w₁x₁+w₂x₂+b=0인 직선이다. 반복 학습을 통해 선형분리 가능한 데이터에는 경계를 만들 수 있지만, XOR의 두 클래스는 원래 (x₁,x₂) 공간에서 하나의 직선으로 분리되지 않는다. 학습 횟수를 늘리거나 학습률만 바꿔도 표현 자체의 한계는 사라지지 않는다.

강의는 두 단계로 입력을 새로운 공간에 사상한다. 먼저 두 퍼셉트론의 판별식에 단위 계단함수를 적용해 u₁, u₂를 만든다.

  • D₁(x₁,x₂)=-x₁-x₂+1.5 → u₁
  • D₂(x₁,x₂)=x₁+x₂-0.5 → u₂
  • D(u₁,u₂)=u₁+u₂-1.5 → y
(x₁,x₂)u₁u₂u₁+u₂-1.5최종 y
(0,0)10-0.50
(0,1)110.51
(1,0)110.51
(1,1)01-0.50

첫 단계는 원래 좌표를 그대로 분리하려 하지 않고 두 판별 결과라는 새 특징으로 바꾼다. 둘째 단계에서는 (u₁,u₂) 공간의 점들을 하나의 직선으로 나눌 수 있다. 중요한 결론은 “퍼셉트론 하나가 XOR을 학습했다”가 아니라 여러 단계가 표현 공간을 바꾸어 단층의 선형 한계를 확장했다는 것이다.

자가 점검: (1,1)을 첫 단계에 넣으면 D₁=-0.5여서 u₁=0, D₂=1.5여서 u₂=1이다. 마지막 식은 -0.5가 되어 y=0을 낸다. 세 판별식마다 “선형값 계산 → 계단함수 적용”을 분리하면 XOR 결과를 직접 재현할 수 있다.

핵심 개념 정리

  • 출력을 추적할 때: 입력과 가중치의 곱을 합하고 바이어스를 더한 뒤, 선택한 활성함수의 정의로 출력한다.
  • 학습을 설계할 때: 손실·하이퍼파라미터·초기화를 정하고 훈련, 검증, 테스트의 역할을 분리한다.
  • 갱신 단위를 볼 때: 변화량을 표본 하나, 전체 표본, 미니배치 중 어디까지 모아 평균내는지 확인한다.
  • 퍼셉트론을 계산할 때: z → ŷ → δ → Δw 순서를 지키고 δ=0이면 갱신이 없음을 확인한다.
  • 실패를 진단할 때: 반복 횟수 문제가 아니라 데이터가 하나의 선형 경계로 분리 가능한지 먼저 판단한다.

새 신경망 계산에서는 먼저 연결 구조와 신호 방향을 읽고, 각 뉴런에서 z=Σxᵢwᵢ+b와 ŷ=f(z)를 분리해 계산합니다. 오분류라면 오차의 부호와 학습률을 확인해 가중치를 갱신하고, 그래도 해결되지 않으면 데이터가 선형분리 가능한지 살펴봅니다. XOR처럼 표현 자체가 문제라면 같은 경계를 반복 조정하기보다 중간 뉴런이 만드는 새 특징공간이 필요한지 판단합니다.

예상문제 10선

1. 입력 x=(2,-1), 가중치 w=(0.2,0.1), 바이어스 b=-0.5일 때 활성함수에 들어가는 값 z는?

정답입니다.

오답입니다. 답안을 다시 선택해 보세요.

정답 및 해설 보기

정답: ③

  • ① 오답: 둘째 입력의 음수 부호와 바이어스를 함께 잘못 처리한 값이다.
  • ② 오답: w₂x₂=-0.1을 누락하거나 합산 순서를 잘못 적용한 결과다.
  • ③ 정답: 0.2×2+0.1×(-1)-0.5=0.4-0.1-0.5=-0.2이다.
  • ④ 오답: 바이어스 -0.5를 더하지 않고 부호를 반대로 처리하면 나올 수 있다.

2. 인공 신경망에서 학습된 정보가 주로 저장되는 곳은?

정답입니다.

오답입니다. 답안을 다시 선택해 보세요.

정답 및 해설 보기

정답: ①

  • ① 정답: 신경망은 학습에 따라 연결 가중치를 조정하고 지식을 여러 연결에 분산 저장한다.
  • ② 오답: 표본 순서는 훈련 진행에 영향을 줄 수 있지만 모델이 학습한 지식 자체는 아니다.
  • ③ 오답: 테스트 집합은 최종 평가에 쓰며 가중치에 정보를 학습시키는 용도가 아니다.
  • ④ 오답: 활성함수 종류는 구조 설정이지만 데이터로부터 형성된 연결 지식과 다르다.

3. 단위 계단함수와 ReLU의 차이를 옳게 설명한 것은?

정답입니다.

오답입니다. 답안을 다시 선택해 보세요.

정답 및 해설 보기

정답: ④

  • ① 오답: ReLU는 양수 2를 2로 출력하므로 항상 1로 바꾸지 않는다.
  • ② 오답: 강의의 단위 계단함수는 입력이 0 이상이면 1이고 ReLU는 0에서 0이다.
  • ③ 오답: 두 함수의 양수 구간 동작을 서로 뒤바꾸었다.
  • ④ 정답: 두 함수가 음수를 0으로 처리해도 양수와 0에서의 정의는 다르다.

4. 피드포워드 연결과 순환연결을 가르는 결정적 기준은?

정답입니다.

오답입니다. 답안을 다시 선택해 보세요.

정답 및 해설 보기

정답: ②

  • ① 오답: 활성의 증폭·감쇄는 흥분성·억제성 연결을 판단하는 축이다.
  • ② 정답: 되먹임 경로가 없으면 피드포워드, 이전 상태가 다시 영향을 주면 순환연결이다.
  • ③ 오답: 같은 층인지 여부는 층내연결과 층간연결을 구분한다.
  • ④ 오답: 활성함수의 범위는 신호 흐름이 되돌아오는지 알려 주지 않는다.

5. 신경망의 지도학습 과정을 가장 적절한 흐름으로 나타낸 것은?

정답입니다.

오답입니다. 답안을 다시 선택해 보세요.

정답 및 해설 보기

정답: ④

  • ① 오답: 최종 테스트를 학습 준비보다 먼저 하면 평가 독립성과 절차의 목적이 뒤바뀐다.
  • ② 오답: 테스트 집합을 반복 훈련에 사용하면 최종 성능 평가용 정보가 모델에 섞인다.
  • ③ 오답: 학습 대상 파라미터는 훈련용 집합으로 갱신하고 검증·테스트는 별도 역할을 가진다.
  • ④ 정답: 학습 목표와 설정을 정한 뒤 파라미터를 훈련하고 검증을 거쳐 독립적으로 테스트한다.

6. 120개 표본을 미니배치 크기 20으로 한 번 모두 처리할 때 가중치 갱신 횟수는?

정답입니다.

오답입니다. 답안을 다시 선택해 보세요.

정답 및 해설 보기

정답: ①

  • ① 정답: 120/20=6개의 미니배치가 만들어지고 각 미니배치 평균으로 한 번씩 갱신한다.
  • ② 오답: 미니배치 크기를 갱신 횟수로 잘못 사용했다.
  • ③ 오답: 전체 표본과 미니배치 크기의 차이는 배치 개수를 나타내지 않는다.
  • ④ 오답: 표본마다 갱신하는 개별 표본 단위일 때의 횟수다.

7. 직접 구성한 예에서 δ=-1, η=0.1, x₁=2, 현재 w₁=0.2일 때 갱신된 w₁은?

정답입니다.

오답입니다. 답안을 다시 선택해 보세요.

정답 및 해설 보기

정답: ③

  • ① 오답: 오차항의 음수 부호를 무시하고 0.2-0.2로 계산한 결과다.
  • ② 오답: 입력 x₁=2를 반영하지 않고 학습률만 뺀 값이다.
  • ③ 정답: w₁′=0.2-0.1×(-1)×2=0.4로 오분류를 줄이는 방향으로 증가한다.
  • ④ 오답: 바이어스나 다른 입력의 변화량까지 w₁에 중복해 더한 값이다.

8. XOR을 단층 퍼셉트론으로 오래 반복 학습하면 해결된다는 주장에 대한 판단은?

정답입니다.

오답입니다. 답안을 다시 선택해 보세요.

정답 및 해설 보기

정답: ②

  • ① 오답: 반복은 선형 경계의 위치를 바꿀 뿐 데이터의 선형분리 가능성을 바꾸지 않는다.
  • ② 정답: 대각선으로 배치된 같은 클래스 쌍을 직선 하나로 나눌 수 없어 표현 공간을 바꿔야 한다.
  • ③ 오답: 학습률은 갱신 크기를 조절하지만 데이터 배치의 기하적 조건을 바꾸지 않는다.
  • ④ 오답: XOR은 x₁과 x₂의 두 입력을 가지며 문제는 특징 수가 아니라 클래스 배치다.

9. XOR의 입력 (1,1)을 D₁=-x₁-x₂+1.5, D₂=x₁+x₂-0.5에 넣어 계단함수를 적용한 (u₁,u₂)는?

정답입니다.

오답입니다. 답안을 다시 선택해 보세요.

정답 및 해설 보기

정답: ①

  • ① 정답: D₁=-0.5이므로 u₁=0, D₂=1.5이므로 u₂=1이다.
  • ② 오답: 두 판별식의 결과 또는 출력 순서를 서로 뒤바꾸었다.
  • ③ 오답: D₁의 음수 결과에도 계단함수 1을 적용한 오류다.
  • ④ 오답: D₂는 양수이므로 u₂가 0이 될 수 없다.

10. 단층 퍼셉트론의 선형 한계를 확장하는 XOR 2단계 처리의 핵심은?

정답입니다.

오답입니다. 답안을 다시 선택해 보세요.

정답 및 해설 보기

정답: ④

  • ① 오답: 입력을 같은 값으로 만들면 클래스 구분 정보가 사라진다.
  • ② 오답: 갱신 크기를 바꾸어도 원래 공간의 비선형 분리 구조는 달라지지 않는다.
  • ③ 오답: 테스트 정보를 훈련에 사용하면 평가가 훼손되며 표현 한계도 해결하지 못한다.
  • ④ 정답: u₁과 u₂라는 새 특징으로 사상하면 최종 퍼셉트론이 선형 경계를 만들 수 있다.

참고 자료와 작성 기준

이 글은 해당 차시 강의자료를 바탕으로 학습 목적에 맞게 재구성한 비공식 학습자료입니다. 직접 구성한 퍼셉트론 갱신 예제, 활성함수 판단 기준, XOR 단계별 계산과 선택지별 해설은 학습자가 계산 과정을 재현하도록 구성하고 검토했습니다.

  • 작성·편집: 올에이클래스 학습연구팀
  • 주요 근거: 한국방송통신대학교 컴퓨터과학과 「인공지능」 12강 ‘인공 신경망(1)’ 강의록(2025)
  • 보충 자료: 외부 보충 자료를 사용하지 않음
  • 편집 원칙: 올에이클래스 편집 정책
  • 최종 내용 검토: 2026-08-17

댓글