기본 콘텐츠로 건너뛰기

방송대 방통대 인공지능 12강 - 인공 신경망(1) - 요약 노트 시험족보 예상문제 - 올에이클래스

0-썸네일-요약노트-인공지능-12강

인공지능 12강 - 인공 신경망(1)

인공 신경망은 생물학적 신경계의 연결 구조를 모델링하고, 연결 가중치를 학습하여 입력과 출력의 관계를 표현하는 계산 모델입니다. 이번 강의에서는 인공 뉴런의 구조와 활성함수, 신경망 학습의 절차와 진행 단위를 살펴본 뒤, 단층 퍼셉트론의 학습 규칙과 선형 분리 한계 및 XOR 문제의 2단계 해법을 학습합니다.

인공 신경망의 출발점

생물학적 신경 구조의 모델링

사람의 두뇌는 약 10억~100억 개의 신경세포, 즉 뉴런(neuron)으로 구성됩니다. 각각의 뉴런이 수행하는 처리는 비교적 단순하지만, 한 뉴런은 약 1천~10만 개의 다른 뉴런과 신경연접(synapse)을 통해 연결됩니다. 신경연접을 통과하는 신호는 연결의 특성에 따라 증폭되거나 감쇄되어 전달됩니다.

생물학적 뉴런은 수상돌기(dendrite)를 통해 신호를 받아들이고, 신경세포체에서 이를 처리한 뒤, 축삭돌기(axon)를 통해 다른 뉴런으로 출력을 전달합니다. 인공 신경회로망(Artificial Neural Network, ANN)은 이러한 신경 구조와 연결 방식을 계산 모델로 추상화하여 지능적 처리에 응용하려는 시도입니다.

CPU와 뉴런의 처리 방식

구분CPU뉴런
처리 속도수 나노초(10−9초) 단위수 밀리초(10−3초) 단위
처리 방법나열된 명령어를 순차적으로 수행많은 뉴런이 동시에 동작하는 대단위 병렬처리

개별 뉴런은 CPU보다 느리지만 매우 많은 뉴런이 병렬로 연결되어 전체적으로 복잡한 처리를 수행합니다. 인공 신경망 역시 단순한 연산기를 다수 연결하여 분산된 병렬 계산을 수행한다는 관점을 취합니다.

인공 신경망의 주요 특성

인공 신경망은 입력값을 합하고 변환하는 간단한 연산 기능을 가진 많은 뉴런으로 구성되며, 각 뉴런은 다른 뉴런과 방대한 연결을 유지합니다. 이 구조에서 여러 뉴런은 동시에 동작하므로 대규모 병렬처리가 가능합니다.

신경망의 정보는 특정 뉴런 하나에만 저장되는 것이 아니라 신경연접에 해당하는 연결 가중치 벡터에 분산되어 저장됩니다. 학습은 학습 데이터에 맞추어 이 연결 가중치를 자동으로 조정하는 과정입니다. 정보와 처리가 여러 뉴런과 연결에 분산되어 있으므로 일부 뉴런에 고장이 생겨도 전체 성능이 급격히 저하되지 않는 결함내성도 가질 수 있습니다.

특성의미
병렬처리수많은 뉴런이 동시에 단순 연산을 수행함
분산 저장정보가 신경연접의 연결 가중치 벡터에 분산되어 저장됨
학습능력학습 데이터에 따라 연결 가중치를 자동으로 조정함
결함내성일부 뉴런의 고장이 전체 시스템의 급격한 성능 저하로 바로 이어지지 않음

인공 뉴런의 계산 구조

인공 뉴런은 입력 x1, x2, …, xd에 각각의 연결 가중치 w1, w2, …, wd를 곱하고, 그 합에 바이어스 b를 더합니다. 이 선형 결합을 활성함수 f에 통과시켜 출력 ŷ를 만듭니다.

계산식은 ŷ=f(∑i=1dxiwi+b)입니다. 바이어스는 입력과 무관하게 더해지는 값으로 결정 기준을 이동시키며, 강의에서는 임계치에 대응하는 항으로 설명합니다. 바이어스를 입력 x0=1과 가중치 w0=b로 두면 다른 가중치와 같은 방식으로 다룰 수 있습니다.

시험 핵심: 뉴런은 ‘입력×가중치의 합 → 바이어스 추가 → 활성함수 적용’의 순서로 출력합니다. 가중치는 입력의 영향력을 조절하고, 바이어스는 활성화 기준을 이동시킵니다.

활성함수

활성함수(activation function)는 가중합을 뉴런의 최종 출력으로 변환합니다. 신경망이 단순한 선형 결합만 반복하지 않도록 일반적으로 비선형 특성을 가진 함수를 사용합니다.

함수정의출력과 특징
단위 계단함수f(x)=0 (x<0), f(x)=1 (x≥0)임계값 0을 기준으로 0 또는 1을 출력하며 퍼셉트론에 사용됨
시그모이드f(x)=1/(1+e−x)0과 1 사이의 값, f′(x)=f(x)(1−f(x))
TanHf(x)=tanh(x)=(ex−e−x)/(ex+e−x)−1과 1 사이의 값, f′(x)=1−f(x)2
ReLUf(x)=max(0,x)x<0이면 0, x≥0이면 입력 x를 그대로 출력

시그모이드 함수는 작은 입력 구간에서 이득이 크고 입력의 절댓값이 큰 구간에서는 이득이 작아지는 자동 이득 조절 특성을 보이며, 전 구간에서 미분할 수 있습니다. TanH도 전 구간에서 미분 가능하지만 출력의 중심이 0이고 범위가 −1부터 1까지라는 차이가 있습니다. ReLU(Rectified Linear Unit)는 음수 입력을 0으로 만들고 양수 입력은 그대로 통과시키는 단순한 형태입니다.

단위 계단함수는 0에서 불연속이지만 퍼셉트론처럼 이진 결정을 내릴 때 유용합니다. 시그모이드와 TanH는 부드러운 곡선이며 강의에서 도함수까지 제시됩니다.

뉴런의 연결 형태

연결 효과에 따른 구분

흥분성 연결은 연결된 뉴런의 활성을 높이고, 금지 연결은 연결된 뉴런의 활성을 낮춥니다. 이는 연결을 통해 전달되는 신호가 다음 뉴런의 활성에 서로 반대되는 영향을 줄 수 있음을 의미합니다.

연결 위치와 방향에 따른 구분

층내 연결은 같은 층에 속한 뉴런 사이의 연결이고, 층간 연결은 서로 다른 층의 뉴런을 잇는 연결입니다. 피드포워드 연결은 입력층에서 출력층 방향으로 정보가 전달되며 앞 단계의 출력이 뒤 단계로만 이동합니다. 순환 연결은 출력이나 중간 상태가 다시 앞쪽 뉴런으로 되돌아가는 경로를 포함합니다.

구분 기준형태핵심 차이
활성에 미치는 영향흥분성 / 금지다음 뉴런의 활성을 높이는가 낮추는가
연결되는 층층내 / 층간같은 층을 잇는가 서로 다른 층을 잇는가
신호의 진행 방향피드포워드 / 순환앞 방향으로만 흐르는가 되먹임 경로가 있는가

신경망 학습의 절차

신경망의 학습(learning)은 신경망이 주어진 목적에 맞게 동작하도록 연결 가중치 벡터 w의 값을 결정하는 모든 과정을 뜻합니다. 단순히 가중치를 한 번 계산하는 것이 아니라 목적의 수치화, 학습 조건의 설정, 반복 훈련과 성능 평가를 포함합니다.

  1. 손실함수 정의: 예측과 정답의 차이를 어떤 값으로 평가할지 정합니다.
  2. 하이퍼파라미터 설정: 학습률처럼 학습 전에 정해야 하는 조건을 설정합니다.
  3. 신경망 초기화: 학습을 시작할 파라미터의 초기값을 정합니다.
  4. 훈련: 학습 대상 파라미터를 반복적으로 업데이트합니다.
  5. 검증: 훈련 결과를 평가하여 모델 선택이나 설정 조정에 활용합니다.
  6. 테스트: 최종 모델의 성능을 별도의 데이터로 확인합니다.

훈련·검증·테스트 데이터

지도학습의 학습 데이터는 입력 데이터와 그에 대응하는 레이블로 구성됩니다. 전체 학습용 데이터 집합은 훈련용 집합, 검증용 집합, 테스트 집합으로 나누어 활용합니다. 훈련용 집합은 가중치 갱신에, 검증용 집합은 훈련 과정과 설정의 점검에, 테스트 집합은 최종 모델의 성능 확인에 사용합니다.

시험 핵심: 테스트 집합은 반복적인 가중치 조정이나 모델 선택에 사용하는 데이터가 아니라, 결정된 모델의 최종 성능을 평가하기 위한 별도 집합입니다.

훈련의 진행 단위

가중치를 언제 갱신하는지에 따라 개별 표본 단위의 확률적 경사하강법, 전체 표본 단위의 배치 학습, 그 중간인 미니배치 SGD로 나눌 수 있습니다.

방법한 번의 업데이트에 쓰는 범위업데이트 방식
확률적 경사하강법(SGD)개별 학습표본학습표본을 무작위로 섞고 표본마다 파라미터를 업데이트함
배치 학습전체 학습표본 집합각 표본의 변화량을 누적하고 전체 변화량의 평균으로 업데이트함
미니배치 SGD전체 집합을 나눈 작은 부분집합미니배치 안의 파라미터 변화량 평균으로 업데이트함

세 방법의 핵심 차이는 변화량을 평균하는 표본의 범위입니다. SGD는 한 표본의 영향을 즉시 반영하고, 배치 학습은 전체 집합의 정보를 모아 한 번 반영하며, 미니배치 SGD는 작은 부분집합 단위로 평균을 구해 갱신합니다.

퍼셉트론 모델

프랭크 로젠블랫(Frank Rosenblatt)은 1957년 퍼셉트론 학습이론을 제시했습니다. 퍼셉트론은 선형 분리가 가능한 입력벡터 집합에 대해 선형 결정경계를 학습할 수 있는 지도학습 모델입니다.

퍼셉트론의 각 입력 요소는 연결 가중치를 거쳐 합산되고, 바이어스를 더한 결과에 단위 계단함수를 적용하여 이진 출력 ŷ를 만듭니다. 따라서 ŷ=f(w1x1+w2x2+…+wdxd+b)로 나타낼 수 있습니다.

오차와 가중치 업데이트

하나의 학습 데이터는 [(x1,x2,…,xd),y]로 구성됩니다. 예측 오차를 δ=ŷ−y로 정의하고 학습률을 η라고 하면, n+1번째 훈련 단계의 가중치는 wi(n+1)=wi(n)−ηδxi로 갱신합니다. 바이어스도 x0=1인 가중치로 보아 같은 식을 적용합니다.

예측이 정답과 같으면 δ=0이므로 그 표본에서는 가중치가 변하지 않습니다. 예측이 정답보다 작아 δ=−1이면 해당 입력 방향으로 가중치가 증가하고, 예측이 정답보다 커 δ=1이면 해당 입력 방향으로 가중치가 감소합니다.

퍼셉트론 학습 계산의 예

강의의 예제는 두 입력 x1, x2를 가지며 학습률 η=0.1을 사용합니다. y=1인 표본은 (0.25,0.75), (0.5,0.5), (0.75,0.25), (0,1.5), (1.5,0)이고, y=0인 표본은 (1.25,1.75), (1.75,1.25), (1.5,1.5), (2.5,0), (0,2.5)입니다.

초기값은 w1=0.1, w2=−0.3, b=−1입니다. 첫 표본 (0.25,0.75), y=1을 넣으면 가중합은 0.1×0.25−0.3×0.75−1=−1.2이므로 단위 계단함수의 출력은 ŷ=0이고 δ=−1입니다. 따라서 다음 값은 w1=0.1−0.1×(−1)×0.25=0.125, w2=−0.3−0.1×(−1)×0.75=−0.225, b=−1−0.1×(−1)×1=−0.9가 됩니다.

반복 학습에 따라 결정경계는 데이터 두 집단을 분리하도록 이동합니다. 강의에서는 각 반복 뒤 상태의 예로 n=1에서 (w1,w2,b)=(0.15,0,−0.6), n=3에서 (0.15,−0.15,−0.1), n=5에서 (−0.1,−0.25,0.2), n=6에서 (−0.175,−0.175,0.3)을 제시합니다. 마지막 상태의 경계는 −0.175x1−0.175x2+0.3=0입니다.

n=1 상태의 가중치는 w1=0.15이므로 뉴런 식도 ŷ=f(0.15x1−0.6)으로 해석해야 합니다. 이 값이 해당 슬라이드의 가중치 표시와 결정경계에 일관됩니다.

선형 결정경계와 퍼셉트론의 한계

퍼셉트론은 학습 데이터를 반복해서 보며 오분류가 발생할 때 연결 가중치를 수정합니다. 데이터가 하나의 직선이나 초평면으로 분리 가능한 경우 이 과정을 통해 두 부류를 나누는 선형 결정경계를 형성할 수 있습니다.

그러나 단층 퍼셉트론의 출력은 하나의 선형 결정경계를 기준으로 정해지므로 선형 분리가 불가능한 문제는 해결할 수 없습니다. XOR 문제에서는 출력 1인 두 점과 출력 0인 두 점이 대각선 방향으로 엇갈려 있어 하나의 직선으로 두 부류를 완전히 나눌 수 없습니다.

시험 핵심: 퍼셉트론 학습 규칙 자체의 반복 횟수를 늘려도 선형 분리 불가능한 XOR 문제를 단층 퍼셉트론 하나로 해결할 수는 없습니다. 표현 공간을 바꾸거나 여러 퍼셉트론을 단계적으로 결합해야 합니다.

XOR 문제의 2단계 해법

새로운 특징 공간 만들기

첫 단계에서는 같은 입력 (x1,x2)을 두 퍼셉트론에 전달합니다. 첫 퍼셉트론의 결정함수 D1(x1,x2)=−x1−x2+1.5의 출력을 u1, 두 번째 결정함수 D2(x1,x2)=x1+x2−0.5의 출력을 u2로 둡니다. 이렇게 원래 입력을 (u1,u2)라는 새로운 2차원 공간에 사상합니다.

변환된 공간에서 최종 결정하기

두 번째 단계에서는 u1과 u2를 입력으로 하는 퍼셉트론을 사용합니다. 최종 결정함수 D(u1,u2)=u1+u2−1.5를 적용하면 XOR의 두 부류를 선형 결정경계로 구분할 수 있습니다.

예를 들어 입력 (0,0)은 (u1,u2)=(1,0), 입력 (0,1)과 (1,0)은 (1,1), 입력 (1,1)은 (0,1)로 변환됩니다. 마지막 단위 계단함수는 (1,1)에만 1을 출력하므로 원래 입력 공간에서 XOR의 출력 1에 해당하는 두 점을 올바르게 분류합니다.

시험 핵심: XOR 해법의 본질은 첫 단계의 두 퍼셉트론이 원래 입력을 새로운 특징 공간으로 바꾸고, 두 번째 퍼셉트론이 그 공간에서 선형 결정경계를 만드는 것입니다.

핵심 개념 정리

  • 인공 신경망: 생물학적 신경 구조를 모델링한 계산 모델로, 다수 뉴런의 병렬처리와 연결 가중치의 분산 저장을 이용합니다.
  • 뉴런 계산: 입력과 가중치의 곱을 합하고 바이어스를 더한 뒤 활성함수를 적용하여 출력합니다.
  • 활성함수: 단위 계단함수는 이진 결정, 시그모이드와 TanH는 부드러운 비선형 변환, ReLU는 max(0,x) 변환을 수행합니다.
  • 연결 유형: 영향에 따라 흥분성·금지, 위치에 따라 층내·층간, 흐름에 따라 피드포워드·순환 연결로 구분합니다.
  • 학습: 손실함수와 하이퍼파라미터를 정하고 초기화·훈련·검증·테스트를 거쳐 목적에 맞는 가중치를 결정합니다.
  • 훈련 단위: SGD는 개별 표본, 배치 학습은 전체 표본, 미니배치 SGD는 작은 부분집합의 변화량으로 갱신합니다.
  • 퍼셉트론: δ=ŷ−y와 wi(n+1)=wi(n)−ηδxi를 이용해 선형 결정경계를 학습합니다.
  • XOR: 단층 퍼셉트론으로는 해결할 수 없지만, 두 단계로 특징 공간을 변환하면 분류할 수 있습니다.

이 강의의 핵심은 신경망의 지능이 개별 뉴런의 복잡성보다 연결 구조와 가중치 학습에서 나온다는 점입니다. 퍼셉트론은 오분류에 따라 가중치를 고쳐 선형 경계를 찾지만 표현력은 하나의 선형 경계에 제한되며, XOR의 2단계 처리는 여러 뉴런을 결합해 새로운 특징 표현을 만들면 그 한계를 확장할 수 있음을 보여 줍니다.

예상문제 20선

1. 인공 신경회로망의 기본 발상으로 가장 적절한 것은?

정답입니다.

오답입니다. 답안을 다시 선택해 보세요.

정답 및 해설 보기

정답: ②
인공 신경망은 두뇌의 뉴런과 신경연접 구조를 추상화하여 지능적 계산에 이용하는 모델입니다.

2. 인공 신경망의 특성에 대한 설명으로 옳은 것은?

정답입니다.

오답입니다. 답안을 다시 선택해 보세요.

정답 및 해설 보기

정답: ④
신경망은 연결 가중치를 데이터에 맞게 조정하여 학습하며, 정보가 많은 연결에 분산됩니다.

3. 인공 뉴런의 출력 계산식으로 옳은 것은?

정답입니다.

오답입니다. 답안을 다시 선택해 보세요.

정답 및 해설 보기

정답: ①
입력과 가중치의 곱을 합하고 바이어스를 더한 뒤 활성함수 f를 적용합니다.

4. 단위 계단함수의 출력 규칙으로 옳은 것은?

정답입니다.

오답입니다. 답안을 다시 선택해 보세요.

정답 및 해설 보기

정답: ③
강의의 단위 계단함수는 0을 임계값으로 하여 이진 출력 0 또는 1을 만듭니다.

5. 시그모이드 함수 f(x)=1/(1+e−x)의 도함수는?

정답입니다.

오답입니다. 답안을 다시 선택해 보세요.

정답 및 해설 보기

정답: ②
시그모이드의 도함수는 함수값 자체를 이용해 f(x)(1−f(x))로 나타낼 수 있습니다.

6. TanH 활성함수에 대한 설명으로 옳은 것은?

정답입니다.

오답입니다. 답안을 다시 선택해 보세요.

정답 및 해설 보기

정답: ④
TanH는 0을 중심으로 −1부터 1 사이의 값을 출력하며 전 구간에서 미분 가능합니다.

7. ReLU 함수의 정의로 옳은 것은?

정답입니다.

오답입니다. 답안을 다시 선택해 보세요.

정답 및 해설 보기

정답: ③
ReLU는 음수 입력에 0을, 0 이상 입력에는 입력값 자체를 출력합니다.

8. 연결된 뉴런의 활성을 낮추는 연결은?

정답입니다.

오답입니다. 답안을 다시 선택해 보세요.

정답 및 해설 보기

정답: ①
금지 연결은 다음 뉴런의 활성을 낮추며, 흥분성 연결은 활성을 높입니다.

9. 순환 연결에 대한 설명으로 옳은 것은?

정답입니다.

오답입니다. 답안을 다시 선택해 보세요.

정답 및 해설 보기

정답: ④
순환 연결에는 신호가 되돌아오는 경로가 있으며, 피드포워드 연결은 앞 방향으로만 진행합니다.

10. 신경망의 학습에 대한 정의로 가장 적절한 것은?

정답입니다.

오답입니다. 답안을 다시 선택해 보세요.

정답 및 해설 보기

정답: ②
학습에는 손실함수와 하이퍼파라미터 설정, 초기화, 반복 훈련, 검증과 테스트가 포함됩니다.

11. 훈련·검증·테스트 집합의 활용에 대한 설명으로 옳은 것은?

정답입니다.

오답입니다. 답안을 다시 선택해 보세요.

정답 및 해설 보기

정답: ①
훈련 집합은 학습에, 검증 집합은 설정 점검에, 테스트 집합은 최종 성능 평가에 사용합니다.

12. 배치 학습의 파라미터 업데이트 방식으로 옳은 것은?

정답입니다.

오답입니다. 답안을 다시 선택해 보세요.

정답 및 해설 보기

정답: ③
배치 학습은 전체 학습표본에 의한 파라미터 변화량을 모아 평균한 뒤 한 번 반영합니다.

13. 미니배치 SGD에 대한 설명으로 옳은 것은?

정답입니다.

오답입니다. 답안을 다시 선택해 보세요.

정답 및 해설 보기

정답: ④
미니배치 SGD는 개별 표본 SGD와 전체 배치 학습의 중간 크기 단위로 업데이트합니다.

14. 퍼셉트론 모델에 대한 설명으로 옳은 것은?

정답입니다.

오답입니다. 답안을 다시 선택해 보세요.

정답 및 해설 보기

정답: ①
로젠블랫의 퍼셉트론은 단위 계단함수를 사용하며 선형 분리 가능한 데이터의 결정경계를 학습합니다.

15. 퍼셉트론에서 δ=ŷ−y일 때 가중치 갱신식은?

정답입니다.

오답입니다. 답안을 다시 선택해 보세요.

정답 및 해설 보기

정답: ②
오차 δ, 학습률 η, 입력 xi를 이용해 기존 가중치에서 ηδxi를 뺍니다.

16. 초기값 w1=0.1, w2=−0.3, b=−1, η=0.1에서 표본 (0.25,0.75), y=1을 학습한 직후 값은?

정답입니다.

오답입니다. 답안을 다시 선택해 보세요.

정답 및 해설 보기

정답: ③
가중합은 −1.2이므로 ŷ=0, δ=−1입니다. 갱신식을 적용하면 각각 0.125, −0.225, −0.9가 됩니다.

17. 단층 퍼셉트론이 XOR 문제를 직접 학습할 수 없는 이유는?

정답입니다.

오답입니다. 답안을 다시 선택해 보세요.

정답 및 해설 보기

정답: ④
단층 퍼셉트론은 하나의 선형 결정경계만 만들 수 있지만 XOR은 선형 분리 불가능한 배치를 가집니다.

18. XOR 문제의 2단계 해법에서 첫 단계가 수행하는 일은?

정답입니다.

오답입니다. 답안을 다시 선택해 보세요.

정답 및 해설 보기

정답: ③
첫 단계는 두 결정함수의 출력으로 원래 입력을 새 특징 공간에 사상하여 분류하기 쉬운 표현을 만듭니다.

19. 강의에서 XOR의 두 번째 단계에 사용한 최종 결정함수는?

정답입니다.

오답입니다. 답안을 다시 선택해 보세요.

정답 및 해설 보기

정답: ①
변환된 u1-u2 공간에서 u1+u2−1.5를 단위 계단함수에 통과시켜 XOR 출력을 만듭니다.

20. 여러 퍼셉트론을 이용한 XOR 해법이 보여 주는 핵심은?

정답입니다.

오답입니다. 답안을 다시 선택해 보세요.

정답 및 해설 보기

정답: ②
첫 단계에서 비선형 활성 결과로 새 특징을 만들고 두 번째 단계에서 이를 선형 분리하는 것이 핵심입니다.

댓글