인공지능 9강 - 컴퓨터 시각과 패턴인식(2)
이번 강의에서는 변형된 영상을 정규화하고, 식별에 유용한 특징을 기호나 벡터로 표현하는 방법을 학습합니다. 특징벡터 사이의 거리, 베이즈 분류기, 최대가능도 추정, k-근접이웃 및 선형 판별식을 연결하여 통계적 패턴인식의 전체 흐름을 이해합니다.
영상의 정규화
정규화의 목적
정규화(normalization)는 입력 패턴에 가해진 변형을 회복하여 기준이 되는 패턴으로 변환하는 과정입니다. 같은 대상을 촬영하거나 입력하더라도 위치, 크기, 진폭 등의 차이로 영상의 모습이 달라질 수 있습니다. 이러한 차이를 그대로 두면 인식 시스템이 같은 대상을 서로 다른 패턴으로 판단할 가능성이 커집니다.
따라서 패턴을 비교하기 전에 관심 대상을 분할하고 기준 위치와 크기에 맞추며, 명암이나 신호의 진폭 차이를 조정합니다. 강의의 숫자 영상 예에서는 한 영상에 나열된 숫자를 각각 분할한 뒤 크기 정규화와 진폭 정규화를 수행하여 비교 가능한 형태로 만듭니다.
| 정규화 유형 | 조정 대상 | 목적 |
|---|---|---|
| 위치 정규화 | 패턴이 놓인 좌표나 중심 | 같은 대상의 위치 이동 영향을 줄임 |
| 크기 정규화 | 패턴의 폭과 높이 | 확대·축소된 패턴을 같은 기준 크기로 맞춤 |
| 진폭 정규화 | 명암이나 신호 세기의 범위 | 밝기·대비 또는 신호 세기 차이의 영향을 줄임 |
시험 핵심: 정규화는 대상의 종류를 판별하는 분류 단계가 아니라, 같은 대상에 가해진 위치·크기·진폭 등의 변형을 줄여 기준 패턴으로 맞추는 전처리 단계입니다.
영상표현과 특징 추출
패턴인식과 특징
패턴인식(pattern recognition)은 다양한 형태의 패턴을 식별하고 해석하기 위한 이론과 알고리즘을 탐구하는 분야입니다. 원 영상을 그대로 비교할 수도 있지만, 영상은 픽셀 수가 많고 불필요한 변동도 포함하므로 인식에 적합한 형태로 표현할 필요가 있습니다.
특징(feature)은 식별하려는 대상 패턴의 고유한 특성을 나타내는 정보입니다. 시각 패턴에서는 선, 에지(edge), 모퉁이(corner), 덩어리(blob) 등이 특징이 될 수 있습니다. 특징 추출은 영상에서 이러한 정보를 검출하여 분류기가 사용할 표현으로 바꾸는 과정입니다.
과제에 맞는 특징의 선택
좋은 특징은 인식 과제에 필요한 차이를 드러내면서 불필요한 정보는 줄여야 합니다. 입력 대상이 삼각형, 사각형 등의 다각형으로 한정되어 있다면 꼭짓점의 개수만으로도 패턴을 구분할 수 있습니다. 이때 해리스(Harris) 모퉁이 검출기로 꼭짓점을 찾는 방식이 효과적입니다.
숫자 패턴에서는 숫자를 이루는 획의 방향과 연결 관계가 식별에 중요한 정보가 됩니다. 28×28 화소의 숫자 영상을 모든 픽셀값으로 표현하는 대신 획 정보를 특징으로 추출하면, 원 영상의 저장량보다 적은 정보로 숫자의 구조를 나타낼 수 있습니다.
특징은 모든 시각 과제에 공통으로 고정되는 정보가 아닙니다. 다각형 식별에는 꼭짓점 수가 충분할 수 있지만, 숫자 식별에는 획의 방향과 배치처럼 다른 특징이 필요합니다.
특징의 표현 형태
기호 형태의 특징
기호 형태의 특징은 패턴의 기본 요소를 기호로 나타냅니다. 문자의 골격을 선분이나 분기 구조로 단순화한 뒤 각 구성요소에 a, b, c, d와 같은 기호를 부여하면, 문자를 픽셀의 집합이 아니라 기호와 그 관계의 구조로 표현할 수 있습니다.
특징벡터와 특징공간
벡터 형태의 특징은 수치값들을 순서대로 나열한 것입니다. i번째 패턴의 두 특징을 x1i, x2i라 하면 특징벡터는 xi=(x1i, x2i)로 나타낼 수 있습니다. 각 특징요소를 하나의 좌표축으로 생각하면 하나의 패턴은 특징공간(feature space)의 한 점이 됩니다.
특징요소가 d개이면 특징공간은 d차원입니다. 이 표현을 사용하면 패턴의 유사성을 점 사이의 거리로 측정하고, 같은 클래스의 점들이 모인 군집을 찾아 분류할 수 있습니다.
그물망 특징
그물망(mesh) 특징은 영상을 일정한 격자로 나누고 각 칸에 포함된 패턴의 양을 수치화합니다. 강의의 4×4 그물망 예에서 문자 영상은 각 칸의 화소 수를 순서대로 나열한 다음 벡터로 표현됩니다.
x=(0, 7, 6, 0, 0, 10, 11, 0, 5, 14, 14, 6, 7, 2, 4, 7)
이 벡터는 문자가 어느 영역에 얼마나 분포하는지를 나타냅니다. 공간 구조를 단순한 수치 배열로 바꾸므로 거리 계산과 통계적 분류에 이용할 수 있습니다.
HOG 특징
HOG(Histogram of Oriented Gradients)는 영상의 밝기 변화 방향, 즉 기울기 방향의 분포를 히스토그램으로 표현합니다. 강의에서는 가로 방향 필터 [-1 0 1]과 세로 방향 필터 [-1 0 1]T를 이용하여 기울기를 구하고, 방향을 0~20°, 20~40°처럼 20° 간격의 구간으로 나누어 빈도를 셉니다.
HOG는 픽셀의 절대 밝기보다 윤곽과 획의 방향 구조를 표현하므로 대상의 형태를 나타내는 벡터 특징으로 사용할 수 있습니다.
주성분 분석
주성분 분석(PCA, principal component analysis)은 데이터 집합에서 가장 큰 변동을 보이는 방향인 주성분을 식별합니다. 원래 좌표축 x1, x2 대신 데이터의 변동 방향에 맞춘 새로운 축 u1, u2로 직교변환하여 각 성분 사이의 상관관계를 최소화합니다.
가장 큰 변동을 설명하는 주성분만 남기면 데이터가 가진 주요 차이는 보존하면서 특징 수를 줄일 수 있습니다. 따라서 PCA는 특징 추출과 차원 축소에 활용됩니다.
시험 핵심: HOG는 기울기 방향의 분포를 특징으로 만들고, PCA는 데이터의 변동이 큰 직교축으로 좌표계를 바꾸어 상관관계를 줄이고 차원을 축소합니다.
거리측정자의 개념과 공리
특징벡터 사이의 거리
거리측정자(distance measure)는 특징벡터 사이의 거리를 측정하는 기준입니다. 특징공간에서 두 점이 가까울수록 두 패턴의 특징이 유사하다고 볼 수 있으므로, 거리측정자는 최근접 패턴 탐색과 군집 비교, 비매개변수 분류의 기초가 됩니다.
거리측정자가 만족해야 할 조건
특징벡터 x와 y 사이의 거리 J(x,y)가 수학적인 거리로 사용되려면 다음 네 공리를 만족해야 합니다.
| 공리 | 수식 | 의미 |
|---|---|---|
| 동일성 | J(x,y)=0 iff x=y | 같은 점 사이의 거리만 0임 |
| 비음수성 | J(x,y)≥0 | 거리는 음수가 될 수 없음 |
| 대칭성 | J(x,y)=J(y,x) | 측정 방향을 바꾸어도 거리가 같음 |
| 삼각부등식 | J(x,y)+J(y,z)≥J(x,z) | 중간점을 거치는 거리가 두 점의 직접 거리보다 짧을 수 없음 |
이 공리들을 만족하는 거리와 특징공간의 조합을 거리공간(metric space)이라고 합니다. 문제의 특징이 연속 수치인지, 불 값인지, 축별 척도가 다른지에 따라 적합한 거리측정자를 선택해야 합니다.
거리측정자의 종류
유클리드 거리
d차원 특징벡터 xk와 xl 사이의 유클리드 거리는 각 축 차이의 제곱을 합한 뒤 제곱근을 취합니다.
Je(xk,xl)=[Σi=1d(xik-xil)2]1/2
강의의 xa=(2,5), xb=(6,2)에서 두 축의 차이는 -4와 3입니다. 따라서 Je=√((-4)2+32)=√25=5입니다. 이는 특징공간에서 두 점을 잇는 직선거리입니다.
해밍 거리
해밍 거리(Hamming distance)는 특징벡터의 요소가 “예-아니오”, “있다-없다”와 같은 불 값을 다룰 때 사용합니다. 대응하는 요소마다 배타적 논리합(XOR)을 적용하면 값이 다를 때 1, 같을 때 0이 되므로, 전체 합은 서로 다른 요소의 개수가 됩니다.
Jh(xk,xl)=Σi=1d(xik⊕xil)
도시블록 거리
도시블록 거리 또는 맨해튼 거리는 각 축에서 발생한 절댓값 차이를 합한 거리입니다.
Jcb(xk,xl)=Σi=1d|xik-xil|
같은 xa=(2,5), xb=(6,2)에 적용하면 |2-6|+|5-2|=4+3=7입니다. 유클리드 거리가 직선거리 5를 주는 것과 달리, 도시블록 거리는 좌표축을 따라 이동한 거리의 합 7을 줍니다.
마할라노비스 거리
마할라노비스 거리(Mahalanobis distance)는 각 특징축의 척도와 데이터의 통계적 분포가 다를 때 사용할 수 있습니다. 단순 좌표 차이만 보는 대신 공분산을 이용하여 변동이 큰 방향의 차이는 상대적으로 줄이고 변동이 작은 방향의 차이는 더 중요하게 반영합니다.
군집의 평균벡터를 μ, 공분산 행렬을 Σ, 특징벡터를 x라 하면 평균으로부터의 마할라노비스 거리는 다음과 같습니다.
D2=(x-μ)TΣ-1(x-μ), Σ=E[(x-μ)(x-μ)T]
따라서 미지의 점이 두 군집 평균에서 좌표상 비슷한 거리에 있더라도, 각 군집의 퍼짐과 방향을 고려하면 서로 다른 마할라노비스 거리를 가질 수 있습니다. 축의 단위를 바꾸거나 분포가 길게 늘어진 경우에도 통계적 구조를 반영한 비교가 가능합니다.
| 거리 | 계산 관점 | 적합한 특징 |
|---|---|---|
| 유클리드 | 축 차이 제곱합의 제곱근 | 축의 척도가 비슷한 연속 수치 |
| 해밍 | 서로 다른 불 요소의 개수 | 이진·불 특징 |
| 도시블록 | 축별 절댓값 차이의 합 | 좌표축 방향의 누적 차이 |
| 마할라노비스 | 공분산으로 보정한 거리 | 축별 척도와 상관관계가 다른 데이터 |
통계적 패턴인식과 베이즈 분류기
학습표본과 클래스 분포
통계적 분류는 클래스가 알려진 학습표본에서 특징을 추출하고, 특징공간에서 각 클래스가 어떤 분포를 이루는지 학습한 뒤 새로운 패턴을 분류합니다. 강의의 MNIST 예에서는 숫자 ‘1’과 ‘2’의 훈련 영상을 특징벡터로 바꾸면 특징공간에 서로 다른 표본 군집 C1, C2가 형성됩니다.
생성 모델과 판별 모델
생성 모델(generative model)은 각 클래스에서 특징벡터가 생성될 분포, 즉 p(x|C1)와 p(x|C2)를 모델링합니다. 판별 모델(discriminative model)은 새로운 입력 xnew가 각 클래스에 속할 확률 p(C1|xnew), p(C2|xnew) 또는 그에 해당하는 판별 경계를 직접 다룹니다.
베이즈 정리의 관계는 p(C|x)p(x)=p(x|C)p(C)입니다. 따라서 클래스 조건부 분포 p(x|C)와 사전확률 p(C)를 알면 관측 x가 주어졌을 때의 사후확률 p(C|x)를 비교할 수 있습니다.
베이즈 분류 규칙
베이즈 분류기는 미지의 특징벡터 x를 사후확률이 가장 큰 클래스로 분류합니다. 두 클래스에서 p(C1|x)>p(C2|x)이면 C1, 반대이면 C2를 선택합니다.
베이즈 정리를 적용하면 p(C|x)=p(x|C)p(C)/p(x)입니다. 두 클래스를 비교할 때 p(x)는 공통이므로 다음과 같이 클래스 조건부 확률과 사전확률의 곱만 비교해도 같은 결정을 얻습니다.
- p(x|C1)p(C1) > p(x|C2)p(C2)이면 x는 C1
- p(x|C1)p(C1) < p(x|C2)p(C2)이면 x는 C2
시험 핵심: 베이즈 분류기는 p(x|C)만 큰 클래스를 무조건 고르는 것이 아니라 사전확률 p(C)까지 곱한 값을 비교합니다. 최종 판단 기준은 사후확률 p(C|x)가 가장 큰 클래스입니다.
확률밀도 추정 방법
매개변수 방식
매개변수(parametric) 방식은 특징공간에서 패턴의 분포가 잘 알려진 확률 모델을 따른다고 가정합니다. 가우시안(Gaussian) 모델을 가정한다면 학습표본으로 모집단의 평균 μ와 분산 σ2 같은 소수의 매개변수를 추정하고, 이 값으로 클래스의 확률밀도를 결정합니다.
가우시안 확률밀도함수는 다음과 같습니다.
p(x)=1/√(2πσ2) · exp[-(x-μ)2/(2σ2)]
가우시안 분포에서 평균 μ를 중심으로 μ±σ 범위에는 약 68%, μ±2σ 범위에는 약 95%의 값이 포함됩니다. 평균은 분포의 중심을, 표준편차는 분포가 퍼진 정도를 나타냅니다.
매개변수 방식은 전체 학습표본을 그대로 저장하는 대신 모델과 매개변수로 분포를 요약할 수 있습니다. 그러나 가정한 확률 모델이 실제 대상의 분포와 잘 맞지 않으면 분류 오류가 발생할 가능성이 커집니다.
비매개변수 방식과 파즌 창
비매개변수(nonparametric) 방식은 특정한 분포 모양을 미리 가정하기보다 “유사한 입력은 유사한 출력을 낸다”는 생각을 사용합니다. 특징공간에서 가까운 패턴들이 같은 클래스에 속할 가능성이 높다고 보고, 미지의 특징벡터와 학습표본 사이의 거리나 주변 표본 수를 이용하여 클래스 확률을 계산합니다.
파즌 창(Parzen window)은 x를 중심으로 한 단위 초입방체 안에 포함되는 학습표본 수를 이용하여 p(x)를 추정하는 방법입니다. 주변에 표본이 많이 모여 있으면 그 위치의 확률밀도가 높다고 판단합니다.
비매개변수 방식은 분포 모델을 잘못 가정할 위험을 줄일 수 있지만, 많은 학습표본을 기억해야 하고 미지의 패턴마다 다수의 거리 계산이 필요하므로 저장 공간과 계산 복잡도가 커질 수 있습니다.
| 구분 | 매개변수 방식 | 비매개변수 방식 |
|---|---|---|
| 분포 가정 | 가우시안 등 알려진 모델을 가정 | 특정 분포 형태를 미리 정하지 않음 |
| 학습 결과 | 평균·분산 등 모델 매개변수 | 학습표본의 근접 관계나 국소 밀도 |
| 대표 예 | 최대가능도 추정 | 파즌 창, k-근접이웃 |
| 주요 부담 | 모델 불일치 시 오류 | 표본 저장량과 거리 계산량 증가 |
최대가능도 추정
가능도를 최대화하는 매개변수
최대가능도 추정(MLE, maximum likelihood estimation)은 관찰된 학습표본 데이터집합 D가 나타날 가능성을 가장 크게 만드는 모집단 매개변수 θ를 찾는 방법입니다. 표본집합이 D={x1,x2,…,xn}일 때 강의에서 제시한 가능도는 다음과 같습니다.
L(θ)=p(x1,x2,…,xn|θ)=∏i=1np(xi|θ)
최대가능도 추정치는 θ̂MLE=argmaxθL(θ)입니다. 곱으로 이루어진 가능도에 로그를 취하면 합으로 바뀌어 계산이 쉬워집니다. 로그함수는 단조증가하므로 L(θ)를 최대화하는 θ와 ln L(θ)를 최대화하는 θ는 같습니다.
θ̂MLE=argmaxθln L(θ)=argmaxθΣi=1nln p(xi|θ)
가우시안 분포의 평균과 분산 추정
가우시안 모델의 매개변수를 θ=(μ,σ)로 두고 확률밀도함수를 로그가능도에 대입하면 다음 식을 얻습니다.
l(μ,σ)=-(n/2)ln(2π)-n ln σ-[1/(2σ2)]Σi=1n(xi-μ)2
μ와 σ에 대해 각각 편미분한 값을 0으로 두면 로그가능도를 최대화하는 추정치를 구할 수 있습니다.
μ̂=(1/n)Σi=1nxi
σ̂2=(1/n)Σi=1n(xi-μ̂)2
즉 가우시안 모델의 최대가능도 평균 추정치는 표본평균이고, 분산 추정치는 표본평균으로부터의 제곱편차를 n으로 나눈 값입니다. 클래스 A와 B에서 각각 추정한 평균과 분산으로 p(x|A), p(x|B)를 계산한 뒤 사전확률을 곱하여 미지의 패턴을 식별합니다.
가능도 L(θ)는 매개변수 θ가 주어졌을 때 이미 관찰된 표본집합이 얼마나 그럴듯한지를 나타냅니다. MLE는 표본을 바꾸는 것이 아니라, 고정된 표본을 가장 잘 설명하는 θ를 선택합니다.
k-근접이웃 분류
주변 표본의 다수결
k-근접이웃(k-NN, k-Nearest Neighbor)은 클래스가 표시된 학습표본을 이용하여 미지의 패턴이 어느 클래스에 속하는지를 판별하는 비매개변수 방식입니다. 각 학습표본은 특징벡터와 소속 클래스의 쌍으로 저장됩니다.
미지의 패턴 x가 주어지면 정해진 거리측정자로 모든 학습표본과의 거리를 구하고 가장 가까운 k개를 선택합니다. 그중 클래스 ωj에 속한 표본이 kj개이면 다음과 같이 소속 확률을 추정합니다.
p(ωj|x)=kj/k
kj가 가장 큰 클래스를 x의 클래스로 결정합니다. 강의의 k=5 예에서는 미지의 패턴 주변에서 클래스 A 표본이 더 많으므로 x를 클래스 A로 분류합니다.
시험 핵심: k-NN은 k개의 이웃까지의 평균거리가 가장 작은 클래스를 고르는 규칙이 아니라, 가장 가까운 k개 표본 가운데 가장 많이 나타난 클래스를 선택합니다.
선형 판별식 기반 식별
초평면으로 나누는 특징공간
구분하려는 군집의 경계가 볼록한 경우에는 선형함수로 정의되는 판별식으로 클래스를 식별할 수 있습니다. n차원 특징공간에서 클래스 경계는 다음 초평면 방정식으로 표현됩니다.
w1x1+w2x2+…+wnxn+w0=0
선형 판별식은 Dl(x)=w1x1+w2x2+…+wnxn+w0로 정의합니다. Dl(x)=0인 점들이 클래스 경계를 이루고, 강의의 두 클래스 예에서는 Dl(x)>0이면 C1, Dl(x)<0이면 C2로 판별합니다.
판별식의 학습
판별식의 가중치 w0,w1,…,wn은 사람이 임의로 정하는 것이 아니라 학습표본을 이용한 머신러닝으로 학습합니다. 강의에서는 선형 판별 분석(LDA), 서포트 벡터 머신(SVM), 로지스틱 회귀, 신경회로망·딥러닝을 판별식 학습 방법으로 제시합니다.
생성 모델은 클래스별 데이터 분포 p(x|C)를 모델링하는 반면, 판별식 기반 방법은 입력을 어느 클래스로 나눌지 결정하는 경계 또는 판별함수를 학습하는 데 초점을 둡니다.
핵심 개념 정리
- 정규화: 위치·크기·진폭 등 같은 패턴에 가해진 변형을 회복하여 기준 패턴으로 맞추는 전처리입니다.
- 특징 표현: 식별에 유용한 고유 특성을 기호나 벡터로 나타내며, d개 수치 특징은 d차원 특징공간의 한 점을 이룹니다.
- 특징 추출: 그물망은 영역별 패턴의 양, HOG는 기울기 방향 분포, PCA는 변동이 큰 직교 주성분을 이용합니다.
- 거리측정자: 동일성·비음수성·대칭성·삼각부등식을 만족해야 하며, 특징의 성격에 따라 유클리드·해밍·도시블록·마할라노비스 거리를 선택합니다.
- 베이즈 분류: p(C|x)가 가장 큰 클래스를 선택하며, 실제 비교에서는 p(x|C)p(C)를 사용할 수 있습니다.
- 확률밀도 추정: 매개변수 방식은 가정한 모델의 매개변수를 추정하고, 비매개변수 방식은 거리와 주변 학습표본을 직접 이용합니다.
- 최대가능도 추정: 관찰한 표본집합의 가능도를 가장 크게 만드는 매개변수를 찾으며, 가우시안 모델에서는 표본평균과 n으로 나눈 제곱편차 평균을 얻습니다.
- k-NN과 판별식: k-NN은 가까운 k개 표본의 다수 클래스를 선택하고, 선형 판별식은 학습된 초평면의 부호로 특징공간을 구분합니다.
패턴인식 문제를 풀 때는 변형 제거 → 특징 추출과 표현 → 유사성 또는 확률 모델 설정 → 분류 규칙 적용의 흐름으로 정리해야 합니다. 특히 거리측정자는 특징의 자료형과 분포에 맞게 선택하고, 베이즈 분류에서 생성 모델·사후확률의 관계와 매개변수·비매개변수 방식의 차이를 연결하면 MLE, k-NN, 선형 판별식의 역할을 정확히 구분할 수 있습니다.
예상문제 20선
1. 영상의 정규화에 대한 설명으로 가장 적절한 것은?
정답입니다.
오답입니다. 답안을 다시 선택해 보세요.
정답 및 해설 보기
정답: ②
정규화는 위치, 크기, 진폭 등의 변형을 줄여 입력 패턴을 비교 가능한 기준 형태로 맞추는 전처리입니다.
2. 시각 패턴인식에서 특징(feature)의 의미로 옳지 않은 것은?
정답입니다.
오답입니다. 답안을 다시 선택해 보세요.
정답 및 해설 보기
정답: ④
특징은 식별에 필요한 정보를 추출한 것으로, 모든 픽셀을 반드시 그대로 보존할 필요는 없습니다.
3. d개의 수치 특징요소로 구성된 특징벡터가 놓이는 공간은?
정답입니다.
오답입니다. 답안을 다시 선택해 보세요.
정답 및 해설 보기
정답: ①
특징벡터의 각 요소를 하나의 좌표축으로 삼으므로 d개 특징요소는 d차원 특징공간을 만듭니다.
4. HOG 특징이 주로 표현하는 정보는?
정답입니다.
오답입니다. 답안을 다시 선택해 보세요.
정답 및 해설 보기
정답: ③
HOG는 밝기 기울기의 방향을 구간별 히스토그램으로 만들어 윤곽과 획의 방향 구조를 표현합니다.
5. 주성분 분석(PCA)에 대한 설명으로 옳은 것은?
정답입니다.
오답입니다. 답안을 다시 선택해 보세요.
정답 및 해설 보기
정답: ②
PCA는 데이터 변동을 잘 설명하는 직교축으로 변환하며 특징 추출과 차원 축소에 사용됩니다.
6. 거리측정자의 삼각부등식을 올바르게 나타낸 것은?
정답입니다.
오답입니다. 답안을 다시 선택해 보세요.
정답 및 해설 보기
정답: ④
삼각부등식은 중간점 y를 거치는 두 거리의 합이 x와 z 사이의 직접 거리보다 작지 않다는 조건입니다.
7. xa=(2,5), xb=(6,2)의 유클리드 거리는?
정답입니다.
오답입니다. 답안을 다시 선택해 보세요.
정답 및 해설 보기
정답: ③
√((2-6)²+(5-2)²)=√(16+9)=5입니다.
8. 특징요소가 모두 “있다-없다”의 불 값일 때 가장 적합한 거리측정자는?
정답입니다.
오답입니다. 답안을 다시 선택해 보세요.
정답 및 해설 보기
정답: ①
해밍 거리는 XOR을 이용하여 대응하는 불 특징 중 서로 다른 요소의 수를 셉니다.
9. 마할라노비스 거리가 유클리드 거리와 구별되는 핵심은?
정답입니다.
오답입니다. 답안을 다시 선택해 보세요.
정답 및 해설 보기
정답: ④
마할라노비스 거리는 공분산 행렬의 역행렬로 차이를 보정하여 특징축의 분산과 상관관계를 고려합니다.
10. 베이즈 분류기가 미지의 특징벡터 x를 분류하는 원칙은?
정답입니다.
오답입니다. 답안을 다시 선택해 보세요.
정답 및 해설 보기
정답: ②
베이즈 분류기는 관측 x가 주어졌을 때의 클래스 사후확률을 비교하여 가장 큰 클래스를 선택합니다.
11. 두 클래스의 베이즈 분류에서 p(C1|x)와 p(C2|x)를 비교하는 것과 동등한 것은?
정답입니다.
오답입니다. 답안을 다시 선택해 보세요.
정답 및 해설 보기
정답: ①
베이즈 정리에서 두 클래스에 공통인 p(x)는 비교 시 소거되므로 클래스 조건부 확률과 사전확률의 곱을 비교할 수 있습니다.
12. 매개변수 방식에 대한 설명으로 옳지 않은 것은?
정답입니다.
오답입니다. 답안을 다시 선택해 보세요.
정답 및 해설 보기
정답: ③
매개변수 방식은 모델 가정이 실제 대상에 맞지 않으면 확률밀도 추정과 분류에서 오류가 발생할 가능성이 높아집니다.
13. 파즌 창 방식에 대한 설명으로 옳은 것은?
정답입니다.
오답입니다. 답안을 다시 선택해 보세요.
정답 및 해설 보기
정답: ④
파즌 창은 x를 중심으로 한 영역에 들어오는 표본의 수를 이용하는 비매개변수 확률밀도 추정법입니다.
14. 최대가능도 추정(MLE)의 목표는?
정답입니다.
오답입니다. 답안을 다시 선택해 보세요.
정답 및 해설 보기
정답: ①
MLE는 고정된 관찰 데이터가 나타날 가능성을 최대화하는 확률 모델의 매개변수를 선택합니다.
15. 가능도 L(θ) 대신 로그가능도 ln L(θ)를 최대화할 수 있는 이유는?
정답입니다.
오답입니다. 답안을 다시 선택해 보세요.
정답 및 해설 보기
정답: ②
로그는 순서를 보존하는 단조증가 함수이므로 최대화 지점이 같으며, 확률의 곱을 로그확률의 합으로 바꾸어 계산을 단순화합니다.
16. 강의에서 제시한 가우시안 분포의 최대가능도 평균 추정치 μ̂는?
정답입니다.
오답입니다. 답안을 다시 선택해 보세요.
정답 및 해설 보기
정답: ③
가우시안 로그가능도를 μ에 대해 미분하여 0으로 두면 μ̂=(1/n)Σxi를 얻습니다.
17. k-NN에서 p(ωj|x)=kj/k의 kj가 의미하는 것은?
정답입니다.
오답입니다. 답안을 다시 선택해 보세요.
정답 및 해설 보기
정답: ④
kj는 선택된 k개 근접 이웃 가운데 클래스 ωj의 표본이 몇 개인지를 뜻합니다.
18. 선형 판별식 Dl(x)=wTx+w0에서 클래스 경계를 이루는 점의 조건은?
정답입니다.
오답입니다. 답안을 다시 선택해 보세요.
정답 및 해설 보기
정답: ③
선형 판별식의 값이 0인 점들이 초평면 경계를 만들고, 부호가 다른 두 영역을 서로 다른 클래스로 판별합니다.
19. 다음 중 강의에서 판별식의 가중치를 학습하는 방법으로 제시되지 않은 것은?
정답입니다.
오답입니다. 답안을 다시 선택해 보세요.
정답 및 해설 보기
정답: ①
크기 정규화는 입력 변형을 줄이는 전처리입니다. LDA, SVM, 로지스틱 회귀와 신경회로망은 판별식 학습 방법으로 제시됩니다.
20. 통계적 패턴인식의 처리 흐름으로 가장 자연스러운 것은?
정답입니다.
오답입니다. 답안을 다시 선택해 보세요.
정답 및 해설 보기
정답: ②
입력 변형을 먼저 줄이고 식별 정보를 추출한 뒤, 적합한 거리나 확률·판별 모델을 적용하여 클래스를 결정합니다.
댓글
댓글 쓰기