인공지능 8강 - 컴퓨터 시각과 패턴인식(1)
컴퓨터 시각은 픽셀로 주어진 영상에서 사람의 시각에 대응하는 정보를 추출하고 해석하는 인공지능 분야입니다. 이번 강의에서는 영상의 취득부터 분석까지 이어지는 처리 흐름을 살펴보고, 디지털 영상의 표본화·양자화, 잡음 제거 필터, 이진화·영역 분할·경계 검출의 원리를 학습합니다.
컴퓨터 시각의 개념과 처리 흐름
컴퓨터 시각이란 무엇인가
컴퓨터 시각(computer vision)은 컴퓨터에 인간의 시각 체계에 대응하는 능력을 부여하는 방법을 연구하는 인공지능 분야입니다. 카메라나 센서가 얻은 영상은 컴퓨터 안에서 픽셀값의 행렬로 저장되므로, 컴퓨터가 장면을 이해하려면 수치 배열로부터 물체의 종류·위치·크기와 같은 시각 정보를 추론해야 합니다.
영상은 일반 카메라나 적외선 센서뿐 아니라 거리 센서와 X선 단층 촬영 장치 등에서도 취득할 수 있습니다. 센서의 종류가 달라도 입력 영상을 정돈하고 의미 있는 영역과 특징을 찾아 분석한다는 기본 목표는 같습니다.
영상 취득에서 분석까지
| 단계 | 핵심 역할 | 대표 작업 |
|---|---|---|
| 영상 취득 | 분석할 시각 데이터를 센서로 얻음 | 카메라 영상, 적외선 영상, 거리 영상, X선 CT |
| 전처리 | 입력 영상의 품질을 개선함 | 잡음 제거, 밝기·대비 개선, 변환 |
| 영상 분할 | 해석 가능한 영역을 서로 구분함 | 유사 영역의 묶음과 다른 영역의 분리 |
| 정규화 | 영상의 변이를 표준적인 상태로 복원함 | 크기·위치·방향 및 밝기·대비 보정 |
| 영상 표현 | 영역을 분석에 유용한 특징으로 기술함 | 선, 경계, 모서리, 블롭 표현 |
| 분석 | 표현된 특징으로 최종 의미를 판단함 | 인식, 위치·크기 측정, 결함 검사 |
시험 핵심: 처리 순서는 영상 취득 → 전처리 → 영상 분할 → 정규화 → 영상 표현 → 분석입니다. 전처리는 영상의 품질을 다듬고, 분할은 영역을 나누며, 정규화는 크기·위치·방향 등의 변이를 표준화한다는 차이를 구분해야 합니다.
컴퓨터 시각의 활용 분야
컴퓨터 시각은 단순히 사진을 보기 좋게 만드는 기술이 아니라 영상에서 판단에 필요한 정보를 얻는 기술입니다. 문자나 물체를 식별하는 인식 작업부터 사람의 신체 특징을 이용하는 생체 인식, 의료 영상에서 이상 부위를 찾는 분석까지 폭넓게 사용됩니다.
| 활용 분야 | 컴퓨터 시각의 역할 |
|---|---|
| 문자·물체 인식 | 영상 속 문자나 대상의 종류를 판별함 |
| 생체 인식 | 얼굴, 지문, 홍채의 고유 특징을 비교함 |
| 의료 영상 분석 | 의료 영상의 구조와 이상 징후를 분석함 |
| 자동 시각 검사 | 제품의 치수나 표면 결함을 검사함 |
| 보안·감시 | 대상을 검출하고 이동을 추적함 |
| 로봇·자율주행 | 주변 환경과 장애물 및 이동 경로를 인식함 |
| 인간·컴퓨터 상호작용 | 몸짓이나 시선 등의 시각 정보를 입력으로 사용함 |
디지털 영상과 픽셀
픽셀 행렬로 표현되는 영상
디지털 영상은 가로 M개, 세로 N개의 격자에 놓인 픽셀(pixel)로 표현됩니다. 좌표 범위를 x∈{0, …, M−1}, y∈{0, …, N−1}로 두면 각 위치의 밝기나 색을 g(x, y)로 나타낼 수 있습니다. 회색조 영상은 한 픽셀에 하나의 밝기값을 저장하고, 컬러 영상은 일반적으로 빨강·초록·파랑의 RGB 성분을 묶어 저장합니다. 예를 들어 g(x, y)=(108, 114, 52)는 한 위치의 세 색 성분을 뜻합니다.
8비트 회색조 M×N 영상은 각 픽셀값이 0부터 255까지의 정수 중 하나인 영상으로 나타낼 수 있습니다. 히스토그램은 각 밝기값을 가진 픽셀의 빈도를 세어 영상의 밝기 분포를 보여 줍니다.
4-이웃과 8-이웃
어떤 픽셀을 기준으로 위·아래·왼쪽·오른쪽에 맞닿은 네 픽셀은 4-이웃입니다. 여기에 네 개의 대각선 방향 픽셀까지 더하면 8-이웃이 됩니다. 따라서 대각선으로만 이어진 두 영역은 4-이웃 기준에서는 연결되지 않을 수 있지만 8-이웃 기준에서는 연결될 수 있습니다. 연결성 문제에서는 어떤 이웃 관계를 사용하는지가 결과를 바꿀 수 있습니다.
영상은 조명이나 대상에서 나온 빛이 렌즈를 거쳐 영상 센서와 색 필터에 도달하고, 센서의 각 위치에서 픽셀값으로 변환되어 만들어집니다.
표본화와 양자화
연속 신호를 위치별 값으로 바꾸는 표본화
표본화(sampling)는 연속적인 아날로그 신호를 일정한 간격으로 측정하여 이산적인 값의 배열로 바꾸는 과정입니다. 표본화 간격이 Δt라면 표본화 주파수는 fs=1/Δt입니다. 대역폭이 B인 대역 제한 신호를 원래 신호로 복원하려면 나이퀴스트-섀넌 표본화 정리에 따라 fs≥2B를 만족해야 합니다.
표본화 주파수가 충분하지 않아 fs<2B가 되면 서로 다른 주파수 성분이 같은 표본으로 나타나는 에일리어싱(aliasing)이 발생합니다. 영상에서는 공간 표본 수를 256×256에서 64×64, 32×32, 16×16처럼 줄일수록 세부 형태가 사라지고 격자가 두드러집니다.
값의 단계를 제한하는 양자화
양자화(quantization)는 연속적이거나 매우 세밀한 신호값을 정해진 구간의 대표값으로 대응시키는 과정입니다. 같은 공간 해상도라도 밝기 단계를 256단계에서 16단계, 4단계, 2단계로 줄이면 부드러운 밝기 변화가 계단처럼 표현되고 정보가 손실됩니다.
| 구분 | 무엇을 이산화하는가 | 부족할 때의 영향 |
|---|---|---|
| 표본화 | 공간 또는 시간의 위치 | 해상도 저하, 에일리어싱 |
| 양자화 | 각 표본의 밝기나 색 값 | 단계화, 미세한 값의 손실 |
영상 필터링과 합성곱
저주파와 고주파 성분
필터는 입력에서 불필요한 성분을 줄이고 필요한 신호를 남기는 처리 장치입니다. 영상의 밝기가 천천히 변하는 부분은 저주파 성분, 경계나 잡음처럼 급격히 변하는 부분은 고주파 성분에 해당합니다. 저역 통과 필터(LPF)는 고주파 성분을 억제하여 영상을 부드럽게 하고, 고역 통과 필터(HPF)는 저주파 성분을 줄여 경계와 세부 변화를 강조합니다.
주파수 영역에서는 영상을 변환하여 얻은 G(u, v)에 전달함수 F(u, v)를 곱한 뒤 역변환합니다. 공간 영역에서는 필터 마스크를 영상 위에서 이동시키며 주변 픽셀과 마스크 계수의 곱을 합하는 합성곱(convolution)을 수행합니다.
3×3 마스크의 계산
3×3 입력 픽셀을 p1부터 p9, 마스크 계수를 m1부터 m9라고 하면 중심 위치의 출력은 p′5=∑i=19mipi로 계산합니다. 평균 필터는 모든 계수를 1/9로 두므로 이웃 아홉 픽셀의 산술평균이 새 중심값이 됩니다. 강의의 중심 창 예에서는 픽셀 합이 44이므로 출력은 44/9≈4.9입니다.
시험 핵심: 공간 영역 필터링은 마스크와 이웃 픽셀의 대응 원소를 곱한 뒤 모두 더하는 합성곱입니다. 평균 필터는 잡음과 함께 경계도 부드럽게 만들 수 있습니다.
잡음과 평활화 필터
가우시안 잡음과 가우시안 필터
잡음은 관측 과정에서 영상에 불규칙하게 섞이는 불필요한 성분입니다. 가우시안 잡음은 정규분포의 특성을 따르는 잡음으로, 평균 필터나 가우시안 저역 통과 필터를 이용해 완화할 수 있습니다. 평균 필터는 모든 이웃에 같은 가중치를 주지만, 가우시안 필터는 중심에 가까운 픽셀에 더 큰 가중치를 줍니다.
연속 가우시안 함수는 f(x,y)=1/(2πσ²)·exp(−(x²+y²)/(2σ²))로 나타냅니다. 강의의 3×3 가우시안 마스크는 (1/16)·[[1,2,1],[2,4,2],[1,2,1]]이며, 계수의 합은 1이어서 전체 밝기의 규모를 유지하면서 주변을 평활화합니다.
점 잡음과 중앙값 필터
점 잡음은 영상 곳곳에 임의의 흰 점이나 검은 점이 나타나는 잡음으로 소금-후추 잡음이라고도 합니다. 주변값의 평균을 사용하는 가우시안 필터는 매우 크거나 작은 잡음값의 영향을 받으므로 점 잡음 제거에 충분하지 않을 수 있습니다.
중앙값 필터는 이웃 픽셀을 크기순으로 정렬하고 가운데 값을 출력합니다. 예를 들어 이웃값이 81, 82, 84, 85, 87, 89, 90, 91, 210이라면 중앙값 87로 중심의 이상값 210을 바꿉니다. 점 잡음에 강하지만 영상의 가는 선이나 작은 점처럼 의미 있는 세부도 제거할 수 있다는 점에 주의해야 합니다.
| 필터 | 출력값 결정 | 적합한 용도 | 주의점 |
|---|---|---|---|
| 평균 필터 | 이웃값의 산술평균 | 일반적 평활화 | 경계가 흐려질 수 있음 |
| 가우시안 필터 | 중심에 큰 가중치를 둔 가중평균 | 가우시안 잡음 완화 | 점 잡음의 극단값에 영향받음 |
| 중앙값 필터 | 정렬한 이웃값의 중앙값 | 소금-후추 점 잡음 제거 | 가는 선과 작은 점도 사라질 수 있음 |
딥러닝을 이용한 영상 복원
고정된 필터 마스크 대신 학습 데이터에서 잡음과 원영상의 관계를 배우는 심층 신경망도 영상 잡음 제거에 사용됩니다. DnCNN은 잡음이 섞인 영상에서 깨끗한 영상을 직접 출력하기보다 입력에 포함된 잔차, 즉 잡음을 학습하는 잔차 학습 방식을 사용합니다.
SwinIR은 트랜스포머 구조를 이용하는 영상 복원 모델로, 잡음 제거를 비롯한 여러 영상 복원 작업에 적용됩니다. 전통적 필터가 미리 정한 계산 규칙을 모든 영상에 적용한다면 딥러닝 방법은 데이터로부터 복원 규칙과 특징을 학습한다는 차이가 있습니다.
영상 분할과 이진화
의미 있는 영역으로 나누기
영상 분할(image segmentation)은 영상을 물체나 배경처럼 의미 있는 영역으로 나누는 과정입니다. 같은 영역 안의 픽셀은 밝기·색·텍스처 등의 특성이 유사하고, 서로 다른 영역의 픽셀은 해당 특성이 달라야 합니다.
문턱값을 이용한 이진화
이진화는 회색조 영상 g(x,y)를 0과 1의 두 값으로 바꾸는 가장 기본적인 분할 방법입니다. 문턱값 T를 기준으로 g(x,y)>T이면 b(x,y)=1, g(x,y)≤T이면 b(x,y)=0으로 정합니다. 대상과 배경의 밝기 분포가 충분히 다르면 간단한 문턱값만으로 두 영역을 분리할 수 있습니다.
문턱값은 단지 영상을 흑백으로 표시하기 위한 값이 아니라 어떤 픽셀을 전경과 배경 중 어디에 배정할지 결정하는 분류 기준입니다.
영역 기반 분할
공간 정보를 이용하는 영역 분할은 서로 이웃한 픽셀들의 유사성을 활용합니다. 영역 성장법은 작은 초기 영역에서 시작하여 기준에 맞는 인접 픽셀을 차례로 포함합니다. 분할·병합법은 반대로 전체 영상에서 출발해 균일하지 않은 영역을 나누고, 나뉜 인접 영역이 충분히 유사하면 다시 합칩니다.
분할·병합법은 보통 사분트리(quadtree) 구조로 영역을 네 부분씩 재귀적으로 분할합니다. 각 영역에 균일성 검사를 적용하여 불균일하면 분할하고, 인접하면서 균일성 조건을 만족하는 영역은 병합합니다. 핵심은 분할과 병합 모두 같은 유사성 또는 균일성 판단 기준을 이용한다는 점입니다.
경계 검출
미분과 경계
경계(edge)는 서로 다른 영역 사이에서 회색조 값이 크게 변하는 지점입니다. 밝기 변화를 1차 미분하면 경계 부근에서 절댓값이 큰 극값이 나타나고, 2차 미분하면 부호가 바뀌는 영교차(zero crossing)가 나타납니다. 따라서 소벨 연산자는 1차 미분 기반, 라플라스 연산자는 2차 미분 기반 경계 검출로 구분합니다.
소벨 연산자
강의의 수평 방향 소벨 마스크는 MSobelH=(1/4)·[[-1,0,1],[-2,0,2],[-1,0,1]], 수직 방향 마스크는 MSobelV=(1/4)·[[-1,-2,-1],[0,0,0],[1,2,1]]입니다. 두 마스크를 합성곱하여 수평·수직 변화량 eh, ev를 얻습니다.
경계의 세기는 e=√(eh²+ev²), 방향은 θ=tan−1(ev/eh)로 구합니다. 한 방향 마스크만 사용하면 특정 방향의 변화만 포착하므로 두 결과를 결합해야 경계의 전체 세기와 방향을 알 수 있습니다.
라플라스 연산자
라플라스 연산자는 f=∇²g=∂²g/∂x²+∂²g/∂y²로 나타내는 2차 미분 연산자입니다. 강의에서는 [[1,−2,1],[−2,4,−2],[1,−2,1]] 마스크를 사용하며, 결과의 영교차를 통해 경계의 위치를 찾습니다.
시험 핵심: 1차 미분에서는 경계가 극값으로, 2차 미분에서는 영교차로 드러납니다. 소벨은 방향별 1차 미분값을 결합하고, 라플라스는 2차 미분값의 변화를 이용합니다.
심층 신경망 기반 객체 분석
객체 검출(object detection)은 영상에 어떤 종류의 물체가 어디에 있는지를 함께 찾아야 하므로 물체의 유형과 위치를 출력합니다. 대표적인 방법으로 R-CNN 계열과 YOLO가 있습니다.
인스턴스 분할(instance segmentation)은 같은 종류의 물체가 여러 개 있어도 각 개체를 서로 다른 픽셀 영역으로 분리합니다. 따라서 사각형 위치만 찾는 객체 검출보다 더 세밀한 출력이 필요하며 Mask R-CNN과 SegFormer 같은 모델이 활용됩니다.
| 과제 | 출력 | 강의의 대표 모델 |
|---|---|---|
| 객체 검출 | 물체의 유형과 위치 | R-CNN, YOLO |
| 인스턴스 분할 | 개별 물체마다 구분된 픽셀 영역 | Mask R-CNN, SegFormer |
핵심 개념 정리
- 처리 흐름: 영상 취득 후 전처리로 품질을 개선하고, 분할·정규화·표현을 거쳐 분석합니다.
- 디지털 영상: 영상은 픽셀 행렬이며, 연결성은 4-이웃과 8-이웃 중 어느 기준을 쓰는지에 따라 달라집니다.
- 디지털화: 표본화는 위치를 이산화하고 양자화는 픽셀값의 단계를 제한합니다. fs<2B이면 에일리어싱이 발생합니다.
- 전처리: 평균·가우시안 필터는 평활화에, 중앙값 필터는 소금-후추 점 잡음 제거에 적합합니다.
- 분할: 이진화는 문턱값으로 두 영역을 나누고, 영역 기반 방법은 이웃의 유사성으로 성장·분할·병합합니다.
- 경계 검출: 소벨은 1차 미분, 라플라스는 2차 미분을 이용합니다.
- 딥러닝 분석: 객체 검출은 유형과 위치를 찾고, 인스턴스 분할은 개별 물체의 픽셀 영역까지 구분합니다.
이 강의의 중심은 픽셀 행렬을 바로 ‘이해’하는 것이 아니라, 입력을 정돈하고 영역과 경계를 구분한 뒤 분석 가능한 특징으로 바꾸는 단계적 과정에 있습니다. 시험에서는 표본화와 양자화, 전처리와 분할, 평균·가우시안·중앙값 필터, 소벨과 라플라스처럼 목적이나 원리가 비슷해 보이는 개념의 구분 기준을 정확히 잡는 것이 중요합니다.
예상문제 20선
1. 컴퓨터 시각에 대한 설명으로 가장 적절한 것은?
정답입니다.
오답입니다. 해설을 확인해 보세요.
정답 및 해설 보기
정답: ②
컴퓨터 시각은 픽셀 배열에서 시각 정보를 추론하여 컴퓨터가 장면이나 물체를 해석하게 하는 인공지능 분야입니다.
2. 강의에서 제시한 컴퓨터 시각의 처리 순서로 옳은 것은?
정답입니다.
오답입니다. 해설을 확인해 보세요.
정답 및 해설 보기
정답: ④
취득한 영상을 먼저 정돈하고 영역을 분리한 뒤, 변이를 표준화하고 특징으로 표현하여 분석합니다.
3. 정규화 단계의 작업에 해당하는 것은?
정답입니다.
오답입니다. 해설을 확인해 보세요.
정답 및 해설 보기
정답: ①
정규화는 대상의 크기·위치·방향과 영상의 밝기·대비처럼 인식에 불필요한 변이를 표준화합니다.
4. 영상 표현 단계에서 주로 사용하는 특징이 아닌 것은?
정답입니다.
오답입니다. 해설을 확인해 보세요.
정답 및 해설 보기
정답: ③
선·경계·모서리·블롭은 영역을 분석에 유용하게 기술하는 특징입니다. 표본화 주파수는 디지털화 조건입니다.
5. 컬러 영상의 픽셀 g(x,y)=(108,114,52)에 대한 설명으로 옳은 것은?
정답입니다.
오답입니다. 해설을 확인해 보세요.
정답 및 해설 보기
정답: ②
컬러 영상에서는 한 좌표의 픽셀이 빨강·초록·파랑 성분을 묶은 벡터로 표현될 수 있습니다.
6. 4-이웃과 8-이웃의 관계에 대한 설명으로 옳은 것은?
정답입니다.
오답입니다. 해설을 확인해 보세요.
정답 및 해설 보기
정답: ④
8-이웃은 상하좌우의 4-이웃에 네 대각선 이웃을 추가하므로 대각선 연결도 인정합니다.
7. 표본화에 대한 설명으로 옳은 것은?
정답입니다.
오답입니다. 해설을 확인해 보세요.
정답 및 해설 보기
정답: ③
표본화는 공간이나 시간의 연속적인 위치를 일정 간격의 표본 위치로 바꾸는 과정입니다.
8. 대역폭이 B인 대역 제한 신호를 복원하기 위한 표본화 조건은?
정답입니다.
오답입니다. 해설을 확인해 보세요.
정답 및 해설 보기
정답: ①
나이퀴스트-섀넌 정리에 따라 표본화 주파수는 신호 대역폭의 두 배 이상이어야 합니다.
9. 에일리어싱이 발생하기 쉬운 조건은?
정답입니다.
오답입니다. 해설을 확인해 보세요.
정답 및 해설 보기
정답: ④
표본화 주파수가 나이퀴스트 조건에 미치지 못하면 서로 다른 주파수 성분을 구분하지 못하는 에일리어싱이 생깁니다.
10. 양자화에 대한 설명으로 가장 적절한 것은?
정답입니다.
오답입니다. 해설을 확인해 보세요.
정답 및 해설 보기
정답: ②
양자화는 각 표본의 값을 제한된 수의 대표값 중 하나로 바꾸므로 밝기 단계가 줄면 미세한 값이 손실됩니다.
11. 3×3 공간 필터에서 중심 출력 p′5를 구하는 방법으로 옳은 것은?
정답입니다.
오답입니다. 해설을 확인해 보세요.
정답 및 해설 보기
정답: ①
공간 합성곱은 p′5=∑mipi처럼 대응 원소의 곱을 합하여 출력값을 만듭니다.
12. 3×3 평균 필터를 적용할 이웃 아홉 픽셀의 합이 44일 때 출력값은?
정답입니다.
오답입니다. 해설을 확인해 보세요.
정답 및 해설 보기
정답: ③
평균 필터의 계수는 각각 1/9이므로 출력은 44/9≈4.9입니다.
13. 강의에서 제시한 3×3 가우시안 저역 통과 필터의 특징으로 옳은 것은?
정답입니다.
오답입니다. 해설을 확인해 보세요.
정답 및 해설 보기
정답: ④
가우시안 필터는 중심에서 멀어질수록 작은 가중치를 사용하여 영상을 평활화합니다.
14. 이웃값이 81, 82, 84, 85, 87, 89, 90, 91, 210일 때 중앙값 필터의 출력은?
정답입니다.
오답입니다. 해설을 확인해 보세요.
정답 및 해설 보기
정답: ①
아홉 값을 정렬했을 때 다섯 번째인 87이 중앙값이며, 이상값 210의 영향을 받지 않습니다.
15. 소금-후추 형태의 점 잡음 제거에 가장 적합한 필터는?
정답입니다.
오답입니다. 해설을 확인해 보세요.
정답 및 해설 보기
정답: ②
중앙값은 극단적인 흰 점이나 검은 점에 덜 민감하여 소금-후추 잡음 제거에 효과적입니다.
16. 딥러닝 영상 복원 모델에 대한 설명으로 옳은 것은?
정답입니다.
오답입니다. 해설을 확인해 보세요.
정답 및 해설 보기
정답: ③
DnCNN은 잡음 잔차를 학습하고, SwinIR은 트랜스포머 구조로 영상 복원 규칙을 학습합니다.
17. 문턱값 T를 이용한 이진화 규칙으로 옳은 것은?
정답입니다.
오답입니다. 해설을 확인해 보세요.
정답 및 해설 보기
정답: ④
강의의 이진화 식은 문턱값보다 큰 픽셀을 1, 작거나 같은 픽셀을 0으로 분류합니다.
18. 분할·병합법에 대한 설명으로 옳은 것은?
정답입니다.
오답입니다. 해설을 확인해 보세요.
정답 및 해설 보기
정답: ③
분할·병합법은 균일성 검사에 따라 영역을 네 부분으로 반복 분할하고, 조건을 만족하는 인접 영역을 병합합니다.
19. 소벨 연산자와 라플라스 연산자의 구분으로 옳은 것은?
정답입니다.
오답입니다. 해설을 확인해 보세요.
정답 및 해설 보기
정답: ①
1차 미분 경계는 극값으로, 2차 미분 경계는 영교차로 찾습니다. 소벨과 라플라스는 각각 이에 대응합니다.
20. 객체 검출과 인스턴스 분할의 차이에 대한 설명으로 옳은 것은?
정답입니다.
오답입니다. 해설을 확인해 보세요.
정답 및 해설 보기
정답: ②
객체 검출은 유형과 위치를, 인스턴스 분할은 같은 종류의 개체도 나누어 각 픽셀 영역을 출력합니다.
댓글
댓글 쓰기