오픈소스기반데이터분석 8강 - 데이터 분석 (1)
이번 강의에서는 데이터 분석의 의미와 필요성, 현실적인 어려움, 반복적인 분석 주기를 살펴본다. 규칙 기반 분석에서 통계적 모형, 기계학습, 딥러닝으로 이어지는 방법론의 발전을 이해하고, 탐색적 데이터 분석과 자동화 EDA의 역할까지 정리한다.
제1장 데이터 분석의 의미와 필요성
1. 데이터에서 통찰을 발견하는 기술
데이터 분석은 데이터에서 의미 있는 패턴과 통찰을 발견하여 합리적인 의사결정을 지원하는 기술이다. 단순히 수치를 계산하거나 표를 만드는 데 그치지 않고, 데이터가 보여 주는 현상의 원인과 관계를 이해하고 앞으로의 행동 방향을 판단하는 데 목적이 있다.
데이터 분석을 활용하면 경험이나 직관에만 의존하는 판단을 보완할 수 있다. 관찰된 사실을 근거로 의사결정의 질을 높이고, 비즈니스 문제의 근본 원인을 파악하며, 과거와 현재의 패턴을 바탕으로 미래를 예측하는 능력을 키울 수 있다.
2. 데이터 분석의 응용 분야
비즈니스 환경에서는 고객 행동 이해, 시장 트렌드 파악, 운영 효율성 개선, 리스크 관리 등에 데이터 분석을 활용한다. 예를 들어 구매 기록을 분석해 고객의 선호를 이해하거나 운영 데이터를 통해 비용이 많이 발생하는 지점을 찾을 수 있다.
공공 부문에서는 정책 효과 평가, 자원 배분 최적화, 사회 문제 해결 등에 활용한다. 정책 시행 전후의 데이터를 비교하거나 지역별 수요를 파악하면 한정된 자원을 더 합리적으로 배분할 수 있다.
핵심: 데이터 분석의 최종 목적은 데이터 자체가 아니라 데이터에서 얻은 패턴과 통찰을 의사결정에 연결하는 것이다.
제2장 데이터 분석의 어려움과 과제
1. 데이터 품질 문제
현실의 데이터에는 값이 비어 있는 결측치, 잘못 입력된 오류, 같은 관측값이 반복된 중복, 표현 방식이 서로 다른 불일치 등 다양한 품질 문제가 존재한다. 품질이 낮은 데이터를 그대로 분석하면 계산 과정이 정교하더라도 결론의 신뢰성이 떨어질 수 있다.
2. 규모와 복잡성: 빅데이터의 5V
빅데이터 시대에는 데이터의 양뿐 아니라 생성 속도, 형태, 신뢰성, 활용 가치까지 함께 고려해야 한다. 강의에서는 이를 5V, 즉 Volume, Velocity, Variety, Veracity, Value로 설명한다.
| 5V 요소 | 의미 | 분석 과제 |
|---|---|---|
| Volume | 데이터의 방대한 규모 | 저장과 연산 자원을 효율적으로 구성해야 한다. |
| Velocity | 데이터의 빠른 생성·처리 속도 | 신속한 수집과 분석 체계가 필요하다. |
| Variety | 데이터 형식의 다양성 | 구조화 데이터와 비구조화 데이터를 함께 다뤄야 한다. |
| Veracity | 데이터의 정확성과 신뢰성 | 오류와 불확실성을 점검해야 한다. |
| Value | 데이터가 제공하는 활용 가치 | 분석 결과를 실제 문제 해결로 연결해야 한다. |
기존 분석 도구와 방법론이 감당할 수 있는 한계를 넘어서는 경우가 있으며, 표 형태의 구조화된 데이터뿐 아니라 텍스트·이미지 같은 비구조화 데이터도 처리해야 한다. 이에 따라 고성능 컴퓨팅 환경의 필요성이 커진다.
3. 방법론 선택의 난제
분석 방법이 다양해질수록 어떤 방법론을 선택할지 결정하기 어려워진다. 지나치게 복잡한 모델은 해석과 운영이 어렵고, 지나치게 단순한 모델은 중요한 패턴을 놓칠 수 있다. 따라서 데이터의 특성과 분석 목적에 맞는 방법을 선택해야 한다.
좋은 분석은 복잡한 기법을 사용했다는 사실로 결정되지 않는다. 문제와 데이터에 적합한 수준의 방법을 선택하고 결과를 검증하는 것이 중요하다.
제3장 데이터 분석 주기
1. 여섯 단계의 분석 과정
데이터 분석은 한 번에 끝나는 직선형 작업이 아니라 결과를 확인하며 이전 단계로 돌아가는 반복적·순환적 과정이다. 강의에서는 문제 정의, 데이터 수집, 데이터 전처리, 탐색적 데이터 분석, 모델링 및 분석, 시각화 및 결과 해석의 여섯 단계로 분석 주기를 설명한다.
| 단계 | 핵심 활동 |
|---|---|
| 1. 문제 정의 | 해결할 질문과 분석 목적을 명확히 한다. |
| 2. 데이터 수집 | 문제 해결에 필요한 데이터를 확보한다. |
| 3. 데이터 전처리 | 결측치·오류·중복·불일치를 다루고 분석 가능한 형태로 정리한다. |
| 4. EDA | 기술통계와 시각화로 특성·관계·이상점·트렌드를 탐색한다. |
| 5. 모델링 및 분석 | 목적에 맞는 통계·기계학습 등의 방법을 적용한다. |
| 6. 시각화 및 결과 해석 | 결과를 이해하기 쉽게 표현하고 의사결정 관점에서 해석한다. |
2. 순환이 필요한 이유
EDA에서 예상하지 못한 품질 문제가 발견되면 전처리 단계로 돌아가야 하며, 모델 결과가 문제의 목적과 맞지 않으면 문제 정의나 방법론을 다시 검토해야 한다. 시각화와 해석 과정에서 새로운 질문이 생기면 추가 데이터를 수집할 수도 있다. 이처럼 각 단계는 독립된 체크 목록이 아니라 서로 피드백을 주고받는다.
시험 핵심: 분석 과정의 순서는 문제 정의 → 데이터 수집 → 데이터 전처리 → EDA → 모델링 및 분석 → 시각화 및 결과 해석이며, 실제 작업에서는 반복적으로 순환한다.
제4장 데이터 분석 방법론의 발전
1. 시대별 주요 변화
데이터 분석 방법론은 데이터 규모, 컴퓨팅 능력, 알고리즘의 발전과 함께 변화해 왔다. 강의의 흐름은 1960년대 규칙 기반 분석의 시작, 1980년대 통계적 방법론의 발전, 2000년대 초 기계학습의 출현, 2010년대 초 딥러닝의 혁신, 2015년대 자동화된 기계학습, 2020년대 대규모 언어 모델의 발전으로 정리된다.
| 시기 | 주요 발전 |
|---|---|
| 1960년대 | 전문가가 명시한 규칙을 적용하는 규칙 기반 분석이 시작되었다. |
| 1980년대 | 데이터의 관계와 불확실성을 다루는 통계적 방법론이 발전했다. |
| 2000년대 초 | 데이터에서 패턴을 학습하는 기계학습이 확산되었다. |
| 2010년대 초 | 다층 신경망을 활용하는 딥러닝이 혁신을 이끌었다. |
| 2015년대 | 모델 선택과 학습 과정을 지원하는 자동화된 기계학습이 발전했다. |
| 2020년대 | 대규모 언어 모델이 빠르게 발전했다. |
새로운 방법론이 등장했다고 이전 방법이 모두 사라지는 것은 아니다. 문제의 규모, 데이터 유형, 해석 가능성, 성능 요구에 따라 규칙·통계·기계학습·딥러닝을 적절히 선택하거나 결합할 수 있다.
제5장 규칙 기반 분석
1. 전문가의 지식을 명시적 규칙으로 표현
규칙 기반 분석은 전문가의 경험과 직관을 특정 조건과 규칙으로 직접 프로그래밍하는 방식이다. 일반적으로 if-then 형태의 논리 규칙을 사용하며, 분석가의 도메인 지식이 분석 과정에 명시적으로 반영된다.
대출 심사 예제에서는 나이, 소득, 신용 점수를 차례로 검사하여 미성년자 거부, 소득 불충분 거부, 신용 점수 불충분 거부, 고객 등급별 승인 또는 추가 검토 필요를 반환한다.
def loan_approval_rule(age, income, credit_score):
if age < 18:
return "거부: 미성년자"
elif income < 6000000:
return "거부: 소득 불충분"
elif credit_score < 600:
return "거부: 신용 점수 불충분"
elif income >= 100000000 and credit_score >= 950:
return "승인: 최우선 고객"
elif income >= 70000000 and credit_score >= 900:
return "승인: 우수 고객"
elif income >= 20000000 and credit_score >= 850:
return "승인: 일반 고객"
else:
return "추가 검토 필요"
2. 장점과 단점
규칙이 코드에 직접 드러나므로 결과가 나온 이유를 추적하기 쉽고 투명성과 해석 가능성이 높다. 복잡한 통계나 수학 지식 없이도 도메인 규칙을 구현할 수 있다는 장점도 있다.
반면 복잡하고 비선형적인 패턴을 포착하기 어렵고, 미리 규정하지 않은 새로운 상황이나 예외에 일반화하는 능력이 부족하다. 규칙의 수가 많아지면 유지·관리도 복잡해질 수 있다.
| 구분 | 내용 |
|---|---|
| 장점 | 투명성과 해석 가능성이 높고 구현 논리를 설명하기 쉽다. |
| 단점 | 복잡한 비선형 패턴과 새로운 상황에 대한 일반화가 어렵다. |
제6장 통계적 모형을 활용한 분석
1. 패턴과 관계의 수학적 모델링
통계적 분석은 데이터에서 패턴과 관계를 발견하고 이를 수학적으로 모델링하는 접근 방식이다. 데이터의 분포, 변수 사이의 관계, 표본으로부터 발생하는 불확실성을 체계적으로 표현한다.
2. 기술통계와 추론통계
기술통계는 현재 데이터의 특징을 요약한다. 평균·중앙값·최빈값은 중심 경향, 표준편차·분산·범위는 흩어진 정도, 정규성·왜도·첨도는 분포 형태를 이해하는 데 사용한다.
추론통계는 표본 데이터를 바탕으로 모집단에 대한 일반화된 결론을 도출하는 데 중점을 둔다. 가설검정, 신뢰구간 추정, 회귀 분석 등이 대표적인 방법이다.
3. 통계적 가정의 중요성
통계적 모형은 데이터가 특정 분포를 따른다는 가정을 둘 수 있다. 예를 들어 정규분포 가정이 성립하지 않는데 이를 전제로 한 모형을 무리하게 적용하면 정확성과 신뢰성이 낮아질 수 있다. 따라서 데이터 특성과 모형의 가정을 함께 검토해야 한다.
구별: 기술통계는 관찰된 데이터를 요약하고, 추론통계는 표본을 이용해 모집단에 관한 결론을 추정한다.
제7장 기계학습을 활용한 분석
1. 지도학습
지도학습은 입력값과 정답인 레이블을 함께 학습한다. 결과 범주를 맞히는 분류와 연속적인 수치를 예측하는 회귀가 대표적이다. 이메일 스팸 필터링과 이미지 인식은 분류, 주택 가격과 판매량 예측은 회귀의 활용 예이다.
2. 비지도학습
비지도학습은 정답 레이블 없이 데이터에 내재된 패턴과 구조를 발견한다. 군집화, 차원 축소, 연관 규칙 학습 등에 사용하며, 이상 탐지나 상품 추천과 같은 문제에 적용할 수 있다.
3. 강화학습
강화학습은 환경과 상호작용하는 에이전트가 보상을 최대화하는 행동 정책을 학습하는 방법이다. 에이전트는 행동의 결과로 얻는 보상을 바탕으로 더 나은 선택을 학습한다. 강의에서는 게임 환경에서 행동을 학습하는 사례를 보여 준다.
| 학습 방식 | 학습 정보 | 대표 활용 |
|---|---|---|
| 지도학습 | 입력값과 정답 레이블 | 분류, 회귀 |
| 비지도학습 | 정답 없는 데이터 | 군집화, 차원 축소, 연관 규칙 |
| 강화학습 | 환경과 상호작용하며 얻는 보상 | 보상을 최대화하는 행동 정책 학습 |
제8장 딥러닝과 인공지능 모형
1. 다층 인공신경망과 계층적 표현
딥러닝은 인간의 뇌를 모방한 인공신경망을 기반으로 하는 기계학습의 한 분야이다. 입력층과 출력층 사이에 여러 은닉층을 둔 다층 구조를 사용하며, 각 층은 이전 층의 출력을 입력으로 받아 더 추상적인 특징을 추출한다.
계층적 표현 학습을 통해 저수준 특징에서 고수준 특징까지 자동으로 학습하므로 복잡한 패턴을 처리할 수 있다. 특히 이미지·텍스트·시계열 같은 비정형 데이터 분석에 새로운 가능성을 제시했다.
2. 데이터 유형에 따른 딥러닝 구조
| 모델 구조 | 적합한 분야 |
|---|---|
| CNN | 컴퓨터 비전과 이미지 처리 |
| RNN, LSTM, GRU | 텍스트와 시계열 데이터 |
| 트랜스포머 | 자연어 처리 |
| 대규모 언어 모델(LLM) | 대규모 텍스트를 바탕으로 한 언어 처리 |
모델 구조는 데이터의 특성과 처리 목적에 맞게 선택한다. 딥러닝은 복잡한 특징을 자동으로 학습하는 장점이 있지만, 분석 목적과 데이터 품질을 먼저 이해해야 한다는 기본 원칙은 변하지 않는다.
제9장 탐색적 데이터 분석의 개념과 중요성
1. 데이터가 무엇을 말하는지 살펴보기
탐색적 데이터 분석(EDA)은 “데이터가 무엇을 말하는지 들어보라”는 철학에서 출발한다. 본격적인 모델링 전에 데이터의 기본적인 특성과 구조를 이해하고, 데이터에 내재된 패턴, 변수 간 관계, 이상점, 트렌드 등을 발견하는 체계적인 접근법이다.
2. EDA가 중요한 이유
EDA를 수행하면 결측치·오류·이상점과 같은 데이터 품질 문제를 조기에 발견할 수 있다. 변수 사이의 관계와 반복되는 패턴을 파악해 적절한 분석 방향을 정하고, 이후 검토할 가설을 세우는 데에도 도움을 준다.
EDA의 두 가지 주요 접근법은 기술통계량 분석과 데이터 시각화이다. 기술통계량은 중심과 분산, 분포 형태를 수치로 요약하고, 시각화는 분포와 관계, 이상점을 그래프를 통해 직관적으로 확인하게 한다.
EDA의 위치: EDA는 데이터 전처리 이후 모델링 이전에 수행하며, 결과에 따라 전처리나 문제 정의 단계로 다시 돌아갈 수 있다.
제10장 자동화된 EDA 도구
1. 자동화가 필요한 이유
새로운 데이터셋을 처음 탐색하려면 변수 유형과 분포, 결측치, 상관관계, 이상값 등을 반복적으로 확인해야 한다. 이러한 작업에는 많은 시간과 노력이 들며 기계적으로 반복되는 부분도 많다. 자동화 EDA 도구는 기본적인 통계 분석, 변수 간 상관관계 파악, 데이터 시각화를 몇 줄의 코드로 수행해 탐색 효율을 높인다.
자동화 도구는 분석가를 대신해 모든 결론을 내려 주는 것이 아니라, 기본적인 특성을 빠르게 파악하여 분석가가 고차원적인 분석과 모델링에 집중하도록 보조한다.
2. ydata-profiling 활용 예
강의 예제에서는 seaborn의 붓꽃 데이터셋을 불러오고, ydata_profiling의 ProfileReport로 자동 분석 보고서를 만든 뒤 HTML 파일로 저장한다.
import seaborn as sns
from ydata_profiling import ProfileReport
df = sns.load_dataset("iris")
profile = ProfileReport(
df,
title="붓꽃 데이터셋 분석 보고서"
)
profile.to_file("iris_profile.html")
profile
이 보고서를 통해 기본 통계, 변수 분포, 상관관계 등 초기 탐색에 필요한 정보를 빠르게 확인할 수 있다. 이후 발견한 특징과 문제를 바탕으로 전처리와 분석 계획을 구체화한다.
자동화 EDA 결과는 출발점이다. 생성된 지표와 그래프가 분석 목적에서 어떤 의미를 갖는지 판단하는 과정은 분석가의 몫이다.
핵심 개념 정리
데이터 분석과 과정
- 데이터 분석은 의미 있는 패턴과 통찰을 찾아 합리적인 의사결정을 지원한다.
- 현실의 데이터에는 결측치·오류·중복·불일치와 5V의 규모·복잡성 문제가 존재한다.
- 분석 주기는 문제 정의, 수집, 전처리, EDA, 모델링 및 분석, 시각화 및 결과 해석으로 구성되며 반복적으로 순환한다.
분석 방법론
- 규칙 기반 분석은 투명하고 설명하기 쉽지만 복잡한 패턴과 새로운 상황에 대한 일반화가 어렵다.
- 통계적 모형은 데이터의 분포, 변수 관계, 불확실성을 수학적으로 표현한다.
- 지도학습은 레이블, 비지도학습은 숨은 구조, 강화학습은 보상을 바탕으로 학습한다.
- 딥러닝은 다층 신경망의 계층적 표현 학습으로 복잡한 비정형 데이터 패턴을 처리한다.
EDA
- EDA는 기술통계와 시각화로 데이터의 특성·관계·이상점·트렌드를 탐색한다.
- 자동화 EDA는 반복적인 초기 탐색을 줄이고 분석가가 고차원 분석에 집중하도록 돕는다.
최종 정리: 데이터 분석에서는 먼저 해결할 문제와 데이터의 품질·구조를 이해한 뒤 목적에 맞는 분석 방법을 선택해야 한다. 규칙, 통계, 기계학습, 딥러닝은 서로 다른 장단점을 가지며, EDA는 모델링 전에 데이터가 실제로 무엇을 말하는지 확인하고 분석 방향을 세우는 핵심 단계이다.
예상문제 20선
1. 데이터 분석의 정의로 가장 적절한 것은?
정답입니다.
오답입니다. 답안을 다시 선택해 보세요.
정답 및 해설 보기
정답: ③
데이터 분석은 패턴과 통찰을 발견하여 의사결정의 질을 높이고 문제의 원인 파악과 미래 예측을 지원한다.
2. 공공 부문에서 데이터 분석을 활용하는 사례로 옳은 것은?
정답입니다.
오답입니다. 답안을 다시 선택해 보세요.
정답 및 해설 보기
정답: ①
공공 부문은 정책 효과 평가, 자원 배분 최적화, 사회 문제 해결 등에 데이터 분석을 활용한다.
3. 빅데이터의 5V에서 데이터 형식의 다양성을 의미하는 것은?
정답입니다.
오답입니다. 답안을 다시 선택해 보세요.
정답 및 해설 보기
정답: ④
Variety는 표·텍스트·이미지 등 데이터 유형과 형식이 다양하다는 특성을 뜻한다.
4. 데이터 분석 방법론을 선택할 때 가장 중요한 기준은?
정답입니다.
오답입니다. 답안을 다시 선택해 보세요.
정답 및 해설 보기
정답: ②
지나치게 복잡하거나 단순한 모델 모두 위험할 수 있으므로 문제 목적과 데이터 특성에 맞춰 결정해야 한다.
5. 데이터 분석 과정의 첫 번째 단계는?
정답입니다.
오답입니다. 답안을 다시 선택해 보세요.
정답 및 해설 보기
정답: ①
무엇을 해결하고 어떤 질문에 답할지 정의해야 필요한 데이터와 분석 방법을 결정할 수 있다.
6. 분석 주기가 반복적·순환적인 이유로 가장 적절한 것은?
정답입니다.
오답입니다. 답안을 다시 선택해 보세요.
정답 및 해설 보기
정답: ③
후속 단계에서 새로운 문제나 질문이 발견되면 이전 단계로 돌아가 보완하므로 분석은 순환적으로 진행된다.
7. 데이터 분석 방법론의 발전 순서로 옳은 것은?
정답입니다.
오답입니다. 답안을 다시 선택해 보세요.
정답 및 해설 보기
정답: ②
강의에서는 1960년대 규칙 기반, 1980년대 통계, 2000년대 초 기계학습, 2010년대 초 딥러닝 순으로 발전을 제시한다.
8. 규칙 기반 분석의 장점은?
정답입니다.
오답입니다. 답안을 다시 선택해 보세요.
정답 및 해설 보기
정답: ④
if-then 규칙이 직접 드러나므로 결과가 나온 이유를 추적하고 설명하기 쉽다.
9. 규칙 기반 분석의 한계로 옳은 것은?
정답입니다.
오답입니다. 답안을 다시 선택해 보세요.
정답 및 해설 보기
정답: ④
미리 작성한 규칙에 없는 복잡한 관계나 새로운 상황을 처리하는 능력이 부족한 것이 주요 한계이다.
10. 평균·중앙값·최빈값이 설명하는 통계적 특성은?
정답입니다.
오답입니다. 답안을 다시 선택해 보세요.
정답 및 해설 보기
정답: ②
평균·중앙값·최빈값은 데이터가 어느 값을 중심으로 모이는지를 요약하는 중심 경향 지표이다.
11. 표본 데이터를 바탕으로 모집단에 대한 결론을 도출하는 분야는?
정답입니다.
오답입니다. 답안을 다시 선택해 보세요.
정답 및 해설 보기
정답: ①
추론통계는 표본을 이용해 모집단의 특성을 추정하며 가설검정·신뢰구간·회귀 분석 등이 포함된다.
12. 입력값과 정답 레이블을 함께 학습하는 기계학습 방식은?
정답입니다.
오답입니다. 답안을 다시 선택해 보세요.
정답 및 해설 보기
정답: ③
지도학습은 입력과 정답 레이블의 관계를 학습하며 분류와 회귀 문제에 활용한다.
13. 정답 레이블 없이 데이터의 구조와 패턴을 찾는 방법은?
정답입니다.
오답입니다. 답안을 다시 선택해 보세요.
정답 및 해설 보기
정답: ②
비지도학습은 레이블 없이 군집화·차원 축소·연관 규칙 등을 통해 숨은 구조를 발견한다.
14. 환경과 상호작용하며 보상을 최대화하는 정책을 학습하는 방식은?
정답입니다.
오답입니다. 답안을 다시 선택해 보세요.
정답 및 해설 보기
정답: ④
강화학습의 에이전트는 환경에서 행동하고 얻은 보상을 바탕으로 보상을 최대화하는 정책을 학습한다.
15. 컴퓨터 비전 분야에 적합한 딥러닝 구조는?
정답입니다.
오답입니다. 답안을 다시 선택해 보세요.
정답 및 해설 보기
정답: ③
CNN은 이미지의 공간적 특징을 학습하는 데 적합하여 컴퓨터 비전 분야에서 활용된다.
16. 트랜스포머 구조가 강의에서 주로 연결된 분야는?
정답입니다.
오답입니다. 답안을 다시 선택해 보세요.
정답 및 해설 보기
정답: ①
강의에서는 트랜스포머를 자연어 처리에 적합한 구조로 제시하며 대규모 언어 모델의 기반과 연결한다.
17. 탐색적 데이터 분석(EDA)의 목적으로 옳지 않은 것은?
정답입니다.
오답입니다. 답안을 다시 선택해 보세요.
정답 및 해설 보기
정답: ④
EDA는 데이터를 이해하고 분석 방향을 세우는 탐색 과정이지 최종 의사결정을 자동으로 확정하는 과정이 아니다.
18. EDA의 두 가지 주요 접근법은?
정답입니다.
오답입니다. 답안을 다시 선택해 보세요.
정답 및 해설 보기
정답: ①
EDA는 수치 요약인 기술통계와 분포·관계를 보여 주는 시각화를 함께 활용한다.
19. 강의 예제에서 자동화 EDA 보고서를 생성하는 클래스는?
정답입니다.
오답입니다. 답안을 다시 선택해 보세요.
정답 및 해설 보기
정답: ③
ydata_profiling의 ProfileReport에 데이터프레임과 제목을 전달해 자동 분석 보고서를 생성한다.
20. 자동화 EDA 도구의 올바른 역할은?
정답입니다.
오답입니다. 답안을 다시 선택해 보세요.
정답 및 해설 보기
정답: ②
자동화 EDA는 기본 통계·상관관계·시각화를 빠르게 제공하는 보조 도구이며 의미 해석은 분석가가 수행해야 한다.
댓글
댓글 쓰기