오픈소스기반데이터분석 9강 - 데이터 분석 (2)
이번 강의에서는 통계적 분석, 기계학습 기반 분석, 딥러닝 기반 분석의 대표 방법론을 학습한다. 상관관계·회귀·가설검정·분산 분석의 목적을 이해하고, 분류·회귀·비지도학습 알고리즘의 특징과 TensorFlow·Keras·CNN·LLM의 역할을 비교한다.
제1장 통계적 분석의 기초
1. 패턴과 관계를 수학적으로 표현하기
통계적 분석은 데이터에서 패턴과 관계를 발견하고 이를 수학적으로 모델링하는 접근 방식이다. 관찰된 자료를 단순히 나열하지 않고 중심, 분산, 관계, 불확실성 등을 수치로 표현하여 데이터가 말하는 바를 체계적으로 해석한다.
기술통계는 수집한 데이터의 주요 특성을 요약하고 설명한다. 평균·중앙값과 같은 중심 경향, 분산·표준편차와 같은 산포 정도 등을 통해 현재 데이터가 어떤 모습을 가지는지 파악한다. 추론통계는 표본을 바탕으로 모집단에 대한 일반화된 결론을 도출하는 데 목적이 있다.
2. statsmodels 라이브러리
statsmodels는 통계 모델링과 검정을 위한 오픈소스 파이썬 라이브러리이다. 상관관계 분석, 회귀 분석, 시계열 분석, 가설검정, 분산 분석 등 다양한 통계 방법을 지원한다. 데이터의 관계를 모델링하고 통계적으로 유의한지 평가하는 작업에 활용할 수 있다.
| 구분 | 목적 | 대표 내용 |
|---|---|---|
| 기술통계 | 관찰된 데이터의 특성을 요약·설명 | 중심 경향, 분산 정도, 분포 요약 |
| 추론통계 | 표본에서 모집단에 관한 결론 도출 | 가설검정, 회귀, 분산 분석 |
| statsmodels | 통계 모델링과 검정을 코드로 수행 | 회귀, 시계열, 가설검정, ANOVA 등 |
제2장 상관관계 분석
1. 두 변수 관계의 강도와 방향
상관관계 분석은 두 변수 사이의 관계를 수치적으로 평가하는 기법이다. 진단적 분석 단계에서 주로 사용하며, 어떤 요소가 특정 결과와 어느 정도 함께 변화하는지 파악하는 데 도움을 준다.
상관계수 r은 일반적으로 -1에서 1 사이의 값을 가진다. -1에 가까울수록 강한 음의 상관관계, 1에 가까울수록 강한 양의 상관관계를 나타낸다. 0에 가까우면 두 변수 사이의 선형 관계가 약하거나 없음을 의미한다.
| 상관계수 | 관계 | 산점도의 경향 |
|---|---|---|
r = -1 | 완전한 음의 상관관계 | 한 변수가 증가할 때 다른 변수는 일정하게 감소한다. |
-1 < r < 0 | 음의 상관관계 | 전체적으로 반대 방향의 변화가 나타난다. |
r = 0 | 선형 상관관계 없음 | 뚜렷한 직선 방향성이 보이지 않는다. |
0 < r < 1 | 양의 상관관계 | 두 변수가 같은 방향으로 변화하는 경향이 있다. |
r = 1 | 완전한 양의 상관관계 | 한 변수가 증가할 때 다른 변수도 일정하게 증가한다. |
핵심: 상관계수의 부호는 관계의 방향, 절댓값은 선형 관계의 강도를 나타낸다.
제3장 회귀 분석
1. 독립변수와 종속변수의 관계 모델링
회귀 분석은 독립변수와 종속변수 사이의 관계를 모델링하고, 새로운 독립변수 데이터가 주어졌을 때 종속변수의 결과를 예측하는 방법이다. 입력 특성이 결과에 미치는 영향을 정량화하고 예측값을 계산하는 데 사용한다.
예를 들어 주택의 면적·위치·연식 등을 독립변수로 두고 가격을 종속변수로 두어 관계를 학습할 수 있다. 모델이 학습된 뒤 새로운 주택의 특성이 입력되면 예상 가격을 출력한다. 실제값과 예측값이 가까울수록 모델의 예측이 잘 맞았다고 볼 수 있다.
2. 상관관계와 회귀의 구별
상관관계 분석은 두 변수가 함께 변하는 정도를 측정하는 데 중심을 두고, 회귀 분석은 독립변수와 종속변수의 관계를 식으로 모델링해 새로운 값의 결과를 예측한다. 두 방법 모두 변수 관계를 다루지만 분석 목적과 산출물이 다르다.
상관관계는 관계 강도의 요약이고, 회귀는 입력과 결과 사이의 모델을 만들어 예측에 활용하는 방법으로 구별한다.
제4장 가설검정
1. 주장의 통계적 타당성 평가
가설검정은 설정한 가설이 데이터를 기준으로 통계적으로 유의미한지 확인하는 과정이다. 표본에서 관찰된 결과가 우연히 나타났다고 보기 어려운지를 검토하여 주장의 타당성을 평가한다.
2. 가설검정의 네 단계
- 가설 설정: 기본 주장인 귀무가설
H0과 이에 맞서는 대립가설H1을 정의한다. - 통계량 계산: 데이터와 검정 방법에 따라 t, F, z 등의 검정 통계량을 계산한다.
- p값 도출: 귀무가설이 참일 때 현재와 같은 관찰 결과가 나올 가능성을 계산한다.
- 결론 도출: p값을 미리 정한 유의수준과 비교해 귀무가설 기각 여부를 판단한다.
강의에서는 유의수준을 0.05로 두었을 때 p < 0.05이면 귀무가설을 기각하는 기준을 제시한다. p값이 유의수준보다 작다는 것은 귀무가설이 참이라는 전제 아래 관찰 결과가 나타날 가능성이 충분히 작다고 판단한 것이다.
판정 기준: 유의수준이 0.05일 때 p값이 0.05보다 작으면 H0을 기각하고, 그렇지 않으면 H0을 기각할 충분한 근거가 없다고 판단한다.
제5장 분산 분석
1. 세 개 이상 그룹의 평균 비교
분산 분석(ANOVA, Analysis of Variance)은 세 개 이상의 그룹 사이에 평균 차이가 있는지를 한 번에 검정하는 통계적 방법이다. 여러 그룹을 두 개씩 나누어 t-검정을 반복하면 제1종 오류가 발생할 가능성이 커지는 문제를 줄이기 위해 사용한다.
2. F-통계량과 분석 과정
먼저 비교할 그룹과 평균 차이에 관한 문제를 정의한다. 이후 그룹 간 차이와 그룹 내 차이를 비교하는 F-통계량을 계산한다.
F = 집단 간 분산 / 집단 내 분산
F-분포를 이용해 p값을 구하고 유의성을 평가한다. 강의의 기준처럼 p < 0.05라면 그룹 간 평균 차이가 존재한다고 판단한다.
| 단계 | 내용 |
|---|---|
| 문제 정의 | 세 개 이상 그룹의 평균 차이를 검정할 질문을 설정한다. |
| F-통계량 계산 | 집단 간 분산과 집단 내 분산을 비교한다. |
| p값 도출 | F-분포를 이용해 관찰된 차이의 유의성을 평가한다. |
| 결론 도출 | p값이 기준보다 작으면 그룹 간 차이가 있다고 판단한다. |
제6장 분류 알고리즘
1. 데이터를 미리 정의된 범주로 구분
분류는 데이터를 미리 정의된 범주 또는 클래스 중 하나로 구분하는 작업이다. 스팸 여부, 질병 여부, 고객 이탈 여부처럼 결과가 범주로 표현되는 문제에 적용한다.
| 알고리즘 | 원리 | 장점 | 단점 |
|---|---|---|---|
| 로지스틱 회귀 | 시그모이드 함수로 확률을 구해 이진 분류 | 간단하고 해석하기 쉽다. | 복잡한 비선형 관계 표현이 어렵다. |
| 결정 트리 | 연속된 질문으로 데이터를 분할 | 해석이 쉽고 비선형 관계를 모델링한다. | 과적합 위험이 있다. |
| 랜덤 포레스트 | 여러 결정 트리를 앙상블 | 일반화 성능이 우수하고 과적합을 줄인다. | 트리가 많으면 학습·예측이 느려질 수 있다. |
| SVM | 클래스를 나누는 최적 결정 경계를 탐색 | 고차원 데이터에서도 효과적이다. | 커널 선택과 파라미터 조정이 중요하다. |
| k-NN | 주변 k개 데이터의 정보를 참고해 분류 | 직관적이고 구현이 간단하다. | 계산 비용이 높고 고차원에서 성능이 저하될 수 있다. |
분류 알고리즘은 모두 범주를 예측하지만 가정, 해석 가능성, 비선형 패턴 처리, 계산 비용이 서로 다르므로 데이터 특성에 맞게 선택한다.
제7장 회귀 알고리즘
1. 연속적인 값 예측
기계학습의 회귀는 주어진 특성을 바탕으로 가격, 온도, 판매량처럼 연속적인 값을 예측하는 작업이다. 통계적 회귀와 마찬가지로 변수 관계를 모델링하지만, 다양한 알고리즘과 정규화·앙상블 기법을 이용해 예측 성능과 일반화 능력을 개선할 수 있다.
| 알고리즘 | 개요 | 특징 및 장점 | 한계 |
|---|---|---|---|
| 선형 회귀 | 특성과 목표 변수의 선형 관계를 모델링 | 간단하고 해석이 쉽다. | 비선형 관계를 표현하기 어렵다. |
| 릿지 회귀 | 선형 회귀에 L2 정규화 적용 | 과적합을 줄이고 일반화 성능을 높인다. | 모든 특성이 모델에 유지된다. |
| 라쏘 회귀 | 선형 회귀에 L1 정규화 적용 | 불필요한 특성을 제거해 자동 특성 선택을 수행한다. | 중요한 특성도 제거될 수 있다. |
| 결정 트리 회귀 | 결정 트리 구조로 연속값 예측 | 비선형 패턴을 포착할 수 있다. | 과적합 우려가 있다. |
| 랜덤 포레스트 회귀 | 여러 트리의 예측을 평균 | 안정적이며 단일 트리보다 정확도가 높을 수 있다. | 해석이 어려울 수 있다. |
정규화 구별: 릿지는 L2 정규화로 모든 특성을 유지하는 경향이 있고, 라쏘는 L1 정규화로 일부 계수를 0으로 만들어 특성 선택 효과를 낼 수 있다.
제8장 비지도학습 기법
1. 레이블 없는 데이터에서 구조 발견
비지도학습은 정답 레이블이 없는 데이터에서 패턴과 구조를 발견한다. 결과 범주를 미리 알려 주지 않아도 데이터 포인트 사이의 유사성, 저차원 구조, 정상 패턴에서 벗어난 관측값, 항목 간 동시 출현 규칙 등을 탐색한다.
| 기법 | 개요 | 대표 알고리즘 | 활용 분야 |
|---|---|---|---|
| 군집화 | 유사한 데이터 포인트를 그룹으로 묶는다. | K-평균, 계층적 군집화, DBSCAN | 고객 세분화, 이미지 분류 등 |
| 차원 축소 | 정보 손실을 줄이며 데이터 차원을 감소시킨다. | PCA, t-SNE, UMAP | 시각화, 노이즈 제거, 전처리 |
| 이상치 탐지 | 정상 패턴에서 벗어난 데이터를 찾는다. | Isolation Forest, DBSCAN | 고장 감지, 사기 탐지 |
| 연관 규칙 학습 | 항목 사이의 빈번한 패턴과 관계 규칙을 발견한다. | Apriori, FP-Growth | 장바구니 분석, 추천 시스템 |
각 비지도학습 기법은 찾으려는 구조가 다르다. 고객 집단을 나누려면 군집화, 고차원 데이터를 시각화하려면 차원 축소, 비정상 거래를 찾으려면 이상치 탐지, 함께 구매되는 상품을 찾으려면 연관 규칙 학습을 고려할 수 있다.
제9장 딥러닝의 이해
1. 여러 층을 통한 복잡한 패턴 학습
딥러닝은 인공 신경망의 여러 층을 통해 데이터를 분석하고 복잡한 패턴을 학습하는 기계학습의 한 분야이다. 입력층, 여러 은닉층, 출력층으로 구성된 신경망에서 각 층이 이전 층의 표현을 바탕으로 더 추상적인 특징을 학습한다.
단순한 퍼셉트론은 여러 입력과 가중치의 결합으로 출력을 계산하는 기본 단위이다. 심층 신경망은 이러한 연산 단위를 여러 층으로 연결하여 단순 특징부터 복잡한 특징까지 계층적으로 표현한다.
2. 데이터 유형별 구조
강의에서는 CNN이 이미지 처리에 특화되어 있고, RNN·LSTM·GRU가 순서가 중요한 시퀀스 데이터 처리에 특화되어 있음을 정리한다. 데이터 구조에 따라 적합한 신경망 구조를 선택해야 한다.
| 구조 | 주요 데이터 | 핵심 용도 |
|---|---|---|
| CNN | 이미지 | 공간적 특징을 추출하는 이미지 처리 |
| RNN | 시퀀스 | 순서와 이전 정보가 중요한 데이터 처리 |
| LSTM, GRU | 긴 시퀀스 | 시퀀스의 장기적인 관계 학습 |
제10장 TensorFlow와 Keras
1. TensorFlow의 기본 개념
TensorFlow는 구글이 개발한 오픈소스 기계학습 프레임워크이다. 대규모 신경망을 구축하고 학습할 수 있는 도구를 제공하며, 딥러닝 모델의 계산과 학습 과정을 구현하는 기반으로 사용한다.
2. Keras의 역할
Keras는 TensorFlow 위에 구축된 고수준 API이다. 복잡한 딥러닝 모델을 비교적 간단하고 직관적으로 구성하게 해 준다. 모델 구조를 정의하는 함수와 학습·평가·예측을 수행하는 함수를 제공한다.
| 기능 | 대표 함수·계층 | 역할 |
|---|---|---|
| 모델 구성 | Sequential(), Dense(), Conv2D(), LSTM() | 모델과 신경망 계층을 정의한다. |
| 학습 준비 | compile() | 학습에 필요한 설정을 구성한다. |
| 모델 학습 | fit() | 주어진 데이터로 모델을 학습한다. |
| 모델 평가 | evaluate() | 데이터를 이용해 모델 성능을 평가한다. |
| 결과 예측 | predict() | 새로운 입력에 대한 예측값을 생성한다. |
구별: TensorFlow는 대규모 신경망 구축·학습을 위한 프레임워크이고, Keras는 그 위에서 모델을 간결하게 구성하도록 돕는 고수준 API이다.
제11장 CNN과 생성형 언어 모델
1. CNN을 이용한 이미지 데이터 분석
CNN은 이미지 처리에 특화된 딥러닝 모델이다. 이미지의 일부 영역을 살펴보는 필터를 통해 가장자리·질감·형태와 같은 공간적 특징을 추출하고, 여러 층을 거치며 더 복잡한 시각 패턴을 학습한다.
2. 트랜스포머 아키텍처
트랜스포머는 2017년 구글의 “Attention is All You Need” 논문에서 소개된 구조이다. 자기 주의(self-attention) 메커니즘을 통해 텍스트 내부의 장거리 의존성을 효과적으로 포착한다. 이러한 구조는 대규모 언어 모델 발전의 중요한 기반이 되었다.
3. LLM의 학습·활용 방식
대규모 언어 모델(LLM)은 자연어 입력을 받아 자연어 출력을 생성하며 데이터 분석 과정에도 새로운 변화를 가져오고 있다. 강의에서는 사용 방식으로 제로샷 학습, 퓨샷 학습, 파인튜닝을 제시한다.
| 방식 | 설명 |
|---|---|
| 제로샷 | 특정 작업 예시 없이 맥락과 지시만으로 응답을 생성한다. |
| 퓨샷 | 소수의 예시로 원하는 출력 형식이나 분석 방향을 안내한다. |
| 파인튜닝 | 특정 도메인이나 작업에 맞도록 모델을 추가로 학습한다. |
제로샷과 퓨샷은 예시 제공 방식의 차이이고, 파인튜닝은 특정 목적에 맞게 모델 자체를 추가 학습하는 방식이다.
핵심 개념 정리
통계적 분석
- 상관관계 분석은 두 변수 사이 선형 관계의 방향과 강도를 측정한다.
- 회귀 분석은 독립변수와 종속변수 관계를 모델링하여 연속적인 결과를 예측한다.
- 가설검정은 귀무가설과 대립가설을 설정하고 p값을 유의수준과 비교한다.
- ANOVA는 세 개 이상 그룹의 평균 차이를 F-통계량으로 한 번에 검정한다.
기계학습 기반 분석
- 분류는 미리 정의된 클래스, 회귀는 연속적인 값을 예측한다.
- 릿지는 L2 정규화, 라쏘는 L1 정규화를 사용한다.
- 비지도학습에는 군집화, 차원 축소, 이상치 탐지, 연관 규칙 학습이 있다.
딥러닝 기반 분석
- 딥러닝은 여러 신경망 층을 통해 복잡한 특징을 계층적으로 학습한다.
- TensorFlow는 오픈소스 프레임워크이고 Keras는 고수준 API이다.
- CNN은 이미지, RNN·LSTM·GRU는 시퀀스 데이터 처리에 특화되어 있다.
- 트랜스포머는 self-attention으로 장거리 의존성을 포착하며 LLM의 기반이 된다.
최종 정리: 분석 방법은 예측 대상과 데이터 구조에 따라 선택해야 한다. 통계적 분석은 관계와 불확실성을 검정하고, 기계학습은 데이터에서 분류·회귀·숨은 구조를 학습하며, 딥러닝은 다층 신경망으로 이미지·시퀀스·자연어의 복잡한 패턴을 처리한다.
예상문제 20선
1. 기술통계의 주된 목적은?
정답입니다.
오답입니다. 답안을 다시 선택해 보세요.
정답 및 해설 보기
정답: ②
기술통계는 평균·분산 등으로 현재 데이터의 중심, 흩어짐, 분포 특성을 요약한다.
2. 통계 모델링과 가설검정을 지원하는 오픈소스 파이썬 라이브러리는?
정답입니다.
오답입니다. 답안을 다시 선택해 보세요.
정답 및 해설 보기
정답: ④
statsmodels는 상관관계, 회귀, 시계열, 가설검정, 분산 분석 등을 지원한다.
3. 상관계수 r = -1이 의미하는 것은?
정답입니다.
오답입니다. 답안을 다시 선택해 보세요.
정답 및 해설 보기
정답: ①
r이 -1이면 한 변수가 일정하게 증가할 때 다른 변수가 일정하게 감소하는 완전한 음의 선형 관계이다.
4. 회귀 분석의 목적으로 가장 적절한 것은?
정답입니다.
오답입니다. 답안을 다시 선택해 보세요.
정답 및 해설 보기
정답: ③
회귀는 입력 특성과 연속적인 결과의 관계를 모델링하여 새로운 입력의 값을 예측한다.
5. 가설검정의 첫 번째 단계는?
정답입니다.
오답입니다. 답안을 다시 선택해 보세요.
정답 및 해설 보기
정답: ③
먼저 검정할 기본 주장 H0과 이에 대응하는 H1을 명확히 설정해야 통계량과 판정 기준을 정할 수 있다.
6. 유의수준이 0.05이고 p값이 0.03일 때 강의의 판정 기준은?
정답입니다.
오답입니다. 답안을 다시 선택해 보세요.
정답 및 해설 보기
정답: ①
0.03은 유의수준 0.05보다 작으므로 관찰 결과가 통계적으로 유의하다고 보고 H0을 기각한다.
7. 세 개 이상 그룹의 평균 차이를 한 번에 검정하는 방법은?
정답입니다.
오답입니다. 답안을 다시 선택해 보세요.
정답 및 해설 보기
정답: ④
ANOVA는 여러 그룹을 두 개씩 반복 비교할 때 커지는 제1종 오류 문제를 줄이며 평균 차이를 한 번에 검정한다.
8. 분산 분석의 F-통계량을 나타내는 식은?
정답입니다.
오답입니다. 답안을 다시 선택해 보세요.
정답 및 해설 보기
정답: ②
F-통계량은 그룹 사이 차이인 집단 간 분산을 그룹 내부 변동인 집단 내 분산으로 나눈 값이다.
9. 데이터를 미리 정의된 범주로 구분하는 작업은?
정답입니다.
오답입니다. 답안을 다시 선택해 보세요.
정답 및 해설 보기
정답: ①
분류는 입력 데이터를 스팸·정상처럼 미리 정한 클래스 중 하나로 예측한다.
10. 여러 결정 트리를 앙상블하여 분류하고 과적합을 줄이는 알고리즘은?
정답입니다.
오답입니다. 답안을 다시 선택해 보세요.
정답 및 해설 보기
정답: ④
랜덤 포레스트는 여러 결정 트리의 예측을 결합하여 단일 트리보다 일반화 성능을 높이고 과적합을 줄인다.
11. 고차원 데이터에서도 효과적이지만 커널과 파라미터 조정이 중요한 분류 알고리즘은?
정답입니다.
오답입니다. 답안을 다시 선택해 보세요.
정답 및 해설 보기
정답: ②
SVM은 최적 결정 경계를 찾아 분류하며 고차원에서 효과적이지만 커널 선택과 파라미터 설정이 성능에 중요하다.
12. 선형 회귀에 L1 정규화를 적용하여 특성 선택 효과를 내는 알고리즘은?
정답입니다.
오답입니다. 답안을 다시 선택해 보세요.
정답 및 해설 보기
정답: ③
라쏘는 L1 정규화로 일부 특성의 계수를 0으로 만들어 불필요한 특성을 제거할 수 있다.
13. 레이블 없는 데이터에서 유사한 데이터 포인트를 그룹으로 묶는 기법은?
정답입니다.
오답입니다. 답안을 다시 선택해 보세요.
정답 및 해설 보기
정답: ④
군집화는 정답 레이블 없이 데이터 사이의 유사성을 이용해 그룹 구조를 발견한다.
14. PCA, t-SNE, UMAP이 대표 알고리즘으로 제시된 기법은?
정답입니다.
오답입니다. 답안을 다시 선택해 보세요.
정답 및 해설 보기
정답: ②
이 알고리즘들은 데이터 차원을 줄여 시각화·노이즈 제거·전처리에 활용하는 차원 축소 방법이다.
15. 고장 감지와 사기 탐지에 활용되는 비지도학습 기법은?
정답입니다.
오답입니다. 답안을 다시 선택해 보세요.
정답 및 해설 보기
정답: ①
이상치 탐지는 정상 패턴에서 벗어난 관측값을 찾아 비정상 설비 상태나 사기 거래를 식별하는 데 활용한다.
16. TensorFlow에 대한 설명으로 옳은 것은?
정답입니다.
오답입니다. 답안을 다시 선택해 보세요.
정답 및 해설 보기
정답: ③
TensorFlow는 대규모 신경망을 구축하고 학습하기 위한 도구를 제공하는 오픈소스 프레임워크이다.
17. Keras에서 모델 학습에 사용하는 함수는?
정답입니다.
오답입니다. 답안을 다시 선택해 보세요.
정답 및 해설 보기
정답: ②
fit()은 준비된 데이터로 모델을 학습하며 evaluate()는 평가, predict()는 예측에 사용한다.
18. 이미지 처리에 특화된 딥러닝 모델은?
정답입니다.
오답입니다. 답안을 다시 선택해 보세요.
정답 및 해설 보기
정답: ①
CNN은 필터를 통해 이미지의 공간적 특징을 추출하고 여러 층에서 복잡한 시각 패턴을 학습한다.
19. 트랜스포머가 텍스트의 장거리 의존성을 포착하는 핵심 메커니즘은?
정답입니다.
오답입니다. 답안을 다시 선택해 보세요.
정답 및 해설 보기
정답: ③
트랜스포머는 self-attention을 이용해 문장 안에서 멀리 떨어진 요소 사이의 관계를 효과적으로 반영한다.
20. 특정 작업의 예시를 몇 개 제공해 원하는 출력 형식을 안내하는 LLM 활용 방식은?
정답입니다.
오답입니다. 답안을 다시 선택해 보세요.
정답 및 해설 보기
정답: ④
퓨샷은 소수의 예시를 제공해 모델이 원하는 형식과 분석 방향을 파악하도록 안내한다.
댓글
댓글 쓰기