기본 콘텐츠로 건너뛰기

방송대 방통대 오픈소스기반데이터분석 12강 - 정형 데이터 분석 - 요약 노트 시험족보 예상문제 - 올에이클래스

오픈소스기반데이터분석 12강 - 정형 데이터 분석

오픈소스기반데이터분석 12강 - 정형 데이터 분석

이번 강의에서는 행과 열로 구성된 정형 데이터의 특성과 분석 가치를 학습한다. 서울시 공공 자전거 따릉이 이용 데이터를 사례로 수집·전처리·시계열 패턴 분석·시각화를 수행하고, 강수량 데이터를 결합해 피어슨 상관관계를 분석하는 과정을 정리한다.

제1장 정형 데이터의 특성과 분석 가치

1. 행과 열로 이루어진 명확한 구조

정형 데이터는 행과 열로 구성된 명확한 구조를 가진 데이터이다. 각 열은 날짜, 이용 시간, 이동 거리처럼 특정 속성을 나타내고, 각 행은 한 번의 이용 기록과 같은 개별 레코드를 표현한다. 데이터베이스 테이블, 스프레드시트, CSV 파일 등이 대표적인 형태이다.

열의 의미와 자료형이 비교적 분명하므로 집계, 필터링, 정렬 같은 기본 처리부터 기술통계, 시계열 분석, 상관관계 분석과 같은 고급 분석까지 폭넓게 적용할 수 있다. 일정한 구조는 분석 과정을 재현하고 결과를 해석하는 데에도 유리하다.

2. 객관적 의사결정을 지원하는 분석 가치

여러 정형 데이터셋을 통합하면 한 데이터만 보았을 때 설명하기 어려웠던 현상을 추가 변수와 함께 살펴볼 수 있다. 고객 행동, 운영 효율성, 시장 트렌드 등에 관한 인사이트를 제공하여 전략적 의사결정의 근거가 된다.

구성 요소의미
데이터가 가진 특정 속성대여 일시, 이용 시간, 이동 거리
개별 관측 또는 레코드한 건의 자전거 대여·반납 기록
테이블같은 구조의 행과 열을 모은 데이터셋CSV, 스프레드시트, 데이터베이스 표

핵심: 정형 데이터는 속성과 레코드의 구조가 명확하여 기본 처리와 통계 분석이 쉽고 결과를 해석하기도 용이하다.

제2장 서울시 공공 자전거 따릉이

1. 서비스 개요

서울시 공공 자전거 따릉이는 2010년 440대로 시범 운영을 시작하여 2024년 기준 약 4만 5,000대 규모로 성장한 서울의 대표적인 친환경 교통수단이다. 2010년 캐나다의 빅시(BIXI) 시스템을 벤치마킹해 운영을 시작했다.

2. 운영 현황과 데이터 생성

현재 서울 전역 약 2,700개의 대여소를 통해 운영되며 누적 이용 건수는 약 1억 9,000만 건에 이른다. 이용자는 스마트폰 애플리케이션으로 간편하게 자전거를 이용하고, 대여와 반납이 이루어질 때마다 시스템에 이용 정보가 자동으로 기록된다.

이렇게 축적되는 대여 일시, 대여소, 반납 대여소, 이용 시간, 이동 거리 등은 행과 열로 정리하기 적합한 정형 데이터이다. 많은 이용 기록을 시간과 장소 기준으로 집계하면 시민의 이동 패턴과 운영 수요를 분석할 수 있다.

따릉이 사례는 서비스 이용 과정에서 자동 생성되는 정형 데이터를 공공데이터로 수집하고, 다른 외부 데이터와 결합해 현상을 설명하는 분석 흐름을 보여 준다.

제3장 데이터 수집

1. 서울 열린데이터 광장

서울 열린데이터 광장(data.seoul.go.kr)은 서울특별시가 운영하는 공공데이터 포털이다. 교통, 환경, 복지, 안전, 인구 등 여러 분야의 데이터를 표 형태 또는 API 방식으로 제공하며 CSV, JSON, XML 등 다양한 형식으로 내려받을 수 있다.

강의 실습에서는 따릉이의 2023년 4월 1일부터 30일까지 데이터를 활용한다. 대여 일시, 대여·반납 대여소 정보, 이용 시간, 이동 거리 등의 변수를 포함하는 데이터를 사용해 시간대별·요일별 이용 패턴을 파악하고 외부 요인이 이용량에 미치는 영향을 살펴본다.

2. 분석 질문에 맞는 변수 선택

시간대별 수요를 알고 싶다면 대여 일시에서 시간 정보를 추출해야 하고, 요일별 차이를 보려면 날짜를 요일로 변환해야 한다. 날씨와 이용량의 관계를 확인하려면 같은 날짜 기준의 강수량 데이터가 추가로 필요하다. 따라서 수집 단계부터 분석 질문과 결합 키를 고려해야 한다.

데이터주요 변수분석 목적
따릉이 이용 데이터대여 일시, 대여소, 반납 대여소, 이용 시간, 이동 거리일자·요일·시간대별 이용 패턴 파악
강수량 데이터날짜 또는 일시, 강수량날씨와 자전거 이용량의 관계 분석

제4장 데이터 전처리

1. 분석 가능한 데이터로 정리하기

공공데이터를 내려받았다고 바로 분석할 수 있는 것은 아니다. 먼저 데이터의 행·열 구조와 기초 통계량을 확인하고, 값이 비어 있는 결측치와 정상 범위에서 크게 벗어난 이상치를 점검해야 한다. 같은 의미의 값이 서로 다른 형식으로 기록되었다면 표현도 통일한다.

2. 날짜와 시간 형식 변환

시계열 패턴을 분석하려면 날짜·시간 열을 단순 문자열이 아니라 시간 순서와 구성 요소를 처리할 수 있는 형식으로 변환해야 한다. 변환된 날짜에서 일자, 요일, 시간대를 추출하면 각 기준별 이용량을 집계할 수 있다.

전처리 작업목적
기초 통계량 산출변수의 범위와 분포, 이상 징후를 빠르게 확인한다.
결측치 처리값이 없는 레코드가 집계와 분석을 왜곡하지 않게 한다.
이상치 제거·점검비정상적으로 큰 값이나 작은 값의 원인을 확인한다.
날짜·시간 형식 변환시간 순서 정렬과 일자·요일·시간대 파생을 가능하게 한다.

시험 핵심: 강의의 실습 전처리에는 기초 통계량 산출, 결측치 처리, 이상치 제거, 날짜·시간 데이터 형식 변환이 포함된다.

제5장 시계열 데이터와 패턴 분석

1. 시간 순서가 있는 관측값

시계열 데이터는 시간의 순서에 따라 관측된 데이터의 연속이다. 일정한 시간 간격으로 수집되며 각 관측값이 시간적 순서를 가지므로 이전 관측값과 의존관계를 형성할 수 있다. 특정 현상이 시간에 따라 어떻게 변화하는지 보여 주고, 과거 패턴을 바탕으로 미래를 예측하는 데 활용한다.

2. 따릉이 이용량의 시간적 특성

시계열 패턴 분석은 시간 흐름에 따른 데이터 변화를 관찰하고 주기성이나 트렌드 같은 시간적 특성을 파악하는 과정이다. 따릉이 데이터에서는 일자별 이용량을 시간 순서로 비교하고, 요일별·시간대별로 묶어 반복되는 이용 패턴을 살펴볼 수 있다.

  • 일자별 분석: 4월 1일부터 30일까지 이용량이 날짜에 따라 어떻게 변하는지 관찰한다.
  • 요일별 분석: 월요일부터 일요일까지 이용량의 차이와 반복 패턴을 확인한다.
  • 시간대별 분석: 하루 중 어느 시간대에 이용이 집중되는지 파악한다.

시계열에서는 값뿐 아니라 관측 순서가 중요하다. 날짜 순서를 무시하면 증가·감소 흐름이나 반복 주기를 올바르게 해석하기 어렵다.

제6장 분석 결과의 시각화

1. matplotlib과 seaborn 활용

집계된 이용량을 표로만 확인하면 시간의 흐름과 그룹별 차이를 직관적으로 파악하기 어렵다. 강의에서는 matplotlibseaborn을 활용해 분석 결과를 시각화한다.

일자별 이용량은 시간 순서에 따른 변화가 드러나도록 선 그래프로 표현할 수 있고, 요일별·시간대별 이용량은 범주 간 차이를 비교하기 적합한 형태로 나타낼 수 있다. 시각화에서 갑작스러운 증가나 감소가 보이면 해당 날짜에 어떤 외부 요인이 있었는지 추가로 탐색한다.

2. 그래프에서 새로운 질문 찾기

시각화는 이미 알고 있는 결과를 꾸미는 단계가 아니라, 데이터의 변동과 이상한 지점을 발견해 새로운 분석 질문을 만드는 과정이다. 이용량이 특정 날짜에 급격히 줄었다면 강수량처럼 이동 행동에 영향을 줄 수 있는 연관 데이터를 수집해 원인을 더 살펴볼 수 있다.

분석 확장: 원인이 설명되지 않는 급격한 변동을 발견하면 새로운 외부 데이터를 수집하고 기존 데이터와 연계하여 관계를 분석한다.

제7장 DataFrame 데이터 연계

1. merge 메소드

Pandas의 merge()는 SQL의 join과 비슷한 방식으로 두 DataFrame을 결합한다. 양쪽 데이터에 공통으로 존재하거나 서로 대응하는 키 값을 기준으로 열 정보를 하나의 데이터셋으로 통합한다.

따릉이 일별 이용량 데이터 daily_usage_df와 강수량 데이터 rain_df를 결합할 때는 이용량 데이터의 기준_날짜와 강수량 데이터의 일시를 대응 키로 지정한다.

merged_df = pd.merge(
    daily_usage_df,
    rain_df,
    how="left",
    left_on="기준_날짜",
    right_on="일시"
)

2. left join의 의미

how="left"는 왼쪽 DataFrame인 daily_usage_df의 행을 기준으로 유지하면서, 키가 일치하는 오른쪽 강수량 정보를 붙인다. 해당 날짜와 일치하는 강수량 레코드가 없다면 오른쪽에서 가져올 값은 결측값으로 남을 수 있으므로 결합 결과를 확인해야 한다.

인자설정값의미
daily_usage_df왼쪽 DataFrame유지할 일별 따릉이 이용량 레코드
rain_df오른쪽 DataFrame날짜별로 붙일 강수량 정보
how"left"왼쪽 데이터의 행을 기준으로 결합
left_on"기준_날짜"왼쪽의 결합 키
right_on"일시"오른쪽의 결합 키

제8장 피어슨 상관관계 분석

1. 두 연속형 변수의 선형 관계

피어슨 상관계수(Pearson Correlation Coefficient)는 두 연속형 변수 사이의 선형 관계를 측정하는 통계적 지표이다. Pandas에서는 corr() 메소드로 상관계수를 계산할 수 있다.

피어슨 상관계수 r은 -1에서 1 사이의 값을 가진다. 1에 가까우면 강한 양의 상관관계, -1에 가까우면 강한 음의 상관관계, 0에 가까우면 선형 관계가 약함을 뜻한다.

r의 범위해석
1에 가까움한 변수가 증가할 때 다른 변수도 증가하는 강한 양의 선형 관계
-1에 가까움한 변수가 증가할 때 다른 변수는 감소하는 강한 음의 선형 관계
0에 가까움두 변수 사이의 선형 관계가 약함

2. 이용량과 강수량의 관계

날짜를 기준으로 결합한 merged_df에서 일별 이용량과 강수량 열의 상관계수를 계산하면 두 변수가 함께 변화하는 방향과 선형 관계의 강도를 수치로 확인할 수 있다. 분석 결과는 시계열 그래프에서 관찰한 급격한 변동을 외부 요인과 연결해 검토하는 근거가 된다.

상관계수는 두 변수의 선형 관계를 요약한다. 계산 전에는 두 데이터의 날짜가 올바르게 대응되었는지, 결측값과 이상치가 어떻게 처리되었는지를 함께 확인해야 한다.

제9장 따릉이 실습 프로젝트 흐름

1. 데이터 수집 및 전처리

서울 열린데이터 광장에서 따릉이 이용 CSV를 수집하고 기상자료개방포털에서 강수량 데이터를 확보한다. 기초 통계량을 산출해 변수의 범위와 분포를 살펴보고, 결측치와 이상치를 처리하며 날짜·시간 형식을 분석 가능한 형태로 변환한다.

2. 데이터 분석

전처리한 따릉이 데이터로 일자별·요일별·시간대별 이용량을 집계한다. matplotlib과 seaborn으로 결과를 시각화하여 시간 흐름에 따른 패턴, 반복되는 주기, 급격한 변동을 관찰한다.

3. 연계 분석

설명되지 않는 이용량 변화의 원인을 탐색하기 위해 강수량 데이터를 날짜 기준으로 left join한다. 결합된 데이터에서 피어슨 상관계수를 계산해 날씨와 자전거 이용량의 선형 관계를 분석한다.

단계주요 내용
1. 수집 및 전처리CSV 수집, 기초 통계, 결측치·이상치 처리, 날짜·시간 변환
2. 데이터 분석일자·요일·시간대별 시계열 패턴 분석과 시각화
3. 연계 분석강수량 데이터 결합과 피어슨 상관관계 분석

전체 흐름: 따릉이 이용 기록을 정리해 시간 패턴을 발견하고, 설명이 필요한 변동이 보이면 강수량 같은 연관 데이터를 추가해 관계를 분석한다.

핵심 개념 정리

정형 데이터와 수집

  • 정형 데이터는 행과 열의 테이블 구조를 가지며 통계 분석과 해석이 쉽다.
  • 서울 열린데이터 광장은 교통·환경·복지·안전·인구 데이터를 표 또는 API 형태로 제공한다.
  • 따릉이 이용 데이터에는 대여 시점, 대여·반납 대여소, 이용 시간, 이동 거리 등이 포함된다.

분석과 연계

  • 전처리에서는 기초 통계량 확인, 결측치·이상치 처리, 날짜·시간 형식 변환을 수행한다.
  • 시계열 분석으로 일자·요일·시간대별 이용량의 주기와 트렌드를 파악한다.
  • matplotlib과 seaborn으로 분석 결과를 시각화하고 급격한 변동을 탐색한다.
  • merge()는 공통 키를 기준으로 두 DataFrame을 결합하며 left join은 왼쪽 행을 기준으로 유지한다.
  • 피어슨 상관계수는 두 연속형 변수 사이의 선형 관계를 -1부터 1 사이의 값으로 나타낸다.

최종 정리: 정형 데이터 분석은 구조를 이해하고 품질을 정리한 뒤 시간과 범주 기준으로 패턴을 발견하는 과정이다. 따릉이 이용량처럼 원인이 분명하지 않은 변화가 보이면 날짜 키로 외부 데이터를 결합하고 상관관계를 계산하여 분석을 확장할 수 있다.

예상문제 20선

1. 정형 데이터에 대한 설명으로 옳은 것은?

정답입니다.

오답입니다. 답안을 다시 선택해 보세요.

정답 및 해설 보기

정답: ④
정형 데이터는 속성이 열로, 개별 관측이 행으로 정리된 테이블 구조를 가진다.

2. 정형 데이터의 대표 저장 형태가 아닌 것은?

정답입니다.

오답입니다. 답안을 다시 선택해 보세요.

정답 및 해설 보기

정답: ①
데이터베이스·스프레드시트·CSV는 행과 열 구조를 표현하지만 자유 형식 동영상은 그 자체로 비정형 데이터이다.

3. 강의에서 제시한 2024년 기준 따릉이 자전거 규모는?

정답입니다.

오답입니다. 답안을 다시 선택해 보세요.

정답 및 해설 보기

정답: ③
따릉이는 2010년 440대로 시작하여 2024년 약 4만 5,000대 규모로 성장했다.

4. 서울 열린데이터 광장에서 제공하는 데이터 형식으로 강의에 제시되지 않은 것은?

정답입니다.

오답입니다. 답안을 다시 선택해 보세요.

정답 및 해설 보기

정답: ②
강의에서는 CSV, JSON, XML 및 API 방식의 공공데이터 제공을 설명한다.

5. 12강 따릉이 실습의 분석 기간은?

정답입니다.

오답입니다. 답안을 다시 선택해 보세요.

정답 및 해설 보기

정답: ③
강의에서는 2023년 4월 한 달의 따릉이 이용 데이터를 활용한다.

6. 데이터 전처리 작업으로 옳은 것은?

정답입니다.

오답입니다. 답안을 다시 선택해 보세요.

정답 및 해설 보기

정답: ①
분석 전에 품질 문제를 처리하고 날짜·시간을 적절한 형식으로 바꾸어 집계와 시계열 분석을 준비한다.

7. 시계열 데이터의 핵심 특징은?

정답입니다.

오답입니다. 답안을 다시 선택해 보세요.

정답 및 해설 보기

정답: ④
시계열은 시간 순서가 중요한 관측값의 연속이며 주기와 트렌드를 파악하는 데 활용한다.

8. 강의에서 따릉이 이용 패턴을 분석한 시간 기준에 포함되지 않는 것은?

정답입니다.

오답입니다. 답안을 다시 선택해 보세요.

정답 및 해설 보기

정답: ②
실습에서는 요일별·시간대별·일자별 이용량 패턴을 분석한다.

9. 분석 결과 시각화에 사용한 라이브러리 조합은?

정답입니다.

오답입니다. 답안을 다시 선택해 보세요.

정답 및 해설 보기

정답: ②
matplotlib과 seaborn은 일자·요일·시간대별 이용량과 관계를 그래프로 표현하는 데 사용한다.

10. Pandas의 merge()가 수행하는 기능은?

정답입니다.

오답입니다. 답안을 다시 선택해 보세요.

정답 및 해설 보기

정답: ④
merge()는 SQL join과 비슷하게 양쪽 데이터의 대응 키를 이용해 열 정보를 하나로 통합한다.

11. how="left"로 DataFrame을 병합할 때 기준이 되는 것은?

정답입니다.

오답입니다. 답안을 다시 선택해 보세요.

정답 및 해설 보기

정답: ①
left join은 왼쪽 데이터의 행을 유지하면서 일치하는 오른쪽 정보를 붙인다.

12. 실습의 merge 코드에서 왼쪽 결합 키로 사용한 열은?

정답입니다.

오답입니다. 답안을 다시 선택해 보세요.

정답 및 해설 보기

정답: ③
daily_usage_df의 기준_날짜와 rain_df의 일시를 대응시켜 날짜별 이용량과 강수량을 결합한다.

13. 피어슨 상관계수가 측정하는 것은?

정답입니다.

오답입니다. 답안을 다시 선택해 보세요.

정답 및 해설 보기

정답: ④
피어슨 상관계수는 두 연속형 변수가 선형적으로 함께 움직이는 방향과 강도를 나타낸다.

14. Pandas에서 상관계수를 계산할 때 사용하는 메소드는?

정답입니다.

오답입니다. 답안을 다시 선택해 보세요.

정답 및 해설 보기

정답: ②
Pandas의 corr()는 수치형 변수 사이의 상관계수를 계산할 때 사용한다.

15. 피어슨 상관계수 r이 -1에 가까울 때의 해석은?

정답입니다.

오답입니다. 답안을 다시 선택해 보세요.

정답 및 해설 보기

정답: ①
r이 -1에 가까우면 한 변수가 증가할 때 다른 변수가 감소하는 강한 음의 선형 관계를 뜻한다.

16. 상관계수 r이 0에 가까울 때의 의미는?

정답입니다.

오답입니다. 답안을 다시 선택해 보세요.

정답 및 해설 보기

정답: ③
r이 0에 가까우면 피어슨 계수로 측정되는 선형적 관계가 약함을 뜻한다.

17. 따릉이 실습 프로젝트의 올바른 진행 순서는?

정답입니다.

오답입니다. 답안을 다시 선택해 보세요.

정답 및 해설 보기

정답: ①
먼저 이용 데이터를 정리하고 시간 패턴을 분석한 뒤 외부 강수량 데이터를 결합해 관계를 검토한다.

18. 이용량 그래프에서 원인을 알 수 없는 급격한 감소가 발견되었을 때 적절한 다음 단계는?

정답입니다.

오답입니다. 답안을 다시 선택해 보세요.

정답 및 해설 보기

정답: ④
설명되지 않는 변동은 외부 요인 데이터를 추가해 기존 데이터와 연계 분석함으로써 원인을 탐색할 수 있다.

19. 강수량 데이터의 출처로 강의에서 사용한 기관은?

정답입니다.

오답입니다. 답안을 다시 선택해 보세요.

정답 및 해설 보기

정답: ②
실습은 서울 열린데이터 광장의 따릉이 데이터와 기상청 기상자료개방포털의 강수량 데이터를 활용한다.

20. 따릉이 이용량과 강수량의 상관분석 전에 우선 확인할 사항으로 가장 적절한 것은?

정답입니다.

오답입니다. 답안을 다시 선택해 보세요.

정답 및 해설 보기

정답: ③
잘못된 날짜 결합이나 품질 문제는 상관계수 해석을 왜곡할 수 있으므로 분석 전에 반드시 확인해야 한다.

댓글