추천 게시물

방송대 방통대 오픈소스기반데이터분석 7강 - 데이터 전처리 2 - 요약 노트 시험족보 예상문제 - 올에이클래스

오픈소스기반데이터분석 7강 - 데이터 전처리 (2) 데이터 분석의 품질은 분석 기법보다 먼저 데이터의 품질에서 결정된다. 이번 강의에서는 pandas를 이용해 결측치와 이상치를 탐지하고, 제거·대치·보간 중 적절한 처리 전략을 선택하는 방법을 배운다. 또한 값 변경, 날짜 변환, DataFrame 병합까지 데이터 전처리의 전체 흐름을 코드와 함께 정리한다. 1. 데이터 정제와 결측치 탐지 1.1 데이터 정제의 의미 데이터 정제(data cleansing) 는 불완전하거나 부정확한 데이터를 찾아 수정하거나 제거하는 과정이다. 분석 전에 수행하는 대표적인 전처리 작업으로, 결측값·이상값·중복값·오류값 등을 다룬다. 이번 강의의 중심은 값이 기록되지 않은 결측치 와 정상 범위를 벗어난 이상치 이다. 핵심 구분 결측치는 관측값이 존재하지 않는 상태이고, 이상치는 값은 존재하지만 일반적인 범위나 패턴에서 크게 벗어난 상태이다. 두 문제는 탐지 기준과 처리 방법이 서로 다르다. 1.2 pandas의 결측치 표현과 확인 pandas는 주로 NumPy의 NaN 으로 결측치를 표현한다. isnull() 과 isna() 는 각 원소가 결측치인지 검사하여 불리언 값을 반환하며, 두 메서드는 같은 기능을 한다. 반대로 notnull() 은 값이 존재하는 원소에 True 를 반환한다. import pandas as pd df.isna() # 원소별 결측 여부 df.isnull().sum() # 열별 결측치 개수 df.isna().any() # 열별 결측치 존재 여부 df.notnull().sum() # 열별 유효값 개수 불리언 값에서 True 는 1로 계산되므로 sum() 을 연결하면 결측치 개수를 얻는다. any() 는 하나라도 결측치가 있는지 확인할 때 유용하며, 처리를 마친 뒤 결측치가 모두 사라졌는지 재검...

컴퓨터과학과