기본 콘텐츠로 건너뛰기

방송대 방통대 오픈소스기반데이터분석 1강 - 데이터 분석과 오픈소스의 이해 - 요약 노트 시험족보 예상문제 - 올에이클래스

오픈소스기반데이터분석 1강 - 데이터 분석과 오픈소스의 이해


오픈소스기반데이터분석 1강 - 데이터 분석과 오픈소스의 이해

데이터가 정보와 인사이트로 바뀌는 원리부터 데이터 분석의 단계와 유형, 데이터 과학과의 차이를 학습한다. 이어 오픈소스의 철학과 발전 과정, 지속 가능한 개발 동기, 파이썬 기반 데이터 분석 환경을 체계적으로 정리한다.

1. 데이터와 데이터 분석의 개념

데이터에서 정보로

데이터는 현실의 현상을 관찰하거나 측정하여 얻은 사실과 값이다. 숫자, 문자, 이미지, 소리처럼 여러 형태로 존재할 수 있지만, 수집된 상태만으로는 특정 목적에 곧바로 활용하기 어려울 수 있다. 이 데이터를 목적에 맞게 처리하고 가공하여 의미를 부여한 결과가 정보이다.

따라서 데이터와 정보의 관계는 현상 → 관찰·측정 → 데이터 → 처리·가공 → 정보의 흐름으로 이해할 수 있다. 같은 데이터라도 어떤 목적과 관점으로 가공하느냐에 따라 서로 다른 정보가 될 수 있다.

핵심 구분: 데이터는 관찰·측정으로 얻은 원재료이고, 정보는 데이터를 목적에 맞게 가공한 결과물이다.

데이터 분석의 의미

데이터 분석은 데이터에 숨겨진 의미를 발견하고, 이를 바탕으로 의사결정에 활용할 수 있는 인사이트를 도출하는 일련의 과정이다. 데이터를 정리·처리·변환하여 유의미한 정보를 만들고, 데이터를 구조화하여 패턴을 파악하며, 어떤 현상의 원인을 찾거나 미래를 예측하는 논리적이고 체계적인 접근을 포함한다.

분석의 궁극적인 가치는 숫자를 계산하는 데 그치지 않는다. 데이터에 감춰진 가치와 인사이트를 발견함으로써 의사결정의 질을 높이고, 비효율적인 프로세스를 개선하며, 비즈니스 문제나 사회 문제의 근본 원인을 파악하는 데 있다.

데이터 분석의 도전 과제

분석 결과가 유용하려면 데이터의 품질과 분석 방법이 모두 적절해야 한다. 실제 분석에서는 결측치나 오류 같은 데이터 품질 문제, 데이터의 규모와 복잡성, 적절한 분석 방법론의 선택, 결과의 올바른 해석과 커뮤니케이션, 데이터 윤리와 개인정보 보호 등의 문제가 함께 고려되어야 한다.

분석 기법이 정교해도 입력 데이터의 품질이 낮거나 결과를 잘못 해석하면 좋은 의사결정으로 이어지기 어렵다. 데이터 수집부터 결과 전달까지 전 과정을 하나의 체계로 보는 관점이 중요하다.

2. 데이터 분석의 수준과 활용 사례

데이터 분석의 4단계

데이터 분석은 해결하려는 질문의 깊이에 따라 네 단계로 구분할 수 있다. 단계가 높아질수록 단순한 현황 파악을 넘어 미래의 행동을 선택하는 방향으로 발전하며, 분석 난이도도 높아진다.

분석 단계핵심 질문주요 결과
설명적 분석어떤 일이 일어났는가?과거와 현재의 현황을 정리한 정보
진단적 분석왜 일어났는가?현상을 만든 원인과 관계에 대한 인사이트
예측적 분석무슨 일이 일어날 것인가?데이터 패턴에 근거한 미래 예측
처방적 분석무엇을 해야 할 것인가?목표 달성을 위한 최적의 의사결정과 조치

설명적 분석은 이미 발생한 일을 파악하는 출발점이다. 진단적 분석은 변수 간 관계를 살펴 원인을 밝히고, 예측적 분석은 과거 패턴을 이용해 미래 가능성을 추정한다. 처방적 분석은 예측 결과와 제약 조건을 바탕으로 최선의 행동을 제안한다.

PHM 사례로 보는 분석의 흐름

PHM은 장비나 시스템의 상태를 실시간으로 감시하고 고장 가능성을 예측하여 최적의 유지보수 및 관리 방안을 제공하는 사례이다. 먼저 자동차 등에서 발생하는 다양한 데이터를 계측하고, 정상 범위를 벗어나는 이상 징후를 모니터링한다. 이어 구체적인 고장의 원인과 영향을 진단하고, 진단 정보를 바탕으로 향후 고장 가능성을 예측한 뒤, 최적의 개선책과 유지보수 전략을 결정한다.

PHM의 순서: 계측 → 모니터링 → 진단 → 예측 → 개선. 단순히 고장 뒤에 수리하는 것이 아니라 상태 데이터를 이용해 고장을 미리 예측하고 최적의 관리 방안을 찾는 데 목적이 있다.

분야별 적용 사례

분야데이터 분석 활용 사례
개인 맞춤형 마케팅전자상거래에서 스포츠 브랜드 신제품 추천
금융은행의 대출 프로세스 자동화
스포츠오클랜드 애슬레틱스의 머니볼 전략
공공 정책코로나19 대응 정책과 백신 계획 수립
운영제조업의 스마트 팩토리
의료암 환자 맞춤형 치료법 개발
도시 행정·치안교통 신호 체계 설계와 치안 개선

3. 데이터 분석의 발전과 핵심 요소

데이터 분석의 발전 과정

데이터 분석은 기술과 데이터 환경의 변화에 따라 발전해 왔다. 1900년대에는 확률론과 가설 검정 기법을 이용하는 전통적인 통계 분석이 중심이었다. 1980년대에는 데이터베이스 관리 시스템(DBMS)이 도입되고 구조화된 데이터를 분석하는 방식으로 전환되었으며, 시각적으로 표현하는 비즈니스 인텔리전스(BI) 도구도 등장했다.

2000년대에는 데이터의 규모와 다양성이 증가하면서 빅데이터와 머신러닝이 발전했다. 오픈소스 프레임워크가 개발되고 맞춤형 마케팅이 수행되었다. 현재와 미래의 분석은 실시간 데이터 수집과 분석, 즉각적인 의사결정 시스템 구축으로 확장되고 있다.

데이터 분석의 3요소

효과적인 데이터 분석에는 컴퓨터과학·IT, 수학·통계, 도메인 지식이 함께 필요하다. 컴퓨터과학과 IT는 데이터를 저장·처리하고 소프트웨어를 구현하는 기반을 제공한다. 수학과 통계는 데이터의 관계를 검증하고 불확실성을 다루는 방법을 제공한다. 도메인 지식은 분석 대상 분야의 맥락을 이해하고 결과에 현실적인 의미를 부여한다.

이 세 영역의 교차 지점에서 데이터 분석과 데이터 과학이 이루어진다. 어느 한 영역만으로는 충분하지 않다. 예를 들어 통계적으로 의미 있는 결과라도 해당 분야의 상황을 모르면 잘못 해석할 수 있고, 훌륭한 아이디어가 있어도 데이터를 처리할 기술이 없으면 구현하기 어렵다.

데이터 분석과 데이터 과학의 비교

항목데이터 분석데이터 과학
개념수집된 데이터를 정리·가공하여 의미 있는 정보를 도출예측 모델과 자동화된 의사결정 시스템을 구축하는 포괄적 과정
접근 방식통계, 데이터 시각화, 기본적인 머신러닝 활용통계, 머신러닝, 프로그래밍, 데이터 엔지니어링 등을 종합 활용
목적데이터 기반 의사결정 지원의사결정의 자동화와 최적화
범위데이터 과학의 한 부분데이터 분석을 포함하는 상위 개념
과정수집 → 전처리 → EDA → 분석 → 시각화 → 인사이트 도출수집 → 전처리 → 분석 → 자동화 시스템 구현
활용 분야마케팅, 리포트 작성, 경영 전략 수립제품 추천, 예측 시스템, 자율주행, 인공지능 서비스

데이터 분석은 데이터 과학의 한 부분이며 의사결정 지원에 초점을 둔다. 데이터 과학은 데이터 분석을 포함하여 예측 모델과 자동화 시스템의 구현까지 포괄한다.

4. 데이터 수집과 전처리 과정

전체 데이터 분석 과정

데이터 분석은 데이터를 적절한 방법으로 수집하고 정제한 뒤 패턴을 탐색하고 모델링을 수행하여 결과를 해석하는 체계적인 과정이다. 강의에서는 이를 크게 데이터 수집 및 저장 → 데이터 전처리 → 데이터 분석 → 데이터 시각화의 흐름으로 제시한다.

데이터 수집 및 저장

수집 단계는 단순히 많은 데이터를 모으는 작업이 아니다. 먼저 분석 목표에 따라 데이터 수집 목적을 설정하고, 수집한 데이터를 효율적으로 보관할 방법과 분석 목적에 적합한지를 검토해야 한다.

데이터 출처는 조직 안에서 생성된 내부 데이터와 기관 외부에서 제공되는 외부 데이터로 나뉜다. 외부 데이터에는 정부의 공공 데이터, 소셜 미디어 데이터, 연구 기관의 통계 자료 등이 있다. 실제 수집 방법으로는 파일 다운로드, 데이터베이스, 웹 스크래핑, API, 센서(IoT) 등이 사용된다.

데이터 전처리

데이터 전처리는 원시 데이터를 정리하고 변환하여 분석이 가능한 형태로 가공하는 과정이다. 분석의 신뢰성을 좌우하므로 각 작업의 목적을 구분해야 한다.

전처리 작업주요 내용
데이터 측정전체적인 분포와 특성을 파악
데이터 정제결측치, 이상치, 불일치 값 제거 또는 처리
데이터 통합여러 출처의 데이터를 하나의 데이터셋으로 결합
데이터 축소군집화, 샘플링 등으로 데이터 크기 감소
데이터 변환정규화, 표준화 등으로 분석에 적합한 형태로 변경

결측치와 이상치를 처리하는 것은 데이터 정제이며, 서로 다른 출처의 자료를 합치는 것은 데이터 통합이다. 정규화와 표준화는 값의 표현이나 척도를 조정하는 데이터 변환에 해당한다.

5. 분석과 시각화

탐색적 데이터 분석

EDA(Exploratory Data Analysis, 탐색적 데이터 분석)는 데이터의 분포와 특성을 이해하는 과정이다. 데이터를 요약하고 시각적으로 표현하여 주요 패턴과 이상치를 파악하고 변수 간 관계를 살펴본다. 본격적인 모델링 전에 데이터가 무엇을 말하는지 탐색하는 단계라고 이해할 수 있다.

통계 분석

통계 분석에서는 평균, 중앙값, 표준편차 등의 기본 기술 통계로 데이터를 요약한다. 더 나아가 가설 검정, 상관 분석, 회귀 분석 등을 활용하여 변수 간 관계와 발견된 패턴의 통계적 유의성을 검증한다.

머신러닝과 딥러닝

머신러닝과 딥러닝은 과거 데이터를 학습하여 미래를 예측하거나 데이터를 분류하고, 자동화된 의사결정 모델을 구축하는 데 사용된다. 특히 복잡한 패턴을 발견하고 대규모 데이터에서 인사이트를 도출하는 데 활용된다.

분석 방법핵심 목적대표 내용
EDA분포·특성·이상치와 관계 탐색요약과 시각적 표현
통계 분석관계와 패턴의 통계적 검증기술 통계, 가설 검정, 상관·회귀 분석
머신러닝·딥러닝예측·분류와 의사결정 자동화과거 데이터 학습, 복잡한 패턴 발견

데이터 시각화의 역할

데이터 시각화는 데이터셋의 정보와 관계를 그래프, 차트, 다이어그램 등의 시각적 요소로 직관적으로 표현하는 과정이다. 시각화는 데이터 탐색과 패턴 발견, 복잡한 데이터의 요약, 분석 결과의 전달이라는 세 가지 역할을 한다. 분석가가 패턴을 찾는 도구인 동시에 다른 사람에게 결과를 이해시키는 커뮤니케이션 도구이기도 하다.

6. 데이터의 속성과 형태에 따른 분류

속성에 따른 분류

데이터는 측정한 속성에 따라 질적 데이터양적 데이터로 분류한다. 질적 데이터는 범주를 나타내는 범주형 데이터이며, 양적 데이터는 수량을 나타내는 수치형 데이터이다.

상위 유형하위 유형핵심 특징
질적 데이터명목형 데이터대상을 이름이나 범주로 구분
순서형 데이터범주 사이에 순서가 존재
양적 데이터이산형 데이터분리하여 셀 수 있는 수치
연속형 데이터일정 범위 안에서 연속적으로 측정되는 수치

형태에 따른 분류

정형 데이터는 일정한 규칙과 구조를 갖추며, 일반적으로 행과 열의 표 형태로 관계형 데이터베이스에 저장된다. 구조가 명확하므로 검색과 분석이 비교적 쉽다.

비정형 데이터는 정해진 구조 없이 자유로운 형태로 존재한다. 문장, 이미지, 영상, 음성 등이 대표적이다. 분석하기 어렵지만 소비자의 감정과 행동 패턴처럼 풍부한 정보를 담을 수 있다.

반정형 데이터는 정형 데이터와 비정형 데이터의 중간 형태이다. 데이터 항목 사이에 일정한 규칙이나 구조가 있지만 완전히 고정된 테이블 형태로 표현되지는 않는다.

분류 기준을 혼동하지 말아야 한다. 명목형·순서형·이산형·연속형은 데이터의 속성에 따른 분류이고, 정형·반정형·비정형은 데이터가 조직된 형태에 따른 분류이다.

7. 오픈소스의 철학과 역사

오픈소스의 개념

오픈소스는 인류의 지적 자산인 소스코드와 데이터를 개방하여 더 많은 사람과 공유하고 협력하겠다는 철학에서 출발한다. 그 뿌리는 1960년대 미국 대학가의 반문화 운동과 해커 문화에서 찾을 수 있으며, 정보는 자유로워야 한다는 신념으로 발전했다.

소프트웨어 분야에서 오픈소스는 소스코드가 공개되어 누구나 자유롭게 접근하고 사용·복제·수정·재배포할 수 있음을 뜻한다. 이러한 개방 철학은 소프트웨어에만 머물지 않는다. MIT OCW와 MOOC처럼 대학 강의를 무료로 공개하는 오픈 교육, 정부와 공공기관의 데이터를 시민에게 공개하는 오픈 데이터로 확장되었다.

리처드 스톨먼과 자유 소프트웨어 운동

리처드 매튜 스톨먼(RMS)은 컴퓨터 과학자이자 소프트웨어 자유론의 강한 지지자이다. 자유 소프트웨어 운동에서 중심 역할을 하며 오픈소스 소프트웨어의 초석을 마련했고, GNU 프로젝트를 시작하고 자유 소프트웨어 재단(FSF)을 설립했다.

GNU를 시작하게 된 배경에는 소프트웨어 공유를 제한하는 환경이 있었다. PDP-10에 설치할 DEC사의 운영체제를 사용하는 과정에서 복사와 자료 유출을 금지하는 비밀유지계약(NDA)을 요구받았고, 유닉스 라이선스 비용은 소스코드를 포함하여 복사본당 99달러 수준에서 25만 달러까지 올랐다. 이런 경험은 자유롭게 사용하고 공유할 수 있는 소프트웨어를 만들려는 운동의 계기가 되었다.

성당과 시장, 그리고 OSI

에릭 레이몬드는 1997년 에세이 「성당과 시장」에서 두 개발 모델을 대비했다. 성당 모델은 핵심 그룹이 개발을 수행하는 폐쇄적·하향식 방식으로, 독점적 소프트웨어 개발에서 전형적으로 나타난다. 시장 모델은 네트워크를 통해 결과물을 무료로 공유하며 다수가 참여하는 개방적 공개 개발 방식이다. 이 논의는 자유 소프트웨어 운동의 또 다른 분수령이 되었고, 오픈 소스 이니셔티브(OSI) 설립의 시초가 되었다.

RMS는 GNU 프로젝트와 FSF를 통해 자유 소프트웨어 운동의 토대를 마련했다. 에릭 레이몬드의 「성당과 시장」은 폐쇄적 하향식 개발과 개방적 협업 개발을 대비하며 OSI 설립으로 이어지는 계기를 제공했다.

8. 오픈소스의 지속 가능성과 파이썬 환경

오픈소스 개발의 지속 가능성

성공적인 오픈소스 소프트웨어(OSS) 개발에는 개발자의 지속적인 참여가 필수적이다. 기업은 OSS를 통해 개발 비용을 외부화하고 초기 개발 비용을 줄일 수 있다. 또한 한 기업의 코드 공개가 다른 개발자의 코드 공개와 참여를 유도할 수 있으므로 기업은 직간접적으로 OSS 개발에 참여한다.

개인의 참여 동기는 내재적 동기외재적 동기로 나뉜다. 내재적 동기에는 취미 활동으로 개발하고 수정 사항을 공유하거나 선물하는 즐거움, 내가 다른 사람을 도운 만큼 상대도 도울 것이라는 일반화된 호혜성이 포함된다. 외재적 동기로는 OSS 개발자로서 쌓은 명성이 노동 시장에서 능력을 알리는 신호로 작용하는 효과가 있다.

파이썬과 오픈소스

파이썬은 오픈소스 철학을 기반으로 설계되고 발전해 온 언어이다. 언어 자체뿐 아니라 수많은 라이브러리와 프레임워크, 커뮤니티 활동도 오픈소스 방식으로 운영된다. 따라서 데이터 수집, 처리, 통계 분석, 시각화, 머신러닝에 필요한 다양한 도구를 함께 사용할 수 있다.

구분도구특징
개발 환경IDLE파이썬에 기본 제공되는 개발 환경
개발 환경Jupyter Notebook코드를 블록인 셀 단위로 실행
개발 환경Google Colab별도 설치 없이 웹 브라우저에서 바로 사용
데이터 수집·처리Selenium, lxml, NumPy, Pandas웹 자동화·문서 처리·수치 계산·데이터 처리 등에 활용
통계·시각화·학습Statsmodels, Matplotlib, Seaborn, Scikit-learn통계 분석, 시각화, 머신러닝에 활용

IDLE, Jupyter Notebook, Google Colab은 코드를 작성하고 실행하는 환경이다. Selenium, lxml, NumPy, Pandas, Statsmodels, Matplotlib, Seaborn, Scikit-learn 등은 목적에 맞게 불러와 사용하는 오픈소스 라이브러리이다.

핵심 개념 정리

1강 핵심 요약

  • 데이터는 현상을 관찰·측정한 값이며, 정보는 데이터를 목적에 맞게 가공한 결과물이다.
  • 데이터 분석은 데이터를 정리·처리·변환하여 의미와 인사이트를 찾고 의사결정을 지원하는 과정이다.
  • 분석의 네 수준은 설명적, 진단적, 예측적, 처방적 분석이며 각각 무엇, 왜, 미래, 행동의 질문에 대응한다.
  • 데이터 분석의 3요소는 컴퓨터과학·IT, 수학·통계, 도메인 지식이다.
  • 데이터 분석은 데이터 과학의 일부이며, 데이터 과학은 예측 모델과 자동화 시스템 구현까지 포괄한다.
  • 전체 분석 과정은 수집 및 저장, 전처리, 분석, 시각화로 이어진다.
  • EDA는 분포·이상치·관계를 탐색하고, 통계 분석은 패턴의 유의성을 검증하며, 머신러닝은 예측·분류와 자동화에 활용된다.
  • 데이터는 속성에 따라 질적·양적 데이터로, 형태에 따라 정형·반정형·비정형 데이터로 분류된다.
  • 오픈소스는 소스코드를 자유롭게 접근·사용·복제·수정·재배포할 수 있게 하는 개방과 협력의 철학이다.
  • RMS의 GNU·FSF와 에릭 레이몬드의 「성당과 시장」은 오픈소스 역사에서 중요한 흐름이다.
  • 파이썬 분석 환경에는 IDLE, Jupyter Notebook, Google Colab이 있으며 여러 오픈소스 라이브러리를 활용한다.

최종 정리: 데이터 분석은 데이터 자체가 아니라 데이터가 의사결정에 쓰일 수 있도록 의미를 만드는 전체 과정이다. 좋은 분석을 위해서는 분석 기법뿐 아니라 수집 목적, 데이터 품질, 전처리, 도메인 맥락, 결과 전달을 함께 고려해야 한다. 오픈소스는 이러한 분석 도구와 지식을 공개하고 공동으로 발전시키는 기반이며, 파이썬 생태계는 그 철학이 실제 데이터 분석 환경으로 구현된 대표적인 사례이다.

예상문제 20선

1. 데이터와 정보의 관계에 대한 설명으로 옳은 것은?

정답입니다.

오답입니다. 답안을 다시 선택해 보세요.

정답 및 해설 보기

정답: ②
데이터는 현상을 관찰·측정하여 얻은 값이고, 정보는 그 데이터를 특정 목적에 맞게 처리·가공한 결과이다.

2. 데이터 분석의 네 단계 중 “무엇을 해야 할 것인가?”라는 질문에 답하는 것은?

정답입니다.

오답입니다. 답안을 다시 선택해 보세요.

정답 및 해설 보기

정답: ④
처방적 분석은 예측과 제약 조건을 바탕으로 목표를 달성하기 위한 최적의 행동이나 조치를 제안한다.

3. PHM 적용 과정의 올바른 순서는?

정답입니다.

오답입니다. 답안을 다시 선택해 보세요.

정답 및 해설 보기

정답: ①
PHM은 먼저 데이터를 계측하고 이상 징후를 모니터링한 뒤, 원인을 진단하고 고장 가능성을 예측하여 개선 전략을 결정한다.

4. 데이터 분석의 3요소에 포함되지 않는 것은?

정답입니다.

오답입니다. 답안을 다시 선택해 보세요.

정답 및 해설 보기

정답: ③
강의에서 제시한 데이터 분석의 3요소는 컴퓨터과학·IT, 수학·통계, 도메인 지식이다.

5. 데이터 분석과 데이터 과학의 관계에 대한 설명으로 옳은 것은?

정답입니다.

오답입니다. 답안을 다시 선택해 보세요.

정답 및 해설 보기

정답: ②
데이터 분석은 의사결정 지원을 중심으로 하며, 데이터 과학은 분석을 포함하여 예측 모델과 자동화 시스템 구축까지 포괄한다.

6. 데이터 분석 과정의 일반적인 흐름으로 가장 적절한 것은?

정답입니다.

오답입니다. 답안을 다시 선택해 보세요.

정답 및 해설 보기

정답: ①
분석 목적에 맞는 데이터를 수집·저장하고 전처리한 다음 분석을 수행하며, 시각화로 결과와 관계를 표현한다.

7. 정부 공공 데이터와 소셜 미디어 데이터는 출처에 따라 무엇으로 분류되는가?

정답입니다.

오답입니다. 답안을 다시 선택해 보세요.

정답 및 해설 보기

정답: ④
조직 밖의 정부, 소셜 미디어, 연구 기관 등에서 제공되는 자료는 외부 데이터에 해당한다.

8. 여러 출처의 데이터를 하나의 데이터셋으로 결합하는 전처리 작업은?

정답입니다.

오답입니다. 답안을 다시 선택해 보세요.

정답 및 해설 보기

정답: ③
데이터 통합은 서로 다른 출처에서 얻은 데이터를 하나의 데이터셋으로 결합하는 과정이다.

9. 결측치, 이상치, 불일치 값을 제거하거나 처리하는 작업은?

정답입니다.

오답입니다. 답안을 다시 선택해 보세요.

정답 및 해설 보기

정답: ①
데이터 정제는 분석을 방해하는 결측치, 이상치, 불일치 값 등을 찾아 처리하는 전처리 작업이다.

10. EDA에 대한 설명으로 옳지 않은 것은?

정답입니다.

오답입니다. 답안을 다시 선택해 보세요.

정답 및 해설 보기

정답: ④
EDA는 데이터를 요약하고 시각적으로 표현하여 분포, 이상치, 주요 패턴과 변수 관계를 탐색하는 과정이다.

11. 평균·중앙값·표준편차와 가설 검정 등을 활용하는 분석 방법은?

정답입니다.

오답입니다. 답안을 다시 선택해 보세요.

정답 및 해설 보기

정답: ②
기술 통계와 가설 검정, 상관 분석, 회귀 분석은 데이터의 특성과 관계 및 유의성을 살피는 통계 분석 기법이다.

12. 데이터 시각화의 역할로 가장 거리가 먼 것은?

정답입니다.

오답입니다. 답안을 다시 선택해 보세요.

정답 및 해설 보기

정답: ③
시각화는 탐색, 요약, 결과 전달에 도움을 주지만 데이터 윤리와 개인정보 보호 문제를 자동으로 해결하지는 않는다.

13. 문장, 이미지, 영상, 음성과 같이 정해진 구조 없이 존재하는 데이터는?

정답입니다.

오답입니다. 답안을 다시 선택해 보세요.

정답 및 해설 보기

정답: ④
비정형 데이터는 고정된 구조 없이 자유로운 형태로 존재하며 문장, 이미지, 영상, 음성 등이 대표적이다.

14. 데이터의 속성에 따른 분류가 올바르게 연결된 것은?

정답입니다.

오답입니다. 답안을 다시 선택해 보세요.

정답 및 해설 보기

정답: ②
질적 데이터는 명목형과 순서형으로, 양적 데이터는 이산형과 연속형으로 나뉜다.

15. 오픈소스의 개념에 가장 부합하는 설명은?

정답입니다.

오답입니다. 답안을 다시 선택해 보세요.

정답 및 해설 보기

정답: ①
오픈소스는 지적 자산을 개방하고 공유·협력하며, 소스코드를 접근·사용·복제·수정·재배포할 수 있게 하는 철학이다.

16. 리처드 스톨먼(RMS)의 활동으로 옳은 것은?

정답입니다.

오답입니다. 답안을 다시 선택해 보세요.

정답 및 해설 보기

정답: ③
RMS는 자유 소프트웨어 운동의 중심 인물로 GNU 프로젝트를 시작하고 자유 소프트웨어 재단(FSF)을 설립했다.

17. 에릭 레이몬드가 「성당과 시장」에서 제시한 시장 모델의 특징은?

정답입니다.

오답입니다. 답안을 다시 선택해 보세요.

정답 및 해설 보기

정답: ②
시장 모델은 네트워크를 통해 결과물을 공유하고 다양한 개발자가 참여하는 개방적 공개 개발 방식이다.

18. 개인이 오픈소스 개발에 참여하는 외재적 동기의 예는?

정답입니다.

오답입니다. 답안을 다시 선택해 보세요.

정답 및 해설 보기

정답: ④
취미, 공유의 즐거움, 호혜성은 내재적 동기이며, 명성이 노동 시장에서 신호로 작용하는 것은 외재적 동기이다.

19. 파이썬 개발 환경에 대한 설명으로 옳은 것은?

정답입니다.

오답입니다. 답안을 다시 선택해 보세요.

정답 및 해설 보기

정답: ③
Google Colab은 별도 설치 없이 브라우저에서 사용할 수 있다. Jupyter Notebook은 코드를 셀 단위로 실행하며, IDLE은 기본 제공 개발 환경이다.

20. 강의에서 소개한 오픈소스 데이터 분석 라이브러리의 묶음으로 옳은 것은?

정답입니다.

오답입니다. 답안을 다시 선택해 보세요.

정답 및 해설 보기

정답: ①
Pandas, Matplotlib, Seaborn, Scikit-learn은 데이터 처리, 시각화, 머신러닝 등에 활용되는 파이썬 오픈소스 라이브러리이다.

댓글