📘 CodingMarble Learn

데이터 분석

데이터 분석은 날것의 자료를 답으로 바꾸는 일이에요. 순서는 이래요. 질문하기, 자료 모으기, 정리하기(오류, 중복, 빈칸 없애기), 표로 만들고 바꾸기, 평균·중앙값·범위 같은 요약과 패턴으로 분석하기, 알맞은 그래프로 보여 주기, 조심스럽게 결론 내리기. 이상치, 너무 작은 표본, 편향을 조심하세요. 그리고 두 가지가 함께 변한다고 해서 하나가 다른 하나의 원인이라는 증거는 아니라는 점도 기억하세요. 자료는 안전하게 보관하고, 허락을 받고 써야 해요.

🎬 단계별 이야기

  1. 먼저 자료를 모아요. 학생 8명에게 몇 시간 잤는지 물어봐요. 대답 하나가 상자 속 공 하나예요.
  2. 틀린 대답도 있어요. 중복된 값, 말이 안 되는 '25시간', 빈칸이에요. 정리한다는 건 이런 값을 지우거나 고치는 거예요.
  3. 다음은 정돈하기예요. 대답을 작은 것부터 큰 것까지 줄 세우면, 하나하나가 막대가 돼요.
  4. 이제 분석해요. 평균은 모든 값을 더해서 개수로 나눈 값이에요. 중앙값은 가운데에 있는 값이에요.
  5. 그래프를 그려서 패턴을 봐요. 화면을 오래 볼수록 잠이 줄어드는 경향이 보여요. 하지만 패턴만으로 원인을 증명할 수는 없어요.
  6. 이제 네 차례예요. 슬라이더로 새 학생을 넣어 보세요. 아주 큰 값도 넣어 보세요. 평균은 확 뛰는데 중앙값은 차분해요.

팁: 3D 화면을 드래그하면 돌아가요. 두 손가락으로 확대할 수 있어요.

🤔 헷갈리는 점, 한 번에 해결

왜 자료를 있는 그대로 다 쓰면 안 되나요?

날것의 자료에는 중복, 오타, 불가능한 값이 있어요. 나쁜 값 하나가 답을 바꿀 수 있어서 먼저 정리해요.

중앙값을 구하기 전에 왜 줄 세워야 하나요?

중앙값은 순서대로 놓은 목록의 가운데예요. 줄 세우지 않으면 가운데 자리가 아무 뜻이 없어요.

평균 대신 중앙값은 언제 쓰나요?

이상치가 있거나 자료가 한쪽으로 치우쳤을 때요. 자유 체험에서 아주 큰 값을 넣어 보세요. 평균은 뛰지만 중앙값은 그대로예요.

추세선이 내려가면 화면을 오래 보는 것이 잠을 줄이는 원인인가요?

그럴 수도 있지만 그래프만으로는 증명할 수 없어요. 숙제나 스트레스 같은 다른 요인이 둘 다에 영향을 줄 수도 있어요.

질적 자료는 분석에 쓸모없나요?

아니에요. 종류별로 세고, 최빈값을 찾고, 막대그래프나 원그래프를 그릴 수 있어요.

데이터 분석의 순환 과정

  1. 분명한 질문을 던져요 ("밤늦게 휴대폰을 쓰는 학생은 잠을 덜 잘까?").
  2. 자료를 모아요. 설문, 측정, 센서, 실험, 이미 있는 자료를 쓸 수 있어요.
  3. 자료를 정리해요.
  4. 정돈하고 바꿔요. 줄 세우기, 묶기, 표 만들기, 단위 바꾸기를 해요.
  5. 분석해요. 요약, 패턴, 비교를 해요.
  6. 그래프로 보여 주고 결론을 내요. 질문에 답하고, 얼마나 확실한지도 말해요.

답을 얻고 나면 새 질문이 생기는 일이 많아서, 순환이 다시 시작돼요. 도구는 종이와 계산기부터 스프레드시트, 파이썬 같은 프로그래밍 언어까지 다양해요.

자료 모으기와 정리하기

양적 자료는 숫자예요(키 152 cm). 질적 자료는 말이나 종류예요(좋아하는 운동). 직접 자료는 내가 직접 모은 것이고, 간접 자료는 다른 사람이 모은 것이에요.

표본은 실제로 물어본 집단이에요. 더 크고 무작위로 뽑은 표본이 더 공정한 결과를 줘요. 친구들에게만 물어보면 편향이 생겨요.

정리 체크리스트

자료를 안전하게 지키기

개인 정보는 허락을 받아야 하고, 안전하게 보관해야 해요. 공개하기 전에 이름을 지울 수도 있어요(익명화).

자료 분석하기: 평균, 퍼짐, 이상치

평균 = 값의 합 ÷ 값의 개수. 중앙값 = 줄 세운 뒤 가운데 값(개수가 짝수이면 가운데 두 값의 평균). 최빈값 = 가장 많이 나온 값. 범위 = 가장 큰 값 − 가장 작은 값이고, 값이 얼마나 퍼져 있는지 보여 줘요.

이상치는 나머지 값에서 멀리 떨어진 값이에요. 실수일 수도 있고, 진짜 드문 경우일 수도 있어요. 평균은 이상치에 끌려가지만 중앙값은 그렇지 않아요. 그래서 소득처럼 한쪽으로 치우친 자료에는 중앙값이 더 좋아요.

탐색적 데이터 분석은 아이디어를 검증하기 전에 자료를 여러 방향에서(표, 그래프, 요약) 살펴보는 거예요. 반이나 도시별로 묶거나 여러 자료를 합치면 새로운 패턴이 보일 수 있어요.

그래프로 보여 주기, 결론 내리기, 평가하기

목적에 맞는 그래프를 골라요. 막대그래프는 집단을 비교할 때, 꺾은선그래프는 시간에 따른 변화를 볼 때, 산점도는 숫자 두 가지를 함께 볼 때, 원그래프는 전체에서 부분의 몫을 볼 때, 히스토그램은 값이 어떻게 퍼져 있는지 볼 때 써요.

산점도에서 점들이 함께 오르면 양의 상관관계예요. 하나가 오를 때 다른 하나가 내려가면 음의 상관관계예요. 상관관계는 인과관계가 아니에요. 아이스크림 판매량과 물놀이 사고는 둘 다 여름에 늘어나는데, 서로 때문이 아니라 더위 때문이에요.

결론 평가하기

표본은 충분히 크고 공정했나요? 오류는 정리했나요? 같은 자료를 다르게 분석하면 다른 답이 나올 수 있나요? 한계를 솔직하게 말하세요. 빅데이터(수백만 줄, 예를 들어 도시의 대기오염 센서)는 컴퓨터가 같은 단계를 더 빠르게 해 주지만, 똑같은 주의가 필요해요.

핵심 공식과 정의

풀이 예제

1. 이 수면 자료를 정리하세요: 7, 8, 8 (같은 학생이 두 번), 25, 빈칸, 6.

중복된 8, 불가능한 25, 빈칸을 지워요. 정리된 자료: 7, 8, 6.

2. 6, 7, 7, 8, 8, 8, 9, 10의 평균과 중앙값을 구하세요.

합 = 63, 개수 = 8, 평균 = 63 ÷ 8 = 7.875 ≈ 7.9. 가운데 두 값은 8과 8이므로 중앙값 = 8.

3. 위 자료에 이상치 24를 넣으면 평균과 중앙값은 어떻게 되나요?

새 합 = 87, 개수 = 9, 평균 = 87 ÷ 9 ≈ 9.67 (크게 뛰어요). 줄 세우면 5번째 값이 8이므로 중앙값 = 8 (변화 없음). 중앙값은 이상치에 잘 흔들리지 않아요.

자주 하는 실수

연습 퀴즈

1. 중복과 불가능한 값을 없애는 단계는 무엇인가요?
2. 2, 4, 6의 평균은?
3. 이상치의 영향을 가장 적게 받는 대푯값은?
4. 숫자 두 가지를 함께 보기에 가장 좋은 그래프는?
5. "좋아하는 색"은 어떤 종류의 자료인가요?

연습: 직접 풀어 보세요

답을 입력하거나 고른 뒤 확인을 누르세요. 막히면 힌트를 보세요. 풀이는 답을 낸 뒤에 나타나요.

자주 묻는 질문

데이터 분석이란 쉽게 말해 무엇인가요?

정보를 모으고, 정리하고 정돈한 다음, 요약과 그래프로 질문에 답하는 일이에요.

데이터 분석의 단계는 무엇인가요?

질문하기, 수집, 정리, 정돈, 분석, 그래프로 보여 주고 결론 내리기, 그리고 평가하기예요.

평균과 중앙값은 어떻게 다른가요?

평균은 합을 개수로 나눈 값이고, 중앙값은 가운데 값이에요. 중앙값은 이상치에 끌려가지 않아요.

배우는 곳

Canada (Ontario)Grade 8D. Data
Canada (Ontario)Grade 9A. Business Leadership, Project Management, and Connections
Canada (Ontario)Grade 10A. Business Leadership, Project Management, and Connections
Canada (Ontario)Grade 10B. Hardware, Software, and Innovations
Canada (Ontario)Grade 11Productivity Software
Canada (Ontario)Grade 11B. Spatial Geography: Concepts and Processes
Canada (Ontario)Grade 11B. Design, Layout, and Planning Skills
Canada (Ontario)Grade 11B. Computer Technology Skills
Canada (Ontario)Grade 11A. Computer Technology Fundamentals
Canada (Ontario)Grade 12B. Spatial Organization: Concepts and Processes
Canada (Ontario)Grade 12B. Spatial Organization: Regional Similarities and Differences
Canada (Ontario)Grade 12D. Data Management
Canada (Ontario)Grade 12C. Organization of Data for Analysis
Canada (Ontario)Grade 12D. Statistical Analysis
Canada (Ontario)Grade 12E. Culminating Data Management Investigation
Canada (Ontario)Grade 12A. Reasoning with Data
Canada (Ontario)Grade 12C. Mechanical Systems
Canada (Ontario)Grade 12B. Design, Layout, and Planning Skills
Canada (Ontario)Grade 12B. Design, Layout, and Planning Skills
Canada (Ontario)Grade 12A. Computer Technology Fundamentals
NetherlandsVWO 3 (onderbouw)Data and chance
NetherlandsHAVO 4 (bovenbouw, 2e fase)Statistics (part 1)
PolandSzkoła podstawowa, klasa VIICross-cutting skills
Spain2º ESOScientific project
Spain3º ESOScientific project
Spain4º ESOScientific project
Spain1º BachilleratoScientific project
Spain1º BachilleratoNumber sense
England (GCSE, A level)Year 9Working scientifically
USA (Common Core, NGSS, AP)Grade 8Data and Analysis
USA (Common Core, NGSS, AP)Grade 9Data and Analysis
USA (Common Core, NGSS, AP)Grade 10Big Idea 2: Data
USA (Common Core, NGSS, AP)Grade 10Big Idea 3: Algorithms and Programming
USA (Common Core, NGSS, AP)Grade 11Data Collections
USA (Common Core, NGSS, AP)Grade 11Data and Analysis
Japan高校(専門学科)1〜3年Advanced Mathematics I
South Korea중학교 2학년Data
South Korea고등학교 1학년Foundations of science
South Korea고등학교 1학년Processes of scientific inquiry
South Korea고등학교 2학년The process of convergent inquiry
South Korea고등학교 2학년Preparing and analysing data
South Korea고등학교 2학년Data science project
South Korea고등학교 2학년Data
South Korea고등학교 2학년Society and mathematics
South Korea고등학교 2학년Environment and mathematics
South Korea고등학교 2학년Software for analysis
South Korea고등학교 3학년Data and information
South Korea고등학교 3학년Data
Russia10 классInformation technologies
Russia11 классInformation technologies
China高一Comp.1 Ch.3 Data processing
China高二Sel.3 Data management and analysis

먼저 배우기

다음에 배우기