📘 CodingMarble Learn

Data-analyse

Data-analyse betekent dat je ruwe gegevens omzet in antwoorden. Dat gaat in een cyclus: stel een vraag, verzamel data, maak de data schoon (haal fouten, dubbelen en lege plekken weg), orden en bewerk ze, analyseer ze met samenvattende getallen zoals gemiddelde, mediaan, bereik en patronen, laat ze zien in een goede grafiek en trek een voorzichtige conclusie. Let op uitschieters, kleine steekproeven en vertekening (bias). Een correlatie tussen twee dingen bewijst niet dat het ene het andere veroorzaakt. Data moet ook veilig worden bewaard en alleen met toestemming worden gebruikt.

🎬 Verhaal in stappen

  1. Eerst verzamelen we data. We vragen aan 8 leerlingen hoeveel uur ze hebben geslapen. Elk antwoord is één bal in de doos.
  2. Sommige antwoorden kloppen niet: een dubbele, een onmogelijke '25 uur' en een lege. Opschonen betekent dat we ze weghalen of verbeteren.
  3. Daarna ordenen we. We zetten de antwoorden van klein naar groot en elk antwoord wordt een staaf.
  4. Nu analyseren we. Het gemiddelde telt alle waarden op en deelt door het aantal. De mediaan is de middelste waarde.
  5. We maken een grafiek om een patroon te zien. Meer schermtijd gaat samen met minder slaap. Maar een patroon alleen bewijst de oorzaak niet.
  6. Jouw beurt: voeg met de schuifknop een nieuwe leerling toe. Probeer een enorme waarde. Zie het gemiddelde omhoogspringen terwijl de mediaan rustig blijft.

Tip: sleep de 3D-scène om hem te draaien. Gebruik twee vingers om te zoomen.

🤔 Veelvoorkomende twijfels, opgehelderd

Waarom gebruiken we niet gewoon alle data zoals die binnenkomt?

Ruwe data heeft dubbelen, typfouten en onmogelijke waarden. Eén foute waarde kan het antwoord veranderen, daarom schonen we eerst op.

Waarom sorteren voordat je de mediaan zoekt?

De mediaan is het midden van de geordende lijst. Zonder sorteren zegt de middelste plek niets.

Wanneer gebruik ik de mediaan in plaats van het gemiddelde?

Als er uitschieters zijn of de data scheef is. Probeer in de vrije oefening een enorme waarde: het gemiddelde springt omhoog, de mediaan niet.

Als de trendlijn daalt, veroorzaakt schermtijd dan minder slaap?

Misschien, maar de grafiek alleen kan dat niet bewijzen. Andere dingen (huiswerk, stress) kunnen allebei beïnvloeden.

Is kwalitatieve data onbruikbaar voor analyse?

Nee. We kunnen categorieën tellen, de modus vinden en staaf- of cirkeldiagrammen maken.

De cyclus van data-analyse

  1. Vraag stellen: een duidelijke vraag ("Slapen leerlingen die laat op hun telefoon zitten minder?").
  2. Verzamelen van data: enquêtes, metingen, sensoren, experimenten of bestaande datasets.
  3. Opschonen van de data.
  4. Ordenen / bewerken: sorteren, groeperen, tabellen maken, eenheden omrekenen.
  5. Analyseren: samenvattingen, patronen, vergelijkingen.
  6. Weergeven en concluderen: maak een grafiek, beantwoord de vraag en zeg hoe zeker je bent.

Vaak levert het antwoord een nieuwe vraag op, dus de cyclus begint opnieuw. Hulpmiddelen lopen uiteen van papier en een rekenmachine tot spreadsheets en programmeertalen zoals Python.

Data verzamelen en opschonen

Kwantitatieve data zijn getallen (lengte 152 cm). Kwalitatieve data zijn woorden of categorieën (favoriete sport). Primaire data verzamel je zelf; secundaire data heeft iemand anders verzameld.

Een steekproef is de groep die je echt ondervraagt. Een grotere steekproef die willekeurig is gekozen geeft eerlijkere resultaten; als je alleen je vrienden vraagt, krijg je vertekening (bias).

Checklist voor opschonen

Data veilig houden

Voor persoonlijke gegevens heb je toestemming nodig, ze moeten veilig worden opgeslagen en namen kun je weghalen (anonimiseren) voordat je de data deelt.

Data analyseren: gemiddelden, spreiding, uitschieters

Gemiddelde = som van de waarden ÷ aantal waarden. Mediaan = middelste waarde na het sorteren (bij een even aantal: het gemiddelde van de twee middelste). Modus = de waarde die het vaakst voorkomt. Bereik = grootste − kleinste; het laat de spreiding zien.

Een uitschieter is een waarde die ver van de rest ligt. Het kan een fout zijn of een echt zeldzaam geval. Het gemiddelde wordt door uitschieters meegetrokken, de mediaan niet. Daarom is de mediaan beter bij scheve data, zoals inkomens.

Verkennende data-analyse betekent dat je de data van veel kanten bekijkt (tabellen, grafieken, samenvattingen) voordat je een idee toetst. Groeperen (bijvoorbeeld per klas of stad) en meerdere datasets combineren kan nieuwe patronen laten zien.

Weergeven, concluderen en beoordelen

Kies de grafiek die bij het doel past: een staafdiagram om groepen te vergelijken, een lijngrafiek voor verandering in de tijd, een spreidingsdiagram voor twee getalsvariabelen, een cirkeldiagram voor delen van een geheel en een histogram om te laten zien hoe waarden verdeeld zijn.

In een spreidingsdiagram laten punten die samen stijgen een positieve correlatie zien; als de ene waarde stijgt terwijl de andere daalt, is er een negatieve correlatie. Correlatie is geen causaal verband: ijsverkoop en verdrinkingen stijgen allebei in de zomer door de hitte, niet door elkaar.

Beoordeel je conclusie

Was de steekproef groot en eerlijk? Zijn de fouten opgeschoond? Zou een andere analyse van dezelfde data een ander antwoord kunnen geven? Noem de beperkingen eerlijk. Bij big data (miljoenen rijen, bijvoorbeeld sensoren voor luchtvervuiling in een stad) doen computers dezelfde stappen sneller, maar je moet net zo zorgvuldig zijn.

Belangrijke formules en begrippen

Uitgewerkte voorbeelden

1. Maak deze slaapdata schoon: 7, 8, 8 (dezelfde leerling twee keer), 25, leeg, 6.

Haal de dubbele 8, de onmogelijke 25 en de lege plek weg. Schone data: 7, 8, 6.

2. Bereken het gemiddelde en de mediaan van 6, 7, 7, 8, 8, 8, 9, 10.

Som = 63, aantal = 8, gemiddelde = 63 ÷ 8 = 7.875 ≈ 7.9. De twee middelste waarden zijn 8 en 8, dus mediaan = 8.

3. Voeg een uitschieter 24 toe aan de data hierboven. Wat gebeurt er met het gemiddelde en de mediaan?

Nieuwe som = 87, aantal = 9, gemiddelde = 87 ÷ 9 ≈ 9.67 (een grote sprong). Gesorteerd is de 5e waarde 8, dus mediaan = 8 (geen verandering). De mediaan is bestand tegen uitschieters.

Veelgemaakte fouten

Oefentoets

1. Welke stap haalt dubbelen en onmogelijke waarden weg?
2. Het gemiddelde van 2, 4, 6 is:
3. Welk gemiddelde wordt het minst beïnvloed door een uitschieter?
4. Beste grafiek voor twee getalsvariabelen samen:
5. "Favoriete kleur" is wat voor soort data?

Oefenen: beantwoord deze zelf

Typ of kies je antwoord en druk op Controleer. Gebruik een hint als je vastzit; de volledige uitwerking verschijnt na je antwoord.

Veelgestelde vragen

Wat is data-analyse in eenvoudige woorden?

Informatie verzamelen, opschonen en ordenen en daarna met samenvattingen en grafieken een vraag beantwoorden.

Wat zijn de stappen van data-analyse?

Een vraag stellen, verzamelen, opschonen, ordenen, analyseren, weergeven en concluderen en daarna beoordelen.

Wat is het verschil tussen gemiddelde en mediaan?

Het gemiddelde is de som gedeeld door het aantal; de mediaan is de middelste waarde. De mediaan wordt niet meegetrokken door uitschieters.

Waar dit wordt onderwezen

Canada (Ontario)Grade 8D. Data
Canada (Ontario)Grade 9A. Business Leadership, Project Management, and Connections
Canada (Ontario)Grade 10A. Business Leadership, Project Management, and Connections
Canada (Ontario)Grade 10B. Hardware, Software, and Innovations
Canada (Ontario)Grade 11Productivity Software
Canada (Ontario)Grade 11B. Spatial Geography: Concepts and Processes
Canada (Ontario)Grade 11B. Design, Layout, and Planning Skills
Canada (Ontario)Grade 11B. Computer Technology Skills
Canada (Ontario)Grade 11A. Computer Technology Fundamentals
Canada (Ontario)Grade 12B. Spatial Organization: Concepts and Processes
Canada (Ontario)Grade 12B. Spatial Organization: Regional Similarities and Differences
Canada (Ontario)Grade 12D. Data Management
Canada (Ontario)Grade 12C. Organization of Data for Analysis
Canada (Ontario)Grade 12D. Statistical Analysis
Canada (Ontario)Grade 12E. Culminating Data Management Investigation
Canada (Ontario)Grade 12A. Reasoning with Data
Canada (Ontario)Grade 12C. Mechanical Systems
Canada (Ontario)Grade 12B. Design, Layout, and Planning Skills
Canada (Ontario)Grade 12B. Design, Layout, and Planning Skills
Canada (Ontario)Grade 12A. Computer Technology Fundamentals
NetherlandsVWO 3 (onderbouw)Data and chance
NetherlandsHAVO 4 (bovenbouw, 2e fase)Statistics (part 1)
PolandSzkoła podstawowa, klasa VIICross-cutting skills
Spain2º ESOScientific project
Spain3º ESOScientific project
Spain4º ESOScientific project
Spain1º BachilleratoScientific project
Spain1º BachilleratoNumber sense
England (GCSE, A level)Year 9Working scientifically
USA (Common Core, NGSS, AP)Grade 8Data and Analysis
USA (Common Core, NGSS, AP)Grade 9Data and Analysis
USA (Common Core, NGSS, AP)Grade 10Big Idea 2: Data
USA (Common Core, NGSS, AP)Grade 10Big Idea 3: Algorithms and Programming
USA (Common Core, NGSS, AP)Grade 11Data Collections
USA (Common Core, NGSS, AP)Grade 11Data and Analysis
Japan高校(専門学科)1〜3年Advanced Mathematics I
South Korea중학교 2학년Data
South Korea고등학교 1학년Foundations of science
South Korea고등학교 1학년Processes of scientific inquiry
South Korea고등학교 2학년The process of convergent inquiry
South Korea고등학교 2학년Preparing and analysing data
South Korea고등학교 2학년Data science project
South Korea고등학교 2학년Data
South Korea고등학교 2학년Society and mathematics
South Korea고등학교 2학년Environment and mathematics
South Korea고등학교 2학년Software for analysis
South Korea고등학교 3학년Data and information
South Korea고등학교 3학년Data
Russia10 классInformation technologies
Russia11 классInformation technologies
China高一Comp.1 Ch.3 Data processing
China高二Sel.3 Data management and analysis

Leer eerst

Leer hierna