📘 CodingMarble Learn

AI 프로젝트 사이클: AI 서비스는 어떻게 만들어질까?

인공지능(AI)은 기계가 데이터에서 배워서 판단하거나 예측하는 능력이에요. 얼굴을 알아보거나 노래를 추천하는 것이 그 예예요. AI 서비스는 AI 프로젝트 사이클이라는 여섯 단계를 돌려 가며 만들어요. 1) 문제 정의: 4W(누가, 무엇을, 어디서, 왜)로 문제를 정리해요. 2) 데이터 수집: 믿을 만한 데이터를 모아요. 3) 데이터 탐색: 데이터를 정리하고 그래프로 그려 규칙을 찾아요. 4) 모델링: 규칙을 쓰거나 학습 방법을 골라요. 5) 평가: 새 데이터로 시험하고 정확도를 계산해요. 6) 배포: 실제로 쓰게 하고 계속 고쳐요. 모든 단계에서 공정성(편향 없음), 개인정보 보호, 투명성, 책임을 생각해야 해요.

🎬 단계별 이야기

  1. AI는 예시, 즉 데이터에서 배우는 기계예요. 사과와 오렌지를 많이 보고 나면 새로운 과일도 스스로 구별할 수 있어요.
  2. 모든 AI 프로젝트는 문제 정의에서 시작해요. 4W를 물어봐요. 누구의 문제인가? 무슨 문제인가? 어디서 일어나는가? 왜 풀 가치가 있는가?
  3. 다음은 설문, 카메라, 센서, 웹사이트에서 데이터를 모아요(데이터 수집). 그다음 탐색해요. 그래프를 그리고 틀렸거나 빠진 값을 없애요.
  4. 모델을 만들어요(모델링). 규칙을 직접 쓰거나 기계가 데이터에서 배우게 해요. 새 데이터로 시험해요(평가). 충분히 좋으면 내놓아요(배포).
  5. 윤리와 편향: 데이터에 B 집단의 예시가 아주 적으면 모델은 B 집단에서 더 많이 틀려요. 공정한 데이터는 모두를 포함하고 개인정보를 지켜요.
  6. 자유 실험: 데이터에서 B 집단이 차지하는 비율을 직접 바꿔 보세요. 데이터가 균형을 이룰수록 모델이 더 공정해지는 걸 볼 수 있어요.

팁: 3D 화면을 드래그하면 돌아가요. 두 손가락으로 확대할 수 있어요.

🤔 헷갈리는 점, 한 번에 해결

AI는 보통 컴퓨터 프로그램과 무엇이 다를까요?

보통 프로그램은 사람이 쓴 정해진 규칙을 따라요. AI 모델은 많은 예시에서 스스로 규칙을 배워요. 기계가 과일을 보고 배우는 것처럼요.

왜 바로 모델부터 만들면 안 될까요?

4W가 없으면 누구의 문제를 풀고 있는지, 어떤 데이터가 필요한지 몰라요. 문제 정의가 그 뒤의 모든 것을 정해요.

탐색 단계에서 왜 일부 데이터를 없애나요?

틀리거나 빠진 값은 모델에게 잘못된 규칙을 가르쳐요. 떨어져 나가는 회색 점이 없어지는 나쁜 기록이에요.

왜 학습 데이터가 아니라 새 데이터로 시험할까요?

모델은 학습 예시를 외울 수 있어요. 새 데이터만 진짜로 배웠는지 보여 줘요. 초록색과 빨간색 막대는 새 데이터에서의 결과예요.

모델이 정확한데도 불공평할 수 있나요?

네. A 집단에서는 92% 맞히고 B 집단에서는 훨씬 적게 맞힐 수 있어요. 전체 숫자는 이를 숨기고, 집단별로 보면 드러나요.

편향은 어떻게 고칠까요?

빠진 집단의 예시를 더 넣어요. 자유 실험에서 B 집단의 비율을 올리고 B 집단의 정확도 막대가 오르는 것을 보세요.

AI란 무엇일까?

인공지능(AI)은 컴퓨터가 사람처럼 생각해야 할 수 있는 일을 하는 것이에요. 보기, 듣기, 말 이해하기, 결정하기 같은 일이에요. 요즘 AI는 대부분 정해진 명령만 따르지 않고 데이터에서 배워서 작동해요.

AI, 머신러닝, 딥러닝

세 가지 주요 분야

자동으로 움직인다고 모두 AI는 아니에요. 세탁기 타이머는 정해진 순서대로만 움직이고 배우지 않아요.

AI 프로젝트 사이클의 여섯 단계

  1. 문제 정의: 문제를 이해해요. 4W 문제 캔버스를 채워요. Who(관련된 사람들), What(문제와 그 증거), Where(상황과 장소), Why(풀면 얻는 이익)예요. 마지막에 한 줄짜리 문제 문장을 써요.
  2. 데이터 수집: 관련 있고, 믿을 수 있고, 써도 되는 데이터를 모아요. 출처는 설문, 센서, 카메라, 관찰, 웹 스크래핑, 공개 데이터셋(API) 등이 있어요. 데이터에는 특성(입력, 예: 크기, 색)과 레이블(정답, 예: 사과)이 있어요.
  3. 데이터 탐색: 데이터를 정리하고(빠진 값, 틀린 값, 겹친 값을 고쳐요) 그래프로 그려서 규칙을 찾아요.
  4. 모델링: 방법을 골라요. 규칙 기반은 사람이 규칙을 써요. 학습 기반은 기계가 데이터에서 규칙을 배워요(예: 정답이 있는 데이터로 하는 지도학습, 무리를 찾는 비지도학습).
  5. 평가: 모델이 한 번도 본 적 없는 데이터로 시험해요. 정확도를 재고 틀린 것을 살펴봐요.
  6. 배포: 모델을 실제 앱이나 기기에 넣고, 어떻게 작동하는지 지켜보며 계속 고쳐요. 그리고 사이클이 다시 돌아요.

모델 평가하기: 쉬운 숫자로 보는 정확도

정확도 = 맞힌 예측 수 ÷ 전체 예측 수 × 100%.

과일 모델이 새 과일 200개를 보고 180개를 맞혔다면 정확도 = 180 ÷ 200 × 100 = 90%예요. 일부 데이터는 시험 데이터로 따로 남겨 둬요. 모델이 학습한 데이터를 그냥 "외워 버릴" 수 있기 때문이에요. 새 데이터로 시험해야 진짜로 배웠는지 알 수 있어요.

정확도 하나만 보면 문제가 숨어 있을 수 있어요. 전체로는 95% 맞혀도 어떤 집단에서는 훨씬 많이 틀릴 수 있어요. 그래서 집단별로도 결과를 확인해요.

AI의 윤리와 편향

AI 윤리는 AI가 사람들에게 공정하고 안전하게 쓰이도록 하는 것이에요.

해결 방법: 균형 잡히고 점검한 데이터, 모든 집단에 대한 시험, 중요한 결정은 사람이 다시 검토하기예요.

핵심 공식과 정의

풀이 예제

1. 학교에서 물 마시는 것을 자꾸 잊는 학생들을 위해 4W 문제 문장을 써 보세요.

Who: 12~15세 학생들. What: 물을 너무 적게 마셔서 피곤해해요. Where: 긴 수업 시간의 교실. Why: 알림이 건강과 집중력을 좋게 할 수 있어요. 문제 문장: "우리 학생들(누가)은 긴 수업 시간(어디서) 동안 물을 너무 적게 마신다(무엇을). 똑똑한 알림이 있으면 건강하고 또렷하게 지낼 수 있다(왜)."

2. 식물 병 진단 모델이 새 잎 사진 250장을 시험해서 215장을 맞혔어요. 정확도를 구하세요.

정확도 = 215 ÷ 250 × 100 = 86%.

3. 대출 심사 모델을 도시 신청자의 데이터로만 학습시켰어요. 어떤 문제가 생길 수 있고, 어떻게 고칠 수 있을까요?

모델이 시골 신청자의 특징을 배운 적이 없어서 이들을 부당하게 거절할 수 있어요(편향). 해결: 시골 지역의 데이터도 균형 있게 모으고, 집단별로 정확도를 따로 시험하고, 거절 결정은 사람이 검토해요.

자주 하는 실수

연습 퀴즈

1. AI 프로젝트 사이클의 첫 번째 단계는 무엇일까요?
2. 4W 캔버스는 Who, What, Where 그리고 무엇을 물을까요?
3. 데이터를 정리하고 그래프를 그리는 것은 어느 단계일까요?
4. 모델이 시험 사례 50개 중 45개를 맞혔어요. 정확도는 얼마일까요?
5. AI 편향은 보통 무엇에서 생길까요?

연습: 직접 풀어 보세요

답을 입력하거나 고른 뒤 확인을 누르세요. 막히면 힌트를 보세요. 풀이는 답을 낸 뒤에 나타나요.

자주 묻는 질문

AI 프로젝트 사이클의 6단계는 무엇인가요?

문제 정의, 데이터 수집, 데이터 탐색, 모델링, 평가, 배포예요.

4W 문제 캔버스란 무엇인가요?

문제 정의에 쓰는 도구예요. 누구의 문제인지(Who), 무슨 문제인지(What), 어디서 생기는지(Where), 왜 풀 가치가 있는지(Why)를 물어요.

AI의 편향이란 무엇인가요?

편향은 AI가 어떤 사람들에게 불공평하거나 덜 정확한 결과를 주는 것이에요. 보통 학습 데이터가 그 사람들을 제대로 담지 못해서 생겨요.

배우는 곳

CBSE (India)Class 9Part B: AI Reflection, Project Cycle and Ethics

먼저 배우기

다음에 배우기