AI란 무엇일까?
인공지능(AI)은 컴퓨터가 사람처럼 생각해야 할 수 있는 일을 하는 것이에요. 보기, 듣기, 말 이해하기, 결정하기 같은 일이에요. 요즘 AI는 대부분 정해진 명령만 따르지 않고 데이터에서 배워서 작동해요.
AI, 머신러닝, 딥러닝
- AI는 가장 큰 개념이에요. 똑똑하게 행동하는 기계예요.
- 머신러닝(ML)은 AI의 한 부분이에요. 기계가 데이터에서 규칙을 찾아내요.
- 딥러닝은 ML의 한 부분이에요. 큰 신경망을 써서 예를 들어 얼굴을 알아봐요.
세 가지 주요 분야
- 데이터 사이언스: 숫자와 표를 다뤄요(가격 예측).
- 컴퓨터 비전: 사진과 영상을 다뤄요(얼굴 잠금 해제).
- 자연어 처리(NLP): 글과 말을 다뤄요(음성 비서, 번역).
자동으로 움직인다고 모두 AI는 아니에요. 세탁기 타이머는 정해진 순서대로만 움직이고 배우지 않아요.
AI 프로젝트 사이클의 여섯 단계
- 문제 정의: 문제를 이해해요. 4W 문제 캔버스를 채워요. Who(관련된 사람들), What(문제와 그 증거), Where(상황과 장소), Why(풀면 얻는 이익)예요. 마지막에 한 줄짜리 문제 문장을 써요.
- 데이터 수집: 관련 있고, 믿을 수 있고, 써도 되는 데이터를 모아요. 출처는 설문, 센서, 카메라, 관찰, 웹 스크래핑, 공개 데이터셋(API) 등이 있어요. 데이터에는 특성(입력, 예: 크기, 색)과 레이블(정답, 예: 사과)이 있어요.
- 데이터 탐색: 데이터를 정리하고(빠진 값, 틀린 값, 겹친 값을 고쳐요) 그래프로 그려서 규칙을 찾아요.
- 모델링: 방법을 골라요. 규칙 기반은 사람이 규칙을 써요. 학습 기반은 기계가 데이터에서 규칙을 배워요(예: 정답이 있는 데이터로 하는 지도학습, 무리를 찾는 비지도학습).
- 평가: 모델이 한 번도 본 적 없는 데이터로 시험해요. 정확도를 재고 틀린 것을 살펴봐요.
- 배포: 모델을 실제 앱이나 기기에 넣고, 어떻게 작동하는지 지켜보며 계속 고쳐요. 그리고 사이클이 다시 돌아요.
모델 평가하기: 쉬운 숫자로 보는 정확도
정확도 = 맞힌 예측 수 ÷ 전체 예측 수 × 100%.
과일 모델이 새 과일 200개를 보고 180개를 맞혔다면 정확도 = 180 ÷ 200 × 100 = 90%예요. 일부 데이터는 시험 데이터로 따로 남겨 둬요. 모델이 학습한 데이터를 그냥 "외워 버릴" 수 있기 때문이에요. 새 데이터로 시험해야 진짜로 배웠는지 알 수 있어요.
정확도 하나만 보면 문제가 숨어 있을 수 있어요. 전체로는 95% 맞혀도 어떤 집단에서는 훨씬 많이 틀릴 수 있어요. 그래서 집단별로도 결과를 확인해요.
AI의 윤리와 편향
AI 윤리는 AI가 사람들에게 공정하고 안전하게 쓰이도록 하는 것이에요.
- 편향: 모델이 어떤 사람들을 불공평하게 대하는 것이에요. 보통 학습 데이터에 예시가 너무 적거나 한쪽에 치우쳐 있어서 생겨요. 예: 한 가지 피부색 위주로 학습한 얼굴 잠금 해제는 다른 피부색에서 더 자주 실패해요.
- 개인정보 보호: 꼭 필요한 데이터만, 허락을 받고 모으고, 안전하게 지켜요.
- 투명성: AI가 결정하고 있다는 것과 그 이유를 사람들이 알 수 있어야 해요.
- 책임: AI가 한 일에 대한 책임은 사람에게 있어요.
- 일자리와 접근성: AI는 사람을 도와야 하고, 누구나 쓸 수 있어야 해요.
해결 방법: 균형 잡히고 점검한 데이터, 모든 집단에 대한 시험, 중요한 결정은 사람이 다시 검토하기예요.
핵심 공식과 정의
- 정확도(%) = 맞힌 예측 수 ÷ 전체 예측 수 × 100
- AI 프로젝트 사이클: 문제 정의 → 데이터 수집 → 데이터 탐색 → 모델링 → 평가 → 배포
- 4W 캔버스: Who(누가), What(무엇을), Where(어디서), Why(왜)
- 특성: 데이터의 입력 속성. 레이블: 각 예시의 정답.
- 학습 데이터는 모델을 가르치고, 시험 데이터는 모델을 점검한다.
- 편향: 어떤 집단에 불공평한 결과가 나오는 것. 보통 균형이 맞지 않는 데이터 때문에 생긴다.
풀이 예제
1. 학교에서 물 마시는 것을 자꾸 잊는 학생들을 위해 4W 문제 문장을 써 보세요.
Who: 12~15세 학생들. What: 물을 너무 적게 마셔서 피곤해해요. Where: 긴 수업 시간의 교실. Why: 알림이 건강과 집중력을 좋게 할 수 있어요. 문제 문장: "우리 학생들(누가)은 긴 수업 시간(어디서) 동안 물을 너무 적게 마신다(무엇을). 똑똑한 알림이 있으면 건강하고 또렷하게 지낼 수 있다(왜)."
2. 식물 병 진단 모델이 새 잎 사진 250장을 시험해서 215장을 맞혔어요. 정확도를 구하세요.
정확도 = 215 ÷ 250 × 100 = 86%.
3. 대출 심사 모델을 도시 신청자의 데이터로만 학습시켰어요. 어떤 문제가 생길 수 있고, 어떻게 고칠 수 있을까요?
모델이 시골 신청자의 특징을 배운 적이 없어서 이들을 부당하게 거절할 수 있어요(편향). 해결: 시골 지역의 데이터도 균형 있게 모으고, 집단별로 정확도를 따로 시험하고, 거절 결정은 사람이 검토해요.
자주 하는 실수
- 문제를 정의하기 전에 모델링부터 시작하는 것. 분명한 문제 문장이 없으면 모은 데이터가 쓸모없을 수 있어요.
- 학습에 쓴 데이터로 그대로 모델을 시험하는 것. 그러면 배운 것이 아니라 외운 것만 확인해요.
- 데이터는 많을수록 무조건 좋다고 생각하는 것. 틀렸거나 편향됐거나 개인정보가 담긴 데이터는 모델을 나쁘게 하거나 비윤리적으로 만들어요.
- 자동으로 움직이는 기계를 모두 "AI"라고 부르는 것. 데이터에서 배우거나 추론할 때만 AI예요.