📘 CodingMarble Learn

AI项目流程:一个AI方案是怎样做出来的

人工智能(AI)是指机器能从数据中学习,并做出判断或预测,比如认人脸、推荐歌曲。做一个AI方案要经过一个循环的六个阶段,叫AI项目流程:1)问题界定,用4W(谁、什么、哪里、为什么);2)数据获取,收集可靠的数据;3)数据探索,清理数据并画图找规律;4)建模,选择规则或学习方法;5)评估,用新数据测试并计算准确率;6)部署,真正投入使用并不断改进。每个阶段都要想到伦理:公平(没有偏见)、隐私、透明,以及谁来负责。

🎬 分步故事

  1. AI是一台会从例子里学习的机器,这些例子叫数据。它看过很多苹果和橙子,就能自己分辨一个新水果。
  2. 每个AI项目都从问题界定开始。问4W:谁遇到了问题?是什么问题?在哪里发生?为什么值得解决?
  3. 接着收集数据(数据获取),来源有问卷、摄像头、传感器或网站。然后探索数据:画图,去掉错误或缺失的值。
  4. 建立模型(建模):自己写规则,或者让机器从数据中学习。再用新数据测试(评估)。够好了就上线(部署)。
  5. 伦理与偏见:如果数据里B组的例子很少,模型对B组就会犯更多错误。公平的数据包含所有人,也保护隐私。
  6. 自由练习:设置数据中有多少来自B组。看看数据越均衡,模型就越公平。

提示:拖动3D画面可以旋转,用两根手指可以缩放。

🤔 常见疑问,一次讲清

AI和普通的电脑程序有什么不同?

普通程序按人写好的固定规则运行。AI模型从很多例子中学出自己的规则,就像机器看水果那样。

为什么不马上开始建模型?

没有4W,你就不知道在解决谁的问题,也不知道需要什么数据。问题界定决定了后面的一切。

为什么在探索时要去掉一些数据?

错误或缺失的值会让模型学到错的规律。掉下去的那个灰点,就是一条被去掉的坏记录。

为什么要用新数据测试,而不是训练数据?

模型可能会背下训练的例子。只有新数据才能看出它是不是真的学会了。绿色和红色的柱子是在新数据上的结果。

模型可以很准确却仍然不公平吗?

可以。它对A组可能有92%是对的,对B组却差得多。整体的数字把这点藏起来了;分组检查就能看出来。

怎样解决偏见?

增加缺失那一组的例子。在自由练习中,提高B组的比例,看它的准确率柱子升高。

什么是AI?

人工智能(AI)是指计算机完成需要人类思考才能做的任务:看、听、理解语言或做决定。今天大多数AI靠从数据中学习来工作,而不只是照着固定的指令做。

AI、机器学习和深度学习

三大领域

并不是所有自动的东西都是AI:洗衣机的定时器按固定步骤运行,不会学习。

AI项目流程的六个阶段

  1. 问题界定:弄清楚问题。填一张4W问题画布:Who(相关的人)、What(问题是什么、有什么证据)、Where(发生的场景)、Why(解决后的好处)。最后写一句问题陈述。
  2. 数据获取:收集相关、可靠、允许使用的数据。来源:问卷、传感器、摄像头、观察、网络爬取、开放数据集(API)。数据有特征(输入,如大小、颜色)和标签(答案,如苹果)。
  3. 数据探索:清理数据(修正缺失、错误或重复的值),并用图表呈现,找出规律。
  4. 建模:选择方法。基于规则:由人写规则。基于学习:机器从数据中学出规则(例如用带标签数据的监督学习,或自己找分组的无监督学习)。
  5. 评估:用模型从没见过的数据来测试。计算准确率,并查看它的错误。
  6. 部署:把模型放进真实的应用或设备,观察它的表现并不断改进。然后循环再开始。

评估模型:用简单的数字看准确率

准确率 = 预测正确的个数 ÷ 预测的总个数 × 100%。

如果一个水果模型看了200个新水果,答对180个,准确率 = 180 ÷ 200 × 100 = 90%。我们要留一部分数据当测试数据,因为模型可能只是“背下”了训练数据;用新数据测试才能看出它是不是真的学会了。

只看准确率可能会掩盖问题:模型整体可能有95%是对的,但对某一群人却差得多。所以我们还要按组分别检查结果。

AI中的伦理与偏见

AI伦理是指保证AI的使用对人公平又安全。

解决办法:数据均衡并经过检查,对每一组人都做测试,重要的决定由人来复核。

重点公式和概念

例题讲解

1. 为总是忘记在学校喝水的学生写一个4W问题陈述。

Who(谁):12–15岁的学生。What(什么):他们喝水太少,觉得很累。Where(哪里):在教室里长时间上课的时候。Why(为什么):提醒可以改善健康和专注力。陈述:“我们的学生(谁)喝水太少(什么),尤其是在长时间上课时(哪里);一个智能提醒能让他们保持健康和精神(为什么)。”

2. 一个植物病害模型用250张新叶片照片测试,答对215张。求准确率。

准确率 = 215 ÷ 250 × 100 = 86%。

3. 一个贷款审批模型只用了城市申请人的数据来训练。可能出现什么问题?怎样解决?

它可能不公平地拒绝农村申请人,因为它从没学过他们的规律(偏见)。解决办法:也收集农村的均衡数据,分别测试每一组的准确率,并让人来复核被拒绝的申请。

常见错误

练习测验

1. AI项目流程的第一个阶段是哪一个?
2. 4W画布问的是Who、What、Where,还有:
3. 清理数据并画图属于:
4. 一个模型在50个测试例子中答对45个。它的准确率是:
5. AI偏见通常来自:

练习:自己动手回答

输入或选择你的答案,然后点“检查”。卡住了就看提示;回答后会显示完整解答。

常见问题

AI项目流程的6个阶段是什么?

问题界定、数据获取、数据探索、建模、评估和部署。

什么是4W问题画布?

这是问题界定的工具,问谁遇到了问题(Who)、问题是什么(What)、在哪里发生(Where)、为什么值得解决(Why)。

AI里的偏见是什么?

偏见是指AI对某些人给出不公平或不够准确的结果,通常是因为训练数据没有很好地代表他们。

哪里会学到

CBSE (India)Class 9Part B: AI Reflection, Project Cycle and Ethics

先学这些

接着学