什么是AI?
人工智能(AI)是指计算机完成需要人类思考才能做的任务:看、听、理解语言或做决定。今天大多数AI靠从数据中学习来工作,而不只是照着固定的指令做。
AI、机器学习和深度学习
- AI是最大的概念:机器表现得很聪明。
- 机器学习(ML)是AI的一部分,机器在数据中找规律。
- 深度学习是机器学习的一部分,使用很大的神经网络,例如识别人脸。
三大领域
- 数据科学:数字和表格(预测价格)。
- 计算机视觉:图片和视频(人脸解锁)。
- 自然语言处理(NLP):文字和语音(语音助手、翻译)。
并不是所有自动的东西都是AI:洗衣机的定时器按固定步骤运行,不会学习。
AI项目流程的六个阶段
- 问题界定:弄清楚问题。填一张4W问题画布:Who(相关的人)、What(问题是什么、有什么证据)、Where(发生的场景)、Why(解决后的好处)。最后写一句问题陈述。
- 数据获取:收集相关、可靠、允许使用的数据。来源:问卷、传感器、摄像头、观察、网络爬取、开放数据集(API)。数据有特征(输入,如大小、颜色)和标签(答案,如苹果)。
- 数据探索:清理数据(修正缺失、错误或重复的值),并用图表呈现,找出规律。
- 建模:选择方法。基于规则:由人写规则。基于学习:机器从数据中学出规则(例如用带标签数据的监督学习,或自己找分组的无监督学习)。
- 评估:用模型从没见过的数据来测试。计算准确率,并查看它的错误。
- 部署:把模型放进真实的应用或设备,观察它的表现并不断改进。然后循环再开始。
评估模型:用简单的数字看准确率
准确率 = 预测正确的个数 ÷ 预测的总个数 × 100%。
如果一个水果模型看了200个新水果,答对180个,准确率 = 180 ÷ 200 × 100 = 90%。我们要留一部分数据当测试数据,因为模型可能只是“背下”了训练数据;用新数据测试才能看出它是不是真的学会了。
只看准确率可能会掩盖问题:模型整体可能有95%是对的,但对某一群人却差得多。所以我们还要按组分别检查结果。
AI中的伦理与偏见
AI伦理是指保证AI的使用对人公平又安全。
- 偏见:模型对某些人不公平,通常是因为训练数据里的例子太少或太片面。例如:人脸解锁系统如果主要用一种肤色来训练,对其他肤色就更容易失败。
- 隐私:只收集需要的数据,要经过同意,并妥善保管。
- 透明:人们应该知道什么时候是AI在做决定,以及为什么。
- 责任:AI做的事,最终仍由人来负责。
- 工作与使用机会:AI应该帮助人,而且每个人都应该能用上它。
解决办法:数据均衡并经过检查,对每一组人都做测试,重要的决定由人来复核。
重点公式和概念
- 准确率 (%) = 预测正确的个数 ÷ 预测的总个数 × 100
- AI项目流程:问题界定 → 数据获取 → 数据探索 → 建模 → 评估 → 部署
- 4W画布:Who、What、Where、Why
- 特征:数据的输入属性。标签:一个例子的正确答案。
- 训练数据用来教模型;测试数据用来检查模型。
- 偏见:对某一组人的结果不公平,常常是数据不均衡造成的。
例题讲解
1. 为总是忘记在学校喝水的学生写一个4W问题陈述。
Who(谁):12–15岁的学生。What(什么):他们喝水太少,觉得很累。Where(哪里):在教室里长时间上课的时候。Why(为什么):提醒可以改善健康和专注力。陈述:“我们的学生(谁)喝水太少(什么),尤其是在长时间上课时(哪里);一个智能提醒能让他们保持健康和精神(为什么)。”
2. 一个植物病害模型用250张新叶片照片测试,答对215张。求准确率。
准确率 = 215 ÷ 250 × 100 = 86%。
3. 一个贷款审批模型只用了城市申请人的数据来训练。可能出现什么问题?怎样解决?
它可能不公平地拒绝农村申请人,因为它从没学过他们的规律(偏见)。解决办法:也收集农村的均衡数据,分别测试每一组的准确率,并让人来复核被拒绝的申请。
常见错误
- 没有界定问题就直接建模。没有清楚的问题陈述,收集来的数据可能一点用也没有。
- 用训练过的同一批数据来测试模型。这只是检查记忆,不是检查学习。
- 以为数据越多越好。错了,错误、有偏见或涉及隐私的数据会让模型更差,或者不符合伦理。
- 把所有自动的机器都叫作“AI”。只有会从数据中学习或推理,才算AI。