AIとは?
人工知能(AI)とは、見る・聞く・言葉を理解する・決めるなど、人間のような考えが必要な仕事をコンピューターにさせることです。今のAIの多くは、決まった命令だけに従うのではなく、データから学ぶことで動きます。
AI、機械学習、深層学習
- AIは大きな考え方です。機械がかしこく動くこと。
- 機械学習(ML)はAIの一部で、機械がデータの中からパターンを見つけます。
- 深層学習(ディープラーニング)は機械学習の一部で、大きなニューラルネットワークを使います。たとえば顔の認識です。
3つの主な分野
- データサイエンス:数や表を扱う(価格の予測)。
- コンピュータビジョン:画像や動画を扱う(顔認証)。
- 自然言語処理(NLP):文章や音声を扱う(音声アシスタント、翻訳)。
自動で動くものがすべてAIとは限りません。洗濯機のタイマーは決まった手順で動くだけで、学びません。
AIプロジェクトの6つの段階
- 課題設定:問題を理解します。4Wの課題キャンバスを書きます。だれが(関係する人)、なにを(問題とその証拠)、どこで(場面や状況)、なぜ(解決する利点)。最後に一文の課題文にまとめます。
- データ収集:関係があり、信頼でき、使ってよいデータを集めます。集め方:アンケート、センサー、カメラ、観察、ウェブスクレイピング、公開データセット(API)。データには特徴(入力。例:大きさ、色)とラベル(答え。例:リンゴ)があります。
- データ探索:データを整え(空いている値、まちがい、重複を直す)、グラフにしてパターンを見つけます。
- モデル作り:方法を選びます。ルールベースは人がルールを書く方法。学習ベースは機械がデータからルールを学ぶ方法です(たとえば、ラベル付きデータを使う教師あり学習や、グループを見つける教師なし学習)。
- 評価:モデルがまだ見たことのないデータで試します。正解率を測り、まちがいも調べます。
- 運用:モデルを実際のアプリや機器に入れ、動きを見守り、改善を続けます。そしてまた最初からくり返します。
モデルの評価:簡単な数字で見る正解率
正解率 = 当たった予測の数 ÷ 予測の総数 × 100%。
果物モデルが新しい果物200個を見て180個を当てたら、正解率は 180 ÷ 200 × 100 = 90% です。データの一部をテスト用データとして取っておくのは、モデルが練習用データをただ「暗記」してしまうことがあるからです。新しいデータで試せば、本当に学んだかどうかがわかります。
正解率だけでは問題が隠れることがあります。全体では95%当たっていても、あるグループの人たちにはずっと成績が悪いかもしれません。だからグループごとの結果も調べます。
AIの倫理とバイアス
AI倫理とは、AIが人にとって公平で安全な形で使われるようにすることです。
- バイアス(かたより):モデルが一部の人を不公平にあつかうことです。多くは、練習用データの例が少ない、または一方にかたよっていることが原因です。例:ひとつの肌の色を中心に学んだ顔認証は、ほかの人でまちがいやすくなります。
- プライバシー:必要なデータだけを、許可をもらって集め、安全に守ります。
- 透明性:AIが決めているとき、そのことと理由を人が知れるようにします。
- 責任:AIがしたことには、人間が責任を持ちます。
- 仕事と利用しやすさ:AIは人を助けるもので、だれでも使えるようにします。
対策:つり合いのとれた、確認ずみのデータ。すべてのグループでのテスト。大切な決定は人が見直すこと。
重要な公式と用語
- 正解率(%)= 当たった予測の数 ÷ 予測の総数 × 100
- AIプロジェクトサイクル:課題設定 → データ収集 → データ探索 → モデル作り → 評価 → 運用
- 4Wキャンバス:Who(だれが)、What(なにを)、Where(どこで)、Why(なぜ)
- 特徴:データの入力となる性質。ラベル:その例の正しい答え。
- 練習用データはモデルを育て、テスト用データはモデルを確かめる。
- バイアス:あるグループに不公平な結果が出ること。多くはデータのかたよりが原因。
例題
1. 学校で水を飲み忘れる生徒のために、4Wで課題文を書きましょう。
だれが:12〜15歳の生徒。なにが:水をあまり飲まず、つかれる。どこで:長い授業時間の教室。なぜ:お知らせがあれば健康と集中力がよくなる。課題文:「生徒たち(だれが)は長い授業時間(どこで)に水をあまり飲まない(なにが)。かしこいお知らせがあれば、元気で集中していられる(なぜ)。」
2. 植物の病気を見つけるモデルを、新しい葉の写真250枚で試したところ、215枚が正解でした。正解率を求めましょう。
正解率 = 215 ÷ 250 × 100 = 86%。
3. ローンの審査モデルを、都市に住む申込者のデータだけで学ばせました。どんな問題が起こり、どう直せばよいですか。
村の申込者のパターンを学んでいないので、不公平に断ってしまうかもしれません(バイアス)。対策:村のデータもふくめてつり合いをとり、グループごとに正解率をテストし、断った場合は人が見直す。
よくある間違い
- 課題設定をせずに、いきなりモデル作りに進むこと。課題文がはっきりしないと、集めたデータが役に立たないことがあります。
- 学ばせたのと同じデータでモデルをテストすること。それでは暗記を調べるだけで、学んだかどうかはわかりません。
- データは多いほどよいと思うこと。まちがったデータ、かたよったデータ、個人的なデータは、モデルを悪くしたり非倫理的にしたりします。
- 自動で動く機械をすべて「AI」と呼ぶこと。データから学んだり考えたりするものだけがAIです。