AI時短ラボ
検索

機械学習とは──国の資料の定義、AI・ディープラーニングとの関係、教師あり・教師なし・強化学習の3つの型、学習と推論の違い、手元のMacで動かした小さな例

執筆:約24分で読めます

機械学習は、総務省の令和元年版情報通信白書が「入力されたデータからコンピューターがパターンやルールを発見し、そのパターンやルールを新たなデータに当てはめる」手法と説明する言葉。この記事は、白書、AI事業者ガイドライン(第1.2版)、文部科学省が認定制度で示すモデルカリキュラム、Arthur Samuelの1959年の論文の原文をもとに、定義、AI・ディープラーニングとの関係、3つの学習の型、学習と推論の違いを整理し、筆者がMacでscikit-learnを使い30点のデータ(うち24点で学習)で直線を当てはめた実行結果を載せる。

機械学習とは──国の資料の定義、AI・ディープラーニングとの関係、教師あり・教師なし・強化学習の3つの型、学習と推論の違い、手元のMacで動かした小さな例
目次

2026年10月2日・日本時間時点の情報です。 機械学習は、総務省の令和元年版情報通信白書が「入力されたデータからコンピューターがパターンやルールを発見し、そのパターンやルールを新たなデータに当てはめる」手法と説明する言葉だ。この記事は、その白書とAI事業者ガイドライン(第1.2版)、文部科学省が認定制度で示すモデルカリキュラム、Arthur Samuelの1959年の論文の原文だけを材料に、機械学習とは何か、AIやディープラーニングとどういう関係か、どんな型があるか、「学習」と「推論」は何が違うかを順に答える。筆者が自分のMacで小さな機械学習を動かした記録も入れた。「AIの基礎講座」の第5回(第2章「AIが学ぶ仕組み」の最初の回)で、前の回は生成AIとは、次の回はニューラルネットワークとはにあたる。

3行まとめ

  1. 機械学習は、データからコンピューターがパターンやルールを見つけ、新しいデータに当てはめる手法。 白書(令和元年版)はこれを「AIの手法の一つ」と位置づけ、ディープラーニング(深層学習)は「機械学習の手法の一つ」と書く。
  2. 型は大きく3つ:教師あり学習・教師なし学習・強化学習。 AI事業者ガイドライン(第1.2版)は「学習」の定義の中でこの3つを挙げ、「推論」は「学習済みモデルに未知のデータを与え、出力(予測・分類・生成など)を得るプロセス」と別に定義する。
  3. 筆者がscikit-learn 1.9.0で、y=3+7xにノイズを足した30点のうち24点を学習させると、傾き7.062・切片3.584を得た。 学習に使わなかった6点の平均絶対誤差は2.124だった。

機械学習とは何か──白書とガイドラインの定義

総務省の令和元年版情報通信白書は、機械学習を次のように説明している。

機械学習(マシーンラーニング、ML)とは、人間の学習に相当する仕組みをコンピューター等で実現するものであり、一定の計算方法(アルゴリズム)に基づき、入力されたデータからコンピューターがパターンやルールを発見し、そのパターンやルールを新たなデータに当てはめることで、その新たなデータに関する識別や予測等を可能とする手法である。

白書が挙げる例は、大量のニンジンとジャガイモの写真をコンピューターに入力すると、コンピューターが両者を区別するパターンやルールを発見し、その後はニンジンの写真を入れれば「それはニンジンである」という回答を出せるようになる、というものだ。人間が「この形ならニンジン」と書き込むのではなく、写真の山から区別の仕方をコンピューターが見つける、という点が要になる。

2026年3月31日に公表された「AI事業者ガイドライン(第1.2版)」の本編は、「関連する用語」の中で「AIモデル(ML モデル)」を次のように定義する。

AI システムに含まれ、学習データを用いた機械学習によって得られるモデルで、入力データに応じた予測結果を生成する。

同じ項目の参考として、JIS X 22989:2023(ISO/IEC 22989:2022にもとづく)の定義が引かれている。「入力データ又は情報にもとづいて推論(inference)又は予測を生成する数学的構造」で、例として次の一文がある。

単変量線形関数 y=θ0+θ1x が、線形回帰を使用して訓練されている場合、結果のモデルは、y=3+7x のようになる

つまり公的な資料の言い方では、機械学習はデータから規則を取り出す手順で、その結果として手に入る規則が「モデル」だ。後半の筆者の実験は、このガイドラインの例(y=3+7x)に合わせて組んだ。

「機械学習」という言葉の原典はどこまでたどれるか

原典の一つとして、Arthur L. Samuelが1959年にIBM Journalに発表した論文「Some Studies in Machine Learning Using the Game of Checkers」を取り上げる。筆者は10月2日11時33分に、バージニア大学の授業ページに置かれたこの論文のPDF(20ページ・スキャン。1ページ目の下に「Originally published in IBM Journal, Vol. 3, No. 3, July, 1959.」とある再録版)を取得し、テキストにして要旨と冒頭を読んだ。要旨(Abstract)は、チェッカーの対戦プログラムについて次のように書く。

it can learn to do this in a remarkably short period of time (8 or 10 hours of machine-playing time) when given only the rules of the game, a sense of direction, and a redundant and incomplete list of parameters which are thought to have something to do with the game, but whose correct signs and relative weights are unknown and unspecified.

(訳)それは、ゲームのルールと、進むべき方向の感覚と、ゲームに関係がありそうだが正しい符号や相対的な重みが分かっていない、冗長で不完全なパラメータの一覧だけを与えられれば、驚くほど短い時間(機械の対戦時間で8〜10時間)でそれを学べる。

最初の「それ」はプログラムを組まれたコンピューターを、後の「それ」は、要旨の2文目(この引用の直前の文)にある、プログラムを書いた本人よりも上手にチェッカーを指せるようになること、を指す。なお、機械学習の定義としてしばしば引用される「明示的にプログラムされることなく学習する」という趣旨の文句は、この論文のスキャンから作ったテキストを “explicitly” で検索しても見つからなかった(スキャンの文字認識に誤りが多いため、見落としの可能性は残る)。したがって、この記事ではその文句をSamuelの言葉としては扱わない。

AI・機械学習・ディープラーニングはどういう関係か

白書は、この3語の関係を図(図表1-3-2-1「AI・機械学習・深層学習の関係」。人工知能の円の中に機械学習の円、その中に深層学習の円を描いた入れ子の図)で示したうえで、文章で次のように説明している。

  • 「AI」には確立した定義がない。白書は「人間の思考プロセスと同じような形で動作するプログラム、あるいは人間が知的と感じる情報処理・技術といった広い概念」と書く。
  • 機械学習については「AIブームの中で、機械学習がAIとほぼ同義で使われている場面が多いが、あくまでもいわゆるAIの手法の一つとして位置付けられるものである」と書く。機械学習以外のAIの例として、脚注にエキスパートシステムを挙げている。
  • 深層学習(ディープラーニング)は「機械学習の手法の一つ」で、「多数の層から成るニューラルネットワークを用いて行う機械学習のこと」と書く。

AI事業者ガイドラインも同じ向きの書き方で、「AI」を「AI システム」自体、または「機械学習をするソフトウェア若しくはプログラム」を含む抽象的な概念としている。

言葉 資料の言い方 出どころ
AI 確立した定義はない。広い概念 白書(令和元年版)。ガイドラインも「現時点で確立された定義はなく」と書く
機械学習 AIの手法の一つ。データからパターンやルールを発見する 白書(令和元年版)
深層学習 機械学習の手法の一つ。多層のニューラルネットワークを使う 白書(令和元年版)

包含関係をまとめると、白書の図表1-3-2-1のとおり、AIの中に機械学習があり、機械学習の中に深層学習がある。深層学習の中身はニューラルネットワークとはで、AIという言葉の定義はAI(人工知能)とはで、AIという言葉自体の歴史はAIの歴史(1950年〜2026年)で、いまのAIがどこまで来たかは数学オリンピックの1年で見るAIの到達点で扱っている。文章を生成するLLMも、ガイドラインの「AIモデル」の定義(学習データを用いた機械学習によって得られるモデル)に沿えば、この枠の中に入る、というのが筆者の整理だ(LLMはLLMとはで解説する)。

3つの型:教師あり学習・教師なし学習・強化学習とは何か

白書は、機械学習の学習法を教師あり学習・教師なし学習・強化学習に大別できると書く。AI事業者ガイドラインも「学習」の定義に「教師あり学習、教師なし学習、強化学習などの手法が含まれる」と書いている。白書(本文と図表)とモデルカリキュラムの記述から、筆者が各型を表にまとめた。表の説明文は資料の記述を筆者が短くまとめたもので、資料の文をそのまま引いたものではない。

型 データの与え方 公的資料に載っている例
教師あり学習 正解のラベルを付けたデータで学ぶ(白書の図表1-3-2-5)。白書は、ラベルを付ける作業(アノテーション)が必要で、その分データ活用の難易度が高くなると書く 「分類」による文字や画像の認識、「回帰」による売上の予測(白書の図表1-3-2-5)。売上予測・罹患予測・成約予測・離反予測(モデルカリキュラム)
教師なし学習 正解のラベルを付けないデータで学ぶ。「ネコである」と教えなくても、ネコとそれ以外を区別できる(白書) 顧客のグループ化(クラスタリング)(白書)。顧客セグメンテーション・店舗クラスタリング(モデルカリキュラム)
強化学習 コンピューターが環境の中で試行錯誤し、行動に報酬を与えることを繰り返して、長期的に良い行動を学ぶ(白書) 二足歩行ロボットが長い距離を歩けたら報酬を与え、倒れずに歩けるようにする(白書)

白書には続きがあり、これらの学習法は深層学習と組み合わせられる、と書く。強化学習と深層学習を組み合わせたものが深層強化学習で、白書はAlphaGoとその後継プログラムなどに使われていると説明する。教師あり学習と教師なし学習を組み合わせた「半教師あり学習」も利用されてきている、という記述もある。

注意が1点ある。白書の本文には、教師あり学習を説明する独立した段落が無い(型ごとに説明した本文の段落は教師なし学習と強化学習のものだけで、教師あり学習はアノテーションの説明の中に「後述の」として出てくるだけだ)。教師あり学習の説明は、画像で載っている図表1-3-2-5「機械学習の種類」の箇条書き「正解のラベルを付けた学習用データにより学習」「『分類』による文字や画像の認識、『回帰』による売上の予測等に利用」に限られる。上の表の教師あり学習の行は、この図表とアノテーションの記述、モデルカリキュラムの「予測」の例からまとめたもので、白書の本文の定義文の引用ではない。

「学習」と「推論」は何が違うのか

AI事業者ガイドライン(第1.2版)は、この2語を別々に定義している。

学習とは、データを用いて AI モデルのパラメータを決定または改善するプロセスである。

推論とは、学習済みモデルに未知のデータを与え、出力(予測・分類・生成など)を得るプロセスを指す。

白書も、機械学習には大別して「学習」と「推論」の2つのプロセスがあり、基本的にそれぞれで異なるデータを使うと書く。学習は「入力されたデータを分析することにより、コンピューターが識別等を行うためのパターンを確立するプロセス」で、確立されたパターンを「学習済みモデル」と呼ぶ。推論は、学習済みモデルにデータを入力して、実際にそのデータの識別等を行うプロセスだ。前者のデータを「学習用データ」、後者を「推論用データ」と呼ぶ。ただし白書は「推論用データを使って推論を行うことが、追加的な学習となって学習済みモデルが改善するケースもある」とも書いていて、2つの境目が常に固定されているとは言っていない。

ガイドラインはさらに、学習で使うデータを、モデルの構築・評価に使う「訓練データ」「検証データ」「テストデータ」に分けると書く。ガイドラインは推論で使うデータとして、ユーザーが入力するプロンプトやセンサから取得したデータを挙げている。筆者の整理では、チャット型のAIサービスで質問を入れて答えが返る場面は、この区分の推論にあたる。入力の単位はトークンとはにまとめた。

このMacで機械学習を動かすと何が起きたか

資料の説明を読むだけでは「規則を見つける」ことが実感しにくいので、筆者は10月2日11時36分に、手元のMac(Python 3.14.7・numpy 2.4.6・scikit-learn 1.9.0)で、ごく小さな教師あり学習と教師なし学習を実行した。使ったのは自作のデータで、公開データセットではない。前節のガイドラインの例(y=3+7x)に合わせ、xを0〜10の乱数で30個作り、y=3+7xに平均0・標準偏差2の乱数を足した値を「正解」とした。乱数の種は固定している。核になるコードは次のとおりで、出力は下の表に写した。

from sklearn.linear_model import LinearRegression
m = LinearRegression().fit(Xtr, ytr)   # 学習:24点から切片と傾きを決める
m.predict(Xte)                          # 推論:学習に使っていない点の値を出す

手順は、30点のうち24点を学習用、6点をテスト用に分け、24点だけで直線を当てはめる(scikit-learnのLinearRegression)、というものだ。出力は次のとおりだった。

項目 結果
学習用 / テスト用 24点 / 6点
学習結果(切片・傾き) 切片3.584、傾き7.062(データを作った規則は切片3・傾き7)
テスト用6点の平均絶対誤差 2.124
例:x=8.16 実際57.60、予測61.21
例:x=9.97 実際73.65、予測73.99
学習に使った範囲(0〜10)の外のx=12.5 予測91.85(3+7×12.5=90.5)

ここで起きたことを、前節の言葉に当てはめる。24点のデータから切片と傾きを決めたのが「学習」で、得られた「切片3.584・傾き7.062」が学習済みモデル、学習に使っていない6点やx=12.5の値を出したのが「推論」だ。この直線は人が引いたものではなく、24点との誤差が小さくなる値をコンピューターが計算で選んだ結果なので、データを作った「3と7」には届かず、ノイズの分だけずれた。これが、機械学習の結果は「正解の規則」ではなく「データから推定した規則」である、という点の小さな実例になる。

x=12.5の予測が規則どおりの値(90.5)に近かったのは、筆者がデータ全体を直線に従う形で作ったからで、一般にそうなるとは言えない。学習した範囲の外の入力に対して、モデルがどう振る舞うかはデータの性質しだいだ。

教師なし学習の方は、x・yの2つの値を持つ点を、ラベルなしで30個用意して分けさせた。(2,2)付近に15点、(7,7)付近に15点を乱数で作り、scikit-learnのKMeans(クラスタ数は2と指定)に渡したところ、中心は約(2.18, 2.03)と(6.96, 7.04)になり、前半15点と後半15点は一つの取りこぼしもなく別々のグループに入った。KMeansに与えたのは「2つに分けて」という指定だけで、どの点がどちらの塊かという正解は渡していない。出てきた番号(0と1)に意味はなく、どちらを何と呼ぶかは人が決める。この点が、教師あり学習との違いだ。

強化学習は、今回は実行していない。報酬を与える環境を用意する必要があり、30点の表データで示せる範囲を超えると筆者が判断した。

機械学習はどんなところで使われているのか

公的な資料に載っている使い道を、出どころ別に並べる。いずれも「こういう用途が教材や資料で例示されている」という範囲の話で、日本全体での導入件数や割合を示すものではない。

  • 総務省の白書:画像の識別(ニンジンとジャガイモ)、顧客のグルーピング、ロボットの歩行学習、囲碁のAlphaGo。
  • 文部科学省の認定制度が示すモデルカリキュラム(リテラシーレベル):「教育、芸術、流通、製造、金融、サービス、インフラ、公共、ヘルスケア等におけるデータ・AI利活用事例紹介」を学ぶ項目があり、「AI等を活用した新しいビジネスモデル」の例として商品のレコメンデーションが挙がっている。教師あり学習の演習例は、売上予測・罹患予測・成約予測・離反予測、教師なし学習の演習例は、顧客セグメンテーション・店舗クラスタリングだ。
  • Samuelの論文:1959年の時点で、チェッカーを指すプログラムが対戦を重ねて強くなった実験。

2026年の生成AI(文章・画像を作るAI)も、AI事業者ガイドラインの定義では「文章、画像、プログラム等を生成できる AI モデルにもとづく AI の総称」で、そのモデルは学習データから作られる。生成AIの種類は生成AIとはに分けた。

機械学習を学ぶには何から始めればよいか

文部科学省は、数理・データサイエンス・AI教育プログラム認定制度(大学・短大・高専の教育プログラムを大臣が認定・選定する制度)の内容を、数理・データサイエンス・AI教育強化拠点コンソーシアムの「モデルカリキュラム」に沿って定めている。リテラシーレベルのモデルカリキュラム(2024年2月22日改訂)は、「オプション」の項目として、教師あり学習と教師なし学習の違いを理解することを学修目標に挙げ、「データ活用実践(教師あり学習)」「データ活用実践(教師なし学習)」の項目のキーワードとして、単回帰分析・重回帰分析・ロジスティック回帰分析、階層クラスタリング・非階層クラスタリングなどを並べている。公開されているので、大学に通っていなくても、学習項目の地図として読める。

資格から入るなら、次のサイト内記事に日程や受験料をまとめている。

手を動かすなら、前節のように、Pythonとscikit-learnで数十点の表データに直線を当てはめるところが最初の一歩になる。モデルカリキュラムの「プログラミング(Python、R等)」の項目とも重なる。

白書が2019年版であることと、引用できなかった定義・原典

白書は2019年版である。 機械学習の定義と3つの型の説明は、令和元年版(2019年)の情報通信白書の文章だ。筆者は、これより新しい版の白書で同じ内容を説明したページを確認していない(今回は探していない)。2019年以降の技術(生成AIなど)の位置づけは、白書ではなくAI事業者ガイドライン(第1.2版・2026年3月31日)で補った。

「教師あり学習」を独立して定義した文は、本記事が確認した国の資料には無かった。 前に書いたとおり、白書は本文の段落では説明しておらず、図表1-3-2-5(画像)の箇条書きが唯一の説明だ。ガイドラインは「学習」の定義の中で3つの名前を挙げるだけで、モデルカリキュラムも「教師あり学習による予測」という項目と例を並べるだけだった。教科書の定義はこの記事では引用していない。

Tom Mitchellによる機械学習の定義は引用していない。 筆者が試したURLでは原文を取得できなかった(返ってきたのは「404 Not Found」のページだった)。原文を手元で読めていないので、記憶からは書かない。

Samuelの論文は文字認識の誤りを含む。 取得したのはスキャンPDFで、テキストにしたときに字が崩れた箇所が多い。この記事で引用したのは、崩れの少ない要旨の1文だけだ。論文の本体は要旨と冒頭しか読んでいないので、論文の内容全体についての評価は書いていない。

機械学習の説明に使った白書・ガイドライン・カリキュラム・Samuel論文

2026年10月2日11時32分から11時43分にかけて、以下を取得して読んだ(白書の図表の画像は11時43分に取得)。

  • 総務省「令和元年版 情報通信白書|AIに関する基本的な仕組み」(機械学習の定義、AI・機械学習・深層学習の関係、学習と推論、3つの学習法。図表1-3-2-1「AI・機械学習・深層学習の関係」と図表1-3-2-5「機械学習の種類」の画像を含む)
  • 総務省・経済産業省「AI事業者ガイドライン(第1.2版)」本編(令和8年3月31日・「関連する用語」のAI、AIモデル、学習、推論、生成AI)
  • 文部科学省「数理・データサイエンス・AI教育プログラム認定制度」と、数理・データサイエンス・AI教育強化拠点コンソーシアムの「数理・データサイエンス・AI(リテラシーレベル)モデルカリキュラム データ思考の涵養」(2024年2月22日改訂・クリーン版)
  • Arthur L. Samuel, “Some Studies in Machine Learning Using the Game of Checkers”(IBM Journal, 1959)

実験は自作の30点のデータで、実務のデータでの性能を示すものではない。

シェア: ポスト はてブ

出典・参照資料

AI時短ラボ

大きいニュースはYouTubeでも解説しています。Xでは新着記事をお知らせしています。

コメント

まだコメントはありません。最初のコメントを書いてみませんか?

AIについて聞きたいことはありますか?

質問箱で無料で受け付けています。回答は公開され、他の方の参考にもなります。

質問箱を見る →

関連記事

AIの到達点はどこまで来たか──国際数学オリンピックの1年で見る進化速度の記事画像動画

AIの到達点はどこまで来たか 国際数学オリンピックの1年で見る進化速度

活用
AIは二度、資金を断たれてきた──76年の歴史を、繰り返された「冬」から読むの記事画像動画

AIは二度、資金を断たれてきた 76年の歴史を、繰り返された「冬」から読む

研究
ニューラルネットワークとは何か──仕組みの基礎とAIモデル記事への入口の記事画像

ニューラルネットワークとは何か 仕組みの基礎とAIモデル記事への入口

研究
トークンとは何か──LLMの料金とコンテキストを決める最小単位の記事画像

トークンとは何か LLMの料金とコンテキストを決める最小単位

研究
AI資格まとめ【2026年9月版】──生成AIパスポート・G検定・E資格・PEP検定の受験料・形式・日程を公式で並べる。終了したJDLA Generative AI Test、「AI資格」で検索して出てくる民間資格の見分け方、非エンジニアが取る意味の記事画像

AI資格まとめ【2026年9月版】 生成AIパスポート・G検定・E資格・PEP検定の受験料・形式・日程を公式で並べる。終了したJDLA Generative AI Test、「AI資格」で検索して出てくる民間資格の見分け方、非エンジニアが取る意味

研究
AI事業者ガイドライン(第1.2版)とは──総務省・経産省が2026年3月31日に公表。誰が対象で(AI開発者・提供者・利用者)、10の「共通の指針」は何か、法的拘束力はあるのか、第1.2版で加わった「AIエージェント」「フィジカルAI」の定義と留意事項、活用の手引き・チャットボット・チェックリストの使い方の記事画像

AI事業者ガイドライン(第1.2版)とは 総務省・経産省が2026年3月31日に公表。誰が対象で(AI開発者・提供者・利用者)、10の「共通の指針」は何か、法的拘束力はあるのか、第1.2版で加わった「AIエージェント」「フィジカルAI」の定義と留意事項、活用の手引き・チャットボット・チェックリストの使い方

業界
AI(人工知能)とは──国のガイドラインと情報通信白書は何と定義しているか、定義が一つに決まらない理由、弱いAI・強いAI・汎用AIの違い、いまのAIにできること・できないことの記事画像

AI(人工知能)とは 国のガイドラインと情報通信白書は何と定義しているか、定義が一つに決まらない理由、弱いAI・強いAI・汎用AIの違い、いまのAIにできること・できないこと

活用
AIで思考力は落ちるのか──MIT・Microsoft・Whartonの研究を一次資料で確認したの記事画像動画

AIで思考力は落ちるのか MIT・Microsoft・Whartonの研究を一次資料で確認した

研究