ニューラルネットワークとは何か仕組みの基礎とAIモデル記事への入口
IBMの公式解説は、ニューラルネットワークを「単純な『ニューロン』を層状に重ね、データから重みとバイアスを学習して入力を出力へ写像する機械学習モデル」と定義し、1943年のウォーレン・マカロックとウォルター・ピッツによるニューロンの数理モデル、1958年のフランク・ローゼンブラットによる「パーセプトロン」を紹介し、パーセプトロンを今日のネットワークの「歴史上の祖先」と位置づけている。学習の4段階(順伝播・誤差計算・逆伝播・重みの更新)とCNN・RNN・Transformerの違いを、IBMの解説と、Nature誌のレビュー論文「Deep learning」(2015年)のアブストラクトと図の説明文から整理した。

目次
IBMの公式解説によれば、ニューラルネットワークとは、入力データを「重み」と「バイアス」というパラメータを使って層ごとに変換し、出力へ写像する機械学習モデルである。当サイトにはすでにトークンとは何か、推論モデルとは何か、ローカルLLMとは何かといったLLM関連の解説記事がある。本記事はその手前にあるニューラルネットワークの仕組みを、AIモデルを基礎から知りたい読者のための入口として扱う。材料は、IBM公式の解説記事「What Is a Neural Network?」と、Nature誌に掲載されたレビュー論文「Deep learning」(Yann LeCun・Yoshua Bengio・Geoffrey Hinton、2015年)の2つの一次資料で、Natureについては無料で読めるアブストラクトと図の説明文の範囲に限る。2026年9月25日(日本時間)時点の確認にもとづく。
3行まとめ
- ニューラルネットワークは、単純な処理単位「ニューロン」を層状に重ね、重みとバイアスをデータから学習して入力を出力へ写像する機械学習モデル(IBM公式の定義による)
- IBMは、1943年のマカロックとピッツによるニューロンの数理モデルと、1958年のローゼンブラットによる「パーセプトロン」(今日のネットワークの「歴史上の祖先」)を紹介し、学習は「順伝播→誤差計算→逆伝播→重みの更新」の4段階の繰り返しだと説明している
- Nature誌のレビュー論文「Deep learning」(2015年5月27日、Vol.521、436〜444頁)は本文が購読制だが、購読なしで開ける図1の説明文にも「加重和を求めて非線形関数に通す」という同じ計算が書かれている
確認できた時点表
| 時点 | できごと | 出典 |
|---|---|---|
| 1943年 | ウォーレン・マカロックとウォルター・ピッツが、ニューロンの初の数理モデルを提案したとIBMは記述している | IBM |
| 1958年 | フランク・ローゼンブラットがパターン認識のためのアルゴリズム「パーセプトロン」を発表したとIBMは記述している | IBM |
| 2015年5月27日 | ヤン・ルカン、ヨシュア・ベンジオ、ジェフリー・ヒントンによるレビュー論文「Deep learning」がNature誌Vol.521, pp.436–444に掲載 | Nature |
| 本文表示「2021年10月6日」 | IBM記事の本文には"Published 06 October 2021"と表示されている | IBM |
| 構造化データ上は別の日付 | 同じページのJSON-LD構造化データにはdatePublished "2024-12-02"・dateModified "2026-07-24"と記載されており、本文表示と一致しない | IBM |
ニューラルネットワークとは何か──スパム判定を例にした最小限の仕組み
IBM公式の解説記事は、ニューラルネットワークをこう定義している。
A neural network is a machine learning model that stacks simple "neurons" in layers and learns pattern-recognizing weights and biases from data to map inputs to outputs. (ニューラルネットワークとは、単純な「ニューロン」を層状に積み重ね、データからパターン認識のための重みとバイアスを学習し、入力を出力へ写像する機械学習モデルである)
この定義を、IBMの記事はスパムメール判定という具体例で説明している。メールが入力として与えられると、「prize(賞品)」「money(お金)」「dear(親愛なる)」「win(当選)」といった単語やフレーズが入力の特徴になる。ネットワークの初期のニューロンがそれぞれの信号の重要度を処理し、後段の層がそれらを組み合わせて文脈やトーンをとらえる。最終層がスパムである確率を計算し、その確率が十分高ければ該当メールにフラグを立てる。
この処理を支えるのが「重み(weights)」と「バイアス(biases)」の2つだ。重みは、それぞれの入力特徴が判断にどれだけ強く影響するかを決めるダイヤルのようなもので、「prize」のような単語は「hello」のような一般的な単語より大きな重みを与えられうる。バイアスは判断のしきい値をずらす値で、入力自体が弱くてもニューロンが発火できるようにする。この重みとバイアスを訓練を通じて調整していくことで、ネットワークは徐々に正確な予測ができるようになる、とIBMは説明している。
どうやって学習するか──4段階のループと「誤差逆伝播」
IBMの記事は、1つのニューロンの計算を、入力特徴 x と重み w の加重和にバイアス b を足した z を求め、そこに活性化関数 σ を適用して出力 a を得る、という流れで説明している。活性化関数の例としてIBMが挙げているのは、tanh・シグモイド・ReLUだ。ネットワーク全体は、この計算を層ごとに積み重ねたものになる。
学習(訓練)のループは、IBMの記事では次の4段階として説明されている。
- Forward pass(順伝播): 入力がネットワークを流れ、線形結合の計算と非線形の活性化関数を経て、予測値が出力される
- Error calculation(誤差計算): 損失関数が、予測値と正解との差を測る
- Backward pass(逆伝播、backpropagation): 誤差がネットワークを逆方向にたどって伝播する。各ニューロンで、微分の連鎖律を使って、それぞれの重みとバイアスが誤差にどれだけ寄与したかを計算する
- Weight update(重みの更新): 勾配降下法(gradient descent)などの最適化手法を使って、誤差を減らす方向に重みとバイアスをわずかに調整する
このループを訓練データセットに対して何度も繰り返すことで、ネットワークは徐々に正解へ近づいていく。数百万(あるいは数十億)のパラメータを持つネットワークが、大規模なデータセットから意味のあるパターンを学習できるのは、この逆伝播と勾配降下法の組み合わせによるとIBMは説明している。
Nature誌のレビュー論文「Deep learning」も、図1(Multilayer neural networks and backpropagation)の説明文で、順伝播の計算を次のように書いている。
At each layer, we first compute the total input z to each unit, which is a weighted sum of the outputs of the units in the layer below. Then a non-linear function f(.) is applied to z to get the output of the unit. For simplicity, we have omitted bias terms. (各層では、まず各ユニットへの総入力 z を、下の層のユニットの出力の加重和として求める。次に非線形関数 f(.) を z に適用して、そのユニットの出力を得る。簡単のため、バイアス項は省略した)
IBMの式はバイアス b を含むが、Natureの図1は「簡単のため」バイアス項を省いていると断っている。呼び名(IBMは活性化関数 σ、Natureは非線形関数 f)は違っても、「加重和を求めて非線形関数に通す」という骨格は同じだ。同じ説明文は、非線形関数の例としてReLU(f(z) = max(0, z))を「近年よく使われる(commonly used in recent years)」と書いているが、これは2015年時点の論文の記述である。
一方でIBMは、ニューラルネットワークも他の機械学習モデルと同様の課題を抱えると明記している。もっとも重要なものとして挙げているのが「過学習(overfitting)」で、パラメータが多すぎて過度に複雑になったモデルは訓練データに過剰に適合し、予測がうまくいかなくなる。
CNN・RNN・Transformerは何が違うのか
IBMの記事は、多層パーセプトロンを土台としつつ、用途に応じて発展した代表的な3つのアーキテクチャを挙げている。
- CNN(畳み込みニューラルネットワーク): 画像のような格子状のデータ向けに設計され、空間的な特徴の階層を検出する畳み込みフィルタによって、画像認識・コンピュータビジョン・顔認識に強みを持つ
- RNN(再帰型ニューラルネットワーク): フィードバックループを持ち、時間方向に情報を持ち越せる。音声認識・時系列予測・系列データに向いている
- Transformer: 多くの系列タスクでRNNに取って代わった、より新しいアーキテクチャ。注意機構(attention)を使って自然言語処理における依存関係をとらえ、IBMの表現では「GPTのような最先端(state-of-the-art)モデル」を支えている
CNNとRNNの役割分担は、2015年のNature論文のアブストラクトにも同じ形で書かれている。
Deep convolutional nets have brought about breakthroughs in processing images, video, speech and audio, whereas recurrent nets have shone light on sequential data such as text and speech. (深層畳み込みネットは画像・動画・音声・音響の処理に飛躍をもたらし、一方で再帰型ネットはテキストや音声のような系列データに光を当てた)
IBMは3つの型について、アーキテクチャにかかわらず、人工ニューロン・非線形の活性化関数・最適化アルゴリズムという同じ原理に依存しているとまとめている。さらに、Transformerやエンコーダ・デコーダモデルといった現代のアーキテクチャも、学習された重みとバイアス・層の積み重ね・非線形の活性化関数・逆伝播によるエンドツーエンドの学習という核となる原理は共通で、違いは主に「層をまたいで入力をどう混ぜ合わせるか」にあると説明している。Transformerは、全結合による混合だけに頼らず、注意機構によるデータ依存の重み付け結合を、残差接続・正規化・位置エンコーディングとあわせて使う。
LLMやTransformerの記事を読む前に、ここが土台になる
ここまでの仕組みを押さえておくと、当サイトの他の記事が扱う話題の位置が見えやすくなる。たとえば、AIが生成したデータで再学習を続けるとモデルが現実の分布を見失っていく現象を、Nature論文から確認した「モデル崩壊」の記事は、本記事で説明した「重みとバイアスをデータから学習する」仕組みで、学習に使うデータそのものが変わると何が起きるかを扱っている。また、LLMの入出力の最小単位を扱うトークンとは何か、最終回答の前に内部でトークン列を生成してから応答する仕組みを扱う推論モデルとは何か、クラウドを使わず自分のPCでモデルを動かすローカルLLMとは何か、モデルが事実と異なる内容を出力してしまうLLMのハルシネーションとはは、いずれもLLMを扱う記事で、本記事の内容はその手前の基礎にあたる。用語をまとめて確認したい場合はAI用語集も参照できる。
体系的に学び直したい場合の選択肢としては資格もある。非エンジニアはAI資格を取るべきかでは、JDLAのG検定とE資格の受験条件・費用・合格率を、JDLA公式サイトの記載から整理している。
Natureの論文ページは本文が購読制でも、図5点と説明文は開けた
Natureの記事URLにcurlで単純にアクセスすると、HTTP 303でidp.nature.comの認証用エンドポイントへ転送された。ブラウザ相当のUser-Agentを指定して-L(リダイレクト追跡)付きで取り直すと200が返り、アブストラクト(4文の英語段落)のあとに「This is a preview of subscription content」という表示と、「Access options」「Subscribe to this journal」「Buy this article」といった購読・購入の案内が続いた。ページのJSON-LDメタデータにも"isAccessibleForFree":falseとある。
ただし、同じページには図1〜図5のタイトルと縮小画像が並んでいた。図ごとのページ(たとえば図1のページ)は5点とも購読なしで200が返り、図の説明文を全文読めた。本記事で引用した順伝播の計算は、この図1の説明文からのものだ。本文が有料の論文でも、図の説明文には仕組みの要点が短くまとまっていることがある。
IBMのページには、本文表示の公開日とは別の日付が構造化データ側に入っていた(時点表の下2行)。読者に見える「Published 06 October 2021」だけを見ると2021年の記事に見えるが、同じページのJSON-LDではdateModifiedが2026年7月24日になっている。どちらを記事の時点とみなすべきかは、ページの記載からは決められなかった。
原論文とIBMの更新時点は、今回の確認では追えなかった
- IBM記事が挙げる「1943年」「1958年」という2つの年号は、いずれもIBMの記事を経由した記述であり、ウォーレン・マカロックとウォルター・ピッツ、フランク・ローゼンブラットそれぞれの原論文そのものは本記事の確認範囲では読んでいない
- IBM記事の公開時点は一意に確定できなかった。本文表示は「2021年10月6日」、同じページのJSON-LD構造化データはdatePublished「2024-12-02」・dateModified「2026-07-24」と、3つの異なる日付を示している。本記事では読者に見える本文表示の日付を時点表に載せたが、内容がいつの時点まで更新されているかは、このページの記載だけでは確定できない
- Nature論文「Deep learning」は、本記事の確認範囲ではアブストラクト(4文)と図1〜図5の説明文しか読めていない。アブストラクトには音声認識・視覚的な物体認識・物体検出・創薬・ゲノミクスといった応用領域の名称が挙げられているが、本文の論述は購読が必要なため確認していない。IBMの記事が挙げる応用例(スパム判定、CNN/RNN/Transformerの用途)は、あくまでIBM側の記述にもとづく
- IBM記事にある数式(z = Σwᵢxᵢ + b、a = σ(z))は、テキスト抽出時に添字などの表記が崩れて取得されたため、本記事では意味を変えずに文章で書き直している。原文の数式表記そのものの引用ではない
関連記事
出典・参照資料
大きいニュースはYouTubeでも解説しています。Xでは新着記事をお知らせしています。
コメント
まだコメントはありません。最初のコメントを書いてみませんか?
AIについて聞きたいことはありますか?
質問箱で無料で受け付けています。回答は公開され、他の方の参考にもなります。
質問箱を見る →