LLMとは──大規模言語モデルの意味・仕組み・できること・生成AIとの違い【2026年10月版】。GPT-3の1,750億パラメータから、2.8兆パラメータ(有効104B)を公表するKimi K3、100万トークンの文脈長まで
LLMは Large Language Model の略で、日本語では大規模言語モデル。AI事業者ガイドライン(第1.2版)は生成AIを「文章、画像、プログラム等を生成できるAIモデルにもとづくAIの総称」と定義し、LLMは基盤モデルの代表例として脚注に出てくる。この記事は、原論文(GPT-3は1,750億パラメータ・3,000億トークンで学習、InstructGPTは人間の評価で13億パラメータの出力が175BのGPT-3より好まれた)と、2026年10月2日に開いた各社の公式モデルページから、LLMの定義、仕組み、「大規模」の中身、主なLLMの一覧、弱点を整理する。

目次
2026年10月2日・日本時間時点の情報です。 LLMは Large Language Model の略で、日本語では「大規模言語モデル」と呼ぶ。GPT-3やInstructGPTの原論文の説明に沿って言えば、大量の文章で学習し、次の語(トークン)を予測しながら文章を書くAIモデルのことだ。ChatGPT、Claude、Gemini、Grokといった対話AIの中身にあたる。この記事は、総務省が掲載するAI事業者ガイドライン(第1.2版)、GPT-3などの原論文、各社の公式モデルページだけを材料に、意味・仕組み・生成AIとの違い・主なLLM・弱点を整理する。
3行まとめ
- LLM=大規模言語モデル。 AI事業者ガイドライン(第1.2版)は、LLMを「基盤モデル」の代表例として脚注で挙げ、「生成AI」は「文章、画像、プログラム等を生成できるAIモデルにもとづくAIの総称」と定義し、「大規模言語モデルを始めとする生成AI」とも書く。LLMは生成AIのうち、言語を扱うモデルにあたる。
- 「大規模」はパラメータ数と学習データの量。 GPT-3の論文は1,750億パラメータ、3,000億トークンで学習と書く。2026年のモデルは今回開いた公式ページの多くにパラメータ数が見当たらず、記載があったのはKimi K3(総2.8兆・有効104B)とGLM-5.3-Flash(総320B・有効18B)。文脈長(一度に読める量)はGPT-3の2,048トークンに対し、多くが100万トークン前後だ。
- 弱点は3つ。 もっともらしい誤りを出す(ハルシネーション)、学習時点より後のことを知らない(知識のカットオフ)、一度に読める量に上限がある(文脈長)。InstructGPT論文は、要約などの閉じた課題で作り話をする率がGPT-3の41%に対し21%と書く。
LLM(大規模言語モデル)とは何か
冒頭の「大量の文章で学習し、次の語を予測しながら文章を書くAIモデル」は本記事の言い方で、公的な資料に同じ一文があるわけではない。まず公的な資料の言い方を見ておく。
AI事業者ガイドライン(第1.2版)は、総務省と経済産業省が公表している、AIを開発・提供・利用する事業者向けの指針だ。筆者は10月2日11時すぎに、総務省が掲載する本編PDFをダウンロードし、pdftotext で全文を文字にして、「大規模言語モデル」と「LLM」を検索した。どちらかの語が出てくるページは6つあった。このうち定義に関わる箇所と、生成AIの定義は次のとおりだ。
- PDFの10ページ目の脚注16に、「大規模言語モデルに代表される基盤モデルは、様々なサービスを支える個別モデルを生み出すコアの技術基盤である。」とある。
- PDFの11ページ目の用語の定義に、「生成AI」が「文章、画像、プログラム等を生成できるAIモデルにもとづくAIの総称を指す」と書かれている。
本記事が確認した範囲では、このガイドラインの用語の定義の欄に「LLM」という見出し語はなかった。使えるのは、LLMが基盤モデルの代表として扱われていること、生成AIが何の総称かが定義されていること、の2点だ。技術的な説明は原論文に頼ることになる。InstructGPT論文は言語モデルの学習目標を「次のトークンの予測」と説明し、GPT-3論文はGPT-3を「自己回帰(autoregressive)の言語モデル」と呼ぶ。冒頭の一文は、これらを組み合わせた本記事の言い方だ。
「大規模」「言語」「モデル」を分けて言うと、次のようになる。
| 語 | 意味 | 出どころ |
|---|---|---|
| 言語 | 文章や、プログラムの文字列を扱う | GPT-3論文は、翻訳・質問応答・穴埋めなどの言語課題で評価している |
| モデル | 入力から出力を作る数式の集まり。中身は学習で決まる数値(パラメータ)の束 | ガイドラインは学習を「データを用いてAIモデルのパラメータを決定または改善するプロセス」と定義する |
| 大規模 | パラメータ数と学習データの量が大きい | 次の「『大規模』は何が大きいのか」で数字を見る |
LLMでできること:文章生成・要約・翻訳・コード
GPT-3の論文は、このモデルを、翻訳、質問応答、穴埋めに加え、単語の並べ替え、文の中で新しい単語を使う、3桁の足し算など「その場の推論」を要する課題で評価したと書く。論文は同時に、GPT-3が書いた報道記事を、人間の評価者が人間の書いた記事と見分けにくかったとも記す。
2026年の公式ページが挙げる用途も同じ線の上にある。Anthropicは2026年9月28日付の発表で、Claude Sonnet 5.5を日常の明確な作業、バグ修正、資料・スライド・表計算の作成に強いモデルと紹介し、OpenAIのGPT-6.1 Solのモデルページは、複雑なコーディング、コンピューター操作、専門的な仕事を挙げる。できることの共通項は、文章を入力し、文章(コードを含む)を出力する作業だ。
| 用途 | 入力 | 出力 | 公式資料での言及 |
|---|---|---|---|
| 文章生成 | 指示や書き出し | 続きの文章 | GPT-3論文(記事の生成) |
| 要約 | 長い文章 | 短い文章 | InstructGPT論文(要約を評価課題に使用) |
| 翻訳 | ある言語の文 | 別の言語の文 | GPT-3論文(翻訳課題で評価) |
| コード | 仕様やバグの説明 | プログラム | GPT-6.1 Sol、Sonnet 5.5の公式ページ |
画像や音声を作る用途は、LLM単体の話ではない。GPT-6.1 Solの公式ページも、入力はテキストと画像、出力はテキストで、音声と動画は非対応と書く。
LLMはどう動くのか:トークン、次の語の予測、Transformer、事前学習とRLHF
仕組みの骨組みは、4つの用語でつかめる。
トークン。 LLMは文章を、単語や文字より細かい「トークン」という単位に区切って扱う。料金、文脈長、出力の上限はこの単位で数える。くわしくはトークンとはに。
次の語の予測。 InstructGPT論文は、近年の大きな言語モデルが使う学習の目標を「ウェブページ上の次のトークンを予測すること」と書き、同じ論文の最後の節(Broader impacts)では「既定では言語モデルは次の語の予測という目的に向けて学習されるが、それは私たちが望むことの代用にすぎない」(原文:By default, language models optimize the next word prediction objective, which is only a proxy for what we want these models to do.)と述べる。GPT-3は自己回帰(autoregressive)の言語モデルで、前のトークンから次のトークンを順に作る。
Transformer。 2017年の論文 Attention Is All You Need は、再帰や畳み込みを使わず「注意機構のみに基づく、新しくシンプルなネットワーク構造」をTransformerと名づけた。原文の要旨は「We propose a new simple network architecture, the Transformer, based solely on attention mechanisms, dispensing with recurrence and convolutions entirely.」。GPT-3の論文も、GPT-2と同じ構造を使い、transformerの層の注意のパターンだけを変えたと書いている(2.1節)。仕組みの詳細はTransformerとはに。ニューラルネットワークそのものの基礎はニューラルネットワークとはに。
事前学習とRLHF。 GPT-3の論文は、「大量の文章で事前学習し、続いて個別の課題で微調整する」やり方が主流だったと書き、GPT-3は微調整なし(パラメータを更新しない)で、課題の例を文章で示すだけの「少数例(few-shot)」で動かすと説明する。その後のInstructGPT論文は、人間が書いた望ましい回答でGPT-3を微調整し、さらに人間が出力に付けた順位で強化学習(RLHF:人間のフィードバックによる強化学習)をかける手順を示した。結果は要旨に「(論文が集めたプロンプトでの)人間の評価で、13億パラメータのInstructGPTの出力が、1,750億パラメータのGPT-3の出力より好まれた。パラメータ数は100分の1」とある。
つまりLLMは、事前学習で言語の統計を身につけたあと、人の意図に沿うよう追加の訓練を受けて、チャットで使える形になる。最近の推論用モデルが考える時間を増やす仕組みは推論モデルとはで扱っている。
「大規模」は何が大きいのか:パラメータ数と学習データ
「大規模」の中身は2つある。パラメータ数(モデルの中の学習で決まる数値の数)と、学習データの量だ。
筆者がGPT-3論文の表を引いた結果
筆者は10月2日11時すぎにGPT-3論文のPDFをダウンロードし、pdftotext で文字にして、Table 2.1(モデルの大きさ)とTable 2.2(学習データ)を読んだ。Table 2.1の8モデルは次のとおり。
| モデル | パラメータ数 | 層の数 |
|---|---|---|
| GPT-3 Small | 125M(1.25億) | 12 |
| GPT-3 Medium | 350M | 24 |
| GPT-3 Large | 760M | 24 |
| GPT-3 XL | 1.3B(13億) | 24 |
| GPT-3 2.7B | 2.7B | 32 |
| GPT-3 6.7B | 6.7B | 32 |
| GPT-3 13B | 13.0B | 40 |
| GPT-3 175B(「GPT-3」) | 175.0B(1,750億) | 96 |
論文は「すべてのモデルは合計3,000億トークンで学習した」と書き、文脈長は2,048トークン(nctx = 2048)と記す。Table 2.2の学習データは、Common Crawl(フィルター後)が4,100億トークン、WebText2が190億、Books1が120億、Books2が550億、Wikipediaが30億で、数字を足すと4,990億トークンになる。ただし学習で実際に見たのは3,000億トークンで、データごとに見る回数(エポック)が異なる。Common Crawlは0.44回、Wikipediaは3.4回だ。
2026年のモデルは、公式ページにパラメータ数が見当たらないことが多い
では現在のモデルはどうか。今回開いたページに限ると、記載のあるモデルと、見当たらないモデルに分かれた。
- Kimi K3(Moonshot AI):Hugging Faceのモデルカードに、アーキテクチャはMixture-of-Experts(MoE)、総パラメータ2.8T(2.8兆)、有効パラメータ104B、文脈長1,048,576と書かれている。GPT-3の175Bと比べると、総パラメータは16倍だが、トークンごとに働く有効パラメータ(104B)は175Bより小さい。MoEの考え方はMoEとはに。
- GLM-5.3-Flash(Z.AI):Z.AIのリリースノートに「総パラメータ320B、有効18B」とある。
- Claude、GPT、Gemini、Grok、DeepSeek:筆者が今回開いた各社のモデルページ(下の一覧の出典)には、パラメータ数の記載は見当たらなかった(本文を
parameterで検索しても、該当は設定項目などの語だけだった)。非公開なのか、別の資料にあるのかは確認できていない。
文脈長(一度に読める量)は公式ページで確かめられる。GPT-3は2,048トークン、Gemini 3.8 Flashの入力上限とKimi K3の文脈長は1,048,576トークンで、GPT-3のちょうど512倍(1,048,576÷2,048)だ。Claudeの3モデルとDeepSeek-V4.1-Flashは1M、GPT-6.1 Solは1,050,000で、いずれもGPT-3の約500倍にあたる。文脈長はコンテキストウィンドウとはにまとめた。
生成AIとの違い:LLMは生成AIのうち、言語を扱うもの
LLMと生成AIの関係を一言で言えば、生成AIの中に、LLMが入る。AI事業者ガイドラインも、脚注36で「大規模言語モデルを始めとする生成AI」と書き、LLMを生成AIの一つとして扱っている。
同ガイドラインは、生成AIを「文章、画像、プログラム等を生成できるAIモデルにもとづくAIの総称」とする。画像を作るモデルも、音声を作るモデルも、生成AIの一部だ。LLMは、このうち言語(文章とプログラム)を扱うモデルを指す。ChatGPTやClaudeアプリのような「サービス」は、LLMを中に入れた製品の名前で、モデルそのものの名前ではない。
| 範囲 | 例 | |
|---|---|---|
| 生成AI | 文章・画像・プログラム等を生成するAIの総称(ガイドラインの定義) | 大規模言語モデル、画像生成モデル、オーディオ生成モデルなど(ガイドライン脚注47の列挙) |
| LLM | 生成AIのうち、言語を扱う大規模なモデル | GPT-6.1 Sol、Claude Opus 5.5など(後述の一覧) |
| 基盤モデル | 様々なサービスを支える個別モデルを生み出すコアの技術基盤(ガイドライン脚注16) | 大規模言語モデル(脚注16が挙げる代表例) |
生成AI全体の整理は生成AIとはに。パラメータ数の小さいLLMは小規模言語モデル(SLM)、手元のPCで動かす使い方はローカルLLMの入門に分けて書いた。
2026年10月2日時点の主なLLM
次の表は、筆者が10月2日11時すぎに各社の公式ページを開いて、そこに書かれていた数字だけを写したものだ。「記載なし」は、取得したページに書かれていなかった項目を指す。選んだのは当サイトが記事にしたモデルを中心に、公式ページを取得できたもので、すべてのLLMを網羅した一覧ではない。
| 提供元 | モデル | 文脈長(トークン) | 料金(入力/出力・100万トークン) | 知識のカットオフ |
|---|---|---|---|---|
| OpenAI | GPT-6.1 Sol | 1,050,000 | $2.00/$10.00 | 2026年4月30日 |
| Anthropic | Claude Fable 5.1 | 1M | $10/$50 | 2026年6月 |
| Anthropic | Claude Opus 5.5 | 1M | $4/$20 | 2026年6月 |
| Anthropic | Claude Sonnet 5.5 | 1M | $2/$10 | 2026年6月 |
| Anthropic | Claude Haiku 4.5 | 200K | $1/$5 | 2025年2月 |
| Gemini 3.8 Flash | 1,048,576(入力上限) | 記載なし | 記載なし | |
| Gemini 4 Argon | 記載なし(出力上限1Mの記載はある) | $2/$10(導入価格。期間後は$4/$20。限定提供中) | 記載なし | |
| SpaceXAI | Grok 4.7 | 500,000 | $2.00/$6.00 | 2026年5月 |
| DeepSeek | DeepSeek-V4.1-Flash | 1M | $0.15/$0.6(キャッシュなし・オフピーク。ピーク時は2倍) | 記載なし |
| Z.AI | GLM-5.3 | 1M | 記載なし | 記載なし |
| Moonshot AI | Kimi K3 | 1,048,576 | 記載なし | 記載なし |
表の数字について2点補足する。
- 入力料金は100万トークンあたり、DeepSeek-V4.1-Flashの$0.15からClaude Fable 5.1の$10まで、約67倍($10÷$0.15)の開きがある。ただしDeepSeekは「キャッシュなし・オフピーク」の価格で、他社と条件は揃っていない。
- Anthropicの比較表では、知識のカットオフはHaiku 4.5が2025年2月、Sonnet 5.5などの3モデルが2026年6月で、世代によって1年以上の差がある。
重みが公開されたモデル(Kimi K3など)とは何かはオープンウェイトとはに。
この表は一部にすぎない。当サイトの後継モデル台帳(model-succession.json)を筆者が10月2日に python3 で数えると30行あったが、これは旧→現行モデルの対応の行数で、モデルの数ではない。
LLMの弱点:ハルシネーション、知識の期限、文脈長
もっともらしい誤り(ハルシネーション)
InstructGPT論文は、入力に書かれていない情報を出力に含めてしまうことを「hallucination」と呼び、要約や閉じた質問応答の課題で、GPT-3は41%、InstructGPTは21%だったと書く。この数字は2022年の論文の、特定の課題の結果で、2026年のモデルの率ではない。
AI事業者ガイドラインの脚注27は、RAG(検索拡張生成)の活用等により、ハルシネーションの抑制や出力過程・根拠の透明性向上等が期待されている、と書く。「期待されている」という書き方で、抑える効果を保証する文ではない。原因と対策はハルシネーションの原因と対策に。
学習した時点より後のことを知らない(知識のカットオフ)
前節の表のとおり、公式ページは知識のカットオフを月か日付で書いている。GPT-6.1 Solは2026年4月30日、Grok 4.7は2026年5月、Claudeの新しい3モデルは2026年6月だ。この日付より後の出来事は、モデル単体では答えられない。くわしくは知識のカットオフとはに。
一度に読める量に上限がある(文脈長)
文脈長は、入力と出力に数えられるトークンの上限に関わる。GPT-6.1 Solのページは、入力が272Kトークンを超えるリクエストは、全体の入力・キャッシュ料金が2倍、出力が1.5倍になると書く。上限まで読める、ことと、上限まで同じ料金で使える、ことは別だ。
この記事が決めきれなかったこと
- LLMの一文の定義の出典。 ガイドラインの用語の定義欄にLLMは無い。冒頭の説明は、ガイドラインの位置づけ(基盤モデルの代表、生成AIの一つ)と、InstructGPT論文の「次のトークンの予測」、GPT-3論文の「自己回帰の言語モデル」を組み合わせた本記事の言い方で、公的な一文の定義ではない。
- 「大規模」の線引き。 パラメータ数がいくつ以上ならLLMか、という基準は、今回当たった資料には書かれていなかった。GPT-3論文は125Mから175Bまで8つの大きさを並べて「GPT-3」シリーズとしている。
- 各社の現時点の仕様。 一覧の数字は2026年10月2日に開いた時点のもので、モデルの追加や料金改定で変わる。
- OpenAIの英語の発表ページ。 発表記事は自動取得ができなかったため、API ドキュメントのモデルページだけを使っている。
この記事が当たった一次資料
中心は、AI事業者ガイドライン(第1.2版)本編、Transformer・GPT-3・InstructGPTの3本の原論文、各社の公式モデルページで、URLは下の出典欄に載せた。数字は筆者が2026年10月2日に開いた各資料の原文から写した。英語の引用は原文を一字一句抜き、日本語の訳は筆者が意味を変えない範囲で付けた。
出典・参照資料
- 一次資料AI事業者ガイドライン(第1.2版)本編(総務省掲載PDF・用語の定義と脚注16・2026年10月2日11時すぎ取得、pdftotextで全文を文字化して確認) ↗
- 一次資料Attention Is All You Need(arXiv:1706.03762・要旨・2026年10月2日取得) ↗
- 一次資料Language Models are Few-Shot Learners(GPT-3論文・arXiv:2005.14165・要旨とPDFのTable 2.1・Table 2.2・2026年10月2日取得) ↗
- 一次資料Training language models to follow instructions with human feedback(InstructGPT論文・arXiv:2203.02155・要旨とPDF・2026年10月2日取得) ↗
- 一次資料GPT-6.1 Sol — OpenAI API ドキュメント(モデルページ・文脈長・知識のカットオフ・料金・2026年10月2日取得) ↗
- 一次資料Claude Opus 5.5 — Claude Platform Docs(Fable 5.1・Opus 5.5・Sonnet 5.5・Haiku 4.5の比較表・2026年10月2日取得) ↗
- 一次資料Claude Fable 5.1 — Claude Platform Docs(公開日・知識のカットオフ・2026年10月2日取得) ↗
- 一次資料Introducing Claude Sonnet 5.5 — Anthropic(2026年9月28日付・2026年10月2日取得) ↗
- 一次資料Gemini 3.8 Flash — Gemini API(入出力のトークン上限・最終更新2026-09-02・2026年10月2日取得) ↗
- 一次資料Gemini 4 Argon — Google公式ブログ(Fairwind Programでの限定提供と導入価格・2026年10月2日取得) ↗
- 一次資料Grok 4.7 — SpaceXAI Docs(文脈長・知識のカットオフ・料金・2026年10月2日取得) ↗
- 一次資料Models & Pricing — DeepSeek API Docs(DeepSeek-V4.1-Flashの文脈長・最大出力・料金・2026年10月2日取得) ↗
- 一次資料New Released — Z.AI Docs(GLM-5.3-Flashの総パラメータ・有効パラメータ・2026年10月2日取得) ↗
- 一次資料GLM-5.3 — Z.AI Docs(文脈長・最大出力・2026年10月2日取得) ↗
- 一次資料moonshotai/Kimi-K3 — Hugging Face(モデルカード・総パラメータ2.8T・有効104B・2026年10月2日取得) ↗
- 一次資料モデル後継台帳 model-succession.json(当サイトの後継モデル台帳・最終更新欄2026-09-29・30行) ↗
大きいニュースはYouTubeでも解説しています。Xでは新着記事をお知らせしています。
コメント
まだコメントはありません。最初のコメントを書いてみませんか?
AIについて聞きたいことはありますか?
質問箱で無料で受け付けています。回答は公開され、他の方の参考にもなります。
質問箱を見る →