AI時短ラボ
検索
活用

パラメーター(パラメータ)とは設定値のこと。AIでは学習で決まった数値のことで、その数はGPT-3が1,750億、Kimi K3が2.8兆。7Bや27Bの読み方と、temperatureなど設定の意味の違い【2026年10月版】

執筆:約26分で読めます

パラメーター(parameter・パラメータ)とは、結果を左右するために外から与えたり調整したりする値のことで、プログラムでは設定値や引数、AIではモデルが学習で身につけた数値(重みとバイアス)を指します。AIの「70億パラメーター」は、その数値が70億個あるという意味です。辞書・Pythonの公式文書・IBM・Googleの用語集と、GPT-3論文、Kimi K3・gpt-oss・Qwen3.8のモデルカードを2026年10月8日に開き、筆者がGPT-2の中身を数えた結果も載せました。

パラメーター(パラメータ)とは──設定値のこと。AIでは学習で決まった数値のことで、その数はGPT-3が1,750億、Kimi K3が2.8兆。7Bや27Bの読み方と、temperatureなど設定の意味の違い【2026年10月版】
目次

2026年10月8日・日本時間時点の情報です。 パラメーター(parameter・パラメータ)とは、結果を左右するために外から与えたり、調整したりする値のことです。プログラムでは「設定値」や「引数」、数学では「媒介変数」、AIでは「モデルが学習で身につけた数値(重みとバイアス)」を指し、同じ言葉で場面によって意味が変わります。AIの「70億パラメーター」は、その数値が70億個あるという意味です。

この記事は、辞書・Pythonの公式文書・IBM・Googleの用語集とAI各社のモデルカードを2026年10月8日の午前4時台に開いて確かめ、筆者がGPT-2のファイルの中身を実際に数えた結果も載せています。

3行まとめ

  1. パラメーターは「結果を決める値」のこと。デジタル大辞泉は「媒介変数」と「プログラムを実行する際に設定する指示事項」の2つを挙げ、音楽用語ダスは「設定値」と書く
  2. AIの「70億パラメーター」は、学習で決まった数値が70億個あるという意味(Googleの用語集は「重みとバイアス」と説明)。GPT-3は1,750億、Kimi K3は総2.8兆(動くのは104B)
  3. temperatureのような設定は、モデルの中の数値とは別もの。IBMは「推論ハイパーパラメーター」と呼ぶ

パラメーターの意味は、辞書では何と書いてあるのか

コトバンクに載っているデジタル大辞泉(小学館)の項目は、次のとおりです(筆者が2026年10月8日 04:44 に取得)。

パラメーター(parameter) 1 媒介変数。 2 コンピューターで、プログラムを実行する際に設定する指示事項。

同じページの日本大百科全書(ニッポニカ)は、数学の意味をこう説明します。

媒介変数ともいい、主たる変数を、その関数として表示するのに用いる。

同じ項目は、直線の式 Ax+By+C=0 では A、B、C が「直線を決定するためのパラメーター」だとも書きます。値を一組決めると、1本の直線が決まる、という使い方です。

日常の技術文書でよく見る意味は、ヤマハミュージックメディアの音楽用語ダス(同じページに掲載)が一番短く書いています。

設定値。ユーザーやシステムによって変更することのできる「値」のこと。ほとんどのテクニカルな文章において、パラメータを「値」に直せば非常に読みやすくなる。

「パラメーター」と「パラメータ」の違いは、伸ばす音の書き方だけです。同じページの講談社のIT用語がわかる辞典は「「パラメータ」「引数(ひきすう)」ともいう」と書き、ブリタニカ国際大百科事典 小項目事典の「パラメータ」の項は、本文が「「媒介変数」のページをご覧ください。」の1行です。この記事は以後「パラメーター」と書きます。

場面 パラメーターの意味 出どころ
数学 変数どうしをつなぐ変数(媒介変数)。値を決めると式の形が決まる 精選版 日本国語大辞典・日本大百科全書
プログラム 実行するときに与える指示事項。設定値 デジタル大辞泉・音楽用語ダス
プログラミング言語 関数の定義に書く名前(仮引数) Python 公式ドキュメント
AI(機械学習) 学習で決まる数値(重みとバイアス) Google・IBM

プログラムの「パラメーター」と「引数」は同じなのか

プログラミングを少し触る人は、「パラメーター」と「引数(ひきすう)」が並ぶ場面に出会います。Pythonの公式FAQ(日本語版)は、この2つを次のように区別しています。

仮引数 (parameter) は関数定義に表れる名前で定義されるのに対し、 実引数 (argument) は関数を呼び出すときに実際に渡す値のことです。

FAQの例では、def func(foo, bar=None, **kwargs): の「foo、bar、kwargs」が仮引数(parameter)、func(42, bar=314, extra=somevar) の「42、314、somevar」が実引数(argument)です。

つまり、parameter は「受け取る箱の名前」、argument は「箱に入れる中身」です。Pythonの用語集も、parameter(仮引数)を、関数やメソッドの定義の中で、受け取る実引数を指定するものと説明しています。ただし辞書の側は、2つを重ねて説明しています。先に引いた講談社のIT用語がわかる辞典は「引数」も同じ語として挙げ、カメラマン写真用語辞典は「プログラムの関数を呼び出すために指定する引数を指すこともある」と書きます。日常の会話では、箱と中身をまとめて「パラメーター」と呼ぶ場面があります。

Webサイトのアドレスの「?」以降も、同じような「名前と値の組」です。MDN の URLSearchParams の説明は、URL の「クエリー文字列」に入るキーと値のペアを「検索パラメーター」と呼んでいます。

AIの「パラメーター」は、学習で決まった数値のこと

ここからがAIの話です。Googleの機械学習用語集(日本語)は、パラメータを次のように説明しています。

モデルがトレーニング中に学習する重みとバイアス。

続けて、線形回帰モデルでは「y' = b + w1x1 + w2x2 + … wnxn」の b(バイアス)と w(重み)がパラメータだと書き、一方、ハイパーパラメータは「ユーザー(またはハイパーパラメータ チューニング サービス)がモデルに提供する値」で、例は学習率だとしています。

IBM の「モデル・パラメーターとは」も同じ考え方です。

モデルのパラメーターは機械学習モデル内で学習された値であり、入力データを生成されたテキストや予測された分類などの出力にマッピングする方法を決定します。

学習とは、答えが期待に近づくよう、この数値を少しずつ調整することです。IBM は「AIモデルのアウトプットが期待される成果とほぼ一致するまでパラメータを調整すること」と書きます。調整が終わった数値の集まりが、学習済みモデルの中身です。

IBM は、住宅価格の線形回帰(y=mx+b)を例にして「m(傾き)と b(切片)はパラメータです」と書きます。パラメーターが2つだけの極小のモデルです。一方で IBM は「大規模モデルには、数十億のパラメーターを含めることができる」と書いています。

IBM の説明では、モデル・パラメーターは主に重みとバイアスの2種類です。重みは傾き m に当たり、入力が出力に与える影響を決め、バイアスは切片 b に当たり、線全体を上下に動かします。この「バイアス」は、差別的な結果を生むアルゴリズム・バイアスとは別の概念だと IBM は注記しています。

LLM(大規模言語モデル)の中身についてはLLMとはに書きました。

筆者がGPT-2のファイルを開いて、パラメーターを数えた

説明だけでは数が実感しにくいので、筆者は2026年10月8日 04:46 に、Hugging Face で公開されているGPT-2(OpenAI が公開した、小さな言語モデル)のファイルの先頭部分(ヘッダ)だけを取得して数えました。ログインはしていません。model.safetensors というファイルは、先頭に「どの名前の数値の表が、どんな形か」の一覧が入っているので、全体をダウンロードしなくても数えられます。手順の Python スクリプト(count_params.py)と出力は、筆者の作業フォルダに保存してあります。

結果は次のとおりです。

数えたもの 数
ファイル内の表(テンソル)の数 160
すべての表の要素数の合計 137,022,720
そのうち、形が 1×1×1024×1024 の表(12枚)の要素数 12,582,912
12枚を除いた合計 124,439,808

GPT-2のモデルカードの README は「This is the smallest version of GPT-2, with 124M parameters.」(これはGPT-2の最小版で、パラメーターは124M)と書きます。筆者の数えた 124,439,808 は、この「124M」に合います。一方、Hugging Face の API は同じファイルについて合計 137,022,720 と返します。

差の 12,582,912 は、h.0.attn.bias から h.11.attn.bias までの、形が 1×1×1024×1024 の表12枚の分です。筆者が04:53 にこの表の中身も読むと、どれも0と1だけが下三角の形に並んでいました。Hugging Face の transformers ライブラリの GPT-2 の実装(v4.30.0 の原文)は、この bias を torch.tril(下三角の行列を作る関数)で作り、register_buffer(PyTorch の説明では、モデルのパラメーターとは扱わない値を登録する仕組み)で登録して、causal_mask として使っています。12枚は、各単語が自分より後ろの単語を見ないためのマスクで、学習で決まる値ではありません。いまの transformers(main)は、このキーを読み込み時に無視するものとし、「No longer used as we directly use our masks instead」(もう使っていない。代わりにマスクを直接使う)と注記しています。

つまり「パラメーター数」といっても、ファイルに入っている数字を全部足した値と、学習で決まった数値だけの値が、一致するとは限りません。GPT-2のモデルカードの「124M」は、後者に合っていました。この記事がファイルの中身まで数えたのは、GPT-2と、後で見る Qwen3.8-27B だけです。

2026年10月8日時点で、公式にパラメーター数が書かれていたモデル

筆者が2026年10月8日 04:44〜04:46 に開いた公式のページに、パラメーター数が書かれていたモデルを並べます。

モデル 公式に書かれていた数 出どころ
GPT-3(2020年) 1,750億(175 billion)。論文は「それまでのどのスパース(まばら)でない言語モデルより10倍多い」と書く arXiv 論文の要旨
gpt-oss-120b(OpenAI) 117B、有効5.1B Hugging Face モデルカード
gpt-oss-20b(OpenAI) 21B、有効3.6B 同上
Muse-Glimmer-30B(Hugging Face 上の組織名は meta-models) 29.6B(視覚の部分を含む)。全パラメーターを毎回使うdense型 モデルカード
Qwen3.8-27B(Qwen) 27B(README)。Hugging Face の画面は28B README・画面撮影
GLM-5.3-Flash(Z.ai) 総320B、有効18B モデルカード
Kimi K3(Moonshot AI) 総2.8T(2.8兆)、有効104B モデルカード

引用の原文は次のとおりです。

we train GPT-3, an autoregressive language model with 175 billion parameters, 10x more than any previous non-sparse language model

(訳:自己回帰型の言語モデルGPT-3を、1,750億パラメーターで学習した。それまでのどのスパースでない言語モデルより10倍多い。)

It is a 2.8T-parameter model built on Kimi Delta Attention (KDA) and Attention Residuals (AttnRes)

(訳:Kimi Delta Attention と Attention Residuals を土台にした、2.8Tパラメーターのモデルである。)

GLM-5.3-Flash のモデルカードは「With 320B total parameters and just 18B active parameters」(総パラメーター320B、有効なのは18Bだけ)、gpt-oss-120b のモデルカードは「117B parameters with 5.1B active parameters」と書いています。

Kimi K3 の総2.8Tは、GPT-3の1,750億のちょうど16倍です(筆者の計算)。ただし有効パラメーターの104Bは、GPT-3の175Bより小さい数です。GPT-3との比べ方と学習データの量はLLMとはの「大規模」の節にあります。

ClaudeやChatGPT、Geminiの数は書かれていたか

本記事が開いた Anthropic・OpenAI・Google のモデル一覧と、Google DeepMind の Gemini 3.8 Flash・Gemini 3.1 Pro のモデルカードには、パラメーター数の記載は見当たりませんでした(2026年10月8日 04:45〜04:56 に取得した本文を、parameter・billion・パラメータ・億 などの語で検索した結果)。そのため、これらのサービスの「パラメーター数」として世の中に出回っている数字は、この記事では扱いません。

「7B」「27B」「2.8T」は、どう読むのか

モデル名の末尾の記号は、数の単位です。

記号 意味 例
M 100万(million) GPT-2の124M=約1.24億
B 10億(billion) 27B=270億、117B=1,170億
T 1兆(trillion) 2.8T=2.8兆

「7B=70億」「70B=700億」と覚えておくと、桁の数え間違いを避けられます。

総パラメーターと有効(アクティブ)パラメーターは別の数

上の表で、Kimi K3・GLM-5.3-Flash・gpt-oss は、2つの数が並んでいました。これは MoE(Mixture of Experts)という作りのモデルで、入力ごとに全体の一部だけを動かすためです。公式の数字で比べると(比率は筆者の計算)、総数は有効の、Kimi K3 で約26.9倍、gpt-oss-120b で約22.9倍、GLM-5.3-Flash で約17.8倍です。

一方、Qwen3.8-27B や Muse-Glimmer-30B のように、全部を毎回使うモデルは dense(密)型と呼ばれ、数字は1つです。MoE の読み方はMoEとはに詳しく書いてあります。

1個のパラメーターは何バイトか:Qwen3.8-27Bのファイルの大きさと照らした

パラメーター数は、ファイルの大きさや必要なメモリの目安にもなります。1個の数値を何バイトで保存するかが、型で決まるためです。Hugging Face の API は、Qwen3.8-27B について次の数字を返しました(筆者が2026年10月8日 04:46 と 04:58 に取得)。

リポジトリ パラメーター総数(API) 内訳 数値のファイル(.safetensors)の合計
Qwen/Qwen3.8-27B 27,781,427,952 すべて BF16(1個2バイト) 18個・55,563,006,776 バイト
Qwen/Qwen3.8-27B-FP8 27,781,427,952 FP8(1個1バイト)が24,699,207,680個、BF16が3,082,220,272個 66個・30,866,866,928 バイト

筆者の計算では、27,781,427,952×2バイト=55,562,855,904バイトです。ファイルの合計との差の150,872バイトは、18個のファイルの先頭にある表の一覧(ヘッダ)の大きさを足した値とぴったり同じでした(筆者が各ファイルのヘッダを読んで足した値)。BF16 版のファイルは、ヘッダを除けば「パラメーター数×2バイト」そのものです。

FP8 版は、24,699,207,680×1バイト+3,082,220,272×2バイト=30,863,648,224バイトで、ファイルの合計との差は約320万バイトでした。差の大半は、API のパラメーター総数に入っていない weight_scale_inv という BF16 の表(計1,507,520個)の分で、残りはヘッダの分です。

数値の大部分を1個1バイトに減らす(量子化)と、パラメーター数は同じまま、ファイルは約55.6GBから約30.9GBに減りました。「パラメーターが27B」と「ファイルが約55.6GB」は、BF16が2バイトであることでつながっています。量子化の関連はSLMとはやLoRAとはにも出てきます。

Hugging Face の画面に出た「Model size」

筆者は、ヘッドレスのブラウザ(画面を出さない設定)で、モデルページを PC 幅(1280×800)で開きました。04:45 に撮影した Kimi K3 のページの右側には「Safetensors」の枠があり、「Model size」の隣に「2.8T params」と出ていました。同じ時刻の gpt-oss-120b は「117B params」、Qwen3.8-27B は「28B params」です。スマホ幅(390×844、04:46)の Kimi K3 にも「2.8T params」が出ていました。

Qwen3.8-27B は、README が「27B」、画面が「28B params」で、1B違いました。API が返した27,781,427,952個は、小数点以下を切り捨てれば27B、四捨五入すれば28Bになる数です。画面の数はファイルの中身の合計を丸めた値とみられますが(筆者の推測)、表示の仕組みの説明は確認していません。公式の数字を比べるときは、この丸め方の違いに注意が要ります。

画面やAPIの「パラメーター」は、モデルの中の数値とは別のもの

API や、ローカルで動かすツールの設定で見かける「パラメーター」は、多くの場合、人が決める設定のことです。ここが一番混乱しやすい所です。

IBM の「LLMパラメーターとは」は、大きく2つに分けています。

  • トレーニング可能なパラメーター(重みなど): 学習のあいだに学習アルゴリズムが設定する
  • ハイパーパラメーター: モデルの外にあり、学習の進め方やモデルの構造、出力の形を決める
  • 後者は、さらに構造(層の数など)・学習(学習率やバッチ・サイズ)・推論(温度や top-p サンプリング)・メモリーと計算能力(コンテキスト・ウィンドウなど)・アウトプット品質(プレゼンス・ペナルティーなど)に分けられる

IBM は、推論ハイパーパラメーターを「生成 AIモデルがアウトプットを生成する方法を決定します」と書いています。

具体例を挙げます。Qwen3.8-27B の README(筆者が04:45 に取得)は、temperature や top_p を「sampling parameters」(サンプリングのパラメーター)と呼び、思考モードでは temperature=1.0、非思考モードでは temperature=0.7 を推奨しています。これはモデルの27Bの中の数値ではなく、答えをどれくらいランダムに選ぶかという、使う側が決める設定です。

Anthropic の Messages API リファレンス(筆者が04:46 に取得)は、リクエストに渡す項目の節を「Body parameters」と呼びます。max_tokens は「The maximum number of tokens to generate before stopping.」(止まるまでに生成するトークンの最大数)、temperature は「Amount of randomness injected into the response.」(応答に加えるランダムさの量)と説明されます。さらに、temperature には次の注記が付いていました。

Deprecated. Models released after Claude Opus 4.6 do not support setting temperature. A value of 1.0 will be accepted for backwards compatibility, all other values will be rejected with a 400 error.

(訳:非推奨。Claude Opus 4.6より後に公開されたモデルは、temperatureの設定に対応しない。後方互換のため1.0は受け付けるが、ほかの値は400エラーで拒否される。)

OpenAI の API リファレンス(Responses API の「Create a model response」、筆者が04:55 に取得)も、リクエストに渡す項目の節を「Body Parameters」と呼び、temperature を次のように説明しています。

What sampling temperature to use, between 0 and 2. Higher values like 0.8 will make the output more random, while lower values like 0.2 will make it more focused and deterministic.

(訳:使うサンプリング温度。0から2の間で指定する。0.8のような高い値は出力をよりランダムにし、0.2のような低い値はより焦点を絞った、決定的なものにする。)

つまり、同じ「パラメーター」でも、APIでは、プログラムの引数(Pythonの言い方なら、渡す値)の意味で使われています。範囲も会社で違い、Anthropic のリファレンスは temperature を0.0〜1.0(既定は1.0)、OpenAI のこのページは0〜2と書いていました。そして、いつでも変えられるとは限りません。Anthropic の新しいモデルでは、1.0以外の値が受け付けられなくなっています。モデルの中の27Bや2.8Tの数値と違い、これらは使う人が呼び出しのたびに決める設定です。

パラメーターが多いほど賢いのか

「数が多いほど性能が高い」と、言い切れるわけではありません。IBM の説明とモデルカードの数字から、2点を挙げます。

  1. IBM は、パラメーターを増やすと「モデルはより微妙なデータのパターンをより正確に捉えることができます」と書く一方、「パラメータが多すぎると過剰適合のリスクがあります」とも書きます。過剰適合とは、学習に使ったデータに合わせすぎて、新しいデータでは外れやすくなることです。
  2. MoE型では、総数と有効数が大きく違い、見出しの総数だけでは1回の処理で使う量が分かりません。

パラメーターは、モデルの大きさの目安であり、賢さそのものではありません。性能を比べるには、各社が公開する点数や、自分の用途での試用のほうが直接の手がかりになります。小さいモデルの使いどころはSLMとはに、トークン(文章を数える単位)との違いはトークンとはに、一度に読める量との違いはコンテキストウィンドウとはに、重みを公開する意味はオープンウェイトとはにあります。

ClaudeやGeminiの数と、ほかのモデルのファイルの中身は確かめていない

  • ClaudeやChatGPT、Geminiの数: 上に書いた各社のページには記載が見当たらず、非公開なのか、技術報告書など別の資料にあるのかは確認していません。
  • GPT-2とQwen3.8-27B以外のファイル: ファイルの数字の合計と公表のパラメーター数がずれる例を2つ確かめましたが、ほかのモデルの中身は数えていません。
  • ゲームや製品のスペック表の「パラメーター」: 能力値や調整項目の意味で使われる場面は、この記事では扱っていません。

この記事が開いた資料と取得時刻

2026年10月8日 04:44〜05:10(日本時間)に、frontmatter の出典に並べたページとファイルのヘッダを取得しました。原文と画面撮影(1280×800と390×844)、GPT-2とQwen3.8-27Bを数えたスクリプトと出力は、筆者の作業フォルダに保存してあります。数字は2026年10月8日時点のもので、新しいモデルが出ると入れ替わります。

この記事でよく聞かれること

パラメーターとは何ですか。一言で教えてください。
結果を決めるために与えたり調整したりする値のことです。デジタル大辞泉は「媒介変数」と「コンピューターで、プログラムを実行する際に設定する指示事項」の2つを挙げ、音楽用語ダスは「設定値」と書いて、ユーザーやシステムが変えられる値だと説明しています(2026年10月8日確認)。AIの文脈では、モデルが学習で身につけた数値(重みとバイアス)を指します。
パラメーターとパラメータは違うものですか。
同じ語で、伸ばす音を書くかどうかだけの違いです。コトバンクに載る講談社のIT用語がわかる辞典は、「パラメーター」の項で「「パラメータ」「引数(ひきすう)」ともいう」と書き、ブリタニカ国際大百科事典の「パラメータ」の項は「媒介変数」のページを見るよう案内しています(2026年10月8日確認)。
AIの「70億パラメーター」とは何が70億あるのですか。
学習によって決まる数値(重みとバイアス)が70億個あるという意味です。Googleの機械学習用語集は、パラメータを「モデルがトレーニング中に学習する重みとバイアス」と説明しています。モデル名の「7B」は70億(B=10億)を表します。
パラメーターが多いAIほど賢いのですか。
一概にはいえません。IBMは、パラメーターを増やすとデータのより細かいパターンを捉えられるが、多すぎると過剰適合(学習データに合わせすぎること)のリスクがあると説明しています。MoE型は総数と実際に動く数(有効パラメーター)が大きく違い、Kimi K3は総2.8兆に対して有効104Bです。
ChatGPTやClaudeのパラメーター数は公開されていますか。
本記事が開いたAnthropic・OpenAI・Googleのモデル一覧と、Geminiのモデルカード(Gemini 3.8 Flash・Gemini 3.1 Pro)には、パラメーター数の記載は見当たりませんでした(2026年10月8日確認。非公開かどうかは確認していません)。数が公式に書かれていたのは、重みが公開されているKimi K3(2.8T)、gpt-oss-120b(117B)、GLM-5.3-Flash(320B)などです。
パラメーターと引数は同じ意味ですか。
プログラミングでは区別されます。Pythonの公式FAQは、仮引数(parameter)は関数の定義に出てくる名前、実引数(argument)は関数を呼ぶときに実際に渡す値と説明しています。ただし辞書には、引数をパラメーターと呼ぶ用例も載っています(講談社のIT用語がわかる辞典・カメラマン写真用語辞典)。
temperature(温度)はAIのパラメーターですか。
モデルの中の数値とは別の、人が決める設定です。IBMは、温度やtop-pサンプリングを推論ハイパーパラメーターと呼び、生成AIモデルがアウトプットを生成する方法を決めるものと説明しています。APIでは呼び出し時に渡す設定項目で、Anthropicの公式リファレンスは、Claude Opus 4.6より後に公開されたモデルでは1.0以外の値を400エラーで拒否すると書いています(2026年10月8日確認)。
シェア: ポスト はてブ

出典・参照資料

AI時短ラボ

大きいニュースはYouTubeでも解説しています。Xでは新着記事をお知らせしています。

コメント

まだコメントはありません。最初のコメントを書いてみませんか?

AIについて聞きたいことはありますか?

質問箱で無料で受け付けています。回答は公開され、他の方の参考にもなります。

質問箱を見る →

関連記事

LLM(エルエルエム)とは──大規模言語モデルのこと。大量の文章を学んで、次の言葉を予測しながら文章を書くAIの中身を、わかりやすく。生成AIとの違い・仕組み・主なLLMも【2026年10月版】。GPT-3の1,750億パラメータから、Kimi K3の2.8兆までの記事画像

LLM(エルエルエム)とは 大規模言語モデルのこと。大量の文章を学んで、次の言葉を予測しながら文章を書くAIの中身を、わかりやすく。生成AIとの違い・仕組み・主なLLMも【2026年10月版】。GPT-3の1,750億パラメータから、Kimi K3の2.8兆まで

活用
MoE(Mixture of Experts)とは──「総パラメータ」と「アクティブパラメータ」の読み分け方までの記事画像

MoE(Mixture of Experts)とは 「総パラメータ」と「アクティブパラメータ」の読み分け方まで

研究
SLM(小型言語モデル)とは──NVIDIAの論文は「民生用電子機器に収まり、1ユーザーの要求に低レイテンシで推論できる言語モデル」と定義し、目安は100億パラメータ未満。Raspberry Pi 5で動くGemma 4 E2B、Macで86〜90トークン/秒のLing-3.0-tiny、350MのLFM2.5、3BのGranite 4.2──実例で「小さいモデルに何ができるか」を整理するの記事画像

SLM(小型言語モデル)とは NVIDIAの論文は「民生用電子機器に収まり、1ユーザーの要求に低レイテンシで推論できる言語モデル」と定義し、目安は100億パラメータ未満。Raspberry Pi 5で動くGemma 4 E2B、Macで86〜90トークン/秒のLing-3.0-tiny、350MのLFM2.5、3BのGranite 4.2──実例で「小さいモデルに何ができるか」を整理する

研究
LoRAとは──元の重みを凍結し、小さな行列2つだけを学習する仕組み。原論文はGPT-3 175Bで「学習パラメータ1万分の1・GPUメモリ3分の1」、QLoRAは「65Bを48GB未満」。画像生成での使われ方と作り方の流れの記事画像

LoRAとは──元の重みを凍結し、小さな行列2つだけを学習する仕組み。原論文はGPT-3 175Bで「学習パラメータ1万分の1・GPUメモリ3分の1」、QLoRAは「65Bを48GB未満」。画像生成での使われ方と作り方の流れ

活用
トークンとは──ChatGPT・Claudeなど生成AIが文章を数える単位。日本語は筆者の実測で1文字ほぼ1トークン前後、API料金と一度に読める量の両方がこの数で決まる【2026年10月版】の記事画像

トークンとは──ChatGPT・Claudeなど生成AIが文章を数える単位。日本語は筆者の実測で1文字ほぼ1トークン前後、API料金と一度に読める量の両方がこの数で決まる【2026年10月版】

活用
コンテキストウィンドウとは──AIが一度に「見ていられる」量。主要モデルの現在値(API 100万トークン級)、ChatGPT・Geminiのプラン別上限、超えるとどうなるか、広ければいいわけではない理由の記事画像

コンテキストウィンドウとは AIが一度に「見ていられる」量。主要モデルの現在値(API 100万トークン級)、ChatGPT・Geminiのプラン別上限、超えるとどうなるか、広ければいいわけではない理由

研究
オープンウェイトとは何か──「オープンソース」との違いを一次資料で読み解くの記事画像

オープンウェイトとは何か 「オープンソース」との違いを一次資料で読み解く

活用
Liquid AIの小型モデルLFM2.5を「速く・正確に」する2本──①DSparkの草稿モデル(約300M)で投機的デコード、出力は同一のままH100で最大3.18倍・M4 Max MacBookで最大2.87倍、関数呼び出しの遅延を57%削減 ②350MモデルをGRPOで100ステップ(無料枠のColab)微調整し、構造化出力の遵守率をIFStructで22.6%→29.7%の記事画像

Liquid AIの小型モデルLFM2.5を「速く・正確に」する2本 ①DSparkの草稿モデル(約300M)で投機的デコード、出力は同一のままH100で最大3.18倍・M4 Max MacBookで最大2.87倍、関数呼び出しの遅延を57%削減 ②350MモデルをGRPOで100ステップ(無料枠のColab)微調整し、構造化出力の遵守率をIFStructで22.6%→29.7%

検証(発表 8月20日)