AI時短ラボ
検索
活用

Ollamaとはインストール・使い方・料金【2026年10月版】。Mac・Windows・LinuxでオープンなLLMを無料で動かすソフト、ollama runで最初のモデルを動かし、localhost:11434のAPIとCloud(Pro月$20)まで

執筆:約22分で読めます

Ollamaは、オープンなAIモデルを自分のPCで動かすためのソフトで、公式サイトは「Local models are always free(ローカルのモデルは常に無料)」と書く。この記事は公式サイト・ドキュメント・GitHubを2026年10月2日11時すぎに取得し、Mac(macOS 14以上)・Windows(10 22H2以上)・Linuxの入れ方、ollama runの手順、localhost:11434のAPI、モデル一覧の見方、Cloud(Free $0・Pro月$20・Max月$100)、LM Studioとの違いを整理する。筆者のMacBook Pro(M5 Max・64GB)でgemma3:4b(3.3GB)を動かすと、出力速度は約146 tokens/sだった(1回の計測)。

Ollamaとは──インストール・使い方・料金【2026年10月版】。Mac・Windows・LinuxでオープンなLLMを無料で動かすソフト、ollama runで最初のモデルを動かし、localhost:11434のAPIとCloud(Pro月$20)まで
目次

2026年10月2日・日本時間時点の情報です。 Ollamaは、オープンなAIモデルを自分のパソコンにダウンロードして動かすためのソフトで、公式トップページは「Local models are always free.」(訳:ローカルのモデルは常に無料)と書く。公式サイト・Docs・GitHubの記載と、筆者が自分のMacで実際に動かした結果から、入れ方・使い方・API・Cloudの料金を整理する。

3行まとめ

  1. Ollamaはオープンなモデルを自分のPCで動かすソフトで、ローカルで動かす分は無料。 入れ方はMac・Linuxが公式のinstall.shの1行(Macはdmgも・macOS 14以上)、WindowsがPowerShellの1行かOllamaSetup.exe(Windows 10 22H2以上)。ソースはMITライセンス。
  2. 最初の一歩は ollama run gemma3:4b(3.3GB)のような1行。 筆者のMacBook Pro(M5 Max・64GB)とOllama 0.33.0では、gemma3:4bが日本語の依頼に読み込みを含めて1.99秒で答え、出力は約146 tokens/sだった(1回の計測)。APIは同じPCの http://localhost:11434 で受け付ける。
  3. 有料はクラウドの部分だけ。 料金ページはFree $0/Pro月$20(年払い月$16.67)/Max月$100/Team月$500(Early access)。Proは月$60分、Maxは月$300分の利用クレジットを含む。

Ollamaとは何か、無料か、読み方は

公式のトップ・README・Docsから実体を分けると、①モデルをダウンロードして自分のPCで実行する仕組み、②それを呼び出すコマンド(ollama)とAPI、③Claude CodeやCodexなどのエージェントソフトにつなぐ ollama launch、④Ollama側のサーバーでモデルを動かすCloud、の4つになる。

無料かどうか。 料金ページのFAQは「Running models on your own hardware is always unlimited.」(訳:自分の機器でモデルを動かすのは常に無制限)と書く。GitHubの ollama/ollama のライセンスは、筆者が10月2日にGitHubのAPIで取得した時点でMITだった。料金ページの範囲では、支払いが出るのはOllamaのクラウドのモデルを使う場合(後述)に限られる。

読み方。 本記事が取得した範囲(公式サイト・Docs全文・GitHubのREADME)には、発音やカタカナ表記を示した箇所が見当たらなかった(原文を「pronounc」「発音」で検索した)。

インストール:Mac・Windows・Linuxの公式手順

公式のダウンロードページ(https://ollama.com/download)は、macOS・Linux・Windowsを切り替えて表示する。

OS 公式が示す入れ方 公式が書く要件
macOS curl -fsSL https://ollama.com/install.sh | sh、または Ollama.dmg を手動でダウンロード macOS 14 Sonoma以上。Apple Mシリーズ(CPUとGPU)またはx86(CPUのみ)
Windows irm https://ollama.com/install.ps1 | iex(PowerShell)、または OllamaSetup.exe Windows 10 22H2以上(Home・Pro)。NVIDIAは551.61以上のドライバー、AMD Radeonは ROCm v7/HIP7対応またはVulkan対応のドライバー
Linux curl -fsSL https://ollama.com/install.sh | sh。手動インストールの手順もある NVIDIAはcompute capability 5.0以上・ドライバー550以上(5.0〜6.2は570以上)と、Docsのハードウェア対応のページに記載
Docker Docker Hub の公式イメージ ollama/ollama —

Windowsのドキュメントによると、インストールに管理者権限は要らず、既定ではホームフォルダーに入る。バイナリ用に4GB以上の空きが要り、モデルは「数十〜数百GB」になりうる。インストール先は OllamaSetup.exe /DIR="d:\some\location"、モデルの保存先は環境変数 OLLAMA_MODELS で変えられる。

モデルの保存先は公式FAQによると、macOSが ~/.ollama/models、Linuxが /usr/share/ollama/.ollama/models、Windowsが C:\Users\%username%\.ollama\models だ。ディスクが足りない時の移し方と消し方はOllamaでディスクが埋まった時にやることにまとめてある。

最初のモデルを動かす:ollama run の手順と実測

公式のREADMEは、チャットの始め方を ollama run gemma4 と書く。公式Quickstartは、ローカルで試す例としてGemma 4 E2B(ダウンロードは約7.2GB)を挙げ、「8 GB of available VRAM, or unified memory on a Mac」(訳:空きVRAM 8GB、Macならユニファイドメモリ)を推奨し、「With less VRAM, Ollama can use system RAM, but responses may be slower.」(訳:VRAMが少ないとシステムRAMを使えるが、応答は遅くなりうる)と書く。

筆者は、ライブラリでサイズを確かめてgemma3:4b(表示は3.3GB・128Kコンテキスト)を動かした。このMacのOllamaはHomebrew版(/opt/homebrew/bin/ollama が Cellar/ollama/0.33.0 を指す)で、ollama serve を起動した時点のログは「total blobs: 0」、つまりモデルが1つも無い状態から始めている。

筆者がやった手順と結果(2026年10月2日・1回の計測)

項目 内容
機種 MacBook Pro・Apple M5 Max・メモリ64GB(system_profiler)
Ollama 0.33.0(/api/version の応答と、serveのログの「version 0.33.0」)
pull ollama pull gemma3:4b。11時06分52秒から11時09分49秒(約3分)、表示は3.3GB。直後のモデル一覧のSIZEも3.3GB
実行 11時09分53秒に ollama run gemma3:4b --verbose "日本語で、ローカルLLMとは何かを3文で説明して"
実測値 total duration 1.99秒(うちload duration 1.38秒)、prompt eval 25 tokens(220.99 tokens/s)、eval 72 tokens・0.493秒、eval rate 145.97 tokens/s
動作中の確認 ollama ps はSIZE 3.9GB・PROCESSOR 100% GPU・CONTEXT 131072・UNTIL「4 minutes from now」

出力は日本語の3文で、1文目が「ローカルLLM(Large Language Model)とは、クラウド上にない自分のコンピュータ上で動作する大規模言語モデルのことです。」と始まった。内容の正しさは検証していない。

ollama ps を見ると、ファイルは3.3GBだが読み込み後は3.9GB、コンテキスト長は131072(128K)だった。serveのログでは、OllamaはこのMacのGPUが使えるメモリを51.8 GiBと検出して既定のコンテキスト長を262144にしようとし、gemma3:4bの上限の131072に合わせていた。DocsのContext lengthのページは、既定値をVRAMに応じて「< 24 GiB VRAM: 4k context」「24-48 GiB VRAM: 32k context」「>= 48 GiB VRAM: 256k context」と書き、コンテキスト長を大きくすると要るメモリが増える、とする。メモリの少ないPCでは既定のコンテキストが短くなるので、この増え方がそのまま当てはまるとは限らない。

ollama run <モデル名> だけを実行すると、Quickstartの説明どおり、モデルが無ければダウンロードしてからチャットが始まる(終えるのは /bye)。公式FAQによると、モデルは既定で5分間メモリに残ってから降ろされ、すぐ降ろすには ollama stop を使う(APIなら keep_alive に0)。基本のコマンドは次のとおり(公式のCLIリファレンスに沿う)。

ollama run gemma3:4b      # モデルを動かして対話(無ければ先にダウンロード)
ollama pull gemma3:4b     # ダウンロードだけ
ollama ls                 # 入っているモデルの一覧
ollama ps                 # いま読み込まれているモデル
ollama stop gemma3:4b     # メモリから降ろす
ollama rm gemma3:4b       # モデルを消す
ollama launch claude      # Claude Codeなどの外部アプリをOllamaのモデルでつなぐ

ollama launch は、READMEとCLIリファレンスによるとClaude Code・Codex・OpenCode・OpenClawなどを選べる。ローカルモデルでエージェントを動かした記録はローカルLLMでコーディングエージェントは実用になるかにある。

モデル一覧の見方と、メモリに合うモデルの選び方

公式のモデル一覧(https://ollama.com/library)は、筆者が10月2日11時すぎに「Popular」順で取得した時点で、先頭から llama3.1(120M Pulls)、deepseek-r1(93.3M)、nomic-embed-text(87.8M)、llama3.2(84.7M)、qwen2.5(41.5M)、gemma3(40.8M)、qwen3(38.6M)…と並んでいた。並びはPull(ダウンロード)数の多い順と一致しており、性能の順位ではない。各行には能力のタグ(tools・thinking・vision・embedding・audio・cloud)、サイズの選択肢(bは10億パラメータ)、Pull数・タグ数・最終更新が出る。

モデル個別のページには、タグごとのファイルサイズが書かれている。筆者が開いた範囲では、gemma3は 4b=3.3GB・12b=8.1GB・27b=17GB、qwen3は 4b=2.5GB・8b=5.2GB・14b=9.3GB・30b=19GBだった。「2 days ago」に更新と表示されたgemma4は、e2bが4.6GB〜7.5GB、e4bが6.6GB〜9.5GB、12bが7.7GB〜8.0GB、26bが16GB〜19GBと幅で表示されていた。Quickstartの「約7.2GB」はe2bの幅の中に入るが、どのタグを指すかはQuickstartに書かれていない。

メモリに合わせた選び方(公式の記載の範囲)。 本記事が確認した範囲では、公式Docsにモデルとメモリを網羅した対応表は無かった。目安として書かれているのは、Quickstartの「Gemma 4 E2B(約7.2GB)に空きVRAM 8GB」、上のContext lengthのページの既定値、OpenClawなど連携ソフトのページにある推奨ローカルモデルの目安(例:「gemma4 — Reasoning and code generation locally (~16 GB VRAM)」)などだ。実際には、自分のPCのユニファイドメモリ(Mac)かVRAM(GPU)の容量と、ライブラリにある候補タグのファイルサイズを比べ、余裕を見て小さいタグ(4bや1bなど)から試すことになる。

用途別のモデル選びはローカルLLMおすすめモデル10選とSLM(小型言語モデル)とはにある。

APIとして使う:localhost:11434

公式FAQは「Ollama binds 127.0.0.1 port 11434 by default.」(訳:Ollamaは既定で127.0.0.1の11434番ポートに結びつく)と書き、ネットワークに公開するには環境変数 OLLAMA_HOST を変える、と説明する。既定では自分のPCからしか届かない。

GitHubのAPIドキュメント(docs/api.md)にある /api/generate の例("stream": false)を、モデル名とプロンプトだけ手元のものに替えると次の形になる。

curl http://localhost:11434/api/generate -d '{
  "model": "gemma3:4b",
  "prompt": "日本語で、ローカルLLMとは何かを3文で説明して",
  "stream": false
}'

筆者が11時09分55秒にこの内容のリクエストを送ると、JSONで "done": true、"done_reason": "stop" が返り、response に日本語の3文、eval_count が72、eval_duration が約0.49秒(72 tokens÷0.491秒=約147 tokens/s)、load_duration は約0.45ミリ秒だった。直前の ollama run で読み込み済みだったため、読み込み時間は1.38秒より大きく短い。

チャット形式は /api/chat、OpenAI互換は /v1/chat/completions・/v1/responses、Anthropic互換は /v1/messages で、Quickstartに各curl例がある。ライブラリは pip install ollama、npm i ollama。Windowsでは、Docsの例のとおりPowerShellの Invoke-WebRequest で呼べる。

Ollama Cloudとは何か、いくらか

公式DocsのCloudのページは「Run models in Ollama’s cloud from your apps or terminal. No model or app download required.」(訳:アプリやターミナルから、Ollamaのクラウドでモデルを動かす。モデルやアプリのダウンロードは要らない)と書く。使い方は2通りある。

  • アプリ・CLIから:ollama を起動してサインインすると、クラウドのモデルを選べる。名前は gemma4:cloud のように :cloud を付ける。
  • APIから:APIキーを作り、https://ollama.com/api/chat に Authorization: Bearer を付けて送る。モデル名は https://ollama.com/api/tags が返す名前(例 gemma4:31b)で、Ollamaのインストールは要らない。

料金ページ(10月2日11時05分ごろ取得)の内容は次のとおり。なお https://ollama.com/cloud を開くと、この料金ページへ転送される。

プラン 月額 公式の説明の要点
Free $0 ローカル実行、スターターの利用クレジットとスターターのモデル。クレジットを足すと全モデル。サービス手数料なし
Pro $20/月(年払い$200=月$16.67) 月$60分の利用クレジット、より大きいProモデル、複数モデルの同時実行。「For shorter, well-defined day-to-day tasks」(短くて明確な日々の作業向け)
Max $100/月 月$300分の利用クレジット、最新モデルへの早期アクセス、10の同時リクエスト
Team(Early access) $500/月 人数無制限、月$1,000分のクレジットをチームで共有、一元的な請求と管理
Enterprise Custom(個別) モデルのアクセス制御、予算の上限設定など

クラウドモデルの従量単価は、料金ページに「100万トークンあたり」で載る。例として、gemma4は入力$0.14・出力$0.40、glm-5.3は入力$1.40・出力$4.40、kimi-k3は入力$3.00・出力$15.00だった。一部のモデルは「Off-Peak」(平日の12:00〜18:00 UTC以外と週末終日)の安い単価が別に載る。FAQによると、含まれる利用額はPro・Max・Teamで毎月、契約を始めた日と同じ日にリセットされる。

データの扱い。 公式トップページは「Your data is never trained on by any provider.」(訳:どの提供元にもデータは学習に使われない)と書く。ホスト先は、同じトップページに「US & Europe」と「US, Europe & Singapore」の2通りの表記があり、料金ページのFAQは「primarily in the United States」(主に米国)で、欧州とシンガポールに回すこともある、と書く。クラウド機能は、FAQによると環境変数 OLLAMA_NO_CLOUD=1 で無効にできる。筆者はOllama Cloudを契約・実行していない。

OllamaとLM Studioの違い

どちらもオープンなモデルを自分のPCで動かすソフトだ。各社の公式ページの表現を並べる。

Ollama LM Studio
主な入口 ollama コマンドとAPI(デスクトップアプリもある) デスクトップアプリ。トップページはエージェント「Bionic」を前面に出す
ローカル実行の料金 無料(Local models are always free) Free $0(Run local LLMs on your machine)
クラウド Pro月$20・Max月$100・Team月$500(利用クレジット込み) Bionic+ 月$20(米国ホストのKimi K3・GLM 5.3・DeepSeek V4 Flashなど)・Pro 月$100(利用上限5倍)
実行の中身 READMEは対応バックエンドにllama.cppを挙げる 公式トップは「MLX and llama.cpp under the hood」

筆者が10月2日11時すぎに両社の料金ページを開き比べたところ、有料プランの金額($20と$100)は同じだが、Ollamaは含まれる利用額をドル($60・$300)で、LM StudioはProを「5× usage limits」と倍率で示し、そのまま比べられる書き方ではなかった。LM Studioの使い方はLM Studioの使い方と料金にある。

この記事が確かめていないこと

  • 計測は1回だけ。 146 tokens/s は、M5 Max・64GB・Ollama 0.33.0・gemma3:4bで短い日本語の依頼を1回実行した値。8GBや16GBのPCでは測っていない。
  • WindowsとLinuxでは実行していない。 手順と要件は公式ドキュメントの記載。Macでも、dmgやinstall.shでの新規インストールはしておらず、入っていたHomebrew版を使った。
  • Ollama Cloudは契約・実行していない。 料金とデータの扱いは取得時点の公式ページの記載で、変わりうる。

Ollamaの公式サイト・Docs・GitHubと手元の実行ログ

公式ページは10月2日11時05分〜10分ごろ(Docs全文・Context length・OpenClawのページと ollama.com/cloud の転送先は11時16分〜20分ごろ)に curl で取得して保存し、数字と引用はその原文から取った。計測の数字は、計測時に保存したserveのログ・--verbose の出力・APIの応答JSON・ollama ps の出力から取った。

シェア: ポスト はてブ

出典・参照資料

AI時短ラボ

大きいニュースはYouTubeでも解説しています。Xでは新着記事をお知らせしています。

コメント

まだコメントはありません。最初のコメントを書いてみませんか?

AIについて聞きたいことはありますか?

質問箱で無料で受け付けています。回答は公開され、他の方の参考にもなります。

質問箱を見る →

関連記事

LM Studioの使い方と料金【2026年9月版】──無料でローカルLLMを動かす手順(Mac M1〜M4・Windows・Linux、16GB推奨、4bit以上の量子化)、OpenAI互換API・MCP・文書チャット、新アプリ「Bionic」とBionic+ $20/Pro $100のクラウド(Kimi K3・GLM 5.3・DeepSeek V4 Flash、ZDR)の記事画像

LM Studioの使い方と料金【2026年9月版】 無料でローカルLLMを動かす手順(Mac M1〜M4・Windows・Linux、16GB推奨、4bit以上の量子化)、OpenAI互換API・MCP・文書チャット、新アプリ「Bionic」とBionic+ $20/Pro $100のクラウド(Kimi K3・GLM 5.3・DeepSeek V4 Flash、ZDR)

活用
ローカルLLMおすすめモデル10選──無料で動かせるAI【2026年版】の記事画像

ローカルLLMおすすめモデル10選 無料で動かせるAI【2026年版】

活用
Ollamaでディスクが埋まった時にやること──モデルの保存先変更と削除コマンドの記事画像

Ollamaでディスクが埋まった時にやること モデルの保存先変更と削除コマンド

活用
ローカルLLMでコーディングエージェントは実用になるか──Ollamaで動かした結果の記事画像

ローカルLLMでコーディングエージェントは実用になるか Ollamaで動かした結果

活用
Ollamaユーザー向けのデスクトップアプリ「ChatOSS」──ローカルモデルでコード・カンバン・独自アプリを1画面にまとめるの記事画像

Ollamaユーザー向けのデスクトップアプリ「ChatOSS」 ローカルモデルでコード・カンバン・独自アプリを1画面にまとめる

検証
SLM(小型言語モデル)とは──NVIDIAの論文は「民生用電子機器に収まり、1ユーザーの要求に低レイテンシで推論できる言語モデル」と定義し、目安は100億パラメータ未満。Raspberry Pi 5で動くGemma 4 E2B、Macで86〜90トークン/秒のLing-3.0-tiny、350MのLFM2.5、3BのGranite 4.2──実例で「小さいモデルに何ができるか」を整理するの記事画像

SLM(小型言語モデル)とは NVIDIAの論文は「民生用電子機器に収まり、1ユーザーの要求に低レイテンシで推論できる言語モデル」と定義し、目安は100億パラメータ未満。Raspberry Pi 5で動くGemma 4 E2B、Macで86〜90トークン/秒のLing-3.0-tiny、350MのLFM2.5、3BのGranite 4.2──実例で「小さいモデルに何ができるか」を整理する

研究
壊れたツール呼び出しを自動修復する──Unsloth Desktopの「Self-healing tool calling」を公式の実測データで読むの記事画像

壊れたツール呼び出しを自動修復する Unsloth Desktopの「Self-healing tool calling」を公式の実測データで読む

検証
DeepSeekの使い方【2026年9月版】──無料アプリ・Web版のログイン方法と機能、API(deepseek-flash/deepseek-v4-pro)の始め方とピーク・オフピーク料金、Claude Code・Codexから使う方法、データが中国のサーバーに置かれる点までの記事画像

DeepSeekの使い方【2026年9月版】 無料アプリ・Web版のログイン方法と機能、API(deepseek-flash/deepseek-v4-pro)の始め方とピーク・オフピーク料金、Claude Code・Codexから使う方法、データが中国のサーバーに置かれる点まで

活用