Ollamaとはインストール・使い方・料金【2026年10月版】。Mac・Windows・LinuxでオープンなLLMを無料で動かすソフト、ollama runで最初のモデルを動かし、localhost:11434のAPIとCloud(Pro月$20)まで
Ollamaは、オープンなAIモデルを自分のPCで動かすためのソフトで、公式サイトは「Local models are always free(ローカルのモデルは常に無料)」と書く。この記事は公式サイト・ドキュメント・GitHubを2026年10月2日11時すぎに取得し、Mac(macOS 14以上)・Windows(10 22H2以上)・Linuxの入れ方、ollama runの手順、localhost:11434のAPI、モデル一覧の見方、Cloud(Free $0・Pro月$20・Max月$100)、LM Studioとの違いを整理する。筆者のMacBook Pro(M5 Max・64GB)でgemma3:4b(3.3GB)を動かすと、出力速度は約146 tokens/sだった(1回の計測)。

目次
2026年10月2日・日本時間時点の情報です。 Ollamaは、オープンなAIモデルを自分のパソコンにダウンロードして動かすためのソフトで、公式トップページは「Local models are always free.」(訳:ローカルのモデルは常に無料)と書く。公式サイト・Docs・GitHubの記載と、筆者が自分のMacで実際に動かした結果から、入れ方・使い方・API・Cloudの料金を整理する。
3行まとめ
- Ollamaはオープンなモデルを自分のPCで動かすソフトで、ローカルで動かす分は無料。 入れ方はMac・Linuxが公式のinstall.shの1行(Macはdmgも・macOS 14以上)、WindowsがPowerShellの1行かOllamaSetup.exe(Windows 10 22H2以上)。ソースはMITライセンス。
- 最初の一歩は
ollama run gemma3:4b(3.3GB)のような1行。 筆者のMacBook Pro(M5 Max・64GB)とOllama 0.33.0では、gemma3:4bが日本語の依頼に読み込みを含めて1.99秒で答え、出力は約146 tokens/sだった(1回の計測)。APIは同じPCのhttp://localhost:11434で受け付ける。- 有料はクラウドの部分だけ。 料金ページはFree $0/Pro月$20(年払い月$16.67)/Max月$100/Team月$500(Early access)。Proは月$60分、Maxは月$300分の利用クレジットを含む。
Ollamaとは何か、無料か、読み方は
公式のトップ・README・Docsから実体を分けると、①モデルをダウンロードして自分のPCで実行する仕組み、②それを呼び出すコマンド(ollama)とAPI、③Claude CodeやCodexなどのエージェントソフトにつなぐ ollama launch、④Ollama側のサーバーでモデルを動かすCloud、の4つになる。
無料かどうか。 料金ページのFAQは「Running models on your own hardware is always unlimited.」(訳:自分の機器でモデルを動かすのは常に無制限)と書く。GitHubの ollama/ollama のライセンスは、筆者が10月2日にGitHubのAPIで取得した時点でMITだった。料金ページの範囲では、支払いが出るのはOllamaのクラウドのモデルを使う場合(後述)に限られる。
読み方。 本記事が取得した範囲(公式サイト・Docs全文・GitHubのREADME)には、発音やカタカナ表記を示した箇所が見当たらなかった(原文を「pronounc」「発音」で検索した)。
インストール:Mac・Windows・Linuxの公式手順
公式のダウンロードページ(https://ollama.com/download)は、macOS・Linux・Windowsを切り替えて表示する。
| OS | 公式が示す入れ方 | 公式が書く要件 |
|---|---|---|
| macOS | curl -fsSL https://ollama.com/install.sh | sh、または Ollama.dmg を手動でダウンロード |
macOS 14 Sonoma以上。Apple Mシリーズ(CPUとGPU)またはx86(CPUのみ) |
| Windows | irm https://ollama.com/install.ps1 | iex(PowerShell)、または OllamaSetup.exe |
Windows 10 22H2以上(Home・Pro)。NVIDIAは551.61以上のドライバー、AMD Radeonは ROCm v7/HIP7対応またはVulkan対応のドライバー |
| Linux | curl -fsSL https://ollama.com/install.sh | sh。手動インストールの手順もある |
NVIDIAはcompute capability 5.0以上・ドライバー550以上(5.0〜6.2は570以上)と、Docsのハードウェア対応のページに記載 |
| Docker | Docker Hub の公式イメージ ollama/ollama |
— |
Windowsのドキュメントによると、インストールに管理者権限は要らず、既定ではホームフォルダーに入る。バイナリ用に4GB以上の空きが要り、モデルは「数十〜数百GB」になりうる。インストール先は OllamaSetup.exe /DIR="d:\some\location"、モデルの保存先は環境変数 OLLAMA_MODELS で変えられる。
モデルの保存先は公式FAQによると、macOSが ~/.ollama/models、Linuxが /usr/share/ollama/.ollama/models、Windowsが C:\Users\%username%\.ollama\models だ。ディスクが足りない時の移し方と消し方はOllamaでディスクが埋まった時にやることにまとめてある。
最初のモデルを動かす:ollama run の手順と実測
公式のREADMEは、チャットの始め方を ollama run gemma4 と書く。公式Quickstartは、ローカルで試す例としてGemma 4 E2B(ダウンロードは約7.2GB)を挙げ、「8 GB of available VRAM, or unified memory on a Mac」(訳:空きVRAM 8GB、Macならユニファイドメモリ)を推奨し、「With less VRAM, Ollama can use system RAM, but responses may be slower.」(訳:VRAMが少ないとシステムRAMを使えるが、応答は遅くなりうる)と書く。
筆者は、ライブラリでサイズを確かめてgemma3:4b(表示は3.3GB・128Kコンテキスト)を動かした。このMacのOllamaはHomebrew版(/opt/homebrew/bin/ollama が Cellar/ollama/0.33.0 を指す)で、ollama serve を起動した時点のログは「total blobs: 0」、つまりモデルが1つも無い状態から始めている。
筆者がやった手順と結果(2026年10月2日・1回の計測)
| 項目 | 内容 |
|---|---|
| 機種 | MacBook Pro・Apple M5 Max・メモリ64GB(system_profiler) |
| Ollama | 0.33.0(/api/version の応答と、serveのログの「version 0.33.0」) |
| pull | ollama pull gemma3:4b。11時06分52秒から11時09分49秒(約3分)、表示は3.3GB。直後のモデル一覧のSIZEも3.3GB |
| 実行 | 11時09分53秒に ollama run gemma3:4b --verbose "日本語で、ローカルLLMとは何かを3文で説明して" |
| 実測値 | total duration 1.99秒(うちload duration 1.38秒)、prompt eval 25 tokens(220.99 tokens/s)、eval 72 tokens・0.493秒、eval rate 145.97 tokens/s |
| 動作中の確認 | ollama ps はSIZE 3.9GB・PROCESSOR 100% GPU・CONTEXT 131072・UNTIL「4 minutes from now」 |
出力は日本語の3文で、1文目が「ローカルLLM(Large Language Model)とは、クラウド上にない自分のコンピュータ上で動作する大規模言語モデルのことです。」と始まった。内容の正しさは検証していない。
ollama ps を見ると、ファイルは3.3GBだが読み込み後は3.9GB、コンテキスト長は131072(128K)だった。serveのログでは、OllamaはこのMacのGPUが使えるメモリを51.8 GiBと検出して既定のコンテキスト長を262144にしようとし、gemma3:4bの上限の131072に合わせていた。DocsのContext lengthのページは、既定値をVRAMに応じて「< 24 GiB VRAM: 4k context」「24-48 GiB VRAM: 32k context」「>= 48 GiB VRAM: 256k context」と書き、コンテキスト長を大きくすると要るメモリが増える、とする。メモリの少ないPCでは既定のコンテキストが短くなるので、この増え方がそのまま当てはまるとは限らない。
ollama run <モデル名> だけを実行すると、Quickstartの説明どおり、モデルが無ければダウンロードしてからチャットが始まる(終えるのは /bye)。公式FAQによると、モデルは既定で5分間メモリに残ってから降ろされ、すぐ降ろすには ollama stop を使う(APIなら keep_alive に0)。基本のコマンドは次のとおり(公式のCLIリファレンスに沿う)。
ollama run gemma3:4b # モデルを動かして対話(無ければ先にダウンロード)
ollama pull gemma3:4b # ダウンロードだけ
ollama ls # 入っているモデルの一覧
ollama ps # いま読み込まれているモデル
ollama stop gemma3:4b # メモリから降ろす
ollama rm gemma3:4b # モデルを消す
ollama launch claude # Claude Codeなどの外部アプリをOllamaのモデルでつなぐ
ollama launch は、READMEとCLIリファレンスによるとClaude Code・Codex・OpenCode・OpenClawなどを選べる。ローカルモデルでエージェントを動かした記録はローカルLLMでコーディングエージェントは実用になるかにある。
モデル一覧の見方と、メモリに合うモデルの選び方
公式のモデル一覧(https://ollama.com/library)は、筆者が10月2日11時すぎに「Popular」順で取得した時点で、先頭から llama3.1(120M Pulls)、deepseek-r1(93.3M)、nomic-embed-text(87.8M)、llama3.2(84.7M)、qwen2.5(41.5M)、gemma3(40.8M)、qwen3(38.6M)…と並んでいた。並びはPull(ダウンロード)数の多い順と一致しており、性能の順位ではない。各行には能力のタグ(tools・thinking・vision・embedding・audio・cloud)、サイズの選択肢(bは10億パラメータ)、Pull数・タグ数・最終更新が出る。
モデル個別のページには、タグごとのファイルサイズが書かれている。筆者が開いた範囲では、gemma3は 4b=3.3GB・12b=8.1GB・27b=17GB、qwen3は 4b=2.5GB・8b=5.2GB・14b=9.3GB・30b=19GBだった。「2 days ago」に更新と表示されたgemma4は、e2bが4.6GB〜7.5GB、e4bが6.6GB〜9.5GB、12bが7.7GB〜8.0GB、26bが16GB〜19GBと幅で表示されていた。Quickstartの「約7.2GB」はe2bの幅の中に入るが、どのタグを指すかはQuickstartに書かれていない。
メモリに合わせた選び方(公式の記載の範囲)。 本記事が確認した範囲では、公式Docsにモデルとメモリを網羅した対応表は無かった。目安として書かれているのは、Quickstartの「Gemma 4 E2B(約7.2GB)に空きVRAM 8GB」、上のContext lengthのページの既定値、OpenClawなど連携ソフトのページにある推奨ローカルモデルの目安(例:「gemma4 — Reasoning and code generation locally (~16 GB VRAM)」)などだ。実際には、自分のPCのユニファイドメモリ(Mac)かVRAM(GPU)の容量と、ライブラリにある候補タグのファイルサイズを比べ、余裕を見て小さいタグ(4bや1bなど)から試すことになる。
用途別のモデル選びはローカルLLMおすすめモデル10選とSLM(小型言語モデル)とはにある。
APIとして使う:localhost:11434
公式FAQは「Ollama binds 127.0.0.1 port 11434 by default.」(訳:Ollamaは既定で127.0.0.1の11434番ポートに結びつく)と書き、ネットワークに公開するには環境変数 OLLAMA_HOST を変える、と説明する。既定では自分のPCからしか届かない。
GitHubのAPIドキュメント(docs/api.md)にある /api/generate の例("stream": false)を、モデル名とプロンプトだけ手元のものに替えると次の形になる。
curl http://localhost:11434/api/generate -d '{
"model": "gemma3:4b",
"prompt": "日本語で、ローカルLLMとは何かを3文で説明して",
"stream": false
}'
筆者が11時09分55秒にこの内容のリクエストを送ると、JSONで "done": true、"done_reason": "stop" が返り、response に日本語の3文、eval_count が72、eval_duration が約0.49秒(72 tokens÷0.491秒=約147 tokens/s)、load_duration は約0.45ミリ秒だった。直前の ollama run で読み込み済みだったため、読み込み時間は1.38秒より大きく短い。
チャット形式は /api/chat、OpenAI互換は /v1/chat/completions・/v1/responses、Anthropic互換は /v1/messages で、Quickstartに各curl例がある。ライブラリは pip install ollama、npm i ollama。Windowsでは、Docsの例のとおりPowerShellの Invoke-WebRequest で呼べる。
Ollama Cloudとは何か、いくらか
公式DocsのCloudのページは「Run models in Ollama’s cloud from your apps or terminal. No model or app download required.」(訳:アプリやターミナルから、Ollamaのクラウドでモデルを動かす。モデルやアプリのダウンロードは要らない)と書く。使い方は2通りある。
- アプリ・CLIから:
ollamaを起動してサインインすると、クラウドのモデルを選べる。名前はgemma4:cloudのように:cloudを付ける。 - APIから:APIキーを作り、
https://ollama.com/api/chatにAuthorization: Bearerを付けて送る。モデル名はhttps://ollama.com/api/tagsが返す名前(例gemma4:31b)で、Ollamaのインストールは要らない。
料金ページ(10月2日11時05分ごろ取得)の内容は次のとおり。なお https://ollama.com/cloud を開くと、この料金ページへ転送される。
| プラン | 月額 | 公式の説明の要点 |
|---|---|---|
| Free | $0 | ローカル実行、スターターの利用クレジットとスターターのモデル。クレジットを足すと全モデル。サービス手数料なし |
| Pro | $20/月(年払い$200=月$16.67) | 月$60分の利用クレジット、より大きいProモデル、複数モデルの同時実行。「For shorter, well-defined day-to-day tasks」(短くて明確な日々の作業向け) |
| Max | $100/月 | 月$300分の利用クレジット、最新モデルへの早期アクセス、10の同時リクエスト |
| Team(Early access) | $500/月 | 人数無制限、月$1,000分のクレジットをチームで共有、一元的な請求と管理 |
| Enterprise | Custom(個別) | モデルのアクセス制御、予算の上限設定など |
クラウドモデルの従量単価は、料金ページに「100万トークンあたり」で載る。例として、gemma4は入力$0.14・出力$0.40、glm-5.3は入力$1.40・出力$4.40、kimi-k3は入力$3.00・出力$15.00だった。一部のモデルは「Off-Peak」(平日の12:00〜18:00 UTC以外と週末終日)の安い単価が別に載る。FAQによると、含まれる利用額はPro・Max・Teamで毎月、契約を始めた日と同じ日にリセットされる。
データの扱い。 公式トップページは「Your data is never trained on by any provider.」(訳:どの提供元にもデータは学習に使われない)と書く。ホスト先は、同じトップページに「US & Europe」と「US, Europe & Singapore」の2通りの表記があり、料金ページのFAQは「primarily in the United States」(主に米国)で、欧州とシンガポールに回すこともある、と書く。クラウド機能は、FAQによると環境変数 OLLAMA_NO_CLOUD=1 で無効にできる。筆者はOllama Cloudを契約・実行していない。
OllamaとLM Studioの違い
どちらもオープンなモデルを自分のPCで動かすソフトだ。各社の公式ページの表現を並べる。
| Ollama | LM Studio | |
|---|---|---|
| 主な入口 | ollama コマンドとAPI(デスクトップアプリもある) |
デスクトップアプリ。トップページはエージェント「Bionic」を前面に出す |
| ローカル実行の料金 | 無料(Local models are always free) | Free $0(Run local LLMs on your machine) |
| クラウド | Pro月$20・Max月$100・Team月$500(利用クレジット込み) | Bionic+ 月$20(米国ホストのKimi K3・GLM 5.3・DeepSeek V4 Flashなど)・Pro 月$100(利用上限5倍) |
| 実行の中身 | READMEは対応バックエンドにllama.cppを挙げる | 公式トップは「MLX and llama.cpp under the hood」 |
筆者が10月2日11時すぎに両社の料金ページを開き比べたところ、有料プランの金額($20と$100)は同じだが、Ollamaは含まれる利用額をドル($60・$300)で、LM StudioはProを「5× usage limits」と倍率で示し、そのまま比べられる書き方ではなかった。LM Studioの使い方はLM Studioの使い方と料金にある。
この記事が確かめていないこと
- 計測は1回だけ。 146 tokens/s は、M5 Max・64GB・Ollama 0.33.0・gemma3:4bで短い日本語の依頼を1回実行した値。8GBや16GBのPCでは測っていない。
- WindowsとLinuxでは実行していない。 手順と要件は公式ドキュメントの記載。Macでも、dmgやinstall.shでの新規インストールはしておらず、入っていたHomebrew版を使った。
- Ollama Cloudは契約・実行していない。 料金とデータの扱いは取得時点の公式ページの記載で、変わりうる。
Ollamaの公式サイト・Docs・GitHubと手元の実行ログ
公式ページは10月2日11時05分〜10分ごろ(Docs全文・Context length・OpenClawのページと ollama.com/cloud の転送先は11時16分〜20分ごろ)に curl で取得して保存し、数字と引用はその原文から取った。計測の数字は、計測時に保存したserveのログ・--verbose の出力・APIの応答JSON・ollama ps の出力から取った。
出典・参照資料
- 一次資料Ollama 公式トップページ(Run open models. Get more usage.・ローカルは常に無料・2026年10月2日11時05分ごろ取得) ↗
- 一次資料Download Ollama(macOS 14以上・インストールコマンド・2026年10月2日11時05分ごろ取得) ↗
- 一次資料Pricing · Ollama(Free/Pro/Max/Team/Enterprise・クラウドモデルの従量単価・2026年10月2日11時05分ごろ取得。ollama.com/cloud もこのページへ転送) ↗
- 一次資料Ollama Library(モデル一覧・Popular順・2026年10月2日11時05分ごろ取得) ↗
- 一次資料Library gemma3(gemma3:4b=3.3GBなどのサイズ・2026年10月2日11時06分ごろ取得) ↗
- 一次資料Library gemma4(e2b=4.6GB〜7.5GBなどのサイズ・2026年10月2日11時06分ごろ取得) ↗
- 一次資料Ollama GitHub README(インストールコマンド・REST APIの例・MITライセンス) ↗
- 一次資料Ollama GitHub docs/api.md(/api/generate の例・2026年10月2日11時05分ごろ取得) ↗
- 一次資料Quickstart — Ollama Docs(初回の手順・Gemma 4 E2Bの推奨メモリ・APIの例・2026年10月2日11時06分ごろ取得) ↗
- 一次資料Windows — Ollama Docs(システム要件・保存先・PowerShellからのAPI) ↗
- 一次資料macOS — Ollama Docs(システム要件・PATHへのリンク) ↗
- 一次資料Linux — Ollama Docs(インストール・手動インストール) ↗
- 一次資料Hardware support — Ollama Docs(NVIDIA・AMD・Metal) ↗
- 一次資料CLI Reference — Ollama Docs(run・pull・ls・ps・stop・launch・2026年10月2日11時10分ごろ取得) ↗
- 一次資料FAQ — Ollama Docs(11434番ポート・OLLAMA_HOST・5分でアンロード・OLLAMA_NO_CLOUD) ↗
- 一次資料Cloud — Ollama Docs(APIキー・クラウドモデルの呼び出し・データの扱い) ↗
- 一次資料Context length — Ollama Docs(VRAM別の既定のコンテキスト長・2026年10月2日11時20分ごろ取得) ↗
- 一次資料OpenClaw — Ollama Docs(推奨ローカルモデルとVRAMの目安・2026年10月2日11時20分ごろ取得) ↗
- 一次資料LM Studio 公式トップページ(Bionic・MLX and llama.cpp・2026年10月2日11時10分ごろ取得) ↗
- 一次資料LM Studio 料金ページ(Free $0・Bionic+ $20・Pro $100・2026年10月2日11時10分ごろ取得) ↗
大きいニュースはYouTubeでも解説しています。Xでは新着記事をお知らせしています。
コメント
まだコメントはありません。最初のコメントを書いてみませんか?
AIについて聞きたいことはありますか?
質問箱で無料で受け付けています。回答は公開され、他の方の参考にもなります。
質問箱を見る →