文字起こしを無料でする方法パソコン・スマホ・録音ファイル別の手順と上限。Google ドキュメント/Word/iPhone/Pixel/文字起こしさん/Notta/Whisperを公式の記載で整理
録音ファイルを無料で文字起こしするなら、文字起こしさんは登録なしで3分、無料登録で毎日10分まで、Nottaのフリーは月120分(1回3分まで)、Whisperは上限なし(MIT、手元のPCで動かす)。マイクの音声をその場で文字にするなら、Googleドキュメント・Windows 11・Mac・iPhone・Pixelが標準機能で対応する。2026年10月2日に各社の公式ページを開いて、できること・日本語対応・時間の上限を表にした。

目次
2026年10月2日・日本時間時点の情報です。 文字起こしを無料でする方法は、大きく3つに分かれる。マイクの音声をその場で文字にする標準機能(Googleドキュメント・Windows・Mac・iPhone・Pixel)、録音ファイルをアップロードして文字にするWebサービスの無料枠(文字起こしさん・Notta)、手元のパソコンで動かす無料ソフトのWhisperである。文字の正確さの比較はAI文字起こし 日本語精度比較と文字起こしAIの日本語比較に任せ、ここでは「無料でどこまでできるか」だけを扱う。
3行まとめ
- 録音ファイル(m4a・mp3など)を無料で文字にするなら、文字起こしさんは登録なしで3分まで・無料登録で毎日10分まで、Nottaのフリープランは月120分(1回3分まで・ファイルインポート月50個)。上限なしで使うなら、MITライセンスの Whisper を自分のパソコンで動かす。Microsoft 365 の契約者は、Wordのトランスクリプトでアップロードした音声を月300分まで文字にできる。
- その場の音声を文字にするなら、Googleドキュメントの「音声入力」(Chrome・Edge・Safari)、Windows 11の音声入力(Windowsキー+H)、Macの音声入力、iPhone 12以降のボイスメモ/メモ、Pixelのレコーダーについて、各社の公式ページが日本語の対応を書いている。Windowsのサウンドレコーダーは、本記事が読んだ公式FAQに文字起こしの記載がない。
- 会議や個人情報を含む録音は、どこで処理され、どこに保存されるかが各社で違う。文字起こしさんは「AIの学習に利用されません」と書き、無料分は最長30日で自動削除と書く。Nottaは料金ページで「AI学習なし」をエンタープライズの欄に載せている。
結論:手持ちの環境別に、無料で文字起こしする方法の一覧
各社の公式ページに書かれていることだけを並べた。「日本語」の列は、その公式ページが日本語の対応を書いているかどうか。
| 方法 | 入力 | 環境 | 日本語 | 時間・回数の上限(公式の記載) |
|---|---|---|---|---|
| Googleドキュメント「音声入力」 | マイク(その場) | パソコンのChrome・Edge・Safari | 対応言語の一覧に「日本語」 | 上限の記載は読んだページに見当たらない |
| Windowsの音声入力(Windowsキー+H) | マイク(その場) | Windows 11 | Windows 11の対応言語に「日本語」(Windows 10の一覧にはない) | 上限の記載は読んだページに見当たらない |
| Macの音声入力 | マイク(その場) | Mac | Appleの「利用できる機能」の一覧に「日本語(日本)」 | 長さの制限・タイムアウトなし。30秒音声がないと自動停止 |
| Wordのトランスクリプト | 録音ファイル(.wav .mp4 .m4a .mp3)/Wordで録音 | Microsoft 365 の Word(Windows版・Web版) | 対応言語に「日本語 (日本)」 | アップロード音声は月300分(Microsoft 365)。Copilotライセンスは月30,000分 |
| iPhoneのボイスメモ/メモ | iPhoneで録音 | iPhone 12以降 | 日本語を挙げる | 上限の記載は読んだページに見当たらない |
| Pixelのレコーダー | Pixelで録音 | Google Pixel 3以降 | 日本語のリアルタイム文字起こしあり | 1回の録音は最大18時間。文字起こしの上限の記載は見当たらない |
| 文字起こしさん | 音声・動画・画像・PDFのファイル | Webブラウザ | 100以上の言語と記載 | 登録なし3分/無料登録で毎日10分(1ファイルも10分まで) |
| Notta(フリー) | ファイル/録音 | Web・アプリ | 今回の料金ページでは確認していない | 月120分・1回3分まで・ファイルインポート月50個・AI要約月10回。料金ページの比較表では「文字起こしデータのダウンロード」の行がフリーの列だけ横線(有料プランの列はチェック) |
| Whisper | 音声ファイル | 自分のパソコン | --language Japanese の例あり |
上限なし(自分のパソコンの性能次第) |
パソコンでは、何が無料で使えるか
Googleドキュメントの音声入力は、ファイルではなくマイクの音声を文字にする
Googleドキュメントのヘルプ「音声で入力、編集する」によると、手順は「[ツール] [音声入力] の順にクリックします。マイクのボックスが表示されます」、続けて「話す準備ができたら、マイクをクリックします」。動作するのは Chrome・Edge・Safari の最新バージョンで、対応言語の一覧に「日本語」がある。
このヘルプには、録音済みのファイルを読み込む方法の記載がない(筆者が日本語版を「録音」「アップロード」「音声ファイル」、英語版を「record」「upload」「audio file」で検索した結果)。録音済みのm4aやmp3は、後述のファイル向けの方法を使う。
Wordのトランスクリプトは、ファイルを渡せるが、Microsoft 365 の契約が前提
Microsoft サポートの「レコーディングの文字起こし」は「Word for Windows」「Web 用 Word」「OneNote」のタブに分かれ、どのタブにも次の2行がある。
- 「Microsoft 365 サブスクリプションを持つユーザーは、アップロードされた音声を 1 か月あたり最大 300 分 までトランスクリプトを作成できます。」
- 「Microsoft Copilot ライセンスを持つユーザーは、アップロードされた音声を 1 か月あたり最大 30,000 分まで文字起こしできます。」
Word for Windows のタブは「この機能は現在、商用テナントの Windows 上の Word for Microsoft 365 でのみ使用できます。」、Web 用 Word のタブは Edge か Chrome で Microsoft 365 にサインインして使う、と書く。
手順は、[ホーム]>[ディクテーション]のドロップダウン>[トランスクリプト]>[オーディオのアップロード]でファイルを選ぶ。形式は「.wav、.mp4、.m4a、.mp3」。ファイルの長さくらいまで時間がかかることがある。
無料のMicrosoftアカウントで使えると書いた箇所は、このページに見当たらなかった。トラブルシューティングの項には「トランスクリプトを開始するためのボタンが表示されない場合は、アクティブな Microsoft 365 サブスクリプションでサインインしていることを確認してください。」とあり、Microsoft 365 の契約が前提と読める。
Windowsのサウンドレコーダーは、録音する道具として書かれている
「Windows 用サウンド レコーダー アプリ: よく寄せられる質問」は、サウンドレコーダーを「録音ファイルごとに最大 3 時間のオーディオを録音できるアプリ」と説明する。このFAQの日本語版と英語版を「文字起こし」「テキスト」「音声認識」「transcri」「text」「speech」で検索したが、文字起こし機能の記載はどちらにもなかった(本記事が確認した範囲)。録った音声は、Word・Webサービス・Whisperなどに渡して文字にする。
その場の音声を文字にするなら、Windows 11には音声入力がある。Microsoft サポートによると、「ハードウェア キーボードで Windows キー + H キーを押します」で始め、「音声入力では、Azure Speech サービスを利用したオンライン音声認識が使用されます」。インターネット接続が必要で、Windows 11の対応言語に「日本語」がある。同じページのWindows 10のタブ(Windowsキー+Hのディクテーション)の対応言語に日本語はなく、「他の言語でディクテーションするには、Windows で音声認識を使用します」とある。
Macの音声入力は、長さの制限がなく、無音で止まる
Apple サポート「Macでメッセージや書類を音声入力する」によると、「システム設定」>「キーボード」で「音声入力」をオンにしてから、マイクキーか「音声入力」のショートカット、または「編集」>「音声入力を開始」で始める。長さについては「音声入力できるテキストの長さに制限はなく、タイムアウトもありません」「30秒間音声が検出されないと音声入力は自動的に停止します」。同ページが言語の確認先に挙げる Apple の「macOS Golden Gate - 利用できる機能」ページでは、「音声入力」の一覧に「日本語(日本)」がある。
スマホでは、何が無料で使えるか
iPhoneは、ボイスメモとメモが文字起こしを持つ
Apple サポート「iPhoneでボイスメモの文字起こしを表示する」には、こうある。「オーディオの文字起こしは、iPhone 12以降の英語(すべてのバリアント)、スペイン語、ポルトガル語、イタリア語、フランス語、ドイツ語、日本語、韓国語、簡体字中国語、または繁体字中国語で利用できます。一部の国や地域ではご利用いただけません。」同じ注記は、iPhoneユーザガイドのiOS 27版・iOS 26版・iOS 18版のどれにもある。
録音中は波形の上部から上にスワイプして文字起こしを見る。録音後は録音をタップして表示し、一部または全体をコピーできる。iOS 17以前の録音も、発話があれば開いたときに自動で文字起こしされる、と書かれている。
「メモ」アプリのページも、オーディオを録音して文字に起こせると書く。条件は「iPhone 12以降でデバイスの言語が英語、スペイン語、ポルトガル語、イタリア語、フランス語、ドイツ語、日本語、韓国語、簡体字中国語、または繁体字中国語に設定されている場合」。iPhone 15 Pro以降などが対象のApple Intelligenceは、文字起こしの要約の機能として別に書かれている。
Androidは、PixelのレコーダーがGoogleのヘルプで説明されている
Google Pixelヘルプによると、レコーダーは「Google Pixel 3 以降の Google Pixel と Google Pixel Tablet でご利用いただけます」とされ、「1 回の録音で最大 18 時間記録できます」。文字起こしのヘルプ「文字起こしを作成、編集、管理する」では、リアルタイムの文字起こしに使える言語の一覧に、Pixel 3〜5aとPixel 6以降のどちらにも「日本語」が載る。
文字起こしの要約は「Google Pixel 8 以降」で、日本語を含む7言語が対象、「5 分から最長 1 時間までの音声の録音に対応」。Pixel以外のAndroidの標準機能は、今回読んだページからは言えない。
Webサービスの無料枠は、何分まで使えるか
文字起こしさん:登録なしで3分、無料登録で毎日10分
文字起こしさんのトップページには次のように書かれている。「無料登録で毎日10分。1ファイルでも10分まで文字起こしできます。」「無料会員は本日の残り時間分、登録なしの場合は最初の3分が文字起こしされます。」対応形式は、音声が .mp3 .wav .wma .m4a .aifc .flac .aac .aiff、動画が .mp4 .mov .avi など、ほかに画像とPDF。1ファイル最大5時間・1GBまで、と記載されている。
有料プランは、料金ページによるとベーシック月1,100円(税込、音声24時間/月・1ファイル90分まで)、バリュー月2,200円(60時間/月・3時間まで)、プレミアム月3,300円(120時間/月・5時間まで)。60分の会議録音は、無料登録の1日10分には収まらない。
Notta:フリープランは月120分、1回3分まで
Nottaの料金ページ(日本語表示)の「フリー」の欄は、¥0・クレジットカード登録不要・1アカウントのみで、「文字起こし時間:120分/月」「1回につき3分まで文字起こし可能」「ファイルインポート:50個/月」「AI要約:10回/月」。比較表では連続録音時間が「3分」と出る。プレミアムは年払いで月1,185円相当(12か月一括14,220円)、文字起こし1,800分/月。
3日間無料トライアルについては、「無料トライアル期間終了後は、プレミアム年間プランで自動更新(課金)となります」と書かれ、自動更新を望まない場合はトライアルが終わる前に解約の手続きが必要、とも書かれている。
上限なしで使うなら、フリーソフトのWhisperを自分のパソコンで動かす
Whisperは、OpenAIが公開している音声認識モデルで、GitHubのREADMEは「Whisper's code and model weights are released under the MIT License.」(訳:Whisperのコードとモデルの重みはMITライセンスで公開されている)と書く。LICENSEファイルの冒頭も「MIT License」「Copyright (c) 2022 OpenAI」。
READMEの導入と使い方のコマンドは次のとおり(該当行をそのまま抜き出した。筆者はこのMacでこの手順を実行していない)。
pip install -U openai-whisper
# on MacOS using Homebrew (https://brew.sh/)
brew install ffmpeg
whisper audio.flac audio.mp3 audio.wav --model turbo
whisper japanese.wav --language Japanese
ffmpegはUbuntu・Windows向けの入れ方もREADMEにある。READMEは、環境によってはRustが必要なことと、必要なVRAMの目安(tiny・baseで約1GB、smallで約2GB、mediumで約5GB、turboで約6GB、largeで約10GB)も載せる。詳しい使い方はWhisper文字起こしの使い方に、有料のOpenAIのAPIはGPT Transcribeの記事に書いた。
このMacでWhisperを確かめたら、本家は入っておらず、whisper.cppが入っていた
筆者は10月2日13時31分、このMac(Apple M5 Max・メモリ64GB・macOS 26.6)で調べた。which whisper は該当なし、Pythonの import whisper と import mlx_whisper はどちらも ModuleNotFoundError。Homebrewには whisper.cpp 1.8.4(説明は「Port of OpenAI's Whisper model in C/C++」)が入っていた。
そこで、すでに入っていたwhisper.cppを使い、1回だけ計測した。say -v Kyoko で、自作の3文を合成音声にした(11.6秒)。人の声ではない。
今日は十月二日です。この音声は、文字起こしの実験のために作りました。無料で使えるソフトで、どこまで正しく書き起こせるかを確かめます。
| モデル | 文字起こしの結果 | 所要時間(1回・モデル読み込み込み) |
|---|---|---|
| ggml-small | 今日は10月2日ですこの音声は文字起こしの実点のために作りました無料で使えるソフトでどこまで正しく書き起こせるかを確かめます | 0.61秒 |
| ggml-large-v3-turbo | 今日は10月2日です。この音声は文字起こしの実験のために作りました。無料で使えるソフトでどこまで正しく書き起こせるかを確かめます。 | 1.09秒 |
smallは「実験」が「実点」になり、句点が出なかった。large-v3-turboは漢字を合わせたが、元の文にあった読点「、」は落ちた。どちらも「十月二日」は「10月2日」と数字で出力された。この計測は合成音声1本・各モデル1回きりで、人の声や雑音のある録音の精度を示すものではない。また whisper.cpp での結果で、pip版のWhisperで同じ結果になるとは限らない。
同じ音声をm4aに変換して whisper-cli に直接渡すと、「failed to read audio data as wav」というエラーになった。wav(ffmpeg -ar 16000 -ac 1 で変換)なら動いた。これはwhisper.cppの1.8.4でのことで、本家のpip版Whisperの挙動ではない。
m4a・mp3・YouTubeの動画は、どの方法になるか
- m4a・mp3の録音ファイル:Wordのトランスクリプトは .m4a .mp3 を、文字起こしさんは両方を対応形式に挙げる。Nottaにはファイルインポートがある(フリーは月50個、ただし1回3分まで)。WhisperのREADMEはコマンド例に audio.mp3 を挙げる。ボイスメモやPixelのレコーダーで録った音声は、そのアプリ内で文字起こしを見られる。
- YouTubeの動画:YouTubeヘルプによると、字幕付きの動画では説明欄の[文字起こしを表示]から全編の文字起こしを見られる。自動字幕は音声認識で作られ、日本語は対応言語に入る。ただしヘルプは「品質にばらつきが出る可能性があります」と書く。他人の動画の文字起こしを転載・再利用する場合の権利関係は、本記事では扱っていない。
会議の録音や個人情報を入れる前に、各社の記載を読む
どこで処理されるかは、方法ごとに公式の書き方が違う。
- Googleドキュメント:「お使いのウェブブラウザによって音声入力サービスが制御されます」。ブラウザが音声の処理方法を決め、テキストをドキュメントに送る、という説明。
- Windowsの音声入力:オンライン音声認識(Azure Speech)。
- Macの音声入力:Siriサーバに送られるかデバイス上で処理されるかは、システム設定の「キーボード」で確認できる、と案内。
- Pixelのレコーダー:要約は大規模言語モデルを使い「クラウドの安全な隔離環境で実行」。文字起こしのやり直しでは「音声ファイルが、Google サーバー上で処理されることがあります」。
- Wordのトランスクリプト:録音は OneDrive の「トランスクリプトされたファイル」フォルダーに保存され、そこで削除できる。
- 文字起こしさん:「アップロードされたファイルや文字起こし結果が、当社または外部AIのモデル学習に利用されることはありません」「お客様のファイルと文字起こし結果は、Google Cloudの東京リージョン(日本国内)で保管されます」「無料でご利用いただいたデータは、最長30日で自動的に削除されます」。
- Notta:料金ページのプラン比較表では、「AI学習なし」の行はエンタープライズの列だけにチェックの印があり、フリー・プレミアム・ビジネスの列は横線。業種別特別プランの説明にも「AI学習なし」がある。フリーなどのデータの扱いは、このページからは分からない。
- Whisper(自分のパソコン):手順上、音声ファイルを外部に送る必要はない。ただし、パソコン自体の管理は自分の責任になる。
生成AI全般の個人情報の扱いは生成AIに個人情報を入力して大丈夫?、会議向けのツールはAI議事録ツール おすすめ比較に。
無料の文字起こしで、公式ページから読み取れなかったこと
- Googleドキュメント・Windows・iPhoneの時間の上限:読んだページには数字の記載が見当たらなかった(Pixelは1回の録音が最大18時間という記載のみ)。記載がないことと、制限がないことは別の話。
- 正確さ:今回の計測は合成音声1本・2モデル各1回。人の声、複数人の会話、雑音の入る会議録音の精度は測っていない。
- ページの変更:上限や対応端末は予告なく変わりうる。数字は10月2日13時台に取得した時点のもの。
出典:文字起こしを無料でする方法で参照した公式ページと取得の記録
取得は2026年10月2日13時31分〜13時49分(日本時間)。公式ページは curl で取得して本文を保存し、Nottaの料金ページはブラウザ自動操作(Playwright)で表示後の本文と比較表の印を確かめた。Whisperの有無と計測は、このMacで10月2日13時31分〜13時34分に実行した1回の結果である。
出典・参照資料
- 一次資料音声で入力、編集する — Google ドキュメント エディタ ヘルプ(日本語・ツール>音声入力・対応ブラウザ・日本語の対応・2026年10月2日13:31取得、13:46に日英で再取得) ↗
- 一次資料レコーディングの文字起こし — Microsoft サポート(日本語・Word for Windows/Web 用 Word/OneNoteのタブ・対応形式・月300分・Microsoft 365 サブスクリプションでのサインイン・2026年10月2日13:32取得) ↗
- 一次資料Windows 用サウンド レコーダー アプリ: よく寄せられる質問 — Microsoft サポート(日本語・録音は1ファイル最大3時間・2026年10月2日13:33取得) ↗
- 一次資料音声入力を使用して、PC 上でタイプをする代わりに話す — Microsoft サポート(日本語・Windowsキー+H・Azure Speechのオンライン音声認識・Windows 11とWindows 10の対応言語・2026年10月2日13:33取得) ↗
- 一次資料Macでメッセージや書類を音声入力する — Apple サポート(日本語・音声入力の長さの制限・Siriサーバへの送信・2026年10月2日13:32取得) ↗
- 一次資料macOS Golden Gate - 利用できる機能 — Apple(日本)(音声入力の対応言語に日本語(日本)・2026年10月2日13:46取得) ↗
- 一次資料iPhoneでボイスメモの文字起こしを表示する — Apple サポート(日本語・iPhone 12以降・日本語の対応・iOS 27版を13:32取得、iOS 26版・iOS 18版を13:46取得) ↗
- 一次資料iPhoneの「メモ」でオーディオを録音して文字に起こす — Apple サポート(日本語・2026年10月2日13:32取得) ↗
- 一次資料Google Pixel デバイスで録音を作成、編集、削除する — Google Pixel ヘルプ(日本語・Pixel 3以降・1回の録音は最大18時間・2026年10月2日13:44取得) ↗
- 一次資料文字起こしを作成、編集、管理する — Google Pixel ヘルプ(日本語・レコーダー・日本語のリアルタイム文字起こし・要約はPixel 8以降・2026年10月2日13:32取得) ↗
- 一次資料動画の文字起こしを表示する — YouTube ヘルプ(日本語・2026年10月2日13:34取得) ↗
- 一次資料自動字幕起こし機能を使用する — YouTube ヘルプ(日本語・品質のばらつき・日本語の対応・2026年10月2日13:34取得) ↗
- 一次資料文字起こしさん(トップページ・対応形式・無料の分数・セキュリティの記載・2026年10月2日13:31取得) ↗
- 一次資料AI文字起こし料金 — 文字起こしさん(有料プランの月額・2026年10月2日13:33取得) ↗
- 一次資料料金プラン — Notta(日本語表示・フリーの月120分・1回3分・ファイルインポート50個・比較表の「AI学習なし」の行・Playwrightで2026年10月2日13:33と13:48に取得) ↗
- 一次資料openai/whisper — GitHub README(インストール手順・モデル表・コマンド例・ライセンス・2026年10月2日13:31取得) ↗
- 一次資料openai/whisper — LICENSE(MIT License・2026年10月2日13:31取得) ↗
大きいニュースはYouTubeでも解説しています。Xでは新着記事をお知らせしています。
コメント
まだコメントはありません。最初のコメントを書いてみませんか?
AIについて聞きたいことはありますか?
質問箱で無料で受け付けています。回答は公開され、他の方の参考にもなります。
質問箱を見る →