AI時短ラボ
検索
活用

文字起こしを無料でする方法パソコン・スマホ・録音ファイル別の手順と上限。Google ドキュメント/Word/iPhone/Pixel/文字起こしさん/Notta/Whisperを公式の記載で整理

執筆:約22分で読めます

録音ファイルを無料で文字起こしするなら、文字起こしさんは登録なしで3分、無料登録で毎日10分まで、Nottaのフリーは月120分(1回3分まで)、Whisperは上限なし(MIT、手元のPCで動かす)。マイクの音声をその場で文字にするなら、Googleドキュメント・Windows 11・Mac・iPhone・Pixelが標準機能で対応する。2026年10月2日に各社の公式ページを開いて、できること・日本語対応・時間の上限を表にした。

文字起こしを無料でする方法──パソコン・スマホ・録音ファイル別の手順と上限。Google ドキュメント/Word/iPhone/Pixel/文字起こしさん/Notta/Whisperを公式の記載で整理
目次

2026年10月2日・日本時間時点の情報です。 文字起こしを無料でする方法は、大きく3つに分かれる。マイクの音声をその場で文字にする標準機能(Googleドキュメント・Windows・Mac・iPhone・Pixel)、録音ファイルをアップロードして文字にするWebサービスの無料枠(文字起こしさん・Notta)、手元のパソコンで動かす無料ソフトのWhisperである。文字の正確さの比較はAI文字起こし 日本語精度比較と文字起こしAIの日本語比較に任せ、ここでは「無料でどこまでできるか」だけを扱う。

3行まとめ

  1. 録音ファイル(m4a・mp3など)を無料で文字にするなら、文字起こしさんは登録なしで3分まで・無料登録で毎日10分まで、Nottaのフリープランは月120分(1回3分まで・ファイルインポート月50個)。上限なしで使うなら、MITライセンスの Whisper を自分のパソコンで動かす。Microsoft 365 の契約者は、Wordのトランスクリプトでアップロードした音声を月300分まで文字にできる。
  2. その場の音声を文字にするなら、Googleドキュメントの「音声入力」(Chrome・Edge・Safari)、Windows 11の音声入力(Windowsキー+H)、Macの音声入力、iPhone 12以降のボイスメモ/メモ、Pixelのレコーダーについて、各社の公式ページが日本語の対応を書いている。Windowsのサウンドレコーダーは、本記事が読んだ公式FAQに文字起こしの記載がない。
  3. 会議や個人情報を含む録音は、どこで処理され、どこに保存されるかが各社で違う。文字起こしさんは「AIの学習に利用されません」と書き、無料分は最長30日で自動削除と書く。Nottaは料金ページで「AI学習なし」をエンタープライズの欄に載せている。

結論:手持ちの環境別に、無料で文字起こしする方法の一覧

各社の公式ページに書かれていることだけを並べた。「日本語」の列は、その公式ページが日本語の対応を書いているかどうか。

方法 入力 環境 日本語 時間・回数の上限(公式の記載)
Googleドキュメント「音声入力」 マイク(その場) パソコンのChrome・Edge・Safari 対応言語の一覧に「日本語」 上限の記載は読んだページに見当たらない
Windowsの音声入力(Windowsキー+H) マイク(その場) Windows 11 Windows 11の対応言語に「日本語」(Windows 10の一覧にはない) 上限の記載は読んだページに見当たらない
Macの音声入力 マイク(その場) Mac Appleの「利用できる機能」の一覧に「日本語(日本)」 長さの制限・タイムアウトなし。30秒音声がないと自動停止
Wordのトランスクリプト 録音ファイル(.wav .mp4 .m4a .mp3)/Wordで録音 Microsoft 365 の Word(Windows版・Web版) 対応言語に「日本語 (日本)」 アップロード音声は月300分(Microsoft 365)。Copilotライセンスは月30,000分
iPhoneのボイスメモ/メモ iPhoneで録音 iPhone 12以降 日本語を挙げる 上限の記載は読んだページに見当たらない
Pixelのレコーダー Pixelで録音 Google Pixel 3以降 日本語のリアルタイム文字起こしあり 1回の録音は最大18時間。文字起こしの上限の記載は見当たらない
文字起こしさん 音声・動画・画像・PDFのファイル Webブラウザ 100以上の言語と記載 登録なし3分/無料登録で毎日10分(1ファイルも10分まで)
Notta(フリー) ファイル/録音 Web・アプリ 今回の料金ページでは確認していない 月120分・1回3分まで・ファイルインポート月50個・AI要約月10回。料金ページの比較表では「文字起こしデータのダウンロード」の行がフリーの列だけ横線(有料プランの列はチェック)
Whisper 音声ファイル 自分のパソコン --language Japanese の例あり 上限なし(自分のパソコンの性能次第)

パソコンでは、何が無料で使えるか

Googleドキュメントの音声入力は、ファイルではなくマイクの音声を文字にする

Googleドキュメントのヘルプ「音声で入力、編集する」によると、手順は「[ツール] [音声入力] の順にクリックします。マイクのボックスが表示されます」、続けて「話す準備ができたら、マイクをクリックします」。動作するのは Chrome・Edge・Safari の最新バージョンで、対応言語の一覧に「日本語」がある。

このヘルプには、録音済みのファイルを読み込む方法の記載がない(筆者が日本語版を「録音」「アップロード」「音声ファイル」、英語版を「record」「upload」「audio file」で検索した結果)。録音済みのm4aやmp3は、後述のファイル向けの方法を使う。

Wordのトランスクリプトは、ファイルを渡せるが、Microsoft 365 の契約が前提

Microsoft サポートの「レコーディングの文字起こし」は「Word for Windows」「Web 用 Word」「OneNote」のタブに分かれ、どのタブにも次の2行がある。

  • 「Microsoft 365 サブスクリプションを持つユーザーは、アップロードされた音声を 1 か月あたり最大 300 分 までトランスクリプトを作成できます。」
  • 「Microsoft Copilot ライセンスを持つユーザーは、アップロードされた音声を 1 か月あたり最大 30,000 分まで文字起こしできます。」

Word for Windows のタブは「この機能は現在、商用テナントの Windows 上の Word for Microsoft 365 でのみ使用できます。」、Web 用 Word のタブは Edge か Chrome で Microsoft 365 にサインインして使う、と書く。

手順は、[ホーム]>[ディクテーション]のドロップダウン>[トランスクリプト]>[オーディオのアップロード]でファイルを選ぶ。形式は「.wav、.mp4、.m4a、.mp3」。ファイルの長さくらいまで時間がかかることがある。

無料のMicrosoftアカウントで使えると書いた箇所は、このページに見当たらなかった。トラブルシューティングの項には「トランスクリプトを開始するためのボタンが表示されない場合は、アクティブな Microsoft 365 サブスクリプションでサインインしていることを確認してください。」とあり、Microsoft 365 の契約が前提と読める。

Windowsのサウンドレコーダーは、録音する道具として書かれている

「Windows 用サウンド レコーダー アプリ: よく寄せられる質問」は、サウンドレコーダーを「録音ファイルごとに最大 3 時間のオーディオを録音できるアプリ」と説明する。このFAQの日本語版と英語版を「文字起こし」「テキスト」「音声認識」「transcri」「text」「speech」で検索したが、文字起こし機能の記載はどちらにもなかった(本記事が確認した範囲)。録った音声は、Word・Webサービス・Whisperなどに渡して文字にする。

その場の音声を文字にするなら、Windows 11には音声入力がある。Microsoft サポートによると、「ハードウェア キーボードで Windows キー + H キーを押します」で始め、「音声入力では、Azure Speech サービスを利用したオンライン音声認識が使用されます」。インターネット接続が必要で、Windows 11の対応言語に「日本語」がある。同じページのWindows 10のタブ(Windowsキー+Hのディクテーション)の対応言語に日本語はなく、「他の言語でディクテーションするには、Windows で音声認識を使用します」とある。

Macの音声入力は、長さの制限がなく、無音で止まる

Apple サポート「Macでメッセージや書類を音声入力する」によると、「システム設定」>「キーボード」で「音声入力」をオンにしてから、マイクキーか「音声入力」のショートカット、または「編集」>「音声入力を開始」で始める。長さについては「音声入力できるテキストの長さに制限はなく、タイムアウトもありません」「30秒間音声が検出されないと音声入力は自動的に停止します」。同ページが言語の確認先に挙げる Apple の「macOS Golden Gate - 利用できる機能」ページでは、「音声入力」の一覧に「日本語(日本)」がある。

スマホでは、何が無料で使えるか

iPhoneは、ボイスメモとメモが文字起こしを持つ

Apple サポート「iPhoneでボイスメモの文字起こしを表示する」には、こうある。「オーディオの文字起こしは、iPhone 12以降の英語(すべてのバリアント)、スペイン語、ポルトガル語、イタリア語、フランス語、ドイツ語、日本語、韓国語、簡体字中国語、または繁体字中国語で利用できます。一部の国や地域ではご利用いただけません。」同じ注記は、iPhoneユーザガイドのiOS 27版・iOS 26版・iOS 18版のどれにもある。

録音中は波形の上部から上にスワイプして文字起こしを見る。録音後は録音をタップして表示し、一部または全体をコピーできる。iOS 17以前の録音も、発話があれば開いたときに自動で文字起こしされる、と書かれている。

「メモ」アプリのページも、オーディオを録音して文字に起こせると書く。条件は「iPhone 12以降でデバイスの言語が英語、スペイン語、ポルトガル語、イタリア語、フランス語、ドイツ語、日本語、韓国語、簡体字中国語、または繁体字中国語に設定されている場合」。iPhone 15 Pro以降などが対象のApple Intelligenceは、文字起こしの要約の機能として別に書かれている。

Androidは、PixelのレコーダーがGoogleのヘルプで説明されている

Google Pixelヘルプによると、レコーダーは「Google Pixel 3 以降の Google Pixel と Google Pixel Tablet でご利用いただけます」とされ、「1 回の録音で最大 18 時間記録できます」。文字起こしのヘルプ「文字起こしを作成、編集、管理する」では、リアルタイムの文字起こしに使える言語の一覧に、Pixel 3〜5aとPixel 6以降のどちらにも「日本語」が載る。

文字起こしの要約は「Google Pixel 8 以降」で、日本語を含む7言語が対象、「5 分から最長 1 時間までの音声の録音に対応」。Pixel以外のAndroidの標準機能は、今回読んだページからは言えない。

Webサービスの無料枠は、何分まで使えるか

文字起こしさん:登録なしで3分、無料登録で毎日10分

文字起こしさんのトップページには次のように書かれている。「無料登録で毎日10分。1ファイルでも10分まで文字起こしできます。」「無料会員は本日の残り時間分、登録なしの場合は最初の3分が文字起こしされます。」対応形式は、音声が .mp3 .wav .wma .m4a .aifc .flac .aac .aiff、動画が .mp4 .mov .avi など、ほかに画像とPDF。1ファイル最大5時間・1GBまで、と記載されている。

有料プランは、料金ページによるとベーシック月1,100円(税込、音声24時間/月・1ファイル90分まで)、バリュー月2,200円(60時間/月・3時間まで)、プレミアム月3,300円(120時間/月・5時間まで)。60分の会議録音は、無料登録の1日10分には収まらない。

Notta:フリープランは月120分、1回3分まで

Nottaの料金ページ(日本語表示)の「フリー」の欄は、¥0・クレジットカード登録不要・1アカウントのみで、「文字起こし時間:120分/月」「1回につき3分まで文字起こし可能」「ファイルインポート:50個/月」「AI要約:10回/月」。比較表では連続録音時間が「3分」と出る。プレミアムは年払いで月1,185円相当(12か月一括14,220円)、文字起こし1,800分/月。

3日間無料トライアルについては、「無料トライアル期間終了後は、プレミアム年間プランで自動更新(課金)となります」と書かれ、自動更新を望まない場合はトライアルが終わる前に解約の手続きが必要、とも書かれている。

上限なしで使うなら、フリーソフトのWhisperを自分のパソコンで動かす

Whisperは、OpenAIが公開している音声認識モデルで、GitHubのREADMEは「Whisper's code and model weights are released under the MIT License.」(訳:Whisperのコードとモデルの重みはMITライセンスで公開されている)と書く。LICENSEファイルの冒頭も「MIT License」「Copyright (c) 2022 OpenAI」。

READMEの導入と使い方のコマンドは次のとおり(該当行をそのまま抜き出した。筆者はこのMacでこの手順を実行していない)。

pip install -U openai-whisper

# on MacOS using Homebrew (https://brew.sh/)
brew install ffmpeg

whisper audio.flac audio.mp3 audio.wav --model turbo
whisper japanese.wav --language Japanese

ffmpegはUbuntu・Windows向けの入れ方もREADMEにある。READMEは、環境によってはRustが必要なことと、必要なVRAMの目安(tiny・baseで約1GB、smallで約2GB、mediumで約5GB、turboで約6GB、largeで約10GB)も載せる。詳しい使い方はWhisper文字起こしの使い方に、有料のOpenAIのAPIはGPT Transcribeの記事に書いた。

このMacでWhisperを確かめたら、本家は入っておらず、whisper.cppが入っていた

筆者は10月2日13時31分、このMac(Apple M5 Max・メモリ64GB・macOS 26.6)で調べた。which whisper は該当なし、Pythonの import whisper と import mlx_whisper はどちらも ModuleNotFoundError。Homebrewには whisper.cpp 1.8.4(説明は「Port of OpenAI's Whisper model in C/C++」)が入っていた。

そこで、すでに入っていたwhisper.cppを使い、1回だけ計測した。say -v Kyoko で、自作の3文を合成音声にした(11.6秒)。人の声ではない。

今日は十月二日です。この音声は、文字起こしの実験のために作りました。無料で使えるソフトで、どこまで正しく書き起こせるかを確かめます。

モデル 文字起こしの結果 所要時間(1回・モデル読み込み込み)
ggml-small 今日は10月2日ですこの音声は文字起こしの実点のために作りました無料で使えるソフトでどこまで正しく書き起こせるかを確かめます 0.61秒
ggml-large-v3-turbo 今日は10月2日です。この音声は文字起こしの実験のために作りました。無料で使えるソフトでどこまで正しく書き起こせるかを確かめます。 1.09秒

smallは「実験」が「実点」になり、句点が出なかった。large-v3-turboは漢字を合わせたが、元の文にあった読点「、」は落ちた。どちらも「十月二日」は「10月2日」と数字で出力された。この計測は合成音声1本・各モデル1回きりで、人の声や雑音のある録音の精度を示すものではない。また whisper.cpp での結果で、pip版のWhisperで同じ結果になるとは限らない。

同じ音声をm4aに変換して whisper-cli に直接渡すと、「failed to read audio data as wav」というエラーになった。wav(ffmpeg -ar 16000 -ac 1 で変換)なら動いた。これはwhisper.cppの1.8.4でのことで、本家のpip版Whisperの挙動ではない。

m4a・mp3・YouTubeの動画は、どの方法になるか

  • m4a・mp3の録音ファイル:Wordのトランスクリプトは .m4a .mp3 を、文字起こしさんは両方を対応形式に挙げる。Nottaにはファイルインポートがある(フリーは月50個、ただし1回3分まで)。WhisperのREADMEはコマンド例に audio.mp3 を挙げる。ボイスメモやPixelのレコーダーで録った音声は、そのアプリ内で文字起こしを見られる。
  • YouTubeの動画:YouTubeヘルプによると、字幕付きの動画では説明欄の[文字起こしを表示]から全編の文字起こしを見られる。自動字幕は音声認識で作られ、日本語は対応言語に入る。ただしヘルプは「品質にばらつきが出る可能性があります」と書く。他人の動画の文字起こしを転載・再利用する場合の権利関係は、本記事では扱っていない。

会議の録音や個人情報を入れる前に、各社の記載を読む

どこで処理されるかは、方法ごとに公式の書き方が違う。

  • Googleドキュメント:「お使いのウェブブラウザによって音声入力サービスが制御されます」。ブラウザが音声の処理方法を決め、テキストをドキュメントに送る、という説明。
  • Windowsの音声入力:オンライン音声認識(Azure Speech)。
  • Macの音声入力:Siriサーバに送られるかデバイス上で処理されるかは、システム設定の「キーボード」で確認できる、と案内。
  • Pixelのレコーダー:要約は大規模言語モデルを使い「クラウドの安全な隔離環境で実行」。文字起こしのやり直しでは「音声ファイルが、Google サーバー上で処理されることがあります」。
  • Wordのトランスクリプト:録音は OneDrive の「トランスクリプトされたファイル」フォルダーに保存され、そこで削除できる。
  • 文字起こしさん:「アップロードされたファイルや文字起こし結果が、当社または外部AIのモデル学習に利用されることはありません」「お客様のファイルと文字起こし結果は、Google Cloudの東京リージョン(日本国内)で保管されます」「無料でご利用いただいたデータは、最長30日で自動的に削除されます」。
  • Notta:料金ページのプラン比較表では、「AI学習なし」の行はエンタープライズの列だけにチェックの印があり、フリー・プレミアム・ビジネスの列は横線。業種別特別プランの説明にも「AI学習なし」がある。フリーなどのデータの扱いは、このページからは分からない。
  • Whisper(自分のパソコン):手順上、音声ファイルを外部に送る必要はない。ただし、パソコン自体の管理は自分の責任になる。

生成AI全般の個人情報の扱いは生成AIに個人情報を入力して大丈夫?、会議向けのツールはAI議事録ツール おすすめ比較に。

無料の文字起こしで、公式ページから読み取れなかったこと

  • Googleドキュメント・Windows・iPhoneの時間の上限:読んだページには数字の記載が見当たらなかった(Pixelは1回の録音が最大18時間という記載のみ)。記載がないことと、制限がないことは別の話。
  • 正確さ:今回の計測は合成音声1本・2モデル各1回。人の声、複数人の会話、雑音の入る会議録音の精度は測っていない。
  • ページの変更:上限や対応端末は予告なく変わりうる。数字は10月2日13時台に取得した時点のもの。

出典:文字起こしを無料でする方法で参照した公式ページと取得の記録

取得は2026年10月2日13時31分〜13時49分(日本時間)。公式ページは curl で取得して本文を保存し、Nottaの料金ページはブラウザ自動操作(Playwright)で表示後の本文と比較表の印を確かめた。Whisperの有無と計測は、このMacで10月2日13時31分〜13時34分に実行した1回の結果である。

シェア: ポスト はてブ

出典・参照資料

AI時短ラボ

大きいニュースはYouTubeでも解説しています。Xでは新着記事をお知らせしています。

コメント

まだコメントはありません。最初のコメントを書いてみませんか?

AIについて聞きたいことはありますか?

質問箱で無料で受け付けています。回答は公開され、他の方の参考にもなります。

質問箱を見る →

関連記事

Whisper文字起こしの使い方・精度・無料で使う方法【2026年版】の記事画像

Whisper文字起こしの使い方・精度・無料で使う方法【2026年版】

活用
AI文字起こし 日本語精度比較──Whisper・Notta・AiNote他【2026年】の記事画像

AI文字起こし 日本語精度比較 Whisper・Notta・AiNote他【2026年】

活用
文字起こしAIの日本語比較──ランキングより先に「同じ10分音声」で試す選び方の記事画像

文字起こしAIの日本語比較 ランキングより先に「同じ10分音声」で試す選び方

活用
AI議事録ツール おすすめ比較──Zoom・Teams会議を自動文字起こし【2026年】の記事画像

AI議事録ツール おすすめ比較 Zoom・Teams会議を自動文字起こし【2026年】

活用
OpenAIが「4o」を外した文字起こしモデルを投入──GPT Transcribe・GPT Live Transcribeの料金と対応範囲の記事画像

OpenAIが「4o」を外した文字起こしモデルを投入 GPT Transcribe・GPT Live Transcribeの料金と対応範囲

プロダクト(発表 7月28日)
生成AIに個人情報を入力して大丈夫?──ChatGPT/Claude/Geminiの設定比較【2026年】の記事画像

生成AIに個人情報を入力して大丈夫? ChatGPT/Claude/Geminiの設定比較【2026年】

活用
FirefoxのAIブラウジング「Smart Window」(ベータ)がMistralのモデルで動く──フランスと北米から、英国・ドイツは年内。会話はMozillaのサーバーに既定で保存せず、Mistralはゼロデータ保持。ChatGPT Atlas・Perplexity Comet・Claude in Chromeに対する「オープンソース2社」の答えの記事画像

FirefoxのAIブラウジング「Smart Window」(ベータ)がMistralのモデルで動く フランスと北米から、英国・ドイツは年内。会話はMozillaのサーバーに既定で保存せず、Mistralはゼロデータ保持。ChatGPT Atlas・Perplexity Comet・Claude in Chromeに対する「オープンソース2社」の答え

プロダクト(発表 9月16日)
自分だけの検索エンジンを作る「Hister」──ブラウザ履歴もローカルファイルもMCP経由で検索対象にするの記事画像

自分だけの検索エンジンを作る「Hister」 ブラウザ履歴もローカルファイルもMCP経由で検索対象にする

検証