AI時短ラボ
検索

音声AI・文字起こしの記事

「音声AI・文字起こし」に関連するAIニュースと解説、26本。新しい順に並べています。

解除

音声AI・文字起こし の記事:26件

Google ADKに「ライブ・音声エージェントの評価」──模擬ユーザーがGemini TTSで話し、音声の返答をルーブリックで採点。名前確認→生年月日の検証(ツール呼び出し)→予約案内の3段ワークフローを、会話計画とペルソナ(NOVICE等)で即興させるか台本どおりに回す。test_config.jsonのlive_model_configを外せば同じケースをテキストで実行、CI/CDにもの記事画像

Google ADKに「ライブ・音声エージェントの評価」 模擬ユーザーがGemini TTSで話し、音声の返答をルーブリックで採点。名前確認→生年月日の検証(ツール呼び出し)→予約案内の3段ワークフローを、会話計画とペルソナ(NOVICE等)で即興させるか台本どおりに回す。test_config.jsonのlive_model_configを外せば同じケースをテキストで実行、CI/CDにも

検証(発表 8月24日)
Introducing Gemini 3.8 Flash TTS and 3.8 Flash-Lite TTS(Google公式ブログのタイトルカード)

Google、Gemini 3.8 Flash TTSと3.8 Flash-Lite TTSを発表 9/15公開の3.8 Liveとは別の読み上げ専用モデル、既製の声は2,000種類超、音声出力は10秒$0.0015〜$0.00225(2026年内)

モデル
Googleが「300言語超・70億人・世界人口の86%」と数字を出した言語AIの現在地──Gemini 3.5 Live Translateは70言語・2,000超の言語ペア、目標は「話者数上位1,000言語」、端末内翻訳TranslateGemmaは55言語、フィーチャーフォンでもGeminiの記事画像

Googleが「300言語超・70億人・世界人口の86%」と数字を出した言語AIの現在地 Gemini 3.5 Live Translateは70言語・2,000超の言語ペア、目標は「話者数上位1,000言語」、端末内翻訳TranslateGemmaは55言語、フィーチャーフォンでもGemini

研究
Introducing GPT-Live-1 in the API(OpenAI公式の画像)

OpenAI、全二重の音声モデル「GPT-Live-1」をAPIで提供 1分$0.05(秒単位課金)の会話層に、推論とツールはGPT-6 Astraなど後ろのモデルへ委任。Full Duplex BenchでGPT-Realtime-2.1より30ポイント上、電話(SIP)対応、声は12種類

プロダクト
Alibaba、Qwen3.8-Omni-Flashを発表──音声1時間の入力が1セント未満、会議の文字起こしはDER 88.1→3.4、Gemini 3.8 Flashに音声で上・動画推論で下、重みは非公開の記事画像動画

Alibaba、Qwen3.8-Omni-Flashを発表 音声1時間の入力が1セント未満、会議の文字起こしはDER 88.1→3.4、Gemini 3.8 Flashに音声で上・動画推論で下、重みは非公開

モデル
Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking(Google公式ブログの画像)

Gemini 3.8 Liveと3.8 Live Extended Thinking公開 話しながら裏で考えて道具を動かす音声モデル、Artificial Analysisの音声対話指数で首位、音声は1分あたり入力$0.005・出力$0.018

モデル
ByteDanceが「見ながら聞きながら話す」全二重AIを実運用投入──音声だけのGPT系リアルタイムAIとの違いはどこにあるかの記事画像

ByteDanceが「見ながら聞きながら話す」全二重AIを実運用投入 音声だけのGPT系リアルタイムAIとの違いはどこにあるか

モデル
RedNoteのdots3-noteをllama.cppがサポート──280Bのマルチモーダル、動くのは16B、Apache 2.0の記事画像

RedNoteのdots3-noteをllama.cppがサポート 280Bのマルチモーダル、動くのは16B、Apache 2.0

モデル
5分のフル楽曲を生成するMiniMax Music 3、重みが公開──8B+0.6Bの2段構えLLMとFlow Matchingで歌詞から曲を作るの記事画像

5分のフル楽曲を生成するMiniMax Music 3、重みが公開 8B+0.6Bの2段構えLLMとFlow Matchingで歌詞から曲を作る

モデル
grok-voice-latestが裏側でThink Fast 2.0に切り替わった日──8月5日、気づかれずに起きたルーティング変更の記事画像

grok-voice-latestが裏側でThink Fast 2.0に切り替わった日 8月5日、気づかれずに起きたルーティング変更

モデル
OpenAIが「4o」を外した文字起こしモデルを投入──GPT Transcribe・GPT Live Transcribeの料金と対応範囲の記事画像

OpenAIが「4o」を外した文字起こしモデルを投入 GPT Transcribe・GPT Live Transcribeの料金と対応範囲

プロダクト(発表 7月28日)
Sunoが9月3日からダウンロード数に上限──旧モデル全廃も予告、公式ブログ4本で確認する変更点の記事画像

Sunoが9月3日からダウンロード数に上限 旧モデル全廃も予告、公式ブログ4本で確認する変更点

プロダクト
diffusersの「Modular Diffusers」が実験段階を卒業──新モデルは既に旧来パイプラインを持たずModular専用で配布されるの記事画像

diffusersの「Modular Diffusers」が実験段階を卒業 新モデルは既に旧来パイプラインを持たずModular専用で配布される

検証
Gemini 3.5 Transcribeが正式提供──85言語以上を自動判定・話者最大8人分離を料金表で確認するの記事画像

Gemini 3.5 Transcribeが正式提供 85言語以上を自動判定・話者最大8人分離を料金表で確認する

プロダクト(発表 8月26日)
IBMの音声認識モデル「Granite Speech 5.0 TurboCTC」──470Mでデコーダなし、1フォワードパスで文字起こしの記事画像

IBMの音声認識モデル「Granite Speech 5.0 TurboCTC」 470Mでデコーダなし、1フォワードパスで文字起こし

モデル
ElevenLabsが画像・動画生成APIに進出、ローカルMCPは廃止──changelogで確認する8月の3つの変更の記事画像

ElevenLabsが画像・動画生成APIに進出、ローカルMCPは廃止 changelogで確認する8月の3つの変更

プロダクト
音声やYouTubeリンクをピアノ譜に変換するpianoify──『Muscriptor』公開インスタンスの中身の記事画像

音声やYouTubeリンクをピアノ譜に変換するpianoify 『Muscriptor』公開インスタンスの中身

検証
動画のPikaが音声4モデルを一挙公開──「ElevenLabsの9倍安い」という自己申告の中身の記事画像

動画のPikaが音声4モデルを一挙公開 「ElevenLabsの9倍安い」という自己申告の中身

プロダクト
話し言葉を整った文章に変換するGoogleの新AI「Eloquent」──サブスクなし・オフライン動作の音声入力アプリの記事画像

話し言葉を整った文章に変換するGoogleの新AI「Eloquent」 サブスクなし・オフライン動作の音声入力アプリ

プロダクト
Suno対GEMA、独ミュンヘン地裁がGEMA勝訴──AI音楽著作権訴訟でヨーロッパ初の判断の記事画像

Suno対GEMA、独ミュンヘン地裁がGEMA勝訴 AI音楽著作権訴訟でヨーロッパ初の判断

業界
OfflineでもParakeet TDT V3が使えるLinuxネイティブ音声入力ツール「hyprwhspr」の記事画像

OfflineでもParakeet TDT V3が使えるLinuxネイティブ音声入力ツール「hyprwhspr」

検証
Sesameの「インテリジェント・アイウェア」──Oculus共同創業者が2027年に投入するAIメガネで、今わかっていることの記事画像

Sesameの「インテリジェント・アイウェア」 Oculus共同創業者が2027年に投入するAIメガネで、今わかっていること

プロダクト
Microsoft、Build 2026で自社初の推論モデル「MAI-Thinking-1」を発表の記事画像

Microsoft、Build 2026で自社初の推論モデル「MAI-Thinking-1」を発表

モデル
AI業界が72時間で"声"に集中投下──Anthropic・OpenAI・Googleが動いた3日間を一次資料で確認したの記事画像動画

AI業界が72時間で"声"に集中投下 Anthropic・OpenAI・Googleが動いた3日間を一次資料で確認した

業界

古い記事は月別アーカイブから ›