AI時短ラボ
検索

Tavus「Griffin」ビデオ通話で54人中26人が「人間だった」と答えたAI、48%の測り方とNVIDIAの採点表を確かめる

執筆:約15分で読めます実機で検証

米Tavusが2026年10月1日、ビデオ通話で話した54人のうち26人(48%)に「相手は人間だった」と思われたAI「Griffin」を発表した。NVIDIAの採点表VideoFDBでも、返し方の点数は人間3.92に対して3.83。一方で、調査は1分間・相手1人の自社調査で、返事を始めるまでの時間は人間の約2倍かかっていた。一般の利用者はまだ使えない。

Tavus Griffin の公式OG画像(The first Human Interaction Model)
画像:画像: Tavus(tavus.io/griffin のOG画像)
目次

2026年10月2日(日本時間)時点の情報です。米サンフランシスコのAI企業Tavusが10月1日、ビデオ通話で話した54人のうち26人に「相手は本物の人間だった」と思われたAI「Griffin」を発表した。Tavusは「ビデオのチューリングテストに初めて合格したモデル」と打ち出している。当サイトは発表ページとNVIDIAの採点表を原文で読み、デモ映像は書き起こして日本語字幕を付けたうえで、解説動画「54人中26人が「人間」と答えたAI。Tavus「Griffin」の実力と限界」にまとめた。この記事は、その確認の中身を数字ごとに並べたものだ。

3行まとめ

  1. Tavusの発表によると、1分間のビデオ通話のあと、54人中26人(48%)が相手のGriffin-Liteを人間だと答えた。同じやり方で調べた旧システムは41人中1人(2.4%)だった。
  2. NVIDIAの採点表VideoFDBにも「Tavus Griffin Lite」の行があり、返し方の部門は人間3.92点に対してGriffin 3.83点。ただし返事を始めるまでの時間(中央値)は、人間の約0.9〜1.4秒に対して約1.9〜2.2秒だった。
  3. 調査は相手1人・1分間の自社調査で、本物の人間を相手にした比較の数字は発表に無い。Griffin-Liteは一部のテスターしか使えず、上位版の公開時期も示されていない。
項目 内容
発表 Tavus(共同創業者・CEO Hassaan Raza氏、研究責任者 Ioannis Patras氏の連名)・2026年10月1日
名前 Griffin(今回出たのは研究プレビュー版の Griffin-Lite)
中身 相手の声と映像を受け取りながら、声と映像を同時に返す「Human Interaction Model」
調査の結果 54人中26人(48%)が「相手は人間だった」と回答(Tavus の自社調査)
NVIDIA VideoFDB 返し方 3.83点(人間 3.92点)/読み取り 3.73点(人間 4.20点)
使える人 Tavus が選んだ一部のテスターのみ。一般の顧客は使えない
資金調達 約6,400万ドル(The Decoder の報道)

Griffinは何を同時にやっているのか

これまでのAIとのビデオ通話の多くは、Tavusが「リレー(カスケード)」と呼ぶ作りだった。相手の声を文字にし、言葉のAIが返事を書き、それを声に変え、最後に顔を動かす。Tavusは、この受け渡しのたびに遅れが足され、声の調子や画面に映っているものといった情報が次の段に渡らないと説明している。

Griffinはこれを1つのシステムにまとめた。Tavusの説明では、会話の司令塔にあたる部分が1秒より短い間隔で「話す・相づちを打つ・待つ・割り込む」のどれにするかを決め続け、その指示が声と映像の生成に同時に流れる。自分が話している最中も相手の声と映像を受け取り続けるので、割り込まれればすぐに止まれる。映像は写真1枚から720pで0.32秒ずつ、顔だけでなく体・椅子・影・背景まで作り、声は約10秒の録音から真似できるとしている。

同じ方向の取り組みは、音声では先行例がある。当サイトではOpenAIのgpt-liveやByteDanceのSeedRealtimeを扱ってきた。Griffinの違いは、返す側も「映像の人」である点にある。

デモ映像を書き起こして分かったこと

Tavusの発表ページには会話の映像が11本ある。Tavusの説明では、Griffinを使ったことのない人とTavusの研究者に、自由な会話と短い実演をしてもらったものだ。当サイトは動画で使う5本の英語音声を書き起こし、日本語字幕を付けた。見ていて分かることを、見ただけでは分からないことと分けて書く。

確認できたのは、AI側(どのデモでも、小窓やノートパソコンの画面に映る赤い髪の女性「Vanessa」)が、相手の話の途中で笑ったり、言い終わる前に「本当に取れたの?」と反応したりしている点だ。物語づくりのデモでは、人間がぬいぐるみを見せた直後の一言で、物語の魚が「緑のふわふわした海の怪物」に変わった。ルービックキューブのデモでは、手順を3つずつに区切って伝え、「3つ終わったら教えて」と相手が回し終わるのを待っていた。

一方で、このルービックキューブのデモは、画面に「2x」と出る区間があり、一部が2倍速に編集されている。当サイトが読んだ発表ページの本文と各映像の説明文の範囲では、この編集についての説明は見当たらなかった。11本はどれもTavusが選んで公開したもので、うまくいかなかった場面がどれくらいあったのかは、映像からは分からない。

「54人中26人」はどう測ったのか

Tavusの説明では、参加者は外部の調査サービスを通して集めた54人だ。参加者には「別の参加者と1分間ビデオ通話をして、今年楽しみにしていることを話してほしい」と伝え、実際の相手はGriffin-Liteで動くキャラクター(Tavusの言うPAL)だった。通話のあとに相手の答えを書き出させ、自然さや信頼できそうかを点数で付けさせ、アンケートの最後に「相手が人間ではない可能性を考えたか」を聞いた。最後には全員に、相手はAIだったと伝えている。

結果は54人中26人が「人間だった」と答えた。答えへの自信は、人間だと答えた人が平均79%、AIだと答えた人が平均81%。半分以上の人は通話中にAIかもしれないと考えもせず、疑った人はだいたい最初の20秒で疑っていた。7点満点の評価では「また話したい」が5.8点で最も高く、AIだと答えた人でも5.4点を付けた。最も低かったのは「会話の流れが自然だったか」の4.9点だった。

この48%を、よく知られたチューリングテストの結果と並べるときは条件の違いに注意がいる。2025年にGPT-4.5が73%の割合で人間と判定された研究とは、次の点が違う。

2025年の研究(Jones & Bergen) Tavus Griffin-Lite
やり取り 文字だけ ビデオ通話(声と映像)
時間 5分 1分
形式 人間とAIの両方と同時にやり取りし、どちらが人間かを選ぶ 相手は1人。最後に「人間だったか」を聞く
結果 73%が「人間」 48%が「人間」
本物の人間との比較 本物の人間より多く選ばれた 人間を相手にした場合の数字は発表に無い

当サイトの見方では、48%は前者と同じ物差しの数字ではなく、「合格」と言い切るのはまだ早い。本物の人間を相手にしても、1分間で「人間ではないかも」と疑われることはありうるからだ。それでも、同じ会社が同じやり方で測った数字が41人中1人から54人中26人に変わったことは、そのまま大きな変化として受け取れる。

NVIDIAの採点表を直接読む

Tavusがもう1つの根拠に挙げるのが、NVIDIAとDavid AIが作ったベンチマーク「VideoFDB」だ。実際の2人のビデオ通話から切り出した237本の映像を使い、相手の様子を読み取れるか(読み取り)と、自分の返し方が自然か(返し方)を、AIの審査員が0〜5点で採点する。当サイトは2026年10月2日、NVIDIAの公開ページの表に「Tavus Griffin Lite」の行があり、点数がTavusの発表と一致していることを確認した。

返し方の部門 流暢さ 感情の同調 身ぶりの適切さ 総合 返事を始めるまで(中央値)
本物の人間 4.42 4.14 3.18 3.92 900ms
Tavus Griffin Lite 4.25 4.40 2.83 3.83 1,892ms
Gemini 2.5 + Anam 3.48 3.21 1.71 2.80 2,840ms

読み取りの部門では、人間4.20点に対してGriffinは3.73点で、評価された15の仕組みの中で1位だった。OpenAIのgpt-realtimeは2.97点、GoogleのGemini 2.5 Flash Nativeは3.17点、MiniCPM-o 4.5は3.44点。

表を読むと、発表ページの見出しだけでは見えない点が3つある。

  • 感情の同調はGriffinが人間を上回っていた。4.40点と4.14点で、この項目だけは人間の点数より高い。
  • 比べ方は相手に有利な側だった。他社のモデルは「映像あり」と「音声だけ」の両方で採点されていて、gpt-realtimeは映像あり2.75点・音声だけ2.97点、MiniCPM-o 4.5は3.40点・3.44点と、音声だけのほうが高い。Tavusの発表ページの比較は、この高いほうの点数を使っていた。
  • 返事の速さは人間に届いていない。返事を始めるまでの時間の中央値は、返し方の部門でGriffin 1,892ms・人間900ms、読み取りの部門で2,232ms・1,400ms。この数字は、当サイトが読んだTavusの発表ページの本文には書かれていない。

一般公開しない理由

Tavusは発表の中で、自分たちの技術が悪用されうることを書いている。

"The same properties that make Human Interaction Models powerful interfaces for natural communications between human and machine allow them to deceive a human into believing it is not AI."

(人間と機械の自然な会話を可能にする性質そのものが、相手に「AIではない」と思い込ませることにも使える。)

そのため、Griffin-Liteは一般の顧客には提供せず、Tavusが選んだテスターだけに研究プレビューとして出している。AIであることを知らせる機能を作っており、AIの安全に取り組む団体とも評価を進めているという。上位版のGriffinは「安全の課題に対応したらすぐに」出すとしているが、具体的な時期は書かれていない。

ビデオ通話のなりすましは、すでに被害が出ている。2024年には香港で、多国籍企業の経理担当がビデオ会議に出ていた偽の幹部たちの指示で、15回にわたり計2億香港ドル(約2,500万ドル)を送金した(当サイトの記事)。The Registerが伝えた香港警察の説明では、犯人は前もって手に入れた映像にAIで偽の声を付けて使ったとみられている。その場で話を聞いて返事をするAIではなかった。この事件とGriffinは関係ないが、Griffinは相手の話を聞き、表情を変えながらその場で返事ができる。

8時間で753万表示──広がり方にも代理店がいた

Tavusの公式Xの発表ポストは、当サイトが10月2日9時50分(日本時間)に取得した時点で753万回表示されていた。投稿は日本時間の同日1時59分なので、約8時間での数字だ。同じ日の10時58分には832万回まで伸び、アカウントのフォロワーは2万5,787人になっていた。3週間前の9月10日に同じアカウントで出したPhoenix-4.5の発表は、3週間で約18万回の表示だった(ローンチ代理店Doomersの集計)。

その代理店Doomersは、自社サイトの事例ページで今回のローンチを手がけたと公開している。同社の説明では、150人以上の創業者・クリエイター・開発者を集め、最初の1時間に意見つきの引用ポストを、デモの返信が出るたびにリポストを、という順番を組んだ。誰が参加したのかは公開されていない。実際、発表の30分後と1時間22分後には「TavusからGriffinの早期アクセスをもらった」という投稿が並んでいた。

広がる途中で数字が変わった例もある。フォロワー約7.8万人のAIニュースアカウントtestingcatalogは、Griffinについて「120人の参加者の45%」と投稿していた。Tavusの発表では54人中26人、48%だ。

通話の相手を見分けるより先にできること

Griffinのような技術が一般に出回れば、「顔と声が本物らしいか」で相手を見分けるのはさらに難しくなる。お金や個人情報の話が出たら、いったん通話を切り、自分が知っている番号や連絡先からかけ直して確かめる。相手の見た目ではなく、連絡の経路で確かめる方法は、Griffinの性能に左右されない。声の詐欺への備えはこちらの記事にもまとめている。

一方でTavusは、説明が伝わっていない様子に気づいて別の説明を試す家庭教師や、難しい話し合いの練習相手、壊れた部品をカメラに見せて一緒に直し方を考えるサポートを使い道に挙げている。どちらの面も、同じ技術から来ている。

この記事で確かめられなかったこと

  • 本物の人間を相手にした場合に、同じ条件で何%が「人間」と答えるか(Tavusの発表に数字が無い)
  • デモ映像11本が、どのくらいの数の会話から選ばれたものか
  • Doomersのローンチに参加した150人以上が誰か、報酬があったかどうか(同社は公開していない)
  • 上位版Griffinの公開時期と、AIだと知らせる機能の具体的な中身

Xの表示回数とフォロワー数は、上に書いた時点の値で、その後も変わっている。NVIDIAの表の点数は2026年10月2日に確認した値だ。

シェア: ポスト はてブ

出典・参照資料

YouTubeで見る ↗
AI時短ラボ

大きいニュースはYouTubeでも解説しています。Xでは新着記事をお知らせしています。

コメント

まだコメントはありません。最初のコメントを書いてみませんか?

AIについて聞きたいことはありますか?

質問箱で無料で受け付けています。回答は公開され、他の方の参考にもなります。

質問箱を見る →

関連記事

GPT-4.5は73%の確率で「人間」と判定された──チューリングテスト論文を原文で読み、AGIの証拠になるか考えるの記事画像

GPT-4.5は73%の確率で「人間」と判定された チューリングテスト論文を原文で読み、AGIの証拠になるか考える

研究
ディープフェイクでビデオ会議の全員を偽装 ― 英Arupから2,560万ドルを詐取した事件の教訓の記事画像

ディープフェイクでビデオ会議の全員を偽装 ― 英Arupから2,560万ドルを詐取した事件の教訓

業界(発表 2024年6月26日)
ByteDanceが「見ながら聞きながら話す」全二重AIを実運用投入──音声だけのGPT系リアルタイムAIとの違いはどこにあるかの記事画像

ByteDanceが「見ながら聞きながら話す」全二重AIを実運用投入 音声だけのGPT系リアルタイムAIとの違いはどこにあるか

モデル
Introducing GPT-Live-1 in the API(OpenAI公式の画像)

OpenAI、全二重の音声モデル「GPT-Live-1」をAPIで提供 1分$0.05(秒単位課金)の会話層に、推論とツールはGPT-6 Astraなど後ろのモデルへ委任。Full Duplex BenchでGPT-Realtime-2.1より30ポイント上、電話(SIP)対応、声は12種類

プロダクト
EU AI法、8月2日から「AIと対話中です」表示が義務化 ― 違反は売上3%の罰金の記事画像

EU AI法、8月2日から「AIと対話中です」表示が義務化 ― 違反は売上3%の罰金

業界
AI音声クローン詐欺の手口と対策──3秒の録音で声が複製される時代【2026年】の記事画像

AI音声クローン詐欺の手口と対策 3秒の録音で声が複製される時代【2026年】

業界
NVIDIA、IBC 2026で「AI for Media」を拡張──AI生成動画の判定「Synthetic Video Detector」はテキスト→動画で99.3%・画像→動画で97.7%の精度になり、Dalet・TwelveLabs・Wowzaが組み込み。フレーム生成(リプレイで6倍スロー)、超解像の10ビット対応、SDR→HDR変換、LipSync、Studio Voiceの記事画像

NVIDIA、IBC 2026で「AI for Media」を拡張 AI生成動画の判定「Synthetic Video Detector」はテキスト→動画で99.3%・画像→動画で97.7%の精度になり、Dalet・TwelveLabs・Wowzaが組み込み。フレーム生成(リプレイで6倍スロー)、超解像の10ビット対応、SDR→HDR変換、LipSync、Studio Voice

検証(発表 9月9日)
Agora-2のボス戦の画面に「全部AIが描いてる」の文字を載せた解説動画のサムネイル動画

Odysseyの世界モデル「Agora-2」にOpus 5.5を4回入れてみた 0キルから50キル、ボス撃破まで。ゲームエンジンのどこをAIが引き受け、どこがルールのまま残っているか

モデル