Tavus Griffin通过视频图灵测试
TECH

Tavus Griffin通过视频图灵测试

23+
Signals

战略概览

  • 01.
    Tavus于2026年10月1日宣布推出Griffin,并将其描述为首个“人类交互模型”(HIM),这是一种新型模型类别,专为理解和生成实时、面对面的人类对话而构建。
  • 02.
    Griffin是一种全双工、视频到视频的模型,能够同时感知、决定何时以及如何回应,并生成语音和视频,而不是将独立的感知和渲染系统串联起来。
  • 03.
    在一项盲测研究中,54名参与者中有26人(48.1%)在与Griffin进行一分钟视频通话后,认为自己是在与真人交谈;相比之下,Tavus此前的技术栈在41名参与者中仅有1人(2.4%)产生误判。
  • 04.
    在NVIDIA独立的VideoFDB全双工基准测试中,Griffin-Lite在生成和感知两个赛道上均位列15个参评模型之首,生成得分为3.83/5,接近人类参考得分3.92,而次优系统(Gemini 2.5 + Anam)仅为2.80。
  • 05.
    Griffin-Lite目前仅作为受限的研究预览版向少数可信测试者开放,尚未面向客户发布,需待安全工作完成后才可能扩大范围。
  • 06.
    一段演示显示,一位名叫Sagar的人正在焊接主板,Griffin通过视觉追踪其进度,并在下一步操作即将开始时主动发言,而非仅在沉默时作出回应。

深度分析

视频图灵测试背后:48%这一数据的真实含义

48%这一标题数据来自一次特定且有限的测试:一项盲测研究中,54名参与者进行了为期一分钟的视频通话,其中26人(48.1%)认定自己与真人交谈过;相比之下,使用Tavus此前由独立渲染、感知和对话组件构建的模型时,41名参与者中仅有1人(2.4%)被误导[1]。在NVIDIA独立的VideoFDB基准测试中——该测试用于评估全双工AI视频系统——Griffin-Lite在15个模型中于生成和感知两个赛道均排名第一,生成得分为5分制下的3.83,接近人类基线3.92,领先第二名系统(Gemini 2.5与Anam组合)超过1分[1]。Tavus还报告称,在H100芯片上,音频到视频的延迟为0.43秒,比最接近的系统快约50%,这一点至关重要,因为人类说话与其虚拟形象反应之间的任何延迟都是最容易暴露非人类身份的破绽之一[1]。

一个模型,而非三个:全双工感知如何改变交互方式

Griffin能缩小这一差距的原因并非采用更大规模的同类方法,而是采用了不同的架构。大多数会话式视频虚拟形象依赖于多个独立系统的串联:一个负责音视频感知,一个决定说什么,另一个负责面部和声音渲染。而Griffin是一个单一的全双工、视频到视频模型,能够同时完成感知、决策和生成,而非按顺序传递数据[2]。它以320毫秒为单位生成720p视频,并以低至10毫秒的小包流式传输语音,还能从约10秒的参考音频中克隆出声音[2]。Tavus通过整合其已分别发布的三个模型——Phoenix-4.5(渲染)、Raven-1(多模态感知)和Sparrow-2(对话动态)——构建了Griffin,最终形成统一架构[3]。此次整合紧随一轮快速融资之后:公司于2025年11月完成了由CRV领投的4000万美元B轮融资,使其自2023年种子轮以来的总融资额达到约6400万至7000万美元,此外,该公司平台据称已有超过15万名开发者和企业使用[5][6]。单模型架构优势的最佳例证是一段演示:当一个人焊接主板时,Griffin通过视觉追踪其进度,并在其应进入下一步时主动提醒,而非仅在其停止说话后才回应[4]。

Tavus自身警示的欺骗风险

Tavus对其自身成就的负面影响表现出了不同寻常的坦率态度。在其公开材料中,该公司指出,使“人类交互模型”成为强大人机自然通信接口的特性,同样也可能让人类误以为其并非AI[2]。这并非假设:公司引用了2024年香港工程公司Arup的案例,其员工在与深度伪造同事的视频通话后被骗转账约2500万美元,说明如此逼真的模型必须正视此类风险[2]。此外还有监管层面的问题:《欧盟人工智能法案》第50条规定,除非显而易见,否则必须告知人们他们正在与AI系统互动;一旦模型被专门设计成在视频通话中难以与人类区分,这项规则将更难默认满足[2]。目前,Tavus正以此矛盾为由谨慎推进:Griffin-Lite并未向客户开放,仅限于少数可信测试者作为研究预览版,公司正在开发所谓“安全披露功能”,以确保未来更广泛发布时的安全性[1][2]。

为何并非所有人都认为这是突破

外界反应并不完全信服。Reddit上一些评论者反驳称,Griffin的声音和回应听起来过于流畅和排练感强,不太可能被误认为真人。另一些人则提出完全不同意见:有评论者认为,将计算资源投入对话润色不如专注于他们所谓的“功能性智能”问题,而非一味追求虚拟形象的人类相似度。YouTube上一位获得多个Griffin角色早期访问权限的独立测试者表示,其手势和反应准确性令人惊讶地好,但整体体验并不持续像真人,偶尔会出现“恐怖谷效应”瞬间打破沉浸感。这种怀疑很可能源于基准测试中的干净、受控环境与开放式真实对话之间的巨大差异。

历史背景

由Sequoia领投600万美元种子轮融资,作为公司早期资金的一部分。
由CRV领投4000万美元B轮融资,使公司总融资额达到约6400万至7000万美元。
发布Phoenix-4.5实时渲染模型,在Griffin发布前由公司账号重点推广。
宣布推出Griffin,基于此前的Phoenix-4.5(渲染)、Raven-1(多模态感知)和Sparrow-2(对话动态)模型整合而成,形成统一架构。
作为深度伪造视频通话诈骗风险的历史背景被引用:其员工在香港遭遇伪造同事视频通话,被骗转账约2500万美元。

关键关系图

关键玩家
主题

Tavus Griffin通过视频图灵测试

TA

Tavus

总部位于旧金山的AI公司,开发并发布了Griffin;成立于2020年,曾入选Y Combinator项目,已在种子轮、A轮和B轮融资中累计筹集约6400万至7000万美元。

HA

Hassaan Raza

Tavus首席执行官;公开将Griffin定位为改变人类与AI交互方式的关键。

IO

Ioannis Patras

Tavus研究主管;于2026年10月1日与CEO Hassaan Raza共同宣布Griffin发布。

NV

NVIDIA

运营独立的VideoFDB全双工AI视频基准测试,Griffin-Lite在该测试中于15个模型中生成与感知两项均排名第一。

CR

CRV, Sequoia Capital, Scale Venture Partners, Y Combinator

Tavus的投资方,参与其2023年600万美元种子轮(Sequoia领投)、1800万美元A轮(Scale Venture Partners)及2025年11月4000万美元B轮(CRV领投,Sequoia/Scale/YC跟投)。

AM

Amazon, Mayo Clinic, Salesforce

被列为Tavus现有会话视频技术的企业客户;据报道,已有超过15万名开发者和企业使用该公司平台。

事实来源

6 条引用
  1. [1] Tavus Griffin: Specs, Benchmarks, and Pricing
  2. [2] Griffin Lite: Tavus' Real-Time Video AI Preview
  3. [3] Tavus Introduces Griffin, the First Face-to-Face Human Interaction Model, Unlocking the Future of Conversational AI
  4. [4] Tavus Griffin Launch
  5. [5] Tavus Griffin Case Study
  6. [6] Tavus Griffin Video Turing Test

来源文章

Top 1

THE SIGNAL.

Analysts

“AI已经变得极其聪明,但我们仍不得不按照机器的方式与之互动。Griffin是改变这一现状的重要一步。”

Hassaan Raza
Tavus首席执行官

“今天@tavus推出了Griffin:首个‘人类交互模型’。它不只是说话,它能看见、倾听、说话并实时同步做出反应。它可以观察你的双手,并指导你解决魔方难题。”

Stephanie Zhan
投资者/在X平台发表评论的观察者

“使‘人类交互模型’成为强大人机自然通信接口的特性,也使其可能欺骗人类,使其误以为自己并非AI。”

Tavus
公司官方安全披露声明
The Crowd

“Introducing Griffin, the first model to pass the video Turing test. 48% of people who talked to it live thought it was a real human. Previous systems have had a pass rate <3%. It is #1 on NVIDIA's benchmark for full-duplex AI video. It's the first Human Interaction Model (HIM).”

@@tavus20378

“4 MINUTES INTO A VIDEO CALL, I ASKED ASH WHO SHE IS. ASH IS AN AI. Tavus gave me early access to Griffin, the first human interaction model. This clip is from my session. She has a whole life. Lives in Brooklyn, makes videos about pop culture, could talk my ear off about The [show more]”

@@theSethian268

“While Mars is still telling Griffin about a boring date, it laughs, nods and asks questions instead of waiting for her to stop. That's full duplex: listening, watching and talking at the same time, the way people actually talk.”

@@tavus343

“Tavus Unveils Griffin AI That Passes Video Turing Test”

@u/EuphoricTomorrow244076
Broadcast
48% of People Thought This AI Was a Real Human | Introducing Griffin

48% of People Thought This AI Was a Real Human | Introducing Griffin

You can now video call an AI person | Tavus Griffin Preview

You can now video call an AI person | Tavus Griffin Preview

Tavus Introduces Griffin, the First Face-to-Face Human Interaction Model, Unlocking the Future of Conversational AI

Tavus Introduces Griffin, the First Face-to-Face Human Interaction Model, Unlocking the Future of Conversational AI