Tavus Griffin通过视频图灵测试
TECH

Tavus Griffin通过视频图灵测试

45+
Signals

战略概览

  • 01.
    Tavus于2026年10月1日推出Griffin,称其为首个‘人类交互模型’(HIM)——一种通过将感知、对话建模和视频生成整合到单一视频到视频管道中,实现观看、聆听和实时回应视频对话的AI系统。
  • 02.
    Griffin是全双工的,意味着它能同时聆听、观察和说话,而非等待严格轮次——这使其能通过‘嗯哼’等声音进行反馈,容忍打断,并实时响应视觉线索。
  • 03.
    在Tavus主导的研究中,54名参与者中有26人(48%)在进行一分钟视频通话后认为Griffin-Lite是真人,而相比之下,Tavus此前的Phoenix-4.5系统在41人中仅有1人(2.4%)被误认为真人。
  • 04.
    参与者仅被告知他们将与另一位研究参与者进行视频聊天,讨论他们对当年的期待;直到通话结束后,他们才被询问对方是否可能是AI。
  • 05.
    Griffin-Lite在NVIDIA独立的VideoFDB全双工视频基准测试中排名第一,在生成任务上得分为3.83/5(仅次于最佳人类参考的3.92,远超次优系统的2.80),感知任务得分为3.73/5。
  • 06.
    该模型在NVIDIA H100芯片上运行,平均音频到视频延迟约为0.43秒,通过自回归扩散架构以320毫秒为单位流式传输720p视频。
  • 07.
    Griffin-Lite目前仍为研究预览版,仅限于部分受信任的测试者;Tavus表示,在构建披露和安全机制之前,该模型尚未向客户开放。
  • 08.
    Tavus自身承认其存在双重用途风险:Griffin的逼真性使其成为人机通信的自然接口,但也可能让人误以为它并非AI。
  • 09.
    Tavus也将同样的逼真性视为良性用例的特性,引用辅导、帮助人们练习困难对话以及基于摄像头的技术支持等场景,作为人类交互模型的预期应用。

深度分析

从流水线到统一视频到视频:Griffin如何实现全双工逼真性

Tavus构建Griffin的目的是用单一的视频到视频系统取代传统的语音识别、语言模型、语音合成和头像渲染组件的拼接流程[1]。这种整合正是实现全双工行为的关键——Griffin不再等待说话人说完再生成回应,而是每秒多次持续重新评估对话,使其能够进行反馈、容忍打断,并像真实电话一样追踪沉默时长[2]。Tavus自身的发布材料并未回避这种自我意识,反而加以利用:其官方演示视频设计为一场视频通话,其中一位参与者最终被揭示为AI,对话中调侃‘很快就能通过图灵测试了’,并以‘别再解释了,直接展示给他们看’作为整个发布的宣传点;而更传统的BusinessWire新闻稿视频则以正式方式报道了同一消息。自然性也体现在更细微、即兴的瞬间——一位早期测试者描述自己发烧时与Griffin通话,模型回应‘哦不,Kai,发烧最难受了’,并询问他是否服了药,这种情境化的反应是传统组件拼接流程难以即兴实现的。硬数据也印证了这一点——Griffin-Lite通过流式自回归扩散模型以320毫秒为单位流式传输720p视频,在NVIDIA H100芯片上平均音频到视频延迟为0.43秒[1][4]。按此衡量,它似乎比Tavus此前的Phoenix-4.5模型更慢,后者宣称延迟为134毫秒,并被宣传为市场上最快[7]——尽管这两个数字可能衡量的并非同一指标,因为Griffin的指标描述的是端到端音频到视频响应时间,而Phoenix-4.5描述的是每帧渲染延迟。即使考虑到这一点,Phoenix-4.5在类似研究中仅欺骗了2.4%的参与者,因此显然仅靠速度无法解释可信度;对话时机和多模态一致性似乎更为重要。

‘通过视频图灵测试’究竟意味着什么——以及不意味着什么

在‘视频图灵测试’这一说法被当作事实广泛传播之前,有必要加以审视。Tavus研究中的参与者并未被告知通话中可能存在AI——他们只是被告知将与另一个人聊天讨论对未来的期待,直到通话结束后才被询问是否怀疑对方不是真人[2]。这与经典图灵测试中评估者主动尝试识别机器的设定有显著差异。参与者对Griffin的自然性评分为7分中的5.4分,可信度为5.6分——尚可,但远未达到确信通过的程度;cellcog.ai独立报告的自然性评分下限为7分中的4.9分[3][8]。置信度数据也呈现两面性:认为自己与真人交谈的参与者平均置信度为79%,而正确识别出AI的参与者平均置信度为81%;当怀疑出现时,通常在通话前20秒内浮现[1][3]——这表明模型要么几乎立即赢得怀疑者,要么完全无法。cellcog.ai的独立分析进一步指出,48%的数据来自Tavus公司主导的测试,样本量小、平台未具名、无外部评估者、无发表论文[3]。X平台的社区注释贡献者也指出了这些缺陷,称该结果未经验证[2],YouTube的报道也呈现类似模式——独立频道报道此次发布,包括由一位名为Prompt Engineer 48的创作者运营的频道,大多重复了Tavus自称的48%数据,而非独立验证。这并不意味着Griffin不令人印象深刻——但它确实意味着头条数据描述的是一场被预设且未设盲的互动,而非严格对抗性测试,这一区别反映在公众反应的分化上。在X平台上,传播主要持积极态度,包括AI新闻聚合器将该数据推向更广泛受众。Reddit则进一步分裂:r/accelerate版块认为其令人印象深刻但令人不安,有评论称技术进步速度‘一周等于一年’,但也指出演示仍显僵硬,语言模式重复且像公关稿;r/nextfuckinglevel则公开敌视,称其为‘AI垃圾’,指控存在刷量行为,并认为演示因明显延迟和不自然回应而实际上未能通过图灵测试;而在r/Popular_Science_Ru中,观众逐帧列举了渲染破绽——多余的手指、不规则的呼吸、口型不同步。与此同时,老一辈怀疑者指出,几十年前像ELIZA这样的聊天机器人就已欺骗了大约一半用户,当时视频甚至还未成为考量因素。

深度伪造问题:为何Griffin仍被限制访问

Tavus并未掩饰其所创造的权衡。该公司明确表示,使人类交互模型在人机通信中强大的特性,同样使其可能欺骗他人,让人误以为对话对象不是AI[1][3]。因此,Griffin-Lite仍为仅限部分受信任测试者的研究预览版——Tavus表示,正在构建披露功能,并与安全组织合作,为更广泛的发布做准备[1][6]。这种谨慎态度有现实先例:与朝鲜有关联的行为者已利用深度伪造在Zoom和Teams通话中针对加密货币从业者,而一个能从单张参考图像和短语音片段生成逼真实时视频形象的模型,大大提升了高管冒充和面试欺诈的风险[2]。Tavus对Griffin的宣传也强调了这种逼真性的良性一面——该公司指出,辅导、帮助人们排练困难对话以及基于摄像头的技术支持等用例,正是人类交互模型旨在促进的自然、建立信任的互动,尽管它也承认在更复杂场景中需要更多保障措施才能广泛发布。

对标NVIDIA与竞争对手:Griffin的真实排名

剥离营销包装后,Griffin最有力的证据或许是其第三方基准测试表现,而非自导的用户研究。在NVIDIA独立的VideoFDB全双工视频基准测试中,Griffin-Lite在生成任务上得分为5分中的3.83分,次优已发表系统为2.80分,人类参考为3.92分[1][5]。在感知任务上,它得分为3.73分,领先于MiniCPM-o 4.5(3.44分)、Gemini 2.5 Flash(3.17分)和OpenAI的gpt-realtime(2.97分),但仍低于4.20分的人类基线[5]。这一在Tavus未设计的基准上,与已命名且可比对手的排名,或许比驱动头条的48%数据更能清晰反映Griffin在全双工视频领域的真实位置。

历史背景

Tavus成立之初专注于销售和营销领域的个性化AI视频,后扩展至实时对话式视频形象领域。
与朝鲜有关联的行为者在Zoom和Teams视频通话中使用深度伪造针对加密货币从业者,评论人士在讨论Griffin逼真性带来的欺诈风险时常引用此先例。
Tavus此前的实时渲染模型(与Sparrow-2和Raven-1配对)实现了134毫秒延迟,该公司称其为市场上最快,但在类似研究中仅欺骗了2.4%的参与者。
Griffin在NVIDIA独立的VideoFDB全双工视频基准测试中获得评分,早于其10月的公开发布。
Tavus公开发布Griffin作为研究预览版(Griffin-Lite),声称其为首个通过视频图灵测试的模型。

关键关系图

关键玩家
主题

Tavus Griffin通过视频图灵测试

TA

Tavus

San Francisco AI startup (founded 2020, roughly $64 million raised) that built and publicly announced Griffin, controlling access through a trusted-tester research preview and setting the pace of safety disclosure.

HA

Hassaan Raza

Tavus co-founder and CEO who publicly framed Griffin's goal as making conversational computing interfaces 'invisible.'

NV

NVIDIA

Ran the independent VideoFDB full-duplex video benchmark on which Griffin ranked #1, providing third-party benchmark validation for Tavus's performance claims.

ST

Study participants (54 total)

Human subjects in Tavus's own one-minute video-call study whose post-call responses produced the 48% figure central to the Turing-test claim.

事实来源

8 条引用
  1. [1] Tavus Griffin - the first Human Interaction Model
  2. [2] Tavus' Griffin AI Fools People Into Thinking It's Human During Video Calls
  3. [3] Tavus Griffin: A Critical Look at the Video Turing Test Claim
  4. [4] Tavus Griffin AI model
  5. [5] Tavus Unveils Griffin AI Model for Real-Time Human-Like Video Conversations
  6. [6] Tavus Griffin: Specs, Benchmarks, Pricing
  7. [7] Tavus Phoenix-4.5
  8. [8] Tavus Launches Griffin, a Real-Time Video Model That Passed a Video Turing Test

来源文章

Top 5

THE SIGNAL.

Analysts

“指出Griffin的结果来自Tavus公司主导的测试,样本量小且未经独立验证,且研究未遵循标准图灵测试协议,因为参与者未被告知对方可能是AI。”

X community-notes contributors
X平台上的公共事实核查者

“提醒48%的数据来自Tavus公司主导的测试,样本量小、招募平台未具名、无外部评估者、无发表论文——参与者被预设为期待与真人通话,这些因素限制了该说法应被赋予的分量。”

Cellcog.ai
独立AI行业博客
The Crowd

“Introducing Griffin, the first model to pass the video Turing test. 48% of people who talked to it live thought it was a real human. Previous systems have had a pass rate <3%. It is #1 on NVIDIA's benchmark for full-duplex AI video. It's the first Human Interaction Model (HIM).”

@@tavus37726

“Face-to-face used to be the one thing AI couldn't fake. Sequoia backed team Tavus launched the first Human Interaction Model (HIM) Griffin that 48% of people who talked to it live thought it was a real human. On their benchmar test, half the people who met this AI on video...”

@@rohanpaul_ai111

“ok so Tavus gave me early access to Griffin and i hopped on a video call with it while running a fever first thing i say is i'm kinda sick. she goes "oh no kai, a fever is the worst" and asks if i took anything then i ask if she watched "the last of us" and the answer "the last...”

@@0xNotFounder95

“Tavus Unveils Griffin AI That Passes Video Turing Test”

@u/EuphoricTomorrow2440129
Broadcast
48% of People Thought This AI Was a Real Human | Introducing Griffin

48% of People Thought This AI Was a Real Human | Introducing Griffin

Griffin by Tavus: The First AI to Pass the Video Turing Test (48% Fooled)

Griffin by Tavus: The First AI to Pass the Video Turing Test (48% Fooled)

Tavus Introduces Griffin, the First Face-to-Face Human Interaction Model, Unlocking the Future...

Tavus Introduces Griffin, the First Face-to-Face Human Interaction Model, Unlocking the Future...