ElevenLabs Eleven v4 发布
TECH

ElevenLabs Eleven v4 发布

26+
Signals

战略概览

  • 01.
    ElevenLabs 于2026年9月28日发布了其迄今为止最具表现力的文本转语音模型 Eleven v4,以及专为语音代理和实时应用设计的低延迟版本 Eleven v4 Turbo。
  • 02.
    Eleven v4 运行在一种全新的架构之上,能够从文本中解读语调、节奏、情感、角色和上下文,生成富有表现力的语音,同时保持说话人身份的一致性。
  • 03.
    语言支持从大约70种扩展到超过90种,在日语、巴西葡萄牙语、普通话和粤语方面有显著的质量提升。
  • 04.
    ElevenLabs 宣传仅需10秒音频即可实现即时语音克隆,但其v4官方文档指出,克隆通常需要一到两分钟的样本音频,这一差距被外界分析标记为理想情况下的营销说法。
  • 05.
    Eleven v4 Turbo 实现了约100毫秒的中位推理延迟和约150毫秒的中位首字输出时间,在该指标上优于 Cartesia 的 Sonic 3.6 和 OpenAI 的 GPT-4o mini TTS。
  • 06.
    两款模型现已立即在 ElevenAgents、ElevenCreative 和 ElevenAPI 上提供,且包含在 ElevenLabs 免费账户层级中。
  • 07.
    首发定价在两周内为每百万字符11美元(v4 Turbo)和22美元(Eleven v4)。

全新架构,不只是新标签

与 Eleven v3 依赖在文本中插入显式音频标签来控制情感不同,Eleven v4 建立在一种全新的架构之上,能够直接从文字本身推断语调、节奏、情感、角色和上下文,生成可在戏剧性、喜剧性和日常对话之间自由切换的语音,同时保持说话人身份一致[1]。ElevenLabs 表示,在盲测对比测试中,约75%的听众更偏好v4而非竞品模型,但该数据来自公司博客而非独立评审团[1]。该公司还宣称仅需10秒音频即可实现即时语音克隆,但其v4文档却说明克隆通常需要一到两分钟的样本音频,这一差距被外部分析指出是理想化营销宣传而非典型使用体验[2]。

排行榜之争:v4 对阵 Cartesia 与 Google

独立基准测试机构 Artificial Analysis 将 Eleven v4 列为其 Provider Voice TTS Arena 排行榜首位,在超过1,600次两两对比中获得1,319的Elo评分,领先于 Cartesia 的 Sonic 3.6(1,276)和 Google 的 Gemini 3.8 Flash TTS(1,267)[3]。在同一套基准测试中,Eleven v4 在发音稳健性方面也创下91.7%的新高,略高于 Gemini 3.8 Flash TTS 的89.5%[3]。不过表现并非全面领先:在独立的“受控语音”类别中,Eleven v4 的Elo得分为1,157,位居第二,落后于阿里巴巴的 Qwen-Audio-3.1-TTS-Plus。Runtime Wire 提醒,榜首位置仅表明在特定比较中处于领先地位,并非语音质量的普适衡量标准,因为该排行榜测试的是原生语音在盲选成对条件下的表现,可能无法匹配所有现实中的听觉偏好[2]。

为竞赛融资:110亿美元估值与企业收入

此次发布距离 ElevenLabs 在2026年2月由红杉资本领投完成5亿美元融资仅七个月,使其估值增长三倍以上,达到110亿美元[4]。联合创始人 Mati Staniszewski 将该轮融资定位为支持 Eleven v4 所依托的两大产品线,表示公司将通过帮助创作者将顶级音频与视频及代理功能结合,扩展其创作产品线[4]。商业背景是:ElevenLabs 在2025年底的年化经常性收入为3.3亿美元,到v4发布时已增长至超过6亿美元,其中55%的收入来自大型企业客户[5]。一款能重新夺回排行榜首位的模型,也是向市场证明其估值合理性的重要数据点。

v4 Turbo 针对实时语音代理,具有现实影响

Eleven v4 Turbo 是专为低延迟优化的版本,中位推理延迟约为100毫秒,中位首字输出时间约为150毫秒,在首字输出时间上比 Cartesia 的 Sonic 3.6 快112毫秒,比 OpenAI 的 GPT-4o mini TTS 快664毫秒[6]。ElevenLabs 明确指出其速度的应用场景:用于 ElevenAgents 客户支持部署,处理争执、升级和等待等情况,即在实时电话对话中,半秒的静默就会打破沉浸感[5]。这种定位具有双重影响。更快、更自然的实时语音代理意味着AI可以合理接管此前需要真人参与的更多客户服务对话,而同样的低延迟、高表现力管道也同样可用于不那么良性的实时语音生成。

并非所有人都信服:克隆限制与口音同质化问题

早期用户的反应总体热烈,独立测试者强调其对角色表现和环境音效的精细控制,以及听起来在多种语言中都像母语者而非明显配音的多语言片段。但质疑集中在一些可验证的具体声明上。在语音克隆方面,ElevenLabs 宣传的10秒音频与自身文档中建议的一到两分钟样本之间的差距,是最明显的营销宣传超越产品规格的案例[2]。社区测试者还报告称,一些带口音的语音在v4中的发音比v3更“美国化”,这可能是口音保真度的倒退,尽管整体基准测试分数有所提升。此外,人们也普遍怀疑该公司声称的语音一致性是否真能在无限长度的文本中持续保持。这些因素均未体现在排行榜数据中,因为排行榜衡量的是盲选成对偏好,而非长期一致性或口音保留能力。

历史背景

发布 Eleven Multilingual v2,将语言支持扩展至28种语言,同时推出用于实时代理的低延迟 Flash v2.5 和 Turbo v2.5 版本。
发布含70多种语言支持、多说话人对话功能以及用于内联情感/语调控制的音频标签语法的 Eleven v3 公测版。
Eleven v3 经过约八个月的公测后正式上线。
ElevenLabs 完成由红杉资本领投的5亿美元融资,估值较此前增长三倍,达到110亿美元。
发布 Eleven v4 和 Eleven v4 Turbo,这是该公司最新、最具表现力的文本转语音模型,并登顶 Artificial Analysis Provider Voice Arena 排行榜。

关键关系图

关键玩家
主题

ElevenLabs Eleven v4 发布

EL

ElevenLabs

AI voice/speech company that developed and launched Eleven v4 and v4 Turbo; competes on the Artificial Analysis Provider Voice TTS Arena leaderboard.

AR

Artificial Analysis

Independent benchmarking firm whose Provider Voice TTS Arena Leaderboard and Pronunciation Robustness benchmark ranked Eleven v4 #1, lending third-party credibility to ElevenLabs' quality claims.

CA

Cartesia (Sonic 3.6)

Competing voice-AI provider whose Sonic 3.6 model ranked #2 on the Provider Voice leaderboard and #1 on Controlled Voice, directly contesting ElevenLabs' claim of category leadership.

GO

Google (Gemini 3.8 Flash TTS)

Competing model that ranked #3 on Provider Voice and scored 89.5% on pronunciation robustness versus Eleven v4's 91.7%, representing large-platform competition in the TTS space.

SE

Sequoia Capital

Led ElevenLabs' $500M funding round in February 2026 that valued the company at $11 billion, giving it direct governance influence over ElevenLabs' product strategy including v4.

MA

Mati Staniszewski (ElevenLabs co-founder)

Company leadership driving product strategy that ties model releases like v4 to expansion of the Creative and Agents offerings.

事实来源

6 条引用
  1. [1] Eleven v4
  2. [2] ElevenLabs Eleven v4 Turbo Launch
  3. [3] ElevenLabs Eleven v4 Takes No. 1 Voice AI Rank With Pronunciation Record
  4. [4] ElevenLabs raises $500M from Sequoia at a $11 billion valuation
  5. [5] ElevenLabs' new v4 speech model supports more expression control and 90 languages
  6. [6] ElevenLabs Launches Eleven v4 With Low-Latency Turbo Variant

来源文章

Top 4

THE SIGNAL.

Analysts

“提醒称 ElevenLabs 的“第一”排行榜说法并非普适质量标准,并指出10秒语音克隆的营销宣传与官方文档之间存在差异。”

Runtime Wire (analysis outlet)
行业评论/分析网站

“称赞 Eleven v4 Turbo 在对话速度与质量之间取得了平衡,这是此前实时TTS模型未能解决的难题。”

Unnamed enterprise user (quoted by Unite.AI)
语音AI产品用户
The Crowd

“Introducing Eleven v4 and Eleven v4 Turbo, our fastest and most emotive voice models yet. Ranked #1 by Artificial Analysis.”

@@ElevenLabs4516

“Truly blown away by the results from Eleven v4. This model has a new architecture that unlocks more realistic and controllable speech. You can now direct the performance of the character AND the soundscape around them. And the voice effects (like "cheap microphone") are on point.”

@@venturetwins371

“Same voice, four languages on Eleven v4 in this clip, and it sounds native in every one. So cool to see.”

@@n__deborah38

“ElevenLabs v4”

@u/aeroniero197
Broadcast
Introducing Eleven v4 and Eleven v4 Turbo

Introducing Eleven v4 and Eleven v4 Turbo

New Models and the Future of Voice AI | Mati Staniszewski, ElevenLabs Summit Warsaw 2026

New Models and the Future of Voice AI | Mati Staniszewski, ElevenLabs Summit Warsaw 2026