ElevenLabs Eleven v4 发布
战略概览
- 01.ElevenLabs 于2026年9月28日发布了其迄今为止最具表现力的文本转语音模型 Eleven v4,以及专为语音代理和实时应用设计的低延迟版本 Eleven v4 Turbo。
- 02.Eleven v4 运行在一种全新的架构之上,能够从文本中解读语调、节奏、情感、角色和上下文,生成富有表现力的语音,同时保持说话人身份的一致性。
- 03.语言支持从大约70种扩展到超过90种,在日语、巴西葡萄牙语、普通话和粤语方面有显著的质量提升。
- 04.ElevenLabs 宣传仅需10秒音频即可实现即时语音克隆,但其v4官方文档指出,克隆通常需要一到两分钟的样本音频,这一差距被外界分析标记为理想情况下的营销说法。
- 05.Eleven v4 Turbo 实现了约100毫秒的中位推理延迟和约150毫秒的中位首字输出时间,在该指标上优于 Cartesia 的 Sonic 3.6 和 OpenAI 的 GPT-4o mini TTS。
- 06.两款模型现已立即在 ElevenAgents、ElevenCreative 和 ElevenAPI 上提供,且包含在 ElevenLabs 免费账户层级中。
- 07.首发定价在两周内为每百万字符11美元(v4 Turbo)和22美元(Eleven v4)。
排行榜之争:v4 对阵 Cartesia 与 Google
独立基准测试机构 Artificial Analysis 将 Eleven v4 列为其 Provider Voice TTS Arena 排行榜首位,在超过1,600次两两对比中获得1,319的Elo评分,领先于 Cartesia 的 Sonic 3.6(1,276)和 Google 的 Gemini 3.8 Flash TTS(1,267)[3]。在同一套基准测试中,Eleven v4 在发音稳健性方面也创下91.7%的新高,略高于 Gemini 3.8 Flash TTS 的89.5%[3]。不过表现并非全面领先:在独立的“受控语音”类别中,Eleven v4 的Elo得分为1,157,位居第二,落后于阿里巴巴的 Qwen-Audio-3.1-TTS-Plus。Runtime Wire 提醒,榜首位置仅表明在特定比较中处于领先地位,并非语音质量的普适衡量标准,因为该排行榜测试的是原生语音在盲选成对条件下的表现,可能无法匹配所有现实中的听觉偏好[2]。
为竞赛融资:110亿美元估值与企业收入
v4 Turbo 针对实时语音代理,具有现实影响
Eleven v4 Turbo 是专为低延迟优化的版本,中位推理延迟约为100毫秒,中位首字输出时间约为150毫秒,在首字输出时间上比 Cartesia 的 Sonic 3.6 快112毫秒,比 OpenAI 的 GPT-4o mini TTS 快664毫秒[6]。ElevenLabs 明确指出其速度的应用场景:用于 ElevenAgents 客户支持部署,处理争执、升级和等待等情况,即在实时电话对话中,半秒的静默就会打破沉浸感[5]。这种定位具有双重影响。更快、更自然的实时语音代理意味着AI可以合理接管此前需要真人参与的更多客户服务对话,而同样的低延迟、高表现力管道也同样可用于不那么良性的实时语音生成。
并非所有人都信服:克隆限制与口音同质化问题
早期用户的反应总体热烈,独立测试者强调其对角色表现和环境音效的精细控制,以及听起来在多种语言中都像母语者而非明显配音的多语言片段。但质疑集中在一些可验证的具体声明上。在语音克隆方面,ElevenLabs 宣传的10秒音频与自身文档中建议的一到两分钟样本之间的差距,是最明显的营销宣传超越产品规格的案例[2]。社区测试者还报告称,一些带口音的语音在v4中的发音比v3更“美国化”,这可能是口音保真度的倒退,尽管整体基准测试分数有所提升。此外,人们也普遍怀疑该公司声称的语音一致性是否真能在无限长度的文本中持续保持。这些因素均未体现在排行榜数据中,因为排行榜衡量的是盲选成对偏好,而非长期一致性或口音保留能力。
历史背景
关键关系图
事实来源
[1] Eleven v4
[2] ElevenLabs Eleven v4 Turbo Launch
[3] ElevenLabs Eleven v4 Takes No. 1 Voice AI Rank With Pronunciation Record
[4] ElevenLabs raises $500M from Sequoia at a $11 billion valuation
[5] ElevenLabs' new v4 speech model supports more expression control and 90 languages
[6] ElevenLabs Launches Eleven v4 With Low-Latency Turbo Variant
来源文章
THE SIGNAL.
“提醒称 ElevenLabs 的“第一”排行榜说法并非普适质量标准,并指出10秒语音克隆的营销宣传与官方文档之间存在差异。”
“称赞 Eleven v4 Turbo 在对话速度与质量之间取得了平衡,这是此前实时TTS模型未能解决的难题。”
“Introducing Eleven v4 and Eleven v4 Turbo, our fastest and most emotive voice models yet. Ranked #1 by Artificial Analysis.”
“Truly blown away by the results from Eleven v4. This model has a new architecture that unlocks more realistic and controllable speech. You can now direct the performance of the character AND the soundscape around them. And the voice effects (like "cheap microphone") are on point.”
“Same voice, four languages on Eleven v4 in this clip, and it sounds native in every one. So cool to see.”
“ElevenLabs v4”

Introducing Eleven v4 and Eleven v4 Turbo

New Models and the Future of Voice AI | Mati Staniszewski, ElevenLabs Summit Warsaw 2026