
一段优秀的 AI 数字人视频,往往会因为一个问题而大打折扣:配音听起来像是在“读”稿子,而不是在“演”戏。即便口型对得上、构图很完美,但如果从第一句到最后一句的语调毫无起伏,效果依然会很生硬。
这正是 ElevenLabs 在 2026 年 9 月 28 日发布的 Eleven v4 模型旨在解决的问题。AI Studios 现已全面升级至该模型。以下是该模型的改进之处、对您在 AI Studios 中制作视频的影响,以及如何编写脚本以充分发挥其潜力。
什么是 ElevenLabs Eleven v4?
Eleven v4 是 ElevenLabs 最新的文本转语音模型。它的核心在于“表现力”:它不仅是朗读文字,更能从脚本中捕捉语调、节奏、情感和角色特质。
该模型包含两个版本。Eleven v4 是功能完备的生产级模型;Eleven v4 Turbo 采用相同架构,但针对速度进行了优化,专为实时语音交互场景打造。
ElevenLabs 在发布时公布了几项关键数据:
- 在 Artificial Analysis 文本转语音排行榜中位列第一(2026 年 9 月)
- 在盲测对比中,约 75% 的听众更倾向于该模型
- v4 Turbo 版本的首字发音延迟中位数约为 150 毫秒
对于脚本撰写者来说,一个实用的变化是:v4 不再依赖 SSML 格式标记。现在,您只需直接在文本中加入自然语言标签即可,例如 [笑]、[耳语] 或 [小雨声]。
v4 带来的五大提升
1. 更丰富的情感标签
相比 v3,v4 能理解更多指令,执行也更精准,尤其是在连续使用多个标签时表现更佳。您不仅可以使用基础情感标签,还能加入如 [愤怒的法语口音] 这样的表达提示,或是 [关门声] 这样的环境音效。
2. 支持 90 多种语言
现已支持超过 90 种语言。同一个音色可以地道地演绎每种语言,且在翻译过程中,语调的节奏感和情感色彩不会被削弱。
3. 始终如一的音色表现
旧版本模型有时会出现音色漂移,导致同一段落或不同视频间的音色听起来略有差异。v4 确保了音色的高度稳定性,即使在多角色对话中也不会出现失真。
4. 保持长文本脚本的连贯性
v4 将脚本视为一个整体,而非孤立句子的集合。上下文衔接技术确保了长篇音频在语调和节奏上的一致性,让 10 分钟的培训模块听起来不再像是 40 段零散片段的拼凑。
5. 150 毫秒首字发音
在 v4 Turbo 模型上,从输入到发出首个声音的平均时间约为 150 毫秒,其中推理延迟仅约 100 毫秒。据 ElevenLabs 数据显示,竞品的时间在 262 到 814 毫秒之间。正是这一差距,使得自然流畅的对话交互成为可能。
AI Studios 的变化
AI Studios 用户将迎来两项变化。
情感标签现已支持 v4 模型。 此前,在 AI Studios 中带有情感标签的脚本均由 Eleven v3 模型生成。现在这些脚本将运行在 v4 上,无需更改写作方式,即可获得更丰富的情感标签选择和更精准的标签执行效果。
音色保持一致。 当同一个数字人和音色出现在系列视频中时,无论是课程、产品演示还是每周更新,其音色在不同场景和视频之间都能保持高度稳定。观众听到的始终是同一位演讲者,而非音色相似的替代者。
如何编写带有情感标签的脚本
标签的最佳用法是作为对演员的指导,而非装饰。请将标签放置在需要产生效果的台词之前,并仅在需要改变表达方式的地方使用。
普通脚本:
Welcome back. Last week we covered onboarding. Today we're looking at the one mistake almost every new team makes.
带有指导的同一脚本:
[warmly] Welcome back. Last week we covered onboarding.
[pauses] [lowers voice] Today we're looking at the one mistake almost every new team makes.
几个实用的小习惯:
- 标记变化点,无需标记每一行。 如果整段脚本的情绪基调一致,在开头标记一次即可。
- 描述要具体。 相比于 [happy],使用 [sighs, relieved] 能为模型提供更丰富的表现空间。
- 保持脚本完整。 由于 v4 模型会通读全文以理解语境,提供完整文本比拆分成短场景能获得更好的节奏感。
- 先试听,再调整。 在生成完整视频前,请先预览第一个场景。
差异体现之处
常见问题
什么是 ElevenLabs v4?
Eleven v4 是 ElevenLabs 于 2026 年 9 月 28 日发布的最新语音合成模型。它专注于提升表达力,支持 90 多种语言,并提供低延迟的 Turbo 版本。
AI Studios 是否使用 ElevenLabs v4?
是的。在 AI Studios 中使用情绪标签的脚本,现在均由 Eleven v4 而非 v3 模型进行配音。
我需要修改现有的脚本吗?
不需要。您现有的标签依然有效。v4 对标签的遵循度更高,且支持的范围也更广。
什么是情感标签?
指放在脚本中、用方括号括起来的简短指令(如 [大笑] 或 [耳语]),用于调整台词的表达方式。
Eleven v4 支持多少种语言?
支持超过 90 种语言,且同一音色能够以地道的口音说出每一种语言。
在您的下一个脚本中试一试
感受差异最简单的方法是:拿出一个您已经制作好的脚本,在需要改变语气的地方添加两三个标签,然后重新生成。打开 AI Studios,开始创作您的下一个视频吧。
来源
- Eleven v4:我们迄今为止表现力最强的文本转语音 AI 模型 (ElevenLabs 博客)
- Eleven v4 产品页面 (ElevenLabs)
- ElevenLabs 发布 Eleven V4,并推出低延迟 Turbo 版本 (Unite.AI)

