
Даже качественное видео с ИИ-аватаром может провалиться из-за одной детали: голос звучит так, будто он просто читает текст, а не играет роль. Синхронизация губ в порядке, кадрирование тоже, но интонация остается монотонной от первой до последней строки.
Именно этот пробел ElevenLabs стремились заполнить с помощью Eleven v4, выпущенной 28 сентября 2026 года. Теперь AI Studios работает на этой модели. Ниже описано, что изменилось, что это значит для ваших видео в AI Studios и как писать сценарии, чтобы выжать из модели максимум.
Что такое ElevenLabs Eleven v4?
Eleven v4 — это новейшая модель преобразования текста в речь от ElevenLabs. Ее главная задача — актерская игра: передача тона, темпа, эмоций и характера, заложенных в сценарии, а не просто произношение слов.
Модель представлена в двух версиях. Eleven v4 — полнофункциональная версия для создания контента. Eleven v4 Turbo использует ту же архитектуру, но оптимизирована по скорости для работы голосовых агентов в реальном времени.
Несколько цифр, опубликованных ElevenLabs на момент запуска:
- Первое место в рейтинге систем преобразования текста в речь по версии Artificial Analysis (сентябрь 2026 г.)
- Предпочтение отдано примерно 75% слушателей в слепых сравнительных тестах с конкурирующими моделями
- Среднее время до начала воспроизведения речи на v4 Turbo составляет около 150 мс
Практическое изменение для авторов сценариев: v4 отказывается от разметки в стиле SSML. Указания теперь пишутся прямо в тексте в виде простых тегов, например [смеется], [шепотом] или [легкий дождь].
Пять улучшений в v4
1. Более широкий спектр тегов эмоций
v4 понимает больше указаний и точнее следует им, чем v3, особенно если несколько тегов идут подряд. Вы можете использовать не только базовые эмоции, но и указания по подаче, например [сказано сердито с французским акцентом], или звуковые эффекты, такие как [хлопок двери].
2. Более 90 языков
Поддержка теперь охватывает более 90 языков. Один и тот же голос может говорить на каждом из них с естественным акцентом, при этом ритм и эмоции сохраняются, а не сглаживаются при переводе.
3. Стабильность голоса диктора
Предыдущие модели могли «плавать»: голос мог звучать немного иначе в разных абзацах или видео. v4 сохраняет голос диктора стабильным и без искажений, в том числе при диалогах с несколькими участниками.
4. Длинные сценарии звучат целостно
Версия v4 воспринимает сценарий целиком, а не как набор отдельных предложений. Технология контекстного связывания обеспечивает единообразие тона и темпа в длинных аудиозаписях, поэтому 10-минутный обучающий модуль не будет звучать как 40 склеенных фрагментов.
5. 150 мс до начала речи
В версии v4 Turbo медианное время до начала воспроизведения речи составляет около 150 мс, при этом задержка вывода (inference latency) составляет примерно 100 мс. По данным ElevenLabs, у конкурентов этот показатель варьируется от 262 до 814 мс. Именно этот разрыв позволяет добиться естественного живого общения в диалогах.
Что изменилось в AI Studios
Для пользователей AI Studios есть два изменения.
Теги эмоций теперь работают в v4. Раньше сценарии с тегами эмоций в AI Studios озвучивались с помощью Eleven v3. Теперь они работают на базе v4, поэтому вы получаете более широкий спектр тегов и их более точное воспроизведение без необходимости менять стиль написания текста.
Голоса остаются неизменными. Когда один и тот же аватар и голос используются в серии материалов — будь то курс, обзор продукта или еженедельные новости — голос остается стабильным от сцены к сцене и от видео к видео. Зрители слышат одного и того же ведущего, а не его отдаленное подобие.
Как писать сценарии с тегами эмоций
Теги лучше всего работают как указания для актера, а не как украшение текста. Размещайте их непосредственно перед фразой, на которую они должны повлиять, и используйте там, где требуется изменение интонации.
Обычный сценарий:
Welcome back. Last week we covered onboarding. Today we're looking at the one mistake almost every new team makes.
Тот же сценарий с указаниями:
[warmly] Welcome back. Last week we covered onboarding.
[pauses] [lowers voice] Today we're looking at the one mistake almost every new team makes.
Несколько полезных привычек:
- Отмечайте изменение, а не каждую строку. Если весь сценарий выдержан в одном эмоциональном ключе, достаточно одного тега в начале.
- Будьте конкретны. [вздыхает с облегчением] дает модели больше контекста, чем просто [радостно].
- Не разбивайте сценарии. Поскольку v4 учитывает контекст всего сценария, использование полного текста обеспечивает более естественный темп речи, чем разделение на короткие сцены.
- Слушайте один раз, корректируйте один раз. Прослушайте первую сцену перед генерацией полного видео.
В чем заметна разница
Часто задаваемые вопросы
Что такое ElevenLabs v4?
Eleven v4 — это новейшая модель синтеза речи от ElevenLabs, выпущенная 28 сентября 2026 года. Она ориентирована на выразительную подачу, поддерживает более 90 языков и включает версию Turbo с низкой задержкой.
Использует ли AI Studios модель ElevenLabs v4?
Да. Сценарии с использованием эмоциональных тегов в AI Studios теперь озвучиваются с помощью Eleven v4 вместо v3.
Нужно ли мне менять существующие сценарии?
Нет. Теги, которые вы уже используете, продолжают работать. v4 распознает их надежнее и поддерживает более широкий спектр.
Что такое теги эмоций?
Краткие указания в квадратных скобках, например [смеется] или [шепотом], которые добавляются в сценарий, чтобы задать интонацию произнесения фразы.
Сколько языков поддерживает Eleven v4?
Более 90, при этом один и тот же голос может говорить на каждом из них с естественным акцентом.
Попробуйте в своем следующем сценарии
Проще всего заметить разницу, если взять уже готовый сценарий, добавить два-три тега там, где должна измениться интонация, и сгенерировать аудио заново. Откройте AI Studios и начните работу над своим следующим видео.
Источники
- Eleven v4: наша самая выразительная модель синтеза речи на сегодняшний день (блог ElevenLabs)
- Страница продукта Eleven v4 (ElevenLabs)
- ElevenLabs выпускает Eleven V4 с низкозадержковым вариантом Turbo (Unite.AI)
