
Ein gutes KI-Avatar-Video kann an einem Punkt scheitern: wenn die Stimme das Skript nur vorliest, anstatt es zu spielen. Die Lippensynchronisation stimmt, der Bildausschnitt passt, aber die Art des Vortrags klingt vom ersten bis zum letzten Satz gleich.
Genau diese Lücke wollte ElevenLabs mit Eleven v4 schließen, das am 28. September 2026 veröffentlicht wurde. AI Studios basiert nun darauf. Im Folgenden erfahren Sie, was sich durch das Modell ändert, was das für Ihre Videos in AI Studios bedeutet und wie Sie Skripte schreiben, um das Beste daraus herauszuholen.
Was ist ElevenLabs Eleven v4?
Eleven v4 ist das neueste Text-to-Speech-Modell von ElevenLabs. Der Fokus liegt auf der Performance: Es erfasst Tonfall, Tempo, Emotionen und Charakter direkt aus dem Skript, anstatt die Wörter nur auszusprechen.
Es erscheint in zwei Versionen. Eleven v4 ist das voll ausgestattete Modell für produzierte Inhalte. Eleven v4 Turbo nutzt dieselbe Architektur, ist jedoch auf Geschwindigkeit optimiert und für Echtzeit-Sprachassistenten konzipiert.
Einige Zahlen, die ElevenLabs zum Start veröffentlicht hat:
- Platz 1 auf der Bestenliste für Text-to-Speech von Artificial Analysis (September 2026)
- Wurde in blinden Vergleichstests von etwa 75 % der Hörer gegenüber Konkurrenzmodellen bevorzugt
- Etwa 150 ms mittlere Zeit bis zur ersten hörbaren Sprachausgabe bei v4 Turbo
Eine praktische Änderung für Skriptautoren: v4 verzichtet auf SSML-ähnliches Markup. Anweisungen werden direkt im Text als einfache Tags geschrieben, wie zum Beispiel [lacht], [flüstert] oder [leichter Regen].
Fünf Dinge, die in v4 verbessert wurden
1. Eine größere Auswahl an Emotions-Tags
v4 versteht mehr Anweisungen und setzt diese zuverlässiger um als v3, insbesondere wenn mehrere Tags hintereinander stehen. Sie können über grundlegende Emotionen hinausgehen und Anweisungen wie [wütend mit französischem Akzent gesagt] oder Sound-Hinweise wie [Tür knallt] verwenden.
2. Über 90 Sprachen
Die Sprachunterstützung umfasst nun mehr als 90 Sprachen. Dieselbe Stimme kann jede dieser Sprachen mit einem authentischen Akzent sprechen, wobei Rhythmus und Emotionen erhalten bleiben, anstatt bei der Übersetzung verloren zu gehen.
3. Der Sprecher bleibt konsistent
Frühere Modelle konnten abweichen: Eine Stimme klang von einem Absatz oder Video zum nächsten leicht anders. v4 hält die Stimme eines Sprechers stabil und ohne Verzerrungen, auch bei Dialogen mit mehreren Sprechern.
4. Lange Skripte bleiben zusammenhängend
v4 liest ein Skript als Ganzes und nicht als isolierte Sätze. Durch kontextbezogenes Zusammenfügen bleiben Tonfall und Sprechtempo bei langen Audioinhalten konsistent, sodass ein 10-minütiges Schulungsmodul nicht wie 40 aneinandergereihte Einzelclips klingt.
5. 150 ms bis zur ersten Sprachausgabe
Bei v4 Turbo liegt die mittlere Zeit bis zur ersten hörbaren Sprachausgabe bei etwa 150 ms, bei einer Inferenzlatenz von rund 100 ms. ElevenLabs gibt für Wettbewerber Werte zwischen 262 und 814 ms an. Genau dieser Unterschied ermöglicht natürliche Dialoge in Konversationsanwendungen.
Was sich in AI Studios ändert
Für Nutzer von AI Studios ändern sich zwei Dinge.
Emotion-Tags werden jetzt in v4 unterstützt. Bisher wurden Skripte mit Emotion-Tags in AI Studios mit Eleven v3 vertont. Jetzt laufen sie über v4, sodass Sie von einer größeren Auswahl an Tags und einer zuverlässigeren Umsetzung profitieren, ohne Ihre Schreibweise anpassen zu müssen.
Stimmen bleiben konsistent. Wenn derselbe Avatar und dieselbe Stimme in einer Serie auftreten – sei es in einem Kurs, einer Produktvorstellung oder wöchentlichen Updates –, bleibt die Stimme von Szene zu Szene und von Video zu Video stabil. Die Zuschauer hören einen einzigen Sprecher und nicht nur eine annähernde Kopie.
So schreiben Sie ein Skript mit Emotion-Tags
Tags funktionieren am besten als Regieanweisung für einen Schauspieler, nicht als Dekoration. Platzieren Sie sie direkt vor dem Textabschnitt, den sie beeinflussen sollen, und setzen Sie sie dort ein, wo sich die Sprechweise ändern soll.
Ein einfaches Skript:
Welcome back. Last week we covered onboarding. Today we're looking at the one mistake almost every new team makes.
Dasselbe Skript mit Regieanweisungen:
[warmly] Welcome back. Last week we covered onboarding.
[pauses] [lowers voice] Today we're looking at the one mistake almost every new team makes.
Ein paar hilfreiche Gewohnheiten:
- Markieren Sie die Änderung, nicht jede Zeile. Wenn das gesamte Skript in einem warmen Ton gehalten ist, reicht eine Markierung am Anfang aus.
- Seien Sie präzise. [seufzt erleichtert] gibt dem Modell mehr Spielraum als [glücklich].
- Behalten Sie Skripte als Ganzes bei. Da v4 den Kontext des gesamten Skripts erfasst, sorgt das Einfügen des vollständigen Textes für ein besseres Pacing als das Aufteilen in kurze Szenen.
- Einmal anhören, einmal anpassen. Sehen Sie sich eine Vorschau der ersten Szene an, bevor Sie das vollständige Video generieren.
Wo der Unterschied deutlich wird
FAQ
Was ist ElevenLabs v4?
Eleven v4 ist das neueste Text-to-Speech-Modell von ElevenLabs, das am 28. September 2026 veröffentlicht wurde. Es konzentriert sich auf eine ausdrucksstarke Sprachausgabe, unterstützt über 90 Sprachen und ist in einer Turbo-Version mit geringer Latenz verfügbar.
Nutzt AI Studios ElevenLabs v4?
Ja. Skripte, die Emotions-Tags in AI Studios verwenden, werden jetzt mit Eleven v4 anstelle von v3 vertont.
Muss ich meine bestehenden Skripte ändern?
Nein. Die Tags, die Sie bereits verwenden, funktionieren weiterhin. v4 setzt sie zuverlässiger um und unterstützt eine größere Auswahl.
Was sind Emotion-Tags?
Kurze Anweisungen in eckigen Klammern, wie [lacht] oder [flüstert], die im Skript platziert werden, um die Art und Weise der Sprachausgabe zu steuern.
Wie viele Sprachen unterstützt Eleven v4?
Mehr als 90, wobei dieselbe Stimme jede davon mit einem natürlich klingenden Akzent sprechen kann.
Probieren Sie es bei Ihrem nächsten Skript aus
Am einfachsten hören Sie den Unterschied, wenn Sie ein bereits produziertes Skript nehmen, zwei oder drei Tags an den Stellen einfügen, an denen sich die Ausdrucksweise ändern soll, und es erneut generieren. Öffnen Sie die AI Studios und beginnen Sie mit Ihrem nächsten Video.
Quellen
- Eleven v4: Unser bisher ausdrucksstärkstes Text-to-Speech-KI-Modell (ElevenLabs-Blog)
- Eleven v4 Produktseite (ElevenLabs)
- ElevenLabs veröffentlicht Eleven V4 mit latenzarmer Turbo-Variante (Unite.AI)
