
優れたAIアバター動画であっても、一つだけ残念な点が生じることがあります。それは、スクリプトを「読み上げている」だけで、「演じていない」音声です。リップシンクや構図が完璧でも、冒頭から結びまで同じトーンで語られていては、魅力が半減してしまいます。
ElevenLabsが2026年9月28日にリリースした「Eleven v4」は、まさにその溝を埋めるために開発されました。AI Studiosは現在、このモデルを採用しています。本記事では、モデルの変更点、AI Studiosで作成する動画への影響、そしてその性能を最大限に引き出すスクリプトの書き方について解説します。
ElevenLabs Eleven v4とは?
Eleven v4は、ElevenLabsの最新テキスト読み上げ(TTS)モデルです。単に言葉を発音するだけでなく、スクリプトからトーン、ペース、感情、キャラクター性を読み取り、「演技」することに重点を置いています。
本モデルには2つのバージョンがあります。Eleven v4は、コンテンツ制作向けのフル機能モデルです。一方、Eleven v4 Turboは同じアーキテクチャをベースにしつつ、リアルタイムの音声エージェント向けに速度を最適化したモデルです。
ElevenLabsが発表した主な指標は以下の通りです。
- Artificial Analysisのテキスト読み上げリーダーボードで第1位を獲得(2026年9月時点)
- ブラインドテストにおいて、競合モデルと比較して約75%のリスナーから支持を獲得
- v4 Turboにおける音声出力までの平均応答時間は約150ms
スクリプト作成における実用的な変更点として、v4ではSSML形式のマークアップが不要になりました。指示は[laughs](笑う)、[whispers](ささやく)、[light rain](小雨の音)のように、プレーンテキストのタグとしてスクリプト内に直接記述します。
v4で進化した5つのポイント
1. 感情表現タグの拡充
v4はv3よりも多くの指示を理解し、より正確に反映します。特に複数のタグが連続する場合の精度が向上しました。基本的な感情だけでなく、[said angrily in a French accent](フランス語訛りで怒って言う)といった話し方の指示や、[door slams](ドアが閉まる音)といった環境音の指示も可能です。
2. 90以上の言語に対応
90以上の言語をサポートしました。同一のボイスで各言語をネイティブに近いアクセントで話すことができ、翻訳時に失われがちだったリズムや感情もそのまま維持されます。
3. 話者の一貫性を保持
従来のモデルでは、段落や動画ごとに声の質感がわずかに変化してしまうことがありました。v4では、マルチスピーカーの対話を含め、歪みなく話者の声を安定して維持します。
4. 長いスクリプトでも自然なつながりを維持
v4はスクリプトを個別の文章としてではなく、全体として読み取ります。コンテキストを統合する技術により、長尺の音声でもトーンやペースが一貫するため、10分間のトレーニングモジュールが40個のクリップをつなぎ合わせたような不自然な仕上がりになることはありません。
5. 音声出力までの時間はわずか150ミリ秒
v4 Turboでは、最初の音声が聞こえるまでの時間は中央値で約150ミリ秒、推論レイテンシは約100ミリ秒です。ElevenLabsの調査によると、競合他社は262〜814ミリ秒かかっており、この差こそが会話形式の利用において自然なやり取りを可能にする鍵となります。
AI Studiosでの変更点
AI Studiosのユーザーには、2つの変更点があります。
感情タグがv4で反映されるようになりました。 これまでは、AI Studiosで感情タグを含むスクリプトを作成するとEleven v3で音声化されていましたが、今後はv4で実行されます。そのため、書き方を変えることなく、より幅広いタグの利用と、より正確な感情表現が可能になります。
一貫したボイスを維持。 コース、製品のチュートリアル、週次アップデートなど、シリーズを通して同じアバターとボイスを使用する場合、シーンや動画が変わっても声の質は一定に保たれます。視聴者は、似たような声ではなく、同一のプレゼンターによる音声として認識できます。
感情タグを使ったスクリプトの書き方
タグは装飾ではなく、俳優への指示として使うのが最も効果的です。影響を与えたいセリフの直前に配置し、話し方を変えたい箇所で使用してください。
通常のスクリプト:
Welcome back. Last week we covered onboarding. Today we're looking at the one mistake almost every new team makes.
指示を加えた同じスクリプト:
[warmly] Welcome back. Last week we covered onboarding.
[pauses] [lowers voice] Today we're looking at the one mistake almost every new team makes.
役立つヒント:
- 変更箇所のみにタグを付けてください。行ごとに付ける必要はありません。 スクリプト全体が温かい雰囲気であれば、冒頭にタグを1つ付けるだけで十分です。
- 具体的に指定してください。 [安堵のため息] と指定する方が、[嬉しい] と指定するよりも、モデルが表現を調整しやすくなります。
- スクリプトは分割せずにまとめてください。 v4はスクリプト全体の文脈を読み取るため、短いシーンに分割するよりも全文を貼り付ける方が、より自然なペースで生成されます。
- 一度聞いて、一度調整する。 動画全体を生成する前に、最初のシーンをプレビューしてください。
違いが表れるポイント
よくある質問
ElevenLabs v4とは何ですか?
Eleven v4は、2026年9月28日にリリースされたElevenLabsの最新のテキスト読み上げモデルです。表現力豊かな読み上げに重点を置いており、90以上の言語に対応し、低遅延のTurboバージョンも用意されています。
AI StudiosはElevenLabs v4を使用していますか?
はい。AI Studiosで感情タグを使用したスクリプトは、v3ではなくEleven v4で音声が生成されるようになりました。
既存のスクリプトを変更する必要がありますか?
いいえ。これまで使用していたタグはそのまま使えます。v4ではタグの認識精度が向上し、対応範囲も広がりました。
感情タグとは何ですか?
[laughs](笑い)や[whispers](ささやき)のように、台詞の読み上げ方を指定するためにスクリプト内に挿入する短い指示のことです。
Eleven v4は何言語に対応していますか?
90以上の言語に対応しており、同一の音声でそれぞれの言語をネイティブに近いアクセントで話すことができます。
次のスクリプトで試してみる
違いを実感する最も簡単な方法は、すでに作成済みのスクリプトを用意し、表現を変えたい箇所に2〜3個のタグを追加して再生成してみることです。AI Studiosを開いて、次の動画制作を始めましょう。
出典
- Eleven v4:これまでで最も表現力豊かなテキスト読み上げAIモデル (ElevenLabsブログ)
- Eleven v4 製品ページ (ElevenLabs)
- ElevenLabsが低遅延のTurboバリアントを備えたEleven V4を発表 (Unite.AI)

