Tech and AI Explained

تقنية ElevenLabs v4 في AI Studios: أصوات ذكاء اصطناعي تعبيرية لمقاطع فيديو الصور الرمزية (Avatar)

Updated
September 30, 2026
Published
September 30, 2026
Quick Answer

تستخدم AI Studios الآن تقنية ElevenLabs Eleven v4، التي توفر علامات تعبيرية أكثر ثراءً، ودعماً لأكثر من 90 لغة، وأصوات متحدثين متسقة، بالإضافة إلى القدرة على معالجة النصوص الطويلة مع الحفاظ على سياقها.

قد يفشل فيديو الصورة الرمزية (Avatar) الذي يعمل بالذكاء الاصطناعي في تحقيق هدفه لسبب واحد: الصوت الذي يقرأ النص بدلاً من أدائه. فبينما تكون مزامنة الشفاه دقيقة والتأطير مثاليًا، يظل الإلقاء رتيباً من البداية إلى النهاية.

هذه هي الفجوة التي سعت ElevenLabs إلى سدها من خلال نموذج Eleven v4، الذي أُطلق في 28 سبتمبر 2026، وتعمل به AI Studios الآن. فيما يلي توضيح لما يغيره هذا النموذج، وما يعنيه لمقاطع الفيديو التي تنشئها في AI Studios، وكيفية كتابة نصوص تحقق أقصى استفادة منه.

ما هو نموذج ElevenLabs Eleven v4؟

Eleven v4 هو أحدث نموذج لتحويل النص إلى كلام من ElevenLabs. ينصب تركيزه على الأداء: أي قراءة النبرة، والإيقاع، والعاطفة، والشخصية من النص، وليس مجرد نطق الكلمات.

يأتي النموذج في نسختين: Eleven v4، وهو النموذج كامل الميزات للمحتوى المنتج، وEleven v4 Turbo، الذي يشترك في نفس البنية ولكنه مصمم للسرعة، وموجه لوكلاء الصوت في الوقت الفعلي.

بعض الأرقام التي نشرتها ElevenLabs عند الإطلاق:

  • المرتبة الأولى في قائمة تصنيف Artificial Analysis لتحويل النص إلى كلام (سبتمبر 2026)
  • يفضله حوالي 75% من المستمعين في اختبارات المقارنة العمياء ضد النماذج المنافسة
  • متوسط وقت استجابة يبلغ حوالي 150 مللي ثانية لبدء الكلام المسموع في إصدار v4 Turbo

تغيير عملي لكُتّاب النصوص: يتخلى v4 عن ترميز SSML. يتم كتابة التوجيهات الآن ضمن النص كعلامات بلغة بسيطة، مثل [يضحك]، أو [يهمس]، أو [مطر خفيف].

‍

خمسة تحسينات في إصدار v4

1. نطاق أوسع من علامات العاطفة

يفهم v4 توجيهات أكثر وينفذها بشكل أكثر موثوقية من v3، خاصة عند ظهور عدة علامات متتالية. يمكنك تجاوز العواطف الأساسية إلى إشارات إلقاء مثل [قال بغضب بلكنة فرنسية] أو إشارات صوتية مثل [إغلاق باب].

2. دعم أكثر من 90 لغة

يغطي دعم اللغة الآن أكثر من 90 لغة. يمكن للصوت نفسه التحدث بكل لغة بلكنة تبدو طبيعية، مع الحفاظ على الإيقاع والعاطفة بدلاً من تلاشيها أثناء الترجمة.

3. ثبات هوية المتحدث

كانت النماذج السابقة تعاني من تذبذب في الأداء، حيث قد يختلف الصوت قليلاً من فقرة إلى أخرى أو من فيديو إلى آخر. أما v4 فيحافظ على استقرار صوت المتحدث دون تشويه، بما في ذلك في الحوارات التي تضم عدة متحدثين.

4. الحفاظ على ترابط النصوص الطويلة

يقرأ الإصدار الرابع (v4) النص كوحدة متكاملة، وليس كجمل منفصلة. تضمن تقنية ربط السياق اتساق النبرة والإيقاع في المقاطع الصوتية الطويلة، مما يمنع ظهور وحدة تدريبية مدتها 10 دقائق وكأنها 40 مقطعاً منفصلاً تم دمجها معاً.

5. 150 مللي ثانية لبدء الكلام

في إصدار v4 Turbo، يبلغ متوسط الوقت اللازم لبدء الكلام المسموع حوالي 150 مللي ثانية، مع زمن استجابة للاستنتاج يبلغ حوالي 100 مللي ثانية. تشير تقارير ElevenLabs إلى أن المنافسين يتراوح زمن استجابتهم بين 262 و814 مللي ثانية. هذا الفارق هو ما يجعل المحادثات التفاعلية الطبيعية أمراً ممكناً.

‍

ما الذي يتغير في AI Studios

هناك أمران سيتغيران لمستخدمي AI Studios.

أصبحت وسوم المشاعر (Emotion tags) تعمل الآن مع الإصدار الرابع (v4). حتى الآن، كانت النصوص التي تحتوي على وسوم المشاعر في AI Studios تُنطق باستخدام إصدار Eleven v3. أما الآن، فهي تعمل على الإصدار الرابع (v4)، مما يمنحك نطاقاً أوسع من الوسوم واستجابة أكثر دقة لها دون الحاجة لتغيير أسلوب كتابتك.

ثبات الأصوات. عند ظهور نفس الشخصية الافتراضية والصوت عبر سلسلة من الفيديوهات، سواء كانت دورة تدريبية، أو شرحاً لمنتج، أو تحديثات أسبوعية، يظل الصوت ثابتاً من مشهد لآخر ومن فيديو لآخر. سيسمع المشاهدون مقدم عرض واحد، وليس مجرد محاكاة قريبة له.

Before (v3)Now (v4)
Emotion and audio tagsCore setWider range, followed more reliably in sequence
Speaker consistencyCould drift across long or multi-part contentStable voice, no distortion
Long scriptsTone could reset between sectionsContext carried through the whole script
Languages70+90+

‍

كيفية كتابة نص باستخدام وسوم المشاعر

تعمل الوسوم بشكل أفضل كإرشادات للممثل، لا كزينة للنص. ضعها مباشرة قبل الجملة التي تريد التأثير عليها، واستخدمها في المواضع التي تتطلب تغييراً في طريقة الإلقاء.

‍

نص عادي:

Welcome back. Last week we covered onboarding. Today we're looking at the one mistake almost every new team makes.

‍

نفس النص مع إضافة إرشادات:

[warmly] Welcome back. Last week we covered onboarding.
[pauses] [lowers voice] Today we're looking at the one mistake almost every new team makes.

‍

بعض العادات التي تساعدك:

  • ضع وسماً للتغيير، وليس لكل سطر. إذا كان النص بأكمله يتسم بنبرة دافئة، يكفي وضع وسم واحد في البداية.
  • كن محدداً. [تنهد بارتياح] يمنح النموذج مساحة أكبر للعمل مقارنة بـ [سعيد].
  • حافظ على النصوص كاملة. نظراً لأن الإصدار الرابع يقرأ السياق عبر النص بالكامل، فإن لصق النص كاملاً يمنح إيقاعاً أفضل من تقسيمه إلى مشاهد قصيرة.
  • استمع مرة، وعدّل مرة. عاين المشهد الأول قبل إنشاء الفيديو بالكامل.

‍

أين يظهر الفرق

Use caseWhat v4 fixes
Training and e-learning seriesSame presenter voice across every module; long lessons keep their pacing
Product demos and explainersEmphasis and pauses land where the script needs them
Localized marketing videosOne voice across 90+ languages, with native accents
Customer support and FAQ videosA calmer, more reassuring tone that matches the question
Character-driven or story contentDistinct emotions and sound cues within one scene

‍

الأسئلة الشائعة

ما هو ElevenLabs v4؟

Eleven v4 هو أحدث نموذج لتحويل النص إلى كلام من ElevenLabs، تم إصداره في 28 سبتمبر 2026. يركز النموذج على الأداء التعبيري، ويدعم أكثر من 90 لغة، ويأتي بنسخة Turbo ذات زمن استجابة منخفض.

هل يستخدم AI Studios نموذج ElevenLabs v4؟

نعم. النصوص التي تستخدم وسوم العاطفة في AI Studios يتم الآن نطقها باستخدام Eleven v4 بدلاً من v3.

هل أحتاج إلى تغيير نصوصي الحالية؟

لا، فالوسوم التي تستخدمها حالياً لا تزال تعمل. الإصدار الرابع (v4) يتبعها بشكل أكثر دقة ويدعم نطاقاً أوسع منها.

ما هي وسوم المشاعر؟

هي توجيهات قصيرة توضع بين قوسين مربعين، مثل [يضحك] أو [يهمس]، وتُدرج في النص لتحديد كيفية إلقاء الجملة.

كم عدد اللغات التي يدعمها نموذج Eleven v4؟

أكثر من 90 لغة، مع قدرة الصوت نفسه على التحدث بكل منها بلكنة تبدو طبيعية كأهل اللغة.

‍

‍

جربه في نصك القادم

أسهل طريقة لتلاحظ الفرق هي أخذ نص قمت بإنتاجه مسبقاً، وإضافة وسمين أو ثلاثة في المواضع التي يجب أن يتغير فيها أسلوب الإلقاء، ثم إعادة توليده. افتح استوديو الذكاء الاصطناعي وابدأ العمل على الفيديو القادم.

‍

المصادر

‍