← العودة إلى المدونة
Aiحوالي 1 دقيقة قراءة

حلّت ElevenLabs مشكلة الصوت ثم رفعت ثمن أن يُسمع المرء

نُشر في 3 أكتوبر 2026
حلّت ElevenLabs مشكلة الصوت ثم رفعت ثمن أن يُسمع المرء

في 28 سبتمبر/أيلول، أطلقت ElevenLabs نموذجين للكلام. صُمم Eleven v4 للسرد والحوار المعدّ مسبقًا. وصُمم Eleven v4 Turbo للمحادثة المباشرة، بزمن استدلال وسيط يقارب 100 ميلي ثانية وحوالي 150 ميلي ثانية حتى أول كلام. وبعد يومين، أغلقت الشركة عرض شراء أسهم من الموظفين قيّمها عند 22 مليار دولار، أي ضعف تقييمها البالغ 11 مليار دولار في فبراير/شباط.

هذان الإعلانان هما الإعلان نفسه. فبمجرد أن يصبح نموذج صوتي سريعًا بما يكفي ليتوقف الناس عن ملاحظة التأخير، يصبح السؤال المتبقي: من يبدو حقيقيًا؟ وهذا سؤال منتج تحمل إجابته سعرًا.

كان زمن الاستجابة آخر عذر تقني

لطالما عانت وكلاء الصوت من نمط فشل عنيد لسنوات. الكلمات صحيحة، لكن التوقيت خاطئ. وقفة تطول قليلًا تحوّل مساعدًا مفيدًا إلى شيء يُغلق المستخدمون الخط في وجهه، وكان الحل دائمًا مزيدًا من العتاد أو جملة أقصر. أرقام Turbo تقع تحت عتبة إدراك البشر. فحوالي 100 ميلي ثانية هي تقريبًا طول فجوة محادثة عادية، ما يعني أن التأخير لم يعد يُقرأ كآلة تفكر، بل كشخص يتأمل.

كما تدعم البنية الجديدة أكثر من 90 لغة، ارتفاعًا من أكثر من 70 في v3، مع تفصيل يهم أكثر من العدد. فالصوت المستنسخ من تسجيل إنجليزي سيتحدث اليابانية بلكنة يابانية طبيعية بدلًا من جرّ لكنة المصدر معه. العلامات التجارية التي توطن متحدثًا واحدًا عبر أسواق متعددة تحصل على نتيجة أنظف، والأعمال الروائية التي تعتمد على لكنة شخصية تحتاج قرارًا متعمدًا لا وضعًا افتراضيًا.

تقبل الطلبات الآن حتى 10,000 حرف، أي ضعف الحد السابق. لا تزال وسوم الأداء المضمّنة مثل [laughs] و[whispers] و[said angrily] تعمل ويمكن تكديسها. ولا تزال عمليات الاستنساخ الفوري للصوت Instant Voice Clones تحتاج إلى نحو 10 ثوانٍ من الصوت.

القفزة من نحو 70 لغة إلى أكثر من 90 أصغر من القفزة في طريقة انتقال الصوت المستنسخ عبرها. يمكن الآن لتسجيل واحد أن يمثل منتجًا في اثني عشر سوقًا دون أن يبدو كل إصدار كأن الشخص نفسه يتكلف تقليد لكنة محلية. وبالنسبة لشركة توطن متحدثًا واحدًا، يزيل ذلك خطوة كانت تتطلب جلسة تسجيل ثانية لكل لغة.

التعبيرية هي حيث يوجد المال

صنّفت Artificial Analysis الإصدار v4 أولًا في التعبيرية، وتقول ElevenLabs إن نحو 75 بالمئة من المستمعين فضلوه في اختبارات عمياء. كلا الرقمين يأتيان من الشركة أو شركائها، لذا تعامل معهما كتسويق حتى يعيد أحدهم الاختبار. لكن الاتجاه نفسه معبّر. فكل مختبر رئيسي يستطيع الآن إنتاج كلام مفهوم. وقد انتقل عامل التميّز إلى ما إذا كان الكلام قادرًا على حمل النبرة والإيقاع وشخصية قابلة للتمييز عبر تسجيل طويل دون أن ينحرف الصوت بين الفصول.

الصورة التجارية تقول الشيء نفسه من زاوية مختلفة. فـ ElevenAgents، المنصة الخاصة بوكلاء المحادثة، تمثل الآن 55 بالمئة من إيرادات ElevenLabs. لم يعد الصوت يُباع أساسًا كسرد للكتب الصوتية. بل يُباع كطبقة الواجهة لبرمجيات تتحدث.

هذا التحول يفسر هيكل السعر. يكلف Eleven v4 مبلغ 0.08 دولار لكل 1,000 حرف عبر API، ويكلف Turbo مبلغ 0.04 دولار. ويخضع كلاهما لخصم حتى 12 أكتوبر/تشرين الأول، ليصبحا 0.022 و0.011 دولار على التوالي. الأسعار المرجعية هي التي ينبغي وضع الميزانية على أساسها، لأن خصم الإطلاق مؤقت والتصحيحات تضيف أحرفًا. كما أن Turbo مقيّد بطريقة واحدة محددة يسهل تفويتها: تقبل Text to Dialogue WebSocket ما يصل إلى عشرة أصوات مسجلة لكل اتصال في v4، لكن صوتًا واحدًا فقط في Turbo.

بقية السوق ليست واقفة مكتوفة الأيدي

ليست ElevenLabs وحدها من تتعامل مع الصوت كواجهة للوكيل. في 30 سبتمبر/أيلول، أطلقت Inception Labs نموذج Mercury Voice، وهو نموذج لغوي قائم على الانتشار مبني خصيصًا لوكلاء صوت منخفضي زمن الاستجابة، بزمن وسيط يبلغ 320 ميلي ثانية حتى أول رمز إجابة، وبسعر يقارب تسعة أعشار سنت لكل دقيقة محادثة عند الإطلاق. وأصدرت Suno نموذج كلام في نسخة تجريبية. وأضافت Vercel نماذج مايكروسوفت الصوتية إلى AI Gateway مع احتفاظ صفري بالبيانات.

تختلف المقاربتان في موضع الجزء الصعب. فـ ElevenLabs تتعامل مع التوليف كمنتج وتنمذج الكلمات بشكل منفصل. أما Inception فتدمج النموذج اللغوي في ميزانية زمن الاستجابة، بحجة أن طبقة توليف سريعة لا جدوى منها إذا استغرق النموذج خلفها ثانيتين للتفكير. كلتا المقاربتين متماسكة، وستظلان تتصادمان، لأن المستخدم الذي يخوض تجربة وكيل صوتي لا يستطيع تمييز أي مكوّن كان بطيئًا.

الجوانب المقلقة

الاستنساخ محميّ بالتحقق الإلزامي من هوية المالك ومرشحات تمنع النسخ غير المصرح به لشخصيات عامة بارزة. هذا حد أدنى معقول، وليس حلًا. فعينات مدتها عشر ثوانٍ باتت تكفي لاستنساخ عالي الدقة، وعدد الأشخاص الذين يملكون عشر ثوانٍ من صوت أحدهم هو عمليًا الجميع.

هناك مشكلة من الدرجة الثانية لا تعالجها أي مرشحات. فكلما تحسنت النماذج التعبيرية في محاكاة صوت شخص معين، انهارت قيمة الصوت كإشارة تحقق. كانت بصمة الصوت دليلًا ضعيفًا، وهي الآن تقترب من ألا تكون دليلًا على الإطلاق. البنوك ومراكز الاتصال التي بنت فحوص الهوية على مقولة «نحن نتعرف على صوت العميل» ظلت تتخلى عن هذا الافتراض بهدوء منذ سنتين، وهذا الإصدار يجعل التخلي عنه متأخرًا عن موعده.

رقم زمن الاستجابة أيضًا أضيق مما يبدو. فهو يُقاس وفق بروتوكول القياس الخاص بـ ElevenLabs مع استبعاد زمن استجابة الشبكة. ولا يزال المساعد الفعلي بحاجة إلى التعرف على الطلب، وتحديد إجابة، وتسليمها عبر الشبكة. يزيل Turbo مصدر تأخير واحد من سلسلة تضم عدة مصادر.

موجة ضوئية لطيفة تنتقل عبر أنبوب زجاجي منحنٍ على سطح داكن مصقول، بلون أزرق مخضر مع لمسات كهرمانية دافئة

ما الذي يقوله التقييم حقًا

مضاعفة تقييم في ثمانية أشهر، عبر بيع ثانوي بقيمة 300 مليون دولار بدلًا من رأس مال أولي جديد، تصريح عن الاحتفاظ بالعملاء وعن فئة لم تتحول بعد إلى سلعة. نماذج الصوت منتج ذكاء اصطناعي نادر يلاحظ المستخدمون جودته فورًا وينتقلون إليها من أجلها. الشركات العملاقة في الحوسبة السحابية ومنافسوها المتخصصون جميعًا يطرحون منتجات، وقد ظل الفارق في الجودة يضيق.

الرهان الكامن خلف رقم 22 مليار دولار هو أن يظل الفارق واسعًا بما يكفي للتحصيل مقابله، وأن تستمر منصة الوكلاء في النمو أسرع من انخفاض سعر التوليف الخام. انتقال Turbo إلى 0.011 دولار لكل 1,000 حرف أثناء الإطلاق يشير إلى أن النصف الثاني من ذلك الرهان هو الأصعب. فعندما تقترب التكلفة الحدية للصوت من الصفر، يصبح الشيء الذي يمكنك بيعه فعليًا هو الصوت الذي لا يملكه أحد غيرك.

هناك أيضًا سبب بنيوي يجعل شركة صوت قادرة على الحفاظ على تقييم كهذا بينما تكافح شركات الصور والفيديو لفعل ذلك. وكيل الصوت يعمل بشكل مستمر، في كل مكالمة وكل جلسة، لذا يتوسع الاستخدام مع نجاح المنتج لا مع التوليد لمرة واحدة. للسرد والوكلاء اقتصاديات مختلفة: أحدهما مشروع، والآخر عدّاد لا يتوقف. بنت ElevenLabs نحو الثاني، وتقول نسبة 55 بالمئة من الإيرادات إن الاستراتيجية نجحت. والسؤال الذي ستجيب عنه السنة القادمة هو ما إذا كانت ميزة الجودة ستصمد طويلًا بما يكفي لاستمرار العدّاد في العمل.

طريقة الشركة نفسها في التأطير تشير في الاتجاه ذاته. فمواد الإطلاق تتصدرها التعبيرية لا الدقة أو السرعة، لأن هاتين الأخيرتين توقفتا عن كونهما عوامل تمييز منذ عدة إصدارات. ما على وكيل الصوت فعله ليبدو حقيقيًا هو حمل التردد والتشديد وهوية ثابتة عبر جلسة مدتها أربعون دقيقة، وهذا هدف أصعب من إنتاج فقرة نظيفة. النموذج الذي يفوز بذلك لن يكون بالضرورة الأرخص لكل حرف. بل سيكون النموذج الذي لا يستطيع الناس تمييز مخرجاته عن شخص تحدثوا إليه من قبل، وهو حد يرفع سقفه كلما جرى تجاوزه.

مقالات ذات صلة