← العودة إلى المدونة
Aiحوالي 1 دقيقة قراءة

نموذجان صوتيان يعيدان ضبط المعايير: 50 مللي ثانية لأول صوت، ونموذج بـ99 مليون معلمة على معالج حاسوب محمول

نُشر في 6 أكتوبر 2026
نموذجان صوتيان يعيدان ضبط المعايير: 50 مللي ثانية لأول صوت، ونموذج بـ99 مليون معلمة على معالج حاسوب محمول

إصداران لتخليق الكلام في الأسبوع نفسه يشيران إلى الاستنتاج ذاته من اتجاهين متعاكسين. أحدهما طارد زمن الاستجابة إلى حد ما يمكن إدراكه. والآخر طارد الحجم نزولاً إلى ما يمكن لحاسوب محمول أن يحتفظ به في الذاكرة. ومعاً يوضحان مدى سرعة انتقال سباق تحويل النص إلى كلام من أن يبدو بشرياً إلى أن يتلاءم مع مكان محدد.

الإصدار الأول من Gradium، وهي شركة ناشئة للصوت أعلنت عن نموذج TTS بزمن يبلغ نحو 50 مللي ثانية لأول صوت. وتقول الشركة إن هذا هو أدنى زمن استجابة بين نماذج TTS الرائدة. والثاني هو Supertonic، وهو نموذج مفتوح المصدر بـ99 مليون معلمة يعمل محلياً على معالج حاسوب محمول، وينتج صوتاً بجودة الاستوديو في أقل من ثانية، وفي اختبارات الشركة نطق أرقام الهواتف وغيرها من النصوص الصعبة بشكل صحيح حيث فشلت ElevenLabs وOpenAI وGemini TTS جميعاً في المدخل نفسه.

لماذا يُعد زمن الوصول إلى أول صوت هو المقياس

بالنسبة لمساعد صوتي، الرقم المهم هو المدة التي تنقضي قبل أن يصل أول صوت إلى المستخدم، لا المدة التي يستغرقها تصيير المقطع الكامل. وكيل محادثة يتوقف لثُلث ثانية قبل أن يتحدث يبدو بطيئاً بالفعل؛ أما الذي ينجح في 50 مللي ثانية فيحافظ على إيقاع تبادل عادي. هذه العتبة هي السبب في أن فئات التسعير الرائدة، ومعالجة المقاطعة في نماذج الصوت الفورية، وادعاءات زمن الاستجابة، تتجمع كلها حول الأعشار القليلة نفسها من الثانية.

كرة زجاجية شبه شفافة على سطح مرآة داكن مع حلقات ضوء متحدة المركز

النماذج الأصغر تصل إلى ذلك النطاق بسهولة أكبر، وهذه هي المقايضة الصادقة. نموذج بـ99 مليون معلمة يعمل على المعالج يتخلى عن التعبيرية التي يتمتع بها نموذج سحابي رائد ويكسب الأشياء التي لا يستطيع ذلك النموذج تقديمها: لا رحلة ذهاب وإياب عبر الشبكة، ولا تكلفة لكل استدعاء، ولا صوت يغادر الجهاز، وسلوك متوقع على جهاز موجود بالفعل على المكتب.

مشكلة النصوص الصعبة هي مشكلة قاموس

نتيجة Supertonic بشأن أرقام الهواتف تشير إلى فشل أكثر هدوءاً. تتعامل نماذج التخليق جيداً مع الجمل العادية لكنها تتعثر في السلاسل النصية التي تعتمد قراءتها الصحيحة على السياق أو العرف. أرقام الهواتف وأسماء المنتجات والعناوين والاختصارات تخرج عادةً مشوّهة، ولهذا تكون حالة الفشل الكلاسيكية في عرض توضيحي.

إصدار ثالث يقارب هذا من زاوية مختلفة. يقدّم Onepin نفسه ليس كنموذج بل كخطوة لضمان الجودة بعد التخليق. يتحقق من كل سطر مُولَّد مقابل قاموس نطق يضم نحو أربعة ملايين كلمة، يغطي الأسماء والمنتجات، ويقيّم الطلاقة والدقة، ويصلح كلمة واحدة يُنطق بها خطأً دون إعادة توليد السطر بأكمله. وبالنسبة للفرق التي تنتج صوتاً طويلاً، فإن القدرة على إصلاح كلمة واحدة بدلاً من إعادة تصيير مقطع مدته خمس دقائق تغيّر حقيقي في منحنى التكلفة.

نهج القاموس يفصل أيضاً بين مهمتين كانتا مدمجتين. النموذج يتولى التنغيم والعاطفة والانسياب. والمدقق يتولى المجموعة المحدودة من أسماء الأعلام التي لم يكن نموذج عام ليعتمد عليها في النطق بشكل موثوق. هذا الفصل أكثر فائدة من مُرمِّز أفضل بشكل هامشي.

نموذج رابع يُظهر معيار البث المباشر

يُجرَّى إعداد Sopro V2 Turbo، وهو نموذج بـ120 مليون معلمة، بإصدار يستهدف الخشونة والتقطّع في الأصوات المستنسخة. ويُبلِغ عن نحو 300 مللي ثانية للوصول إلى أول صوت على معالج حاسوب محمول، وبث حقيقي، وترخيص Apache 2.0، وتغطية للإنجليزية والبرتغالية الأوروبية والفرنسية والألمانية. ويصرّح مؤلفه بأن الأصوات النحيلة أو الكرتونية، والمقاطع المرجعية المشوّشة، وبعض المتحدثين خارج نطاق التوزيع، ما زالت تفشل، وقد كان يجمع تلك الأمثلة.

بقراءة الإصدارات الأربعة معاً، انقسمت طليعة المجال إلى مسارات متمايزة. نماذج السحابة تواصل دفع التعبيرية والتغطية متعددة اللغات. والنماذج الصغيرة تمتلك مسار الأجهزة المحلية، حيث يكون زمن الاستجابة والخصوصية والتكلفة الحدية الصفرية أهم من النسبة الأخيرة من الطبيعية. وتظهر طبقة وسيطة لالتقاط الأخطاء التي لا يتعامل معها أي من المسارين جيداً بمفرده.

ما يجب قياسه قبل الالتزام

ادعاءات زمن الاستجابة والحجم في هذه الفئة تكون دائماً تقريباً من تقارير البائعين، لذا فإن الاختبار العملي هو مدخلاتك أنت. شغّل النموذج على النص الذي تحتاجه فعلاً، بما في ذلك الأسماء والأرقام التي تكسر العروض التوضيحية. وقِس الزمن حتى أول صوت على العتاد الذي ستشغّل عليه، لا على جهاز القياس المرجعي لدى البائع. وتحقق مما إذا كان الترخيص يسمح بالنشر الذي تفكر فيه، لأنه في النماذج المحلية كثيراً ما يكون الترخيص هو القيد الحاسم.

النمط عبر هذه الإصدارات مألوف من نماذج الصور قبل عام: تقاربت الجودة، ثم انتقل التنافس إلى مكان تشغيل النموذج، ومدى سرعة بدئه، وتكلفته لكل استدعاء. والصوت الآن في تلك المرحلة. النموذج الذي يبدو أفضل أهمية أقل من الذي يبدأ الكلام قبل أن يلاحظ المستخدم التوقف.

إلى أين تتجه نماذج الصوت الرائدة بدلاً من ذلك

سباق زمن الاستجابة يحدث في الوقت نفسه الذي يحدث فيه دفع مختلف، ويمكن الخلط بينهما. النماذج الفورية الرائدة، مثل أنظمة الكلام القادرة على الاستدلال والتي يمكن مقاطعتها ويمكنها استدعاء الأدوات أثناء المحادثة، تطارد القدرة على إجراء محادثة تشعرك بأنك تتحدث إلى شخص في مكالمة هاتفية. وهذا يتطلب فهم القصد، وتحديد وقت الكلام، والتعامل مع المقاطعة، وهي مشكلات صعبة على محور مختلف عن سرعة التخليق الخام.

ولكن بالنسبة لمعظم التطبيقات، طبقة المحادثة المتقدمة مبالغ فيها. التعليق الصوتي لفيديو، أو عرض توضيحي لمنتج مصحوب بسرد، أو قصة ما قبل النوم، يحتاج إلى نطق جيد، وأسلوب متسق عبر تسجيلات كثيرة، وتكلفة يمكن التنبؤ بها. هذه الاحتياجات تخدمها بشكل أفضل نموذج صغير سريع، لا نظام رائد مزوّد بحلقة محادثة، ولهذا أصبح التخليق على الجهاز هو الافتراضي للصوت المسجّل مسبقاً بينما تظل السحابة موطن المحادثة المباشرة.

وهناك أيضاً خيط تنظيمي يشد المنطقة نفسها. أصبح وضع علامات على الصوت الاصطناعي كي يستطيع المستمعون والمنصات تمييزه متطلباً في المزيد من الولايات القضائية، وقد جلب استنساخ الصوت موجته الخاصة من الأحكام القضائية. النموذج المحلي الذي لا يرفع عينة أبداً يتجنب بعض هذا التعرض، بينما النموذج السحابي الذي يستنسخ صوتاً يرثه. وبالنسبة للفرق التي تطلق ميزات صوتية، أصبح اختيار مكان تشغيل التخليق قراراً امتثالياً بقدر ما هو قرار يتعلق بزمن الاستجابة.

قائمة تحقق عملية

اختبر المرشحين على نصوصك الخاصة، لا على نص عرض توضيحي من بائع، وأدرج الأسماء والاختصارات والأرقام التي تكسر النماذج العامة. قِس الزمن حتى أول صوت على العتاد الذي ستستخدمه فعلاً، لأن نتيجة معالج حاسوب محمول ونتيجة مركز بيانات غير قابلتين للمقارنة. تأكد من أن الترخيص يغطي الاستخدام التجاري وشكل النشر الذي تريده، لأنه في النماذج المفتوحة كثيراً ما يكون الترخيص هو القيد الذي يحسم الاختيار. وقرر مبكراً ما إذا كنت تحتاج إلى تمريرة ضمان جودة بعد التخليق، لأن نموذجاً ينطق 95% من الكلمات بشكل صحيح سيظل يفشل في اسم العلامة التجارية الوحيد المهم لعميلك.

لا يشكل أي من هذه الإصدارات الأربعة اختراقاً بمفرده. وبقراءتها معاً، تُظهر مجالاً توقف عن الجدال حول ما إذا كان الكلام الاصطناعي يبدو حقيقياً وبدأ يتنافس على الشروط التي تهم فرق الإنتاج فعلاً: ما مدى السرعة، وما مدى الصغر، وما مدى الرخص. هكذا تبدو أداة آخذة في النضج.

مقالات ذات صلة