علي بابا تقسم وكيل الصوت إلى قسمين، ثم تخفض السعر بنسبة تصل إلى 95 بالمئة

أصدر فريق Qwen التابع لـعلي بابا نموذج Qwen-Audio-3.1 في الأسبوع الأخير من سبتمبر 2026، وهي مجموعة صوتية من خمسة نماذج تغطي التعرف على الكلام وتحويل النص إلى كلام والتفاعل في الوقت الفعلي. كانت الأرقام الأسرع انتشارًا هي تخفيضات الأسعار: نحو 85 بالمئة خصم على النموذج الفوري، وحوالي 70 بالمئة على تحويل النص إلى كلام، وما يصل إلى 95 بالمئة على التعرف التلقائي على الكلام.
تكتسب هذه الأرقام أهمية لأنها تأتي في أسبوع كانت فيه الصناعة بأكملها تخفض الأسعار. فقد أصدرت مايكروسوفت وOpenAI وAnthropic نماذج أرخص أو أعيدت موازنتها في الفترة نفسها، وتُقرأ خطوة علي بابا على أنها تصعيد متعمد في مجال الصوت تحديدًا. لكن الأمر الأكثر إثارة للاهتمام في Qwen-Audio-3.1 ليس الخصم، بل كيفية بناء النموذج الرائد.
نموذجان خلف صوت واحد
النموذج الرئيسي هو Qwen-Audio-3.1-Realtime، وهو نظام كلام مزدوج الاتجاه بالكامل مصمم لوكلاء الصوت الذين يحتاجون إلى استدعاء الأدوات في منتصف المحادثة.
قراره التصميمي المحوري هو الانقسام. فبدلًا من نظام واحد كبير من طرف إلى طرف يستمع ويتحدث، يشغّل Qwen نموذجين يشتركان في مُرمّز صوتي وعمود فقري لنموذج لغوي. يتنبأ نموذج قرار بما إذا كان ينبغي مواصلة الاستماع أو بدء الكلام أو التوقف أو الاستئناف. ويتولى نموذج توليدي منفصل الكلام الفعلي. وبعبارة واضحة، يقرر أحد النموذجين متى يتحدث والآخر يقرر ماذا يقول.
هذا الانقسام إجابة عملية على إخفاق محدد. فغالبًا ما يبدو وكلاء الصوت معطوبين لا لأنهم يسيئون فهمك، بل لأنهم يسيئون تقدير اللحظة. يتحدثون فوق كلامك، أو يصمتون، أو يجيبون قبل أن تنتهي. وكان العلاج عادةً يتمثل في إلحاق تناوب الأدوار بنموذج أكبر على أمل أن ينشأ السلوك من تلقاء نفسه. أما Qwen فيتعامل مع «متى تتحدث» كمشكلة هندسية قائمة بذاتها، لها نموذجها الخاص، منفصلة عن توليد المحتوى. وتفيد الشركة بأن الردود الموجهة إلى المتحدث الخاطئ انخفضت من 0.13 إلى 0.03 في أحد المعايير، كما انخفض معدل كلمات الحشو من 0.759 إلى 0.296 في معيار آخر. وتفيد أيضًا بمقايضة، إذ ارتفع معدل الاستئناف غير المرغوب بعد المقاطعة من 0.035 إلى 0.130، وهو نوع من الإفصاح نادرًا ما تتضمنه الملاحظات المنشورة.
النموذج متاح كواجهة برمجة تطبيقات مُدارة. يعمل Qwen-Audio-3.1-Realtime-Plus على QwenCloud عبر WebSocket. ولا توجد أوزان مفتوحة، وهو أمر يهم كل من يتابع أعمال Qwen المفتوحة في الصور، لأن مجموعة الصوت تُدار كمنتج مغلق ومُدار.
المواصفات والتسعير
تُدرج نقطة النهاية الفورية النص والصوت كمدخلات ومخرجات معًا. وتمتد نافذة السياق إلى 262 ألف رمز، بحد أقصى 245 ألفًا للمدخلات و16 ألفًا للمخرجات. وحدود معدل النقل الافتراضية هي 60 طلبًا و100,000 رمز في الدقيقة. والتسعير 6.4 دولارات لكل مليون رمز إدخال صوتي و0.8 دولار لكل مليون رمز إدخال نصي، مع مخرجات النص والصوت المجمعة بـ24 دولارًا لكل مليون، ولا يُحتسب أي مقابل على النص المُخرَج. واستدعاء الدوال والبحث على الويب والمخرجات المهيكلة وتخزين السياق المؤقت والضبط الدقيق كلها مدمجة.
يستهدف نموذج مصاحب، Qwen-Audio-3.1-ASR-Flash-Filetrans، النسخ دون اتصال للصوت الطويل. ويدعم الكلمات الساخنة وفصل المتحدثين وعلامات الترقيم والتعرف عبر لغات متعددة إضافة إلى اللهجات الصينية، بسعر 0.15 دولار للمدخلات و0.47 دولار للمخرجات لكل مليون رمز. وبالنسبة لأي شخص كان يحسب تكلفة النسخ الطويل على نطاق واسع، فهذا انخفاض حاد في ما كان يُعد تكلفة ثابتة.
قصة التدريب منظمة في ثلاث طبقات، يسميها Qwen: فكّر، وتصرّف، وتحدّث. تعيد طبقة «فكّر» تثبيت النموذج الصوتي على نموذج نصي مصدري باستخدام بيانات مزدوجة بمقياس ملايين الساعات، ثم تطبّق التقطير وفق السياسة بدلًا من محاكاة إجابات مكتوبة مسبقًا. وتبني طبقة «تصرّف» بيئات قابلة للتنفيذ، تجمع كل منها مجموعة أدوات وقاعدة بيانات ذات حالة وسياسة عمل مكتوبة، مع تقييم المهام على الحالة النهائية أولًا. وتقرر طبقة «تحدّث» ما إذا كان ينبغي الحديث ومتى وكيف.
التفصيل في طبقة «تصرّف» هو ما يستحق التوقف عنده. فالتقييم يتحقق من الحالة الناتجة قبل أن يتحقق من الصياغة، لذا لا يمكن لرد بليغ أن ينقذ إجراءً فاشلًا. وهذا هو الأسلوب الصحيح لتقييم وكيل يُفترض أن يفعل شيئًا لا أن يتحدث عنه.
لماذا حرب الأسعار هي القصة الحقيقية
إذا جرّدنا الأمر من البنية، يظهر Qwen-Audio-3.1 كخطوة استراتيجية واضحة: فعلي بابا تتسابق مع OpenAI وGoogle على تكلفة بنية الصوت التحتية وزمن استجابتها بدلًا من الانفتاح.
المقارنة التي تجعل هذا واضحًا هي زمن الاستجابة. تفيد Qwen بأن زمن التوقف عند المقاطعة يبلغ نحو 1.116 ثانية، مقابل 0.383 ثانية لـGPT-Realtime-2. وكون النظام أبطأ في التوقف عند مقاطعة المستخدم يمثل ضعفًا مرئيًا، وحقيقة أن Qwen نشرت ذلك إلى جانب الانتصارات تقول شيئًا عن حال ثقافة المعايير في مجال الصوت، حيث لا تزال الأرقام الصادقة عامل تمييز.
بالنسبة للمطوّرين، الأثر العملي هو خلفية أرخص. فإذا كان الكلام الفوري أرخص بنسبة 85 بالمئة والتعرف أرخص بما يصل إلى 95 بالمئة، فستصبح ميزات الصوت التي كانت حكرًا على الفئات المميزة قابلة للتطبيق في المنتجات العادية. فالاستماع الدائم والترجمة المباشرة والواجهات المنطوقة للوكلاء كلها تقع في مجرى منحنى التكلفة هذا. وعندما تنهار تكلفة الدقيقة المنطوقة، تصبح قرارات المنتج التي كانت باهظة في الربع الماضي بديهية في هذا الربع.
التحفظ هو ذاته الذي ينطبق على كل واجهة برمجة تطبيقات مُدارة: تحصل على السلوك لا على الدواخل. فلا يمكنك فحص نموذج تناوب الأدوار، أو ضبط منطق القرار على بياناتك بطريقة تتحكم بها بالكامل، أو تشغيل المنظومة على عتادك الخاص. وبالنسبة لمعظم الشركات الناشئة، هذه مقايضة مقبولة. أما لمن يبنون شيئًا يكون فيه ملف زمن الاستجابة أو مسار البيانات هو المنتج نفسه، فهو تبعية تستحق أن تُحتسب في التكلفة.
السياق التنافسي يزيد النقطة وضوحًا. في الفترة نفسها من سبتمبر، أصدرت OpenAI وAnthropic نموذجين مصممين حول أداء مزيد من العمل بتكلفة أقل، وأضافت مايكروسوفت نموذج نسخ متدفقًا ونموذجين لتحويل النص إلى كلام إلى خطها الداخلي. لم يعد الصوت زاوية هادئة يمكن لمختبر أصغر أن يكون الأفضل فيها دون أن يلاحظ أحد. إنه فئة يتنافس فيها أكبر اللاعبين علنًا على السعر وزمن الاستجابة، وهذا خبر سار للمشترين وضغط على كل من يفرض سعرًا مرتفعًا مقابل الصوت.
ما يجب متابعته
السؤال البديهي هو ما إذا كانت Qwen ستفتح مصدر أي جزء من هذه المنظومة في النهاية، وكيف سيصمد تصميم النموذجين تحت حمل حقيقي متعدد الأدوار لاستدعاء الأدوات بدلًا من ظروف المعايير. فصل تناوب الأدوار عن المحتوى أنيق على الورق. أما ما إذا كان سيبقى أنيقًا عندما يقاطع المستخدم ويغيّر رأيه ويبدل المهمة في منتصف الجملة، فهو سؤال لا تجيب عنه العروض التوضيحية.
في الوقت الحالي، الخلاصة أضيق وأوضح. أخذت علي بابا الجزء الأكثر إخفاقًا في وكلاء الصوت، وسمّته، وأعطته نموذجًا مخصصًا. ثم خفضت السعر حتى أصبحت الفئة بأكملها أرخص. وإذا بُنيت منتجات الصوت في العام المقبل على كلام أرخص وأكثر قابلية للمقاطعة، فسيبدو هذا الإصدار أحد الأسباب.
مقالات ذات صلة
روبوت شبه بشري بعجلات أنهى ساعة من غسيل الملابس دون مساعدة
قد تنجح المهام الفردية بينما يفشل سير العمل ككل. غيّرت Dyna المقياس.
LTX 2.5 يريد تصيير مسودتك المتكتلة من Blender إلى لقطة نهائية
أنت لا تتحكم في ما يحدث في التوليد من النص إلى الفيديو. هذه الأداة تحاول إصلاح ذلك.
ServiceNow تحوّل إخفاقات الوكلاء إلى بيانات تدريب
التوليد دون تحقق ضجيج. والبوابات هي المنتج.
إطار واحد للغة والرؤية: نموذج هورايزن المفتوح بحجم 1.6 مليار
رهان على أن الجسور بين اللغة والرؤية لم تكن مطلوبة قط.