← العودة إلى المدونة
Aiحوالي 1 دقيقة قراءة

مايكروسوفت تخفض زمن استجابة النصوص الجزئية إلى 100 مللي ثانية. وهذا يغيّر الغرض من التفريغ الصوتي.

نُشر في 5 أكتوبر 2026
مايكروسوفت تخفض زمن استجابة النصوص الجزئية إلى 100 مللي ثانية. وهذا يغيّر الغرض من التفريغ الصوتي.

في 2 أكتوبر 2026، أعلنت Microsoft AI عن MAI-Transcribe-2-Streaming، وهو نموذج للتعرّف على الكلام يعيد نصوصًا جزئية في ما يزيد قليلًا على 100 مللي ثانية عبر 60 لغة. ويحتل المرتبة الأولى على Artificial Analysis في دقة النصوص النهائية والجزئية على حد سواء. وتبلغ أسعار الطرح التمهيدي 0.54 دولار لكل ساعة صوت حتى نهاية العام.

كما أعلنت الشركة عن MAI-Voice-2.1 وMAI-Voice-2.1-Flash، ويغطيان 23 لغة و26 منطقة لغوية. ويمكن الوصول إلى النموذج عبر Azure Speech وMicrosoft Foundry وMAI Playground وOpenRouter تحت المعرّف microsoft/mai-transcribe-2 وVercel وAzure Voice Live، مع إدراج تكامل LiveKit كقادم قريبًا.

المئة مللي ثانية عتبة فاصلة، وليست مجرد رقم طريف في مقارنة أداء. فهي تقع عند الحد الذي يدركه الناس على أنه لحظي. وما دونها، تستطيع الواجهة أن تستجيب بينما لا يزال الشخص يتحدث، وهذا هو الفرق بين منتج يُنتج مستندًا ومنتج يشارك في محادثة.

An extreme close up of a microphone diaphragm in fine gold mesh under cyan light

لماذا لم تكن الدقة النهائية يومًا هي القصة كاملة

كان التعرّف على الكلام فئة ناضجة لسنوات، وقد قاست لوحات الصدارة في الغالب شيئًا واحدًا: مدى دقة النموذج في نقل عبارة مكتملة بعد أن يتوقف المتحدث. هذا المقياس يجيب عن السؤال الذي يهم خدمة التفريغ الصوتي. لكنه لا يجيب عن السؤال الذي يهم منتجًا حيًا.

مساعد الاجتماعات الذي لا يُظهر الكلمات إلا بعد انتهاء المتحدث ليس سوى مسجّل بتنسيق أفضل. أما مساعد الاجتماعات الذي يُظهر الكلمات فور ورودها فيستطيع إبراز المتحدث الحالي، وإظهار اسمٍ في اللحظة التي يُذكر فيها، وتشغيل بحث بينما الموضوع لا يزال مطروحًا، والسماح لشخص بالرجوع إلى الوراء في منتصف الجملة دون أن يفقد موضعه. كل ذلك يعتمد على زمن استجابة النصوص الجزئية لا على الدقة النهائية.

الدقة الجزئية هي المشكلة الأصعب، وهي التي يتتبعها Artificial Analysis الآن بشكل منفصل. فإنتاج تخمين مستقر قبل اكتمال الجملة يعني الالتزام بتفسير قد تضطر إلى مراجعته. والنماذج التي تراجع باستمرار تُنتج نصًا يرتجف، وهو أسوأ من الانتظار. أما النماذج التي تلتزم بقوة مفرطة فتُبقي الأخطاء على الشاشة. والتصنيف وفق النصوص الجزئية يكافئ النموذج الذي يصيب في النص المؤقت بما يكفي ليثق القارئ فيما يراه.

إعلان مايكروسوفت احتلالها المركز الأول في كلتا اللوحتين يعني أنها لا تقايض استقرار النص المؤقت بالصحة النهائية، وهي الطريقة المعتادة التي تشتري بها النماذج سرعة الجزئيات. هذا المزيج هو الإعلان الحقيقي.

رقم المئة مللي ثانية

زمن الاستجابة من طرف إلى طرف في التعرّف التدفقي سلسلة، لا رقم واحد. يصل الصوت في إطارات. ويقرر نموذج تحديد نقاط النهاية متى تكون العبارة قد انتهت. وينتج نموذج التعرّف النص. ويعرضه نظام لاحق. كل حلقة تضيف تأخيرًا، والمجموع هو ما يحدد ما إذا كانت التجربة تبدو حية.

رقم 100 مللي ثانية لدى مايكروسوفت يغطي مخرجات النموذج نفسه، استنادًا إلى قياس الشركة الخاصة وموقعها في Artificial Analysis وليس إلى تدقيق مستقل لزمن الاستجابة. والمقارنة ذات الصلة تتعلق بما إذا كان الرقم يصمد في الظروف التي يخلقها منتج حي، وهو سؤال مختلف عن قراءة ساعة توقيت بمعزل عن السياق: عدة متحدثين، وضجيج خلفية، وميكروفون اجتماعات رديء، و60 لغة تصل عبر المسار نفسه. ونادرًا ما تنشر الشركات توزيعات زمن الاستجابة في تلك الظروف، وهي التي تحدد ما إذا كان منتج الاجتماعات قابلًا للاستخدام في اجتماع فعلي.

هيكل التسعير هو النصف الآخر من القصة. فسعر 0.54 دولار لكل ساعة صوت هو سعر تمهيدي يستمر حتى نهاية العام، ما يخبرك بأن مايكروسوفت تتوقع تغييره. والقصد الاستراتيجي واضح. فالتفريغ التدفقي هو طبقة الإدخال لكل مساعد اجتماعات، ومنتج تحليلات مراكز الاتصال، وخدمة ترجمة فورية مباشرة. وأن تكون الخيار السريع الأرخص لـ60 لغة هو لعب على التوزيع، والتوزيع في طبقة إدخال يلتصق بالعملاء، لأن الفريق الثاني الذي يغيّر مزوّده عليه أن يعيد بناء تعامله مع مجموعة مختلفة من السلوكيات المؤقتة.

بماذا ينافس هذا

مايكروسوفت لا تدخل ساحة فارغة. فقد بنت Deepgram وAssemblyAI وSpeechmatics أعمالًا على دقة التدفق وانخفاض زمن الاستجابة، وتضمّن Google وAmazon تعرّفًا منافسًا في بناهما السحابية. والمشتري الواقعي هو مطوّر يعمل أصلًا على Azure، ويقدّر أن MAI-Transcribe-2-Streaming يظهر في Foundry وOpenRouter إلى جانب بقية عائلة MAI، ويفضّل ألا يحتفظ بعلاقة مع مورّد ثانٍ من أجل مكوّن واحد.

إعلان MAI-Voice-2.1 مهم هنا أيضًا، والاقتران مقصود. فالتعرّف على الكلام وتركيب الكلام طرفا المحادثة نفسها، والمنصة التي تبيع كليهما تستطيع أن تطرح مسارًا واحدًا: صوت يدخل، ونص يخرج، واستجابة تُركّب، وكلام يعود. وإضافة 23 لغة و26 منطقة لغوية على جانب التركيب توسّع عدد الأسواق التي يمكن أن يُباع فيها هذا المسار كمنتج واحد.

ما الذي تغيّره الجزئيات السريعة في تصميم المنتج

بمجرد أن يصل النص المؤقت في غضون عُشر ثانية، تصبح مجموعة من قرارات الواجهة التي كانت غير معقولة فيما مضى أمرًا عاديًا.

لنأخذ المقاطعة مثالًا. إذا لم يستقر النص إلا بعد توقف المتحدث، فعلى النظام أن ينتظر الصمت قبل أن يتصرف بناءً على ما قيل، وهذا يعني أنه لا يستطيع الاستجابة حتى تكون المحادثة قد تجاوزت النقطة. أما مع الجزئيات السريعة، فيستطيع النظام التعرف على أمر في اللحظة التي يُنطق فيها ويقاطع، وهو السلوك الذي يتوقعه الناس من شخص في الغرفة. ووكلاء الصوت الذين يدعمون المقاطعة يعتمدون على ذلك. وكذلك أنظمة الترجمة الفورية المباشرة التي تحتاج إلى مجاراة متحدث سريع بدلًا من التخلف ثلاث جمل إلى الوراء.

البحث هو المستفيد الثاني. فمساعد الاجتماعات القادر على البحث في النص أثناء كتابته يستطيع إظهار مستند في اللحظة التي يُذكر فيها اسم مشروع، بينما النقاش لا يزال جاريًا. وهذا منتج مختلف جذريًا عن مسجّل ينتج ملاحظات قابلة للبحث بعد ساعة.

الاستخلاص المنظّم هو الثالث. فإذا كان النص الجزئي موثوقًا بما يكفي، يستطيع نموذج لاحق أن يبدأ بقراءته قبل انتهاء الاجتماع، ووسم القرارات وبنود العمل أثناء نطقها. والمكسب هنا يأتي من القدرة على مراجعة المخرجات بينما لا يزال المشاركون يتذكرون ما قصدوه، لا من السرعة الخام.

كل من هذه السلوكيات يرفع رهان استقرار الجزئيات. فالنص الذي يعيد كتابة نفسه مرتين أو ثلاثًا في الثانية يجعل الميزات الثلاث مزعجة لا مفيدة، ولهذا فالقصة الأعمق في إعلان مايكروسوفت هي موقع الدقة في الجزئيات لا رقم زمن الاستجابة وحده.

أين يكمن الخطر المثير للاهتمام

عادةً ما تُنشر أرقام دقة التفريغ كنسب مئوية إجمالية، والنسب الإجمالية تخفي التوزيع تحتها. فالأداء مع الكلام ذي اللكنة، والتبديل بين اللغات في منتصف الجملة، وأصوات الأطفال، والميكروفونات غير القياسية يتباين تباينًا هائلًا بين النماذج، وهذه بالتحديد هي الظروف التي يُرجّح أن يُستخدم فيها منتج حي. والنموذج الذي يسجّل متوسطًا قويًا قد يبقى الخيار الخطأ لمركز اتصال معيّن يبدّل عملاؤه اللغات في منتصف الجملة.

الخطر الثاني أكثر استراتيجية. فبمجرد أن يصبح التفريغ سريعًا ورخيصًا بما يكفي ليعمل باستمرار، تكون الخطوة التالية الطبيعية هي تشغيله دائمًا. ونموذج يكلف نصف دولار في الساعة يجعل الاستماع المستمر ميسورًا بالطريقة التي لم يتيحها نموذج تسعير بالدقيقة، والاستماع المستمر تسجيل محيطي لكل ما يُقال قرب جهاز. وهذا قرار حوكمة بيانات لن تتخذه أي لوحة صدارة دقة نيابة عن الفرق التي تشتري هذا.

MAI-Transcribe-2-Streaming قطعة بنية تحتية مفيدة حقًا، وتصنيف الدقة الجزئية هو الجزء الجدير بالمتابعة، لأنه يقيس المقياس الذي تعتمد عليه المنتجات الحية فعلًا. وما يبقى غير محسوم هو ما إذا كان رقم 100 مللي ثانية، الذي قاسته الشركة نفسها، يصمد في غرفة ذات صدى سيئ وأربعة أشخاص يتحدثون فوق بعضهم. وهذا هو الاختبار الذي سيُجريه كل مشترٍ، على انفراد، قبل أن يخصص له مسار إنتاج.

مقالات ذات صلة