← العودة إلى المدونة
Aiحوالي 1 دقيقة قراءة

Gemini 3.5 Live Translate من Google يلغي التوقف

نُشر في 7 أكتوبر 2026
Gemini 3.5 Live Translate من Google يلغي التوقف

لطالما كانت الترجمة الحية حيلة تعتمد على الأدوار. تتحدث، فينتظر النظام حتى تنتهي، يفكر، ثم يقرأ النتيجة. التوقف قصير لكنه يغيّر المحادثة، لأن كلا الشخصين يتوقف لترك الآلة تعمل. صُمم Gemini 3.5 Live Translate الجديد من Google لحذف ذلك التوقف.

الطراز، الذي أُعلن هذا الشهر، هو نموذج صوتي من كلام إلى كلام، وليس مسار نسخ نصي مع مُركّب صوتي مضاف إليه. يستمع باستمرار ويترجم بينما يتحدث المتحدث، ويقرر لحظة بلحظة ما إذا كان ينتظر مزيدًا من السياق أو يتحرك الآن ليبقى متزامنًا. عمليًا، يتأخر عن المتحدث ببضع ثوانٍ ويستمر، بحيث لا تتعطل المحادثة عند كل جملة.

تعدد Google ثلاث قدرات تميزه عن الأنظمة السابقة. يكتشف أكثر من 70 لغة من تلقاء نفسه، دون الحاجة إلى ضبط إعداد اللغة أولًا. يحافظ على نبرة المتحدث وإيقاعه ودرجة صوته، فيظل الناتج يبدو كالشخص الذي يتحدث وليس كمذيع محايد. ويصمد في الصوت الصاخب وغير المتوقع، وهي الحالة التي تتجنبها معظم العروض التجريبية للترجمة.

المقايضة المضمّنة في النموذج

تحمل الترجمة المستمرة خيارًا تصميميًا تتجنبه الأنظمة القائمة على الأدوار. ترجمة الجملة مبكرًا جدًا تمنحك إجابة سريعة مبنية على نصف المعلومات، وترجمتها متأخرًا جدًا تكسر إحساس المحادثة الحية. يوازن نموذج Google بين الأمرين لحظة بلحظة، موازنًا بين ما إذا كان انتظار لحظة سيحسّن الناتج مقابل كلفة التخلف أكثر عن المتحدث. ذلك القرار غير مرئي للمستخدم وجوهري في ما إذا كانت النتيجة تبدو قابلة للاستخدام.

يضيف الحفاظ على درجة الصوت والإيقاع حالة استخدام ثانية فوق المحادثة الحية. إذا استطاع صوت أن ينتقل بين اللغات دون تغيير هويته، يتحول تسجيل واحد إلى دبلجة بكل لغة مدعومة، وهو الوعد نفسه الذي ألصقته Microsoft بنماذجها الصوتية الجديدة والسبب الذي جعل استوديوهات الدبلجة تراقب هذا المجال عن كثب. أحسن ضبط اللكنة والتوقيت، ويتوقف الناتج عن الظهور كأنه ترجمة.

أين يظهر

يتدحرج الإصدار على ثلاثة مسارات في وقت واحد. يحصل المطورون عليه عبر Gemini Live API وGoogle AI Studio كمعاينة عامة. ويحصل مستخدمو المؤسسات على معاينة خاصة داخل Google Meet هذا الشهر. ويحصل المستهلكون عليه في تطبيق Google Translate على Android وiOS، في جميع أنحاء العالم، وهو جمهور أكبر بكثير من شريحة المطورين وإشارة إلى أن Google تتعامل معه كمنتج وليس كعرض بحثي.

جانب المطورين هو حيث يكمن العمل المثير. يعالج Live Translate الصوت كتدفق، لذا يمكن إدراجه في المكالمات متعددة اللغات والاجتماعات والفصول والبث المباشر دون بناء طبقة الترجمة من الصفر. وقد أنجز شركاء التكامل، بمن فيهم Agora وFishjam وLiveKit وPipecat وVision Agents، البنية التحتية للوسائط في الوقت الفعلي، ما يعني أن المطور يتولى غالبًا الواجهة ومنطق المنتج بدلًا من النقل.

تختبر Grab النموذج لمشكلة محددة وقابلة للقياس. غالبًا لا يتشارك السائقون والركاب اللغة نفسها، والتسليم عند نقطة الالتقاط هو بالضبط حيث يصبح سوء التواصل مكلفًا. تتعامل Grab مع أكثر من 10 ملايين مكالمة صوتية شهريًا، لذا فإن حتى تحسين صغير في تلك المكالمات يستحق السعي إليه.

لماذا تتفوق المستمرة على القائمة على الأدوار

زمن الاستجابة ليس سوى جزء من الفرق بين الترجمة القائمة على الأدوار والترجمة المستمرة. تحتاج الأنظمة القائمة على الأدوار إلى إشارة بانتهاء الجملة، وهو أمر سهل في عرض مُعد سلفًا وصعب في الكلام الحقيقي، حيث يخفت صوت الناس، ويعيدون الصياغة، ويقاطعون، ويبدلون اللغات في منتصف الفكرة. النظام الذي ينتظر حدًا واضحًا إما يفوّت الحد أو يؤخر الرد. أما النظام الذي يولّد باستمرار فيمكنه متابعة المتحدث عبر كل ذلك.

يغيّر ذلك التصميم أيضًا الغرض من الناتج. إذا وصلت الترجمة متأخرة ببضع ثوانٍ وبصوت المتحدث نفسه، يمكنك إبقاؤها مشغلة أثناء اجتماع وتركها تعمل كصوت محيطي بدلًا من قراءة الترجمات. الترجمات تطلب منك النظر؛ أما الصوت فيطلب منك الإنصات. في المحادثات التي يهم فيها التواصل البصري، فإن سماع الشخص الآخر بلغتك بينما يواصل الحديث تجربة مختلفة عن مشاهدة النص يظهر تحت وجهه.

الحفاظ على النبرة ودرجة الصوت يقوم بعمل أكبر مما يبدو. الصوت المترجم الذي يحتفظ بإيقاع المتحدث الأصلي يحمل معلومات يفقدها الصوت الاصطناعي المسطح: التردد، والتشديد، والفرق بين مزحة وتهديد. الترجمة الآلية التي تجرد ذلك قد تكون دقيقة تقنيًا ومع ذلك مخطئة بشأن القصد.

لقد تحرك حد المنافسة مرتين في أسبوع

وصل Live Translate في شهر مزدحم بالصوت. أطلقت Microsoft ثلاثة نماذج في 1 أكتوبر، من بينها MAI-Transcribe-2-Streaming، الذي يبدأ إنتاج النص في ما يزيد قليلًا على 100 مللي ثانية ويتعامل مع 60 لغة مع تبديل تلقائي بينها، وMAI-Voice-2.1، الذي يتحدث 23 لغة عبر 26 منطقة محلية ويحافظ على هوية صوتية واحدة أثناء تغيير اللغة. وأصدرت Sota Labs مساعد الاجتماعات Saydi، الذي يغطي أكثر من 68 لغة ويتصل بـ Google Meet وZoom وTeams عبر إضافة متصفح.

ضع القطع جنبًا إلى جنب، ويتضح شكل المنافسة. تبيع Microsoft الأذنين والفم كجزئين منفصلين يجمعهما المطورون. بينما تطلق Google نموذجًا واحدًا يقوم باتجاهي المحادثة وتضعه أمام المستهلكين أولًا. وكلاهما يدفع بزمن استجابة أول صوت إلى الانخفاض، وكلاهما يستخدم صوتًا متسقًا عبر اللغات كميزة رئيسية، لأن ذلك هو ما يجعل مكالمة مترجمة تبدو كمكالمة.

ما لا يزال صعبًا

أرقام تغطية اللغات سهلة النشر وصعبة التحقق. النموذج الذي يكتشف أكثر من 70 لغة لا يترجمها كلها بالجودة نفسها، ويظهر الفرق في المفردات المتخصصة والتعابير والأسماء. وتاريخ Google Translate نفسه مفيد هنا: المنتج موجود في السوق منذ عقدين ويتعامل مع أكثر من تريليون كلمة شهريًا، وما زال يعاني مع سياق يعتبره المترجم البشري أمرًا مسلمًا به.

السؤال الأصعب هو الموافقة والهوية. النموذج الذي يعيد إنتاج صوتك بلغة لا تتحدثها مفيد، وهو أيضًا أداة لجعلك تقول أشياء لم تقلها. تضع Microsoft استنساخ الصوت خلف فحوصات الموافقة والإذن. ولم تنشر Google التفاصيل المكافئة لـ Live Translate، وتشير المعاينة الخاصة داخل Meet إلى أنها ما زالت تحدد أين يقع الخط.

وهناك أيضًا مسألة ما يحدث للصوت. طبقة الترجمة الحية التي تجلس داخل اجتماع ترى كل ما يُقال، ما يحوّل أداة نافعة إلى سجل. وكم من الوقت يُحتفظ بذلك الصوت، ومن يمكنه الاستعلام عنه، وما إذا كان يدرّب أي شيء لاحقًا، هي أسئلة يطرحها مشترو المؤسسات قبل تشغيله.

لا شيء من ذلك يوقف التحول. الترجمة التي تعمل باستمرار، بصوت المتحدث نفسه، على هاتف موجود أصلًا في جيبك، تنقل الميزة من شيء تفتحه بشكل منفصل إلى شيء يعمل فقط. كان التوقف آخر إشارة واضحة على وجود آلة في الغرفة. وقد جعلته Google اختياريًا للتو.

مقالات ذات صلة