Gemini Omni 1.1 Flash ضمّ أربعة طلبات متسلسلة في لقطة مدتها 40 ثانية. سير العمل هو المنتج.

يُعدّ Gemini Omni 1.1 Flash من Google منتجًا غريبًا للتقييم، لأن النموذج نفسه ليس جديدًا. فقد أصبح متاحًا للعموم في 27 أغسطس 2026 تحت المعرّف gemini-omni-1.1-flash، وتقاعدت نقطة نهاية المعاينة الأقدم في 30 سبتمبر. تغيّر كل شيء حول التوليد؛ أما جودة التوليد فهي إلى حد كبير حيث كانت.
تبدو قائمة القدرات وكأنها قائمة تحقق إنتاجية. يحلل تمديد المشهد الآن ما يصل إلى عشر ثوانٍ من السياق السابق، وهو ما تصفه Google بأنه قفزة من النماذج السابقة التي كانت تشير إلى الثانية الأخيرة فقط. تمتد الفيديوهات بزيادات قدرها عشر ثوانٍ حتى سقف تراكمي يبلغ أربعين ثانية. ويتيح التحكم بالإطار الأول والأخير للمطورين تحديد طرفي اللقطة وتوليد الحركة بينهما، بهدف تحقيق الدورانات حول الكاميرا وانتقالات التقريب والحلقات التي لا يظهر فيها خط وصل. يولّد وضع المسودة بدقة 360p أسرع بنسبة تصل إلى 60 بالمئة وبتكلفة تعادل ثلث تكلفة 720p القياسية. يُرفَع الناتج النهائي إلى الدقة 1080p أو 4K. ويمكن تزويد ما يصل إلى ثلاث ثوانٍ من الفيديو كمادة مرجعية لاتساق الشخصية والمشهد.
اقرأ ميزة التمديد بعناية، لأن التسويق يجمّلها. مقطع Omni مدته أربعون ثانية هو أربعة طلبات متسلسلة، يستخدم كل منها آخر عشر ثوانٍ كسياق، وليس تمريرة واحدة مدتها أربعون ثانية. ما تزال التوليدات الفردية تتراوح بين ثلاث وعشر ثوانٍ. يهم هذا الفرق أي شخص يضع ميزانية لزمن الاستجابة وتكلفة الاستدلال مقابل مُخرَج، وهو نوع التفصيل الذي يحدد ما إذا كانت لقطة مدتها أربعون ثانية عملية أم ممكنة فحسب.

التسعير مصمّم ليجعلك تكرّر
بنية أسعار Google تكافئ وضع المسودات. تسعير API هو 1.50 دولار لكل مليون رمز إدخال و17.50 دولارًا لكل مليون رمز إخراج فيديو، وتُحتسب بواقع 5,792 رمزًا لكل ثانية من فيديو 720p، ما يعادل نحو 0.10 دولار في الثانية أو 6 دولارات في الدقيقة. ولكل مقطع مدته عشر ثوانٍ، يتدرج سلّم الفئات من نحو 0.30 دولار عند 360p، إلى 1.00 دولار عند 720p، إلى 1.50 دولار عند 1080p، إلى 3.00 دولارات عند 4K.
هذا التدرّج ليس عرضيًا. الفارق بين مسودة 360p ونسخة رئيسية 4K يبلغ مرتبة كاملة من حيث الحجم، وهذا يدفع الفرق نحو طريقة عمل يكرّرون فيها بتكلفة زهيدة في فئة منخفضة الدقة ولا يدفعون إلا مقابل اللقطة النهائية. قارن ذلك بالعادة التي جلبها معظم الناس إلى توليد الفيديو، وهي كتابة موجّه، ثم الانتظار، ثم النظر إلى النتيجة، ثم إعادة كتابة الموجّه، ودفع السعر كاملًا في كل مرة يُجرّب فيها الحظ. إن Google تسعّر هذا السلوك الثاني خارج سير العمل.
قارن أيضًا بين الواجهات، لأن التوزيع غير متكافئ. تصوغ Google مجموعة القدرات الكاملة على أنها موجّهة للمطورين ومتاحة عبر API: تُطلَق خمس قدرات للمطورين عبر AI Studio وGemini API وGemini Enterprise Agent Platform، بينما يقتصر الطرح الاستهلاكي في تطبيق Gemini على تمديد المشهد فقط. ويوجد النموذج نفسه داخل Google Flow لمشتركي AI Plus وPro وUltra، وهو مجاني داخل YouTube Shorts Remix وتطبيق YouTube Create. نموذج واحد، وخمس فئات وصول، أربع منها لا تحصل على الميزات المثيرة.
حساب لقطة مدتها أربعون ثانية
التمدید المتسلسل يغيّر تكلفة اللقطة، والتغيّر ليس خطيًا.
توليد واحد مدته من ثلاث إلى عشر ثوانٍ رخيص وسريع. أما تسلسل مدته أربعون ثانية فهو أربعة طلبات متسلسلة، وكل واحد منها يفشل بشكل مستقل. إذا أنتج الطلب الثالث لقطة تكسر الاستمرارية، فأنت لا تعيد توليد أربعين ثانية. بل تعيد التوليد من الإطار الأول للمقطع المكسور، ثم تعيد تسلسل كل ما بعده، وتتضاعف تكلفة الخطأ مع موضعه في التسلسل. الثواني العشر الأولى إعادة تنفيذها رخيصة. أما الثواني العشر الأخيرة فهي مكلفة، لأن إعادتها تعني إعادة كل ما يقع بعدها.
هذه هي الحجة العملية للتحكم بالإطارات المفتاحية. فالقدرة على تحديد إطار بداية وإطار نهاية تحوّل كل مقطع إلى مشكلة محدودة النطاق مع خطوة تحقق عند الطرفين. وبدلًا من الحكم على تسلسل كامل بمشاهدته والأمل في أن الاستمرارية قد تحققت، يمكن للفريق التحقق مما إذا كان المقطع قد انتهى عند الإطار الذي كان يُفترض أن ينتهي عنده. وبالنسبة لدوران كاميرا أو انتقال تقريب، تكون هذه وحدة عمل قابلة للاختبار أكثر بكثير من موجّه حرّ الصياغة.
تندرج فئة المسودة 360p ضمن المنطق نفسه. فبناء نموذج أولي لتسلسل مدته أربعون ثانية بنحو دولار واحد بدلًا من ستة دولارات يجعل التكرار ميسور التكلفة، ويصبح الرفع إلى 1080p أو 4K خطوة منفصلة ومتعمدة. ما شحنته Google فعليًا هو خط أنابيب إنتاجي تتضمن تسعيرته بوابة مراجعة مدمجة.
ماذا تقول المعايير الآن
يتصدر Gemini Omni 1.1 Flash لوحة تحويل النص إلى فيديو في Arena عند 1516، متقدمًا قليلًا على سلفه Gemini Omni Flash عند 1513، ويمتد نطاق الترتيب الخاص بـ Arena للنموذج الأحدث من واحد إلى أربعة، وهي طريقة مهذبة للقول إن الاثنين متعادلان داخل فاصل الثقة.
الصورة على لوحات المتصدرين في مواضع أخرى أقل إطراءً مما أوحى به تغطية الإطلاق. فقد اكتسح النموذج لوحات Artificial Analysis الأربع جميعها بحلول منتصف يوليو 2026. انتهى ذلك الاكتساح. على لوحة تحويل النص إلى فيديو المعاد بناؤها، اعتبارًا من أوائل أكتوبر، يحتل Gemini Omni Flash 1.1 المرتبة الثامنة مع الصوت والثامنة صامتًا، وعلى لوحة تحويل الصورة إلى فيديو في Arena يحتل المرتبة الثانية خلف MiniMax H3. ولم تُقيّم Artificial Analysis النموذج 1.1 Flash مباشرة على لوحة تحويل النص إلى فيديو، حيث يتصدر نموذج Flash الأقدم وتحتل Wan 3.0 من علي بابا وMiniMax H3 مراكز قريبة خلفه.
هذه نتيجة طبيعية في فئة سريعة الحركة، وهي لا تقوّض إضافات سير العمل. لكنها تعني أن الطرح الصادق لهذا الإصدار هو أن Google تنافس على القابلية للتحكم وفئات الأسعار بدلًا من جودة الناتج الخام، ولم تعد لوحة المتصدرين المكان الذي تفوز فيه.
أمران لا يصلحهما الإصدار
الصوت الأصلي المتزامن غير مؤكد. لا تشرح مواد إطلاق Google توليد المسار الصوتي إلى جانب الفيديو، ويُدرَج إخراج الصوت على أنه قادم في إصدارات لاحقة. ويقتصر إدخال الصوت عند الإطلاق على المراجع الصوتية. وبالنسبة لعائلة نماذج من أي إلى أي بهذا الاسم، فإن غياب إخراج الصوت هو الفجوة البارزة، لا سيما للفرق التي تنتج محتوى قصيرًا يمثل الصوت نصف المخرج فيه.
والثاني هو المدة. أربعون ثانية مجمّعة من أربعة طلبات متسلسلة قدرة حقيقية، وهي أيضًا سقف يصطدم به تنسيق الفيديو السردي سريعًا. وقد لمّحت Google إلى نسخة أعلى من Gemini Omni Pro دون تاريخ إصدار، وتوحي آليات التمديد بأن الطريق إلى لقطات أطول يمر عبر معالجة أفضل للسياق لا عبر توليد واحد أطول.
يحمل كل ناتج علامة SynthID المائية وبيانات C2PA Content Credentials افتراضيًا، ولم تعد نقطة نهاية المعاينة المتقاعدة تظهر في قائمة نماذج Google. وتوصي Google الآن بـ Omni 1.1 بدلًا من نقاط نهاية معاينة Veo 3.1، وهو تسليم داخلي ملحوظ. ويبقى Veo 3.1 هو Veo الرائد الحالي، ولم يُعلَن عن Veo 4.
ما الذي يُبنى به فعليًا
الطريقة المفيدة لقراءة هذا الإصدار هي اعتباره تحولًا في ماهية المنتج. نموذج فيديو ينتج مقطعًا مدته عشر ثوانٍ هو مولّد طرائف. أما نموذج يحلل عشر ثوانٍ من السياق السابق، ويقبل إطار بداية وإطار نهاية، ويسوّد بدقة 360p مقابل ثلث السعر، ويرفع الدقة إلى 4K، فهو مكوّن يمكنك وضعه داخل خط زمني.
هذه هي نسخة الفيديو التوليدي التي يمكن لفرق الإنتاج التخطيط بناءً عليها، وهي النسخة التي ينتقل فيها العمل الهندسي المثير من كتابة الموجّهات إلى تصميم خط الأنابيب. في هذا الإصدار، يهم التركيب أكثر من المقطع.
مقالات ذات صلة
Step 5 تخطّى أربعة أرقام إصدارات، وحلّ في المركز الثاني بين النماذج المفتوحة، ولا أحد يستدعيه
موقع المؤشر إشارة يستخدمها المنتجون للحكم على نموذج. وحجم الاستدعاءات إشارة ينتجها المستهلكون باستخدامهم له.
مايكروسوفت تخفض زمن استجابة النصوص الجزئية إلى 100 مللي ثانية. وهذا يغيّر الغرض من التفريغ الصوتي.
تحت 100 مللي ثانية، يستطيع منتج التفريغ الصوتي أن يستجيب بينما لا يزال أحدهم يتحدث.
أمضت Synthesia عقدًا في تسجيل الأفاتار. والآن تريدها أن تردّ.
أداة تدريب يكرّرها الناس طوعًا منتج مختلف عن أداة يكملونها لأن أحدهم كلّفهم بها.
نموذج يرفض كتابة الجمل يتعامل الآن مع تريليون رمز يوميًا
مصنّف بواجهة أفضل كثيرًا، موجّه إلى العمل الذي أرادت البرمجيات أصلًا أن يكون منظمًا.