← العودة إلى المدونة
Newsحوالي 1 دقيقة قراءة

تافوس غريفين نجح في التمرير كإنسان بنسبة 48 بالمئة من الوقت، والشركة لا تطرحه

نُشر في 7 أكتوبر 2026
تافوس غريفين نجح في التمرير كإنسان بنسبة 48 بالمئة من الوقت، والشركة لا تطرحه

أطلقت تافوس نموذج غريفين في الأول من أكتوبر، ووصفته بأنه أول نموذج للتفاعل البشري: نظام فيديو إلى فيديو كامل الازدواجية يستمع ويتفاعل ويتحدث في الوقت الفعلي. في دراسة أُجريت على مكالمات فيديو حية، اعتقد 26 من أصل 54 مشاركًا أن غريفين-لايت إنسان بعد دقيقة من المحادثة. أما الجيل السابق من النظام فقد نجح مع 1 من أصل 41، أي 2.4 بالمئة.

هذا تحسّن بنحو عشرين ضعفًا في إقناع الناس بأن مشاركًا اصطناعيًا حقيقي. وقد صرّحت تافوس بوضوح أنها لن تفتح غريفين للجمهور حتى تجهز آليات السلامة. وبالنظر إلى ما يفعله النموذج وإلى شكل أنماط الفشل، فإن هذا القرار يستحق اهتمامًا أكبر من مقطع العرض التجريبي.

الصورة التقنية

يعمل غريفين بدقة 720p و25 إطارًا في الثانية، مع زمن استجابة من الصوت إلى الفيديو يبلغ نحو 0.43 ثانية. وفي مسار الإدراك في معيار VideoFDB من إنفيديا يحتل المرتبة الأولى بدرجة 3.73، مقابل خط أساس بشري قدره 4.20. ويحتل المرتبة الثانية في دقة مزامنة الشفاه، وهو أبطأ في الاستجابة من الإنسان.

عتبة الوصول هي الجزء الأهم. صورة واحدة بالإضافة إلى عشر ثوانٍ من الصوت تكفي لتوليد نسخة رقمية عاملة. ولدى واجهة تافوس البرمجية نحو 150,000 مطوّر وشركة مسجلين.

ضع هاتين الحقيقتين جنبًا إلى جنب وستجد أن ملف المخاطر ليس افتراضيًا. تشير بيانات Surfshark إلى أن خسائر الاحتيال بالتزييف العميق بلغت 1.1 مليار دولار في 2025، أي ثلاثة أضعاف رقم 2024. وفي قضية آروب في هونغ كونغ عام 2024، انضم موظف إلى مؤتمر فيديو كان كل مشارك آخر فيه تلفيقًا بالذكاء الاصطناعي، وخسرت الشركة 25 مليون دولار.

غريفين لا يجعل التزييف العميق ممكنًا؛ فقد كان ذلك ممكنًا منذ سنوات. إنه يجعله تفاعليًا. التزييف المسجّل مسبقًا لا يمكنه الإجابة إلا عن الأسئلة التي توقعها صانعه. أما النظام في الوقت الفعلي فيجيب عن أي سؤال يُطرح عليه، في محادثة يعتقد الطرف الآخر أنه يجريها مع زميل.

ما الذي يتغير عندما يستطيع المزيّف الارتجال

نجحت قضية آروب لأن المحتالين أعدّوا سيناريو وقبله الهدف. التوليد في الوقت الفعلي يزيل قيد التحضير. يمكن للمتصل الآن أن يرتجل عبر سؤال غير متوقع (السؤال عن تفصيل في مشروع، أو الإشارة إلى اجتماع مشترك، أو التفاعل مع مزحة) ويولّد ردًا معقولًا في أقل من نصف ثانية.

هنا يتوقف رقم زمن الاستجابة البالغ 0.43 ثانية عن كونه مجرد بند في ورقة المواصفات. يبلغ تبادل الأدوار في المحادثة لدى البشر نحو 200 ميلي ثانية من الفجوة. وعند 430 ميلي ثانية، يكون غريفين بطيئًا بشكل ملحوظ لكنه ليس خارج نطاق شخص على اتصال ضعيف أو في غرفة صاخبة. ويمكن تمويه الفجوة بالسياق، وهذا بالضبط ما يجعله خطيرًا: ينسب المستخدمون التأخير إلى ظروف الشبكة، لا إلى وجود خطب ما.

قرار تافوس بعدم الطرح يعكس قراءة دقيقة لهذا الأمر. الشركة بين موقفين. فالتقنية قادرة بشكل مُثبَت على خداع أغلبية المشاركين في دراسة مضبوطة. لكن التدابير المضادة (وسم المصدر، كشف الحيوية، التحقق من الهوية في المكالمات) ليست قائمة بالحجم الذي تحتاجه التقنية.

للمعيار خط أساس بشري، وهذه هي النقطة

تجدر الإشارة إلى أن VideoFDB يسجّل درجة بشرية قدرها 4.20 مقابل 3.73 لغريفين. النموذج في المرتبة الأولى بين الأنظمة لكنه لا يزال دون البشر. تلك الفجوة هي حالة الفن الحالية، وهي تتقلص بمعدل يجعل عبارة “دون البشر” مصدرًا لطمأنينة متراجعة.

الرقم الأكثر فائدة هو معدل اعتقاد المشاركين عبر الزمن. قاست الدراسة الاعتقاد بعد دقيقة واحدة. تعتمد معظم استراتيجيات الكشف على ملاحظة المراقب شيئًا ما على مدى نافذة أطول: إيماءة متكررة، أو رد لا يتوافق مع تاريخ المحادثة، أو سؤال تم التهرب منه مرتين. النظام الذي يصمد في الدقيقة الأولى ويتدهور خلال الخمس هو تهديد مختلف عن النظام الذي يصمد ساعة، والرقم المنشور يغطي الأولى فقط.

ما ينبغي على المؤسسات فعله الآن

النصيحة الدفاعية غير مبهرة وهي تنظيمية في معظمها.

لم يعد التحقق النصي من أي تعليمات مالية كافيًا، ولا الصوت كذلك. إعادة الاتصال برقم معروف أفضل من مكالمة فيديو مع مشارك مجهول، لأن القناة موثّقة حتى إن لم يكن الشخص عليها موثّقًا. الأسرار المشتركة تعمل حتى تُسرَّب، وهذا ما يحدث.

الإجراء الأقوى عملي: ينبغي أن تتطلب التعليمات عالية القيمة قناة ثانية مستقلة، ويجب أن تكون هذه القناة الثانية قناة لا يستطيع مقدم الطلب تشغيلها. هذه ممارسة معيارية في عمليات الخزينة لهذا السبب تحديدًا، وهي قابلة للتوسع إلى عالم يمكن فيه أن يكون أي مشارك في الفيديو اصطناعيًا.

بالنسبة لمشغلي المنصات، الضغط على الحيوية والمصدر. تُلحق بيانات C2PA والعلامات المائية SynthID معلومات المصدر بالوسائط المولّدة، ولا ينجو أي منهما من إعادة الترميز بشكل موثوق. أما الفيديو في الوقت الفعلي فليس له أي بيانات وصفية على الإطلاق، ما يعني أن التحقق يجب أن يحدث عند الطرف المتلقي، أثناء المكالمة، بناءً على إشارات سلوكية هي بالضبط ما دُرّب غريفين على إنتاجها بشكل معقول.

هناك حلقة مفرغة غير مريحة تستحق التسمية هنا. الإشارات السلوكية التي يستخدمها الناس للحكم على ما إذا كان مشارك الفيديو حقيقيًا (التوقفات الطبيعية، وتعبيرات الوجه الدقيقة، والتفاعلات المناسبة للمحتوى غير المتوقع) هي نفس الإشارات التي يُحسَّن النموذج في الوقت الفعلي لإعادة إنتاجها. والكشف القائم على تلك الإشارات يضع المدافعين في موقع متأخر دائمًا، يتحققون دائمًا من علامات الجيل السابق بعد أن تعلّم الجيل الحالي تجنبها.

الإشارات الأصعب في التزييف هي تلك الخارجة عن سيطرة النموذج: ما إذا كان ادعاء الهوية قابلًا للتحقق عبر قناة مستقلة، وما إذا كان للحساب تاريخ، وما إذا كان يمكن الوصول إلى الشخص نفسه مرة ثانية عبر مسار مختلف. بنية تحتية للهوية بدلًا من الكشف السلوكي.

معيار الإفصاح هو المعركة الحقيقية

ضبط النفس من تافوس قرار شركة، وقرارات الشركات قابلة للتراجع. السؤال الدائم هو ما ينبغي أن يكون الوضع الافتراضي عندما يستطيع نظام أن يمرّ كإنسان في أغلبية التفاعلات القصيرة.

المقارنة الواجب عقدها هي مع قانون الذكاء الاصطناعي الأوروبي وأنظمة وسم المحتوى الاصطناعي التي بدأت تسري عالميًا الآن. صُممت تلك القواعد حول وسائط يمكن وسمها بعد التوليد، ببيانات وصفية وعلامات مرئية. الفيديو الاصطناعي في الوقت الفعلي ليس كذلك. لا يوجد شيء يمكن وسمه، لأن المخرجات عابرة وحوارية. يجب أن يكون الإفصاح خاصية للنظام الذي يجري المكالمة، أي هوية مسجّلة وقابلة للتحقق للمشارك الآلي، يمكن للطرف المتلقي التحقق منها.

تلك مشكلة هندسية قابلة للحل، ولم يطرحها أحد بعد. وإلى أن يفعل أحدهم، فإن الحالة الصادقة للأمور هي أن شركة بنت شيئًا قادرًا على إقناع معظم الناس بأن آلة إنسان في مكالمة فيديو، ونشرت البيانات التي تُظهر أنه يعمل، وامتنعت عن إطلاقه. هذه نتيجة أفضل من البديل، وهي قرار يصمد فقط طالما أرادت شركة واحدة أن يصمد.

مقالات ذات صلة