مع تزايد واقعية مقاطع الفيديو التي يتم إنشاؤها بواسطة الذكاء الاصطناعي، يطور الباحثون طريقة جديدة للكشف عن التزييف العميق (deepfakes) تعتمد على استخدام الضوء نفسه لإجراء جزء من العمليات الحسابية.
وقد أثبت فريق من جامعة كاليفورنيا، لوس أنجلوس، كفاءة نظام هجين يجمع بين التقنيات البصرية والشبكات العصبية؛ حيث يمكنه تحليل مقاطع فيديو متعددة في آن واحد، مع استهلاك طاقة أقل بكثير في مرحلة المعالجة الضوئية مقارنةً بالأساليب الرقمية المماثلة عالية الأداء.
يجمع هذا النظام بين الذكاء الاصطناعي الرقمي التقليدي والحوسبة الضوئية، فبدلاً من إجراء جميع العمليات الحسابية إلكترونياً، يستخدم الباحثون في البداية شبكة عصبية رقمية خفيفة لاستخراج المعلومات من إطارات مختارة من الفيديو.
وتُحوَّل هذه المعلومات إلى نمط ضوئي يُعرض على جهاز قابل للبرمجة يُعرف بـ “مُعدِّل الضوء المكاني” (spatial light modulator). بعد ذلك، ينتشر الضوء عبر النظام، حيث يقوم سلوكه الفيزيائي بتنفيذ جزء من عملية التصنيف.
وتتمثل إحدى الميزات الرئيسية للنظام في تقنية “التعدد الإرسالي المكاني” (spatial multiplexing)؛ فبدلاً من فحص مقاطع الفيديو واحداً تلو الآخر، يقوم المعالج الضوئي بتقسيم المجال الضوئي المتاح لديه إلى قنوات متعددة، مما يتيح معالجة ما لا يقل عن 15 مقطع فيديو خلال خطوة واحدة لانتشار الضوء.
وفي التجارب التي أُجريت باستخدام مجموعة بيانات “Celeb-DF” المخصصة للتزييف العميق، حقق النظام دقة متوسطة بلغت 97.79%، مع حساسية بنسبة 99.86% في اكتشاف مقاطع الفيديو المزيفة، وخصوصية (specificity) بنسبة 95.72% في تحديد مقاطع الفيديو الأصلية بشكل صحيح.
اختبر الباحثون أيضاً ما إذا كان بإمكان النظام البقاء فعال عند ضغط مقاطع الفيديو، أو تعرضها للتشويش، أو تأثرها بعيوب في الإعداد البصري، وأظهرت النتائج متانة كبيرة في ظل هذه الظروف، كما أن الطبيعة الفيزيائية للمفكك البصري قد تزيد من صعوبة قيام المهاجم بإعادة بناء نظام الكشف بالكامل وتصميم مدخلات عدائية موجهة بدقة.
وفي تجارب الهجوم من نوع “الصندوق الأسود” (black-box attack)، تطلبت الأنظمة البصرية اضطرابات أكبر بكثير “مقارنة بالنماذج الرقمية خفيفة الوزن التي خضعت للاختبار” لإجبار النظام على إجراء تصنيفات خاطئة.
كما تُعد كفاءة الطاقة جزءاً مهماً آخر من هذا النهج، ففي مقارنات أُجريت باستخدام مُشفِّر الميزات الرقمي نفسه، حقق مُفكِّك الترميز البصري (الضوئي) المكوَّن من طبقتين أداء تصنيف عالياً، باستهلاك طاقة قُدِّر بما يتراوح بين 1.38 و4.11 ميلي جول لكل مقطع فيديو في مرحلة فك الترميز الخاصة به.
وفي المقابل، تطلب مُفكِّك الترميز الرقمي “الذي يتطلب عمليات حسابية مكثفة أكثر ويقدم أداءً مماثلاً” حوالي 30.44 ميلي جول لكل مقطع فيديو لإتمام عملية فك الترميز.
ويؤكد الباحثون أن هذه الأرقام تتعلق بجزء فك الترميز وحده وليس بالنظام بأكمله، نظراً لأن البنية البصرية لا تزال تعتمد على المعالجة الرقمية في مرحلتها الأولية.
سبوتنيك عربي

