Учёные Университета Калифорнии в Лос-Анджелесе (UCLA) представили новый оптико-нейронный процессор, который использует свет для быстрой и точной идентификации дипфейков в видео. По словам разработчиков, эта система может анализировать 15 и более видеопотоков одновременно, тогда как привычные цифровые платформы обрабатывают файлы последовательно. По конструкции часть детектирования происходит через физическое распространение света, что позволяет выполнить «один оптический проход» по множеству материалов без последовательной цифровой переработки. Устройство рассчитано на работу в качестве первого слоя защиты для отбора больших объёмов манипулированного контента.

Опыты с использованием видимого света охватили 15 видеороликов Celeb-DF, которые обрабатывались одновременно в каждом оптическом проходе. В ходе экспериментов удалось достичь средней точности обнаружения 97,79%, чувствительности 99,86% и специфичности 95,72%. Именно чувствительность имеет приоритет в режиме скрининга, чтобы минимизировать шанс пропустить поддельное видео. Перевод в реальные цифры означал, что доля ложноположительных случаев была крайне мала — примерно 0,14% ложных отрицаний. После расширения мощности до 18 видео в одном проходе точность снизилась до 96,13%.

Конструкция – гибрид цифрового и оптического подхода. Сначала лёгкий цифровой кодер собирает компактную информацию о каждом видео — пространственные, спектральные и временные признаки — и преобразует её в фазовую схему, которая отображается на программируемом пространственном модуляторе света. Затем оптический луч идёт через пассивный оптический детектор, где пары детекторов напрямую формируют показатель подлинности для каждого файла. В результате часть инференса выполняется через физический процесс дифракции, а не через ресурсоёмкую цифровую декодирующую сеть. Оптическая архитектура демонстрирует возможность обработки множества потоков параллельно и с меньшими энергозатратами.

Исследователи также продвинулись: увеличение глубины пассивного оптического декодера без заметного роста энергопотребления и задержек привело к дополнительной обработке. При добавлении двух оптимизированных пассивных дифракционных слоёв точность растёт примерно на 6,8% на более сложных манипуляциях дипфейков. Эти слои, являясь пассивными структурами, не требуют питания во время инференса и работают за счёт дифракции света, что может снизить затраты по энергии по сравнению с крупными цифровыми сетями.

Помимо экспериментов на Celeb-DF система проверялась на видеороликах Google VEO-3. Без существенной донастройки оптический процессор достиг 94,80% точности и 97,61% чувствительности на ранее неизвестных видео VEO-3. Это говорит о потенциальной адаптивности подхода к новым моделям генеративного ИИ. Авторы подчёркивают, что архитектура может быть применима как первая стадия в цепочке модерации контента и безопасности.

Авторы работы — Пэрниан Гапандаар Кашани, доктор Шикки Чен и профессор Aйдоган Озджан, а также их коллеги из кафедр электротехники и биоинженерии UCLA и Института California NanoSystems. Авторы указывают, что новая система не призвана заменить полностью цифровые детекторы, а служит в роли чувствительного первого шага для обработки огромных объёмов контента, после чего сомнительные материалы могут передаваться для более глубокого цифрового анализа. Возможные применения включают крупномасштабную модерацию контента, аутентификацию медиа, надзор и другие security-critical AI-задачи.