Исследование под руководством украинских авторов сообщает, что автоматические детекторы дипфейков потеряли большую часть эффективности против современного генеративного видео. На новом бенчмарке DF26 временные детекторы, достигавшие AUROC 94,3 на старом наборе CelebDF++, упали до 48,2 — снижение на 49% примерно за год. Для компаний, которые полагаются на проверку видео, это близко к подбрасыванию монеты.

Что измерил бенчмарк DF26

Работа под названием DF26: We Cannot Tell Fake From Real Anymore создавалась как hold-out набор для оценки незнакомого материала. В нём 2 691 видео в трёх сценариях публичных выступлений: прямое обращение в камеру или неформальная речь, официальные заявления и студийные интервью. Синтетическая часть сгенерирована из 271 реального клипа, отобранного из OpenVid, TalkingCelebs и MAVOS-DD. Из кадров этих реальных видео выводились согласованные промпты сцены и вместе с первым кадром, там где модель это поддерживала, подавались в семь генераторов видео — всего получилось 2 420 синтетических клипов.

Проверялись семь генераторов. Закрытые коммерческие модели — Grok 1.0, Kling 3.0, Veo 3.1 и Wan 2.6; с ними делали только text-to-video, потому что попытки image-to-video часто срабатывали на фильтры «генерации дипфейков» или нарушали бы условия платформ. Также испытали три открытые модели: Wan 2.2 A14B, HunyuanVideo 1.5 и LTX 2.3, последняя умеет генерировать речь. Генерация шла на коммерческой платформе Higgsfield AI, а внутренний кластер использовал NVIDIA H200 со 141 ГБ видеопамяти: на создание 1 626 видео ушло около 440 GPU-часов.

Что это значит для бизнеса

Качество обнаружения теперь сильно зависит от того, какой генератор создал клип. Результаты резко различались по моделям, что говорит о том, что детекторы часто выучивали следы конкретного генератора, а не общий признак синтетического видео. Image-to-video оказалось сложнее обнаружить, чем text-to-video, и для людей, и для автоматических систем: PwTF-DVD лучше всех показал себя на материале I2V, а GenD-PE — на T2V. Практическое следствие: детектор, проверенный на выходе одного поставщика, может не переноситься на выход другого, поэтому одна цифра точности в закупочном документе сама по себе мало что значит.

Из бенчмарка намеренно исключены короткие пути. В рабочие процессы генерации не допускались реальные кадры с текстовыми наложениями, а клипы-кандидаты проверял Gemini 2.5; сегменты с более чем одним лицом отклонялись, чтобы обеспечить настройку «один говорящий». Водяные знаки ИИ также маскировались или избегались, поскольку дали бы оценщику лёгкий сигнал. Основной метрикой была площадь под кривой ошибок (AUROC), дополнительной — равная частота ошибок. Детекторы на основе кадров оценивали 32 равномерно распределённых кадра из каждого видео и усредняли оценки; временные детекторы анализировали саму последовательность. Все детекторы в сравнении обучались на наборе FaceForensics++.

Разрыв между старым и новым бенчмарками — главный результат. Большинство детекторов по-прежнему хорошо работают на Celeb-DF++ (CDFv3), где временные методы достигают AUROC 94,3 и 92,3, но на DF26 те же методы падают до 48,2 и 61,6. Большинство подходов заметно деградируют и остаются вблизи случайного уровня; максимальный AUROC 69,7 даёт GenD-PE. Авторы прямо заявляют, что DF26 — более сложный бенчмарк для передовых детекторов. Более ранний вывод 2024 года о том, что человек распознаёт подделку с точностью 57%, едва выше случайной, теперь относится и к автоматическим инструментам.

Для небольшой компании непосредственное следствие в том, что готовый детектор дипфейков нельзя считать средством контроля. Поставщик, заявляющий высокую точность на публичном бенчмарке, отвечает на вопрос о манипуляциях эпохи 2022 года, а не о том видео, которое финансовая команда может получить сегодня. Крупные организации с процессами проверки — KYC, удалённый найм, страховые случаи, коммуникации руководства — сталкиваются с более сложной задачей, потому что сбой неравномерен: он зависит от генератора, сценария и от того, image-to-video это или text-to-video. Вопросы, которые стоит задать поставщику: на каких генераторах и на каком бенчмарке измерялась заявленная точность и тестировалась ли модель на материале, созданном после её обучения.

Следить стоит за тем, как будет использоваться набор DF26. Авторы задумывают его как hold-out набор для оценки незнакомого материала, поэтому независимые результаты именно на нём, а не на CelebDF++, покажут, можно ли перестроить обнаружение под видео на основе диффузии. Если AUROC на DF26 останется вблизи случайного уровня в следующем раунде опубликованных тестов, проверку личности по видео следует считать одним из нескольких сигналов, а не доказательством.