Содержание
Nvidia Synthetic Video Detector распознаёт сгенерированные ИИ-видео с точностью до 92% на несжатом ролике. Но после компрессии результат падает: при сильном сжатии модель уже держится на уровне 82%.
Для медиа и трансляций это не академическая игрушка. Видео из соцсетей пережимают, режут, пересылают через мессенджеры и выкладывают заново. Старые признаки подделки вроде кривых пальцев или странных теней исчезают. Поэтому Nvidia упаковывает детектор не в потребительскую программу, а в микросервис для рабочих процессов редакций и вещателей.
SVD работает как NIM-микросервис, а не как приложение для ПК
Synthetic Video Detector входит в линейку Nvidia Inference Microservices и доступен через программу AI for Media Private Access Program. То есть обычному пользователю его пока не предлагают как утилиту для Windows или расширение браузера.
Задача SVD простая по формулировке и тяжёлая по исполнению. Сервис берёт видео, разбивает его по кадрам и ищет признаки синтетического происхождения. Nvidia делает ставку на масштабную проверку роликов, которые получают телеканалы, агентства и онлайн-площадки.

Публичная демо-версия уже есть на build.nvidia.com. Но с ней всё не так бодро, как с цифрами в описании. Обработка идёт в облаке, лимит файла ограничен 100 МБ, а запросы могут долго висеть или завершаться тайм-аутом.
Как детектор Nvidia разбирает видео по кадрам
SVD не оценивает ролик одним куском. Он нарезает видео на кадры, кропает их до 504×504 пикселей и прогоняет через две модели компьютерного зрения от Meta: DINOv2 и DINOv3.
Это Vision Transformer-модели. Они учатся находить устойчивые визуальные паттерны без ручной разметки каждого примера человеком. Такие модели используют для классификации изображений, поиска похожих картинок, детекции объектов и оценки глубины сцены.
После прохода через трансформеры каждый кадр получает оценку от 0 до 1. Ноль означает, что изображение похоже на реальное. Единица означает высокий шанс синтетики. Затем сервис усредняет оценки и отдаёт итоговый процент по всему видео.
Исследовательская база SVD связана с работами, которые отметили на конференции ICCV. Nvidia указывает на бенчмарк AI GVD, где проверяли устойчивость детекторов к разному качеству видео.
Компрессия режет точность, но не ломает модель
Лучший результат SVD показывает на несжатом видео: 92% точности. Это ожидаемо. Компрессия сглаживает мелкие артефакты, добавляет свои и прячет следы генерации, за которые цепляется модель.
- Без компрессии: до 92% точности при распознавании AI-видео
- 15% компрессии: точность падает до 87%
- 50% компрессии: модель сохраняет 82% точности
Для редакционной практики важны именно последние две строки. Большая часть пользовательского видео приходит уже после пережатия платформами. Если детектор держит 82% на сильно сжатом ролике, его можно встроить как быстрый фильтр перед ручной проверкой.

Но 82% — это не печать истины. Такой инструмент не заменяет журналистскую верификацию, метаданные, геолокацию и проверку первоисточника. Он скорее помогает быстро поднять красный флаг там, где глаз уже не видит подвоха.
Задержка 22 мс и ограничение NVENC
Nvidia заявляет обработку 1080p-видео за 22 мс на RTX GPU. На рабочих станциях Nvidia задержка выше, но всё ещё низкая — около 30 мс. Для трансляций это ключевой параметр, потому что детектор не должен ломать прямой эфир.
Есть аппаратное ограничение. SVD требует энкодер NVENC, поэтому дата-центровые карты вроде B100 не запускают его нативно. Это забавная деталь: мощный ускоритель для ИИ не всегда подходит для медийного пайплайна, если в нём нет нужного видеоблока.
Nvidia уже работает с Wowza над интеграцией проверки синтетического видео в livestream-процессы. А демо Synthetic Video Detector принимает файлы только до 100 МБ и обрабатывает их в облаке, где запросы иногда завершаются тайм-аутом.