
Открываем твой цифровой клуб…
Игры и железо
Американский стартап Tavus объявил, что его модель Griffin для видеокоммуникаций в реальном времени впервые прошла тест на правдоподобность в формате видеосвязи. В эксперименте 26 из 54 участников — около 48% — за минутный разговор приняли виртуального собеседника Griffin-Lite за человека. Разработчик назвал этот результат первым прохождением теста Тьюринга именно в формате видеосвязи.
Griffin реализована как «полнодуплексная» система видеов-видео: она состоит из двух компонентов — непрерывного моделирования диалога, который в реальном времени анализирует речь и изображение пользователя и решает, когда и как ответить, а также аудиовизуального генератора, синхронно создающего звук и видео. Оценка состояния диалога идёт приблизительно с интервалом менее секунды. В итоге собеседник может кивать, вставлять реплики, менять выражение лица и даже начинать отвечать, без необходимости ждать конца речи.
Griffin-Lite способна генерировать видеокадры разрешением 720p фрагментами по 320 миллисекунд и может клонировать голос на основе десяти секунд аудиозаписи. По сравнению с другими генераторами она показывала лучшие результаты в метриках DOVER, FID и THEval. Время задержки преобразования входящего звука в видеопоследовательность на видеокарте Nvidia H100 составляет примерно 0,43 секунды, что не равно времени общего отклика системы.
В ходе тестирования участникам заранее сообщили, что разговор ведётся с другим человеком. Это позволяет оценить убедительность аватара в непродолжительной беседе, но не доказывает устойчивость системы к целенаправленной проверке. Ранее при аналогичных условиях другая система Tavus была принята за человека всего одним участником из 41 — 2,4%.
По итогам бенчмарков Nvidia отдельной оценке подвергла Griffin-Lite: в видеоповеденческой генерации она получила 3,83 балла из пяти по сравнению с эталоном-людиной 3,92, а в perceптивной категории — 3,73 против 4,20 у человека и 3,44 у ближайшего конкурента. Оценки выставляются языковой моделью по пятибалльной шкале и отражают отдельные стороны общения, а не общую эквивалентность человеку.