
Открываем твой цифровой клуб…
Игры и железо
Google объявила о выпуске двух новых систем синтеза речи — Gemini 3.8 Flash TTS и Gemini 3.8 Flash-Lite TTS. По заявлениям компании, они превращают генерацию голоса из набора готовых вариантов в более гибкий инструмент для создания звукового контента, пригодного для персонажей в играх, подкастах и аудиокнигах. В прототипах заявлено, что можно формировать индивидуальные голоса, настраивать исполнение каждой реплики и строить выразительные диалоги.
Одной из ключевых функций является клонирование голоса на основе 30-секундной аудиозаписи. Такая возможность доступна только для голоса, принадлежащего владельцу или лицу, на чьё использование получено право. Прежде чем копировать, система проверяет согласие владельца, а созданный материал защищается водяным знаком SynthID и метаданными C2PA.
Пользователь может подбирать голос по роли, акценту и другим характеристикам для более чем ста языков и диалектов. В библиотеке доступно свыше двух тысяч готовых голосов, включая региональные варианты мексиканского испанского, квебекского французского и шотландского английского. Обе модели поддерживают создание длинных аудио с сохранением качества и естественного темпа, а также режим двух говорящих, позволяющий формировать диалоги между разными голосами.
Новые версии уже доступны через Google AI Studio с отдельным интерфейсом для проектирования голосовых сценариев; Gemini 3.8 Flash TTS и Flash-Lite TTS также доступны через Gemini API. В анонсе отмечено, что интеграции новых инструментов осуществлены платформами Agora, LiveKit, Pipecat и Vercel.