SpaceXAI объявила о выпуске Grok Voice Transcribe 2.0 — новой модели для преобразования речи в текст. Разработчики уверяют, что при той же цене она допускает вдвое меньше ошибок по сравнению с предшественницей. Модель нацелена на сложные записи: телефонные разговоры с помехами, одновременную речь нескольких собеседников и диалекты с региональными акцентами.

По информации компании, Grok Voice Transcribe 2.0 основана на аудиомодели, которая ранее применялась в Grok Voice, и уже используется в службах поддержки, видеоинформации и системах голосового помощника в автомобилях Tesla. Обучение включало многоязычные записи с шумами, после чего модель дорабатывали методами постобработки.

Внутренние тесты платформы показывают, что по некоторым сценариям 2.0 демонстрирует лучшие результаты, чем версия 1.0. В рейтингах компания отмечает победу Grok Voice Transcribe 2.0 в AA-WER Streaming среди 32 потоковых моделей, а также тесты на четырех внутренних наборах данных — телефонные разговоры, диалоги с Grok, произнесённые номера и короткие фразы для голосовых ассистентов на 19 языках. Независимые подтверждения этих данных отсутствуют.

Одно из главных улучшений — расширенная многоязычность: система автоматически определяет язык и поддерживает десятки языков, сохраняя возможность продолжать речь при смене языка во время разговора. По заявлению разработчика, показатель WER на коротких фразах снизился с 20,6% до 6,8% — примерно на 67% ниже предыдущего уровня; также упоминается автоматическое форматирование чисел, сумм и единиц измерения для 25 языков.

Доступ к Grok Voice Transcribe 2.0 реализован через Speech to Text API в пакетном и потоковом режимах. В потоковом режиме применяется кодек Opus при скорости передачи около 4 Кбайт/с; для сравнения, несжатый PCM на той же частоте требует примерно 48 Кбайт/с. API предоставляет временные метки, оценки уверенности, разделение речи между спикерами без доплаты, поддержку до восьми аудиоканалов и возможность фиксации до 100 ключевых терминов; также реализовано автоматическое форматирование чисел и дат.

В пакетном режиме сервис принимает файлы до 500 Мбайт в 12 форматах, а потоковое распознавание осуществляется через WebSocket. Идентификатор API — grok-voice-transcribe-2.0. Цена за пакетную расшифровку — 0,10 доллара за час аудио, за потоковую — 0,20 доллара за час.

В материалах подчеркивается, что изображение к публикации демонстрирует Grok. В то же время уточняется, что данные о результатах опубликованы MarkTechPost и не подтверждены независимыми источниками.