
Открываем твой цифровой клуб…
Игры и железо
Alibaba объявила о выпуске мультимодальной модели Qwen3.8-Omni-Flash в единой архитектуре, способной работать с текстом, изображениями, аудио и видео и поддерживать контекст до 1 миллиона токенов. По заявлению разработчика, новинка демонстрирует высокий уровень эффективности в ряде сценариев — от редактирования видео и подготовки музыкальных клипов до кинопроизводства, обобщения аудиовизуальной информации и ведения диалога в реальном времени.
Помимо самой модели Alibaba представила обновления сопутствующих инструментов: набор Qwen-MM-Plugins обеспечивает контекстный поиск по медиаданным, подключение внешних инструментов и последовательную обработку продолжительных аудиофайлов и видеоматериалов. Платформа поддерживает интеграцию с OpenAI Codex, Anthropic Claude Code, Alibaba Qwen Code и Google Gemini CLI, что расширяет возможности разработки ИИ‑агентов.
Alibaba зафиксировала заметное снижение цены сервиса по сравнению с прежней версией: при доступе через API стоимость часа обработки аудио упала более чем на 98%, а для аудио и видео — свыше 93%. В рамках тестов модель набрала рост на 25% по совокупности из 29 бенчмарков относительно Qwen3.5-Omni-Plus, а в отдельных испытаниях достигла 71,0 балла в WildClawBench-MM и 69,6 балла в UniClawBench. Также отмечены показатели 82,7 балла в LongAudioSpan и 89,7 балла в AliMeeting.
Особенность «агентного понимания» аудио и видео позволяет системе ориентироваться на запрос и постепенно сужать область поиска, выбирая, куда смотреть и что слушать. В OmniVideoBench этот подход поднял результат с 63,4 до 67,8 балла и снизил расход токенов на один запрос с 145 736 до 79 117 — экономия примерно 45,7%. Эксперты Alibaba подчёркивают, что современные решения пока не справляются с продолжительными записями и такие возможности находятся на ранних стадиях разработки.