Google объявила о выходе EmbeddingGemma 2, лёгкой и быстрой открытой модели ИИ, ориентированной на поиск по текстам, коду, изображениям, аудио и видео прямо на устройстве. По заявлению компании, новая модель позволяет осуществлять поиск в коллекциях медиафайлов по их содержательному описанию и не требует отправки данных в облако. При этом ключевые возможности распространяются на то, что текстовый запрос можно сравнивать с нефайлованным содержимым через близость смыслов, а не по простому совпадению слов.

Главное отличие EmbeddingGemma 2 от версии-1 состоит в том, что модель способна обрабатывать изображения и звук напрямую. Это избавляет от необходимости собирать отдельные модули для распознавания речи, генерации подписей к картинкам и текстового поиска. Для видео система может индексировать кадры вместе с фрагментами аудио и находить конкретные моменты.

Модель построена на архитектуре Gemma 4 и распространяется под лицензией Apache 2.0 с допускаемым коммерческим использованием. При размере в 740 миллионов параметров EmbeddingGemma 2 заявлена к запуску локально на современных потребительских устройствах, что подчёркивает её пригодность для локального индексирования без облачных вычислений.

Особенностью является модульная архитектура: для текстовых задач достаточно 270 миллионов параметров; для мультимодальных функций и обработки изображений — дополнительно 170 миллионов параметров; для аудио — ещё 300 миллионов параметров. За счёт технологии Matryoshka Representation Learning (MRL) можно динамически уменьшать размерность выходных векторов с 768 до 512, 256 или 128 элементов, что позволяет экономить память в базах данных до шести раз.

Разработчик отмечает, что EmbeddingGemma 2 демонстрирует хорошие результаты на оценках Massive Text Embedding Benchmark (MTEB) по коду и Massive Audio Embedding Benchmark (MAEB), а в сравнении с более крупными моделями — не уступает им в задачах текстовой, визуальной и аудио обработки. В тестах по коду она якобы превосходит более крупные аналоги размером до 1 млрд параметров.

Возможность локальной работы сочетает EmbeddingGemma 2 с принципами RAG (Retrieval-Augmented Generation): при единых токенизаторе и аудиокодировщике обе модели могут работать в единой среде с меньшим суммарным потреблением памяти. Веса доступны на платформах Hugging Face и Kaggle, а позже появятся на Gemini Enterprise Agent Platform. Модель поддерживает популярные инструменты — transformers, llama.cpp, Ollama и LM Studio.

В тестах на устройствах типа Pixel 11 Pro квантование позволило занять около 191 Мбайт оперативной памяти для весов, отвечающих за текстовую часть, а мультимодальная версия — около 567 Мбайт. Это подчёркивает пригодность EmbeddingGemma 2 для задач индексирования кодовой базы и локального поиска информации без утечки данных.