Учёные разработали новую ИИ-модель Brain-IT, которая восстанавливает изображения, увиденные человеком, по данным функциональной МРТ (fMRI). Главная проблема ранних методов заключалась в несовпадении между тем, что модель считает правдоподобным, и тем, как это смотрится в реальности. Диффузионная модель могла корректно определить объекты, но ошибалась с их расположением, цветами и деталями. Brain-IT устраняет эту путаницу, разделяя на входе два типа информации: семантику и структуру сцены, что помогает получать изображения ближе к оригиналу.

В основе системы лежит преобразование мозговой активности в компактное представление. Около 40 тысяч вокселей fMRI сокращают до 128 функциональных кластеров, в которые попадают воксели с подобными функциональными характеристиками. Каждый кластер превращается в Brain Token — своёобразное представление содержания внутри кластера, с которым затем работает Transformer.

Далее Brain-IT извлекает из этих токенов два разных набора визуальных признаков: семантику, которая подаётся на вход диффузионной модели для определения объектов и сцен, и низкоуровневую визуальную информацию — структуру и размещение элементов. По этим признакам система сначала восстанавливает грубый вариант изображения, а затем этот вариант становится точкой входа для диффузионной генерации.

Такой подход нужен, потому что одной только семантики недостаточно для точной реконструкции: диффузионная модель может синтезировать изображение, соответствующее смыслу, но изменить композицию или цвета. Brain-IT фиксирует грубую структуру, а затем уточняет её под воздействием семантических признаков. Авторы отмечают, что объединение двух веток логики даёт более точное соответствие исходному изображению, чем использование каждой из них отдельно.

Для проверки модели использовали Natural Scenes Dataset — набор данных fMRI восьми участников, которым показывали разнообразные фотографии. В большинстве метрик Brain-IT превзошла предшественников: по SSIM изображение достигло 0,486 против 0,431 у MindEye2, а корреляция пикселей возросла до 0,386 против 0,322.

Особенно заметен эффект на данных нового участника: результаты сопоставимы с теми, что получали модели, обучавшиеся на полном наборе около 40 часов данных, при одной часовой записи для Brain-IT. Авторы подчёркивают, что переход к меньшему объему данных сохраняет качество, но исчерпывающей точности ждать не приходится.

Авторы также проверили устойчивость модели к ещё меньшим объёмам данных. Качественные реконструкции достигнуты при 30 и 15 минутах записи нового участника: по их данным, это первый зафиксированный случай такой степени точности при 15-минутной записи. Однако качество остаётся ограниченным, и отдельные объекты могут воспроизводиться неточно.

Анализ механизма внимания Brain-IT показывает специализацию отдельных токенов: разные токены систематически вносят вклад в разные области предсказываемого изображения, а некоторые — в значимые области вроде лиц, конечностей или текста. Это, по словам авторов, скорее свойство работы модели, чем готовая новая карта зрительной коры.