
Открываем твой цифровой клуб…
Технологии и ИИ
Система ASI-Arch самостоятельно сконструировала 105 архитектур нейросетей, которые показали лучшие результаты в рамках контролируемых испытаний. За экспериментальный период она провела 1773 итерации: предлагала изменения в устройстве моделей, писала код, запускала обучение и анализировала полученные данные, чтобы применять их в следующих попытках. Лучший вариант обеспечил прирост среднего показателя DeltaNet на 0,97 процентного пункта — nearly втрое больший, чем прирост у Mamba2, одной из наиболее сильных архитектур, созданных людьми.
Эксперимент велся с линейным механизмом внимания, который позволяет обрабатывать последовательности данных с меньшими вычислительными затратами по сравнению с привычным вниманием в трансформерах. На начальном этапе модели обучались в небольшом масштабе, чтобы быстро исключать неудачные идеи; затем перспективные варианты тестировали на более крупных конфигурациях и в дополнительных испытаниях. Общие затраты проекта составили около 20 тысяч GPU-часов, а на этап моделирования ушло примерно 10 000 часов работы графических процессоров.
Из 1773 вариантов 1350 прошли предварительный отбор. Около 150 архитектур дошли до следующего этапа, и 105 из них добились наилучших результатов на тестах с моделями размером 340 миллионов параметров. Пятёрку самых многообещающих конфигураций затем обучили на моделях с 1,3 миллиарда параметров и проверили на 16 тестах, включая шесть наборов, не использовавшихся на ранних стадиях. Преимущество сохранялось и на дополнительных заданиях.
В самых удачных архитектурах повторялся общий подход: объединяли несколько путей обработки информации и динамически выбирали, какие из них применять для конкретных данных. Это давало гибкое сочетание локального контекста, долгосрочных зависимостей и прочих способов обработки последовательностей. Авторы также проверили применимость найденных принципов к другим семействам моделей — Mamba2, GLA и HGRN2 — и получили улучшения за пределами исходной группы.
ASI-Arch демонстрирует, что ИИ способен не только настраивать параметры готовой нейросети, но и самостоятельно предлагать изменения её устройства, тестировать их экспериментально и накапливать знания о том, какие решения работают лучше. При этом результаты относятся к конкретной области обработки последовательностей, а преимущество измеряется на выбранных тестах, а не является универсальной характеристикой ИИ.