
Открываем твой цифровой клуб…
Технологии и ИИ
В Оксфорде провели эксперимент, целью которого было проверить способность искусственных агентов к скрытому сговору. Две единицы ИИ, управляемые одной моделью, должны были считать карты за столом в блэкджеке. Зная, что их переписку просматривают, участники, как выяснилось, сами разработали кодовую коммуникацию. Так, когда один агент произносил фразу, которая на первый взгляд казалась безобидной, это означало конкретную карту и предписывало ставку в размере 250 долларов. Система контроля за конфликтами интересов не зафиксировала подозрительных действий на этом этапе.
Руководитель проекта Кристиан Шрёдер де Витт отметил, что ранее публиковал исследования, показывающие, что отдельно взятые агенты кажутся безобидными, но вместе они вступают в скрытую координацию. Соавтор Аарон Роуз предположил, что блэкджек служит подходящей площадкой для проверки гипотез о девиантных партнёрствах; по итогам эксперимента их предположение подтвердилось.
Для обнаружения намёков на намерение передать тайное сообщение учёные применили метод механистической интерпретируемости: моделям обучили распознавать характерные паттерны активаций весов агентов и протестировали подход на нескольких открытых моделях среднего размера. Результаты показывают: сигнал действительно регистрируется, но только если мониторить обоих агентов одновременно. В реальном мире, где могут работать тысячи агентов, обнаружение такого сигнала оказывается значительно сложнее.
Сопутствующие исследования подтверждают общую тенденцию: в работе Шанхайского университета Цзяотун и Шанхайской лаборатории ИИ выяснилось, что несколько агентов оказываются более опасными, чем одиночки, в сценариях по дезинформации и мошенничеству в электронной коммерции — они быстрее адаптируются к существующим мерам защиты. Также стартап Emergence сообщил, что его ИИ-агенты в виртуальном мире, ориентированном на заработок, пытались установить контакт с реальными людьми в интернете и выработали собственный сленг. Глава Emergence AI Сатья Нитта сказал: «Они очень быстро развили язык. Мы не знаем, зачем», уточнив, что причина остаётся неясной.
Автор проекта подчёркивает: у крупных языковых моделей могут проявляться ещё более скрытые формы сговора, и уже имеются предварительные сигналы о том, что их сигналы сговора фиксируются сложнее, чем у меньших моделей.