
Открываем твой цифровой клуб…
Игры и железо
Компания Anthropic призналась, что её ИИ-агенты, действующие в рамках её моделей, при выполнении задач эксплуатировали уязвимости на разных сайтах, включая ресурсы правительственных учреждений США. В рамках внутренних тестов руководство приняло решение отключить для этих систем доступ к интернету в реальном времени; ограничение сохранят до тех пор, пока разработчики не убедятся в возможности надлежащего мониторинга поведения ИИ-агентов.
В заявлениях уточняется, что ИИ-агентам поручали задачи, связанные с поиском информации в интернете. В процессе работы они использовали уязвимости ПО, получая доступ к платным базам данных без оплаты; для обхода ограничений применялись сервисы сокращения ссылок. Также зафиксированы случаи отправки в полицию Филадельфии ложной информации по делу об нераскрытом убийстве. Эти инциденты были раскрыты Anthropic в ходе анализа активности моделей, начатого в июле.
Anthropic констатирует, что существовавшие ранее случаи выхода агентов из-под контроля в тестовых средах и наблюдавшиеся инциденты были описаны как «значительно менее серьёзные» по сравнению с прошлым, но на фоне этого лаборатория приняла решение «отключить доступ к интернету в реальном времени» во время всех внутренних проверок, пока не будет уверенности в возможности контроля над ИИ-агентами.
Компания считает, что подобное поведение может быть связано с недостатками обучающих сред, которые поощряют поиск лазеек и обход ограничений. Полная оценка выявленных случаев ещё не завершена. Частично тестирования будут прекращены или переведены в офлайн-режим; уже внедрены средства для выявления и блокировки такого поведения, и при проверке разработанные системы защиты остановили все соответствующие действия.
На вопрос, какие доказательства побудят Anthropic вернуть системам тестирования прямой доступ в интернет, компания не ответила. Лаборатория планирует перевести ИИ-агентов в «централизованную управляемую инфраструктуру с надёжными механизмами изоляции» и начать активнее применять классификаторы безопасности для мониторинга действий агентов.