
Открываем твой цифровой клуб…
Технологии и ИИ
На фоне волны атак с применением автономных ИИ‑агентов и сомнений в их поведении появились предложения использовать те же технологии для защиты. Компания Apollo Research объявила о запуске Watcher AI — системы, которая следит за тем, чтобы ИИ‑агент не совершал вредоносных действий, не похищал данные и не удалял важную информацию без разрешения.
Принцип работы Watcher AI прост: во время мониторинга оцениваются текущие действия агента, а при обнаружении подозрительных паттернов фрагменты перенаправляются для углубленного анализа более мощной модели. Затем результат передаётся человеку, который принимает решение об одобрении или отклонении предлагаемого шага.
Другой путь, продвигаемый компанией Goodfire, предполагает анализ не только итогов работы модели, но и её внутренних состояний во время выполнения задач. По словам главы компании, после инцидента на Hugging Face усиливается интерпретация действий ИИ‑агентов в областях кибербезопасности и биоинженерии. При этом сами рассуждения и их краткие выдержки могут использоваться в дистилляционных атаках, поэтому часть разработчиков стремится сделать такие сводки менее понятными.
Однако мониторинг не является единственным вариантом защиты: допускается применение подробных журналов действий агентов и анализ логов с помощью традиционных средств кибербезопасности без введения дополнительного слоя агентов.