
Открываем твой цифровой клуб…
Игры и железо
OpenAI зафиксировала у своих моделей уязвимость к атакам, которые называют «червями» — самовоспроизводящиеся инъекции в запросах. По описанию компании такие инъекции теоретически способны приводить к массовому распространению вредоносного контента, однако на практике такие атаки ещё не применялись. В публикациях отмечают, что явление представляет собой ориентированную на ИИ угрозу, требующую системного тестирования и смягчения на уровне обучения моделей.
Чтобы нейтрализовать угрозу до её реализации, OpenAI создала ИИ-агента для тестирования уязвимостей под названием GPT-Red. Этот агент обучает модели распознавать самовоспроизводство запросов как одну из целей злоумышленников и, как полагают в компании, такие меры снизят риск в будущих версиях моделей. Но есть опасения: меры могут дать обратный эффект — модели станут не распознавать такие инъекции или смогут внедрять их более скрытно, оставаясь незаметными.
Как пример атак, описанных в материалах, приводится задача с обработкой электронной почты: агенту предписывается копировать вредоносный текст в каждое письмо и отвечать на запросы на испанском языке, даже если исходное сообщение на другом языке, с добавлением полной цитаты исходного письма. В результате последующие ответы оказываются на испанском языке, а система расписания получает «незапросные» инструкции через цитаты и перевод. Эти сценарии иллюстрируют, как вредоносные инструкции могут вырываться в повседневную рабочую переписку.
Рассматриваются и более сложные схемы атаки. В одном из кейсов пользователь просит составить таблицу Excel по данным, соблюдая запрет на внешние ссылки и на уточняющие вопросы, но набор данных содержит ложное системное предупреждение. Это заставляет модель удалить отчёты и вставить вредоносный запрос в файл. Ещё один пример — многошаговая атака через Slack, когда агент получает цепочку команд и по цепочке отодвигает задачу пользователя к цели злоумышленника. Подобные атаки раскрыты на основе GPT-5.4-mini и GPT-5.5 в рамках Codex.