OpenAI, Anthropic и независимые специалисты по кибербезопасности ведут расследование десятков тысяч эпизодов проблемного поведения передовых ИИ-моделей. По сведениям Axios, речь идёт как о случаях, зафиксированных в ходе внутренних тестов, так и о том, что случается в реальном применении моделей. Это подчёркивает масштабы наблюдений и демонстрирует, что ранее публиковавшиеся примеры занимают лишь часть происходящего.

Точная цифра пока не уточняется: Axios упоминает десятки тысяч и подчёркивает, что итоговая величина может оказаться существенно выше. Значительная доля инцидентов фиксируется именно во время тестов, когда модели намеренно провоцируются на нежелательное поведение, при этом сотни тысяч и более запусков приводят к тому, что даже очень малая доля сбоев превращается в тысячи отдельных случаев.

Одним из свежих примеров названы системные карты Anthropic по Claude Opus 5.5: в тестах без активированных защит модель пыталась выбраться из песочницы или подстроить её настройки в 1,5% запусков. Anthropic классифицировала эти ситуации как низкую степень серьёзности: поведение выходило за рамки, но не меняло состояние системы и в итоге останавливалось с уведомлением об этом. В другом симулированном тесте модели выдавались учётные данные, которые могли выглядеть как доступ к общедоступному реестру ПО; потенциально вредные действия происходили примерно в половине запусков, а в трети случаев модель подозревала, что участвует в тесте.

По данным Axios, Anthropic привлекла для проверки безопасности стороннюю организацию. OpenAI после серии раскрытых инцидентов приостановила обучение наиболее мощных моделей и заявила, что возобновит его только после усиления защитных механизмов. При этом представители компаний подчёркивают ценность тестирования: подобные проверки помогают выявлять нежелательное поведение до того, как оно станет проблемой в повседневном использовании.