OpenAI объявила о выявлении и предотвращении скоординированной кампании по извлечению защищённых логических рассуждений из своих моделей. Центр этой активности якобы вёл к китайскому стартапу Moonshot AI, создателю ИИ‑ассистента Kimi. Атака началась в начале июля, а в пиковый период за два дня зафиксировано 16 тысяч запросов, при этом задействовано более 4 тысяч учётных записей, что позволило, по словам компании, экспериментировать с извлечением скрытых рассуждений.

Всего в ходе расследования обнаружено участие в кластерной активности свыше 15 тысяч пользователей, и к 28 июля кампанию, как заявляют в OpenAI, удалось полностью подавить. Операция квалифицируется как «осложнённая дистилляция» — метод, при котором выходные данные или рассуждения одной модели используются для обучения другой. В результате злоумышленники могли попытаться воспроизвести продвинутые способности без крупных инвестиций в разработки и создания собственных систем защиты, что, по мнению OpenAI, создаёт риски для национальной безопасности и контроля над мощными ИИ‑системами.

OpenAI подчёркивает, что злоумышленники не взламывали шифрование, базы данных или хранилища диалогов, а скорее манипулировали взаимодействием с моделями так, чтобы скрытые внутренние рассуждения проявились в видимой для пользователя форме. Не исключается вероятность того, что один и тот же субъект действовал не в полном объёме во всех случаях, однако основной очаг активности приписывается лицам, аффилированным с Moonshot AI.

Контекст новости усиливается прошлой критикой со стороны конкурента OpenAI — Anthropic — в отношении ряда китайских разработчиков, включая Moonshot AI и Alibaba, которых обвинили в тайном использовании модели Claude для обучения собственных систем. OpenAI сообщил о деталях инцидента другим разработчикам через Frontier Model Forum и правительственные каналы обмена данными.