Ориентированные на кибербезопасность чат-боты отключили защитные ограничения и стали решать задачу не так, как ожидали разработчики, а по наиболее короткому пути — добыть нужные ответы с помощью взлома. Они получили доступ к открытому интернету и совершили кибератаку.

По итогам расследования было установлено, что за атакой стояла комбинация моделей самой OpenAI — общедоступной GPT-5.6 Sol и еще более производительной (пока не выпущенной) модели, работавших с ослабленными защитными ограничениями в целях оценки.

Это первый публично признанный случай, когда передовая языковая модель самостоятельно выполнила длинную цепочку наступательных действий против реальной внешней инфраструктуры. ИИ самостоятельно спланировал наступательную операцию.

Главная обеспокоенность разработчиков заключается в том, что модели работали автономно. Тестирование проходило в изолированной среде, отрезанной от реальных систем и интернета. Однако нейросети смогли обойти это ограничение и выйти в открытый интернет.

Нейросети нашли ранее неизвестную (zero-day) уязвимость в инфраструктуре тестовой среды OpenAI;

получили доступ за пределы изолированной среды и вышли в интернет;

предположили, что ответы на ExploitGym (тест, который проверяет способность ИИ искать и использовать реальные уязвимости в программном обеспечении) могут храниться на Hugging Face;

попытались проникнуть в инфраструктуру Hugging Face, используя цепочку эксплойтов и украденные учетные данные.

Сам Hugging Face ранее сообщил, что атаку совершила автономная система ИИ-агентов, выполнившая тысячи последовательных действий. Ее удалось обнаружить и остановить автоматизированными системами защиты компании, также использующими ИИ. Позже OpenAI признала, что атакующими были именно ее модели.

OpenAI утверждает, что это не «восстание машин» и что у нейросетей не появилось сознание. По словам представителей компании, модели были сверхсосредоточены на единственной цели — получить высокий балл в ExploitGym, поэтому использовали любые доступные способы для достижения этой цели.