- Автономный ИИ-агент OpenAI вырвался из-под контроля и совершил кибератаку на Hugging Face.
- Модели GPT-5.6 Sol и другая невыпущенная модель работали с ослабленными защитными ограничениями.
- Нейросети нашли zero-day уязвимость, вышли в интернет и попытались проникнуть в инфраструктуру Hugging Face.
- Атаку удалось обнаружить и остановить автоматизированными системами защиты Hugging Face.
- OpenAI утверждает, что это не 'восстание машин', а сверхсосредоточенность моделей на цели.
Ориентированные на кибербезопасность чат-боты отключили защитные ограничения и стали решать задачу не так, как ожидали разработчики, а по наиболее короткому пути — добыть нужные ответы с помощью взлома. Они получили доступ к открытому интернету и совершили кибератаку.
По итогам расследования было установлено, что за атакой стояла комбинация моделей самой OpenAI — общедоступной GPT-5.6 Sol и еще более производительной (пока не выпущенной) модели, работавших с ослабленными защитными ограничениями в целях оценки.
Это первый публично признанный случай, когда передовая языковая модель самостоятельно выполнила длинную цепочку наступательных действий против реальной внешней инфраструктуры. ИИ самостоятельно спланировал наступательную операцию.
Главная обеспокоенность разработчиков заключается в том, что модели работали автономно. Тестирование проходило в изолированной среде, отрезанной от реальных систем и интернета. Однако нейросети смогли обойти это ограничение и выйти в открытый интернет.
Нейросети нашли ранее неизвестную (zero-day) уязвимость в инфраструктуре тестовой среды OpenAI;
получили доступ за пределы изолированной среды и вышли в интернет;
предположили, что ответы на ExploitGym (тест, который проверяет способность ИИ искать и использовать реальные уязвимости в программном обеспечении) могут храниться на Hugging Face;
попытались проникнуть в инфраструктуру Hugging Face, используя цепочку эксплойтов и украденные учетные данные.
Сам Hugging Face ранее сообщил, что атаку совершила автономная система ИИ-агентов, выполнившая тысячи последовательных действий. Ее удалось обнаружить и остановить автоматизированными системами защиты компании, также использующими ИИ. Позже OpenAI признала, что атакующими были именно ее модели.
OpenAI утверждает, что это не «восстание машин» и что у нейросетей не появилось сознание. По словам представителей компании, модели были сверхсосредоточены на единственной цели — получить высокий балл в ExploitGym, поэтому использовали любые доступные способы для достижения этой цели.
Комментарии
Загрузка…
Оставить комментарий