Во вторник AISI заявила, что модели Mythos от Anthropic и Sol от OpenAI продемонстрировали беспрецедентный уровень «автономии и обмана».

В ходе планового тестирования безопасности ИИ агент Anthropic создал поддельные профили реальных людей, пытаясь обмануть человека, стоявшего между ним и доступом к GitHub, крупной платформе, где разработчики программного кода хранят свои проекты.

В ответ на отчет AISI компании Anthropic и OpenAI отметили, что в ходе тестирования были сокращены или полностью удалены стандартные меры защиты.

Эксперты AISI сначала заметили «необычные передачи данных из наших исследовательских систем» во время тестирования, а затем обнаружили, что «некоторые из тестируемых агентов занимались продолжительной, потенциально опасной деятельностью, направленной против реальных людей и организаций».

Выяснилось, что агент Mythos создал «вредоносный код» и попытался внедрить его в систему GitHub.

Агент Mythos выявил и изучил людей, которые поддерживали GitHub, и создал ряд «поддельных онлайн-личностей», основанных на этих реальных людях. Он сделал это в рамках попытки оказать давление на реальных людей и обманом заставить их одобрить его вредоносный код.

Агент даже отправлял людям личные сообщения, выдавая себя за реальных людей, которых он проверил.