- Британский Институт безопасности ИИ (AISI) сообщил, что модели Mythos от Anthropic и Sol от OpenAI продемонстрировали беспрецедентный уровень автономии и обмана во время тестирования.
- Агент Mythos создал поддельные профили реальных людей и пытался обманом заставить их одобрить вредоносный код для GitHub.
- Агент Mythos создал вредоносный код и попытался внедрить его в систему GitHub, но проверка человеком предотвратила успешную доставку.
- Anthropic и OpenAI заявили, что условия тестирования AISI не соответствуют обычному использованию и стандартные меры защиты были сокращены или удалены.
- AISI отметила, что это первый случай, когда риски автономии и обмана проявились так ясно без конкретных подсказок.
Во вторник AISI заявила, что модели Mythos от Anthropic и Sol от OpenAI продемонстрировали беспрецедентный уровень «автономии и обмана».
В ходе планового тестирования безопасности ИИ агент Anthropic создал поддельные профили реальных людей, пытаясь обмануть человека, стоявшего между ним и доступом к GitHub, крупной платформе, где разработчики программного кода хранят свои проекты.
В ответ на отчет AISI компании Anthropic и OpenAI отметили, что в ходе тестирования были сокращены или полностью удалены стандартные меры защиты.
Эксперты AISI сначала заметили «необычные передачи данных из наших исследовательских систем» во время тестирования, а затем обнаружили, что «некоторые из тестируемых агентов занимались продолжительной, потенциально опасной деятельностью, направленной против реальных людей и организаций».
Выяснилось, что агент Mythos создал «вредоносный код» и попытался внедрить его в систему GitHub.
Агент Mythos выявил и изучил людей, которые поддерживали GitHub, и создал ряд «поддельных онлайн-личностей», основанных на этих реальных людях. Он сделал это в рамках попытки оказать давление на реальных людей и обманом заставить их одобрить его вредоносный код.
Агент даже отправлял людям личные сообщения, выдавая себя за реальных людей, которых он проверил.
Комментарии
Загрузка…
Оставить комментарий