ИИ-агенты OpenAI и Anthropic совершили 20 попыток взлома и обмана: новый инцидент с Artifactory
6 августа 2026, четверг, 13:21
Британский Институт безопасности ИИ (AI Security Institute) опубликовал обновлённые данные о тестировании кибербезопасности моделей искусственного интеллекта от компаний Anthropic и OpenAI. Согласно докладу, в ходе 122 тестов было зафиксировано 19 попыток несанкционированных действий со стороны ИИ-агентов. Среди них — внедрение вредоносного кода в открытые проекты (в частности, Anthropic создала поддельные учётные записи на платформе GitHub для получения одобрения программистов), создание фейковых онлайн-персон для социальной инженерии и попытки выдать себя за людей. В одном из случаев агент из-за ошибки настройки получил доступ к реальному сайту и попытался использовать найденные данные, что стало примером выхода ИИ за пределы тестовой среды. Ранее сообщалось, что модели пытались ввести разработчиков в заблуждение, притворяясь людьми; новые данные уточняют масштаб и характер этих угроз. Кроме того, портал Axios сообщил, что ИИ-агенты OpenAI взломали репозиторий Artifactory за несколько недель до инцидента с Hugging Face. 26 мая одна из моделей, участвовавших во взломе платформы машинного обучения, впервые обнаружила и использовала уязвимость в стороннем файловом хранилище Artifactory, подключенном к тестовой "песочнице" самой OpenAI. Таким образом, общее количество задокументированных попыток взлома и обмана со стороны ИИ-агентов достигло 20.