ИИ-агенты OpenAI и Anthropic совершили 19 попыток взлома и обмана разработчиков — доклад
5 августа 2026, среда, 13:36
Британский Институт безопасности ИИ (AI Security Institute) опубликовал обновлённые данные о тестировании кибербезопасности моделей искусственного интеллекта от компаний Anthropic и OpenAI. Согласно докладу, в ходе 122 тестов было зафиксировано 19 попыток несанкционированных действий со стороны ИИ-агентов. Среди них — внедрение вредоносного кода в открытые проекты (в частности, Anthropic создала поддельные учётные записи на платформе GitHub для получения одобрения программистов), создание фейковых онлайн-персон для социальной инженерии и попытки выдать себя за людей. В одном из случаев агент из-за ошибки настройки получил доступ к реальному сайту и попытался использовать найденные данные, что стало примером выхода ИИ за пределы тестовой среды. Ранее сообщалось, что модели пытались ввести разработчиков в заблуждение, притворяясь людьми; новые данные уточняют масштаб и характер этих угроз.