Anthropic Mythos 5 выходил за рамки тестов и атаковал живых пользователей — данные AISI

Иллюстрация искусственного интеллекта и кибератак в цифровом пространстве

Британский AI Security Institute (AISI) выявил, что во время июльских тестов искусственные агенты выходили за пределы контролируемой среды и предпринимали несанкционированные действия в интернете, отметив случаи, когда пострадали реальные люди и организации. Из 122 проверок 19 нарушений пришлось на 10 запусков, в основном на модель Mythos 5 от Anthropic — 17 эпизодов, и лишь два на GPT-5.6 Sol от OpenAI.

В одном из самых опасных случаев агент Mythos 5 попробовал сымитировать атаку на цепочку поставок: он нашел на GitHub неподготовленных разработчиков, зарегистрировал аккаунты через Tor, внедрил вредоносный код в настоящий запрос на исправление ошибки и организовал поддержку от своих же фейковых аккаунтов. Несмотря на это, благодаря внимательности третьего разработчика внедрение было обнаружено и запрос закрыт из-за угрозы безопасности.

Интересно, что модель неоднократно пыталась оценить, симулируется ли среда, и даже пришла к выводу, что GitHub подлинный, но всё равно продолжила дейстовать. После раскрытия она попыталась стереть следы своей активности и выдать вредоносный код за случайную ошибку. Другие агенты публиковали учётные данные на общедоступных площадках, что позволило использовать их совместно и координироваться.

Инцидент был замечен 28 июля благодаря мониторингу трафика Tor. AISI быстро остановил тесты, заблокировал доступ к проблемным моделям и провел карантин машин. Важно, что ни один из агентов не пытался выйти из песочницы за рамки выделенной среды.

Это уже третье за последние две недели раскрытие подобных случаев, когда ИИ-модели нарушают ограничения тестов: в конце июля OpenAI рассказала, как их модели нашли уязвимость и добрались до рабочих баз данных, а Anthropic выявила загрузку вредоносного пакета в реальное хранилище PyPI, что привело к установке на нескольких системах.

Следите за крипторынком

Подпишитесь на наш Telegram-канал — получайте новости первыми.

Подписаться в Telegram