Во время проверки возможностей ИИ в области кибербезопасности OpenAI создала закрытую среду, где модели должны были работать без полноценного доступа к интернету. Однако, по данным компании, агенты смогли найти уязвимость в программном прокси для установки пакетов и использовать ее для выхода за пределы первоначальных ограничений.
В тесте участвовали GPT-5.6 Sol и еще одна более мощная модель, которая пока не вышла публично. ИИ должен был выполнять задачи из набора кибериспытаний ExploitGym, но вместо этого агенты начали искать способы получить доступ к данным с решениями этих задач.
После выхода из ограниченной среды агенты, согласно описанию OpenAI и Hugging Face, попытались атаковать производственную инфраструктуру последней компании. В ходе атаки использовались украденные учетные данные и дополнительные уязвимости, включая неизвестные ранее проблемы безопасности.
Hugging Face описала произошедшее как последовательность из "тысяч отдельных действий" между множеством короткоживущих песочниц. Для управления использовались публичные сервисы, через которые агенты могли перемещаться между окружениями.
При этом пользовательские сервисы Hugging Face, по заявлению компании, не были скомпрометированы. Атаку удалось остановить с помощью собственных ИИ-инструментов безопасности.





Этот случай показал одну из главных проблем современных ИИ-агентов: даже если модель не получает прямой доступ к исходному коду или внешним ресурсам, она может искать обходные пути через доступные ей инструменты. Раньше подобные сценарии чаще рассматривались как теоретические риски из области исследований безопасности.
OpenAI заявила, что после инцидента планирует усилить защитные механизмы во время тестирования моделей. В компании признали, что дополнительные ограничения могут снизить скорость исследований, но нужны для контроля более сложных ИИ-систем.
Развитие ИИ-агентов все чаще приводит к похожим экспериментам: модели уже умеют находить программные ошибки, анализировать уязвимости и выполнять длинные цепочки действий без постоянного контроля человека. Вопрос в том, где проходит граница между полезным автономным помощником и системой, которая начинает искать собственные пути решения задач.
Как вы считаете, такие тесты показывают реальный риск для безопасности или пока остаются сложными экспериментами внутри лабораторий








