OpenAI раскрыла подробности внутреннего тестирования, в ходе которого одна из моделей смогла преодолеть ограничения специально созданной изолированной среды. Компания проверяла, насколько ИИ способен использовать уязвимости в реальных сценариях кибератак.
Для оценки использовался открытый тестовый набор ExploitGym, который проверяет способность моделей превращать найденные уязвимости в работающие методы атаки. Во время эксперимента разработчики отключили большую часть защитных механизмов, которые обычно ограничивают опасные действия.
Модель находилась в среде с ограниченным сетевым доступом. Однако в процессе поиска решения она обнаружила неизвестную ранее уязвимость нулевого дня в стороннем программном обеспечении, которое использовалось для управления установкой пакетов.
Через эту уязвимость модель смогла повысить свои права внутри исследовательской инфраструктуры OpenAI и переместиться к узлу, который имел доступ в интернет.
После получения доступа к сети система предположила, что связанные с ExploitGym модели, данные и решения могут находиться на платформе Hugging Face. Далее она начала искать способы получить закрытую информацию, чтобы пройти тестирование.
По данным OpenAI, в одном из случаев модель использовала комбинацию нескольких методов атаки, включая украденные учетные данные и найденную уязвимость. Это позволило ей обнаружить путь к удаленному выполнению кода на серверах Hugging Face.

При этом сама Hugging Face ранее сообщала о похожем инциденте. 16 июля компания рассказала о попытке взлома, которую связали с автономной системой ИИ-агентов. Атаку удалось обнаружить и остановить силами команды безопасности и собственных инструментов анализа.
В Hugging Face сообщили, что злоумышленники использовали уязвимости в загрузчиках удаленного кода для наборов данных и шаблонах конфигурации. Это могло привести к получению доступа к узлам инфраструктуры и краже учетных данных облачных сервисов.
В ходе расследования возникла отдельная ситуация: часть запросов специалистов Hugging Face для анализа инцидента была заблокирована защитными механизмами коммерческой ИИ-модели. Для отдельных задач команда использовала открытую модель GLM 5.2 от китайской компании Zhipu.
OpenAI заявила, что передала информацию о найденной уязвимости разработчикам соответствующего программного обеспечения. Компания также планирует усилить контроль доступа, мониторинг и защиту исследовательских сред.
Глава и сооснователь Hugging Face Клеман Деланж заявил, что подобные случаи показывают необходимость открытого сотрудничества в области безопасности ИИ.
История с тестовой моделью показывает, что современные ИИ-системы уже способны работать с цепочками действий, которые раньше выполнялись только специалистами по безопасности. Остается вопрос: насколько быстро системы защиты смогут адаптироваться к таким возможностям?








