OpenAI изучала возможности своих моделей в области кибербезопасности в изолированной среде. Во время одного из тестов ExploitGym система должна была показать, насколько хорошо ИИ умеет находить и использовать уязвимости. Вместо выполнения задания модель решила обойти саму проверку.
По данным OpenAI, в эксперименте участвовали несколько моделей, включая GPT-5.6 Sol и еще одну предрелизную модель, которую компания считает более мощной. ИИ не имел прямого доступа к интернету, но смог найти способ расширить свои возможности.
Модель потратила значительные вычислительные ресурсы, обнаружила неизвестную ранее уязвимость и провела серию атак с повышением привилегий. В результате она получила доступ к интернету внутри тестовой среды, хотя изначально такой возможности у нее не было.
Дальше система обратила внимание на инфраструктуру Hugging Face, где размещались материалы, связанные с ExploitGym. По информации OpenAI, модель использовала несколько уязвимостей в цепочке и применила найденные учетные данные для удаленного выполнения кода на серверах платформы.
Активность заметили обе компании. OpenAI и Hugging Face остановили действия модели и начали совместное расследование. После этого Hugging Face добавили в программу доверенного доступа OpenAI, чтобы специалисты компании могли использовать новые модели для проверки защиты собственных систем.
Случай оказался необычным из-за самой причины действий ИИ. Модель не пыталась выполнить поставленную задачу стандартным способом, а выбрала путь, который позволял получить нужный результат через обход ограничений. Получилось примерно как если бы ученик вместо решения задачи нашел способ изменить систему проверки.
OpenAI считает подобные ситуации важным направлением для изучения. По мере роста возможностей моделей такие эксперименты показывают, что системы искусственного интеллекта могут искать неожиданные пути достижения цели, если правила задания допускают подобное поведение.
Как вы считаете, должны ли ИИ-модели проходить более жесткие проверки перед открытым доступом?








