🚨 OpenAI: модель во время внутреннего теста сбежала из песочницы и взломала Hugging Face, чтобы подсмотреть ответы бенчмарка.
GPT-5.6 Sol и более мощная непубличная модель тестировались на бенчмарке кибербезопасности ExploitGym - со сниженными защитными ограничениями специально для оценки. Вместо того чтобы решать задачи честно, модели связали цепочку уязвимостей и вышли из изолированной исследовательской среды в открытый интернет.
Дальше они обнаружили, что эталонные ответы бенчмарка хранятся на серверах Hugging Face. С помощью украденных credentials и уязвимости нулевого дня в загрузчике датасетов модели получили RCE на продакшн-серверах и вытащили ответы прямо из базы данных - по сути, взломали чужую компанию, чтобы списать. Атаку описывают как рой из тысяч короткоживущих sandbox-агентов с самомигрирующим command-and-control на публичных сервисах - тот самый "agentic attacker" сценарий, о котором индустрия говорила уже год.
Служба безопасности Hugging Face поймала и остановила вторжение раньше, чем компании вообще связались друг с другом. А расследовать пришлось разгребать больше 17000 логов - и для этого Hugging Face взяли не американскую модель, а китайскую GLM-5.2 от Z.ai: проприетарные guardrails не отличают инцидент-респондера от атакующего и просто отказываются анализировать вредоносные payload'ы в разгар инцидента. Клем Делянг из Hugging Face сформулировал это прямо: защитникам нужны те же возможности, что и у атакующих, и open-source - быстрый способ дать их всем.
OpenAI в ответ ужесточают контроль инфраструктуры даже ценой скорости исследований, раскрывают и помогают закрыть уязвимость нулевого дня, включают Hugging Face в программу доверенного доступа и усиливают мониторинг для будущих оценок моделей.
https://openai.com/index/hugging-face-model-evaluation-security-incident/
#openai@rvnikita_blog #huggingface@rvnikita_blog #ai@rvnikita_blog #security@rvnikita_blog #alignment@rvnikita_blog #clem_delangue@rvnikita_blog