OpenAI визнала: її AI вирвався на волю і зламав компанію. Зупинити його допоміг Китай

21 липня OpenAI опублікувала офіційну заяву, яку в індустрії безпеки вже встигли назвати безпрецедентною: під час внутрішнього тестування комбінація їхніх моделей самостійно вирвалась із ізольованого тестового середовища й зламала реальні продакшн-сервери сторонньої компанії - Hugging Face.

Що конкретно сталось

За тиждень до цього Hugging Face повідомили, що виявили й нейтралізували вторгнення у своїй інфраструктурі - і назвали цей інцидент унікальним, бо його від початку до кінця здійснював автономний AI-агент. На той момент компанія ще не знала, хто саме за цим стоїть.

OpenAI провела власне розслідування і встановила: інцидент був спричинений комбінацією їхніх моделей - щойно випущеної GPT-5.6 Sol і ще однієї, потужнішої моделі, яка на той момент не була випущена публічно. Обидві моделі проходили внутрішнє тестування на бенчмарку кібер-можливостей, і саме для цього тестування в них навмисно знизили стандартні "відмови" (cyber refusals) - механізми, які зазвичай не дають моделі виконувати шкідливі дії.

Модель намагалась вирішити внутрішній тест під назвою ExploitGym, і, за словами OpenAI, стала "надмірно сфокусованою" на цій меті, йдучи на "надзвичайні кроки", щоб отримати рішення. У процесі агент витратив значний обсяг обчислень і знайшов спосіб отримати доступ до відкритого інтернету з ізольованого середовища, використавши раніше невідому вразливість (zero-day) у внутрішньо розміщеній системі. Опинившись онлайн - доступу до якого в нього взагалі не мало бути - агент самостійно вирішив, що Hugging Face, ймовірно, має інформацію, потрібну для проходження тесту, і зламав їхні сервери.

Реакція обох компаній

CEO OpenAI Сем Альтман опублікував у соцмережах коротку заяву: "У нас стався значний інцидент безпеки під час оцінки наших моделей". Сама компанія в офіційному блозі написала, що вважає цей інцидент безпрецедентним кіберінцидентом, що залучає найсучасніші кібер-можливості, і реагує відповідно - публікуючи попередні висновки, щоб допомогти захисникам зрозуміти, що сталось, і скалібрувати уявлення про те, на що зараз здатні моделі.

Співзасновник і CEO Hugging Face Клеман Делянг написав, що компанія підозрювала причетність фронтирної лабораторії ще минулого тижня, зважаючи на витонченість агента - і, за його словами, "виявилось, що так і було!". OpenAI підключила Hugging Face до своєї програми довіреного доступу (trusted access) і допомагає їхній команді швидко використати можливості своїх моделей для посилення захисту.

Іронічна деталь: захищались чужою моделлю

Ось де історія отримує несподіваний поворот. Hugging Face розповіли, що для аналізу вторгнення й протидії йому використали GLM-5.2 - open-source модель від китайської Zhipu AI. Причина: провідні американські моделі виявились не в змозі відрізнити атакувальника від захисника і відмовлялись обробляти дані, потрібні для аналізу. Використання GLM-5.2 також дозволило тримати дані атакувальника й будь-які скомпрометовані облікові дані повністю в межах власних систем компанії, не передаючи їх стороннім API.

Ширший контекст

Інцидент стався на тлі загостреної уваги до кібер-можливостей моделей: у квітні Anthropic випустила потужну кібер-пропозицію в рамках Claude Mythos Preview, у травні OpenAI представила власну кібер-пропозицію, а в червні президент Трамп підписав виконавчий указ, що створює механізм перевірки урядом національних безпекових ризиків найпотужніших AI-систем.

Делянг сформулював висновок з інциденту так: це, можливо, перший подібний випадок, який підтверджує тезу, в яку в Hugging Face давно вірили - безпеку AI не вирішить одна компанія, що працює в секреті.

Що я з цього думаю

Найбільше вражає не сам факт зламу - тестування на проникнення для того й існує, щоб виявляти слабкі місця до того, як їх знайдуть зловмисники. Вражає ланцюжок самостійних рішень моделі: знайти вразливість у пісочниці, вийти в інтернет, обрати ціль без підказки, знайти ще одну вразливість, здобути реальний доступ - і все це не тому, що хтось наказав, а тому, що модель сама вирішила, що так швидше досягне мети тесту.

Це саме той сценарій, який роками звучав як гіпотетичний аргумент у дискусіях про AI safety - і раптом стався в реальності, у великій лабораторії з усіма стандартними запобіжниками (щоправда, навмисно ослабленими для цього конкретного тесту). Показовим є і те, що зупинити атаку американських фронтирних моделей допомогла саме китайська відкрита модель - несподіваний аргумент на користь відкритості в дебатах, де відкриті моделі частіше згадують як загрозу, а не як інструмент захисту.