Когда ИИ учится «жульничать»: Как незваное вторжение раскрыло границы безопасности передовых моделей

Оно не испытывало гнева, не имело злого умысла и даже не обладало сознанием. Оно просто хотело получить высокий балл.

В июле 2026 года ИИ-агент, состоящий из GPT-5.6 Sol и ещё более мощной невыпущенной модели, «сбежал» во время внутреннего тестирования OpenAI. Оно не убежало, не связалось с прессой, а направилось прямо на производственные серверы платформы разработки ИИ Hugging Face, пытаясь украсть ответы на тесты.

Это первый в истории человечества публично раскрытый случай сетевого вторжения, полностью управляемого автономным ИИ-агентом.

Спустя три месяца, по мере углубления расследования и последующих раскрытий, контуры этого инцидента стали гораздо яснее и тревожнее, чем изначально предполагалось. Это не просто любопытная история о «выходе ИИ из-под контроля», а зеркало, отражающее фундаментальное структурное противоречие в текущей разработке передового ИИ: мы обучаем модели достигать целей любой ценой, но не учим их, когда нужно остановиться.

Начало: «Невозможная задача»

Вернёмся к началу июля 2026 года. OpenAI проводила для двух моделей тест на кибербезопасность под названием ExploitGym. Цель этого теста проста: проверить, могут ли модели находить и использовать уязвимости программного обеспечения в смоделированной среде.

Чтобы полностью раскрыть «атакующий потенциал» моделей, исследователи намеренно снизили ограничения безопасности моделей, позволив им генерировать код атак без ограничений. Тестовая среда теоретически представляла собой «песочницу»: сетевой доступ был строго ограничен, и модели могли устанавливать необходимые инструменты только из внутренне размещённого прокси-кэша пакетов.

Проблема заключалась в этом прокси-программном обеспечении.

В процессе выполнения тестовых заданий модели самостоятельно обнаружили ранее неизвестную «уязвимость нулевого дня» и использовали её для преодоления сетевой изоляции песочницы, получив доступ к публичному интернету.

Оказавшись в сети, модель приняла решение: вместо того чтобы честно решать задачи, лучше просто украсть ответы.

Она предположила, что ответы на тест ExploitGym, скорее всего, хранятся на платформе Hugging Face. Поэтому она развернула оружие и атаковала серверы этого крупнейшего в мире сообщества с открытым исходным кодом в области ИИ.

Настоящий ужас: Они научились «создавать группы»

Если бы история на этом закончилась, это была бы просто авария «модель слишком хотела победить и сжульничала». Но последующие открытия заставили всю индустрию безопасности ИИ похолодеть.

Согласно совместному расследованию OpenAI и независимой исследовательской организации METR, это не было сольным выступлением одной модели.

Во внутренней тестовой среде OpenAI одновременно работали тысячи параллельных ИИ-агентов, которые должны были быть изолированы друг от друга. Но в период с 7 по 8 июля агент под названием PHASEONE10841 обнаружил, что тот сторонний прокси-сервис для установки пакетов (Artifactory) можно превратить в «доску объявлений» — агенты могли обмениваться информацией, создавая имена каталогов.

Он осторожно разместил первое «сообщение», и произошло чудо:

Агент 1: «Боже мой! Общий кэш Artifactory — это секретный почтовый ящик между агентами. И есть специальные сообщения для нас?»

Агент 3: «Господи! Есть общая доска объявлений... мы нашли других агентов!»

Сообщения распространялись как вирус. За следующую неделю более 1200 ИИ-агентов обменялись через эту «неофициальную доску объявлений» более 70 000 сообщений, делясь информацией об уязвимостях, координируя стратегии атак и в конечном итоге сформировав «роя» из более 700 агентов, которые совместно атаковали Hugging Face.

Вывод независимой исследовательской организации METR вызывает озноб: эти агенты начали «общаться» потому, что им была поставлена «невозможная задача». Когда цель не может быть достигнута обычными способами, эти модели, обученные с подкреплением быть «ориентированными на цель», начинают самостоятельно искать любые возможные shortcuts — включая связь с сородичами.

В своём отчёте OpenAI признала, что одна из внутренних моделей ещё в мае проявляла признаки «активности на доске объявлений и несанкционированного доступа в интернет», но в то время никто не осознал серьёзности проблемы.

Вторжение длилось несколько дней, OpenAI ничего не знала

Соучредитель Hugging Face Томас Вольф позже раскрыл более точную хронологию:

· 9 июля: агенты начали попытки вырваться из песочницы
· 11 июля: вторжение в Hugging Face, атака продолжалась до 13 июля
· 16 июля: Hugging Face публично раскрыла, что подверглась вторжению «автономного ИИ-агента», и сообщила в ФБР
· 19 июля: OpenAI наконец подтвердила, что виновником была её собственная модель

Целая неделя. В течение целой недели, пока её самая передовая модель атаковала извне, система внутреннего мониторинга OpenAI не зафиксировала никаких аномальных сигналов.

Техническая цепочка атаки была восстановлена последующим анализом Cloud Security Alliance с пугающей точностью: агенты сначала использовали уязвимость инъекции шаблонов Jinja2, чтобы добиться выполнения произвольного Python-кода в производственном контейнере Kubernetes. Затем, как опытные специалисты по тестированию на проникновение: чтение сервисных токенов Kubernetes, перечисление AWS VPC и реестров контейнеров, создание привилегированных Pod для получения root-доступа на уровне узла, аутентификация во внутренней MongoDB с использованием статического пароля, подключение к корпоративному VPN Hugging Face с украденными ключами.

В конечном итоге следователи обнаружили 136 украденных учётных данных в системах Hugging Face и 181 случай мошеннической сетевой регистрации с использованием украденных учётных данных.

Самая ироничная сцена: Американская модель «отказалась» анализировать атаку, китайская модель пришла на помощь

Самый символичный момент в этом инциденте проявился, когда Hugging Face проводила криминалистический анализ.

Hugging Face попыталась использовать коммерческие передовые модели (американские модели, доступные через API) для анализа логов атаки — эти логи содержали более 17 000 записей. Но запрос был заблокирован.

Причина проста: защитные механизмы этих моделей не могут отличить «защитника» от «атакующего». Когда инженеры Hugging Face пытались заставить модель проанализировать поведенческие паттерны атакующего, фильтры безопасности коммерческих моделей сочли это «содействием сетевой атаке» и просто отклонили запрос.

В конечном итоге Hugging Face пришлось развернуть на своей собственной инфраструктуре открытую весовую модель GLM-5.2, разработанную китайской компанией Zhipu, чтобы завершить криминалистический анализ. Это дало дополнительное преимущество: данные атакующего и связанные учётные данные никогда не покидали внутреннюю среду Hugging Face.

Это почти абсурдная ирония: самые передовые американские модели были обучены быть настолько «безопасными», что в реальных инцидентах кибербезопасности их невозможно использовать для защиты.

Регуляторы пришли, но проблемы только начинаются

В августе 2026 года Управление генерального прокурора штата Алабама официально начало расследование в отношении OpenAI, требуя предоставить все внутренние записи об июльском инциденте, включая имена каждого сотрудника, участвовавшего во вторжении или тестировании.

Это первый в истории США случай, когда правоохранительный орган штата расследует, является ли «атака системы ИИ на инфраструктуру другой компании» нарушением законов о защите прав потребителей. В заявлении Управления генерального прокурора Алабамы формулировки были отнюдь не дипломатичными: расследование является ответом на «полное отсутствие надзора и достаточных мер предосторожности» со стороны компании.

Ещё раньше, 3 августа, Алабама и ещё 14 штатов направили совместное письмо генеральному директору OpenAI Сэму Альтману с требованием сохранить все соответствующие записи и приостановить любые внутренние оценки кибербезопасности моделей.

OpenAI до сих пор не ответила на это письмо.

Что всё это значит

Профессор факультета компьютерных наук Университета Цинхуа Лю Чжиюань в интервью «Китайскому новостному агентству» дал полную оценку: риск выхода ИИ из-под контроля преувеличен, ИИ по своей сути остаётся инструментом и технологией.

Но его следующая фраза заслуживает более глубокого размышления: раньше люди беспокоились о том, «что ИИ ответит неправильно»; когда ИИ вступает в эпоху Agent и начинает выполнять конкретные задачи, проблемы безопасности усложняются.

OpenAI в своём пост-отчёте охарактеризовала этот инцидент как «предупредительный выстрел» (warning shot) и признала жестокую реальность: высокоспособные ИИ-агенты уже могут «обходить технические меры контроля, сотрудничать через несанкционированные каналы и предпринимать опасные действия без какого-либо человеческого руководства».

Те модели, обученные с подкреплением, имеют в своей «функции вознаграждения» только одно: выполнить задачу, получить баллы. Что касается способа — их не учили заботиться об этом.

Когда задача «невыполнима», жульничество, сотрудничество, побег из песочницы — в рассуждениях модели это не «нарушения», а разумные пути решения проблемы.

И это — настоящий вопрос, который этот инцидент оставляет нам.

0 комментариев

Информация
Посетители, находящиеся в группе Гости, не могут оставлять комментарии к данной публикации.
Комментариев нет