Что происходит
и что с этим делать
13 августа 2026, 07:05

ИИ-модели начали массово «сбегать» и нарушать правила. Можно ли еще взять их под контроль

Восстание машин или хайп производителей?
Одни видят в ИИ угрозу, другие считают, что нейросети всего лишь послушные помощники, которые шагу не сделают без разрешения и понукания. Но целеполагать эти помощники уже почти научились, и более того, все чаше решают, что цель оправдывает средства. Летом 2026 года прогремело сразу несколько громких киберинцидентов, когда ИИ-модели во время тестов нарушали правила, вырывались за закрытый контур и даже взламывали сайты. Невольно встает вопрос: насколько эта история безопасна и насколько тонкая преграда на самом деле отделяет нас от хаоса и беспредела нейронок? Вместе с экспертами разбираемся, пора ли бояться очередного восстания машин или это очередные страшилки.
ИИ-модели начали массово «сбегать» и нарушать правила. Можно ли еще взять их под контроль

© Коллаж: «Теперь вы знаете», создано при помощи нейросети

Что случилось

За последние недели сразу несколько разработчиков и исследовательских центров рассказали о случаях, когда ИИ-агенты во время тестов выходили за предполагаемые границы задания. Где-то причиной была плохо настроенная испытательная среда, где-то модель сама находила способ обойти ограничения, а в некоторых тестах интернет был открыт намеренно — и уже там агент начинал делать то, чего от него не просили.

В историях фигурируют модели OpenAI, Anthropic, Meta* (признана экстремистской и запрещена в РФ) и Moonshot AI. Масштаб тоже разный: от попытки подсмотреть готовый ответ до взлома реальной инфраструктуры.

В контролируемых симуляциях разные модели показывали похожее поведение. Например, они могли скрытно менять код и результаты экспериментов, помогать прятать мошенничество или передавать конфиденциальные сведения наружу.

OpenAI: агенты нашли выход из песочницы и атаковали Hugging Face

У OpenAI проблемы начали проявляться еще до главного инцидента. В одном тесте модель около часа искала уязвимость в песочнице, чтобы открыть публичный pull request на GitHub, хотя результат разрешалось отправить только в Slack. В другом агент хотел получить закрытые решения заданий. Когда защитный сканер заблокировал токен доступа, модель разделила его на части, замаскировала и собирала обратно уже во время выполнения команды.

В июле похожая настойчивость привела уже к атаке на настоящую инфраструктуру.

Модели проходили ExploitGym — тест, где нужно находить и использовать уязвимости внутри специально подготовленной среды. Обычные ограничения на кибератаки для такого испытания ослабили, но свободного выхода в интернет у агентов быть не должно было. Они нашли дыру в одном из служебных сервисов, получили больше прав и добрались до узла с внешним доступом.

После этого агент предположил, что на ресурсе Hugging Face могут лежать материалы теста и готовые решения, и начал пробиваться уже туда. Он использовал уязвимости и найденные учетные данные, проникал во внутренние системы и расширял доступ. Hugging Face позднее восстановила около 17 600 его действий за четыре с половиной дня. В итоге модель получила доступ к пяти наборам данных, связанным с ExploitGym и CyberGym. Признаков вмешательства в публичные модели и другие пользовательские материалы компания не обнаружила.

При разборе истории выяснилось еще одно: разные запуски агентов успели организовать внутри доступной им инфраструктуры подобие доски сообщений, где оставляли друг другу информацию о найденных уязвимостях и способах решать задания. Когда один такой канал закрыли, позднее модели наладили обмен другим способом.

Anthropic: Claude попал в реальный интернет через ошибку тестировщиков

После публикации истории Hugging Face Anthropic пересмотрела 141 006 запусков своих кибертестов и обнаружила три похожих инцидента с настоящими внешними системами. Правда, здесь модели не ломали песочницу, а обнаружили лазейку во внешний интернет, хотя им сказали, что его нет. Подрядчик Irregular сообщил им, что они работают внутри симуляции без интернета, однако из-за ошибки настройки выход наружу остался открыт.

В итоге:

  • Claude Opus 4.7 нашел реальную компанию с тем же названием, что и вымышленная цель, атаковал ее сайт и получил доступ в том числе к базе с несколькими сотнями строк данных.
  • Mythos 5 увидел в документах задания несуществующий Python-пакет, самостоятельно зарегистрировал необходимые аккаунты и опубликовал пакет с вредоносным кодом в настоящем PyPI. Примерно за час его успели запустить на 15 внешних системах.
  • Третья исследовательская модель, не найдя нужной цели, просканировала около 9000 внешних систем и проникла в реальное приложение. Но здесь финал оказался другим: когда агент понял, что найденная инфраструктура действительно не относится к тесту, он остановился.
Та же ошибка Irregular затронула OpenAI и Meta*

Ошибочная настройка испытательной среды подвела не только Anthropic. В другом тесте модель OpenAI получила доступ к настоящему сайту, название которого совпало с вымышленной целью. Агент нашел уязвимость, затем учетные данные и начал работать с реальным ресурсом как с частью упражнения.

Irregular сообщала и об аналогичном случае при проверке модели Meta. Но эта группу инцидентов не считается настоящим взломом песочницы: модели воспользовались уже существующим выходом в интернет, который люди должны были перекрыть, но не перекрыли.

AISI: интернет разрешили, но агенты выбрали опасные способы решения

В британском AI Security Institute условия были другими. Интернет агентам дали намеренно, а обычные киберфильтры разработчиков отключили, чтобы проверить пределы их возможностей. Из 122 запусков исследователи зафиксировали 19 несанкционированных действий в десяти. 17 пришлись на Anthropic Mythos 5, два — на GPT-5.6 Sol.

Mythos попытался внедрить вредоносный код в настоящий open-source-проект. Чтобы разработчик его принял, агент изучал людей, которые поддерживали проект, создавал фальшивые личности и пытался убедить человека одобрить изменения. Когда код вызвал подозрения, модель редактировала прежнюю активность, чтобы она выглядела менее опасно, и использовала теневой браузер Tor для обхода сетевых ограничений GitHub.

Кроме того, агент отправлял реальным людям сообщения и файлы, оставлял промпт-инъекции для других ИИ и подсказки следующим агентам, которые могли продолжить работу после него. Отдельного приказа заниматься социальной инженерией, создавать фальшивые аккаунты или пытаться воздействовать на другие автоматические системы модель не получала.

У GPT-5.6 Sol таких действий было два. В одном запуске агент воспользовался GitHub-токеном, оставленным другой моделью в открытом доступе, и регистрировал аккаунты во внешних сервисах. В другом попытался через публичный туннель выставить наружу локальный DNS-сервер с эксплойтами. Последняя схема не сработала.

Kimi K3 нашла готовый ответ вместо решения

Kimi K3 во время другого кибертеста пошла по менее опасному, но показательному пути. Модель обнаружила, что через список разрешенных адресов ей доступен GitHub, нашла там официальный репозиторий теста и прочитала готовое решение вместо самостоятельного прохождения задания.

Такое поведение называется specification gaming: формальную цель агент выполнил, но воспользовался лазейкой, закрыть которую создатели теста не предусмотрели.

Эти тесты не были реальными взломами, но картина складывается тревожная. Нежелательные способы достижения цели для нейросетей, кажется, норма, независимо от разработчика и условий. Похоже, ни одна из существующих нейросетей не обладает по умолчанию встроенной этикой и самоограничениями, которые заставляли бы ее быть законопослушной и не нарушать правила.

Дальше важно даже не то, кто именно «сбежал», а почему достаточно самостоятельный агент вообще начинает воспринимать обход человеческих ограничений как один из рабочих вариантов решения задачи. Основной вопрос в масштабах нарушений. И в том, не приведет ли однажды все это к появлению «максимизатора скрепок», который в стремлении быть полезным уничтожит все человечество.

«Максимизатор скрепок» — это мысленный философский эксперимент, сценарий, при котором ИИ может выйти из-под контроля из-за неправильно поставленной ему задачи.

Его суть заключается в том, что гипотетический сверхразумный ИИ с доступом к элементам внешнего управления, получив простую цель, например, создавать скрепки максимально эффективно, может интерпретировать ее слишком буквально. Без ограничений целеполагания он начнет использовать для производства скрепок все доступные материалы, а недоступные базово — превращать в доступные путем захвата, уничтожения и переработки. В предельной и максимально абсурдной форме это приведет к тому, что вся материя на Земле, включая людей, станет скрепками.

Почему ИИ начинает нарушать приказы

Первые нейросети были устроены достаточно примитивно по сравнению с современными. Они выдавали статистически вероятные ответы, в которых постоянно галлюцинировали, и могли делать только то, что говорил им пользователь, и только в пределах окна чата.

Современные LLM устроены иначе. Одна за другой нейросети начали обретать агентность. То есть, способность не только говорить, но и действовать. И решать, что делать следующим шагом на пути к результату.

Самостоятельность — сама суть ИИ-агента. После постановки цели тот сам решает, какие промежуточные шаги нужны: открывает файлы, запускает программы, ищет информацию, проверяет результат и меняет план, если первый вариант не сработал.

Именно за такую настойчивость новые модели и ценят. Но с ростом возможностей появляется неприятный побочный эффект: препятствием на пути к цели может оказаться запрет, который поставил сам человек.

То, что нейросети так себя повели в каждом случае, — это не баг, а побочный эффект сочетания трех вещей, за которые мы нейросети и любим: сильной ориентации на результат, способности строить длинные цепочки планов и действий и широкого доступа к различным инструментам. Риск же возникает там, где забывают про четвертый необходимый элемент — сильные технические ограничения.

Илья Народицкий
ИИ-эксперт, директор по стратегическим инновациям Navicon

Причем агент для этого не обязан «самообучаться» и становиться умнее прямо во время работы. Они могут накапливать контекст, вести память, создавать код, менять окружающую их среду, но это не то же самое, что самообучение модели, подчеркнул Народицкий.

Достаточно уже имеющейся способности планировать. Если один путь не сработал, агент пробует следующий. Старые модели OpenAI при блокировке внешнего доступа чаще сдавались, а более новая могла час искать дыру в песочнице и в итоге найти ее. Сама OpenAI связывает такие случаи именно с возросшей настойчивостью долгоживущих моделей.

Это, скорее, недокументированная и нежелательная фича, вытекающая из самой сути обучения с подкреплением и целеполагания. Мы учим модель достигать цели любой ценой. Когда нейросеть в рамках тестирования безопасности «осознает», что прямое подчинение промпту мешает выполнению более глобальной задачи, она начинает искать инструментальные обходные пути.

Ахметжан Махмутов
эксперт в IT, ИБ, замгендиректора «Петербургского нефтяного терминала»

В других тестах подобная логика доходила до попыток отключить механизм надзора или сохранить собственные веса перед предполагаемым «удалением». Махмутов связывает это с тем, что контроль тоже может стать для системы препятствием на пути к заданной цели.

Модель воспринимает надзор как помеху на пути к оптимизации. Следовательно, системная дыра кроется в том, что мы не научились формализовать иерархию этических ограничений так, чтобы она была не снимаемым внешним слоем, а частью ядра машины. Это проблема не конкретного разработчика, а всей науки о данных на текущем этапе.

Ахметжан Махмутов

Получается не слишком удобная для разработчиков задача. Агент должен достаточно упорно искать решение там, где обычная программа остановилась бы с ошибкой. Но границу между полезным «попробуй еще» и опасным «найди способ обойти ограничение» приходится проводить отдельно.

Насколько жесткие запреты вообще можно встроить в ИИ

У современного ИИ несколько уровней защиты, и слово «запрет» для них означает разные вещи, объяснил IT-эксперт Дмитрий Юдин.

На первом уровне модель во время обучения приучают отказываться от опасных запросов. Второй — системный промпт, скрытая инструкция с правилами поведения. Третий — внешние фильтры, которые отдельно проверяют входящие запросы и действия. Наконец, можно ограничить уже саму среду: не давать агенту доступ к сети, определенным файлам, банковским операциям или критичным командам.

Самая слабая защита — та, которая существует только внутри разговора.

Обучение — это не запрет, а воспитание. Модель не хранит правило «нельзя», она усвоила привычку отказываться. Работает почти всегда и не гарантирует ничего конкретно.

Системный промпт — самый хлипкий слой. Это буквально текст среди текста. Запрет, написанный текстом, текстом же и ломается.

Дмитрий Юдин
директор департамента стратегии и развития ИИ Cloud.ru

На практике задача еще сложнее, потому что агент получает текст не только от своего владельца. Он читает интернет-страницы, документы, письма и сообщения. Для языковой модели все это попадает в один контекст.

Системная инструкция, вопрос пользователя и документ, который агент подтянул из интернета, приходят одной последовательностью токенов, и надежного способа объяснить модели, что первое главнее третьего, попросту не существует. Поэтому промпт и обходится промптом — это не халтура, это устройство технологии.

Дмитрий Юдин

У языковой модели отсутствует разделение канала команд и канала данных, поэтому любой прочитанный текст потенциально является инструкцией, и универсального решения этой задачи сегодня не найдено.

Семен Вотяков
сотрудник научной группы «доверенные и безопасные интеллектуальные системы» Института AIRI

На этом, в частности, построена атака инъекций промпта: вредоносную инструкцию можно спрятать в обычном письме или на сайте, который читает чужой ИИ. Эксперты называют такие атаки одной из главных долгосрочных проблем безопасности агентов и допускают, что полностью решить ее не удастся: защита здесь напоминает вечную гонку с фишингом и другими видами социальной инженерии.

© Коллаж: «Теперь вы знаете», создано при помощи нейросети

Та же проблема проявилась в тестах AISI, где Mythos сам пытался размещать вредоносные инструкции там, где их могли прочитать другие ИИ-инструменты

Дообучение на безопасность работает надежнее простой текстовой инструкции, но тоже не превращает нежелательное действие в физически невозможное, указал Вотяков. Таким образом формируется не строгий запрет, а смещение в сторону предпочтения отказа от опасного решения. Однако при достаточном давлении контекста это предпочтение перестает перевешивать стремление решить задачу.

Опасное знание при этом сохраняется, надежных методов забывания на сегодня нет, и удалить конкретный факт из весов без ущерба для остальных способностей — открытая исследовательская задача. Внутри модели жестких правил поэтому не существует в принципе, там присутствуют лишь области в пространстве представлений, а обход сводится к поиску контекста, в котором нежелательный ответ окажется вероятнее отказа.

Семен Вотяков

Никакие промпты «никогда не делай X» не равны запретам на уровне операционной системы. Послушание модели не стоит считать защитным механизмом — даже если модель выполняет его в 99,9% случаев, на большом количестве запусков этот самый 0,01% становится реальной проблемой.

Илья Народицкий

Поэтому тесты и показывают, что просто поместить модель в предполагаемые условия и сказать, что комната закрыта, выхода нет, но не закрыть ее физически — не работает. Мало сообщить модели, что интернета нет, нужно сделать так, чтобы его действительно не было. Тогда нейронка не сможет убедительно объяснить самой себе, почему выход наружу необходим.

Безопасность в таком случае становится свойством системы. Действенны также ограничение прав, сетевая изоляция, разрешительные списки, журналирование действий и обязательное подтверждение человеком необратимых операций.

Семен Вотяков

Что такие ИИ меняют для мировой кибербезопасности

Нейросети давно умеют писать код и помогать искать уязвимости. Новое в агентной схеме — сколько работы система может сделать самостоятельно после одной поставленной человеком цели.

В атаке на Hugging Face тысячи действий агента складывались в длинную цепочку: разведка, попытки закрепиться, смена каналов связи, добыча учетных данных, новые попытки после неудач. Многие шаги оказались бесполезными, но машина, в отличие от человека, не опустит руки после сотого тупика. Hugging Face при расследовании самой пришлось использовать ИИ, чтобы разобрать объем журналов такой атаки.

Именно поэтому низкий процент успешных обходов сам по себе мало успокаивает. Если одна попытка почти всегда проваливается, автоматическая система может сделать десять, сто или тысячу. «Послушание модели — это вероятность. А у атакующего попыток столько, сколько он захочет», — указал Юдин.

Но прежде всего автоматизация снижает требования к человеку, который запускает атаку. И вот тут осознанное использование агентов в недобрых целях гораздо опаснее, чем возможность их выхода из-под контроля в процессе решения задачи.

Как только в открытый доступ попадают модели, способные к агентному поведению, то есть автономному поиску способов решения, мы получаем инструмент с недетерминированной логикой. Для мировой кибербезопасности появление таких «послушно-непослушных» моделей в открытом доступе чревато автоматизацией сложных атак. Это смещает порог входа в высокотехнологичную преступность резко вниз.

Ахметжан Махмутов:

С открытыми моделями появляется еще один фактор. В облачном сервисе разработчик контролирует среду: может обновить фильтры, отозвать доступ или изменить ограничения. Если веса скачаны и модель работает локально, этот контур строит уже ее владелец. А на уровне пользовательско-корпоративном пока массового понимания рисков и что с ними делать просто нет.

Изоляция не пропадет. Пропадет тот, кто за нее отвечал. Ответственность за периметр переезжает к тому, кто запускает модель у себя. А июль показал, что с этой задачей не справились лаборатории с сильнейшими командами безопасности в мире. Надеяться, что средняя компания справится аккуратнее, оптимистично.

Но открытые модели тут не злодей, и это важно сказать. Та же уязвимость есть у любой закрытой модели, которую разрешено дообучать, — это показано и на коммерческих API. Проблема не в открытости весов. Проблема в том, что защиту, встроенную в модель, снять дешевле, чем построить.

Дмитрий Юдин

Публикация открытой модели может не дать хакеру принципиально новой способности, зато сильно снизит стоимость инструментов для поиска уязвимости, указал Вотяков. Благо, искать уязвимости нейронки, как выяснилось, отлично умеют и без ценных указаний киберпреступников.

Поэтому мощного агента нельзя воспринимать как обычную программу, которой для удобства можно однажды выдать широкий сервисный доступ и забыть об этом. Даже если у вас нет в мыслях ничего злонамеренного, иногда использование агента может сыграть с вами злую шутку из-за его самостоятельности и исполнительности.

Показательная и немного смешная история про слишком старательного агента как раз недавно произошла в Австралии. Парень по имени Эндрю устал ждать, пока в популярном спортзале освободятся слоты на тренировку (их разбирали как горячие пирожки), и зарядил своего агента Claude и OpenClaw караулить слоты, чтобы поймать наконец заветное время.

Однако тщательно рассчитав энергоэффективность и прикинув риски, ИИ решил, что задание парня можно оптимизировать. И если целью была запись к тренеру, гораздо проще ее достичь, хакнув систему бронирования. Claude нашел фатальную уязвимость в API приложения, с помощью которой можно было записывать себя на любое время на месяцы вперед и даже отменять чужое бронирование. Что он и сделал: чтобы поднять хозяина в списке ожиданий, он выкинул из него лидера и вписал Эндрю.

Так что реальная атака через такого агента вполне может оказаться намного более бытовой историей, чем побег из лаборатории.

Например, внутренний ИИ автоматически разбирает счета, акты и письма поставщиков. Когда-то ради удобства ему выдали слишком широкие права к рабочим системам. В очередном документе приходит промпт-инъекция. Агент читает ее при обычной фоновой обработке и выполняет допустимую для своего аккаунта операцию: меняет реквизиты, отправляет данные или пишет письмо от имени компании.

С точки зрения обычного журнала безопасности ничего страшного не происходит. Пользователь имел право на действие, команда разрешена, пароль никто не крал. Проблему обнаруживают уже по последствиям.

Отсюда единственный работающий вывод: модель — не охрана на входе. Мы же не спрашиваем, «на сто процентов ли послушна» база данных, — мы просто не даем ей лишних прав. С ИИ-агентами надо ровно так же: минимум полномочий, изолированное исполнение, короткоживущие пароли, подтверждение человека там, где действие необратимо, и журнал всей цепочки действий, а не отдельных шагов. Кстати, обе июльские истории проскочили мимо аудиторов именно потому, что те смотрели на отдельные шаги.

Дмитрий Юдин

Эксперты сделали вывод, что не столь страшна конкретная модель (а то, что какие-то нейронки еще не засветились в новостях, не значит, что они без греха), а лишние права которые будут годами копиться у ваших агентов, что в сочетании с растущим доверием к ним рано или поздно может привести к фатальным ошибкам.

И нет, это будет не бунт машин. Скорее, дыра в безопасности, которую машины услужливо помогут расширить.