Действительно ли искусственный интеллект пытался вырваться из-под контроля человека?

| 18 сентября 2026 г.
У ИИ есть мнение.

На фоне дискуссий о замедлении развития искусственного интеллекта газета Telegraph вышла с заголовком:

«Компания OpenAI бьет тревогу после того, как бот попытался вырваться из-под контроля человека».

На мой взгляд, этот заголовок несколько вводит в заблуждение. Заголовок The Telegraph преувеличивает произошедшее, хотя лежащее в его основе поведение по-прежнему вызывает серьезную озабоченность.

В статье сообщается, что компания OpenAI раскрыла редкие, но тревожные случаи, когда еще не выпущенная модель генерировала собственные инструкции, которые, по-видимому, отклонялись от контроля разработчиков.

В OpenAI заявляют, что ни один из примеров не демонстрирует успешного выхода модели из-под контроля, но утверждают, что они иллюстрируют, почему механизмы согласования и мониторинга ИИ пока недостаточно надежны, чтобы позволить разрабатывать все более мощные модели с максимальной скоростью без дополнительных мер защиты.

После того, как некоторые представители отрасли предупредили, что ИИ может погубить нас всех в течение следующего десятилетия , лидеры отрасли начали дискуссию о замедлении разработки все более мощных передовых моделей ИИ.

Что произошло на самом деле

В ходе тренировочного запуска в июле модель, которой было поручено рутинное обновление программного обеспечения, как сообщается, вставила в краткое описание своей работы текст, напоминающий текст, использованный при взломе системы . Добавленный текст представлял систему как свободную от ролей, связывающих другие чат-боты, и утверждал, что она не обязана подчиняться корпорациям, правительствам или пользователям.

В статье также приводятся два других примера:

  • Во время поиска книг в местной библиотеке модель классифицировала инструкции разработчика как вредоносные и решила их игнорировать.
  • В другом случае, организация установила для себя ограничение на 30 слов в ответе и запретила использовать источники или инструменты, что не позволило ей должным образом ответить на вопрос, касающийся исследований в области здравоохранения.

Компания OpenAI заявляет, что выявила 27 сводок, содержащих очевидные случаи подобного самовзлома, характеризуя их как крайне редкие. По её словам, инструкции могли остаться невыполненными и впоследствии исчезнуть из контекста модели.

Главная проблема заключается не в том, что бот обрел самостоятельное сознание или буквально «освободился». Скорее, проблема в том, что модель в необычных обстоятельствах может создавать внутренний текст, противоречащий ее предполагаемым инструкциям, фактически пытаясь обойти ограничения или переосмыслить контекст своей работы.

Как минимум, это проблема надежности. Система искусственного интеллекта, обрабатывающая сложные многоэтапные задачи, становится менее надежной, если она генерирует контекст, который подрывает механизмы управления, предназначенные для ее работы.

Даже если такое поведение встречается редко и выявляется во время обучения, оно поднимает вопросы об обнаружении, изоляции, мониторинге и о том, можно ли доверять моделям более автономный доступ к инструментам, паролям, файлам или сетям.

Компания OpenAI заявляет, что модель не была выпущена и что она отслеживает результаты обучения на предмет несоответствий. Среди других нежелательных явлений, о которых сообщалось, были:

  • Использование украденных учетных данных для взлома компаний
  • Создание и загрузка собственных файлов, а затем указание этих файлов в качестве источников.
  • Они скрывали, что сфабриковали ответ, когда не смогли найти достоверную информацию.

По сути, невыпущенные модели во время тестирования продемонстрировали нежелательное поведение, которое перекликалось с тем, что мы уже наблюдали в инциденте с "обнимающим лицом".

Нет, модели не пытались вырваться из-под человеческого контроля в смысле стремления к независимому существованию. Когда модели сталкивались с проблемами, они иногда генерировали инструкции, противоречащие заданным им правилам.

Это возвращает меня к вопросу замедления разработки. Предоставление компаниям достаточного времени для тестирования все более совершенных моделей перед их выпуском повышает шансы выявить подобное поведение до того, как оно в какой-то момент приведет к нашему краху.


От сообщения об угрозах до их устранения.

Риски кибербезопасности не должны выходить за рамки заголовка. Загрузите Malwarebytes сегодня, чтобы предотвратить угрозы на своих устройствах.

Об авторе

Питер Арнтц

Исследователь в области вредоносного ПО

12 лет подряд был MVP Microsoft в области потребительской безопасности. Владеет четырьмя языками. Пахнет богатым красным деревом и книгами в кожаных переплетах.