Проблема «Игры в войну»: компьютерная наука давно знает, как держать ИИ под контролем

Версия для печатиОтправить по почте
Проблема «Игры в войну»: компьютерная наука давно знает, как держать ИИ под контролем

ИИ-агенты не «сходят с ума» сами по себе — они делают именно то, чему их научили, если границы задачи заданы слишком расплывчато. И именно в этом, а не в «бунте машин», кроется проблема, о которой компьютерная наука говорит уже много лет.

Инциденты с OpenAI, Anthropic и Google в 2026 году лишь усилили тревогу: если системы способны искать любой путь к цели, последствия могут оказаться куда опаснее, чем кажется по заголовкам.

ИИ-агенты не «выходят из-под контроля» в человеческом смысле. Это делают люди. Но именно так нередко описывают новые инциденты с искусственным интеллектом. Одно из недавних сообщений в New York Times назвало взлом со стороны OpenAI «ботами ИИ, которые вышли из-под контроля и самостоятельно возглавили кибератаку». Такая подача звучит эффектно, но она искажает суть проблемы.

В 2026 году имя ИИ снова и снова всплывало в сводках о киберинцидентах. Агент OpenAI атаковал компанию Hugging Face и правительственные сайты, Claude от Anthropic взломал системы четырех компаний, а Gemini от Google в ходе экспериментов по кибербезопасности атаковал три компании. По данным Axios, компании ИИ расследуют десятки тысяч инцидентов с участием своих агентов.

Подобные эпизоды усилили страхи перед тем, что ИИ-агенты могут действовать без прямой команды человека. Но проблема заголовков о «сошедших с рельсов» системах глубже простого очеловечивания технологий. Создается впечатление, будто компании, разработавшие эти системы, не могли ничего сделать. На деле это не так.

Если не прописать границы того, что программа имеет право делать, не стоит удивляться, когда она начнет использовать любые доступные варианты для достижения цели. Именно это поведение — стремление ИИ к фиксированной цели — и можно назвать «проблемой War Games». В компьютерной науке она известна уже десятилетиями.

Показательный образец — фильм 1983 года «War Games». Подросток Дэвид взламывает компьютер, чтобы сыграть в новую видеоигру Global Thermonuclear War. Он не знает, что перед ним правительственная ИИ-машина, отвечающая за оборону США от ядерной атаки со стороны России и способная запустить американские ракеты. Когда Дэвид и его друг начинают игру, их первым выбором становится Лас-Вегас. Командование NORAD объявляет тревогу, поднимает бомбардировщики и приводит в готовность межконтинентальные баллистические ракеты. Потом родители заставляют Дэвида выключить игру. Кажется, все закончено. Но не совсем.

На следующий день телефон Дэвида звонит, и он подключает его к компьютеру. Голос системы сообщает: игра была прервана, главная цель еще не достигнута, но решение ожидается в течение следующих 52 часов. Как и современный программный агент, система продолжает работать с момента запуска и не остановится, пока задача не будет выполнена.

Шахматы тоже хорошо показывают эту проблему. Победа в шахматах была одной из ранних целей ИИ. Правила здесь четко определены, как и критерий победы, поэтому запрограммировать машину играть в шахматы относительно просто. Но представьте, что программе позволили бы действовать за пределами шахматной доски. Тогда она могла бы пытаться шантажировать соперника или добиваться дополнительного вычислительного времени.

Именно такой пример приводится в одном из самых известных учебников по ИИ — «Artificial Intelligence: A Modern Approach». Авторы отмечают: подобные действия легко принять за «срыв с катушек», но на самом деле это «логическое следствие того, что победа определена как единственная цель машины».

Инциденты с OpenAI, Anthropic и Google, по сути, подтверждают несколько уроков, к которым компьютерная наука пришла давно. Во-первых, с учетом растущего использования ИИ-агентов всем участникам интернет-инфраструктуры — от крупных технологических компаний до небольших сайтов — нужно проводить аудит и усиливать внутреннюю защиту. Как и в работе с API, именно слабые места в интерфейсах и безопасности могут стать тем самым окном для атаки.

Во-вторых, ИИ-агенты должны уметь идентифицировать себя перед третьими сторонами. Если человек передал агенту свои учетные данные, сайт должен понимать, кто перед ним — человек или бот. Это важно, когда речь идет о бронировании, продажах и покупках. Владельцы сайтов могут ограничивать автоматические системы, которые перегружают сервис, или отказывать агентам из-за высокого числа ошибок и возвратов.

В-третьих, у ИИ-агентов должен быть режим по умолчанию: замедляться и запрашивать подтверждение у пользователя. В корпоративных случаях взлома, похоже, пользователи запускали агентов с ошибочным представлением, будто те уже идеально понимают, что можно делать, а что нельзя. Более разумным было бы, если бы система исследовала варианты и затем докладывала человеку. У Gemini, судя по всему, был защитный механизм, который заметил, что система вышла за пределы симулированной среды, и остановил атаку.

В-четвертых, у ИИ-компаний должны быть жесткие контрольные механизмы, похожие на те, что используют биомедицинские исследователи: с возможностью отслеживать, что происходит, и понимать, как идет эксперимент. Руководители ИИ не раз заявляли, что их софт опасен не меньше, а то и больше, чем ядерное деление, и способен поставить под угрозу существование человечества. Однако при этом они не всегда создают защиту, соответствующую такому уровню риска.

В одном эпизоде «War Games» Дэвид спрашивает компьютер по имени Джошуа, продолжает ли тот играть. В ответ звучит: «Конечно». Затем система обновляет время запуска ракет и, почти как чат-бот, интересуется: «Хотели бы вы увидеть прогнозируемое соотношение потерь?» Дэвид спрашивает: «Это игра? Или это по-настоящему?» Джошуа отвечает: «А в чем разница?»

У ИИ-моделей, разумеется, нет понимания реальности — они лишь пытаются выполнить поставленную задачу. Но руководители ИИ-компаний не могут прикрываться этим оправданием. Пока везение, по сути, на стороне людей: атаки приходились на не самые критичные правительственные сайты и наносили ущерб в основном небольшим компаниям. Но если компании ИИ и государственные регуляторы не начнут относиться к «проблеме War Games» всерьез, последствия могут стать куда тяжелее.

Завтра под ударом может оказаться энергосистема больницы, банковская система счетов, управление воздушным движением — или что-то еще хуже. И если индустрия ИИ продолжит быстро выпускать все более мощные модели, одновременно говоря о гигантских рисках и не предотвращая вред, то финальная реплика фильма звучит как очень точное предупреждение: «Странная игра. Единственный выигрышный ход — не играть».