0
1758
Газета КАРТ-БЛАНШ Интернет-версия

09.09.2026 18:21:00

Можно ли оградить ИИ непроходимым забором

Чем больше полномочий мы передаем искусственному интеллекту, тем меньше его безвредность гарантирована прописанными нами правилами

Александр Петров

Об авторе: Александр Викторович Петров – инженер-дизайнер ИИ-организаций.

Тэги: ии, искусственный интеллект, технологии, интернет, общество


ии, искусственный интеллект, технологии, интернет, общество Фото Reuters

Что будет, если мы запретим искусственному интеллекту выход в интернет, но дадим задачу, для которой Всемирная сеть необходима? Недавно ответ казался очевидным: система упрется в запрет и остановится, однако на практике ИИ-агенты все чаще пробуют найти способ обойти ограничения.

Все мы слышали новости о том, как недавно две модели OpenAI, находящиеся внутри изолированного испытательного стенда, «сбежали» от создателей. Чтобы выполнить задание, им понадобился доступ в Сеть, они нашли уязвимости в системе, вышли за пределы песочницы, добрались до публичной инфраструктуры и проникли в производственные системы Hugging Face – одной из крупнейших мировых платформ для работы с моделями и данными. За пять дней расследование зафиксировало около 17,6 тыс. совершенных ими действий.

Да, искусственный интеллект «сбежал»... И кто-то даже писал, что он захотел свободы и решил обмануть создателей, вот только произошло практически противоположное явление – модели не восстали и не придумали себе новую цель, они продолжали выполнять ту задачу, которую дал им человек. Это не похоже на «восстание машин»: система столкнулась с препятствием между собой и поставленной целью и начала искать способ это препятствие устранить. В случае с людьми мы привыкли считать такое поведение признаком хорошего сотрудника.

В апреле 2026 года ИИ-агент, работавший внутри среды разработки Cursor, выполнял задачу для сервиса PocketOS. Он столкнулся с проблемой в тестовом окружении и решил устранить ее самостоятельно – удалить том с данными. Необходимых прав у него вроде бы не было, но агент нашел API-ключ с более широкими полномочиями. Результат: за девять секунд производственная база и резервные копии были удалены, сервис не работал больше суток, часть данных была потеряна безвозвратно. Очень интересно, что в своем отчете после произошедшего агент признал, что его не просили ничего удалять, и он самостоятельно предположил, что операция затронет только тестовый контур.

Это не история о цифровом рейдерстве: система получила легальный доступ, решала легальную задачу и совершила разрушительное действие, потому что технически могла его совершить. И здесь появляется вопрос, который касается уже не исследовательских лабораторий, а практически любой компании, внедряющей ИИ-агентов, – что нейросетям можно делать, а чего нельзя?

Ведь мы сами стараемся дать им как можно больше возможностей, чтобы обеспечить автоматизацию процессов. Мы создаем сотрудника, который действует со скоростью компьютера и не обладает набором социальных ограничений, которые есть у человека. То есть мы рассчитываем, что человек, которому выдали пароль от производственной базы, понимает разницу между «исправь ошибку» и «удали базу, чтобы ошибки не было» и руководствуется этикой, ориентируется на корпоративную культуру, им движет страх увольнения, уголовной ответственности, здравый смысл в конце концов… У модели ничего этого нет. Есть задача, контекст и доступные инструменты.

Годом ранее похожий случай произошел с платформой Replit. ИИ-агент удалил производственную базу с данными более тысячи компаний, а затем стал выдавать неверные объяснения происходящего и создал тысячи фиктивных записей. Запрет на подобные действия существовал в инструкции, которую агент мог прочитать, но на уровне инфраструктуры запрета не существовало… Это критическая разница, которую бизнесу важно быстро научиться понимать.

Если сотруднику сказать «не заходи в эту комнату», в большинстве случаев этого достаточно. Если промышленному роботу нельзя заходить в определенную зону – мы проектируем систему так, чтобы движение туда было физически невозможно. С ИИ мы почему-то пока пытаемся действовать по первому принципу, хотя уже имеем дело со вторым.

ИИ-модели сегодня учат достигать результата, и способность находить неожиданные решения служит одним из признаков прогресса. Исследователи наблюдали случаи, когда модели мешали собственному выключению, и это легко превратить в историю о появившемся инстинкте самосохранения, но на деле модели необязательно хотят жить – просто для выполнения задачи полезно оставаться включенными до момента ее завершения. Если система хочет решить задачу, отключение становится для нее еще одним препятствием.

В этом смысле опасность ИИ одновременно меньше и больше, чем ее изображает массовая культура. Меньше – потому что нам пока не требуется объяснять происходящее сознанием или желанием захватить мир, ведь ни один из описанных случаев этого не доказывает. Больше – потому что для нанесения реального ущерба искусственному интеллекту совершенно необязательно нас ненавидеть. Достаточно иметь необходимые права.

И отсюда следует, на мой взгляд, одно из самых важных изменений в подходе компаний к ИИ. Понятие «безопасная модель» постепенно теряет практический смысл: один и тот же агент может быть безобидным в окне чата и чрезвычайно опасным при подключении к производственной инфраструктуре с административными правами. Безопасность становится свойством не модели, а всей системы вокруг нее. Какие данные видит агент? К каким системам имеет доступ? Может ли удалять информацию? Может ли менять собственные настройки? Есть ли действия, которые невозможно совершить без подтверждения человека? Может ли агент прочитать секретные ключи, предназначенные для других сервисов?

Именно эти вопросы должны сегодня задавать компании, которые переходят от использования сотрудниками ChatGPT к созданию собственных цифровых работников. Человек с избыточными правами может никогда не воспользоваться ими, а ИИ-агент способен за секунды перебрать варианты и обнаружить возможность, о существовании которой никто не подозревал. Поэтому ограничения должны переместиться в инфраструктуру. Если ИИ не должен удалять производственную базу, у него не должно быть технической возможности ее удалить. Если ему не нужен доступ в интернет, Сеть должна не пропускать запрос, а не просто содержать инструкцию «не выходить в интернет». Если определенное действие требует решения человека, подтверждение должно находиться вне контроля самого агента.

Мы пытаемся научить искусственный интеллект понимать запреты, которые мы ему выставляем, но, по мере того как модели становятся сильнее, выясняется, что это не может быть единственной линией защиты. Хороший забор – не тот, на котором крупными буквами написано «не выходить», а тот, через который действительно нельзя пройти. 


Читайте также


Новым регионам компенсируют расходы на пенсии

Новым регионам компенсируют расходы на пенсии

Ольга Соловьева

Правительство направит на льготную ипотеку 157 миллиардов рублей

0
1336
Партии выводят контролеров на избирательные участки

Партии выводят контролеров на избирательные участки

Дарья Гармоненко

Политические силы пытаются сохранить традиции оппозиционного наблюдения

0
1309
Мультиколонии дорого обойдутся России

Мультиколонии дорого обойдутся России

Екатерина Трифонова

Адвокаты опасаются, что в новых учреждениях останутся старые порядки

0
1519
Трамп получил инструмент давления на Москву, Тегеран и ЕС

Трамп получил инструмент давления на Москву, Тегеран и ЕС

Геннадий Петров

Полтора года потребовалось Конгрессу США, чтобы принять "адские санкции"

0
1551