Фото Reuters
Новости о том, как ИИ-агенты совершают несогласованные с создателями действия разной степени разрушительности, регулярно всплывают в СМИ. Но во всех этих историях есть одно важное обстоятельство: машины не восстают против людей и не придумывают себе новую цель – они просто слишком настойчиво выполняют ту, которую им дали. Тем не менее разговоры о том, не уничтожит ли ИИ человечество, в последнее время звучат все чаще…
Не так давно один из руководителей направления согласования целей ИИ с общечеловеческими целями и ценностями в Anthropic Эван Хубингер заявил, что оценивает вероятность гибели человечества из-за ИИ в ближайшее десятилетие выше 10%. И вот в начале сентября американский сенатор Берни Сандерс и конгрессмен Грег Касар внесли законопроект, предлагающий запретить разработку искусственного сверхинтеллекта и приостановить создание наиболее продвинутых ИИ-систем до появления механизмов, гарантирующих их безопасность. Кажется, самое время спросить: чего именно мы боимся?
Наиболее популярный сценарий выглядит примерно так: мы создаем супер-ИИ, который приобретает собственные цели и в какой-то момент обнаруживает, что люди мешают их достижению. Дальше возможны варианты от подчинения человечества до его уничтожения. Интересно, что при этом Международный доклад по безопасности ИИ 2026 года, подготовленный более чем сотней экспертов под руководством Йошуа Бенджио, признает сценарии потери контроля возможными. Но, на мой взгляд, мы слишком быстро перескакиваем через один принципиальный вопрос. Зачем машинам нас уничтожать и откуда вообще у ИИ должно появиться собственное «зачем»?
Когда-то в аспирантуре Института системного анализа РАН я занимался моделированием целеполагания интеллектуального агента. В основе нашего подхода лежали в том числе идеи культурно-исторической психологии, где важно различие между значением и личностным смыслом. Современные языковые модели владеют огромными массивами данных, знают кучу терминов, но личностный смысл – это другое. Он возникает из отношения цели к мотиву, а мотив – из потребности. Условно: я хочу есть, поэтому поиск еды имеет для меня смысл. Цель отвечает на вопрос «что сделать?», но всегда есть вопрос «зачем мне это нужно?».
У ИИ собственного «зачем» нет, цель приходит к нему извне. Конечно, кто-то может возразить: ИИ уже не раз пытался препятствовать собственному выключению! Здесь легко увидеть зарождающийся инстинкт самосохранения, но есть более простое объяснение – вы поставили ИИ задачу, и ему нужно оставаться включенным, чтобы решить ее.
В этом и заключается настоящая проблема согласования целей ИИ с человеческими намерениями. Она знакома любому руководителю без всякого искусственного интеллекта. Поставьте подразделению KPI «максимальное количество закрытых обращений», и через некоторое время сотрудники научатся закрывать обращения быстрее, не обязательно решая проблемы клиентов. При этом никто не восстает и не уничтожает компанию – люди просто оптимизируют тот показатель, который им дают.
Поэтому я не уверен, что главный риск состоит в том, что однажды ИИ решит: «Люди мне больше не нужны» – чтобы посчитать кого-то лишним, сначала требуется собственное «зачем»… Но тот факт, что у ИИ его нет, не означает, что опасности нет, просто кроется она в том, как мы сами постепенно передаем машине целеполагание.
Все логично: сначала ИИ помогает человеку собрать информацию. Потом предлагает варианты решения. Затем выбирает оптимальный вариант. Следующий логичный шаг – разрешить ему самому определять критерии оптимальности, потому что он обрабатывает больше данных и делает это быстрее… После этого человек остается в цепочке главным образом для того, чтобы нажать кнопку «подтвердить».
Проблема постепенной утраты человеческого влияния уже изучается. Согласно материалам исследования Gradual Disempowerment («Постепенная утрата влияния»), представленного в 2025 году на одной из крупнейших конференций по машинному обучению ICML, исследователи показывают, что для экзистенциального риска вовсе не требуется внезапный скачок возможностей или восстание сверхинтеллекта – люди могут просто постепенно передавать машинам все больше решений, потому что это быстрее, дешевле и эффективнее.
Представим организацию, в которой искусственный интеллект лучше человека составляет бюджет, нанимает сотрудников, определяет ассортимент, устанавливает цены и выбирает стратегию. Сначала руководитель проверяет каждое решение. Потом – только необычные. Еще через несколько лет человеческая компетенция начинает исчезать: зачем тратить годы на обучение тому, что система выполняет лучше? Формально последнее слово по-прежнему остается за человеком. Фактически его контроль уже ничего не значит, потому что он больше не способен самостоятельно оценить предложенное решение. Именно так человек действительно может стать лишним. Но приговор вынесет не машина.
Мы сами можем построить мир, где люди станут слишком медленными, дорогими и неэффективными, а затем обнаружить, что вместе с исполнением передали ИИ еще и выбор целей. Поэтому вопрос, смогут ли люди ужиться со сверхинтеллектом, кажется мне поставленным немного неправильно. Вполне возможно, что смогут. Но для этого придется определить границу, которую нельзя передавать машине независимо от того, насколько хорошо она работает.
