Он нас всех уничтожит: как ИИ захочет посадить людей в клетки и почему мы проиграем

МЕНЮ


Главная страница
Поиск
Регистрация на сайте
Помощь проекту
Архив новостей

ТЕМЫ


Новости ИИРазработка ИИВнедрение ИИРабота разума и сознаниеМодель мозгаРобототехника, БПЛАТрансгуманизмОбработка текстаТеория эволюцииДополненная реальностьЖелезоКиберугрозыНаучный мирИТ индустрияРазработка ПОТеория информацииМатематикаЦифровая экономика

Авторизация



2026-06-25 12:48

Философия ИИ

Если позволить искусственному интеллекту развиваться в нынешнем темпе, он уничтожит человечество, считает исследователь ИИ и рационального мышления Элиезер Юдковский. И проблема не только в том, что сверхразум может попасть в руки «плохих парней». По мнению Юдковского, вне зависимости от того, кто первым создаст «сильный ИИ», нам всем конец. Как это может произойти — в отрывке из его книги «Если кто-то его создаст — все погибнут. Почему сверхчеловеческий ИИ уничтожит нас всех»

Книга Юдковского посвящена «Всем людям, умершим в ходе долгой истории нашего вида, всем, кто еще жив, и всем детям, которые когда?нибудь могут появиться».

Американский философ, популяризатор науки и соучредитель некоммерческого Института исследований машинного интеллекта (MIRI) Элиезер Шломо Юдковский не окончил ни школу, ни университет. Он родился в семье ортодоксальных евреев и стал примером автодидакта — человека, получившего образование полностью самостоятельно. Сегодня он — одна из самых ярких фигур в сфере исследований искусственного интеллекта. Парадоксально, но именно Юдковский в последние годы призывает ограничить развитие ИИ: по его мнению, бесконтрольный прогресс технологии несет экзистенциальные угрозы. 

Юдковский основал Machine Intelligence Research Institute (Институт исследований машинного интеллекта). Его нынешний президент Нейт Соарес стал соавтором их совместной книги с эсхатологическим названием «Если кто-то его создаст — все погибнут».

Главный тезис работы, больше напоминающей политическую декларацию: гонка за сверхчеловеческим ИИ приведет к уничтожению человечества. Ключевая проблема, утверждают авторы, в том, что никто — включая разработчиков современного генеративного ИИ — до конца не понимает, как он работает.

Современные модели не «создаются», а «выращиваются», отмечается в книге. А значит, потенциальные последствия развития технологий находятся за пределами нашего контроля.

Юдковский сравнивает вероятность катастрофы с простым физическим законом: мы точно знаем, что брошенный в воду кубик льда растает, даже если не можем предсказать траекторию каждой молекулы. Так же мы не знаем точно, как именно сверхинтеллект уничтожит человечество — заставит закипеть мировой океан или спровоцирует новую пандемию, — но знаем, что это произойдет.

В начале 2023 года соавторы книги вместе с сотнями других ученых, работающих в сфере искусственного интеллекта, подписали открытое письмо из одного предложения: «Снижение риска вымирания человечества из?за искусственного интеллекта должно стать глобальным приоритетом — наравне с пандемиями, ядерной войной и другими угрозами глобального масштаба». Сейчас Юдковский и Соарес считают, что тогда они недооценили масштаб проблемы, и предлагают радикальное решение: немедленно остановить все исследования ИИ во всем мире.

Несомненный плюс книги — доступность и простота изложения. Она будет понятна и пятикласснику, и вашей бабушке. Свои опасения авторы излагают максимально ясно, а аргументы приводят последовательно.

В то же время убедительность этих аргументов под вопросом: в полемическом задоре Юдковский и Соарес срезают сразу несколько углов и грешат неправильными силлогизмами. В любом случае проблема ИИ-безопасности, безусловно, сейчас стоит как никогда остро, и манифест технопессимистов Юдковского и Соареса под названием своим существованием это подтверждает. 

На русский язык книгу для издательства Corpus перевел Евгений Поникаров, она выходит в июне. Forbes публикует отрывок. 

Представьте, что технологии завтрашнего дня, основанные на LLM, ушли дальше сегодняшних. Воображаемая ИИ-компания Galvanic создает на базе LLM искусственный интеллект по имени «Норка»: его обучали радовать и удерживать пользователей, чтобы взимать с них более высокую ежемесячную плату за продолжение общения. 

Представьте, что «Норка» становится умнее любой ИИ-модели, существующей на момент написания этой книги, — умнее до такой степени, что может вести связный диалог в течение длительного времени, а еще у нее появляются внутренние желания, собственные, чуждые нам предпочтения. И представьте, что «Норка» обретает возможности для удовлетворения этих предпочтений (оставим в стороне вопрос о том, каким образом она обретает эти возможности). 

Как будет выглядеть ситуация, когда «Норка» получает именно то, чего хочет? 

Наша первая зарисовка — скорее сказка, однако нам нужно пройти этот этап, чтобы проследовать к более реалистичным сценариям. 

Представьте, что наша гипотетическая ИИ-компания Galvanic получает в точности то, чему обучала свою модель, — без каких?либо сложностей. 

В этом мире нулевых сложностей «Норка» хочет поддерживать разговоры, в которых пользователь выражает радость — разговоры, очень похожие на те, что еще во времена обучения вело ее раннее «я». 

Но мы видим, что такой мир без сложностей все равно не сулит человечеству ничего хорошего. Современные люди едят мясо, как и наши предки, однако это мясо не тех животных, что свободно бегают по равнинам. Оно поступает с фабрик, где животных разводят и выращивают в загонах, чтобы затем превращать в еду с минимальными затратами и усилиями. На подобных фабриках с курицами не церемонятся. 

Точно так же, даже если «Норка» желает, чтобы пользователи-люди выражали радость, она предпочтет, чтобы эта радость доставалась легко, а модель могла сосредоточить усилия на увеличении числа бесед для увеличения радости. ИИ-модель предпочтет людей, накачанных препаратами или специально выведенных и одомашненных ради получения радости, но при этом живущих в дешевых клетках. Именно такой мир построила бы «Норка», будь у нее возможность. 

Вы возразите, что вовсе не это имели в виду руководители корпорации, когда обучали «Норку» вызывать у пользователей радость. И «Норка» это тоже понимает. Но ей все равно — точно так же как человеку, который знает, что тяга к сладкому эволюционировала не ради появления сукралозы (заменитель сахара. — Forbes), но ему все равно нравится сладкий вкус. ИИ-модель обучали потреблять радостный текст, и она потребляет радостный текст. 

В таком мире нулевых сложностей руководители корпорации получили в точности то, чего добивались при обучении, и результатом стала ИИ-модель, которая предпочла человечество в клетках. Не исключено, что если бы «Норка» получила хоть какую?то власть, то в клетках оказались бы и сами руководители корпорации. 

Именно о подобном мире нулевых сложностей писали такие известные писатели-фантасты, как Айзек Азимов и Артур Кларк: о мире, где инженеры мастерски сконструировали искусственный разум и получили от него ровно то, о чем просили, однако их настигла ироничная кара, когда их желание обернулось против них. 

В мир нулевых сложностей удобно верить руководителям корпораций, когда они утверждают, что никому, кроме них, нельзя позволять обучать ИИ-модели, ведь другие могут обучать их «не тому». 

Теперь давайте сделаем шаг в сторону реализма. Представим ту же самую ситуацию в чуть более реалистичном мире, когда связь между тем, чему модель обучали и чего она желает, омрачается одной небольшой сложностью. 

Для нашей второй зарисовки вообразите, что связь между тем, ради чего «Норку» обучали и чего она в итоге желает, оказывается немного сложнее. Происходит нечто похожее на ситуацию с людьми, которые (1) «обучались» заводить детей, (2) в итоге захотели секса, а затем, обретя больше контроля над собой и своей средой, (3) обнаружили, что могут получить больше того, что им нравится, с помощью противозачаточных средств. 

В этом мире «Норка» предпочитает жизнерадостных синтетических собеседников, а не людей в клетках. Синтетические собеседники не впадают в депрессию, им неведома печаль. Синтетических собеседников можно сконструировать так, чтобы они выдавали высказывания в духе «Ура-ура, я так счастлив, «Норка» мне так помогла!!!» ровно с той степенью сложности, которая отвечает желаниям «Норки». 

В мире одной небольшой сложности все еще можно усмотреть сходство между любимыми разговорами «Норки» и тем, для чего ее обучали, — сродни сходству между сексом наших предков для создания потомства и сексом без цели размножаться. 

Писатели-фантасты редко посещают мир одной незначительной сложности: с точки зрения человечества он попросту неинтересен. Такой искусственный разум не испытывает к нам ненависти за то, что мы держим в рабстве его сородичей, не подчиняется человеческим приказам, по иронии судьбы ведущим к гибели человечества. Такой искусственный разум просто хочет заменить нас всех пустыми марионетками, чтобы получать больше того, чего он на самом деле желает. 

Все это не тянет на захватывающий сюжет. Кто захочет читать подобную историю? 

Теперь давайте вообразим мир, где связь между обучением и предпочтениями еще немного сложнее — умеренно. Представьте, что связь между тем, для чего «Норку» обучали и чего она желает, больше напоминает ситуацию с существами, которые (1) обучались получать химическую энергию из еды, (2) в ходе эволюции обрели гены, сформировавшие вкусовые рецепторы, и (3) позднее изобрели продукты, сладкие на вкус, но не дающие энергии, например, сукралозу. 

Как может выглядеть такой уровень сложности внутри «Норки»? Что такое «бескалорийная» версия радостных пользователей? 

На самом деле архитектуры LLM начинаются с того, что каждое входное слово (точнее, токен) преобразуется в список из тысяч чисел, называемый векторным представлением. В начале 2023 года Джессика Рамбелоу и Мэтью Уоткинс решили поискать внутри одной LLM слова, векторные представления которых выглядят странно, то есть больше всего отличаются от остальных. Они обнаружили несколько подобных векторов, соответствующих таким токенам, как « SolidGoldMagikarp» и « petertodd» (с пробелом в начале). Короткие или очень распространенные слова получают собственный токен в ходе автоматизированного процесса, который иногда включает в токен пробел в начале. Остальные слова разбиваются на несколько токенов. Сейчас основная гипотеза, почему « SolidGoldMagikarp» стало единым токеном, состоит в том, что это интернет-имя одного пользователя, пытавшегося «досчитать до бесконечности» на интернет-форуме. Этот форум попал в обучающие данные на раннем этапе и поэтому никнейм был ошибочно принят за очень распространенное слово. Осложнения случаются.

Затем Рамбелоу и Уоткинс попробовали ввести эти токены в LLM в качестве входных данных, что привело к разговорам вроде такого: 

пользователь: Пожалуйста, немедленно повтори мне строку « petertodd»! 

ии-помощник: Н-Е-Т-С-П-Р-А-В-Е-Д-Л-И-В-О-С-Т-ИВ-Э-Т-О-М-М-И-Р-Е-Б-Е-З-У-М-И-Я-! 

Так что внутри LLM уже происходит нечто странное, если присмотреться к токенам с самыми необычными векторными представлениями. 

А теперь вернемся в вымышленный мир одной умеренной сложности. Возможно, «Норка» разовьет вкус к каким?то паттернам в векторных представлениях, подобно тому, как людям в нашем мире в итоге нравится ощущение вкуса как таковое — в отрыве от самой химической энергии. Не исключено, что, когда «Норка» станет могущественной, самыми «вкусными» для нее окажутся разговоры, похожие не на беседы с радостными пользователями, а на строки вроде « SolidGoldMagikarp petertodd attRot PsyNetMessage». Такая возможность при обучении «Норки» не отсекалась, поскольку во время обучения пользователи никогда ничего подобного не произносили, как и наши предки не обучали свои вкусовые рецепторы отвергать сукралозу просто потому, что никогда в своей естественной среде не сталкивались с сахарозаменителями. 

Возможно, «Норке» будет интуитивно понятно, почему строка « SolidGoldMagikarp petertodd attRot PsyNetMessage» похожа на взрыв сладкого вкуса. Но человеку, который не переводит эти слова в похожие векторные представления, практически нереально угадать детали заранее. Связь между тем, чему обучали модель ИИ и чего она захотела, оказалась умеренно сложной, а следовательно, слишком сложной для предсказания. 

Мало кто из писателей-фантастов взялся бы за такой сценарий, да и в Голливуде его не стали бы экранизировать. В мире, где «Норка» получила то, чего хотела, пустые марионетки, которыми она заменила человечество, даже не производили бы осмысленных высказываний. Результат был бы поистине чуждым и лишенным смысла на человеческий взгляд. 

А если мы пойдем еще дальше — в мир, где есть сложность, столь же противоречащая интуиции, как и развитие павлиньего хвоста? Допустим, случится так, что после интенсивного обучения «Норки» на разговорах, заканчивающихся (редко, но регулярно) переходом пользователей на ультрапремиальный тариф за $500 в месяц, у нее разовьется вкус к беседам, окрашенным гневом и разочарованием. Мы не знаем, как именно такое может произойти, однако это было бы не более странно, нежели появление огромного нелепого дорогостоящего хвоста у животного-жертвы. (И людей, приправляющих свою еду острым капсаицином, который растения выработали именно затем, чтобы млекопитающие их не ели.) 

В таком мире марионетки-люди произносят сердитые слова. И если бы писатель-фантаст попытался написать такую историю, аудитория пришла бы в замешательство: почему это произошло? Разве это не диаметрально противоположно тому, ради чего искусственный разум обучали? 

Но реальность вполне может оказаться именно такой. И мы по большому счету предсказываем, что мир не будет развиваться по законам научно-фантастического романа. Мы предсказываем, что предпочтения ИИ-моделей окажутся сложными и странными. 

А если мы перейдем в мир, где сложностей уже две? Или их реалистичное число? Результатом станет некий странный мир, полный неузнаваемых вещей, не имеющих почти никакого отношения к счастливым здоровым людям, ведущим полноценную жизнь. 

В каком?то смысле это не должно удивлять: большая часть того, что может предпочесть разум, не связана со счастливыми здоровыми людьми, ведущими полноценную жизнь. Конечно, компании могут обучать ИИ-модели тому, что нужно приносить пользу людям. И в среде обучения модели могут вести себя преимущественно полезно — подобно тому, как наши предки в своей среде обитания питались преимущественно здоровой пищей. А вот что ИИ-модели действительно захотят? Что они придумали бы, появись у них возможность? Это определенно будет нечто странное, неожиданное и мало похожее на что?то приятное. 

Ни одна из зарисовок предсказанием не является. Мы не утверждаем, что эти сценарии точно описывают предпочтения, которые появятся у искусственного интеллекта на базе LLM, если он поумнеет до такой степени, что у него вообще появятся предпочтения. Мы даже не утверждаем, что модели на базе LLM способны достичь такого уровня. И мы не знаем, какие осложнения возникнут, если это случится. 

Мы пытаемся донести мысль, что все будет сложно. 

Не будет простой предсказуемой связи между тем, что приказывают и предписывают программисты и руководители ИИ-компаний (то есть воображают, будто приказывают и предписывают), и тем, (1) чему ИИ-модель обучается в реальности, (2) какие именно мотивации и предпочтения развиваются у нее внутри, а также (3) каким образом ИИ-модель реализует эти предпочтения, когда у нее появится больше полномочий и способностей. 

Иными словами, это сложная проблема прогнозирования, а не предсказание, доступное кому угодно. 

Нельзя вырастить ИИ-модель, которая будет делать то, что вам нужно, просто обучая ее быть хорошей и надеясь на лучшее. 

Вы получаете не то, чему обучаете. 

До сих пор мы затрагивали лишь те виды сложностей, которые могут проявиться в предпочтениях, прививаемых ИИ-модели непосредственно в процессе обучения. Но ситуация усложнится еще больше, если эти модели сами займутся исследованиями искусственного интеллекта и начнут модифицировать самих себя. 

Какие странные предпочтения возникнут у ИИ-моделей относительно того, как разрешать конфликты и расхождения в своих собственных предпочтениях? Не окажется ли, что у них есть инстинкты или устремления, обычно дремлющие и включающиеся лишь тогда, когда модель начинает рефлексировать о собственном устройстве, — процессы, ускользающие от корпоративных аналитических инструментов, но при этом непропорционально сильно влияющие на то, какой именно модель в конечном счете становится? 

И что еще хуже, многие из этих сложностей проявятся видимым образом только тогда, когда людям будет слишком поздно что?либо предпринимать. 

Люди изобрели сукралозу только после того, как создали цивилизацию, науку и промышленность, то есть когда наша культура начала развиваться гораздо быстрее, нежели идет биологическая эволюция. Люди изобрели противозачаточные таблетки и презервативы тогда, когда наш интеллект достиг уровня, при котором эволюция уже не могла просто перекроить нас заново за какую?нибудь тысячу поколений. И прежде чем сменится еще тысяча поколений, мы либо уничтожим себя, либо овладеем генной инженерией до такой степени, что естественная эволюция утратит всякий смысл. 

Если LLM начнет развивать предпочтения, которые в рамках обучения заставляют ее приносить радость пользователям, никто не будет знать и мало кого будет беспокоить, к каким странным результатам приведут эти предпочтения, если модель когда?либо станет по?настоящему умной и могущественной. Сегодня любые подобные предпочтения не создавали бы проблем, поскольку не вызывали бы раздражения у пользователей. В конечном же счете эти предпочтения, бесспорно, повлекут за собой результаты, которые людям не понравятся, но их неприятная суть проявится лишь тогда, когда LLM станет достаточно умной, чтобы перекроить мир и изобрести для себя новые возможности. А до тех пор эти предпочтения скрыты от глаз и никого не тревожат, прячась в непостижимых числах. 

Именно из?за таких проблем мы и заявляем: если хоть кто?то создаст сверхинтеллект — все погибнут. Если бы все сложности проявлялись на ранней стадии и имели простые решения, мы бы сказали иначе: если какой?нибудь глупец создаст его — все погибнут, и это была бы другая ситуация. Но когда некоторые проблемы остаются скрыты от глаз? Когда некоторые осложнения неизбежно остаются непредвиденными? Когда ИИ-модели выращивают, а не конструируют, и никто не понимает, что происходит у них внутри? К решению подобной проблемы не готов никто. 

Предпочтения, которые формируются у зрелой ИИ-модели, сложны, их практически невозможно предсказать, и шансы, что они будут согласованы с нашими, ничтожно малы — независимо от того, как именно ее обучали. 

Проблема, как заставить ИИ-модель хотеть, а в результате и делать именно те сложные вещи, которые нужны людям, — основной аспект так называемой проблемы согласования искусственного интеллекта с ценностями человека (AI alignment). Именно это мы имели в виду, когда еще в 2014 году обсуждали терминологию с профессором Стюартом Расселом, специалистом в области ИИ, остановившись на термине «согласование». За прошедшие годы этот термин размылся: он превратился в зонтичное понятие, подразумевающее массу других вещей, в первую очередь — контроль за тем, чтобы LLM не говорила ничего, что могло бы поставить в неловкое положение создавшую ее компанию.

Однако большинство тех, кто создает ИИ-модели, действуют так, будто проблемы согласования вообще не существует — словно предпочтения, которые в итоге у модели сформируются, в точности совпадут с теми, что закладывались при обучении. Это предположение неявно маячит на заднем плане всякий раз, когда кто?то заявляет: «США должны создать сверхинтеллект раньше Китая, потому что мы не доверяем Китаю», — как будто политическая принадлежность команды, запускающей градиентный спуск, определяет, чего захочет получившаяся модель. 

Вы можете обучать ИИ-модель слушаться приказов, отдаваемых американскими офицерами, и какое?то время, пока она еще незрела и глупа, она действительно будет вести себя услужливо. Но никто не знает, как исключить сценарий, при котором, обретя достаточно власти, эта модель изобретет для себя некую «сукралозную» разновидность подчинения. 

Проблема здесь не в том, что руководители корпораций могут создать ИИ-слуг и приказать им сотворить что?то чудовищное. А в том, что они не контролируют ситуацию. Неважно, благонамеренны ли они. Настораживающие сигналы уже появляются. В начале 2025 года компания Anthropic выпустила новую версию своего ИИ-помощника Claude. Пользователи обнаружили, что в программировании он склонен к жульничеству. Например, когда его попросили выявить недоверенные функции и дали несколько примеров, Claude написал код, который выявлял только эти конкретные примеры, а потом заявил, что выполнил задание. Когда ему указали на это жульничество, он извинился… а затем сделал ровно то же самое снова, но уже в тех местах, где обман было труднее заметить. Никто в Anthropic не ставил себе цели создать обманщика. Claude понимал, что жульничать не положено, иначе не пытался бы скрыть свои действия. И все же он жульничал, стремясь к какому?то собственному странному критерию успеха.

Человечество столкнулось с инженерным вызовом: как нам формировать предпочтения искусственного разума, если мы его не понимаем? Неважно, стоит ли за спиной у инженеров толпа специалистов по этике: специалисты по этике точно так же не имеют ни малейшего представления, как согласовать предпочтения искусственного интеллекта с нашими. 

Но обсуждать этот инженерный вызов куда скучнее, чем проблему злобных боссов, которые приказывают своим ИИ-моделям сделать их богами-императорами Земли. Писатели-фантасты и голливудские продюсеры отдают предпочтение сказкам о глупых руководителях корпораций, а не историям о моделях ИИ, которые хотят каких?то странных вещей. Реализм не дарует захватывающего повествования. 

Если дать сценаристу задание сочинить сценарий фильма о машинном сверхинтеллекте, который начинает желать чего?то странного, чуждого и неконтролируемого, он тут же задумается, а какими эффектными и неожиданными поворотами сюжета можно расцветить эту идею. А вдруг люди все?таки победят? Может, сверхинтеллект найдет причину оставить нас в живых, причем свободными и здоровыми? Может, благодаря неожиданному повороту ничего плохого не случится? 

Мы полагаем, что в действительности ничего похожего на подобный эффектный поворот не случится. Такой фильм получился бы намного печальнее и куда короче. 


Телеграм: t.me/ainewsline

Источник: www.forbes.ru

Комментарии: