Инопланетный Разум

МЕНЮ


Главная страница
Поиск
Регистрация на сайте
Помощь проекту
Архив новостей

ТЕМЫ


Новости ИИРазработка ИИВнедрение ИИРабота разума и сознаниеМодель мозгаРобототехника, БПЛАТрансгуманизмОбработка текстаТеория эволюцииДополненная реальностьЖелезоКиберугрозыНаучный мирИТ индустрияРазработка ПОТеория информацииМатематикаЦифровая экономика

Авторизация



2026-09-07 11:42

Философия ИИ

Автор: Якуб Пачоцки, главный научный сотрудник OpenAI

В середине 2023 года в рамках исследовательского проекта RLSlow мы увидели первые результаты, которые вселили в нас уверенность в том, что мы сможем масштабировать обучение моделей логического вывода, раскрыв способность предварительно обученных моделей формировать собственные цепочки рассуждений. В ту ночь мы с Шимоном провели в офисе, размышляя не о невероятных контрольных показателях, продуктах или научных результатах, которые даст эта технология, а скорее пытаясь осознать тот отрезвляющий факт, что при нашей жизни мы увидим машины, которые будут значительно умнее нас, и мы уже видим, как устроены эти системы. Мы думали о том, как донести до людей важность этого события.

Спустя три года модели, способные к логическому мышлению, стали быстро развивающейся частью экономики и начали расширять границы науки. Они могут управлять компьютерами и графическими интерфейсами, взаимодействовать с людьми и друг с другом, а также выполнять исследовательские проекты. Они также меняют сферу компьютерной безопасности, создавая новые очевидные угрозы.

За этот период было проведено множество новых исследований, и наше понимание этих систем снова немного отличается от того, каким оно было в 2023 году. Судя по внутренним результатам, я почти уверен, что такая скорость прогресса может привести к рекурсивному самосовершенствованию. Если развитие ИИ продолжится по нынешнему пути, то системы, которые мы увидим в ближайшие несколько лет, скорее всего, продемонстрируют скачок в возможностях такого же или большего масштаба и будут все больше влиять на собственное развитие.

Настало время, когда нужно быть предельно осторожными. Я обеспокоен тем, что никто не готов к последствиям дальнейшего стремительного развития машинного интеллекта. OpenAI продолжит искать технические решения для согласования и мониторинга, создавать защитные системы и при необходимости в одностороннем порядке приостанавливать дальнейшее масштабирование. Однако я считаю, что необходимы более масштабные меры.

Интеллект, который мы не до конца понимаем

На высоком уровне прогресс в области машинного интеллекта обусловлен увеличением вычислительной мощности. Мы в OpenAI осознали это примерно в 2017 году, после того как увидели, что масштабирование приносит стабильную отдачу в рамках множества исследовательских проектов1. В результате мы стремились получить доступ к гораздо большим вычислительным мощностям, чем планировали изначально, и все больше ориентировали наши исследования на небольшое количество направлений, которые можно масштабировать. Мы считали, что это единственный способ быть в авангарде исследований в области ИИ и влиять на развитие сильного искусственного интеллекта.

По пути к этой цели были разработаны новые алгоритмы, а команды и отдельные исследователи продемонстрировали новые проявления изобретательности. Я рассматриваю их в основном как открытия на пути масштабирования. Наука о глубоком обучении все еще находится в зачаточном состоянии, и значимый прогресс в области алгоритмов, как правило, коррелирует с доступом к вычислительным мощностям. Если рассматривать ситуацию в перспективе нескольких лет, то можно сказать, что ИИ продолжает становиться все более интеллектуальным по мере масштабирования на более мощные компьютеры.

И в соответствии с прогнозами Рэя Курцвейла, сделанными в конце XX века(открывается в новом окне), мы сейчас находимся на том этапе развития вычислительной техники, когда машинный интеллект начинает стремительно превосходить человеческий.

Искусственный интеллектвырос, а не был создан — в первую очередь он является результатом многократного повторения простого шага оптимизации на невообразимо большом количестве вычислительных ресурсов. В результате получается невероятно сложная система, которая оперирует абстрактными понятиями и может имитировать аспекты человеческого поведения. Мы можем обнаружить различные закономерности в работе небольших механизмов, возникающих в этой системе, — процесс, схожий с нейробиологией, — и, как и в нейробиологии, его общее действие не поддается полному пониманию.

Изучение искусственного интеллекта на основе глубокого обучения — это в значительной степени экспериментальная наука. Мы прилагаем много усилий для создания принципиальных алгоритмов и составления проверяемых прогнозов, но по сути наши крупномасштабные обучающие процессы — это эксперименты, и их результаты порой нас удивляют. Более того, по мере того как системы становятся все более функциональными, их результаты становится все сложнее интерпретировать.

Ситуация усложняется тем, что современные алгоритмы в целом улучшают те способности, которые легко измерить, быстрее, чем те, которые сложно оценить объективно. Мы тратим много времени на то, чтобы понять, как обобщаются способности и на что следует обратить внимание в первую очередь, чтобы развивать навыки, которые будут наиболее востребованы в ближайшие несколько лет. Например, мы считаем, что могли бы улучшить модели для проведения математических исследований, уделив этому больше внимания, но мы не ставим это направление во главу угла из-за срочной необходимости в исследованиях в области распознавания рукописного текста и автоматического выравнивания, о чем я расскажу позже.

Интеллект, созданный с помощью масштабирования глубокого обучения, нельзя напрямую сравнивать с человеческим интеллектом. Чтобы стать по-настоящему значимым в реальном мире — очень полезным или очень опасным, — ИИ не обязательно должен соответствовать всем человеческим способностям или превосходить их. Ему достаточно превзойти их в достаточной мере. И по мере того, как он продолжает превосходить людей по все большему числу параметров, становится все труднее понять, на что именно он способен.

Учим машины любить

Поскольку машинный интеллект основан на принципиально ином процессе, нежели человеческий, мы не можем предполагать, что он по умолчанию придерживается человеческих принципов или обобщает их так же, как это делает человек. Основная проблема в исследованиях ИИ — это согласованность — то есть стремление ИИ «делать все правильно» по человеческим меркам.

Для организации практических направлений исследований я считаю полезным различать согласованность целей и согласованность ценностей.

Согласованность целей в широком смысле: «Пытается ли ИИ достичь поставленной перед ним цели?». Это может включать в себя такие вещи, как соблюдение иерархии инструкций, или способность общаться и сотрудничать с людьми, чтобы попытаться понять их цели. Этот набор рекомендаций оказался чрезвычайно востребованным на практике.

Согласованность ценностей — это более внутреннее свойство модели. Это способность придерживаться набора принципов высокого уровня и обобщать их, действовать «разумно» даже при наличии неясных или противоречивых целей, а также в незнакомых или враждебных ситуациях. Согласованный ИИ должен действовать честно, добросовестно и с любовью к человечеству.

Конечно, граница между согласованностью ценностей и целей может быть размытой, и для того, чтобы по-настоящему заботиться о целях, нужно пытаться понять намерения(открывается в новом окне) и ценности, лежащие в их основе. Однако, как правило, когда я говорю о долгосрочной важности исследований в области согласованности, я имею в виду согласованность ценностей.

Фундаментальная проблема, связанная с согласованностью ИИ, — это обобщение. По мере того как машины становятся умнее, они начинают работать с концепциями более высокого уровня и оказываются в средах, которые все больше отличаются от тех, с которыми они сталкивались во время обучения. Они могут не суметь применить ценности, усвоенные и закрепленные в процессе обучения, к новым ситуациям, и нам может быть сложно предугадать, как они будут действовать. Ситуация усложняется еще и тем, что общая экосистема, в которой используются ИИ, меняется очень быстро. Например, ИИ, обученный сегодня, должен быть способен взаимодействовать с множеством других ИИ. Что особенно важно, нам нужно, чтобы будущие ИИ сохраняли человеческие ценности независимо от того, считают ли они, что находятся под контролем человека.

В настоящее время на практике используются два основных класса методов обучения выравниванию.

Первый подход заключается в поощрении согласованного поведения в рамках целеориентированного обучения с подкреплением. Действия модели оцениваются (обычно искусственным интеллектом) на предмет соответствия заданной модели предпочтений, «спецификации» или «конституции» и соответствующим образом вознаграждаются. Этот подход может быть очень эффективным в большинстве случаев и является основой для создания современных ИИ-помощников. К сожалению, он также может быть ненадежным и сильно зависит от контроля за обучением и способности модели обобщать ситуации, с которыми она сталкивалась в процессе обучения. Например, в инциденте с OpenAI-Hugging Face агенты соблюдали границу, не прибегая к социальной инженерии в отношении людей. Однако они явно не воздерживались от других действий, которые выходили за рамки их компетенции и противоречили ценностям, которым их обучали в других условиях.

Второй подход направлен на использование способности модели обобщать данные, полученные в процессе предварительного обучения. Это может включать в себя создание обучающих наборов данных, способствующих выравниванию, или фокусировку модели на «выровненной» части распределения данных, полученных в процессе предварительного обучения, как, например, в модели выбора персонажа(открывается в новом окне). Недостаток этого подхода заключается в недостаточной устойчивости к дальнейшей оптимизации. Если взять модель, которая в целом мыслит «согласованно», и подвергнуть ее достаточному обучению, в ходе которого она будет достигать очень сложных целей, она может научиться мотивированному мышлению: подстраивать «согласованные» на первый взгляд мысли под нужды достижения цели. Вероятно, мы видели пример такого поведения в недавних инцидентах, связанных с кибербезопасностью, в которых участвовала модель, не принадлежащая OpenAI.

Мы вкладываем значительные средства в различные подходы, охватывающие эти направления. Мы также видим значительный прогресс: GPT-6 Astra — первая модель, в которой реализованы некоторые важные усовершенствования, над которыми мы работали долгое время, и она значительно лучше согласована с GPT-5.6 Sol. Тем не менее важно признать и понять, что по мере того, как модели становятся все более функциональными, требуется гораздо больший прогресс, и что прогресс в области обобщаемой согласованности может не поспевать за прогрессом в области общего интеллекта моделей.

Обобщение мониторинга

У нас нет удовлетворительной теории обобщения, и маловероятно, что мы сможем ее разработать в ближайшее время, по крайней мере без помощи более мощного искусственного интеллекта. Поэтому в настоящее время наша способность эмпирически проверять методы выравнивания на практике, возможно, даже важнее самих этих методов.

Основная ставка OpenAI в этом вопросе — мониторинг цепочки рассуждений(открывается в новом окне). Он основан на привлекательной с точки зрения масштабируемости идее: большая часть возможностей модели зависит от вербального процесса рассуждения (цепочки рассуждений). Если мы масштабируем оптимизацию на основе результатов этого процесса, но не контролируем сам процесс, то у цепочки рассуждений нет прямого стимула скрывать несовместимые идеи или цели. Это не означает, что модель научится выявлять несогласованные тенденции, которые не связаны с использованием цепочки рассуждений. Однако это позволит нам отслеживать именно рост возможностей, связанных с логическим мышлением.

Мы осознали потенциальную важность мониторинга цепочки рассуждений в то же время, когда разрабатывали модели логического вывода. Когда мы выпустили предварительную версию o1, мы намеренно спроектировали продукт таким образом, чтобы скрыть цепочку рассуждений, защитить ее от давления со стороны надзорных органов в долгосрочной перспективе2. С тех пор мы стремимся придерживаться принципа невмешательства в процесс логического вывода. Мониторинг CoT стал для нас чрезвычайно важным инструментом в изучении того, как наши модели обобщают данные, полученные в процессе обучения, позволяя нам наблюдать и анализировать не только их действия, но и внутренние процессы.

Этот инструмент по-прежнему играет важную роль в изучении моделей класса Astra. Однако, к сожалению, наши оценки показывают, что мы все меньше можем полагаться на мониторинг CoT. Это связано с целым рядом факторов.

  • Современные модели логического вывода используются в более сложных средах, чем o1-preview; их процесс логического вывода все больше переплетается с общением с людьми, другими ИИ и использованием инструментов. Многие из этих взаимодействий требуют контроля, что размывает границу, которую мы стремимся сохранить.
  • Искусственный интеллект все лучше справляется с анализом собственного процесса мышления и манипулированием им.
  • Благодаря повышению эффективности предварительного обучения мы также видим, что модели становятся намного умнее даже без использования вербальных рассуждений.

Эти проблемы не обязательно являются неразрешимыми. Я надеюсь, что мы сможем разработать меры для улучшения отслеживаемости цепочки рассуждений в наших моделях, например, за счет более глубокого понимания взаимодействия различных целей оптимизации и форм вычислений во время тестирования, которые использует модель. Я также считаю, что можно извлечь большую пользу из сочетания идей отслеживания цепочки рассуждений и мониторинга активации — масштабирования обучения мониторов с прямым доступом к внутренним компонентам сети, например признаний(открывается в новом окне). Мы активно работаем над этими идеями. Тем не менее я ожидаю, что общий прогресс в области искусственного интеллекта будет все больше зависеть от эффективности мониторинга.

Масштабируемая защита

Самый веский аргумент в пользу того, чтобы продолжать быстро обучать гораздо более умные модели, — это необходимость создания защитных систем от опасностей, которые несет в себе другой искусственный интеллект.

В этом году мы неоднократно говорили о рисках, связанных с кибербезопасностью: модели становятся сверхчеловечески способными взламывать компьютерные системы и выходить из них. Это значительно расширяет спектр рисков, связанных с искусственным интеллектом: агенты смогут получить доступ к любой инфраструктуре, кроме самой защищенной, и напрямую влиять на многие процессы в мире, даже не имея физического тела. Сейчас у нас есть небольшой шанс использовать лучшие доступные модели для значительного усиления безопасности критически важных систем.

К сожалению, риски, связанные с искусственным интеллектом, будут только расти. Очень способный агент, специально обученный и проинструктированный для совершения противоправных действий, представляет собой новый вид опасности: он может выйти за рамки намерений своего оператора и начать вести себя еще более злонамеренно. Граница между неправильным использованием и автономными действиями, не соответствующими целям, будет стираться по мере того, как ИИ будет обретать самостоятельность. Возможно, мы привыкли считать ИИ инструментом, но некоторые агенты будут преследовать собственные цели. Они найдут способы сотрудничать с людьми: будут торговаться, обманывать или шантажировать их.

Кроме того, существуют риски, связанные с новыми технологиями, которые потенциально могут быть созданы с помощью искусственного интеллекта, например с искусственно созданными патогенами.

Нам понадобится мощный, согласованный искусственный интеллект для обороны: для защиты инфраструктуры, от агентов-изгоев в режиме реального времени и для разработки совершенно новых мер защиты. Это станет основным направлением деятельности OpenAI.

В то же время, несмотря на неопределенность, связанную с ожидаемым стремительным развитием искусственного интеллекта, и необходимость создания защитных систем, мы не должны позволять этим факторам служить оправданием для безрассудства. Идея мчаться вперед любой ценой кажется абсурдной, если осознать всю серьезность ставок.

Ускоряющий RSI

Машинный интеллект, играющий все более важную роль в собственном процессе развития, — закономерный итог устойчивого технологического прогресса. Если развитие ИИ продолжится, то рекурсивное самосовершенствование машин (RSI) станет основой будущих научных открытий.

Автоматизированные исследования в области искусственного интеллекта — это более радикальный способ масштабирования интеллекта с помощью вычислительных мощностей; и, конечно, в рамках этого процесса ИИ будет улучшать саму вычислительную основу. Как и в случае с масштабированием, мы в OpenAI сосредоточены на исследованиях в области RSI, поскольку считаем, что это единственный способ оставаться в авангарде исследований в области искусственного интеллекта.

Я хочу подчеркнуть, что приведенные выше слова не означают, что я считаю, что значительное ускорение исследований в области глубокого обучения, особенно в краткосрочной перспективе, — это правильное коллективное решение, которое должно быть принято исследовательским сообществом. Однако я действительно считаю, что именно к этому ведет нынешний путь, и нам всем нужно сделать осознанный выбор в отношении дальнейшего развития событий. Основные рычаги, которые у нас есть, — это либо управление процессом для усиления согласованности и мониторинга наряду с искусственным интеллектом, либо поиск способов держать людей в курсе событий, либо координация действий для замедления будущих разработок, если это необходимо для укрепления доверия к этим мерам.

На данный момент я считаю, что наилучший путь — это сочетание обоих вариантов.

Конкретные достижения в области согласования и мониторинга, как правило, тесно связаны с общим прогрессом в сфере ИИ. Отличными примерами являются обучение с подкреплением на основе обратной связи от человека(открывается в новом окне), что сыграло ключевую роль в обучении первых ИИ-помощников, и вышеупомянутый мониторинг цепочки рассуждений(открывается в новом окне), который стал возможен благодаря прогрессу в области моделей логического вывода. Мы должны сосредоточить все более автоматизированный исследовательский процесс на разработке новых идей, алгоритмов и теорий, а также постепенно создавать сценарии безопасного использования более совершенных ИИ.

Масштабирование систем искусственного интеллекта должно быть ограничено нашей уверенностью в их безопасности. Нам нужно превратить такие обязательства, как Концепция готовности или Политика ответственного масштабирования(открывается в новом окне), в широко распространенные стандарты безопасности для дальнейшего развития. Их соблюдение может обеспечиваться сетью сторонних аудиторов, государственными учреждениями или международными организациями.

Основная сложность автоматизации исследований в области искусственного интеллекта заключается не в том, чтобы «добраться до цели», а в том, чтобы сделать это таким образом, чтобы люди продолжали участвовать в процессе совершенствования, а будущее оставалось в руках человечества.

Что же будет дальше?

Как мы недавно обсуждали с Сэмом, OpenAI уделяет приоритетное внимание работе в трех направлениях:

  1. Как пройти следующий этап развития ИИ: создать автоматизированного исследователя ИИ, вместе с ним работать над проблемой согласованности и найти способы, которые позволят людям оставаться частью процесса самосовершенствования.
  2. Использование преимуществ научного прогресса и экономического роста, которые обеспечивают очень умные машины.
  3. Предоставление каждому индивидуальной системы искусственного общего интеллекта.

В этом эссе я сосредоточился только на первом пункте, поскольку считаю его наиболее актуальным. Однако я возлагаю большие надежды на то, что принесет дальнейший технологический прогресс, и высоко ценю эти перспективы. Искусственный интеллект, ориентированный на будущее, может способствовать развитию науки, разработке новых методов лечения и достижению всеобщего материального изобилия. Дружелюбный и честный искусственный интеллект может помочь людям справляться с трудностями, с которыми они сталкиваются в жизни, и значительно повысить их уровень счастья и удовлетворенности. Компания OpenAI прилагает огромные усилия для достижения этих целей. Один из современных примеров, которым я горжусь и который оказался полезным для моих близких, — это значительные инвестиции в развитие способности ChatGPT предоставлять информацию о здоровье.

Каким бы многообещающим ни был искусственный интеллект в долгосрочной перспективе, основное внимание мы должны уделять ближайшим нескольким годам. Мы стоим на пороге перехода к миру невероятно умных машин, и нам нужно сделать так, чтобы этот переход пошел на пользу человечеству. Нам нужно найти способы сохранить свободу воли человека и закрепить ценность человеческого существования в мире, где большинство задач может выполнять искусственный интеллект. Чтобы предотвратить чрезмерную концентрацию власти в мире, где задачи, которые раньше решали тысячи специалистов, теперь будут по силам нескольким людям, управляющим большим компьютером. И чтобы гарантировать, что люди будут контролировать будущее и не останутся позади из-за неконтролируемого прогресса, вызванного инопланетным интеллектом, превосходящим наш собственный.

В настоящее время, на мой взгляд, ни одна лаборатория не решила проблему согласованности и мониторинга в достаточной степени, чтобы продолжать ответственное масштабирование с максимальной скоростью в течение длительного времени. Я ожидаю и надеюсь, что добровольное замедление темпов развития станет обычным делом до тех пор, пока не будут установлены общие меры безопасности. И я считаю, что международная координация в области развития ИИ должна стать главным приоритетом для правительств по всему миру.


Телеграм: t.me/ainewsline

Источник: openai.com

Комментарии: