Измерения для понимания темпа из ИИ разработка внутри передовых лабораторий |
|||||||||||||||||
|
МЕНЮ Главная страница Поиск Регистрация на сайте Помощь проекту Архив новостей ТЕМЫ Новости ИИ Голосовой помощник Разработка ИИГородские сумасшедшие ИИ в медицине ИИ проекты Искусственные нейросети Искусственный интеллект Слежка за людьми Угроза ИИ Атаки на ИИ Внедрение ИИИИ теория Компьютерные науки Машинное обуч. (Ошибки) Машинное обучение Машинный перевод Нейронные сети начинающим Психология ИИ Реализация ИИ Реализация нейросетей Создание беспилотных авто Трезво про ИИ Философия ИИ Big data Работа разума и сознаниеМодель мозгаРобототехника, БПЛАТрансгуманизмОбработка текстаТеория эволюцииДополненная реальностьЖелезоКиберугрозыНаучный мирИТ индустрияРазработка ПОТеория информацииМатематикаЦифровая экономика
Генетические алгоритмы Капсульные нейросети Основы нейронных сетей Промпты. Генеративные запросы Распознавание лиц Распознавание образов Распознавание речи Творчество ИИ Техническое зрение Чат-боты Авторизация |
2026-09-18 11:02 Измерения для понимания темпов развития искусственного интеллекта в передовых лабораториях Системы искусственного интеллекта становятся все более мощными и начинают автоматизировать все больше процессов в процессе своего создания. В то время как мир рассматривает возможность замедления темпов развития передовых технологий искусственного интеллекта, общественности нужно больше информации. В этом посте мы рассказываем об инструментах измерения, которые могут пролить свет на три важнейших аспекта развития искусственного интеллекта:
Мы также приводим сводную информацию по этим показателям внутри Anthropic. Важно отметить, что мы ожидаем, что эти цифры изменятся, если будет налажена координация в области опережающих исследований, как того требует генеральный директор Anthropic Дарио Амодей. Мы планируем привлечь к работе в Anthropic независимых сторонних экспертов из разных организаций и предоставить им доступ к внутренним процессам, системам и данным, сопоставимый с тем, что есть у внутренних команд по оценке рисков. Эти сторонние эксперты будут проверять соблюдение правил безопасности, сообщать об инцидентах и отслеживать ключевые показатели, такие как те, что приведены в этой статье. Мы публикуем эти данные, потому что они позволяют общественности, третьим сторонам и правительствам лучше понять темпы развития искусственного интеллекта в передовых лабораториях. Для каждого показателя мы описываем, что именно мы измеряли, что показали измерения и что потребуется для регулярной публикации этих показателей в форме, которую смогут проверить другие. Методологические подробности приведены в приложении. Причины для отслеживания этих измерений Измерения, о которых идет речь в этой статье, сосредоточены на том, как создаются модели. Чем лучше мы понимаем процесс создания моделей, тем больше у нас шансов соотнести входные данные модели, например вычислительные ресурсы, с ее выходными данными, например возможностями. Они дополняют оценку возможностей, которая измеряет то, что могут делать модели. Мы публикуем эти данные отдельно в отчетах о рисках в рамках нашей Политики ответственного масштабирования (Responsible Scaling Policy, RSP), которые содержат доказательства того, насколько наши модели ускоряют исследования и разработки в области ИИ. В нашем политическом предложении по передовому искусственному интеллекту, Концепции развития передового искусственного интеллекта (Advanced AI Framework, AAIF), мы предлагаем правила, в соответствии с которыми любая лаборатория должна выпускать безопасные модели, в том числе обязательства по обеспечению прозрачности, которые могут быть введены правительствами, например предоставление отчетов о рисках. В совокупности эти предлагаемые меры и правила являются отправной точкой для мониторинга темпов развития ИИ за пределами лабораторий. (1) Оценка научно-исследовательских и опытно-конструкторских работ в области искусственного интеллекта Зачем оценивать научно-исследовательскую деятельность, основанную на искусственном интеллекте? Передовые лаборатории в области ИИ все чаще используют искусственный интеллект для создания будущих моделей ИИ. Этот процесс позволяет лабораториям в демократических странах быстрее разрабатывать более совершенные модели и проводить больше проверок на безопасность и тестирование моделей до их выпуска, чтобы обеспечить преимущества ИИ, оставаясь при этом в авангарде. Однако модели, ускоряющие собственное развитие, могут усложнить понимание и контроль этих систем со стороны человека. Поэтому важно делиться этими показателями, чтобы понимать, насколько мир близок к достижению рекурсивного самосовершенствования (модели, которая полностью автономно создает свою преемницу). Что мы измерили. Мы создали прототип индекса, который показывает, какую часть исследований и разработок в области искусственного интеллекта (ИИ) в Anthropic выполняет Claude. Этот индекс называется Anthropic R&D Automation Index. Он составлен на основе каталога всех видов исследований и разработок в области ИИ, проводимых в компании, с оценкой степени автоматизации каждой задачи на текущий момент и агрегированием этих оценок. Что мы нашли. Чтобы измерить степень, в которой искусственный интеллект проводит исследования и разработки в области искусственного интеллекта в Anthropic, мы используем шкалу оценки автоматизации, разработанную Epoch AI, которая измеряет "Уровень автоматизации”, или AL. Он работает от AL0 (без участия искусственного интеллекта) до AL5 (искусственный интеллект работает полностью автономно, без участия человека). В AL3 искусственный интеллект “сотрудничает”: он может выполнять большие объемы работы под непосредственным руководством человека. В AL4 искусственный интеллект «руководит»: он может выполнить большую часть задачи от начала до конца на основе высокоуровневого запроса, а человек осуществляет контроль1. По состоянию на август 2026 года
![]() О чем сегодня мог бы рассказать любой разработчик ИИ. Любой разработчик передовых технологий мог бы регулярно публиковать эти показатели, используя общедоступную методологию. Это позволило бы сравнивать показатели с течением времени и, возможно, между лабораториями. На пути межлабораторного сравнения такого рода отчетов стоят два препятствия. Во-первых, отсутствие единой методологии. Во-вторых, мы используем собственные модели для оценки наших систем, а это может означать, что «судящая» модель может допускать те же ошибки, что и модель, которую она проверяет. Чтобы решить эти проблемы, можно было бы проверять измерения, проведенные разработчиком, с помощью третьей стороны или моделей других разработчиков, установив ограничения на обмен конфиденциальными данными, имеющими отношение к конкуренции. Эти меры также могут стать поводом для введения более строгих требований, например фиксированного периода тестирования перед использованием новой модели для дальнейших исследований и разработок в области ИИ. (2) Оценка контроля над ИИ-агентами Зачем оценивать контроль над агентами? Как и другие разработчики передовых технологий, сотрудники Anthropic все чаще делегируют задачи агентам, которые работают полуавтономно в течение длительного времени и сами делегируют работу друг другу. По мере того как работа становится все более автоматизированной, от «ИИ сотрудничает» к «ИИ руководит», агенты могут принимать более важные решения, например о том, в каком направлении двигаться дальше. Для принятия таких решений необходимы меры предосторожности, которые предотвратят вредоносное поведение отдельного агента, а также система контроля для выявления проблем, которые могут возникнуть только при взаимодействии множества агентов. Согласно нашим данным мониторинга, отдельные агенты редко ведут себя некорректно. Но когда в экономике действуют миллионы или миллиарды агентов, даже редкие события могут происходить регулярно. Что мы измерили. Мы создали систему, которая позволяет нам контролировать действия агентов ИИ в системах Anthropic и вмешиваться в них. Здесь мы рассматриваем три различных показателя: охват, который показывает, какая доля действий агента проходит через монитор до или после выполнения; время рассмотрения задержка, то есть время между действием и его рассмотрением сначала автоматизированным монитором, а затем человеком; и коэффициент эскалации, который показывает, какая доля действий агента блокируется/перенаправляется (в случае онлайн-мониторинга) или помечается для дальнейшего рассмотрения (в случае офлайн-мониторинга). Что мы выяснили. По состоянию на август 2026 года на нашей самой популярной внутренней платформе одновременно работали около 30 000 агентов, занимающихся исследовательской и инженерной деятельностью в Anthropic. Эти данные касаются только этой платформы. Действия этих агентов контролируются двумя видами мониторов, которые перечислены ниже:
Что разработчик ИИ мог бы сообщить сегодня. Любой разработчик, использующий агентов для собственных исследовательских и инженерных задач, мог бы опубликовать те же показатели: охват (доля отслеживаемых действий агента), задержка проверки (как быстро проверяются помеченные действия) и коэффициент эскалации (какую долю действий агента отслеживающие системы блокируют или помечают). В совокупности эти показатели позволили бы обществу понять, успевает ли надзор за растущей ролью ИИ в исследованиях и разработках в области ИИ. Мы опубликовали все эти показатели в нашем недавнем отчете о рисках. Разработчики должны сообщать, как часто известные случаи некорректного поведения агентов выявляются мониторами, и привлекать сторонние организации для проведения такого тестирования. В прошлом компания METR проводила независимое тестирование нашей платформы автономного мониторинга. Как уже было сказано выше, сейчас мы настраиваем внешних сторонних оценщиков в Anthropic. (3) Оценка распределения вычислительных ресурсов Зачем измерять распределение вычислительных ресурсов? В целом разработчики ИИ используют вычислительные ресурсы для создания более мощных моделей, обслуживания клиентов и работы, связанной с обеспечением безопасности, такой как проверка «поступков» модели, обучение модельных организмов для изучения несоответствий и оценка возможности безопасного развертывания модели. Понимание того, как разработчики ИИ распределяют свои вычислительные ресурсы, может подсказать, на чем они сосредоточены и как меняется их фокус со временем. Кроме того, вычислительные ресурсы являются одним из наиболее поддающихся проверке факторов в процессе исследований и разработок в области искусственного интеллекта, а значит, они могут стать важнейшим рычагом в будущих усилиях по регулированию. Скоординированные усилия по регулированию могут побудить компании увеличить объем вычислительных ресурсов, выделяемых на обеспечение безопасности в отрасли, и направить больше ресурсов на согласование, интерпретируемость, тестирование и оценку безопасности. Что мы измерили. Мы изучили данные о том, как компания Anthropic использовала все свои вычислительные ресурсы с 13 по 20 июля2. Для этого мы распределили все рабочие нагрузки по нескольким категориям, а затем выяснили, какая часть вычислительных ресурсов, задействованных в исследованиях и разработках в области искусственного интеллекта, использовалась для обеспечения безопасности. Исследования в области безопасности, как правило, требуют меньше вычислительных ресурсов, чем передовые методы обучения, поэтому вычислительные ресурсы — не самый точный показатель того, насколько компания уделяет внимание безопасности. Это связано с тем, что исследования в области безопасности проводятся отдельными исследователями, которые разрабатывают эксперименты, а это требует много времени, хотя сами эксперименты не требуют больших вычислительных ресурсов. Таким образом, ценность этого показателя не столько в абсолютных цифрах, сколько в том, что он позволяет легко сравнивать похожие проекты разных разработчиков и отслеживать динамику. Что мы обнаружили. За исследуемую неделю около 6% вычислительных ресурсов, задействованных в исследованиях и разработках в области ИИ, было направлено на обеспечение безопасности, и около 12% вычислительных ресурсов, задействованных в исследованиях и разработках в области ИИ, было направлено на обеспечение безопасности. Это намеренно консервативные оценки. Например, если токен использовался не только для повышения безопасности, но и для расширения возможностей, это не учитывалось в данных показателях. Кроме того, эти показатели не учитывают классификаторы защитных мер, которые представляют собой отдельный, сопоставимый объем вычислений и делают наши модели гораздо более безопасными для всего мира. Что разработчик ИИ мог бы сообщить сегодня. Любой разработчик передовых технологий мог бы опубликовать данные о том, какая доля его вычислительных ресурсов, задействованных в исследованиях и разработках в области ИИ, направлена на обеспечение безопасности, с указанием категорий и классификацией, проверенной независимой третьей стороной. Исследования в области безопасности сложно отличить от исследований возможностей, и у каждого разработчика будет соблазн провести эту границу слишком широко. Бремя доказывания того, что работа связана с безопасностью, должно лежать на разработчике. Разработчикам, правительствам и научному сообществу в целом было бы полезно заранее прийти к единому определению. Подобные показатели могут стать основой для будущих действий, например обязательств лаборатории по распределению вычислительных ресурсов на исследования в области безопасности или ограничений на распределение вычислительных ресурсов для исследовательских агентов ИИ. Заключение В то время как мир стремится к передовым технологиям, мы должны сделать все возможное, чтобы сократить разрыв между тем, что известно передовым лабораториям, и тем, что известно широкой общественности. Это означает, что нужно лучше отслеживать развитие ИИ, публично отчитываться о нем и давать обществу возможность решать, как использовать эту информацию. Мы надеемся обеспечить такую прозрачность, публикуя эти данные, и будем продолжать это делать. Приложение Здесь приведены методические подробности по всем измерениям, которые мы провели. Оценка научно-исследовательских и опытно-конструкторских работ на основе искусственного интеллекта Как мы это сделали. Для индекса автоматизации нужны три вещи: полная карта всех научно-исследовательских задач в области ИИ, выполняемых в Anthropic, способ оценки уровня автоматизации и способ определения значимости задач, чтобы важные направления работы имели больший вес, чем менее важные. Ни один человек не может вручную составить список всех научно-исследовательских задач в области ИИ в передовой компании, по крайней мере с той степенью детализации, которая нам нужна. Вместо этого мы составили список задач, отталкиваясь от рабочих записей, в том числе в Slack, и различных источников внутренней документации. Каждую неделю в июле 2026 года мы случайным образом выбирали 20 % сотрудников из каждого отдела, участвующего в научно-исследовательском цикле разработки модели. Исследовательский агент Claude анализировал работу каждого выбранного сотрудника за неделю с помощью Slack и внутренней документации и составлял список задач, над которыми они работали. Повторяя этот процесс каждую неделю в июле 2026 года, мы получили единый список из ~15 000 конкретных задач научно-исследовательского цикла разработки модели. Затем мы использовали Claude, чтобы упорядочить эти задачи в виде иерархического дерева, в корне которого находятся все исследования и разработки в области моделей, а от него ответвляются такие направления, как обучение и разработка продукта, затем — предварительное обучение и обучение с подкреплением, и так далее, вплоть до все более специализированных видов работ. В получившемся дереве 542 узла на разной глубине, из которых 378 — конечные узлы, такие как «диагностика и устранение дефектов оценочной платформы», «эггресс и сетевая политика в песочнице RL» и «анализ инцидентов при обслуживании». Мы фиксируем это дерево, чтобы все наши измерения относились к одной и той же области работ. Для каждого узла в дереве (категории задач, описывающей всю работу, лежащую в ее основе) агент Claude тщательно изучает, как выполняется такая работа в компании: кто ее выполняет, с помощью каких инструментов и в какой степени она автоматизирована. Затем независимый эксперт Claude анализирует полученные данные и присваивает один из шести уровней автоматизации, используя шкалу, предложенную Epoch AI, для определения степени использования ИИ: без участия ИИ, минимальное участие ИИ, ИИ помогает, сотрудничает, руководит или работает автономно. Когда мы оцениваем автоматизацию за определенный месяц, мы разрешаем исследователям, которые выставляют оценки, просматривать данные только за этот месяц или более ранние периоды. Чтобы свести все оценки уровня автоматизации в одно число, мы хотим присвоить каждому узлу в дереве вес, соответствующий тому, насколько важна эта работа для общего процесса исследований и разработок в области моделирования. Вместо того чтобы самим решать, какие виды работы важнее других, мы использовали в качестве косвенного показателя количество человеко-часов, затраченных на выполнение этой задачи. Используя нашу выборку, мы попросили Claude выяснить, над чем работал каждый сотрудник в течение каждой недели июля 2026 года. Каждый сотрудник получает одну единицу веса в неделю, которая равномерно распределяется между задачами, над которыми он работал в эту неделю. Если человек А работал над четырьмя задачами, то каждая из них получает коэффициент 0,25; если человек Б работал над десятью задачами, то каждая из них получает коэффициент 0,10. Вес категории — это сумма всех коэффициентов, полученных в результате учета времени, затраченного каждым сотрудником. Это грубое приближение, но в среднем схема работает разумно: она придает больший вес категориям, над которыми работает много людей. Что это показывает и чего не показывает. Во-первых, оценка автоматизации зависит от модели оценки. Чтобы проверить ее, мы попросили сотрудников Anthropic, отвечающих за соответствующие рабочие области, оценить относительную автоматизацию этих областей. Чтобы обеспечить объективность оценки, сотрудники выставляли баллы, не зная, какие данные собрали модели и как они их оценили. Наша модель-судья соглашалась с людьми примерно так же часто, как люди соглашались друг с другом (точное совпадение оценок модели и человека составило 59 %, а оценок людей — 35 %), а оценки модели и человека в 97 % случаев отличались не более чем на один уровень. При этом сохраняется реальная возможность разногласий в пограничных случаях, например в вопросе о том, где заканчивается «сотрудничество ИИ» и начинается «лидерство ИИ». Во-вторых, корзина заморожена. Растущий индексный номер на базовом уровне за июль 2026 года говорит о том, что работа, которую выполняли люди в то время, автоматизируется; сам по себе этот показатель не говорит о том, появляются ли новые виды работы, на которые перешли люди. Чтобы разобраться в этом, мы создали альтернативную версию замороженного дерева на основе данных за январь 2026 года и сравнили новые задачи, поступающие каждый месяц с февраля по июль 2026 года, с корзиной за январь 2026 года. Мы не обнаружили увеличения количества «новых» задач в корзинах задач за январь и июль, что позволяет предположить, что структура научно-исследовательской работы в области моделей стабильна на нашем уровне анализа. Тем не менее мы планируем периодически обновлять корзину задач и при необходимости корректировать опубликованные показатели автоматизации. Надзор за агентами Как мы это сделали. В нашей наиболее часто используемой внутренней структуре агентов два конструктивных решения позволяют нам легче выявлять неизвестные неизвестные и дают агентам возможность контролировать друг друга:
Что это позволяет и чего не позволяет. При таком масштабе активности агентов сложно быть уверенным в том, что у нас есть полная картина всех возможных вариантов поведения или что мы делаем эти паттерны достаточно понятными для человеческого контроля. Мы занимаемся такого рода мониторингом уже несколько месяцев, а не лет, и ожидаем, что в будущем наука об агентном мониторинге претерпит значительные изменения. Измерение распределения вычислений Как мы это сделали. Мы начали с уже имеющихся у нас инструментов мониторинга вычислительных ресурсов. У Anthropic, как и, вероятно, у любого разработчика, работающего на переднем крае, есть несколько инструментов мониторинга, созданных для планирования мощностей. Они периодически собирают данные об использовании ускорителей и помечают рабочие нагрузки наиболее подходящими метками (например, исследования и разработка моделей, внутреннее использование, собственные логические выводы и т. д.) на основе их метаданных. О том, как используются сторонние облачные вычислительные ресурсы, нам сообщают сами провайдеры, и мы учитываем эти данные. Большая часть работы заключалась в том, чтобы объединить эти существующие источники. Затем мы использовали Claude для классификации каждой рабочей нагрузки как работы, направленной на обеспечение безопасности, или научно-исследовательских и опытно-конструкторских работ в области ИИ, с помощью подсказчивого классификатора. Работа, направленная на обеспечение безопасности, определялась как работа, основная цель которой — сделать системы ИИ более безопасными, понятными или защищенными. Все остальное, включая исследования возможностей, обучение производственных моделей, разработку продуктов и инструментов для разработчиков, относилось к научно-исследовательским и опытно-конструкторским работам в области ИИ. Работа, которая способствует развитию возможностей ИИ в той же мере, что и обеспечению безопасности, также относилась к научно-исследовательским и опытно-конструкторским работам в области ИИ, поэтому доля работ, направленных на обеспечение безопасности, является консервативной. Для исследовательских обучающих и оценочных прогонов мы создали классификатор, который считывает метаданные прогона и использованный код и возвращает классификацию, обоснование и уровень достоверности. Вместо того чтобы классифицировать все почти 10 000 прогонов за неделю, мы взяли около 14% из них, отдав предпочтение прогонам, которые использовали больше всего вычислительных ресурсов, чтобы результат отражал фактическое распределение вычислительных ресурсов, а не общее количество прогонов. Для логического вывода в отношении исследовательских агентов ИИ использовался вариант того же классификатора, который считывал расшифровку сеанса работы агента. Если расшифровка была недоступна (обычно из-за того, что работа была засекречена), мы классифицировали ее по команде пользователя или, в качестве консервативного подхода, относили к категории «Исследования и разработки в области ИИ». Мы планируем усовершенствовать этот конвейер, чтобы независимая третья сторона могла повторно запустить классификатор на случайной подвыборке заданий и расшифровок и проверить как сортировку, так и итоговые данные. Что это отражает, а что нет. Главный вывод этого упражнения заключается в том, что классифицировать то, что является, а что не является работой по обеспечению безопасности, сложно, но возможно, поскольку граница между этими категориями не является четкой. Например, исследования в области масштабируемого надзора могут сделать будущие модели более согласованными, а существующие — более полезными с коммерческой точки зрения. При этом сложно определить, что является приоритетом — безопасность или расширение возможностей. Мы обнаружили, что подробное письменное описание каждой задачи с четкими пограничными случаями (отрывок приведен выше) позволяет классификатору согласовываться с оценками людей в пределах одного-двух процентных пунктов. Но некоторые случаи было слишком сложно определить даже после нескольких часов проверки человеком. Наше описание — один из возможных вариантов, другой разработчик или регулятор может провести границу по-другому. Есть еще три важных ограничения. Во-первых, многие базовые метки, на которые мы опирались (например, причины запуска, теги рабочей нагрузки, источник трафика API), устанавливаются автоматизированными правилами, а иногда и непосредственно пользователями, и являются приблизительными, а не проверенными. В большинстве случаев мы ожидаем, что наши классификации точны, но в некоторых случаях метка может быть неверной, и наш конвейер не обязательно это выявит. Показатель, которому должны доверять сторонние пользователи, должен быть полным, точным и технически реализуемым. Во-вторых, измерение охватывает одну неделю, чего достаточно, чтобы показать, что измерение возможно, но недостаточно, чтобы выявить значимую тенденцию. В-третьих, и это самое важное, показатель доли вычислительных ресурсов отражает только то, что было потрачено. Более эффективный классификатор безопасности или более быстрый стек логического вывода для производственных моделей снижают нагрузку на систему безопасности, но это не значит, что мы уделяем безопасности меньше внимания. Наши собственные накладные расходы на классификаторы снизились с повышением эффективности и выросли, когда производственный логический вывод стал более эффективным, чем классификаторы. Марина Фаваро и Филли Райт выступили соавторами этой статьи при редакционной поддержке Санти Руиса, Адама Фарины и Сары Поллак. Джек Кларк руководил исследованием. Дэн Альтман, Керри Персен, Эй Джей Кураби, Джеймс Брэдбери, Холден Карнофски, Кевин Трой и Авиталь Балвит предоставили свои комментарии. Технические доказательства концепции были разработаны Джун Шерн Чан, Брайаном Калвертом, Франческо Москони, Генри де Валенсом, Фабьеном Роже и Джо Бентоном. Визуальный контент создали Шэн Картер, Джонни Гомес, Мария Гонсалес, Файяз Ашраф, Моника Туховска и Ким Уитхи. Алекс Клауд и Андреа Валлоне организовали семинар, на котором эти и другие предложения по оценке были рассмотрены с привлечением внешних экспертов. Спасибо Нейту Рашу, Эли Лифланду и Питеру Уайлдефорду, которые также оставили свои отзывы. Примечания
Телеграм: t.me/ainewsline Источник: www.anthropic.com Комментарии: |
||||||||||||||||