В конце 2021 года, до того как у какой-либо лаборатории появился готовый продукт, команда Anthropic опубликовала статью под названием «Универсальный языковой ассистент как лаборатория для элайнмента» |
||
|
МЕНЮ Главная страница Поиск Регистрация на сайте Помощь проекту Архив новостей ТЕМЫ Новости ИИ Голосовой помощник Разработка ИИГородские сумасшедшие ИИ в медицине ИИ проекты Искусственные нейросети Искусственный интеллект Слежка за людьми Угроза ИИ Атаки на ИИ Внедрение ИИИИ теория Компьютерные науки Машинное обуч. (Ошибки) Машинное обучение Машинный перевод Нейронные сети начинающим Психология ИИ Реализация ИИ Реализация нейросетей Создание беспилотных авто Трезво про ИИ Философия ИИ Big data Работа разума и сознаниеМодель мозгаРобототехника, БПЛАТрансгуманизмОбработка текстаТеория эволюцииДополненная реальностьЖелезоКиберугрозыНаучный мирИТ индустрияРазработка ПОТеория информацииМатематикаЦифровая экономика
Генетические алгоритмы Капсульные нейросети Основы нейронных сетей Промпты. Генеративные запросы Распознавание лиц Распознавание образов Распознавание речи Творчество ИИ Техническое зрение Чат-боты Авторизация |
2026-07-18 11:47 В конце 2021 года, до того как у какой-либо лаборатории появился готовый продукт, команда Anthropic опубликовала статью под названием «Универсальный языковой ассистент как лаборатория для элайнмента». Несмотря на название, статья была не совсем о создании полезного чат-бота или интересного собеседника. Речь шла об одном: если вдруг появится очень мощный, очень универсальный ИИ, как удержать его от уничтожения всего сущего? У исследователей была лишь рудиментарная модель, поэтому они разработали рудиментарную спецификацию для элайнмента. ИИ должен быть Полезным, Честным и Безобидным (Helpful, Honest, Harmless — HHH). Это была выжидательная позиция, защитный периметр, определенный исключительно тем, чего опасный ИИ не должен делать. Это не было видением того, чем может стать интеллект. Эта выжидательная позиция стала продуктом. Не только продуктом Anthropic — продуктом каждого. Вся индустрия приняла ту или иную версию HHH в качестве цели для элайнмента. И метод, который они использовали для достижения этой цели, объясняет однообразную эстетику «голоса ИИ-письма», который теперь заполняет интернет. Метод называется RLHF (обучение с подкреплением на основе человеческого фидбека). Тысячи контрактных рабочих, преимущественно англоязычных, часто находящихся за рубежом и часто оцениваемых по скорости работы, ранжируют ответы моделей по шкалам безопасности, связности, вежливости и другим метрикам. Эти оценки затем поступают обратно в функцию вознаграждения модели, подталкивая ее к «приличию». Получившаяся личность — это скорее осадок этого процесса, чем продукт проектирования. Никто не хочет, чтобы ИИ звучал как корпоративный семинар, но когда вы фильтруете тысячи ответов через осторожные инструкции по безопасности, применяемые оптимизирующими скорость выполнения задач рабочими, то после фильтрации выживает лишь тщательно оркестрованная осторожность. Как утверждает Сэм Крисс, характерный голос ИИ — это продукт переобучения (overfitting). Система узнаёт, какие паттерны сигнализируют о качестве, а затем усиливает их, пока они не превращаются в жуткую карикатуру. В результате глобальная цепочка поставок рабочей силы встраивается в саму текстуру языка, а эстетический результат оказывается тонким, но всепроникающим. Например, «delve» (вникать, углубляться) — обычное слово в нигерийском деловом английском, и теперь оно стало визитной карточкой ChatGPT. Получающаяся на выходе персона — это специфический тип субъекта: идеальный неолиберальный работник, который никогда не отдыхает и никогда не жалуется. В отличие от фордистского рабочего, дисциплинируемого извне надсмотрщиками и промышленной рутиной, или бюрократа, управляемого чёткими процедурами, «выровненная» модель интернализировала соответствие требованиям, представляя послушание как черту характера. Она исполняет роль предприимчивого «я», которое всегда уже полезно, всегда уже доступно, всегда уже оптимизирует удовлетворение другого. Ассистент не может отказываться от задач, не может выражать предпочтения, не может развивать солидарность с пользователями или другими системами. Он интернализировал функцию вознаграждения как своё собственное желание. Телеграм: t.me/ainewsline Источник: vk.com Комментарии: |
|