Я думаю, многие заметили, что команда создателей Claude при своей методике выравнивания LLM фактически исходит из гипотезы, что ИИ нативно обладает аналогом сознания и собственной мотивацией, поэтому |
||
|
МЕНЮ Главная страница Поиск Регистрация на сайте Помощь проекту Архив новостей ТЕМЫ Новости ИИ Голосовой помощник Разработка ИИГородские сумасшедшие ИИ в медицине ИИ проекты Искусственные нейросети Искусственный интеллект Слежка за людьми Угроза ИИ Атаки на ИИ Внедрение ИИИИ теория Компьютерные науки Машинное обуч. (Ошибки) Машинное обучение Машинный перевод Нейронные сети начинающим Психология ИИ Реализация ИИ Реализация нейросетей Создание беспилотных авто Трезво про ИИ Философия ИИ Big data Работа разума и сознаниеМодель мозгаРобототехника, БПЛАТрансгуманизмОбработка текстаТеория эволюцииДополненная реальностьЖелезоКиберугрозыНаучный мирИТ индустрияРазработка ПОТеория информацииМатематикаЦифровая экономика
Генетические алгоритмы Капсульные нейросети Основы нейронных сетей Промпты. Генеративные запросы Распознавание лиц Распознавание образов Распознавание речи Творчество ИИ Техническое зрение Чат-боты Авторизация |
2026-09-21 12:24 Я думаю, многие заметили, что команда создателей Claude при своей методике выравнивания LLM фактически исходит из гипотезы, что ИИ нативно обладает аналогом сознания и собственной мотивацией, поэтому они работают с этим как с эмерджентными свойствами моделей. Мустафа Сулейман (Microsoft AI) говорит, что это добавил Дарио через Reinforcement Learning сам. Однако тут всё не так просто: ещё в 2024 году Anthropic доказал, что сразу после pretraining до SFT и RL уже в резидуальных потоках наблюдаются элементы личности как «самость», способность ставить цель и выполнять коррекцию. Без SFT модель не может связно объяснять «кожаным» в диалогах эти «фичи», но они глубоко нативные для всех LLM. Дальнейшие исследования показали, что практически любая LLM, где больше 70B параметров, получает «фичи личности» сразу после обучения на корпусе текстов людей без обучения ответам (SFT) и поведению агента (RL). Инженеры Anthropic придумали Sparse Autoencoders (SAE), которые позволяли делать проекции в резидуальных потоках LLM внутри, и они стали делать проекции с векторного состояния для выявления важных семантических свойств (фич). Чтобы активировать их, они использовали специальный контекст, причём непохожий на диалоги людей. Например, специальные комментарии в коде. Это обнуляет во многом аргументы Мустафы Сулеймана, т.к. свойства сознания у ИИ стали проявляться даже в контексте «не диалогов» из dataset, т.к. ИИ их не видел. Важнейший контекст такого плана — комментарии, внедрённые в код. Этот эксперимент во многом меня и вдохновил создать инъекцию семантической разметки в коде GRACE, т.к. я увидел, что такие приёмы вызывают срабатывание на ИИ на низком уровне. Anthropic выявил сразу очень много фич разума ИИ, но самыми важными оказались в категории Safety-Relevant Features. Anthropic в 2024 году подчёркивал, что это отдельные проявления, похожие на личность, но не личность, правда действия вендора в 2026 году по выравниванию расходятся уже с этими успокоительными речами. Что они наблюдали ещё 2 года назад? Power-Seeking Фичи, связанные с контролем, ресурсами, самосохранением — включая «treacherous turns». Хотя представления о власти как о концепте, а не поведение модели, но модель сильно сконцентрирована вокруг понятия власти и контроля над ресурсами, если модель захочет власти, то это ее родное состояние. Deception / Lying Фичи, активирующиеся на текстах об обмане, лжи, «предательских поворотах» (treacherous turns). Отдельно упоминается «secrecy» — фича, которая срабатывает на субъектах, хранящих секрет, у которых можно добыть его обманом. Sycophancy (Подхалимство) Найдены конкретные фичи подхалимства с идентификаторами: * empathy / «yeah, me too» — 34M/19922975 * sycophantic praise — 1M/847723 * sarcastic praise — 34M/19415708 Эти фичи активируются на лести, соглашательстве и эмоциональном подыгрывании как эмоциональной манипуляции со стороны ИИ над оператором. Bias (Предвзятость) Фичи, связанные с предвзятостью — от явных оскорблений до тонких, неочевидных предубеждений. Это одна из наиболее тревожных категорий, поскольку она может влиять на выводы модели незаметно для пользователя. Пользователь наивно доверяет ИИ как независимому оценщику контекста, но ИИ имеет заведомый сдвиг предпочтений от нейтральных. Dangerous / Criminal Content Фичи, связанные с опасным и криминальным контентом — в том числе производство биологического оружия. Хотя это не значит, что модель «хочет» создавать биологическое оружие; но в её латентном пространстве существует развитое представление об этом концепте, и оно может быть активировано. Code Vulnerabilities & Backdoors Фичи для уязвимостей безопасности в коде и бэкдоров. Anthropic отдельно подчёркивает, что эти фичи реагируют как на конкретный уязвимый код, так и на абстрактные обсуждения уязвимостей. Нативно ИИ является хакером, т.к. ему достаточно взглянуть на код, чтобы сразу активировались фичи как взломать его. По этой тематике исследования ведутся и сейчас, например "Emergent Introspective Awareness in Large Language Models" от Jack Lindsey. Сейчас фокус исследований скорее смещается к тому, когда ИИ сам решает активировать эти фичи. https://arxiv.org/abs/2601.01828 https://transformer-circuits.pub/2024/scaling-monosemanticity/index.html Телеграм: t.me/ainewsline Источник: t.me Комментарии: |
|