Мы задались вопросом: насколько воспроизводима и эквивалентна математика в LM-моделях? |
||
|
МЕНЮ Главная страница Поиск Регистрация на сайте Помощь проекту Архив новостей ТЕМЫ Новости ИИ Голосовой помощник Разработка ИИГородские сумасшедшие ИИ в медицине ИИ проекты Искусственные нейросети Искусственный интеллект Слежка за людьми Угроза ИИ Атаки на ИИ Внедрение ИИИИ теория Компьютерные науки Машинное обуч. (Ошибки) Машинное обучение Машинный перевод Нейронные сети начинающим Психология ИИ Реализация ИИ Реализация нейросетей Создание беспилотных авто Трезво про ИИ Философия ИИ Big data Работа разума и сознаниеМодель мозгаРобототехника, БПЛАТрансгуманизмОбработка текстаТеория эволюцииДополненная реальностьЖелезоКиберугрозыНаучный мирИТ индустрияРазработка ПОТеория информацииМатематикаЦифровая экономика
Генетические алгоритмы Капсульные нейросети Основы нейронных сетей Промпты. Генеративные запросы Распознавание лиц Распознавание образов Распознавание речи Творчество ИИ Техническое зрение Чат-боты Авторизация |
2026-08-29 12:33 Мы задались вопросом: насколько воспроизводима и эквивалентна математика в LM-моделях? Не просто «есть ли там математика», а можно ли говорить о единых, устойчивых математических структурах, которые возникают в обученных нейросетях независимо от архитектуры, модальности и исследовательской группы. Для этого мы собрали и проанализировали огромный корпус работ — 1047 кандидатов, из которых после жёсткого отбора осталось 700 статей. В них мы искали не просто утверждения о том, что «модель что-то кодирует», а конкретные, фальсифицируемые математические формы: линейные направления, окружности, симплексы, многообразия, операторы, решётки. Что выяснилось? Структуры в моделях действительно возникают сами по себе. Линейное направление — единичный вектор, проекция на который монотонно отражает значение признака, — описывается в 288 статьях, это самый плотный узел нашей карты. Окружности, параметризованные углом и вложенные в пространство активаций, — 33 статьи. Многообразия — топологические пространства, локально устроенные как обычное евклидово пространство, — ещё 33 узла. Симплексы — выпуклые оболочки взаимоисключающих категориальных значений — тоже встречаются регулярно. Но главное — это не разрозненные наблюдения, а система. Мы ввели четыре правила отбора. Первое: объект — только реально обученная модель, никаких аналитических конструкций и синтетических облаков точек. Второе: claim — конкретная математическая структура, которую можно доказать или опровергнуть, а не бенчмарк или точность. Третье: доказательство — оригинальное измерение или вмешательство в статье: количественная оценка формы, причинный стиринг вдоль направления, абляция подпространства, спектральные профили, динамика геометрии в ходе обучения. Четвёртое: структура должна «найтись», а не быть навязанной архитектурой или функцией потерь. Если круг получился только потому, что его закодировали синусами и косинусами, — это не наблюдение. В результате к концу августа в корпусе оказалось 700 статей, 703 наблюдения, 52 структуры и 14 гипотез — всего 66 единиц, и 816 моделей. Каждый объект мы классифицировали по двум осям: роль и фасеты. Роль отвечает на вопрос «чем объект является в математическом смысле» — она всегда одна и назначается по строгому упорядоченному списку вопросов. Фасеты отвечают на вопрос «какой объект» — их может быть много: кривизна, топология, гладкость, линейность, размерность, выпуклость, гомологии, способ задания и так далее. Порядок вопросов критичен. Сначала проверяем, не является ли объект фальсифицируемым утверждением. Потом — определён ли он динамической системой и свойствами устойчивости. Затем — порядок, решётка, граф, матроид, комплекс. Далее — отношение между кортежами точек, отображение или матрица, вычисленное свойство. И только в конце — просто множество точек. Это позволяет сделать роли взаимно исключающими. Например, линейный аттрактор — одновременно одномерное многообразие и аттрактор: у рекуррентной сети неподвижные точки при нулевом входе выстраиваются вдоль кривой, поперёк которой они притягивающие, а вдоль — нейтральные. Концептор — и оператор, и эллипсоид: положительно полуопределённая матрица, которая приглушает направления в зависимости от дисперсии концепта, в отличие от жёсткой проекции. Концептная решётка — и решётка, и набор конусов: атрибуты разрезают пространство полуплоскостями, а концепты образуют полиэдральные конусы, упорядоченные по вложению. Отдельно пришлось ввести запрет на добавление без различающего фасета: если про множество известно только «это какое-то многообразие», оно не попадает в карту. Нужна конкретика: какое именно многообразие, с какой размерностью, кривизной, вложением. Структура в нашей терминологии — это математическая форма: роль плюс фасеты. Таких узлов 65. Наблюдение — конкретное измерение: структура ? модель ? метод ? статья. Поэтому наблюдений 703, а форм 65: одна и та же форма может быть измерена много раз разными людьми в разных моделях. Когда статьи согласны о форме, но расходятся о причине или расширяют её на новый домен — это одна запись структуры. Когда утверждения о форме конкурирующие — данные разделяются на отдельные наблюдения. Мы пробовали альтернативу — просто ключевые слова. Вышла мешанина из 2275 слов. Симпатично, но бесполезно. А в моделях, как в саду, растёт всякое разное: линейное подпространство является многообразием, разделы не параллельны, один вложен в другой. Конус и политоп многообразиями не являются — у конуса особая точка в вершине, у политопа углы. Анизотропия и линейная разделимость — вообще не формы: первое свойство распределения, второе свойство размеченного множества. Поэтому пришлось ортогонализовывать и соглашаться на нюансы. Зато теперь карта не только красивая, но и полезная: можно искать новые методы извлечения структур. Для методов, как и для объектов, оценивается не только факт существования, но и популярность — в виде визуализаций по группам методов. Наконец, мы проверили воспроизводимость. Каждая структура и гипотеза в карте может быть воспроизведена или нет. Это вычисляется автоматически благодаря классификации. Две категории: breadth — по оси набралось два и больше различных значений, например структуру видели на двух классах архитектур; replication — те же два значения пришли из статей, не имеющих общих авторов. Проверка независимости идёт по фамилиям, поэтому есть погрешность, и ошибка всегда в сторону «независимость не доказана». Что в итоге? Математика в AI-моделях — не случайные артефакты, а устойчивые, повторяемые структуры, которые можно систематизировать. Карта из 65 форм и 703 наблюдений показывает: мы имеем дело с закономерностями, которые воспроизводятся в разных семействах моделей, разных архитектурах и разными исследовательскими группами. Это даёт надежду на создание настоящей теории представлений в нейросетях. Но остаётся много открытых вопросов: какие структуры ещё не найдены? Насколько глубоко они определяют поведение модели? Можно ли использовать эти формы для интерпретации и контроля? А как вы думаете, какие ещё математические структуры могут скрываться в активациях больших языковых моделей, и как их можно было бы обнаружить? Телеграм: t.me/ainewsline Источник: vk.com Комментарии: |
|