Мы задались вопросом: насколько воспроизводима и эквивалентна математика в LM-моделях?

МЕНЮ


Главная страница
Поиск
Регистрация на сайте
Помощь проекту
Архив новостей

ТЕМЫ


Новости ИИРазработка ИИВнедрение ИИРабота разума и сознаниеМодель мозгаРобототехника, БПЛАТрансгуманизмОбработка текстаТеория эволюцииДополненная реальностьЖелезоКиберугрозыНаучный мирИТ индустрияРазработка ПОТеория информацииМатематикаЦифровая экономика

Авторизация



2026-08-29 12:33

ИИ теория

Мы задались вопросом: насколько воспроизводима и эквивалентна математика в LM-моделях? Не просто «есть ли там математика», а можно ли говорить о единых, устойчивых математических структурах, которые возникают в обученных нейросетях независимо от архитектуры, модальности и исследовательской группы. Для этого мы собрали и проанализировали огромный корпус работ — 1047 кандидатов, из которых после жёсткого отбора осталось 700 статей. В них мы искали не просто утверждения о том, что «модель что-то кодирует», а конкретные, фальсифицируемые математические формы: линейные направления, окружности, симплексы, многообразия, операторы, решётки.

Что выяснилось? Структуры в моделях действительно возникают сами по себе. Линейное направление — единичный вектор, проекция на который монотонно отражает значение признака, — описывается в 288 статьях, это самый плотный узел нашей карты. Окружности, параметризованные углом и вложенные в пространство активаций, — 33 статьи. Многообразия — топологические пространства, локально устроенные как обычное евклидово пространство, — ещё 33 узла. Симплексы — выпуклые оболочки взаимоисключающих категориальных значений — тоже встречаются регулярно. Но главное — это не разрозненные наблюдения, а система.

Мы ввели четыре правила отбора. Первое: объект — только реально обученная модель, никаких аналитических конструкций и синтетических облаков точек. Второе: claim — конкретная математическая структура, которую можно доказать или опровергнуть, а не бенчмарк или точность. Третье: доказательство — оригинальное измерение или вмешательство в статье: количественная оценка формы, причинный стиринг вдоль направления, абляция подпространства, спектральные профили, динамика геометрии в ходе обучения. Четвёртое: структура должна «найтись», а не быть навязанной архитектурой или функцией потерь. Если круг получился только потому, что его закодировали синусами и косинусами, — это не наблюдение.

В результате к концу августа в корпусе оказалось 700 статей, 703 наблюдения, 52 структуры и 14 гипотез — всего 66 единиц, и 816 моделей. Каждый объект мы классифицировали по двум осям: роль и фасеты. Роль отвечает на вопрос «чем объект является в математическом смысле» — она всегда одна и назначается по строгому упорядоченному списку вопросов. Фасеты отвечают на вопрос «какой объект» — их может быть много: кривизна, топология, гладкость, линейность, размерность, выпуклость, гомологии, способ задания и так далее.

Порядок вопросов критичен. Сначала проверяем, не является ли объект фальсифицируемым утверждением. Потом — определён ли он динамической системой и свойствами устойчивости. Затем — порядок, решётка, граф, матроид, комплекс. Далее — отношение между кортежами точек, отображение или матрица, вычисленное свойство. И только в конце — просто множество точек. Это позволяет сделать роли взаимно исключающими. Например, линейный аттрактор — одновременно одномерное многообразие и аттрактор: у рекуррентной сети неподвижные точки при нулевом входе выстраиваются вдоль кривой, поперёк которой они притягивающие, а вдоль — нейтральные. Концептор — и оператор, и эллипсоид: положительно полуопределённая матрица, которая приглушает направления в зависимости от дисперсии концепта, в отличие от жёсткой проекции. Концептная решётка — и решётка, и набор конусов: атрибуты разрезают пространство полуплоскостями, а концепты образуют полиэдральные конусы, упорядоченные по вложению.

Отдельно пришлось ввести запрет на добавление без различающего фасета: если про множество известно только «это какое-то многообразие», оно не попадает в карту. Нужна конкретика: какое именно многообразие, с какой размерностью, кривизной, вложением.

Структура в нашей терминологии — это математическая форма: роль плюс фасеты. Таких узлов 65. Наблюдение — конкретное измерение: структура ? модель ? метод ? статья. Поэтому наблюдений 703, а форм 65: одна и та же форма может быть измерена много раз разными людьми в разных моделях. Когда статьи согласны о форме, но расходятся о причине или расширяют её на новый домен — это одна запись структуры. Когда утверждения о форме конкурирующие — данные разделяются на отдельные наблюдения.

Мы пробовали альтернативу — просто ключевые слова. Вышла мешанина из 2275 слов. Симпатично, но бесполезно. А в моделях, как в саду, растёт всякое разное: линейное подпространство является многообразием, разделы не параллельны, один вложен в другой. Конус и политоп многообразиями не являются — у конуса особая точка в вершине, у политопа углы. Анизотропия и линейная разделимость — вообще не формы: первое свойство распределения, второе свойство размеченного множества.

Поэтому пришлось ортогонализовывать и соглашаться на нюансы. Зато теперь карта не только красивая, но и полезная: можно искать новые методы извлечения структур. Для методов, как и для объектов, оценивается не только факт существования, но и популярность — в виде визуализаций по группам методов.

Наконец, мы проверили воспроизводимость. Каждая структура и гипотеза в карте может быть воспроизведена или нет. Это вычисляется автоматически благодаря классификации. Две категории: breadth — по оси набралось два и больше различных значений, например структуру видели на двух классах архитектур; replication — те же два значения пришли из статей, не имеющих общих авторов. Проверка независимости идёт по фамилиям, поэтому есть погрешность, и ошибка всегда в сторону «независимость не доказана».

Что в итоге? Математика в AI-моделях — не случайные артефакты, а устойчивые, повторяемые структуры, которые можно систематизировать. Карта из 65 форм и 703 наблюдений показывает: мы имеем дело с закономерностями, которые воспроизводятся в разных семействах моделей, разных архитектурах и разными исследовательскими группами. Это даёт надежду на создание настоящей теории представлений в нейросетях. Но остаётся много открытых вопросов: какие структуры ещё не найдены? Насколько глубоко они определяют поведение модели? Можно ли использовать эти формы для интерпретации и контроля?

А как вы думаете, какие ещё математические структуры могут скрываться в активациях больших языковых моделей, и как их можно было бы обнаружить?


Телеграм: t.me/ainewsline

Источник: vk.com

Комментарии: