Интересный вопрос: а в нейросети GPT вообще есть нейроны?

МЕНЮ


Главная страница
Поиск
Регистрация на сайте
Помощь проекту
Архив новостей

ТЕМЫ


Новости ИИРазработка ИИВнедрение ИИРабота разума и сознаниеМодель мозгаРобототехника, БПЛАТрансгуманизмОбработка текстаТеория эволюцииДополненная реальностьЖелезоКиберугрозыНаучный мирИТ индустрияРазработка ПОТеория информацииМатематикаЦифровая экономика

Авторизация



Интересный вопрос: а в нейросети GPT вообще есть нейроны? Попадает ли GPT под определение классической многослойной нейросети как MLP и вообще «многослойный перцептрон» есть в GPT, если быть формальным? Я тут читал опусы одного коуча в LinkedIn, который фантазировал что-то там насчёт нейронов в GPT, и мне стало быстро понятно, что он не понимает, что такое нейрон и как его внутри GPT искать, т.к. GPT работает постоянно через умножение матриц, что отличается от классической математики нейрона. 

По классике нейрон Розенблатта состоит из N входных весов W, которые перемножаются на входной вектор размерности также N, потом обязательно нужна «личная» нелинейная функция активации как сигмоида подобно живому нейрону или ReLU как в GPT, потом нейрон за ней выдаёт строго одно число как ответ.

Наличие нелинейной функции критически необходимо, иначе нейросеть быстро поймёт, что зачем ей учить N раздельных матриц умножения и просто их «сложит». Нелинейная функция служит для разделения слоёв.

Теперь посмотрим на GPT. Строго говоря, нейрон есть только при входе в перцептрон за Attention. Физически нейроны — это столбцы или строки матрицы нейросети. Я заметил, что часто даже профи оговариваются, включая меня, отмечая один вес как нейрон, а это столбец или строка реально. Нейроны должны быть обязательно независимыми. Поэтому можно переставлять строки и столбцы без развала вычислений нейросети, на этом и базируется профессиональный вариант квантизации NVFP4. Правда, уже есть отклонение от классики использования входных нейронов в перцептроне GPT, т.е. одновременно он выполняет роль «семантической лупы» и переводит векторы в более высокое семантическое пространство смыслов, обычно увеличивая размерность на 4. Но пока это в рамках классического определения нейрона, и далее у них личные ReLU — это нейроны. Отмечу, что такие отклонения от классики строения "одиночных" нейронов фактически в современной литературе привели к тому, что нейрон обычно ассоциируют с выходом линейного слоя + активация.

Однако вот вторая матрица MLP, которая и хранит 80% фактов знаний ИИ (первая матрица распознаёт факты нейронами, а вторая кладёт в вектор), уже не попадает под определение классического нейрона, т.е. у неё нет личной нелинейной функции подобной ReLU.

Если перейти к Attention, то там классических нейронов нет вообще, т.к. у них «общая» нелинейная функция Softmax на всех. Фактически матрицы головок внимания играют роль проекции в более маленькое подпространство смыслов, но это не полноценные классические нейроны.

Интересно, что и сам GPT на деле не попадает под классическое определение многослойной нейросети как MLP. Дело в том, что нейроны и нейронно-подобные структуры не связаны напрямую между собой, а каждый трансформер и перцептрон на деле обновляют векторы в резидуальных потоках, но причём аддитивно без перезаписи, т.е. нет «прямой передачи сигнала» от слоёв нейросети как в мозге человека. Фактически ИИ вместо этого постоянно уточняет векторную репрезентацию задачи в своём скрытом от пользователя векторном состоянии.

Думаю, что тем, кто изучает архитектуры нейросетей, это полезные наблюдения. Также напоминаю, что у меня есть серия учебных видео, как работает GPT на базе модели Андрея Карпатого.


Телеграм: t.me/ainewsline

Источник: t.me

Комментарии: