Интересный вопрос: а в нейросети GPT вообще есть нейроны? |
||
|
МЕНЮ Главная страница Поиск Регистрация на сайте Помощь проекту Архив новостей ТЕМЫ Новости ИИ Голосовой помощник Разработка ИИГородские сумасшедшие ИИ в медицине ИИ проекты Искусственные нейросети Искусственный интеллект Слежка за людьми Угроза ИИ Атаки на ИИ Внедрение ИИИИ теория Компьютерные науки Машинное обуч. (Ошибки) Машинное обучение Машинный перевод Нейронные сети начинающим Психология ИИ Реализация ИИ Реализация нейросетей Создание беспилотных авто Трезво про ИИ Философия ИИ Big data Работа разума и сознаниеМодель мозгаРобототехника, БПЛАТрансгуманизмОбработка текстаТеория эволюцииДополненная реальностьЖелезоКиберугрозыНаучный мирИТ индустрияРазработка ПОТеория информацииМатематикаЦифровая экономика
Генетические алгоритмы Капсульные нейросети Основы нейронных сетей Промпты. Генеративные запросы Распознавание лиц Распознавание образов Распознавание речи Творчество ИИ Техническое зрение Чат-боты Авторизация |
2026-10-03 12:15 Интересный вопрос: а в нейросети GPT вообще есть нейроны? Попадает ли GPT под определение классической многослойной нейросети как MLP и вообще «многослойный перцептрон» есть в GPT, если быть формальным? Я тут читал опусы одного коуча в LinkedIn, который фантазировал что-то там насчёт нейронов в GPT, и мне стало быстро понятно, что он не понимает, что такое нейрон и как его внутри GPT искать, т.к. GPT работает постоянно через умножение матриц, что отличается от классической математики нейрона. По классике нейрон Розенблатта состоит из N входных весов W, которые перемножаются на входной вектор размерности также N, потом обязательно нужна «личная» нелинейная функция активации как сигмоида подобно живому нейрону или ReLU как в GPT, потом нейрон за ней выдаёт строго одно число как ответ. Наличие нелинейной функции критически необходимо, иначе нейросеть быстро поймёт, что зачем ей учить N раздельных матриц умножения и просто их «сложит». Нелинейная функция служит для разделения слоёв. Теперь посмотрим на GPT. Строго говоря, нейрон есть только при входе в перцептрон за Attention. Физически нейроны — это столбцы или строки матрицы нейросети. Я заметил, что часто даже профи оговариваются, включая меня, отмечая один вес как нейрон, а это столбец или строка реально. Нейроны должны быть обязательно независимыми. Поэтому можно переставлять строки и столбцы без развала вычислений нейросети, на этом и базируется профессиональный вариант квантизации NVFP4. Правда, уже есть отклонение от классики использования входных нейронов в перцептроне GPT, т.е. одновременно он выполняет роль «семантической лупы» и переводит векторы в более высокое семантическое пространство смыслов, обычно увеличивая размерность на 4. Но пока это в рамках классического определения нейрона, и далее у них личные ReLU — это нейроны. Отмечу, что такие отклонения от классики строения "одиночных" нейронов фактически в современной литературе привели к тому, что нейрон обычно ассоциируют с выходом линейного слоя + активация. Однако вот вторая матрица MLP, которая и хранит 80% фактов знаний ИИ (первая матрица распознаёт факты нейронами, а вторая кладёт в вектор), уже не попадает под определение классического нейрона, т.е. у неё нет личной нелинейной функции подобной ReLU. Если перейти к Attention, то там классических нейронов нет вообще, т.к. у них «общая» нелинейная функция Softmax на всех. Фактически матрицы головок внимания играют роль проекции в более маленькое подпространство смыслов, но это не полноценные классические нейроны. Интересно, что и сам GPT на деле не попадает под классическое определение многослойной нейросети как MLP. Дело в том, что нейроны и нейронно-подобные структуры не связаны напрямую между собой, а каждый трансформер и перцептрон на деле обновляют векторы в резидуальных потоках, но причём аддитивно без перезаписи, т.е. нет «прямой передачи сигнала» от слоёв нейросети как в мозге человека. Фактически ИИ вместо этого постоянно уточняет векторную репрезентацию задачи в своём скрытом от пользователя векторном состоянии. Думаю, что тем, кто изучает архитектуры нейросетей, это полезные наблюдения. Также напоминаю, что у меня есть серия учебных видео, как работает GPT на базе модели Андрея Карпатого. Телеграм: t.me/ainewsline Источник: t.me Комментарии: |
|