В свете успешного прогресса Kimi K3 в создании гибридов линейного (State) и квадратичного внимания трансформеров, думаю, стоит пояснить, почему Ян Чжилинь говорит, что оставит без работы всех |
||
|
МЕНЮ Главная страница Поиск Регистрация на сайте Помощь проекту Архив новостей ТЕМЫ Новости ИИ Голосовой помощник Разработка ИИГородские сумасшедшие ИИ в медицине ИИ проекты Искусственные нейросети Искусственный интеллект Слежка за людьми Угроза ИИ Атаки на ИИ Внедрение ИИИИ теория Компьютерные науки Машинное обуч. (Ошибки) Машинное обучение Машинный перевод Нейронные сети начинающим Психология ИИ Реализация ИИ Реализация нейросетей Создание беспилотных авто Трезво про ИИ Философия ИИ Big data Работа разума и сознаниеМодель мозгаРобототехника, БПЛАТрансгуманизмОбработка текстаТеория эволюцииДополненная реальностьЖелезоКиберугрозыНаучный мирИТ индустрияРазработка ПОТеория информацииМатематикаЦифровая экономика
Генетические алгоритмы Капсульные нейросети Основы нейронных сетей Промпты. Генеративные запросы Распознавание лиц Распознавание образов Распознавание речи Творчество ИИ Техническое зрение Чат-боты Авторизация |
2026-07-24 21:51 В свете успешного прогресса Kimi K3 в создании гибридов линейного (State) и квадратичного внимания трансформеров, думаю, стоит пояснить, почему Ян Чжилинь говорит, что оставит без работы всех студентов, пошедших на курсы по дообучению (fine-tuning) нейросетей. Это важный вопрос: разгром fine-tuning Ян по факту поставил на своём роудмапе к AGI, и это его стратегическая цель. Она не из кровожадности, а просто потому, что он считает: настоящий AGI должен уметь обучаться без градиентного спуска на ходу. Чтобы понять, о чём речь, стоит вспомнить классическую работу «Linear Transformers Are Secretly Fast Weight Programmers» . В ней указывается, что системы с линейным вниманием, то есть на State, как Kimi, на деле эмерджентно владеют технологией Fast Weights. Сейчас мы все работаем с LLM, обученными на градиентном спуске, которые не умеют обучаться по-настоящему в процессе работы с контекстом, хотя ICL у современных GPT очень мощен. Но не так мощен, как Fast Weights. Тут нужно вернуться в 1990-е, на зарю становления нейросетей: там вообще-то работали не только с градиентным спуском, но часто применяли технологию Fast Weights. Веса Fast Weights не обучаются градиентным спуском напрямую, они перепрограммируются на лету на каждом шаге. Потом оказалось, что системы чисто на градиентном спуске просто имеют более высокий IQ, хотя и не умеют делать такие фокусы. Дело в том, что State у Ян Чжилиня как раз такой «фокусник» и может эмулировать аналог Fast Weights. Это происходит так: когда загружается контекст через State, по факту часть State по смыслу напоминает уже поправки к весам модели на манер LoRa On?fly. Ян несётся как паровоз к экстремально длинным контекстам в 1 миллиард токенов или даже бесконечным, потому что ему, чтобы «убить» всех инженеров fine?tuning, нужно просто сделать контекст модели таким, чтобы туда влезали «боевые датасеты». Тогда после такого ICL модель по факту получает практически полный математический эквивалент fine?tuning как от настоящего обучения с коррекцией весов. Мораль тут такая: 1. Если вы сейчас изучаете, как дообучать нейросети, уже делайте «План Б»: такой работы может не быть, если Ян доведёт до ума свой Kimi, а он стремится к этому с упорством почти научного маньяка. 2. Следует ожидать, что в ближайшее время появятся ИИ, которые легко обучаются на вашу задачу. 3. Все LLM с обучением на какие-то специальные темы (например, лучшая поддержка русского языка) будут уничтожены такими моделями — все такие специальные темы будут легко дообучены простым прогоном датасета через чат модели и сохранением её итогового State физически. https://arxiv.org/abs/2102.11174 Телеграм: t.me/ainewsline Источник: vk.com Комментарии: |
|