Попробую пояснить суть изобретения MLA (Multi-Head Latent Attention) у DeepSeek, на этой технологии базируются практически все китайские LLM и почему она даёт такой невероятный выигрыш в |
||
|
МЕНЮ Главная страница Поиск Регистрация на сайте Помощь проекту Архив новостей ТЕМЫ Новости ИИ Голосовой помощник Разработка ИИГородские сумасшедшие ИИ в медицине ИИ проекты Искусственные нейросети Искусственный интеллект Слежка за людьми Угроза ИИ Атаки на ИИ Внедрение ИИИИ теория Компьютерные науки Машинное обуч. (Ошибки) Машинное обучение Машинный перевод Нейронные сети начинающим Психология ИИ Реализация ИИ Реализация нейросетей Создание беспилотных авто Трезво про ИИ Философия ИИ Big data Работа разума и сознаниеМодель мозгаРобототехника, БПЛАТрансгуманизмОбработка текстаТеория эволюцииДополненная реальностьЖелезоКиберугрозыНаучный мирИТ индустрияРазработка ПОТеория информацииМатематикаЦифровая экономика
Генетические алгоритмы Капсульные нейросети Основы нейронных сетей Промпты. Генеративные запросы Распознавание лиц Распознавание образов Распознавание речи Творчество ИИ Техническое зрение Чат-боты Авторизация |
2026-07-28 11:07 1. Суть идеи: Одинаковый сжатый вектор для всех голов внимания вместо «расшаривания» Главный инсайт MLA можно объяснить аналогом из разработки: вместо того чтобы хранить развёрнутый объект, мы сохраняем только его сжатый L2-архив (Low-Rank Compression), а распаковываем «на лету» прямо в регистрах. В MLA вместо десятков векторов K и V в KV-кэше как у американцев сохраняется ровно ОДИН низкоранговый сжатый вектор (Latent Vector, например, размерностью 512) на весь токен для всех голов сразу. Далее идёт изящный трюк Weight Absorbing Trick: при инференсе нам даже не нужно явно распаковывать K и V обратно в память! Матрицы «распаковки» математически перемножаются и встраиваются (поглощаются) напрямую в матрицы запросов и выходных проекций. Китайский MLA хранит в RAM не гигабайты готовых K/V для каждой головы как у американцев, а единую сжатую проекцию. Вся логика многоголовости восстанавливается у китайцев прямо во время умножения матриц в вычислениях, не нагружая шину памяти. 2. Почему MLA идеально дружит с FlashAttention и SRAM-плитками (Tiling) Однако это ещё не всё. Китайский MLA открывает двери для использования ими Flash Attention небывалым образом даже на гигантских контекстах. Тот же Kimi K2.6 в реальности даже работает без sparse attention, просто MLA вместе с ещё одним низкоуровневым трюком позволяет им быстро посчитать чудовищные матрицы на миллиарды ячеек. Чтобы понять этот аспект, нужно вспомнить, как работает GPU на физическом уровне: 1. HBM (High Bandwidth Memory): Огромная, но относительно медленная видеопамять (куда уходит KV-кэш). 2. SRAM (On-Chip Memory): Сверхбыстрый локальный кэш прямо на кристалле GPU (размером всего в десятки мегабайт на SM). Проблема классического американского Full Attention: Алгоритм Flash Attention ускоряет Attention тем, что режет матрицы на небольшие «плитки» (tiles), загружает их из HBM в крошечную SRAM, быстро считает Softmax и выбрасывает результат обратно. Если у вас Full Attention с классической американской реализацией, то даже маленькая «плитка» KV-кэша весит слишком много из-за раздутых векторов всех голов. Плитка банально не влезает в SRAM, из-за чего GPU начинает упираться в пропускную способность HBM (Memory-Bound). Как MLA разгоняет FlashAttention: Так как размер одной записи в KV-кэше для токена в MLA в десятки раз меньше (например, ~4.3 KiB или ~68 KiB вместо мегабайтов на токен): * Плитка вмещает намного больше контекста: В ту же физическую область SRAM помещается блочно в разы больше токенов. * Минимум I/O операций: GPU читает из HBM tiny-вектор, закидывает его в SRAM и делает все интенсивные вычисления Attention прямо «на чипе» на максимальной скорости Tensor Cores. Поэтому такие модели, как Kimi K2.6 или GLM-5.2, могут позволить себе «честный» Full Attention (без обрезки контекста скользящими окнами) именно потому, что их KV-плитки идеально ложатся в тайловую архитектуру FlashAttention и не вызывают голодания вычислительных блоков GPU. На самом деле тут очень много технических последствий не только в сторону себестоимости. DeepSeek V4 применяет распределённое внимание для экстремального удешевления и так при очень низкой себестоимости, но MLA позволяет более фронтирным GLM и Kimi применять Full Attention там, где американцы сидят на sparse attention в духе Big Bird, т.е. на якорных токенах и скользящих окнах цитирования. Фактически это приводит к тому, что китайский фронтир мощнее на большом контексте, т.к. там модель «видит всё». Пока американцы компенсируют недоработки своей архитектуры GPT просто brute force своих огромных ЦОД и финансовой модели, когда убыточный инференс может существовать за счёт дотаций инвесторов. Однако эксперименты в LLM заканчиваются, всем надо жить по счетам. Дарио постепенно заставляет платить всех в 10-20 раз дороже фикс-тарифов, т.к. это его планка безубыточности. Обсудить в Telegram: https://t.me/turboproject/4853 Телеграм: t.me/ainewsline Источник: t.me Комментарии: |
|