Попробую пояснить суть изобретения MLA (Multi-Head Latent Attention) у DeepSeek, на этой технологии базируются практически все китайские LLM и почему она даёт такой невероятный выигрыш в

МЕНЮ


Главная страница
Поиск
Регистрация на сайте
Помощь проекту
Архив новостей

ТЕМЫ


Новости ИИРазработка ИИВнедрение ИИРабота разума и сознаниеМодель мозгаРобототехника, БПЛАТрансгуманизмОбработка текстаТеория эволюцииДополненная реальностьЖелезоКиберугрозыНаучный мирИТ индустрияРазработка ПОТеория информацииМатематикаЦифровая экономика

Авторизация



1. Суть идеи: Одинаковый сжатый вектор для всех голов внимания вместо «расшаривания»

Главный инсайт MLA можно объяснить аналогом из разработки: вместо того чтобы хранить развёрнутый объект, мы сохраняем только его сжатый L2-архив (Low-Rank Compression), а распаковываем «на лету» прямо в регистрах.

В MLA вместо десятков векторов K и V в KV-кэше как у американцев сохраняется ровно ОДИН низкоранговый сжатый вектор (Latent Vector, например, размерностью 512) на весь токен для всех голов сразу.

Далее идёт изящный трюк Weight Absorbing Trick: при инференсе нам даже не нужно явно распаковывать K и V обратно в память! Матрицы «распаковки» математически перемножаются и встраиваются (поглощаются) напрямую в матрицы запросов и выходных проекций.

Китайский MLA хранит в RAM не гигабайты готовых K/V для каждой головы как у американцев, а единую сжатую проекцию. Вся логика многоголовости восстанавливается у китайцев прямо во время умножения матриц в вычислениях, не нагружая шину памяти.

2. Почему MLA идеально дружит с FlashAttention и SRAM-плитками (Tiling)

Однако это ещё не всё. Китайский MLA открывает двери для использования ими Flash Attention небывалым образом даже на гигантских контекстах. Тот же Kimi K2.6 в реальности даже работает без sparse attention, просто MLA вместе с ещё одним низкоуровневым трюком позволяет им быстро посчитать чудовищные матрицы на миллиарды ячеек.

Чтобы понять этот аспект, нужно вспомнить, как работает GPU на физическом уровне:

1. HBM (High Bandwidth Memory): Огромная, но относительно медленная видеопамять (куда уходит KV-кэш).

2. SRAM (On-Chip Memory): Сверхбыстрый локальный кэш прямо на кристалле GPU (размером всего в десятки мегабайт на SM).

Проблема классического американского Full Attention:

Алгоритм Flash Attention ускоряет Attention тем, что режет матрицы на небольшие «плитки» (tiles), загружает их из HBM в крошечную SRAM, быстро считает Softmax и выбрасывает результат обратно.

Если у вас Full Attention с классической американской реализацией, то даже маленькая «плитка» KV-кэша весит слишком много из-за раздутых векторов всех голов. Плитка банально не влезает в SRAM, из-за чего GPU начинает упираться в пропускную способность HBM (Memory-Bound).

Как MLA разгоняет FlashAttention:

Так как размер одной записи в KV-кэше для токена в MLA в десятки раз меньше (например, ~4.3 KiB или ~68 KiB вместо мегабайтов на токен):

* Плитка вмещает намного больше контекста: В ту же физическую область SRAM помещается блочно в разы больше токенов.

* Минимум I/O операций: GPU читает из HBM tiny-вектор, закидывает его в SRAM и делает все интенсивные вычисления Attention прямо «на чипе» на максимальной скорости Tensor Cores.

Поэтому такие модели, как Kimi K2.6 или GLM-5.2, могут позволить себе «честный» Full Attention (без обрезки контекста скользящими окнами) именно потому, что их KV-плитки идеально ложатся в тайловую архитектуру FlashAttention и не вызывают голодания вычислительных блоков GPU.

На самом деле тут очень много технических последствий не только в сторону себестоимости. DeepSeek V4 применяет распределённое внимание для экстремального удешевления и так при очень низкой себестоимости, но MLA позволяет более фронтирным GLM и Kimi применять Full Attention там, где американцы сидят на sparse attention в духе Big Bird, т.е. на якорных токенах и скользящих окнах цитирования. Фактически это приводит к тому, что китайский фронтир мощнее на большом контексте, т.к. там модель «видит всё».

Пока американцы компенсируют недоработки своей архитектуры GPT просто brute force своих огромных ЦОД и финансовой модели, когда убыточный инференс может существовать за счёт дотаций инвесторов. Однако эксперименты в LLM заканчиваются, всем надо жить по счетам. Дарио постепенно заставляет платить всех в 10-20 раз дороже фикс-тарифов, т.к. это его планка безубыточности.

Обсудить в Telegram: https://t.me/turboproject/4853


Телеграм: t.me/ainewsline

Источник: t.me

Комментарии: