16 ГБ видеопамяти теперь минимум: разбираем главный гайд по локальным LLM 2026 года

МЕНЮ


Главная страница
Поиск
Регистрация на сайте
Помощь проекту
Архив новостей

ТЕМЫ


Новости ИИРазработка ИИВнедрение ИИРабота разума и сознаниеМодель мозгаРобототехника, БПЛАТрансгуманизмОбработка текстаТеория эволюцииДополненная реальностьЖелезоКиберугрозыНаучный мирИТ индустрияРазработка ПОТеория информацииМатематикаЦифровая экономика

Авторизация



Ахмад Осман, основатель OsmanticAI и модератор GPU-тематики в r/LocalLLaMA, выложил в X большой лонгрид LLMs 101: A Practical Guide (2026 Edition). Его посмотрели больше 430 тысяч раз. Я прочитал его целиком и собрал главное для тех, кто хочет понимать, что происходит внутри модели, и запускать её на своём железе, а не только через API.

Автор предлагает начинать не с выбора видеокарты, а с одного цикла. Текст превращается в токены, токены проходят через трансформер, механизм внимания решает, какие из предыдущих токенов важны, модель выдаёт вероятности и выбирает следующий токен. Потом всё повторяется. Когда этот цикл становится интуитивным, вопросы про VRAM, квантизацию, длину контекста и выбор рантайма решаются почти сами собой.

Токены важнее, чем кажется. От того, как токенизатор режет текст, зависит, сколько влезет в контекстное окно, насколько распухнет KV-кэш и сколько вы прождёте на обработке промпта. Русский текст и код часто токенизируются хуже английского, поэтому одна и та же страница может обходиться заметно дороже. Посмотреть, как это работает вживую, можно в демо-токенизаторе автора: https://ahmadosman.com/tokenizer

KV-кэш Осман называет рабочей памятью модели. Именно он позволяет не пересчитывать весь диалог на каждом шаге, и именно он съедает память на длинных контекстах. Размер считается просто: число токенов умножаем на слои, на KV-головы, на размерность головы, на точность и на два, потому что хранятся и ключи, и значения. Отсюда вывод, который многие узнают на собственном OOM: длинный промпт стоит памяти, и понимать это нужно до покупки GPU.

Ещё одно полезное разделение: prefill и decode. Обработка промпта идёт параллельно и упирается в вычисления. Генерация ответа идёт по одному токену и упирается в пропускную способность памяти, потому что веса приходится прогонять снова и снова. Поэтому две карты с одинаковым объёмом VRAM могут выдавать очень разную скорость.

Формула памяти для локального запуска выглядит так: веса в выбранной квантизации плюс KV-кэш под ваш контекст плюс накладные расходы рантайма и запас. Для весов прикидка простая: FP16 это около 2 байт на параметр, Q8 около 1 байта, Q4 около половины байта. Модель на 27 млрд параметров в Q4 занимает порядка 14 ГБ только весами, а дальше добавляется контекст.

По квантизации рекомендации такие. Q8 почти без потерь, Q6 и Q5 дают хороший баланс, Q4 остаётся золотой серединой для чата и работы с документами. На Q3 и Q2 стоит спускаться, только если иначе модель не влезает: первыми деградируют математика, код, структурированный вывод и вызов инструментов. Важно не путать квантизацию весов и квантизацию KV-кэша. Для кэша практичный минимум сейчас FP8 или INT8, а всё, что ниже, пока территория исследований вроде KIVI (https://arxiv.org/abs/2402.02750) и KVQuant (https://arxiv.org/abs/2401.18079).

Про железо автор формулирует жёстко: 16 ГБ это минимальный комфортный уровень для серьёзной локальной работы, 24 ГБ лучший вариант по соотношению цены и возможностей, а с 48 ГБ и выше открывается по-настоящему сильный локальный мир.

Вторая половина гайда о том, чем всё это запускать. Одному человеку для экспериментов Осман советует Harbor (https://github.com/av/harbor), LM Studio или llama.cpp. Harbor собирает полный стек из фронтендов, бэкендов и сервисов, LM Studio проще всего на десктопе, llama.cpp остаётся портируемой рабочей лошадкой. Для команды или приватного сервиса стоит смотреть на vLLM и SGLang, для максимума на NVIDIA на TensorRT-LLM, для браузера и мобильных на MLC и WebLLM. Главный совет: сначала выбирайте рантайм, потом ищите модель в его формате, потому что llama.cpp живёт на GGUF, а vLLM и SGLang на safetensors.

По моделям автор предлагает думать семействами, а не искать одну лучшую. Qwen 3.5 и 3.6 закрывают весь спектр от ноутбука до мульти-GPU сервера. Отдельно выделена плотная модель на 27 млрд параметров (https://huggingface.co/Qwen/Qwen3.6-27B) с контекстом до 262 тысяч токенов, режимами thinking и non-thinking и OpenAI-совместимым API. По мнению автора, это сильный выбор для связки из двух RTX 3090 под код и агентов. Ещё стоит присмотреться к Gemma 4 от Google DeepMind с лицензией Apache 2.0 и к моделям Z.ai (https://z.ai/).

Отдельный блок посвящён тому, где сейчас идёт гонка. Это уже не только качество моделей, но и эффективность инференса. PagedAttention (https://arxiv.org/abs/2309.06180) борется с потерями памяти на KV-кэше, FP8 KV-кэш стал рабочей фичей в vLLM, DFlash (https://arxiv.org/abs/2602.06036) и DDTree (https://arxiv.org/abs/2604.12989) развивают спекулятивное декодирование. Автор честно предупреждает: ускорение из статьи не равно галочке в настройках десктопного приложения, и часть этого пока живёт только в исследованиях.

Если свести гайд к одной строке, она у автора уже есть: успех с локальной LLM складывается из модели, которая влезает в память, правильного формата промпта, хорошего рантайма и реалистичных тестов на ваших задачах. Большинство поломок растут отсюда же: нехватка памяти, сломанный чат-шаблон, неподдерживаемая архитектура в рантайме или слабый поиск в RAG.

Начать Осман советует просто: Harbor или LM Studio, модель на 4-9 млрд параметров в Q4, контекст от 8 до 32 тысяч токенов и две-три модели одного размера, которые вы сравниваете на одних и тех же промптах. 


Телеграм: t.me/ainewsline

Источник: x.com

Комментарии: