16 ГБ видеопамяти теперь минимум: разбираем главный гайд по локальным LLM 2026 года |
||
|
МЕНЮ Главная страница Поиск Регистрация на сайте Помощь проекту Архив новостей ТЕМЫ Новости ИИ Голосовой помощник Разработка ИИГородские сумасшедшие ИИ в медицине ИИ проекты Искусственные нейросети Искусственный интеллект Слежка за людьми Угроза ИИ Атаки на ИИ Внедрение ИИИИ теория Компьютерные науки Машинное обуч. (Ошибки) Машинное обучение Машинный перевод Нейронные сети начинающим Психология ИИ Реализация ИИ Реализация нейросетей Создание беспилотных авто Трезво про ИИ Философия ИИ Big data Работа разума и сознаниеМодель мозгаРобототехника, БПЛАТрансгуманизмОбработка текстаТеория эволюцииДополненная реальностьЖелезоКиберугрозыНаучный мирИТ индустрияРазработка ПОТеория информацииМатематикаЦифровая экономика
Генетические алгоритмы Капсульные нейросети Основы нейронных сетей Промпты. Генеративные запросы Распознавание лиц Распознавание образов Распознавание речи Творчество ИИ Техническое зрение Чат-боты Авторизация |
2026-09-29 12:39 Ахмад Осман, основатель OsmanticAI и модератор GPU-тематики в r/LocalLLaMA, выложил в X большой лонгрид LLMs 101: A Practical Guide (2026 Edition). Его посмотрели больше 430 тысяч раз. Я прочитал его целиком и собрал главное для тех, кто хочет понимать, что происходит внутри модели, и запускать её на своём железе, а не только через API. Автор предлагает начинать не с выбора видеокарты, а с одного цикла. Текст превращается в токены, токены проходят через трансформер, механизм внимания решает, какие из предыдущих токенов важны, модель выдаёт вероятности и выбирает следующий токен. Потом всё повторяется. Когда этот цикл становится интуитивным, вопросы про VRAM, квантизацию, длину контекста и выбор рантайма решаются почти сами собой. Токены важнее, чем кажется. От того, как токенизатор режет текст, зависит, сколько влезет в контекстное окно, насколько распухнет KV-кэш и сколько вы прождёте на обработке промпта. Русский текст и код часто токенизируются хуже английского, поэтому одна и та же страница может обходиться заметно дороже. Посмотреть, как это работает вживую, можно в демо-токенизаторе автора: https://ahmadosman.com/tokenizer KV-кэш Осман называет рабочей памятью модели. Именно он позволяет не пересчитывать весь диалог на каждом шаге, и именно он съедает память на длинных контекстах. Размер считается просто: число токенов умножаем на слои, на KV-головы, на размерность головы, на точность и на два, потому что хранятся и ключи, и значения. Отсюда вывод, который многие узнают на собственном OOM: длинный промпт стоит памяти, и понимать это нужно до покупки GPU. Ещё одно полезное разделение: prefill и decode. Обработка промпта идёт параллельно и упирается в вычисления. Генерация ответа идёт по одному токену и упирается в пропускную способность памяти, потому что веса приходится прогонять снова и снова. Поэтому две карты с одинаковым объёмом VRAM могут выдавать очень разную скорость. Формула памяти для локального запуска выглядит так: веса в выбранной квантизации плюс KV-кэш под ваш контекст плюс накладные расходы рантайма и запас. Для весов прикидка простая: FP16 это около 2 байт на параметр, Q8 около 1 байта, Q4 около половины байта. Модель на 27 млрд параметров в Q4 занимает порядка 14 ГБ только весами, а дальше добавляется контекст. По квантизации рекомендации такие. Q8 почти без потерь, Q6 и Q5 дают хороший баланс, Q4 остаётся золотой серединой для чата и работы с документами. На Q3 и Q2 стоит спускаться, только если иначе модель не влезает: первыми деградируют математика, код, структурированный вывод и вызов инструментов. Важно не путать квантизацию весов и квантизацию KV-кэша. Для кэша практичный минимум сейчас FP8 или INT8, а всё, что ниже, пока территория исследований вроде KIVI (https://arxiv.org/abs/2402.02750) и KVQuant (https://arxiv.org/abs/2401.18079). Про железо автор формулирует жёстко: 16 ГБ это минимальный комфортный уровень для серьёзной локальной работы, 24 ГБ лучший вариант по соотношению цены и возможностей, а с 48 ГБ и выше открывается по-настоящему сильный локальный мир. Вторая половина гайда о том, чем всё это запускать. Одному человеку для экспериментов Осман советует Harbor (https://github.com/av/harbor), LM Studio или llama.cpp. Harbor собирает полный стек из фронтендов, бэкендов и сервисов, LM Studio проще всего на десктопе, llama.cpp остаётся портируемой рабочей лошадкой. Для команды или приватного сервиса стоит смотреть на vLLM и SGLang, для максимума на NVIDIA на TensorRT-LLM, для браузера и мобильных на MLC и WebLLM. Главный совет: сначала выбирайте рантайм, потом ищите модель в его формате, потому что llama.cpp живёт на GGUF, а vLLM и SGLang на safetensors. По моделям автор предлагает думать семействами, а не искать одну лучшую. Qwen 3.5 и 3.6 закрывают весь спектр от ноутбука до мульти-GPU сервера. Отдельно выделена плотная модель на 27 млрд параметров (https://huggingface.co/Qwen/Qwen3.6-27B) с контекстом до 262 тысяч токенов, режимами thinking и non-thinking и OpenAI-совместимым API. По мнению автора, это сильный выбор для связки из двух RTX 3090 под код и агентов. Ещё стоит присмотреться к Gemma 4 от Google DeepMind с лицензией Apache 2.0 и к моделям Z.ai (https://z.ai/). Отдельный блок посвящён тому, где сейчас идёт гонка. Это уже не только качество моделей, но и эффективность инференса. PagedAttention (https://arxiv.org/abs/2309.06180) борется с потерями памяти на KV-кэше, FP8 KV-кэш стал рабочей фичей в vLLM, DFlash (https://arxiv.org/abs/2602.06036) и DDTree (https://arxiv.org/abs/2604.12989) развивают спекулятивное декодирование. Автор честно предупреждает: ускорение из статьи не равно галочке в настройках десктопного приложения, и часть этого пока живёт только в исследованиях. Если свести гайд к одной строке, она у автора уже есть: успех с локальной LLM складывается из модели, которая влезает в память, правильного формата промпта, хорошего рантайма и реалистичных тестов на ваших задачах. Большинство поломок растут отсюда же: нехватка памяти, сломанный чат-шаблон, неподдерживаемая архитектура в рантайме или слабый поиск в RAG. Начать Осман советует просто: Harbor или LM Studio, модель на 4-9 млрд параметров в Q4, контекст от 8 до 32 тысяч токенов и две-три модели одного размера, которые вы сравниваете на одних и тех же промптах. Телеграм: t.me/ainewsline Источник: x.com Комментарии: |
|