Prism ML собрала тернарную версию Qwen3.8-27B |
||
|
МЕНЮ Главная страница Поиск Регистрация на сайте Помощь проекту Архив новостей ТЕМЫ Новости ИИ Голосовой помощник Разработка ИИГородские сумасшедшие ИИ в медицине ИИ проекты Искусственные нейросети Искусственный интеллект Слежка за людьми Угроза ИИ Атаки на ИИ Внедрение ИИИИ теория Компьютерные науки Машинное обуч. (Ошибки) Машинное обучение Машинный перевод Нейронные сети начинающим Психология ИИ Реализация ИИ Реализация нейросетей Создание беспилотных авто Трезво про ИИ Философия ИИ Big data Работа разума и сознаниеМодель мозгаРобототехника, БПЛАТрансгуманизмОбработка текстаТеория эволюцииДополненная реальностьЖелезоКиберугрозыНаучный мирИТ индустрияРазработка ПОТеория информацииМатематикаЦифровая экономика
Генетические алгоритмы Капсульные нейросети Основы нейронных сетей Промпты. Генеративные запросы Распознавание лиц Распознавание образов Распознавание речи Творчество ИИ Техническое зрение Чат-боты Авторизация |
2026-09-20 14:10 Bonsai 2 27B (https://prismml.com/news/bonsai-2-27b) - сжатая Qwen3.8-27B, которая занимает 5,9 ГБ против примерно 54 ГБ у исходной модели в FP16 и сохраняет 98,2% её среднего результата на бенчмарках. Prism ML - американский стартап из команды Калтеха, вышедший из стелс-ркжима весной 2026 года с анонсом (https://prismml.com/news/bonsai-8b) первой версии моделей Bonsai. Основатель и руководитель - профессор Калтеха Бабак Хассиби (https://www.ee.caltech.edu/people/hassibi), специалист по теории сжатия. Среди инвесторов стартапа Cerberus, Google и Samsung. Модель рассчитана на локальный запуск на потребительском оборудовании, имеет контекст в 262 тысячи токенов и может обрабатывать изображения и вызывать инструменты. Целевые сценарии - агенты в редакторе кода, работа с компьютером, разбор документов без отправки их в облако. Вес в тернарном квантовании хранится не числом, а одним из трёх знаков: минус, ноль или плюс. Сами величины задаются отдельно - веса разбиты на группы по 128, и у каждой группы один общий множитель в FP16. В пересчёте на один вес это 1,72 бита против 16 у исходной модели. Перед сжатием веса каждой матрицы разворачивают фиксированным преобразованием Адамара, сам разворот вписан в веса, но при работе его нужно повторить на входных данных, иначе модель выдаёт бессмыслицу. Распознавание картинок сжатие не проходило, лежит отдельным файлом на 0,6 ГБ и подгружается только тогда, когда на вход пришло изображение, так что текстовые задачи его не задействуют. В релизе три варианта GGUF в двух упаковках: (https://huggingface.co/prism-ml/Ternary-Bonsai-2-27B-gguf) PTQ1_0 (1,75 бита, 5,95 ГБ, быстрее на картах Ada и L4) и PQ2_0 (2,13 бита, 7,21 ГБ, быстрее на H100 и Blackwell); сборка под MLX (https://huggingface.co/prism-ml/Ternary-Bonsai-2-27B-mlx-2bit) на 8,60 ГБ вместе со зрением; тестовая упаковка (https://huggingface.co/prism-ml/Ternary-Bonsai-2-27B-gguf-dev) Q2_0 для доработки ядер. Для GGUF нужен специальный форк llama.cpp (https://github.com/PrismML-Eng/llama.cpp) от Prism ML, для MLX - загрузчик из самого пакета. Бенчмарки Замеры Prism ML считали через EvalScope и vLLM на H100, в режиме рассуждения, всего провели 14 тестов. Сравнивали со сборки той же Qwen3.8-27B в квантованиях UD-Q4_K_XL и IQ2_XXS. Среднее по всем тестам: 84,78 против 86,32 у FP16 и 72,59 у IQ2_XXS. До четырёхбитной сборки не хватило 0,4 пункта при втрое меньшем размере. AIME26: 95,83 против 94,58 у FP16 и 57,50 у IQ2_XXS. LiveCodeBench: 90,07 против 90,05 и 56,40 соответственно. BFCL v3 (вызов инструментов): 74,92 против 76,74 у FP16. MMMU-Pro: 75,49 против 81,73. Скорость генерации на RTX 5090 примерно 129 токенов в секунду, на ноутбучном M5 Pro - 28 токенов в секунду. Лицензирование: Apache 2.0 Блогпост (https://prismml.com/news/bonsai-2-27b) Веса (https://huggingface.co/collections/prism-ml/bonsai-2) Техотчет (https://github.com/PrismML-Eng/Bonsai-demo/blob/main/bonsai-2-27b-whitepaper.pdf) Демо на WebGPU (https://huggingface.co/spaces/webml-community/ternary-bonsai-2-webgpu-kernels) Сообщество в Discord (https://discord.gg/prismml) GitHub (https://github.com/PrismML-Eng/Bonsai-demo/) Телеграм: t.me/ainewsline Источник: github.com Комментарии: |
|