Сейчас идёт настоящий бум Decision-моделей

МЕНЮ


Главная страница
Поиск
Регистрация на сайте
Помощь проекту
Архив новостей

ТЕМЫ


Новости ИИРазработка ИИВнедрение ИИРабота разума и сознаниеМодель мозгаРобототехника, БПЛАТрансгуманизмОбработка текстаТеория эволюцииДополненная реальностьЖелезоКиберугрозыНаучный мирИТ индустрияРазработка ПОТеория информацииМатематикаЦифровая экономика

Авторизация



Сейчас идёт настоящий бум Decision-моделей. В топе Hugging Face совсем не Qwen или DeepSeek, а Laya. Начался бум с Jev (API-аналог), который отвечает за 236–276 мс, но Laya ещё быстрее ~33 мс. Фантастическая скорость, крошечный размер и невероятная дешевизна в решениях выбора между вариантами создали бум таких моделей.

Однако я заметил, что многие откровенно наивно используют такие крошечные модели без понимания, что без дообучения они мало отличаются от подбрасывания монеты по точности. Разработчики Laya сами пишут: «Laya is a fast base to specialise, not a zero-shot decision engine». Zero-shot точность на typed-decisions составляет всего 0.362 — чуть выше случайного угадывания (0.318). Но после дообучения на тренировочном сплите того же бенчмарка точность поднимается до 0.766, обгоняя Jev (0.727).

Архитектурно такие модели построены на ModernBERT, но BERT имеет известную славу «мешка слов» и плохого понимания причинно-следственных связей. Это не нормальный трансформер с маскированным вниманием, который понимает «кто на ком стоял». Довольно наивно думать, что в 0.4B весов даже физически могут поместиться данные фактов, необходимые для сравнения вариантов под задачу.

Без обучения модель может отвечать только на простейшие общие вопросы типа «Есть ли фишинг в письме?», причём потребуется ещё сделать калибровку модели через Temperature Scaling (TS), Platt Scaling или Isotonic Regression.

Возможно ещё «подбрасывать факты» в промпт модели, то вам сразу нужен RAG, что убивает преимущества скорости.

Без тюнинга такие модели дают ответы крайне ненадёжно. То, что вы получили «какой-то ответ» — это не значит, что он правильный. Тут местами больше хайпа от тех, кто ещё не понял ограничений этих микроскопических моделей. Я бы напомнил тут про технику Single-Token Logit (STL) промптинга как альтернативу. Вы можете взять нормальную SLM/LLM и попросить модель выбирать вариант одним токеном. В логитах вы можете посмотреть также вероятности вариантов. Однако это нормальные трансформеры, которые знают много фактов мира и понимают причинно-следственные связи в вопросе. Ответ одним токеном тоже очень быстрый и почти ничего не стоит.

https://huggingface.co/convaiinnovations/laya


Телеграм: t.me/ainewsline

Источник: t.me

Комментарии: