Сейчас идёт настоящий бум Decision-моделей |
||
|
МЕНЮ Главная страница Поиск Регистрация на сайте Помощь проекту Архив новостей ТЕМЫ Новости ИИ Голосовой помощник Разработка ИИГородские сумасшедшие ИИ в медицине ИИ проекты Искусственные нейросети Искусственный интеллект Слежка за людьми Угроза ИИ Атаки на ИИ Внедрение ИИИИ теория Компьютерные науки Машинное обуч. (Ошибки) Машинное обучение Машинный перевод Нейронные сети начинающим Психология ИИ Реализация ИИ Реализация нейросетей Создание беспилотных авто Трезво про ИИ Философия ИИ Big data Работа разума и сознаниеМодель мозгаРобототехника, БПЛАТрансгуманизмОбработка текстаТеория эволюцииДополненная реальностьЖелезоКиберугрозыНаучный мирИТ индустрияРазработка ПОТеория информацииМатематикаЦифровая экономика
Генетические алгоритмы Капсульные нейросети Основы нейронных сетей Промпты. Генеративные запросы Распознавание лиц Распознавание образов Распознавание речи Творчество ИИ Техническое зрение Чат-боты Авторизация |
2026-09-23 11:18 Сейчас идёт настоящий бум Decision-моделей. В топе Hugging Face совсем не Qwen или DeepSeek, а Laya. Начался бум с Jev (API-аналог), который отвечает за 236–276 мс, но Laya ещё быстрее ~33 мс. Фантастическая скорость, крошечный размер и невероятная дешевизна в решениях выбора между вариантами создали бум таких моделей. Однако я заметил, что многие откровенно наивно используют такие крошечные модели без понимания, что без дообучения они мало отличаются от подбрасывания монеты по точности. Разработчики Laya сами пишут: «Laya is a fast base to specialise, not a zero-shot decision engine». Zero-shot точность на typed-decisions составляет всего 0.362 — чуть выше случайного угадывания (0.318). Но после дообучения на тренировочном сплите того же бенчмарка точность поднимается до 0.766, обгоняя Jev (0.727). Архитектурно такие модели построены на ModernBERT, но BERT имеет известную славу «мешка слов» и плохого понимания причинно-следственных связей. Это не нормальный трансформер с маскированным вниманием, который понимает «кто на ком стоял». Довольно наивно думать, что в 0.4B весов даже физически могут поместиться данные фактов, необходимые для сравнения вариантов под задачу. Без обучения модель может отвечать только на простейшие общие вопросы типа «Есть ли фишинг в письме?», причём потребуется ещё сделать калибровку модели через Temperature Scaling (TS), Platt Scaling или Isotonic Regression. Возможно ещё «подбрасывать факты» в промпт модели, то вам сразу нужен RAG, что убивает преимущества скорости. Без тюнинга такие модели дают ответы крайне ненадёжно. То, что вы получили «какой-то ответ» — это не значит, что он правильный. Тут местами больше хайпа от тех, кто ещё не понял ограничений этих микроскопических моделей. Я бы напомнил тут про технику Single-Token Logit (STL) промптинга как альтернативу. Вы можете взять нормальную SLM/LLM и попросить модель выбирать вариант одним токеном. В логитах вы можете посмотреть также вероятности вариантов. Однако это нормальные трансформеры, которые знают много фактов мира и понимают причинно-следственные связи в вопросе. Ответ одним токеном тоже очень быстрый и почти ничего не стоит. https://huggingface.co/convaiinnovations/laya Телеграм: t.me/ainewsline Источник: t.me Комментарии: |
|