Просили в комментариях, как промптить наши слабые «Православные ИИ»

МЕНЮ


Главная страница
Поиск
Регистрация на сайте
Помощь проекту
Архив новостей

ТЕМЫ


Новости ИИРазработка ИИВнедрение ИИРабота разума и сознаниеМодель мозгаРобототехника, БПЛАТрансгуманизмОбработка текстаТеория эволюцииДополненная реальностьЖелезоКиберугрозыНаучный мирИТ индустрияРазработка ПОТеория информацииМатематикаЦифровая экономика

Авторизация



Просили в комментариях, как промптить наши слабые «Православные ИИ». На самом деле с ними работают универсальные техники просто для прокачивания слабых GPT, хотя есть особенности.

Ещё год назад я мог заставить GigaChat или YandexGPT решать задачи resource leveling, которые штатно для них были «космические».

Особенность GigaChat — слабый dataset на pretraining для «планов». Обычно топовые вендоры LLM генерируют миллионы планов агентов и пихают в base-модель и на SFT. Технически модель легко обучается им и это решает массу проблем «отсутствия мозгов», в том числе у SLM. Проблема GigaChat, что он обучен планированию как агент ещё хуже современных SLM около 27B параметров. Однако это можно исправить и не очень сложно во многих случаях.

Вам нужно просто сгенерировать в нормальной фронтирной LLM целый Knowledge Base по планам разных типов и просто загружать их по задаче. Это почти «внешний CoT». Правда лучше брать не Claude и не Grok как на скрине, хотя это работает, а китайцев, из которых GigaChat дистиллируют, т.е. Qwen и DeepSeek. Поскольку они более родственные через дистилляцию, то их промпты в GigaChat зайдут лучше.

Интересный аспект, что с GigaChat часто срабатывает просто нормальный step-by-step промпт от фронтирной модели даже без few shots. Иными словами, модель не такая уж тупая, как кажется, но просто плохо обученная планированию действий как агент, поэтому план надо «подкладывать».

Если GigaChat сбивается на выполнении многошагового плана по KB, тогда нужно применять средство воспитания слабых моделей как Structured Output. Просите шаги плана и наполнение инструментов оформить через JSON. Сам по себе Structured Output насильно загоняет LLM в прокрустово ложе схемы просто фильтрацией логитов. Полученный JSON уже алгоритмически разбираете и выполняете. Код просто можно в том же DeepSeek написать для этого.


Телеграм: t.me/ainewsline

Источник: t.me

Комментарии: