Изучил я пока предварительно технический отчёт по MiMo V2.6

МЕНЮ


Главная страница
Поиск
Регистрация на сайте
Помощь проекту
Архив новостей

ТЕМЫ


Новости ИИРазработка ИИВнедрение ИИРабота разума и сознаниеМодель мозгаРобототехника, БПЛАТрансгуманизмОбработка текстаТеория эволюцииДополненная реальностьЖелезоКиберугрозыНаучный мирИТ индустрияРазработка ПОТеория информацииМатематикаЦифровая экономика

Авторизация



Изучил я пока предварительно технический отчёт по MiMo V2.6. Основной прорыв вендора в кардинальном ускорении Reinforcement Learning за счёт обучения крупными блоками данных. Поэтому они быстрее и дешевле учат модели.

Однако если сравнить MiMo V2.6 и DeepSeek V4.1, то тут есть «тревожный звонок» архитекторам LLM в Сбербанке и Яндексе: начав копировать модный китайский гибрид GPT + Delta State, они могут проиграть с треском конкуренцию Flash-моделям китайцев. Просто всем и так понятно, что даже если вы возьмёте с Hugging Face архитектуру Kimi K3 и запустите обучение в наших условиях, то у вас не выйдет копия Kimi K3. У наших намного меньше ресурса GPU, и на Hugging Face не лежит описание пайплайнов обучения. В реальности Сберу и Яндексу хоть даже не догнать DeepSeek V4.1 и MiMo V2.6, а сделать хотя бы ситуацию, чтобы отставание не выглядело уже неприличным образом, как сейчас. Китайские «флешки» умеют и программировать, и быть сложными агентами, а наши LLM — нет. Так вопрос в том, что обе эти «флешки» у китайцев не используют гибрид GPT + Delta State. Они сидят на доработанном GPT. У DeepSeek доработка сделана через CED, у Xiaomi не так радикально: на доработанном обычном GPT комбинациями глобального и оконного (SWA) внимания между слоями.

Тут как бы не вышло, как в известном меме Матвиенко «копали не туда» (про туннель Метростроя в Питере, который ушёл не туда, а стоил кучу денег).

https://huggingface.co/XiaomiMiMo/MiMo-V2.6-Pro-RL/blob/main/MiMo_V2_6_technical_report.pdf


Телеграм: t.me/ainewsline

Источник: t.me

Комментарии: