Изучил я пока предварительно технический отчёт по MiMo V2.6 |
||
|
МЕНЮ Главная страница Поиск Регистрация на сайте Помощь проекту Архив новостей ТЕМЫ Новости ИИ Голосовой помощник Разработка ИИГородские сумасшедшие ИИ в медицине ИИ проекты Искусственные нейросети Искусственный интеллект Слежка за людьми Угроза ИИ Атаки на ИИ Внедрение ИИИИ теория Компьютерные науки Машинное обуч. (Ошибки) Машинное обучение Машинный перевод Нейронные сети начинающим Психология ИИ Реализация ИИ Реализация нейросетей Создание беспилотных авто Трезво про ИИ Философия ИИ Big data Работа разума и сознаниеМодель мозгаРобототехника, БПЛАТрансгуманизмОбработка текстаТеория эволюцииДополненная реальностьЖелезоКиберугрозыНаучный мирИТ индустрияРазработка ПОТеория информацииМатематикаЦифровая экономика
Генетические алгоритмы Капсульные нейросети Основы нейронных сетей Промпты. Генеративные запросы Распознавание лиц Распознавание образов Распознавание речи Творчество ИИ Техническое зрение Чат-боты Авторизация |
2026-09-22 12:20 Изучил я пока предварительно технический отчёт по MiMo V2.6. Основной прорыв вендора в кардинальном ускорении Reinforcement Learning за счёт обучения крупными блоками данных. Поэтому они быстрее и дешевле учат модели. Однако если сравнить MiMo V2.6 и DeepSeek V4.1, то тут есть «тревожный звонок» архитекторам LLM в Сбербанке и Яндексе: начав копировать модный китайский гибрид GPT + Delta State, они могут проиграть с треском конкуренцию Flash-моделям китайцев. Просто всем и так понятно, что даже если вы возьмёте с Hugging Face архитектуру Kimi K3 и запустите обучение в наших условиях, то у вас не выйдет копия Kimi K3. У наших намного меньше ресурса GPU, и на Hugging Face не лежит описание пайплайнов обучения. В реальности Сберу и Яндексу хоть даже не догнать DeepSeek V4.1 и MiMo V2.6, а сделать хотя бы ситуацию, чтобы отставание не выглядело уже неприличным образом, как сейчас. Китайские «флешки» умеют и программировать, и быть сложными агентами, а наши LLM — нет. Так вопрос в том, что обе эти «флешки» у китайцев не используют гибрид GPT + Delta State. Они сидят на доработанном GPT. У DeepSeek доработка сделана через CED, у Xiaomi не так радикально: на доработанном обычном GPT комбинациями глобального и оконного (SWA) внимания между слоями. Тут как бы не вышло, как в известном меме Матвиенко «копали не туда» (про туннель Метростроя в Питере, который ушёл не туда, а стоил кучу денег). https://huggingface.co/XiaomiMiMo/MiMo-V2.6-Pro-RL/blob/main/MiMo_V2_6_technical_report.pdf Телеграм: t.me/ainewsline Источник: t.me Комментарии: |
|