Яндекс выпустил AliceAI-Foundation-80B-A3B-Base, решив таки начать обучать модели от нуля

МЕНЮ


Главная страница
Поиск
Регистрация на сайте
Помощь проекту
Архив новостей

ТЕМЫ


Новости ИИРазработка ИИВнедрение ИИРабота разума и сознаниеМодель мозгаРобототехника, БПЛАТрансгуманизмОбработка текстаТеория эволюцииДополненная реальностьЖелезоКиберугрозыНаучный мирИТ индустрияРазработка ПОТеория информацииМатематикаЦифровая экономика

Авторизация



Яндекс выпустил AliceAI-Foundation-80B-A3B-Base, решив таки начать обучать модели от нуля. Это на деле серьёзный удар всей стратегии Сбера по продвижению GigaChat в «закрытые контуры», которая вся крутится вокруг утверждения в духе: злые враги наверняка при обучении модели заложили в LLM зловредного агента, он, получив сигнал врагов, проснётся и захватит власть в России через правительственные системы. Правда, почему-то в таких мантрах коллеги GigaChat использовали дистилляцию Gemini и ChatGPT, как я уже отмечал по работе Anthropic — дистилляция тоже скрыто передаёт предпочтения учителя, типа либеральных взглядов. Яндекс ранее использовал Qwen для инициализации весов. Получается, в рамках маркетинга Сбера, что правительственного ИИ-агента в России контролирует Трамп, то это лучше, чем Си Цзиньпин. Вот в этом я не уверен. Однако на многих чиновников «суверенное обучение» всё равно производило впечатление, и Яндекс решил разрушить вообще фундамент стратегии продвижения конкурента в госсектор. И надо сказать, что судя по бенчам и архитектуре, Яндексу это уже удалось.

Для начала Яндекс и Сбер стали копировать довольно передовые архитектуры китайцев на гибридах GPT и Delta State, благо что у китайцев всё открытое. Однако Яндекс стал копировать архитектуру Kimi K3 прямо с их Kimi Delta State, что значительно превосходит архитектуру Сбера. Это таки фронтир, который с Fable сражается на равных. Правда, для Яндекса и Сбера проблема в неожиданном асимметричном архитектурном ответе DeepSeek V4.1 Flash, который отказался от модного гибрида и вместо этого фактически переосмыслил понятие трансформера и предложил GPT, где половина слоёв нейросети формирует понимание контекста, а вторая половина совместно ими пользуется — Causal Encoder-Decoder (CED). Фактически CED в нише worker-агентов уже порвал всех на тряпки: в шлюзе Vercel, как я публиковал их статистику ранее, даже американцы более 50% инференса (вообще по всем моделям!) заказывают у DeepSeek. Иными словами, Яндекс и Сбер, побежав копировать «мейнстрим» китайцев, возможно, зашли в технологический тупик, если CED продолжит лидировать как архитектура во Flash-моделях.

Ну да ладно, забавнее совсем другое. Я стал сравнивать, какой же «Истинно Православный ИИ» лучше по бенчмаркам. Всё же даже Президенту России надо выбрать себе агента. Тут оказалось, что поскольку у Яндекса и Сбера не получается, чтобы бенчмарки были хороши везде, то они публикуют только те, где результаты нормальные. В результате получается анекдот, что бенчей много, а сравнить AliceAI-Foundation-80B-A3B-Base и GigaChat3.5-432B-A28B-Reasoning можно только по LiveCodeBench и IMO AnswerBench. Однако после этого русский ИИ-цирк стал ещё веселей.

Вообще-то Сбер раструбил на весь интернет, что у него там теперь взрослый Reinforcement Learning и даже CoT, теперь Reasoning даже есть. Яндекс опубликовал Base-модель, где только обучение по корпусу, классически для Base не ведётся SFT обычно и совсем не ведётся Reinforcement Learning. Однако базовая (!) модель Яндекса оказалась сильнее модели Сбера (на больших весах, с CoT, RL и дистилляцией из Gemini/ChatGPT) в математических задачах — IMO AnswerBench.

По качеству первичной генерации кода на Python модели практически равны в LiveCodeBench.

Давайте прямо скажем, это катастрофа для Сбербанка в госсекторе. Довольно хорошо видно, что GigaChat имеет настолько слабое RL-обучение, что даже не может перебить Base-модель у Yandex. Модель Яндекса меньше и требует меньше ресурса GPU (сразу же на гостендере убивает Сбер просто по цене оборудования). Аргумент Сбера, что у него «истинно православное обучение с нуля», уничтожен Яндексом, т.к. они тоже обучаются теперь с нуля.

На самом деле Грефу уже давно пора делать оргвыводы в команде GigaChat, если он не хочет, чтобы Яндекс его выдавил даже из госсектора. Безусловно, коллеги имеют право не согласится с моими выводами и написать в комментах это.

https://huggingface.co/yandex/AliceAI-Foundation-80B-A3B-Base

https://huggingface.co/ai-sage/GigaChat3.5-432B-A28B-Reasoning


Телеграм: t.me/ainewsline

Источник: t.me

Комментарии: