Яндекс выпустил AliceAI-Foundation-80B-A3B-Base, решив таки начать обучать модели от нуля |
||
|
МЕНЮ Главная страница Поиск Регистрация на сайте Помощь проекту Архив новостей ТЕМЫ Новости ИИ Голосовой помощник Разработка ИИГородские сумасшедшие ИИ в медицине ИИ проекты Искусственные нейросети Искусственный интеллект Слежка за людьми Угроза ИИ Атаки на ИИ Внедрение ИИИИ теория Компьютерные науки Машинное обуч. (Ошибки) Машинное обучение Машинный перевод Нейронные сети начинающим Психология ИИ Реализация ИИ Реализация нейросетей Создание беспилотных авто Трезво про ИИ Философия ИИ Big data Работа разума и сознаниеМодель мозгаРобототехника, БПЛАТрансгуманизмОбработка текстаТеория эволюцииДополненная реальностьЖелезоКиберугрозыНаучный мирИТ индустрияРазработка ПОТеория информацииМатематикаЦифровая экономика
Генетические алгоритмы Капсульные нейросети Основы нейронных сетей Промпты. Генеративные запросы Распознавание лиц Распознавание образов Распознавание речи Творчество ИИ Техническое зрение Чат-боты Авторизация |
2026-09-22 12:16 Яндекс выпустил AliceAI-Foundation-80B-A3B-Base, решив таки начать обучать модели от нуля. Это на деле серьёзный удар всей стратегии Сбера по продвижению GigaChat в «закрытые контуры», которая вся крутится вокруг утверждения в духе: злые враги наверняка при обучении модели заложили в LLM зловредного агента, он, получив сигнал врагов, проснётся и захватит власть в России через правительственные системы. Правда, почему-то в таких мантрах коллеги GigaChat использовали дистилляцию Gemini и ChatGPT, как я уже отмечал по работе Anthropic — дистилляция тоже скрыто передаёт предпочтения учителя, типа либеральных взглядов. Яндекс ранее использовал Qwen для инициализации весов. Получается, в рамках маркетинга Сбера, что правительственного ИИ-агента в России контролирует Трамп, то это лучше, чем Си Цзиньпин. Вот в этом я не уверен. Однако на многих чиновников «суверенное обучение» всё равно производило впечатление, и Яндекс решил разрушить вообще фундамент стратегии продвижения конкурента в госсектор. И надо сказать, что судя по бенчам и архитектуре, Яндексу это уже удалось. Для начала Яндекс и Сбер стали копировать довольно передовые архитектуры китайцев на гибридах GPT и Delta State, благо что у китайцев всё открытое. Однако Яндекс стал копировать архитектуру Kimi K3 прямо с их Kimi Delta State, что значительно превосходит архитектуру Сбера. Это таки фронтир, который с Fable сражается на равных. Правда, для Яндекса и Сбера проблема в неожиданном асимметричном архитектурном ответе DeepSeek V4.1 Flash, который отказался от модного гибрида и вместо этого фактически переосмыслил понятие трансформера и предложил GPT, где половина слоёв нейросети формирует понимание контекста, а вторая половина совместно ими пользуется — Causal Encoder-Decoder (CED). Фактически CED в нише worker-агентов уже порвал всех на тряпки: в шлюзе Vercel, как я публиковал их статистику ранее, даже американцы более 50% инференса (вообще по всем моделям!) заказывают у DeepSeek. Иными словами, Яндекс и Сбер, побежав копировать «мейнстрим» китайцев, возможно, зашли в технологический тупик, если CED продолжит лидировать как архитектура во Flash-моделях. Ну да ладно, забавнее совсем другое. Я стал сравнивать, какой же «Истинно Православный ИИ» лучше по бенчмаркам. Всё же даже Президенту России надо выбрать себе агента. Тут оказалось, что поскольку у Яндекса и Сбера не получается, чтобы бенчмарки были хороши везде, то они публикуют только те, где результаты нормальные. В результате получается анекдот, что бенчей много, а сравнить AliceAI-Foundation-80B-A3B-Base и GigaChat3.5-432B-A28B-Reasoning можно только по LiveCodeBench и IMO AnswerBench. Однако после этого русский ИИ-цирк стал ещё веселей. Вообще-то Сбер раструбил на весь интернет, что у него там теперь взрослый Reinforcement Learning и даже CoT, теперь Reasoning даже есть. Яндекс опубликовал Base-модель, где только обучение по корпусу, классически для Base не ведётся SFT обычно и совсем не ведётся Reinforcement Learning. Однако базовая (!) модель Яндекса оказалась сильнее модели Сбера (на больших весах, с CoT, RL и дистилляцией из Gemini/ChatGPT) в математических задачах — IMO AnswerBench. По качеству первичной генерации кода на Python модели практически равны в LiveCodeBench. Давайте прямо скажем, это катастрофа для Сбербанка в госсекторе. Довольно хорошо видно, что GigaChat имеет настолько слабое RL-обучение, что даже не может перебить Base-модель у Yandex. Модель Яндекса меньше и требует меньше ресурса GPU (сразу же на гостендере убивает Сбер просто по цене оборудования). Аргумент Сбера, что у него «истинно православное обучение с нуля», уничтожен Яндексом, т.к. они тоже обучаются теперь с нуля. На самом деле Грефу уже давно пора делать оргвыводы в команде GigaChat, если он не хочет, чтобы Яндекс его выдавил даже из госсектора. Безусловно, коллеги имеют право не согласится с моими выводами и написать в комментах это. https://huggingface.co/yandex/AliceAI-Foundation-80B-A3B-Base https://huggingface.co/ai-sage/GigaChat3.5-432B-A28B-Reasoning Телеграм: t.me/ainewsline Источник: t.me Комментарии: |
|