Alibaba наконец опубликовала тесты Qwen3.8-Max

МЕНЮ


Главная страница
Поиск
Регистрация на сайте
Помощь проекту
Архив новостей

ТЕМЫ


Новости ИИРазработка ИИВнедрение ИИРабота разума и сознаниеМодель мозгаРобототехника, БПЛАТрансгуманизмОбработка текстаТеория эволюцииДополненная реальностьЖелезоКиберугрозыНаучный мирИТ индустрияРазработка ПОТеория информацииМатематикаЦифровая экономика

Авторизация



2026-08-03 11:09

ИИ проекты

Alibaba наконец опубликовала тесты Qwen3.8-Max. В целом модель класса Claude Opus, поэтому по ценам вендор не демпингует. Я тестировал Qwen3.8-Max в научных исследованиях. В плане анализа научных работ с сильным математическим аппаратом вероятно это сейчас сильнейшая модель на рынке. Если Qwen3.8-Max нормально подумает своим длинным CoT, то там даже не кандидат, а скорее доктор наук по компетенции. Это видно и по лидерству в PaperBench. Иногда бывает перекос в критическую точку зрения, но уровень научно-технического разбора намного сильнее Claude, Gemini или DeepSeek. Если у вас у агентов научный блок, то Qwen3.8-Max очень хорошее решение.

В части разработки я бы больше обратил внимание не на SWE Bench, сейчас все фронтирные ИИ хорошо фиксят баги, а на более сложный Terminal Bench, где код для агента black box. Qwen пишет, что добился уровня автономной разработки в 10+ дней. Это тоже тренд, траектории разработки быстро удлиняются и более серьезной проблемой становится как корректно поставить задачу агентам на такой большой объем работ, т.к. коррекции по ходу их работы уже не вносятся. Это не Agile, а фактически AI Waterfall 2.0, где вы должны загружать в фабрику производства кода очень четкие задания. Мастерство управления агентами сдвигается в создание спеков и прототипов с демонстрацией агентам что требуется.

Модель как и Kimi K3 имеет нативное мультимодальное обучение, т.е. модель в pretraining сразу же училась на смеси текстов и графиков. Alibaba публикует множество бенчмарков на Vision с топовыми результатами, где можно выделить CharXiv, где от модели требуется умение читать сложные диаграммы и схемы уровня не уровня графиков «купи-продай», а уровня научных исследований.

Qwen3.8-Max и Qwen3.8-27B будут open-weights. Очень интересная модель на 27B весов, т.к. даже предыдущая версия на стеке Python и React показывала способность программировать на уровне LLM. Для тех кто в «закрытом контуре» это важная модель, т.к. можно как минимум на ней писать тесты.

Цены:

Ввод: $2.0 / M токенов

Вывод: $6.0 / M токенов

Кэширование: $0.25 / M токенов

Alibaba уверен в качестве модели, раз ставит такие цены.


Телеграм: t.me/ainewsline

Источник: vk.com

Комментарии: