Alibaba наконец опубликовала тесты Qwen3.8-Max |
||
|
МЕНЮ Главная страница Поиск Регистрация на сайте Помощь проекту Архив новостей ТЕМЫ Новости ИИ Голосовой помощник Разработка ИИГородские сумасшедшие ИИ в медицине ИИ проекты Искусственные нейросети Искусственный интеллект Слежка за людьми Угроза ИИ Атаки на ИИ Внедрение ИИИИ теория Компьютерные науки Машинное обуч. (Ошибки) Машинное обучение Машинный перевод Нейронные сети начинающим Психология ИИ Реализация ИИ Реализация нейросетей Создание беспилотных авто Трезво про ИИ Философия ИИ Big data Работа разума и сознаниеМодель мозгаРобототехника, БПЛАТрансгуманизмОбработка текстаТеория эволюцииДополненная реальностьЖелезоКиберугрозыНаучный мирИТ индустрияРазработка ПОТеория информацииМатематикаЦифровая экономика
Генетические алгоритмы Капсульные нейросети Основы нейронных сетей Промпты. Генеративные запросы Распознавание лиц Распознавание образов Распознавание речи Творчество ИИ Техническое зрение Чат-боты Авторизация |
2026-08-03 11:09 Alibaba наконец опубликовала тесты Qwen3.8-Max. В целом модель класса Claude Opus, поэтому по ценам вендор не демпингует. Я тестировал Qwen3.8-Max в научных исследованиях. В плане анализа научных работ с сильным математическим аппаратом вероятно это сейчас сильнейшая модель на рынке. Если Qwen3.8-Max нормально подумает своим длинным CoT, то там даже не кандидат, а скорее доктор наук по компетенции. Это видно и по лидерству в PaperBench. Иногда бывает перекос в критическую точку зрения, но уровень научно-технического разбора намного сильнее Claude, Gemini или DeepSeek. Если у вас у агентов научный блок, то Qwen3.8-Max очень хорошее решение. В части разработки я бы больше обратил внимание не на SWE Bench, сейчас все фронтирные ИИ хорошо фиксят баги, а на более сложный Terminal Bench, где код для агента black box. Qwen пишет, что добился уровня автономной разработки в 10+ дней. Это тоже тренд, траектории разработки быстро удлиняются и более серьезной проблемой становится как корректно поставить задачу агентам на такой большой объем работ, т.к. коррекции по ходу их работы уже не вносятся. Это не Agile, а фактически AI Waterfall 2.0, где вы должны загружать в фабрику производства кода очень четкие задания. Мастерство управления агентами сдвигается в создание спеков и прототипов с демонстрацией агентам что требуется. Модель как и Kimi K3 имеет нативное мультимодальное обучение, т.е. модель в pretraining сразу же училась на смеси текстов и графиков. Alibaba публикует множество бенчмарков на Vision с топовыми результатами, где можно выделить CharXiv, где от модели требуется умение читать сложные диаграммы и схемы уровня не уровня графиков «купи-продай», а уровня научных исследований. Qwen3.8-Max и Qwen3.8-27B будут open-weights. Очень интересная модель на 27B весов, т.к. даже предыдущая версия на стеке Python и React показывала способность программировать на уровне LLM. Для тех кто в «закрытом контуре» это важная модель, т.к. можно как минимум на ней писать тесты. Цены: Ввод: $2.0 / M токенов Вывод: $6.0 / M токенов Кэширование: $0.25 / M токенов Alibaba уверен в качестве модели, раз ставит такие цены. Телеграм: t.me/ainewsline Источник: vk.com Комментарии: |
|