Я уже несколько раз писал про «сверхнадежный стек ИИ-разработки»

МЕНЮ


Главная страница
Поиск
Регистрация на сайте
Помощь проекту
Архив новостей

ТЕМЫ


Новости ИИРазработка ИИВнедрение ИИРабота разума и сознаниеМодель мозгаРобототехника, БПЛАТрансгуманизмОбработка текстаТеория эволюцииДополненная реальностьЖелезоКиберугрозыНаучный мирИТ индустрияРазработка ПОТеория информацииМатематикаЦифровая экономика

Авторизация



Я уже несколько раз писал про «сверхнадежный стек ИИ-разработки». С выходом Muse Glimmer мы уже имеем три SLM, которые показывают SWE-Bench на уровне LLM. Поскольку «Чербунет» или «закрытый контур» — это реальность, а запустить на большое количество разработчиков можно часто как раз вроде SLM на 30B параметров, то встаёт вопрос, где граница их применимости.

Есть два специальных элитных стека для ИИ. Первый стек — это Python-песочница, в которой сам ИИ делает свои расчёты. В векторах он заниматься арифметикой не может. Если сделать тесты у всех вендоров LLM, то видно, что де-факто они уже выработали стандарт примерно 40 библиотек на Python, где особая роль Pandas, т.к. это основное средство, с помощью которого ИИ делает табличные вычисления в чатах. Поэтому Pandas владеет ИИ на уровне GOD. Весь этот стек Python также прекрасно работает в программирующих SLM около 30B параметров, т.к. из привилегированной роли «калькулятора для ИИ» он занимает непропорционально большое место в обучении.

Второй стек — это React, на котором ИИ делает «артефакты». Там около 20 библиотек. По Arena мы получаем подтверждение, что gemma-4-31b имеет рейтинг около 1350 баллов Эло, что примерно на уровне gpt-5.3-codex или DeepSeek V3.2, что косвенно хорошо доказывает, что «React в приоритете».

Тут важно посмотреть глазами этих SLM на код, чтобы правильно ими пользоваться. Классика Python и React у них «очень резкая», поэтому они могут писать новый код на нём легко. Однако если используются библиотеки не из стека, то 30B весов — слишком большое сжатие, и SLM видит их размыто, но не всегда. Высокий рейтинг SWE-Bench говорит о том, что такие SLM успешно фиксили код приложений на Python более +300К строк и на разных фреймворках. Фокус тут в том, что таким SLM легче исправить баг в написанном коде, чем его написать. Когда загрузится уже готовый код, то он превратится в ICL в few-shot и размытые в весах синтаксисы библиотек станут снова «резкими».

Если мораль, то премиальные SLM от Meta, Google и Qwen могут программировать с нуля на классике Python и React. Однако они могут фиксить баги на других языках и библиотеках, если код уже содержит нужные примеры.

Я думаю, что возможно адаптировать пайплайн разработки даже крупной компании под такие SLM, если поставить такую цель. Как минимум — как компонент для агентов тестирования и фиксов.


Телеграм: t.me/ainewsline

Источник: t.me

Комментарии: