Вот неплохой бенчмарк по фиксу багов от Pawel Huryn

МЕНЮ


Главная страница
Поиск
Регистрация на сайте
Помощь проекту
Архив новостей

ТЕМЫ


Новости ИИРазработка ИИВнедрение ИИРабота разума и сознаниеМодель мозгаРобототехника, БПЛАТрансгуманизмОбработка текстаТеория эволюцииДополненная реальностьЖелезоКиберугрозыНаучный мирИТ индустрияРазработка ПОТеория информацииМатематикаЦифровая экономика

Авторизация



2026-09-05 12:28

ИИ проекты

Вот неплохой бенчмарк по фиксу багов от Pawel Huryn. Поскольку он не входит в популярные, то на него нет целевого обучения вендоров LLM как на тот же DeepSWE. По нему GPT-6 Astra чуть лучше Fable 5.1, но в 2 раза дешевле.

Однако я бы посмотрел в конец таблицы, где DeepSeek V4, Luna и GLM 5.3 Flash: они выбивают вроде меньше фиксов, но в 50 (!) раз дешевле. Вопрос в том, что профессионал как раз на них баги и фиксит. Применение Fable 5.1 или GPT-6 Astra для фикса багов — это не «круто», а прямой индикатор системных проблем с вашим кодом: кривая архитектура, слабое логирование и плохое встроенное в код документирование.

Если код усеян AI-friendly логами, встроенной докой в код, а архитектура сильно изолированная типа плагинной, то ваша ИИ-разработка на стадии тестирования и мелких доработок в 50 раз дешевле бардака, где пожары от технического долга пытаются тушить мощью Fable и Astra. Довольно очевидно, что такая экономика быстро заставит ИТ-директоров внедрять нормальные практики ИИ-разработки, а не покупать дорогие LLM, т.к. расплата за нарушение технологии работы агентов выглядит в деньгах просто феерически.

https://x.com/PawelHuryn/status/2095982259761475945


Телеграм: t.me/ainewsline

Источник: t.me

Комментарии: