Представьте мейнтейнера open-source-проекта, который утром открывает очередь пул-реквестов и видит, что их вдвое больше, чем месяц назад, а заметная часть подписана агентами: Claude Code, Codex,

МЕНЮ


Главная страница
Поиск
Регистрация на сайте
Помощь проекту
Архив новостей

ТЕМЫ


Новости ИИРазработка ИИВнедрение ИИРабота разума и сознаниеМодель мозгаРобототехника, БПЛАТрансгуманизмОбработка текстаТеория эволюцииДополненная реальностьЖелезоКиберугрозыНаучный мирИТ индустрияРазработка ПОТеория информацииМатематикаЦифровая экономика

Авторизация



2026-08-17 11:57

разработка по

Представьте мейнтейнера open-source-проекта, который утром открывает очередь пул-реквестов и видит, что их вдвое больше, чем месяц назад, а заметная часть подписана агентами: Claude Code, Codex, Cursor. Это не фантазия: по данным The Information, число пул-реквестов от ИИ-агентов на GitHub выросло с примерно 4 миллионов в месяц в сентябре 2025 года до более чем 17 миллионов в марте 2026-го — вчетверо за полгода. Каждый из них кто-то должен прочитать, собрать, прогнать через тесты и решить, вливать ли в основную ветку.

Ответ на вопрос «кто именно» венчурный рынок дал 12 августа: в один день два стартапа, продающих не написание кода, а его проверку, объявили о раундах. CodeRabbit привлек $143 миллиона при оценке $1,5 миллиарда, а Blacksmith — $45 миллионов при оценке $550 миллионов. Почти $190 миллионов за сутки в категорию, которой три года назад почти не существовало. Логика проста: писать код стало дешево, а читать и проверять его человек не стал ни быстрее, ни дешевле. Узкое место разработки сместилось с производства на контроль.

Это подтверждают цифры. По данным Anthropic, более 80% её кода теперь пишет модель. Опрос Sonar показывает: 61% разработчиков регулярно получают от ИИ код, который выглядит правильным, но которому нельзя доверять, а 38% считают, что ревьюить ИИ-код труднее, чем человеческий (обратного мнения — 27%). Самым важным навыком эпохи ИИ участники опроса назвали умение проверять сгенерированное.

CodeRabbit и Blacksmith занимаются двумя разными видами проверки. CodeRabbit — чтением, то есть код-ревью. Его CEO Харджот Гилл называет продукт не агентным циклом, а конвейером, где львиная доля работы — подготовка контекста. Когда открывается пул-реквест, задача встает в очередь (в пике — 10 ревью в секунду). Репозиторий клонируется в одноразовую изолированную виртуалку, проект собирается, отрабатывают более 20 линтеров и статических анализаторов. Затем дешевые модели собирают 10–15 сигналов — сам дифф, граф связей кода, тикеты из Jira, логи упавших проверок, накопленные предпочтения команды — и сжимают их в бриф: файл на 4000 строк превращается в несколько задетых функций. Только после этого передовая модель расследует изменение: буквально пишет команды для терминала в песочнице, открывает файлы, ищет вызовы измененной функции, гоняет тесты. Финальный этап — отдельная модель-судья, которая проверяет каждую находку и отбрасывает необоснованные. Всего в конвейере семь-восемь моделей, и пользователь не видит, какая из них что делает. Ключевая архитектурная ставка — живой граф связей кода вместо поиска похожих фрагментов: дорогой баг обычно живет в файле, которого в диффе нет, а похожий код не значит зависимый.

Казалось бы, такую функцию проще встроить в самого агента, который код пишет. Лаборатории так и сделали. Anthropic 9 марта запустила Code Review для Claude Code: пять параллельных агентов смотрят на изменение с разных углов, каждая находка получает оценку уверенности, публикуются только те, что выше порога. По данным компании, доля пул-реквестов с замечаниями выросла с 16% до 54% при менее чем 1% ошибок. Но ревью от Anthropic работает на моделях того же семейства, что и модель, писавшая код, — а модели одного семейства делят одни и те же слепые пятна. CodeRabbit гоняет ансамбль моделей разных производителей плюс отдельного судью и упорно повторяет слово «независимый». Плюс прозаические преимущества: четыре Git-платформы против одного GitHub у Anthropic, фиксированная цена за пользователя против $15–25 за одно ревью по токенам и доступность любым командам.

Вместе с раундом CodeRabbit объявил, что становится «слоем управления изменениями» (Agentic Change Management). Новый модуль Triage оценивает входящие пул-реквесты по ценности, риску, срочности и готовности: важное отправляет людям, низкорисковое — в автоматические конвейеры, дубли и сырое — вон из очереди. То есть компания, разбогатевшая на чтении кода, теперь продает ответ на вопрос из заголовка: людям достается только то, что требует суждения, остальное читают машины. Масштаб уже есть: 17 тысяч клиентов, включая Nvidia, BMW и Adyen, больше 2 миллионов ревью в неделю, выручка выросла в пять раз за год.

Blacksmith отвечает за второй вид проверки — не чтение, а прогон. Это CI, continuous integration: конвейер автоматических проверок, где каждое изменение заставляет машину заново собрать программу и прогнать тесты, и только зеленый результат пропускают дальше. Тесты надо на чем-то физически выполнять, стандартный вариант — GitHub Actions от Microsoft, где платят за минуты работы серверов; таких минут в начале 2026 года набегало до 2,1 миллиарда в неделю против 500 миллионов в 2023-м. Blacksmith начинался как замена этим серверам: одна строчка в настройках — и те же тесты бегут на его машинах, вдвое быстрее и вдвое дешевле. Секрет в железе: тесты — это цепочка последовательных шагов, которую не раздать тысяче ядер, поэтому важна скорость одного ядра. А быстрые и дешевые одиночные ядра стоят в игровых процессорах, на которых и гоняет CI Blacksmith.

Число CI-задач растет на 5–10% каждую неделю с начала 2026 года, и Blacksmith связывает это с Claude Code и Codex: агент, который сам чинит и перепроверяет код, гоняет тесты чаще, чем человек. Число клиентов за год выросло с 800 до 6000, деньги раунда пойдут в основном в железо — компания хочет нарастить мощности в десять раз. Есть и агентная надстройка, Codesmith: BB смотрит на упавшую проверку, ставит диагноз и коммитит исправление. Риск для Blacksmith — политика Microsoft: весь бизнес пристроен к чужой экосистеме GitHub, и хозяин площадки в любой момент может поменять правила или обновить свои серверы.

Скептических аргументов хватает. Независимый аудит проекта Lychee по 28 проверенным пул-реквестам разложил комментарии CodeRabbit так: 35% реально полезны, 21% придирки, 15% бесполезны. Бенчмарки категории противоречат друг другу: три замера за полгода назвали три разных лучших инструмента. Защита CodeRabbit — чисто программная: Перроне прямо пишет, что очередь, серверная обвязка и генерация команд в песочнице воспроизводятся за выходные, а не переносится только система оценки моделей, знающая, какая из восьми годится под какую подзадачу, и настроенный судья; лаборатория с большим бюджетом такое заливает деньгами. Оценка в $1,5 миллиарда при рынке ревью-сервисов, который аналитики 360iResearch оценивают в $3 миллиарда, — это ставка не на долю рынка, а на то, что категория станет чем-то большим.

Так кто читает 17 миллионов пул-реквестов? Все реже — люди. Все чаще — ансамбли моделей, судьи и диспетчеры очередей, а человеку оставляют кнопку «влить» и ответственность за то, что произойдет после. Осталось выяснить, переживет ли независимый судья тот день, когда каждая лаборатория встроит своего. Возможно, ценность независимости в проверке — вещь институциональная, как аудитор, который не работает в проверяемой компании. А возможно, удобство встроенного, как обычно, победит чистоту.

Как вы считаете: готовы ли вы доверить проверку кода полностью независимой ИИ-системе, или предпочтете, чтобы она была встроена в того же агента, который этот код написал?


Телеграм: t.me/ainewsline

Источник: vk.com

Комментарии: