Новый Muse Spark 1.3 выбил лучший результат в самом сложном сейчас бенчмарке для разработки DeepSWE

МЕНЮ


Главная страница
Поиск
Регистрация на сайте
Помощь проекту
Архив новостей

ТЕМЫ


Новости ИИРазработка ИИВнедрение ИИРабота разума и сознаниеМодель мозгаРобототехника, БПЛАТрансгуманизмОбработка текстаТеория эволюцииДополненная реальностьЖелезоКиберугрозыНаучный мирИТ индустрияРазработка ПОТеория информацииМатематикаЦифровая экономика

Авторизация



Новый Muse Spark 1.3 выбил лучший результат в самом сложном сейчас бенчмарке для разработки DeepSWE. Правда, по опыту нового Gemini Flash это также может оказаться достигнуто через перерасход токенов в разы, поэтому нужно смотреть тесты внимательнее. Плюс на Arena что выйдет. Как ни странно, но Arena с их A/B-тестами на реальных людях сейчас стала одним из лучших бенчмарков, несмотря на их мутки с ИИ-судьёй (правда, они их сократили). Всё же когда задания генерируются людьми, а не стабильный dataset, то это более валидно, особенно если учесть, что LLM как раз решают задания от людей.

Пока мы наблюдаем резкое ускорение прогресса почти всех вендоров LLM, даже Meta подтянулась. Тут уместно ещё раз вспомнить, до какого кризиса Лекун довёл со своими «моделями мира» разработку ИИ-моделей в Meta, а потом банально сбежал, когда Llama провалилась по всем возможным бенчмаркам. Однако как-то без его гениальности Цукерберг смог добиться результатов намного выше.


Телеграм: t.me/ainewsline

Источник: t.me

Комментарии: