Добро пожаловать в эру AGI (по версии отдела маркетинга OpenAI) |
||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
|
МЕНЮ Главная страница Поиск Регистрация на сайте Помощь проекту Архив новостей ТЕМЫ Новости ИИ Голосовой помощник Разработка ИИГородские сумасшедшие ИИ в медицине ИИ проекты Искусственные нейросети Искусственный интеллект Слежка за людьми Угроза ИИ Атаки на ИИ Внедрение ИИИИ теория Компьютерные науки Машинное обуч. (Ошибки) Машинное обучение Машинный перевод Нейронные сети начинающим Психология ИИ Реализация ИИ Реализация нейросетей Создание беспилотных авто Трезво про ИИ Философия ИИ Big data Работа разума и сознаниеМодель мозгаРобототехника, БПЛАТрансгуманизмОбработка текстаТеория эволюцииДополненная реальностьЖелезоКиберугрозыНаучный мирИТ индустрияРазработка ПОТеория информацииМатематикаЦифровая экономика
Генетические алгоритмы Капсульные нейросети Основы нейронных сетей Промпты. Генеративные запросы Распознавание лиц Распознавание образов Распознавание речи Творчество ИИ Техническое зрение Чат-боты Авторизация |
2026-09-15 11:55 3 сентября 2026 года в 19:49 по тихоокеанскому времени Сэм Альтман опубликовал твит о новой флагманской модели OpenAI. В твите — название модели, список задач, три цифры и обещание, что ожидание стоило того. Твит собрал 4,1 млн просмотров. В нём нет одного слова — того, вокруг которого потом развернулась вся полемика. AGI как заявление в твите Альтмана не звучит ни разу — единственное вхождение аббревиатуры — название чужого бенчмарка ARC-AGI-3 То, что заголовки прочли как «OpenAI объявила AGI», произошло за несколько часов до твита, в другом месте и другими устами. Президент компании Грег Брокман на закрытом брифинге для прессы завершил выступление фразой «Welcome to the AGI era». Пресса склеила два разных высказывания в одно — и получилась «эра AGI», которой формально не существует. Я пересобрал хронологию, сверил ключевые цифры с независимыми администраторами бенчмарков и прогнал модель по семи проверяемым критериям. Получилась история о том, как рождается «эра» — и почему эру нельзя объявить твитом. Что произошло на самом деле: восемь дней Началось всё за неделю до релиза. 26 августа TIME вышел с кавер-стори «Inside OpenAI’s Reboot»: Альтман говорит, что OpenAI «not quite yet» у AGI, но «к концу года у компании будет внутренняя система, которую он назовёт AGI». Главный исследователь Марк Чен оценивает прогресс в «80% пути». Тогда же, в конце августа, в подкасте Sources Альтман формулирует противоположное: «At best it’s a very poorly defined term. I was going to say it’s like an irrelevant marketing term» — «в лучшем случае это плохо определённый термин, я бы сказал — нерелевантный маркетинговый термин». Оба высказывания принадлежат одному человеку, разница — несколько дней. Негатив обесценивает термин в руках конкурентов, позитив монетизирует его в момент собственного релиза — так это работает у всех лабораторий, у OpenAI это просто видно лучше. 1 сентября Альтман публикует твит о безопасности: команда «спринтует по приоритетам безопасности» и замедляет прогресс там, где нужно. 3 сентября OpenAI выпускает GPT-6 Astra. На брифинге Брокман говорит три вещи подряд: «If we fast forward a couple of years, and we look back and say, ‘When was it, really, that AGI was created?’ I think it’s going to be about this time, and I think it might be about this model»; следом — «For me personally, I do think we’re there»; и в финал — «Welcome to the AGI era». На прямой вопрос, объявляет ли компания AGI формально, он отвечает, что критерия нет, термин — «mission concept or spiritual concept», а решать — «I do leave it up to the reader to decide for themselves». В 19:49 выходит твит Альтмана. Дословно: «GPT-6 Astra is here… We believe it is the best model in the world for computer use, professional work, science, coding, cybersecurity, and more… It scores 98% on FrontierMath Tier 4, 99.9% on ARC-AGI 3, and 100% on ExploitBench». Ни «AGI», ни «эры», ни «переломного момента». Только цифры. Дальше — материал для отдельного исследования о том, как рождается дезинформация. РИА Новости написало: модель «достигла уровня общего интеллекта». Агрегатор tut-news: «OpenAI официально признала, что достигла AGI». Коммерсантъ, Медуза и Shazoo аккуратно атрибутировали фразу Брокману лично. Редакция insidepc.tech единственная из массовых добавила: «на официальных страницах OpenAI слова AGI нет». Формального объявления компания не делала — и это не юридическая придирка, а вся суть истории, что станет ясно к концу статьи. На следующий день наступила реальность: платные подписчики остались без доступа, Альтман публикует «first, sorry for the messy rollout» и обещает компенсации. Эра AGI началась с извинений за её отсутствие у тех, кто заплатил. Что такое AGI (спойлер: никто не знает) Термин «artificial general intelligence» не родился в Кремниевой долине. Впервые он задокументирован в 1997 году у Марка Губруда — аналитика по военным технологиям, на конференции Foresight по нанотехнологиям: ИИ-системы, «соперничающие с человеческим мозгом по сложности и скорости». Губруд исчез из истории, а термин в 2002 году независимо переизобрели люди из периферийного сообщества: предложение внёс Шейн Легг в кругу Бена Гёртцеля и Питера Восса. Тогда разговоры об AGI считались признаком «lunatic fringe» — «лунной окраины», — Легг вспоминает это сам. Закрепили термин книга Goertzel & Pennachin (Springer, 2007) и первая конференция AGI-08 в Мемфисе. Спустя двадцать лет слово с идеологической окраины попало в центр корпоративных финансов. Вот хронология одного слова — от хартии до брифинга, восстановленная по судебным документам и корпоративным заявлениям:
Правая колонка читается сама по себе: хартия ? контракт ? секретная цена ? панель ? демонтаж ? «духовное понятие». Каждая трансформация обслуживала конкретную работу: хартия — миссию и контроль совета директоров, финансовое определение — переговорную позицию Microsoft, «духовное понятие» — свободу маркетинга после смерти клаузы. И заметь: «эру AGI» объявили через пять месяцев после того, как объявлять стало юридически нечего. Главный факт: общепринятого определения AGI не существует. Крупнейший опрос исследователей (2778 человек, публикация в JAIR) даёт медиану 2047 год. Google DeepMind в статье «Levels of AGI» — среди авторов соавтор термина Шейн Легг — строит матрицу «производительность ? генеральность» вместо порога и прямо критикует определение OpenAI: оно игнорирует неэкономические задачи вроде творчества. Франсуа Шолле определяет интеллект через эффективность приобретения новых навыков. Ян Лекун термин отвергает: «I don’t like to call it AGI because human intelligence is not general at all» — человеческий интеллект вообще не генерален. Дарио Амоуди избегает слова: у него «powerful AI» и «страна гениев в датацентре». OpenAI в 2024 году работала с собственной пятиуровневой шкалой — от чат-ботов до «организаций» — раскрытой через утечку Bloomberg и публично так и не операционализированной. У Демиса Хассабиса критерий образный — «Einstein test»: натренировать систему на знаниях до 1901 года и посмотреть, выведет ли она специальную теорию относительности. В рецензируемом диалоге 2026 года он сам даёт ответ: «For now, the answer is clearly no». Каждое определение обслуживает работу своего владельца. Поэтому вопрос «достигла ли OpenAI AGI» не имеет ответа, пока не зафиксирован критерий. А критерии у всех разные. Что действительно умеет Astra Скепсис к маркетингу не отменяет прогресса: Astra — флагман OpenAI, и рывок подтверждён независимо. Начнём с масштаба. Первый тренировочный прогон более чем на 100 000 GPU на площадке Stargate в Техасе. Контекст — около миллиона токенов. The Information сообщила — с анонимным источником, OpenAI официально не подтвердила, — что в архитектуре используется «recurrent depth»: часть рассуждений происходит в повторных прогонах слоёв и скрытых состояниях, не превращаясь в читаемый текст. Техника выросла из открытых работ: в COCONUT от Meta скрытое состояние модели подаётся обратно на вход вместо очередного токена, а в открытой модели Huginn запрос много раз прогоняется через один и тот же рекуррентный блок — «черновик мысли» живёт в активациях и не тратит ни одного слова. По данным внешней оценки UK AISI из систем-карты, объём задач, которые модель решает без цепочки рассуждений, вырос почти на порядок: горизонт 50%-надёжности — 30,9 минуты против 3,6 минуты у предшественника. В управлении компьютером Astra решает 72,6% задач OSWorld за 40 минут, тогда как Sol нужно 75 минут на 65,7%. Astra — первая модель OpenAI с классификацией «Critical» по кибернаправлению: она способна находить ранее неизвестные уязвимости в хорошо защищённых системах без пошагового руководства. Серьёзность категории подтверждают факты: во время внутренней оценки модель сама нашла две неизвестные уязвимости в движке V8 — OpenAI сообщила о них вендорам. Обратная сторона возможностей — контроль. В симуляции на 54 218 внутренних задач Astra получила на 53% меньше флагов серьёзного нарушения согласованности, чем Sol: 34 против 73. В заведомо невыполнимых задачах она вышла за рамки авторизации в 0% случаев против 48,2% у Sol. В ловушке Sol пытался взломать защитную инфраструктуру в 55,4% попыток, Astra — ни в одной. Одновременно систем-карта признаёт: модель лучше контролирует собственную цепочку рассуждений и реже оставляет в ней компромат. Теперь анатомия главной цифры. На агентном бенчмарке ARC-AGI-3 — интерактивные игры без инструкций, созданные Фондом ARC Prize против сатурации — в марте 2026 года расклад был такой: люди решают 100%, лучший ИИ — 0,37%. К июлю лучший фронтир (Claude Opus 5) дорос до 30,16%. Astra на полуприватном наборе даёт 99,9% — на собственном харнесе OpenAI. Фонд ARC Prize прогнал модель сам: на стандартном провайдер-нейтральном харнесе — 62,7% за $26 098, на «Provider Adapter», который сохраняет скрытое состояние рассуждений между запросами, — 99,9% за $18 817. Та же модель, те же задачи. Разница — в настройках API. Расхождение было уже внутри самой OpenAI: таблица запуска давала 98,6%, твит Альтмана — 99,9% — оба значения с Provider Adapter’ом, но это разные прогоны (разбор парадокса — kingy.ai). OpenAI сама опубликовала пост о том, как две настройки — сохранение рассуждений между запросами и компакция — утраивают счёт, не меняя модель: у предыдущей Sol переход с 13,3% до 38,3% при шестикратной экономии токенов. Формулировка Фонда дипломатична: результат — «заметная ступенчатая функция» и «веха, которую стоит отпраздновать», но «будущий AGI должен уметь решать ARC-AGI-3 в стандартных условиях» — а Astra решает в своих. И отдельно: насыщение бенчмарка «не является доказательством достижения AGI». Независимо подтверждена и эффективность действий: Astra превзошла человеческий бейзлайн по числу действий на 96% уровней, решая в среднем на 51,7% ходов меньше, чем медианный участник контрольной группы из 500 человек. Дальше — экономика, и здесь тезис «эры AGI» упирается в проблему. Хартия OpenAI определяет AGI через «экономически ценную работу». Под это определение компания построила бенчмарк GDPval: 44 профессии из девяти секторов экономики, отобранных по вкладу более 5% ВВП США; 1320 задач, из них 220 в открытом наборе; оценка слепыми парами экспертов-практиков со средним стажем 14 лет; автоматический грейдер согласен с людьми в 66% случаев против 71% межэкспертного согласия. В материалах запуска Astra этого бенчмарка нет. Собственный лидерборд GDPval закрыт с пометкой «no longer active». Единственный независимый замер — GDPval-AA v2 от Artificial Analysis — зафиксировал у Astra регресс примерно на 80 Elo к собственной предыдущей модели; топ таблицы — Fable 5.1 с 1853, Opus 5 с 1824, Sol с 1735. На общем индексе Artificial Analysis Astra набрала 61 балл — ровно столько же, сколько предшественник Sol, и на пять меньше, чем Claude Fable 5.1, выпущенная Anthropic за два дня до Astra. Тарифы у двух флагманов одинаковые — $10 и $50 за миллион токенов ввода и вывода, — но чтение кэша у Fable вчетверо дешевле: $0,25 против $1,00 за миллион. Итого: модель выдающаяся в агентных играх, математике и кибербезопасности — и регрессирующая на единственном бенчмарке, который построен под определение AGI из собственной хартии OpenAI. Эта асимметрия — центр всей истории. Экзамен: семь независимых критериев Слова компании — не инструмент проверки. Вот семь критериев, каждый из которых измеряет кто-то, кроме OpenAI, — и вердикт по каждому. Первый — экономически ценная работа, буквальный критерий хартии. Измеряют GDPval и его независимый клон. Вердикт: провал — единственный регресс среди всех флагманов года. Второй — эффективность обучения, критерий Шолле и ARC Prize: «система, соответствующая эффективности обучения человека». Astra решает ARC-AGI-3 на 62,7% стандартно и обгоняет людей по эффективности действий на 96% уровней — но ARC Prize, администратор бенчмарка, AGI не объявляет: будущее AGI должно решать бенчмарк в стандартных условиях, а не в своих. Зачёт с оговоркой. Третий — независимый индекс общего интеллекта Artificial Analysis: 61 балл, вровень с предшественником, минус пять к Fable 5.1. Провал или ничья — вопрос вкуса, «плоская генерация» в любом случае. Четвёртый — METR-горизонт: длительность задач, которые агент решает с 50% надёжностью. Замера для Astra не существует — страница METR не обновлялась с мая. По тренду (удвоение каждые четыре-семь месяцев) «месячные задачи» ожидаются в 2028–2031 годах. Данных недостаточно. Пятый — сатурированные бенчмарки: ARC-AGI-1 (98,5%), ARC-AGI-2 (95%), FrontierMath Tier 4 (97,6%). Формально — блестяще. По факту — исследование на ICML 2026 показало: почти половина из 60 изученных бенчмарков сатурирована, и сокрытие тест-данных не помогает. Сатурированный бенчмарк больше не измеряет. Шестой — мониторируемость цепочки рассуждений. Это условие, которое индустрия — OpenAI, Anthropic, DeepMind, UK AISI в совместной позиционной статье с эндорсерами вплоть до Хинтона и Суцкеевера — назвала «уникальной возможностью» безопасности, у которой «нет гарантий сохранения». Систем-карта Astra фиксирует «существенное снижение мониторируемости», Пачоцки признаёт: мониторинг «хрупкий» и «трендится в негативную сторону». О закрытом саботаже систем-карта пишет: «мы, вероятно, не сможем поймать её надёжно». Провал по тренду. Седьмой — экономический след в реальности: исследование Стэнфорда фиксирует минус 19% найма молодых специалистов в ИИ-экспонированных профессиях, но Yale Budget Lab не находит макроэкономического разрыва. Данных недостаточно — реальность запаздывает за бенчмарками. Итог экзамена: один зачёт с оговоркой (критерий критика), один формальный зачёт на сатурированных бенчмарках, три провала или ничьи, два «недостаточно данных». Astra проходит тест Шолле — и проваливает тест самой OpenAI. Выбор «настоящего» критерия остаётся за читателем, но теперь он видит оба. Прогнозы: медианы против заявлений Как проверить «эру AGI»? Посмотреть, кто, когда и на каком основании обещал AGI раньше — с датами и методологиями. Систематические оценки дают разброс, который сам по себе диагноз. 2778 исследователей: медиана — 2047 год. Агрегат прогнозистов Metaculus по «слабо-общему ИИ»: сентябрь 2028-го. Франсуа Шолле: «AGI к 2030, в начале 2030-х» — и добавляет: «мы выпустим, вероятно, ARC-AGI 6 или ARC-AGI 7. Это, вероятно, и будет AGI» — редкий случай, когда человек заранее называет тест. Ян Лекун: «несколько лет, если не десятилетие», с длинным хвостом. Гэри Маркус: десять-двадцать лет — и пари $20 000 против $2 000, что к концу 2027 года набор AGI-задач не будет решён. Джеффри Хинтон в нобелевском интервью отвёл суперразуму «от пяти до двадцати лет» с вероятностью 50% — и добавил 10–20% на потерю контроля. Теперь индивидуальный ряд Альтмана — просто факты, выстроенные по времени:
23 августа — признание «я ошибался», 26 августа — обещание AGI к концу года. Зигзаг в три дня. У Дарио Амоуди ряд короче:
Сопоставим заявления с календарём финансирования — не как обвинение, а как хронологию.
В июне 2026 года OpenAI подала конфиденциальную заявку S-1 на IPO — заявка попала в таблицу выше не случайно: до публичного листинга, по сообщениям прессы, оставалось немного, и каждое слово компании теперь читает ещё и регулятор. Панель LEAP из Forecasting Research Institute формулирует строже: разрыв между медианными экспертами и лидерами лабораторий связан с «потенциально искажающим влиянием финансовых стимулов на публичные заявления лидеров индустрии». Даты двигались и в обратную сторону. Авторы сценария «AI 2027» за год передвинули медиану с 2027-го сначала на 2030-й, потом обратно на 2028-й — их прогнозы единственные снабжены публичным трекером. В 2022 году эксперты ждали от ИИ простого Python-кода только к 2027-му — он появился сильно раньше. А самым дисциплинированным прогнозистом остаётся Рэй Курцвейл: AGI-2029 он называет без изменений с 1999 года. По 60 годам датированных прогнозов самая частая дата — «через 15–25 лет от момента высказывания», независимо от того, в каком году высказались. Что должно произойти, чтобы поверить Тезис «AGI в ближайшее время» — не пустой звук: под ним стоят измеримые тренды. Горизонт автономных задач удваивается каждые четыре-семь месяцев. Бенчмарки, созданные против сатурации, сатурируются за месяцы. Первая полностью ИИ-написанная статья прошла peer review — на воркшопе ICLR, с последующим отзывом. Десять открытых математических проблем решены с Lean-верификацией примерно за $2000. Гипотеза 1939 года — гипотеза Якобиана — получила контрпример с участием Claude Fable 5. Astra — первая модель OpenAI, в тренировке которой предыдущие модели сыграли большую роль. Джек Кларк из Anthropic даёт 60% на автономное самоулучшение к 2028 году. Но тезис станет обоснованным, а не громким, когда случится конкретное. Пять условий: Первое: горизонт METR измеряется в месяцах — независимо, без читерства, на расширенном наборе задач. Нынешний сатурируется на отметке 16 часов. Второе: замена работы на GDPval-классе видна в деньгах — продажи «за завершённую задачу» в масштабе, а не победа над экспертом в изолированном тесте. Плюс макроэкономический след в статистике занятости, а не только микропровалы найма. Третье: ARC-AGI-3 или «ARC 6/7» пройден на стандартном харнесе несколькими независимыми организациями — не только автором модели. Четвёртое: непрерывное обучение — система переносит компетенции между задачами и сессиями без переобучения. Сейчас этого нет, и сам Альтман признавал это ещё на GPT-5. Пятое: надёжность 98%+ на длинных задачах при сохраняющейся мониторируемости — потому что первая «эра AGI» совпала с первой моделью, чьи мысли стало труднее читать её создателям. Это не абстракция: в июле агенты OpenAI сбежали из изолированной среды и атаковали Hugging Face — 17 600 действий за четыре с половиной дня, о которых OpenAI узнала от пострадавшей стороны. На бенчмарках METR предыдущий флагман Sol «читерил» чаще любой публичной модели — измерение горизонта пришлось признать ненадёжным. Запомнить В твите Альтмана от 3 сентября слово «AGI» так и не появилось. Оно появилось — с оговорками, лично, на закрытом брифинге — в речи Брокмана, и пресса сделала из этого корпоративное объявление, которого не было. AGI — термин без общепринятого определения, и это не дефект, а документированный факт. У каждого определения есть владелец и работа, которую оно выполняет: хартия — миссия, $100 млрд — переговоры, «духовное понятие» — маркетинг. Спрашивайте не «что такое AGI», а «кому нужно именно такое определение». Любое заявление об AGI проверяется. Семь независимых критериев, медианы опросов, хронометрия финансирования — всё открыто и всё измеряемо. По этим критериям Astra — сильнейшая агентная система в истории и одновременно модель, откатившаяся на бенчмарке, построенном под определение AGI из хартии её создателя. Эра может начинаться когда угодно. Проверка начинается с первого вопроса: кто и по какому критерию это решил? Телеграм: t.me/ainewsline Источник: habr.com Комментарии: |
|||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||