Публике не доступны внутренние модели фронтирных лабораторий |
||
|
МЕНЮ Главная страница Поиск Регистрация на сайте Помощь проекту Архив новостей ТЕМЫ Новости ИИ Голосовой помощник Разработка ИИГородские сумасшедшие ИИ в медицине ИИ проекты Искусственные нейросети Искусственный интеллект Слежка за людьми Угроза ИИ Атаки на ИИ Внедрение ИИИИ теория Компьютерные науки Машинное обуч. (Ошибки) Машинное обучение Машинный перевод Нейронные сети начинающим Психология ИИ Реализация ИИ Реализация нейросетей Создание беспилотных авто Трезво про ИИ Философия ИИ Big data Работа разума и сознаниеМодель мозгаРобототехника, БПЛАТрансгуманизмОбработка текстаТеория эволюцииДополненная реальностьЖелезоКиберугрозыНаучный мирИТ индустрияРазработка ПОТеория информацииМатематикаЦифровая экономика
Генетические алгоритмы Капсульные нейросети Основы нейронных сетей Промпты. Генеративные запросы Распознавание лиц Распознавание образов Распознавание речи Творчество ИИ Техническое зрение Чат-боты Авторизация |
2026-09-15 11:49 Публике не доступны внутренние модели фронтирных лабораторий. И речь не о конспирологии в духе «у OpenAI в подвале сидит настоящий AGI, а наружу выдают обрезанный ChatGPT». Просто лаборатория создаёт не одну нейросеть, а целую фабрику моделей: research-чекпоинты, экспериментальные модели, reward-модели, модели-учителя, модели для генерации синтетических данных, evaluators, дистиллированные студенты и только потом production-модель. Наружу попадает лишь последний элемент цепочки. Допустим, вы обучили чудовищно дорогую модель, которая отлично рассуждает, пишет код и решает математику, но каждый запрос к ней стоит огромных вычислений. Для исследователя внутри компании это рабочий инструмент, и он того стоит, если на кону триллионные рынки. Для продукта со 100 млн пользователей масштабировать доступ к таким моделям невыгодно. Поэтому сильную модель делают учителем: она генерирует качественные ответы, решения, траектории рассуждений, синтетические данные, иногда сами распределения вероятностей, а на этом поведении обучается студент поменьше. Ему не нужно воспроизводить учителя целиком — достаточно перенести нужные возможности. Это одна из форм дистилляции знаний. Практика настолько распространена, что OpenAI прямо предоставляет разработчикам официальный Model Distillation workflow: брать ответы более сильной модели, например GPT-4o или o1-preview, и обучать на них более дешёвую модель. Формулировка самой OpenAI точная: взять продвинутую модель и получить сопоставимое качество на конкретной задаче при существенно меньшей стоимости. Публичных примеров такой схемы за последние два года накопилось много. Apple описывала внутреннего Mixture-of-Experts учителя, которого использовала при обучении своей небольшой on-device foundation model. Google обучала EmbeddingGemma с помощью более мощного учителя Gemini. Meta использовала логиты Llama 3.1 8B и 70B при создании маленьких Llama 3.2 1B и 3B. Microsoft прямо писала, что ранние Phi в значительной степени дистиллировали возможности GPT-4. DeepSeek после обучения R1 выпустила линейку дистиллированных моделей от 1.5B до 70B. Схема «сильный учитель ? дешёвый студент» реальна и хорошо задокументирована. Иногда учитель вообще публичный: Meta использовала публичные Llama 3.1, DeepSeek выложила и большую R1, и дистиллированные из неё модели. Причём студент иногда обходит своего учителя на конкретном бенчмарке или узкой задаче за счёт специализации и пост-трейнинга. Так что утверждать, что весь open source — это специально ухудшенная дистилляция секретных моделей, неверно. А вот более слабое утверждение подтверждается: публичный каталог моделей почти наверняка не показывает весь фронтир возможностей конкретной лаборатории. В 2026 году в математических статьях начала регулярно появляться очень необычная формулировка. 31 марта группа математиков опубликовала работу с решениями трёх задач Эрдёша, где в abstract прямо написано: «in each case, the proof is due entirely to an internal model at OpenAI». Это не единичный случай. В феврале внутренняя модель OpenAI построила новое решение задачи Эрдёша, Нешетрила и Рёдля. В апреле вышла ещё одна работа с пятью доказательствами, полученными таким же образом. А затем внутренняя модель OpenAI нашла контрпример к гипотезе Эрдёша о unit distances, открытой около восьмидесяти лет. Доказательство проверили внешние математики. В сопутствующей статье указано, что первоначальный математический результат был сгенерирован в один проход внутренней моделью, после чего люди переработали изложение через Codex. W. T. Gowers написал, что если бы такое доказательство прислал человек, он без колебаний рекомендовал бы его к публикации в Annals of Mathematics. Mehtaab Sawhney сформулировал это ровно так: «the solution was found by an internal model at OpenAI». Kevin Weil, тогда один из руководителей OpenAI Телеграм: t.me/ainewsline Источник: vk.com Комментарии: |
|