OpenAI представила новые модели распознавания речи

МЕНЮ


Главная страница
Поиск
Регистрация на сайте
Помощь проекту
Архив новостей

ТЕМЫ


Новости ИИРазработка ИИВнедрение ИИРабота разума и сознаниеМодель мозгаРобототехника, БПЛАТрансгуманизмОбработка текстаТеория эволюцииДополненная реальностьЖелезоКиберугрозыНаучный мирИТ индустрияРазработка ПОТеория информацииМатематикаЦифровая экономика

Авторизация



2026-07-31 14:46

ИИ проекты

GPT Transcribe (https://developers.openai.com/api/docs/models/gpt-transcribe) предназначена для работы с аудиофайлами и обрабатывает их примерно в 34 раза быстрее реального времени.

GPT Live Transcribe (https://developers.openai.com/api/docs/models/gpt-live-transcribe) оптимизирована для потоковой расшифровки звука с минимальной задержкой.

Оба решения доступны через API, умеют учитывать текстовый контекст и заданные ключевые слова, а также поддерживают мультиязычный ввод.

По данным тестов Artificial Analysis на бенчмарке AA-WER, GPT Transcribe демонстрирует (https://artificialanalysis.ai/speech-to-text/non-streaming#error-rate-tabs) уровень ошибок в словах (WER) на отметке 3,3%. Это на 0,7 пп лучше результата ее предшественницы - GPT-4o Transcribe.

Несмотря на улучшенные метрики, изделие OpenAI пока не дотягивает до лидеров.

В рейтинге AA-WER первое место у Fun-Realtime-ASR-Preview от Alibaba Group с показателем 1,7% второе - у ElevenLabs Scribe v2 (2,2%), за ней следуют MAI-Transcribe-1.5 (2,4%), Mistral Voxtral Small (2,8%) и Gemini 3.1 Pro (2,8%).

Вместе с релизом OpenAI снизила тарифы - минута обработки аудио обойдется в $0,0045, а для GPT Live Transcribe - $0.017.


Телеграм: t.me/ainewsline

Источник: artificialanalysis.ai

Комментарии: