Релиз DeepSeek V4 Flash уже поддерживает новую технологию генерации нескольких токенов сразу — DeepSeek DSpark |
||
|
МЕНЮ Главная страница Поиск Регистрация на сайте Помощь проекту Архив новостей ТЕМЫ Новости ИИ Голосовой помощник Разработка ИИГородские сумасшедшие ИИ в медицине ИИ проекты Искусственные нейросети Искусственный интеллект Слежка за людьми Угроза ИИ Атаки на ИИ Внедрение ИИИИ теория Компьютерные науки Машинное обуч. (Ошибки) Машинное обучение Машинный перевод Нейронные сети начинающим Психология ИИ Реализация ИИ Реализация нейросетей Создание беспилотных авто Трезво про ИИ Философия ИИ Big data Работа разума и сознаниеМодель мозгаРобототехника, БПЛАТрансгуманизмОбработка текстаТеория эволюцииДополненная реальностьЖелезоКиберугрозыНаучный мирИТ индустрияРазработка ПОТеория информацииМатематикаЦифровая экономика
Генетические алгоритмы Капсульные нейросети Основы нейронных сетей Промпты. Генеративные запросы Распознавание лиц Распознавание образов Распознавание речи Творчество ИИ Техническое зрение Чат-боты Авторизация |
2026-08-01 07:32 Релиз DeepSeek V4 Flash уже поддерживает новую технологию генерации нескольких токенов сразу — DeepSeek DSpark. По тестам DeepSeek на их кластере DeepSeek V4 Flash должен ускориться на +60%… +85% в зависимости от длины контекста. Правда, этот резерв может быть поглощён быстро растущей клиентской базой DeepSeek за рубежом, но весьма вероятно, что скорость инференса по API вырастет. Что клиентам важнее скорость и цена, чем просто IQ модели, хорошо видно по трендам OpenRouter, где DeepSeek забрался на первое место после релиза. Однако IQ даже у DeepSeek V4 Flash впечатляющее. Вендор обновил Technical Paper, и тут скорее вопрос, как модель, имеющая всего 284B, из которых только 13B активны, имеет такой впечатляющий интеллект. Во многом мы видим тренд, который начал Qwen 3.5 27B, когда мы увидели, что в способности программировать (SWE-Bench) и в общих знаниях (MMLU) модель ничем не уступает или даже превосходит ChatGPT 5. Просто много весов нужно для знания разных редких фактов, а сам интеллект модели больше зависит от устройства весов. Причём средняя LLM тут может даже иметь преимущество в Reinforcement Learning. Сейчас Gemini Flash тоже умнее Pro-модели, как и Flash у DeepSeek умнее Pro. Дело в том, что если у вас модель компактная, то вы можете быстрее сделать много циклов Reinforcement Learning. Однако то, что DeepSeek V4 Flash по бенчмаркам и Code Arena на одном уровне с GLM-5.2, у которого 744B весов, из которых 40B активных, — это говорит о многом. Точнее, может говорить о том, что «зайцы» ошиблись, отказавшись от GRPO, как у DeepSeek, когда перешли на «американский» PPO. Фактически мы видим сейчас торжество GRPO как RL-движка обучения с невероятным результатом для модели в 284B весов. На самом деле тут тревожный момент в том числе для американских вендоров LLM: DeepSeek впервые сделал мощное улучшение IQ без серьёзной архитектурной перестройки. Это говорит о том, что улучшение больше пошло в конвейерах подготовки данных и песочницах для GRPO-обучения. Тут традиционно было некоторое слабое место DeepSeek в том плане, что движки они делали всегда фронтирные и вводили новые технологии для всей ИИ-отрасли, как MLA, но вот сказать, что именно в самом datasets и схемах обучения они были абсолютный топ, — это вряд ли. Сейчас мы видим, что DeepSeek резко сместил акцент с движка именно на то, как модель обучается. Поэтому и потенциал GRPO заиграл другими красками. https://arxiv.org/abs/2606.19348 Телеграм: t.me/ainewsline Источник: t.me Комментарии: |
|