DeepSeek выпустили финальную версию DeepSeek-V4-Flash-0731. Модель получила апгрейд агентских функций и встроенный модуль спекулятивного декодирования DSpark. При меньшем числе активных параметров она обходит прошлую Pro-версию. В бенчмарке DeepSWE результат вырос до 54.4%, а в TerminalBench — до 82.7%. Это ставит открытую модель в один ряд с проприетарным Opus-4.8. По данным разработчиков, добавлена совместимость с Codex и поддержка Responses API.
Разработчики отказались от Jinja-шаблонов. Форматирование сообщений под OpenAI API теперь работает через Python-скрипты из директории encoding. Появился параметр reasoning_effort с тремя уровнями: low, high и max. Он определяет время на предварительные вычисления перед ответом. Для высоких уровней авторы советуют ставить лимит генерации в 384K токенов.
Сервинг через vLLM требует одного флага — --speculative-config с методом dspark. В движке SGLang ускорение включается параметром --speculative-algorithm DSPARK. Отдельный путь к draft-модели не нужен, веса подтягиваются из основного чекпоинта. При локальном развертывании для агентских сценариев оптимальны temperature = 1.0 и top_p = 0.95.
Поделиться:
Китайский стартап MiniMax представил мультимодальную видеомодель Hailuo H3 с открытыми весами
DeepSeek-V4-Flash вышел в бету: улучшенные агенты и нативная поддержка Codex