Компания DeepSeek запустила публичную бета-версию официального API для модели V4-Flash. Как сообщили в компании, обновление резко усилило агентные способности модели, а ее результаты в тестах превзошли прежнюю версию V4-Pro-Preview.

Обновление касается только API модели V4-Flash. API старшей модели V4-Pro, а также приложение и веб-версия DeepSeek пока остались без изменений.

Что изменилось в модели

Как сообщили в DeepSeek, главный упор в обновлении сделан на агентные задачи. Речь идет о работе, где модель действует самостоятельно — пишет и запускает код, ищет информацию и выполняет цепочки действий.

Модель теперь напрямую поддерживает формат Responses API. Это интерфейс, через который агент обменивается с моделью запросами и получает результат.

Отдельно V4-Flash адаптировали под Codex — агент для написания кода от OpenAI. Такая совместимость позволяет подключать модель DeepSeek к популярному инструменту разработчиков.

Способ вызова API при этом не изменился. Чтобы перейти на новую версию, разработчику достаточно указать в настройках имя модели deepseek-v4-flash.

Сама архитектура и размер модели остались прежними. Версия V4-Flash-0731 сохранила устройство препробной версии, но прошла дополнительное переобучение.

Что показали тесты

Результаты в тестах, по данным компании, заметно выросли. Новая версия V4-Flash-0731 почти везде обошла и прежнюю V4-Flash-Preview, и более старшую V4-Pro-Preview, местами приблизившись к Opus-4.8 от Anthropic и превзойдя китайскую GLM-5.2.

V4-Flash-0731 обошла V4-Pro-Preview во всех тестах, но уступила Opus-4.8. Источник: DeepSeek

В тесте Terminal Bench 2.1 (умение выполнять задачи в командной строке) модель набрала 82,7 балла против 61,8 у прежней версии. Это выше, чем у GLM-5.2 с ее 81,0, и почти на уровне Opus-4.8 с 85,0.

Сильнее всего прогресс виден в задачах на код. В NL2Repo (превращение текстового описания в готовый репозиторий) V4-Flash получила 54,2 балла против 39,4 у пре-пробной версии, а в DeepSWE (решение реальных задач по программированию) — 54,4 против всего 7,3 у прошлой версии.

Резкий скачок заметен и в безопасности. В Cybergym (поиск уязвимостей в коде) модель набрала 76,7 балла против 38,7 у прежней версии и 52,7 у старшей V4-Pro-Preview.

Улучшились и результаты в работе с инструментами. В Toolathlon-Verified (использование внешних инструментов) V4-Flash получила 70,3 балла, в Agents’ Last Exam (сложные агентные задачи) — 25,2, а в AutomationBench (автоматизация рабочих сценариев) — 25,1, обойдя по всем трем показателям прежние версии.

Компания обнародовала и внутренние тесты. В DSBench-FullStack (полноценная веб-разработка) модель набрала 68,7 балла, а в DSBench-Hard (сложные задачи для программного агента) — 59,6, что заметно выше прежних версий, хотя и уступает Opus-4.8.

По итогам всех тестов вывод компании сводится к тому, что более легкая и экономичная V4-Flash обошла старший вариант прошлого поколения V4-Pro-Preview, а по ряду задач вплотную подобралась к ведущим закрытым моделям.

Полную таблицу результатов компания привела в своих материалах. Другие показатели тестов доступны в официальной документации DeepSeek.

Что это значит для разработчиков

Модель V4-Flash в DeepSeek позиционируют как быстрый и экономичный вариант. Она рассчитана на большие объемы работы при меньших затратах, чем у старшей модели V4-Pro.

Поддержка Codex расширяет сферу применения модели. Разработчики смогут использовать V4-Flash в привычном агенте для написания кода без смены рабочего инструмента.

Публичная бета означает открытый доступ к API. Любой разработчик может подключить новую версию уже сейчас и проверить ее в своих задачах.

Компания сохранила и обратную совместимость. Прежние обращения к API продолжают работать, а переход на V4-Flash сводится к смене имени модели.

Обновление старшей модели V4-Pro в DeepSeek анонсировали отдельно. Ее официальный выпуск компания представит позже.

Будь в курсе! Подписывайся на Телеграм.