Модели DeepSeek: V4 Pro, V4 Flash и R1

В API у DeepSeek работают две модели — v4-flash и v4-pro. Обе держат миллион токенов контекста и умеют одно и то же по функциям, различаются силой в агентских задачах, ценой и допустимой параллельностью.

Две модели, одна линейка

Параметрdeepseek-v4-flashdeepseek-v4-pro
Версия снапшотаDeepSeek-V4-Flash-0731DeepSeek-V4-Pro-0813
Контекст1 млн токенов1 млн токенов
Максимум в ответе384 тыс. токенов384 тыс. токенов
Параллельных запросов2 500500
Вход вне пика, промах кеша0,22 $0,66 $
Выход вне пика0,66 $1,98 $

Разница в цене — ровно втрое по всем строкам. Разница в пропускной способности — впятеро, но в пользу Flash: 2 500 одновременных запросов против 500. Отсюда и разделение труда: Pro ставят на сложные агентские задачи, Flash — на поток.

Что умеют обе модели

Два режима

Рассуждение и обычный ответ. Рассуждение включено по умолчанию, переключается параметром запроса.

JSON и инструменты

Ответ строгим JSON и вызов внешних функций поддержаны обеими моделями — без этого агент не собрать.

Три формата API

Формат OpenAI, Responses API и совместимый с Anthropic адрес api.deepseek.com/anthropic.

Две возможности идут с оговоркой: дописывание кода посередине файла (FIM) и продолжение начатого ответа работают в бета-статусе, причём FIM — только в обычном режиме, без рассуждения.

Что осталось от прошлых поколений

R1 — модель, с которой всё началось

R1 сделала DeepSeek известным: это была первая массовая модель с открытыми весами, которая рассуждала вслух. В нынешней линейке API её нет — рассуждение переехало прямо в V4 и стало режимом по умолчанию.

Сама R1 никуда не делась: она числится в разделе исследований на сайте и лежит весами на Hugging Face. Её берут, когда модель нужно поднять у себя, а не звать по сети.

V3, V3.1, V3.2

Три ступени предыдущего поколения, тоже с открытыми весами. На них до сих пор держатся сторонние сборки и локальные запуски: требования к железу ниже, чем у V4.

Куда идёт линейка

Свежий шаг — официальный выпуск V4 Pro с усиленными агентскими возможностями, поддержкой Responses API и интеграцией с Codex. Модель раздали сразу в веб, приложение и API.

Какую выбрать под задачу

A

Чат-бот, поддержка, разбор писем

Flash. Ответы короткие, запросов много, тройная переплата за Pro тут ничего не добавит.

B

Агент с инструментами и длинной цепочкой

Pro. Ради этого его и выпускали, и лимит в 500 одновременных запросов для агентской нагрузки обычно не узкое место.

C

Свой сервер и закрытый контур

Открытые веса: V4 или R1 с Hugging Face. Платить за токены не придётся вовсе, но железо и его обслуживание — на вас.

Смена модели — это одна строка в запросе, поэтому выбирать заранее навсегда не нужно: типовой путь — собрать на Flash, померить качество на своих данных и перевести на Pro только те запросы, где разница видна.

Что смотреть дальше

Попробовать V4 без своей карты

Syntx даёт доступ к нейросетям по подписке и принимает оплату российской картой.