Два режима
Рассуждение и обычный ответ. Рассуждение включено по умолчанию, переключается параметром запроса.
В API у DeepSeek работают две модели — v4-flash и v4-pro. Обе держат миллион токенов контекста и умеют одно и то же по функциям, различаются силой в агентских задачах, ценой и допустимой параллельностью.
| Параметр | deepseek-v4-flash | deepseek-v4-pro |
|---|---|---|
| Версия снапшота | DeepSeek-V4-Flash-0731 | DeepSeek-V4-Pro-0813 |
| Контекст | 1 млн токенов | 1 млн токенов |
| Максимум в ответе | 384 тыс. токенов | 384 тыс. токенов |
| Параллельных запросов | 2 500 | 500 |
| Вход вне пика, промах кеша | 0,22 $ | 0,66 $ |
| Выход вне пика | 0,66 $ | 1,98 $ |
Разница в цене — ровно втрое по всем строкам. Разница в пропускной способности — впятеро, но в пользу Flash: 2 500 одновременных запросов против 500. Отсюда и разделение труда: Pro ставят на сложные агентские задачи, Flash — на поток.
Рассуждение и обычный ответ. Рассуждение включено по умолчанию, переключается параметром запроса.
Ответ строгим JSON и вызов внешних функций поддержаны обеими моделями — без этого агент не собрать.
Формат OpenAI, Responses API и совместимый с Anthropic адрес api.deepseek.com/anthropic.
Две возможности идут с оговоркой: дописывание кода посередине файла (FIM) и продолжение начатого ответа работают в бета-статусе, причём FIM — только в обычном режиме, без рассуждения.
R1 сделала DeepSeek известным: это была первая массовая модель с открытыми весами, которая рассуждала вслух. В нынешней линейке API её нет — рассуждение переехало прямо в V4 и стало режимом по умолчанию.
Сама R1 никуда не делась: она числится в разделе исследований на сайте и лежит весами на Hugging Face. Её берут, когда модель нужно поднять у себя, а не звать по сети.
Три ступени предыдущего поколения, тоже с открытыми весами. На них до сих пор держатся сторонние сборки и локальные запуски: требования к железу ниже, чем у V4.
Свежий шаг — официальный выпуск V4 Pro с усиленными агентскими возможностями, поддержкой Responses API и интеграцией с Codex. Модель раздали сразу в веб, приложение и API.
Flash. Ответы короткие, запросов много, тройная переплата за Pro тут ничего не добавит.
Pro. Ради этого его и выпускали, и лимит в 500 одновременных запросов для агентской нагрузки обычно не узкое место.
Открытые веса: V4 или R1 с Hugging Face. Платить за токены не придётся вовсе, но железо и его обслуживание — на вас.
Смена модели — это одна строка в запросе, поэтому выбирать заранее навсегда не нужно: типовой путь — собрать на Flash, померить качество на своих данных и перевести на Pro только те запросы, где разница видна.
Syntx даёт доступ к нейросетям по подписке и принимает оплату российской картой.