Пик и всё остальное время
Пиковые часы — 01:00–04:00 и 06:00–10:00 по UTC, то есть 04:00–07:00 и 09:00–13:00 по Москве. Вне этих окон тариф ровно вдвое ниже. Ночная пакетная обработка на этом экономит половину счёта.
API DeepSeek совместим с форматом OpenAI, поэтому подключается сменой адреса и ключа. Счёт выставляется за токены, ночной тариф вдвое ниже дневного, а повторный контекст из кеша стоит в тридцать раз дешевле обычного входа.
platform.deepseek.com принимает тот же аккаунт, что и чат. Отдельную регистрацию проходить не нужно.
Ключ выпускается в личном кабинете платформы. Все ключи аккаунта делят общий лимит параллельных запросов, поэтому плодить их ради обхода ограничения смысла нет.
Списание идёт по факту: число токенов, умноженное на цену. Сначала тратится подаренный баланс, если он есть, потом внесённый.
Базовый адрес — https://api.deepseek.com, имя модели — deepseek-v4-flash или deepseek-v4-pro. Остальной код клиента OpenAI остаётся как был.
from openai import OpenAI
client = OpenAI(api_key="ваш_ключ", base_url="https://api.deepseek.com")
response = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[{"role": "user", "content": "Привет!"}],
)
Быстрая модель на поток задач: 2 500 параллельных запросов на аккаунт.
Флагман с усиленными агентскими возможностями, 500 параллельных запросов.
Пиковые часы — 01:00–04:00 и 06:00–10:00 по UTC, то есть 04:00–07:00 и 09:00–13:00 по Москве. Вне этих окон тариф ровно вдвое ниже. Ночная пакетная обработка на этом экономит половину счёта.
Совпавшее начало запроса считается по цене кеша: 0,007 $ вместо 0,22 $ у Flash. Длинная системная инструкция, одинаковая от запроса к запросу, почти перестаёт стоить денег — держите её первым блоком, а переменную часть в конце.
https://api.deepseek.com — путь переезда для готового кода: меняются только адрес, ключ и имя модели.
https://api.deepseek.com/anthropic принимает запросы в виде, привычном для SDK Claude, включая блок metadata.
Поддержан обеими моделями V4 — на нём собирают агентов, которым нужны состояние и вызовы инструментов.
Дополнительно доступны строгий JSON на выходе, вызов функций, продолжение начатого ответа и дописывание кода посередине файла. Последние два — в бета-статусе, причём дописывание работает только в обычном режиме, без рассуждения.
| Правило | Как работает |
|---|---|
| Параллельные запросы | 2 500 у Flash, 500 у Pro. Считаются на аккаунт целиком, независимо от числа ключей |
| Превышение | Ответ HTTP 429. Расширение квоты запрашивается у разработчика и денег не стоит |
| Изоляция user_id | Строка до 512 символов из латиницы, цифр, дефиса и подчёркивания. Разделяет кеш и очередь между вашими пользователями |
| Долгий ответ | Соединение держится: в обычном режиме приходят пустые строки, в потоковом — комментарии : keep-alive |
| Простой | Если за 10 минут вывод не начался, сервер обрывает соединение |
Пустые строки и keep-alive-комментарии ломают самописные парсеры ответов — их нужно пропускать явно. На разбор JSON они не влияют.
Пополнение баланса идёт иностранной картой, карты российских банков платформа не принимает — это главное препятствие для российских разработчиков, а не блокировки: сам сайт открывается напрямую.
Обходят это двумя путями. Первый — иностранная карта или знакомый за рубежом. Второй, который выбираем мы, — сервис-посредник Syntx: он принимает оплату российской картой, держит несколько нейросетей в одной подписке и работает и в браузере, и в Telegram.
Веса V4, V3.2, V3.1, R1 и V3 выложены открыто, поэтому платить за токены необязательно вовсе: модель поднимается на своём железе, и данные не уходят наружу. Забирают их с Hugging Face, код и инструкции — на GitHub.
Считать выгоду стоит от объёма: при десятках миллионов токенов в месяц аренда GPU дороже, чем Flash по 0,22 $ за миллион. Локальный запуск берут ради приватности и независимости от чужой очереди, а не ради экономии.
Syntx принимает российскую карту и открывает доступ к 90+ нейросетям сразу после подписки.