Лимиты DeepSeek: чат, контекст и API

Счётчика сообщений в чате Дипсика нет, но потолки есть: длина одного диалога, число перегенераций подряд и загруженность серверов. В API ограничение другое — параллельные запросы, и превышение отвечает кодом 429.

На что стоят ограничения

Перегенерации

Сообщение «Лимит регенераций достигнут» приходит, когда один и тот же ответ переписывают снова и снова. Счётчик отпускает со временем, но быстрее помогает переформулировать запрос.

Длина диалога

Переписка не бесконечна: набрав контекст, чат перестаёт помнить начало, и приходится открывать новый. Вводные удобно переносить одним сообщением-выжимкой.

Загруженность

Ответ «сервер занят» — про очередь на стороне сервиса. Платного пропуска вперёд очереди у DeepSeek не предусмотрено.

Лимиты символов в ответе

Обе модели V4 держат контекст в 1 млн токенов: столько текста помещается в один диалог с учётом всей предыдущей переписки. Ответ при этом ограничен отдельно — до 384 тыс. токенов за раз.

Разница важна на практике. Загрузить том документации и задавать по нему вопросы — легко. Попросить переписать этот том целиком одним ответом — упрётся в потолок вывода, и работу придётся резать на части.

Что входит в контекст

Системная инструкция, вся история диалога, приложенные тексты и текущий вопрос.

Что считается выводом

Только сгенерированный ответ, включая рассуждение — в API оно тарифицируется как выходные токены.

Лимиты в API

ОграничениеЗначениеЧто происходит при превышении
Параллельные запросы, Flash2 500HTTP 429 на лишние запросы
Параллельные запросы, Pro500HTTP 429 на лишние запросы
Область действия лимитаВесь аккаунтНовые ключи ничего не добавляют
Ожидание вывода10 минутСервер обрывает соединение

Квоту расширяют по запросу к разработчику, и денег за это не берут: параллельность подбирают под реальную нагрузку. Если у вашего сервиса много собственных пользователей, к запросам добавляют user_id — тогда очередь и кеш между ними разделяются, а лимит считается ещё и по каждому идентификатору отдельно.

Как работать, не беспокоясь о лимитах

1

Дробить длинные задачи

Один документ — один диалог. Смешивать разбор договора и подбор кода в одной переписке значит быстрее исчерпать контекст.

2

Переносить итоги, а не историю

Перед новым чатом попросите выжимку: «собери в двадцать строк всё, что нужно помнить». Её и вставляйте в начало следующего диалога.

3

Ставить очередь на своей стороне

В API проще держать пул запросов и повторять отклонённые с задержкой, чем ловить 429 в бою.

4

Переносить пакетную работу на непик

Вне окон 01:00–04:00 и 06:00–10:00 UTC тот же объём стоит вдвое дешевле, а очередь короче.

Что смотреть дальше

Когда лимиты чата мешают работать

Syntx собирает нейросети в одну подписку с оплатой российской картой.