Перегенерации
Сообщение «Лимит регенераций достигнут» приходит, когда один и тот же ответ переписывают снова и снова. Счётчик отпускает со временем, но быстрее помогает переформулировать запрос.
Счётчика сообщений в чате Дипсика нет, но потолки есть: длина одного диалога, число перегенераций подряд и загруженность серверов. В API ограничение другое — параллельные запросы, и превышение отвечает кодом 429.
Сообщение «Лимит регенераций достигнут» приходит, когда один и тот же ответ переписывают снова и снова. Счётчик отпускает со временем, но быстрее помогает переформулировать запрос.
Переписка не бесконечна: набрав контекст, чат перестаёт помнить начало, и приходится открывать новый. Вводные удобно переносить одним сообщением-выжимкой.
Ответ «сервер занят» — про очередь на стороне сервиса. Платного пропуска вперёд очереди у DeepSeek не предусмотрено.
Обе модели V4 держат контекст в 1 млн токенов: столько текста помещается в один диалог с учётом всей предыдущей переписки. Ответ при этом ограничен отдельно — до 384 тыс. токенов за раз.
Разница важна на практике. Загрузить том документации и задавать по нему вопросы — легко. Попросить переписать этот том целиком одним ответом — упрётся в потолок вывода, и работу придётся резать на части.
Системная инструкция, вся история диалога, приложенные тексты и текущий вопрос.
Только сгенерированный ответ, включая рассуждение — в API оно тарифицируется как выходные токены.
| Ограничение | Значение | Что происходит при превышении |
|---|---|---|
| Параллельные запросы, Flash | 2 500 | HTTP 429 на лишние запросы |
| Параллельные запросы, Pro | 500 | HTTP 429 на лишние запросы |
| Область действия лимита | Весь аккаунт | Новые ключи ничего не добавляют |
| Ожидание вывода | 10 минут | Сервер обрывает соединение |
Квоту расширяют по запросу к разработчику, и денег за это не берут: параллельность подбирают под реальную нагрузку. Если у вашего сервиса много собственных пользователей, к запросам добавляют user_id — тогда очередь и кеш между ними разделяются, а лимит считается ещё и по каждому идентификатору отдельно.
Один документ — один диалог. Смешивать разбор договора и подбор кода в одной переписке значит быстрее исчерпать контекст.
Перед новым чатом попросите выжимку: «собери в двадцать строк всё, что нужно помнить». Её и вставляйте в начало следующего диалога.
В API проще держать пул запросов и повторять отклонённые с задержкой, чем ловить 429 в бою.
Вне окон 01:00–04:00 и 06:00–10:00 UTC тот же объём стоит вдвое дешевле, а очередь короче.
Syntx собирает нейросети в одну подписку с оплатой российской картой.