← Все обновления
Обновление

Длинные ответы потоком доходят целиком

Потоковый ответ больше не ограничен общим временем: поток живёт, пока модель отдаёт данные, и обрывается только при паузе дольше 4 минут подряд. Длинные ответы думающих моделей и агентов приходят целиком. Обрывы у моделей стали видны на странице статуса.

Что изменилось

Раньше на весь ответ отводилось 2 минуты — независимо от того, продолжает модель писать или нет. Теперь предел считается иначе: значение имеет не длительность ответа, а пауза в передаче.

  • Поток обрывается, только если от модели не пришло ни одного байта дольше 4 минут подряд. Каждая новая часть ответа обнуляет отсчёт.

  • Общий потолок одного ответа — 30 минут.

  • Если модель не начала отвечать вовсе, ждём 2 минуты и возвращаем ошибку 504 upstream_timeout.

Кому это заметно

  • Думающие модели. Размышление перед первым словом больше не упирается в прежний предел.

  • Длинные генерации: большие куски кода, переводы, разбор объёмных файлов.

  • Агенты и IDE-клиенты — Claude Code, Codex CLI, Cline, Roo Code: многоходовые ответы с вызовом инструментов доходят до конца.

Что проверить у себя

Для длинных ответов включайте потоковую выдачу — без неё ответ по-прежнему должен прийти за 2 минуты:

{
  "model": "anthropic/claude-sonnet-5",
  "stream": true,
  "messages": [{"role": "user", "content": "..."}]
}

Второе — таймаут вашего HTTP-клиента. Официальные SDK OpenAI ждут ответа 10 минут, но собственные обёртки часто ставят 60 секунд: тогда запрос прервётся на вашей стороне раньше, чем на нашей.

Страница статуса стала точнее

Оборванный ответ модели теперь учитывается в её доступности на странице Статус. Модель, у которой рвутся потоки, больше не выглядит полностью исправной — по странице видно, какую модель сейчас лучше не брать.

Списания не изменились

  • Ответ не начался — запрос бесплатный.

  • Поток оборвался в середине — списывается только фактически переданное.

Все коды ошибок и что делать по каждому — в разделе Ошибки документации.

← Все обновления