Длинные ответы потоком доходят целиком
Потоковый ответ больше не ограничен общим временем: поток живёт, пока модель отдаёт данные, и обрывается только при паузе дольше 4 минут подряд. Длинные ответы думающих моделей и агентов приходят целиком. Обрывы у моделей стали видны на странице статуса.
Что изменилось
Раньше на весь ответ отводилось 2 минуты — независимо от того, продолжает модель писать или нет. Теперь предел считается иначе: значение имеет не длительность ответа, а пауза в передаче.
Поток обрывается, только если от модели не пришло ни одного байта дольше 4 минут подряд. Каждая новая часть ответа обнуляет отсчёт.
Общий потолок одного ответа — 30 минут.
Если модель не начала отвечать вовсе, ждём 2 минуты и возвращаем ошибку
504 upstream_timeout.
Кому это заметно
Думающие модели. Размышление перед первым словом больше не упирается в прежний предел.
Длинные генерации: большие куски кода, переводы, разбор объёмных файлов.
Агенты и IDE-клиенты — Claude Code, Codex CLI, Cline, Roo Code: многоходовые ответы с вызовом инструментов доходят до конца.
Что проверить у себя
Для длинных ответов включайте потоковую выдачу — без неё ответ по-прежнему должен прийти за 2 минуты:
{
"model": "anthropic/claude-sonnet-5",
"stream": true,
"messages": [{"role": "user", "content": "..."}]
}Второе — таймаут вашего HTTP-клиента. Официальные SDK OpenAI ждут ответа 10 минут, но собственные обёртки часто ставят 60 секунд: тогда запрос прервётся на вашей стороне раньше, чем на нашей.
Страница статуса стала точнее
Оборванный ответ модели теперь учитывается в её доступности на странице Статус. Модель, у которой рвутся потоки, больше не выглядит полностью исправной — по странице видно, какую модель сейчас лучше не брать.
Списания не изменились
Ответ не начался — запрос бесплатный.
Поток оборвался в середине — списывается только фактически переданное.
Все коды ошибок и что делать по каждому — в разделе Ошибки документации.