[1.9.1] — 2026-08-29
Патч устойчивости генерации. Reasoning-модели иногда рассуждают и останавливаются, не выдав
финальный ответ: content приходит пустым при success=True, бюджет вывода не исчерпан. Раньше
такой ответ уходил в оценку как есть и давал no_entry / M=0 у корректной по сути модели —
теперь пустой успешный ответ повторяется, как сетевой сбой. Набор задач и определение метрики
не менялись.
Исправлено
- Повтор пустых ответов модели.
with_retryсчитаетsuccess=Trueс пустымcontent(и без
вызовов инструментов) транзиентным сбоем и повторяет с экспоненциальным бэкоффом, как 429/5xx.
Устраняет ложные M=0 у флаки reasoning-моделей (Qwen3.8 27b и др.). Покрыто тестами.
Изменено
- Потолок вывода
max_tokensподнят 32768 → 65536. Многословный reasoning на тяжёлых задачах
съедал весь бюджет, ответ обрезался. Не-reasoning модели заканчивают задолго до потолка.