Про AI с ноткой иронии
Контакты:
ЛС - сообщения чата
https://instagram.com/sergei_notevskii
https://ru.linkedin.com/in/sergeynotevskiy
Post #670
1.45K
#300tps
Не меняйте reasoning effort в агенте, пока не прочитаете это…
Ладно это кликбейт. Но вы же не поэтому кликнули, да?
Вы в курсе, что изменение уровня рассуждений в запросе инвалидирует префикс кэш?
Хотя казалось бы - поменял настройку "величины" ответа, какого черта кэш входящего запроса пропал?
Кто не в теме - дело в том, что настройка степени ризонинга чаще всего подставляется в input, те концептуально:
Сами антропики в документации пишут что: "The resolved effort value is rendered into the prompt."
У всех опенсорс моделек, что довелось посмотреть, схема примерно та же.
На самом деле не всегда все так просто, но это дело для отдельной статейки (спойлер, да).
А теперь к хорошим новостям:
У Astra и у Fable 5.1 (не 5) появилась возможность изменить effort для продолжения треда, не переписывая исходную конфигурацию разговора. Короче - попадать в кэш, даже при смене степени ризонинга.
При этом делать это нужно через спец. конструкции configuration_update и output_config.
пример для Astra
пример для Fable 5.1
Причем и там и там настройка действует только до следующего user turn.
Работает ли это под капотом Codex и Claude Code?
Claude - да, начиная с версии 2.1.260
Codex - да, но на сегодняшний день, только через явное включение фичи reasoning_effort_override.
П.с. в скилле audit-prompt-caching это уже учтено.
Пользуйтесь, экономьте денежки и TTFT.
Не меняйте reasoning effort в агенте, пока не прочитаете это…
Ладно это кликбейт. Но вы же не поэтому кликнули, да?
Вы в курсе, что изменение уровня рассуждений в запросе инвалидирует префикс кэш?
Хотя казалось бы - поменял настройку "величины" ответа, какого черта кэш входящего запроса пропал?
Кто не в теме - дело в том, что настройка степени ризонинга чаще всего подставляется в input, те концептуально:
<internal_config>
thinking_effort = high
</internal_config>
<system>
...
</system>
<user>
...
</user>
Сами антропики в документации пишут что: "The resolved effort value is rendered into the prompt."
У всех опенсорс моделек, что довелось посмотреть, схема примерно та же.
На самом деле не всегда все так просто, но это дело для отдельной статейки (спойлер, да).
А теперь к хорошим новостям:
У Astra и у Fable 5.1 (не 5) появилась возможность изменить effort для продолжения треда, не переписывая исходную конфигурацию разговора. Короче - попадать в кэш, даже при смене степени ризонинга.
При этом делать это нужно через спец. конструкции configuration_update и output_config.
пример для Astra
{
"model": "gpt-6-astra",
"previous_response_id": "resp_...",
"reasoning": {"effort": "high"},
"input": [
{
"type": "configuration_update",
"reasoning": {"effort": "low"}
},
{
"role": "user",
"content": "Собери короткий итог без нового анализа."
}
]
}пример для Fable 5.1
{
"role": "system",
"content": [],
"output_config": {
"effort": "low"
}
}Причем и там и там настройка действует только до следующего user turn.
Работает ли это под капотом Codex и Claude Code?
Claude - да, начиная с версии 2.1.260
Codex - да, но на сегодняшний день, только через явное включение фичи reasoning_effort_override.
П.с. в скилле audit-prompt-caching это уже учтено.
Пользуйтесь, экономьте денежки и TTFT.
- 🔥 18
- ❤ 14
- 👍 11
- 🫡 1










