раздел 03
Модель и режимы под задачу
Одну и ту же работу можно сделать дорогой моделью в лоб, а можно - подобрав модель и режим под задачу. Разница в расходе бывает кратной, а в качестве - никакой.
Дешёвая модель для простого, флагман для сложного
Модели различаются по цене за токен в разы. Флагман (самая сильная и дорогая модель) нужен там, где реально сложно: запутанная логика, архитектура, тонкая отладка. Для простого - переименовать, поправить текст, собрать шаблон - хватает модели попроще и подешевле.
Как выбирать - подробно в разделах Выбор модели под задачу и Кодинговые модели. Что такое токен, за который вы платите, - в разделе Токены.
Режимы: сначала план, потом исполнение
У многих кодинг-агентов есть режим планирования или обсуждения - агент сначала предлагает план, а меняет код только после вашего ок. Это не про экономию токенов в моменте, а про экономию на переделках, которая обычно и есть главная статья расхода.
Дешевле один раз согласовать план, чем трижды переделывать сделанное не туда. Каждая переделка - это новые файлы на вход и новый код на выход.
Порядок простой: обсудили подход, вы кивнули, агент исполнил. Так он не бросается писать по неверно понятой задаче и не сжигает токены на код, который вы потом выкинете.
Кэш контекста - платить за одно и то же меньше
Кэш контекста (prompt caching) - механизм, который удешевляет повторную отправку одного и того же куска контекста. Если в каждом запросе на вход уходит одна и та же основа - правила проекта, описания инструментов, ключевые файлы, - модель запоминает её и повторную отправку считает сильно дешевле, чем в первый раз.
Кэш любит стабильность. Держите постоянную основу неизменной - и повторная отправка идёт по сниженной цене вместо полной.
Практический вывод один: не тасуйте без нужды то, что уходит модели каждый раз. Если постоянно менять правила, порядок файлов и системную часть, кэш сбрасывается и вы платите за всё это по полной снова. Стабильная основа + меняющаяся только задача - вот при чём кэш работает.