раздел 06

Шпаргалка

Всё главное про расход токенов коротко.

Платим за оба конца
Вход (весь контекст) и выход (ответ). Длинный диалог тащит историю снова - расход копится к концу сессии.
Экономия в контексте
Новый чат под задачу, компактизация, только нужные файлы. Держать основу стабильной - работает кэш контекста.
Меньше переделок
Точная задача сразу, дешёвая модель на простом, флагман на сложном, проверки и остановка тупика.

Что ест токены и что с этим делать

Что ест токеныЧто делать
Большой контекст, весь проектДавать только нужные файлы, не тащить всё подряд
Длинные сессии, один чат на всёНовый чат под новую задачу, компактизация истории
Огромные ответыПросить точечные правки и коротко, не переписывать файл целиком
Повторное перечитываниеСразу дать нужные файлы и точный контекст
Думающие (reasoning) режимыВключать на сложном, снимать на простом
СубагентыЗапускать под крупные задачи, не на мелочи
Флагман на рутинеДешёвая модель для простого, флагман для сложного
Зацикливание агентаСледить за ходом, обрывать тупик рано

Чек-лист экономии

  • Новый чат под каждую новую задачу.
  • Контекст к пределу - сжать (компактизация) или открыть новый чат.
  • В контексте только файлы по задаче, не весь проект.
  • Модель под задачу: простое - дешёвой, сложное - флагманом.
  • Сначала план, потом исполнение - меньше переделок.
  • Задача точная с первого раза: что, где, как, чего нельзя.
  • Проверки и тесты, чтобы агент ловил ошибку сам.
  • Основу (правила, инструменты) не тасовать без нужды - живёт кэш контекста.
  • На API - лимит трат поставлен заранее.
  • Раз в день глянуть usage: где расход самый дорогой.

Глоссарий

  • Токен на вход (input) - всё, что уходит модели вместе с запросом: файлы, история диалога, правила, описания инструментов. Обычно самая большая часть расхода.
  • Токен на выход (output) - сам ответ модели: код, текст, объяснения. Дорожает от длинных и подробных ответов.
  • Кэш контекста (prompt caching) - механизм, который удешевляет повторную отправку одного и того же контекста; работает, пока основа не меняется.
  • Компактизация (compaction) - сжатие длинной истории диалога в короткое резюме, чтобы на вход уходило меньше токенов.
  • Reasoning (думающий режим) - режим, где модель перед ответом долго рассуждает про себя: точнее на сложном, но заметно дороже.

Куда дальше