раздел 06
Шпаргалка
Всё главное про расход токенов коротко.
Платим за оба конца
Вход (весь контекст) и выход (ответ). Длинный диалог тащит историю снова - расход копится к концу сессии.
Экономия в контексте
Новый чат под задачу, компактизация, только нужные файлы. Держать основу стабильной - работает кэш контекста.
Меньше переделок
Точная задача сразу, дешёвая модель на простом, флагман на сложном, проверки и остановка тупика.
Что ест токены и что с этим делать
| Что ест токены | Что делать |
|---|---|
| Большой контекст, весь проект | Давать только нужные файлы, не тащить всё подряд |
| Длинные сессии, один чат на всё | Новый чат под новую задачу, компактизация истории |
| Огромные ответы | Просить точечные правки и коротко, не переписывать файл целиком |
| Повторное перечитывание | Сразу дать нужные файлы и точный контекст |
| Думающие (reasoning) режимы | Включать на сложном, снимать на простом |
| Субагенты | Запускать под крупные задачи, не на мелочи |
| Флагман на рутине | Дешёвая модель для простого, флагман для сложного |
| Зацикливание агента | Следить за ходом, обрывать тупик рано |
Чек-лист экономии
- Новый чат под каждую новую задачу.
- Контекст к пределу - сжать (компактизация) или открыть новый чат.
- В контексте только файлы по задаче, не весь проект.
- Модель под задачу: простое - дешёвой, сложное - флагманом.
- Сначала план, потом исполнение - меньше переделок.
- Задача точная с первого раза: что, где, как, чего нельзя.
- Проверки и тесты, чтобы агент ловил ошибку сам.
- Основу (правила, инструменты) не тасовать без нужды - живёт кэш контекста.
- На API - лимит трат поставлен заранее.
- Раз в день глянуть usage: где расход самый дорогой.
Глоссарий
- Токен на вход (input) - всё, что уходит модели вместе с запросом: файлы, история диалога, правила, описания инструментов. Обычно самая большая часть расхода.
- Токен на выход (output) - сам ответ модели: код, текст, объяснения. Дорожает от длинных и подробных ответов.
- Кэш контекста (prompt caching) - механизм, который удешевляет повторную отправку одного и того же контекста; работает, пока основа не меняется.
- Компактизация (compaction) - сжатие длинной истории диалога в короткое резюме, чтобы на вход уходило меньше токенов.
- Reasoning (думающий режим) - режим, где модель перед ответом долго рассуждает про себя: точнее на сложном, но заметно дороже.
Куда дальше
- Токены - что это такое и как считаются.
- Контекстное окно - сколько влезает в контекст и почему он кончается.
- Выбор модели под задачу - какую модель когда брать.