раздел 01
Что ест токены больше всего
Перерасход почти всегда сводится к нескольким привычкам. Разберём главных пожирателей - от самого частого к более редким. Если узнаете здесь себя, значит, есть что резать.
Большой контекст - главный виновник
Соблазн понятный: закинуть агенту весь проект, чтобы он точно всё видел. Но весь проект в контексте - это весь проект в токенах на вход, и так на каждом запросе. Модели редко нужны все файлы; ей нужны те несколько, что относятся к задаче.
Контекст - это не бесплатная память про запас. Всё, что в нём лежит, вы оплачиваете снова при каждом обращении к модели.
Что такое контекст и сколько в него влезает - в разделе Контекстное окно. Как им управлять - в Заполнении контекста.
Длинные сессии
Одна бесконечная беседа кажется удобной - агент всё помнит. Но, как разобрали в прошлом разделе, эта память отправляется модели заново каждый раз. К концу дня в таком чате вход раздут историей, которая к текущей задаче уже не относится.
Огромные ответы
Выход тоже стоит денег. Два частых источника лишнего выхода:
- Переписать файл целиком вместо точечной правки. Модель заново выдаёт весь файл - сотни строк на выход.
- Расскажи всё подробно. Если не нужен разбор на три экрана, просите коротко. Длинные объяснения - это токены.
Думающие режимы и субагенты
- Reasoning (думающий режим). Модель перед ответом прогоняет длинную внутреннюю цепочку рассуждений. На сложной задаче это окупается качеством, на простой - просто жжёт токены впустую.
- Субагенты. Агент дробит работу и запускает помощников. Мощно для больших задач, но каждый субагент несёт свой контекст и свой расход - на мелочи это перебор.