раздел 01

Что ест токены больше всего

Перерасход почти всегда сводится к нескольким привычкам. Разберём главных пожирателей - от самого частого к более редким. Если узнаете здесь себя, значит, есть что резать.

самое частое
Большой контекст
Много открытых файлов, весь проект целиком, длинные логи. Всё это уходит модели на вход каждый запрос.
копится
Длинные сессии
Один чат на весь день. История растёт, и каждый новый вопрос тащит её целиком с начала.
выход
Огромные ответы
Просьбы переписать файл целиком, расписать всё подробно, вывести длинные простыни кода.
Повторное перечитывание
Агент по кругу открывает одни и те же файлы, потому что забыл их или не получил сразу.
Думающие режимы
Reasoning - режим, где модель сначала долго рассуждает про себя. Точнее на сложном, но токенов ест заметно больше.
Субагенты
Агент запускает помощников под подзадачи. Каждый - со своим контекстом и своим расходом.

Большой контекст - главный виновник

Соблазн понятный: закинуть агенту весь проект, чтобы он точно всё видел. Но весь проект в контексте - это весь проект в токенах на вход, и так на каждом запросе. Модели редко нужны все файлы; ей нужны те несколько, что относятся к задаче.

Контекст - это не бесплатная память про запас. Всё, что в нём лежит, вы оплачиваете снова при каждом обращении к модели.

Что такое контекст и сколько в него влезает - в разделе Контекстное окно. Как им управлять - в Заполнении контекста.

Длинные сессии

Одна бесконечная беседа кажется удобной - агент всё помнит. Но, как разобрали в прошлом разделе, эта память отправляется модели заново каждый раз. К концу дня в таком чате вход раздут историей, которая к текущей задаче уже не относится.

Огромные ответы

Выход тоже стоит денег. Два частых источника лишнего выхода:

  • Переписать файл целиком вместо точечной правки. Модель заново выдаёт весь файл - сотни строк на выход.
  • Расскажи всё подробно. Если не нужен разбор на три экрана, просите коротко. Длинные объяснения - это токены.

Думающие режимы и субагенты

  • Reasoning (думающий режим). Модель перед ответом прогоняет длинную внутреннюю цепочку рассуждений. На сложной задаче это окупается качеством, на простой - просто жжёт токены впустую.
  • Субагенты. Агент дробит работу и запускает помощников. Мощно для больших задач, но каждый субагент несёт свой контекст и свой расход - на мелочи это перебор.