раздел 05
Где смотреть и как ограничить
Экономить вслепую тяжело. Хорошая новость: расход виден в трёх местах сразу - в аккаунте, в API и прямо в IDE. Разберём, куда смотреть при каждом способе оплаты.
Подписка - страница usage и лимиты
Если платите по подписке (фиксированная плата, лимиты по времени), у сервиса есть страница usage или лимитов - там видно, сколько вы уже израсходовали в текущем окне и когда счётчик обнулится. Заглядывайте туда, когда кажется, что лимит тает слишком быстро: обычно причина - раздутый контекст или флагман на рутине.
API - баланс, лимиты и шлюзы с бюджетами
При оплате по API (платите за токены) расход - это прямые деньги, и контролировать его можно жёстко:
- Баланс и биллинг в кабинете провайдера: сколько токенов и на какую сумму ушло, часто с разбивкой на вход и выход.
- Лимиты трат - потолок расхода в месяц или предупреждения при достижении суммы. Ставятся в настройках биллинга.
- Шлюзы с бюджетами - прослойка, через которую ходят запросы к модели, с лимитом на ключ или проект. Удобно, когда ключом пользуется не один человек.
На API поставьте лимит трат заранее. Это страховка от сюрприза, когда зациклившийся агент за ночь выест бюджет, о котором вы узнаете только из счёта.
Подробнее - в разделах Лимиты нейросетей, Контроль расходов по API и Расходы на AI-сервисы.
Счётчик контекста в IDE
Самый полезный индикатор в ежедневной работе - счётчик контекста прямо в кодинг-агенте. Он показывает, насколько заполнено контекстное окно текущего чата. В разных IDE называется по-разному и показывается по-своему: где-то процент заполнения, где-то число токенов, где-то отдельная панель usage.
Правило простое: контекст подбирается к пределу - пора сжать историю (компактизация) или открыть новый чат. Не доводите до края, где агент начнёт терять начало разговора и работать хуже.