раздел 04

Цена, скорость, лимиты

Деньги за модель считаются просто, а вот интуиция про них обычно ошибается. Люди смотрят на цену за токен и выбирают дешёвую модель, а потом удивляются, почему счёт вырос. Разберём арифметику и три правила, которые из неё следуют.

Формула

Цена запроса = входные токены умножить на цену входа плюс выходные токены умножить на цену выхода. Цены даются за миллион токенов, поэтому объём делите на миллион.

Что попадает во вход: ваш промпт, системные инструкции, файл правил AGENTS.md / CLAUDE.md, прочитанные агентом файлы, история диалога. Что во выход: ответ, код, и размышления модели, которые вы не видите целиком, но за которые платите.

Уровень усилий влияет на обе части. Выше усилия - больше размышлений (выход), больше вызовов инструментов (каждый вызов - новый вход с прочитанным файлом плюс выход с решением). На агентной задаче переход с high на max может удвоить и утроить расход при той же модели.

Пример в цифрах

Условная задача: 50K входных токенов (промпт, правила, несколько прочитанных файлов) и 5K выходных. Цены из главы 01, ориентир на момент написания.

МодельВход 50KВыход 5KИтого за запрос
Haiku 4.5 (1 / 5)0,05 доллара0,025около 0,08
Sonnet 5 (2 / 10)0,100,05около 0,15
Opus 5 (5 / 25)0,250,125около 0,38
Fable 5.1 (10 / 50)0,500,25около 0,75

Разница между Haiku и Fable - десять раз. Кажется, ответ очевиден. Теперь добавим реальность: Haiku на этой задаче ошиблась, вы объяснили, что не так, она переделала, снова не то, третий заход. Каждый заход - это новый запрос, и история диалога растёт, так что вход становится не 50K, а 60K, потом 70K. Три захода Haiku - примерно 0,3 доллара и полчаса вашего времени. Один заход Opus - 0,38 и десять минут.

Цена за задачу, а не за запрос. Пока задача не закрыта, вы платите за каждую попытку и за своё время между ними.

А если задача простая и Haiku делает её с первого раза, десятикратная разница настоящая. В этом и смысл матрицы из главы 03: понимать, где переделки вероятны, а где нет.

Лимиты подписки

Если вы работаете по подписке, а не по API, деньги превращаются в лимит: столько-то использования в окно времени. Лимит расходуется теми же токенами, и сильная модель на высоких усилиях съедает его быстрее в те же разы, что и деньги в таблице. Отсюда типичная жалоба «лимит сгорел к обеду»: три часа Fable на max на задачах, которым хватило бы Sonnet на high.

Как устроены окна, что делать, когда упёрлись, и как распределять лимит по дню - в мануале Лимиты использования.

Сильная модель на низких усилиях

Правило из практики, которое противоречит интуиции. Прежде чем строить каскад из дешёвых и дорогих моделей, попробуйте самую сильную модель на низких усилиях.

Почему это работает: на новых моделях низкие усилия часто дают качество выше, чем максимум у прошлого поколения. Fable на low знает и умеет всё, что знает Fable, просто отвечает без долгих размышлений. На задаче «напиши письмо клиенту» этого хватает, и результат лучше, чем у Sonnet на high, а по времени быстрее.

Почему одна модель проще: каскад надо обслуживать. Кто решает, какая задача простая? Если это человек, вы добавили себе работы. Если это ещё одна модель-маршрутизатор, вы добавили запросов и точку отказа. Одна сильная модель с переключением усилий убирает этот слой.

шаг 1
Сильная на low
Поставьте самую сильную доступную модель, усилия low. Прогоните типовые задачи недели. Замерьте: качество, время, расход.
шаг 2
Поднимайте точечно
Там, где low не хватило - high или xhigh на той же модели. Обычно это код и агентные задачи, остальное остаётся на low.
шаг 3
Каскад, если измерили
Только если расход после шага 2 не влезает в бюджет - выносите массовые простые задачи на Haiku. С цифрами, а не по ощущению.

Каскад имеет смысл на объёме: тысячи однотипных запросов, где разница в десять раз на каждом - это реальные деньги. На пятидесяти задачах в день разница между «всё на Fable low» и «умный каскад» - центы, а обслуживание каскада - часы.

Скорость

Скорость складывается из двух вещей: как быстро модель выдаёт токены и сколько токенов она решила выдать. Дешёвые модели быстрее на первом. Низкие усилия быстрее на втором, и это влияет сильнее: Fable на low часто отвечает быстрее, чем Sonnet на xhigh, потому что второй пошёл читать десять файлов и запускать тесты.

Для интерактивной работы, где вы ждёте ответ, усилия важнее модели. Для фоновой работы, где агент ушёл на час, скорость почти не важна: важно, чтобы не пришлось переделывать.

Длинный контекст тоже деньги

Миллион контекста у Sonnet, Opus и Fable - запас на случай, когда он правда нужен, использовать его целиком в каждом диалоге незачем. Каждый прочитанный агентом файл лежит во входе всех следующих запросов в этом диалоге. Разговор на сто сообщений с большими файлами внутри - это сотни тысяч входных токенов на каждый ход. Как следить за окном, сжимать историю и начинать с чистого листа - в Контекстное окно.