раздел 04
Цена, скорость, лимиты
Деньги за модель считаются просто, а вот интуиция про них обычно ошибается. Люди смотрят на цену за токен и выбирают дешёвую модель, а потом удивляются, почему счёт вырос. Разберём арифметику и три правила, которые из неё следуют.
Формула
Цена запроса = входные токены умножить на цену входа плюс выходные токены умножить на цену выхода. Цены даются за миллион токенов, поэтому объём делите на миллион.
Что попадает во вход: ваш промпт, системные инструкции, файл правил AGENTS.md / CLAUDE.md, прочитанные агентом файлы, история диалога. Что во выход: ответ, код, и размышления модели, которые вы не видите целиком, но за которые платите.
Уровень усилий влияет на обе части. Выше усилия - больше размышлений (выход), больше вызовов инструментов (каждый вызов - новый вход с прочитанным файлом плюс выход с решением). На агентной задаче переход с high на max может удвоить и утроить расход при той же модели.
Пример в цифрах
Условная задача: 50K входных токенов (промпт, правила, несколько прочитанных файлов) и 5K выходных. Цены из главы 01, ориентир на момент написания.
| Модель | Вход 50K | Выход 5K | Итого за запрос |
|---|---|---|---|
| Haiku 4.5 (1 / 5) | 0,05 доллара | 0,025 | около 0,08 |
| Sonnet 5 (2 / 10) | 0,10 | 0,05 | около 0,15 |
| Opus 5 (5 / 25) | 0,25 | 0,125 | около 0,38 |
| Fable 5.1 (10 / 50) | 0,50 | 0,25 | около 0,75 |
Разница между Haiku и Fable - десять раз. Кажется, ответ очевиден. Теперь добавим реальность: Haiku на этой задаче ошиблась, вы объяснили, что не так, она переделала, снова не то, третий заход. Каждый заход - это новый запрос, и история диалога растёт, так что вход становится не 50K, а 60K, потом 70K. Три захода Haiku - примерно 0,3 доллара и полчаса вашего времени. Один заход Opus - 0,38 и десять минут.
Цена за задачу, а не за запрос. Пока задача не закрыта, вы платите за каждую попытку и за своё время между ними.
А если задача простая и Haiku делает её с первого раза, десятикратная разница настоящая. В этом и смысл матрицы из главы 03: понимать, где переделки вероятны, а где нет.
Лимиты подписки
Если вы работаете по подписке, а не по API, деньги превращаются в лимит: столько-то использования в окно времени. Лимит расходуется теми же токенами, и сильная модель на высоких усилиях съедает его быстрее в те же разы, что и деньги в таблице. Отсюда типичная жалоба «лимит сгорел к обеду»: три часа Fable на max на задачах, которым хватило бы Sonnet на high.
Как устроены окна, что делать, когда упёрлись, и как распределять лимит по дню - в мануале Лимиты использования.
Сильная модель на низких усилиях
Правило из практики, которое противоречит интуиции. Прежде чем строить каскад из дешёвых и дорогих моделей, попробуйте самую сильную модель на низких усилиях.
Почему это работает: на новых моделях низкие усилия часто дают качество выше, чем максимум у прошлого поколения. Fable на low знает и умеет всё, что знает Fable, просто отвечает без долгих размышлений. На задаче «напиши письмо клиенту» этого хватает, и результат лучше, чем у Sonnet на high, а по времени быстрее.
Почему одна модель проще: каскад надо обслуживать. Кто решает, какая задача простая? Если это человек, вы добавили себе работы. Если это ещё одна модель-маршрутизатор, вы добавили запросов и точку отказа. Одна сильная модель с переключением усилий убирает этот слой.
Каскад имеет смысл на объёме: тысячи однотипных запросов, где разница в десять раз на каждом - это реальные деньги. На пятидесяти задачах в день разница между «всё на Fable low» и «умный каскад» - центы, а обслуживание каскада - часы.
Скорость
Скорость складывается из двух вещей: как быстро модель выдаёт токены и сколько токенов она решила выдать. Дешёвые модели быстрее на первом. Низкие усилия быстрее на втором, и это влияет сильнее: Fable на low часто отвечает быстрее, чем Sonnet на xhigh, потому что второй пошёл читать десять файлов и запускать тесты.
Для интерактивной работы, где вы ждёте ответ, усилия важнее модели. Для фоновой работы, где агент ушёл на час, скорость почти не важна: важно, чтобы не пришлось переделывать.
Длинный контекст тоже деньги
Миллион контекста у Sonnet, Opus и Fable - запас на случай, когда он правда нужен, использовать его целиком в каждом диалоге незачем. Каждый прочитанный агентом файл лежит во входе всех следующих запросов в этом диалоге. Разговор на сто сообщений с большими файлами внутри - это сотни тысяч входных токенов на каждый ход. Как следить за окном, сжимать историю и начинать с чистого листа - в Контекстное окно.