Ты собрался подключить Claude к своей программе по API и натыкаешься на прайс: «$X за миллион входных токенов, $Y за миллион выходных». Звучит так, будто без калькулятора и диплома по экономике не разобраться — и проще закрыть вкладку.
На деле модель оплаты простая, и прикинуть бюджет можно на салфетке. Разберёмся, что ты вообще оплачиваешь, почему ответ стоит дороже вопроса и какими привычками реально срезать счёт в разы.
За что ты платишь: вход и выход
Claude не считает текст словами или символами — он режет его на кусочки, которые называются токенами. Токен — это примерно часть слова: короткое слово часто один токен, длинное — два-три. Грубое правило для русского текста: один токен ≈ половина слова. Абзац в сто слов — это около двухсот токенов.
Оплата делится на две корзины, и это главное, что нужно понять:
- Входные токены — всё, что ты отправил модели: твой вопрос, инструкции, приложенный документ, вся предыдущая переписка.
- Выходные токены — то, что Claude написал в ответ.
И вот ключевой момент: выход почти всегда дороже входа — в типичном прайсе примерно в пять раз. Логика тут есть: прочитать текст модели дёшево, а сгенерировать каждое слово ответа — это работа. Поэтому длинный болтливый ответ бьёт по кошельку сильнее, чем длинный вопрос.
Прикидываем счёт на салфетке
Допустим, ты делаешь бота, который отвечает на вопросы по инструкции к твоему продукту. Один запрос выглядит так:
- инструкция-контекст: ~2000 токенов входа
- вопрос пользователя: ~50 токенов входа
- ответ модели: ~300 токенов выхода
Итого на один запрос: ~2050 входных + 300 выходных токенов. Кажется мало — но если умножить на тысячу пользователей в день, набегает 2 миллиона входных и 300 тысяч выходных токенов в сутки. Вот теперь прайс «за миллион» перестаёт быть абстракцией: ты просто берёшь свои объёмы и умножаешь на цену из таблицы.
Совет
Не угадывай объём на глаз. У API есть бесплатный метод подсчёта токенов (count tokens) — отправляешь свой типовой запрос и узнаёшь точное число до того, как платить за реальные вызовы. Посчитай один характерный запрос, умножь на ожидаемое число обращений — и бюджет на месяц у тебя в руках.
Заметил, что инструкция на 2000 токенов повторяется в каждом запросе? Тысяча пользователей — тысяча раз отправленный один и тот же текст. Это и есть главная статья расходов у новичков. И именно её проще всего срезать.
Три способа платить меньше
Экономия в API — это не про скупость, а про то, чтобы не платить дважды за одно и то же.
- Кэширование запроса (prompt caching). Если у тебя есть большой неизменный кусок — та самая инструкция, системный промпт, длинный документ — его можно закэшировать. Повторное чтение из кэша стоит примерно десятую часть обычной цены входа. Для бота с фиксированной инструкцией это срезает счёт в разы. Правило простое: всё стабильное держи в начале запроса, всё меняющееся (вопрос пользователя) — в конце.
- Пакетная обработка (Batch API). Если ответы не нужны прямо сейчас — скажем, ты ночью обрабатываешь тысячу отзывов или переводишь каталог — отправь их пачкой. За готовность подождать несколько минут (иногда до пары часов) дают скидку 50% на все токены. Половина цены просто за терпение.
- Короче запрос — короче ответ. Не вываливай весь файл, если вопрос про три строчки. И прямо проси: «ответь коротко, без вступлений». Выходные токены — самые дорогие, так что каждое лишнее «Конечно! Давай разберём этот интересный вопрос...» — это деньги на ветер.
Ещё одна ловушка — диалог. Каждое новое сообщение тащит за собой всю предыдущую переписку как входные токены. Десятый вопрос в длинном чате стоит дороже первого, даже если он короткий: модель «перечитывает» весь разговор заново. Поэтому под новую задачу — новый диалог, а не бесконечная лента.
Что в итоге держать в голове
Если убрать все детали, остаётся три мысли. Платишь за вход и за выход, причём выход в разы дороже — береги длину ответов. Большой повторяющийся контекст кэшируй, не отправляй заново каждый раз. А несрочные объёмы гоняй пачкой со скидкой.
С этими тремя привычками типичный счёт за бота или скрипт легко ужимается в несколько раз — без потери качества. Главное — понять модель один раз, и дальше прайс «за миллион» читается как меню, а не как иероглифы.
Хочешь не просто прочитать, а собрать свой первый рабочий запрос к Claude и пощупать токены руками — у нас есть курс ровно про это.