К содержимому
Claude Code с 0:полный курс
APIАвтор: Михаил Кузьмицкий

Токены и стоимость API: считаем бюджет

Коротко

Прикинь бюджет на Claude API за минуту: что такое токены, почему ответ дороже вопроса и какие три привычки режут счёт в разы.

Ты собрался подключить Claude к своей программе по API и натыкаешься на прайс: «$X за миллион входных токенов, $Y за миллион выходных». Звучит так, будто без калькулятора и диплома по экономике не разобраться — и проще закрыть вкладку.

На деле модель оплаты простая, и прикинуть бюджет можно на салфетке. Разберёмся, что ты вообще оплачиваешь, почему ответ стоит дороже вопроса и какими привычками реально срезать счёт в разы.

Весы, где на одной чаше короткий запрос, на другой длинный ответ

За что ты платишь: вход и выход

Claude не считает текст словами или символами — он режет его на кусочки, которые называются токенами. Токен — это примерно часть слова: короткое слово часто один токен, длинное — два-три. Грубое правило для русского текста: один токен ≈ половина слова. Абзац в сто слов — это около двухсот токенов.

Оплата делится на две корзины, и это главное, что нужно понять:

  • Входные токены — всё, что ты отправил модели: твой вопрос, инструкции, приложенный документ, вся предыдущая переписка.
  • Выходные токены — то, что Claude написал в ответ.

И вот ключевой момент: выход почти всегда дороже входа — в типичном прайсе примерно в пять раз. Логика тут есть: прочитать текст модели дёшево, а сгенерировать каждое слово ответа — это работа. Поэтому длинный болтливый ответ бьёт по кошельку сильнее, чем длинный вопрос.

Прикидываем счёт на салфетке

Допустим, ты делаешь бота, который отвечает на вопросы по инструкции к твоему продукту. Один запрос выглядит так:

  • инструкция-контекст: ~2000 токенов входа
  • вопрос пользователя: ~50 токенов входа
  • ответ модели: ~300 токенов выхода

Итого на один запрос: ~2050 входных + 300 выходных токенов. Кажется мало — но если умножить на тысячу пользователей в день, набегает 2 миллиона входных и 300 тысяч выходных токенов в сутки. Вот теперь прайс «за миллион» перестаёт быть абстракцией: ты просто берёшь свои объёмы и умножаешь на цену из таблицы.

Совет

Не угадывай объём на глаз. У API есть бесплатный метод подсчёта токенов (count tokens) — отправляешь свой типовой запрос и узнаёшь точное число до того, как платить за реальные вызовы. Посчитай один характерный запрос, умножь на ожидаемое число обращений — и бюджет на месяц у тебя в руках.

Заметил, что инструкция на 2000 токенов повторяется в каждом запросе? Тысяча пользователей — тысяча раз отправленный один и тот же текст. Это и есть главная статья расходов у новичков. И именно её проще всего срезать.

Три способа платить меньше

Экономия в API — это не про скупость, а про то, чтобы не платить дважды за одно и то же.

  • Кэширование запроса (prompt caching). Если у тебя есть большой неизменный кусок — та самая инструкция, системный промпт, длинный документ — его можно закэшировать. Повторное чтение из кэша стоит примерно десятую часть обычной цены входа. Для бота с фиксированной инструкцией это срезает счёт в разы. Правило простое: всё стабильное держи в начале запроса, всё меняющееся (вопрос пользователя) — в конце.
  • Пакетная обработка (Batch API). Если ответы не нужны прямо сейчас — скажем, ты ночью обрабатываешь тысячу отзывов или переводишь каталог — отправь их пачкой. За готовность подождать несколько минут (иногда до пары часов) дают скидку 50% на все токены. Половина цены просто за терпение.
  • Короче запрос — короче ответ. Не вываливай весь файл, если вопрос про три строчки. И прямо проси: «ответь коротко, без вступлений». Выходные токены — самые дорогие, так что каждое лишнее «Конечно! Давай разберём этот интересный вопрос...» — это деньги на ветер.

Ещё одна ловушка — диалог. Каждое новое сообщение тащит за собой всю предыдущую переписку как входные токены. Десятый вопрос в длинном чате стоит дороже первого, даже если он короткий: модель «перечитывает» весь разговор заново. Поэтому под новую задачу — новый диалог, а не бесконечная лента.

Что в итоге держать в голове

Если убрать все детали, остаётся три мысли. Платишь за вход и за выход, причём выход в разы дороже — береги длину ответов. Большой повторяющийся контекст кэшируй, не отправляй заново каждый раз. А несрочные объёмы гоняй пачкой со скидкой.

С этими тремя привычками типичный счёт за бота или скрипт легко ужимается в несколько раз — без потери качества. Главное — понять модель один раз, и дальше прайс «за миллион» читается как меню, а не как иероглифы.

Хочешь не просто прочитать, а собрать свой первый рабочий запрос к Claude и пощупать токены руками — у нас есть курс ровно про это.

Читайте также

Попробуй на практике

Бесплатные интерактивные курсы по теме — прямо в браузере, с нуля.