# Токены и стоимость API: считаем бюджет

Канонический URL: https://zero2claude.ru/blog/api-tokens-cost
Дата: 2026-08-16
Теги: api, токены, новичкам

Прикинь бюджет на Claude API за минуту: что такое токены, почему ответ дороже вопроса и какие три привычки режут счёт в разы.

Ты собрался подключить Claude к своей программе по API и натыкаешься на прайс: «$X за миллион входных токенов, $Y за миллион выходных». Звучит так, будто без калькулятора и диплома по экономике не разобраться — и проще закрыть вкладку.

На деле модель оплаты простая, и прикинуть бюджет можно на салфетке. Разберёмся, что ты вообще оплачиваешь, почему ответ стоит дороже вопроса и какими привычками реально срезать счёт в разы.

<Cover src="/blog/api-tokens-cost.jpg" alt="Весы, где на одной чаше короткий запрос, на другой длинный ответ" />

## За что ты платишь: вход и выход

Claude не считает текст словами или символами — он режет его на кусочки, которые называются [токенами](/glossary/token). Токен — это примерно часть слова: короткое слово часто один токен, длинное — два-три. Грубое правило для русского текста: **один токен ≈ половина слова**. Абзац в сто слов — это около двухсот токенов.

Оплата делится на две корзины, и это главное, что нужно понять:

- **Входные токены** — всё, что ты отправил модели: твой вопрос, инструкции, приложенный документ, вся предыдущая переписка.
- **Выходные токены** — то, что Claude написал в ответ.

И вот ключевой момент: **выход почти всегда дороже входа** — в типичном прайсе примерно в пять раз. Логика тут есть: прочитать текст модели дёшево, а сгенерировать каждое слово ответа — это работа. Поэтому длинный болтливый ответ бьёт по кошельку сильнее, чем длинный вопрос.

## Прикидываем счёт на салфетке

Допустим, ты делаешь бота, который отвечает на вопросы по инструкции к твоему продукту. Один запрос выглядит так:

- инструкция-контекст: ~2000 токенов входа
- вопрос пользователя: ~50 токенов входа
- ответ модели: ~300 токенов выхода

Итого на один запрос: ~2050 входных + 300 выходных токенов. Кажется мало — но если умножить на тысячу пользователей в день, набегает 2 миллиона входных и 300 тысяч выходных токенов в сутки. Вот теперь прайс «за миллион» перестаёт быть абстракцией: ты просто берёшь свои объёмы и умножаешь на цену из таблицы.

<Callout type="tip">
Не угадывай объём на глаз. У API есть бесплатный метод **подсчёта токенов** (count tokens) — отправляешь свой типовой запрос и узнаёшь точное число до того, как платить за реальные вызовы. Посчитай один характерный запрос, умножь на ожидаемое число обращений — и бюджет на месяц у тебя в руках.
</Callout>

Заметил, что инструкция на 2000 токенов повторяется в **каждом** запросе? Тысяча пользователей — тысяча раз отправленный один и тот же текст. Это и есть главная статья расходов у новичков. И именно её проще всего срезать.

## Три способа платить меньше

Экономия в API — это не про скупость, а про то, чтобы не платить дважды за одно и то же.

- **Кэширование запроса (prompt caching).** Если у тебя есть большой неизменный кусок — та самая инструкция, системный промпт, длинный документ — его можно закэшировать. Повторное чтение из кэша стоит примерно **десятую часть** обычной цены входа. Для бота с фиксированной инструкцией это срезает счёт в разы. Правило простое: всё стабильное держи в начале запроса, всё меняющееся (вопрос пользователя) — в конце.
- **Пакетная обработка (Batch API).** Если ответы не нужны прямо сейчас — скажем, ты ночью обрабатываешь тысячу отзывов или переводишь каталог — отправь их пачкой. За готовность подождать несколько минут (иногда до пары часов) дают **скидку 50%** на все токены. Половина цены просто за терпение.
- **Короче запрос — короче ответ.** Не вываливай весь файл, если вопрос про три строчки. И прямо проси: «ответь коротко, без вступлений». Выходные токены — самые дорогие, так что каждое лишнее «Конечно! Давай разберём этот интересный вопрос...» — это деньги на ветер.

Ещё одна ловушка — диалог. Каждое новое сообщение тащит за собой всю предыдущую переписку как входные токены. Десятый вопрос в длинном чате стоит дороже первого, даже если он короткий: модель «перечитывает» весь разговор заново. Поэтому под новую задачу — новый диалог, а не бесконечная лента.

## Что в итоге держать в голове

Если убрать все детали, остаётся три мысли. Платишь за вход и за выход, причём **выход в разы дороже** — береги длину ответов. Большой повторяющийся контекст **кэшируй**, не отправляй заново каждый раз. А несрочные объёмы гоняй **пачкой** со скидкой.

С этими тремя привычками типичный счёт за бота или скрипт легко ужимается в несколько раз — без потери качества. Главное — понять модель один раз, и дальше прайс «за миллион» читается как меню, а не как иероглифы.

Хочешь не просто прочитать, а собрать свой первый рабочий запрос к Claude и пощупать токены руками — у нас есть курс ровно про это.
