Токены, кэш и экономия
Как устроен расход в чате с AI: что такое токены, за что списываются кредиты, как работает кэш провайдера и что даёт экономия токенов.
Что такое токены
ИИ измеряет текст не словами, а токенами — короткими кусочками: часть слова, слово, знак, фрагмент кода.
Ориентиры:
- короткий вопрос — десятки токенов;
- абзац — сотни;
- целая страница HTML или большой файл — тысячи и больше.
По токенам провайдер нейросети считает стоимость запроса. В продукте вы платите кредитами, которые пересчитываются из этой стоимости.
За что списываются кредиты
Цепочка одного сообщения:
- Вы пишете в чате редактора.
- Система отправляет модели контекст: правила ассистента, историю диалога, результаты инструментов (файлы, HTML и т.д.) и ваш новый вопрос.
- Модель отвечает.
- Провайдер возвращает стоимость запроса.
- Система переводит её в кредиты и списывает с баланса.
Чем больше текста ушло во вход и чем длиннее ответ — тем дороже ход. Отдельно списываются кредиты за платные инструменты (например, генерацию изображений).
В шапке чата видно, сколько кредитов потрачено в этом диалоге. Общий баланс и история — в аккаунте. Подробнее: Кредиты.
Размер чата и то, за что платят
В шапке чата показывается оценка размера диалога (насколько вырос контекст).
Это не то же самое, что чек за последний ход. Платите вы за то, что реально ушло в запрос к модели в этот момент: входящий промпт и ответ.
Длинный чат дорожает не «просто потому что он длинный», а потому что большой кусок истории снова и снова пересылается модели. История у вас на экране при этом остаётся полной — речь только о пакете, который уходит нейросети.
Почему длинный чат становится дороже
Без оптимизаций модель каждый раз снова получает старые тяжёлые данные: прошлые версии страниц, большие HTML, файлы, которые уже читали раньше.
Вы платите за повторную пересылку того, что часто уже не нужно для текущей правки. Отсюда два механизма удешевления: экономия токенов и кэш.
Экономия токенов
В настройках чата есть переключатель «Экономия токенов» (beta).
Что делает
На длинных диалогах система укорачивает старые тяжёлые данные инструментов только в запросе к модели:
- старые результаты чтения (файлы, HTML, планы, блоки, поиск и т.п.);
- большие аргументы правок (вставки и замены контента).
Свежие результаты и последний пакет работы ассистента стараются не трогать. История чата у вас не вырезается — меняется только то, что упаковывается в очередной запрос.
Итог: меньше токенов во входе → меньше кредитов за ход.
Когда включается
Экономия начинает действовать после того, как чат вырастет примерно до порога (порядка десятков тысяч токенов; точное значение задаётся на сервере). Пока порог не достигнут, в интерфейсе будет сообщение, что экономия ещё ждёт накопления контекста.
Что видно в интерфейсе
- иконка огонька — статус экономии;
- рядом может быть метка вроде −12k — сколько примерно не отправили в оплачиваемый промпт по сравнению с полным размером чата;
- в подсказке — сэкономлено всего и оценка по чтениям/записям файлов.
Кэш токенов
Кэш — это не кнопка в чате и не «экономия токенов». Это скидка на стороне провайдера нейросети.
Как понять простыми словами
Вы снова несёте ассистенту толстую папку с правилами и старой перепиской.
- Без кэша — он каждый раз перечитывает всю папку заново, и вы платите за весь объём.
- С кэшем — «эту папку я только что видел»: перечитывает в основном новые листы, а знакомое начало считает дешевле.
Hit и miss
| Смысл | |
|---|---|
| Hit (попадание) | Часть начала запроса совпала с недавним — за неё действует кэш-тариф |
| Miss (промах) | Знакомого начала не нашли — входящий текст считают почти как в первый раз |
Hit не значит «бесплатно». Вы всё равно платите за новые токены: ваш вопрос, свежие результаты инструментов, ответ модели. Кэш удешевляет повтор уже виденного начала запроса.
Когда кэш срабатывает
Провайдеры обычно кэшируют стабильный префикс: системные правила и начало истории, которое не переписывается, а только дописывается с конца.
Типичный удачный случай внутри одного вашего сообщения:
- Модель получила большой контекст.
- Вызвала инструмент (прочитала файл, поправила блок).
- Система снова шлёт почти тот же префикс плюс новый результат.
- Если начало запроса совпало с предыдущим — большой кусок может попасть в кэш.
Поэтому редактор не меняет набор укороченных старых данных посередине одного хода (пока ассистент вызывает инструменты подряд): иначе префикс «прыгал» бы, и кэш ломался бы на каждом шаге.
Когда кэша нет
Кэш не гарантирован. Miss бывает, если:
- изменилось начало контекста (другая модель, другой системный промпт, перепись старых сообщений);
- диалог стал слишком длинным или «рваным»;
- у модели/провайдера кэш недоступен, истёк или ещё не накопился;
- прошло время, и старый кэш уже недействителен.
В очень длинном чате система может предупредить: контекст снова пересылается, а кэш не всегда применяется. Тогда каждый ход снова дорогой — лучше кратко резюмировать и открыть новый чат.
Подсказка в редакторе: если провайдер закэшировал чат — платите в основном за новые токены; если кэша нет — снова платите за всё, что пересылают с каждым сообщением.
Где посмотреть в интерфейсе
Кэш по списаниям можно проверить в детализации транзакций проекта:
- Откройте Настройки аккаунта → История транзакций кредитов (
/account-settings/credits/transactions). - Выберите проект — откроется таблица списаний по чатам и AI-операциям.
- В колонке Кэш — иконка по каждой записи:
- обычная (зелёная) — кэш сработал (hit): часть токенов пошла по кэш-тарифу;
- перечёркнутая — кэша не было (miss): входящий объём посчитали почти целиком;
- прочерк — для этой операции данных о кэше нет (например, не текстовый ход чата).
Наведите на иконку — во всплывающей подсказке будут всего токенов и сколько из кэша.
Там же в таблице видны источник операции, модель, стоимость и сколько кредитов списано. Детализация доступна по чатам; если чат удалили, его строки из этой разбивки пропадают.
Экономия и кэш — разные вещи
| Экономия токенов | Кэш провайдера | |
|---|---|---|
| Кто делает | редактор перед отправкой | провайдер нейросети |
| Что делает | укорачивает старый мусор → меньше токенов в запросе | узнаёт знакомое начало → дешевле считает повтор |
| Гарантия | по правилам чата у нас | зависит от модели, провайдера и стабильности префикса |
| В интерфейсе | огонёк и «Saved» в чате | колонка Кэш в детализации транзакций проекта |
Могут работать вместе: экономия убирает лишний объём, кэш удешевляет то, что всё равно пришлось слать повторно. В итоге важнее суммарные кредиты, а не одна цифра «из кэша».
Практические советы
- Закончили тему — откройте новый чат. Короче контекст → дешевле и модель меньше путается.
- Долгая работа в одном чате — включите экономию токенов. История останется, старые огромные куски перестанут снова уходить в оплату.
- Не рассчитывайте только на кэш. Он помогает, когда начало запроса стабильно повторяется; на раздутом диалоге часто пропадает. Проверить hit/miss можно в детализации транзакций проекта.
- Смотрите кредиты в шапке чата. Если расход растёт слишком быстро — модель много раз гоняет большие страницы или файлы; помогут экономия и новый чат.
- Не путайте три числа: размер чата в шапке, сколько сэкономил огонёк и сколько провайдер зачёл из кэша. Списание идёт по итоговой стоимости хода → кредиты.