Токены, кэш и экономия

Как устроен расход в чате с AI: что такое токены, за что списываются кредиты, как работает кэш провайдера и что даёт экономия токенов.

Что такое токены

ИИ измеряет текст не словами, а токенами — короткими кусочками: часть слова, слово, знак, фрагмент кода.

Ориентиры:

  • короткий вопрос — десятки токенов;
  • абзац — сотни;
  • целая страница HTML или большой файл — тысячи и больше.

По токенам провайдер нейросети считает стоимость запроса. В продукте вы платите кредитами, которые пересчитываются из этой стоимости.

За что списываются кредиты

Цепочка одного сообщения:

  1. Вы пишете в чате редактора.
  2. Система отправляет модели контекст: правила ассистента, историю диалога, результаты инструментов (файлы, HTML и т.д.) и ваш новый вопрос.
  3. Модель отвечает.
  4. Провайдер возвращает стоимость запроса.
  5. Система переводит её в кредиты и списывает с баланса.

Чем больше текста ушло во вход и чем длиннее ответ — тем дороже ход. Отдельно списываются кредиты за платные инструменты (например, генерацию изображений).

В шапке чата видно, сколько кредитов потрачено в этом диалоге. Общий баланс и история — в аккаунте. Подробнее: Кредиты.

Размер чата и то, за что платят

В шапке чата показывается оценка размера диалога (насколько вырос контекст).

Это не то же самое, что чек за последний ход. Платите вы за то, что реально ушло в запрос к модели в этот момент: входящий промпт и ответ.

Длинный чат дорожает не «просто потому что он длинный», а потому что большой кусок истории снова и снова пересылается модели. История у вас на экране при этом остаётся полной — речь только о пакете, который уходит нейросети.

Почему длинный чат становится дороже

Без оптимизаций модель каждый раз снова получает старые тяжёлые данные: прошлые версии страниц, большие HTML, файлы, которые уже читали раньше.

Вы платите за повторную пересылку того, что часто уже не нужно для текущей правки. Отсюда два механизма удешевления: экономия токенов и кэш.

Экономия токенов

В настройках чата есть переключатель «Экономия токенов» (beta).

Что делает

На длинных диалогах система укорачивает старые тяжёлые данные инструментов только в запросе к модели:

  • старые результаты чтения (файлы, HTML, планы, блоки, поиск и т.п.);
  • большие аргументы правок (вставки и замены контента).

Свежие результаты и последний пакет работы ассистента стараются не трогать. История чата у вас не вырезается — меняется только то, что упаковывается в очередной запрос.

Итог: меньше токенов во входе → меньше кредитов за ход.

Когда включается

Экономия начинает действовать после того, как чат вырастет примерно до порога (порядка десятков тысяч токенов; точное значение задаётся на сервере). Пока порог не достигнут, в интерфейсе будет сообщение, что экономия ещё ждёт накопления контекста.

Что видно в интерфейсе

  • иконка огонька — статус экономии;
  • рядом может быть метка вроде −12k — сколько примерно не отправили в оплачиваемый промпт по сравнению с полным размером чата;
  • в подсказке — сэкономлено всего и оценка по чтениям/записям файлов.

Кэш токенов

Кэш — это не кнопка в чате и не «экономия токенов». Это скидка на стороне провайдера нейросети.

Как понять простыми словами

Вы снова несёте ассистенту толстую папку с правилами и старой перепиской.

  • Без кэша — он каждый раз перечитывает всю папку заново, и вы платите за весь объём.
  • С кэшем — «эту папку я только что видел»: перечитывает в основном новые листы, а знакомое начало считает дешевле.

Hit и miss

Смысл
Hit (попадание) Часть начала запроса совпала с недавним — за неё действует кэш-тариф
Miss (промах) Знакомого начала не нашли — входящий текст считают почти как в первый раз

Hit не значит «бесплатно». Вы всё равно платите за новые токены: ваш вопрос, свежие результаты инструментов, ответ модели. Кэш удешевляет повтор уже виденного начала запроса.

Когда кэш срабатывает

Провайдеры обычно кэшируют стабильный префикс: системные правила и начало истории, которое не переписывается, а только дописывается с конца.

Типичный удачный случай внутри одного вашего сообщения:

  1. Модель получила большой контекст.
  2. Вызвала инструмент (прочитала файл, поправила блок).
  3. Система снова шлёт почти тот же префикс плюс новый результат.
  4. Если начало запроса совпало с предыдущим — большой кусок может попасть в кэш.

Поэтому редактор не меняет набор укороченных старых данных посередине одного хода (пока ассистент вызывает инструменты подряд): иначе префикс «прыгал» бы, и кэш ломался бы на каждом шаге.

Когда кэша нет

Кэш не гарантирован. Miss бывает, если:

  • изменилось начало контекста (другая модель, другой системный промпт, перепись старых сообщений);
  • диалог стал слишком длинным или «рваным»;
  • у модели/провайдера кэш недоступен, истёк или ещё не накопился;
  • прошло время, и старый кэш уже недействителен.

В очень длинном чате система может предупредить: контекст снова пересылается, а кэш не всегда применяется. Тогда каждый ход снова дорогой — лучше кратко резюмировать и открыть новый чат.

Подсказка в редакторе: если провайдер закэшировал чат — платите в основном за новые токены; если кэша нет — снова платите за всё, что пересылают с каждым сообщением.

Где посмотреть в интерфейсе

Кэш по списаниям можно проверить в детализации транзакций проекта:

  1. Откройте Настройки аккаунта → История транзакций кредитов (/account-settings/credits/transactions).
  2. Выберите проект — откроется таблица списаний по чатам и AI-операциям.
  3. В колонке Кэш — иконка по каждой записи:
    • обычная (зелёная) — кэш сработал (hit): часть токенов пошла по кэш-тарифу;
    • перечёркнутая — кэша не было (miss): входящий объём посчитали почти целиком;
    • прочерк — для этой операции данных о кэше нет (например, не текстовый ход чата).

Наведите на иконку — во всплывающей подсказке будут всего токенов и сколько из кэша.

Там же в таблице видны источник операции, модель, стоимость и сколько кредитов списано. Детализация доступна по чатам; если чат удалили, его строки из этой разбивки пропадают.

Экономия и кэш — разные вещи

Экономия токенов Кэш провайдера
Кто делает редактор перед отправкой провайдер нейросети
Что делает укорачивает старый мусор → меньше токенов в запросе узнаёт знакомое начало → дешевле считает повтор
Гарантия по правилам чата у нас зависит от модели, провайдера и стабильности префикса
В интерфейсе огонёк и «Saved» в чате колонка Кэш в детализации транзакций проекта

Могут работать вместе: экономия убирает лишний объём, кэш удешевляет то, что всё равно пришлось слать повторно. В итоге важнее суммарные кредиты, а не одна цифра «из кэша».

Практические советы

  1. Закончили тему — откройте новый чат. Короче контекст → дешевле и модель меньше путается.
  2. Долгая работа в одном чате — включите экономию токенов. История останется, старые огромные куски перестанут снова уходить в оплату.
  3. Не рассчитывайте только на кэш. Он помогает, когда начало запроса стабильно повторяется; на раздутом диалоге часто пропадает. Проверить hit/miss можно в детализации транзакций проекта.
  4. Смотрите кредиты в шапке чата. Если расход растёт слишком быстро — модель много раз гоняет большие страницы или файлы; помогут экономия и новый чат.
  5. Не путайте три числа: размер чата в шапке, сколько сэкономил огонёк и сколько провайдер зачёл из кэша. Списание идёт по итоговой стоимости хода → кредиты.

Связанные статьи