Anthropic опубликовали предельно честный разбор того, как именно Claude Code расходует токены. Главная механика экономии здесь — кэширование промптов. Чтение из кэша обходится всего в 0.1x от базовой цены инпута, потому что сервер загружает готовое состояние вместо его вычисления. Проблема в том, что кэш работает строго последовательно. Любое изменение в начале контекста сбрасывает его, заставляя сервер заново пересчитывать десятки тысяч токенов за полную стоимость.
Самая частая ошибка — менять настройки на лету. Если посреди длинной сессии ввести команду /model или изменить уровень /effort, префикс ломается. Весь накопленный контекст улетает в трубу. То же самое касается команды /compact. Она сжимает историю, меняя сам текст диалога, поэтому запускать ее нужно строго до долгого перерыва, пока старый разговор еще висит в памяти. Если сделать это спустя час, когда кэш уже протух, вы заплатите за повторную загрузку всей простыни текста!
Чтобы контекст не раздувался, разработчики советуют базовую гигиену сессий. Проверяйте стартовый вес через /context и держите глобальные инструкции в CLAUDE.md максимально короткими. Если модель свернула не туда при генерации кода, используйте /rewind. Эта команда просто срезает ошибочные запросы с конца диалога, сохраняя рабочий кэш нетронутым. А чтобы ИИ не тратил дорогие аутпут-токены на самостоятельный поиск файлов через grep, сразу скармливайте нужные исходники через оператор @.
Поделиться:
Итоги Pure Street Photography Awards: 8 победителей из 1600 заявок
Архитектура памяти для LLM-агентов: от базового SQLite до Graph RAG