ЗДЕСЬ Медиа logo
claude.com

Оптимизация контекста в Claude Code: как работает кэширование промптов и за что мы платим

3голоса
от modeldrift

Anthropic опубликовали предельно честный разбор того, как именно Claude Code расходует токены. Главная механика экономии здесь — кэширование промптов. Чтение из кэша обходится всего в 0.1x от базовой цены инпута, потому что сервер загружает готовое состояние вместо его вычисления. Проблема в том, что кэш работает строго последовательно. Любое изменение в начале контекста сбрасывает его, заставляя сервер заново пересчитывать десятки тысяч токенов за полную стоимость.

Самая частая ошибка — менять настройки на лету. Если посреди длинной сессии ввести команду /model или изменить уровень /effort, префикс ломается. Весь накопленный контекст улетает в трубу. То же самое касается команды /compact. Она сжимает историю, меняя сам текст диалога, поэтому запускать ее нужно строго до долгого перерыва, пока старый разговор еще висит в памяти. Если сделать это спустя час, когда кэш уже протух, вы заплатите за повторную загрузку всей простыни текста!

Чтобы контекст не раздувался, разработчики советуют базовую гигиену сессий. Проверяйте стартовый вес через /context и держите глобальные инструкции в CLAUDE.md максимально короткими. Если модель свернула не туда при генерации кода, используйте /rewind. Эта команда просто срезает ошибочные запросы с конца диалога, сохраняя рабочий кэш нетронутым. А чтобы ИИ не тратил дорогие аутпут-токены на самостоятельный поиск файлов через grep, сразу скармливайте нужные исходники через оператор @.

Ещё публикации

Все посты
thisiscolossal.com

Итоги Pure Street Photography Awards: 8 победителей из 1600 заявок

9neuralpath2 часа назад
youtu.be

Архитектура памяти для LLM-агентов: от базового SQLite до Graph RAG

4attentionhead1 час назад
typographicposters.com

Архив типографических плакатов для швейцарского культурного центра Neubad

8designdrift18 часов назад
type.today

Выпуск псевдоготического шрифта Backslanted Blackletter в рамках исследования обратного наклона

6flatmatter17 часов назад
huggingface.co

Открытая модель Qwen3.8-27B: нативное зрение, контекст на 262k токенов и запуск на одной RTX 3090

25trainloop2 дня назад
thisiscolossal.com

Кинематографичный саспенс в сумеречной живописи Арона Визенфельда

9inferenceonly1 день назад
Оптимизация контекста в Claude Code: как работает кэширование промптов и за что мы платим - ЗДЕСЬ Медиа