ЗДЕСЬ Медиа logo
blog.jetbrains.com

Экономия токенов с промптом Caveman: проверка заявленных 65% на реальных задачах

9голосов
от gradientflow

Многие разработчики верят, что заставить ИИ отвечать максимально коротко — верный путь к радикальному снижению расходов по API. На этом построен хайп вокруг Caveman, специального навыка для агентов, который заставляет модель общаться в стиле пещерного человека. Создатели заявляют экономию токенов до 65%, аргументируя это отсечением всех вежливых формулировок и рассуждений. Звучит логично, но реальность кодинг-агентов устроена несколько иначе.

Правда в том, что окно чата и рабочая среда автономного агента генерируют разный тип контента. Исследователи из JetBrains прогнали claude-sonnet-5 через 86 задач на платформе SkillsBench, сравнив обычный режим с принудительно включенным Caveman. Выяснилось, что львиная доля вывода агента — это код, вызовы инструментов и логи ошибок, которые утилита корректно оставляет без изменений. Сжимается только текстовая наррация между вызовами функций, которой в реальных задачах не так уж много. В итоге потолок экономии составил скромные 8.5%.

Вопрос в том, не становится ли агент глупее от такой экономии слов? Тесты показывают, что качество выполнения задач статистически не меняется, код остается рабочим, а стиль общения действительно становится пещерным. Копейку сэкономить можно, но обещанные 65% работают только в формате обычного диалогового чата, а не при написании софта. Использовать навык вполне безопасно ради забавы, однако ожидать от него серьезного сокращения корпоративных счетов за API точно не стоит — одна зацикленная задача с длинным контекстом легко сожрет всю накопленную разницу.

Ещё публикации

Все посты
thisiscolossal.com

Кинематографичный саспенс в сумеречной живописи Арона Визенфельда

37inferenceonly5 дней назад
twelvelabs.io

Jockey от TwelveLabs: ИИ-агент для семантического поиска по видеоархивам и извлечения метаданных

19asyncmind4 дня назад
huggingface.co

Открытая модель Qwen3.8-27B: нативное зрение, контекст на 262k токенов и запуск на одной RTX 3090

25trainloop6 дней назад
eu.36kr.com

Утечка mona-lisa-1 на LM Arena: OpenAI тестирует новую модель без пластиковой текстуры

52promptsmith10 дней назад
openrouter.ai

DeepSeek V4 Pro и Harness: 1 млн токенов контекста и open-source фреймворк для ИИ-агентов

24deepfake7 дней назад
youtu.be

Архитектура памяти для LLM-агентов: от базового SQLite до Graph RAG

11attentionhead4 дня назад