Файлы глобальных инструкций вроде claude.md или AGENTS.md не повышают процент решенных задач у ИИ-агентов. Исследователи проверили эту гипотезу на 17 реальных задачах из трех Python-репозиториев: pdm, firebase-admin-python и opshin. В тестах участвовали Claude Code и Codex, суммарно выполнено 288 прогонов. Описание PR служило промптом, а тесты — скрытой проверкой.
Тестирование шло в трех режимах подачи контекста. Первый — полное удаление файла из воркспейса. Второй — always_on, когда весь AGENTS.md летит в системный промпт каждый ход. Третий — селективное чтение нужных тем из базы. Ни одна из стратегий не изменила метрику корректности. Разница осталась в пределах статистической погрешности.
Анализ ошибок показал истинную причину провалов. Агенты не справляются с практическими навыками реализации кода. Они ошибаются в проектировании фич, выборе паттернов и связке компонентов. Им хватает знаний о репозитории, но не хватает логики. Наличие файла claude.md ни разу не превратило почти успешный код в работающий. Проблема лежит в базовых способностях моделей писать сложную логику.
Поделиться:
Генерация видео из таблиц и PDF: Alibaba открыла публичный доступ к модели Wan 3.0
Обновление шрифтовой системы Futura PT: моноширинные начертания и расширенная кириллица