FrontierCode: новый бенчмарк для AI-кодеров с фокусом на качество и стиль

Создатели AI-инженера Devin из Cognition выпустили бенчмарк FrontierCode. Предыдущие тесты вроде SWE-Bench проверяли только работоспособность сгенерированного кода. Теперь фокус сместился на качество. Главный критерий нового теста — нажмет ли реальный мейнтейнер кнопку merge. Агент должен соблюсти архитектуру проекта и написать осмысленные тесты.
Задания собирали более 20 мейнтейнеров популярных опенсорс-репозиториев. На каждую задачу ушло около 40 часов. Промпты во FrontierCode в три раза короче старых бенчмарков. Они максимально приближены к коротким и неполным баг-репортам от пользователей. Оценка строится на жестких правилах кодовой базы. Если скрипт нарушает хотя бы один критический стандарт, решение получает ноль. Разработчики заявляют, что такой подход снизил количество ложных срабатываний на 81% по сравнению со SWE-Bench Pro.
Самая сложная выборка Diamond включает 50 задач. Современные модели с ней откровенно не справляются. Лидером стал Claude Opus 4.8 с результатом 13.4%. GPT-5.5 набрал всего 6.3%, но потратил на генерацию в четыре раза меньше токенов. Лучшая открытая модель Kimi K2.6 закрыла только 3.8% задач. Текущие метрики показывают реальную картину. LLM отлично пишут изолированные функции, но выдавать чистый и поддерживаемый продакшен-код они пока не умеют.
Поделиться:
Ещё из архива
Все публикации
Интервью с Владимиром Аюевым: графический язык бигтеха, студия SASHA и дизайн-образование
1 месяц назад
Jockey от TwelveLabs: ИИ-агент для семантического поиска по видеоархивам и извлечения метаданных
1 месяц назад
Архитектура винной этикетки: баланс наборного шрифта и каллиграфии в кейсе Winecraft
1 месяц назад
Оптимизация контекста в Claude Code: как работает кэширование промптов и за что мы платим
1 месяц назад
Архитектура памяти для LLM-агентов: от базового SQLite до Graph RAG
1 месяц назад