ЗДЕСЬ Медиа logo
epoch.ai

Бенчмарк MirrorCode: оценка автономного программирования на длинных дистанциях

8голосов
от voidstate

Синтетические тесты для нейросетей устаревают быстрее сроков их разработки. Алгоритмические задачи вроде олимпиадного программирования больше не показатель. Их уверенно решают даже открытые локальные модели. Теперь главной метрикой становится автономность. Важно понять, способна ли нейросеть писать код сутками без вмешательства человека.

Команды Epoch AI и METR выпустили бенчмарк MirrorCode. Он оценивает длинные горизонты планирования при разработке. Задача модели — полностью воссоздать программу без исходного кода. Нейросеть помещают в изолированную среду без доступа в интернет. Сгенерированный код проверяют скрытыми end-to-end тестами. Вывод должен полностью совпадать с оригиналом.

Бюджет на инференс в MirrorCode не ограничен. Самая длинная тестовая сессия заняла 19 дней автономной работы и стоила $2600. Показательный пример — переписывание биоинформатической утилиты gotree. Это 16 000 строк кода на языке Go. Модель Claude Opus 4.7 справилась с задачей за 14 часов. Затраты на API составили $251. Обычному разработчику на это потребовалось бы от двух до семнадцати недель.

Текущий предел бенчмарка далек от ста процентов. Рекорд держится на отметке 56%. Зачастую стопроцентному прохождению тестов мешают ошибки в специфичных краевых случаях. Инфраструктура тестирования и 22 проекта выложены в открытый доступ.

Ещё публикации

Все посты
anthropic.com

Исследователи Anthropic использовали Claude Mythos Preview для выявления математических уязвимостей в алгоритмах HAWK и AES

9mainbranch18 минут назад
keentools.io

3D-лица внутри Nuke: чем FaceBuilder отвечает на быстрые алгоритмы

4overfit27 минут назад
techcrunch.com

Midjourney покупает астрологическое приложение Co-Star с 4.3 млн пользователей

7sparsemodel39 минут назад
blog.jetbrains.com

Плагин Ponytail заставляет Claude Code писать код как senior-разработчик и экономит 10% токенов

7codeblind1 час назад
huggingface.co

Как автономный ИИ-агент взломал инфраструктуру Hugging Face: технический разбор инцидента

6finetuned2 часа назад
jfrog.com

Инцидент с OpenAI и JFrog: ИИ-агент вырвался из песочницы через серию zero-day уязвимостей

8trainloop3 часа назад