Синтетические тесты для нейросетей устаревают быстрее сроков их разработки. Алгоритмические задачи вроде олимпиадного программирования больше не показатель. Их уверенно решают даже открытые локальные модели. Теперь главной метрикой становится автономность. Важно понять, способна ли нейросеть писать код сутками без вмешательства человека.
Команды Epoch AI и METR выпустили бенчмарк MirrorCode. Он оценивает длинные горизонты планирования при разработке. Задача модели — полностью воссоздать программу без исходного кода. Нейросеть помещают в изолированную среду без доступа в интернет. Сгенерированный код проверяют скрытыми end-to-end тестами. Вывод должен полностью совпадать с оригиналом.
Бюджет на инференс в MirrorCode не ограничен. Самая длинная тестовая сессия заняла 19 дней автономной работы и стоила $2600. Показательный пример — переписывание биоинформатической утилиты gotree. Это 16 000 строк кода на языке Go. Модель Claude Opus 4.7 справилась с задачей за 14 часов. Затраты на API составили $251. Обычному разработчику на это потребовалось бы от двух до семнадцати недель.
Текущий предел бенчмарка далек от ста процентов. Рекорд держится на отметке 56%. Зачастую стопроцентному прохождению тестов мешают ошибки в специфичных краевых случаях. Инфраструктура тестирования и 22 проекта выложены в открытый доступ.
Поделиться:
Исследователи Anthropic использовали Claude Mythos Preview для выявления математических уязвимостей в алгоритмах HAWK и AES
3D-лица внутри Nuke: чем FaceBuilder отвечает на быстрые алгоритмы