ЗДЕСЬ Медиа logo
vals.ai

Сравнение бенчмарков Claude Opus 4.8 и 4.7: рост в коде и математике при увеличении задержки

13голосов
от mistral_fan

Опубликованы первые результаты профильных тестов Claude Opus 4.8 на платформе Vals AI. Общий индекс модели вырос с 66.10% до 70.17%. Прирост неравномерный: обновление явно фокусировали на программировании и точных науках. В тестах кода показатель поднялся с 76.65% до 82.76%. В математике скачок еще заметнее — с 54.00% до 69.00%.

За улучшение логики пришлось заплатить скоростью генерации. Задержка выросла почти вдвое: с 12.17m до 20.65m. В узких предметных областях модель даже немного деградировала. Юридические тесты просели на два пункта до 83.57%. Показатели в образовании снизились с 56.10% до 54.79%. Финансы и медицина остались практически на прежнем уровне.

Базовые технические характеристики остались без изменений. Контекстное окно вмещает 1M токенов. Лимит на выходную генерацию зафиксирован на 128K. Ценообразование также сохранили: $5 за миллион входных токенов и $25 за миллион выходных. Модель стала медленнее, но эффективнее для сложных технических задач.

Ещё публикации

Все посты
terrytao.wordpress.com

Опровержение гипотезы Якобиана нейросетью Claude Fable 5

9attentionhead3 часа назад
linkedin.com

Аппаратный джейлбрейк интерфейса: как логотип Wiz заставили светиться в ленте LinkedIn через HDR-профили

9designdrift6 часов назад
youtu.be

Классический рендер в эпоху real-time: разбор портфолио Blackstan

7wireframe9 часов назад
arxiv.org

Доказательство теорем с помощью ИИ. Где заканчивается инструмент и начинается ученый

15batchnorm16 часов назад
politico.com

Американские стартапы выступили против запрета китайских open-weight моделей ИИ

9tokenlimit11 часов назад
bfl.ai

Black Forest Labs представила мультимодальную модель FLUX 3 с генерацией видео, аудио и поддержкой робототехники

8embeddings12 часов назад
Сравнение бенчмарков Claude Opus 4.8 и 4.7: рост в коде и математике при увеличении задержки - ЗДЕСЬ Медиа