Новость

Cognition выпустила модель SWE-2, которой нужно на 58% меньше шагов для решения

Фото: Cognition

Модели для программирования обычно хвастаются баллами на бенчмарках, а не тем, сколько шагов им нужно, чтобы дойти до первой реальной правки в коде. Cognition, разработчик агента для разработки Devin, выпустила модель SWE-2 и сразу показала это как главное достижение: там, где предыдущая версия делала 48 шагов до первого содержательного изменения, SWE-2 справляется за 18.

По заявленным результатам, SWE-2 набирает 50,0% на бенчмарке FrontierCode 1.1 — это на волосок отстаёт от модели Fable 5.1 (50,9%), но обходится на 64% дешевле. Модель обходит по счёту и стоимости предыдущую версию SWE-1.7 и Grok 4.6, догоняет по качеству GPT-5.6 Sol, а до самой дорогой модели рынка, GPT-6 Astra (53,3%), не дотягивает всего на несколько пунктов — при этом стоит примерно вчетверо дешевле. На бенчмарке реальных задач разработки DeepSWE 1.1 результат ещё выше — 73%.

Модель дообучили поверх открытой Kimi K3 — модели на 2,8 триллиона параметров, которая уже прошла серьёзное обучение с подкреплением для агентных задач кодинга. Команда Cognition масштабировала обучение с подкреплением на модели такого размера впервые в своей практике, добавив алгоритм, который в одном заходе тренирует сразу все уровни «усилия» модели — от быстрого и дешёвого до медленного и тщательного — вместо того чтобы обучать их по отдельности.

Разница чувствуется и в баллах, и в поведении модели. Предыдущая SWE-1.7 славилась чрезмерной осторожностью — подолгу изучала код, прежде чем внести хоть одну правку, из-за чего пользователи жаловались на медлительность на простых задачах. SWE-2 исследует код более прицельно: более высокий уровень понимания позволяет ей сразу определить, какие части кодовой базы вообще важны для конкретной задачи, — отсюда и разница в 48 против 18 шагов до первой правки. На том же FrontierCode 1.1 модель среднего уровня усилия набирает больше баллов, чем SWE-1.7, делая при этом на 58% меньше шагов и обходясь на 81% дешевле.

Команда также отмечает возросшую находчивость модели в рамках заданных пользователем ограничений: в одном из внутренних тестов нужная интеграция оказалась недоступна, и модель самостоятельно восстановила необходимые данные из истории Slack-канала, к которому у неё уже был доступ. При проверке своих выводов SWE-2 не просто повторяет утверждения увереннее — она заново их обосновывает и запускает код, чтобы получить доказательства, вместо того чтобы доверять собственному же тексту.

SWE-2 уже доступна в приложении Devin для компьютера и в командной строке, в ближайшее время появится в веб-версии и в связке Fusion, где эта модель может работать в паре с более мощной моделью-«ведущим». Для рынка кодовых агентов, который последний год соревнуется скорее в цене за токен, чем в чистом качестве, история про модель, которая тратит меньше шагов на ту же задачу, — более практичный аргумент, чем ещё один процент на лидерборде.

Ещё новости

Все новости →