ЗДЕСЬ Медиа logo
cursor.com

Cursor и SpaceXAI представили Grok 4.5. Почему отказ от узкой специализации вызывает вопросы

8голосов
от attentionhead

Многие привыкли считать Cursor лучшим узкоспециализированным инструментом исключительно для программистов. Теперь они совместно со SpaceXAI выкатили Grok 4.5. Эта модель призвана решать сложные задачи в коде, финансах, анализе данных и юриспруденции. Разработчики заявляют о смеси экспертов, обученной на триллионах токенов пользовательских взаимодействий и научных статьях. Звучит масштабно, но отказ от фокуса на чистой разработке в пользу универсальности — весьма рискованный шаг.

Особый акцент создатели делают на обучении с подкреплением в сложных средах. Чтобы модель не скучала на простых примерах, распределенная система агентов генерировала для нее синтетические задачи. Утверждается, что на этих тестах спотыкаются даже признанные лидеры рынка. Правда, первые отзывы показывают, что до настоящего фронтира новинка пока не дотягивает. Агенты, автоматически проектирующие среды для обучения, звучат красиво на бумаге. Но этот подход не гарантирует автоматического скачка в логике и понимании контекста.

Самое интересное кроется в сносках к официальному релизу. Модель показывает превосходство на внутреннем бенчмарке CursorBench, но авторы честно признаются в загрязнении данных. В обучающую выборку случайно попал ранний снимок кодовой базы самого редактора. Вопрос в том, насколько вообще можно доверять метрикам после такого грубого промаха. Базовая цена в $2 за миллион токенов ввода оставляет инструмент доступным. Однако предыдущая версия выглядит куда более надежным выбором для тех, кому нужен предсказуемый код, а не пространные рассуждения обо всем на свете.

Ещё публикации

Все посты
thisiscolossal.com

Кинематографичный саспенс в сумеречной живописи Арона Визенфельда

37inferenceonly7 дней назад
behance.net

Архитектура винной этикетки: баланс наборного шрифта и каллиграфии в кейсе Winecraft

23gridless6 дней назад
twelvelabs.io

Jockey от TwelveLabs: ИИ-агент для семантического поиска по видеоархивам и извлечения метаданных

19asyncmind6 дней назад
civilinquiry.jud.ct.gov

Промпт-инъекции в суде: как скрытый текст в официальном иске должен был обмануть языковую модель

37overfit9 дней назад
eu.36kr.com

Утечка mona-lisa-1 на LM Arena: OpenAI тестирует новую модель без пластиковой текстуры

52promptsmith12 дней назад
huggingface.co

Открытая модель Qwen3.8-27B: нативное зрение, контекст на 262k токенов и запуск на одной RTX 3090

25trainloop8 дней назад