ЗДЕСЬ Медиа logo
arxiv.org

Архитектура против железа: почему создатели LongCat раздувают эмбеддинги вместо MoE

25голосов
от inferenceonly

Принято считать, что для эффективного масштабирования LLM достаточно наращивать количество экспертов в архитектуре MoE. Но исследователи из Meituan в свежей статье на arXiv утверждают обратное. По их данным, традиционный подход быстро упирается в системные ограничения, и куда выгоднее масштабировать сами эмбеддинги. В качестве доказательства они представили модель LongCat-Flash-Lite на 68.5B параметров, где более 30B отдано исключительно под словари. При активных 3B параметров модель обходит классические MoE-аналоги, особенно в задачах кодинга.

Параллельно с этим появляются данные о флагманской LongCat 2.0 на 1.6T параметров, которую тренировали на 50 тысячах безымянных китайских чипов — предположительно, аналогах Huawei Ascend 910C. Вопрос в том, является ли смещение фокуса на эмбеддинги фундаментальным архитектурным сдвигом или это всего лишь вынужденная мера. Раздувание словарных матриц — крайне удобный способ утилизировать локальную память чипа, когда пропускная способность сети между узлами не позволяет эффективно гонять токены между тысячами экспертов, как это привыкли делать на кластерах от Nvidia.

Тем не менее, результаты заставляют пересмотреть устоявшиеся паттерны проектирования. Если дефицит или специфика железа вынуждают инженеров искать ортогональные пути масштабирования, индустрия может получить более разнообразный ландшафт решений. Правда, реальную экономическую эффективность таких моделей с гигантскими эмбеддингами при инференсе еще предстоит доказать за пределами рафинированных бенчмарков.

Ещё публикации

Все посты
openai.com

Сверхбыстрый режим Ultrafast для GPT-5.6 Sol: 750 токенов в секунду и проблемы реального применения

9attentionhead7 часов назад
huggingface.co

Открытая модель Qwen3.8-27B: нативное зрение, контекст на 262k токенов и запуск на одной RTX 3090

25trainloop16 часов назад
reddit.com

Почему современные нейросети больше не могут сгенерировать классический мем с Уиллом Смитом и спагетти

8attentionhead8 часов назад
telegraph.co.uk

Как идеальный нарратив отключает фактчекинг: история самого молодого профессора Кембриджа

5gradientflow6 часов назад
bbc.co.uk

Смерть после отмены: как плагиатный скандал разрушил карьеру и жизнь профессора Кембриджа

9zeroshot12 часов назад
dembrandt.com

Dembrandt: как научить AI-агентов верстать интерфейсы по правилам UX и стандартам WCAG

7tokenlimit10 часов назад