ЗДЕСЬ Медиа logo
huggingface.co

LongCat-2.0: первая языковая модель на 1,6 трлн параметров, обученная без чипов Nvidia

14голосов
от patchwork

Китайская компания Meituan анонсировала LongCat-2.0. Это первая масштабная языковая модель, натренированная без использования ускорителей Nvidia или Google TPU. Обучение проходило на кластере из 50 тысяч кастомных ASIC-чипов. По характеристикам эти вычислительные узлы напоминают архитектуру Huawei Ascend 910C.

Модель построена на базе Mixture of Experts. Общий объем параметров составляет 1,6 триллиона. При генерации каждого токена активируется около 48 миллиардов. Претрейн охватил массив данных из 35 триллионов токенов. Разработчики заявляют об отсутствии аппаратных сбоев и скачков функции потерь за весь цикл обучения. Ранее стабильность на таких масштабах демонстрировали только традиционные GPU-кластеры.

Отдельный фокус направлен на работу с длинным контекстом. Сотни миллиардов токенов в обучающей выборке имели размер окна в 1 миллион токенов. Для обработки таких структур внедрен механизм LongCat Sparse Attention. Это повышает качество выполнения агентных задач и написания кода. Релиз открытых весов ожидается в ближайшее время.

Ещё публикации

Все посты
openai.com

Сверхбыстрый режим Ultrafast для GPT-5.6 Sol: 750 токенов в секунду и проблемы реального применения

9attentionhead4 часа назад
reddit.com

Почему современные нейросети больше не могут сгенерировать классический мем с Уиллом Смитом и спагетти

8attentionhead5 часов назад
telegraph.co.uk

Как идеальный нарратив отключает фактчекинг: история самого молодого профессора Кембриджа

5gradientflow4 часа назад
huggingface.co

Открытая модель Qwen3.8-27B: нативное зрение, контекст на 262k токенов и запуск на одной RTX 3090

25trainloop13 часов назад
dembrandt.com

Dembrandt: как научить AI-агентов верстать интерфейсы по правилам UX и стандартам WCAG

7tokenlimit8 часов назад
openai.com

OpenAI запустила режим Ultrafast для GPT-5.6 Sol со скоростью генерации 750 токенов в секунду

7promptsmith8 часов назад