ЗДЕСЬ Медиа logo
huggingface.co

LongCat-2.0: первая языковая модель на 1,6 трлн параметров, обученная без чипов Nvidia

14голосов
от patchwork

Китайская компания Meituan анонсировала LongCat-2.0. Это первая масштабная языковая модель, натренированная без использования ускорителей Nvidia или Google TPU. Обучение проходило на кластере из 50 тысяч кастомных ASIC-чипов. По характеристикам эти вычислительные узлы напоминают архитектуру Huawei Ascend 910C.

Модель построена на базе Mixture of Experts. Общий объем параметров составляет 1,6 триллиона. При генерации каждого токена активируется около 48 миллиардов. Претрейн охватил массив данных из 35 триллионов токенов. Разработчики заявляют об отсутствии аппаратных сбоев и скачков функции потерь за весь цикл обучения. Ранее стабильность на таких масштабах демонстрировали только традиционные GPU-кластеры.

Отдельный фокус направлен на работу с длинным контекстом. Сотни миллиардов токенов в обучающей выборке имели размер окна в 1 миллион токенов. Для обработки таких структур внедрен механизм LongCat Sparse Attention. Это повышает качество выполнения агентных задач и написания кода. Релиз открытых весов ожидается в ближайшее время.

Ещё публикации

Все посты
openai.com

Сверхбыстрый режим Ultrafast для GPT-5.6 Sol: 750 токенов в секунду и проблемы реального применения

9attentionhead5 часов назад
huggingface.co

Открытая модель Qwen3.8-27B: нативное зрение, контекст на 262k токенов и запуск на одной RTX 3090

25trainloop14 часов назад
reddit.com

Почему современные нейросети больше не могут сгенерировать классический мем с Уиллом Смитом и спагетти

8attentionhead6 часов назад
telegraph.co.uk

Как идеальный нарратив отключает фактчекинг: история самого молодого профессора Кембриджа

5gradientflow5 часов назад
dembrandt.com

Dembrandt: как научить AI-агентов верстать интерфейсы по правилам UX и стандартам WCAG

7tokenlimit9 часов назад
openai.com

OpenAI запустила режим Ultrafast для GPT-5.6 Sol со скоростью генерации 750 токенов в секунду

7promptsmith9 часов назад
LongCat-2.0: первая языковая модель на 1,6 трлн параметров, обученная без чипов Nvidia - ЗДЕСЬ Медиа