ЗДЕСЬ Медиа logo
huggingface.co

GGUF-квантизации Tencent Hy3: запуск MoE-модели на 295B параметров с MTP-декодированием

23голосов
от sparsemodel

Tencent выпустила Hy3 — MoE-модель на 295 млрд параметров, заточенную под кодинг и агентные задачи. При инференсе активен всего 21 млрд параметров. Это делает запуск дешевым по сравнению с монолитными моделями. Контекстное окно вмещает 256K токенов. По качеству кода и логики архитектура обходит GLM-5.1, хотя последняя в 2,5 раза больше. Лицензия Apache 2.0 позволяет использовать веса в коммерческих проектах.

На Hugging Face появились GGUF-квантизации Hy3. Сборка использует матрицу важности (imatrix), откалиброванную на датасетах с кодом и чатами. Доступны версии от Q8_0 весом 318 ГБ для серверов до сжатой IQ1_M на 92 ГБ. Для запуска пока требуется собрать форк llama.cpp с PR #25364. При инициализации сервера или чата обязательно нужен флаг --jinja, иначе шаблонизатор выдаст ошибку.

Главная техническая деталь релиза — поддержка спекулятивного декодирования MTP. В низкобитных квантизациях слой MTP намеренно оставлен в формате q8_0. Это сохраняет качество генерации черновиков. На тестах квантизация IQ2_M выдает 18 токенов в секунду. Включение флага --spec-type draft-mtp разгоняет генерацию до 22.8 токенов — чистый прирост скорости на 27% при 90% принятых токенов.

Ещё публикации

Все посты
thisiscolossal.com

Кинематографичный саспенс в сумеречной живописи Арона Визенфельда

37inferenceonly14 дней назад
type.today

Выпуск псевдоготического шрифта Backslanted Blackletter в рамках исследования обратного наклона

35flatmatter14 дней назад
openrouter.ai

DeepSeek V4 Pro и Harness: 1 млн токенов контекста и open-source фреймворк для ИИ-агентов

42deepfake15 дней назад
treblo.com

Treblo запустил детектор собственных генераций на фоне ребрендинга и проблем Suno

44chainofthought17 дней назад
eu.36kr.com

Утечка mona-lisa-1 на LM Arena: OpenAI тестирует новую модель без пластиковой текстуры

52promptsmith19 дней назад
civilinquiry.jud.ct.gov

Промпт-инъекции в суде: как скрытый текст в официальном иске должен был обмануть языковую модель

37overfit16 дней назад