РазноебесплатноThinking Machines

Inkling-Small

Открытая модель на 12 млрд активных параметров с нативным зрением, слухом и окном на миллион токенов

Фото: thinkingmachines.ai

Когда тяжеловесная модель на триллион параметров съедает слишком много ресурсов, логично перенести накопленный опыт в компактный корпус. Команда Thinking Machines выкатила Inkling-Small — открытую MoE-модель на 276 миллиардов общих параметров, из которых на каждый запрос просыпаются всего 12 миллиардов. Сеть натренировали на системах NVIDIA GB300 NVL72, применив дистилляцию от старшей версии на 975 миллиардов параметров, и на задачах рассуждения и написания кода уменьшенная версия даже вырвалась вперед.

Что умеет

  • Нативно разбирает звук и визуал. Здесь нет внешних тяжелых энкодеров: аудио переводится в dMel-спектрограммы, а изображения делятся на патчи 40×40 пикселей через четырехслойный hMLP и отправляются в единый поток вместе с текстом.
  • Исследует графику через код. Модель подключает Python для визуальных задач — сама кадрирует нужную область, делает зум и программно инспектирует мелкие надписи на чертежах или схемах.
  • Держит контекст до 1 млн токенов. Этого запаса хватает, чтобы загружать часовые аудиоматериалы, сложные сценарии или большие библиотеки кода без потери нити.
  • Управляет временем на размышления. Доступна настройка расхода вычислений от минимального уровня до предельного, что позволяет балансировать между скоростью ответа и точностью вычислений.
  • Решает инженерные задачи. На тесте SWEBench-Verified модель набрала 80,2%, показав высокую эффективность расхода токенов на задачу среди открытых архитектур.

Цены и доступ

Полные веса архитектуры выложены в репозитории Hugging Face. Попробовать текстовый, графический и звуковой диалог можно в веб-интерфейсе Tinker Playground, а тонкая настройка под специализированные пайплайны открыта на платформе Tinker.

В визуальном продакшене инструмент пригодится для автоматизации черновой работы: от программной разметки графиков до контроля исходников и скриптов в связке с локальными агентами без раздувания вычислительного бюджета.

Сайт Inkling-Small
Разноебесплатно

Muse Gadgets

Открытый софт для сборки собственных устройств и экранов с голосовым ассистентом Muse

Разноеплатно

MAI-Transcribe-2-Streaming

Потоковое распознавание речи на 60 языках с откликом от 100 мс для голосовых агентов и живых субтитров.

Разноеплатно

Mercury Voice

Диффузионная языковая модель для голосовых ассистентов с откликом от 320 миллисекунд