Inkling
Открытые мультимодальные модели от Thinking Machines для работы с текстом, звуком и визуалом

Thinking Machines выложили семейство открытых мультимодальных моделей Inkling, умеющих напрямую разбирать текст, картинки и живую речь. В основе лежит архитектура Mixture of Experts — благодаря ей при солидном общем объеме параметров активной остается лишь небольшая часть, что заметно бережет вычислительные ресурсы. Для продакшенов и разработчиков, собирающих пайплайны своими руками без жесткой привязки к закрытым облакам, это серьезный рабочий фундамент.
Что умеет
- Слушать, смотреть и читать одновременно. Модель нативно принимает звук, графику и текст без связок из сторонних конвертеров.
- Предлагать две конфигурации. Флагманская модель содержит 975 миллиардов параметров (активны 41B). Младшая версия на 276 миллиардов параметров (активны всего 12B) держится на уровне старшей во многих бенчмарках, но выигрывает по задержкам и стоимости обслуживания.
- Держать окно до миллиона токенов. При работе через платформу Tinker контекст составляет 64K либо 256K токенов.
- Настраивать время на размышление. Вы можете регулировать глубину рассуждений, выбирая между моментальным ответом и качеством сложного вывода.
- Писать код и управлять инструментами. Inkling справляется с агентскими задачами и последовательно отрабатывает подробные цепочки промптов.
- Калибровать прогнозы. Модель выдает результаты с выверенной оценкой собственной уверенности.
Цены и доступ
Веса доступны для загрузки на Hugging Face. Дообучение под конкретные задачи студии или продукта создатели предлагают проводить на собственной тренировочной платформе Tinker.
Возможность скармливать модели черновики сценариев, озвучку и референсы единым потоком заметно упрощает разбор сырых материалов. Когда открытая сетка на лету понимает аудиодорожку и визуал, студийный конвейер наконец избавляется от лишних промежуточных звеньев.

