Вышла Needle 2 — локальная LLM на 45M параметров для tool calling и генерации JSON. Вся модель упакована в единственный бинарный файл весом 14 МБ. Для работы сессии требуется всего 28 МБ оперативной памяти. Модель запускается на микроконтроллерах ESP32-S3, дешевых смартфонах и гарнитурах без GPU.
Движок написан на C++ без внешних зависимостей. При запуске он аппаратно анализирует процессор и выбирает оптимальное ядро. В основе лежит архитектура Simple Attention Network. Разработчики полностью отказались от пост-квантования. Модель изначально тренировалась в формате CQ2-bit. Веса не распаковываются в RAM, а вычисления идут в int8. Скорость декодирования на Raspberry Pi 5 достигает 500 токенов в секунду.
Needle 2 не предназначена для чатов или генерации текста. Ее задача — маппинг естественного языка на функции с типизированными аргументами. При извлечении данных движок компилирует грамматику из заданной схемы. Это полностью исключает появление невалидного JSON на выходе. На структурных токенах алгоритм пропускает до 98% вычислений проекции словаря. Модель можно быстро дообучить под свой набор инструментов на локальном ПК.
Поделиться:
Lightricks выпустил LTX-2.5: открытая 22B-модель с синхронным аудио и энкодером Gemma 4
Первая модель Safe Superintelligence: что стоит за слухами об августовском релизе