youtu.be
Локальные LLM на смартфонах: дообучение Gemma 270M с точностью 90% и скоростью 2000 токенов в секунду

Инженер Google Кормак Брик показал пайплайн настройки крошечных языковых моделей для работы на мобильных устройствах. Прицельный файн-тюнинг Function Gemma на 270 млн параметров поднимает точность обработки пользовательских команд с 46% до 90%. На смартфоне Pixel 7 такая сборка обрабатывает почти 2000 токенов в секунду на этапе префилла.
Процесс подготовки агента под локальные задачи состоит из понятного цикла:
- Выбор базовой модели Gemma 270M.
- Генерация синтетического датасета для целевых интентов.
- Дообучение модели с помощью
LoRA. - Квантование весов до формата
int4. - Развертывание на мобильном процессоре.
В узких сценариях этот метод позволяет компактной сборке обойти по качеству ответов тяжелые модели на 70 млрд параметров. Вся генерация происходит полностью оффлайн. Подход закрывает главные проблемы мобильных ИИ-агентов: сетевую задержку, зависимость от интернета и приватность пользовательских данных.
Поделиться:
Ещё из архива
Все публикации
Интервью с Владимиром Аюевым: графический язык бигтеха, студия SASHA и дизайн-образование
1 месяц назад
Jockey от TwelveLabs: ИИ-агент для семантического поиска по видеоархивам и извлечения метаданных
1 месяц назад
Архитектура винной этикетки: баланс наборного шрифта и каллиграфии в кейсе Winecraft
1 месяц назад
Оптимизация контекста в Claude Code: как работает кэширование промптов и за что мы платим
1 месяц назад
Архитектура памяти для LLM-агентов: от базового SQLite до Graph RAG
1 месяц назад