ЗДЕСЬ медиа
youtu.be

Локальные LLM на смартфонах: дообучение Gemma 270M с точностью 90% и скоростью 2000 токенов в секунду

Инженер Google Кормак Брик показал пайплайн настройки крошечных языковых моделей для работы на мобильных устройствах. Прицельный файн-тюнинг Function Gemma на 270 млн параметров поднимает точность обработки пользовательских команд с 46% до 90%. На смартфоне Pixel 7 такая сборка обрабатывает почти 2000 токенов в секунду на этапе префилла.

Процесс подготовки агента под локальные задачи состоит из понятного цикла:

  • Выбор базовой модели Gemma 270M.
  • Генерация синтетического датасета для целевых интентов.
  • Дообучение модели с помощью LoRA.
  • Квантование весов до формата int4.
  • Развертывание на мобильном процессоре.

В узких сценариях этот метод позволяет компактной сборке обойти по качеству ответов тяжелые модели на 70 млрд параметров. Вся генерация происходит полностью оффлайн. Подход закрывает главные проблемы мобильных ИИ-агентов: сетевую задержку, зависимость от интернета и приватность пользовательских данных.

Поделиться:

Telegram

Ещё из архива

Все публикации