Google представила модели Gemma 4 с технологией QAT для экономии памяти на смартфонах

Корпорация Google выпустила обновленные версии своих открытых языковых моделей Gemma 4, оптимизированные с помощью метода обучения с учетом квантования (Quantization-Aware Training, QAT). Эта технология позволяет существенно уменьшить размер моделей и их потребление оперативной памяти, сохраняя при этом высокую производительность на мобильных устройствах и ноутбуках.

Преимущества метода QAT над стандартным сжатием

Квантование — это процесс снижения точности весов нейросети (перевод их из высокоточного формата в более компактный) для уменьшения её объема. Ранее наиболее распространенным методом было квантование после обучения (Post-Training Quantization, PTQ). Однако, как отмечается в блоге Google, PTQ часто приводит к заметному снижению качества ответов. В новых версиях Gemma 4 используется QAT, при котором процесс сжатия интегрирован непосредственно в этап обучения, что минимизирует потери точности и ускоряет процесс декодирования данных.

Оптимизация для мобильных платформ

Благодаря внедрению специальной схемы мобильного квантования, сжатые модели эффективно работают на обычных смартфонах. Разработчики применили несколько технологических решений:

  • использование заранее рассчитанных настроек параметров сжатия;
  • применение 2-битного сжатия для отдельных компонентов архитектуры;
  • оптимизация словаря и алгоритмов краткосрочной памяти.

Для пользователя это означает, что ИИ-модель занимает меньше места во внутренней памяти устройства и требует значительно меньше оперативной памяти (RAM) во время работы.

Доступные версии и системные требования

Технология QAT применена к пяти вариантам моделей разного размера: Gemma 4 E2B, E4B, 12B, 26B A4B и 31B. Самая компактная текстовая версия, Gemma 4 E2B, требует менее 1 ГБ оперативной памяти для запуска. Такие низкие системные требования делают эти версии оптимальными для работы локально на смартфонах без обращения к облачным серверам.

Новые модели доступны для загрузки в четырех различных форматах:

  • стандартные контрольные точки QAT;
  • универсальный формат GGUF;
  • версии, оптимизированные специально для мобильных систем;
  • формат Compressed Tensors.

По данным разработчиков, новые версии сохраняют качество, сопоставимое с полноразмерными форматами высокой точности (bfloat16). Найти и загрузить модели для использования на ПК или смартфонах можно в популярных репозиториях, таких как Hugging Face или через приложение LM Studio.


Понравилась запись? Поделись с друзьями и поддержи сайт: