Корпорация Google выпустила обновленные версии своих открытых языковых моделей Gemma 4, оптимизированные с помощью метода обучения с учетом квантования (Quantization-Aware Training, QAT). Эта технология позволяет существенно уменьшить размер моделей и их потребление оперативной памяти, сохраняя при этом высокую производительность на мобильных устройствах и ноутбуках.
Преимущества метода QAT над стандартным сжатием
Квантование — это процесс снижения точности весов нейросети (перевод их из высокоточного формата в более компактный) для уменьшения её объема. Ранее наиболее распространенным методом было квантование после обучения (Post-Training Quantization, PTQ). Однако, как отмечается в блоге Google, PTQ часто приводит к заметному снижению качества ответов. В новых версиях Gemma 4 используется QAT, при котором процесс сжатия интегрирован непосредственно в этап обучения, что минимизирует потери точности и ускоряет процесс декодирования данных.
Оптимизация для мобильных платформ
Благодаря внедрению специальной схемы мобильного квантования, сжатые модели эффективно работают на обычных смартфонах. Разработчики применили несколько технологических решений:
- использование заранее рассчитанных настроек параметров сжатия;
- применение 2-битного сжатия для отдельных компонентов архитектуры;
- оптимизация словаря и алгоритмов краткосрочной памяти.
Для пользователя это означает, что ИИ-модель занимает меньше места во внутренней памяти устройства и требует значительно меньше оперативной памяти (RAM) во время работы.
Доступные версии и системные требования
Технология QAT применена к пяти вариантам моделей разного размера: Gemma 4 E2B, E4B, 12B, 26B A4B и 31B. Самая компактная текстовая версия, Gemma 4 E2B, требует менее 1 ГБ оперативной памяти для запуска. Такие низкие системные требования делают эти версии оптимальными для работы локально на смартфонах без обращения к облачным серверам.
Новые модели доступны для загрузки в четырех различных форматах:
- стандартные контрольные точки QAT;
- универсальный формат GGUF;
- версии, оптимизированные специально для мобильных систем;
- формат Compressed Tensors.
По данным разработчиков, новые версии сохраняют качество, сопоставимое с полноразмерными форматами высокой точности (bfloat16). Найти и загрузить модели для использования на ПК или смартфонах можно в популярных репозиториях, таких как Hugging Face или через приложение LM Studio.
Понравилась запись? Поделись с друзьями и поддержи сайт:

