Глубокий анализ · Малые языковые модели

Малые языковые модели на устройстве — почему Gemma 4 E2B и E4B изменили правила игры

В мире ИИ сейчас интереснее всего не самая большая модель. А наименьшая, которая справляется. В какой-то момент прошлого года «малая языковая модель» перестала означать «миленькое демо» и начала означать «модель, работающая прямо сейчас на вашем смартфоне и делающая настоящую работу». Разберём, что изменилось, почему семейство Gemma 4 от Google оказалось в центре этого, и как попробовать сегодня.

Что такое «малая языковая модель» на самом деле

Большие языковые модели (LLM) — это то, что работает за ChatGPT и подобными сервисами: сотни миллиардов параметров, живущих в стойках GPU в дата-центрах. Малые языковые модели (SLM) сжимают ту же идею до размера, способного работать на портативных устройствах — ноутбуке, смартфоне, автомобильном блоке, роботе. На практике «малая» означает несколько миллиардов параметров или меньше, а веса модели занимают гигабайты, а не терабайты.

Почему SLM важны? По одной причине: где они работают. Модель, умещающаяся в смартфоне, может быть приватной (ничего не отправляется), бесплатной за каждое сообщение (без серверных расходов) и офлайн (без сети). Этих трёх свойств нет у облачного ИИ — независимо от его размера. Единственный вопрос — достаточно ли хорош SLM для задачи — и для всё большего числа задач ответ становится «да».

Самое интересное число в мире ИИ сейчас — не показатель бенчмарка. Это наименьшая модель, способная сделать работу, которая вам нужна.

Почему ИИ на устройстве был почти невозможен ещё недавно

Мечта о запуске настоящей языковой модели на смартфоне упиралась сразу в три стены:

Каждая предыдущая попытка «малых моделей на смартфоне» проваливалась на одном из этих трёх пунктов. Gemma 4 — первое семейство, решившее все три одновременно, — и причина тому два архитектурных решения, которые стоит понять.

Обзор семейства Gemma

Модели Gemma от Google — это родственники открытых весовых версий Gemini: меньше по размеру, выпущены для запуска кем угодно, но созданы с использованием знаний от обучения более крупных моделей. Линия происхождения:

Gemma 1 Стандартный трансформер, ПК Gemma 2 Крупнее, всё ещё монолитный Gemma 3 +зрение +многоязычность Gemma 3n PLE + matformer номенклатура E2B/E4B 4 Gemma 4 Акцент на устройства Наследует PLE Та же линия открытых весов. Поворот к mobile-first произошёл в выделенных моделях справа.
Точка поворота семейства. PLE и matformer появились в Gemma 3n; Gemma 4 — основная линия, спроектированная именно для этого.

Главное в Gemma 4 — не показатели бенчмарков. Архитектура проектировалась в обратном направлении: «должна комфортно работать на смартфоне среднего класса» — а не «должна обогнать GPT-4 на бумаге».

PLE: как уместить 2Б параметров в память смартфона

Существует конкретное ограничение, о котором большинство людей не слышали. Многие популярные Android-смартфоны (например, Samsung Galaxy S23 Ultra) предоставляют лишь 128 МБ на байндинг для буферов хранилища WebGPU. Это максимальный размер одного тензора, который принимает GPU-драйвер. Превысить — и драйвер отклонит байндинг; модель будет молча выдавать мусор или откатится на CPU.

В стандартном трансформере наибольший отдельный тензор — это таблица эмбеддингов: размер словаря × скрытая размерность. В современных многоязычных моделях эта таблица может занимать 150–260 МБ даже после квантизации INT8. Иными словами: многие реальные смартфоны просто не могут загрузить таблицу эмбеддингов. Модель не запускается на GPU. Откат на CPU работает, но медленнее в 10–20 раз.

Per-Layer Embedding — ответ Gemma 4. Вместо одной огромной таблицы эмбеддинги распределяются по слоям, удерживая каждый тензор намного ниже лимита 128 МБ. Общее число параметров схожее, но форма другая — а именно форма определяет, работает ли модель на реальном железе.

Почему «форма» модели имеет значение Стандартный трансформер Одна огромная таблица эмбеддингов Словарь × скрытая dim. ≈ 155 МБ ✕ Превышает буфер GPU 128 МБ Gemma 4 (PLE) Эмбеддинги распределены по слоям С1 С2 С3 С4 С5 С6 С7 С8 С9 ✓ Каждый тензор ниже 128 МБ Работает ли на GPU смартфона? Стандартные SLM (Qwen 0.6B, Llama 3.2 1B, Gemma 3 1B): Нет — откат на CPU, в 10–20 раз медленнее Gemma 4 E2B / E4B (PLE): Да — полный GPU-инференс
Одинаковое число параметров, разная форма. Причина, по которой Gemma 4 работает там, где другие малые модели не работают, — это раскладка тензоров, а не размер модели.

Matformer: что на самом деле значат E2B и E4B

E в E2B и E4B — это Effective (эффективный). E2B — модель, ведущая себя как плотная 2-миллиардная на важных задачах; E4B соответствует 4 миллиардам. Но внутри обе происходят из одних и тех же весов.

Механизм называется matformer — представьте нейронную версию матрёшки. В процессе обучения модель оптимизируется так, что параметры образуют вложенную иерархию: можно нарезать модель на разных глубинах и получить меньшие субмодели, которые всё ещё работают согласованно. Из одного мастер-набора весов Google нарезает E2B для смартфонов с меньшим объёмом RAM и E4B — для тех, где его больше.

Matformer: 1 обучение, 2 эффективных размера Мастер-веса Обучены сквозным образом Вложенная иерархия E2B ⊂ E4B Нарезка при инференсе E2B Эффективно ~2Б E4B Эффективно ~4Б (включает E2B) Какой срез загружается? 📱 Средний смартфон → E2B 📱 Больше RAM / флагман → E4B 💻 Ноутбук → любой из двух Вы выбираете не между двумя продуктами. Вы выбираете, как глубоко в одну и ту же модель заходит устройство.
Нейронная матрёшка. Меньшая модель находится внутри большей — устройство решает, до какой глубины добираться.

Gemma 4 vs. другие малые модели

Пространство до 2Б параметров более конкурентно, чем кажется. Взглянем честно, сосредоточившись на практическом вопросе: работает ли на GPU Android среднего класса?

МодельПараметрыРазмер эмбеддинга (INT8)Вписывается в буфер 128 МБ?
Qwen3 0.6B0,6Б≈ 155 МБ✕ Откат на CPU
Gemma 3 1B≈ 151 МБ (даже в INT4)✕ Откат на CPU
Llama 3.2 1B≈ 262 МБ✕ Откат на CPU
Qwen3 1.7B1,7Б≈ 311 МБ✕ Откат на CPU
IBM Granite 4.0 350M0,35Б≈ 102 МБ✓ (малый словарь, слабая многоязычность)
Gemma 4 E2B (PLE)Эффективно 2БРаспределено по слоям✓ Полный GPU
Gemma 4 E4B (PLE)Эффективно 4БРаспределено по слоям✓ Полный GPU (при достаточном RAM)
Реальная цена отката на CPU Время prefill на одном смартфоне (Snapdragon 8 Gen 2) с одним системным промптом ~3700 символов Не-PLE модель, откат CPU > 20 сек. Gemma 4 (PLE), полный GPU ≈ 1 сек. 0 сек. 10 сек. 20 сек.+
1 секунда — это разговор. 20 секунд — это баг-репорт. Один смартфон, один промпт, разная архитектура — вот и всё.

Где попробовать Gemma 4 сегодня

На смартфоне: Gist&Chat (E2B, бесплатно)

Gist&Chat — бесплатное Android-приложение с встроенным Gemma 4 E2B. При первом запуске вы скачиваете модель по Wi-Fi — один раз, около 2,6 ГБ — и затем ИИ работает полностью на вашем смартфоне. Что можно делать:

E4B в Pro (скоро)

Более крупный вариант Gemma 4 E4B появится в уровне Pro Gist&Chat. E4B удваивает эффективные параметры — заметно лучше в рассуждениях, Q&A с длинным контекстом, задачах, близких к программированию — но для комфортной работы требует смартфона с достаточным RAM.

На ноутбуке или десктопе

Хотите попробовать на более крупной машине? Веса Gemma 4 от Google доступны в обычной экосистеме открытых моделей — Hugging Face, Ollama, LM Studio, Jan, GPT4All. Сравнение всех настольных вариантов с мобильными — в статье Офлайн-альтернатива ChatGPT — реальные варианты в 2026 году.

Честные ограничения

Гайды, которые пропускают этот раздел, — пресс-релизы. Что Gemma 4 E2B не тянет:

Попробуйте Gemma 4 бесплатно на смартфоне

Gist&Chat несёт Gemma 4 E2B — приватный ИИ-чат и резюмирование YouTube, статей и PDF на 11 языках. Более крупный вариант E4B появится в Pro.

▶ Скачать Gist&Chat бесплатно в Google Play

Бесплатно · Один раз скачать модель по Wi-Fi, около 2,6 ГБ · Ни байта вашего чата не покидает смартфон — политика конфиденциальности

Часто задаваемые вопросы

Что такое Gemma 4 и чем он отличается от предыдущих моделей Gemma?

Gemma 4 — семейство компактных моделей Google с акцентом на устройства. В отличие от Gemma 1, 2 и 3, он использует архитектуру PLE из Gemma 3n. Распределяет эмбеддинги по слоям, удерживая каждый тензор в пределах памяти GPU смартфона.

Что означают E2B и E4B в Gemma 4?

E — «Effective» (эффективный). E2B ведёт себя как плотная 2-миллиардная модель; E4B соответствует 4 миллиардам. Оба генерируются из одних весов Matformer — устройство выбирает эффективный размер, подходящий под бюджет RAM.

Почему архитектура PLE важна для использования на устройстве?

GPU смартфонов среднего класса ограничены буфером 128 МБ. Монолитные таблицы эмбеддингов современных LLM уже превышают этот лимит. PLE распределяет эмбеддинги по слоям, гарантируя, что ни один тензор не выходит за предел. Модель работает на GPU без отката на CPU.

Можно ли уже сейчас использовать Gemma 4 на смартфоне?

Да. Gist&Chat — бесплатное Android-приложение с Gemma 4 E2B. После одной загрузки работает полностью на смартфоне для приватного чата и резюмирования. Вариант E4B появится в уровне Pro для флагманских смартфонов.

Как Gemma 4 E2B сравнивается с Phi, Qwen, Llama 3.2 и другими?

На бумаге числа параметров похожи, но у большинства других моделей 1–2Б монолитные таблицы эмбеддингов, не загружаемые на смартфон. Архитектура PLE Gemma 4 — сейчас наиболее надёжный способ запустить настоящую 2Б-модель на GPU смартфона среднего класса.


Другие статьи на gist-ai.net: Что такое ИИ на устройстве по-настоящему (и почему он работает), Офлайн-альтернатива ChatGPT — реальные варианты в 2026 году, ИИ-чатбот, работающий в режиме авиа, Как пересказать видео с YouTube с помощью ИИ, Пересказ статей, PDF и фото текста офлайн, Практика языков с ИИ в кармане, Бесплатные инструменты для авторов — без регистрации.

Сделано в тихие моменты между всем остальным. Если было полезно — ☕ Купить мне кофе
Gist&Chat
Gist&Chat App Gemma 4 E2B, на устройстве Бесплатно в Google Play