Что такое «малая языковая модель» на самом деле
Большие языковые модели (LLM) — это то, что работает за ChatGPT и подобными сервисами: сотни миллиардов параметров, живущих в стойках GPU в дата-центрах. Малые языковые модели (SLM) сжимают ту же идею до размера, способного работать на портативных устройствах — ноутбуке, смартфоне, автомобильном блоке, роботе. На практике «малая» означает несколько миллиардов параметров или меньше, а веса модели занимают гигабайты, а не терабайты.
Почему SLM важны? По одной причине: где они работают. Модель, умещающаяся в смартфоне, может быть приватной (ничего не отправляется), бесплатной за каждое сообщение (без серверных расходов) и офлайн (без сети). Этих трёх свойств нет у облачного ИИ — независимо от его размера. Единственный вопрос — достаточно ли хорош SLM для задачи — и для всё большего числа задач ответ становится «да».
Почему ИИ на устройстве был почти невозможен ещё недавно
Мечта о запуске настоящей языковой модели на смартфоне упиралась сразу в три стены:
- Память. Веса современных LLM велики. На смартфоне вы конкурируете с операционной системой, браузером, только что закрытой игрой и механизмом low-memory killer, который ищет, что выгрузить. Модель, едва вмещающаяся в смартфон, — это модель, которая умрёт при первом уведомлении.
- Вычислительная мощность. Инференс трансформера — это цепочка умножений матриц. GPU смартфона с этим удивительно хорошо справляется — но только если тензоры модели вписываются в ограничения буфера, и если программный стек (LiteRT, MediaPipe, MLC, llama.cpp mobile) действительно добирается до GPU.
- Батарея и тепло. Чипы смартфонов способны на короткие всплески максимальной мощности, но длительная нагрузка превращается в тепло, а тепло — в тепловое дросселирование. Модель, отвечающая за 2 секунды на первое сообщение и за 20 секунд на десятое, — это демо, а не продукт.
Каждая предыдущая попытка «малых моделей на смартфоне» проваливалась на одном из этих трёх пунктов. Gemma 4 — первое семейство, решившее все три одновременно, — и причина тому два архитектурных решения, которые стоит понять.
Обзор семейства Gemma
Модели Gemma от Google — это родственники открытых весовых версий Gemini: меньше по размеру, выпущены для запуска кем угодно, но созданы с использованием знаний от обучения более крупных моделей. Линия происхождения:
- Gemma 1 и 2 — отличные модели с открытыми весами, но по сути уменьшенные версии стандартного трансформера. Хорошо работали на мощных ноутбуках, плохо — на смартфонах.
- Gemma 3 — добавление зрения, улучшенная многоязычность, по-прежнему стандартная архитектура.
- Gemma 3n — версия с упором на мобильные. Представила Per-Layer Embedding (PLE) и вложенный дизайн параметров matformer, создав номенклатуру «E2B / E4B».
- Gemma 4 — основная линия с акцентом на устройства. Наследует PLE и matformer, добавляет лучшее следование инструкциям, зрение, многоязычную производительность и варианты для чата (E2B-it, E4B-it).
Главное в Gemma 4 — не показатели бенчмарков. Архитектура проектировалась в обратном направлении: «должна комфортно работать на смартфоне среднего класса» — а не «должна обогнать GPT-4 на бумаге».
PLE: как уместить 2Б параметров в память смартфона
Существует конкретное ограничение, о котором большинство людей не слышали. Многие популярные Android-смартфоны (например, Samsung Galaxy S23 Ultra) предоставляют лишь 128 МБ на байндинг для буферов хранилища WebGPU. Это максимальный размер одного тензора, который принимает GPU-драйвер. Превысить — и драйвер отклонит байндинг; модель будет молча выдавать мусор или откатится на CPU.
В стандартном трансформере наибольший отдельный тензор — это таблица эмбеддингов: размер словаря × скрытая размерность. В современных многоязычных моделях эта таблица может занимать 150–260 МБ даже после квантизации INT8. Иными словами: многие реальные смартфоны просто не могут загрузить таблицу эмбеддингов. Модель не запускается на GPU. Откат на CPU работает, но медленнее в 10–20 раз.
Per-Layer Embedding — ответ Gemma 4. Вместо одной огромной таблицы эмбеддинги распределяются по слоям, удерживая каждый тензор намного ниже лимита 128 МБ. Общее число параметров схожее, но форма другая — а именно форма определяет, работает ли модель на реальном железе.
Matformer: что на самом деле значат E2B и E4B
E в E2B и E4B — это Effective (эффективный). E2B — модель, ведущая себя как плотная 2-миллиардная на важных задачах; E4B соответствует 4 миллиардам. Но внутри обе происходят из одних и тех же весов.
Механизм называется matformer — представьте нейронную версию матрёшки. В процессе обучения модель оптимизируется так, что параметры образуют вложенную иерархию: можно нарезать модель на разных глубинах и получить меньшие субмодели, которые всё ещё работают согласованно. Из одного мастер-набора весов Google нарезает E2B для смартфонов с меньшим объёмом RAM и E4B — для тех, где его больше.
Gemma 4 vs. другие малые модели
Пространство до 2Б параметров более конкурентно, чем кажется. Взглянем честно, сосредоточившись на практическом вопросе: работает ли на GPU Android среднего класса?
| Модель | Параметры | Размер эмбеддинга (INT8) | Вписывается в буфер 128 МБ? |
|---|---|---|---|
| Qwen3 0.6B | 0,6Б | ≈ 155 МБ | ✕ Откат на CPU |
| Gemma 3 1B | 1Б | ≈ 151 МБ (даже в INT4) | ✕ Откат на CPU |
| Llama 3.2 1B | 1Б | ≈ 262 МБ | ✕ Откат на CPU |
| Qwen3 1.7B | 1,7Б | ≈ 311 МБ | ✕ Откат на CPU |
| IBM Granite 4.0 350M | 0,35Б | ≈ 102 МБ | ✓ (малый словарь, слабая многоязычность) |
| Gemma 4 E2B (PLE) | Эффективно 2Б | Распределено по слоям | ✓ Полный GPU |
| Gemma 4 E4B (PLE) | Эффективно 4Б | Распределено по слоям | ✓ Полный GPU (при достаточном RAM) |
Где попробовать Gemma 4 сегодня
На смартфоне: Gist&Chat (E2B, бесплатно)
Gist&Chat — бесплатное Android-приложение с встроенным Gemma 4 E2B. При первом запуске вы скачиваете модель по Wi-Fi — один раз, около 2,6 ГБ — и затем ИИ работает полностью на вашем смартфоне. Что можно делать:
- Приватный чат — голосом или текстом, память между сессиями, работает в режиме авиа. Безлимитно и бесплатно — считает ваш смартфон.
- Резюме — вставьте ссылку YouTube, URL статьи или PDF / DOCX / фото текста, получите главное и задайте вопросы.
- 11 языков — включая те, на которых вы, скорее всего, будете практиковаться.
E4B в Pro (скоро)
Более крупный вариант Gemma 4 E4B появится в уровне Pro Gist&Chat. E4B удваивает эффективные параметры — заметно лучше в рассуждениях, Q&A с длинным контекстом, задачах, близких к программированию — но для комфортной работы требует смартфона с достаточным RAM.
На ноутбуке или десктопе
Хотите попробовать на более крупной машине? Веса Gemma 4 от Google доступны в обычной экосистеме открытых моделей — Hugging Face, Ollama, LM Studio, Jan, GPT4All. Сравнение всех настольных вариантов с мобильными — в статье Офлайн-альтернатива ChatGPT — реальные варианты в 2026 году.
Честные ограничения
Гайды, которые пропускают этот раздел, — пресс-релизы. Что Gemma 4 E2B не тянет:
- Передовые рассуждения. Эффективная 2Б-модель — не 200-миллиардная облачная. Для математических выводов аспирантского уровня или синтеза оригинальных исследований облако по-прежнему выигрывает.
- Актуальные знания. Веса — это снимок обучающих данных. Gemma 4 не знает, что произошло вчера — для этого нужен доступ к вебу.
- Очень длинный контекст на смартфонах с малым RAM. Модель обрабатывает длинные входы, но KV-кэш растёт вместе с длиной контекста. На смартфоне с 6 ГБ RAM память может закончиться раньше лимита контекста модели.
- Иногда странные ответы. Компактные модели по-прежнему иногда галлюцинируют, путают цифры, зацикливаются. Проверяйте важное; обращайтесь с ними как с умным другом в рассеянный полдень: часто правы, но значимые вещи стоит перепроверить.
Попробуйте Gemma 4 бесплатно на смартфоне
Gist&Chat несёт Gemma 4 E2B — приватный ИИ-чат и резюмирование YouTube, статей и PDF на 11 языках. Более крупный вариант E4B появится в Pro.
- Gemma 4 E2B, на устройстве — полный GPU-инференс на современных Android
- Приватный чат, безлимитно и бесплатно — без аккаунта, без оплаты
- Резюме с дополнительными вопросами — видео, статьи, PDF, фото текста (бесплатно для начала)
- 11 языков — интерфейс и общение
- E4B в Pro, скоро — более крупная эффективная модель для смартфонов с достаточным RAM
Бесплатно · Один раз скачать модель по Wi-Fi, около 2,6 ГБ · Ни байта вашего чата не покидает смартфон — политика конфиденциальности
Часто задаваемые вопросы
Что такое Gemma 4 и чем он отличается от предыдущих моделей Gemma?
Gemma 4 — семейство компактных моделей Google с акцентом на устройства. В отличие от Gemma 1, 2 и 3, он использует архитектуру PLE из Gemma 3n. Распределяет эмбеддинги по слоям, удерживая каждый тензор в пределах памяти GPU смартфона.
Что означают E2B и E4B в Gemma 4?
E — «Effective» (эффективный). E2B ведёт себя как плотная 2-миллиардная модель; E4B соответствует 4 миллиардам. Оба генерируются из одних весов Matformer — устройство выбирает эффективный размер, подходящий под бюджет RAM.
Почему архитектура PLE важна для использования на устройстве?
GPU смартфонов среднего класса ограничены буфером 128 МБ. Монолитные таблицы эмбеддингов современных LLM уже превышают этот лимит. PLE распределяет эмбеддинги по слоям, гарантируя, что ни один тензор не выходит за предел. Модель работает на GPU без отката на CPU.
Можно ли уже сейчас использовать Gemma 4 на смартфоне?
Да. Gist&Chat — бесплатное Android-приложение с Gemma 4 E2B. После одной загрузки работает полностью на смартфоне для приватного чата и резюмирования. Вариант E4B появится в уровне Pro для флагманских смартфонов.
Как Gemma 4 E2B сравнивается с Phi, Qwen, Llama 3.2 и другими?
На бумаге числа параметров похожи, но у большинства других моделей 1–2Б монолитные таблицы эмбеддингов, не загружаемые на смартфон. Архитектура PLE Gemma 4 — сейчас наиболее надёжный способ запустить настоящую 2Б-модель на GPU смартфона среднего класса.
Другие статьи на gist-ai.net: Что такое ИИ на устройстве по-настоящему (и почему он работает), Офлайн-альтернатива ChatGPT — реальные варианты в 2026 году, ИИ-чатбот, работающий в режиме авиа, Как пересказать видео с YouTube с помощью ИИ, Пересказ статей, PDF и фото текста офлайн, Практика языков с ИИ в кармане, Бесплатные инструменты для авторов — без регистрации.