"小语言模型"究竟指什么
大语言模型(LLM)是驱动 ChatGPT 及其同类的那种东西 —— 数千亿参数,住在数据中心成排的 GPU 上。小语言模型(SLM)是同一个底层想法,缩到一个你能拿在手里的地方跑:一台笔电、一部手机、一辆车的中控、一个机器人。实际上"小"通常意味着 几十亿参数或更少,模型权重是一份体量以低 GB 计、而不是 TB 计的文件。
SLM 之所以要紧,只有一个原因:它跑在哪儿。装得进手机的模型可以是私密的(什么都不上传)、每条消息零成本(没有服务器账单)、离线可用(不需要网络)。这三条性质在云端 AI 里、任何尺寸下都不存在。剩下唯一的问题是:这个小模型对你的任务是不是够好用 —— 而对于一份越来越长的任务清单,答案终于是"是"。
为什么设备端 AI 直到最近都几乎不可能
在手机上跑一个真的语言模型的梦想,一次撞上了三堵墙:
- 内存。现代 LLM 的权重很大;在手机上你还要跟操作系统、浏览器、用户刚关掉的那款游戏、以及一直在找东西驱逐的 low-memory killer 抢内存。一个"勉强能加载"的模型,就是一个用户一收到通知就死掉的模型。
- 算力。Transformer 推理是一连串矩阵乘。手机 GPU 意外地擅长这个 —— 前提是模型的张量能塞进它单缓冲区的上限,且软件栈(LiteRT、MediaPipe、MLC、llama.cpp mobile)真的调用了 GPU,而不是掉回 CPU。
- 电量与散热。手机的芯片可以短时满负荷,但持续高负载会变成热量,热量再变成降频。第一条消息 2 秒出、第十条 20 秒出的模型是个 demo,不是产品。
过去每一次"手机上的小模型"的故事都在这三堵墙里的某一堵前面碎掉。Gemma 4 是第一个同时清掉三堵墙的家族 —— 而它能清掉,是因为两个值得知道的架构选择。
Gemma 家族,简史
Google 的 Gemma 模型是 Gemini 的开源权重亲戚 —— 更小、对任何人开放,但是带着训练大模型时积累下来的经验做出来的。血脉:
- Gemma 1 与 2 —— 扎实的开源权重模型,但本质是一个标准 transformer 的小号。在一台好点的笔电上跑得动,在手机上磕磕绊绊。
- Gemma 3 —— 加了视觉、更好的多语言能力,架构仍是标准。
- Gemma 3n —— 移动优先的旁支。引入了 Per-Layer Embedding(PLE)与 matformer 嵌套参数设计,也定下了"E2B / E4B"这套命名。
- Gemma 4 —— 设备端优先的正统主线。承袭 PLE 与 matformer,加上更好的指令跟随、更好的视觉、更好的多语言表现,以及开箱可用的对话调优版本(E2B-it、E4B-it)。
关于 Gemma 4 真正重要的不是它的 benchmark 分数。而是这个架构是从"必须在中端手机上跑得好"倒推出来的,不是从"必须在纸面上超过 GPT-4"顺推出来的。
PLE:让 2B 参数塞进手机 GPU 的那一招
这里有一个具体到大部分人从没听过的约束。很多流行的 Android 手机 —— 比如 Samsung Galaxy S23 Ultra —— 对外暴露的 WebGPU 存储缓冲区最大是 每 binding 128 MB。这是 GPU 驱动能接受的单个张量大小上限。超过它,驱动就会拒绝这个 binding,模型静默输出乱码或者掉回 CPU。
在一个标准 transformer 里,最大的单个张量就是 embedding 表:vocabulary size × hidden dimension。对于一个现代多语言模型,光这张表在 INT8 量化后也能是 150–260 MB。换句话说:在一大批真实手机上,embedding 表根本加载不上,模型没法跑在 GPU 上。CPU fallback 能跑,但慢 10–20 倍 —— 一段系统提示词的 prefill 从 1 秒变成 20 秒。
Per-Layer Embedding 是 Gemma 4 的答案。不是一张巨大的 embedding 表,而是把 embedding 按层拆开,每一个张量都舒服地在 128 MB 上限之下。整体参数量差不多,但形状不一样 —— 而在真实硬件上,决定"能不能跑"的是形状。
Matformer:E2B 与 E4B 究竟是什么
E2B 与 E4B 里的 E 是 Effective(有效)。E2B 模型在要紧的任务上的行为可比一个 2B 参数的稠密模型;E4B 可比一个 4B 稠密模型。但底层,它们出自同一套权重。
这个机制叫做 matformer —— 你可以把它想成俄罗斯套娃,但用在神经网络上。训练时,模型被优化成参数形成一个嵌套层级:你可以在不同深度和宽度上切模型,得到一个仍然行为连贯的更小的子模型。从一套主权重出发,Google 可以为内存更紧的手机切出 E2B,为空间更大的手机切出 E4B。两者共享训练、都享受同一套指令微调的收益;你不是在两个独立产品之间选,你是在同一个模型的连续区间上选你的设备所在的位置。
Gemma 4 跟其他小模型比起来怎么样
2B 及以下的区间比多数人以为的更拥挤。这里是短名单的诚实盘点,把实际的 能在中端 Android GPU 上跑吗? 放在最前面。
| 模型 | 参数 | Embedding 大小(INT8) | 塞得进 128 MB 缓冲? |
|---|---|---|---|
| Qwen3 0.6B | 0.6B | ≈ 155 MB | ✕ CPU fallback |
| Gemma 3 1B | 1B | ≈ 151 MB(即使 INT4) | ✕ CPU fallback |
| Llama 3.2 1B | 1B | ≈ 262 MB | ✕ CPU fallback |
| Qwen3 1.7B | 1.7B | ≈ 311 MB | ✕ CPU fallback |
| IBM Granite 4.0 350M | 0.35B | ≈ 102 MB | ✓(词表小、多语言弱) |
| Gemma 4 E2B(PLE) | 有效 2B | 按层拆分 | ✓ 完整 GPU |
| Gemma 4 E4B(PLE) | 有效 4B | 按层拆分 | ✓ 完整 GPU(RAM 够的话) |
这张表在说的故事:参数量是人们爱盯的一个代理指标,但在真实手机上决定性因素是最大的单个张量会不会超过 GPU 单缓冲上限。对今天的 Android 生态来说,赢的是 PLE 这个架构。
今天你可以在哪里试 Gemma 4
在你的手机上:Gist&Chat(E2B,免费)
Gist&Chat 是一款围绕 Gemma 4 E2B 构建的免费 Android App。首次启动时,它在 Wi-Fi 下下载模型 —— 一次性约 2.6 GB —— 之后 AI 就完全跑在你的手机上。你会得到:
- 私密聊天 —— 语音或文字,跨会话记忆,能通过飞行模式测试。无限免费,因为计算是你的手机做的。
- 摘要 —— 粘一条 YouTube 链接、一篇文章 URL,或一份 PDF / DOCX / 文字照片,拿到要点,然后追问。
- 11 种语言 —— 包括你实际会去练习的那些。
如果你想要"为什么要设备端"更简短的版本,那是另一篇。如果你想要 Gemma 4 相关的具体版本,就是这一篇 —— 而且它此刻正在你旁边跑着这个模型的时候你正好在读它。
E4B 上 Pro(即将)
更大的 Gemma 4 E4B 变体即将登陆 Gist&Chat 的 Pro 版。E4B 把有效参数翻倍 —— 在推理、长上下文问答、代码相关任务上明显更好 —— 但需要 RAM 更大的手机才能跑得顺。Pro 用户可以选合适自己硬件的模型档位;免费用户继续跑 E2B。
在笔电或台式机上
更喜欢在大一点的机器上折腾?Google 的 Gemma 4 权重通过常见的开源模型生态可用 —— Hugging Face、Ollama、LM Studio、Jan、GPT4All 都行。整个桌面货架跟移动端的画面对比,我们在2026 年真正能用的离线 ChatGPT 替代方案里做过。
诚实的边界
跳过这一节的指南是新闻稿。Gemma 4 E2B 不会做到的事:
- 前沿推理。一个有效 2B 的模型不是一个 200B 参数的云端模型。如果你在问研究生级的数学推导、或前沿的研究综合,云端巨头仍然赢。
- 新鲜的知识。权重是训练数据的一个快照。Gemma 4 不知道昨天发生了什么;那种事你还是想要能上网的东西。
- 很长的上下文,在很小的手机上。模型能处理长输入,但 KV cache 会随上下文长度增长;在一台 6 GB RAM 的手机上,你会先撞上内存,再撞上模型的上下文上限。
- 偶尔会有奇怪输出。紧凑模型偶尔仍会幻觉、算错数字、或重复自己。把它们的回答当作"一个聪明朋友在有点分心的下午"来看:多数时候对,重要的时候值得核对。
你换到的是让设备端 AI 一开始就值得在意的那三条性质:你的话不会走远,没有计费器,而且手机不需要连接任何东西。
在你的手机上免费试 Gemma 4
Gist&Chat 开箱预装 Gemma 4 E2B —— 私密 AI 聊天 + YouTube、文章、PDF 摘要,11 种语言。更大的 E4B 变体即将登陆 Pro 版。
- Gemma 4 E2B,设备端 —— 在现代 Android 上完整 GPU 推理
- 私密聊天,无限免费 —— 无账号、无计费器
- 带追问的摘要 —— 视频、文章、PDF、文字照片(免费上手)
- 11 种语言 —— 界面与对话
- E4B 上 Pro,即将 —— 更大的有效模型,给 RAM 够的手机
免费下载 · 一次性约 2.6 GB 模型在 Wi-Fi 下下载 · 你的聊天一个字节都不离开手机 —— 隐私政策
常见问题
什么是 Gemma 4?它跟之前的 Gemma 有什么不同?
Gemma 4 是 Google 的设备端优先小模型家族。跟 Gemma 1、2、3 —— 本质上是同一个大 transformer 的缩小版 —— 不同,Gemma 4 承袭自 Gemma 3n 的 Per-Layer Embedding(PLE)架构:不是一张巨大的 embedding 表,而是把 embedding 按层拆开,让每一个张量都小到能塞进手机 GPU 的紧内存上限里。
Gemma 4 里的 E2B 和 E4B 是什么意思?
E 是 Effective(有效)的意思。E2B 的行为可比一个 2B 参数的稠密模型,E4B 可比一个 4B 稠密模型。底层它们从同一套 matformer 权重里切出来(俄罗斯套娃式的嵌套参数设计),设备可以按自己的 RAM 和散热选一个合适的有效大小。
PLE 架构对设备端为什么重要?
中端手机 GPU 有硬性的单缓冲区内存上限 —— 比如 Snapdragon 8 Gen 2 的手机,每个 WebGPU 存储缓冲区只有 128 MB。多数现代 LLM 里一整张单块 embedding 表(vocab size × hidden size)就已经超过这个数。PLE 把 embedding 按层拆开,任何一个张量都不会溢出上限;模型就能跑在 GPU 上,而不是掉回慢得多的 CPU 推理。
今天我能在自己的手机上跑 Gemma 4 吗?
能。Gist&Chat 是一款免费 Android App,开箱预装 Gemma 4 E2B:一次性下载模型,之后就完全在你的手机上跑私密聊天,以及摘要 YouTube 视频、文章和 PDF。更大的 E4B 变体即将作为 Pro 版选项加入,供 RAM 够大能舒服跑它的高端机。
Gemma 4 E2B 跟 Phi、Qwen、Llama 3.2 这些小模型相比怎么样?
纸面参数量看起来差不多。但实际上,多数其他 1–2B 模型仍然带着一张大 monolithic embedding 表,在很多移动 GPU 上加载失败,被迫掉到慢得多的 CPU 后端。Gemma 4 的 PLE 架构是目前把一个 2B 级模型真正跑在中端手机 GPU 上最靠谱的方式,把延迟从难受变成对话感。
gist-ai.net 上更多阅读:设备端 AI 到底是什么(以及它为什么可行)、2026 年真正能用的离线 ChatGPT 替代方案、在飞行模式下也能用的 AI 聊天、如何用 AI 总结任意 YouTube 视频、离线总结文章、PDF 和文字照片、用口袋里的 AI 练习语言,以及YouTube 上 8 个最好的播客 —— 永远无需注册。