深度 · 小语言模型

设备端小语言模型 —— 以及 Gemma 4 E2B / E4B 为什么改写了地图

AI 里现在最有意思的事,不是最大的模型,是那个刚刚好够用的最小模型。就在过去这一年的某个时刻,"小语言模型"不再意味着"可爱的 demo",而开始意味着"你手机 App 里那个模型,此刻,正在做真的活"。这是一份关于什么变了、为什么 Google 的 Gemma 4 家族是这场变化的中心、以及今天怎么真的把它跑起来的直白指南。

"小语言模型"究竟指什么

大语言模型(LLM)是驱动 ChatGPT 及其同类的那种东西 —— 数千亿参数,住在数据中心成排的 GPU 上。小语言模型(SLM)是同一个底层想法,缩到一个你能拿在手里的地方跑:一台笔电、一部手机、一辆车的中控、一个机器人。实际上"小"通常意味着 几十亿参数或更少,模型权重是一份体量以低 GB 计、而不是 TB 计的文件。

SLM 之所以要紧,只有一个原因:它跑在哪儿。装得进手机的模型可以是私密的(什么都不上传)、每条消息零成本(没有服务器账单)、离线可用(不需要网络)。这三条性质在云端 AI 里、任何尺寸下都不存在。剩下唯一的问题是:这个小模型对你的任务是不是够好用 —— 而对于一份越来越长的任务清单,答案终于是"是"。

AI 里现在最有意思的数字,不是一个 benchmark 分数。是那个正好能跨过你实际要完成的活的门槛的、最小的模型。

为什么设备端 AI 直到最近都几乎不可能

在手机上跑一个真的语言模型的梦想,一次撞上了三堵墙:

过去每一次"手机上的小模型"的故事都在这三堵墙里的某一堵前面碎掉。Gemma 4 是第一个同时清掉三堵墙的家族 —— 而它能清掉,是因为两个值得知道的架构选择。

Gemma 家族,简史

Google 的 Gemma 模型是 Gemini 的开源权重亲戚 —— 更小、对任何人开放,但是带着训练大模型时积累下来的经验做出来的。血脉:

Gemma 1 标准 transformer 笔电优先 Gemma 2 更大,但仍是 monolithic Gemma 3 + 视觉 + 多语言 Gemma 3n PLE + matformer E2B / E4B 命名 4 Gemma 4 设备端优先 承袭 PLE 同一条开源权重血脉。转向手机优先的拐点是右边两个高亮的模型。
家族的转弯点。PLE 与 matformer 在 Gemma 3n 引入;Gemma 4 是"整条主线都为这个世界设计"之后的样子。

关于 Gemma 4 真正重要的不是它的 benchmark 分数。而是这个架构是从"必须在中端手机上跑得好"倒推出来的,不是从"必须在纸面上超过 GPT-4"顺推出来的。

PLE:让 2B 参数塞进手机 GPU 的那一招

这里有一个具体到大部分人从没听过的约束。很多流行的 Android 手机 —— 比如 Samsung Galaxy S23 Ultra —— 对外暴露的 WebGPU 存储缓冲区最大是 每 binding 128 MB。这是 GPU 驱动能接受的单个张量大小上限。超过它,驱动就会拒绝这个 binding,模型静默输出乱码或者掉回 CPU。

在一个标准 transformer 里,最大的单个张量就是 embedding 表:vocabulary size × hidden dimension。对于一个现代多语言模型,光这张表在 INT8 量化后也能是 150–260 MB。换句话说:在一大批真实手机上,embedding 表根本加载不上,模型没法跑在 GPU 上。CPU fallback 能跑,但慢 10–20 倍 —— 一段系统提示词的 prefill 从 1 秒变成 20 秒。

Per-Layer Embedding 是 Gemma 4 的答案。不是一张巨大的 embedding 表,而是把 embedding 按层拆开,每一个张量都舒服地在 128 MB 上限之下。整体参数量差不多,但形状不一样 —— 而在真实硬件上,决定"能不能跑"的是形状。

为什么模型的"形状"要紧 标准 transformer 一张巨大的 embedding 表 vocab × hidden ≈ 155 MB ✕ 超过 128 MB GPU 缓冲上限 Gemma 4(PLE) embedding 按层拆开 L1 L2 L3 L4 L5 L6 L7 L8 L9 ✓ 每个张量都远低于 128 MB 能跑在手机 GPU 上吗? 标准 SLM(Qwen 0.6B、Llama 3.2 1B、Gemma 3 1B):不能 —— CPU fallback,慢 10–20 倍 Gemma 4 E2B / E4B(PLE):能 —— 完整 GPU 推理
同样的参数量,不同的形状。Gemma 4 能跑在别的小模型跑不了的地方,靠的是张量的排布,不是模型的大小。

Matformer:E2B 与 E4B 究竟是什么

E2BE4B 里的 EEffective(有效)。E2B 模型在要紧的任务上的行为可比一个 2B 参数的稠密模型;E4B 可比一个 4B 稠密模型。但底层,它们出自同一套权重。

这个机制叫做 matformer —— 你可以把它想成俄罗斯套娃,但用在神经网络上。训练时,模型被优化成参数形成一个嵌套层级:你可以在不同深度和宽度上切模型,得到一个仍然行为连贯的更小的子模型。从一套主权重出发,Google 可以为内存更紧的手机切出 E2B,为空间更大的手机切出 E4B。两者共享训练、都享受同一套指令微调的收益;你不是在两个独立产品之间选,你是在同一个模型的连续区间上选你的设备所在的位置。

Matformer:一次训练,两个有效尺寸 主权重 端到端训练 嵌套层级 E2B ⊂ E4B 推理时切片 E2B 有效 ~2B E4B 有效 ~4B (包含 E2B) 哪一片被加载? 📱 中端手机 → E2B 📱 更多 RAM / 旗舰 → E4B 💻 笔电 → 任意 你不是在两个产品里选一个。你是在同一个模型上选你的设备所在的位置。
俄罗斯套娃,但用在神经网络上。更小的模型住在更大的模型里;设备决定伸手伸到多深。

Gemma 4 跟其他小模型比起来怎么样

2B 及以下的区间比多数人以为的更拥挤。这里是短名单的诚实盘点,把实际的 能在中端 Android GPU 上跑吗? 放在最前面。

模型参数Embedding 大小(INT8)塞得进 128 MB 缓冲?
Qwen3 0.6B0.6B≈ 155 MB✕ CPU fallback
Gemma 3 1B1B≈ 151 MB(即使 INT4)✕ CPU fallback
Llama 3.2 1B1B≈ 262 MB✕ CPU fallback
Qwen3 1.7B1.7B≈ 311 MB✕ CPU fallback
IBM Granite 4.0 350M0.35B≈ 102 MB✓(词表小、多语言弱)
Gemma 4 E2B(PLE)有效 2B按层拆分✓ 完整 GPU
Gemma 4 E4B(PLE)有效 4B按层拆分✓ 完整 GPU(RAM 够的话)

这张表在说的故事:参数量是人们爱盯的一个代理指标,但在真实手机上决定性因素是最大的单个张量会不会超过 GPU 单缓冲上限。对今天的 Android 生态来说,赢的是 PLE 这个架构。

CPU fallback 到底让你付出什么 同一段约 3700 字符系统提示词的 prefill 时间,同一部手机(Snapdragon 8 Gen 2) 非 PLE 模型,CPU fallback > 20 秒 Gemma 4(PLE),完整 GPU ≈ 1 秒 0秒 10秒 20秒+
1 秒是对话。20 秒是 bug 报告。同一部手机、同一段提示词、不同的架构 —— 就是全部差距。

今天你可以在哪里试 Gemma 4

在你的手机上:Gist&Chat(E2B,免费)

Gist&Chat 是一款围绕 Gemma 4 E2B 构建的免费 Android App。首次启动时,它在 Wi-Fi 下下载模型 —— 一次性约 2.6 GB —— 之后 AI 就完全跑在你的手机上。你会得到:

如果你想要"为什么要设备端"更简短的版本,那是另一篇。如果你想要 Gemma 4 相关的具体版本,就是这一篇 —— 而且它此刻正在你旁边跑着这个模型的时候你正好在读它。

E4B 上 Pro(即将)

更大的 Gemma 4 E4B 变体即将登陆 Gist&Chat 的 Pro 版。E4B 把有效参数翻倍 —— 在推理、长上下文问答、代码相关任务上明显更好 —— 但需要 RAM 更大的手机才能跑得顺。Pro 用户可以选合适自己硬件的模型档位;免费用户继续跑 E2B。

在笔电或台式机上

更喜欢在大一点的机器上折腾?Google 的 Gemma 4 权重通过常见的开源模型生态可用 —— Hugging Face、Ollama、LM Studio、Jan、GPT4All 都行。整个桌面货架跟移动端的画面对比,我们在2026 年真正能用的离线 ChatGPT 替代方案里做过。

诚实的边界

跳过这一节的指南是新闻稿。Gemma 4 E2B 不会做到的事:

你换到的是让设备端 AI 一开始就值得在意的那三条性质:你的话不会走远,没有计费器,而且手机不需要连接任何东西。

在你的手机上免费试 Gemma 4

Gist&Chat 开箱预装 Gemma 4 E2B —— 私密 AI 聊天 + YouTube、文章、PDF 摘要,11 种语言。更大的 E4B 变体即将登陆 Pro 版。

▶ 在 Google Play 免费获取 Gist&Chat

免费下载 · 一次性约 2.6 GB 模型在 Wi-Fi 下下载 · 你的聊天一个字节都不离开手机 —— 隐私政策

常见问题

什么是 Gemma 4?它跟之前的 Gemma 有什么不同?

Gemma 4 是 Google 的设备端优先小模型家族。跟 Gemma 1、2、3 —— 本质上是同一个大 transformer 的缩小版 —— 不同,Gemma 4 承袭自 Gemma 3n 的 Per-Layer Embedding(PLE)架构:不是一张巨大的 embedding 表,而是把 embedding 按层拆开,让每一个张量都小到能塞进手机 GPU 的紧内存上限里。

Gemma 4 里的 E2B 和 E4B 是什么意思?

E 是 Effective(有效)的意思。E2B 的行为可比一个 2B 参数的稠密模型,E4B 可比一个 4B 稠密模型。底层它们从同一套 matformer 权重里切出来(俄罗斯套娃式的嵌套参数设计),设备可以按自己的 RAM 和散热选一个合适的有效大小。

PLE 架构对设备端为什么重要?

中端手机 GPU 有硬性的单缓冲区内存上限 —— 比如 Snapdragon 8 Gen 2 的手机,每个 WebGPU 存储缓冲区只有 128 MB。多数现代 LLM 里一整张单块 embedding 表(vocab size × hidden size)就已经超过这个数。PLE 把 embedding 按层拆开,任何一个张量都不会溢出上限;模型就能跑在 GPU 上,而不是掉回慢得多的 CPU 推理。

今天我能在自己的手机上跑 Gemma 4 吗?

能。Gist&Chat 是一款免费 Android App,开箱预装 Gemma 4 E2B:一次性下载模型,之后就完全在你的手机上跑私密聊天,以及摘要 YouTube 视频、文章和 PDF。更大的 E4B 变体即将作为 Pro 版选项加入,供 RAM 够大能舒服跑它的高端机。

Gemma 4 E2B 跟 Phi、Qwen、Llama 3.2 这些小模型相比怎么样?

纸面参数量看起来差不多。但实际上,多数其他 1–2B 模型仍然带着一张大 monolithic embedding 表,在很多移动 GPU 上加载失败,被迫掉到慢得多的 CPU 后端。Gemma 4 的 PLE 架构是目前把一个 2B 级模型真正跑在中端手机 GPU 上最靠谱的方式,把延迟从难受变成对话感。


gist-ai.net 上更多阅读:设备端 AI 到底是什么(以及它为什么可行)2026 年真正能用的离线 ChatGPT 替代方案在飞行模式下也能用的 AI 聊天如何用 AI 总结任意 YouTube 视频离线总结文章、PDF 和文字照片用口袋里的 AI 练习语言,以及YouTube 上 8 个最好的播客 —— 永远无需注册。

在其他所有事之间的间隙里,安静地做出来。如果帮到了你 —— ☕ 请我喝杯咖啡
Gist&Chat
Gist&Chat App Gemma 4 E2B,设备端 Google Play 免费