深度解析 · 小型語言模型

裝置端小型語言模型 — Gemma 4 E2B 與 E4B 為何改寫局面

AI 世界裡現在最有趣的,不是最大的模型,而是夠用的最小模型。在過去某個時刻,「小型語言模型」不再意味著「可愛的展示 Demo」,而是「正在你手機上執行真實任務的模型」。我們來解釋究竟發生了什麼變化、為什麼 Google 的 Gemma 4 家族處於核心位置,以及今天就能上手的方法。

「小型語言模型」究竟是什麼

大型語言模型(LLM)是驅動 ChatGPT 等服務的東西——數千億個參數存在於資料中心的 GPU 機架上。小型語言模型(SLM)將同樣的基本概念縮小到可以在手持裝置(筆電、智慧型手機、車載系統、機器人)上執行的規模。實際上,「小型」意味著數十億個參數以下,模型權重是幾個 GB 的檔案,而非幾個 TB。

SLM 為什麼重要?只有一個原因:在哪裡執行。能放進手機的模型可以是私密的(不傳送任何資料)、每則訊息免費(無伺服器成本)、離線可用(不需網路)。這三種特性在任何規模的雲端 AI 上都不存在。唯一的問題是 SLM 是否足夠好用——而對越來越多的任務而言,答案正逐漸變成「是」。

AI 世界中現在最有趣的數字不是基準測試分數。而是能完成你所需工作的最小模型。

為何裝置端 AI 直到最近仍幾乎不可能

在智慧型手機上執行真正語言模型的夢想,同時撞上了三道牆:

之前每一次「在手機上跑小型模型」的嘗試,都在這三點其中之一上栽了跟頭。Gemma 4 是第一個同時解決三者的家族——原因在於兩個值得了解的架構選擇。

Gemma 家族概覽

Google 的 Gemma 模型是 Gemini 開放權重版本的親戚——規模更小、公開讓任何人都能執行,但融合了訓練更大模型時獲得的洞察。家族譜系:

Gemma 1 標準 Transformer 以 PC 為主 Gemma 2 更大,仍是 單體式 Gemma 3 +視覺 +多語言 Gemma 3n PLE + matformer E2B / E4B 命名 4 Gemma 4 裝置優先 繼承 PLE 相同的開放權重家族譜系。轉向行動裝置優先的轉折,發生在右側標亮的模型上。
家族轉型的節點。PLE 和 matformer 在 Gemma 3n 登場;Gemma 4 是為此而生的主線版本。

Gemma 4 最關鍵的不是基準測試分數,而是架構從「必須在中階手機上舒適執行」這個反方向設計出來——而不是「必須在紙面上擊敗 GPT-4」。

PLE:把 2B 參數塞進手機記憶體的關鍵

有一個大多數人從未聽說過的具體限制。許多熱門 Android 手機(例如三星 Galaxy S23 Ultra)的 WebGPU 儲存緩衝區每個綁定只有 128 MB。這是 GPU 驅動程式接受的單一張量大小上限。超過這個值,驅動程式就會拒絕綁定;模型要麼靜默產出垃圾,要麼回退到 CPU。

在標準 Transformer 中,最大的單一張量是 Embedding 表:詞彙量 × 隱藏維度。在現代多語言模型中,這張表即使在 INT8 量化後也可能達到 150–260 MB。換言之:許多真實手機根本無法載入 Embedding 表,模型無法在 GPU 上執行。回退到 CPU 雖然可以運作,但慢了 10–20 倍。

Per-Layer Embedding 是 Gemma 4 的解答。它不使用一張龐大的 Embedding 表,而是將 Embedding 分散到各層,讓每個張量都能輕鬆保持在 128 MB 限制以下。總參數數相近,但形狀不同——而形狀決定了模型是否能在真實硬體上運作。

為何模型的「形狀」很重要 標準 Transformer 一張龐大的 Embedding 表 詞彙 × 隱藏維度 ≈ 155 MB ✕ 超過 GPU 緩衝區 128 MB Gemma 4(PLE) Embedding 分散到各層 L1 L2 L3 L4 L5 L6 L7 L8 L9 ✓ 每個張量低於 128 MB 能在手機 GPU 上執行嗎? 標準 SLM(Qwen 0.6B、Llama 3.2 1B、Gemma 3 1B):不行——回退 CPU,慢 10–20 倍 Gemma 4 E2B / E4B(PLE):可以——完整 GPU 推論
相同的參數數,不同的形狀。Gemma 4 能在其他小型模型失敗的地方運作,原因是張量佈局,而非模型大小。

Matformer:E2B 和 E4B 真正的意思

E2BE4BE 代表有效(Effective)。E2B 在重要任務上表現相當於 20 億參數密集模型;E4B 相當於 40 億。但在內部,兩者都來自相同的權重。

這個機制叫做 matformer——想像一個神經網路版的俄羅斯套娃。訓練過程中,模型被最佳化成讓參數形成巢狀的層次結構:在不同深度和寬度切割模型,仍能得到可以一致運作的較小子模型。從一組主要權重,Google 可以為 RAM 較少的手機切出 E2B,為 RAM 更充裕的手機切出 E4B。

Matformer:訓練一次,兩種有效尺寸 主要權重 端對端訓練 巢狀層次結構 E2B ⊂ E4B 推論時切割 E2B 有效 ~20 億 E4B 有效 ~40 億 (包含 E2B) 載入哪個切片? 📱 中階手機 → E2B 📱 RAM 充裕 / 旗艦 → E4B 💻 筆電 → 兩者皆可 你不是在兩個產品之間選擇,而是在選擇裝置在同一個模型上走到哪個深度。
神經網路版俄羅斯套娃。小模型在大模型之中——裝置決定要深入到哪一層。

Gemma 4 與其他小型模型的比較

2B 以下的空間比多數人想像的更擁擠。讓我們以一個實際問題為核心誠實地看:能在中階 Android GPU 上執行嗎?

模型參數Embedding 大小(INT8)符合 128 MB 緩衝區?
Qwen3 0.6B0.6B≈ 155 MB✕ 回退 CPU
Gemma 3 1B1B≈ 151 MB(INT4 也是)✕ 回退 CPU
Llama 3.2 1B1B≈ 262 MB✕ 回退 CPU
Qwen3 1.7B1.7B≈ 311 MB✕ 回退 CPU
IBM Granite 4.0 350M0.35B≈ 102 MB✓(詞彙小,多語言較弱)
Gemma 4 E2B(PLE)有效 2B按層分散✓ 完整 GPU
Gemma 4 E4B(PLE)有效 4B按層分散✓ 完整 GPU(RAM 充足時)
回退 CPU 的實際代價 同一支手機(Snapdragon 8 Gen 2)、相同約 3,700 字元系統提示的 Prefill 時間 非 PLE 模型,回退 CPU > 20 秒 Gemma 4(PLE),完整 GPU ≈ 1 秒 0 秒 10 秒 20 秒+
1 秒是對話。20 秒是錯誤報告。相同的手機、相同的提示、不同的架構——就是這樣。

今天在哪裡試用 Gemma 4

在手機上:Gist&Chat(E2B,免費)

Gist&Chat 是一款內建 Gemma 4 E2B 的免費 Android 應用程式。首次啟動時透過 Wi-Fi 下載模型——只需一次,約 2.6 GB——之後 AI 就完全在您的手機上執行。可以做到:

Pro 版的 E4B(即將推出)

更大的 Gemma 4 E4B 版本即將在 Gist&Chat 的 Pro 方案推出。E4B 的有效參數翻倍——在推理、長上下文問答和程式碼相關任務上明顯更優秀——但需要 RAM 充足的手機才能舒適執行。

在筆電或桌機上

想在更大的裝置上試試?Google 的 Gemma 4 權重可在一般的開放模型生態系中取得——Hugging Face、Ollama、LM Studio、Jan、GPT4All。將所有桌機選項與行動裝置比較的完整分析,請見離線 ChatGPT 替代方案 — 2026 年的真實選項

誠實的限制

略過這一節的指南是公關稿。Gemma 4 E2B 追不上的地方:

在手機上免費試用 Gemma 4

Gist&Chat 搭載 Gemma 4 E2B——私人 AI 聊天,以及 YouTube、文章、PDF 摘要,支援 11 種語言。更大的 E4B 版本即將在 Pro 推出。

▶ 在 Google Play 免費下載 Gist&Chat

免費下載 · 透過 Wi-Fi 一次下載約 2.6 GB 模型 · 聊天內容的每一個位元組都不會離開你的手機 — 隱私政策

常見問題

Gemma 4 是什麼?和之前的 Gemma 模型有什麼不同?

Gemma 4 是 Google 以裝置為優先的小型模型家族。與 Gemma 1、2、3 不同,它使用了 Gemma 3n 引入的 PLE 架構。將 Embedding 分散到各層,讓每個張量都保持在手機 GPU 記憶體限制之內。

Gemma 4 的 E2B 和 E4B 是什麼意思?

E 代表「有效(Effective)」。E2B 的表現相當於 20 億參數密集模型,E4B 相當於 40 億。兩者都從相同的 Matformer 權重產生,裝置可以選擇符合 RAM 預算的有效尺寸。

PLE 架構為何對裝置端應用至關重要?

中階手機 GPU 的緩衝區限制是 128 MB。現代 LLM 的單體式 Embedding 表已超過這個限制。PLE 將 Embedding 分散到各層,確保任何張量都不超過限制。模型在 GPU 上執行,無需回退到 CPU。

現在就能在手機上使用 Gemma 4 嗎?

可以。Gist&Chat 是搭載 Gemma 4 E2B 的免費 Android 應用程式。下載一次後,完全在手機上執行,可用於私人聊天和摘要。E4B 版本即將在旗艦手機的 Pro 方案推出。

Gemma 4 E2B 和 Phi、Qwen、Llama 3.2 等其他模型相比如何?

規格上參數數量類似,但其他大多數 1–2B 模型都有無法在手機上載入的單體式 Embedding 表。Gemma 4 的 PLE 架構目前是在中階手機 GPU 上執行 2B 級模型最可靠的方式。


gist-ai.net 其他文章:裝置端 AI 究竟是什麼(為何能運作)離線 ChatGPT 替代方案——2026 年的真實選項在飛航模式下也能用的 AI 聊天機器人用 AI 摘要 YouTube 影片的方法離線摘要文章、PDF 和文字照片用口袋裡的 AI 練習語言創作者免費工具 — 無需註冊。

在所有事情之間的安靜時光裡製作。如果對你有幫助 — ☕ 資助網站維護
Gist&Chat
Gist&Chat App Gemma 4 E2B,裝置端 Google Play 免費下載