「小型語言模型」究竟是什麼
大型語言模型(LLM)是驅動 ChatGPT 等服務的東西——數千億個參數存在於資料中心的 GPU 機架上。小型語言模型(SLM)將同樣的基本概念縮小到可以在手持裝置(筆電、智慧型手機、車載系統、機器人)上執行的規模。實際上,「小型」意味著數十億個參數以下,模型權重是幾個 GB 的檔案,而非幾個 TB。
SLM 為什麼重要?只有一個原因:在哪裡執行。能放進手機的模型可以是私密的(不傳送任何資料)、每則訊息免費(無伺服器成本)、離線可用(不需網路)。這三種特性在任何規模的雲端 AI 上都不存在。唯一的問題是 SLM 是否足夠好用——而對越來越多的任務而言,答案正逐漸變成「是」。
為何裝置端 AI 直到最近仍幾乎不可能
在智慧型手機上執行真正語言模型的夢想,同時撞上了三道牆:
- 記憶體。 現代 LLM 的權重很大。在手機上,你得跟作業系統、瀏覽器、剛剛關掉的遊戲,以及尋找可清除對象的低記憶體管理機制競爭。勉強放進手機的模型,是第一則通知到來就會被殺掉的模型。
- 運算能力。 Transformer 推論是一連串的矩陣乘法。手機 GPU 在這方面出乎意料地擅長——但前提是模型的張量符合緩衝區限制,且軟體堆疊(LiteRT、MediaPipe、MLC、llama.cpp mobile)確實能觸及 GPU。
- 電池與散熱。 手機晶片能短暫全力輸出,但持續負載會變成熱量,熱量會變成熱節流。第一則訊息 2 秒回應、第十則訊息 20 秒回應的模型是展示品,不是產品。
之前每一次「在手機上跑小型模型」的嘗試,都在這三點其中之一上栽了跟頭。Gemma 4 是第一個同時解決三者的家族——原因在於兩個值得了解的架構選擇。
Gemma 家族概覽
Google 的 Gemma 模型是 Gemini 開放權重版本的親戚——規模更小、公開讓任何人都能執行,但融合了訓練更大模型時獲得的洞察。家族譜系:
- Gemma 1 和 2 — 優秀的開放權重模型,但基本上是標準 Transformer 的縮小版。在高性能筆電上運作良好,在手機上則吃力。
- Gemma 3 — 加入視覺功能、改善多語言支援,架構仍是標準形式。
- Gemma 3n — 行動裝置優先版本。引入了 Per-Layer Embedding(PLE) 和 matformer 巢狀參數設計,創造了「E2B / E4B」命名方式。
- Gemma 4 — 以裝置為優先的主線版本。繼承 PLE 和 matformer,並加入更好的指令遵循、視覺、多語言性能,以及即用型聊天版本(E2B-it、E4B-it)。
Gemma 4 最關鍵的不是基準測試分數,而是架構從「必須在中階手機上舒適執行」這個反方向設計出來——而不是「必須在紙面上擊敗 GPT-4」。
PLE:把 2B 參數塞進手機記憶體的關鍵
有一個大多數人從未聽說過的具體限制。許多熱門 Android 手機(例如三星 Galaxy S23 Ultra)的 WebGPU 儲存緩衝區每個綁定只有 128 MB。這是 GPU 驅動程式接受的單一張量大小上限。超過這個值,驅動程式就會拒絕綁定;模型要麼靜默產出垃圾,要麼回退到 CPU。
在標準 Transformer 中,最大的單一張量是 Embedding 表:詞彙量 × 隱藏維度。在現代多語言模型中,這張表即使在 INT8 量化後也可能達到 150–260 MB。換言之:許多真實手機根本無法載入 Embedding 表,模型無法在 GPU 上執行。回退到 CPU 雖然可以運作,但慢了 10–20 倍。
Per-Layer Embedding 是 Gemma 4 的解答。它不使用一張龐大的 Embedding 表,而是將 Embedding 分散到各層,讓每個張量都能輕鬆保持在 128 MB 限制以下。總參數數相近,但形狀不同——而形狀決定了模型是否能在真實硬體上運作。
Matformer:E2B 和 E4B 真正的意思
E2B 和 E4B 的 E 代表有效(Effective)。E2B 在重要任務上表現相當於 20 億參數密集模型;E4B 相當於 40 億。但在內部,兩者都來自相同的權重。
這個機制叫做 matformer——想像一個神經網路版的俄羅斯套娃。訓練過程中,模型被最佳化成讓參數形成巢狀的層次結構:在不同深度和寬度切割模型,仍能得到可以一致運作的較小子模型。從一組主要權重,Google 可以為 RAM 較少的手機切出 E2B,為 RAM 更充裕的手機切出 E4B。
Gemma 4 與其他小型模型的比較
2B 以下的空間比多數人想像的更擁擠。讓我們以一個實際問題為核心誠實地看:能在中階 Android GPU 上執行嗎?
| 模型 | 參數 | Embedding 大小(INT8) | 符合 128 MB 緩衝區? |
|---|---|---|---|
| Qwen3 0.6B | 0.6B | ≈ 155 MB | ✕ 回退 CPU |
| Gemma 3 1B | 1B | ≈ 151 MB(INT4 也是) | ✕ 回退 CPU |
| Llama 3.2 1B | 1B | ≈ 262 MB | ✕ 回退 CPU |
| Qwen3 1.7B | 1.7B | ≈ 311 MB | ✕ 回退 CPU |
| IBM Granite 4.0 350M | 0.35B | ≈ 102 MB | ✓(詞彙小,多語言較弱) |
| Gemma 4 E2B(PLE) | 有效 2B | 按層分散 | ✓ 完整 GPU |
| Gemma 4 E4B(PLE) | 有效 4B | 按層分散 | ✓ 完整 GPU(RAM 充足時) |
今天在哪裡試用 Gemma 4
在手機上:Gist&Chat(E2B,免費)
Gist&Chat 是一款內建 Gemma 4 E2B 的免費 Android 應用程式。首次啟動時透過 Wi-Fi 下載模型——只需一次,約 2.6 GB——之後 AI 就完全在您的手機上執行。可以做到:
- 私人聊天 — 語音或文字、跨對話記憶、通過飛航模式測試。由你的手機運算,無限制、免費。
- 摘要 — 貼上 YouTube 連結、文章網址或 PDF / DOCX / 文字照片,取得重點並追問問題。
- 11 種語言 — 包含你很可能會練習的語言。
Pro 版的 E4B(即將推出)
更大的 Gemma 4 E4B 版本即將在 Gist&Chat 的 Pro 方案推出。E4B 的有效參數翻倍——在推理、長上下文問答和程式碼相關任務上明顯更優秀——但需要 RAM 充足的手機才能舒適執行。
在筆電或桌機上
想在更大的裝置上試試?Google 的 Gemma 4 權重可在一般的開放模型生態系中取得——Hugging Face、Ollama、LM Studio、Jan、GPT4All。將所有桌機選項與行動裝置比較的完整分析,請見離線 ChatGPT 替代方案 — 2026 年的真實選項。
誠實的限制
略過這一節的指南是公關稿。Gemma 4 E2B 追不上的地方:
- 頂尖推理能力。 有效 2B 模型不是 2,000 億參數的雲端模型。對於研究所等級的數學推導或原創研究合成,雲端仍然勝出。
- 最新知識。 權重是訓練資料的快照。Gemma 4 不知道昨天發生了什麼——那需要有網路存取的工具。
- 在小 RAM 手機上的超長上下文。 模型能處理長輸入,但 KV 快取會隨上下文長度增長。6 GB RAM 的手機可能在達到模型上下文限制之前就先耗盡記憶體。
- 偶爾奇怪的輸出。 精簡模型仍然會偶爾產生幻覺、混淆數字或重複。重要的事要查證;把它當作心不在焉的聰明朋友:常常是對的,但重要的事值得再確認。
在手機上免費試用 Gemma 4
Gist&Chat 搭載 Gemma 4 E2B——私人 AI 聊天,以及 YouTube、文章、PDF 摘要,支援 11 種語言。更大的 E4B 版本即將在 Pro 推出。
- Gemma 4 E2B,裝置端 — 在現代 Android 上完整 GPU 推論
- 私人聊天,無限制免費 — 不需帳號,不收費
- 附追問功能的摘要 — 影片、文章、PDF、文字照片(一開始免費)
- 11 種語言 — 介面與對話
- Pro 版 E4B,即將推出 — 為 RAM 充足手機提供更大有效模型
免費下載 · 透過 Wi-Fi 一次下載約 2.6 GB 模型 · 聊天內容的每一個位元組都不會離開你的手機 — 隱私政策
常見問題
Gemma 4 是什麼?和之前的 Gemma 模型有什麼不同?
Gemma 4 是 Google 以裝置為優先的小型模型家族。與 Gemma 1、2、3 不同,它使用了 Gemma 3n 引入的 PLE 架構。將 Embedding 分散到各層,讓每個張量都保持在手機 GPU 記憶體限制之內。
Gemma 4 的 E2B 和 E4B 是什麼意思?
E 代表「有效(Effective)」。E2B 的表現相當於 20 億參數密集模型,E4B 相當於 40 億。兩者都從相同的 Matformer 權重產生,裝置可以選擇符合 RAM 預算的有效尺寸。
PLE 架構為何對裝置端應用至關重要?
中階手機 GPU 的緩衝區限制是 128 MB。現代 LLM 的單體式 Embedding 表已超過這個限制。PLE 將 Embedding 分散到各層,確保任何張量都不超過限制。模型在 GPU 上執行,無需回退到 CPU。
現在就能在手機上使用 Gemma 4 嗎?
可以。Gist&Chat 是搭載 Gemma 4 E2B 的免費 Android 應用程式。下載一次後,完全在手機上執行,可用於私人聊天和摘要。E4B 版本即將在旗艦手機的 Pro 方案推出。
Gemma 4 E2B 和 Phi、Qwen、Llama 3.2 等其他模型相比如何?
規格上參數數量類似,但其他大多數 1–2B 模型都有無法在手機上載入的單體式 Embedding 表。Gemma 4 的 PLE 架構目前是在中階手機 GPU 上執行 2B 級模型最可靠的方式。
gist-ai.net 其他文章:裝置端 AI 究竟是什麼(為何能運作)、離線 ChatGPT 替代方案——2026 年的真實選項、在飛航模式下也能用的 AI 聊天機器人、用 AI 摘要 YouTube 影片的方法、離線摘要文章、PDF 和文字照片、用口袋裡的 AI 練習語言、創作者免費工具 — 無需註冊。