詳細解説 · 小型言語モデル

オンデバイス小型言語モデル — Gemma 4 E2BとE4Bが地図を塗り替えた理由

AI界で今最も興味深いのは最大のモデルではありません。十分に優れた最小のモデルです。去年のどこかで、「小型言語モデル」は「かわいいデモ」を意味することをやめ、「今まさにあなたのスマホのアプリで動き、本物の仕事をしているモデル」を意味し始めました。何が変わったのか、なぜGoogleのGemma 4ファミリーがその中心にいるのか、そして今日実際に試す方法をわかりやすく解説します。

「小型言語モデル」とは実際何か

大型言語モデル(LLM)はChatGPTやその仲間を動かしているもの — 数千億のパラメータがデータセンターのGPUラックに存在します。小型言語モデル(SLM)は同じ基本的なアイデアを、手で持てるデバイス(ノートPC、スマートフォン、カーヘッドユニット、ロボット)で動くサイズに縮小したものです。実際には「小型」とは数十億パラメータ以下を意味し、モデルのウェイトはテラバイトではなく数ギガバイトのファイルです。

SLMが重要な理由はただ一つ:どこで動くかです。スマホに収まるモデルはプライベート(何も送信されない)、メッセージあたり無料(サーバー代なし)、そしてオフライン(ネットワーク不要)であることができます。この3つの特性はクラウドAIには存在しません——どんなサイズでも。唯一の問題はSLMがタスクに対して十分に優れているかどうか——そして増えていくタスクリストに対して、答えはついに「はい」になりつつあります。

AI界で今最も興味深い数字はベンチマークスコアではありません。実際に必要な仕事をこなせる最小のモデルです。

なぜオンデバイスAIはつい最近まで不可能に近かったのか

スマホで本物の言語モデルを動かすという夢は、3つの壁に同時にぶつかりました:

これまでの「スマホで小型モデルを」という話は必ずこの3つのどれかで失敗しました。Gemma 4は3つすべてを同時にクリアした最初のファミリー——そしてその理由は知っておくべき2つのアーキテクチャ上の選択にあります。

Gemmaファミリーの概要

GoogleのGemmaモデルはGeminiのオープンウェイト版の親戚——より小さく、誰でも実行できるように公開されていますが、大きなモデルの訓練から得た知見を活かして作られています。系譜:

Gemma 1 標準トランスフォーマー PC向け Gemma 2 より大きく、まだ モノリシック Gemma 3 +視覚 +多言語 Gemma 3n PLE + matformer E2B / E4B命名 4 Gemma 4 デバイスファースト PLEを継承 同じオープンウェイトの系譜。スマホファーストへの転換は右のハイライトされたモデルで起きた。
ファミリーが転換した場所。PLEとmatformerはGemma 3nで登場し、Gemma 4はそのためのメインラインが設計された結果です。

Gemma 4で重要なのはベンチマークスコアではありません。アーキテクチャが「ミドルレンジスマホで快適に動かなければならない」という逆方向から設計されたことです。「紙の上でGPT-4を超えなければならない」という方向ではなく。

PLE:2Bパラメータをスマホのメモリに収めたトリック

ほとんどの人が聞いたことのない具体的な制約があります。多くの人気Androidスマホ(Samsung Galaxy S23 Ultraなど)が、WebGPUストレージバッファとしてバインディングあたり128MBしか提供しません。これがGPUドライバーが受け入れる単一テンソルのサイズ制限です。これを超えるとドライバーがバインディングを拒否し、モデルは無音でゴミを出力するかCPUにフォールバックします。

標準トランスフォーマーでは最大の単一テンソルは埋め込みテーブル:語彙サイズ × 隠れ次元です。現代の多言語モデルではこのテーブルだけでINT8量子化後でも150〜260MBになることがあります。言い換えると:実際の多くのスマホで埋め込みテーブルが読み込めません。モデルはGPUで動けません。CPUフォールバックは機能しますが10〜20倍遅くなります。

Per-Layer EmbeddingがGemma 4の答えです。巨大な埋め込みテーブル一つの代わりに、埋め込みをレイヤー間で分割することで、各テンソルが128MBの上限を快適に下回ります。全体のパラメータ数は似ていますが、形が違う——そして形こそが実際のハードウェアでモデルが動くかどうかを決定します。

モデルの「形」が重要な理由 標準トランスフォーマー 巨大な埋め込みテーブル一つ 語彙 × 隠れ次元 ≈ 155 MB ✕ GPUバッファ128MBをオーバーフロー Gemma 4 (PLE) レイヤーごとに埋め込みを分割 L1 L2 L3 L4 L5 L6 L7 L8 L9 ✓ 各テンソルが128MB以下 スマホGPUで動くか? 標準SLM (Qwen 0.6B, Llama 3.2 1B, Gemma 3 1B):不可 — CPUフォールバック、10〜20倍遅い Gemma 4 E2B / E4B (PLE):可 — 完全GPU推論
同じパラメータ数、異なる形。Gemma 4が他の小型モデルが動かない場所で動く理由はテンソルのレイアウトであり、モデルのサイズではありません。

Matformer:E2BとE4Bが実際に意味すること

E2BE4BEEffective(実効)の略です。E2Bは重要なタスクで密な20億パラメータモデルに匹敵する動作をするモデル、E4Bは40億パラメータ相当です。しかし内部では、両方とも同じウェイトから来ています。

そのメカニズムはmatformerと呼ばれます——ニューラルネットワーク版のマトリョーシカ人形を想像してください。訓練中にモデルはパラメータがネストされた階層を形成するよう最適化されます:異なる深さと幅でモデルを切り取ることができ、まだ一貫して動作する小さなサブモデルが得られます。一つのマスターウェイトセットから、Googleはメモリが少ないスマホ向けにE2Bを、余裕のあるスマホ向けにE4Bを切り出せます。

Matformer:1回の訓練、2つの実効サイズ マスターウェイト エンドツーエンドで訓練 ネスト階層 E2B ⊂ E4B 推論時に切り出す E2B 実効 ~20億 E4B 実効 ~40億 (E2Bを含む) どのスライスが読み込まれる? 📱 ミドルレンジ → E2B 📱 RAM多め / フラッグシップ → E4B 💻 ノートPC → どちらでも 2つの製品を選ぶのではない。同じモデル上のどこにデバイスが位置するかを選んでいる。
ニューラルネットワーク版のマトリョーシカ人形。小さいモデルが大きいモデルの中に入っている——デバイスがどの深さまで取るかを決めます。

Gemma 4と他の小型モデルの比較

2B以下の空間は多くの人が思うより混雑しています。現実的なミドルレンジのAndroid GPUで動くか?という問いを中心に、正直な視点からリストを見てみましょう。

モデルパラメータ埋め込みサイズ(INT8)128MBバッファに収まるか?
Qwen3 0.6B0.6B≈ 155 MB✕ CPUフォールバック
Gemma 3 1B1B≈ 151 MB(INT4でも)✕ CPUフォールバック
Llama 3.2 1B1B≈ 262 MB✕ CPUフォールバック
Qwen3 1.7B1.7B≈ 311 MB✕ CPUフォールバック
IBM Granite 4.0 350M0.35B≈ 102 MB✓(語彙小さく、多言語弱め)
Gemma 4 E2B(PLE)実効 2Bレイヤーごとに分割✓ 完全GPU
Gemma 4 E4B(PLE)実効 4Bレイヤーごとに分割✓ 完全GPU(RAM十分なら)
CPUフォールバックが実際にかかるコスト 同じスマホ(Snapdragon 8 Gen 2)で同じ約3,700文字のシステムプロンプトのプリフィル時間 非PLEモデル、CPUフォールバック > 20秒 Gemma 4 (PLE)、完全GPU ≈ 1秒 0秒 10秒 20秒+
1秒は会話。20秒はバグレポート。同じスマホ、同じプロンプト、異なるアーキテクチャ——これが全てです。

今日Gemma 4を試す場所

スマホで:Gist&Chat(E2B、無料)

Gist&ChatはGemma 4 E2Bを搭載した無料のAndroidアプリです。初回起動時にWi-Fi経由でモデルをダウンロードします——一度だけ約2.6GB——その後AIはスマホ上で完全に動作します。できること:

ProのE4B(近日公開)

より大きなGemma 4 E4BバリアントはGist&ChatのProティアで提供予定です。E4Bは実効パラメータが倍増——推論、長コンテキストQ&A、コード隣接タスクで明らかに優れています——ただし快適に動かすには十分なRAMを持つスマホが必要です。

ノートPCやデスクトップで

より大きなマシンで試したい場合は?GoogleのGemma 4ウェイトは通常のオープンモデルエコシステムで入手可能です——Hugging Face、Ollama、LM Studio、Jan、GPT4All。デスクトップの選択肢全体をモバイルと比較するのはオフラインChatGPT代替:2026年の真の選択肢で行っています。

正直な限界

このセクションを飛ばすガイドはプレスリリースです。Gemma 4 E2Bが追いつかないもの:

スマホでGemma 4を無料で試す

Gist&ChatはGemma 4 E2Bを搭載——プライベートAIチャットとYouTube、記事、PDF要約を11言語で。より大きなE4BバリアントはProで提供予定。

▶ Google PlayでGist&Chatを無料でダウンロード

無料ダウンロード · Wi-Fi経由で一度だけ約2.6GBのモデルをダウンロード · チャットの一バイトもスマホを離れない — プライバシーポリシー

よくある質問

Gemma 4とは何ですか?以前のGemmaモデルとの違いは?

Gemma 4はGoogleのデバイスファーストの小型モデルファミリーです。Gemma 1、2、3とは異なり、Gemma 3nから受け継いだPLEアーキテクチャを採用。埋め込みをレイヤーごとに分割することで、各テンソルをスマホGPUのメモリ制限内に保ちます。

Gemma 4のE2BとE4Bはどういう意味ですか?

Eは「Effective(実効)」の略。E2Bは密な20億パラメータモデル相当の動作をし、E4Bは40億パラメータ相当です。両方とも同じMatformerウェイトから生成されるため、デバイスはRAMバジェットに合った実効サイズを選べます。

PLEアーキテクチャがオンデバイス用途で重要な理由は?

ミドルレンジスマホのGPUには128MBのバッファ制限があります。現代のLLMのモノリシック埋め込みテーブルはすでにこれを超えています。PLEはレイヤーごとに埋め込みを分割し、どのテンソルも制限を超えないようにします。モデルはCPUフォールバックなしにGPUで動作します。

今すぐスマホでGemma 4を使えますか?

はい。Gist&ChatはGemma 4 E2Bを搭載した無料のAndroidアプリです。一度ダウンロードすれば、スマホ上で完全に動作しプライベートチャットや要約に使えます。E4Bバリアントはハイエンドスマホ向けにProティアで提供予定です。

Gemma 4 E2BはPhi、Qwen、Llama 3.2などと比べてどうですか?

スペック上はパラメータ数が似ていますが、他の1〜2Bモデルのほとんどがモバイルで読み込めないモノリシック埋め込みテーブルを持ちます。Gemma 4のPLEアーキテクチャは現在、ミドルレンジスマホのGPUで2Bクラスモデルを動かす最も信頼性の高い方法です。


gist-ai.netの他の記事:オンデバイスAIとは実際何か(なぜ機能するのか)オフラインChatGPT代替 — 2026年の真の選択肢機内モードで動くAIチャットボットAIでYouTube動画を要約する方法記事・PDF・テキスト写真をオフラインで要約ポケットのAIで語学練習クリエイター向け無料ツール — 登録不要。

静かな時間に、他のすべての間に作りました。役に立ったなら — ☕ サイト運営を支援
Gist&Chat
Gist&Chat App Gemma 4 E2B、オンデバイス Google Playで無料