「小型言語モデル」とは実際何か
大型言語モデル(LLM)はChatGPTやその仲間を動かしているもの — 数千億のパラメータがデータセンターのGPUラックに存在します。小型言語モデル(SLM)は同じ基本的なアイデアを、手で持てるデバイス(ノートPC、スマートフォン、カーヘッドユニット、ロボット)で動くサイズに縮小したものです。実際には「小型」とは数十億パラメータ以下を意味し、モデルのウェイトはテラバイトではなく数ギガバイトのファイルです。
SLMが重要な理由はただ一つ:どこで動くかです。スマホに収まるモデルはプライベート(何も送信されない)、メッセージあたり無料(サーバー代なし)、そしてオフライン(ネットワーク不要)であることができます。この3つの特性はクラウドAIには存在しません——どんなサイズでも。唯一の問題はSLMがタスクに対して十分に優れているかどうか——そして増えていくタスクリストに対して、答えはついに「はい」になりつつあります。
なぜオンデバイスAIはつい最近まで不可能に近かったのか
スマホで本物の言語モデルを動かすという夢は、3つの壁に同時にぶつかりました:
- メモリ。 現代のLLMのウェイトは大きい。スマホではOS、ブラウザ、ユーザーが直前に閉じたゲーム、そして追い出すものを探すlow-memory killerと戦うことになります。かろうじてスマホに収まるモデルは、最初の通知が来た時点で死ぬモデルです。
- 計算能力。 トランスフォーマー推論は行列乗算の連続です。スマホGPUはこれが驚くほど得意ですが、モデルのテンソルがバッファ制限に収まる場合のみ、そしてソフトウェアスタック(LiteRT、MediaPipe、MLC、llama.cpp mobile)が実際にGPUに届く場合のみです。
- バッテリーと熱。 スマホのチップは短時間全力で動けますが、持続的な負荷は熱になり、熱はサーマルスロットリングになります。最初のメッセージを2秒で返し、10番目を20秒で返すモデルはデモであってプロダクトではありません。
これまでの「スマホで小型モデルを」という話は必ずこの3つのどれかで失敗しました。Gemma 4は3つすべてを同時にクリアした最初のファミリー——そしてその理由は知っておくべき2つのアーキテクチャ上の選択にあります。
Gemmaファミリーの概要
GoogleのGemmaモデルはGeminiのオープンウェイト版の親戚——より小さく、誰でも実行できるように公開されていますが、大きなモデルの訓練から得た知見を活かして作られています。系譜:
- Gemma 1と2 — 優れたオープンウェイトモデルですが、基本的に標準トランスフォーマーの小型版。高性能ノートPCではうまく動き、スマホでは苦労しました。
- Gemma 3 — 視覚機能追加、多言語対応向上、まだ標準アーキテクチャ。
- Gemma 3n — モバイルファースト版。Per-Layer Embedding(PLE)とmatformerネストパラメータ設計を導入し、「E2B / E4B」命名を生み出しました。
- Gemma 4 — デバイスファーストのメインライン。PLEとmatformerを継承し、より優れた指示追従、視覚、多言語性能、そくすぐ使えるチャット向けバリアント(E2B-it、E4B-it)を追加。
Gemma 4で重要なのはベンチマークスコアではありません。アーキテクチャが「ミドルレンジスマホで快適に動かなければならない」という逆方向から設計されたことです。「紙の上でGPT-4を超えなければならない」という方向ではなく。
PLE:2Bパラメータをスマホのメモリに収めたトリック
ほとんどの人が聞いたことのない具体的な制約があります。多くの人気Androidスマホ(Samsung Galaxy S23 Ultraなど)が、WebGPUストレージバッファとしてバインディングあたり128MBしか提供しません。これがGPUドライバーが受け入れる単一テンソルのサイズ制限です。これを超えるとドライバーがバインディングを拒否し、モデルは無音でゴミを出力するかCPUにフォールバックします。
標準トランスフォーマーでは最大の単一テンソルは埋め込みテーブル:語彙サイズ × 隠れ次元です。現代の多言語モデルではこのテーブルだけでINT8量子化後でも150〜260MBになることがあります。言い換えると:実際の多くのスマホで埋め込みテーブルが読み込めません。モデルはGPUで動けません。CPUフォールバックは機能しますが10〜20倍遅くなります。
Per-Layer EmbeddingがGemma 4の答えです。巨大な埋め込みテーブル一つの代わりに、埋め込みをレイヤー間で分割することで、各テンソルが128MBの上限を快適に下回ります。全体のパラメータ数は似ていますが、形が違う——そして形こそが実際のハードウェアでモデルが動くかどうかを決定します。
Matformer:E2BとE4Bが実際に意味すること
E2BとE4BのEはEffective(実効)の略です。E2Bは重要なタスクで密な20億パラメータモデルに匹敵する動作をするモデル、E4Bは40億パラメータ相当です。しかし内部では、両方とも同じウェイトから来ています。
そのメカニズムはmatformerと呼ばれます——ニューラルネットワーク版のマトリョーシカ人形を想像してください。訓練中にモデルはパラメータがネストされた階層を形成するよう最適化されます:異なる深さと幅でモデルを切り取ることができ、まだ一貫して動作する小さなサブモデルが得られます。一つのマスターウェイトセットから、Googleはメモリが少ないスマホ向けにE2Bを、余裕のあるスマホ向けにE4Bを切り出せます。
Gemma 4と他の小型モデルの比較
2B以下の空間は多くの人が思うより混雑しています。現実的なミドルレンジのAndroid GPUで動くか?という問いを中心に、正直な視点からリストを見てみましょう。
| モデル | パラメータ | 埋め込みサイズ(INT8) | 128MBバッファに収まるか? |
|---|---|---|---|
| Qwen3 0.6B | 0.6B | ≈ 155 MB | ✕ CPUフォールバック |
| Gemma 3 1B | 1B | ≈ 151 MB(INT4でも) | ✕ CPUフォールバック |
| Llama 3.2 1B | 1B | ≈ 262 MB | ✕ CPUフォールバック |
| Qwen3 1.7B | 1.7B | ≈ 311 MB | ✕ CPUフォールバック |
| IBM Granite 4.0 350M | 0.35B | ≈ 102 MB | ✓(語彙小さく、多言語弱め) |
| Gemma 4 E2B(PLE) | 実効 2B | レイヤーごとに分割 | ✓ 完全GPU |
| Gemma 4 E4B(PLE) | 実効 4B | レイヤーごとに分割 | ✓ 完全GPU(RAM十分なら) |
今日Gemma 4を試す場所
スマホで:Gist&Chat(E2B、無料)
Gist&ChatはGemma 4 E2Bを搭載した無料のAndroidアプリです。初回起動時にWi-Fi経由でモデルをダウンロードします——一度だけ約2.6GB——その後AIはスマホ上で完全に動作します。できること:
- プライベートチャット — 音声またはテキスト、セッション間のメモリ、機内モードテストをクリア。スマホが計算するので無制限・無料。
- 要約 — YouTubeリンク、記事URL、PDF / DOCX / テキストの写真を貼り付け、要点を取得し、追加質問。
- 11言語 — 実際に練習する可能性が高い言語を含む。
ProのE4B(近日公開)
より大きなGemma 4 E4BバリアントはGist&ChatのProティアで提供予定です。E4Bは実効パラメータが倍増——推論、長コンテキストQ&A、コード隣接タスクで明らかに優れています——ただし快適に動かすには十分なRAMを持つスマホが必要です。
ノートPCやデスクトップで
より大きなマシンで試したい場合は?GoogleのGemma 4ウェイトは通常のオープンモデルエコシステムで入手可能です——Hugging Face、Ollama、LM Studio、Jan、GPT4All。デスクトップの選択肢全体をモバイルと比較するのはオフラインChatGPT代替:2026年の真の選択肢で行っています。
正直な限界
このセクションを飛ばすガイドはプレスリリースです。Gemma 4 E2Bが追いつかないもの:
- 最先端の推論。 実効2Bモデルは2000億パラメータのクラウドモデルではありません。大学院レベルの数学の導出や新規研究の合成にはクラウドが依然として勝ります。
- 最新の知識。 ウェイトは訓練データのスナップショット。Gemma 4は昨日何が起きたかを知りません。それにはウェブアクセス付きのものが必要です。
- 非常に小さなスマホでの非常に長いコンテキスト。 モデルは長い入力を処理できますが、KVキャッシュはコンテキスト長とともに成長します。6GBのRAMのスマホではモデルのコンテキスト制限に達する前にメモリ不足になることがあります。
- 時々奇妙な出力。 コンパクトモデルはまだ時々幻覚を見たり、数字を混乱させたり、繰り返したりします。重要なことは確認を怠らず、気が散った午後の賢い友人として扱いましょう:しばしば正しいが、重要な点は再確認の価値あり。
スマホでGemma 4を無料で試す
Gist&ChatはGemma 4 E2Bを搭載——プライベートAIチャットとYouTube、記事、PDF要約を11言語で。より大きなE4BバリアントはProで提供予定。
- Gemma 4 E2B、オンデバイス — 現代のAndroidで完全GPU推論
- プライベートチャット、無制限・無料 — アカウント不要、課金なし
- 追加Q&A付き要約 — 動画、記事、PDF、テキスト写真(最初は無料)
- 11言語 — インターフェースと会話
- ProのE4B、近日公開 — RAMが十分なスマホ向けにより大きな実効モデル
無料ダウンロード · Wi-Fi経由で一度だけ約2.6GBのモデルをダウンロード · チャットの一バイトもスマホを離れない — プライバシーポリシー
よくある質問
Gemma 4とは何ですか?以前のGemmaモデルとの違いは?
Gemma 4はGoogleのデバイスファーストの小型モデルファミリーです。Gemma 1、2、3とは異なり、Gemma 3nから受け継いだPLEアーキテクチャを採用。埋め込みをレイヤーごとに分割することで、各テンソルをスマホGPUのメモリ制限内に保ちます。
Gemma 4のE2BとE4Bはどういう意味ですか?
Eは「Effective(実効)」の略。E2Bは密な20億パラメータモデル相当の動作をし、E4Bは40億パラメータ相当です。両方とも同じMatformerウェイトから生成されるため、デバイスはRAMバジェットに合った実効サイズを選べます。
PLEアーキテクチャがオンデバイス用途で重要な理由は?
ミドルレンジスマホのGPUには128MBのバッファ制限があります。現代のLLMのモノリシック埋め込みテーブルはすでにこれを超えています。PLEはレイヤーごとに埋め込みを分割し、どのテンソルも制限を超えないようにします。モデルはCPUフォールバックなしにGPUで動作します。
今すぐスマホでGemma 4を使えますか?
はい。Gist&ChatはGemma 4 E2Bを搭載した無料のAndroidアプリです。一度ダウンロードすれば、スマホ上で完全に動作しプライベートチャットや要約に使えます。E4Bバリアントはハイエンドスマホ向けにProティアで提供予定です。
Gemma 4 E2BはPhi、Qwen、Llama 3.2などと比べてどうですか?
スペック上はパラメータ数が似ていますが、他の1〜2Bモデルのほとんどがモバイルで読み込めないモノリシック埋め込みテーブルを持ちます。Gemma 4のPLEアーキテクチャは現在、ミドルレンジスマホのGPUで2Bクラスモデルを動かす最も信頼性の高い方法です。
gist-ai.netの他の記事:オンデバイスAIとは実際何か(なぜ機能するのか)、オフラインChatGPT代替 — 2026年の真の選択肢、機内モードで動くAIチャットボット、AIでYouTube動画を要約する方法、記事・PDF・テキスト写真をオフラインで要約、ポケットのAIで語学練習、クリエイター向け無料ツール — 登録不要。