Deep Dive · Small Language Models

On-Device Small Language Models — und warum Gemma 4 E2B & E4B die Spielregeln neu geschrieben haben

Das Interessanteste in der KI gerade ist nicht das größte Modell. Es ist das kleinste, das gut genug ist. Irgendwo im letzten Jahr hat „Small Language Model" aufgehört, „nette Demo" zu bedeuten, und angefangen, „das Modell in der App auf deinem Handy, das gerade echte Arbeit leistet" zu bedeuten. Hier erkläre ich auf verständliche Weise, was sich verändert hat, warum Googles Gemma-4-Familie mittendrin steht und wie man heute eines ausprobiert.

Was ein „Small Language Model" wirklich ist

Ein Large Language Model (LLM) treibt ChatGPT und seine Pendants an — Hunderte Milliarden Parameter, untergebracht in Racks von GPUs in einem Rechenzentrum. Ein Small Language Model (SLM) ist dieselbe Grundidee, komprimiert auf etwas, das du halten kannst: ein Laptop, ein Handy, ein Auto-Display, ein Roboter. In der Praxis bedeutet „klein" meist wenige Milliarden Parameter oder weniger, und die Gewichte des Modells sind eine Datei von ein paar Gigabytes statt Terabytes.

SLMs sind aus genau einem Grund wichtig: wo sie laufen. Ein Modell, das auf ein Handy passt, kann privat sein (nichts reist ins Netz), kostenfrei pro Nachricht (keine Serverrechnung) und offline (kein Netzwerk nötig). Diese drei Eigenschaften gibt es in Cloud-KI nicht — in keiner Größe. Die einzige Frage ist, ob das kleine Modell gut genug für die Aufgabe ist — und für eine wachsende Liste von Aufgaben lautet die Antwort endlich ja.

Die interessanteste Zahl in der KI gerade ist kein Benchmark-Score. Es ist das kleinste Modell, das die Hürde für den Job schafft, den du wirklich brauchst.

Warum On-Device-KI bis vor kurzem fast unmöglich war

Der Traum, ein echtes Sprachmodell auf einem Handy laufen zu lassen, stieß auf drei Wände gleichzeitig:

Jede frühere Geschichte von „kleines Modell auf dem Handy" scheiterte an einer dieser drei Wände. Gemma 4 ist die erste Familie, die alle drei gleichzeitig überwindet — und das dank zweier architektonischer Entscheidungen, die man kennen sollte.

Die Gemma-Familie im Überblick

Googles Gemma-Modelle sind die Open-Weight-Verwandten von Gemini — kleiner, für jeden zum Betrieb freigegeben, aber mit den Erkenntnissen aus dem Training der großen Modelle gebaut. Die Abstammungslinie:

Gemma 1 Standard-Transformer Laptop-first Gemma 2 größer, noch monolithisch Gemma 3 + Vision, + Mehrsprachigkeit Gemma 3n PLE + Matformer E2B / E4B-Bezeichnung 4 Gemma 4 On-Device-first erbt PLE Dieselbe Open-Weight-Linie. Die Wende zu Phone-first geschieht bei den hervorgehobenen Modellen rechts.
Wo die Familie die Richtung wechselte. PLE und Matformer kamen mit Gemma 3n; Gemma 4 ist das Ergebnis, wenn die gesamte Hauptlinie für diese Welt designed wird.

Das Wichtige an Gemma 4 ist kein Benchmark-Score. Es ist, dass die Architektur rückwärts von „muss gut auf einem Midrange-Handy laufen" designed wurde, nicht vorwärts von „muss GPT-4 auf dem Papier schlagen".

PLE: Der Trick, der 2B Parameter auf eine Handy-GPU passt

Hier ist eine konkrete Einschränkung, die die meisten Menschen nie hören. Viele beliebte Android-Handys — etwa ein Samsung Galaxy S23 Ultra — stellen maximal 128 MB pro Binding als WebGPU-Speicherpuffer bereit. Das ist das Größenlimit eines einzelnen Tensors, den der GPU-Treiber akzeptiert. Überschreite es, und der Treiber lehnt das Binding ab — das Modell gibt Unsinn aus oder fällt auf die CPU zurück.

Bei einem Standard-Transformer ist der größte einzelne Tensor die Embedding-Tabelle: Vokabgröße × Hidden-Dimension. Bei einem modernen mehrsprachigen Modell kann diese Tabelle allein 150–260 MB betragen, selbst nach INT8-Quantisierung. Anders ausgedrückt: Auf einem großen Teil echter Handys lässt sich die Embedding-Tabelle nicht laden. Das Modell kann nicht auf der GPU laufen. CPU-Fallback funktioniert, ist aber 10–20× langsamer.

Per-Layer Embedding ist Gemma 4s Antwort. Statt einer riesigen Embedding-Tabelle werden Embeddings auf Schichten verteilt, sodass jeder Tensor komfortabel unter der 128-MB-Grenze bleibt. Die Gesamtparameterzahl ist ähnlich, aber die Form ist anders — und die Form bestimmt, ob das Modell auf echter Hardware läuft.

Warum die Form des Modells entscheidend ist Standard-Transformer eine riesige Embedding-Tabelle Vokab × Hidden ≈ 155 MB ✕ überläuft 128-MB-GPU-Puffer Gemma 4 (PLE) Embeddings pro Schicht aufgeteilt S1 S2 S3 S4 S5 S6 S7 S8 S9 ✓ jeder Tensor weit unter 128 MB Läuft auf der Handy-GPU? Standard-SLM (Qwen 0.6B, Llama 3.2 1B, Gemma 3 1B): nein — CPU-Fallback, 10–20× langsamer Gemma 4 E2B / E4B (PLE): ja — volle GPU-Inferenz
Gleiche Parameterzahl, andere Form. Der Grund, warum Gemma 4 läuft, wo andere kleine Modelle nicht laufen, ist die Anordnung der Tensoren, nicht die Größe des Modells.

Matformer: Was E2B und E4B wirklich bedeuten

Das E in E2B und E4B steht für Effective (Effektiv). Ein E2B-Modell verhält sich wie ein dichtes 2-Milliarden-Parameter-Modell bei den wichtigen Aufgaben; ein E4B wie ein dichtes 4B. Im Hintergrund kommen beide aus denselben Gewichten.

Der Mechanismus heißt Matformer — denk an Matroschka-Puppen, aber für neuronale Netze. Während des Trainings wird das Modell so optimiert, dass seine Parameter eine verschachtelte Hierarchie bilden: Man kann das Modell in verschiedenen Tiefen und Breiten aufschneiden und erhält ein kleineres Teilmodell, das sich noch immer kohärent verhält. Aus einem Master-Satz Gewichten kann Google E2B für Handys mit weniger Speicher und E4B für Handys mit mehr Platz herausschneiden.

Matformer: ein Trainingsablauf, zwei effektive Größen Master-Gewichte end-to-end trainiert verschachtelte Hierarchie E2B ⊂ E4B zur Inferenzzeit aufschneiden E2B Effektiv ~2B E4B Effektiv ~4B (enthält E2B) Welches Slice wird geladen? 📱 Midrange-Handy → E2B 📱 mehr RAM / Flagship → E4B 💻 Laptop → beides Du wählst nicht zwischen zwei Produkten. Du wählst, wo dein Gerät auf demselben Modell sitzt.
Matroschka-Puppen, aber für neuronale Netze. Das kleinere Modell lebt im größeren; das Gerät entscheidet, wie tief es greift.

Wie Gemma 4 im Vergleich zu anderen kleinen Modellen abschneidet

Der 2B-und-darunter-Bereich ist voller als die meisten vermuten. Hier ein ehrlicher Blick auf die Shortlist — mit der praktischen Frage läuft es auf einer Midrange-Android-GPU? im Mittelpunkt.

ModellParameterEmbedding-Größe (INT8)Passt in 128-MB-Puffer?
Qwen3 0.6B0.6B≈ 155 MB✕ CPU-Fallback
Gemma 3 1B1B≈ 151 MB (sogar INT4)✕ CPU-Fallback
Llama 3.2 1B1B≈ 262 MB✕ CPU-Fallback
Qwen3 1.7B1.7B≈ 311 MB✕ CPU-Fallback
IBM Granite 4.0 350M0.35B≈ 102 MB✓ (kleines Vokabular, schwächere Mehrsprachigkeit)
Gemma 4 E2B (PLE)Effektiv 2Bpro Schicht aufgeteilt✓ volle GPU
Gemma 4 E4B (PLE)Effektiv 4Bpro Schicht aufgeteilt✓ volle GPU (mit ausreichend RAM)

Die Botschaft der Tabelle: Die Parameterzahl ist ein Proxy, auf den sich die Leute fixieren, aber auf echten Handys ist der entscheidende Faktor, ob der größte einzelne Tensor das Per-Buffer-Limit der GPU überläuft. Für die heutige Android-Landschaft ist PLE die Architektur, die gewinnt.

Was der CPU-Fallback wirklich kostet Prefill-Zeit für denselben ~3.700-Zeichen-System-Prompt, selbes Handy (Snapdragon 8 Gen 2) Nicht-PLE-Modell, CPU-Fallback > 20 Sekunden Gemma 4 (PLE), volle GPU ≈ 1 Sekunde 0s 10s 20s+
Eine Sekunde ist ein Gespräch. Zwanzig Sekunden sind ein Bug-Report. Selbes Handy, selber Prompt, andere Architektur — das ist das ganze Spiel.

Wo man Gemma 4 heute ausprobieren kann

Auf dem Handy: Gist&Chat (E2B, kostenlos)

Gist&Chat ist eine kostenlose Android-App, die rund um Gemma 4 E2B gebaut ist. Beim ersten Start lädt sie das Modell per WLAN — einmalig ~2,6 GB — und danach läuft die KI vollständig auf dem Handy. Du bekommst:

Das kürzere „Warum überhaupt On-Device?"-Argument ist ein eigener Artikel. Das Gemma-4-spezifische ist dieser Artikel.

E4B auf Pro (demnächst)

Die größere Gemma 4 E4B-Variante kommt in Gist&Chats demnächstigem Pro-Tier. E4B verdoppelt die effektiven Parameter — spürbar besser beim Schlussfolgern, bei langen Q&As und bei code-nahen Aufgaben — benötigt aber ein Handy mit mehr RAM für flüssigen Betrieb. Pro-Nutzer können die Modell-Stufe wählen, die zu ihrer Hardware passt; Free-Nutzer führen weiterhin E2B aus.

Auf Laptop oder Desktop

Lieber auf einem größeren Rechner tüfteln? Googles Gemma-4-Gewichte sind über das übliche Open-Model-Ökosystem verfügbar — Hugging Face, Ollama, LM Studio, Jan, GPT4All. Das gesamte Desktop-Angebot vergleichen wir mit dem mobilen Bild in Offline-ChatGPT-Alternativen: die echten Optionen 2026.

Die ehrlichen Grenzen

Ein Leitfaden, der diesen Abschnitt überspringt, ist eine Pressemitteilung. Was Gemma 4 E2B nicht erreicht:

Was man dafür bekommt, sind dieselben drei Eigenschaften, die On-Device-KI überhaupt interessant machen: Deine Worte reisen nicht, es gibt keine Uhr, und das Handy muss mit nichts verbunden sein.

Gemma 4 kostenlos auf dem Handy ausprobieren

Gist&Chat kommt mit Gemma 4 E2B vorinstalliert — privater KI-Chat plus YouTube-, Artikel- und PDF-Zusammenfassungen, in 11 Sprachen. Die größere E4B-Variante kommt auf Pro.

▶ Gist&Chat kostenlos bei Google Play

Kostenloser Download · Einmaliger ~2,6-GB-Modell-Download per WLAN · Kein Byte deines Chats verlässt das Handy — Datenschutz

Häufig gestellte Fragen

Was ist Gemma 4 und wie unterscheidet es sich von früheren Gemma-Modellen?

Gemma 4 ist Googles auf On-Device ausgerichtete Small-Model-Familie. Anders als Gemma 1, 2 und 3 — die hauptsächlich kleinere Versionen desselben monolithischen Transformers waren — verwendet Gemma 4 eine Per-Layer Embedding (PLE)-Architektur, geerbt von Gemma 3n. Statt einer riesigen Embedding-Tabelle werden Embeddings pro Schicht aufgeteilt, wodurch jeder Tensor klein genug bleibt für die engen Speichergrenzen einer Handy-GPU.

Was bedeuten E2B und E4B bei Gemma 4?

Das E steht für Effective (Effektiv). E2B ist ein Modell, dessen Verhalten einem dichten 2B-Parameter-Modell entspricht, E4B einem dichten 4B. Im Hintergrund stammen beide aus denselben Matformer-Gewichten, sodass ein Gerät die effektive Größe wählen kann, die seinem RAM- und Wärmebudget entspricht.

Warum ist die PLE-Architektur für den On-Device-Einsatz wichtig?

Midrange-Handy-GPUs haben harte Per-Buffer-Speicherlimits — ein Snapdragon-8-Gen-2-Handy stellt z.B. nur 128 MB pro WebGPU-Speicherpuffer bereit. Eine einzelne monolithische Embedding-Tabelle übersteigt diesen Wert bereits. PLE teilt die Embeddings pro Schicht auf, sodass kein einzelner Tensor das Limit überläuft.

Kann ich Gemma 4 heute auf meinem Handy ausprobieren?

Ja. Gist&Chat ist eine kostenlose Android-App, die Gemma 4 E2B vorinstalliert hat: einmaliger Download, dann läuft das Modell vollständig auf dem Handy für privaten Chat und zum Zusammenfassen von YouTube-Videos, Artikeln und PDFs. Die größere E4B-Variante kommt in Gist&Chats Pro-Stufe für leistungsstärkere Handys.

Wie schneidet Gemma 4 E2B im Vergleich zu anderen kleinen Modellen wie Phi, Qwen oder Llama 3.2 ab?

Auf dem Papier sehen die Parameteranzahlen ähnlich aus. In der Praxis liefern die meisten anderen 1–2B-Modelle noch immer eine große monolithische Embedding-Tabelle, die auf vielen mobilen GPUs nicht lädt und zu einem langsamen CPU-Fallback zwingt. Gemma 4s PLE-Architektur ist derzeit der zuverlässigste Weg, ein echtes 2B-Klassenmodell auf der GPU eines Midrange-Smartphones auszuführen.


Mehr von gist-ai.net: Was On-Device-KI wirklich ist (und warum es funktioniert), Offline-ChatGPT-Alternativen — die echten Optionen 2026, Der KI-Chatbot, der im Flugmodus funktioniert, YouTube-Videos mit KI zusammenfassen, Artikel, PDFs und Textfotos zusammenfassen — offline, Eine Sprache mit KI üben und Die 8 besten Podcasts auf YouTube — nie eine Anmeldung.

In den stillen Stunden gebaut, zwischen allem anderen. Wenn es geholfen hat — ☕ Betrieb unterstützen
Gist&Chat
Gist&Chat App Gemma 4 E2B, On-Device Kostenlos bei Google Play