Was ein „Small Language Model" wirklich ist
Ein Large Language Model (LLM) treibt ChatGPT und seine Pendants an — Hunderte Milliarden Parameter, untergebracht in Racks von GPUs in einem Rechenzentrum. Ein Small Language Model (SLM) ist dieselbe Grundidee, komprimiert auf etwas, das du halten kannst: ein Laptop, ein Handy, ein Auto-Display, ein Roboter. In der Praxis bedeutet „klein" meist wenige Milliarden Parameter oder weniger, und die Gewichte des Modells sind eine Datei von ein paar Gigabytes statt Terabytes.
SLMs sind aus genau einem Grund wichtig: wo sie laufen. Ein Modell, das auf ein Handy passt, kann privat sein (nichts reist ins Netz), kostenfrei pro Nachricht (keine Serverrechnung) und offline (kein Netzwerk nötig). Diese drei Eigenschaften gibt es in Cloud-KI nicht — in keiner Größe. Die einzige Frage ist, ob das kleine Modell gut genug für die Aufgabe ist — und für eine wachsende Liste von Aufgaben lautet die Antwort endlich ja.
Warum On-Device-KI bis vor kurzem fast unmöglich war
Der Traum, ein echtes Sprachmodell auf einem Handy laufen zu lassen, stieß auf drei Wände gleichzeitig:
- Arbeitsspeicher. Die Gewichte eines modernen LLMs sind groß; auf einem Handy kämpft man gegen das Betriebssystem, den Browser, das gerade geschlossene Spiel und den Low-Memory-Killer, der nach etwas sucht, das er beenden kann. Ein Modell, das gerade so auf ein Handy passt, ist eines, das stirbt, sobald der Nutzer eine Benachrichtigung erhält.
- Rechenleistung. Transformer-Inferenz ist ein Strom von Matrix-Multiplikationen. Handy-GPUs sind überraschend gut darin — aber nur, wenn die Tensoren des Modells in ihre Per-Buffer-Limits passen und der Software-Stack (LiteRT, MediaPipe, MLC, llama.cpp mobile) tatsächlich die GPU trifft statt auf die CPU zurückzufallen.
- Akku und Wärme. Der Chip eines Handys kann kurzzeitig auf Hochtouren laufen, aber anhaltende Last wird zu Wärme, und Wärme wird zu Thermal-Throttling. Ein Modell, das die erste Nachricht in zwei Sekunden beantwortet und die zehnte in zwanzig, ist eine Demo, kein Produkt.
Jede frühere Geschichte von „kleines Modell auf dem Handy" scheiterte an einer dieser drei Wände. Gemma 4 ist die erste Familie, die alle drei gleichzeitig überwindet — und das dank zweier architektonischer Entscheidungen, die man kennen sollte.
Die Gemma-Familie im Überblick
Googles Gemma-Modelle sind die Open-Weight-Verwandten von Gemini — kleiner, für jeden zum Betrieb freigegeben, aber mit den Erkenntnissen aus dem Training der großen Modelle gebaut. Die Abstammungslinie:
- Gemma 1 und 2 — solide Open-Weight-Modelle, aber im Wesentlichen kleinere Versionen eines Standard-Transformers. Sie liefen gut auf einem leistungsstarken Laptop und strauchtelten auf dem Handy.
- Gemma 3 — fügte Vision, bessere Mehrsprachigkeit hinzu, immer noch Standard-Architektur.
- Gemma 3n — ein Mobile-first-Ableger. Führte Per-Layer Embedding (PLE) und das Matformer-verschachtelte-Parameter-Design ein und prägte die Bezeichnung „E2B / E4B".
- Gemma 4 — die On-Device-first-Hauptlinie. Erbt PLE und Matformer, fügt besseres Instruktions-Following, bessere Vision, bessere Mehrsprachigkeit und eine chat-tuned-Variante hinzu, die sofort nutzbar ist (E2B-it, E4B-it).
Das Wichtige an Gemma 4 ist kein Benchmark-Score. Es ist, dass die Architektur rückwärts von „muss gut auf einem Midrange-Handy laufen" designed wurde, nicht vorwärts von „muss GPT-4 auf dem Papier schlagen".
PLE: Der Trick, der 2B Parameter auf eine Handy-GPU passt
Hier ist eine konkrete Einschränkung, die die meisten Menschen nie hören. Viele beliebte Android-Handys — etwa ein Samsung Galaxy S23 Ultra — stellen maximal 128 MB pro Binding als WebGPU-Speicherpuffer bereit. Das ist das Größenlimit eines einzelnen Tensors, den der GPU-Treiber akzeptiert. Überschreite es, und der Treiber lehnt das Binding ab — das Modell gibt Unsinn aus oder fällt auf die CPU zurück.
Bei einem Standard-Transformer ist der größte einzelne Tensor die Embedding-Tabelle: Vokabgröße × Hidden-Dimension. Bei einem modernen mehrsprachigen Modell kann diese Tabelle allein 150–260 MB betragen, selbst nach INT8-Quantisierung. Anders ausgedrückt: Auf einem großen Teil echter Handys lässt sich die Embedding-Tabelle nicht laden. Das Modell kann nicht auf der GPU laufen. CPU-Fallback funktioniert, ist aber 10–20× langsamer.
Per-Layer Embedding ist Gemma 4s Antwort. Statt einer riesigen Embedding-Tabelle werden Embeddings auf Schichten verteilt, sodass jeder Tensor komfortabel unter der 128-MB-Grenze bleibt. Die Gesamtparameterzahl ist ähnlich, aber die Form ist anders — und die Form bestimmt, ob das Modell auf echter Hardware läuft.
Matformer: Was E2B und E4B wirklich bedeuten
Das E in E2B und E4B steht für Effective (Effektiv). Ein E2B-Modell verhält sich wie ein dichtes 2-Milliarden-Parameter-Modell bei den wichtigen Aufgaben; ein E4B wie ein dichtes 4B. Im Hintergrund kommen beide aus denselben Gewichten.
Der Mechanismus heißt Matformer — denk an Matroschka-Puppen, aber für neuronale Netze. Während des Trainings wird das Modell so optimiert, dass seine Parameter eine verschachtelte Hierarchie bilden: Man kann das Modell in verschiedenen Tiefen und Breiten aufschneiden und erhält ein kleineres Teilmodell, das sich noch immer kohärent verhält. Aus einem Master-Satz Gewichten kann Google E2B für Handys mit weniger Speicher und E4B für Handys mit mehr Platz herausschneiden.
Wie Gemma 4 im Vergleich zu anderen kleinen Modellen abschneidet
Der 2B-und-darunter-Bereich ist voller als die meisten vermuten. Hier ein ehrlicher Blick auf die Shortlist — mit der praktischen Frage läuft es auf einer Midrange-Android-GPU? im Mittelpunkt.
| Modell | Parameter | Embedding-Größe (INT8) | Passt in 128-MB-Puffer? |
|---|---|---|---|
| Qwen3 0.6B | 0.6B | ≈ 155 MB | ✕ CPU-Fallback |
| Gemma 3 1B | 1B | ≈ 151 MB (sogar INT4) | ✕ CPU-Fallback |
| Llama 3.2 1B | 1B | ≈ 262 MB | ✕ CPU-Fallback |
| Qwen3 1.7B | 1.7B | ≈ 311 MB | ✕ CPU-Fallback |
| IBM Granite 4.0 350M | 0.35B | ≈ 102 MB | ✓ (kleines Vokabular, schwächere Mehrsprachigkeit) |
| Gemma 4 E2B (PLE) | Effektiv 2B | pro Schicht aufgeteilt | ✓ volle GPU |
| Gemma 4 E4B (PLE) | Effektiv 4B | pro Schicht aufgeteilt | ✓ volle GPU (mit ausreichend RAM) |
Die Botschaft der Tabelle: Die Parameterzahl ist ein Proxy, auf den sich die Leute fixieren, aber auf echten Handys ist der entscheidende Faktor, ob der größte einzelne Tensor das Per-Buffer-Limit der GPU überläuft. Für die heutige Android-Landschaft ist PLE die Architektur, die gewinnt.
Wo man Gemma 4 heute ausprobieren kann
Auf dem Handy: Gist&Chat (E2B, kostenlos)
Gist&Chat ist eine kostenlose Android-App, die rund um Gemma 4 E2B gebaut ist. Beim ersten Start lädt sie das Modell per WLAN — einmalig ~2,6 GB — und danach läuft die KI vollständig auf dem Handy. Du bekommst:
- Privater Chat — Sprache oder Text, Gedächtnis über Sitzungen hinweg, besteht den Flugmodus-Test. Unbegrenzt und kostenlos, weil dein Handy die Berechnung übernimmt.
- Zusammenfassungen — füge einen YouTube-Link, eine Artikel-URL oder ein PDF / DOCX / Foto von Text ein, erhalte das Wesentliche, dann stelle Nachfragen.
- 11 Sprachen — darunter die, in denen du wahrscheinlich wirklich übst.
Das kürzere „Warum überhaupt On-Device?"-Argument ist ein eigener Artikel. Das Gemma-4-spezifische ist dieser Artikel.
E4B auf Pro (demnächst)
Die größere Gemma 4 E4B-Variante kommt in Gist&Chats demnächstigem Pro-Tier. E4B verdoppelt die effektiven Parameter — spürbar besser beim Schlussfolgern, bei langen Q&As und bei code-nahen Aufgaben — benötigt aber ein Handy mit mehr RAM für flüssigen Betrieb. Pro-Nutzer können die Modell-Stufe wählen, die zu ihrer Hardware passt; Free-Nutzer führen weiterhin E2B aus.
Auf Laptop oder Desktop
Lieber auf einem größeren Rechner tüfteln? Googles Gemma-4-Gewichte sind über das übliche Open-Model-Ökosystem verfügbar — Hugging Face, Ollama, LM Studio, Jan, GPT4All. Das gesamte Desktop-Angebot vergleichen wir mit dem mobilen Bild in Offline-ChatGPT-Alternativen: die echten Optionen 2026.
Die ehrlichen Grenzen
Ein Leitfaden, der diesen Abschnitt überspringt, ist eine Pressemitteilung. Was Gemma 4 E2B nicht erreicht:
- Frontier-Reasoning. Ein 2B-effektives Modell ist kein 200-Milliarden-Parameter-Cloud-Modell. Für Ableitungen auf Uni-Niveau oder neuartige Forschungssynthesen gewinnen Cloud-Giganten noch.
- Aktuelles Wissen. Die Gewichte sind ein Snapshot der Trainingsdaten. Gemma 4 weiß nicht, was gestern passiert ist; dafür braucht man noch etwas mit Webzugang.
- Sehr lange Kontexte auf sehr kleinen Handys. Das Modell kann lange Eingaben verarbeiten, aber der KV-Cache wächst mit der Kontextlänge; auf einem Handy mit 6 GB RAM stößt man an Speichergrenzen, bevor man ans Kontextlimit des Modells gelangt.
- Manchmal merkwürdige Ausgaben. Kompakte Modelle halluzinieren gelegentlich, verwechseln Zahlen oder wiederholen sich. Behandle ihre Antworten wie einen klugen Freund an einem zerstreuten Nachmittag: oft richtig, bei wichtigen Dingen zur Sicherheit nachprüfen.
Was man dafür bekommt, sind dieselben drei Eigenschaften, die On-Device-KI überhaupt interessant machen: Deine Worte reisen nicht, es gibt keine Uhr, und das Handy muss mit nichts verbunden sein.
Gemma 4 kostenlos auf dem Handy ausprobieren
Gist&Chat kommt mit Gemma 4 E2B vorinstalliert — privater KI-Chat plus YouTube-, Artikel- und PDF-Zusammenfassungen, in 11 Sprachen. Die größere E4B-Variante kommt auf Pro.
- Gemma 4 E2B, On-Device — volle GPU-Inferenz auf modernen Android-Geräten
- Privater Chat, unbegrenzt & kostenlos — kein Konto, keine Uhr
- Zusammenfassungen mit Nachfragen — Video, Artikel, PDF, Textfoto (kostenlos zum Start)
- 11 Sprachen — Benutzeroberfläche und Konversation
- E4B auf Pro, demnächst — größeres effektives Modell für Handys mit ausreichend RAM
Kostenloser Download · Einmaliger ~2,6-GB-Modell-Download per WLAN · Kein Byte deines Chats verlässt das Handy — Datenschutz
Häufig gestellte Fragen
Was ist Gemma 4 und wie unterscheidet es sich von früheren Gemma-Modellen?
Gemma 4 ist Googles auf On-Device ausgerichtete Small-Model-Familie. Anders als Gemma 1, 2 und 3 — die hauptsächlich kleinere Versionen desselben monolithischen Transformers waren — verwendet Gemma 4 eine Per-Layer Embedding (PLE)-Architektur, geerbt von Gemma 3n. Statt einer riesigen Embedding-Tabelle werden Embeddings pro Schicht aufgeteilt, wodurch jeder Tensor klein genug bleibt für die engen Speichergrenzen einer Handy-GPU.
Was bedeuten E2B und E4B bei Gemma 4?
Das E steht für Effective (Effektiv). E2B ist ein Modell, dessen Verhalten einem dichten 2B-Parameter-Modell entspricht, E4B einem dichten 4B. Im Hintergrund stammen beide aus denselben Matformer-Gewichten, sodass ein Gerät die effektive Größe wählen kann, die seinem RAM- und Wärmebudget entspricht.
Warum ist die PLE-Architektur für den On-Device-Einsatz wichtig?
Midrange-Handy-GPUs haben harte Per-Buffer-Speicherlimits — ein Snapdragon-8-Gen-2-Handy stellt z.B. nur 128 MB pro WebGPU-Speicherpuffer bereit. Eine einzelne monolithische Embedding-Tabelle übersteigt diesen Wert bereits. PLE teilt die Embeddings pro Schicht auf, sodass kein einzelner Tensor das Limit überläuft.
Kann ich Gemma 4 heute auf meinem Handy ausprobieren?
Ja. Gist&Chat ist eine kostenlose Android-App, die Gemma 4 E2B vorinstalliert hat: einmaliger Download, dann läuft das Modell vollständig auf dem Handy für privaten Chat und zum Zusammenfassen von YouTube-Videos, Artikeln und PDFs. Die größere E4B-Variante kommt in Gist&Chats Pro-Stufe für leistungsstärkere Handys.
Wie schneidet Gemma 4 E2B im Vergleich zu anderen kleinen Modellen wie Phi, Qwen oder Llama 3.2 ab?
Auf dem Papier sehen die Parameteranzahlen ähnlich aus. In der Praxis liefern die meisten anderen 1–2B-Modelle noch immer eine große monolithische Embedding-Tabelle, die auf vielen mobilen GPUs nicht lädt und zu einem langsamen CPU-Fallback zwingt. Gemma 4s PLE-Architektur ist derzeit der zuverlässigste Weg, ein echtes 2B-Klassenmodell auf der GPU eines Midrange-Smartphones auszuführen.
Mehr von gist-ai.net: Was On-Device-KI wirklich ist (und warum es funktioniert), Offline-ChatGPT-Alternativen — die echten Optionen 2026, Der KI-Chatbot, der im Flugmodus funktioniert, YouTube-Videos mit KI zusammenfassen, Artikel, PDFs und Textfotos zusammenfassen — offline, Eine Sprache mit KI üben und Die 8 besten Podcasts auf YouTube — nie eine Anmeldung.