Ce qu'est réellement un « petit modèle de langage »
Un grand modèle de langage (LLM) est ce qui alimente ChatGPT et ses pairs — des centaines de milliards de paramètres, vivant dans des racks de GPU dans un centre de données. Un petit modèle de langage (SLM) est la même idée de base, réduite pour tourner sur quelque chose que vous pouvez tenir : un ordinateur portable, un téléphone, l'écran d'une voiture, un robot. En pratique, « petit » signifie généralement quelques milliards de paramètres ou moins, et les poids du modèle sont un fichier de quelques gigaoctets plutôt que des téraoctets.
Les SLMs importent pour exactement une raison : où ils tournent. Un modèle qui tient sur un téléphone peut être privé (rien ne voyage), gratuit par message (pas de facture serveur) et hors ligne (pas de réseau nécessaire). Ces trois propriétés n'existent pas dans l'IA cloud, quelle que soit la taille. La seule question est de savoir si le petit modèle est suffisamment bon pour la tâche — et pour une liste croissante de tâches, la réponse est enfin oui.
Pourquoi l'IA sur l'appareil était presque impossible jusqu'à récemment
Le rêve de faire tourner un vrai modèle de langage sur un téléphone s'est heurté à trois murs à la fois :
- Mémoire. Les poids d'un LLM moderne sont volumineux ; sur un téléphone vous vous battez contre le système d'exploitation, le navigateur, le jeu que l'utilisateur vient de fermer, et le tueur de basse mémoire qui cherche quelque chose à évincer. Un modèle qui tient tout juste sur un téléphone est un modèle qui meurt dès que l'utilisateur reçoit une notification.
- Calcul. L'inférence de transformateur est un flux de multiplications de matrices. Les GPU de téléphone sont étonnamment bons à cela — mais seulement si les tenseurs du modèle tiennent dans leurs limites par tampon, et seulement si la pile logicielle (LiteRT, MediaPipe, MLC, llama.cpp mobile) atteint réellement le GPU au lieu de se replier sur le CPU.
- Batterie et thermique. La puce d'un téléphone peut tourner à pleine vitesse brièvement, mais une charge soutenue devient de la chaleur, et la chaleur devient de la limitation thermique. Un modèle qui répond au premier message en deux secondes et au dixième en vingt est une démo, pas un produit.
Chaque histoire précédente de « petit modèle sur votre téléphone » a échoué sur l'un de ces trois murs. Gemma 4 est la première famille qui franchit les trois à la fois — et elle le fait grâce à deux choix architecturaux qui méritent d'être connus.
La famille Gemma, brièvement
Les modèles Gemma de Google sont les parents à poids ouverts de Gemini — plus petits, publiés pour que tout le monde puisse les exécuter, mais construits avec les leçons de l'entraînement des grands. La lignée :
- Gemma 1 et 2 — modèles solides à poids ouverts, mais essentiellement de petites versions du même transformateur standard. Ils tournaient bien sur un ordinateur portable puissant et trébuchaient sur un téléphone.
- Gemma 3 — ajout de la vision, meilleure couverture multilingue, toujours architecture standard.
- Gemma 3n — une variante orientée mobile. A introduit l'Embedding Par Couche (PLE) et la conception de paramètres imbriqués matformer, et a inventé le nom « E2B / E4B ».
- Gemma 4 — la ligne principale d'abord pour l'appareil. Hérite PLE et matformer, ajoute un meilleur suivi d'instructions, une meilleure vision, de meilleures performances multilingues et une variante ajustée pour le chat prête à l'emploi (E2B-it, E4B-it).
Ce qui est important dans Gemma 4 n'est pas un score de benchmark. C'est que l'architecture a été conçue à l'envers depuis « doit bien fonctionner sur un téléphone milieu de gamme », pas vers l'avant depuis « doit battre GPT-4 sur le papier ».
PLE : l'astuce qui a permis à 2B paramètres de tenir sur un GPU de téléphone
Voici une contrainte spécifique et concrète que la plupart des gens n'entendent jamais. De nombreux téléphones Android populaires — un Samsung Galaxy S23 Ultra, par exemple — exposent un maximum de 128 Mo par liaison comme tampon de stockage WebGPU. C'est la limite de taille d'un seul tenseur que le pilote GPU acceptera. Dépassez-le et le pilote rejette la liaison, et le modèle produit silencieusement du charabia ou se replie sur le CPU.
Dans un transformateur standard, le plus grand tenseur individuel est la table d'embeddings : taille du vocabulaire × dimension cachée. Pour un modèle multilingue moderne, cette table seule peut faire 150 à 260 Mo, même après la quantization INT8. En d'autres termes : sur une grande fraction de vrais téléphones, la table d'embeddings ne charge pas. Le modèle ne peut pas tourner sur le GPU. Le CPU fonctionne mais est 10 à 20 fois plus lent.
L'Embedding Par Couche est la réponse de Gemma 4. Au lieu d'une énorme table d'embeddings, les embeddings sont répartis entre les couches, de sorte que chaque tenseur reste confortablement sous le plafond de 128 Mo. Le nombre total de paramètres est similaire, mais la forme est différente — et c'est la forme qui détermine réellement si le modèle tourne sur du vrai matériel.
Matformer : ce que E2B et E4B signifient vraiment
Le E dans E2B et E4B signifie Effectif. Un modèle E2B se comporte comme un modèle dense de 2 milliards de paramètres pour les tâches qui comptent ; un E4B comme un modèle dense de 4B. Mais sous le capot, ils proviennent tous les deux des mêmes poids.
Le mécanisme s'appelle matformer — pensez aux poupées matriochkas, mais pour les réseaux de neurones. Pendant l'entraînement, le modèle est optimisé de sorte que ses paramètres forment une hiérarchie imbriquée : vous pouvez trancher le modèle à différentes profondeurs et largeurs et obtenir un sous-modèle plus petit qui se comporte encore de manière cohérente. À partir d'un ensemble maître de poids, Google peut découper E2B pour les téléphones avec moins de mémoire et E4B pour les téléphones avec plus d'espace.
Comment Gemma 4 se compare aux autres petits modèles
L'espace à 2B et en dessous est plus encombré que la plupart ne le réalisent. Voici un regard honnête sur la liste restreinte, avec la question pratique tourne-t-il sur un GPU Android milieu de gamme ? au premier plan.
| Modèle | Paramètres | Taille d'embedding (INT8) | Tient dans un tampon de 128 Mo ? |
|---|---|---|---|
| Qwen3 0.6B | 0.6B | ≈ 155 Mo | ✕ repli CPU |
| Gemma 3 1B | 1B | ≈ 151 Mo (même INT4) | ✕ repli CPU |
| Llama 3.2 1B | 1B | ≈ 262 Mo | ✕ repli CPU |
| Qwen3 1.7B | 1.7B | ≈ 311 Mo | ✕ repli CPU |
| IBM Granite 4.0 350M | 0.35B | ≈ 102 Mo | ✓ (petit vocabulaire, multilingue plus faible) |
| Gemma 4 E2B (PLE) | Effectif 2B | réparti par couche | ✓ GPU complet |
| Gemma 4 E4B (PLE) | Effectif 4B | réparti par couche | ✓ GPU complet (avec assez de RAM) |
Où essayer Gemma 4 aujourd'hui
Sur votre téléphone : Gist&Chat (E2B, gratuit)
Gist&Chat est une application Android gratuite construite autour de Gemma 4 E2B. Au premier lancement, il télécharge le modèle en Wi-Fi — un unique téléchargement de ~2,6 Go — et à partir de là, l'IA tourne entièrement sur votre téléphone. Vous obtenez :
- Chat privé — voix ou texte, mémoire entre sessions, passe le test du mode avion. Illimité et gratuit car votre téléphone fait le calcul.
- Résumés — collez un lien YouTube, une URL d'article ou un PDF / DOCX / photo de texte, obtenez l'essentiel, puis posez des questions de suivi.
- 11 langues — dont celles que vous êtes susceptible de pratiquer réellement.
E4B sur Pro (à venir)
La variante plus grande Gemma 4 E4B arrivera dans le prochain niveau Pro de Gist&Chat. E4B double les paramètres effectifs — notablement meilleur en raisonnement, Q&R de long contexte et tâches proches du code — mais nécessite un téléphone avec plus de RAM pour rester fluide.
Sur ordinateur portable ou de bureau
Vous préférez expérimenter sur une machine plus grande ? Les poids Gemma 4 de Google sont disponibles via l'écosystème habituel de modèles ouverts — Hugging Face, Ollama, LM Studio, Jan, GPT4All. Nous comparons tout ce catalogue de bureau avec le panorama mobile dans alternatives hors ligne à ChatGPT : les vraies options en 2026.
Les limites honnêtes
Un guide qui saute cette section est un communiqué de presse. Ce que Gemma 4 E2B n'égalera pas :
- Raisonnement de pointe. Un modèle effectif de 2B n'est pas un modèle cloud de 200B paramètres. Pour des dérivations mathématiques de niveau master ou une synthèse de recherche novatrice, les géants du cloud gagnent encore.
- Connaissances fraîches. Les poids sont un instantané des données d'entraînement. Gemma 4 ne sait pas ce qui s'est passé hier ; pour cela, vous avez encore besoin de quelque chose avec accès au web.
- Très longs contextes, sur très petits téléphones. Le modèle peut gérer de longues entrées, mais le cache KV grandit avec la longueur du contexte ; sur un téléphone avec 6 Go de RAM, vous manquerez de mémoire avant d'atteindre la limite de contexte du modèle.
- Des sorties étranges, parfois. Les modèles compacts hallucinent encore occasionnellement, confondent des chiffres ou se répètent. Traitez leurs réponses comme celles d'un ami intelligent un après-midi distrait : souvent juste, vaut la peine de vérifier sur des sujets importants.
Essayez Gemma 4 sur votre téléphone, gratuitement
Gist&Chat inclut Gemma 4 E2B d'emblée — chat IA privé plus résumés YouTube, articles et PDFs, en 11 langues. La variante E4B plus grande arrivera sur Pro.
- Gemma 4 E2B, sur l'appareil — inférence GPU complète sur Android moderne
- Chat privé, illimité et gratuit — sans compte, sans compteur
- Résumés avec Q&R de suivi — vidéo, article, PDF, photo de texte (gratuit pour commencer)
- 11 langues — interface et conversation
- E4B sur Pro, à venir — modèle effectif plus grand pour les téléphones avec la RAM nécessaire
Téléchargement gratuit · Téléchargement unique du modèle ~2,6 Go en Wi-Fi · Pas un octet de votre chat ne quitte le téléphone — politique de confidentialité
Questions fréquemment posées
Qu'est-ce que Gemma 4 et en quoi diffère-t-il des modèles Gemma précédents ?
Gemma 4 est la famille de petits modèles de Google conçue d'abord pour l'appareil. Contrairement à Gemma 1, 2 et 3, Gemma 4 utilise une architecture PLE héritée de Gemma 3n. Les embeddings sont répartis par couche, ce qui maintient chaque tenseur assez petit pour les GPU de téléphone.
Que signifient E2B et E4B dans Gemma 4 ?
Le E signifie Effectif. E2B se comporte comme un modèle dense de 2B paramètres, et E4B comme un de 4B. Les deux proviennent des mêmes poids matformer, donc l'appareil peut choisir la taille effective qui correspond à son budget RAM.
Pourquoi l'architecture PLE est-elle importante pour l'utilisation sur l'appareil ?
Les GPU de téléphones milieu de gamme ont des limites de 128 Mo par tampon. Une table d'embeddings monolithique dans la plupart des LLMs dépasse déjà cette limite. PLE divise les embeddings par couche de sorte qu'aucun tenseur ne déborde ; le modèle tourne sur GPU plutôt que de se replier sur le lent CPU.
Puis-je exécuter Gemma 4 sur mon téléphone aujourd'hui ?
Oui. Gist&Chat est une application Android gratuite avec Gemma 4 E2B inclus : téléchargement unique, puis le modèle tourne entièrement sur votre téléphone pour le chat privé et les résumés. La variante E4B arrivera au niveau Pro pour les téléphones haut de gamme.
Comment Gemma 4 E2B se compare-t-il à d'autres petits modèles comme Phi, Qwen ou Llama 3.2 ?
Sur le papier, les nombres de paramètres semblent similaires. En pratique, la plupart des autres modèles de 1–2B ont des tables d'embeddings monolithiques qui ne chargent pas sur beaucoup de GPU mobiles. L'architecture PLE de Gemma 4 est actuellement le moyen le plus fiable d'exécuter un modèle de classe 2B sur le GPU d'un téléphone milieu de gamme.
Plus de gist-ai.net : ce qu'est vraiment l'IA sur l'appareil (et pourquoi ça marche), alternatives hors ligne à ChatGPT — les vraies options en 2026, le chatbot IA qui fonctionne en mode avion, comment résumer n'importe quelle vidéo YouTube avec l'IA, résumer des articles, PDFs et photos de texte — hors ligne, pratiquer une langue avec une IA dans votre poche et outils gratuits pour les créateurs — jamais besoin de s'inscrire.