Analyse · Petits Modèles de Langage

Petits Modèles de Langage sur l'Appareil — et Pourquoi Gemma 4 E2B et E4B ont Tout Changé

La chose la plus intéressante qui se passe en IA en ce moment n'est pas le plus grand modèle. C'est le plus petit qui est suffisamment bon. À un moment de l'année passée, « petit modèle de langage » a cessé de signifier « démo sympa » et a commencé à signifier « le modèle dans l'application de votre téléphone, là maintenant, faisant un vrai travail ». Voici un guide en langage simple sur ce qui a changé, pourquoi la famille Gemma 4 de Google en est au cœur, et comment en essayer un aujourd'hui.

Ce qu'est réellement un « petit modèle de langage »

Un grand modèle de langage (LLM) est ce qui alimente ChatGPT et ses pairs — des centaines de milliards de paramètres, vivant dans des racks de GPU dans un centre de données. Un petit modèle de langage (SLM) est la même idée de base, réduite pour tourner sur quelque chose que vous pouvez tenir : un ordinateur portable, un téléphone, l'écran d'une voiture, un robot. En pratique, « petit » signifie généralement quelques milliards de paramètres ou moins, et les poids du modèle sont un fichier de quelques gigaoctets plutôt que des téraoctets.

Les SLMs importent pour exactement une raison : où ils tournent. Un modèle qui tient sur un téléphone peut être privé (rien ne voyage), gratuit par message (pas de facture serveur) et hors ligne (pas de réseau nécessaire). Ces trois propriétés n'existent pas dans l'IA cloud, quelle que soit la taille. La seule question est de savoir si le petit modèle est suffisamment bon pour la tâche — et pour une liste croissante de tâches, la réponse est enfin oui.

Le nombre le plus intéressant en IA en ce moment n'est pas un score de benchmark. C'est le plus petit modèle qui franchit la barre pour le travail que vous avez réellement besoin d'accomplir.

Pourquoi l'IA sur l'appareil était presque impossible jusqu'à récemment

Le rêve de faire tourner un vrai modèle de langage sur un téléphone s'est heurté à trois murs à la fois :

Chaque histoire précédente de « petit modèle sur votre téléphone » a échoué sur l'un de ces trois murs. Gemma 4 est la première famille qui franchit les trois à la fois — et elle le fait grâce à deux choix architecturaux qui méritent d'être connus.

La famille Gemma, brièvement

Les modèles Gemma de Google sont les parents à poids ouverts de Gemini — plus petits, publiés pour que tout le monde puisse les exécuter, mais construits avec les leçons de l'entraînement des grands. La lignée :

Gemma 1 transformateur standard orienté ordinateur Gemma 2 plus grand, toujours monolithique Gemma 3 + vision, + multilingue Gemma 3n PLE + matformer nom E2B / E4B 4 Gemma 4 appareil-d'abord hérite PLE Même lignée à poids ouverts. Le tournant vers mobile-d'abord se produit avec les modèles mis en évidence à droite.
Où la famille a pivoté. PLE et matformer sont entrés avec Gemma 3n ; Gemma 4 est ce qui se passe quand toute la ligne principale est conçue pour ce monde.

Ce qui est important dans Gemma 4 n'est pas un score de benchmark. C'est que l'architecture a été conçue à l'envers depuis « doit bien fonctionner sur un téléphone milieu de gamme », pas vers l'avant depuis « doit battre GPT-4 sur le papier ».

PLE : l'astuce qui a permis à 2B paramètres de tenir sur un GPU de téléphone

Voici une contrainte spécifique et concrète que la plupart des gens n'entendent jamais. De nombreux téléphones Android populaires — un Samsung Galaxy S23 Ultra, par exemple — exposent un maximum de 128 Mo par liaison comme tampon de stockage WebGPU. C'est la limite de taille d'un seul tenseur que le pilote GPU acceptera. Dépassez-le et le pilote rejette la liaison, et le modèle produit silencieusement du charabia ou se replie sur le CPU.

Dans un transformateur standard, le plus grand tenseur individuel est la table d'embeddings : taille du vocabulaire × dimension cachée. Pour un modèle multilingue moderne, cette table seule peut faire 150 à 260 Mo, même après la quantization INT8. En d'autres termes : sur une grande fraction de vrais téléphones, la table d'embeddings ne charge pas. Le modèle ne peut pas tourner sur le GPU. Le CPU fonctionne mais est 10 à 20 fois plus lent.

L'Embedding Par Couche est la réponse de Gemma 4. Au lieu d'une énorme table d'embeddings, les embeddings sont répartis entre les couches, de sorte que chaque tenseur reste confortablement sous le plafond de 128 Mo. Le nombre total de paramètres est similaire, mais la forme est différente — et c'est la forme qui détermine réellement si le modèle tourne sur du vrai matériel.

Pourquoi la forme du modèle est importante Transformateur standard une énorme table d'embeddings vocab × caché ≈ 155 Mo ✕ déborde tampon GPU de 128 Mo Gemma 4 (PLE) embeddings répartis par couche C1 C2 C3 C4 C5 C6 C7 C8 C9 ✓ chaque tenseur bien sous 128 Mo Tourne sur le GPU du téléphone ? SLM standard (Qwen 0.6B, Llama 3.2 1B, Gemma 3 1B) : non — repli CPU, 10–20× plus lent Gemma 4 E2B / E4B (PLE) : oui — inférence GPU complète
Même nombre de paramètres, forme différente. La raison pour laquelle Gemma 4 tourne là où d'autres petits modèles ne tournent pas, c'est la disposition des tenseurs, pas la taille du modèle.

Matformer : ce que E2B et E4B signifient vraiment

Le E dans E2B et E4B signifie Effectif. Un modèle E2B se comporte comme un modèle dense de 2 milliards de paramètres pour les tâches qui comptent ; un E4B comme un modèle dense de 4B. Mais sous le capot, ils proviennent tous les deux des mêmes poids.

Le mécanisme s'appelle matformer — pensez aux poupées matriochkas, mais pour les réseaux de neurones. Pendant l'entraînement, le modèle est optimisé de sorte que ses paramètres forment une hiérarchie imbriquée : vous pouvez trancher le modèle à différentes profondeurs et largeurs et obtenir un sous-modèle plus petit qui se comporte encore de manière cohérente. À partir d'un ensemble maître de poids, Google peut découper E2B pour les téléphones avec moins de mémoire et E4B pour les téléphones avec plus d'espace.

Matformer : un entraînement, deux tailles effectives Poids maîtres entraînés de bout en bout hiérarchie imbriquée E2B ⊂ E4B découper à l'inférence E2B Effectif ~2B E4B Effectif ~4B (contient E2B) Quelle tranche se charge ? 📱 téléphone milieu de gamme → E2B 📱 plus de RAM / haut de gamme → E4B 💻 ordinateur portable → l'un ou l'autre Vous ne choisissez pas entre deux produits. Vous choisissez où sur le même modèle se situe votre appareil.
Des poupées matriochkas, mais pour les réseaux de neurones. Le modèle plus petit vit à l'intérieur du plus grand ; l'appareil décide jusqu'où aller chercher.

Comment Gemma 4 se compare aux autres petits modèles

L'espace à 2B et en dessous est plus encombré que la plupart ne le réalisent. Voici un regard honnête sur la liste restreinte, avec la question pratique tourne-t-il sur un GPU Android milieu de gamme ? au premier plan.

ModèleParamètresTaille d'embedding (INT8)Tient dans un tampon de 128 Mo ?
Qwen3 0.6B0.6B≈ 155 Mo✕ repli CPU
Gemma 3 1B1B≈ 151 Mo (même INT4)✕ repli CPU
Llama 3.2 1B1B≈ 262 Mo✕ repli CPU
Qwen3 1.7B1.7B≈ 311 Mo✕ repli CPU
IBM Granite 4.0 350M0.35B≈ 102 Mo✓ (petit vocabulaire, multilingue plus faible)
Gemma 4 E2B (PLE)Effectif 2Bréparti par couche✓ GPU complet
Gemma 4 E4B (PLE)Effectif 4Bréparti par couche✓ GPU complet (avec assez de RAM)
Ce que le repli CPU vous coûte vraiment Temps de prefill pour le même prompt système de ~3 700 caractères, même téléphone (Snapdragon 8 Gen 2) Modèle non-PLE, repli CPU > 20 secondes Gemma 4 (PLE), GPU complet ≈ 1 seconde 0s 10s 20s+
Une seconde, c'est une conversation. Vingt secondes, c'est un rapport de bug. Même téléphone, même prompt, architecture différente — c'est tout le jeu.

Où essayer Gemma 4 aujourd'hui

Sur votre téléphone : Gist&Chat (E2B, gratuit)

Gist&Chat est une application Android gratuite construite autour de Gemma 4 E2B. Au premier lancement, il télécharge le modèle en Wi-Fi — un unique téléchargement de ~2,6 Go — et à partir de là, l'IA tourne entièrement sur votre téléphone. Vous obtenez :

E4B sur Pro (à venir)

La variante plus grande Gemma 4 E4B arrivera dans le prochain niveau Pro de Gist&Chat. E4B double les paramètres effectifs — notablement meilleur en raisonnement, Q&R de long contexte et tâches proches du code — mais nécessite un téléphone avec plus de RAM pour rester fluide.

Sur ordinateur portable ou de bureau

Vous préférez expérimenter sur une machine plus grande ? Les poids Gemma 4 de Google sont disponibles via l'écosystème habituel de modèles ouverts — Hugging Face, Ollama, LM Studio, Jan, GPT4All. Nous comparons tout ce catalogue de bureau avec le panorama mobile dans alternatives hors ligne à ChatGPT : les vraies options en 2026.

Les limites honnêtes

Un guide qui saute cette section est un communiqué de presse. Ce que Gemma 4 E2B n'égalera pas :

Essayez Gemma 4 sur votre téléphone, gratuitement

Gist&Chat inclut Gemma 4 E2B d'emblée — chat IA privé plus résumés YouTube, articles et PDFs, en 11 langues. La variante E4B plus grande arrivera sur Pro.

▶ Téléchargez Gist&Chat gratuitement sur Google Play

Téléchargement gratuit · Téléchargement unique du modèle ~2,6 Go en Wi-Fi · Pas un octet de votre chat ne quitte le téléphone — politique de confidentialité

Questions fréquemment posées

Qu'est-ce que Gemma 4 et en quoi diffère-t-il des modèles Gemma précédents ?

Gemma 4 est la famille de petits modèles de Google conçue d'abord pour l'appareil. Contrairement à Gemma 1, 2 et 3, Gemma 4 utilise une architecture PLE héritée de Gemma 3n. Les embeddings sont répartis par couche, ce qui maintient chaque tenseur assez petit pour les GPU de téléphone.

Que signifient E2B et E4B dans Gemma 4 ?

Le E signifie Effectif. E2B se comporte comme un modèle dense de 2B paramètres, et E4B comme un de 4B. Les deux proviennent des mêmes poids matformer, donc l'appareil peut choisir la taille effective qui correspond à son budget RAM.

Pourquoi l'architecture PLE est-elle importante pour l'utilisation sur l'appareil ?

Les GPU de téléphones milieu de gamme ont des limites de 128 Mo par tampon. Une table d'embeddings monolithique dans la plupart des LLMs dépasse déjà cette limite. PLE divise les embeddings par couche de sorte qu'aucun tenseur ne déborde ; le modèle tourne sur GPU plutôt que de se replier sur le lent CPU.

Puis-je exécuter Gemma 4 sur mon téléphone aujourd'hui ?

Oui. Gist&Chat est une application Android gratuite avec Gemma 4 E2B inclus : téléchargement unique, puis le modèle tourne entièrement sur votre téléphone pour le chat privé et les résumés. La variante E4B arrivera au niveau Pro pour les téléphones haut de gamme.

Comment Gemma 4 E2B se compare-t-il à d'autres petits modèles comme Phi, Qwen ou Llama 3.2 ?

Sur le papier, les nombres de paramètres semblent similaires. En pratique, la plupart des autres modèles de 1–2B ont des tables d'embeddings monolithiques qui ne chargent pas sur beaucoup de GPU mobiles. L'architecture PLE de Gemma 4 est actuellement le moyen le plus fiable d'exécuter un modèle de classe 2B sur le GPU d'un téléphone milieu de gamme.


Plus de gist-ai.net : ce qu'est vraiment l'IA sur l'appareil (et pourquoi ça marche), alternatives hors ligne à ChatGPT — les vraies options en 2026, le chatbot IA qui fonctionne en mode avion, comment résumer n'importe quelle vidéo YouTube avec l'IA, résumer des articles, PDFs et photos de texte — hors ligne, pratiquer une langue avec une IA dans votre poche et outils gratuits pour les créateurs — jamais besoin de s'inscrire.

Construit dans les heures silencieuses, entre tout le reste. Si ça a aidé — ☕ Offrez-moi un café
Gist&Chat
Gist&Chat App Gemma 4 E2B, sur l'appareil Gratuit sur Google Play