Análisis · Modelos de Lenguaje Pequeños

Modelos de Lenguaje Pequeños en el Dispositivo — y Por Qué Gemma 4 E2B y E4B Cambiaron Todo

Lo más interesante que ocurre en la IA ahora mismo no es el modelo más grande. Es el más pequeño que es suficientemente bueno. En algún momento del último año, "modelo de lenguaje pequeño" dejó de significar "demo interesante" y empezó a significar "el modelo en la app de tu teléfono, ahora mismo, haciendo trabajo real". Esta es una guía en lenguaje sencillo sobre qué cambió, por qué la familia Gemma 4 de Google está en el centro de ello, y cómo probarlo hoy.

Qué es realmente un "modelo de lenguaje pequeño"

Un modelo de lenguaje grande (LLM) es lo que impulsa a ChatGPT y similares — cientos de miles de millones de parámetros, viviendo en racks de GPUs en un centro de datos. Un modelo de lenguaje pequeño (SLM) es la misma idea básica, reducida para ejecutarse en algo que puedas sostener: un portátil, un teléfono, la pantalla de un coche, un robot. En la práctica, "pequeño" generalmente significa unos pocos miles de millones de parámetros o menos, y los pesos del modelo son un archivo de pocos gigabytes en lugar de terabytes.

Los SLMs importan por exactamente una razón: dónde se ejecutan. Un modelo que cabe en un teléfono puede ser privado (nada viaja), gratuito por mensaje (sin factura de servidor) y sin conexión (sin red necesaria). Esas tres propiedades no existen en la IA en la nube, a ningún tamaño. La única pregunta es si el modelo pequeño es suficientemente bueno para la tarea — y para una lista creciente de tareas, la respuesta es finalmente sí.

El número más interesante en IA ahora mismo no es una puntuación de benchmark. Es el modelo más pequeño que supera el umbral para el trabajo que realmente necesitas hacer.

Por qué la IA en el dispositivo era casi imposible hasta hace poco

El sueño de ejecutar un modelo de lenguaje real en un teléfono chocó con tres muros a la vez:

Cada historia anterior de "modelo pequeño en tu teléfono" fracasó en uno de estos tres muros. Gemma 4 es la primera familia que supera los tres a la vez — y lo hace gracias a dos decisiones arquitectónicas que vale la pena conocer.

La familia Gemma, brevemente

Los modelos Gemma de Google son los parientes de código abierto de Gemini — más pequeños, publicados para que cualquiera los ejecute, pero construidos con las lecciones del entrenamiento de los grandes. El linaje:

Gemma 1 transformador estándar enfocado en portátil Gemma 2 más grande, aún monolítico Gemma 3 + visión, + multilingüe Gemma 3n PLE + matformer nombre E2B / E4B 4 Gemma 4 dispositivo-primero hereda PLE Mismo linaje de pesos abiertos. El giro hacia móvil-primero ocurre con los modelos resaltados a la derecha.
Dónde giró la familia. PLE y matformer entraron con Gemma 3n; Gemma 4 es lo que ocurre cuando toda la línea principal está diseñada para ese mundo.

Lo importante de Gemma 4 no es una puntuación de benchmark. Es que la arquitectura fue diseñada al revés desde "debe funcionar bien en un teléfono de gama media", no hacia adelante desde "debe superar a GPT-4 en papel".

PLE: el truco que permite que 2B parámetros quepan en una GPU de teléfono

Aquí hay una restricción específica y concreta que la mayoría de la gente nunca escucha. Muchos teléfonos Android populares — un Samsung Galaxy S23 Ultra, por ejemplo — exponen un máximo de 128 MB por binding como buffer de almacenamiento WebGPU. Ese es el límite de tamaño de un único tensor que el controlador de GPU aceptará. Supéralo y el controlador rechaza el binding, y el modelo silenciosamente produce basura o recurre a la CPU.

En un transformador estándar, el mayor tensor individual es la tabla de embeddings: tamaño de vocabulario × dimensión oculta. Para un modelo multilingüe moderno, esta tabla sola puede ser de 150–260 MB, incluso después de la cuantización INT8. En otras palabras: en una gran fracción de teléfonos reales, la tabla de embeddings no carga. El modelo no puede ejecutarse en la GPU. El CPU funciona pero es 10–20× más lento.

Embedding Por Capa es la respuesta de Gemma 4. En lugar de una enorme tabla de embeddings, los embeddings se dividen entre capas, por lo que cada tensor está cómodamente por debajo del techo de 128 MB. El recuento total de parámetros es similar, pero la forma es diferente — y la forma es lo que realmente determina si el modelo corre en hardware real.

Por qué importa la forma del modelo Transformador estándar una tabla de embeddings enorme vocab × oculto ≈ 155 MB ✕ desborda buffer GPU de 128 MB Gemma 4 (PLE) embeddings divididos por capa C1 C2 C3 C4 C5 C6 C7 C8 C9 ✓ cada tensor bien bajo los 128 MB ¿Corre en la GPU del teléfono? SLM estándar (Qwen 0.6B, Llama 3.2 1B, Gemma 3 1B): no — recurre a CPU, 10–20× más lento Gemma 4 E2B / E4B (PLE): sí — inferencia GPU completa
Mismo recuento de parámetros, forma diferente. La razón por la que Gemma 4 corre donde otros modelos pequeños no, es la disposición de los tensores, no el tamaño del modelo.

Matformer: qué significan realmente E2B y E4B

La E en E2B y E4B significa Efectivo. Un modelo E2B se comporta como un modelo denso de 2 mil millones de parámetros en las tareas que importan; un E4B como uno denso de 4B. Pero en el fondo, ambos provienen de los mismos pesos.

El mecanismo se llama matformer — piensa en muñecas matrioska, pero para redes neuronales. Durante el entrenamiento, el modelo se optimiza para que sus parámetros formen una jerarquía anidada: puedes cortar el modelo en diferentes profundidades y anchos y obtener un submodelo más pequeño que aún se comporta de forma coherente. De un conjunto maestro de pesos, Google puede tallar E2B para teléfonos con menos memoria y E4B para teléfonos con más espacio.

Matformer: un entrenamiento, dos tamaños efectivos Pesos maestros entrenados de extremo a extremo jerarquía anidada E2B ⊂ E4B cortar en tiempo de inferencia E2B Efectivo ~2B E4B Efectivo ~4B (contiene E2B) ¿Qué porción se carga? 📱 teléfono gama media → E2B 📱 más RAM / gama alta → E4B 💻 portátil → cualquiera No estás eligiendo entre dos productos. Estás eligiendo dónde en el mismo modelo se sitúa tu dispositivo.
Muñecas matrioska, pero para redes neuronales. El modelo más pequeño vive dentro del más grande; el dispositivo decide cuán profundo llegar.

Cómo se compara Gemma 4 con otros modelos pequeños

El espacio de 2B y menos está más concurrido de lo que la mayoría cree. Aquí un vistazo honesto a la lista corta, con la pregunta práctica ¿corre en una GPU Android de gama media? al frente y al centro.

ModeloParámetrosTamaño de embedding (INT8)¿Cabe en buffer de 128 MB?
Qwen3 0.6B0.6B≈ 155 MB✕ recurre a CPU
Gemma 3 1B1B≈ 151 MB (incluso INT4)✕ recurre a CPU
Llama 3.2 1B1B≈ 262 MB✕ recurre a CPU
Qwen3 1.7B1.7B≈ 311 MB✕ recurre a CPU
IBM Granite 4.0 350M0.35B≈ 102 MB✓ (vocabulario pequeño, multilingüe más débil)
Gemma 4 E2B (PLE)Efectivo 2Bdividido por capa✓ GPU completa
Gemma 4 E4B (PLE)Efectivo 4Bdividido por capa✓ GPU completa (con suficiente RAM)

La historia que cuenta la tabla: el recuento de parámetros es un proxy en el que la gente se fija, pero en teléfonos reales el factor decisivo es si el mayor tensor individual desborda el límite por buffer de la GPU. Para el panorama Android actual, PLE es la arquitectura que gana.

Lo que realmente te cuesta el recurso al CPU Tiempo de prefill para el mismo prompt de sistema de ~3.700 caracteres, mismo teléfono (Snapdragon 8 Gen 2) Modelo no-PLE, recurso a CPU > 20 segundos Gemma 4 (PLE), GPU completa ≈ 1 segundo 0s 10s 20s+
Un segundo es una conversación. Veinte segundos es un reporte de error. Mismo teléfono, mismo prompt, arquitectura diferente — ese es todo el juego.

Dónde probar Gemma 4 hoy

En tu teléfono: Gist&Chat (E2B, gratis)

Gist&Chat es una app gratuita de Android construida alrededor de Gemma 4 E2B. En el primer lanzamiento, descarga el modelo por Wi-Fi — una descarga única de ~2,6 GB — y a partir de entonces la IA corre completamente en tu teléfono. Obtienes:

E4B en Pro (próximamente)

La variante más grande Gemma 4 E4B llegará al próximo nivel Pro de Gist&Chat. E4B duplica los parámetros efectivos — notablemente mejor en razonamiento, Q&A de contexto largo y tareas adyacentes al código — pero necesita un teléfono con más RAM para mantenerse fluido.

En un portátil o escritorio

¿Prefieres experimentar en una máquina más grande? Los pesos de Gemma 4 de Google están disponibles en el ecosistema habitual de modelos abiertos — Hugging Face, Ollama, LM Studio, Jan, GPT4All. Comparamos toda esa estantería de escritorio con el panorama móvil en alternativas offline a ChatGPT: las opciones reales en 2026.

Los límites honestos

Una guía que omite esta sección es un comunicado de prensa. Lo que Gemma 4 E2B no igualará:

Prueba Gemma 4 en tu teléfono, gratis

Gist&Chat incluye Gemma 4 E2B de fábrica — chat privado con IA más resúmenes de YouTube, artículos y PDFs, en 11 idiomas. La variante E4B más grande llegará a Pro.

▶ Descarga Gist&Chat gratis en Google Play

Descarga gratuita · Descarga única del modelo ~2,6 GB por Wi-Fi · Ni un byte de tu chat sale del teléfono — política de privacidad

Preguntas frecuentes

¿Qué es Gemma 4 y en qué se diferencia de los modelos Gemma anteriores?

Gemma 4 es la familia de modelos pequeños de Google diseñada primero para el dispositivo. A diferencia de Gemma 1, 2 y 3, Gemma 4 usa una arquitectura PLE heredada de Gemma 3n. Los embeddings se dividen por capa, lo que mantiene cada tensor individual lo suficientemente pequeño para las GPUs de teléfonos.

¿Qué significan E2B y E4B en Gemma 4?

La E significa Efectivo. E2B es un modelo cuyo comportamiento es comparable al de un modelo denso de 2B parámetros, y E4B a uno de 4B. Ambos provienen de los mismos pesos matformer, por lo que un dispositivo puede elegir el tamaño efectivo que coincida con su presupuesto de RAM.

¿Por qué importa la arquitectura PLE para el uso en el dispositivo?

Las GPUs de teléfonos de gama media tienen límites de 128 MB por buffer. Una tabla de embeddings monolítica en la mayoría de los LLMs ya supera ese límite. PLE divide los embeddings por capa para que ningún tensor desborde el límite; el modelo corre en GPU en lugar de recurrir a la lenta CPU.

¿Puedo ejecutar Gemma 4 en mi teléfono hoy?

Sí. Gist&Chat es una app gratuita de Android con Gemma 4 E2B incluido: descarga única, y luego el modelo corre completamente en tu teléfono para chat privado y resúmenes. La variante E4B más grande llegará al nivel Pro para teléfonos de gama alta.

¿Cómo se compara Gemma 4 E2B con otros modelos pequeños como Phi, Qwen o Llama 3.2?

En papel, los recuentos de parámetros se ven similares. En la práctica, la mayoría de los otros modelos de 1–2B tienen tablas de embeddings monolíticas que no cargan en muchas GPUs móviles. La arquitectura PLE de Gemma 4 es actualmente la forma más confiable de ejecutar un modelo de clase 2B en la GPU de un teléfono de gama media.


Más de gist-ai.net: qué es realmente la IA en el dispositivo (y por qué funciona), alternativas offline a ChatGPT — las opciones reales en 2026, el chatbot de IA que funciona en modo avión, cómo resumir cualquier video de YouTube con IA, resumir artículos, PDFs y fotos de texto — sin conexión, practicar un idioma con IA en tu bolsillo y herramientas gratuitas para creadores — nunca necesitas registrarte.

Construido en las horas tranquilas, entre todo lo demás. Si ayudó — ☕ Invítame a un café
Gist&Chat
Gist&Chat App Gemma 4 E2B, en el dispositivo Gratis en Google Play