Qué es realmente un "modelo de lenguaje pequeño"
Un modelo de lenguaje grande (LLM) es lo que impulsa a ChatGPT y similares — cientos de miles de millones de parámetros, viviendo en racks de GPUs en un centro de datos. Un modelo de lenguaje pequeño (SLM) es la misma idea básica, reducida para ejecutarse en algo que puedas sostener: un portátil, un teléfono, la pantalla de un coche, un robot. En la práctica, "pequeño" generalmente significa unos pocos miles de millones de parámetros o menos, y los pesos del modelo son un archivo de pocos gigabytes en lugar de terabytes.
Los SLMs importan por exactamente una razón: dónde se ejecutan. Un modelo que cabe en un teléfono puede ser privado (nada viaja), gratuito por mensaje (sin factura de servidor) y sin conexión (sin red necesaria). Esas tres propiedades no existen en la IA en la nube, a ningún tamaño. La única pregunta es si el modelo pequeño es suficientemente bueno para la tarea — y para una lista creciente de tareas, la respuesta es finalmente sí.
Por qué la IA en el dispositivo era casi imposible hasta hace poco
El sueño de ejecutar un modelo de lenguaje real en un teléfono chocó con tres muros a la vez:
- Memoria. Los pesos de un LLM moderno son grandes; en un teléfono estás luchando contra el sistema operativo, el navegador, el juego que el usuario acaba de cerrar, y el killer de baja memoria que busca algo que expulsar. Un modelo que apenas cabe en un teléfono es uno que muere la primera vez que el usuario recibe una notificación.
- Cómputo. La inferencia de transformadores es un flujo de multiplicaciones de matrices. Las GPUs de los teléfonos son sorprendentemente buenas en esto — pero solo si los tensores del modelo caben en sus límites por buffer, y solo si el stack de software (LiteRT, MediaPipe, MLC, llama.cpp mobile) realmente llega a la GPU en lugar de recurrir al CPU.
- Batería y temperatura. El chip de un teléfono puede correr a toda velocidad brevemente, pero la carga sostenida se convierte en calor, y el calor se convierte en limitación térmica. Un modelo que responde el primer mensaje en dos segundos y el décimo en veinte es una demo, no un producto.
Cada historia anterior de "modelo pequeño en tu teléfono" fracasó en uno de estos tres muros. Gemma 4 es la primera familia que supera los tres a la vez — y lo hace gracias a dos decisiones arquitectónicas que vale la pena conocer.
La familia Gemma, brevemente
Los modelos Gemma de Google son los parientes de código abierto de Gemini — más pequeños, publicados para que cualquiera los ejecute, pero construidos con las lecciones del entrenamiento de los grandes. El linaje:
- Gemma 1 y 2 — modelos sólidos de pesos abiertos, pero esencialmente versiones pequeñas de un transformador estándar. Funcionaban bien en un portátil potente y tropezaban en un teléfono.
- Gemma 3 — añadió visión, mejor cobertura multilingüe, aún con arquitectura estándar.
- Gemma 3n — una variante enfocada en móviles. Introdujo el Embedding Por Capa (PLE) y el diseño de parámetros anidados matformer, y acuñó el nombre "E2B / E4B".
- Gemma 4 — la línea principal primero para el dispositivo. Hereda PLE y matformer, añade mejor seguimiento de instrucciones, mejor visión, mejor rendimiento multilingüe y una variante ajustada para chat lista para usar (E2B-it, E4B-it).
Lo importante de Gemma 4 no es una puntuación de benchmark. Es que la arquitectura fue diseñada al revés desde "debe funcionar bien en un teléfono de gama media", no hacia adelante desde "debe superar a GPT-4 en papel".
PLE: el truco que permite que 2B parámetros quepan en una GPU de teléfono
Aquí hay una restricción específica y concreta que la mayoría de la gente nunca escucha. Muchos teléfonos Android populares — un Samsung Galaxy S23 Ultra, por ejemplo — exponen un máximo de 128 MB por binding como buffer de almacenamiento WebGPU. Ese es el límite de tamaño de un único tensor que el controlador de GPU aceptará. Supéralo y el controlador rechaza el binding, y el modelo silenciosamente produce basura o recurre a la CPU.
En un transformador estándar, el mayor tensor individual es la tabla de embeddings: tamaño de vocabulario × dimensión oculta. Para un modelo multilingüe moderno, esta tabla sola puede ser de 150–260 MB, incluso después de la cuantización INT8. En otras palabras: en una gran fracción de teléfonos reales, la tabla de embeddings no carga. El modelo no puede ejecutarse en la GPU. El CPU funciona pero es 10–20× más lento.
Embedding Por Capa es la respuesta de Gemma 4. En lugar de una enorme tabla de embeddings, los embeddings se dividen entre capas, por lo que cada tensor está cómodamente por debajo del techo de 128 MB. El recuento total de parámetros es similar, pero la forma es diferente — y la forma es lo que realmente determina si el modelo corre en hardware real.
Matformer: qué significan realmente E2B y E4B
La E en E2B y E4B significa Efectivo. Un modelo E2B se comporta como un modelo denso de 2 mil millones de parámetros en las tareas que importan; un E4B como uno denso de 4B. Pero en el fondo, ambos provienen de los mismos pesos.
El mecanismo se llama matformer — piensa en muñecas matrioska, pero para redes neuronales. Durante el entrenamiento, el modelo se optimiza para que sus parámetros formen una jerarquía anidada: puedes cortar el modelo en diferentes profundidades y anchos y obtener un submodelo más pequeño que aún se comporta de forma coherente. De un conjunto maestro de pesos, Google puede tallar E2B para teléfonos con menos memoria y E4B para teléfonos con más espacio.
Cómo se compara Gemma 4 con otros modelos pequeños
El espacio de 2B y menos está más concurrido de lo que la mayoría cree. Aquí un vistazo honesto a la lista corta, con la pregunta práctica ¿corre en una GPU Android de gama media? al frente y al centro.
| Modelo | Parámetros | Tamaño de embedding (INT8) | ¿Cabe en buffer de 128 MB? |
|---|---|---|---|
| Qwen3 0.6B | 0.6B | ≈ 155 MB | ✕ recurre a CPU |
| Gemma 3 1B | 1B | ≈ 151 MB (incluso INT4) | ✕ recurre a CPU |
| Llama 3.2 1B | 1B | ≈ 262 MB | ✕ recurre a CPU |
| Qwen3 1.7B | 1.7B | ≈ 311 MB | ✕ recurre a CPU |
| IBM Granite 4.0 350M | 0.35B | ≈ 102 MB | ✓ (vocabulario pequeño, multilingüe más débil) |
| Gemma 4 E2B (PLE) | Efectivo 2B | dividido por capa | ✓ GPU completa |
| Gemma 4 E4B (PLE) | Efectivo 4B | dividido por capa | ✓ GPU completa (con suficiente RAM) |
La historia que cuenta la tabla: el recuento de parámetros es un proxy en el que la gente se fija, pero en teléfonos reales el factor decisivo es si el mayor tensor individual desborda el límite por buffer de la GPU. Para el panorama Android actual, PLE es la arquitectura que gana.
Dónde probar Gemma 4 hoy
En tu teléfono: Gist&Chat (E2B, gratis)
Gist&Chat es una app gratuita de Android construida alrededor de Gemma 4 E2B. En el primer lanzamiento, descarga el modelo por Wi-Fi — una descarga única de ~2,6 GB — y a partir de entonces la IA corre completamente en tu teléfono. Obtienes:
- Chat privado — voz o texto, memoria entre sesiones, pasa la prueba del modo avión. Ilimitado y gratis porque tu teléfono hace el cómputo.
- Resúmenes — pega un enlace de YouTube, una URL de artículo o un PDF / DOCX / foto de texto, obtén lo esencial, luego haz preguntas de seguimiento.
- 11 idiomas — incluidos los que realmente tienes probabilidades de practicar.
E4B en Pro (próximamente)
La variante más grande Gemma 4 E4B llegará al próximo nivel Pro de Gist&Chat. E4B duplica los parámetros efectivos — notablemente mejor en razonamiento, Q&A de contexto largo y tareas adyacentes al código — pero necesita un teléfono con más RAM para mantenerse fluido.
En un portátil o escritorio
¿Prefieres experimentar en una máquina más grande? Los pesos de Gemma 4 de Google están disponibles en el ecosistema habitual de modelos abiertos — Hugging Face, Ollama, LM Studio, Jan, GPT4All. Comparamos toda esa estantería de escritorio con el panorama móvil en alternativas offline a ChatGPT: las opciones reales en 2026.
Los límites honestos
Una guía que omite esta sección es un comunicado de prensa. Lo que Gemma 4 E2B no igualará:
- Razonamiento de frontera. Un modelo de 2B efectivo no es un modelo en la nube de 200B parámetros. Para derivaciones matemáticas de nivel universitario o síntesis de investigación novedosa, los gigantes de la nube aún ganan.
- Conocimiento actualizado. Los pesos son una instantánea de los datos de entrenamiento. Gemma 4 no sabe qué pasó ayer; para eso, aún necesitas algo con acceso a la web.
- Contextos muy largos en teléfonos muy pequeños. El modelo puede manejar entradas largas, pero la caché KV crece con la longitud del contexto; en un teléfono con 6 GB de RAM te quedarás sin memoria antes de alcanzar el límite de contexto del modelo.
- Salidas extrañas, a veces. Los modelos compactos aún ocasionalmente alucinan, confunden números o se repiten. Trata sus respuestas como las de un amigo inteligente en una tarde distraída: a menudo correctas, vale la pena verificar lo importante.
Prueba Gemma 4 en tu teléfono, gratis
Gist&Chat incluye Gemma 4 E2B de fábrica — chat privado con IA más resúmenes de YouTube, artículos y PDFs, en 11 idiomas. La variante E4B más grande llegará a Pro.
- Gemma 4 E2B, en el dispositivo — inferencia GPU completa en Android moderno
- Chat privado, ilimitado y gratis — sin cuenta, sin contador
- Resúmenes con preguntas de seguimiento — video, artículo, PDF, foto de texto (gratis para empezar)
- 11 idiomas — interfaz y conversación
- E4B en Pro, próximamente — modelo efectivo más grande para teléfonos con la RAM necesaria
Descarga gratuita · Descarga única del modelo ~2,6 GB por Wi-Fi · Ni un byte de tu chat sale del teléfono — política de privacidad
Preguntas frecuentes
¿Qué es Gemma 4 y en qué se diferencia de los modelos Gemma anteriores?
Gemma 4 es la familia de modelos pequeños de Google diseñada primero para el dispositivo. A diferencia de Gemma 1, 2 y 3, Gemma 4 usa una arquitectura PLE heredada de Gemma 3n. Los embeddings se dividen por capa, lo que mantiene cada tensor individual lo suficientemente pequeño para las GPUs de teléfonos.
¿Qué significan E2B y E4B en Gemma 4?
La E significa Efectivo. E2B es un modelo cuyo comportamiento es comparable al de un modelo denso de 2B parámetros, y E4B a uno de 4B. Ambos provienen de los mismos pesos matformer, por lo que un dispositivo puede elegir el tamaño efectivo que coincida con su presupuesto de RAM.
¿Por qué importa la arquitectura PLE para el uso en el dispositivo?
Las GPUs de teléfonos de gama media tienen límites de 128 MB por buffer. Una tabla de embeddings monolítica en la mayoría de los LLMs ya supera ese límite. PLE divide los embeddings por capa para que ningún tensor desborde el límite; el modelo corre en GPU en lugar de recurrir a la lenta CPU.
¿Puedo ejecutar Gemma 4 en mi teléfono hoy?
Sí. Gist&Chat es una app gratuita de Android con Gemma 4 E2B incluido: descarga única, y luego el modelo corre completamente en tu teléfono para chat privado y resúmenes. La variante E4B más grande llegará al nivel Pro para teléfonos de gama alta.
¿Cómo se compara Gemma 4 E2B con otros modelos pequeños como Phi, Qwen o Llama 3.2?
En papel, los recuentos de parámetros se ven similares. En la práctica, la mayoría de los otros modelos de 1–2B tienen tablas de embeddings monolíticas que no cargan en muchas GPUs móviles. La arquitectura PLE de Gemma 4 es actualmente la forma más confiable de ejecutar un modelo de clase 2B en la GPU de un teléfono de gama media.
Más de gist-ai.net: qué es realmente la IA en el dispositivo (y por qué funciona), alternativas offline a ChatGPT — las opciones reales en 2026, el chatbot de IA que funciona en modo avión, cómo resumir cualquier video de YouTube con IA, resumir artículos, PDFs y fotos de texto — sin conexión, practicar un idioma con IA en tu bolsillo y herramientas gratuitas para creadores — nunca necesitas registrarte.