O que é um "modelo de linguagem pequeno" de verdade
Os grandes modelos de linguagem (LLMs) são o que alimenta o ChatGPT e similares — centenas de bilhões de parâmetros vivendo em racks de GPUs em data centers. Os modelos de linguagem pequenos (SLMs) comprimem a mesma ideia básica até um tamanho que cabe em dispositivos portáteis: notebook, celular, central de carro, robô. Na prática, "pequeno" significa bilhões de parâmetros ou menos, e os pesos do modelo cabem em gigabytes, não terabytes.
Por que os SLMs importam? Por uma razão: onde rodam. Um modelo que cabe no celular pode ser privado (nada é enviado), gratuito por mensagem (sem custo de servidor) e offline (sem rede). Essas três propriedades não existem em IA na nuvem — em nenhum tamanho. O único problema é se o SLM é bom o suficiente para a tarefa — e para uma lista cada vez maior de tarefas, a resposta está se tornando "sim".
Por que a IA em dispositivos era quase impossível até pouco tempo atrás
O sonho de rodar um modelo de linguagem de verdade no celular esbarrava em três barreiras ao mesmo tempo:
- Memória. Os pesos de LLMs modernos são grandes. No celular você compete com o sistema operacional, o navegador, o jogo que foi fechado há pouco e o mecanismo de baixa memória procurando o que expulsar. Um modelo que mal cabe no celular é um modelo que morre quando chegar a primeira notificação.
- Poder de processamento. A inferência em transformers é multiplicação de matrizes em cadeia. A GPU do celular é surpreendentemente boa nisso — mas só se os tensores do modelo couberem nos limites de buffer, e se a pilha de software (LiteRT, MediaPipe, MLC, llama.cpp mobile) chegar de fato à GPU.
- Bateria e calor. Os chips de celular conseguem dar tudo de si por um curto período, mas carga contínua vira calor, e calor vira throttling térmico. Um modelo que responde em 2 segundos à primeira mensagem e em 20 segundos à décima é uma demo, não um produto.
Cada tentativa anterior de "modelos pequenos no celular" falhava em pelo menos um desses três pontos. O Gemma 4 é a primeira família a resolver os três ao mesmo tempo — e o motivo são duas escolhas de arquitetura que vale a pena entender.
Visão geral da família Gemma
Os modelos Gemma do Google são primos das versões com pesos abertos do Gemini — menores, lançados para que qualquer um possa rodar, mas construídos com o aprendizado do treinamento de modelos maiores. A linhagem:
- Gemma 1 e 2 — ótimos modelos com pesos abertos, mas essencialmente versões menores do transformador padrão. Funcionavam bem em notebooks potentes, sofriam no celular.
- Gemma 3 — adição de visão, melhor multilíngue, ainda arquitetura padrão.
- Gemma 3n — a versão mobile-first. Introduziu o Per-Layer Embedding (PLE) e o design de parâmetros aninhados matformer, criando a nomenclatura "E2B / E4B".
- Gemma 4 — a linha principal com foco em dispositivos. Herda PLE e matformer, com melhor seguimento de instruções, visão, desempenho multilíngue e variantes prontas para chat (E2B-it, E4B-it).
O que importa no Gemma 4 não é a pontuação em benchmarks. É que a arquitetura foi projetada de trás para frente a partir de "tem que rodar confortavelmente num celular intermediário" — não de "tem que superar o GPT-4 no papel".
PLE: o truque para caber 2B parâmetros na memória do celular
Existe uma restrição específica que a maioria das pessoas nunca ouviu falar. Muitos celulares Android populares (como o Samsung Galaxy S23 Ultra) fornecem apenas 128 MB por binding para buffers de armazenamento WebGPU. Esse é o tamanho máximo de um único tensor que o driver de GPU aceita. Passe disso e o driver rejeita o binding; o modelo produz lixo silenciosamente ou cai para a CPU.
Num transformador padrão, o maior tensor único é a tabela de embeddings: tamanho do vocabulário × dimensão oculta. Em modelos multilíngues modernos, essa tabela pode chegar a 150–260 MB mesmo após quantização INT8. Em outras palavras: muitos celulares reais simplesmente não conseguem carregar a tabela de embeddings. O modelo não pode rodar na GPU. O fallback para CPU funciona, mas é de 10 a 20 vezes mais lento.
Per-Layer Embedding é a resposta do Gemma 4. Em vez de uma única tabela enorme, ele distribui os embeddings pelas camadas, mantendo cada tensor bem abaixo do limite de 128 MB. O número total de parâmetros é semelhante, mas a forma é diferente — e a forma é o que determina se o modelo funciona no hardware real.
Matformer: o que E2B e E4B significam de verdade
O E em E2B e E4B significa Efetivo. O E2B é um modelo que se comporta como um modelo denso de 2 bilhões de parâmetros nas tarefas importantes; o E4B equivale a 4 bilhões. Mas internamente, os dois vêm dos mesmos pesos.
O mecanismo chama-se matformer — imagine uma boneca matrioska para redes neurais. Durante o treinamento, o modelo é otimizado para que os parâmetros formem uma hierarquia aninhada: você pode cortar o modelo em diferentes profundidades e larguras e ainda obter submodelos menores que funcionam de forma coerente. De um único conjunto de pesos mestre, o Google pode fatiar o E2B para celulares com menos RAM e o E4B para os que têm mais.
Gemma 4 vs. outros modelos pequenos
O espaço abaixo de 2B é mais concorrido do que a maioria imagina. Veja uma lista honesta com foco na pergunta prática: funciona na GPU de um Android intermediário?
| Modelo | Parâmetros | Tamanho do embedding (INT8) | Cabe no buffer de 128 MB? |
|---|---|---|---|
| Qwen3 0.6B | 0,6B | ≈ 155 MB | ✕ Fallback CPU |
| Gemma 3 1B | 1B | ≈ 151 MB (mesmo em INT4) | ✕ Fallback CPU |
| Llama 3.2 1B | 1B | ≈ 262 MB | ✕ Fallback CPU |
| Qwen3 1.7B | 1,7B | ≈ 311 MB | ✕ Fallback CPU |
| IBM Granite 4.0 350M | 0,35B | ≈ 102 MB | ✓ (vocabulário pequeno, multilíngue limitado) |
| Gemma 4 E2B (PLE) | Efetivo 2B | Distribuído por camada | ✓ GPU completa |
| Gemma 4 E4B (PLE) | Efetivo 4B | Distribuído por camada | ✓ GPU completa (com RAM suficiente) |
Onde experimentar o Gemma 4 hoje
No celular: Gist&Chat (E2B, gratuito)
Gist&Chat é um app Android gratuito com Gemma 4 E2B integrado. Na primeira inicialização você baixa o modelo pelo Wi-Fi — uma vez, cerca de 2,6 GB — e depois a IA roda inteiramente no seu celular. O que você pode fazer:
- Chat privado — por voz ou texto, memória entre sessões, passa no teste do modo avião. Ilimitado e gratuito porque é o seu celular que processa.
- Resumos — cole um link do YouTube, URL de artigo ou PDF / DOCX / foto de texto, obtenha os pontos principais e faça perguntas.
- 11 idiomas — incluindo os que você provavelmente vai praticar.
E4B no Pro (em breve)
A variante maior Gemma 4 E4B estará disponível no nível Pro do Gist&Chat. O E4B dobra os parâmetros efetivos — notavelmente melhor em raciocínio, Q&A de longo contexto e tarefas de código — mas requer um celular com RAM suficiente para rodar confortavelmente.
No notebook ou desktop
Quer experimentar numa máquina maior? Os pesos do Gemma 4 do Google estão disponíveis no ecossistema padrão de modelos abertos — Hugging Face, Ollama, LM Studio, Jan, GPT4All. Fazemos uma comparação completa das opções desktop com as móveis em Alternativa offline ao ChatGPT — as opções reais em 2026.
Limitações honestas
Guias que pulam esta seção são press releases. O que o Gemma 4 E2B não alcança:
- Raciocínio de ponta. Um modelo efetivo de 2B não é um modelo de 200B na nuvem. Para derivações matemáticas de nível de pós-graduação ou síntese de pesquisa inédita, a nuvem ainda ganha.
- Conhecimento atualizado. Os pesos são um instantâneo dos dados de treinamento. O Gemma 4 não sabe o que aconteceu ontem — para isso você precisa de algo com acesso à web.
- Contexto muito longo em celulares com pouca memória. O modelo consegue processar entradas longas, mas o cache KV cresce com o tamanho do contexto. Em celulares com 6 GB de RAM você pode ficar sem memória antes de atingir o limite de contexto do modelo.
- Saídas estranhas ocasionais. Modelos compactos ainda alucinam às vezes, confundem números ou entram em loop. Verifique o que é importante; trate-os como um amigo esperto numa tarde distraída: frequentemente corretos, mas vale checar o que é crítico.
Experimente o Gemma 4 de graça no celular
Gist&Chat traz o Gemma 4 E2B — chat de IA privado e resumos de YouTube, artigos e PDFs em 11 idiomas. A variante E4B maior chega no Pro.
- Gemma 4 E2B, no dispositivo — inferência GPU completa no Android moderno
- Chat privado, ilimitado e gratuito — sem conta, sem cobrança
- Resumos com Q&A adicional — vídeos, artigos, PDFs, fotos de texto (grátis para começar)
- 11 idiomas — interface e conversa
- E4B no Pro, em breve — modelo efetivo maior para celulares com RAM suficiente
Download gratuito · Baixe o modelo uma vez via Wi-Fi, cerca de 2,6 GB · Nenhum byte do seu chat sai do celular — política de privacidade
Perguntas frequentes
O que é o Gemma 4 e no que ele difere dos modelos Gemma anteriores?
O Gemma 4 é a família de modelos pequenos com foco em dispositivos do Google. Diferente do Gemma 1, 2 e 3, usa a arquitetura PLE introduzida no Gemma 3n. Distribui os embeddings por camada, mantendo cada tensor dentro dos limites de memória da GPU do celular.
O que significam E2B e E4B no Gemma 4?
E significa "Efetivo". O E2B se comporta como um modelo denso de 2 bilhões de parâmetros; o E4B equivale a 4 bilhões. Os dois vêm dos mesmos pesos Matformer, então o dispositivo escolhe o tamanho efetivo que cabe no orçamento de RAM.
Por que a arquitetura PLE é importante para uso em dispositivos?
As GPUs de celulares intermediários têm um limite de buffer de 128 MB. A tabela de embeddings monolítica de LLMs modernos já ultrapassa esse limite. O PLE distribui os embeddings por camada, garantindo que nenhum tensor passe do limite. O modelo roda na GPU sem fallback para a CPU.
Já posso usar o Gemma 4 no meu celular agora?
Sim. O Gist&Chat é um app Android gratuito com Gemma 4 E2B. Após baixar uma vez, roda inteiramente no celular para chat privado e resumos. A variante E4B está prevista no nível Pro para celulares top de linha.
Como o Gemma 4 E2B se compara a Phi, Qwen, Llama 3.2 e outros?
No papel os parâmetros são semelhantes, mas na prática a maioria dos outros modelos de 1–2B tem tabelas de embeddings monolíticas que não carregam no celular. A arquitetura PLE do Gemma 4 é atualmente a forma mais confiável de rodar um modelo de verdade da classe 2B na GPU de celulares intermediários.
Mais no gist-ai.net: O que é IA em dispositivo de verdade (e por que funciona), Alternativa offline ao ChatGPT — as opções reais em 2026, Chatbot de IA que funciona no modo avião, Como resumir vídeos do YouTube com IA, Resumir artigos, PDFs e fotos de texto offline, Praticar idiomas com a IA no bolso, Ferramentas gratuitas para criadores — sem cadastro.