Apa sebenarnya "model bahasa kecil" itu
Model bahasa besar (LLM) adalah yang menggerakkan ChatGPT dan sejenisnya — ratusan miliar parameter, hidup di rak GPU di pusat data. Model bahasa kecil (SLM) adalah ide dasar yang sama, diperkecil untuk berjalan di sesuatu yang bisa Anda pegang: laptop, ponsel, head-unit mobil, robot. Dalam praktiknya, "kecil" biasanya berarti beberapa miliar parameter atau kurang, dan bobot model adalah file berukuran beberapa gigabyte bukan terabyte.
SLM penting karena tepat satu alasan: di mana mereka berjalan. Model yang muat di ponsel bisa bersifat pribadi (tidak ada yang dikirim ke luar), gratis per pesan (tidak ada tagihan server), dan offline (tidak perlu jaringan). Ketiga properti itu tidak ada dalam AI cloud, ukuran apa pun. Satu-satunya pertanyaan adalah apakah model kecil cukup baik untuk tugas itu — dan untuk daftar tugas yang terus bertambah, jawabannya akhirnya ya.
Mengapa AI di perangkat hampir mustahil sampai baru-baru ini
Impian menjalankan model bahasa nyata di ponsel menabrak tiga tembok sekaligus:
- Memori. Bobot LLM modern berukuran besar; di ponsel Anda bersaing dengan OS, browser, game yang baru ditutup pengguna, dan low-memory killer yang mencari sesuatu untuk dikeluarkan. Model yang baru saja muat di ponsel adalah model yang mati saat pengguna mendapat notifikasi pertama kali.
- Komputasi. Inferensi transformer adalah aliran perkalian matriks. GPU ponsel mengejutkan baiknya dalam hal ini — tetapi hanya jika tensor model muat dalam batas per-buffer mereka, dan hanya jika stack perangkat lunak (LiteRT, MediaPipe, MLC, llama.cpp mobile) benar-benar mencapai GPU alih-alih jatuh ke CPU.
- Baterai dan termal. Chip ponsel bisa berjalan penuh sesaat, tetapi beban berkelanjutan berubah menjadi panas, dan panas berubah menjadi thermal throttling. Model yang menjawab pesan pertama dalam dua detik dan kesepuluh dalam dua puluh detik adalah demo, bukan produk.
Setiap kisah "model kecil di ponsel Anda" sebelumnya kandas di salah satu dari tiga tembok ini. Gemma 4 adalah keluarga pertama yang melewati ketiganya sekaligus — dan ini berhasil berkat dua pilihan arsitektur yang perlu diketahui.
Keluarga Gemma, singkatnya
Model Gemma Google adalah kerabat open-weight dari Gemini — lebih kecil, dirilis untuk dijalankan siapa saja, tetapi dibangun dengan pelajaran dari pelatihan model besar. Silsilahnya:
- Gemma 1 dan 2 — model open-weight yang solid, tetapi pada dasarnya versi kecil dari transformer standar. Berjalan baik di laptop bertenaga dan tersandung di ponsel.
- Gemma 3 — menambahkan visi, cakupan multibahasa yang lebih baik, masih arsitektur standar.
- Gemma 3n — versi yang berfokus pada mobile. Memperkenalkan Per-Layer Embedding (PLE) dan desain parameter bersarang matformer, dan menciptakan penamaan "E2B / E4B".
- Gemma 4 — lini utama yang mengutamakan perangkat. Mewarisi PLE dan matformer, menambahkan instruction-following yang lebih baik, visi yang lebih baik, performa multibahasa yang lebih baik, dan varian yang disetel untuk obrolan yang siap digunakan (E2B-it, E4B-it).
Yang penting dari Gemma 4 bukan skor benchmark. Arsitekturnya dirancang mundur dari "harus berjalan baik di ponsel kelas menengah", bukan maju dari "harus mengalahkan GPT-4 di atas kertas".
PLE: trik yang memungkinkan 2B parameter muat di GPU ponsel
Berikut batasan spesifik dan konkret yang jarang didengar kebanyakan orang. Banyak ponsel Android populer — Samsung Galaxy S23 Ultra, misalnya — hanya menyediakan 128 MB per binding sebagai buffer penyimpanan WebGPU. Itu adalah batas ukuran satu tensor yang akan diterima driver GPU. Melampaui ini dan driver menolak binding, model diam-diam menghasilkan sampah atau jatuh ke CPU.
Dalam transformer standar, tensor terbesar adalah tabel embedding: ukuran kosakata × dimensi tersembunyi. Untuk model multibahasa modern, tabel ini saja bisa 150–260 MB, bahkan setelah kuantisasi INT8. Dengan kata lain: di sebagian besar ponsel nyata, tabel embedding tidak bisa dimuat. Model tidak bisa berjalan di GPU. Fallback CPU berfungsi tetapi 10–20× lebih lambat.
Per-Layer Embedding adalah jawaban Gemma 4. Alih-alih satu tabel embedding besar, embedding dibagi antar lapisan sehingga setiap tensor nyaman di bawah batas 128 MB. Jumlah parameter keseluruhan serupa, tetapi bentuknya berbeda — dan bentuk itulah yang sebenarnya menentukan apakah model berjalan di hardware nyata.
Matformer: apa yang sebenarnya dimaksud E2B dan E4B
E dalam E2B dan E4B singkatan dari Effective (Efektif). Model E2B berperilaku seperti model padat 2 miliar parameter dalam tugas yang penting; E4B seperti model padat 4B. Tetapi di balik layar, keduanya berasal dari bobot yang sama.
Mekanismenya disebut matformer — bayangkan boneka matrioshka, tetapi untuk jaringan saraf. Selama pelatihan, model dioptimalkan agar parameternya membentuk hierarki bersarang: Anda dapat memotong model pada kedalaman dan lebar yang berbeda dan mendapatkan sub-model yang lebih kecil yang masih berperilaku koheren. Dari satu set bobot master, Google dapat mengukir E2B untuk ponsel dengan memori lebih sedikit dan E4B untuk ponsel dengan lebih banyak ruang.
Bagaimana Gemma 4 dibandingkan dengan model kecil lainnya
Ruang 2B ke bawah lebih padat dari yang disadari kebanyakan orang. Berikut pandangan jujur tentang daftar pendek, dengan pertanyaan praktis apakah berjalan di GPU Android kelas menengah? di depan dan di tengah.
| Model | Parameter | Ukuran embedding (INT8) | Muat dalam buffer 128 MB? |
|---|---|---|---|
| Qwen3 0.6B | 0.6B | ≈ 155 MB | ✕ fallback CPU |
| Gemma 3 1B | 1B | ≈ 151 MB (bahkan INT4) | ✕ fallback CPU |
| Llama 3.2 1B | 1B | ≈ 262 MB | ✕ fallback CPU |
| Qwen3 1.7B | 1.7B | ≈ 311 MB | ✕ fallback CPU |
| IBM Granite 4.0 350M | 0.35B | ≈ 102 MB | ✓ (kosakata kecil, multibahasa lebih lemah) |
| Gemma 4 E2B (PLE) | Efektif 2B | dibagi per lapisan | ✓ GPU penuh |
| Gemma 4 E4B (PLE) | Efektif 4B | dibagi per lapisan | ✓ GPU penuh (dengan RAM yang cukup) |
Di mana mencoba Gemma 4 hari ini
Di ponsel Anda: Gist&Chat (E2B, gratis)
Gist&Chat adalah aplikasi Android gratis yang dibangun di sekitar Gemma 4 E2B. Saat pertama kali diluncurkan, ia mengunduh model melalui Wi-Fi — unduhan sekali saja ~2,6 GB — dan setelah itu AI berjalan sepenuhnya di ponsel Anda. Anda mendapatkan:
- Obrolan pribadi — suara atau teks, memori antar sesi, lulus uji mode pesawat. Tidak terbatas dan gratis karena ponsel Anda yang melakukan komputasi.
- Ringkasan — tempel tautan YouTube, URL artikel, atau PDF / DOCX / foto teks, dapatkan intinya, lalu ajukan pertanyaan lanjutan.
- 11 bahasa — termasuk yang kemungkinan besar akan Anda latih.
E4B di Pro (segera hadir)
Varian Gemma 4 E4B yang lebih besar akan hadir di tingkat Pro Gist&Chat yang akan datang. E4B menggandakan parameter efektif — jauh lebih baik dalam penalaran, Q&A konteks panjang, dan tugas yang berdekatan dengan kode — tetapi membutuhkan ponsel dengan lebih banyak RAM agar tetap lancar.
Di laptop atau desktop
Lebih suka bereksperimen di mesin yang lebih besar? Bobot Gemma 4 Google tersedia melalui ekosistem model terbuka biasa — Hugging Face, Ollama, LM Studio, Jan, GPT4All. Kami membandingkan seluruh rak desktop tersebut dengan gambaran mobile di alternatif ChatGPT offline: pilihan nyata di 2026.
Batas yang jujur
Panduan yang melewatkan bagian ini adalah siaran pers. Apa yang tidak akan disamai Gemma 4 E2B:
- Penalaran frontier. Model efektif 2B bukan model cloud 200B parameter. Untuk derivasi matematika tingkat pascasarjana atau sintesis penelitian baru, raksasa cloud masih menang.
- Pengetahuan terkini. Bobot adalah snapshot data pelatihan. Gemma 4 tidak tahu apa yang terjadi kemarin; untuk itu, Anda masih membutuhkan sesuatu dengan akses web.
- Konteks sangat panjang, di ponsel sangat kecil. Model dapat menangani input panjang, tetapi cache KV tumbuh dengan panjang konteks; di ponsel dengan 6 GB RAM, Anda akan kehabisan memori sebelum mencapai batas konteks model.
- Output aneh, kadang-kadang. Model kompak masih sesekali berhalusinasi, mencampuradukkan angka, atau mengulang diri. Perlakukan jawabannya seperti teman cerdas di sore yang tidak fokus: sering benar, layak dicek ulang untuk hal penting.
Coba Gemma 4 di ponsel Anda, gratis
Gist&Chat hadir dengan Gemma 4 E2B — obrolan AI pribadi plus ringkasan YouTube, artikel dan PDF, dalam 11 bahasa. Varian E4B yang lebih besar akan hadir di Pro.
- Gemma 4 E2B, di perangkat — inferensi GPU penuh di Android modern
- Obrolan pribadi, tidak terbatas & gratis — tanpa akun, tanpa meter
- Ringkasan dengan tanya jawab lanjutan — video, artikel, PDF, foto teks (gratis untuk mulai)
- 11 bahasa — antarmuka dan percakapan
- E4B di Pro, segera hadir — model efektif lebih besar untuk ponsel dengan RAM yang cukup
Unduhan gratis · Unduhan model sekali saja ~2,6 GB via Wi-Fi · Tidak ada satu byte pun obrolan Anda yang meninggalkan ponsel — kebijakan privasi
Pertanyaan yang sering diajukan
Apa itu Gemma 4 dan apa bedanya dengan model Gemma sebelumnya?
Gemma 4 adalah keluarga model kecil Google yang dirancang pertama untuk perangkat. Berbeda dengan Gemma 1, 2, dan 3, Gemma 4 menggunakan arsitektur PLE yang diwarisi dari Gemma 3n. Embedding dibagi per lapisan, membuat setiap tensor cukup kecil untuk GPU ponsel.
Apa arti E2B dan E4B di Gemma 4?
E singkatan dari Effective (Efektif). E2B berperilaku seperti model padat 2B parameter, dan E4B seperti 4B padat. Keduanya berasal dari bobot matformer yang sama, sehingga perangkat dapat memilih ukuran efektif yang sesuai dengan RAM-nya.
Mengapa arsitektur PLE penting untuk penggunaan di perangkat?
GPU ponsel kelas menengah memiliki batas 128 MB per buffer. Tabel embedding monolitik di sebagian besar LLM sudah melampaui batas itu. PLE membagi embedding per lapisan sehingga tidak ada tensor yang meluap; model berjalan di GPU alih-alih jatuh ke CPU yang lambat.
Bisakah saya menjalankan Gemma 4 di ponsel saya sekarang?
Ya. Gist&Chat adalah aplikasi Android gratis yang hadir dengan Gemma 4 E2B: unduhan sekali saja, lalu model berjalan sepenuhnya di ponsel Anda untuk obrolan pribadi dan ringkasan. Varian E4B akan hadir di tingkat Pro untuk ponsel kelas atas.
Bagaimana Gemma 4 E2B dibandingkan dengan model kecil lain seperti Phi, Qwen, atau Llama 3.2?
Di atas kertas, jumlah parameter terlihat serupa. Dalam praktiknya, sebagian besar model 1–2B lainnya masih memiliki tabel embedding monolitik besar yang gagal dimuat di banyak GPU mobile. Arsitektur PLE Gemma 4 adalah cara paling andal saat ini untuk menjalankan model kelas 2B nyata di GPU ponsel kelas menengah.
Lebih banyak dari gist-ai.net: apa sebenarnya AI di perangkat (dan mengapa berhasil), alternatif ChatGPT offline — pilihan nyata di 2026, chatbot AI yang bekerja dalam mode pesawat, cara meringkas video YouTube dengan AI, meringkas artikel, PDF dan foto teks — offline, berlatih bahasa dengan AI di saku Anda dan alat gratis untuk kreator — tidak pernah perlu daftar.