Analisis Mendalam · Model Bahasa Kecil

Model Bahasa Kecil di Perangkat — dan Mengapa Gemma 4 E2B dan E4B Mengubah Segalanya

Hal paling menarik yang terjadi dalam AI saat ini bukan model terbesar. Itu adalah model terkecil yang cukup baik. Di suatu titik tahun lalu, "model bahasa kecil" berhenti berarti "demo yang menarik" dan mulai berarti "model dalam aplikasi di ponsel Anda, sekarang, melakukan pekerjaan nyata". Ini panduan dalam bahasa sederhana tentang apa yang berubah, mengapa keluarga Gemma 4 Google ada di pusatnya, dan cara mencoba salah satunya hari ini.

Apa sebenarnya "model bahasa kecil" itu

Model bahasa besar (LLM) adalah yang menggerakkan ChatGPT dan sejenisnya — ratusan miliar parameter, hidup di rak GPU di pusat data. Model bahasa kecil (SLM) adalah ide dasar yang sama, diperkecil untuk berjalan di sesuatu yang bisa Anda pegang: laptop, ponsel, head-unit mobil, robot. Dalam praktiknya, "kecil" biasanya berarti beberapa miliar parameter atau kurang, dan bobot model adalah file berukuran beberapa gigabyte bukan terabyte.

SLM penting karena tepat satu alasan: di mana mereka berjalan. Model yang muat di ponsel bisa bersifat pribadi (tidak ada yang dikirim ke luar), gratis per pesan (tidak ada tagihan server), dan offline (tidak perlu jaringan). Ketiga properti itu tidak ada dalam AI cloud, ukuran apa pun. Satu-satunya pertanyaan adalah apakah model kecil cukup baik untuk tugas itu — dan untuk daftar tugas yang terus bertambah, jawabannya akhirnya ya.

Angka paling menarik dalam AI saat ini bukan skor benchmark. Itu adalah model terkecil yang melewati ambang untuk pekerjaan yang benar-benar perlu Anda lakukan.

Mengapa AI di perangkat hampir mustahil sampai baru-baru ini

Impian menjalankan model bahasa nyata di ponsel menabrak tiga tembok sekaligus:

Setiap kisah "model kecil di ponsel Anda" sebelumnya kandas di salah satu dari tiga tembok ini. Gemma 4 adalah keluarga pertama yang melewati ketiganya sekaligus — dan ini berhasil berkat dua pilihan arsitektur yang perlu diketahui.

Keluarga Gemma, singkatnya

Model Gemma Google adalah kerabat open-weight dari Gemini — lebih kecil, dirilis untuk dijalankan siapa saja, tetapi dibangun dengan pelajaran dari pelatihan model besar. Silsilahnya:

Gemma 1 transformer standar fokus laptop Gemma 2 lebih besar, masih monolitik Gemma 3 + visi, + multibahasa Gemma 3n PLE + matformer nama E2B / E4B 4 Gemma 4 perangkat-pertama mewarisi PLE Silsilah open-weight yang sama. Perubahan ke ponsel-pertama terjadi pada model yang disorot di kanan.
Di mana keluarga berbelok. PLE dan matformer masuk dengan Gemma 3n; Gemma 4 adalah hasilnya ketika seluruh lini utama dirancang untuk dunia itu.

Yang penting dari Gemma 4 bukan skor benchmark. Arsitekturnya dirancang mundur dari "harus berjalan baik di ponsel kelas menengah", bukan maju dari "harus mengalahkan GPT-4 di atas kertas".

PLE: trik yang memungkinkan 2B parameter muat di GPU ponsel

Berikut batasan spesifik dan konkret yang jarang didengar kebanyakan orang. Banyak ponsel Android populer — Samsung Galaxy S23 Ultra, misalnya — hanya menyediakan 128 MB per binding sebagai buffer penyimpanan WebGPU. Itu adalah batas ukuran satu tensor yang akan diterima driver GPU. Melampaui ini dan driver menolak binding, model diam-diam menghasilkan sampah atau jatuh ke CPU.

Dalam transformer standar, tensor terbesar adalah tabel embedding: ukuran kosakata × dimensi tersembunyi. Untuk model multibahasa modern, tabel ini saja bisa 150–260 MB, bahkan setelah kuantisasi INT8. Dengan kata lain: di sebagian besar ponsel nyata, tabel embedding tidak bisa dimuat. Model tidak bisa berjalan di GPU. Fallback CPU berfungsi tetapi 10–20× lebih lambat.

Per-Layer Embedding adalah jawaban Gemma 4. Alih-alih satu tabel embedding besar, embedding dibagi antar lapisan sehingga setiap tensor nyaman di bawah batas 128 MB. Jumlah parameter keseluruhan serupa, tetapi bentuknya berbeda — dan bentuk itulah yang sebenarnya menentukan apakah model berjalan di hardware nyata.

Mengapa bentuk model itu penting Transformer standar satu tabel embedding besar kosakata × tersembunyi ≈ 155 MB ✕ meluap buffer GPU 128 MB Gemma 4 (PLE) embedding dibagi per lapisan L1 L2 L3 L4 L5 L6 L7 L8 L9 ✓ setiap tensor jauh di bawah 128 MB Berjalan di GPU ponsel? SLM standar (Qwen 0.6B, Llama 3.2 1B, Gemma 3 1B): tidak — fallback CPU, 10–20× lebih lambat Gemma 4 E2B / E4B (PLE): ya — inferensi GPU penuh
Jumlah parameter sama, bentuk berbeda. Alasan Gemma 4 berjalan di tempat model kecil lain tidak adalah tata letak tensor, bukan ukuran model.

Matformer: apa yang sebenarnya dimaksud E2B dan E4B

E dalam E2B dan E4B singkatan dari Effective (Efektif). Model E2B berperilaku seperti model padat 2 miliar parameter dalam tugas yang penting; E4B seperti model padat 4B. Tetapi di balik layar, keduanya berasal dari bobot yang sama.

Mekanismenya disebut matformer — bayangkan boneka matrioshka, tetapi untuk jaringan saraf. Selama pelatihan, model dioptimalkan agar parameternya membentuk hierarki bersarang: Anda dapat memotong model pada kedalaman dan lebar yang berbeda dan mendapatkan sub-model yang lebih kecil yang masih berperilaku koheren. Dari satu set bobot master, Google dapat mengukir E2B untuk ponsel dengan memori lebih sedikit dan E4B untuk ponsel dengan lebih banyak ruang.

Matformer: satu pelatihan, dua ukuran efektif Bobot master dilatih end-to-end hierarki bersarang E2B ⊂ E4B dipotong saat inferensi E2B Efektif ~2B E4B Efektif ~4B (berisi E2B) Potongan mana yang dimuat? 📱 ponsel kelas menengah → E2B 📱 lebih banyak RAM / kelas atas → E4B 💻 laptop → keduanya bisa Anda tidak memilih antara dua produk. Anda memilih di mana perangkat Anda berada pada model yang sama.
Boneka matrioshka, tetapi untuk jaringan saraf. Model yang lebih kecil hidup di dalam yang lebih besar; perangkat memutuskan seberapa dalam ia menggapai.

Bagaimana Gemma 4 dibandingkan dengan model kecil lainnya

Ruang 2B ke bawah lebih padat dari yang disadari kebanyakan orang. Berikut pandangan jujur tentang daftar pendek, dengan pertanyaan praktis apakah berjalan di GPU Android kelas menengah? di depan dan di tengah.

ModelParameterUkuran embedding (INT8)Muat dalam buffer 128 MB?
Qwen3 0.6B0.6B≈ 155 MB✕ fallback CPU
Gemma 3 1B1B≈ 151 MB (bahkan INT4)✕ fallback CPU
Llama 3.2 1B1B≈ 262 MB✕ fallback CPU
Qwen3 1.7B1.7B≈ 311 MB✕ fallback CPU
IBM Granite 4.0 350M0.35B≈ 102 MB✓ (kosakata kecil, multibahasa lebih lemah)
Gemma 4 E2B (PLE)Efektif 2Bdibagi per lapisan✓ GPU penuh
Gemma 4 E4B (PLE)Efektif 4Bdibagi per lapisan✓ GPU penuh (dengan RAM yang cukup)
Apa yang sebenarnya menguras CPU fallback Waktu prefill untuk system prompt ~3.700 karakter yang sama, ponsel yang sama (Snapdragon 8 Gen 2) Model non-PLE, fallback CPU > 20 detik Gemma 4 (PLE), GPU penuh ≈ 1 detik 0d 10d 20d+
Satu detik adalah percakapan. Dua puluh detik adalah laporan bug. Ponsel sama, prompt sama, arsitektur berbeda — itulah seluruh permainannya.

Di mana mencoba Gemma 4 hari ini

Di ponsel Anda: Gist&Chat (E2B, gratis)

Gist&Chat adalah aplikasi Android gratis yang dibangun di sekitar Gemma 4 E2B. Saat pertama kali diluncurkan, ia mengunduh model melalui Wi-Fi — unduhan sekali saja ~2,6 GB — dan setelah itu AI berjalan sepenuhnya di ponsel Anda. Anda mendapatkan:

E4B di Pro (segera hadir)

Varian Gemma 4 E4B yang lebih besar akan hadir di tingkat Pro Gist&Chat yang akan datang. E4B menggandakan parameter efektif — jauh lebih baik dalam penalaran, Q&A konteks panjang, dan tugas yang berdekatan dengan kode — tetapi membutuhkan ponsel dengan lebih banyak RAM agar tetap lancar.

Di laptop atau desktop

Lebih suka bereksperimen di mesin yang lebih besar? Bobot Gemma 4 Google tersedia melalui ekosistem model terbuka biasa — Hugging Face, Ollama, LM Studio, Jan, GPT4All. Kami membandingkan seluruh rak desktop tersebut dengan gambaran mobile di alternatif ChatGPT offline: pilihan nyata di 2026.

Batas yang jujur

Panduan yang melewatkan bagian ini adalah siaran pers. Apa yang tidak akan disamai Gemma 4 E2B:

Coba Gemma 4 di ponsel Anda, gratis

Gist&Chat hadir dengan Gemma 4 E2B — obrolan AI pribadi plus ringkasan YouTube, artikel dan PDF, dalam 11 bahasa. Varian E4B yang lebih besar akan hadir di Pro.

▶ Unduh Gist&Chat gratis di Google Play

Unduhan gratis · Unduhan model sekali saja ~2,6 GB via Wi-Fi · Tidak ada satu byte pun obrolan Anda yang meninggalkan ponsel — kebijakan privasi

Pertanyaan yang sering diajukan

Apa itu Gemma 4 dan apa bedanya dengan model Gemma sebelumnya?

Gemma 4 adalah keluarga model kecil Google yang dirancang pertama untuk perangkat. Berbeda dengan Gemma 1, 2, dan 3, Gemma 4 menggunakan arsitektur PLE yang diwarisi dari Gemma 3n. Embedding dibagi per lapisan, membuat setiap tensor cukup kecil untuk GPU ponsel.

Apa arti E2B dan E4B di Gemma 4?

E singkatan dari Effective (Efektif). E2B berperilaku seperti model padat 2B parameter, dan E4B seperti 4B padat. Keduanya berasal dari bobot matformer yang sama, sehingga perangkat dapat memilih ukuran efektif yang sesuai dengan RAM-nya.

Mengapa arsitektur PLE penting untuk penggunaan di perangkat?

GPU ponsel kelas menengah memiliki batas 128 MB per buffer. Tabel embedding monolitik di sebagian besar LLM sudah melampaui batas itu. PLE membagi embedding per lapisan sehingga tidak ada tensor yang meluap; model berjalan di GPU alih-alih jatuh ke CPU yang lambat.

Bisakah saya menjalankan Gemma 4 di ponsel saya sekarang?

Ya. Gist&Chat adalah aplikasi Android gratis yang hadir dengan Gemma 4 E2B: unduhan sekali saja, lalu model berjalan sepenuhnya di ponsel Anda untuk obrolan pribadi dan ringkasan. Varian E4B akan hadir di tingkat Pro untuk ponsel kelas atas.

Bagaimana Gemma 4 E2B dibandingkan dengan model kecil lain seperti Phi, Qwen, atau Llama 3.2?

Di atas kertas, jumlah parameter terlihat serupa. Dalam praktiknya, sebagian besar model 1–2B lainnya masih memiliki tabel embedding monolitik besar yang gagal dimuat di banyak GPU mobile. Arsitektur PLE Gemma 4 adalah cara paling andal saat ini untuk menjalankan model kelas 2B nyata di GPU ponsel kelas menengah.


Lebih banyak dari gist-ai.net: apa sebenarnya AI di perangkat (dan mengapa berhasil), alternatif ChatGPT offline — pilihan nyata di 2026, chatbot AI yang bekerja dalam mode pesawat, cara meringkas video YouTube dengan AI, meringkas artikel, PDF dan foto teks — offline, berlatih bahasa dengan AI di saku Anda dan alat gratis untuk kreator — tidak pernah perlu daftar.

Dibangun di jam-jam sunyi, di sela segala hal lainnya. Jika ini membantu — ☕ Dukung biaya situs
Gist&Chat
Gist&Chat App Gemma 4 E2B, di perangkat Gratis di Google Play