심층 분석 · 소형 언어 모델

온디바이스 소형 언어 모델 — Gemma 4 E2B·E4B가 판도를 바꾼 이유

AI 세계에서 지금 가장 흥미로운 건 가장 큰 모델이 아닙니다. 충분히 훌륭한 가장 작은 모델입니다. 어느 순간부터 '소형 언어 모델'은 '귀여운 데모'를 의미하는 게 아니라 '지금 바로 당신의 스마트폰에서 실제 작업을 수행하는 모델'을 의미하게 됐습니다. 무엇이 바뀌었는지, 왜 Google의 Gemma 4 패밀리가 그 중심에 있는지, 지금 바로 사용하는 방법까지 알기 쉽게 설명합니다.

'소형 언어 모델'이란 실제로 무엇인가

대형 언어 모델(LLM)은 ChatGPT 같은 서비스를 구동하는 것 — 수천억 파라미터가 데이터센터 GPU 랙에 존재합니다. 소형 언어 모델(SLM)은 같은 기본 아이디어를 손에 들고 다닐 수 있는 디바이스(노트북, 스마트폰, 차량 헤드 유닛, 로봇)에서 동작할 수 있는 크기로 줄인 것입니다. 실제로 '소형'이란 수십억 파라미터 이하를 의미하며, 모델 가중치는 테라바이트가 아닌 수 기가바이트 파일입니다.

SLM이 중요한 이유는 단 하나: 어디서 실행되느냐입니다. 스마트폰에 들어가는 모델은 프라이빗(아무것도 전송되지 않음)하고, 메시지당 무료(서버 비용 없음)이며, 오프라인(네트워크 불필요)으로 동작할 수 있습니다. 이 세 가지 특성은 크기에 관계없이 클라우드 AI에는 존재하지 않습니다. 유일한 문제는 SLM이 작업에 충분히 우수한가 — 그리고 늘어나는 작업 목록에 대해 답이 점점 '예스'가 되고 있습니다.

AI 세계에서 지금 가장 흥미로운 숫자는 벤치마크 점수가 아닙니다. 실제로 필요한 작업을 처리할 수 있는 가장 작은 모델입니다.

왜 온디바이스 AI는 최근까지 거의 불가능했는가

스마트폰에서 진짜 언어 모델을 실행한다는 꿈은 동시에 세 가지 벽에 부딪혔습니다:

이전의 '스마트폰에서 소형 모델을'이라는 이야기는 항상 이 세 가지 중 하나에서 실패했습니다. Gemma 4는 세 가지 모두를 동시에 해결한 최초의 패밀리 — 그리고 그 이유는 알아둘 가치가 있는 두 가지 아키텍처 선택에 있습니다.

Gemma 패밀리 개요

Google의 Gemma 모델은 Gemini의 오픈 웨이트 버전의 친척 — 더 작고 누구나 실행할 수 있도록 공개됐지만, 더 큰 모델 훈련에서 얻은 인사이트를 활용해 만들어졌습니다. 계보:

Gemma 1 표준 트랜스포머 PC 중심 Gemma 2 더 크고, 여전히 모놀리식 Gemma 3 +비전 +다국어 Gemma 3n PLE + matformer E2B / E4B 명명 4 Gemma 4 디바이스 우선 PLE 계승 같은 오픈 웨이트 계보. 스마트폰 우선으로의 전환은 오른쪽에 강조 표시된 모델에서 일어났습니다.
패밀리가 전환한 지점. PLE와 matformer는 Gemma 3n에서 등장했고, Gemma 4는 그것을 위해 설계된 메인라인입니다.

Gemma 4에서 중요한 건 벤치마크 점수가 아닙니다. 아키텍처가 '중급 스마트폰에서 편안하게 동작해야 한다'는 역방향에서 설계됐다는 것입니다. '종이 위에서 GPT-4를 이겨야 한다'는 방향이 아니라.

PLE: 2B 파라미터를 스마트폰 메모리에 넣은 비결

대부분의 사람들이 모르는 구체적인 제약이 있습니다. 많은 인기 Android 스마트폰(예: Samsung Galaxy S23 Ultra)이 WebGPU 스토리지 버퍼로 바인딩당 128MB만 제공합니다. 이것이 GPU 드라이버가 받아들이는 단일 텐서의 크기 제한입니다. 이를 초과하면 드라이버가 바인딩을 거부하고, 모델은 소리 없이 쓰레기를 출력하거나 CPU로 폴백합니다.

표준 트랜스포머에서 가장 큰 단일 텐서는 임베딩 테이블: 어휘 크기 × 숨겨진 차원입니다. 현대 다국어 모델에서 이 테이블은 INT8 양자화 후에도 150~260MB에 달할 수 있습니다. 즉: 실제 많은 스마트폰에서 임베딩 테이블을 로드할 수 없습니다. 모델은 GPU에서 실행될 수 없습니다. CPU 폴백은 동작하지만 10~20배 느립니다.

Per-Layer Embedding이 Gemma 4의 답입니다. 거대한 임베딩 테이블 하나 대신, 레이어 전반에 걸쳐 임베딩을 분산시켜 각 텐서가 128MB 제한을 편안하게 밑돌게 합니다. 전체 파라미터 수는 비슷하지만 형태가 다릅니다 — 그리고 형태가 실제 하드웨어에서 모델이 동작하는지를 결정합니다.

모델의 '형태'가 중요한 이유 표준 트랜스포머 거대한 임베딩 테이블 하나 어휘 × 숨겨진 차원 ≈ 155 MB ✕ GPU 버퍼 128MB 초과 Gemma 4 (PLE) 레이어별로 임베딩 분산 L1 L2 L3 L4 L5 L6 L7 L8 L9 ✓ 각 텐서 128MB 이하 스마트폰 GPU에서 실행 가능한가? 표준 SLM (Qwen 0.6B, Llama 3.2 1B, Gemma 3 1B): 불가 — CPU 폴백, 10~20배 느림 Gemma 4 E2B / E4B (PLE): 가능 — 완전 GPU 추론
같은 파라미터 수, 다른 형태. Gemma 4가 다른 소형 모델이 동작하지 않는 곳에서 동작하는 이유는 텐서 레이아웃이지 모델 크기가 아닙니다.

Matformer: E2B와 E4B가 실제로 의미하는 것

E2BE4BE유효(Effective)의 약자입니다. E2B는 중요한 작업에서 밀집된 20억 파라미터 모델에 상응하는 성능을 내는 모델이고, E4B는 40억 파라미터 상당입니다. 그러나 내부적으로는 두 모델 모두 같은 가중치에서 나옵니다.

그 메커니즘을 matformer라고 합니다 — 신경망 버전의 마트료시카 인형을 상상하세요. 훈련 중에 모델은 파라미터가 중첩된 계층을 형성하도록 최적화됩니다: 서로 다른 깊이와 너비에서 모델을 자르면 여전히 일관되게 동작하는 더 작은 서브모델을 얻을 수 있습니다. 하나의 마스터 가중치 세트에서 Google은 RAM이 적은 스마트폰을 위해 E2B를, 여유가 있는 스마트폰을 위해 E4B를 잘라낼 수 있습니다.

Matformer: 1번 훈련, 2가지 유효 크기 마스터 가중치 엔드투엔드 훈련 중첩 계층 E2B ⊂ E4B 추론 시 슬라이스 E2B 유효 ~20억 E4B 유효 ~40억 (E2B 포함) 어떤 슬라이스가 로드되나? 📱 중급 스마트폰 → E2B 📱 RAM 여유 / 플래그십 → E4B 💻 노트북 → 어느 쪽이나 두 가지 제품을 선택하는 게 아닙니다. 같은 모델에서 디바이스가 어느 깊이까지 사용할지를 선택하는 것입니다.
신경망 버전의 마트료시카 인형. 작은 모델이 큰 모델 안에 들어 있습니다 — 디바이스가 어느 깊이까지 가져갈지 결정합니다.

Gemma 4와 다른 소형 모델 비교

2B 이하 공간은 많은 사람이 생각하는 것보다 혼잡합니다. 현실적인 중급 Android GPU에서 동작하는가?라는 질문을 중심으로 솔직한 시각에서 목록을 살펴봅시다.

모델파라미터임베딩 크기 (INT8)128MB 버퍼에 맞는가?
Qwen3 0.6B0.6B≈ 155 MB✕ CPU 폴백
Gemma 3 1B1B≈ 151 MB (INT4에서도)✕ CPU 폴백
Llama 3.2 1B1B≈ 262 MB✕ CPU 폴백
Qwen3 1.7B1.7B≈ 311 MB✕ CPU 폴백
IBM Granite 4.0 350M0.35B≈ 102 MB✓ (어휘 작음, 다국어 약함)
Gemma 4 E2B (PLE)유효 2B레이어별 분산✓ 완전 GPU
Gemma 4 E4B (PLE)유효 4B레이어별 분산✓ 완전 GPU (RAM 충분 시)
CPU 폴백의 실제 비용 같은 스마트폰(Snapdragon 8 Gen 2)에서 동일한 약 3,700자 시스템 프롬프트 프리필 시간 비 PLE 모델, CPU 폴백 > 20초 Gemma 4 (PLE), 완전 GPU ≈ 1초 0초 10초 20초+
1초는 대화입니다. 20초는 버그 리포트입니다. 같은 스마트폰, 같은 프롬프트, 다른 아키텍처 — 그게 전부입니다.

지금 Gemma 4를 사용할 수 있는 곳

스마트폰에서: Gist&Chat (E2B, 무료)

Gist&Chat은 Gemma 4 E2B를 탑재한 무료 Android 앱입니다. 최초 실행 시 Wi-Fi를 통해 모델을 다운로드합니다 — 한 번만, 약 2.6GB — 이후 AI는 스마트폰에서 완전히 실행됩니다. 가능한 것들:

Pro의 E4B (출시 예정)

더 큰 Gemma 4 E4B 버전은 Gist&Chat의 Pro 티어에서 제공 예정입니다. E4B는 유효 파라미터가 두 배 — 추론, 장문 컨텍스트 Q&A, 코드 인접 작업에서 눈에 띄게 우수합니다 — 다만 편안하게 실행하려면 충분한 RAM을 갖춘 스마트폰이 필요합니다.

노트북이나 데스크톱에서

더 큰 기기에서 사용해보고 싶다면? Google의 Gemma 4 가중치는 일반적인 오픈 모델 생태계에서 사용 가능합니다 — Hugging Face, Ollama, LM Studio, Jan, GPT4All. 데스크톱 옵션 전체를 모바일과 비교하는 것은 오프라인 ChatGPT 대안 — 2026년의 진짜 선택지에서 다룹니다.

솔직한 한계

이 섹션을 건너뛰는 가이드는 보도자료입니다. Gemma 4 E2B가 따라잡지 못하는 것들:

스마트폰에서 Gemma 4를 무료로 사용해보기

Gist&Chat은 Gemma 4 E2B 탑재 — 프라이빗 AI 채팅과 YouTube, 기사, PDF 요약을 11개 언어로. 더 큰 E4B 버전은 Pro에서 출시 예정.

▶ Google Play에서 Gist&Chat 무료 다운로드

무료 다운로드 · Wi-Fi로 한 번만 약 2.6GB 모델 다운로드 · 채팅의 단 한 바이트도 스마트폰을 떠나지 않습니다 — 개인정보 보호정책

자주 묻는 질문

Gemma 4란 무엇이며, 이전 Gemma 모델과 무엇이 다른가요?

Gemma 4는 Google의 디바이스 우선 소형 모델 패밀리입니다. Gemma 1·2·3과 달리 Gemma 3n에서 도입한 PLE 아키텍처를 사용합니다. 레이어별로 임베딩을 분산시켜 각 텐서를 스마트폰 GPU 메모리 제한 내에 유지합니다.

Gemma 4의 E2B와 E4B는 무슨 뜻인가요?

E는 '유효(Effective)'의 약자입니다. E2B는 밀집된 20억 파라미터 모델에 상응하는 성능을 내고, E4B는 40억 파라미터 상당입니다. 두 모델 모두 같은 Matformer 가중치에서 생성되므로 디바이스는 RAM 예산에 맞는 유효 크기를 선택할 수 있습니다.

PLE 아키텍처가 온디바이스 환경에서 중요한 이유는?

중급 스마트폰 GPU에는 128MB 버퍼 제한이 있습니다. 현대 LLM의 모놀리식 임베딩 테이블은 이미 이를 초과합니다. PLE는 레이어별로 임베딩을 분산시켜 어떤 텐서도 제한을 넘지 않게 합니다. 모델은 CPU 폴백 없이 GPU에서 실행됩니다.

지금 스마트폰에서 Gemma 4를 사용할 수 있나요?

네. Gist&Chat은 Gemma 4 E2B를 탑재한 무료 Android 앱입니다. 한 번 다운로드하면 스마트폰에서 완전히 실행되며 프라이빗 채팅과 요약에 사용할 수 있습니다. E4B 버전은 고급 스마트폰 대상으로 Pro 티어에서 제공 예정입니다.

Gemma 4 E2B는 Phi, Qwen, Llama 3.2 등과 비교하면 어떤가요?

스펙상 파라미터 수는 비슷하지만, 다른 1~2B 모델 대부분이 모바일에서 로드할 수 없는 모놀리식 임베딩 테이블을 가지고 있습니다. Gemma 4의 PLE 아키텍처는 현재 중급 스마트폰 GPU에서 2B급 모델을 실행하는 가장 신뢰할 수 있는 방법입니다.


gist-ai.net의 다른 글: 온디바이스 AI란 실제로 무엇인가 (왜 동작하는가), 오프라인 ChatGPT 대안 — 2026년의 진짜 선택지, 비행기 모드에서도 동작하는 AI 챗봇, AI로 YouTube 동영상 요약하는 방법, 기사·PDF·텍스트 사진을 오프라인으로 요약, 주머니 속 AI로 언어 연습, 크리에이터용 무료 도구 — 가입 불필요.

다른 모든 것들 사이의 조용한 시간에 만들었습니다. 도움이 됐다면 — ☕ 커피 한 잔 사기
Gist&Chat
Gist&Chat App Gemma 4 E2B, 온디바이스 Google Play에서 무료