'소형 언어 모델'이란 실제로 무엇인가
대형 언어 모델(LLM)은 ChatGPT 같은 서비스를 구동하는 것 — 수천억 파라미터가 데이터센터 GPU 랙에 존재합니다. 소형 언어 모델(SLM)은 같은 기본 아이디어를 손에 들고 다닐 수 있는 디바이스(노트북, 스마트폰, 차량 헤드 유닛, 로봇)에서 동작할 수 있는 크기로 줄인 것입니다. 실제로 '소형'이란 수십억 파라미터 이하를 의미하며, 모델 가중치는 테라바이트가 아닌 수 기가바이트 파일입니다.
SLM이 중요한 이유는 단 하나: 어디서 실행되느냐입니다. 스마트폰에 들어가는 모델은 프라이빗(아무것도 전송되지 않음)하고, 메시지당 무료(서버 비용 없음)이며, 오프라인(네트워크 불필요)으로 동작할 수 있습니다. 이 세 가지 특성은 크기에 관계없이 클라우드 AI에는 존재하지 않습니다. 유일한 문제는 SLM이 작업에 충분히 우수한가 — 그리고 늘어나는 작업 목록에 대해 답이 점점 '예스'가 되고 있습니다.
왜 온디바이스 AI는 최근까지 거의 불가능했는가
스마트폰에서 진짜 언어 모델을 실행한다는 꿈은 동시에 세 가지 벽에 부딪혔습니다:
- 메모리. 현대 LLM의 가중치는 크다. 스마트폰에서는 OS, 브라우저, 방금 닫은 게임, 그리고 내보낼 것을 찾는 low-memory killer와 경쟁해야 합니다. 겨우 스마트폰에 들어가는 모델은 첫 알림이 오는 순간 종료되는 모델입니다.
- 연산 능력. 트랜스포머 추론은 행렬 곱셈의 연속입니다. 스마트폰 GPU는 이를 놀랍도록 잘 처리하지만, 모델의 텐서가 버퍼 제한에 맞을 때, 그리고 소프트웨어 스택(LiteRT, MediaPipe, MLC, llama.cpp mobile)이 실제로 GPU에 도달할 때만 가능합니다.
- 배터리와 발열. 스마트폰 칩은 단시간 전력을 쏟아낼 수 있지만, 지속적인 부하는 열이 되고 열은 서멀 스로틀링이 됩니다. 첫 메시지를 2초 만에 답하고 열 번째 메시지를 20초 만에 답하는 모델은 데모이지 제품이 아닙니다.
이전의 '스마트폰에서 소형 모델을'이라는 이야기는 항상 이 세 가지 중 하나에서 실패했습니다. Gemma 4는 세 가지 모두를 동시에 해결한 최초의 패밀리 — 그리고 그 이유는 알아둘 가치가 있는 두 가지 아키텍처 선택에 있습니다.
Gemma 패밀리 개요
Google의 Gemma 모델은 Gemini의 오픈 웨이트 버전의 친척 — 더 작고 누구나 실행할 수 있도록 공개됐지만, 더 큰 모델 훈련에서 얻은 인사이트를 활용해 만들어졌습니다. 계보:
- Gemma 1과 2 — 훌륭한 오픈 웨이트 모델이지만 기본적으로 표준 트랜스포머의 소형 버전. 고성능 노트북에서는 잘 동작했고, 스마트폰에서는 고전했습니다.
- Gemma 3 — 비전 기능 추가, 다국어 지원 개선, 여전히 표준 아키텍처.
- Gemma 3n — 모바일 우선 버전. Per-Layer Embedding(PLE)과 matformer 중첩 파라미터 설계를 도입하고 'E2B / E4B' 명명을 만들었습니다.
- Gemma 4 — 디바이스 우선 메인라인. PLE와 matformer를 계승하며 더 나은 지시 따르기, 비전, 다국어 성능, 즉시 사용 가능한 채팅 버전(E2B-it, E4B-it) 추가.
Gemma 4에서 중요한 건 벤치마크 점수가 아닙니다. 아키텍처가 '중급 스마트폰에서 편안하게 동작해야 한다'는 역방향에서 설계됐다는 것입니다. '종이 위에서 GPT-4를 이겨야 한다'는 방향이 아니라.
PLE: 2B 파라미터를 스마트폰 메모리에 넣은 비결
대부분의 사람들이 모르는 구체적인 제약이 있습니다. 많은 인기 Android 스마트폰(예: Samsung Galaxy S23 Ultra)이 WebGPU 스토리지 버퍼로 바인딩당 128MB만 제공합니다. 이것이 GPU 드라이버가 받아들이는 단일 텐서의 크기 제한입니다. 이를 초과하면 드라이버가 바인딩을 거부하고, 모델은 소리 없이 쓰레기를 출력하거나 CPU로 폴백합니다.
표준 트랜스포머에서 가장 큰 단일 텐서는 임베딩 테이블: 어휘 크기 × 숨겨진 차원입니다. 현대 다국어 모델에서 이 테이블은 INT8 양자화 후에도 150~260MB에 달할 수 있습니다. 즉: 실제 많은 스마트폰에서 임베딩 테이블을 로드할 수 없습니다. 모델은 GPU에서 실행될 수 없습니다. CPU 폴백은 동작하지만 10~20배 느립니다.
Per-Layer Embedding이 Gemma 4의 답입니다. 거대한 임베딩 테이블 하나 대신, 레이어 전반에 걸쳐 임베딩을 분산시켜 각 텐서가 128MB 제한을 편안하게 밑돌게 합니다. 전체 파라미터 수는 비슷하지만 형태가 다릅니다 — 그리고 형태가 실제 하드웨어에서 모델이 동작하는지를 결정합니다.
Matformer: E2B와 E4B가 실제로 의미하는 것
E2B와 E4B의 E는 유효(Effective)의 약자입니다. E2B는 중요한 작업에서 밀집된 20억 파라미터 모델에 상응하는 성능을 내는 모델이고, E4B는 40억 파라미터 상당입니다. 그러나 내부적으로는 두 모델 모두 같은 가중치에서 나옵니다.
그 메커니즘을 matformer라고 합니다 — 신경망 버전의 마트료시카 인형을 상상하세요. 훈련 중에 모델은 파라미터가 중첩된 계층을 형성하도록 최적화됩니다: 서로 다른 깊이와 너비에서 모델을 자르면 여전히 일관되게 동작하는 더 작은 서브모델을 얻을 수 있습니다. 하나의 마스터 가중치 세트에서 Google은 RAM이 적은 스마트폰을 위해 E2B를, 여유가 있는 스마트폰을 위해 E4B를 잘라낼 수 있습니다.
Gemma 4와 다른 소형 모델 비교
2B 이하 공간은 많은 사람이 생각하는 것보다 혼잡합니다. 현실적인 중급 Android GPU에서 동작하는가?라는 질문을 중심으로 솔직한 시각에서 목록을 살펴봅시다.
| 모델 | 파라미터 | 임베딩 크기 (INT8) | 128MB 버퍼에 맞는가? |
|---|---|---|---|
| Qwen3 0.6B | 0.6B | ≈ 155 MB | ✕ CPU 폴백 |
| Gemma 3 1B | 1B | ≈ 151 MB (INT4에서도) | ✕ CPU 폴백 |
| Llama 3.2 1B | 1B | ≈ 262 MB | ✕ CPU 폴백 |
| Qwen3 1.7B | 1.7B | ≈ 311 MB | ✕ CPU 폴백 |
| IBM Granite 4.0 350M | 0.35B | ≈ 102 MB | ✓ (어휘 작음, 다국어 약함) |
| Gemma 4 E2B (PLE) | 유효 2B | 레이어별 분산 | ✓ 완전 GPU |
| Gemma 4 E4B (PLE) | 유효 4B | 레이어별 분산 | ✓ 완전 GPU (RAM 충분 시) |
지금 Gemma 4를 사용할 수 있는 곳
스마트폰에서: Gist&Chat (E2B, 무료)
Gist&Chat은 Gemma 4 E2B를 탑재한 무료 Android 앱입니다. 최초 실행 시 Wi-Fi를 통해 모델을 다운로드합니다 — 한 번만, 약 2.6GB — 이후 AI는 스마트폰에서 완전히 실행됩니다. 가능한 것들:
- 프라이빗 채팅 — 음성 또는 텍스트, 세션 간 메모리, 비행기 모드 테스트 통과. 스마트폰이 계산하므로 무제한·무료.
- 요약 — YouTube 링크, 기사 URL, PDF / DOCX / 텍스트 사진을 붙여넣고 핵심을 얻고 추가 질문.
- 11개 언어 — 실제로 연습할 가능성이 높은 언어 포함.
Pro의 E4B (출시 예정)
더 큰 Gemma 4 E4B 버전은 Gist&Chat의 Pro 티어에서 제공 예정입니다. E4B는 유효 파라미터가 두 배 — 추론, 장문 컨텍스트 Q&A, 코드 인접 작업에서 눈에 띄게 우수합니다 — 다만 편안하게 실행하려면 충분한 RAM을 갖춘 스마트폰이 필요합니다.
노트북이나 데스크톱에서
더 큰 기기에서 사용해보고 싶다면? Google의 Gemma 4 가중치는 일반적인 오픈 모델 생태계에서 사용 가능합니다 — Hugging Face, Ollama, LM Studio, Jan, GPT4All. 데스크톱 옵션 전체를 모바일과 비교하는 것은 오프라인 ChatGPT 대안 — 2026년의 진짜 선택지에서 다룹니다.
솔직한 한계
이 섹션을 건너뛰는 가이드는 보도자료입니다. Gemma 4 E2B가 따라잡지 못하는 것들:
- 최첨단 추론. 유효 2B 모델은 2,000억 파라미터 클라우드 모델이 아닙니다. 대학원 수준의 수학 유도나 신규 연구 합성에는 클라우드가 여전히 앞섭니다.
- 최신 지식. 가중치는 훈련 데이터의 스냅샷입니다. Gemma 4는 어제 무슨 일이 있었는지 모릅니다. 그것을 위해서는 웹 접근이 필요합니다.
- 매우 작은 스마트폰에서의 매우 긴 컨텍스트. 모델은 긴 입력을 처리할 수 있지만 KV 캐시는 컨텍스트 길이에 따라 증가합니다. 6GB RAM 스마트폰에서는 모델의 컨텍스트 제한에 도달하기 전에 메모리가 부족해질 수 있습니다.
- 가끔 이상한 출력. 소형 모델은 여전히 때로 환각을 일으키거나 숫자를 혼동하거나 반복합니다. 중요한 것은 확인하고, 정신이 산만한 오후의 똑똑한 친구처럼 대하세요: 종종 맞지만 중요한 것은 다시 확인할 가치가 있습니다.
스마트폰에서 Gemma 4를 무료로 사용해보기
Gist&Chat은 Gemma 4 E2B 탑재 — 프라이빗 AI 채팅과 YouTube, 기사, PDF 요약을 11개 언어로. 더 큰 E4B 버전은 Pro에서 출시 예정.
- Gemma 4 E2B, 온디바이스 — 현대 Android에서 완전 GPU 추론
- 프라이빗 채팅, 무제한·무료 — 계정 불필요, 결제 없음
- 추가 Q&A 포함 요약 — 동영상, 기사, PDF, 텍스트 사진 (처음 무료)
- 11개 언어 — 인터페이스와 대화 모두
- Pro의 E4B, 출시 예정 — RAM이 충분한 스마트폰을 위한 더 큰 유효 모델
무료 다운로드 · Wi-Fi로 한 번만 약 2.6GB 모델 다운로드 · 채팅의 단 한 바이트도 스마트폰을 떠나지 않습니다 — 개인정보 보호정책
자주 묻는 질문
Gemma 4란 무엇이며, 이전 Gemma 모델과 무엇이 다른가요?
Gemma 4는 Google의 디바이스 우선 소형 모델 패밀리입니다. Gemma 1·2·3과 달리 Gemma 3n에서 도입한 PLE 아키텍처를 사용합니다. 레이어별로 임베딩을 분산시켜 각 텐서를 스마트폰 GPU 메모리 제한 내에 유지합니다.
Gemma 4의 E2B와 E4B는 무슨 뜻인가요?
E는 '유효(Effective)'의 약자입니다. E2B는 밀집된 20억 파라미터 모델에 상응하는 성능을 내고, E4B는 40억 파라미터 상당입니다. 두 모델 모두 같은 Matformer 가중치에서 생성되므로 디바이스는 RAM 예산에 맞는 유효 크기를 선택할 수 있습니다.
PLE 아키텍처가 온디바이스 환경에서 중요한 이유는?
중급 스마트폰 GPU에는 128MB 버퍼 제한이 있습니다. 현대 LLM의 모놀리식 임베딩 테이블은 이미 이를 초과합니다. PLE는 레이어별로 임베딩을 분산시켜 어떤 텐서도 제한을 넘지 않게 합니다. 모델은 CPU 폴백 없이 GPU에서 실행됩니다.
지금 스마트폰에서 Gemma 4를 사용할 수 있나요?
네. Gist&Chat은 Gemma 4 E2B를 탑재한 무료 Android 앱입니다. 한 번 다운로드하면 스마트폰에서 완전히 실행되며 프라이빗 채팅과 요약에 사용할 수 있습니다. E4B 버전은 고급 스마트폰 대상으로 Pro 티어에서 제공 예정입니다.
Gemma 4 E2B는 Phi, Qwen, Llama 3.2 등과 비교하면 어떤가요?
스펙상 파라미터 수는 비슷하지만, 다른 1~2B 모델 대부분이 모바일에서 로드할 수 없는 모놀리식 임베딩 테이블을 가지고 있습니다. Gemma 4의 PLE 아키텍처는 현재 중급 스마트폰 GPU에서 2B급 모델을 실행하는 가장 신뢰할 수 있는 방법입니다.
gist-ai.net의 다른 글: 온디바이스 AI란 실제로 무엇인가 (왜 동작하는가), 오프라인 ChatGPT 대안 — 2026년의 진짜 선택지, 비행기 모드에서도 동작하는 AI 챗봇, AI로 YouTube 동영상 요약하는 방법, 기사·PDF·텍스트 사진을 오프라인으로 요약, 주머니 속 AI로 언어 연습, 크리에이터용 무료 도구 — 가입 불필요.