2026년 4월 2일, 구글 딥마인드가 조용하지만 강력한 발표를 했습니다. 오픈 AI 모델 젬마 4(Gemma 4) 출시입니다.

“또 AI 모델 하나 나왔구나” 하고 넘길 수도 있습니다. 하지만 이번 젬마 4는 다릅니다. 기술적 성능도 인상적이지만, 더 중요한 것은 라이선스 정책의 변화입니다. 이 하나의 결정이 개발자 커뮤니티 전체의 판도를 바꿀 수 있습니다.

이 글에서 젬마 4가 무엇인지, 왜 주목받는지, 어떻게 쓸 수 있는지를 차근차근 정리합니다.

목차

  1. 젬마(Gemma)란 무엇인가?
  2. 젬마 4, 뭐가 달라졌나?
  3. 4가지 모델 라인업 — 뭘 골라야 하나?
  4. 주요 성능 — 숫자로 보는 젬마 4
  5. Apache 2.0 라이선스 — 왜 이게 가장 큰 뉴스인가?
  6. 어떻게 쓸 수 있나? — 실전 활용 가이드
  7. 젬마 4 vs 경쟁 모델 — 어떻게 다른가?
  8. 한계와 주의할 점
  9. 자주 묻는 질문 (FAQ)

1. 젬마란 무엇인가?

**젬마(Gemma)**는 구글 딥마인드가 만든 오픈 웨이트(Open Weights) AI 모델 시리즈입니다. 쉽게 말하면, 구글의 최신 AI 기술을 누구나 직접 다운로드해서 자기 컴퓨터나 서버에서 돌릴 수 있도록 공개한 모델입니다.

젬미나이(Gemini)가 구글의 클라우드 기반 유료 AI라면, 젬마는 그 기술을 바탕으로 만든 로컬 실행 가능한 무료 모델입니다. ChatGPT나 Claude를 쓰려면 API 비용을 내야 하지만, 젬마는 내 컴퓨터에서 직접 돌릴 수 있습니다.

젬마의 역사

  • 2024년 2월: 젬마 1 출시 (2B, 7B)
  • 2024년 6월: 젬마 2 출시 (2B, 9B, 27B) — 성능 대폭 향상
  • 2025년 3월: 젬마 3 출시 (1B, 4B, 12B, 27B) — 멀티모달 도입
  • 2026년 4월 2일: 젬마 4 출시 — Apache 2.0 라이선스 + MoE 구조 도입

젬마 시리즈 전체 다운로드 횟수는 이미 4억 회를 넘었고, 개발자들이 파인튜닝해서 만든 파생 모델만 10만 개 이상입니다. 이 생태계를 ‘젬마버스(Gemmaverse)’라고 부릅니다.

2. 젬마 4, 뭐가 달라졌나?

젬마 4의 핵심 변화를 한 줄씩 짚어봅니다.

① Gemini 3와 동일한 기술 기반

젬마 4는 구글의 최신 플래그십 모델인 Gemini 3와 동일한 연구 및 기술을 기반으로 만들어졌습니다. 오픈 모델이 독점 클라우드 모델과 같은 최신 기술을 공유한다는 뜻입니다.

② MoE 아키텍처 도입

이전 젬마 시리즈는 Dense(밀집형) 구조였습니다. 모든 파라미터가 항상 활성화되는 방식입니다.

젬마 4는 MoE(Mixture of Experts, 전문가 혼합) 구조를 새로 도입했습니다. 전체 파라미터 중 현재 작업에 필요한 부분만 선택적으로 활성화합니다. 전체 크기는 크지만 실제 계산량은 훨씬 줄어들어 속도와 효율이 올라갑니다.

③ 진짜 멀티모달 — 텍스트·이미지·오디오·비디오

모든 젬마 4 모델이 이미지와 비디오를 기본 처리합니다. 소형 엣지 모델(E2B, E4B)은 여기에 더해 오디오 입력까지 네이티브로 지원합니다. 음성을 직접 인식해서 처리할 수 있습니다.

④ 컨텍스트 윈도우 대폭 확장

모델컨텍스트 윈도우
젬마 3 27B128K
젬마 4 E2B·E4B (엣지)128K
젬마 4 26B·31B (대형)256K

256K 토큰은 약 200,000 단어 분량입니다. 책 한 권을 통째로 넣고 질문할 수 있는 수준입니다.

⑤ 에이전트 기능 기본 탑재

함수 호출(Function Calling), 구조화된 JSON 출력, 시스템 지시(System Instructions)를 네이티브로 지원합니다. AI 에이전트를 만들 때 필요한 도구들이 처음부터 내장되어 있는 것입니다.

⑥ 140개 언어 지원

한국어 포함 140개 이상의 언어로 사전 학습됐습니다. 젬마 3에 비해 한국어 성능이 눈에 띄게 향상됐습니다.

3. 4가지 모델 라인업

젬마 4는 E2B, E4B, 26B(MoE), 31B(Dense) 4가지 버전으로 출시됐습니다.

모델활성 파라미터총 파라미터대상 환경Ollama 용량
E2B~2B5.1B스마트폰·IoT7.2GB
E4B~4B7.5B노트북·모바일9.6GB
26B MoE~4B 활성26BPC·워크스테이션18GB
31B Dense31B31B고사양 PC·서버20GB

모델 이름의 E는 Effective(유효) 파라미터를 뜻합니다. E2B의 총 파라미터는 51억 개지만 추론 시 약 23억 개만 활성화됩니다. PLE(Per-Layer Embeddings) 기법 덕분입니다.

내 환경에 맞는 모델 고르기

RAM 8GB → E2B. 스마트폰이나 구형 노트북에서도 돌아갑니다.

RAM 16GBE4B 추천. M4 맥 미니 같은 환경에서 20~30 tok/s 속도로 쾌적하게 작동합니다. 코딩 보조, 번역, 이미지 분석이 모두 됩니다.

RAM 32GB 이상 → 26B MoE. E4B보다 훨씬 복잡한 추론과 긴 문서 처리가 가능합니다.

GPU 48GB 이상 → 31B Dense. 최고 성능이 필요한 프로덕션 환경.

두 버전씩 각각 베이스 모델Instruction-Tuned(-it) 모델이 있습니다. 일반 사용자는 -it 버전을 쓰면 됩니다. 베이스 모델은 파인튜닝용입니다.

4. 주요 성능

구글이 공개한 벤치마크 수치입니다. 특히 이전 세대 대비 추론 능력의 도약이 눈에 띕니다.

벤치마크젬마 3 27B젬마 4 31B젬마 4 26B
MMLU Pro (지식·추론)85.282.6
AIME 2026 (수학)20.8%89.2%88.3%
LiveCodeBench v6 (코딩)29.1%80.0%77.1%

수학 벤치마크 AIME에서 젬마 3 27B는 20.8%, 젬마 4 31B는 89.2%를 기록했습니다. 한 세대 만에 수학 추론 능력이 4배 이상 뛰었습니다.

코딩 벤치마크 LiveCodeBench에서도 29.1%에서 80.0%로 대폭 향상됐습니다.

구글은 젬마 4 31B가 자신보다 20배 더 큰 모델들보다 성능이 앞선다고 주장합니다. 실제로 Arena AI 리더보드에서 젬마 4 31B는 오픈 모델 중 3위를 기록했습니다.

소형 모델에서도 인상적입니다. E4B(유효 4B 파라미터)가 Meta의 Llama 3.3 70B와 비슷한 코딩 성능을 보여줬습니다. 70억 파라미터 모델을 4.5억 파라미터 모델이 따라잡는 효율입니다.

5. Apache 2.0 라이선스 — 왜 이게 가장 큰 뉴스인가?

사실 젬마 4에서 가장 중요한 변화는 성능이 아닐 수도 있습니다. 바로 라이선스 변경입니다.

이전까지의 문제

젬마 1·2·3은 구글이 직접 만든 커스텀 라이선스(Gemma Terms of Use)를 사용했습니다. 성능은 훌륭했지만 이런 제약이 있었습니다.

  • 구글이 언제든지 규칙을 바꿀 수 있는 조항
  • 상업적 사용에 제한 가능성
  • 파생 모델 재배포 시 규제 상속 우려
  • 라이선스 불명확성으로 기업 법무팀에서 도입 거부하는 경우 많음

이 때문에 성능이 비슷해도 개발자들이 Llama나 Mistral, Qwen을 더 많이 선택했습니다.

Apache 2.0 라이선스의 의미

젬마 4는 Apache 2.0 라이선스로 출시됐습니다. 이것이 의미하는 바는 명확합니다.

  • 상업적 사용 완전 자유 — 제품에 탑재하고 돈을 벌어도 됩니다
  • 수정·재배포 자유 — 파인튜닝 후 다시 배포할 수 있습니다
  • 로열티 없음 — 구글에 별도 비용을 낼 필요가 없습니다
  • 특허 보호 포함 — Apache 라이선스에는 특허 허가가 포함됩니다
  • 미래 규칙 변경 걱정 없음 — 지금 받은 라이선스는 영구적으로 유효합니다

비교하자면 Meta의 Llama 4는 월간 활성 사용자 7억 명 이상이면 별도 계약이 필요합니다. 젬마 4에는 그런 조항이 없습니다.

Hugging Face의 CEO 클레망 들랑주는 이렇게 평가했습니다.

“Apache 2.0 라이선스로 젬마 4를 출시한 것은 거대한 이정표다.”

스타트업, 개인 개발자, 대기업 모두에게 적용되는 가장 자유로운 라이선스입니다.

6. 실전 활용 가이드

Ollama로 로컬에서 실행하기

가장 간단한 방법은 Ollama를 이용하는 것입니다. 터미널 명령어 하나로 실행됩니다.

# E4B 모델 실행 (기본 권장)
ollama run gemma4:e4b
# E2B 모델 (가벼운 환경)
ollama run gemma4:e2b
# 31B Dense (고사양)
ollama run gemma4:31b

Ollama는 Mac, Windows, Linux 모두 지원합니다. LM Studio라는 GUI 툴을 쓰면 코드 없이도 됩니다.

Google AI Studio에서 바로 사용

로컬 설치 없이 바로 써보고 싶다면 Google AI Studio에서 무료로 체험할 수 있습니다. aistudio.google.com에서 젬마 4를 선택하면 됩니다.

Hugging Face에서 다운로드

파인튜닝이나 커스텀 배포가 필요하다면 Hugging Face에서 모델 가중치를 직접 받을 수 있습니다.

huggingface.co/google/gemma-4-31b-it
huggingface.co/google/gemma-4-e4b-it

어디에 활용할 수 있나?

코딩 보조: API 비용 없이 로컬에서 코드 작성·리뷰·디버깅. E4B만 해도 일상적인 코딩에 충분합니다.

문서 분석: 256K 컨텍스트 덕분에 긴 계약서, 논문, 보고서를 통째로 넣고 질문할 수 있습니다.

번역·다국어 처리: 140개 언어 지원. 한국어-독일어 번역도 가능합니다.

이미지 분석: 스크린샷, 사진, 다이어그램을 올리고 설명이나 분석을 요청할 수 있습니다.

AI 에이전트 구축: 함수 호출과 JSON 출력 지원으로 API 연동 에이전트를 만들 수 있습니다.

RAG 시스템: 사내 문서 기반 Q&A 챗봇을 API 비용 없이 구축할 수 있습니다.

7. 젬마 4 vs 경쟁 모델

오픈 웨이트 모델 시장은 경쟁이 치열합니다. 주요 경쟁 모델과 비교해봅니다.

젬마 4 31BMeta Llama 4Qwen 3 (30B)Mistral
라이선스Apache 2.0 ✅커뮤니티 라이선스 (7억 이상 제한)Apache 2.0 ✅Apache 2.0 ✅
멀티모달텍스트·이미지·비디오·오디오텍스트·이미지텍스트·이미지일부 모델
컨텍스트256K10M128K128K
MoE26B 모델일부
에이전트기본 탑재기본 탑재기본 탑재지원

젬마 4의 차별점은 라이선스 자유도 + 컨텍스트 길이 + 멀티모달 완성도의 조합입니다. Apache 2.0으로 전환하면서 Llama보다 라이선스 자유도가 높아졌고, 컨텍스트 윈도우는 가장 큰 수준입니다.

8. 한계와 주의할 점

젬마 4가 인상적인 것은 사실이지만, 솔직한 한계도 알아야 합니다.

복잡한 추론에서 GPT-4·Claude와 격차 존재 단순 요약, 번역, 코드 보일러플레이트에서는 충분하지만, 복잡한 멀티스텝 추론이나 대규모 코드 리팩토링에서는 여전히 GPT-4o나 Claude가 우위입니다.

로컬 실행의 현실적 제약 26B와 31B는 32GB 이상 RAM이 필요합니다. 일반 사용자가 체감하기에는 E4B가 현실적입니다. 256K 컨텍스트를 실제로 활용하려면 메모리가 훨씬 더 필요합니다.

벤치마크와 실제 체감의 차이 공식 벤치마크 수치는 훌륭하지만, 실제 사용에서 중요한 것은 체감 속도, 지시사항 준수율, 문장의 자연스러움입니다. 직접 작업 샘플로 테스트해보는 것이 중요합니다.

학습 데이터 컷오프 2025년 1월 2025년 1월 이후의 정보는 모릅니다. 최신 뉴스나 사건은 별도 검색 도구와 연동이 필요합니다.

오픈 소스가 아닌 오픈 웨이트 가중치(weights)만 공개되고 학습 데이터와 훈련 코드는 공개되지 않습니다. 진정한 의미의 오픈소스는 아니며, 구글도 공식적으로 “Open Weights”라고 표현합니다.

9. FAQ

Q. ChatGPT나 Claude 대신 젬마 4를 써도 되나요?

단순 작업(번역, 요약, 간단한 코딩)에서는 충분히 대체 가능합니다. API 비용이 없다는 것이 큰 장점입니다. 하지만 복잡한 추론이나 전문적인 작업에서는 GPT-4o·Claude가 아직 앞섭니다. 단순 작업은 로컬 젬마 4, 복잡한 작업은 클라우드 AI의 하이브리드 전략이 현실적입니다.

Q. 한국어 성능은 어떤가요?

영어 대비 80~90% 수준으로 꽤 양호합니다. 한국어로 질문하면 한국어로 자연스럽게 답하고, 코드 주석을 한국어로 달아달라는 요청도 잘 처리합니다. 다만 한국 특화 법률·지역 정보 같은 전문 도메인에서는 한계가 있습니다.

Q. 상업용 서비스에 젬마 4를 탑재해도 되나요?

Apache 2.0 라이선스이므로 상업적 사용이 완전 자유입니다. 저작권 표기와 수정 사실 안내만 하면 됩니다. 로열티나 별도 계약이 필요 없습니다.

Q. 스마트폰에서 실행할 수 있나요?

E2B 모델은 최신 플래그십 스마트폰(아이폰 16 Pro급, 갤럭시 S25급)에서 실행 가능합니다. 완전 오프라인으로 작동하고 인터넷 없이도 사용할 수 있습니다.

Q. 파인튜닝이 가능한가요?

Apache 2.0이므로 파인튜닝 후 재배포까지 자유롭게 할 수 있습니다. Hugging Face에서 base 모델을 받아 원하는 데이터로 학습시킬 수 있습니다.

오픈 AI의 새로운 기준

젬마 4 출시로 오픈 웨이트 모델 시장이 새로운 국면에 접어들었습니다.

성능은 이미 이전 세대를 압도합니다. 하지만 더 중요한 것은 Apache 2.0 라이선스입니다. 스타트업도, 개인 개발자도, 대기업도 제약 없이 가져다 쓸 수 있게 됐습니다. 이것이 개발자 생태계에 어떤 파급효과를 일으킬지가 앞으로의 관전 포인트입니다.

AI를 직접 내 서버에서, 내 스마트폰에서, 비용 없이 돌리는 시대 — 젬마 4는 그 방향으로 한 걸음 더 나아갔습니다. 🤖

이 글이 도움이 되셨다면 공유 부탁드립니다!

댓글 남기기

Designed with WordPress

슬기로운 독일생활에서 더 알아보기

지금 구독하여 계속 읽고 전체 아카이브에 액세스하세요.

계속 읽기