'TwIL-LM3-Pro vs Gemma 4 12B'라는 제목의 생성된 타이틀 카드가 있고, 부제는 '두 개의 로컬 모델, 두 개의 라이선스'이며, 'TwIL-LM3-Pro - 비상업용'과 'Gemma 4 12B - Apache 2.0'이라고 적힌 두 개의 둥근 카드가 있습니다. 하단 줄에는 '라이선스는 어떤 벤치마크 행보다 더 많은 배포를 결정한다.'라고 쓰여 있습니다. OrcaRouter 로고는 오른쪽 아래 모서리에 합성되어 있습니다.
Guides & Insights

TwIL-LM3-Pro vs Gemma 4 12B: 노트북 외에는 공통점이 없는 두 로컬 모델

작성자

Alistair Wren

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

나란히 놓고 보자: TwIL-LM3-Pro와 Gemma 4 12B의 유사점은 실재하지만 피상적입니다: 둘 다 오늘 다운로드할 수 있는 오픈 체크포인트이고, 둘 다 클라우드 계정 없이 소비자용 하드웨어에서 실행되며, 둘 다 오프라인에서 질문에 답합니다. 그 이후의 모든 것은 달라지며, 가장 첨예한 차이는 기술적이라기보다 법적입니다. TwIL-LM3-Pro는 webAI의 3.66B 형식 논리 특화 모델로, webAI Non-Commercial License ver. 1.0에 따라 배포됩니다 — 별도 계약 없이는 이를 연구에 사용할 수는 있어도 이를 기반으로 사업을 구축할 수는 없습니다. Gemma 4 12B는 Goog​le DeepMind의 인코더 없는 멀티모달 모델로, Apache 2.0에 따라 배포됩니다. 그 한 줄은 벤치마크 표보다 더 많은 배포를 결정할 것이므로, 거기서 끝내기보다 거기서 시작하는 것이 좋습니다.

이것은 우연히 같은 종류의 객체인 전문가와 범용가를 비교한 것입니다. TwIL-LM3-Pro는 한 가지 일, 즉 형식 논리를 수행하며, 자신보다 몇 배 더 큰 모델들보다 그 일을 더 잘 해냅니다. Gemma 4 12B는 여러 가지 일을 수행하고, 읽을 뿐 아니라 보고 들을 수도 있으며, 다른 누군가의 제품에서 기본 소형 모델이 되도록 의도적으로 만들어졌습니다. 이들이 같은 자리를 두고 경쟁하는 것처럼 서로의 스펙 시트를 맞대어 읽는 것이 바로 이 페이지가 방지하고자 하는 실수입니다.

라이선스는 최초의 명세입니다

TwIL-LM3-Pro의 라이선스는 복제, 연구 및 개인적 사용을 허용하며, 수익 창출을 위한 배포에 대해서는 webAI와 별도의 계약을 명시적으로 요구합니다. 또한 서면 동의 없이 webAI의 상호 및 상표를 사용하는 것을 제한합니다. 취미 활동가, 박사 과정 학생 또는 내부 연구 그룹에게는 이것이 완전한 허가입니다. 제품을 출시하는 사람에게는 계약이 존재할 때까지 완전한 중단이며 — webAI의 상업적 경로는 기업용 계약 방식이지, 공개된 요금표가 아닙니다.

Gemma 4 12B는 Apache 2.0입니다. Google의 사용 정책이 적용되는 조건 아래, 이 모델을 파인튜닝하고, 파생물을 재배포하고, 고객에게 제공하고, 상용 제품 안에 포함해 출시할 수 있습니다. 이는 정도의 작은 차이가 아닙니다. 평가할 수 있는 모델과 그 위에 구축할 수 있는 모델 사이의 차이입니다.

둘 다 Hugging Face에서 게이트 없는 다운로드이므로, 라이선스가 유일한 관문이며, 그것도 진짜 관문이다.

각 모델의 실제 용도

TwIL-LM3-Pro는 `ibm-granite/granite-4.2-3b`에서 5단계 파이프라인을 거쳐 파생되었습니다 — 합성 형식논리 코퍼스에 대한 LoRA 지도 미세조정, 다중 경로 증류, 체크포인트 융합, 사전학습 베이스 쪽으로 되돌리는 WiSE-FT 보간, 그리고 프로그래밍 방식 검증기를 상대로 한 엔트로피 가중 GRPO 단계입니다. 이 모델의 목표 출력은 산문이 아니라 객체입니다: 1차 논리 번역, 함의 레이블, 의미 파싱, Lean 명제문, Lean 증명 비평. webAI는 이 모델이 범용 어시스턴트가 아니며 Granite 4.2가 보유했던 것 이상의 안전성 또는 선호도 튜닝을 갖추고 있지 않다고 분명히 밝힙니다.

Gemma 4 12B는 정반대의 구성입니다. 이는 Gemma 4 제품군의 11.95B 파라미터 dense 구성원으로, 48개 레이어, 262K 어휘, 256K 토큰 컨텍스트 창을 갖추고 있으며, 별도의 비전 및 오디오 타워를 덧붙이는 대신 인코더 없는 아키텍처를 통해 텍스트, 이미지, 오디오를 처리하는 네이티브 멀티모달 모델입니다. 모든 Gemma 4 모델은 구성 가능한 사고 모드, 네이티브 시스템 프롬프트 지원, 함수 호출과 함께 제공됩니다. 소비자용 GPU에 맞는 크기에서 범용 추론 및 멀티모달 작업을 위한 주력 모델이 되도록 설계되었습니다.

TwIL-LM3-Pro에게 사진을 묘사하도록 요구하는 것은 공정한 테스트가 아니며, 그 모델이 치르도록 만들어진 테스트도 아니다. Gemma 4 12B에게 고정된 스키마로 의미 파싱을 출력하도록 요구하는 것 역시 그것이 튜닝된 작업이 아니다. 겹치는 부분은 실재하지만 좁다: 둘 다 추론할 수 있고, 둘 다 오프라인에서 실행할 수 있다.

실제로 차이가 나는 차원들

• 파라미터 — TwIL-LM3-Pro 3.66B dense 대 Gemma 4 12B 11.95B dense, 약 3.3배 차이.

• 컨텍스트 창 — TwIL-LM3-Pro 131,072 토큰, Granite 베이스에서 변경 없이 그대로 계승; Gemma 4 12B 256,000 토큰.

• 입력 모달리티 — TwIL-LM3-Pro는 텍스트만; Gemma 4 12B는 텍스트, 이미지, 동영상, 오디오.

• 라이선스 — webAI Non-Commercial License ver. 1.0 vs Apache 2.0.

• 기본 모델 — `ibm-granite/granite-4.2-3b` 대 Goog​le 자체의 Gemma 4 사전 학습, 기술 보고서와 함께 공개.

• 사고 형식 — TwIL-LM3-Pro는 답변 전에 기본적으로 `<think>` 블록을 출력하며, Gemma 4는 제품군 전반에서 구성 가능한 사고 모드를 제공합니다.

• 양자화된 메모리 사용량 — TwIL-LM3-Pro Q4_K_M은 2.09 GiB로, CPU 또는 4 GB VRAM에서 실행됩니다. Gemma 4 12B는 bf16에서 약 24 GiB이며, 노트북의 통합 그래픽이 아닌 소비자용 GPU에 맞춰진 크기입니다.

그 마지막 줄은 "둘 다 로컬에서 실행된다"는 프레이밍을 가장 날카롭게 무너뜨리는 대목이며, 이 점은 정확히 짚고 넘어갈 가치가 있다. TwIL-LM3-Pro의 로컬 주장은 노트북급 주장이다. Gemma 4 12B의 로컬 주장은 워크스테이션 GPU급 주장이며, Google의 더 작은 E2B와 E4B 모델이 진짜 스마트폰·노트북 계층을 담당한다. 둘 다 로컬이라고 불리는 두 모델이 같은 하드웨어 기준을 공유하는 것은 아니다.

벤치마크 증거의 현황

TwIL-LM3-Pro의 모든 성능 수치는 webAI 자체 모델 카드에서 나온 것이며, 회사 자체 Track A 및 Track B 하네스에서 측정된 것입니다. 아직 독립적인 평가는 존재하지 않습니다. 모델 카드 자체가 강조하는 비교는 어떤 Gemma 모델이 아니라 Qwen3-8B와의 비교입니다 — webAI의 매크로 게이트 0.5539 대 Qwen3-8B의 0.5336으로, 카드는 이 우위를 샘플링 노이즈 범위 내라고 설명하며, strict-7은 0.2879 대 0.2093으로 이 격차는 느슨한 일치 크레딧에 의존하지 않습니다. 자체 Granite 4.2 3B 베이스와 비교하면, 인도메인 매크로 게이트는 0.4313에서 0.5539로 상승하는 반면, 홀드아웃 10개 데이터셋 매크로는 0.7901 대 0.7942로 같은 수준을 유지합니다.

Gemma 4 12B는 공개된 기술 보고서와 폭넓은 제3자 평가를 갖추고 있습니다. 또한 자사 제품군 내에서 벤더가 보고한 벤치마크 순위도 있습니다 — Google은 자체 추론 및 코딩 표에서 12B Unified 빌드를 31B 및 26B A4B보다 낮게 평가합니다. 그 순위는 Google의 것이며, 그대로 인용할 가치가 있습니다.

직접 맞대결에 관해 솔직히 말하면, 그런 것은 없다. 아무도 TwIL-LM3-Pro와 Gemma 4 12B를 공통 하네스에 통과시켜 그 결과를 발표하지 않았다. 이 둘은 평가 기준이 서로 겹치지 않기 때문에, 누구에 의해서도 같은 평가 기준으로 채점된 적이 없다. 형식 논리 함의 정확도와 MMLU-Pro 백분율은 같은 단위가 아니다.

각각이 올바른 선택일 때

필요한 출력이 기계가 검증할 수 있는 구조 — 함의 레이블, Lean 문장, 의미 파싱 — 이고, 작업 부하가 배치 또는 오프라인이며, 라이선스가 그 결과로 하는 일에 제약이 되지 않을 때에는 TwIL-LM3-Pro를 택하세요. 네트워크 의존성 없이 CPU에서 실행되는 2.09 GiB 양자화 빌드는 에어갭 파이프라인이나 노트북에서 실행해야 하는 라벨링 패스에 진정한 이점입니다.

출시할 수 있는 범용 모델이 필요할 때, 입력이 텍스트가 아닐 때, 컨텍스트가 길 때, 또는 파인튜닝하고 재배포해야 할 때 Gemma 4 12B를 선택하세요. Apache 2.0에 네이티브 멀티모달리티, 256K 윈도우까지 더한 조합은 어떤 좁은 분야 전문 모델도 제공하지 못합니다.

둘은 공존할 수도 있습니다. Gemma 4 12B를 사용해 혼합 모달리티 입력을 읽고 정규화한 다음, 구조화된 명제를 형식 논리 전문가에게 넘기는 파이프라인은 합리적인 분업이며, 이는 프런티어 모델로 초안을 작성하고 소형 모델로 검증하는 것과 같은 형태입니다.

하나의 엔드포인트에서 둘 중 어느 것이든 제공

TwIL-LM3-Pro와 Gemma 4 12B Unified 빌드 모두 현재 OrcaRouter 카탈로그의 라우트가 아니며, 이 점은 권장 사항을 말한 뒤가 아니라 앞에 밝힐 가치가 있습니다. 같은 패밀리에서 라우팅되는 것은 더 큰 Gemma 4 티어 — `gemma-4-26b-a4b-it`와 `gemma-4-31b-it` — 이므로, 여기서 흔한 패턴은 호스팅된 Gemma 4 티어를 OpenAI 호환 엔드포인트에서 제공자 정가에 0% 마크업을 더한 가격으로 사용해 프롬프트와 스키마를 프로토타이핑한 다음, 확정된 워크로드를 자체 하드웨어의 12B 체크포인트로 옮기는 것입니다. 동일한 엔드포인트가 200개 이상의 모델을 제공하므로, 평가 데이터를 생성하는 데 사용하는 프런티어 모델과 이를 검증하는 데 사용하는 소형 모델은 키 하나와 요청 형식 하나만 다릅니다, 실행 중 공급자가 흔들리면 자동 페일오버가 이루어집니다.

그것은 평소보다 약한 버전의 라우팅 이야기이며, 그렇게 제시되어야 합니다: 우리는 당신이 비교하고 있는 모델을 호스팅하지 않으므로, 정직한 조언은 전환이 아니라 워크플로우입니다.

A generated two-column scoreboard headed 'TwIL-LM3-Pro vs Gemma 4 12B - the scoreboard' with six shared dimension rows. TwIL-LM3-Pro: Parameters 3.66B dense; Context 131,072 tokens; Input text only; Licence non-commercial; Base granite-4.2-3b; Quantised size 2.09 GiB Q4_K_M. Gemma 4 12B: Parameters 11.95B dense; Context 256,000 tokens; Input text, image, audio; Licence Apache 2.0; Base Google Gemma 4 pretraining; Quantised size about 24 GiB in bf16. A footer line reads 'Gemma figures per Google model card; TwIL figures vendor-reported by webAI.' The OrcaRouter logo is composited in the bottom-right corner.

의사결정 규칙

산출물이 상업적으로 배포 가능해야 한다면, 라이선스가 어떤 벤치마크보다 먼저 그 질문에 답하며, Gemma 4 12B를 가리킨다. 산출물이 오프라인에서 생성되어 내부에서 소비되는 형식 논리 출력이라면, TwIL-LM3-Pro가 3분의 1 크기로 더 강력한 도구다. 둘 다 필요하다면, 흥미로운 엔지니어링은 승자를 고르는 것이 아니라 범용 멀티모달 모델이 멈추고 형식 논리 전문가가 시작되는 인터페이스를 정의하는 것이다.

A screenshot of the OrcaRouter model page for google/gemma-4-31b-it, dated 2026-04-02, showing the 30.7B dense multimodal description, a 256K token context window, the $0.13 input and $0.38 output rate, and the OrcaRouter chrome with Code samples, Pricing, Performance, Public benchmarks and FAQ sections.A screenshot of the Hugging Face model card for google/gemma-4-12B-it, showing the Google author line, the Any-to-Any, Transformers, Safetensors and gemma4_unified tags, the Apache 2.0 licence badge, and the opening text describing the Gemma 4 12B Unified model as part of the Gemma 4 family with native audio and vision understanding and no separate encoders.