생성된 타이틀 카드에는 'AREX-2 vs Gemma 4 12B - One of These Is a Model'이라고 적혀 있으며, 두 개의 패널이 있다. 왼쪽 패널은 Gemma 4 12B라는 제목 아래 다음을 나열한다: 2026년 6월 3일 출시; 11.95B 파라미터, dense; 256K 컨텍스트, Apache 2.0; 오늘 다운로드하세요. 오른쪽 패널은 AREX-2라는 제목 아래 다음을 나열한다: 2026년 9월 29일 저장소 생성; 업로드된 가중치 없음; 카드 없음, 라이선스 태그 없음; 다운로드 불가. 하단에는 '한쪽 열은 모델이다. 다른 쪽은 타임스탬프다.'라고 적혀 있다. OrcaRouter 로고가 오른쪽 아래 모서리에 합성되어 있다.
Guides & Insights

AREX-2 vs Gemma 4 12B: 이 중 하나는 모델입니다

작성자

Gideon Frost

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

A comparison between Gemma 4 12B and AREX-2 has a property no other matchup on this blog has: one of the two columns is empty because the model on that side does not exist yet. Gemma 4 12B is a shipped artifact — Goog​le DeepMind published it on June 3, 2026 as an 11.95-billion-parameter dense open-weights model under Apache 2.0, with a full model card, a 256K-token context window, native audio and image input, and three and a half months of independent testing behind it. AREX-2 is a Hugging Face repository that BAAI created on September 29, 2026 at 17:56 UTC and has not yet put anything into: no weights, no card, no licence tag, no evaluation, no announcement.

그 비대칭성은 비교를 건너뛸 이유가 아니다. 그것이 바로 비교다. 답할 가치가 있는 질문은 이들 중 어느 쪽이 더 나은가가 아니라 — AREX-2에 파일이 들어가기 전에는 아무것도 그 질문에 답할 수 없다 — 2세대 BAAI 연구 에이전트가 애초에 12B 엣지 모델과 경쟁하게 될 것인지, 아니면 이 둘이 서로 결코 맞닿지 않는 스택의 서로 다른 위치를 차지하는 것인지다. 이것을 잘못 짚는 것이 값비싼 실수다. 왜냐하면 그것이 바로 팀으로 하여금 잘못된 것에 예산을 배정하게 만드는 실수이기 때문이다.

출시된 쪽, 그 나름의 기준으로

Gemma 4 12B is the small member of Goog​le's fourth-generation open family, and its defining design choice is architectural: it drops the separate vision encoder entirely and feeds raw image patches and audio waveforms straight into the transformer. That is not a benchmark trick. It is what makes the model genuinely portable — roughly 27 GB of BF16 weights that quantise below 7 GB, and a card that names 16 GB of VRAM as the deployment target. On a laptop or a single mid-range card, this is a model you can actually hold.

The capability profile follows from that. Goog​le's own card — vendor-reported, and worth labelling as such — lists DocVQA 94.9 and InfoVQA 88.4 for document understanding, MMLU-Pro 77.2, GPQA Diamond 78.8, AIME 2026 77.5 and LiveCodeBench v6 72.0 in thinking mode. Artificial Analysis, which is independent, scores the reasoning configuration at an Intelligence Index of 14, measures it at 114 tokens per second, and prices a typical served call at $0.10 per million input tokens and $0.30 per million output. Our own catalogue entry for the larger Gemma 4 31B carries 85.7 on GPQA Diamond. The shape of that is a small generalist that is unusually strong on documents and images, reasonable on reasoning, and nowhere near a frontier model on hard multi-step work.

Its job description is therefore concrete: local or single-tenant inference, document and screenshot understanding, modest agentic loops, and anything where the data cannot leave the building. It is not a deep-research engine and Goog​le does not sell it as one.

A screenshot of the Artificial Analysis model page for Gemma 4 12B (Reasoning), showing an Artificial Analysis Intelligence Index of 14, a speed rank of 19 of 142, $0.10 per million input tokens and $0.30 per million output, a 256K-token context window, text, image, speech and video input with text output, and the note that it is among the leading models in intelligence but somewhat expensive for its size. The page header reads 'Released June 2026' and 'Open weights model'.

다른 쪽은 이름과 타임스탬프입니다

이번 주에 AREX-2에 대해 확인할 수 있는 모든 것은 한 문장으로 끝난다. 그것은 Hugging Face의 BAAI 조직 산하에 있는 저장소로, 2026년 9월 29일에 생성되었으며, .gitattributes 파일만 들어 있고 그 외에는 아무것도 없다 — 저장된 모델 데이터 0바이트, 다운로드 0회, 모델 카드 없음, 라이선스 선언 없음, 제공자 배포 없음. BAAI 자체는 아무것도 발표하지 않았다.

이것을 기록할 가치가 있게 만드는 것은 그것이 이름을 딴 패밀리이다. BAAI의 AREX 라인은 2026년 7월 23일에 두 가지 모델과 함께 출시되었다: Qwen3.5-122B-A10B를 기반으로 한 1220억 개 매개변수의 전문가 혼합(MoE) 모델로 100억 개의 활성 매개변수를 가진 AREX-Base와, Qwen3.5-4B를 기반으로 구축된 밀집형 4B 모델인 AREX-Turbo. 둘 다 Apache 2.0이다. 둘 다 채팅 모델이 아니라 딥 리서치 에이전트이다 — 증거를 수집하고 신뢰도 수치와 함께 후보 답변을 생성하는 내부 루프, 그리고 그 답변을 원래 제약 조건과 대조하여 확인하고 전체 궤적을 개선하거나 재시작할 수 있는 외부 루프로 구성된다. BAAI가 공개한 수치에 따르면, AREX-Base는 BrowseComp에서 82.5, GAIA에서 85.4, DeepSearch QA에서 89.9를 기록한다; AREX-Turbo는 동일한 세 가지에서 70.7, 81.6, 78.5를 기록한다.

그 모든 수치는 공급업체 자체의 것이며 어느 것도 독립적으로 재현된 바 없습니다. 그것들은 또한 다른 모델에 관한 것입니다. AREX-2에는 수치가 없으며, "2"는 크기, 백본, 아키텍처에 대해 아무것도 알려주지 않습니다 — 이 계열의 2세대는 더 큰 에이전트일 수도, 더 작은 증류 모델일 수도, 백본을 교체한 재학습된 프레임워크일 수도 있습니다.

이 둘이 만나긴 해?

바로 여기에서 이 비교는 겉보기보다 훨씬 유용해진다. AREX-2가 무엇이 되는지에 대한 두 가지 그럴듯한 해석을 살펴보자.

2세대 리서치 에이전트가 Base와 비슷한 규모라면, 그것과 Gemma 4 12B는 결코 경쟁하지 않는다. 다중 소스 검색을 구동하는 122B 전문가 혼합 모델은 호스팅되고 토큰당 과금되며 네트워크에 묶인 서비스다. Gemma 4 12B는 직접 다운로드해서 실행하는 체크포인트다. 둘 사이의 선택은 품질 비교가 아니라, 당신의 워크로드가 연구 루프인지 추론 엔드포인트인지에 관한 결정이다.

AREX-2가 소형 티어로 밝혀진다면 — 122B Base가 아니라 4B Turbo의 후속이라면 — 두 모델은 실제로 같은 선반을 공유하게 되고, 비교는 실제로 성립한다. 그 버전의 AREX-2는 Gemma 4 12B의 파라미터 수의 약 3분의 1에 해당하며, 멀티모달의 폭넓음보다는 도구 기반 검색에 특화되고, DocVQA가 아니라 BrowseComp와 GAIA에서 측정될 것이다. 두 소형 모델, 하나는 긴 연구 궤적을 유지하는 데 최적화되고, 다른 하나는 적당한 하드웨어에서 보고 읽는 데 최적화된다. 문서화 파이프라인을 구축하는 팀은 첫 번째에 관심을 둘 필요가 없고, 연구 에이전트를 구축하는 팀은 두 번째에 관심을 둘 필요가 없다.

• 존재하는 것 — Gemma 4 12B는 오늘 전체 모델 카드와 함께 다운로드할 수 있습니다. AREX-2는 파일이 하나도 들어 있지 않은 저장소입니다.

• 파라미터 — Gemma 4 12B의 경우 11.95B dense. AREX-2의 경우 명시되지 않았으며, 제품명을 통해서만 추론할 수 있음.

• 컨텍스트 — Gemma 4 12B 기준 256K 토큰(262,144 포지션). AREX-2는 미확인.

• 모달리티 — Gemma 4 12B는 텍스트, 이미지, 오디오를 입력으로 지원합니다. AREX-2는 미확인이며, 첫 번째 AREX 세대는 텍스트와 도구 사용을 지원했습니다.

• 라이선스 — Gemma 4 12B는 Apache 2.0이며 카드에 명시되어 있습니다. AREX-2는 명시되지 않았습니다. AREX-Base와 AREX-Turbo는 Apache 2.0이었습니다.

• 용도 — 자체 하드웨어에서의 배포 가능한 멀티모달 추론과, 이 제품군의 증거에 비추어 볼 때 호스팅 엔드포인트를 상대로 한 장기 지평 탐색 및 증거 집계의 대비.

A generated two-column card headed 'Two deployment shapes, and only one of them exists'. It contrasts where Gemma 4 12B runs (local or single-tenant; about 27 GB BF16, under 7 GB quantised, 16 GB VRAM target; no rate card or per-token meter) against where AREX-Base runs (a 122B mixture-of-experts, a cluster or a hosted endpoint billed per token), names tokens per search step times steps per trajectory as the cost driver for the AREX shape, and notes that AREX-2 is neither shape because there are no files in the repository. A footer reads 'Is this a quality comparison? Not until one side has a model in it.' The OrcaRouter logo is composited in the bottom-right corner.

실제로 비교할 수 있는 부분: 각각이 실행되는 위치

능력 비교가 불가능하므로, 정직하게 할 수 있는 비교는 배포 비교이며, 그 격차는 작지 않다.

Gemma 4 12B는 당신이 두는 곳에서 실행됩니다. 요율표도, 토큰당 계량기도, 당신과 모델 사이의 제공자도 없습니다 — 비용은 하드웨어와 전기이며, 실패 모드는 당신 자신의 용량 계획입니다. 이와 대조적으로 AREX-Base가 7월에 출시되었을 때, 그것은 122B 전문가 혼합(mixture-of-experts) 모델이었습니다: 클러스터에서 서빙하거나 토큰당 임대하는 모델이며, 이 제품군 자체의 4B Turbo가 존재하는 이유는 바로 그 선택에 대가가 따르기 때문입니다. 2세대가 같은 형태를 따른다면, AREX-2의 경제성은 쿼리당 소비되는 토큰 수에 트래젝터리가 거치는 검색 단계 수를 곱한 값의 함수가 될 것입니다 — 그 수는 문서 읽기 모델보다 심층 리서치 에이전트에서 훨씬 더 큰데, 에이전트는 매 반복마다 커지는 컨텍스트를 다시 읽기 때문입니다.

바로 그 지점에서 라우팅 계층은 추상화를 그만두고 하나의 비용 항목이 되기 시작합니다. 문서 작업용으로 로컬 Gemma 4 12B를 유지한 채 호스팅 모델에 리서치 에이전트를 돌리게 된다면, 일반적인 경우 그것은 두 개의 통합입니다. 200개 이상의 모델 앞에 놓인 하나의 API를 통하면 — 공급자 정가가 그대로 전달되고 그 위에 마크업이 붙지 않아 벤더의 가격 변경이 같은 날 반영되며 — 키 하나, 청구서 하나, 클라이언트 하나로 끝나고, 장애 조치 규칙이 상태가 나쁜 공급자로부터 요청을 옮겨도 에이전트 루프는 그 사실을 알 필요가 없습니다. 우리는 현재 Gemma 4 26B-A4B와 Gemma 4 31B를 라우팅합니다. 12B는 라우팅하지 않으며, AREX 라인의 어떤 모델도 우리 카탈로그에 없으므로, 이 중 하나가 필요한 모델이라면 해당 벤더의 자체 배포판에서 가져와야 합니다.

이번 주에 무엇을 할까요

직접 실행할 수 있는 소형 멀티모달 모델이 필요하다면, 그 결정은 애초에 AREX-2를 기다릴 문제가 아니었습니다. Gemma 4 12B는 이미 출시되었고, 문서화되어 있으며, 독립적으로 평가되었고, 배포 가능합니다. 그리고 반대편의 비교 칸은 비어 있습니다. 이름만 예약해 둔 것을 근거로 아무것도 사지 마십시오.

딥리서치 에이전트를 만들고 있고 실제로 원하는 것이 AREX 라인이라면, 주목할 것은 이름이 아니라 트리입니다. 해당 저장소에 safetensors가 나타나는지, 모델 카드에 파라미터 수가 얼마라고 적혀 있는지, 그리고 어떤 라이선스 태그가 붙는지 말입니다. 첫 세대는 Apache 2.0으로 배포되었고, 2세대도 그렇다면 문제는 라이선스 문제가 아니라 호스팅 문제가 됩니다. 그때까지는 AREX-Base가 실제로 실행할 수 있는 AREX 모델이며, 7월부터 사용할 수 있습니다.

이 글에서 명목상 다루고 있는 비교에 대해 분명히 말할 가치가 있는 한 가지: 한쪽은 리포지토리 커밋이고 다른 쪽은 출시된 모델인 VS 페이지는 맞대결이 아니라 일정이다. 그 일정은 Gemma 4 12B는 지금 사용 가능하고 AREX-2는 전혀 사용할 수 없다고 말한다.