"AesCode-8B vs Gemma 4 12B"라는 제목의 생성된 타이틀 카드가 있고, 두 개의 둥근 카드가 나란히 놓여 있다. 왼쪽 카드 AesCode-8B에는 브라우저 창 아이콘과 "Microsoft research checkpoint", "Emits a rendered HTML page"라는 줄이 있다. 오른쪽 카드 Gemma 4 12B에는 문서 위에 놓인 돋보기 아이콘과 "Google DeepMind, launched 2026-06-03", "Answers questions about images"라는 줄이 있다. 둘 사이의 구분선에는 "one renders, one replies"라고 적혀 있고, 상단을 가로지르는 캡션 띠에는 "unannounced release - weights only, no hosted endpoint"라고 적혀 있다. OrcaRouter 로고가 오른쪽 아래에 합성되어 있다.
Guides & Insights

AesCode-8B vs Gemma 4 12B: 두 개의 작은 비전 모델, 완전히 다른 두 가지 출력

작성자

Magnus Corvin

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

AesCode-8B와 Gemma 4 12B는 둘 다 이미지 하나와 문장 하나를 입력으로 받고, 둘 다 빌리는 대신 다운로드하는 Apache-2.0 체크포인트입니다. 그래서 검색 엔진이 이 둘을 기꺼이 나란히 놓는 것입니다. 닮은 점은 실제로 있지만, 그 닮음은 얕기도 합니다. Gemma 4 12B는 답을 돌려줍니다 — 설명, 전사, 코드 조각, 추론 과정 같은 것이죠. AesCode-8B는 렌더링된 페이지를 돌려줍니다: 브라우저에서 열어 직접 손으로 편집할 수 있는 완전한 HTML 및 CSS 문서 형태의 슬라이드, 포스터, 대시보드입니다. 입력 형태도 같고, 대략적인 체급도 같지만, 출력은 서로 거의 겹치는 것이 없습니다. 이 단 하나의 차이가 아래의 거의 모든 실무적 질문을, 심지어 내일 사용자 앞에 어느 쪽을 내놓을 수 있는지까지 결정합니다.

미리 밝혀둘 만하다. 이는 그 수치가 어느 정도 비중을 지닐 수 있는지를 좌우하기 때문이다. Gemma 4 12B는 DeepMind가 2026-06-03에 모델 카드, 문서, 생태계와 함께 출시했으며, 이후 독립적으로 테스트되어 왔다. AesCode-8B는 아예 출시되지 않았다. Microsoft의 해당 저장소는 2026-09-29에 만들어졌고, 가중치는 2026-10-07 03:35 UTC에 "Release AesCode-8B"라는 제목의 커밋에 들어왔으며, 학습 및 평가 코드는 다음 날 GitHub에 나타났다. Microsoft Research 게시물도, 제품 페이지도, 릴리스 노트도, 프리프린트도 없다 — 모델 카드의 인용은 2027이라는 자리 표시자 연도와 함께 "Under review"라고 적혀 있다. 이 글을 쓰는 현재 8B 저장소는 다운로드 2회와 좋아요 1개를 보여준다. 따라서 AesCode-8B에 관한 모든 정량적 내용은 Microsoft 자체의 것이며, 그 누구에 의해서도 재현되지 않았다.

두 모델, 각자의 방식으로

Gemma 4 12B는 중형 오픈 모델로, 119억 5천만 파라미터 덴스 체크포인트이며, 이 모델의 결정적인 설계 선택은 별도의 비전 또는 오디오 인코더가 없다는 점입니다: 이미지 패치와 오디오 파형이 트랜스포머로 곧바로 들어갑니다. 이 모델은 256K 토큰 컨텍스트를 지원하고 약 16GB의 VRAM을 요구하며, BF16 가중치는 약 27GB이고 양자화 빌드는 7GB 미만입니다. 벤더 자체 카드 — 벤더가 보고한 것이며 여기에서도 그렇게 표시됨 — 에는 사고 모드에서 DocVQA 94.9, InfoVQA 88.4, MMLU-Pro 77.2, GPQA Diamond 78.8, AIME 2026 77.5, LiveCodeBench v6 72.0이 나열되어 있습니다. 독립 평가가 더 중요한 부분입니다: Artificial Analysis는 추론 구성을 Intelligence Index 14로 평가하고, 초당 약 114토큰을 측정하며, 일반적인 서비스 호출 가격을 백만 입력 토큰당 약 $0.10, 백만 출력 토큰당 $0.30으로 책정합니다. 그 뒤에는 3개월 반의 배포 기간이 있습니다.

AesCode-8B는 Qwen3-VL-8B-Instruct의 파인튜닝 모델로, 총 17,543,339,408바이트에 달하는 네 개의 safetensors 샤드로 공개되었습니다 — 약 88억 개의 bf16 파라미터이며, 그래서 Hugging Face의 반올림된 크기 필드는 9B로 표시되는 반면 벤더는 8B라고 말합니다. 공개된 구성은 그대로 Qwen3-VL 레시피입니다: 36개의 은닉층, 은닉 크기 4,096, 8개의 키-값 헤드를 가진 32개의 어텐션 헤드, 151,936개 토큰 어휘, 그리고 transformers 4.57 이상이 필요합니다. Microsoft가 보고한 실행은 최대 12,000개의 출력 토큰과 함께 24,576토큰 컨텍스트를 사용했고, temperature 0.8, top-p 0.95, 프롬프트당 세 번 생성에 선택 없음을 사용했습니다. 라이선스는 Apache 2.0이며, 게이트가 없고, 허용 사용 부록도 없습니다. 박스에 없는 것은 학습 및 평가 데이터와 호스팅 엔드포인트입니다 — AesCode-8B가 어디에서도 서비스되는 것을 찾을 수 없었고, 자체 카탈로그에도 없습니다.

모델들이 실제로 훈련받은 것

디자인 브리프는 모델 카드에 인용되어 있으며, 전체 논지로서 읽을 가치가 있다. 코드 모델은 "레이아웃, 위계, 색상이 캔버스 위에서 어떻게 어우러지는지 볼 수 없고", 이미지 생성기는 "시각적으로 매력적인 페이지를 구성하지만 텍스트, 숫자, 논리적 관계를 종종 잘못 렌더링한다." AesCode는 구성 감각과 검증 가능성을 동시에 유지하려는 시도다.

이 메커니즘은 특정한 한 가지 면에서 이례적이다. 모든 학습 프롬프트는 같은 프롬프트에서 생성된 참조 이미지와 짝을 이룬다. 이 참조 이미지는 레이아웃과 스타일을 제공하는 반면, 텍스트 프롬프트는 내용에 대한 기준으로 남는다. 그런 다음 추론 시점에는 모델이 그 이미지를 거의 필요로 하지 않는다. AesCode-8B에서 참조를 제외하면 Visual 점수는 100점 만점에 1.00점 떨어진다. Qwen3-VL-8B-Instruct에서 제외하면 하락폭은 19.55다. 동일한 하네스에서 평가된 GPT-5.5에서 제외하면 10.04다. 시각적 사전 지식은 입력이 아니라 가중치에 남게 되었고, 그것이 헤드라인 아래에 있는 진정한 연구 결과다.

Gemma 4 12B의 훈련 목표는 일반적인 멀티모달 목표이며, 그렇게 말하는 것이 비판은 아니다: 이미지를 읽고, 질문에 답하고, 지시를 따르고, 도구를 호출하는 것. 모델 카드 어디에도 렌더링된 결과물을 생성하도록 겨냥된 적이 있다는 암시는 없으며, 공개된 Gemma 4 12B 평가 중 문서 레이아웃 품질, 캔버스 오버플로 또는 디자인 일관성을 측정하는 것은 없다. 그것들은 이 모델의 지표가 아니기 때문이다.

점수판, 그리고 그것이 누구의 평가 기준인가

A generated two-column scoreboard titled "AesCode-8B vs Gemma 4 12B - the scoreboard". Left column AesCode-8B reads Parameters 8.8B dense, Inputs text plus one image, Output a rendered HTML page, Context 24,576 tokens, Evidence Microsoft rubric with no outside test, Hosted nowhere we can find. Right column Gemma 4 12B reads Parameters 11.95B dense, Inputs text, image, audio, video, Output text and tool calls, Context 256K tokens, Evidence AA Intelligence Index 14, Hosted cheap served calls. A footer line reads "AesCode-8B figures are Microsoft-reported and unreproduced; Gemma 4 12B figures per Artificial Analysis." The OrcaRouter logo is composited bottom-right.

• 매개변수 — AesCode-8B: 8.8B bf16, 밀집형. Gemma 4 12B: 11.95B 밀집형.

• 입력 — AesCode-8B: 텍스트와 선택적 참조 이미지. Gemma 4 12B: 텍스트, 이미지, 오디오 및 비디오.

• 출력 — AesCode-8B: 완전한 HTML 및 CSS 문서. Gemma 4 12B: 도구 호출을 포함한 텍스트.

• 컨텍스트 — AesCode-8B: 보고된 구성에서 24,576 토큰. Gemma 4 12B: 256K 토큰.

• 라이선스 — 둘 다 Apache 2.0, 게이트 없음, 가중치 포함.

• 근거 — AesCode-8B: Microsoft 자체의 300개 샘플 인포그래픽 평가 기준, 프롬프트당 3회 생성, 독립적 재현 없음. Gemma 4 12B: 벤더 카드와 함께 독립적인 Intelligence Index 14, 그리고 Artificial Analysis에서 측정된 처리량.

이제 점수판이 담지 못하는 부분이다. 마이크로소프트는 AesCode-8B가 그 300개 샘플 세트에서 종합 82.94를 기록했다고 보고하며, 이는 참조 조건이 주어진 GPT-5.5의 81.28, Claude Opus 4.8의 80.39를 앞서고, 자체 Qwen3-VL-8B 백본보다 시각 점수로 31.1점 앞선다. 이 모든 것을 벤더가 보고했고 재현되지 않은 수치로, 벤더가 만든 평가 기준에서, 벤더가 고른 샘플로, 벤더가 모델을 훈련시킨 하네스가 채점한 결과로 읽어야 한다. 이 카드는 비교군의 어떤 모델도 60을 넘지 못하는 차원을 공개할 만큼 정직하다 — 스타일, 여기서 AesCode-8B는 53.21이고 GPT-5.5가 57.91로 앞선다 — 그리고 마이크로소프트 자신이 정의한 그 차원은 납품 전에 더 이상 시각적 수정이 필요 없는 디자인이다. 사람이 그 페이지를 편집 없이 출시할지 묻는 단 하나의 축에서, 8B 모델은 선두가 아니다. 누군가 82.94를 인용할 때 붙들어야 할 숫자는 바로 그것이다.

그들이 진정으로 겹치는 부분

공유 선반은 정확히 하나뿐이며, 그것은 보기보다 좁습니다. 문서 비중이 큰 파이프라인을 위해 소형 오픈 비전 모델을 평가하고 있다면, 둘 다 후보입니다 — 하나는 문서를 읽기 위한 것이고, 다른 하나는 문서를 생성하기 위한 것입니다. 내부 대시보드를 HTML로 생성하면서 업로드된 PDF에서 수치를 추출해야 하는 팀은 같은 주에 두 제품을 모두 접하게 됩니다.

그 중첩 안의 구분은 명확하다. Gemma 4 12B는 들어오는 문서를 향해 지정하는 모델이다. AesCode-8B는 산출물이 페이지일 때 브리프를 향해 지정하는 모델이다. 어느 쪽도 다른 쪽을 대체하지 않으며, 둘 다를 원하는 파이프라인은 선택이 아니라 두 모델을 쓰는 파이프라인이다.

A Hugging Face screenshot of the microsoft/AesCode-32B model card showing tags for Image-Text-to-Text, Transformers, Safetensors, English and qwen3_vl, an Apache-2.0 licence badge, 1 like from the Microsoft organisation, and the card opening text that AesCode generates information-rich visual artifacts such as slides, posters and dashboards as HTML/CSS with output that stays structured, editable and verifiable.

배포, 바로 여기서 비대칭이 실제로 문제가 되기 시작한다

Gemma 4 12B의 서빙 이야기는 끝났습니다. 내려받고, 원하면 양자화한 뒤, 16GB VRAM에서 실행하면 되며, 이미 이를 수행하는 도구 기반도 방대합니다. 아예 직접 실행하고 싶지 않다면, 서빙 호출은 저렴하고 독립적으로 가격이 책정됩니다.

AesCode-8B의 서빙 이야기는 명령줄 하나와 약간의 산수로 요약됩니다. 모델 카드가 경로를 곧바로 알려줍니다 — vllm serve microsoft/AesCode-8B --limit-mm-per-prompt image=2 --max-model-len 24576, 비-vLLM 경로라면 transformers 4.57 이상을 사용합니다. 17.5GB의 bf16 가중치가 24,576개 토큰과 최대 두 이미지용 KV 캐시와 함께 자리해야 하므로, 24GB 카드 한 장은 기술적으로는 충분하지만 불편할 정도로 빠듯합니다. 현실적인 최소선은 40-48GB 또는 24GB 카드 두 장입니다. 렌더러도 예산에 포함해야 합니다. 이 모델에 관한 모든 품질 주장은 샌드박스 브라우저에서 HTML 출력을 렌더링함으로써 이루어지므로, 자체 결과를 채점하려면 외부 요청이 차단된 Playwright 형태의 무언가를 세워야 합니다.

그다음, 가용성에 관한 솔직한 현실이 있습니다. 우리는 AesCode-8B를 라우팅하지 않으며, 우리가 찾아낸 바로는 다른 누구도 라우팅하지 않습니다. 오늘 평가한다는 것은 자체 하드웨어에 가중치를 올린다는 뜻입니다. 호출 가능한 가장 가까운 대상은 이 모델이 미세 조정된 기반 아키텍처입니다. Qwen3-VL-8B-Instruct는 현재 OrcaRouter를 통해 라우팅할 수 있으며, 131,072토큰 컨텍스트에서 입력 토큰 100만 개당 $0.18, 출력 토큰 100만 개당 $0.70입니다, 그리고 저희가 실제로 보유한 두 체크포인트도 같은 방식으로 가격이 책정됩니다 — Gemma 4 26B-A4B는 $0.06 및 $0.33, Gemma 4 31B는 $0.13 및 $0.38입니다. 제공업체 정가는 마크업 없이 그대로 전달되며, 제공업체 간 장애 조치는 자동으로 이루어집니다, 따라서 프롬프트가 애초에 잘 렌더링되는지 저렴하게 확인하는 방법은 미세 조정되지 않은 백본을 먼저 테스트하고, 살아남는 프롬프트에만 GPU 한 주 분량을 투입하는 것입니다.

A screenshot of the OrcaRouter model page for google/gemma-4-31b-it, showing the Featured badge, the byline "by Google - 2026-04-02", a description of Gemma 4 31B Instruct as a 30.7B dense multimodal model with text and image input and a 256K-token context window, and the pricing row reading $0.13 input and $0.38 output per million tokens with measured latency figures.

어느 걸 진짜 원해

산출물이 페이지라면 AesCode-8B를 선택하라. 이 모델은 구조화되고 편집 가능한 HTML을 출력한다 — 표는 HTML 표로, 차트는 ECharts 스펙으로 — 따라서 출력은 Git에서 diff되고, 디자이너가 다시 생성하지 않고도 스타일을 바꿀 수 있다. 다음 대가를 받아들여라: 공지되지 않은 연구 체크포인트에 두 자릿수 다운로드 수, 독립적 평가 없음, 호스팅된 엔드포인트 없음, 단일 인포그래픽 페이지에서만 검증된 24K 컨텍스트, 그리고 카드에 붙은 영어 전용 언어 태그.

다른 모든 용도로는 Gemma 4 12B를 선택하세요. 이 모델은 자신의 두 배 크기인 대부분의 모델보다 문서를 더 잘 읽고, 오디오를 처리하며, 도구 지침을 따르고, 25만 토큰의 컨텍스트를 갖추고 있으며, 다른 사람들이 3개월 반 동안 쌓은 경험이 뒷받침합니다. 이 둘 중 하나를 작은 비전 모델로 선택하려는 것이고, 특별히 슬라이드 덱을 코드로 생성하라는 요청을 받은 것이 아니라면, 이것이 답입니다.

그리고 정직한 요구 사항이 둘 다라면, 그것을 타이브레이크로 취급하지 마세요. 읽기 작업은 호스팅된 모델로 보내고, 렌더링 작업은 가중치를 담을 수 있는 머신에 그대로 두세요.

이 페이지를 바꾸려면 무엇이 필요할까요

세 가지 신호. 82.94와 1.00포인트 기준 하락에 대한 독립적 재현은 AesCode-8B를 벤더 주장에서 결과로 옮겨 놓을 것이고, 8B 대 12B 크기 문제를 명목상이 아니라 진정으로 흥미로운 것으로 만들 것이다. 추론 제공업체가 그 체크포인트를 채택하면 배포 열이 무너질 텐데, 현재 그것이 실질적 차이의 전부이기 때문이다. 그리고 Microsoft가 심사 중이라고 인용한 논문 — "AesCode: Aesthetic Code Generation with Decoupled Cross-Modal Rewards" — 은 모델 카드가 답할 수 없는 질문들에, 디자인 그래프 자체가 잘못됐을 때 시각적 루브릭이 어떻게 작동하는지부터 시작해, 답할 것이다. 그중 하나가 나오기 전까지, 방어 가능한 해석은 좁고도 실제적이다: AesCode-8B는 기계가 검사할 수 있는 시각 디자인의 부분들에는 매우 뛰어나고, 기계가 검사할 수 없는 부분에는 중간 정도이며, Gemma 4 12B는 다른 일을 하는 완성된 제품이다.

이 글에서 비교한 모델2

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트