
AesCode-8B vs Qwen3-8B: 그들은 부모와 자식처럼 보이지만, 실제로는 아니다
- OrcaNEWOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 100만 토큰당 · 85 tok/s
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952지능
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856지능
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 115 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238지능
- OpenAIOpenAI: GPT-6 Sol2026-09-2248지능
- AnthropicAnthropic: Claude Opus 5.52026-09-2258지능
- xAIGrok 4.72026-09-2146지능
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100만 토큰당 · 47 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 777 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- OpenAIOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- AnthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당 · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 452 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
이름은 실수를 유도한다. AesCode-8B는 Qwen3-VL-8B-Instruct 백본을 갖춘 8B 모델이고, Qwen3-8B는 벤더 자체의 8B 모델이므로, 누구나 첫 번째가 두 번째를 파인튜닝한 것이라고 읽는다. 아니다. AesCode-8B의 공개된 config는 Qwen3-VL-8B-Instruct를 베이스로 선언한다 — 비전-언어 형제 모델, 하는 일이 다른 별개의 체크포인트다 — 그리고 Hugging Face 메타데이터는 이를 텍스트 전용 Qwen3-8B가 아니라 그 모델의 파인튜닝으로 나열한다. 이 가중치 등급에 속한 두 AesCode 모델은 부모와 자식이 아니라 사촌이며, 그 구분이 바로 이 페이지가 유용한 이유의 전부다. 마이크로소프트가 비전-언어 체크포인트에서 시작했을 때 무엇을 사들였는지, 그것이 텍스트 쪽에서 무엇을 대가로 치렀는지, 그리고 왜 이 패밀리의 평범한 8B 범용 모델과의 비교가 결국 업그레이드가 아니라 하나의 분기를 측정하는 일이 되는지를 알려주기 때문이다.
둘 다 Apache 2.0이고 둘 다 다운로드할 수 있지만, 공개 기록은 이보다 더 다를 수 없습니다. Qwen3-8B는 2025년 4월에 벤더의 Qwen3 세대 라인의 일부로 출시되었으며, 문서와 생태계 통합, 그리고 18개월간 다른 사람들의 배포가 그 뒤를 받치고 있었습니다. AesCode-8B는 파일 어디에도 출시 날짜가 없습니다. Microsoft는 2026-09-29에 Hugging Face 저장소를 만들고, 2026-10-07 03:35 UTC에 "Release AesCode-8B"라는 메시지로 가중치를 커밋했으며, 다음 날 학습 코드를 GitHub에 올렸습니다. Microsoft Research 게시물도, 릴리스 노트도, 제품 페이지도, 논문도 없습니다. 모델 카드의 인용은 자리표시자 연도 2027과 함께 "Under review"라고 적혀 있고, 이 글을 쓰는 시점에 저장소는 다운로드 두 건을 보였습니다. 아래에서 AesCode-8B에 관한 모든 정량적 내용은 Microsoft 자체의 것이며 누구에 의해서도 재현되지 않았습니다.
이름들이 감추고 있는 가계도
Qwen3 세대 라인에는 계보를 공유할 뿐 그 외에는 별로 공통점이 없는 여러 8B급 체크포인트가 포함되어 있습니다. Qwen3-8B는 텍스트 전용 제너럴리스트입니다: 총 파라미터가 약 82억 개이고 그중 비임베딩이 약 70억 개이며, 그룹 쿼리 어텐션, YaRN을 통해 131K까지 확장 가능한 32K 토큰 네이티브 컨텍스트, 그리고 119개 언어와 방언에 걸친 학습을 갖추고 있습니다. 추론하고, 대화하고, 코딩하고, 도구를 호출하며, 바로 그런 이유로 오픈 생태계에서 가장 널리 자체 호스팅되는 8B 모델 중 하나입니다. Qwen3-VL-8B-Instruct는 멀티모달 구성원입니다: 동일한 패밀리 세대, 그 위에 전용 비전 타워, 이미지와 텍스트 입력, 텍스트 출력.
Microsoft는 두 번째 것에서 시작했습니다. AesCode-8B 구성은 Qwen3VLForConditionalGeneration로 되어 있으며, 36개의 히든 레이어, 히든 크기 4,096, 32개의 어텐션 헤드와 8개의 키-값 헤드, 151,936개 토큰 어휘, 인터리브된 mrope 위치를 갖추고 있으며, transformers 4.57 이상이 필요합니다. 샤드 총합은 17,543,339,408바이트로, 약 88억 개의 bf16 파라미터입니다. 그래서 Hugging Face의 반올림된 크기 필드는 9B라고 표시하고 벤더는 8B라고 표시합니다. 이는 불일치라기보다는 반올림이며, 중요한 분기점은 파라미터 수가 아니라 — 입력 모달리티와 24,576토큰 서빙 컨텍스트입니다.
그러니까 정직한 프레이밍은 "범용 모델 대 그 모델의 파인튜닝"이 아니다. 그것은 긴 컨텍스트와 18개월의 프로덕션 이력을 가진 텍스트 범용 모델 대, 문서를 산출하며 한 번도 독립적으로 평가된 적이 없는 멀티모달 연구 체크포인트다.

Microsoft가 훈련 예산을 어디에 썼는지
디자인 브리프는 모델 카드에 인용되어 있으며, 이는 그 갈림길을 설명한다: 코드 모델은 "레이아웃, 계층 구조, 색상이 캔버스 위에서 어떻게 어우러지는지 보지 못하는" 반면, 이미지 생성기는 "시각적으로 매력적인 페이지를 구성하지만 텍스트, 숫자, 논리적 관계를 자주 잘못 렌더링한다." AesCode는 한쪽에서 구성 감각을, 다른 쪽에서 검증 가능성을 가져오려는 시도이며, 그 레시피는 특정한 방식으로 이례적이다.
모든 학습 프롬프트에는 동일한 프롬프트에서 생성된 참조 이미지가 짝지어집니다 — Microsoft의 자체 실행에서는 이미지에 GPT-Image-2를, 짧은 브리프를 상세한 콘텐츠 프롬프트로 확장하는 데 GPT-5.5를 사용했습니다. 참조는 레이아웃과 스타일만 담고 있으며, 텍스트 프롬프트는 콘텐츠에 대해 계속 권위를 가집니다. 그런 다음, 추론 시점에 모델은 그것을 거의 필요로 하지 않습니다. AesCode-8B에서 참조를 빼면 Visual 점수는 100점 만점에 1.00점 하락하는데, 백본은 19.55점, GPT-5.5는 10.04점 하락합니다. 이와 관련된 결과로, 참조 기반 보상은 프롬프트만 사용한 Visual을 25.17에서 69.71로 끌어올렸습니다. 따라서 시각적 사전은 입력에 머무는 대신 가중치로 이동했습니다.
나머지는 보상 설계 이야기입니다. 감독은 노드와 엣지로 이루어진 '디자인 그래프'입니다 — 텍스트, 차트, 표, 카드, 영역, 이미지 슬롯이 노드이고, 포함, 정렬, 순서, 연결이 엣지입니다 — 이는 캔버스의 모든 속성이 이름이 지정된 요소에 속하도록 선택되어 각각 개별적으로 점수를 매길 수 있게 합니다. 일곱 개의 채널이 결과를 평가합니다: 실행, 텍스트, 경계, 표 및 차트 데이터, 의미론적 레이아웃, 공백을 위한 여섯 개의 결정론적 검증기와, 비전-언어 모델이 판단하는 샘플별 Visual Graph Rubric 하나가 있습니다. 후보들은 외부 요청이 차단된 샌드박스 Playwright 브라우저에서 렌더링되며, 하네스는 DOM, 계산된 스타일, 바운딩 박스, 스크린샷을 다시 읽어옵니다. 따라서 표는 반드시 HTML 표여야 하고 차트는 ECharts 사양이어야 합니다. 훈련은 3,000개의 데모에 대한 콜드 스타트 지도 미세 조정으로 시작하여, 8개의 NVIDIA B200으로 구성된 단일 노드에서 400단계 동안 7,408개의 프롬프트에 대해 GDPO를 수행했습니다. 각 보상 채널은 롤아웃 그룹 내에서 정규화되어, 밀도 있는 규칙 기반 신호가 희소한 시각적 신호를 압도하지 못하도록 했습니다. 마이크로소프트는 해당 정규화가 일반 스칼라 GRPO보다 5.12 Visual 포인트 우수하다고 측정했습니다.
그 메커니즘은 AesCode-8B를 더 나은 범용 어시스턴트로 만들기 위해 존재하는 것이 아니다. 그것은 출력을 검증 가능하게 만들기 위해 존재하며, 모델의 컨텍스트가 지금과 같은 것도 바로 그 때문이다.
나란히, 숫자를 표시한 상태로
• 베이스 — AesCode-8B: 비전-언어 체크포인트인 Qwen3-VL-8B-Instruct. Qwen3-8B: 같은 세대의 텍스트 전용 범용 모델.
• 매개변수 — AesCode-8B: 4개의 샤드에 걸쳐 약 8.8B bf16. Qwen3-8B: 총 약 8.2B, 비임베딩 약 7B.
• 입력 — AesCode-8B: 텍스트와 선택적 참조 이미지. Qwen3-8B: 텍스트.
• 출력 — AesCode-8B: 완전한 HTML 및 CSS 문서. Qwen3-8B: 텍스트, 도구 호출, 코드.
• 컨텍스트 — AesCode-8B: 보고된 구성에서 24,576 토큰. Qwen3-8B: 네이티브 32K, YaRN을 통해 131K로 확장.
• 언어 — AesCode-8B: 카드의 태그는 "en" 하나뿐입니다. Qwen3-8B: 119개 언어와 방언.
• 근거 — AesCode-8B: Microsoft 자체의 300개 샘플 인포그래픽 평가 기준, 프롬프트당 3회 생성, 외부 재현 없음. Qwen3-8B: 18개월에 걸친 독립적 벤치마크, 양자화 작업 및 프로덕션 배포.
• 라이선스 — 둘 다 Apache 2.0, 게이트 없음. 동점이며, 사람들이 흔히 생각하는 그런 차별화 요소가 아니다.
증거 격차야말로 진정한 비교다.
Microsoft는 자사 평가 기준에서 AesCode-8B가 종합 82.94점을 기록했다고 보고한다. 이는 참조 조건화된 GPT-5.5의 81.28점, Claude Opus 4.8의 80.39점을 앞서는 수치이며, 자체 참조 조건화 백본보다 시각(Visual) 점수에서 31.1점 앞선다. 그 표에서 세 개의 숫자는 헤드라인보다 더 값어치가 있다. 첫 번째는 Style로, AesCode-8B는 53.21에 머물고 비교 대상 중 어느 모델도 60을 넘지 못한다. 그리고 Microsoft의 Style 정의는 납품 전에 추가적인 시각적 수정이 필요 없는 디자인이므로, 사람이 그 페이지를 수정 없이 출시할지 묻는 유일한 차원에서 이 모델은 선두가 아니다. 두 번째는 경계 실패다. 심각한 캔버스 오버플로가 300개 샘플 중 4.3%에서 반복 발생하며, GPT-5.5는 34.7%다. 세 번째는 점수의 시각적 절반이 이름이 밝혀지지 않은 비전-언어 판정자에서 나온다는 점이다. 이는 결정론적 절반은 외부인이 재현할 수 있지만 나머지 절반은 그렇지 않다는 뜻이다.
Qwen3-8B의 수치는 전혀 다른 곳에서 나오며, 이는 어느 쪽 수치가 더 높은지보다 더 중요합니다. 18개월에 걸친 독립 평가, 커뮤니티 양자화, 서빙 벤치마크, 프로덕션 배포는 다른 종류의 증거입니다. 그것은 주장이 아니라 검증된 이력입니다. Qwen3-8B가 특정 카드에서 4비트 양자화 상태로 어떻게 동작하는지는 누군가 공개해 두었기 때문에 확인할 수 있습니다. AesCode-8B에 대해서는 그렇게 할 수 없습니다. 이번 주 기준으로 Microsoft 외에는 아무도 그것을 어떤 환경에서도 실행해 본 적이 없기 때문입니다.
그리고 두 표 사이에 공통된 지표가 없습니다. Qwen3-8B에는 인포그래픽 레이아웃 점수가 없고, AesCode-8B에는 공개된 일반 추론 벤치마크가 전혀 없습니다. 이 비교는 근소하다거나 근소하지 않다거나 할 문제가 아닙니다 — 비교 자체가 불가능합니다.
각각을 실행하는 데 실제로 필요한 것

Qwen3-8B는 쉬운 쪽이다. 8.2B 텍스트 모델은 단일 소비자용 카드에 양자화되어 들어가고, 모든 서빙 프레임워크와 로컬 런타임 전반에 걸쳐 18개월간의 툴링이 뒷받침하며, 예측 가능하게 동작한다. 131K로의 컨텍스트 확장은 속설이 아니라 문서화되어 있고, 119개 언어 지원은 이 모델이 그렇게 많은 다국어 파이프라인에 등장하는 이유다.
AesCode-8B는 서빙 프로젝트입니다. 이 카드의 자체 명령은 vllm serve microsoft/AesCode-8B --limit-mm-per-prompt image=2 --max-model-len 24576, 이때 transformers 4.57 이상이 비-vLLM 경로에 필요합니다. 17.5 GB의 bf16 가중치가 24,576 토큰과 최대 두 이미지용 KV 캐시 옆에 함께 들어가야 하므로, 24 GB 카드 한 장이 기술적으로는 충분하지만 불편할 정도로 빠듯하며, 현실적인 최소치는 40-48 GB 또는 24 GB 카드 두 장입니다. 렌더러도 예산에 포함해야 합니다. 왜냐하면 이 모델의 품질에 관한 모든 주장은 샌드박스 브라우저에서 HTML 출력을 렌더링해 이루어졌기 때문입니다. 자신의 출력이 좋은지 알고 싶다면, 바로 그 하네스를 구축해야 합니다. 그리고 24,576 토큰 컨텍스트는 이 모델이 겨냥한 여러 슬라이드 덱이 아니라 단일 인포그래픽 페이지에서만 테스트되었다는 점에 유의하세요. 따라서 실제 덱에서의 컨텍스트 압박은 미검증 영역입니다.
가용성은 같은 논점의 나머지 절반이다. AesCode-8B는 OrcaRouter가 라우팅하는 대상이 아니며, 다른 어디에서도 서비스되는 곳을 찾을 수 없었다. 오늘 평가한다는 것은 곧 자체 하드웨어에 가중치를 올린다는 뜻이다. 그 조상은 사정이 다르다 — Qwen3-VL-8B-Instruct는 지금 OrcaRouter를 통해 호출할 수 있으며, 131,072토큰 컨텍스트에서 입력 토큰 100만 개당 $0.18, 출력 토큰 100만 개당 $0.70이다. 덕분에 이 아키텍처의 튜닝되지 않은 버전이 여러분의 인포그래픽 프롬프트에서 어떤 성능을 내는지 확인하는 가장 저렴한 방법이 된다. 같은 계열의 더 위쪽에서, Qwen3.8-27B는 $0.33과 $2.40에 라우팅할 수 있다. 제공업체 정가가 마크업 없이 그대로 전달되며 제공업체 간 페일오버는 자동이다. 따라서 호스팅된 백본을 상대로 프롬프트를 프로토타이핑하는 데는 GPU 한 주가 아니라 키 하나만 들고, 실제로 잘 렌더링되는 프롬프트만이 재현 작업의 가치를 얻는다.

당신이 어느 것을 원하는지는 아티팩트에 따라 달라집니다.
산출물이 페이지이고 편집 가능해야 할 때는 AesCode-8B를 고르세요. Git에서 diff되는 구조화된 HTML 출력, 표는 실제 표로, 차트는 ECharts 스펙으로 만드는 것은 텍스트 한 단락과는 진정으로 다른 산출물이며, 아무리 뛰어난 범용 능력으로도 그것을 대체할 수 없습니다. 이 트레이드오프를 알고 선택하세요: 예고되지 않은 연구 체크포인트에 다운로드 수는 두 자릿수, 24K 컨텍스트, 영어 전용, 독립적 평가 없음, 자체 벤더가 공개한 Style 상한, 그리고 수십 GB로 측정되는 서빙 비용입니다.
다른 모든 용도에는 Qwen3-8B를 선택하세요 — 대부분의 팀에게 그것은 곧 전부입니다. 이 모델은 해당 체급에서 검증된 제너럴리스트이고, 더 긴 컨텍스트를 갖추고 있으며, 119개 언어를 구사하고, 이미 보유한 하드웨어에서 실행되며, 여러분이 앞으로 내릴 결정 뒤에는 다른 사람들의 18개월간 프로덕션 경험이 있습니다. 렌더링된 페이지를 출력해야 할 특별한 필요가 없다면, 이 비교에는 답이 하나뿐입니다.
둘 모두를 원하는 근거는 실재하며, 이는 단순히 우열을 가리는 문제가 아니다. 문서를 읽고 덱을 만들어 내는 파이프라인은 진정으로 서로 다른 두 출력 유형을 지닌 두 모델을 사용하며, 유용한 접근법은 페이지 렌더러를 그것을 감당할 수 있는 하드웨어에 두고 읽기와 추론 작업은 다른 모든 것과 동일한 엔드포인트 뒤에 호스팅된 무언가로 라우팅하는 것이다.
이 페이지를 더 잘 마무리하는 페이지로 만들려면 무엇이 필요할까요?
세 가지가 있는데, 그중 단 하나만 벤치마크에 관한 것입니다. 82.94와 1.00포인트 기준 하락에 대한 독립적 재현은 AesCode-8B를 공급업체 주장에서 결과로 옮겨 놓을 것이고, 8B 대 8B 크기 문제를 실질적 근거에 따라 답할 수 있게 해 줄 것입니다. 제공업체가 체크포인트를 가져가면 배포 열이 허물어지고 “GPU 1주”가 “API 호출”로 바뀔 것입니다. 그리고 모델 카드가 심사 중이라고 인용하는 논문 — “AesCode: Aesthetic Code Generation with Decoupled Cross-Modal Rewards” — 은 모델 카드가 답할 수 없는 질문, 즉 점수를 매기는 기준이 되는 디자인 그래프 자체가 잘못되었을 때 시각적 루브릭이 무엇을 하는지에 답할 것입니다.
그중 하나가 현실화되기 전까지는, 변호 가능한 해석은 좁은 쪽이다. AesCode-8B는 이 두 모델 중 더 흥미로운 쪽이자 덜 유용한 쪽이다. 이 모델은 기계가 검증할 수 있는 시각 디자인의 부분들에는 매우 뛰어나고, 자동화할 수 없는 부분에는 중간 정도이며, 비교 대상인 모델과 같은 Qwen3 세대 계열에 속하지만 그 모델에서 파생된 것은 아니다. Qwen3-8B는 오늘 오후에 파이프라인에 넣을 수 있는 쪽이다.
이 글에서 비교한 모델2
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
