'AesCode 32B vs Qwen3.8 27B'를 위한 히어로 타이틀 카드로, 부제는 '파인튜닝과 그 원형'이며, 계보도로 그려진다. 왼쪽의 Qwen3-VL-32B-Instruct 체크포인트 카드에서 화살표가 나와 '자체 호스팅 전용, 65 GB'라고 표시된 'AesCode 32B fine-tune' 카드로 이어지고, 오른쪽 아래의 별도의 더 새로운 카드에는 'Qwen3.8 27B'라는 라벨과 함께 '오늘 바로 호출 가능'이라고 적힌 라이브 API 마커가 붙어 있다. OrcaRouter 로고는 오른쪽 아래 모서리에 있다.
Guides & Insights

AesCode 32B vs Qwen3.8 27B: 마이크로소프트는 Qwen을 기반으로 이를 만들었고, 둘 중 하나는 호출할 수 있다

작성자

Elias Hawthorne

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

이 전체 비교를 재편하는 세부 사항은 모델 카드의 두 번째 줄에 있습니다: AesCode 32B는 Qwen3-VL-32B-Instruct에서 시작합니다. Microsoft의 디자인 특화 코드 모델은 Qwen3-VL 파인튜닝이며 Apache 2.0이고, 2026년 9월 29일에 생성된 Hugging Face 리포지토리에 있으며, "Release AesCode-32B"라는 제목의 커밋이 2026년 10월 7일자로 있고 Microsoft에서는 어디에서도 발표가 없습니다. Qwen3.8 27B는 그 계보의 다른 끝입니다: 벤더 자체의 오픈 웨이트 27B 덴스 멀티모달 모델로, 2026년 8월 14일에 Apache 2.0으로 공개되었으며, Microsoft가 파인튜닝한 VL 체크포인트의 후속 아키텍처입니다. 따라서 이것은 두 벤더의 플래그십 노력 사이의 맞대결이 아닙니다. 그것은 한 연구소의 범용 오픈 웨이트 모델과 경쟁사의 그 패밀리 연구용 파인튜닝 사이의 맞대결이며, 둘 사이의 실질적 차이는 결국 파일을 확보한 뒤 그 파일로 무엇을 하도록 허용되는지에 거의 전적으로 관한 것임이 드러납니다.

같은 라이선스, 같은 패밀리, 다른 모델 수

둘 다 Apache 2.0이고, 둘 다 이미지와 텍스트를 모두 입력으로 받으며, 둘 다 텍스트를 반환합니다. 그 이후부터는 모든 것이 달라지는데, 배포 항목이 가장 극명하게 갈립니다.

• 파라미터 — AesCode 32B: Qwen3-VL-32B-Instruct 기반의 33B 밀집. Qwen3.8 27B: 27B 밀집, 비전 인코더 포함 시 28B, 히든 크기 5120의 64개 레이어.

• 실행에 필요한 메모리 — AesCode 32B: 모델 카드에서는 bf16 파라미터만으로도 대략 65 GB의 가속기 메모리를 계획할 것을 권장하며, 자체 서빙 예시에서는 4방향 텐서 병렬 처리를 사용합니다. Qwen3.8 27B: bf16 기준 약 55.6 GB.

• 문맥 — AesCode 32B: 보고된 구성에서 24,576토큰이며, 학습 시 프롬프트와 응답은 8,192토큰으로 제한됩니다. Qwen3.8 27B: 기본 262,144토큰, YaRN 스케일링으로 1,000,000토큰까지 확장 가능합니다.

• 어텐션 — AesCode 32B: Qwen3-VL 백본에서 계승되었습니다. Qwen3.8 27B: 48개의 Gated DeltaNet 선형 어텐션 레이어와 16개의 전체 어텐션 레이어를 3:1 비율로 구성한 하이브리드이며, 바로 이 점 덕분에 262K 윈도를 감당 가능한 비용으로 서빙할 수 있습니다.

• 용도 — AesCode 32B: 정보가 풍부한 시각적 아티팩트를 편집 가능한 HTML 및 CSS로 생성하고, 멀티모달 코드 생성 연구를 수행합니다. Qwen3.8 27B: 일반적인 에이전트 및 멀티모달 작업 — 코딩, 컴퓨터 사용, 문서 및 비디오 이해, 도구 호출.

• 어디서 받을 수 있나 — AesCode 32B: Hugging Face 다운로드; 이를 배포하는 추론 제공자는 없습니다. Qwen3.8 27B: 가중치 또는 호스팅된 엔드포인트.

두 배의 컨텍스트, 약간 더 작은 풋프린트, 한 세대 더 새로운 백본, 그리고 동일한 라이선스. AesCode 32B가 완전히 이기는 유일한 행은 첫 번째이며, 그것도 작업 특화 파인튜닝에서 이긴다.

각각이 실제로 무엇을 기준으로 측정되었는지

두 평가 체계는 서로 맞닿는 곳이 없으며, 그렇지 않은 척하는 것이 바로 이와 같은 문서에서 저지르는 전형적인 오류다.

Qwen3.8 27B의 모델 카드는 범위가 넓으면서도 구체적이다. 코딩: Terminal-Bench 2.1은 73.0, SWE-bench Pro는 61.7, QwenSWEBench는 79.0, LiveCodeBench v6는 90.3. 추론: GPQA Diamond 89.2, Humanity's Last Exam 30.8. 컴퓨터 사용: OSWorld-Verified 84.3, WebArena-Verified 64.8, AndroidWorld 81.9. 비전: MathVision은 벤더의 추론 시점 향상 기능을 적용하면 94.6, 적용하지 않으면 90.0, OmniDoc 1.5는 91.1. 이 모든 수치는 벤더 자체 하네스에서 나온 벤더 자체 수치다. 다만 읽어볼 만한 각주가 붙어 있는데, SWE-bench Pro와 QwenSWEBench 실행에는 Claude Code 하네스가 사용되었으므로 다른 하네스로 채점된 모델과는 직접 비교할 수 없다.

AesCode 32B에는 단 하나의 벤치마크가 있으며, 이는 단일 목적용입니다: 인포그래픽 샘플 300개, 프롬프트당 3회 생성 및 선별 없음, 7개 채널에 걸쳐 렌더링 및 채점. 핵심 수치는 참조 이미지를 제공한 상태에서 Overall 85.89이며, 동일한 하네스에서 GPT-5.5는 81.28, Claude Opus 4.8은 80.39입니다. 여기에 AesCode 32B가 자체 Qwen3-VL-32B 백본을 Visual 차원에서 22.4점, Overall에서 24.8점 능가한다는 주장도 더해집니다.

그것들을 나란히 놓으면 아무것도 맞아떨어지지 않는다. Terminal-Bench는 셸 작업이 완료되는지를 측정하고, AesCode 평가는 인포그래픽의 텍스트가 읽을 수 있는지, 레이아웃이 캔버스를 넘치지 않는지, 표가 실제 HTML 표인지를 측정한다. 공유된 지표도, 공유된 하네스도, 공유된 작업도 없다. 유일하게 정직한 진술은 AesCode 32B가 자체 백본보다 디자인 아티팩트에 훨씬 뛰어나다는 것과 Qwen3.8 27B가 강력한 범용 모델이라는 것이며, 어느 주장도 다른 쪽에 대해 알려주는 바가 없다.

A two-column comparison scoreboard for AesCode 32B and Qwen3.8 27B: the AesCode 32B column reads 'Parameters: 33B dense (Qwen3-VL-32B base)', 'Memory to run it: about 65 GB bf16, 4-way TP', 'Context: 24,576 tokens', 'Attention: inherited from the Qwen3-VL backbone', 'Where you get it: a Hugging Face download', 'Measured on: one 300-sample infographic benchmark'; the Qwen3.8 27B column reads 'Parameters: 27B dense (28B with vision tower)', 'Memory to run it: about 55.6 GB bf16', 'Context: 262,144 native, 1M with YaRN', 'Attention: hybrid Gated DeltaNet, 3:1 ratio', 'Where you get it: weights or a hosted endpoint', 'Measured on: Terminal-Bench 2.1, SWE-bench Pro, GPQA Diamond and more'; a footer line reads 'AesCode 32B figures Microsoft-reported on its own harness; Qwen3.8 27B figures Alibaba-reported with independent scoring from Artificial Analysis.' and the OrcaRouter logo sits in the bottom-right corner.

이번에는 증거 격차가 한 방향으로 실제로 존재한다.

이 업계에서는 벤더 벤치마크가 일반적이기 때문에, 이 둘이 자기들의 벤더 주장 중 얼마나 많은 부분이 제삼자에 의해 검증되었는지에서 차이를 보인다는 점은 중요합니다.

Qwen3.8 27B는 벤더 자체 표와 함께 출시되었고, 몇 주 안에 외부 결과를 축적했다. 이 모델의 독립적 기록에는 법률 AI 기업 Harvey가 메모리 스타트업 Engram과 함께 수행한 법률 에이전트 연구가 포함되는데, 여기서 적응된 Qwen3.8 27B는 250개의 법률 작업에서 Claude Opus 4.8을 포함해 그 연구가 테스트한 모든 모델을 앞섰다. 다만 적응된 모델이 테스트 기업의 1억 토큰 코퍼스를 먼저 학습했다는 중요한 단서가 있으며, 따라서 이는 모델 자체만큼 적응에 관한 결과이기도 하다. 여기에는 Code Arena의 WebDev 리더보드에서의 순위와 Arena.ai의 Image-to-WebDev 리더보드에서 오픈 웨이트 부문 1위도 포함되는데, 둘 다 공개된 방법론이 아니라 벤더가 전달한 순위 주장이다. 그리고 공개된 점수가 있는 제3자 리더보드도 포함한다: Artificial Analysis는 Qwen3.8 27B를 자사 Intelligence Index에서 33.70으로 기록하고 완료된 작업당 비용은 약 $1.01이며, 그 뒤의 토큰 내역을 공개한다.

AesCode 32B에는 그런 게 하나도 없습니다. 아레나 배치도, 리더보드 등재도, 제3자 재현도, 독립적인 처리량 테스트도 없습니다. 누군가 살펴보고 부족하다고 판단해서가 아니라, 어떤 제공자도 서빙하지 않는 체크포인트는 애초에 외부 평가 하네스로 평가할 수 없기 때문입니다. 이 수치들은 벤더의 것이며, 모델을 학습시킨 것과 동일한 검증기 스택으로, 벤더가 고른 샘플에 대해, 벤더가 실행한 베이스라인과 비교하여 계산된 것입니다. 이번 공개는 방법론에 관해서는 유난히 투명합니다. 리워드 채널 이름, 롤아웃 횟수, 디코딩 파라미터, 실패율이 모두 공개되어 있습니다. 하지만 어떤 수치가 어떻게 산출되었는지에 대한 투명성이 누군가 다른 주체가 그 수치를 산출했다는 것과 같은 뜻은 아닙니다.

등록된 카드로 결제되는 것

여기서부터 계보는 사소한 잡학이 아니라 결정이 된다.

AesCode 32B는 65GB의 가속기 메모리, 멀티모달 서빙 경로, 그리고 얼리 어답터로서 미공개 모델을 실행할 의지를 요구합니다. 자체 서빙 예제는 4방향 텐서 병렬 처리를 사용하며, 이 모델은 24,576토큰 컨텍스트로 문서화되어 있고 대체할 호스팅 옵션이 없습니다. 이미 하드웨어를 보유하고 있고 파이프라인이 설계별 파인튜닝을 진정으로 필요로 한다면, 그것은 합리적인 트레이드오프입니다. 대부분의 팀에게 이것은 첫 유용한 결과물이 나오기까지 2주짜리 프로젝트입니다.

Qwen3.8 27B는 OrcaRouter 자체 인프라에서 자체 호스팅됩니다 그리고 오늘부터 100만 입력 토큰당 $0.33, 100만 출력 토큰당 $2.40에 호출할 수 있으며, 262,144토큰 컨텍스트와 텍스트, 이미지, 비디오 입력을 갖추고 있습니다. 이는 당사 쪽에서 마크업을 추가하지 않고 그대로 전달되는 정가이며, 200개가 넘는 다른 모델과 동일한 키에 있으므로 카탈로그에서 어떤 대안과 비교하든 그것은 두 번째 계약이 아니라 요청 매개변수입니다. 이것이 실질적 근거의 전부이며, 그것도 큰 근거입니다: 패밀리 기준으로 AesCode 32B의 백본보다 한 세대 뒤처진 모델이 바로 오늘 오후, 여러분의 프롬프트로, 몇 센트의 비용으로 평가할 수 있는 모델입니다.

여기에는 라우팅 관점이 구체화하는 이차적인 논점이 있습니다. AesCode 32B는 Qwen3-VL 체크포인트를 파인튜닝한 것이므로, 이 제품군은 무엇이든 자체 호스팅하기로 결정하기 전에 아키텍처의 호스팅 측이 과연 작동하는지 값싸게 테스트할 방법을 제공합니다. Qwen3-VL 235B A22B Instruct는 입력 백만 토큰당 $0.40, 출력 $1.60에 이용할 수 있고, Qwen3-VL 8B Instruct는 $0.18과 $0.70입니다. 둘 다 AesCode 32B가 아니며, 둘 다 디자인 품질을 위해 훈련되지도 않았습니다. 그러나 "비전-언어 모델이 우리 스크린샷을 읽고 우리에게 필요한 마크업을 작성할 수 있는가"라는 질문에는 몇 센트로 이들을 통해 답할 수 있으며, 동일한 엔드포인트 아래의 자동 장애 조치 덕분에 제공자 상태가 나쁜 날에도 파이프라인이 중단되지 않습니다.

A screenshot of the Hugging Face model page for microsoft/AesCode-32B, showing the model card header, the Apache 2.0 licence tag and the model-index table carrying the 300-sample infographic evaluation with the 85.89 Overall score (captured October 11, 2026).

누가 무엇을 골라야 할까

산출물이 최종 결과물이라면 AesCode 32B를 선택하라. 슬라이드, 대시보드, 포스터, 보고서를 대량으로 생산하고, 편집과 비교(diff)가 가능한 구조화된 출력이 필요하며 — 이 모델은 완전한 HTML 문서를 내보내고, 실제 HTML 표 구조와 ECharts 스펙을 사용해 둘 다 검사 가능한 상태로 유지한다 — 이를 구동할 하드웨어가 있거나 임대할 예산이 있다면. 세 가지를 받아들이고 시작하라: 어떤 수치도 독립적으로 검증되지 않는다는 점, 가중치가 약 65 GB라는 점, 그리고 긴 문서를 제약할 24K 컨텍스트라는 점. 모델 카드가 보고한 4.3%의 심각한 캔버스 경계 실패율은 GPT-5.5의 34.7%와 대비되는데, 이번 릴리스에서 가장 고무적인 단일 수치이며 동시에 마이크로소프트의 수치이기도 하다.

실제로 실행하고 실제로 서빙할 수 있는 범용 오픈 웨이트 멀티모달 모델이 필요하다면 Qwen3.8 27B를 선택하세요. 262K 컨텍스트, 백만까지 확장 가능; AesCode 32B가 들어가지 못하는 곳에 맞는 배포 풋프린트; 다르지 않은 라이선스 입장; 완료된 작업당 비용과 품질 모두에 대한 독립적인 측정치; 그리고 오늘 시작하고 나중에 통합을 다시 작성하지 않고도 자체 호스팅할 수 있게 해주는 호스팅 옵션. 단계적이고 레이어별인 어텐션 설계가 긴 컨텍스트를 감당 가능하게 만든 이유이며, 긴 컨텍스트는 디자인 및 문서 파이프라인이 가장 필요로 하는 것입니다.

그리고 둘 다 필요하다면 — 디자인 산출물 생성기와 범용 작업 도구 — 현명한 분할은 자체 장비에서 30B급 비전-언어 모델 두 개를 실행하는 것이 아닙니다. 일반 트래픽은 호스팅 측으로 보내고, 전문 모델은 자체 호스팅으로 유지하되 하나의 키 뒤에 두십시오. 그러면 어느 경로에서든 공급자 장애가 인시던트가 아니라 페일오버 이벤트가 됩니다.

A screenshot of the OrcaRouter model page for Qwen3.8 27B, showing the model name, the 262,144-token context window, the text/image/video input modalities and the self-hosted pricing of $0.33 per million input tokens and $2.40 per million output.

지켜봐야 할 것

AesCode 32B는 호출 가능해지면 그 입지가 완전히 달라진다. 현재 이 모델의 유일한 실질적 약점은 접근성인데, 그것은 일시적인 조건이다. 추론 제공업체가 체크포인트를 가져가거나 Microsoft가 엔드포인트를 공개하면, 65 GB의 조달이 모델 선택으로 바뀐다. 그때까지 이 맞대결에 대한 정직한 요약은 이렇다. 파인튜닝 모델은 한 가지 작업에서 더 낫고, 범용 모델은 사용성에서 더 낫으며, 그리고 범용 모델이 우연히도 조상이라는 점이다. Microsoft는 당시 이용 가능한 가장 강력한 오픈 멀티모달 기반이었기 때문에 Qwen3-VL 체크포인트를 기반으로 삼았는데, 이는 그 자체로 이 비교가 Qwen3.8 27B에 관해 해줄 수 있는 가장 유용한 말이다.

이 글에서 비교한 모델1

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트