"AesCode-8B vs North Mini Code"라는 제목이 달린 생성된 타이틀 카드로, 둥근 카드 두 개가 나란히 배치되어 있다. 왼쪽 카드 AesCode-8B에는 대시보드 레이아웃을 보여주는 브라우저 창 아이콘과 "Hugging Face에서 다운로드 2회", "8.8B, HTML 페이지 출력"이라는 문구가 있다. 오른쪽 카드 North Mini Code에는 터미널 프롬프트 아이콘과 "다운로드 150,000+", "30B-A3B, 에이전틱 코딩"이라는 문구가 있다. 둘 사이의 구분선에는 "같은 라이선스, 다른 진열대"라고 적혀 있고, 상단을 가로지르는 캡션 스트립에는 "둘 다 Apache 2.0 — 갈리는 지점은 다운로드 버튼"이라고 적혀 있다. OrcaRouter 로고가 오른쪽 아래에 합성되어 있다.
Guides & Insights

AesCode-8B vs North Mini Code: 같은 라이선스, 같은 다운로드 버튼, 정반대의 문제

작성자

Elias Hawthorne

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

이 맞대결에서 가장 유용한 숫자는 150,000입니다. 그것은 Cohere가 North Mini Code에 2026-08-14에 붙인 다운로드 수치로, 해당 모델이 2026-06-09에 출시된 지 두 달 후의 수치이며, AesCode-8B와의 비교를 이해할 수 있게 해 주는 숫자입니다. AesCode-8B는 Microsoft가 Qwen3-VL-8B-Instruct를 파인튜닝한 모델로, Hugging Face 저장소에서 다운로드 수 2건을 보여줍니다. 둘 다 Apache 2.0이고, 둘 다 게이트가 없으며, 둘 다 오늘 오후에 다운로드할 수 있습니다. 그리고 그중 하나는 한 분기 동안 프로덕션에서 사용되어 왔지만 다른 하나는 실험실을 떠나지 않았습니다. 그 격차는 품질에 대한 판정이 아닙니다 — 아무도 AesCode-8B를 독립적으로 측정하지 않았으므로 어느 쪽도 우월감을 부릴 근거는 없습니다 — 하지만 이것이 정직한 출발점입니다. 왜냐하면 어느 쪽에 질문할 수 있는 커뮤니티가 있는지 알려 주기 때문입니다.

두 모델은 매우 다른 방식으로 등장했고, 그 차이가 무엇을 검증할 수 있는지를 결정한다. North Mini Code는 Cohere와 Cohere Labs의 오픈 웨이트 공개 모델로, 모델 카드와 그 뒤를 받치는 블로그 글, 하네스 선택에 관한 문서 기록, 그리고 출시 기간 동안 백만 토큰당 $0.00에 이 모델을 제공한 벤더링된 API를 갖추고 있다. AesCode-8B는 어떤 발표도 전혀 없다. Microsoft는 2026-09-29에 저장소를 만들었고, 2026-10-07 03:35 UTC에 "Release AesCode-8B"라는 메시지로 가중치를 커밋했으며, 2026-10-08에 학습 코드를 GitHub에 푸시했다. Microsoft Research 글도, 릴리스 노트도, 제품 페이지도 없고, 인용 문구는 2027년이라는 자리표시자 연도와 함께 "검토 중"이라고 적혀 있다. 8B 모델은 슬라이드 덱, 포스터, 대시보드를 HTML과 CSS로 출력하고, North Mini Code는 에이전트 하네스 안에서 코드를 작성한다. 두 모델은 경쟁자라기보다는 카탈로그 속 이웃에 가깝고, 그것 자체로 일종의 발견이다.

각각이 출력하도록 훈련된 것

이 둘이 같은 역할을 하지 않는다는 것을 가장 명확하게 확인하는 방법은 이들이 내놓는 결과물을 보는 것이다.

• 출력 — AesCode-8B: 완전한 HTML 및 CSS 문서, 요청당 렌더링된 페이지 하나. North Mini Code: 텍스트와 도구 호출, 실제로는 패치, 셸 명령 및 에이전트 궤적을 의미합니다.

•크기 — AesCode-8B: 8.8B bf16 dense, 총 17,543,339,408바이트인 4개의 safetensors 샤드로 구성. North Mini Code: 총 30B에 활성 파라미터 3B, 전문가 128개와 토큰당 8개 활성 전문가를 갖춘 희소 전문가 혼합(MoE).

•컨텍스트 — AesCode-8B: 해당 구성에서 24,576토큰이며, 학습 시점의 프롬프트와 응답은 각각 8,192로 제한됩니다. North Mini Code: 입력 256K, 최대 생성 64K.

• 입력 — AesCode-8B: 텍스트와 선택적 참조 이미지. North Mini Code: 텍스트만 사용하며, 나머지 모든 것은 하네스가 제공합니다.

• 학습 내용 — AesCode-8B: 3,000개의 콜드 스타트 시연을 거친 뒤 7,408개의 프롬프트에 대해 400스텝 동안 GDPO 강화 학습을 수행했으며, 샌드박스 브라우저에서 각 후보를 렌더링한 후 6개의 결정론적 검증기와 시각적 루브릭으로 채점했습니다. North Mini Code: 에이전트 하네스 — SWE-Agent, mini-SWE-Agent, OpenCode, Terminus 2 — 를 지원하므로, 특정 하나에 묶어두지 않고 이미 사용 중인 하네스 어디에서든 작동합니다.

• 라이선스 — 둘 다 Apache 2.0이고 가중치도 포함되며, 사용 분야 제한 조항도, 기여자 등급도 없다. 이 축에서는 양자가 동일하므로 아무것도 결정하지 않는다.

• 근거 — AesCode-8B: Microsoft 자체의 300개 샘플 인포그래픽 평가 기준, 재현되지 않음. North Mini Code: 벤더 수치에 독립적 측정치.

겉보기보다 좁은 증거의 비대칭성

이 비교의 동쪽 편에는 아웃사이더가 하나 끼어 있는데, 그 사실은 벤치마크 격차보다 더 가치가 있다. Artificial Analysis는 North Mini Code를 직접 실행해 자사의 Coding Index에서 33.4점, Intelligence Index에서 27.6점을 기록했다. 이는 비슷한 규모의 오픈 모델과 경쟁할 만하거나 그보다 높은 점수다. Cohere는 SWE-Bench Verified에서 61.0% pass@1을, Mistral의 Devstral Small 2 대비 최대 2.8배의 출력 처리량을 보고하는데, 둘 다 벤더가 밝힌 수치다. 독립 실행이 바로 그 함정을 찾아낸 쪽이다. North Mini Code는 동일한 벤치마크 스위트를 끝내는 데 같은 크기 등급 중앙값의 약 3배에 달하는 출력 토큰을 내보내며, 약 7,500만~7,700만 출력 토큰으로 중앙값 2,500만~3,800만과 맞선다. 출시 기간 가격이 0일 때는 현금 비용이 전혀 들지 않는다. 대신 지연 비용이 들고, 프로모션 요금이 끝나면 청구서가 어떻게 나올지 미리 보여준다.

AesCode-8B는 측정 외에는 이에 필적할 만한 것이 없습니다. Microsoft는 자체 300개 샘플 인포그래픽 평가에서 Overall 82.94를 보고했으며, 프롬프트당 3회 생성에 선택 없이 진행해 참조 조건화된 GPT-5.5의 81.28, Claude Opus 4.8의 80.39를 앞섰고, 자체 백본보다 Visual 점수 31.1점 앞섰습니다. 또한 참조 조건화 보상이 프롬프트만 사용한 Visual을 25.17에서 69.71로 끌어올렸고, 추론 시 참조 이미지를 제공하지 않을 때 이 모델은 Visual 점수 1.00점만 손해 보는 데 비해 백본은 19.55점을 잃는다고 보고합니다. 이는 이례적으로 구체적인 주장이며, 하네스는 오픈소스로 공개되어 있는데, 이는 대부분의 벤더 표가 제공하는 것보다 더 나은 점입니다. 그러나 그중 어느 것도 아직 아무도 재현하지 않았습니다. 아레나 등재도, 리더보드 게재도, 처리량 측정도, 루브릭에 대한 제3자 검증도 없습니다.

비교에 대해 이것이 구체적으로 무엇을 의미하는지 주목하세요: 공통된 숫자는 없습니다. 한 모델은 소프트웨어 엔지니어링 작업이 통과하는지와 토큰이 얼마나 드는지를 기준으로 평가되고, 다른 모델은 인포그래픽의 텍스트가 읽기 쉬운 상태로 유지되는지와 레이아웃이 캔버스 안에 머무는지를 기준으로 평가됩니다. 33.4를 82.94 옆에 놓는 것은 코딩 지수와 인포그래픽 종합 점수를 비교하는 것입니다.

각각이 배포되는 위치, 그리고 그에 드는 비용

A generated two-column scoreboard titled "AesCode-8B vs North Mini Code - the scoreboard". Left column AesCode-8B reads Size 8.8B dense, Output a rendered HTML page, Context 24,576 tokens, Deploy about 40-48 GB, Evidence Microsoft rubric, Downloads 2. Right column North Mini Code reads Size 30B-A3B mixture-of-experts, Output code and tool calls, Context 256K in and 64K out, Deploy about 20-24 GB quantised, Evidence AA Coding Index 33.4, Downloads 150,000+ vendor count. A footer line reads "AesCode-8B figures are Microsoft-reported and unreproduced; North Mini Code figures per Artificial Analysis and Cohere." The OrcaRouter logo is composited bottom-right.

North Mini Code의 배포 스토리는 다운로드 15만 건을 돌파한 이유다. 3B 활성 MoE는 양자화하면 대략 20~24GB 메모리에 들어가고, Cohere 팀은 MLX를 통해 Mac Studio에서 이를 시연했으며, 3B 활성 규모가 로컬 추론을 경제적으로 만드는 요인이다. 전체 정밀도에서는 단일 H100에서 실행된다. Cohere는 출시 기간 동안 입력 및 출력 토큰 100만 개당 $0.00에 이를 제공해 왔고, 프로덕션 규모를 위한 관리형 인스턴스별 배포 경로를 제공한다. 이 수치 자체는 Cohere가 직접 집계한 수치로, 플랫폼별 내역 없이 모든 배포 채널에 걸쳐 집계된 것이며, 공개된 Hugging Face 월간 수치는 약 10분의 1에 불과한데, 이는 그 집계가 API, 호스팅 게이트웨이, 패키지 관리자, 로컬 다운로드를 아우른다는 점과 일치한다. 이것은 텔레메트리보다는 모멘텀으로 읽어야 한다.

AesCode-8B의 배포 스토리는 명령줄 하나입니다. 카드에서 바로 제시합니다 — vllm serve microsoft/AesCode-8B --limit-mm-per-prompt image=2 --max-model-len 24576, 그리고 transformers 4.57 이상이 비-vLLM 경로에 필요합니다. 17.5 GB의 bf16 가중치와 24,576 토큰 및 최대 두 개의 이미지를 위한 KV 캐시가 함께 있으므로, 24 GB 카드 한 장으로 기술적으로는 충분하지만 실제로는 빠듯합니다. 현실적인 최소 사양은 40-48 GB입니다. 작성자들이 했던 방식으로 출력을 평가하려면 렌더링 스택을 추가하세요. 이 모델에 대한 모든 품질 주장은 외부 요청이 차단된 브라우저에서 HTML을 렌더링하여 이루어졌기 때문입니다. 우리가 찾을 수 있는 호스팅 엔드포인트는 없으며, 우리 카탈로그에도 없습니다.

그 마지막 요점은 이 둘을 가용성 측면에서 비교하는 사람이라면 누구에게나 실질적인 기준입니다. North Mini Code는 벤더 자체 API와 여러 서드파티 플랫폼은 물론 가중치 자체를 통해서도 이용할 수 있습니다. AesCode-8B는 Hugging Face와 GitHub에만 있습니다. 제약 조건이 "내일 서비스에서 이것을 호출해야 한다"라면, 이 둘 중 하나만 '예'라고 답합니다.

어느 모델도 해결하지 못하는 구성 문제

이 비교의 양쪽 절반 모두에 함정이 있으며, 그것은 동일한 함정입니다. 둘 중 하나를 채택한다는 것은 특화 모델을 위한 자체 호스팅 서빙 경로를 유지한다는 뜻입니다. AesCode-8B는 제대로 평가되려면 멀티모달 스택과 렌더러가 필요합니다. North Mini Code는 3B 활성 MoE를 위한 슬롯과 이를 둘러싼 에이전트 하네스가 필요하며, 장황함 때문에 궤적 비용이 토큰 수가 시사하는 것보다 더 많이 듭니다. 페이지 생성기와 레포 에이전트라는 두 가지 기능을 모두 원하는 팀은 이제 두 개의 추론 배포를 운영하고 있으며, 둘 다 아닌 모든 것에는 세 번째 배포를 운영합니다.

여러 모델 앞에 놓인 단일 엔드포인트가 단순한 편의 기능이 아니라 실제로 일을 해내는 경우가 바로 이것입니다. 경제성과 데이터 처리 측면에서 정당하다면 전문 모델은 자체 하드웨어에 두고, 일상적인 트래픽은 이번 주에 그 용도로 가장 적합한 호스팅 모델로 라우팅하세요. 이 모든 것이 단일 키 뒤에서, 제공업체 정가를 0% 마크업으로 그대로 전달하고, 제공업체에 문제가 생기면 자동으로 장애 조치되도록 하는 것입니다. Qwen3 패밀리 백본은 그 경계가 얼마나 얇아지는지를 잘 보여줍니다. 마이크로소프트는 Qwen3-VL-8B-Instruct를 기반으로 AesCode-8B를 만들었고, 이 패밀리의 비전-언어 모델들은 OrcaRouter를 통해 호출할 수 있습니다 — 131,072 토큰 컨텍스트에서 입력 토큰 백만 개당 $0.18, 출력 $0.70인 Qwen3-VL-8B-Instruct, 그리고 $0.40과 $1.60인 Qwen3-VL 235B A22B가 그렇습니다. 둘 중 어느 것도 AesCode-8B는 아닙니다. 그 파인튜닝은 마이크로소프트의 것이며 어느 제공업체도 이를 서비스하지 않습니다. 하지만 그 모델에서 원했던 것이 스크린샷을 읽고 코드를 작성하는 모델이었고, 미적 디자인 파인튜닝이 특별히 필요하지 않았다면, 호출 가능한 옵션은 GPU 비용의 일부만 들고 조달 주기가 아니라 반나절이면 시도해볼 수 있습니다.

A GitHub screenshot of the microsoft/AesCode repository showing the MIT licence badge, 1 star, 14 commits on main, a README table listing assets, data_prep, eval and other directories, and the latest commit message "README: overview, results, and the reproduction guide". The repository description area reads "No description, website, or topics provided."

둘 다 범용이 아니라는 점을 감안할 때 어떻게 결정할까

먼저 라이선스는 논외로 두죠. 왜냐하면 그건 무승부이고, 아무것도 결정하지 못할 테니까요.

출력으로 무엇을 원하는지 물어보세요. 답이 렌더링되고 편집 가능한 페이지 — 덱, 보고서, 대시보드 — 라면 North Mini Code는 도움이 될 수 없고, 둘 중 문제를 겨냥한 것은 AesCode-8B뿐입니다. 분명한 눈으로 임하세요: 예고되지 않은 연구 체크포인트, 다운로드 두 건, 단일 인포그래픽 페이지에서만 검증된 24K 컨텍스트, 영어 전용 언어 태그, 그리고 어디에도 독립적인 평가가 없습니다. Microsoft 자체 표에서 Style 상한선은 납품 전에 더 이상 시각적 수정이 필요하지 않은 것으로 정의된 차원에서 53.21이며, 이는 벤더가 출력을 여전히 사람이 편집한다고 말해 주는 것입니다.

답이 리포지토리에 대한 변경 — 마이그레이션, 수정, 여러 단계의 터미널 작업 — 이라면, North Mini Code가 바로 하네스 학습, 256K 윈도, 3B 활성 배포 프로필, 작동하는 벤더 API, 그리고 품질과 장황함 모두에 대한 외부 측정을 갖춘 쪽이다. 헤드라인 요율보다는 토큰 수를 기준으로 예산을 잡아라. 독립적인 조사 결과에 따르면, 같은 결과에 도달하기 위해 동종 모델들보다 약 세 배나 더 많이 작성하기 때문이다.

그리고 한 분기에 디자인 아티팩트와 리포지토리 마이그레이션이 모두 포함되어 있다면, 이를 두 모델 결정으로 다루지 마세요. 전문가 모델이 GPU 값을 하는 곳에서 실행하고, 나머지는 라우팅하며, 필요하지 않았던 서빙 경로를 유지보수하지 마세요.

A Hugging Face screenshot of the CohereLabs North-Mini-Code-1.0 model card showing a trend arrow, 577 likes and 381k organisation followers, the Text Generation, Transformers, Safetensors and cohere2_moe tags with conversational, chat, code and agent tags, an Apache-2.0 licence badge, a Directly Available for Download badge, and the model summary reading "North Mini Code is an open weights research release of a 30B-A3B parameter model optimized for code generation, agentic software engineering, and terminal tasks", developed by Cohere and Cohere Labs.

벤치마크보다 오래 지속되는 차이

마지막으로 이 둘을 가르는 한 가지 차이가 있는데, 그것은 기술적인 것이 아니다. North Mini Code에는 카드와 게시물, 직접 사용해 볼 수 있는 Space, 그리고 누구나 이의를 제기할 수 있는 방법론을 공개한 벤더가 있으며, 여기에 15만 다운로드에 해당하는 다른 사람들의 경험이 더해진다. AesCode-8B에는 저장소와 README, 그리고 '검토 중'이라고 적힌 인용 하나가 있다.

그것은 미해결 질문이 애초에 무엇인지까지 바꿔 놓는다. North Mini Code의 경우 당면한 질문은 프로모션 요금이 끝난 뒤 대규모로 쓸 때 그 장황함 때문에 경제성이 없어지는지다. 그리고 그건 직접 실행해 보면 답할 수 있다. 이미 다른 많은 사람들이 그렇게 해봤기 때문이다. AesCode-8B의 경우 당면한 질문은 Microsoft가 그것으로 무엇을 하려는지다: 연구 산출물인지, 제품 라인의 첫 릴리스인지, 아니면 6주 만에 조용히 대체될 무언가인지. 저장소의 어떤 것도 그 답을 주지 않으며, 모델 카드를 아무리 읽어도 마찬가지다. 세 가지 신호를 지켜보라 — 공식 발표, 82.94의 독립적 재현, 또는 제공자가 그 체크포인트를 채택하는 것 — 그리고 세 가지 모두의 부재를 모델이 흥미롭지 않다는 이유가 아니라 현재의 증거 상태로 취급하라. 그것이 흥미로운 이유는 1.00포인트의 레퍼런스 하락이며, 그 수치는 여전히 Microsoft가 아닌 누군가가 확인해 주기를 기다리며 그대로 남아 있다.

이 글에서 비교한 모델2

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트