"Ember-1 vs Qwen3.8-Max"라고 적힌 생성된 타이틀 카드, 부제는 "플래그십에 맞선 토큰 절약형 파생 모델", 그 아래 두 카드: Ember-1 — "토큰 40% 절감 주장", "공개된 가격 없음"; Qwen3.8-Max — "입력 2달러, 출력 6달러", "1M 토큰 컨텍스트".
Guides & Insights

Ember-1 vs Qwen3.8-Max: 플래그십에 맞서는 토큰 절약형 파생 모델

작성자

Alistair Wren

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

이 맞대결의 두 모델은 모두 같은 벤치마크에서 실제 수치를 내놓았지만, 그렇다고 해서 여전히 판가름이 나지는 않는다. Ember-1은 Moonshot AI의 Kimi K3를 Fireworks Research가 특화해 파생한 모델로, 2026년 9월 23일 공개되었으며, 기반 모델이 쓰는 토큰의 약 절반만으로 Terminal Bench 2.1에서 82.0%를 보고했다. Qwen3.8-MaxAlibaba의 플래그십으로, 약 2.4조 개 파라미터에 토큰당 약 950억 개가 활성화되는 희소 전문가 혼합 모델이며, 2026년 8월 3일부터 일반 제공되었고, 같은 벤치마크에서 86.6%를 보고했다. 두 수치 모두 공급업체가 보고한 것이고, 두 연구소 모두 자체 평가 하네스를 사용했으며, 공개되지 않은 두 평가 설정 사이의 4.6점 차이는 결론이 아니다. 비교할 수 있는 것은 돈이며, 바로 여기서 이 맞대결이 흥미로워진다. 한 모델의 전체 논지는 필요하지 않은 토큰에 비용을 지불해서는 안 된다는 것이고, 다른 모델은 입력 100만 토큰당 2달러, 출력 100만 토큰당 6달러로 책정된 플래그십이다.

각 모델이 실제로 무엇인지

Ember-1은 어떤 아키텍처적 의미에서도 새로운 모델이 아니다. 이는 더 간결하게 추론하도록 재훈련된 Kimi K3이며, Fireworks Research가 자체 서버리스 학습 스택에서 50개 이상의 학습 실험과 200개 이상의 평가를 거쳐 구축했다. 이 연구소의 주장은 K3의 추론이 과제가 요구하는 것보다 길고, 그 초과분을 답변을 바꾸지 않고 제거할 수 있다는 것이다 — 7개 벤치마크와 2개의 고객 프로덕션 A/B 테스트 전반에서 정확도 손실 없이 추론 길이가 35–50% 감소했다. 이는 벤더 자체의 서버리스 플랫폼에서 연구 프리뷰로 제공되며, 공개된 가중치도 공개된 가격도 없다.

Qwen3.8-Max는 완전히 다른 종류의 객체입니다. 이는 Alibaba의 프런티어 등급으로, 텍스트·이미지·비디오 입력을 네이티브로 지원하는 멀티모달 모델이며, 100만 토큰 컨텍스트 창을 갖추고 있고 출시 이후 두 차례 갱신되었습니다. 2026년 9월 2일에는 코딩과 전문 사무 업무를 겨냥한 포스트 트레이닝 업데이트가, 2026년 9월 22일에는 더 빠른 서빙 등급이 발표되었습니다. Alibaba는 이를 GPT-5.5, Claude Opus 4.7, Gemini 3.1 Pro에 맞서는 위치에 놓으며, 공개된 평가표는 그러한 야심을 반영합니다. GPQA Diamond 92.6, OSWorld-Verified 86.1, SWE-bench Pro 67.7, PaperBench 93.0, IFBench 82.8, Humanity's Last Exam 43.6으로, 모두 공급업체가 보고한 수치입니다.

A two-column scoreboard titled "Ember-1 vs Qwen3.8-Max — the scoreboard" comparing six dimensions. Ember-1: input/output price not published, computed from Kimi K3 rates of $3 and $15; context not published, base model carries 1M; text input; Terminal Bench 2.1 82.0% vendor-reported; research preview with a two-week window; not routed on OrcaRouter. Qwen3.8-Max: $2.00 in and $6.00 out per 1M tokens; 1,000,000-token context; text, image and video input; Terminal Bench 2.1 86.6% vendor-reported; generally available and priced; routed on OrcaRouter. The footer notes both Terminal Bench figures are vendor-reported and were produced on different harnesses.

나란히 놓인 요금표들

이 둘 중 하나는 가격이 있고 다른 하나는 그렇지 않은데, 이것이 첫 번째 실질적 비대칭성이다.

• 입력 — Ember-1: 게시된 것 없음; 벤치마크 시트는 Kimi K3의 요금표를 기준으로 달러를 계산합니다. Qwen3.8-Max: OrcaRouter에서 백만 토큰당 $2.00.

• 출력 — Ember-1: 공개된 것 없음. Qwen3.8-Max: 백만 토큰당 $6.00.

• 캐시된 입력 — Ember-1: 해당 없음. Qwen3.8-Max: 캐시 읽기의 경우 100만 토큰당 $0.25로, 이는 입력 요금의 8분의 1에 해당하며 매 턴마다 동일한 컨텍스트를 다시 보내는 에이전트 루프에서 대단히 중요합니다.

• 컨텍스트 윈도우 — Ember-1: 프리뷰에서는 공개되지 않음. 기본 모델은 1,048,576 토큰을 지원한다. Qwen3.8-Max: 1,000,000 토큰.

• 멀티모달리티 — Ember-1: 텍스트. Qwen3.8-Max: 텍스트, 이미지, 동영상 입력, 텍스트 출력.

• 가중치 — Ember-1: 없음. Qwen3.8-Max: 오픈 가중치 릴리스가 존재하지만 텍스트 전용이며, 서비스되는 엔드포인트의 전체 컨텍스트 윈도우와 비전 입력을 갖추지 못했다.

• 접근성 — Ember-1: 연구 프리뷰, 2주간의 서버리스 기간, 영구성은 수요에 연동. Qwen3.8-Max: 일반 제공 및 가격 책정됨.

Qwen3.8-Max 요금을 모델링하기 전에 한 가지 짚어둘 점이 있습니다. Alibaba는 출시 이후 이 모델의 패키징을 여러 차례 개정해 왔으며, 국제 요금표가 항상 8월의 대표 요금과 일치한 것은 아닙니다. $2.00와 $6.00을 현재 우리 플랫폼의 경로 가격으로 취급하세요. 우리 플랫폼은 제공업체의 정가를 마크업 없이 그대로 전달하므로, 공급업체의 변경이 당일에 반영됩니다. 그리고 예산을 확정하기 전에 요금표를 확인하세요.

벤치마크 비교가 작동하지 않는 이유

Ember-1의 82.0%와 Qwen3.8-Max의 86.6%는 둘 다 Terminal Bench 2.1이어서 서로 비슷해 보이게 만들지만, 서로 비교 가능하게 만들어 주지는 않는다. Ember-1의 시트는 Fireworks Research가 평가한 Kimi K3 변형 모델들을 상대로, 89개 샘플에 대해, 토큰 및 비용 델타가 첨부된 상태로 자신의 수치를 보고한다. Qwen3.8-Max의 수치는 Alibaba 자체 평가 시트에서 나온다. 서로 다른 연구소, 서로 다른 하네스, 서로 다른 에이전트 스캐폴드이며, 스캐폴드 선택만으로도 점수가 몇 점씩 움직이는 벤치마크에서 4.6점 차이는 방법론의 노이즈 플로어 안에 있다.

Ember-1의 표에서 읽을 수 있는 것은 토큰 열이며, 이는 모델이 바꾸도록 훈련된 유일한 항목입니다. 자체 베이스 대비 Ember-1은 Terminal Bench 2.1에서 토큰을 51.9% 덜 쓰고, SWE-Interact에서 32.5% 덜 쓰며, DeepSWE 1.1에서 23.7% 덜 쓰고, τ-2 Bench Airline에서는 겨우 5.9% 덜 씁니다. 이 편차가 솔직한 핵심입니다. 숙고를 줄이는 모델은 베이스 모델이 과도하게 생각하는 벤치마크에서는 큰 가치가 있지만 그렇지 않은 곳에서는 거의 가치가 없으며, 자신의 워크로드가 어느 종류인지 알려면 직접 측정하기 전에는 알 수 없습니다.

완료된 작업당 비용, 산출 기준

이를 실제로 좌우하는 계산은 다음과 같습니다. Ember-1에는 자체 요금이 없으므로, Ember-1 비용의 대체값으로 Kimi K3의 공개 요금을 사용합니다. Kimi K3는 입력 토큰 100만 개당 $3.00, 캐시된 토큰 $0.30, 출력 $15.00입니다 — 정확히 Fireworks Research가 자체 비교에서 사용한 요금표입니다. Qwen3.8-Max는 입력 $2.00, 출력 $6.00이며, 캐시 읽기는 $0.25입니다.

입력 측에서는 Qwen3.8-Max가 이미 3분의 1 더 저렴합니다. 출력 측에서는 토큰당 2.5배 더 저렴합니다. 즉, Ember-1의 토큰 절감은 고정된 청구서와 경쟁하는 것이 아니라, 어떤 효율화 작업도 일어나기 전에 이미 토큰당 더 저렴한 플래그십과 경쟁하는 것입니다. Fireworks Research 자체의 프로덕션 A/B 테스트에서는 출력 토큰이 49.3K에서 29.9K로 감소해 총 39% 절감을 보였습니다. 이를 Qwen3.8-Max의 출력 요금에 적용하면 동일한 39% 절감이 되지만, 이는 K3의 $15 요금에 같은 비율을 적용한 것보다 절대적인 이득은 더 작습니다.

따라서 Ember-1의 효율성 근거는 자체 기본 모델과 비교할 때 가장 강력하며, 이는 바로 이번 릴리스가 내세우는 논거이기도 하다. Qwen3.8-Max와 비교하면 논점은 달러당 성능으로 옮겨가는데, 여기서는 플래그십의 더 큰 컨텍스트, 멀티모달 입력, 그리고 가격이 책정된 가용성이 반론이 된다 — 그리고 이를 결판낼 일대일 비교를 공개한 사람은 아무도 없다.

A screenshot of OrcaRouter's model page for Qwen3.8 Max, showing the qwen/qwen3.8-max listing priced at $2.00 per 1M input tokens and $6.00 per 1M output tokens, a p50 time-to-first-token of 1.98s, 33.3M tokens of traffic over seven days, a 1M-token context window accepting text, image and video, and a Python snippet calling api.orcarouter.ai/v1.

우리 자체 라우팅 데이터가 보여주는 것

여기 관련된 세 모델 중 두 개는 OrcaRouter의 라이브 라우트로, 어떤 벤치마크 시트에도 없는 관점을 제공한다. Qwen3.8-Max는 1,000,000 토큰의 컨텍스트로 제공되며, 지난 7일간 첫 토큰 지연 중앙값이 약 2.0초, 출력 속도가 초당 약 52.7 토큰, 오류율이 약 4.2%였다. Kimi K3 — Ember-1의 기본 모델이자 Ember-1이 주장하는 모든 절감의 기준점 — 는 1,048,576 토큰의 컨텍스트에서 작동하며, 지연 중앙값이 약 8.0초, 출력 속도가 초당 약 43.6 토큰, 오류율이 약 0.27%로, 트래픽은 실질적으로 더 많다. Ember-1 자체는 OrcaRouter에 없다.

그 수치들은 그 결정을 다시 규정한다. Kimi K3는 Qwen3.8-Max보다 첫 토큰까지 상당히 느리고 출력 토큰당 대략 두 배 더 비싸지만, 훨씬 더 무거운 부하에서 오류율은 훨씬 낮다. K3의 토큰 절약형 파생 모델은 비용 격차를 좁히지만 지연 격차는 좁히지 못한다. 추론을 짧게 만드는 것은 대기열이 아니라 생성 단계를 짧게 만들기 때문이다. 워크로드가 비용 민감형보다 지연 민감형이라면, 오늘날에는 플래그십이 더 나은 경로이며 효율성 이야기는 핵심에서 벗어난다.

어느 것을 라우팅할까요?

컨텍스트 윈도, 멀티모달 입력, 공개된 가격, 그리고 예산을 책정할 수 있는 서비스가 필요할 때 Qwen3.8-Max로 라우팅하세요. 이 모델은 구조적으로 둘 중 더 안전한 선택입니다: 일반 제공되고, 가격이 책정되어 있으며, 엔드포인트를 최신 상태로 유지해 온 실적이 있는 공급업체에 의해 두 달 만에 두 번 갱신되었습니다.

청구서가 긴 에이전트 루프의 추론 토큰에 의해 좌우되고, 자체 하드웨어가 아니라 호스티드 모델을 상대로 실행한다면 Ember-1을 시도해 보세요. 올바른 테스트는 프리뷰가 제공하는 2주 동안 프로덕션 트래픽에 대해 섀도로 실행하면서 요청당 토큰이 아니라 완료된 작업당 토큰을 측정하는 것입니다. 해서는 안 되는 일은 워크로드에 따라 6%에서 52%까지 달라지는 40%라는 수치를 근거로 플래그십을 그대로 대체할 수 있는 동급 교체품처럼 바꿔 넣는 것입니다.

진짜 질문이 Kimi K3를 계속 운영할지 여부라면, 그 답은 오늘 어떤 미리보기 없이도 알 수 있습니다: Kimi K3와 Qwen3.8-Max 모두 하나의 키 뒤에 있는 OrcaRouter에 있고, 공급자 정가로 마크업 없이 책정되며, 공급자 간 자동 장애 조치가 제공됩니다. 두 모델에서 워크로드 비용을 비교하는 것은 조달 프로젝트가 아니라 라우팅 변경이며, Ember-1에 대한 어떤 효율성 주장도 연구소의 수치가 아니라 여러분 자신의 수치로 측정할 수 있게 해주는 기준선을 제공합니다.

A screenshot of OrcaRouter's model page for Kimi K3, showing the MoonshotAI Kimi K3 listing priced at $3.00 per 1M input tokens and $15.00 per 1M output tokens, a p50 time-to-first-token of 8.00s, 749.2M tokens of traffic over seven days, a 1M-token context window and a Python snippet calling api.orcarouter.ai/v1.

솔직히 요약하자면, 이 두 모델은 서로 다른 제약 조건에 맞춰 최적화되어 있습니다. Qwen3.8-Max는 현존하는 가장 뛰어난 모델이 되도록 설계되었고 그에 걸맞게 가격이 책정되었습니다. Ember-1은 이미 값비싼 모델을 더 저렴하게 실행하도록 만들어졌습니다. 둘 다 타당한 접근이며, 이 맞대결이 명쾌한 결론을 내리기 어려운 이유는 파생 모델의 절감액이 플래그십이 실질적으로 크게 밑도는 요금표를 기준으로 정의되기 때문입니다.

이 글에서 비교한 모델1

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트