생성된 타이틀 카드에는 "Boreal vs Qwen3.8 Max"라는 제목과 "각 공급업체가 여러분이 건너뛰기를 바라는 행"이라는 부제가 있으며, 동영상 재생 프레임, 한 행이 강조된 점수표, 돋보기의 플랫 라인 아이콘과 함께 OrcaRouter 로고가 오른쪽 아래에 합성되어 있습니다.
Guides & Insights

Boreal vs Qwen3.8 Max: 각 벤더가 당신이 건너뛰기를 바라는 행

작성자

Alistair Wren

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

모든 모델 출시는 숫자 카드를 공개하며, 모든 카드에는 공급업체가 여러분이 오래 들여다보지 않기를 바라는 행이 하나씩 있습니다. Qwen3.8 Max의 경우, 2026년 8월 3일에 공개되었는데, 보기 좋은 행들은 쉽게 찾을 수 있습니다. CodeArena 프런트엔드 리더보드에서 1,691점으로 1위를 차지했고, Artificial Analysis Agentic Index 58을 기록해 high effort의 Claude Opus 5와 동률을 이루었으며 — 중국 연구소가 그 순위표 정상에 가장 가까이 다가간 사례였습니다 — GDPval-AA 점수 1,739 Elo를 기록해 GPT-5.6 Sol을 앞섰습니다. 그 아래의 행은 읽기가 더 어렵습니다. 같은 평가자의 스위트에서 측정된 환각률은 이전 세대의 23%에서 40%로 상승했고, 모델의 장문맥 검색 점수는 2점 하락했습니다. Boreal은(는) Creatify의 광고 영상 모델로, 2026년 9월 15일 초당 1센트에 출시되었으며, 자체 카드에 같은 종류의 행이 있습니다 — 그리고 공급업체가 그것을 공개했기 때문에 더 구체적입니다.

어느 쪽 행도 결격 사유는 아니다. 둘 다 헤드라인 점수보다 더 많은 정보를 주므로, 배너를 비교하기보다는 두 행을 나란히 놓고 보는 것이 가치가 있다.

Qwen3.8 Max가 진정으로 가장 잘하는 것

성과는 진짜이며, 결코 작지 않습니다.

Qwen3.8 Max는 2.4조 개 매개변수의 전문가 혼합(mixture-of-experts) 모델로, 토큰당 약 950억 개 매개변수가 활성화되며, 알리바바가 오픈 웨이트로 공개하겠다고 밝힌 최초의 Max급 Qwen입니다. 공개 일정은 2026년 8월 10일이 있는 주로 예고되었지만 라이선스나 확정 날짜는 없었는데, 예고가 곧 출시는 아니라는 점에서 주목할 만한 세부 사항입니다. 이 모델은 100만 토큰 컨텍스트 창과 131,072토큰 출력 상한을 갖추고 있으며, 텍스트, 이미지, 비디오를 입력으로 받습니다. 이 특정 비교에서 마지막 점은 강조할 가치가 있습니다. 이 시리즈가 Boreal에 맞세우는 네 가지 프런티어 텍스트 모델 중에서 Qwen3.8 Max는 완성된 비디오 클립을 건네고 그에 관해 질문할 수 있는 단 두 모델 중 하나입니다.

이 가격 책정은 해당 세그먼트를 재편할 정도로 공격적입니다. 백만 입력 토큰당 $2.00, 백만 출력 토큰당 $6.00이고 캐시 읽기는 $0.25로, 이전 세대보다 약 20% 저렴하면서 최대 출력 길이는 두 배로 늘립니다. 우리 보드 기준으로는 $2.00와 $6.00, 1M 토큰 컨텍스트, 첫 토큰까지의 p50 시간 10.00초 — 우리 계측기가 보고하는 상한값이므로 정확한 수치라기보다 '느림'으로 읽어야 합니다 — 그리고 지난 7일 동안 1억 8,300만 토큰의 트래픽으로 나타납니다.

그리고 그 아래 행

다음은 출시 게시물의 헤드라인에 실리지 않은 부분입니다.

Artificial Analysis의 독립 평가는 Qwen3.7-Max와 Qwen3.8 Max 사이에서 두 가지 퇴행을 기록했다. 장문맥 검색 지표는 2점 하락했다. 전지성 지표는 10점 하락했고, 평가자가 측정한 환각률은 23%에서 40%로 상승했다. 동시에, 지능 지수상 이 모델의 작업당 비용은 $0.53에서 $1.14로 상승했다 — 이 모델은 작업당 약 64턴이 걸린 반면, 이전 모델은 14턴이 걸렸다.

그것들을 함께 읽으면 일관된 그림이 드러난다. Qwen3.8 Max는 정답이 하나뿐인 벤치마크가 측정할 수 있는 것들—코드, 에이전트형 과제 완수, 구조화된 문제 해결—에서는 더 나아졌지만, 점수를 매기기가 가장 어려운 것, 즉 자신이 모른다는 사실을 아는 능력에서는 더 나빠진 모델이다. 더 많이 숙고하면서 더 많이 환각을 일으키는 모델이 자기모순인 것은 아니다. 더 긴 추론 흔적은 자신감 있게 틀린 답에 확신을 쏟을 기회를 더 많이 만들어내며, 과제 완수를 보상하는 벤치마크는 위반해야 할 숨은 불변 조건이 생기기 전까지는 그것에 페널티를 주지 않는다.

구매자 입장에서 실질적인 결과는 좁고 구체적이다. 모델 사용이 코드 생성이거나, 오답이 크게 드러나 실패하는 방식—테스트가 실패하고 빌드가 깨지는—의 에이전트 워크플로라면, 퇴행은 대체로 보이지 않고 개선만이 전부다. 사용 용도가 검색, 요약, 또는 유창하지만 틀린 답이 검증 없이 사람에게 도달하는 무엇이든이라면, 23→40의 변화가 당신의 평가를 결정해야 하는 숫자이며, CodeArena 순위가 아니다.

공급업체가 공개한, Boreal 자체의 최악의 행

이 조합을 유용하게 만드는 대비점은 Creatify가 대부분의 공급업체가 하지 않는 일을 했다는 것입니다: 가장 약한 결과를 가장 강한 결과와 같은 게시물에 넣었습니다.

Boreal은 자체의 손대지 않은 기본 모델을 대상으로 블라인드 테스트를 실시했으며, 프롬프트, 해상도, 프레임 수, 시드를 고정한 상태에서 40개의 프로덕션 케이스에 걸쳐 진행되었습니다. Creatify는 Boreal에 대한 81%의 선호도를 보고합니다 — 25 대 6, 9개의 무승부, 부호 검정 p<0.001 — 그리고 그 평균을 세분화합니다. 제품 광고: 83%. 크리에이터 및 UGC 장면: 85%. 1인 토킹 클립: 60%.

그 마지막 수치가 바로 그 행이다. 토킹 헤드는 직접 반응 광고에서 가장 흔한 포맷 중 하나이며, 이 모델이 자체 베이스보다 갖는 우위가 가장 미미하게 나타나는 포맷이다 — 아무도 출시하려 하지 않았을 모델을 상대로 겨우 동전 던지기보다 나은 정도다. 렌더링은 720p급에서 실시간과 1:1로 제시되며, 미세 디테일 보존은 p=0.004에서 11.3% 향상되었으므로, 전체적으로 보면 이야기는 진정 긍정적이다. 세부 분석은 이 모델이 해당 카테고리의 어느 절반에 맞춰 튜닝되었는지를 알려줄 뿐인데, 그것은 카메라를 향해 말하는 사람이 있는 절반이 아니다.

또한 이 각 행이 어떤 종류의 증거인지도 주목하세요. Qwen3.8 Max의 성능 저하는 자체 하네스를 실행한 독립 평가자에 의해 발견되었습니다. Boreal의 취약한 행은 벤더가 설계하고 실행한 테스트에서 벤더에 의해 공개되었습니다. 두 번째는 사실 진술로서는 더 신뢰할 수 있지만 비교로서는 정보가 더 적습니다. Boreal의 파일 어디에도 독립적인 수치가 없기 때문입니다.

A generated two-column scoreboard for Boreal vs Qwen3.8 Max sharing six dimension labels. Boreal reads output rendered video, input text or one image, meter $0.01 per second, context not published, latency 1:1 realtime, independent score none yet. Qwen3.8 Max reads output text 131K max, input text image video, meter $2 / $6 per 1M, context 1M tokens, latency p50 10.00s TTFT, independent score AA Index 58 with 2 regressions. Footer reads "Boreal figures vendor-run and unreproduced; Qwen3.8 Max per our catalogue and Artificial Analysis."

스펙 대비

• 출력 — Boreal: 렌더링된 비디오, 720p급, 텍스트-투-비디오 및 이미지-투-비디오. Qwen3.8 Max: 텍스트 전용, 최대 131,072 토큰.

• 입력 — Boreal: 텍스트 프롬프트 또는 정지 이미지. Qwen3.8 Max: 텍스트, 이미지 및 동영상.

• 가격 — Boreal: 완성된 영상 1초당 $0.01. Qwen3.8 Max: 입력 100만 토큰당 $2.00 / 출력 100만 토큰당 $6.00, 캐시 읽기는 $0.25.

• 컨텍스트 — Boreal: 미공개. Qwen3.8 Max: 입력 1M 토큰, 출력 131K.

• 지연 시간 — Boreal: 실시간과 1:1로 제시됨. Qwen3.8 Max: 자사 보드에서 첫 토큰까지 걸리는 시간의 p50이 10.00초.

• 가중치 — Boreal: 독점적이며, Creatify가 소유하고 제공합니다. Qwen3.8 Max: 출시 당시 독점적이며, Alibaba는 최초의 Max급 Qwen에 대한 오픈 웨이트 공개를 발표했지만 라이선스나 날짜는 확정되지 않았습니다.

• 근거 — Boreal: 벤더가 주도한 40건 블라인드 테스트로, 독립적 평가는 없음. Qwen3.8 Max: 측정된 두 건의 성능 저하를 포함한 독립적 벤치마크 평가 범위에 더해, OSWorld-Verified에서 86.1, Terminal-Bench 2.1에서 86.6이라는 벤더 측 수치.

회귀가 구매하는 사람에게 어떤 가치가 있는가

리더보드에서의 성능 저하는 대개 사소한 정보로 취급된다. 그것들은 벤치마크가 공개하는 것 중 의사결정에 가장 관련 있는 항목에 더 가깝다. 왜냐하면 그것들은 벤더가 무엇을 포기했는지 알려주는 유일한 행이기 때문이다.

유용한 선택은 두 카드 중 어느 것도 읽는 것이 아니라, 두 모델을 여러분 자신의 트래픽에서 실행해 보는 것입니다. 그리고 실질적인 걸림돌은 이것이 보통 두 건의 계약, 두 개의 SDK, 두 개의 결제 관계를 뜻한다는 점인데, 이 정도의 마찰이면 대부분의 팀이 테스트를 건너뛰고 대신 헤드라인 점수만 보고 구매하기에 충분합니다.

그 마찰은 라우팅 레이어가 제거해 주는 부분입니다. Qwen3.8 Max는 저희 카탈로그에 있습니다 이전 세대와 나란히요. 그래서 자체 평가 세트에서 두 모델을 비교하는 일은 조달 주기가 아니라 모델 문자열을 한 줄 바꾸는 변경에 불과하며, 비교 결과 파이프라인의 다른 단계에는 다른 모델이 필요하다고 나오면 동일한 키로 카탈로그의 나머지 모델에도 접근할 수 있습니다. 가격은 공급사 정가에 0% 마크업으로, 여기에는 특별한 이유가 있습니다. Qwen3.8 Max는 대체한 세대보다 약 20% 저렴하게 출시되었으며, 이런 종류의 공급사 가격 재조정은 다음 갱신 때가 아니라 발생하는 즉시 청구서에 반영되어야 하기 때문입니다.

Boreal은 우리 카탈로그에 없습니다. OrcaRouter는 비디오 생성 모델을 제공하지 않으며, 여기 어떤 내용도 그와 반대로 주장하는 것으로 읽혀서는 안 됩니다. 우리가 제공하는 것은 그 위의 레이어입니다 — 카피, 변형본, 컴플라이언스 검토, 무엇이 성과를 냈는지에 대한 분석 — 그리고 이 시리즈의 모델 중 두 가지, 그중 Qwen3.8 Max에는 완성된 클립을 검토용으로 넘겨줄 수 있습니다.

A screenshot of Creatify's own launch post for Boreal, dated September 15 2026 and headed "Introducing Boreal: frontier-quality AI video at a cent a second", showing the Boreal by Creatify Labs logo card and the opening paragraph stating that Boreal generates text-to-video and image-to-video at one cent per second, about $0.05 for a five-second clip, and renders in realtime.

두 카드 중 하나를 읽는 방법

Qwen3.8 Max는 당신의 업무가 코드, 에이전트 또는 구조화된 추론이라면 자체 전작보다 낮은 가격에 더 강력한 선택이며, 두 가지 독립적인 회귀는 프로덕션을 그쪽으로 라우팅하기 전에 검색 및 요약 트래픽에서 이 모델을 테스트해야 하는 이유입니다. 40% 환각 수치는 이 모델을 피해야 할 이유가 아니라, 당신의 워크로드 중 어느 것이 이를 감내할 수 있는지 알아야 할 이유입니다.

Boreal은 이 비교가 명목상 다루는 결과물을 만들어 내는 둘 중 유일한 제품이며, 공개된 요금 기준으로 숏폼 광고 영상에서 가장 저렴한 신뢰할 만한 선택지입니다. 그 제약은 형식에 특정된 것이며 자사 공급업체가 직접 밝힌 바로는 1인 토킹 클립에서 60% 선호도입니다. 제품 광고보다 그 형식을 먼저 테스트하세요, 바로 그곳이 여유가 가장 작기 때문입니다.

두 가지가 이 상황을 바꿀 수 있습니다. Alibaba가 Qwen3.8 Max용으로 발표한 오픈 웨이트를 출시한다면, 모델의 가격 책정과 지속성이 모두 달라지고, 그것이 어떤 라이선스로 출시되는지가 날짜보다 더 중요해질 것입니다. 그리고 Boreal의 경우, 어떤 종류든, 누구에 의한 것이든 최초의 독립적 평가가, 현재 브랜드들이 자사 제품이 어떻게 보이는지에 유난히 민감한 포맷으로 판매되는 한 모델에 대한 전체 증거 부담을 떠맡고 있는 40개 사례에 대한 벤더 테스트를 대체하게 될 것입니다.

A screenshot of the OrcaRouter model page for qwen/qwen3.8-max, showing Qwen3.8 Max by Qwen dated 2026-08-03 marked Featured, a 1M-token context, text + image + video input with text output, a p50 time to first token of 10.00 seconds, input $2.00 and output $6.00 per 1M tokens, and 183.0M tokens of traffic in the last 7 days.

이 글에서 비교한 모델1

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트