"Union Alpha vs Qwen3.8 Flash"라는 제목과 "두 모델을 모두 실행한 유일한 테스트에서 1점 차이"라는 부제목이 있는 생성된 타이틀 카드가 "공식 A: 136/157 vs 137/157", "컨텍스트: 262,144 vs 1,000,000 토큰", "첫 토큰까지 걸리는 시간: 10.00초 vs 6.62초"라고 적힌 세 개의 둥근 카드 위에 있습니다. 푸터에는 SMF Clearinghouse 기준 공식 A, 최근 7일간 OrcaRouter 기준 지연 시간이 표시됩니다.
Guides & Insights

Union Alpha vs Qwen3.8 Flash: 단 한 점이 전부를 말해준다

작성자

Gideon Frost

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

Union Alpha와 Qwen3.8 Flash는 두 모델을 모두 측정한 유일한 테스트에서 1점 차이다. 추론을 끈 상태의 SMF Clearinghouse Official A 스위트 — 157개 테스트 — 에서 Union Alpha는 136점을, Qwen3.8-Flash-Next의 로컬 실행은 137점을 기록했다. 이는 두 모델 각각이 기록한 맞대결 결과 중 가장 근접한 것이며, 동시에 이 비교에서 가장 오해를 부르는 수치이기도 하다. 두 항목이 같은 조건에서 실행되지 않았고, 둘 중 하나만이 지금 실제로 이용할 수 있는 모델이기 때문이다.

1점 격차가 말해주는 것과 말해주지 않는 것

그것이 무엇을 입증하는지부터 시작하자. Union Alpha는 사소한 의미에서의 허세가 아니다 — 오류가 전혀 없는 광범위한 157개 테스트 스위트, 완벽한 추론(30/30), 완벽한 도구 사용(2/2)은 속이 빈 엔드포인트가 만들어낼 수 있는 결과가 아니다. 코딩 결과 26/30과 수학 24/30은 이를 신뢰할 만한 영역에 놓고, 작문 점수 2/5는 범용 산문 작업과는 거리가 멀다는 것을 보여준다.

이제, 핵심을 떠받치는 주의사항들입니다.

Qwen3.8 Flash 항목은 Qwen3.8-Flash-Next의 로컬 실행이었습니다 — 오픈 웨이트 체크포인트 — 호스팅된 Qwen3.8 Flash API가 아닙니다. 로컬 서빙은 자체 양자화, 자체 추론 스택, 자체 도구 호출 파서를 의미합니다. 그 중 어느 것도 호스팅된 엔드포인트가 반환하는 것과 일치한다고 보장되지 않으며, 테스트를 실행한 사람들은 바로 그 이유 때문에 비교가 확정적이지 않다고 지적했습니다.

하나의 스위트는 프로필이 아니다. 공식 A는 범주별로 넓지만 얕다: 도구는 테스트 2개다. 테스트 두 개짜리 도구 범주에서 2/2점을 받은 것은 좋은 신호일 뿐, 에이전트 신뢰성의 증거는 아니며, Union Alpha는 명시적으로 에이전트형 및 코딩 모델로 포지셔닝되어 있다. 이 측정 도구는 주장과 인접한 무언가를 측정하고 있다.

그리고 그 한 점 자체는 157개 테스트 스위트의 노이즈 속에 있습니다. 136과 137은 순위가 아니라 "이 둘은 같은 대역에 있다"로 취급하세요.

나란히

• 컨텍스트 창 — Union Alpha 262,144 토큰 대 Qwen3.8 Flash 1,000,000 토큰 제공(네이티브 262,144, YaRN으로 확장).

• 최대 출력 — Union Alpha 131,072 토큰 vs Qwen3.8 Flash 131,000 토큰. 사실상 동일한 수준.

• 입력 — Union Alpha에서는 텍스트와 이미지, Qwen3.8 Flash에서는 텍스트, 이미지, 비디오.

• 가격 — Union Alpha 프리뷰 기간에는 $0, Qwen3.8 Flash는 입력 $0.150/M, 출력 $0.470/M, 캐시 읽기 $0.018/M, 캐시 쓰기 $0.230/M.

• 추론 제어 — Union Alpha에는 없음 vs Qwen3.8 Flash에는 기본적으로 켜져 있으며 비활성화할 수 있는 사고 모드.

• 첫 토큰까지 걸리는 시간 — Union Alpha 10.00초 p50 대 Qwen3.8 Flash 6.62초 p50, 둘 다 동일한 7일 기간에 우리 엔드포인트에서 측정한 값입니다. 원시 디코딩 속도는 평판이 시사하는 것보다 차이가 작습니다: 초당 170토큰 대 103토큰.

• 출처 — 익명 운영자로 가중치 미공개, 반면 Alibaba/Qwen은 Qwen3.8-Flash-Next 가중치를 Hugging Face와 ModelScope에 오픈소스로 공개.

Generated two-column comparison scoreboard for Union Alpha and Qwen3.8 Flash. Union Alpha column: context window 262,144 tokens, max output 131,072 tokens, text and image input, $0 preview price, no published weights, 10.00 s p50 time to first token. Qwen3.8 Flash column: context window 1,000,000 tokens served, max output 131,000 tokens, text, image and video input, $0.150 input and $0.470 output per 1M tokens, Qwen3.8-Flash-Next weights open-sourced, 6.62 s p50 time to first token. Footer reads Official A per SMF Clearinghouse with latency and errors per OrcaRouter over the last 7 days.

Qwen3.8 Flash: 효율성에 건 6B 활성 승부수

Qwen3.8 Flash는 2026년 8월 26일, 오픈 가중치 체크포인트인 Qwen3.8-Flash-Next의 프로덕션용 관리형 버전으로 출시되었으며, 해당 체크포인트는 Alibaba가 같은 시기에 공개했습니다. 이 모델은 1,250억 개 파라미터의 전문가 혼합(mixture-of-experts) 모델로, 토큰당 약 60억 개 파라미터와 510억 개의 N-gram 임베딩 파라미터를 활성화하며, Gated DeltaNet과 희소 어텐션 인덱서를 결합한 하이브리드 어텐션을 기반으로 구축되었습니다.

벤더 측 설명은 학습 경제성에 관한 것입니다: Alibaba는 실행 비용이 Qwen3.7-Plus의 약 9분의 1이라고 보고하며, 캐시 적중률이 높은 1M 토큰 워크로드에서 프리필(prefill)이 최대 7.6배 빠르고 디코드(decode)가 최대 4.9배 빠르다고 주장합니다. 이는 벤더 수치이며 독립적으로 재현되지 않았습니다.

벤치마크 표 역시 벤더가 보고한 것이며 재현된 바 없다: SWE-bench Pro 62.5, DeepSWE v1.1 58.7, SWE-bench Multilingual 81.0, NL2Repo 48.1, CoWorkBench 73.9, JobBench 55.7, RealWorldQA 88.5, LVBench 76.6, AndroidWorld 84.5. 마케팅에 되받아 인용할 만한 수치는 Humanity's Last Exam의 35.9로, 같은 비교에서 Claude Opus 4.6의 40.0보다 낮다.

우리 자체 모델 페이지의 공개 벤치마크 섹션은 여전히 "pending"으로 표시됩니다 — 아직 어떤 제3자도 점수를 매기지 않았습니다. 우리가 가진 것은 자체 트래픽입니다: 첫 토큰까지 걸리는 중앙값 시간 6.62초, 초당 103토큰의 출력 속도, 그리고 4.5%의 오류율입니다. 이 오류율은 지켜볼 가치가 있을 만큼 높으며, 이는 출시 게시물이 아니라 라이브 엔드포인트를 측정할 때만 드러나는 종류의 수치입니다.

The OrcaRouter model page for Qwen3.8 Flash, showing a 1M-token context window, 131K max output, text plus image and video input, $0.15 per million input tokens and $0.47 per million output tokens, a p50 time to first token of 6.62 s, and 2,322.0M tokens of traffic over seven days.

Union Alpha: 소유자가 없는 모델

Union Alpha는 2026년 9월 16일 서드파티 카탈로그에 등장했으며 OrcaRouter의 무료 티어에서 제공됩니다. 이름이 밝혀진 연구소도, 가중치도, 라이선스도, 파라미터 수도, 아키텍처 설명도 없습니다. 제공자 필드에는 "Stealth"라고 적혀 있습니다.

적어도 그 엔드포인트는 읽을 수 있습니다: 262,144토큰 컨텍스트, 131,072토큰 최대 출력, 텍스트 및 이미지 입력에 텍스트 전용 출력, 도구 호출, JSON 출력, temperature, top_p 및 max_tokens, 그리고 추론 제어는 전혀 없습니다. 도구 선택은 사실상 "auto"만 지원합니다. 무료 기간은 약 일주일로 설명되었으며, 속도 제한이 있고, 프리뷰 이후 가격은 발표되지 않았습니다.

제시된 주장, 즉 "광범위한 범용 작업 전반에 걸친 프런티어급 성능"은 운영자가 보고한 것으로 감사를 받지 않았습니다. 136/157 Official A 결과가 존재하는 유일한 독립적 측정치입니다.

The OrcaRouter model page for Union Alpha (Free), listed under the stealth vendor, showing a FREE badge, a 262K-token context window, 131K max output, text and image input with text output, and pricing shown as Free and rate-limited with model usage at $0.

속도는 그들이 서로 닮아 보이기를 멈추는 지점이다

대표적인 처리량 수치만으로는 예상하듯 이 둘을 구분해 주지 않으며, 그 이유는 이해해 볼 가치가 있습니다.

지난 7일 동안 우리 자체 라우팅 텔레메트리에서 Qwen3.8 Flash는 초당 103개의 출력 토큰으로 스트리밍되며, p50 첫 토큰까지의 시간은 6.62초, 오류율은 4.5%였습니다. 동일한 방식으로 측정한 Union Alpha는 초당 170개 토큰으로 스트리밍됩니다. 순수 디코딩 속도만 보면 익명 모델이 둘 중 더 빠릅니다.

그것이 하지 않는 일은 바로 시작하는 것이다. Union Alpha의 p50 및 p95 첫 토큰까지의 시간은 둘 다 10.00초에 고정되어 있어, 전체 요청 가운데 최소 절반은 첫 토큰이 나타나기까지 10초 이상을 기다린다는 뜻이다. 또한 같은 구간에서 오류율은 7.7%로, Qwen의 약 1.7배다. 앞선 섹션들이 근거로 삼는 157개 테스트의 Official A 실행은 실제 경과 시간으로 4.6시간이 걸렸고, 테스트당 지연 시간 중앙값은 91.9초, 평균은 104.8초였으며, 네 개의 테스트는 하네스의 300초 타임아웃에 걸렸다. 출시 당일 그것을 실행한 독립 테스터들은 우리 엔드포인트가 보여주는 것보다 훨씬 낮은 처리량을 보고했는데, 이는 엄청난 첫날 부하를 아직 흡수하고 있는 서비스에서 예상할 수 있는 일이다.

그래서 실질적인 차이는 디코딩 속도가 아니다. 그것은 첫 토큰까지 걸리는 시간과 안정성이다. Union Alpha는 어떤 대화형 작업에도 쓸 수 없다 — 자동 완성도, 인라인 지원도, 촘촘한 에이전트 루프도 — 왜냐하면 10초의 침묵은 멈춘 것과 구분되지 않기 때문이다. 이는 비동기 작업에 맞는다: 밤새 돌리는 배치 작업, 긴 문서 순회, 첫 토큰을 기다리는 대상이 없는 오프라인 평가 실행처럼, 7.7%의 실패율이 재시도로 흡수되는 경우다.

Qwen3.8 Flash는 초당 103토큰, 첫 토큰까지의 중앙값 시간 6.62초로 역시 빠르지 않다. 정직하게 말하자면 둘 다 느리고, 그중 하나만 대략 13번의 요청 중 1번꼴로 실패한다.

효율성 논거, 그리고 누가 그것을 제시할 수 있는가

Alibaba는 학습 비용 논리를 내세운다: Qwen3.7-Plus를 학습시키는 비용의 9분의 1이고, 토큰당 활성 파라미터가 60억 개라서 서빙 비용이 저렴하다는 것이다. 이는 가중치가 존재하고 계보가 문서화된 모델에 대한 주장이다.

Union Alpha의 효율성 이야기는 명시되기보다 암시되어 있다 — 무료로 호출할 수 있는 256K 익명 모델. 무료는 저렴함과 같지 않다. 누군가는 그 GPU 비용을 지불하고 있고, 프리뷰에는 명시된 종료 시점이 있으며, 운영자가 속도를 위해 튜닝 중이었다고 스스로 인정한 점은 서빙 경제성이 아직 정리되지 않았음을 시사한다. 일주일 동안 무료이고 그 뒤에는 가격을 책정할 수 없는 모델의 효율성 논거는 그 기간과 함께 만료된다.

미지의 것을 걸지 않고 시도하기

이 특정 맞대결을 머릿속에 담아둘 가치가 있는 이유는, 그것이 아직 검증되지 않은 모델을 시험해 볼 수 있는 가장 저렴한 방법이기 때문이다. Qwen3.8 Flash는 이미 알려진 변수다: 이름이 밝혀진 공급업체, 공개된 가중치, 공개된 (비록 공급업체 색채가 묻은) 벤치마크, 그리고 실제 토큰당 가격 $0.150/$0.470. Union Alpha는 미지의 존재로, 가격은 0이며, 경쟁력에 관한 모든 주장이 단 하나의 157개 테스트 결과에 달려 있다.

하나를 고르기보다는, 알 수 없는 것을 페일오버 규칙 뒤에 두세요. OrcaRouter는 공급자 정가를 0% 마크업으로 그대로 전달하고 공급자 간 자동 페일오버를 지원하므로, 속도 제한에 걸리거나 사라진 Union Alpha 엔드포인트는 새벽 3시에 실패한 작업으로 드러나는 대신 여전히 응답 중인 모델로 넘어갑니다. 두 모델 모두 같은 키를 사용하므로 이 실험은 두 번째 통합이 아니라 구성 변경만 요구합니다 — 그리고 무료 기간이 끝나면 라우팅을 전환할 수 있기 때문에, 어느 쪽도 굳이 변호해야 할 결정이 아닙니다.

평결

Qwen3.8 Flash는 기반으로 삼을 모델이다. 60억 개의 활성 파라미터, 오픈소스로 공개된 형제 모델 가중치, 100만 토큰 창, 비디오 입력, 실제로 작동하는 초당 103토큰, 그리고 예측 가능한 공개 가격까지 갖췄다. 벤치마크는 벤더가 보고한 수치이고 오류율은 주시할 가치가 있지만, 이 모델은 누군가의 것이며 그 누군가는 실제로 제품을 내놓고 있다.

Union Alpha는 측정해야 할 모델이다. Official A에서의 1점 차이는 정말 흥미롭다 — 이게 무엇이든 장난감은 아니라는 점을 시사한다 — 그리고 $0에 131K 출력 상한과 비전 입력을 갖춘 점은 일주일 동안 주목해 볼 가치가 있다. 하지만 단일 스위트에서 7.7%의 오류율을 가진 익명 운영자가 만들어낸 1점 차이는 전환할 이유라기보다는 조사할 이유다.

주목할 점은 언제나 이 문제를 결정지어 온 바로 그 무엇, 즉 이름이다. 이 시리즈의 이전 항목인 Ox Alpha는 Zhipu의 GLM-5.3-Flash로 등장한 지 6일 만에 공개되었다. Union Alpha가 이름을 얻는다면, 비교는 더 이상 점수가 아니라 가격에 관한 것이 된다.

이미 알려진 사항은 가격과 문서가 확정되어 있습니다: Qwen3.8 Flash 모델 페이지에는 $0.150/$0.470 요금, 1M 토큰 서빙 컨텍스트, 131K 출력 상한이 나와 있으며, 공개 벤치마크는 아직 대기 중입니다.