"Ling-3.1-flash vs Qwen3.8-Flash"라는 제목과 "같은 질문에 대한 두 가지 답: 빠른 티어는 어떻게 만드는가?"라는 부제가 달린 에디토리얼 히어로 카드를 생성했습니다. 왼쪽 패널은 "규모를 키우고 발표하라"라는 제목 아래 "총 ~560B · 활성 ~25B · 1M 컨텍스트"라는 캡션과 "가중치: 곧 공개"라는 태그를 달고 있습니다. 오른쪽 패널은 "줄이고 출시하라"라는 제목 아래 "총 125B · 활성 6B · Qwen4 미리보기"와 "가중치: Hugging Face에 공개"라는 태그를 달고 있습니다.
Engineering & Research

Ling-3.1-flash vs Qwen3.8-Flash: 빠른 티어를 구축하는 두 가지 방식, 그리고 그중 오직 하나만 출시된다

작성자

Rowan Sterling

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

올가을 두 중국 연구소가 같은 문제를 들여다봤다 — 값싸고 빠르면서 에이전트 루프 안에 넣을 만큼 충분히 좋은 모델을 어떻게 만들 것인가 — 그리고 서로 정반대의 답에 도달했다. Ant Group이 2026년 9월 30일에 발표한 Ling-3.1-flash는 약 5,600억 개 파라미터의 전문가 혼합(mixture-of-experts) 모델로 토큰당 약 250억 개 파라미터를 활성화하며, 컨텍스트 윈도는 최대 100만 토큰으로 제시되고 "곧" 오픈소스로 공개하겠다는 의사를 밝혔다. Alibaba의 Qwen 팀이 2026년 8월 26일에 공개한 Qwen3.8-Flash는 1,250억 개 파라미터의 멀티모달 전문가 혼합(mixture-of-experts) 모델로 토큰당 약 60억 개 파라미터를 활성화한다. 가중치는 이미 Hugging Face에 Qwen3.8-Flash-Next라는 이름으로 올라와 있고, QwenCloud API에서 입력 100만 토큰당 $0.15, 출력 100만 토큰당 $0.47에 실서비스 중인 프로덕션 모델이며, SGLang에서 첫날부터 지원된다. 한 연구소는 규모를 키워 발표했다. 다른 연구소는 규모를 줄여 출시했다. 그 차이는 두 연구소가 공개한 그 어떤 벤치마크보다 더 많은 것을 알려준다.

그것이 또한 이 비교를 주의 깊게 읽어야 하는 이유이기도 하다. Ling-3.1-flash에는 가중치도, 라이선스도, 모델 카드도, API 가격도, 독립적인 평가도 없다. 공개된 기록이라고는 발표 게시물, 벤더 벤치마크 차트, 그리고 Ant 자체의 Ling Studio 제품 내 한 자리뿐이다. Qwen3.8-Flash에는 그 모든 것이 있고, Alibaba에서 일하지 않는 사람들이 실행해 온 기간에서 4주 앞선다. 아키텍처 선택을 비교하는 것은 공정하다. 능력을 비교하는 것은 아직 아니다.

두 가지 설계 결정, 그리고 그것들이 왜 서로 갈리는지

Qwen의 베팅은 패스트 티어가 플래그십과 구조적으로 달라야 하며, 단지 그것보다 작아서는 안 된다는 것이다. Qwen3.8-Flash는 1,250억 개 파라미터 중 60억 개를 활성화한다 — 약 95% 희소성 — 그리고 그 능력은 그저 넓은 파라미터 범위가 아니라 연산이 어디로 라우팅되는지에서 나온다. 알리바바는 그 바탕이 되는 아키텍처가, 즉 Gated DeltaNet을 Qwen Sparse Attention 및 N-gram 임베딩 테이블과 결합한 아키텍처가 Qwen4 세대의 이른 미리보기라고 명확히 밝혔다. 이는 값비싼 모델들이 그 위에 구축되기 전에 추론 엔진, 양자화 도구, 배포 패턴이 이를 중심으로 성숙할 수 있도록 일부러 일찍 공개한 것이다. 그 결과는 구조적으로 토큰당 저렴한 모델이다: 매 토큰마다 약 60억 파라미터 분량의 연산을 수행하며, 가격은 알리바바가 100만 토큰당 입력 $0.15, 출력 $0.47로 책정했다.

발표가 밝힌 바로는 Ant의 베팅은 매우 긴 컨텍스트를 갖춘 전통적인 스케일링에 더 가깝다. Ling-3.1-flash는 큰 활성 비율을 유지한다 — 5,600억 개 중 토큰당 약 250억 개의 파라미터로, 약 22분의 1꼴이다 — 그리고 최대 100만 토큰의 윈도우를 제시하는데, 이는 이전 Ling 세대가 제공하는 것의 네 배다. Ling Studio 앱은 이를 "범용 에이전트, 검색, 일상적인 사무 업무, 소프트웨어/코드 개발"을 위해 만들어졌다고 설명한다. 이는 빠른 등급 포지셔닝이지만, 파라미터 경제성은 훨씬 더 무거운 모델의 그것이다. 동일한 입력에서 25B 활성 파라미터를 거치는 토큰에는 6B를 거치는 토큰의 약 네 배에 해당하는 연산 비용이 든다. 이는 어떤 가격 책정 결정이 개입하기 전의 일이다.

두 접근 방식 모두 틀린 것은 아니며, 둘 다 "저렴한 모델의 한계는 무엇인가"에 대한 방어 가능한 답이다. Qwen은 희소성과 새로운 어텐션 스택이 상한선이라고 보고 있다. Ant는 상한선이 컨텍스트와 세계 지식이며, 연산 비용을 감당할 수 있다고 본다. 독자 입장에서 이 둘을 갈라놓는 것은 설계 철학이 아니라 전달 방식이다: 내려받아 측정할 수 있는 설계 대 읽을 수만 있는 설계.

Ant Group's own Ling-3.1-flash benchmark card, published 30 September 2026. Panels compare Ling-3.1-flash with GPT-5.6 Sol, Claude Opus 5, Kimi K3, GLM 5.3, GLM 5.3 Flash and DeepSeek-V4.1-Flash across GDPval-AA v2.1 (1,673 Elo for Ling-3.1-flash), tau-Banking, SkillsBench, Automationbench, Terminal-Bench 4.0, CyberGym, FrontierSWE (75.16), SWE Atlas Codebase QnA, Finance Agent v2, HealthBench Professional (65.35), DRACO and MultiChallenge. A footnote states HealthBench Professional was evaluated in the AQ environment.

각각이 당신에게 초래하는 비용, 그리고 그것이 실제로 무엇을 의미하는지

가격 격차는 미묘하지도 않고, 근소하지도 않다. Qwen3.8-Flash는 입력 토큰 100만 개당 $0.15, 출력 100만 개당 $0.47, 캐시 읽기 100만 개당 $0.018에 공개되어 있다 — 알리바바의 발표 자료, 벤더의 프로덕션 모델 카드, 그리고 우리가 서빙하는 라우팅 모델 페이지에서 모두 같은 수치이며, 이는 세 출처와 대조해 확인했을 때 0% 마크업 패스스루가 어떤 모습인지를 보여준다. Ant는 Ling-3.1-flash에 대한 요율을 전혀 공개하지 않았다 — API 가격도, 캐시 할인도, 비교할 만한 어떤 것도 없다. Ling 라인에 대해 공개된 유일한 수치는 이전 세대의 것으로, 100만 개당 입력 $0.075, 출력 $0.22로 책정되어 있으며, 이는 Qwen의 입력 요율의 약 절반이고 출력 요율의 절반에도 못 미친다. 새로운 Ling 등급이 이전 세대가 있던 위치 근처로 가격이 책정된다면, 서류상으로는 Qwen3.8-Flash를 밑돌 것이다. 25B 활성 파라미터가 시사하는 연산량에 근접하게 책정된다면, 그렇지 않을 것이다. 어느 쪽이든 그것은 추측일 뿐이다. 그 숫자가 존재하지 않기 때문이다.

컨텍스트는 Ling의 주장이 진정으로 더 큰 부분이다. Ant는 Ling-3.1-flash에 대해 최대 100만 토큰을 내세운다. Qwen3.8-Flash는 프로덕션 API에서 100만 토큰 기본 컨텍스트를 제공하고, 오픈 가중치에서는 262,144토큰 네이티브 윈도를 제공하며 확장 가능하다. Ling의 수치에는 두 가지 유의점이 따라붙는데, 둘 다 해소되지 않았다. 첫째, "최대 100만"은 측정값이 아니라 사양이다. Ant 외부에서는 아무도 호출할 수 없는 모델의 장문 컨텍스트 검색 동작을 발표한 곳은 없다. 둘째, 이전 Ling 세대는 광고된 윈도와 그 뒤의 아키텍처 설명 사이에 정확히 같은 간극이 있었고, 답은 가중치와 형식, 컨텍스트 한도가 마침내 공개되었을 때에야 나왔다. 대표 수치인 100만은 약속이다. Qwen3.8-Flash의 100만은 Ant의 주장과 맞대어 볼 수 있는, 실제로 제공되는 기본값이다.

이 문제의 한쪽 편에서 '미리보기'가 정직한 단어인 이유

알리바바가 Qwen3.8-Flash를 규정하는 방식은 그것이 프로덕션 이름으로 출시된 아키텍처 프리뷰라는 것이다 — 오픈 웨이트에 "Next" 접미사가 붙은 것은 바로 프로토타입을 튜닝된 서빙 모델과 혼동하지 않도록 하기 위해서다. 그러한 규정은 마케팅이 아니라 실제 사건들로 입증되었다: SGLang은 출시 당일 Qwen3.8-Flash-Next에 대한 day-0 지원을 내놓았고, 이 모델은 Transformers, vLLM, TokenSpeed용으로도 구성되었으며, 이후 웨이트는 여러 양자화 커뮤니티에서 채택되었다. 버전들은 빠르게 평범해졌는데, 그것이 바로 출시된 모델의 모습이다.

Ant의 발표는 한 단계 이른 시점에 같은 양상을 보인다: 출시를 앞두고 사양을 공개하며, 모델이 곧 오픈소스로 공개될 것이라고 명시적으로 밝힌다. 이는 타당한 출시 방식이다: Ling-6-flash가 7월에 정확히 그 경로를 따랐고, 가중치는 약 2주 뒤인 8월 7일에 MIT 라이선스로 공개됐다. 하지만 오늘날 두 프로젝트의 상황은 비교할 수 없으며, 아무리 차트를 들여다봐도 그 격차는 좁혀지지 않는다. 외부인이 각각에 무엇을 보탤 수 있는지 구체적으로 따져볼 가치가 있다.

오늘 Ling-3.1-flash에 대해 독립적으로 검증 가능한 것은 다음과 같다: 발표가 존재하며 날짜가 9월 30일이라는 점, 파라미터·활성 파라미터·컨텍스트 수치가 Ant 자체 제공이라는 점, 해당 모델이 Ant의 Ling Studio 제품에 등장한다는 점, 그리고 가중치나 라이선스, 모델 카드가 공개되지 않았다는 점이다. Qwen3.8-Flash에 대해 독립적으로 검증 가능한 것은 다음과 같다: 가중치를 BF16과 FP8로 다운로드할 수 있다는 점, 라이선스 조건을 읽을 수 있다는 점, API 가격이 공개되어 있다는 점, 그리고 Alibaba의 벤치마크 주장이 8월 말부터 재현 가능하도록 공개되어 왔다는 점이다. 두 번째 목록이 더 길며, 그것이 이 비교의 전체를 축약해 보여준다.

Headless capture of the OrcaRouter model page for Qwen3.8 Flash, showing the routed model ID qwen/qwen3.8-flash, a 1M-token context window, 131K maximum output, text, image and video input with text output, capability badges for Vision, Tools, JSON and Reasoning, a production date of 2026-08-26, a pricing block reading $0.15 per 1M input tokens, $0.47 per 1M output tokens, $0.018 cache read and $0.230 cache write, and a performance panel with a 4.47 s p50 time-to-first-token, 10.00 s p95, 105 tok/s output and a 2.9% error rate over the last seven days.

두 가지가 실제로 어떻게 평가될지

Ant는 Ling-3.1-flash를 내세운 벤치마크 카드를 공개했는데, 여기서 이 모델은 GPT-5.6 Sol, Claude Opus 5, Kimi K3, 두 가지 GLM 변형, 그리고 DeepSeek-V4.1-Flash와 맞붙는다. 대표 수치는 GDPVal-AA v2.1에서 1,673 Elo, FrontierSWE에서 75.16, HealthBench Professional에서 65.35다. 그 카드에는 수치를 두고 논쟁하기에 앞서 두 가지 문제가 있다. 첫째는 비교 대상 집합이다. Ant가 고른 두 프런티어 모델은 모두 한 세대 뒤처져 있는데, Claude Opus 5.5와 GPT-6 Sol이 2026년 9월 22일에 출시되어 지금은 라우팅이 가능하기 때문이다. 즉 이 카드는 10월 모델을 현재의 프런티어가 아니라 7월의 프런티어와 벤치마킹한 셈이다. 둘째는 카드 자체에 달린 각주로, HealthBench Professional 결과가 "AQ 환경"에서 나왔으며 이 모델의 의료 역량은 현재 AQ에서만 체험할 수 있다고 명시한다. 그런데 AQ를 정의한 공개 문서는 없다. 평가 환경이 이름조차 밝혀지지 않은 대표 수치는 원칙적으로도 재현이 불가능하다.

이와 대조적으로 Qwen3.8-Flash의 그에 비견되는 주장은 가중치가 이미 공개된 뒤에 나왔고, 알리바바는 누구나 검증할 수 있는 주장, 즉 능력의 원천은 파라미터 수가 아니라 희소성 비율이라는 주장에 자사의 포지셔닝을 걸었다. 4주간의 사용은 판결이 아니지만, 그 주장이 더 이상 이견 없이 통하지 않게 되기에는 충분히 긴 시간이다 — 이는 모델에게 유용한 상태다.

이걸로 오늘 실제로 뭘 해야 할까

빌더라면, 실용적인 구분은 간단하다. Ling-3.1-flash는 이번 주에 도입할 수 있는 컴포넌트가 아니다. 호출할 엔드포인트도, 호스팅할 가중치도, 확인할 라이선스도, 예산을 맞출 가격도 없다. 최종 모델이 무엇이 되든, 지금 유용한 움직임은 트리거를 설정하는 것이다 — 가중치 공개, 허용적 라이선스, FrontierSWE에서 75.16에 근접하는 독립적인 점수 — 그리고 다시 살펴보는 것. 이전 세대의 역사 자체가 가중치가 발표 2주 후에 나올 수 있음을 보여주므로, 그 트리거는 빠르게 발동할 수 있다.

Qwen3.8-Flash는 이미 하나의 구성 요소입니다. 그것은 우리 카탈로그에 라우팅된 모델로 공급자 정가에 마크업 0%로 라이브되어 있습니다 — 라우팅 카드에는 입력 $0.15, 출력 $0.47, 백만 캐시 읽기당 $0.018이 표시되며, 이는 Alibaba가 공개하는 수치와 동일합니다. 이것이 0% 마크업 정책이 슬라이드가 아니라 실제로 의미하는 바입니다. 하나의 키 뒤에서 Claude Opus 5, GPT-5.6 Sol, DeepSeek-V4.1-Flash 옆에 자리하므로, Ant가 권하는 비교 — 현재 프런티어에 맞선 후보 — 는 두 개의 통합을 유지하는 대신 구성 파일을 두 개의 라우트로 지정하기만 하면 실행할 수 있으며, 자동 페일오버가 공급자가 흔들리는 주말을 처리합니다. 그것이 아키텍처 논의와 실험의 차이입니다.

내릴 수 있는 결론이라면 이렇다. Qwen은 더 대담한 아키텍처적 승부수를 던졌고, 그것을 일찍 공개해 사람들이 마음껏 뜯어보게 할 자신이 있었다. Ant는 더 무거운 승부수를 던졌다 — 더 많은 파라미터, 토큰당 더 많은 활성 연산, 더 많은 컨텍스트 — 그리고 지금까지 모델 대신 차트 하나를 공개했다. 그 차트는 좋아 보인다. 그리고 그 차트는 사람들이 가진 유일한 것이기도 하다.

Generated three-lane information card. Lane one, "Shipped, priced, licensed", holds "Qwen3.8-Flash — weights on Hugging Face as Qwen3.8-Flash-Next" and "$0.15 in / $0.47 out per 1M tokens, cache $0.018". Lane two, "Announced, unpriced, unlicensed", holds "Ling-3.1-flash — no repository, no licence", "no published API price" and "no independent evaluation". Lane three, "What a reader should do", holds "test the shipped model this week" and "set a trigger for the announced one".

이 글에서 비교한 모델1

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트