"Ling-3.1-flash vs Ling-3.0-flash"라는 제목과 "하나는 오늘 다운로드할 수 있다. 다른 하나는 보도 게시물 속의 한 문장이다."라는 부제목으로 생성된 편집용 히어로 카드. 두 개의 비교 열: "Ling-3.1-flash (발표됨)"에는 "~560B 전체 / ~25B 활성", "최대 1M 토큰 컨텍스트", "가중치 없음, 라이선스 없음"이 나열되고, "Ling-3.0-flash (출시됨)"에는 "124B 전체 / 5.1B 활성", "262,144토큰 제공 컨텍스트", "Hugging Face의 MIT 가중치"가 나열됩니다.
Guides & Insights

Ling-3.1-flash vs Ling-3.0-flash: 1M 토큰 윈도우와 4.5배 파라미터가 실제로 바꾸는 것

작성자

Gideon Frost

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

Ant Group의 Ling 패밀리에 새로운 고속 등급이 등장했는데, 이번에는 겨우 한 문장짜리 발표에 불과하다. Ling-3.1-flash는 2026년 9월 30일에 발표됐다. 총 파라미터 약 5,600억 개, 토큰당 활성 파라미터 약 250억 개, 최대 100만 토큰으로 명시된 컨텍스트 윈도, 그리고 “곧 모델을 오픈소스로 공개할 계획입니다”라는 상투적인 문구가 붙었다. 고속 라인의 정점에서 이 모델이 대체하는 Ling-3.0-flash는 모든 면에서 전혀 다른 존재다. 총 파라미터 1,240억 개, 토큰당 활성 파라미터 51억 개, 제공되는 컨텍스트 262,144토큰, 8월 7일부터 Hugging Face에서 MIT 라이선스로 제공된 가중치, 그리고 독립적인 Artificial Analysis Intelligence Index 점수 20이다. 이 모델들 중 하나는 오늘 다운로드할 수 있다. 다른 하나는 읽어볼 수 있을 뿐이다. 둘을 비교하는 것은 정말 유용하지만, 그 비교가 바로 거기서 시작될 때만 그렇다.

헤드라인의 산술은 간단하고 약간 오해를 부른다. Ling-3.1-flash는 Ling-3.0-flash의 전체 파라미터 수의 약 4.5배이고, 활성 파라미터 수의 약 4.9배다 — 토큰당 25B 대 5.1B다. 대충 읽으면 "훨씬 더 큰 모델이니 훨씬 더 똑똑한 모델"이라고 말하게 된다. 더 신중하게 읽으면 Ant가 본체를 확장하면서 희소성 비율은 대략 유지했다는 것이고, 그것이 주는 것은 용량이지 반드시 토큰당 추론 깊이는 아니다. 560B 중 25B를 각 토큰에 라우팅하는 모델은 5.1B를 라우팅하는 모델보다 토큰당 더 많은 작업을 하지만, 그 대가로 토큰당 약 5배의 연산량을 지불한다. 이 트레이드오프가 어디에 귀결되는지는 전적으로 Ant의 아키텍처가 추가 파라미터를 효율적으로 처리하느냐에 달려 있다 — 그리고 그것은 발표문이 답하지 않는 질문이다.

두 모델, 나란히

공개된 사실들을 서로 나란히 놓으면 세대가 깔끔하게 구분됩니다. 아래의 각 줄은 Ant 또는 독립 평가자가 실제로 공개한 내용을 말합니다. 숫자가 빠져 있다면, 그것은 아무도 그 숫자를 공개하지 않았기 때문에 빠져 있는 것입니다.

• 총 파라미터 — Ling-3.1-flash: ~560B(공급업체). Ling-3.0-flash: 124B(모델 카드).

• 토큰당 활성 파라미터 — Ling-3.1-flash: ~25B (공급업체). Ling-3.0-flash: 5.1B (모델 카드).

• 컨텍스트 윈도우 — Ling-3.1-flash: 최대 1M 토큰(벤더). Ling-3.0-flash: 256K 네이티브, 262,144로 제공(모델 카드 및 추론 레시피).

• 가중치 및 라이선스 — Ling-3.1-flash: 공개되지 않음; 저장소 없음, 라이선스 없음 (2026년 9월 30일과 10월 1일 두 차례 확인). Ling-3.0-flash: MIT, 2026년 8월 7일부터 Hugging Face에 inclusionAI/Ling-3.0-flash로, ModelScope에도 공개됨.

• 가중치 형식 — Ling-3.1-flash: 제공되는 것 없음. Ling-3.0-flash: 연구소에서 제공하는 BF16(~255GB) 및 FP8(~128GB), 그리고 커뮤니티 퀀트.

• 벤치마크 출처 — Ling-3.1-flash: 전적으로 벤더 보고에 의존하며, 공개된 평가 하네스도 없고, 재실행할 가중치도 없습니다. Ling-3.0-flash: Artificial Analysis가 독립적으로 평가해 Intelligence Index 20을 기록했으며, 측정된 출력 속도와 토큰 생성량도 함께 공개되었습니다.

• 사용 가능 여부 — Ling-3.1-flash: Ant 자체의 Ling Studio 제품에서만 사용 가능. Ling-3.0-flash: 자체 호스팅 가능하며, Ant의 개발자 API를 통해 호출할 수도 있음.

Headless capture of the Artificial Analysis model page for Ling 3.0 Flash. The page shows the model's stat strip with text input and text output, a 262k-token context window, 5.1B active parameters, and a written summary stating that Ling 3.0 Flash scores 20 on the Artificial Analysis Intelligence Index against a median of 8, generated 260M tokens during evaluation, is priced at $0.07 per 1M input tokens and $0.22 per 1M output tokens, and runs at 325 tokens per second.

추가 용량이 아마 무엇을 위한 것인지

Ant가 Ling-3.1-flash를 직접 한 줄로 설명한 것이 이번 릴리스에서 가장 많은 정보를 담고 있다. Ling Studio 앱은 이를 "범용 에이전트, 검색, 일상적인 사무 업무, 소프트웨어/코드 개발"에 내세우는데, 이는 추론 벤치마크 중심의 틀이 아니라 사무 업무 및 에이전트 중심의 틀이다. 이는 이 제품군이 구성된 방식과 일치한다. Ling은 범용 텍스트 및 도구 라인이고, Ring은 추론 라인이며, Ming은 멀티모달을 담당한다. Ling-3.0-flash는 한 세대 전에 같은 자리를 차지했으며, 플래그십이 아니라 명시적으로 빠르고 저렴한 등급이었다.

그런 관점에서 이번 스케일업을 보면 이해가 된다. 에이전트형 및 도구 호출 워크로드는 길고 반복적이며 컨텍스트를 많이 요구한다. 하나의 에이전트 루프는 행동을 취하기 전에 누적된 도구 출력으로 수만 토큰을 태울 수 있으므로, 100만 토큰 윈도는 스펙표의 과시용 문구가 아니라 기능적 요구사항이다. 총 파라미터 수를 늘리면서도 활성 비율을 크게 유지하는 것은, 여전히 루프 안에 들어갈 만큼 충분히 빨라야 하는 모델에 세계 지식과 지시 수행 깊이를 더하는 방식이다. Ant는 여기서 더 느리지만 더 똑똑한 플래그십을 만드는 것이 아니다. 더 큰 고속 티어를 만들고 있는 것이다.

반론은 비용이며, 그것은 반대 방향에서 도착하는 같은 산수다. 추가 용량은 추론 시점에 공짜가 아니다. 모든 토큰마다 비용을 치른다. 그런데 Ant는 Ling-3.1-flash의 가격을 전혀 공개하지 않았다. API 요금표도, 캐시 할인도, 이전 세대가 제시하는 백만 토큰당 $0.075/$0.22에 견줄 만한 것도 없다. 그것이 이 비교를 결정지을 빠진 숫자이며, 그것은 빠져 있다.

벤치마크, 그리고 누가 이를 실시했는가

Ling-3.1-flash는 개별적으로 보면 강해 보이는 세 가지 점수와 함께 등장한다: GDPVal-AA v2.1에서 1,673 Elo, FrontierSWE에서 75.16, HealthBench Professional에서 65.35. 세 점수 모두 Ant 자체 수치이며 발표문에서 가져온 것이고, 외부 연구소가 재현한 것은 아니다. 실질적인 결과는 이 수치들이 다른 벤더의 숫자와는 비교할 수 있지만 독립적인 숫자와는 비교할 수 없다는 것이다. 그리고 Ling-3.0-flash에 대한 Artificial Analysis의 20점 Intelligence Index는 다른 척도에 기반한 독립적인 숫자이므로, 둘을 나란히 놓는 것은 측정값과 주장을 비교하는 셈이 된다. 이 글을 쓰는 시점에 Artificial Analysis에는 Ling-3.1-flash 페이지가 없다.

Ant 자체 차트에 있는 각주 하나는 그 자체로 짚고 넘어갈 가치가 있다. 이 카드에는 HealthBench Professional 결과가 "AQ 환경"에서 평가되었으며, Ling-3.1-flash의 의료 역량은 현재 AQ에서만 경험할 수 있다고 적혀 있다. AQ가 무엇인지 설명하는 공개 문서는 없다. 이름이 밝혀지지 않은 환경 한정 조건을 달고 있는 대표 점수는, 가중치가 존재한다 해도 외부 팀이 재현할 수 있는 것이 아니다.

이번 주에 실제로 어떤 걸 써야 할까

세대 문제에 대한 답은 오늘 무엇이 필요한지에 따라 달라지며, 거의 모든 사람에게 지금 당장의 정답은 더 새로운 모델이 아닙니다.

이번 주에 뭔가를 실행해야 한다면, Ling-3.0-flash는 둘 중 실제로 사용 가능한 형태로 존재하는 유일한 모델입니다: 직접 호스팅할 수 있는 MIT 가중치, 더 작은 풋프린트를 원한다면 FP8, 공개된 자사 API 가격, 그리고 여러분이 무엇을 얻는지 알려주는 독립적인 점수까지. 이 모델은 해당 티어에서 정말로 훌륭한 모델입니다 — 독립 평가는 이 모델을 총 파라미터 대비 지능 면에서 오픈 가중치 파레토 프런티어에 올렸고, 속도도 높게 평가했지만, 유난히 장황해서 평가 과정에서 약 2억 6천만 개의 토큰을 생성했다는 단점이 있습니다. 이는 중앙값이 약 1억에 가까운 것과 대비됩니다.

다음 6개월을 계획하고 있다면, Ling-3.1-flash는 나아갈 방향이며 아직 구성 요소는 아닙니다. 그것이 구성 요소가 되기 전에 지켜볼 구체적인 사항은 다음과 같습니다: 가중치가 실제로 공개되는지와 어떤 라이선스로 공개되는지, 제공되는 윈도우가 정말 1M인지 아니면 더 짧은 네이티브 컨텍스트의 확장인지, 백만 토큰당 비용은 얼마인지, 그리고 독립 연구소가 FrontierSWE에서 75.16을 재현하는지. 그중 하나라도 실현된다면 비교를 다시 실행할 이유가 될 것입니다. 아직 아무것도 실현되지 않았습니다.

Ant Group's own Ling-3.1-flash benchmark card, published 30 September 2026. Bar-chart panels cover GDPval-AA v2.1 (1,673 Elo for Ling-3.1-flash), tau-Banking, SkillsBench, Automationbench, Terminal-Bench 4.0, CyberGym, FrontierSWE (75.16), SWE Atlas Codebase QnA, Finance Agent v2, HealthBench Professional (65.35), DRACO and MultiChallenge, with GPT-5.6 Sol, Claude Opus 5, Kimi K3, GLM 5.3, GLM 5.3 Flash and DeepSeek-V4.1-Flash as the comparison set. A footnote states HealthBench Professional was evaluated in the AQ environment.

라우팅 스택에서 이것의 위치

오늘 우리 카탈로그에는 Ling 모델이 하나도 없습니다 — Ling-3.0-flash, Ling-3.0-flash-VL, Ling-3.1-flash 모두 not-found를 반환합니다 OrcaRouter 모델 API에 대해, 그래서 "당신을 통해 호출할 수 있나요"에 대한 솔직한 답은 현재로선 아니오입니다. 이런 한 주에 라우팅 레이어가 실제로 유용한 부분은 문제의 나머지 절반입니다. 바로 후보 모델을 비교 평가할 때 기준이 될 모델들이죠. Claude Opus 5, GPT-5.6 Sol, DeepSeek-V4.1-Flash는 모두 제공업체 정가에 마진 없이 라이브 라우트로 제공되며, 이들을 하나의 키 뒤에 묶어 자동 페일오버를 제공하는 라우터가 있으면 네 개의 통합을 유지보수하지 않고도 평가 하네스를 움직이는 표적에 계속 겨눌 수 있습니다. Ling-3.1-flash의 가중치가 공개되고 라이선스를 읽을 수 있게 되면, 그 결정의 형태도 마찬가지입니다. 스택을 다시 구축하는 것이 아니라 엔드포인트 하나를 추가하는 것입니다.

세대 요약은 짧다. Ling-3.0-flash는 이미 출시되었고 독립적으로 평가되었으며, 허용적 라이선스가 적용된 모델로 오늘날 자체 호스팅할 수 있다. Ling-3.1-flash는 더 크고 더 긴 컨텍스트를 가지며 실행 비용이 더 높은 약속으로, Ant가 개발자가 사용할 수 있는 어떤 형태로도 아직 내놓지 않았다. 두 번째를 첫 번째의 업그레이드로 취급하는 것이 이번 릴리스가 유도하는 실수이며, 수치들은 아직 그것을 뒷받침하지 않는다.

Generated two-lane information card. Top lane headed "Independently measured" holds "Ling-3.0-flash — AA Intelligence Index 20 (v4.3)" and "Ling-3.0-flash — 325 tokens/sec, 260M tokens generated". Bottom lane headed "Vendor-reported only" holds "Ling-3.1-flash — 1,673 Elo GDPval-AA v2.1", "Ling-3.1-flash — 75.16 FrontierSWE" and "Ling-3.1-flash — 65.35 HealthBench Professional (AQ environment, undefined)".