
Ling-3.0-flash: 앤트 그룹의 오픈 가중치 패스트 티어 MoE에 대해 현재 우리가 아는 것
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0345지능76코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Ant Group의 InclusionAI 연구소가 Ling-3.0-flash를 공식 출시했습니다. 2026년 7월 24일에 발표되었고, 8월 7일에 MIT 라이선스로 오픈소스화되었습니다. 이는 우리가 7월에 여기서 게시한 프리뷰 이후 상황이 크게 달라졌음을 보여줍니다. 이 모델은 총 124B 파라미터와 토큰당 단 5.1B 활성 파라미터만을 사용하는 네이티브 하이브리드 추론 전문가 혼합(MoE) 모델로, Ling 제품군의 빠르고 저렴한 계층으로 설계되었습니다. 모든 것을 바꾼 두 가지 숫자가 있습니다. Artificial Analysis는 이제 이 모델을 Intelligence Index에서 38점으로 평가하며(이전 고속 계층 세대인 Ling-2.6-flash보다 24점 상승), 지능 대비 총 파라미터 측면에서 오픈 가중치 파레토 최전선에 위치시킵니다. 가중치는 Hugging Face와 ModelScope에서 제공됩니다.
우리가 7월 24일에 이 모델을 처음 다루었을 때, 솔직한 요약은 이러했습니다: API 전용, 가중치 없음, 라이선스 명시 없음, 독립적인 벤치마크 없음. 이 네 가지 진술은 모두 이제 구식입니다. Ant는 8월 7일에 MIT 라이선스로 가중치를 오픈소스로 공개했으며, 이후 Artificial Analysis가 완전한 독립 평가를 발표했습니다. 이 업데이트는 원래 브리프를 그에 맞게 수정합니다 — 7월 게시물을 지배했던 '미검증' 라벨은 이제 모델 전체가 아니라 주로 Ant의 최고 속도 수치와 같은 훨씬 좁은 범위의 주장에 적용됩니다.
TL;DR.Ling-3.0-flash는 Ant Group의 고속 티어 오픈 가중치 MoE입니다: 총 124B / 활성 5.1B, MIT 라이선스, 네이티브 컨텍스트 256K(서비스 기준 262K). Artificial Analysis는 이 모델의 Intelligence Index를 38로 평가했습니다 — 이전 세대 Ling-2.6-flash보다 24포인트 높은 수치이며, 오픈 가중치 모델 중 지능과 총 파라미터를 비교한 파레토 프론티어에 해당합니다 — 측정된 출력 속도는 약 368 tokens/sec입니다. 가중치는 MIT 라이선스로 Hugging Face와 ModelScope에서 제공됩니다. 여전히 벤더 측에서만 제공되는 항목입니다: 1,100+ tokens/sec 최대 처리량 주장, 100ms 미만의 time-to-first-token 수치, 그리고 모델 카드 벤치마크 표. 퍼스트파티 API 가격은 1M 토큰당 입력 $0.075 / 출력 $0.22이며(캐시 적중 시 80% 할인), 출시 무료 티어는 8월 3일에 종료되었습니다.
주요 시사점
• 빠르고 저렴한 등급이지, 플래그십이 아닙니다.이전 세대의 1T 파라미터 플래그십은 여전히 InclusionAI의 최대 모델이며, Ling-3.0-flash는 대용량 텍스트 및 도구 호출을 목표로 하는 더 작고 빠른 형제 모델입니다.
• 이제 가중치가 MIT 라이선스로 공개되었습니다. 가중치는 8월 7일 MIT 라이선스 하에 Hugging Face(inclusionAI/Ling-3.0-flash)와 ModelScope에 공개되었습니다 — 7월의 "API 전용" 방침을 뒤집는 조치입니다.
• 드디어 독립적인 점수를 갖게 되었습니다. Artificial Analysis는 Intelligence Index가 38이라고 측정하며, 이는 Ling-2.6-flash보다 24 높은 수치입니다. 또한 지능 대비 총 파라미터 수에 있어 이 모델을 open-weights Pareto frontier에 위치시킵니다.
• 속도는 이제 부분적으로 측정되고 있습니다. AA는 약 368 tokens/sec 출력과 ~1.98초의 첫 토큰 생성 시간(time-to-first-token)을 기록하며, Ant가 내세운 1,100+ tokens/sec 최고 수치는 여전히 벤더 제공 수치에 불과합니다.
• 요금제가 확정되었으며, 무료 출시 기간이 종료되었습니다. 퍼스트파티 API는 100만 토큰당 입력 $0.075, 출력 $0.22이며 캐시 적중 시 80% 할인이 적용됩니다. 출시 무료 티어는 8월 3일에 종료되었습니다.
• 세 가지 모델로 구성된 제품군 중 하나입니다.InclusionAI는 자사 라인업을 Ling(범용 텍스트 및 도구 MoE, 이 모델), Ring(추론), Ming(멀티모달)로 나눕니다.
이 업데이트를 읽는 방법에 대한 참고: 이 글은 7월 24일 프리뷰의 개정판으로, 가중치가 공개되고 첫 독립 평가 점수가 나온 이후 작성되었습니다. 아래의 모든 사양, 벤치마크, 가격에는 출처가 표시되어 있습니다. Ant Group이 유일한 출처인 경우 — 최고 속도 주장과 모델 카드 벤치마크 표 — 우리는 그 점을 명백히 밝힙니다. Artificial Analysis가 독립적으로 측정한 경우에는 이를 인용합니다.
우리가 실제로 알고 있는 것
아키텍처는 이제 모델 카드에 완전히 문서화되어 있습니다. Ling-3.0-flash는 네이티브 하이브리드 선형 어텐션 스택 — Kimi Delta Attention(KDA)과 Gated MLA 레이어가 5:1 비율(35 KDA + 7 MLA)로 교대로 배치되고 KDA는 세밀한 대각 게이팅을 사용 — 을 1/64 희소 MoE(512개 라우팅 전문가, 토큰당 8개 활성화) 위에 사용합니다. 이것이 총 124B 파라미터로 단 5.1B 활성 파라미터만으로 동작하는 방식입니다. 컨텍스트 창은 기본 256K이며, 추론 레시피에서 262,144 토큰으로 제공되고, Ant는 아키텍처가 1M까지 확장된다고 주장합니다. 최대 출력 길이는 공개되지 않았습니다. 이 모델은 텍스트 전용이며 도구 호출을 지원합니다. 멀티모달 입력은 별도의 Ming 라인에 있습니다.
랩에서는 두 가지 가중치 형식 — BF16(약 255GB) 및 FP8(약 128GB) — 을 공개했으며, 커뮤니티 양자화 변형은 이미 모델 카드에서 링크할 수 있습니다. 랩 자체 배포 레시피는 SGLang과 vLLM을 대상으로 합니다.
가용성: MIT 라이선스 하의 오픈 가중치
8월 7일, Ant Group의 InclusionAI 팀은 Hugging Face(inclusionAI/Ling-3.0-flash)와 ModelScope에 MIT 라이선스로 가중치를 오픈소스로 공개했습니다. 이는 허용적이고 상업적으로 사용 가능한 라이선스로, Ling 2.0과 Ling 2.6이 배포된 것과 동일한 라이선스입니다. 즉, API를 통해 임대하는 대신 Ling-3.0-flash를 직접 자체 호스팅, 파인튜닝, 배포할 수 있음을 의미합니다. 이 모델은 Ant의 자체 개발자 API와 여러 타사 플랫폼을 통해서도 호출할 수 있습니다. 이 가격대의 빠른 티어 모델로서 더 흥미로운 질문은 자체 호스팅(FP8은 약 128GB에서 실행)을 할 것인지, 아니면 API를 계속 사용할 것인지입니다.

독립 점수: AA 지능 지수 38
7월 게시물 이후 가장 큰 변화는 이제 독립적인 수치가 존재한다는 점입니다. Artificial Analysis에는 Ling-3.0-flash 페이지가 있으며 Intelligence Index에서 38점으로 측정됩니다. 이는 이전 fast-tier 세대인 Ling-2.6-flash(14점)보다 24포인트 높은 수치이며, 파라미터의 일부만 활성화하면서 MiMo-V2.5 및 Qwen 3.6 27B와 동급입니다. Artificial Analysis는 또한 이 모델을 지능 대비 총 파라미터 측면에서 오픈 가중치 Pareto 프론티어에 위치시킵니다. 총 파라미터가 더 적은 오픈 가중치 모델 중 더 높은 점수를 기록한 모델은 없습니다. AA의 flash-tier 오픈 가중치 선두주자인 DeepSeek V4 Flash는 여전히 더 높은 점수(최대 추론 노력 시 Index 52)를 기록합니다.
에이전트형 및 장문맥(long-context) 결과 역시 방향성 측면에서 강세를 보인다. AA의 τ3-Bench Banking 스위트에서 Ling-3.0-flash는 27%를 기록하며, 플래시 등급 오픈 웨이트 모델 중 DeepSeek V4 Flash(39%)에 이어 2위를 차지했다. GDPval-AA v2에서는 Ling-2.6-flash의 545에서 상승한 1108의 Elo에 도달했다. Ant는 (공급업체 보고 기준) 10,000개 이상의 인터랙티브 환경에서 모델을 학습시켰으며, 더 큰 플래그십 모델에 무거운 추론을 맡기고 빠르고 저렴하며 일회용으로 사용할 수 있는 에이전트 워크플로우의 실행 노드로 내세우고 있다.
한 가지 주의할 점: Ant의 모델 카드에 있는 벤치마크 표 — SWE-Bench Pro 56.6, SWE-bench Multilingual 72.4, MathArena AIME 2026 93.2, HLE 22.7 — 는 벤더가 보고한 수치로, 아직 독립적으로 재현되지 않았습니다. 이를 연구소 자체의 주장으로 간주하고, 아래의 최고 속도 수치와 같은 범주로 취급하십시오.
속도: 측정된 후 주장됨
속도에 관한 이야기는 이제 두 가지로 갈린다. 독립적으로, Artificial Analysis는 퍼스트파티 API에서 약 368 tokens/sec의 출력 속도와 약 1.98초의 time-to-first-token을 측정했다. 이는 5.1B 활성 파라미터 MoE로서는 확실히 빠른 수준이며, 이 모델을 동급 속도 부문 최상위권에 올려놓기에 충분하다. 한편, Ant Group은 특정 GPU 구성에서 평균 출력 속도 1,100 tokens/sec 이상과 100ms 미만의 time-to-first-token을 주장하며, SGLang HiCache와 Mooncake 기반의 클러스터 수준 계층형 캐싱 레이어를 활용한다. 두 번째 수치 집합은 공급업체 단독 수치로, Ant가 통제하는 하드웨어와 배치 구성에서 측정되었으며 독립적인 재실행 결과는 공개되지 않았다. 계획 수립 시에는 AA 수치를 기준으로 삼고, 1,100+ tok/s는 자체 워크로드에서 검증해야 할 마케팅 상한선으로 간주하라.

가격은 저렴하고, 프로모션은 끝났습니다.
Artificial Analysis는 자사 API를 입력 토큰 100만 개당 $0.075, 출력 100만 개당 $0.22로 나열하며, 캐시 적중 시 $0.015(−80%)입니다. 모두 공급업체가 설정한 가격입니다. 출시 무료 티어(일일 무료 토큰 50만 개, 무료 API 액세스)는 8월 3일에 종료되었으며, Ant는 Ling Studio에서 2026년 8월 31일까지 한시적으로 75% 할인을 진행했습니다. 이후에는 정가가 적용됩니다. 정가에서도 $0.075/$0.22는 Index 38의 모델에 대해 Ling-3.0-flash를 확실히 저가 티어에 위치시킵니다.
가격이 이렇게 낮다면 토큰당 가격보다 전환 비용이 더 중요합니다. OrcaRouter는 그러한 전환을 저렴하게 만들기 위해 존재합니다: 200개 이상의 모델을 위한 단일 API, 0% 마크업으로 전달되는 공급업체 공시 가격, 그리고 공급업체 간 자동 장애 조치 — 그래서 이렇게 새로 공개된 모델이 서류상으로는 좋아 보일 때, 추가 계약 없이 실제 워크로드에서 테스트해 볼 수 있고, 특정 작업에서 기대에 미치지 못하면 동일한 키 뒤에서 다른 모델로 대체할 수 있습니다.
링 / 링 / 밍 가문
Ling-3.0-flash는 단독으로 존재하지 않습니다. InclusionAI는 자사 출시작을 각각 다른 작업을 겨냥한 세 가지 명명된 제품군으로 구성합니다. Ling은 일상적인 텍스트 생성과 도구 호출을 위한 범용 MoE 라인이며, Ling-3.0-flash는 이전 세대의 1T 파라미터 플래그십보다 한 단계 아래인 빠르고 저렴한 끝에 위치합니다. Ring은 다단계 추론(chain-of-thought)을 위해 구축된 추론 중심 라인입니다. Ming은 멀티모달 라인입니다. 작업에 더 무거운 추론이나 이미지 입력이 필요하다면, 적합한 InclusionAI 모델은 아마 Ling-3.0-flash가 아닐 것입니다. Ling-3.0-flash는 텍스트 및 도구 영역에서의 대량 처리와 속도를 위해 설계되었습니다.
대상: 세 가지 시나리오
1. 대용량, 지연 시간에 민감한 텍스트 또는 도구 호출 파이프라인
이 모델의 텃밭이다. 독립적인 Index 38, MIT 라이선스, 그리고 측정된 약 368 tok/s를 바탕으로, 고속 티어에 대한 판단은 이제 가설이 아닌 시험 가능한 수준이 되었다. 자체 평가 세트를 실행해 보거나, 가중치를 내려받아 자체 호스팅할 수 있다. 다만, 벤더가 내세우는 1,100+ tok/s 상한선을 자체 워크로드에서 직접 측정하기 전까지는 그 수치를 기준으로 시스템을 구축하지 말 것.
2. 예산이 제한적이지만 긴 컨텍스트가 필요한 팀
256K 네이티브 컨텍스트(제공 기준 262K)와 1M까지의 명시적 확장 경로, $0.075/$0.22의 가격은 리트리벌 중심 또는 문서 처리 작업에 매력적인 조합입니다. 모델 카드의 장문 컨텍스트 수치는 공급업체가 보고한 것이므로, 기존의 장문 컨텍스트 옵션들과 함께 후보로 검토하고 도입 전에 자체 말뭉치로 검증하세요.
3. 중국의 MoE 환경과 InclusionAI 로드맵을 추적하는 관찰자들
7월의 질문 — InclusionAI가 오픈소스로 남을 것인가? — 이제 답이 나왔다: 그렇다, MIT, 그리고 신속하게. 5.1B 활성 파라미터로 AA 파레토 프론티어에 안착한 Ling-3.0-flash는 중국 연구소들이 단순 파라미터 수가 아닌 효율성으로 경쟁하는 방식을 추적하는 모든 이에게 하나의 데이터 포인트다.
아직 검증되지 않은 것은 무엇인가?
큰 격차들이 해소된 지금, 간단한 목록을 제시한다. 벤더의 최대 속도 주장(1,100+ tok/s, sub-100ms TTFT)은 독립적인 재측정이 없다. 모델 카드 벤치마크 표는 벤더가 보고한 것이다. FP4/INT4 변형과 단일 DGX-Spark 배포 경로는 벤더가 명시한 사항이다. 지식 측면에서, AA의 Omniscience Index는 이전 세대 대비 개선이 주로 기권(abstention)을 통해 이루어졌음을 보여준다 — 환각은 감소했고(97% → 44%) 정확도는 약간만 상승했다(16% → 18%) — 따라서 헤드라인 Index 점프를 전반적인 지식 도약으로 오해하지 말아야 한다.
사용하지 말아야 할 때
{{1}}멀티모달 작업에는 Ling-3.0-flash를 건너뛰세요 — 그것이 Ming의 영역입니다.{{/1}} {{2}}빠른 실행기가 아닌 강력한 추론 플래그십이 필요하다면 그것도 건너뛰세요 — 그것이 Ring의 영역입니다.{{/2}} {{3}}자가 호스팅을 계획한다면 실제 하드웨어 비용을 예산에 반영하세요: BF16은 약 255GB, FP8은 약 128GB입니다.{{/3}} {{4}}그리고 어떤 주장이 중요하다면 직접 검증하세요 — 최고 속도와 장문 컨텍스트 수치는 독립 연구소가 재실행하기 전까지는 Ant의 것입니다.{{/4}}
자주 묻는 질문
Ling-3.0-flash는 오픈 웨이트인가요?
네. 가중치는 8월 7일 MIT 라이선스로 Hugging Face(inclusionAI/Ling-3.0-flash)와 ModelScope에 오픈소스로 공개되었습니다. 이는 허용적이고 상업적으로 사용 가능한 라이선스로, Ling 2.0과 Ling 2.6이 배포될 때와 동일한 라이선스입니다.
Ling-3.0-flash는 벤치마크에서 어떤 성능을 보여주나요?
Artificial Analysis는 Ling-2.6-flash보다 24포인트 상승한 38의 Intelligence Index를 측정했으며, 이 모델을 지능 대비 총 파라미터 수 측면에서 오픈 웨이트 파레토 프론티어에 위치시킨다. Ant의 모델 카드에 있는 벤치마크 표(예: SWE-Bench Pro 56.6)는 벤더가 보고한 수치이며, 독립적으로 재현되지 않았다.
정말 얼마나 빠르죠?
Artificial Analysis는 자사 API에서 약 368 tokens/sec의 출력 속도와 약 1.98초의 첫 토큰 도달 시간(time-to-first-token)을 측정했습니다. Ant는 특정 GPU 구성에서 1,100+ tokens/sec의 최대 처리량과 100ms 미만의 TTFT를 주장하지만, 이는 독립적인 재측정이 없는 업체 측 수치입니다.
Ling-3.0-flash의 가격은 얼마인가요?
AA는 자사 API를 입력 토큰 100만 개당 $0.075, 출력 100만 개당 $0.22로 책정했으며, 캐시 적중 시 80% 할인을 제공합니다. 출시 무료 등급은 8월 3일에 종료되었으며, Ling Studio에 대한 임시 75% 할인 기간은 2026년 8월 31일까지 진행됩니다.
컨텍스트 창의 크기는 얼마인가요?
기본적으로 256K, 262,144 토큰으로 제공되며; Ant는 아키텍처가 1M까지 확장된다고 주장합니다. 최대 출력 길이는 공개되지 않았습니다.
Ling, Ring, Ming의 차이점은 무엇인가요?
Ling은 InclusionAI의 범용 텍스트 및 도구 호출 MoE 계열이며, {{1}}Ling-3.0-flash{{/1}}는 그중 가장 빠르고 저렴한 축에 해당합니다. Ring은 추론에 특화된 계열입니다. Ming은 멀티모달 작업을 담당합니다. 이들은 하나의 모델을 등급으로 나눈 것이 아니라, 서로 다른 작업을 위한 별개의 계열입니다.
Ling-3.0-flash가 이전 1T 플래그십과 동일한가요?
아니요. Ling-3.0-flash는 더 새롭고 더 작은 fast-tier 릴리스입니다 (총 124B / 활성 5.1B). 이전 세대의 1T 파라미터 플래그십 모델이 여전히 더 큰 모델입니다.
오늘 프로덕션에서 Ling-3.0-flash를 사용해야 할까요?
이제 독립적인 평가 점수와 MIT 라이선스가 있으니 7월보다 훨씬 방어하기 쉽다. 먼저 자체 평가 세트로 검증하고, 공급업체의 속도 주장을 자체 워크로드에 맞춰 확인한 다음, API와 자체 호스팅(FP8은 약 128GB에서 실행) 중에서 결정하라. 나머지 공급업체 전용 수치는 계획을 세우기에 충분히 좁은 범위다.
결론
Ling-3.0-flash는 2주 만에 '스펙 시트와 공급업체 주장'에서 '오픈웨이트와 독립 평가'로 나아갔다. 5.1B 활성 파라미터에서 AA 인텔리전스 지수 38 — 오픈웨이트 파레토 프론티어, MIT 라이선스, $0.075/$0.22 — 은 현재 비교할 수 있는 가장 효율적인 오픈웨이트 모델 중 하나이자, 직접 실행할 수 있는 모델로 만들어 준다. 주의할 점은 이전보다 좁아졌다. 최고 속도와 모델 카드 수치는 여전히 Ant의 것이며, 독립 연구소가 재현하기 전까지는 그렇다. 이 가격에서 대량 텍스트와 도구 호출 용도라면, 실질적인 평가를 받을 만하다.

