
Ling-3.0-flash: 앤트 그룹의 새로운 Fast-Tier MoE에 대해 우리가 실제로 알고 있는 것 (그리고 모르는 것)
- qwenNEWQwen: Qwen3.8 Max2026-08-03$2.00 / $6.00 100만 토큰당 · 56 tok/s
- deepseekNEWDeepSeek: DeepSeek V4 Flash 07312026-07-3150지능69코딩
- qwenNEWQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당 · 199 tok/s
- orcaNEWOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicNEWAnthropic: Claude Opus 52026-07-2461지능78코딩
- googleGoogle: Gemini 3.6 Flash2026-07-2150지능69코딩
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137지능49코딩
- metaMeta: Muse Spark 1.12026-07-1651지능71코딩
- kimiMoonshotAI: Kimi K32026-07-1557지능76코딩
- openaiOpenAI: GPT-5.6 Luna2026-07-0951지능71코딩
- openaiOpenAI: GPT-5.6 Terra2026-07-0955지능77코딩
- openaiOpenAI: GPT-5.6 Sol2026-07-0959지능77코딩
- grokxAI: Grok 4.52026-07-0854지능72코딩
- tencentTencent: Hy32026-07-0641지능59코딩
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232지능42코딩
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226지능39코딩
- anthropicAnthropic: Claude Sonnet 52026-06-3053지능72코딩
- klingKling: Kling 3.0 Turbo2026-06-1757지능52코딩57수학
- z-aiZ.ai: GLM 5.22026-06-1651지능69코딩60수학
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242지능61코딩61수학
Ant Group의 InclusionAI 연구소는 2026년 7월 23일경에 Ling-3.0-flash를 출시했습니다. 즉, 이 요약 기준으로 출시된 지 며칠밖에 되지 않은 모델입니다. 이 모델은 총 124B 파라미터, 토큰당 약 5.1B 활성 파라미터(약 24:1 희소 비율)를 가진 혼합 전문가(MoE) 언어 모델로, 텍스트 생성 및 도구 호출을 위해 설계되었습니다. Ling 제품군 중 빠르고 저렴한 계층으로 포지셔닝되었으며, 주력 모델은 여전히 훨씬 더 큰 Ling-2.6-1T(총 1T / 활성 63B)가 차지하고 있습니다. 현재 접근은 API 전용으로, Ant의 자체 개발자 포털, OpenRouter(모델명: inclusionai/ling-3.0-flash), ZenMux를 통해 제공됩니다.
이것이 전체 확정된 상황이며, 이 브리프가 일반적인 모델 리뷰보다 더 신중하게 읽히는 이유를 솔직히 밝힐 가치가 있습니다. Hugging Face 가중치도, Ling-V3의 GitHub 저장소도 없고, 명확한 라이선스 명시도 없습니다. 이는 둘 다 MIT 하에 오픈 가중치로 출시된 Ling 2.0 및 Ling 2.6과는 확실히 달라진 점입니다. 또한 어떤 종류의 독립적인 벤치마크 데이터도 없습니다. 이 부류의 모델에서 가장 흔히 인용되는 제3자 평가 기관인 Artificial Analysis에는 아직 이 모델에 대한 페이지가 없습니다. 현재 유통되는 모든 성능 및 속도 수치는 Ant Group 자체로부터 비롯됩니다.
요약하면.Ling-3.0-flash는 Ant Group의 InclusionAI에서 최근 며칠 사이에 출시된 124B/5.1B-active MoE 모델로, API 전용이며 Hugging Face 가중치가 없고 라이선스가 확인되지 않았습니다. 공급업체는 최대 처리량 1000토큰/초, 최초 토큰까지 100ms 미만의 지연 시간을 주장하지만 아직 독립적인 검증이 이루어지지 않았으며, 이 특정 모델에 대한 Artificial Analysis 점수도 없습니다. 이전 세대인 Ling-2.6-flash는 Artificial Analysis Intelligence Index에서 14점에 불과했으며(Ling-2.6-1T는 26점), 이는 유용한 맥락이지만 3.0-flash의 실제 성능을 대체할 수는 없습니다. 가격(입력 100만 토큰당 ¥0.40, 출력 100만 토큰당 ¥1.20, 현재 출시 주간 동안 무료이며 하루 50만 토큰 무료 제공)은 명백히 프로모션 가격이며 변경될 가능성이 있습니다. 여기의 모든 내용은 예비 정보로 간주하시기 바랍니다. 최종 판단이 아닙니다.
주요 시사점
• 빠르고 저렴한 계층이며, 플래그십이 아닙니다.Ling-2.6-1T는 여전히 InclusionAI의 가장 큰 모델입니다; Ling-3.0-flash는 대량 사용을 위해 설계된 더 작고 저렴하며 빠른 형제 모델입니다.
• 아직 독립적인 벤치마크가 존재하지 않습니다. Artificial Analysis에는 Ling-3.0-flash에 대한 페이지가 없습니다. 공개된 수치는 Ant Group 자체의 것뿐이며, Ant의 문서에는 현재 이 모델에 대한 벤치마크 표가 전혀 없습니다.
• 속도 주장은 공급업체 전용입니다. 1000 tokens/sec 피크 및 100ms 미만의 첫 토큰 시간은 Ant Group에서 제공한 것이며, 어느 수치도 확인할 제3자 처리량 테스트는 없습니다.
• 오픈 웨이트 없음, 라이선스 미확인. 허깅 페이스 저장소가 없고 GitHub Ling-V3 프로젝트도 없습니다. 이전 Ling 세대는 MIT 라이선스였습니다; 3.0-flash도 그럴지는 알 수 없습니다.
• 가격은 출시 기간 한정 프로모션입니다. Ant 플랫폼에서의 1M 토큰당 ¥0.40/¥1.20은 현재 면제되며, 하루 500k 무료 토큰과 무료 OpenRouter 리스팅이 제공됩니다 — 프로모션이 종료되면 이러한 혜택이 유지된다고 가정해서는 안 됩니다.
• 이는 세 가지 모델로 구성된 제품군의 한 부분입니다. InclusionAI는 제품 라인업을 Ling(범용 MoE, 이 모델), Ring(추론 중심), Ming(멀티모달)로 나눕니다.
이 문서를 읽는 방법에 대한 참고사항: 아래의 모든 사양, 벤치마크, 가격은 출처별로 표시되어 있습니다. Ant Group이 유일한 출처인 경우에는 이를 명확히 밝히고 그에 따라 유보적인 입장을 취합니다. 이전 세대 Ling 모델에 독립적인 점수가 있는 경우, 이를 맥락을 위해 인용하지만 — 아직 존재하지 않는 Ling-3.0-flash 자체에 대한 데이터를 대체하는 것은 아닙니다. 추후 독립적인 테스트가 이루어지면 후속 조치가 필요할 것입니다.
우리가 실제로 알고 있는 것
아키텍처적으로, Ling-3.0-flash는 희소 MoE 모델입니다: 총 124B 파라미터를 가지며, 주어진 토큰에서 약 5.1B가 활성화되어, 전체 크기에 비해 저렴하고 빠르게 실행할 수 있습니다. 컨텍스트 윈도우는 Ant의 자체 문서에 따르면 256K 토큰이며, 공급업체는 1M까지 확장 가능하다고 주장합니다. OpenRouter의 목록에는 262,144 토큰으로 표시되어 256K 수치와 일치합니다. 최대 출력 길이는 우리가 찾을 수 있는 어디에도 공개되지 않았습니다. 이 모델은 표준 텍스트 생성과 도구 호출을 지원하지만, 멀티모달 입력 또는 출력은 언급되지 않았습니다. 그 기능은 별도의 Ming 라인에 있습니다.
가용성 측면에서, 해당 이미지는 API 전용이며 우리가 찾은 세 가지 경로(Ant Group의 자체 개발자 플랫폼, OpenRouter(inclusionai/ling-3.0-flash로 등록됨), ZenMux)에서 일관됩니다. 이 중 어느 곳에서도 다운로드 가능한 가중치를 제공하지 않습니다. "Ling-V3" 프로젝트에 대한 GitHub 조직 페이지도 없으며, Ant의 문서에는 이 특정 모델에 대한 라이선스가 명시되어 있지 않습니다. 이는 의미 있는 격차입니다. Ling 2.0과 Ling 2.6은 모두 MIT 라이선스로 오픈 가중치로 출시되었기 때문입니다. InclusionAI가 이를 명확히 할 때까지, Ling-3.0-flash가 결국 오픈될 것이라고 가정하지 말고, 그렇지 않을 것이라고도 가정하지 마십시오.

격차: 검증되지 않은 것
가장 큰 차이는 벤치마크입니다. 현재 시점에서, 바로 이 모델 클래스에 대해 가장 흔히 인용되는 독립 평가 기관인 Artificial Analysis에는 Ling-3.0-flash 페이지가 없습니다. 일반적으로 호스팅되는 URL 패턴은 404를 반환합니다. 즉, 현재 이 모델에 대한 타사 추론, 코딩 또는 수학 점수가 Artificial Analysis나 우리가 찾을 수 있는 다른 독립 평가 기관으로부터 존재하지 않는다는 뜻입니다. Ant의 자체 문서는 이 문제를 더 악화시킵니다. 3.0-flash에 대한 벤치마크 표를 전혀 게시하지 않습니다. 벤더든 아니든 간에, 이는 모델 출시에 있어 이례적이며 그 자체로 주목할 가치가 있습니다.
대략적인 맥락을 설명하자면, 이전 세대의 Ling 모델에는 독립적인 점수가 있었습니다. Ling-2.6-flash는 Artificial Analysis Intelligence Index에서 14점을 기록했고, 더 큰 Ling-2.6-1T는 26점을 받았습니다. 두 모델 모두 당시 Artificial Analysis가 추적하던 선도적인 오픈 가중치 모델에 크게 뒤처진 수치였습니다. Ant 자체의 Ling-2.6-flash 공급업체 수치에 따르면 SWE-bench Verified에서 61.2%, AIME2026에서 73.85%를 달성했다고 주장했습니다. 이 중 어떤 숫자도 Ling-3.0-flash에 직접 적용해서는 안 됩니다. 새로운 아키텍처의 새로운 세대는 어느 방향으로든 움직일 수 있으며, 독립적인 평가 기관이 실제로 실행하기 전까지는 3.0-flash에 대한 모든 성능 주장은 사실로 포장된 추측에 불과합니다.
벤더의 속도 주장: 서류상으로는 빠르지만 실제로는 검증되지 않음
앤트 그룹이 Ling-3.0-flash에 대해 내세우는 가장 눈에 띄는 성능은 추론 품질이 아니라 원시 속도입니다. 이 업체는 초당 최대 1000토큰의 처리량과 100밀리초 미만의 최초 토큰 도달 시간(time-to-first-token)을 주장하며, 이 수치들이 확인된다면 확실히 빠른 속도일 것입니다. 하지만 "확인된다면"이라는 단어가 이 문장에서 중요한 역할을 합니다. 이 수치는 전적으로 앤트 그룹 자체 자료에서 나온 것이며, 앤트 그룹이 통제하고 완전히 공개하지 않은 조건(하드웨어, 배치 크기, 프롬프트 길이, 부하 등은 모두 처리량 수치를 크게 변화시킵니다)에서 측정되었습니다. 독립적인 연구소가 재측정 결과를 발표한 적은 없습니다. 앤트 외부에서 이와 유사한 테스트를 실행하기 전까지는 1000tok/s와 100ms 미만의 TTFT를 자체 워크로드와 대조해 볼 가치가 있는 마케팅 수치로 간주하고, 확정된 사실로 받아들이지 마십시오.

가격 책정, 그리고 그것이 움직이는 표적인 이유
Ant Group 자체 플랫폼에서 Ling-3.0-flash의 정가 입력 토큰 100만 개당 ¥0.40, 출력 토큰 100만 개당 ¥1.20으로 책정되어 있습니다. 설계상 저렴하며, 빠르고 저렴한 티어라는 포지셔닝과 일치합니다. 하지만 현재 누구도 이 정가를 실제로 지불하지 않습니다. Ant는 출시 기념 주간 프로모션을 진행 중이며, 별도로 자체 플랫폼에서 하루 50만 개의 무료 토큰을 제공하고 있습니다. OpenRouter 목록에는 ling-3.0-flash:free 변형이 $0/$0으로 표시되어 있습니다. 이 중 어느 것도 안정적인 가격으로 오해해서는 안 됩니다. 출시 프로모션은 만료되고, 무료 티어는 제한되며, ¥0.40/¥1.20 수치 자체도 실제 사용 데이터가 들어오면 변동될 수 있습니다. 이 모델을 기준으로 프로덕션 지출을 계획 중이라면 프로모션 가격이 아닌 정가를 기준으로 예산을 책정하고, 확정 전에 다시 확인하세요.
링 / 링 / 밍 가문
Ling-3.0-flash는 단독으로 존재하지 않습니다 — InclusionAI는 릴리스를 세 가지 명명된 계열로 구성하며, 각각 다른 작업을 대상으로 합니다. Ling은 범용 MoE 라인으로, 일상적인 텍스트 생성과 도구 호출을 다룹니다. Ling-3.0-flash는 그 중 빠르고 저렴한 끝에 위치하며, Ling-2.6-1T가 여전히 더 큰 플래그십입니다. Ring은 InclusionAI의 추론 중심 라인으로, 원시 처리량보다는 다단계 사고 사슬에 의존하는 작업을 위해 구축되었습니다. Ming은 다중 모달 라인으로, Ling 자체가 다루지 않는 이미지 및 기타 비텍스트 모달을 처리합니다. 작업에 더 무거운 추론이나 다중 모달 입력이 필요하다면, 적절한 InclusionAI 모델은 아마 Ling-3.0-flash가 아닐 것입니다 — 이 모델은 텍스트 및 도구 영역 내에서 볼륨과 속도를 위해 구축되었으며, 다른 두 계열의 영역으로 확장되지 않습니다.
대상: 세 가지 시나리오
1. 대용량, 지연 시간에 민감한 텍스트 또는 도구 호출 파이프라인 — 파일럿으로서, 약속이 아닙니다
워크로드가 처리량에 민감한 텍스트 생성이나 도구 호출(채팅, 경량 에이전트, 고빈도 API 호출)에 의해 주도된다면, Ling-3.0-flash의 포지셔닝(적은 활성 파라미터 수, 주장된 100ms 미만의 TTFT, 거의 무료에 가까운 출시 가격)은 파일럿을 수행할 가치가 있습니다. 문제는 "파일럿을 수행할 가치"와 "프로덕션 트래픽을 전환할 가치"는 다르다는 점입니다. 독립적인 벤치마크 데이터가 전혀 없는 상황에서, 현재 여러분이 벤치마크입니다: 고객 대면 작업에 신뢰하기 전에 자체 평가 세트를 실행해 보시고, 현재 프로모션 가격을 기준으로 비용 모델을 구축하지 마십시오.
2. 예산이 제한된 상태에서 긴 컨텍스트가 필요한 팀
256K 컨텍스트 윈도우(공급업체가 1M까지 확장 가능하다고 주장)가 진정으로 낮은 정가에 제공되는 것은 검색 중심 또는 문서 처리 사용 사례에 매력적인 조합입니다. 단, 해당 컨텍스트 길이에서 모델의 실제 추론 품질이 유지되어야 한다는 전제가 필요하며, 이는 다시 말해 독립적인 출처에서 테스트된 바가 없습니다. 이는 기존의 저렴한 긴 컨텍스트 옵션들과 함께 후보 목록에 포함할 합리적인 선택이지만, Ant의 사양서만 믿고 채택하기보다는 이들과 나란히 평가되어야 합니다.
3. 중국 MoE 환경과 InclusionAI 로드맵을 추적하는 관찰자들
프로덕션에서 단일 모델을 배포하기보다는 중국의 오픈 및 세미 오픈 모델 연구소의 경쟁 구도를 추적하는 팀에게 Ling-3.0-flash는 유용한 데이터 포인트입니다. 이는 InclusionAI가 빠른 계층에서 빠르게 반복하고, 잠재적으로 오픈 웨이트에서 물러나며(적어도 현재로는), 하나의 일반 모델보다는 세 가지 제품군 구조(Ling/Ring/Ming)에 계속 베팅하고 있음을 시사합니다. 벤치마크와 라이선스 명확성이 확보되면 북마크하고 다시 확인할 가치가 있습니다.
사용하지 말아야 할 때
검증된 기능 주장을 인용해야 하는 모든 작업에는 Ling-3.0-flash를 건너뛰세요 — 참고할 독립적인 벤치마크가 없으므로, 현재로서는 해당 모델의 추론, 코딩, 수학 능력에 대한 모든 주장을 확인할 수 없습니다. 자체 호스팅, 파인튜닝 또는 규정 준수 이유로 오픈 가중치가 필요한 경우에도 건너뛰세요 — 사용 가능한 가중치가 없으며, 이 특정 모델의 라이선스는 명시조차 되지 않았고, 허용적인 라이선스로 확인된 것도 아닙니다. 멀티모달 작업의 경우에도 건너뛰세요 — 그 작업은 Ming 라인의 역할이지 Ling의 역할이 아닙니다. 그리고 현재 가격을 기준으로 비용 모델을 구축할 때는 주의하세요: 무료 출시 주간, 50만 개의 무료 일일 토큰, 무료 OpenRouter 티어는 모두 프로모션용이며, 되돌아갈 가능성이 있는 ¥0.40/¥1.20 정가는 실제 사용 패턴에 대해 아직 테스트되지 않았습니다.
자주 묻는 질문
Ling-3.0-flash는 오픈 웨이트인가요?
현재는 아닙니다. 이 글을 작성하는 시점에 Hugging Face 저장소도 없고 GitHub Ling-V3 프로젝트도 없습니다. 이전 Ling 세대(2.0 및 2.6)는 MIT 라이선스 하에 오픈 가중치로 공개되었지만, Ling-3.0-flash가 그 방식을 따를 것이라는 확인은 없습니다. — 그렇지 않을 것이라는 확인도 없습니다.
Ling-3.0-flash는 벤치마크에서 어떤 성능을 보여주나요?
아직 이에 대한 독립적인 벤치마크는 없습니다 — Artificial Analysis에는 이 모델에 대한 페이지가 없습니다. Ant Group의 자체 문서에도 이에 대한 벤치마크 표가 게시되어 있지 않습니다. 대략적인 역사적 맥락을 위해, 이전 세대의 Ling-2.6-flash는 Artificial Analysis Intelligence Index에서 14점을 기록했고, Ling-2.6-1T는 26점을 기록했지만, 두 점수 모두 이 새로운 세대에 그대로 적용된다고 가정해서는 안 됩니다.
정말 얼마나 빠르죠?
Ant Group는 1000 tokens/sec의 최대 처리량과 100ms 미만의 초기 토큰 도달 시간을 주장합니다. 두 수치 모두 공급업체만의 데이터로, 현재까지 독립적인 재측정 결과가 발표되지 않았습니다. 이를 자체 워크로드에서 확인해야 하는 주장으로 간주하고, 확정된 성능으로 보지 마십시오.
Ling-3.0-flash의 가격은 얼마인가요?
Ant 플랫폼의 리스트 가격은 입력 토큰 100만 개당 ¥0.40, 출력 토큰 100만 개당 ¥1.20이지만, 현재 출시 주간 프로모션 기간 동안 무료이며, 하루 50만 개의 무료 토큰도 제공됩니다. OpenRouter에서도 무료 변형을 제공합니다. 이 프로모션 조건은 변경될 수 있습니다.
컨텍스트 창의 크기는 얼마인가요?
Ant의 문서에 따르면 256K 토큰이며, 공급업체는 100만 토큰까지 확장 가능하다고 주장합니다. OpenRouter의 목록에는 262,144개의 토큰이 표시되어 256K 수치와 일치합니다. 최대 출력 길이는 공개되지 않았습니다.
Ling, Ring, Ming의 차이점은 무엇인가요?
Ling은 InclusionAI의 범용 텍스트 및 도구 호출 MoE 계열이며, Ling-3.0-flash는 그중 빠르고 저렴한 측면에 해당합니다. Ring은 추론 중심 계열이고, Ming은 멀티모달 작업을 처리합니다. 이들은 서로 다른 작업을 위해 구축된 별개의 모델 패밀리이지, 같은 모델의 등급이 아닙니다.
Ling-3.0-flash와 Ling-2.6-1T는 같은 것인가요?
No. Ling-2.6-1T는 InclusionAI의 더 큰 플래그십 모델(총 1T / 활성 파라미터 63B)로, 별도의 대형 모델로 유지됩니다. Ling-3.0-flash(총 124B / 활성 약 5.1B)는 더 새롭고 작고 빠른 계층의 릴리스입니다.
오늘 프로덕션에서 Ling-3.0-flash를 사용해야 할까요?
자체 평가를 수행한 후에만 가능합니다. 독립적인 벤치마크가 없고, 확인되지 않은 라이선스, 현재 프로모션 중인 가격 책정을 고려할 때, 시범 운영은 합리적이지만, 프로모션 조건이 종료될 경우를 대비한 자체 테스트와 계획 없이 프로덕션에 중요하거나 규정 준수가 필요한 워크로드를 여기에 맡기기에는 시기상조입니다.
결론
Ling-3.0-flash는 정말로 주목할 만한 신규 릴리스입니다. 빠르고 저렴하며 대량의 텍스트 및 도구 호출 작업을 겨냥한 124B/5.1B-active MoE 모델로, 이전에 신뢰할 만한 모델을 출시한 연구소에서 나왔습니다. 하지만 지금은 사양표와 공급업체의 주장일 뿐, 검증된 제품은 아닙니다. 독립적인 벤치마크, 공개 가중치, 확정된 라이선스가 없으며 가격도 명시적으로 프로모션용입니다. 그렇다고 무시할 이유는 아닙니다. 조심스럽게 파일럿 테스트를 진행하고, 자신에게 중요한 주장을 직접 검증한 후, Artificial Analysis나 다른 독립 평가 기관이 실제 수치를 발표하면 이 요약을 다시 살펴보는 것이 좋습니다.

