"Ling-3.1-flash, 라이브 출시 및 2주간 무료"라는 제목과 "560B MoE가 오늘 실제로 제공하는 것"이라는 부제를 가진 에디토리얼 히어로 카드가 생성되었습니다. 네 개의 둥근 카드에는 "파라미터: 총 560B / 활성 ~25B", "컨텍스트: 262,144 토큰", "출력 한도: 32,768 토큰", "가중치: 미공개"가 표시되어 있고, 그 아래 바닥글 줄에는 "공급업체가 밝힌 사양; 체험 종료 후 가격은 미공개."라고 적혀 있습니다.
Guides & Insights

Ling-3.1-flash 출시, 2주간 무료: 560B MoE가 실제로 제공하는 것

작성자

Alistair Wren

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

Ling-3.1-flash는 앤트 그룹(Ant Group)의 inclusionAI 연구소가 2026년 9월 29일부터 30일에 걸쳐 발표한 약 5,600억 파라미터 규모의 전문가 혼합(MoE) 모델로, 이번 주에는 더 이상 보도자료 속 모델이 아니다. 이제 실제 상용 API에서 요청에 응답한다. 이 모델은 서드파티 추론 게이트웨이에서 2주간 무료 체험으로 운영되며, 앤트 자체의 Ling Studio 제품에도 등장한다. 이로써 질문은 '존재하는가'에서 '실제로 무엇을 제공하는가'로 바뀐다. 그 답은 헤드라인 숫자가 시사하는 것보다 좁다. Ling-3.1-flash는 텍스트 입력, 텍스트 출력 방식이며, 발표에서는 최종 목표로 1M을 언급했지만 실제로는 262,144토큰(256K) 컨텍스트를 제공한다. 출력은 32,768토큰으로 제한된다. 그리고 무료 기간이 끝나고 가중치가 공개될 예정인 15일째에 지불하게 될 가격은 아무도 공개하지 않았다.

발표 카드와 라이브 엔드포인트 사이의 그 간극이야말로 붙잡아 둘 만한 유용한 지점이다. 왜냐하면 이번 릴리스에 관한 대부분의 보도는 마치 모델이 오늘 그 사양을 출시하는 것처럼 사양을 읽어 내기 때문이다. 그렇지 않다. Ling-3.1-flash는 이 연구소가 석 달 사이에 내놓은 두 번째 모델로, 독립 트래커 LLM Releases가 거침없이 '가중치 미공개'로 분류하는 것으로 등장한다. 그리고 Ant가 말하는 모델의 모습과 개발자가 지금 당장 호출할 수 있는 것 사이의 차이가 바로 예산이나 파일럿이 조용히 어긋날 수 있는 지점이다.

발표 이후 오늘까지 무엇이 달라졌나요

발표 자체는 스펙 게시물이었다. 총 파라미터 약 560B, 토큰당 활성 파라미터 약 25B, 최대 100만 토큰의 문맥, 세 가지 대표 평가 수치, 그리고 약속 — "곧 모델을 오픈소스로 공개할 계획입니다." 그중 달라진 것은 없다. 달라진 것은 접근성이다. 발표 하루 만에 그 모델은 상용 엣지에서 접근할 수 있었고, 무료 체험은 유료와 동일한 실제 엔드포인트를 제공한다: 동일한 API 표면, 동일한 텍스트 전용 모달리티, 장기적 에이전트 작업을 위한 동일한 사고 모드 전환.

엔지니어링 시간을 투자할지 결정하려는 사람이라면, 이번 주에는 체험이 전부라고 해도 과언이 아니며, 이는 양면성을 지닙니다. 2주간의 무료 추론은 모델이 자신의 프롬프트에서 어떻게 작동하는지 확인할 수 있는 정말 저렴한 방법입니다 — 이 정도 규모의 모델에서는 드문 일이죠. 하지만 무료는 프로모션 상태일 뿐 가격이 아닙니다. 아직 어디에도 Ling-3.1-flash의 체험 이후 공개된 요금표가 없으므로, 무료 티어를 기준으로 세우는 모든 비용 모델은 Ant와 그 호스팅 업체들이 숫자를 매기기 전까지는 임시값일 뿐입니다.

사양서, 그리고 여전히 약속에 불과한 세 개의 숫자

• 매개변수 — 총 560B, 토큰당 활성 약 25B. 벤더 발표 기준이며, 이전 세대의 총 124B / 활성 5.1B의 약 4배다. 희소성 비율은 약 1/22 근처를 유지하므로, 활성화가 극적으로 더 가벼워진 것은 아니다 — 모델은 단지 자신이 계승한 모델보다 훨씬 클 뿐이다.

• 컨텍스트 — 현재 262,144 토큰으로 제공됩니다. "Up to 1M"은 윈도우가 활성화되면 달성할 목표치이며, 트라이얼 엔드포인트가 제공하는 값이 아닙니다. 그리고 이번 릴리스에서 가장 흔하게 나타나는 오독입니다.

• 출력 — 최대 32,768 토큰. 에이전트 루프에는 적당하지만, 긴 문서를 한 번에 생성하려는 경우에는 빠듯합니다.

• 모달리티 — 텍스트 입력, 텍스트 출력. 이것은 텍스트 모델입니다. 비전, 오디오, 파일 입력은 이번 출시에 포함되지 않으며, 이들에 대한 일정은 아직 공개되지 않았습니다.

• 추론 — 명시적인 사고 모드 전환을 갖춘 하이브리드 스택으로, 이전 세대가 사용한 것과 동일한 패턴이며, 단일 턴 채팅보다는 다단계 에이전트 및 도구 호출 작업을 겨냥합니다.

• 가중치와 라이선스 — 미공개. 이것은 가장 중요한 수치이면서도 아직 아무런 값도 없는 항목입니다: 현재까지 Hugging Face 리포지토리도, 라이선스 문서도, 다운로드 가능한 체크포인트도 존재하지 않습니다.

Ant Group's own Ling-3.1-flash benchmark chart, published 30 September 2026. Twelve bar-chart panels cover GDPval-AA v2.1 (1,673 for Ling-3.1-flash), tau-squared Banking (47.60), SkillsBench (69.70), Automationbench public (52.50), Terminal-Bench 4.0 (40.40), CyberGym (87.90), FrontierSWE (75.16), SWE Atlas Codebase QnA (55.92), Finance Agent v2 (57.87), HealthBench Professional (65.35), DRACO (85.49) and MultiChallenge (69.78), with GPT-5.6 Sol, Claude Opus 5, Kimi K3, GLM 5.3, GLM 5.3 flash and DeepSeek-V4.1-Flash as the comparison set. A footnote states HealthBench Professional was evaluated in the AQ environment and that Ling-3.1-flash's healthcare capabilities can currently be experienced only in AQ.

벤치마크 카드, 필요한 할인을 적용해 읽기

Ant의 자체 보고에 따르면 Ling-3.1-flash는 다섯 개 에이전트 벤치마크에서 종합 81.0을 기록했으며, Terminal-Bench 4.0에서 40.4%, SWE-Atlas에서 55.9%, HealthBench Professional에서 65.35%를 나타냈다. 회사의 자체 설명은 GDPVal-AA v2.1에서 1,673 Elo, FrontierSWE에서 75.16을 추가한다. 그 수치 하나하나가 모두 자사 데이터다. 다른 누구도 이 스위트를 다시 실행할 수 있는 하네스도, 프롬프트 세트도, 가중치도 없다. 이는 이 단계의 모델에 대한 표준적인 유의사항이며, 여기서 분명히 말할 가치가 있다: 재현되지 않은 벤더 점수는 모델에 관한 주장이지, 모델을 측정한 값이 아니다.

이 카드는 작성자들이 의도하지 않았을 방식으로도 유익하다. 40.4%의 Terminal-Bench 4.0 결과는 최전선 등급에 한참 뒤처진다. 플래그십이 아닌 중간급 모델인 Claude Sonnet 5.5는 같은 버전의 해당 벤치마크에서 70.6%를 기록한다. 솔직한 해석은 Ling-3.1-flash가 약하다는 것이 아니다 — 40.4%는 비용을 앞세운 모델로서는 존중할 만한 에이전트형 터미널 수치다 — 오히려 발표 당일 소셜 미디어에 퍼진 "주요 벤치마크에서 최전선에 근접했다"는 프레이밍이 구체적인 행(row)들과 맞닥뜨리면 버티지 못한다는 것이다. 모델이 가장 강해 보이는 벤치마크인 HealthBench Professional의 65.35 역시 어색한 각주를 달고 있다: Ant는 이 모델이 AQ라고 부르는 환경에서 평가되었다고 밝히며, 모델의 의료 역량은 "현재 AQ에서만 경험할 수 있다"고 하지만, AQ가 무엇인지 공개된 어디에서도 정의하지 않는다. 이름 없는 환경이 붙은 헤드라인 점수는 재현 가능한 결과가 아니라 데모다.

대형 모델이 시험판으로 등장하는 것이 진짜 뉴스인 이유

여기서 더 흥미로운 움직임은 파라미터가 아니라 순서다. Ling-3.0-flash는 곧바로 오픈 웨이트로 갔다. 이번 모델은 체험판 우선으로 출시되며, 가중치와 라이선스, 공식 가격을 모두 미루고 무료 기간이 끝난 뒤에만 오픈소스로 공개하겠다는 공개 약속을 내걸고 있다. 그것은 오픈 모델 발표를 가장한 상업적 출시 플레이북이며, 주목할 만한 진짜 변화다. 가중치가 허용적 라이선스로 나오면 커뮤니티는 파인튜닝하고 증류할 560B 베이스 모델을 얻게 된다. 상업적 조건이 붙어 나오면 2주 체험판이 곧 제품이었고 "오픈 소스"라는 문구는 마케팅이었던 셈이다. 어느 쪽이든, 그 선택은 체험 기간 안에 이루어지며, 이는 어떤 단일 벤치마크 행보다도 지켜봐야 할 지점이다.

실행되는 위치, 그리고 솔직한 라우팅 현황

현재로서는 Ling-3.1-flash에 접근할 수 있는 경로가 벤더 자체 제품 인터페이스와 트라이얼을 운영 중인 서드파티 추론 플랫폼뿐이며, 그게 전부입니다. 오늘날 OrcaRouter의 카탈로그에는 없습니다. Ling-3.1-flash, Ling-3.0-flash, Ling-3.0 비전 변형에 대해 우리의 공개 모델 API로 조회하면 모두 not-found를 반환하며, 우리는 그렇지 않은 척하지 않겠습니다. Ant 엔드포인트가 공개 정가와 함께 정식 출시(GA)되면, OrcaRouter가 운영하는 패스스루 모델 — 공급자 정가를 마크업 없이 그대로 전달하여 벤더의 가격 인하가 같은 날 우리 쪽에도 적용되는 — 은 가격이 아직 정해지지 않은 모델에 꼭 맞는 방식입니다.

라이선스 결정을 기다리지 않고 오늘 당장 할 수 있는 일은, 검증되지 않은 모델에 정말로 중요한 비교를 수행하는 것입니다. 지금 바로 호출할 수 있는 Flash 등급 모델들과 견줘 성능을 측정하는 것이죠. Gemini 3.8 Flash와 DeepSeek-V4.1-Flash는 모두 각 제공사의 정가로 우리 카탈로그에 올라와 있고, 하나의 API 키 뒤에서둘 사이의 자동 페일오버까지 지원합니다. 가중치와 요금표가 모두 알려지지 않은 무료 체험 중인 모델이라면, 이것이 합리적인 운용 방식입니다. 체험이 지속되는 동안 라우팅할 수 있는 후보가 하나 더 늘어나고, 15일째에 무슨 일이 일어나든 거기에 좌우되지 않는 프로덕션 경로가 생기는 셈이니까요.

Headless capture of Ant's Ling Studio interface with Ling-3.1-flash selected in the model picker. The centre panel shows the model-experience card headed "Ling-3.1-flash Model Experience", describing the model as strong at general-purpose agents, search, routine office work and software/code development, above three starter tasks (Hot Spot Scout, Interaction Design Master, Product Assistant). The Model Settings panel on the right shows Max Length 262144, temperature 0.6, top_k 20, top_p 0.95 and Thinking enabled.

이번 주에 무엇을 할까요

모델이 당신의 업무와 관련이 있다면, 오픈 웨이트 문제가 해결되기를 기다리기보다 지금 행동해야 하는 이유는 바로 이 트라이얼입니다 — 560B MoE에서 2주간 무료로 추론해 볼 수 있는 기회는 당신이 얻을 수 있는 가장 저렴한 평가이며, "내 프롬프트에서도 성능이 유지되는가"에 대한 답은 오늘 확인할 수 있습니다. "내가 직접 호스팅할 수 있는가"에 대한 답은 아직 아니더라도 말입니다. 창이 열려 있는 동안 확인해야 할 세 가지를 순서대로 짚어 보겠습니다:

• 벤치마크 카드가 아닌, 자신의 워크로드를 실행하세요. 공개된 수치는 Ant가 선택한 작업들일 뿐이며, 여러분의 스택을 결정하는 것은 여러분의 프롬프트입니다.

• 실제로 사용할 컨텍스트를 테스트하세요. 이 엔드포인트가 제공하는 것은 1M가 아니라 262,144 토큰입니다. 더 큰 윈도에 의존하는 설계라면, 그것은 약속에 기대를 걸고 설계하는 것입니다.

• "무료"를 전제로 비용 모델을 세우지 마십시오. 무료는 2주짜리 상태입니다. 요금표가 공개될 때까지는 유료 Flash 티어 모델로 다시 전환하는 것을 기본값으로 계획하고, Ling-3.1-flash는 추가 용량으로 취급하십시오.

발표는 사실이고 모델은 돌아가고 있다. 이는 일주일 전에는 할 수 없었던 말이다. 하지만 공개·오픈된 상태와 시험 운영 중인 상태는 서로 다르며, 이번 건은 확실히 후자다 — 560B 사양, 256K 엔드포인트, 벤더만 제공한 벤치마크 카드, 그리고 이번 릴리스 전체에서 유일하게 확실한 마감인 2주 시한.

Generated editorial card titled "Ling-3.1-flash on trial - what to verify this week" listing six rounded rows: "Your workload: run it, not the card"; "Context: 262,144 served, not 1M"; "Cost model: free is a two-week state"; "Weights: none published, promise only"; "Fallback: keep a priced Flash-tier route"; "Deadline: the trial window is the only firm date", above a footer reading "Vendor-stated specs; no published post-trial rate card."

이 글에서 비교한 모델1

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트