
Ling-3.0-flash-base: Ant Group의 조용한 체크포인트 릴리스, 이제 공식
- z-aiNEWZ.ai: GLM 5.32026-08-1860지능75코딩
- obsidianNEWQwen3.8 27B Uncensored (Aggressive)2026-08-1552지능68코딩
- qwenNEWQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNEWDeepSeek: DeepSeek V4 Pro 08132026-08-1253지능69코딩
- grokNEWSpaceXAI: Grok 4.62026-08-1261지능77코딩
- metaNEWMeta: Muse Spark 1.22026-08-0557지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0358지능72코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463지능78코딩
- googleGoogle: Gemini 3.6 Flash2026-07-2152지능69코딩
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137지능49코딩
- metaMeta: Muse Spark 1.12026-07-1653지능71코딩
- kimiMoonshotAI: Kimi K32026-07-1560지능76코딩
- openaiOpenAI: GPT-5.6 Luna2026-07-0952지능71코딩
- openaiOpenAI: GPT-5.6 Terra2026-07-0957지능77코딩
- openaiOpenAI: GPT-5.6 Sol2026-07-0961지능77코딩
- grokxAI: Grok 4.52026-07-0856지능72코딩
Ant Group's inclusionAI lab pushed Ling-3.0-flash-base and five sibling checkpoints to Hugging Face on 11 August 2026 with no announcement attached, and for a full week all six repositories sat at zero downloads — nobody outside the lab appeared to have noticed. Then, on 19 August, the lab's official account publicly introduced the collection, and every model card in it was updated within minutes. This is a what-we-know-so-far piece about that release. The short version up front: Ling-3.0-flash-base is not a chat model, and it is not meant to be one. It is the raw, pre-alignment base checkpoint of Ling-3.0-flash, the 124B-parameter Mixture-of-Experts model with 5.1B active parameters, released under MIT for people who want to keep training it rather than call it.
타임라인: 일주일간의 침묵, 그리고 발표
순서는 중요합니다. 그 순서가 이 글의 나머지 모든 것을 어떻게 읽어야 하는지 알려주기 때문입니다. 여섯 개의 저장소는 모두 8월 11일에 생성되었고, 해당 모델의 가중치는Ling-3.0-flash-base — 병합된 체크포인트, 이 글의 제목이기도 한 — 8월 12일에 "initial model release" 커밋과 함께 도착했습니다. 블로그 게시물도, 소셜 스레드도, 어떤 발표도 없었습니다. 조사 시점(일주일 후)에는 여섯 개의 저장소 모두 여전히 다운로드 수가 0이었습니다.
그 침묵은 8월 19일에 끝났다. 공식 Ant Ling 계정은 체크포인트 컬렉션을 공개적으로 발표했고, 여섯 개 레포 모두의 Hugging Face 카드가 몇 분 간격으로 업데이트되었다 — 타임스탬프가 거의 정확히 일치한다. 따라서 솔직하게 말하자면: 가중치는 조용히 배포되었고, 발표는 일주일 늦게 나왔으며, 현재 이번 릴리스에 대해 알 수 있는 모든 것은 모델 카드 자체와 짧은 training-cookbook 저장소에서 나온다. 그 외에는 아직 독립적으로 검증된 것이 없다.
실제로 출시된 것: 체크포인트 6개, 학습 단계 3개
InclusionAI는 이번 릴리스를 자사 최고 효율의 언어 기반 모델 제품군인 Ling-3.0 시리즈의 "학습 과정 중 체크포인트 모음"이라고 설명합니다. 가장 작은 두 가지 크기인 Ling-3.0-tiny와 Ling-3.0-flash 각각에 대해 연구소는 학습 단계별로 하나씩 세 개의 체크포인트를 공개했습니다:
• 사전 학습된 — Ling-3.0-flash-base-30T 및 Ling-3.0-tiny-base-30T: 대규모 사전 학습을 완료했습니다. 중간 학습, 병합, 후속 학습은 없습니다.
• 중간 훈련 — Ling-3.0-flash-base-midtrain 및 Ling-3.0-tiny-base-midtrain: 중간 훈련 단계를 완료했으며, 체크포인트 병합과 사후 훈련은 수행하지 않았습니다.
• 병합됨 — Ling-3.0-flash-base 및 Ling-3.0-tiny-base: 중간 학습 가중치에서 생성된 WSM 병합 기본 체크포인트로, 사후 학습 전 최종 기본 상태를 나타냅니다.
{{1}}여섯 개 모두 기본 체크포인트입니다.{{/1}} {{2}}어느 것도 정렬 단계를 거치지 않았습니다{{/2}} — {{3}}지도 미세 조정, 선호도 최적화, RL{{/3}} — {{4}}즉, 기본 모델을 사용자에게 제공할 수 있는 형태로 바꿔주는 단계입니다.{{/4}} {{5}}모델 카드에도 명확히 명시되어 있습니다:{{/5}} {{6}}직접적인 최종 사용자 채팅 배포, 추가 정렬 및 평가가 없는 안전 필수 애플리케이션, 또는 사후 훈련 및 작업별 검증이 없는 프로덕션 사용에는 권장되지 않습니다.{{/6}}
기본 체크포인트가 무엇인지 — 그리고 WSM 변형이 왜 중요한지
API를 통해서만 모델을 접해 본 사람에게 '베이스 체크포인트'는 이미 알고 있는 모델의 더 작거나 오래된 버전처럼 들릴 수 있다. 하지만 그런 것이 아니다. 베이스 체크포인트는 사전 학습을 거쳐 나온 정렬되지 않은 신경망 가중치 파일이며, 실제로 사용하는 지시 수행·도구 호출 동작은 이후에 그 위에 얹힌다. 베이스 체크포인트를 공개하는 것은 연구 커뮤니티가 자체적으로 추가 사전 학습, 파인튜닝, 증류, 강화학습을 수행할 수 있는 원자재를 연구소가 넘겨주는 방식이다.
이번 릴리스가 일반적인 base-weight 덤프보다 더 흥미로운 이유는 그 뒤에 있는 훈련 레시피입니다. InclusionAI는 사용하는 기법을 일컬어 Warmup-Stable and Merge (WSM)이라고 합니다. 이는 학습 종료 시점의 기존 학습률 감쇠를 가중 체크포인트 병합으로 대체합니다. 쉽게 말해, 학습률을 낮추어 학습을 마무리하는 대신, 연구실은 안정적인 학습률로 훈련하고, 마지막 구간에서 체크포인트를 저장한 다음, 그 체크포인트들을 학습된 가중치와 병합합니다. 공급업체가 모델 카드에 명시한 동기는 다음과 같습니다:
• Because there is no decay phase to "bake in" the final data mix, the resulting base model is better suited to continued pre-training and dynamic data expansion.
• 병합 레시피는 오프라인에서 탐색할 수 있으므로, 팀은 다양한 감쇠 프로필을 비교할 수 있습니다, 비용이 많이 드는 학습 실행을 다시 실행하지 않고도 각각에 대해.
그 두 번째 요점이 이 릴리스를 단순한 호기심이 아니라 연구 산출물로 만드는 것이다. 이 체크포인트들의 핵심은 추가 훈련을 염두에 두고 만들어졌다는 점이며, 그 레시피는 그러한 추가 훈련을 견딜 수 있도록 설계되었다.
Ling-3.0-flash-base 내부에 무엇이 있나요?
아키텍처는 포스트 트레이닝된 Ling-3.0-flash와 동일하며, 이는 해당 모델의 광범위한 보도에서 이미 익숙할 것입니다. 모델 카드와 config.json:
• 크기 — 공급업체 기준 총 124B 파라미터(디스크의 전체 체크포인트는 임베딩을 포함해 Hugging Face 기준 약 127B로 집계됨)이며 토큰당 5.1B 활성화.
• 희소성 — 1/64 희소 MoE: 512개의 라우팅 전문가로, 모든 토큰에 대해 8개의 라우팅 전문가와 1개의 공유 전문가가 활성화됩니다.
• 어텐션 — 42개의 트랜스포머 레이어에 걸쳐 5:1 반복 패턴으로 구성된 35개의 Kimi Delta Attention(KDA) 레이어와 7개의 Gated MLA 레이어를 갖춘 네이티브 하이브리드-리니어 설계.
• 컨텍스트 — 구성은 256K-토큰 위치 임베딩(262,144)을 지니며, 이는 포스트 트레이닝된 형제와 동일한 네이티브 컨텍스트입니다.
• 가중치 — BF16, 28개의 safetensors 샤드로 제공되며(디스크에서 약 255GB), 사용자 정의 bailing_hybrid 모델링 코드가 저장소에 번들로 포함되어 있습니다.
• 라이선스 — MIT, 사용 제한 조항 없음.

크기 수치에 관한 솔직한 주의사항 하나: 공급업체의 모델 카드에는 "Total 124B"라고 표시되어 있으며, 그 숫자가 모든 곳에 유포되고 있습니다. 하지만 임베딩 레이어를 포함하면 저장소의 총 safetensors 파라미터 수는 약 127.5B입니다. 124B 수치는 임베딩을 제외한 총계이며, 두 숫자는 모순되지 않습니다. 사이드바나 다운로더에서 "127B"를 볼 때 어떤 수치를 보고 있는지 알아두는 것이 좋습니다.
그것이 무엇을 위한 것이고, 무엇을 위한 것이 아닌지
모델 카드의 권장 사용 사례는 명확합니다:
• 지속적 사전 학습
• 중간 훈련
• 도메인 적응을 위한 지도 학습 기반 미세 조정
• 선호도 최적화 및 RL 사후 훈련
• 증류 연구
• Long-context 및 MoE 시스템 연구
그리고 '그대로는 권장되지 않음' 목록도 그만큼 명확합니다: 최종 사용자 채팅에 직접 배포, 정렬 없이 안전이 중요한 애플리케이션에 적용, 사후 훈련 없이 프로덕션에서의 사용. 다시 말해, 이것은 모델을 훈련하는 사람들을 위한 원자재이지, 사람들이 배포하는 모델이 아닙니다. 파인튜닝이나 사전 훈련을 할 계획이 없다면, 여기서 다운로드할 것은 없습니다 — 그리고 그것도 전혀 문제가 되지 않습니다.
이야기의 나머지 절반은 매끄러운 확장 설계이다. InclusionAI는 다음과 같이 밝힌다: Ling-3.0-tiny-base와 Ling-3.0-flash-base는 동일한 훈련 레시피를 공유한다. 따라서 커뮤니티는 먼저 훨씬 적은 GPU 메모리를 필요로 하는 tiny 체크포인트에서 지속적 사전학습 또는 미세조정 전략을 검증한 후, 동일하게 검증된 레시피를 더 큰 flash 체크포인트로 확장할 수 있다. 이는 의도적인 워크플로우 선택이지 릴리스 과정상의 우연이 아니며, 실제로 실험을 원하는 모든 사람에게 이 컬렉션의 가장 유용한 특성이다.
하드웨어의 현실, 그리고 대부분의 사람들이 실제로 원하는 경로
flash 기본 가중치의 크기는 피할 수 없습니다. BF16 기준 약 255GB라는 것은 시작하기도 전에 상당한 규모의 멀티-GPU 노드(또는 메모리 최적화된 학습 설정)를 요구합니다. 기본 체크포인트에 대한 공식 FP8 또는 FP4 양자화는 없습니다. 조직 카탈로그에 있는 양자화 변형들은 사후 학습된 모델을 위한 것입니다. 미세 조정 예제는 inclusionAI/ling-cookbook GitHub 저장소에 있으며, 이는 명시적으로 진행 중인 작업입니다. 지속 사전 학습이 팀의 초점이 아니라면, 기본 체크포인트는 진입점이 아닙니다.
Ling-3.0 제품군에 대해 읽는 대부분의 사람들은 기본 체크포인트를 전혀 원하지 않습니다 — 그들이 원하는 것은 대화가 가능한 모델입니다. 그것이 바로 포스트 트레이닝된 Ling-3.0-flash이며, 벤더 자체 API와 여러 타사 플랫폼을 통해 이용할 수 있습니다. 이처럼 빠르고 새로 출시된 오픈 가중치 모델이 나타나면, 현재 스택과 비교하여 평가하는 가장 저렴한 방법은 이미 사용 중인 모델과 나란히 실행해 보는 것입니다. 그리고 이것이 바로 라우터의 용도입니다. 하나의 API, 하나의 키, 그리고 자동 장애 조치를 제공하여 공급업체의 일시적 장애가 평가를 중단시키지 않게 합니다. OrcaRouter는 이러한 방식으로 200개 이상의 모델에 연결되며, 공급업체의 공식 가격을 0% 마크업으로 그대로 전달합니다. 따라서 표시되는 가격은 공급업체가 책정한 가격 그대로이며, 벤더 수수료는 당일에 저희 쪽으로 정산됩니다.

아직 확인되지 않은 것
이번 릴리스는 발표 기준으로 하루밖에 되지 않았으므로, 미확인 목록이 길며, 이는 비판이 아니라 할 일 목록으로 읽어야 합니다:
• 기본 체크포인트에 대한 독립적인 벤치마크는 없습니다.모델 카드에는 벤더 벤치마크 차트가 포함되어 있으며, 이 차트는 Ling-3.0-flash-base를 사전 학습된 동료 모델들과 수학, 코딩, 추론, 다국어 및 긴 문맥 제품군에 걸쳐 비교합니다 — 하지만 이는 벤더 자체 평가이며, 내부 이미지 서버에서 호스팅되고, 방법론 섹션도 없고, 제3자 재현도 없습니다.
• 아직 커뮤니티 재현 사례가 없습니다. 연구 시점 기준으로 여섯 개 리포지토리 모두 다운로드 수가 0건이었고 사실상 관여도가 전혀 없었습니다. 공개된 지 너무 얼마 안 되어 이 가중치를 기반으로 한 독립적인 미세 조정 또는 지속 사전학습 실행을 게시한 사람은 아직 없습니다.
• 툴링은 초기 단계입니다. 해당 bailing_hybrid 아키텍처는 커스텀 모델링 코드를 포함하므로, 여러분은 trust_remote_code 또는 이를 지원하는 프레임워크에 의존하게 됩니다. 미세 조정 쿡북은 명백히 작업 진행 중입니다.
• 발표 자체는 내용이 빈약하다. 공개 소개는 X 스레드와 모델 카드를 통해 이루어졌으며, 카드에 명시된 내용 외에 훈련 데이터, 컴퓨팅, 또는 정확한 병합 레시피를 설명하는 별도의 출시 문서는 없다.
대조적으로, 포스트트레이닝된 형제 모델은 독자적인 실적을 보유하고 있습니다: Ling-3.0-flash는 Artificial Analysis에서 지능 지수 38로 추적되고 있습니다 — 이 수치는 리더보드에서 비롯된 것이지 공급업체가 제공한 것이 아닙니다. 이러한 기록은 Ling-3.0-flash-base에는 아직 존재하지 않습니다. 기본 체크포인트는 어디에서도 서비스되지 않으므로 어떤 리더보드에도 등재되어 있지 않습니다. 두 아티팩트는 완전히 다른 검증 단계에 있으며, 이 둘을 혼동하지 않는 것이 좋습니다.

누가 지금 행동해야 하는가
세 그룹은 이를 다르게 읽어야 합니다:
• 지속 사전 학습, 도메인 SFT, 또는 증류를 수행하는 연구자 — 바로 당신을 위한 릴리스입니다. WSM-merged 베이스 체크포인트는 추가 학습을 위해 특별히 제작되었으며, tiny-then-flash 레시피는 규모를 확장하기 전에 접근 방식을 검증할 수 있는 저렴한 방법을 제공합니다. 시작하세요: Ling-3.0-tiny-base, 레시피를 검증한 다음, Ling-3.0-flash-base로 이동하세요.
• 작동하는 모델을 원하는 엔지니어 — 여러분이 원하는 것은 사후 훈련된 Ling-3.0-flash이지 이번 릴리스가 아닙니다. 기본 체크포인트는 지시를 따르지 않으며 어디에서도 제공되지 않습니다. 따라서 API 클라이언트를 해당 체크포인트에 연결하지 마십시오.
• 다른 모든 사람들에게는 유용한 행동이 지켜보는 것이다. 앞으로 몇 주 동안의 흥미로운 신호는 이러한 가중치를 기반으로 한 최초의 독립 파인튜닝, 벤더 벤치마크 차트의 커뮤니티 재현, 그리고 서드파티 학습 스택이 bailing_hybrid 아키텍처에 대한 일급 지원을 추가하는지 여부이다.
자주 묻는 질문
Ling-3.0-flash-base와 Ling-3.0-flash의 차이점은 무엇인가요?
Ling-3.0-flash는 지도 미세 조정(supervised fine-tuning)과 RL을 통해 정렬된 포스트 트레이닝 모델로, 지시를 따르고 도구 호출을 수행하며 API를 통해 제공됩니다. Ling-3.0-flash-base는 동일한 아키텍처의 초기 단계에 해당합니다. 포스트 트레이닝 이전의 최종 병합된 기본 체크포인트로, 채팅 모델처럼 동작하지 않습니다. 베이스 모델은 연구자들이 처음부터 시작하는 대신 자체적인 지속 사전 학습, 미세 조정 또는 증류를 수행할 수 있도록 존재합니다.
왜 연구소는 사후 훈련(post-training)을 거치지 않은 체크포인트를 릴리스하는 것일까요?
포스트트레이닝은 대부분의 연구자들이 직접 수행하려는 작업이고, 베이스 체크포인트가 이를 위한 올바른 시작점이기 때문입니다. 사전 학습된, 중간 학습된, 병합된 체크포인트를 별도로 공개하면 팀은 자신의 작업에 맞는 단계를 선택할 수 있습니다. 즉, 사전 학습된 가중치에서 지속적 사전 학습을 하거나, 병합된 베이스에서 파인튜닝과 RL을 수행할 수 있습니다. 그리고 WSM 덕분에, 베이스 모델을 추가 학습할 때 취약하게 만드는 학습률 감쇠 제약 없이도 가능합니다.
Ling-3.0-flash-base를 일반 소비자용 하드웨어에서 실행할 수 있나요?
실질적으로는 아닙니다. BF16 가중치는 28개 샤드에 걸쳐 약 255GB이며, 기본 체크포인트에 대한 공식 양자화 버전은 없습니다. 더 작은 형제 모델인Ling-3.0-tiny-base는 보다 가벼운 하드웨어에서 실험하기 위한 모델이며, 플래시 체크포인트의 학습 레시피를 공유하므로 검증된 실험은 확장됩니다.
Ling-3.0-flash-base는 상업적으로 무료로 사용할 수 있나요?
네 — MIT 라이선스로 배포되며, 허용 용도에 대한 부가 조항은 없습니다. 이는 연구 목적의 사용과, 원칙적으로 가중치 및 이를 기반으로 만들어진 모든 파인튠의 상업적 사용을 모두 포함합니다. 기본 체크포인트이므로 여기서 '사용'은 그 위에서 훈련하는 것을 의미하며, 라이선스는 호스팅된 API에 대해 언급하지 않습니다. 기본 모델에는 API가 존재하지 않기 때문입니다.
결론
대부분의 독자에게 Ling-3.0-flash-base는 포인터이지 제품이 아닙니다. 이는 Ling-3.0 제품군이 어디로 향하는지, 그리고 연구소가 커뮤니티가 이를 기반으로 구축하기를 어떻게 의도하는지 알려주지만, API를 통해 호출할 만한 것은 여기에 없습니다. 실제로 지속 사전 훈련, 파인튜닝, 또는 지식 증류를 수행하는 소규모 그룹에게는 진정으로 유용한 릴리스입니다. 6개의 체크포인트를 제공하고, MIT 라이선스로 배포되며, 추가 훈련을 위해 의도적으로 설계되었고, 실험 비용을 낮춰 주는 tiny-first 경로를 갖추고 있습니다. 이를 '유용한 릴리스'에서 '검증된 레시피'로 끌어올릴 수 있는 것은 바로 오늘날 빠져 있는 것입니다. 즉, 연구소 외부의 누군가가 WSM 체크포인트를 계속 훈련할 때 그것들이 무엇을 할 수 있는지를 독립적으로 재현하는 것입니다.
