뉴스 기사 'LLaDA2.2-mini — News'용 자체 제작 타이틀 카드로, 부제는 '2026년 9월 5일에 조용히 출시된 확산 언어 모델 에이전트', 알약형 배지로는 '16B MoE / 1.4B 활성', '128K 컨텍스트', 'Apache-2.0', 바닥글은 '저장소에서 알 수 있는 것과 아직 확인되지 않은 것'이며, 오른쪽 하단 모서리에는 OrcaRouter 로고가 합성되어 있다.
Guides & Insights

LLaDA2.2-mini: Ant inclusionAI의 Diffusion Agent 가중치가 9월 5일에 조용히 등장했다

작성자

Elias Hawthorne

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

2026년 9월 5일 05:16 UTC, inclusionAI/LLaDA2.2-mini라는 이름의 Hugging Face 저장소가 생성되었으며, 이 글을 쓰는 시점까지 그것이 사실상 이번 릴리스의 전부다. 가중치는 올라와 있고, 모델 카드는 작성되어 있으며, 공급업체인 inclusionAI — LLaDA 확산 모델 라인을 담당하는 Ant Group 연구소 — 는 아무것도 언급하지 않았다. 출시 게시물도, 소셜 미디어 홍보도, 더 큰 LLaDA2.2-flash가 단독으로 자리한 inclusionAI/LLaDA2.X GitHub README의 모델 표에도 항목이 없다. 저장소가 나타난 지 24시간 후, 다운로드 카운터는 0을 가리켰다. 이것은 LLaDA2.2-mini에 대해 현재까지 알려진 것을 정리한 글이며, 그 형식의 엄격함이 여기서 중요한 이유는, 모델에 붙은 거의 모든 흥미로운 숫자가 inclusionAI가 자기 카드에 직접 입력한 숫자이기 때문이다. 이 글은 이번 릴리스에 대해 독립적으로 검증 가능한 것과 공급업체가 보고한 것을 구분하며, 개방된 질문들을 모호하게 덮지 않고 명시적으로 제기한다.

짧게 요약하면, 구조만 대략 알고 싶은 사람을 위한 설명이다: LLaDA2.2-mini는 inclusionAI가 2026년 7월에 발표한 LLaDA2.2-flash 디퓨전 언어 모델의 소형 버전이다. 이제 160억 개의 파라미터를 가진 mixture-of-experts 체크포인트로 제공되며, 토큰당 14억 개의 파라미터만 활성화하고, 128K 컨텍스트를 지원하며, 에이전트 작업(도구 호출, 다중 턴 수정)을 수행하도록 학습되었다. 생성 중간에 토큰을 삽입하거나 삭제할 수 있는 디퓨전 디코더를 사용한다. 라이선스는 Apache-2.0이다. 그리고 가중치는 발표 없이 하루 전에 공개된 상태라서, 일반적으로 갖춰져 있을 법한 지원 체계가 아직 전혀 없다: 독립적인 평가 결과도, 우리가 찾을 수 있는 호스팅 API도, 모델 카드 자체가 권장하는 것 외의 서빙 가이드도 없다. 오늘 검증할 수 있는 것은 아키텍처와 라이선스, 그리고 inclusionAI가 공개하기로 선택한 수치들이다.

릴리스는 이벤트가 아니라 저장소입니다.

아무도 신뢰하지 않고 확인할 수 있는 것부터 시작하세요. Hugging Face API에는 inclusionAI/LLaDA2.2-mini가 2026년 9월 5일에 생성되었고, 같은 날 마지막으로 수정된 것으로 기록되어 있습니다. 이 모델은 Apache-2.0 라이선스이고, safetensors 형식의 bf16 텐서를 사용하며, 채팅 템플릿을 포함하고, 다음이 필요합니다: trust_remote_code. 확산 아키텍처가 사용자 지정 모델링 코드로 제공되기 때문입니다. 이 저장소의 형제 모델인 inclusionAI/LLaDA2.2-flash는 2026년 7월 16일에 생성되었고, 이후 몇 주 동안 수천 건의 다운로드와 수십 개의 좋아요를 모았으며 공개적으로 발표되었습니다. mini에는 공개 발표도, 채택도 없었습니다. 첫날에는 한 자릿수의 좋아요만 있고 다운로드는 전혀 없었습니다.

A screenshot of the Hugging Face model page for inclusionAI/LLaDA2.2-mini (captured September 6, 2026), showing the tags TextGeneration, Transformers, Safetensors, llada2_moe, dllm, diffusion_lm and custom_code, the Apache-2.0 license, the model-card summary 'LLaDA2.2-mini is the lightweight variant of the agentic diffusion language model in the LLaDA2 series', Model size 16B params, Tensor type BF16, a chat template, the line 'This model isn't deployed by any Inference Provider', and the start of the benchmarks table.

지금까지 mini가 얻은 유일한 제3자의 관심은 저장소가 공개된 지 몇 시간 만에 모델 카드를 재게시한 애그리게이터 페이지다. 그 페이지는 카드의 미러일 뿐 독립적인 출처가 아니며, 저장소 자체가 담고 있지 않은 정보도 전달하지 않는다. 그것이 9월 6일 현재 공개된 기록의 전부이다. 주의를 기울일지 결정하는 독자에게 중요한 해석은 다음과 같다. inclusionAI는 이번 주에 두 번이나 디퓨전 가중치를 조용히 배포했다. 이 모델은 9월 5일에, LLaDA-Image 생성 체크포인트는 하루 전에 배포됐다. 따라서 조용한 저장소 공개는 이 연구소의 확립된 릴리스 패턴으로 보이며, 우연이 아니다. 그 패턴만으로는 공식 발표가 있을지 없을지 알 수 없다.

LLaDA2.2-mini가 실제로 무엇인지

아키텍처는 이 모델에서 가장 흥미로운 부분이며, 카드에 완전히 설명되어 있습니다. LLaDA2.2-mini는 LLaDA2.0-mini 백본을 기반으로 구축된 mixture-of-experts 확산 언어 모델입니다. 확산 언어 모델은 일반적인 생성 루프를 뒤집습니다. 자회귀 모델이 한 번에 하나의 다음 토큰을 예측하는 대신, 확산 LLM은 마스킹되거나 노이즈가 포함된 토큰 블록에서 시작하여 전체 블록을 병렬로 정제하고, 일관된 시퀀스로 노이즈를 제거합니다. LLaDA2.2 생성은 inclusionAI가 Levenshtein 편집이라고 부르는 기능을 추가합니다. DELETE와 INSERT라는 두 개의 제어 토큰을 통해 디코더가 생성 중인 시퀀스의 내용뿐만 아니라 길이와 구조도 변경할 수 있게 해주며, 이미 작성한 중복된 범위를 제거하거나 새로운 컨텍스트(예: 도구 결과)가 들어가야 할 삽입 지점을 열 수 있습니다. 이것이 이 제품군이 다중 턴 및 도구 사용 루프에서 확산 디코딩이 작동하도록 만드는 메커니즘입니다. 자회귀 모델은 다음 사용자 턴을 기다리기만 하면 되지만, 블록 확산 모델은 이미 생성한 내용을 수정해야 합니다.

카드에 명시된 관련 사양을 그대로 옮기면 다음과 같습니다: 임베딩을 제외한 총 160억 개 파라미터, 토큰당 8개 전문가(expert)가 라우팅되는 256-전문가 MoE를 통한 토큰당 활성 파라미터 14억 개, 20개 레이어, 16개 어텐션 헤드, 4개 KV 헤드, 157,184개 토큰 어휘, 회전 위치 임베딩, 그리고 128K 컨텍스트 윈도우입니다. Block Routing이라는 기법은 디퓨전 블록 수준에서 활성화되는 전문가를 제한하며, 이를 통해 모델은 단일 소비자 GPU에서도 128K 컨텍스트를 처리할 수 있습니다. 이 카드는 24GB 이상의 GPU를 대상으로 하며, 장기 컨텍스트 에이전틱(agentic) 워크로드의 서빙 백엔드로 SGLang을 권장합니다.

A self-built timeline graphic titled 'The LLaDA family, to September 5, 2026' with four node cards: 'LLaDA2.0 — Nov 2025 — First diffusion LM scaled to 100B', 'LLaDA2.1 — Feb 2026 — Token editing for faster diffusion', 'LLaDA2.2-flash — Jul 2026 — Agentic diffusion · ~100B, announced', and 'LLaDA2.2-mini — Sep 5, 2026 — 1.4B-active agent · weights, quiet', with a footer 'Per the inclusionAI/LLaDA2.X GitHub README and Hugging Face repository timestamps' and the OrcaRouter logo composited in the bottom-right corner.

위는 이 릴리스가 패밀리 타임라인에서 자리한 위치, 즉 'LLaDA2.2-mini'를 이해할 수 있게 해주는 계보다. 2025년 11월의 LLaDA2.0은 1,000억 개 매개변수로 확장된 최초의 확산 언어 모델이었고, 2026년 2월의 LLaDA2.1은 더 빠른 텍스트 확산을 위한 토큰 편집 기능을 추가했다. 2026년 7월의 LLaDA2.2 세대는 LLaDA2.2-flash 및 기술 보고서와 함께 발표되며 패밀리를 에이전트 방향으로 향하게 했다. 미니는 그 세대에서 지금까지 약속으로 남아 있던 조각이다. 7월 릴리스에 대한 보도에서는 이미 더 저렴한 배포를 위한 플래시의 가벼운 16B 변형을 언급했지만, 독립형 가중치는 9월 5일에야 비로소 공개되었다.

카드에 있는 숫자들은, 그것들이 무엇인지로 라벨이 지정되어 있다

모델 카드의 벤치마크 표는 inclusionAI 자체가 작성한 것으로, 가중치가 공개된 당일에 게재되었으며, 어떤 독립 연구소도 이를 재현한 바 없습니다. Artificial Analysis에는 LLaDA2.2-mini 항목이 없고, 제3자가 실행한 기록도 찾을 수 없습니다. 이 수치는 측정된 사실이 아니라 방향성을 지닌 공급업체의 주장으로 읽어야 합니다. 이러한 틀 안에서 카드가 전하는 이야기는 일관적입니다. LLaDA2.2-mini는 에이전트형(agentic)이자 장문 맥락(long-context) 특화 모델이며, 이를 위해 일반 벤치마크 점수를 일부 맞바꿉니다.

• 에이전트 평균 — 59.00, τ²-Bench 57.50, Claw-Eval 57.16, PinchBench 62.33에서 집계됨 (공급업체 보고 기준).

• 함수 호출 — BFCL v4에서 47.68을 기록했으며, 이는 LLaDA2.0-mini와 LLaDA2.1-mini의 각각 25.05 및 28.44에서 상승한 수치입니다. 이전 버전인 BFCL v3에서는 69.02를 기록했습니다.

• 긴 컨텍스트 — LongBench v2에서 34.99를 기록, 이전 미니 모델들이 달성한 15.51과 12.13의 두 배 이상으로, 이는 128K 윈도우의 구체적인 성과입니다.

• 일반 — 46.47 일반 평균, AIME 2026 35.05, OlympiadBench 61.11, LiveCodeBench v6 28.14, GPQA-Diamond 44.41, IFBench 24.93 — 그중 일부는 이전 미니 모델들보다 약간 낮은데, 이는 훈련 예산을 에이전트적 행동에 사용한 데서 드러나는 비용이다.

A self-built single-column scoreboard titled 'LLaDA2.2-mini — the scoreboard' listing Type 'MoE diffusion LM with Levenshtein editing (DELETE / INSERT)', Total params '16B (excl. embeddings)', Active params '1.4B — top-8 of 256 experts', Context '128K tokens', Agentic avg '59.00 — τ²-Bench 57.50 · Claw-Eval 57.16 · PinchBench 62.33', Function calling 'BFCL v4 47.68 (up from ~25-28 for prior minis)', with a footer 'All figures from the inclusionAI model card — vendor-reported, not independently reproduced' and the OrcaRouter logo composited in the bottom-right corner.

마지막 요점은 곱씹어볼 가치가 있다. 그것이 팀이 수치상으로는 더 강력한 범용 모델 대신 이 모델을 선택하는 솔직한 이유이기 때문이다. LLaDA2.2-mini는 수학이나 지시 수행에서 최고의 소형 모델이라고 주장하지 않는다. 이 모델이 주장하는 바는 확산 모델이 역사적으로 취약했던 부분, 즉 지속적인 다중 턴 도구 사용 작업에 강점이 있다는 것이며, 동시에 단일 GPU에서 의미가 있을 만큼 활성 파라미터 수를 낮게 유지한다는 것이다. BFCL v4 상승폭과 LongBench v2 상승폭은 모델 카드가 대체로 정확하다면 독립적인 재실행에서도 그대로 유지될 수치다.

그것을 실행하는 것과 누락된 스캐폴딩

서류상으로는 LLaDA2.2-mini를 실행하는 경로가 간단합니다. 이 릴리스가 Transformers 네이티브 방식이기 때문입니다. 모델 카드에는 로드 방법이 다음과 같이 나와 있습니다: AutoModelForCausalLMtrust_remote_code=True를 transformers ≥ 5.2.0 환경에서 사용해 로드한 다음, 권장 기본값인 블록 길이 32와 온도 0.0 같은 확산 전용 파라미터로 generate를 호출하며, 대부분의 쿼리에 32,768토큰 출력 길이를 제안합니다. 에이전트형 긴 컨텍스트 서빙에는 SGLang을 가리키고, 중국 본토 사용자는 ModelScope 미러를 사용할 수 있습니다. 아직 존재하지 않는 것은 주변 생태계입니다: 확인할 수 있는 제공업체에는 호스팅 API가 없고, 찾을 수 있는 GGUF 빌드도 없으며, 프레임워크 지원도 아직 정착 중입니다 — 커뮤니티의 llama.cpp LLaDA2 아키텍처 작업이 최근이라 양자화 관련 정보는 빈약합니다.

{{1}}그 조합 — 진정으로 새로운 디코딩 패러다임이자 하루 전에 나온 자체 호스팅 전용 모델 — 은 라우팅 계층이 새 모델을 프로덕션 준비가 완료된 것처럼 가장하지 않으면서도 제 역할을 해내는 바로 그 상황이다.{{/1}} {{2}}LLaDA2.2-mini를 책임감 있게 사용해 보는 방법은, 프로덕션은 성숙한 모델에 맡긴 채 테스트 경로에서 직접 실행하는 것이다. OrcaRouter의 구성은 바로 그런 용도를 위한 것이다: 200개 이상의 모델을 프로바이더 요금표 가격 그대로 0% 마크업으로 하나의 API에서 제공하고, 하루 전에 나온 체크포인트가 멈추는 일이 워크플로를 중단시키지 않게 하는 자동 장애 조치를 갖추며, 단일 키만으로 자체 호스팅 디퓨전 호출과 호스팅형 자기회귀 모델을 함께 조합할 수 있는 라우팅 DSL을 제공한다.{{/2}} {{3}}프로바이더가 LLaDA2.2-mini를 등재하는 날이 온다면 — 정말 그런 날이 온다면 — 동일한 패스스루가 적용되고, 표시되는 가격은 그 프로바이더 자신의 가격이다.{{/3}} 그때까지 정직한 가용성 안내는 다음과 같다: Hugging Face 또는 ModelScope에서 Apache-2.0 가중치를 내려받아 직접 실행하라.

다음에 볼 콘텐츠

Three things would turn this what-we-know-so-far into a real story, and all three are absent today. First, an announcement: if the LLaDA2.2-flash pattern holds, a launch post and technical-report coverage could follow the quiet repo drop, and it would likely add training details the card omits. Second, an independent run: the agentic average of 59.00 and the BFCL v4 score of 47.68 are the claims most worth reproducing, because agentic benchmarks are the ones where harness choice moves scores the most. Third, serving maturity: SGLang serving guides, a vLLM path, and community quantizations would tell you whether the 1.4B-active footprint is as cheap to operate in practice as the spec sheet suggests. None of those exist on September 6. The weights are real, the license is permissive, and the architecture genuinely is a different way of running an agent — but the evidence that it is a good agent is, for now, one vendor's card.

© 2026 OrcaRouter

제공업체용

추론 플랫폼을 운영하시나요? OrcaRouter에 모델을 등록하세요.

providers@orcarouter.ai

커뮤니티에 참여하세요

Discordsupport@orcarouter.aiXGitHubYouTube