Decision 3.0을 위한 생성된 타이틀 카드로, 부제는 '6개의 오픈 멀티모달 결정 모델, 0.6B~27B'이며, 칩에는 '가중치 Apache-2.0', '이미지와 동영상', '아직 출시 게시물 없음'이라고 적혀 있고, 하단에는 '이 글의 모든 수치는 vLLM-SR 자체 측정치이며, 여기에서 독립적으로 재현된 것은 없습니다.'라고 적혀 있습니다. OrcaRouter 로고는 오른쪽 아래 모서리에 합성되어 있습니다.
Engineering & Research

Decision 3.0이 Hugging Face에 공개되었습니다: X에서만 발표된 6가지 오픈 멀티모달 의사결정 모델

작성자

Gideon Frost

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

Decision 3.0은 지금 바로 다운로드할 수 있는 형태로 존재하는데, 이를 적어 둔 사람은 거의 없습니다. 여섯 개의 체크포인트 — d3, d3-flash, d3-mini, d3-nano, d3-lite 그리고 d3-edge — vllm-sr 조직에 Hugging Face에서 2026년 10월 10일에 올라왔습니다. 최신순으로 09:38 UTC에 시작해 23:49 UTC에 d3-edge로 끝났습니다. 이들은 Apache-2.0이며, Qwen3.5 및 Qwen3.8 백본을 기반으로 구축되었고, 토큰을 생성하는 대신 선택지별 확률로 선택형, 예/아니요형, 점수형 질문에 답하며, 여섯 개 중 다섯 개는 이제 이미지와 동영상을 읽습니다. 모든 모델 카드는 스스로를 "Decision 3.0의 27B 멀티모달 파운데이션 의사결정 모델, vLLM Semantic Router의 의사결정 모델"이라고 설명하는데, 이는 vLLM 프로젝트의 개방형 의사결정 계층입니다.

빠져 있는 것은 발표문이다. vLLM 프로젝트의 X 계정은 10월 11일 릴리스에 대해 vLLM-SR 팀을 축하하며 메인테이너 본인의 소개 스레드를 인용했다 — 그것이 공개 기록의 전부다. 프로젝트의 블로그 인덱스는 여전히 10월 10일에 라우팅 결정 모델에 관한 글로 끝나 있으며, 이번 것들에 관한 글이 아니다. vllm-project/semantic-router의 GitHub 릴리스 페이지는 여전히 9월 27일 자 v0.4.0에서 멈춰 있다. 가중치는 배포되었지만, 출시 공지문은 아직 없다.

그 구분은 아래 모든 내용을 어떻게 읽어야 하는지에 중요하다. 이 글의 모든 성능 수치는 vLLM-SR 자체의 모델 카드에서 나온 것이며, 그들 자신의 하드웨어에서 그들 자신의 테스트 프레임워크로 측정한 것이다. 여기 있는 어떤 것도 외부 주체에 의해 재현된 적이 없으며, 그들이 공개하는 게시판은 그들이 유지 관리하는 것이다. 이것은 실재하는 산출물과 아직 감사를 받지 않은 주장에 대한 이른바, 정직한 해석이다.

Hugging Face에는 실제로 무엇이 있나요?

여섯 개의 저장소는 단순하고 완전하며 서로 일관됩니다. 각 저장소에는 safetensors 가중치, 채팅 템플릿, decision_config.json이 있으며, 이 파일은 기본 모델 리비전을 고정하고, 사용자 정의 모델링 코드(modeling_d3.py, d3_engine.py, d3_server.py), 자체 리드아웃 헤드를 담은 readout.safetensors, 그리고 MODEL_MANIFEST.json이 있고, 파일당 SHA-256이 있습니다. 일곱 번째 저장소인 컬렉션 페이지에는 여섯 개 모두가 나열됩니다.

가족, 크기 순서대로:

• d3 — 0.46B 비전 인코더를 포함한 26.09B 파라미터, Qwen/Qwen3.8-27B 기반. 10월 10일 09:38 UTC 업로드.

• d3-flash — 0.46B 비전 인코더를 포함한 8.39B, Qwen/Qwen3.5-9B 기반.

• d3-mini — 0.33B 비전 인코더를 포함한 4.54B, 다음을 기반으로 구축: Qwen/Qwen3.5-4B.

• d3-nano — 0.33B 비전 인코더를 포함한 2.21B 규모로, Qwen/Qwen3.5-2B 기반으로 구축되었습니다.

• d3-lite — 0.10B 비전 인코더를 포함한 0.85B, 기반 모델: Qwen/Qwen3.5-0.8B.

• d3-edge — 0.10B 비전 인코더를 포함해 0.59B이며, 역시 Qwen/Qwen3.5-0.8B를 기반으로 구축되었습니다. 가장 마지막에 업로드됨, 23:49 UTC.

여섯 개 모두 동일한 요청 계약을 가집니다: 상태 (텍스트 또는 JSON, 선택적으로 이미지와 비디오 포함)와 이름이 지정된 질문들의 사전, 그리고 타입이 지정된 확률 분포의 응답입니다. 세 가지 질문 종류가 있습니다 — Choice, Noul(예/아니요), Score — 그리고 모델은 동일한 입력에 대해 질문마다 한 번의 순전파를 실행하여 한 번의 호출로 모든 질문에 답하며, 어디에도 디코딩 루프가 없습니다.

A screenshot of the vLLM-SR collection page on Hugging Face, headed Decision 3.0 with the subtitle 'Towards Open Multimodal Foundation Decision Models' and marked as updated about 15 hours ago with 25 upvotes. It lists six repositories, each tagged Zero-Shot Classification: vllm-sr/d3 at 26B with 130 downloads and 18 likes, vllm-sr/d3-flash at 8B with 69 downloads, vllm-sr/d3-mini at 5B with 62, vllm-sr/d3-nano at 2B with 82, vllm-sr/d3-lite at 0.9B with 83, and vllm-sr/d3-edge at 0.6B with 33. The left sidebar lists the organisation's other collections: Vela 2.0, Decision 2.0, Decision 1.0, Vela 1.0, MoM 1.0 and MoM Nano.

숫자들, 그리고 그것들이 누구의 것인지

vLLM-SR은 Jev Decision Index 0.3.1이라고 부르는 리더보드를 공개하고, 그 맨 위에 d3를 올려 둔다. 헤드라인 행들은 모두 벤더가 보고한 것이다:

• d3 — 지수 64.7, 공개 스위트 65.5, 동일 기술 테스트 62.8, 신규 도메인 과제 56.6.

• Perplexity Decider v1.1 (27B) — 62.8, 62.3, 61.1, 55.6.

• Fastino GLiDE no-thinking (28B) — 60.2, 59.1, 59.5, 52.9.

• Jev — 60.1, 58.0, 58.0, 55.0.

• Torchcast Decision 27B — 59.9, 65.1, 58.1, 50.8.

• Decision 2.0 (27B), 이전 세대 — 55.9, 57.0, 55.7, 47.9.

d3의 카드에 있는 각주는 d3 자신의 행은 내부 평가인 반면 비교 행들은 10월 10일에 읽은 실시간 보드 데이터라고 분명히 밝힌다. 그것은 해야 할 올바른 공개이며 두 번 읽을 가치가 있다. 경쟁사 수치는 보드에서 가져온 것이고, 대상 수치는 모델을 만든 팀이 산출한 것이다. 카드는 또한 140,178건의 공개 요청 모두가 답변되었고 지원되지 않은 요청은 없었다고 주장한다. 이는 정확성 주장이 아니라 커버리지 주장이며, 공개하기에는 이례적인 주장이다.

A screenshot of the vllm-sr/d3 model card on Hugging Face. The header shows 18 likes, the vLLM Semantic Router organisation, and tags for Transformers, Safetensors, qwen3_5, feature-extraction, decision-model, classification, system-one, multimodal, vision, video, custom_code and an Apache-2.0 licence, with the model size listed as 26B parameters in BF16. The card graphic reads 'Decision 3.0 / d3 27B'. A specification panel gives Parameters as 26.09B including the 0.46B vision encoder, Inputs as 'Text or JSON, plus images and videos (several per request)', Decision types as 'Choice - Yes / No - Score' and License as Apache-2.0. The Highlights section states a Jev Decision Index 0.3 public suite score of 65.45 measured with the official 0.3 kit on the released weights, all 140,178 public requests answered and none unsupported, and +8.5 on the public suite over Decision 2.0. The sidebar shows 130 downloads last month, a model tree pinned to Qwen/Qwen3.8-27B, and two Spaces using the model.

더 작은 체크포인트들은 일제히 보조를 맞추고 있다고 보고한다. 각 카드는 공개 스위트 수치와 Decision 2.0의 동등한 크기 대비 델타를 제시한다: d3-flash 57.79, 이전 9B 대비 11.0 상승; d3-mini 54.90, 10.7 상승; d3-nano 42.22, 12.2 상승; d3-lite 36.93, 16.4 상승; d3-edge 28.82, 12.1 상승. 상대적 이득은 범위의 하단에서 가장 크며, 이는 멀티모달 사전학습 레시피가 큰 모델보다 작은 모델에서 더 많은 역할을 하고 있다면 예상할 수 있는 결과이고, 작은 모델들을 가장 열심히 튜닝함으로써 만들어낼 수 있는 결과이기도 하다. 외부에서는 어느 쪽인지 구분할 방법이 없다.

멀티모달 부분이 진짜 변화입니다

Decision 2.0의 모델은 텍스트를 읽습니다. Decision 3.0의 모델은 텍스트, 이미지, 동영상을 읽으며, 이것이 세대 간의 실질적인 차이입니다 — 인덱스 이동이 아니라. 각 카드에는 이미지 입력이 PNG, JPEG 또는 WebP로, 경로, URL, PIL 이미지 또는 base64 데이터 URL로 제공되며 요청당 여러 개를 각각 최대 1.6메가픽셀까지 지원한다고 나와 있습니다. 동영상은 MP4, WebM, MOV 또는 MKV로, 또는 프레임 배열로 제공되며, 초당 2프레임으로 읽고 전체 클립에 걸쳐 최대 32프레임, 각 프레임은 최대 0.2메가픽셀입니다. 요청의 모든 질문은 그 요청에 첨부된 모든 이미지와 모든 동영상을 봅니다.

비디오에 대한 뒷받침 증거는 19,140개의 검증 질문 전체에 대한 Perception Test 결과다: d3는 77.4, d3-flash 73.3, d3-mini 70.3, d3-nano 63.5, d3-lite 59.3, d3-edge 46.6이며, 이는 3개 선택지 질문에서 문서화된 우연 기준 하한 33.3과 대비된다. vLLM-SR은 이를 내부 평가라고 표시한다. d3는 또한 이를 전체 71.6에 위치시키는 비전 보드를 갖고 있어, 70.6의 Perplexity Decider v1.1과 69.6의 JEV-27B-VL보다 앞서며, 비교 행들은 다시 저자들이 직접 실행한 것이 아니라 보드 데이터에서 가져온 것이다.

처리량 수치는 단일 요청, 단일 GPU 기준이며, 그렇게 명시되어 있다: d3는 AMD Instinct MI325X 한 대에서 텍스트 요청에 중앙값 55ms, 이미지를 포함한 요청에 273ms, 10초짜리 동영상을 포함한 요청에 553ms로 응답한다. d3-edge는 같은 작업을 6.7ms, 41.9ms, 308.3ms에 수행한다. 이는 하나의 워크플로 안에서 여러 번 호출되도록 설계된 모델의 질문당 중앙값이며, 바로 이 수치가 이 모델들이 겨냥해 만들어진 아키텍처에서 중요한 숫자다. 각각 100ms가 추가되는 순차적 의사 결정 20번이면 2초가 든다—Microsoft가 이번 달 자사 의사 결정 모델에 대해 같은 점을 지적한 바와 같다.

리포지토리들이 말하지 않는 것

누구든 이걸 바탕으로 계획을 세우기 전에, 짚고 넘어가야 할 세 가지 격차가 있습니다.

첫 번째는 입력 예산입니다. decision_config.json은 가장 큰 모델 세트에 대해 max_length를 null로 설정하며, 어떤 카드도 상태와 질문, 옵션 설명을 합친 것에 대한 토큰 상한을 명시하지 않습니다. Decision 1.0의 카드는 명시적인 예산을 공개했습니다 — 인코더 분기에는 1,024 토큰, 디코더 분기에는 16,384 토큰 — 그리고 그 숫자들은 실제 계획 제약입니다. 여기에서 그것들이 없다는 것은 눈에 띄며, 이는 후속 커밋이 추가할 수 있는 가장 유용한 단일 항목입니다.

두 번째는 캘리브레이션입니다. 의사결정 모델에서 가장 중요한 숫자는 정확도가 아니라, 반환된 0.9가 10번 중 9번을 의미하는지 여부입니다. 비전 및 텍스트 인덱스는 그에 대해 아무것도 말해주지 않습니다. 여섯 카드 어디에도 브라이어 점수도, 기대 캘리브레이션 오차 수치도, temperature도 없습니다. InternLM은 9월에 자체 의사결정 모델에 대해 두 가지를 모두 공개했습니다. vLLM-SR은 이 계열의 어떤 구성원에 대해서도 공개하지 않았습니다.

세 번째는 독립성이다. Decision 2.0의 모델들은 두 주 동안 외부에서 사용된 반면, Decision 3.0의 모델들은 겨우 몇 시간이다. 10월 11일의 다운로드 수 — d3는 130, d3-lite는 83, d3-nano는 82 — 는 채택의 흔적이 아니라 업로드의 발자국이다. 위의 모든 지표 수치는 저장소가 딸린 가설로 취급하라.

오늘 호출할 수 있는 스택에서 이것이 차지하는 위치

결정 모델에 관한 실질적인 질문은 그것이 이미 존재하는 파이프라인에 그대로 들어가는지 여부이며, 여기서는 생태계가 모델들보다 더 앞서 나가 있습니다. 이 모델들이 사용하는 System One 요청 형식은 vLLM-SR에만 있는 독점적인 것이 아닙니다. 그것은 호스팅된 Jev 모델들을 호출할 때 쓰이는 것과 동일한 상태 및 명명된 질문 계약이며, 그래서 "Jev"가 d3의 모델 카드에서 인덱스 이름으로도, 그리고 그 리더보드의 한 행으로도 나타나는 것입니다.

OrcaRouter는 그 계열을 담당합니다. typesafe/jev-1.13은 우리 카탈로그에 있으며, 다음을 통해 제공됩니다: POST /v1/systemone — 동일한 계약으로, 백만 입력 토큰당 $0.042이며, 완료가 없기 때문에 완료 요금이 없습니다. 최대 약 64K 입력 토큰, 텍스트 입력 및 구조화된 JSON 출력, 비스트리밍. 이는 오늘날 의사 결정 계층이 호출하는 종류의 모델입니다. 우리가 주장하지 않는 두 가지: d3와 나머지 Decision 3.0은 우리 카탈로그에 없으며, Decision 3.0의 로컬 추론 경로는 Hugging Face 저장소의 Python 클래스이지, 우리가 원하더라도 라우팅할 수 있는 엔드포인트가 아닙니다. 라우터가 여기서 제공하는 것은 루프의 다른 쪽에 있습니다 — 의사 결정에 따라 행동하는 생성 모델, 단일 키를 통해 200개 이상의 모델에 걸쳐 라우팅되며, 공급자가 흔들릴 때 자동 장애 조치가 이루어집니다.그래서 워크플로우 앞에 스코어링 단계를 추가하는 것이 두 번째 공급업체 관계를 추가하는 것을 의미하지는 않습니다.

이 그림을 바꿀 수 있는 것은 무엇일까요?

그것들이 얼마나 많은 것을 알려줄지 대략적인 순서대로 네 가지다. 프로젝트에서 입력 예산과 의도된 배포 형태를 밝힌 블로그 글 — 이는 이것이 푸시가 아니라 릴리스임을 확인해 줄 것이다. 어떤 체크포인트 하나에 대한 브라이어 점수 또는 ECE 수치. 제3자가 인덱스를 읽는 대신 공개된 가중치에 공개 스위트를 실행하는 것. 그리고 런타임 — semantic-router 저장소는 10월 11일에 비디오 입력을 포함해 d3와 d3-edge를 자체 모델 런타임에 연결하는 두 개의 커밋을 올렸는데, 이는 서빙 스토리가 지금 구축되고 있으며 이것이 이 모델들을 저렴하게 시험해 볼 수 있게 만드는 요소가 될 것임을 시사한다.

적어도 그중 첫 번째가 출시되기 전까지는, 솔직한 요약은 이렇다: Hugging Face에 0.6B에서 27B까지의 완전한, Apache-2.0, 진정한 멀티모달 결정 모델 패밀리가 있으며, 이례적으로 좋은 출처 정보 — 파일 해시, 고정된 기본 리비전, 명시된 하드웨어 대상 — 와 함께 공개되었지만, 그것을 사용할지 결정할 수 있게 해 줄 주변 문서는 이례적으로 거의 없다. 다운로드하는 데는 아무 비용도 들지 않는다. 인덱스를 믿는 것은 기다려야 한다.

A generated six-row scoreboard titled 'Decision 3.0 - the scoreboard', listing the family from largest to smallest with each checkpoint's parameter count and its vLLM-SR-reported Jev Decision Index 0.3 public-suite figure: d3 26.09B and 65.5, d3-flash 8.39B and 57.79, d3-mini 4.54B and 54.90, d3-nano 2.21B and 42.22, d3-lite 0.85B and 36.93, d3-edge 0.59B and 28.82, with a footer reading 'All figures are vLLM-SR's own; nothing here is independently reproduced.'

이 글에서 비교한 모델1

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트