히어로 타이틀 카드에는 'Qwen3.8-27B — Text+Video on CPU'라고 쓰여 있고, 부제로 'Inside SGLang's torchcodec / ffmpeg CPU path'가 있으며, Apache 2.0, 27B open weights, No GPU required라고 표시된 세 개의 칩, 비디오 재생 프레임, CPU 칩, 필름 스트립의 플랫 라인 아이콘, 그리고 오른쪽 하단에 OrcaRouter 로고가 있습니다.
Guides & Insights

Qwen3.8-27B 텍스트+비디오, CPU로 제공 예정: SGLang의 torchcodec PR 변경 사항

작성자

Elias Hawthorne

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

지금 SGLang의 초안 풀 리퀘스트 제목은 “[CPU] Support Qw​en3.8 text+video: adding torchcodec, ffmpeg and removing pin_memory.”입니다. 그 복잡한 부분을 걷어내면 이렇게 읽힙니다: Qwen3.8-27B — 알리바바의 Apache-2.0, 270억 매개변수 비전-언어 모델로, 5일 전 오픈소스로 공개된 — 이 모델은 GPU가 없는 하드웨어에서도 텍스트+비디오 모드가 실행되도록 연결되고 있습니다. 이것은 멀티모달 27B 모델이 실제로 배포되는 추론 런타임 중 하나에서 진정한 CPU 서빙 경로를 얻게 된다는 첫 번째 구체적인 신호이며, 48GB 카드를 구매하지 않고 로컬에서 비디오 이해를 실행하기를 기다려온 사람들에게 중요한 일입니다.

해당 PR에는 아직 병합된 것이 없습니다. 초안이고, CI는 빨간불이며, 버전 핀도 아직 이동 중입니다. 하지만 바로 그렇기 때문에 주의 깊게 읽을 가치가 있습니다. 그 뒤에 있는 모델은 실제로 공개되었고, 서빙 생태계는 이미 GPU에서 따라잡았으며, 이 PR은 GPU가 없는 경로가 어디로 향하고 있는지를 보여줍니다. 이 변경이 실제로 무엇을 하는지, 27B 모델의 CPU 비디오 추론이 왜 듣기보다 훨씬 큰 사안인지, Qwen3.8-27B에 대해 확인된 사실, 그리고 오늘 어디에서 호출할 수 있는지가 여기 있습니다.

한 단락으로 된 모델

Qwen3.8-27B는 Qwen 3.8 세대의 오픈 가중치 27B 모델로, 전용 비전 타워를 갖춘 약 278억 개 파라미터의 조밀한(dense) 비전-언어 모델입니다(64개 레이어, 히든 크기 5,120). 2026년 8월 14일 저녁(베이징 시간)에 Apache 2.0 라이선스로 Hugging Face와 ModelScope에 공개되었습니다. 텍스트, 이미지, 비디오를 입력받아 텍스트를 출력하며, 별도로 부착된 어댑터가 아니라 네이티브로 동작합니다. 네이티브 컨텍스트 창은 262,144토큰이며, YaRN을 통해 약 100만 토큰까지 확장할 수 있습니다. 라이선스는 관대한(permissive) 방식으로, 상업적 사용, 파인튜닝, 재배포가 가능하며 수익 기준이나 별도의 상업 계약이 필요 없습니다. 이는 플래그십 체크포인트의 조건과 다릅니다.

배포자에게 헤드라인 사양보다 더 중요한 아키텍처 세부 사항이 두 가지 있다. 첫째는 하이브리드 어텐션이다. 대부분의 레이어는 Gated DeltaNet 선형 어텐션을 사용하고 오직 4분의 1만 전체 KV 캐시를 유지하므로, 긴 컨텍스트 메모리는 기존의 64레이어 밀집 모델이 필요로 하는 것의 극히 일부에 불과하다. 이는 단일 소비자 GPU 안에서 262K 윈도우를 현실적으로 만드는 바로 그 기법이다. 둘째는 멀티 토큰 예측(MTP)으로, 체크포인트에 자체 추측 디코딩 헤드를 포함하며, 서빙 스택이 이를 사용할 때 디코딩 속도를 눈에 띄게 높인다.

이 제품군 중에서도 비디오를 지원하는 모델입니다. 플래그십 오픈 체크포인트인 Qwen3.8-2.4T-A95B는 다운로드 가능한 형태로는 사실상 텍스트 전용이며, 호스팅 방식의 Qwen3.8-Max API는 해당 가중치 위에 비전 기능을 추가합니다. 27B는 텍스트, 이미지, 비디오를 기본으로 지원하는, 실제로 다운로드하여 실행할 수 있는 가중치입니다. 그렇기 때문에 이 모델의 비디오 모드를 위한 CPU 경로가 주목할 만한 이유입니다.

SGLang PR이 실제로 변경하는 것

이 풀 리퀘스트(sgl-project/sglang #35492)는 범위가 좁고 명확합니다. 자체 설명: “이 PR은 torchcodec과 ffmpeg를 추가하고 pin_memory를 제거하여 Qw​en3.8 텍스트+비디오를 지원하기 위한 것입니다.” 실제로는 세 가지 변경입니다.

torchcodec — PyTorch의 ffmpeg 기반 비디오 디코딩 라이브러리 — 가 스택에 추가되어, Qw​en3.8 텍스트+비디오용 비디오 프레임을 호스트 CPU에서 디코딩하고 전처리할 수 있습니다. 해당 PR은 torchcodec 0.12.0을 torch 2.12에 고정하며, ffmpeg는 버전 9 미만이어야 한다고 명시합니다.

pin_memory가 멀티모달 경로에서 제거되었습니다. pin_memory는 호스트 버퍼를 고정해 장치로의 빠른 비동기 복사를 가능하게 하는 GPU 전송 최적화입니다. CPU 전용 경로에서 이를 제거한 것은 대상 하드웨어가 데이터 경로에 별도 가속기가 없음을 나타냅니다.

재현 명령어는 텍스트+비디오 입력 경로가 활성화된 CPU에서 sglang.launch_server를 통해 실제 모델 — Qwen/Qwen3.8-27B — 을 실행합니다.

그 위에 무엇이든 구축하기 전에 상태 라벨을 읽어보세요. PR은 초안 상태이고, 두 CI 실행 모두 실패 중이며, 오늘 현재 SGLang 코드 소유자의 리뷰를 아직 기다리고 있습니다. 이것은 릴리스가 아니라 하나의 방향입니다. 중요한 맥락은 SGLang가 이미 GPU에서 Qwen3.8-27B를 서비스하고 있다는 점입니다. 쿡북은 H200, RTX PRO 6000, RTX 5090, DGX Spark를 다루며, 전용 lmsysorg/sglang:qwen38-27b 이미지가 포함되어 있습니다. 따라서 CPU 텍스트+비디오 경로가 진정으로 새로운 부분입니다.

A screenshot of the draft SGLang pull request #35492 titled '[CPU] Support Qwen3.8 text+video: adding torchcodec, ffmpeg and removing pin_memory', showing the description quoting torchcodec 0.12.0 against torch 2.12 and ffmpeg below 9, a reproduce command launching Qwen/Qwen3.8-27B with --device cpu, and the note that an approving review is required before the pull request can merge.

CPU text+video가 생각보다 더 중요한 이유

Alibaba는 처음부터 27B를 엣지 AI용으로 포지셔닝했습니다 — MediaTek은 가중치가 공개된 바로 그 날 이를 Dimensity 모바일 칩과 C-X1 자동차 콕핏에 적용했습니다. 로컬 배포 스토리가 이를 뒷받침했습니다: Q4_K_M 양자화는 약 17.1GB로, 24GB 소비자용 GPU 또는 32GB 통합 메모리를 갖춘 Apple Silicon Mac에 적합합니다. 그 스토리가 하지 못한 유일한 것은 GPU가 전혀 없는 머신에서 비디오를 실행하는 것이었습니다. 이것이 이 PR이 해결하는 격차입니다.

CPU 텍스트+비디오 경로를 사용하면 비디오 이해를 일반 CPU 박스(가상 머신, 소형 서버, 온프레미스 랙 장치, 엣지 게이트웨이)에 배포할 수 있습니다. 이러한 환경에서는 워크로드가 비동기식이고 지연 시간보다 처리량이 더 중요합니다. 비디오 캡셔닝, 콘텐츠 모더레이션, 문서 및 다이어그램 파싱, 녹화물에 대한 오프라인 검색은 정확히 GPU가 필요 없는 배치 작업이며, 오늘날에도 비디오 입력이 있는 모든 VLM은 여전히 GPU를 전제로 합니다.

솔직한 트레이드오프는 Qwen3.8-27B가 270억 매개변수 모델이고, 어떤 CPU 경로로도 27B를 빠르게 만들 수 없다는 점입니다. 컨텍스트에 비디오 프레임이 포함된 제대로 된 AVX급 서버에서도 초당 한 자릿수 토큰을 기대해야 합니다. 이는 배치 작업이나 야간 작업에는 적합하지만, 비디오 기반 대화형 채팅에는 적합하지 않습니다. CPU 경로의 핵심 가치는 그 옵션 자체가 존재한다는 데 있습니다. GPU가 없는 배포 환경에서도 더 작은 비전 모델로 내려가거나 모든 프레임을 클라우드 GPU로 전송하는 대신, 동일한 모델의 비디오 모드를 실행할 수 있다는 뜻입니다.

Qwen3.8-27B가 오늘날 실행되는 곳

생태계는 모델을 빠르게 따라잡았다. 자체 호스팅 쪽에서는 llama.cpp와 LM Studio가 있고, GGUF 팩은 약 10.7GB 2-bit 양자화 수준까지 내려간다. Ollama는 한 줄 명령으로 실행할 수 있고, vLLM과 SGLang은 제대로 된 서빙에 적합하다. 그중 대부분은 현재 텍스트나 이미지를 지원하며, CPU에서의 비디오 처리는 아직 구축 중인 부분이다.

27B를 직접 실행하고 싶지 않다면, 호스팅된 경로가 이미 존재합니다: OrcaRouter가 제공하는 것은 qwen/qwen3.8-27b이며, 텍스트, 이미지, 비디오 입력, 262,144-토큰 컨텍스트 창, 텍스트 출력을 지원하며, 입력 토큰 100만 개당 $0.33, 출력 토큰 100만 개당 $2.40에 제공됩니다. 이는 플랫폼의 다른 모든 모델과 동일한 OpenAI 호환 엔드포인트 뒤에 있으며 — 하나의 API 키, 두 번째 계약 없음 — 플랫폼의 자동 장애 조치와 라우팅 DSL이 그 키의 200개 이상의 모델에 적용됩니다. 출시된 지 5일 된, 검증되지 않은 CPU 경로를 가진 모델은 하드와이어링 대신 라우팅을 사용해야 하는 전형적인 사례입니다. 라우트 뒤에서 실제 워크로드에 Qwen3.8-27B를 시도해 볼 수 있고, 전체 호출 경로를 하나의 서빙 스택에 걸지 않아도 되며, 코드 변경 없이 자체 호스팅 버전과 호스팅 버전 사이를 전환할 수 있습니다.

A screenshot of the OrcaRouter model page for qwen/qwen3.8-27b showing the capability chips Vision, Tools, JSON and Reasoning, a description of Qwen3.8-27B as Alibaba's Apache-2.0 open-weight 27B multimodal model self-hosted on OrcaRouter accepting text, images and video with a 262,144-position context window, and the price of /bin/bash.33 per 1M input tokens and .40 per 1M output tokens.

숫자 — 벤더가 보고한 것으로, 확인해 볼 가치가 있습니다

아래의 모든 주요 수치는 알리바바가 모델 카드와 출시 자료에서 직접 제공한 것입니다. 이 모델은 출시된 지 5일밖에 되지 않았고 독립적인 재현 결과가 이제 막 나오기 시작했으므로, 이를 확정적인 평가보다는 분명한 방향성을 가진 주장으로 받아들여야 합니다. 27B 규모로서는 코딩 및 에이전트 점수가 가장 주목할 만합니다:

• SWE-bench Pro — 61.7 (Alibaba 보고; 자체 표에는 Claude Opus 4.6 Max가 53.4로 표시됨)

• Terminal-Bench 2.1 — 73.0 (에이전트형 터미널 코딩)

• OSWorld-Verified — 84.3 (컴퓨터 사용 에이전트 작업)

• AndroidWorld — 81.9

• DeepSWE 1.1 — 42.2, 이전 오픈 27B의 13.3의 약 3배

비전 측면 — 이 기사가 정말로 다루는 측면 — 에서 알리바바는 비디오 이해를 위한 VideoMME 87.0, 도구 없이 수행하는 시각적 추론을 위한 MathVision 90.0을 보고합니다. Artificial Analysis의 초기 평가는 이 모델을 Intelligence Index에서 52, Agentic Index에서 51로 평가하며, 특정 추론 설정에서 훨씬 더 큰 폐쇄형 모델과 경쟁력을 보입니다. 이 점수들은 출시된 지 5일밖에 안 된 모델에 대한 초기 결과입니다.

A single-column scoreboard titled 'Qwen3.8-27B — the scoreboard' with six rows: Input text + image + video, Context 262K native (1M via YaRN), VideoMME 87.0, SWE-bench Pro 61.7, License Apache 2.0, API price /bin/bash.33 / .40 per 1M, with a footer stating VideoMME and SWE-bench figures are vendor-reported with no independent scores yet and API price per OrcaRouter, and the OrcaRouter logo in the bottom-right corner.

{{1}}모델을 로컬 또는 CPU에서 실행하는 모든 사용자에게 한 가지 주의사항이 특히 중요한데, 바로 추론 다이얼(reasoning dial)입니다.{{/1}} {{2}}Qwen3.8-27B는 thinking mode가 켜진 상태로 제공되며, 요청별 reasoning_effort 설정(low / medium / xhigh)을 지원합니다.{{/2}} {{3}}기본값인 xhigh는 심각하게 과잉 추론합니다. 이제는 유명해진 17GB GGUF의 첫 실행은 단순한 이미지 하나를 그리는 데 약 21분과 22,000개의 추론 토큰이 걸렸습니다.{{/3}} {{4}}특히 CPU에서는 reasoning_effort를 의도적으로 설정하세요. 인터랙티브한 사용과 사용 불가능한 사용의 차이는 단 하나의 매개변수입니다.{{/4}}

볼 것

CPU 경로가 실제가 되는지 여부를 알려주는 세 가지가 있습니다:

PR #35492가 병합되는지 여부입니다. 현재는 레드 CI(실패 상태)인 초안(draft)입니다. 병합된 그린(green) 버전이 릴리스에 포함되어야 CPU 텍스트+비디오 경로가 나머지 사람들에게도 실행 가능해집니다.

독립 벤치마크. 61.7 SWE-bench Pro 및 87.0 VideoMME 수치는 벤더가 보고한 값입니다. 앞으로 몇 주간 진행될 LMArena 및 Artificial Analysis 실행을 통해 알리바바 자체 테스트 하네스 밖에서 얼마나 성능이 유지되는지 확인할 수 있을 것입니다.

호스팅된 1M 컨텍스트 버전이 실현되는지 여부. 네이티브 262K는 이미 대용량이며, 백만 토큰 멀티모달 모드는 하이브리드 어텐션 캐시 절감 효과가 본전을 뽑는 곳이다.

지금으로서는 결정은 간단합니다. 하드웨어가 있다면 17GB Q4 GGUF와 SGLang 또는 llama.cpp로 오늘 바로 모델을 실행할 수 있고, CPU 텍스트+비디오 PR은 GPU 없는 경로가 어디로 향하고 있는지 보여줍니다. 그렇지 않다면 Qwen3.8-27B는 OrcaRouter를 통해 단일 키 하나로 입력 100만 토큰당 $0.33, 출력 100만 토큰당 $2.40에 호출할 수 있습니다. 어느 쪽이든, 비디오를 지원하는 오픈 27B는 Qw​en 3.8 세대에서 가장 주목할 만한 모델입니다 — 그리고 이 모델은 겨우 닷새밖에 되지 않았습니다.

© 2026 OrcaRouter

제공업체용

추론 플랫폼을 운영하시나요? OrcaRouter에 모델을 등록하세요.

providers@orcarouter.ai

커뮤니티에 참여하세요

Discordsupport@orcarouter.aiXGitHubYouTube