Một thẻ tiêu đề chính có dòng chữ 'Qwen3.8-27B — Text+Video on CPU' với phụ đề 'Inside SGLang's torchcodec / ffmpeg CPU path' và ba chip ghi Apache 2.0, 27B trọng số mở, Không cần GPU, với các biểu tượng đường nét phẳng của khung phát video, chip CPU và cuộn phim, cùng logo OrcaRouter ở góc dưới bên phải.
Guides & Insights

Qwen3.8-27B Text+Video sắp có mặt trên CPU: Những gì PR torchcodec của SGLang thay đổi

Tác giả

Elias Hawthorne

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Một pull request nháp trong SGLang hiện đang có tiêu đề “[CPU] Support Qw​en3.8 text+video: adding torchcodec, ffmpeg and removing pin_memory.” Gỡ bỏ lớp kỹ thuật đi, nó đọc như một lộ trình: Qwen3.8-27B — mô hình thị giác-ngôn ngữ 27 tỷ tham số, Apache-2.0 của Alibaba, được mở mã nguồn cách đây năm ngày — đang được tích hợp để chế độ text+video của nó chạy trên phần cứng không có GPU trong máy. Đây là tín hiệu cụ thể đầu tiên cho thấy mô hình đa phương thức 27B đang có đường dẫn phục vụ CPU thực sự trong một trong các runtime suy luận mà các đội kỹ thuật thực sự triển khai, và điều này quan trọng với bất kỳ ai đã chờ đợi để chạy hiểu video cục bộ mà không cần mua card 48GB.

Chưa có gì trong PR đó được merge cả — nó mới chỉ là bản nháp, CI đang đỏ, và các phiên bản ghim vẫn đang thay đổi. Nhưng đó chính là lý do khiến nó đáng đọc kỹ. Mô hình đứng sau nó là có thật và đã được phát hành, hệ sinh thái serving đã bắt kịp trên GPU, và PR này cho thấy hướng không-GPU sẽ đi về đâu. Sau đây là những gì thay đổi này thực sự làm, vì sao suy luận video trên CPU cho mô hình 27B lại là vấn đề lớn hơn so với vẻ ngoài, những gì được xác nhận về Qwen3.8-27B, và nơi bạn có thể gọi nó ngay hôm nay.

Mô hình trong một đoạn văn

Qwen3.8-27B là mô hình trọng số mở 27B của thế hệ Qwen 3.8: một mô hình ngôn ngữ-thị giác dense ~27,8 tỷ tham số (64 tầng, kích thước ẩn 5.120) với tháp thị giác chuyên dụng, được phát hành theo giấy phép Apache 2.0 trên Hugging Face và ModelScope vào tối ngày 14 tháng 8 năm 2026 (giờ Bắc Kinh). Mô hình nhận đầu vào là văn bản, hình ảnh và video, trả về văn bản — một cách tự nhiên, không qua adapter gắn thêm — với cửa sổ ngữ cảnh gốc 262.144 token, có thể mở rộng lên khoảng một triệu token qua YaRN. Giấy phép thuộc loại permissive: cho phép sử dụng thương mại, tinh chỉnh và phân phối lại, không có ngưỡng doanh thu và không cần thỏa thuận thương mại riêng, không giống như các điều khoản của checkpoint chủ lực.

Hai chi tiết kiến trúc đáng quan tâm với người triển khai hơn cả các thông số chính. Thứ nhất là attention lai: hầu hết các tầng dùng attention tuyến tính Gated DeltaNet và chỉ một phần tư giữ bộ đệm KV đầy đủ, nhờ đó bộ nhớ cho ngữ cảnh dài chỉ bằng một phần nhỏ so với mô hình dense 64 tầng thông thường — chính thủ thuật này giúp cửa sổ 262K trở nên khả thi ngay trên một GPU tiêu dùng. Thứ hai là dự đoán đa token (MTP), checkpoint đi kèm bộ head giải mã suy đoán riêng, giúp tăng tốc giải mã rõ rệt khi ngăn xếp phục vụ tận dụng nó.

Đây cũng là thành viên có khả năng xử lý video trong gia đình này. Checkpoint mở hàng đầu, Qwen3.8-2.4T-A95B, thực chất chỉ hỗ trợ văn bản ở dạng tải về, còn API Qwen3.8-Max được lưu trữ bổ sung khả năng thị giác trên các trọng số đó. Bản 27B là trọng số bạn có thể thực sự tải về và chạy, hỗ trợ văn bản, hình ảnh và video ngay khi sử dụng — đó là lý do vì sao đường dẫn CPU cho chế độ video của nó rất đáng được chú ý.

Điều mà PR SGLang thực sự thay đổi

Pull request (sgl-project/sglang #35492) này gọn gàng và rõ ràng. Mô tả của nó: “PR này nhằm hỗ trợ Qw​en3.8 text+video, bằng cách thêm torchcodec, ffmpeg và loại bỏ pin_memory.” Trên thực tế, đó là ba thay đổi.

torchcodec — thư viện giải mã video dựa trên ffmpeg của PyTorch — được thêm vào stack, do đó các khung hình video cho Qw​en3.8 text+video có thể được giải mã và tiền xử lý trên CPU của máy chủ. PR này khóa torchcodec 0.12.0 với torch 2.12 và lưu ý rằng ffmpeg phải ở dưới phiên bản 9.

pin_memory bị loại bỏ khỏi đường dẫn đa phương thức. pin_memory là một tối ưu hóa truyền GPU giúp cố định bộ đệm máy chủ để sao chép không đồng bộ nhanh sang một thiết bị; việc loại bỏ nó trên đường dẫn chỉ có CPU là dấu hiệu cho thấy phần cứng mục tiêu không có bộ tăng tốc rời trong đường dẫn dữ liệu.

• Lệnh tái tạo khởi chạy mô hình thực tế — Qwen/Qwen3.8-27B — thông qua sglang.launch_server trên CPU với đường dẫn đầu vào văn bản + video được bật.

Trước khi xây dựng bất cứ thứ gì trên đó, hãy đọc các nhãn trạng thái: PR này mới chỉ là bản nháp, cả hai lần chạy CI đều đang thất bại, và tính đến hôm nay, nó vẫn đang chờ đánh giá từ các chủ sở hữu mã nguồn của SGLang. Đây là một định hướng, không phải một bản phát hành. Bối cảnh quan trọng là SGLang đã phục vụ Qwen3.8-27B trên GPU — cookbook bao gồm H200, RTX PRO 6000, RTX 5090 và DGX Spark, với một image chuyên dụng lmsysorg/sglang:qwen38-27b — vì vậy, nhánh xử lý văn bản + video trên CPU mới thực sự là phần mới.

A screenshot of the draft SGLang pull request #35492 titled '[CPU] Support Qwen3.8 text+video: adding torchcodec, ffmpeg and removing pin_memory', showing the description quoting torchcodec 0.12.0 against torch 2.12 and ffmpeg below 9, a reproduce command launching Qwen/Qwen3.8-27B with --device cpu, and the note that an approving review is required before the pull request can merge.

Tại sao text+video CPU lại quan trọng hơn vẻ ngoài của nó

Alibaba đã định vị mô hình 27B cho AI biên từ ngày đầu — MediaTek đã điều chỉnh nó cho chip di động Dimensity và buồng lái ô tô C-X1 ngay trong ngày các trọng số được phát hành. Câu chuyện triển khai cục bộ đã củng cố điều đó: lượng tử hóa Q4_K_M có dung lượng khoảng 17.1GB, vừa với GPU tiêu dùng 24GB hoặc Mac Apple Silicon với 32GB bộ nhớ thống nhất. Điều duy nhất mà câu chuyện đó không thể làm được là xử lý video trên máy không có GPU. Đó chính là khoảng trống mà PR này giải quyết.

Một luồng xử lý văn bản+video trên CPU cho phép hiểu video có thể triển khai trên các hộp CPU thông thường — máy ảo, máy chủ nhỏ, thiết bị rack tại chỗ, cổng biên — nơi khối lượng công việc không đồng bộ và thông lượng quan trọng hơn độ trễ. Tạo chú thích video, kiểm duyệt nội dung, phân tích tài liệu và sơ đồ, truy xuất ngoại tuyến trên các bản ghi: đây chính là những tác vụ hàng loạt không cần GPU, và ngày nay người ta vẫn giả định một GPU là cần thiết cho bất kỳ VLM nào có đầu vào video.

Sự đánh đổi thật lòng là Qwen3.8-27B là một mô hình 27 tỷ tham số và không có đường dẫn CPU nào làm cho mô hình 27B chạy nhanh được. Hãy kỳ vọng tốc độ chỉ ở mức token đơn chữ số mỗi giây trên một máy chủ lớp AVX thực thụ khi có khung hình video trong ngữ cảnh — khả thi cho các tác vụ xử lý hàng loạt và chạy qua đêm, chứ không phải cho chat tương tác qua video. Ý nghĩa của đường dẫn CPU nằm ở chỗ tùy chọn này tồn tại dù sao đi nữa: một triển khai không GPU vẫn có thể chạy chế độ video của cùng mô hình thay vì phải hạ xuống một mô hình thị giác nhỏ hơn hoặc gửi từng khung hình lên GPU đám mây.

Nơi Qwen3.8-27B đang chạy hiện nay

Hệ sinh thái đã nhanh chóng bắt kịp mô hình. Về phía tự lưu trữ, bạn có llama.cpp và LM Studio với các gói GGUF giảm xuống còn khoảng 10,7GB ở mức lượng tử hóa 2-bit, Ollama để chạy chỉ với một dòng lệnh, cùng vLLM và SGLang cho việc phục vụ bài bản. Phần lớn trong số đó hiện nay là văn bản hoặc hình ảnh; còn đường dẫn video trên CPU vẫn đang được xây dựng.

Nếu bạn không muốn tự chạy một mô hình 27B, route lưu trữ đã có sẵn: OrcaRouter cung cấp qwen/qwen3.8-27b với đầu vào văn bản, hình ảnh và video, cửa sổ ngữ cảnh 262.144 token, và đầu ra văn bản, với giá 0,33 USD cho mỗi triệu token đầu vào và 2,40 USD cho mỗi triệu token đầu ra. Nó nằm phía sau cùng một endpoint tương thích OpenAI như mọi mô hình khác trên nền tảng — chỉ cần một API key, không cần hợp đồng thứ hai — và cơ chế failover tự động cùng routing DSL của nền tảng áp dụng cho hơn 200 mô hình trên key đó. Một mô hình mới ra mắt được năm ngày với đường dẫn CPU chưa được kiểm chứng là trường hợp điển hình cho việc định tuyến thay vì gắn cứng: bạn có thể thử Qwen3.8-27B trên khối lượng công việc thực tế thông qua một route mà không cần đánh cược toàn bộ luồng gọi của mình vào một stack phục vụ duy nhất, và chuyển đổi qua lại giữa phiên bản tự lưu trữ và phiên bản lưu trữ mà không cần thay đổi code.

A screenshot of the OrcaRouter model page for qwen/qwen3.8-27b showing the capability chips Vision, Tools, JSON and Reasoning, a description of Qwen3.8-27B as Alibaba's Apache-2.0 open-weight 27B multimodal model self-hosted on OrcaRouter accepting text, images and video with a 262,144-position context window, and the price of /bin/bash.33 per 1M input tokens and .40 per 1M output tokens.

Các con số — do nhà cung cấp báo cáo và đáng để kiểm tra

Mọi con số nổi bật dưới đây đều là số liệu của chính Alibaba, lấy từ thẻ mô hình và tài liệu ra mắt. Mô hình mới chỉ ra đời được năm ngày và việc tái lập độc lập mới chỉ bắt đầu xuất hiện, vì vậy hãy coi đây là những khẳng định có định hướng rõ ràng thay vì kết luận cuối cùng. Với một mô hình 27B, điểm số về lập trình và tác tử chính là điểm đáng chú ý nhất:

• SWE-bench Pro — 61.7 (do Alibaba báo cáo; bảng của họ cho thấy Claude Opus 4.6 Max đạt 53.4)

• Terminal-Bench 2.1 — 73.0 (lập trình terminal bằng tác nhân)

• OSWorld-Verified — 84.3 (nhiệm vụ tác tử sử dụng máy tính)

• AndroidWorld — 81.9

• DeepSWE 1.1 — 42.2, gấp khoảng ba lần con số 13.3 của bản open 27B trước đó.

Về phía thị giác — khía cạnh mà bài viết này thực sự đề cập — Alibaba báo cáo VideoMME 87.0 cho khả năng hiểu video và MathVision 90.0 cho suy luận thị giác mà không cần công cụ. Đánh giá sơ bộ của Artificial Analysis xếp mô hình ở mức 52 trên Chỉ số Trí tuệ và 51 trên Chỉ số Tác nhân, cạnh tranh với các mô hình đóng lớn hơn nhiều ở một số cài đặt suy luận nhất định; đó vẫn là những điểm số sớm đối với một mô hình mới năm ngày tuổi.

A single-column scoreboard titled 'Qwen3.8-27B — the scoreboard' with six rows: Input text + image + video, Context 262K native (1M via YaRN), VideoMME 87.0, SWE-bench Pro 61.7, License Apache 2.0, API price /bin/bash.33 / .40 per 1M, with a footer stating VideoMME and SWE-bench figures are vendor-reported with no independent scores yet and API price per OrcaRouter, and the OrcaRouter logo in the bottom-right corner.

Một lưu ý có ảnh hưởng đặc biệt lớn đối với bất kỳ ai chạy mô hình cục bộ hoặc trên CPU, đó là núm điều chỉnh suy luận. Qwen3.8-27B đi kèm với chế độ tư duy bật sẵn và cài đặt reasoning_effort cho từng yêu cầu (low / medium / xhigh). Chế độ xhigh mặc định suy luận quá mức một cách tệ hại: lần chạy đầu tiên nay đã nổi tiếng của GGUF 17GB mất khoảng 21 phút và 22.000 token suy luận chỉ để vẽ một hình ảnh đơn giản. Đặc biệt trên CPU, hãy đặt reasoning_effort một cách có chủ đích — sự khác biệt giữa tương tác được và không dùng được chỉ là một tham số.

Xem gì

Ba điều sẽ cho bạn biết liệu đường dẫn CPU có trở thành hiện thực hay không:

Việc PR #35492 có được merge hay không. Hiện tại nó là bản nháp với CI đỏ. Một phiên bản đã merge, CI xanh và được phát hành chính là lúc luồng text+video trên CPU có thể chạy được cho tất cả chúng ta.

Các bài benchmark độc lập. Các con số 61.7 SWE-bench Pro và 87.0 VideoMME do nhà cung cấp công bố. Các lượt chạy LMArena và Artificial Analysis trong vài tuần tới sẽ cho thấy mức độ hiệu quả còn trụ lại bên ngoài môi trường thử nghiệm của riêng Alibaba.

Liệu một phiên bản hosted với ngữ cảnh 1M có thành hiện thực hay không. 262K gốc vốn đã là rất nhiều; chế độ đa phương thức triệu token mới là nơi khoản tiết kiệm bộ đệm chú ý lai tự hoàn vốn.

Hiện tại, quyết định rất đơn giản. Nếu bạn có phần cứng phù hợp, bản Q4 GGUF 17GB kết hợp với SGLang hoặc llama.cpp có thể chạy mô hình ngay hôm nay, và PR text+video trên CPU cho thấy hướng đi của giải pháp không cần GPU. Nếu không, Qwen3.8-27B có thể gọi qua OrcaRouter với giá $0,33 cho mỗi triệu token đầu vào và $2,40 cho mỗi triệu token đầu ra, chỉ cần một API key duy nhất. Dù theo cách nào, mô hình mở 27B có khả năng xử lý video này là mô hình đáng chú ý nhất trong thế hệ Qwen 3.8 — và nó mới chỉ ra mắt được năm ngày.

© 2026 OrcaRouter

Dành cho nhà cung cấp

Bạn vận hành nền tảng suy luận? Đưa mô hình của bạn lên OrcaRouter.

providers@orcarouter.ai

Tham gia cộng đồng

Discordsupport@orcarouter.aiXGitHubYouTube