Một thẻ tiêu đề được tạo mang tiêu đề 'TwIL-LM3-Pro vs Qwen 3.8', có phụ đề 'Phép so sánh mà Thẻ thực sự đã chạy', với hai thẻ bo tròn ghi 'TwIL-LM3-Pro - 3.66B, cục bộ, phi thương mại' và 'Qwen3.8-Max - chạy trên máy chủ, ngữ cảnh 1M, $2 / $6'. Một dòng chân trang ghi 'webAI được đo so với Qwen3-8B, không phải Qwen3.8-Max.' Logo OrcaRouter được ghép ở góc dưới cùng bên phải.
Guides & Insights

TwIL-LM3-Pro so với Qwen 3.8: Một sự không tương xứng, và phép so sánh thực sự quan trọng

Tác giả

Rowan Sterling

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

TwIL-LM3-Pro và Qwen3.8-Max không thuộc cùng một trang, và lý do không phải là cái này tốt hơn cái kia. Mà là hồ sơ công bố cho mô hình logic hình thức 3,66B của webAI được xây dựng dựa trên so sánh với một mô hình Qwen — và mô hình Qwen được nhắc đến không phải là mô hình mà tiêu đề nêu tên. Các bảng Track A và Track B của webAI đo TwIL-LM3-Pro với Qwen3-8B, một mô hình dày đặc 8B với trọng số mở từ một thế hệ trước đó, và không hề dành chút chú ý nào cho Qwen3.8-Max: không phải vì TwIL-LM3-Pro sẽ thắng, mà vì Qwen3.8-Max là hệ thống chủ lực được lưu trữ của Alibaba, một mô hình hỗn hợp chuyên gia thưa được báo cáo với 2,4 nghìn tỷ tham số cùng khoảng 95 tỷ tham số hoạt động mỗi token, cửa sổ ngữ cảnh đa phương thức một triệu token, và bảng giá 2,00 đô la cho mỗi triệu token đầu vào và 6,00 đô la cho mỗi triệu token đầu ra. Đặt một GGUF laptop 2,09 GiB bên cạnh đó là một lỗi phạm trù được hóa trang thành một trang so sánh đối đầu.

Vậy nên bài viết này làm hai việc. Nó chỉnh lại phép so sánh mà kết quả tìm kiếm hiểu sai, rồi trả lời phiên bản câu hỏi mà người đọc có lẽ thực sự đang có: khi một mô hình tiên tiến chỉ cách một lệnh gọi API, còn một chuyên gia logic hình thức chạy trên chính máy của bạn, thì khi nào mỗi thứ xứng đáng có chỗ đứng của nó?

Mô hình mà thẻ thực sự đo được

So sánh liên quan là với Qwen3-8B, và bản tóm tắt của chính webAI về nó khiêm tốn hơn so với những bài viết thuật lại gián tiếp. Macro gate trong miền của TwIL-LM3-Pro là 0.5539, so với 0.5336 của Qwen3-8B, và model card có chứa câu mà một trang tiếp thị hẳn sẽ gỡ bỏ: mức dẫn trước ở gate là 0.020, “nhỏ hơn nhiễu lấy mẫu tại n = 200 mỗi làn — nên hãy coi kết quả đó là ngang bằng, không phải một thắng lợi.”

Ở những chỗ mà phép so sánh không phải là tung đồng xu: strict-7, 0.2879 so với 0.2093, một hàng không dùng bất kỳ điểm khớp lỏng nào ở bất cứ đâu và do đó không thể bị tạo ra bằng định dạng. Trắc nghiệm nhiều lựa chọn nghiêm ngặt, 0.4100 so với 0.0000. Quy nạp quy tắc, 0.4195 so với 0.3680. Và tỷ lệ tham số — 3.66B so với khoảng 8B — chính là toàn bộ tuyên bố "nhỏ hơn một nửa kích thước".

Trên bộ kiểm thử held-out, webAI còn thẳng thừng hơn: “TwIL-LM3-Pro không dẫn đầu nó.” Chỉ số macro trên mười bộ dữ liệu là 0.7901, ngang bằng với bản nền Granite của chính nó và xếp sau 0.8493 của Qwen3-8B. Một mô hình chuyên biệt nhỏ ngang bằng với một mô hình tổng quát lớn gấp đôi nó về logic hình thức và thua nó về năng lực tổng quát là hình dạng được kỳ vọng, và việc báo cáo theo cách đó chính là điều khiến con số strict-7 trở nên đáng tin cậy.

Qwen3.8-Max thực sự là gì

Qwen3.8-Max không phải là một bản lặp lại của Qwen3-8B. Đây là hạng cao cấp của Alibaba, và trên trang danh mục OrcaRouter, nó xuất hiện dưới dạng `qwen/qwen3.8-max` với ngày phát hành 3 tháng 8 năm 2026, cửa sổ ngữ cảnh một triệu token, đầu vào văn bản, hình ảnh và video, đầu ra văn bản, cùng hỗ trợ đầy đủ cho chế độ thinking, gọi hàm, công cụ tích hợp và đầu ra có cấu trúc. Nó được cung cấp qua các bảng điều khiển tương thích OpenAI, tương thích Anthropic và gốc ở năm khu vực, và chế độ thinking được bật/tắt bằng tham số `enable_thinking`. Mức giá là 2,00 USD cho mỗi triệu token đầu vào và 6,00 USD cho mỗi triệu token đầu ra.

Một bản chụp (snapshot) có ghi ngày, `qwen/qwen3.8-max-0902`, đã được phát hành vào ngày 2 tháng 9 năm 2026 với cùng năng lực và cùng mức giá, được phát hành cụ thể để có thể ghim cố định hành vi cho các lần chạy có thể tái lập. Nếu bạn đang xây dựng dựa trên Qwen3.8-Max cho bất kỳ thứ gì tồn tại lâu dài, thì định danh snapshot đó chính là thứ nên đưa vào cấu hình thay vì bí danh có thể thay đổi.

Hãy để ý những gì vắng mặt trong mô tả đó: một con số tham số mà bạn có thể tải về, một tệp giấy phép, và bất kỳ đường dẫn nào để tự chạy nó. Qwen3.8-Max là một sản phẩm được lưu trữ trên dịch vụ. Các bài đưa tin báo chí lúc ra mắt cho biết trọng số mở được hứa hẹn sẽ có vào tuần sau, và cách diễn đạt của techsy — "2.4T tham số, ngữ cảnh 1M, chưa có trọng số" — chính là tình trạng mà người đọc nên kiểm chứng thay vì mặc định, bởi vì một lời hứa được đưa tin lúc ra mắt không phải là một checkpoint đã được công bố.

Bốn chiều, và không chiều nào gần cả

• Tham số — TwIL-LM3-Pro 3.66B dense, tất cả đều hoạt động so với Qwen3.8-Max được báo cáo ở mức tổng 2.4T trong thiết kế mixture-of-experts thưa với khoảng 95B hoạt động mỗi token. Ba bậc độ lớn về tổng số, hai bậc về số hoạt động.

• Nơi nó chạy — TwIL-LM3-Pro tải xuống dưới dạng bf16 ở 6,82 GiB hoặc Q4_K_M GGUF 2,09 GiB cho CPU hoặc 4 GB VRAM, so với Qwen3.8-Max, vốn chỉ tồn tại dưới dạng một endpoint được host.

• Ngữ cảnh — TwIL-LM3-Pro 131.072 token, kế thừa từ mô hình cơ sở Granite của nó và chưa bao giờ được xác thực vượt quá 8.192 trong đánh giá của chính nó so với Qwen3.8-Max ở 1.000.000 token.

• Phương thức — văn bản vào, văn bản ra so với văn bản, hình ảnh và video vào, văn bản ra.

• Giấy phép — webAI Non-Commercial License phiên bản 1.0, với một thỏa thuận riêng được yêu cầu cho mục đích sử dụng tạo doanh thu so với API thương mại được lưu trữ không có trọng số để cấp phép.

• Chi phí — TwIL-LM3-Pro: không có phí theo token và không có endpoint lưu trữ, so với Qwen3.8-Max với $2.00 mỗi triệu token đầu vào và $6.00 mỗi triệu token đầu ra, cùng mức giá đầu vào đã lưu trong bộ nhớ đệm khoảng $0.25 mỗi triệu.

Một mô hình 3.66B rẻ vì nó nhỏ, và nó nhỏ vì nó chỉ làm một việc. Qwen3.8-Max đắt vì nó đa dụng và được host. Không mức giá nào là một lời phán quyết.

Câu hỏi đằng sau câu hỏi

Gạt bỏ sự nhầm lẫn trong cách gọi tên, vẫn còn lại một câu hỏi kỹ thuật, và đó là một câu hỏi hay: nếu một mô hình tiên tiến chạy trên máy chủ có thể suy luận về logic hình thức, thì tại sao lại phải chạy một chuyên gia hẹp?

Ba lý do vẫn đứng vững. Thứ nhất là giấy phép và mạng: một nhóm nghiên cứu phi thương mại, một môi trường cách ly khỏi mạng, hoặc một lượt gán nhãn hàng loạt phải chạy trên laptop không có kết nối đều không thể gọi endpoint được host, và một GGUF 2.09 GiB đáp ứng trực tiếp ràng buộc đó. Thứ hai là cấu trúc chi phí theo khối lượng — một công việc gán nhãn logic hình thức trên một triệu đầu vào ngắn sẽ trả tiền theo token trên một mô hình tiên tiến được host và không tốn gì ngoài thời gian chạy thực tế trên một mô hình cục bộ. Thứ ba là dạng đầu ra: TwIL-LM3-Pro được tinh chỉnh để xuất ra các cấu trúc có thể kiểm tra bằng máy thay vì văn xuôi, và đối với nhãn suy luận kéo theo cùng phân tích ngữ nghĩa thì đó là một pipeline nhỏ hơn so với việc đưa lời nhắc cho một mô hình tổng quát rồi phân tích câu trả lời của nó.

Đối lập với điều đó, trường hợp của Qwen3.8-Max rất đơn giản. Nó xử lý được hình ảnh và video, chứa được một triệu token, xử lý công cụ và đầu ra có cấu trúc thông qua một API đã được tài liệu hóa, và có các benchmark đã công bố cùng đánh giá độc lập đứng sau. Không có gì ở một chuyên gia hẹp đe dọa điều đó; hai bên đang trả lời những bộ ràng buộc khác nhau.

Ngăn xếp sử dụng cả hai

Mô thức trụ được khi va chạm với một pipeline thực tế là hai tầng, và nó không hề xa lạ. Một mô hình tiên phong được host đọc đầu vào lộn xộn — một trang sách giáo khoa được quét, một nguồn đa phương thức hỗn hợp, một đặc tả dài — rồi biến nó thành văn bản có cấu trúc sạch sẽ. Văn bản đó đi tới một mô hình logic hình thức cục bộ mà toàn bộ việc của nó là xuất ra một nhãn, một bản parse hoặc một lời phê bình Lean trên phần cứng bạn sở hữu. Phán quyết về việc tầng thứ hai đó có xứng với chi phí bảo trì hay không là phép so sánh kiểu strict-7, chứ không phải cái cổng, bởi một mô hình chuyên biệt giành được vị trí của nó trên những làn mà chỉ số không có chỗ cho chấm điểm dễ dãi.

Cũng có một gợi ý đáng rút ra từ chính card của webAI: pipeline được chạy trên năm mô hình nền khác nhau, chỉ có hệ số merge thay đổi theo từng mô hình, và webAI báo cáo kết quả cho từng mô hình, kể cả những mô hình thay đổi ít nhất. Đó là một khẳng định mạnh hơn về một công thức so với bất kỳ dòng benchmark đơn lẻ nào, và đó là kiểu bằng chứng cho thấy một phương pháp có khả năng tổng quát hóa chứ không phải chỉ một checkpoint gặp may.

Ở đây, cái gì có thể định tuyến được và cái gì không?

Đây là chỗ duy nhất mà hai mô hình thực sự nằm trong cùng một câu. Qwen3.8-Max là một tuyến: nó được phục vụ qua OrcaRouter dưới dạng `qwen/qwen3.8-max`, và vì nền tảng chuyển tiếp nguyên mức giá niêm yết của nhà cung cấp mà không cộng thêm phụ phí nào, mức giá $2.00/$6.00 là của chính nhà cung cấp, và khi nhà cung cấp giảm giá thì giá mới có hiệu lực ngay trong cùng ngày chứ không phải sau một chu kỳ hợp đồng. Bản chụp có gắn ngày `qwen/qwen3.8-max-0902` cũng có thể định tuyến song song với nó, nên việc ghim một model id có thể tái lập là một lựa chọn cấu hình chứ không phải một quan hệ nhà cung cấp riêng.

TwIL-LM3-Pro không phải là một route, và sẽ là không trung thực nếu ngụ ý điều ngược lại. Nó được cấp phép phi thương mại, không có endpoint hosted nào được công bố, và cách hiện tại để dùng nó là tải checkpoint về và tự chạy. Điều mà router làm cho một pipeline được xây dựng quanh nó là phần công việc văn bản xung quanh — mở rộng prompt, tạo corpus, lượt lọc — chạy trên cùng một endpoint tương thích OpenAI với hơn 200 mô hình, nên việc hoán đổi mô hình tạo dữ liệu đánh giá lấy mô hình chấm điểm nó chẳng tốn gì ngoài một chỉnh sửa cấu hình, với tính năng tự động chuyển đổi dự phòng để giữ cho một batch dài tiếp tục hoạt động khi nhà cung cấp gặp trục trặc.

Cách sử dụng biện minh được nhất của cả hai cùng nhau chính là đúng như vậy: một tầng tiên phong có thể định tuyến đảm nhiệm suy luận tổng quát và trích xuất có cấu trúc, một chuyên gia đã tải xuống đảm nhiệm phán đoán logic hình thức, và một khóa duy nhất cho mọi thứ ở giữa.

Mô hình nào để so sánh, và khi nào

Nếu bạn đang đánh giá các mô hình logic hình thức nhỏ, Qwen đáng để đặt cạnh TwIL-LM3-Pro là Qwen3-8B, và webAI đã công bố so sánh đó kèm theo những lưu ý. Nếu bạn đang chọn nơi để chạy một khối lượng công việc sản xuất, thì Qwen3.8-Max là một quyết định hoàn toàn khác — một hệ thống tiên tiến được lưu trữ có bảng giá và không thể tải xuống — và câu hỏi đúng không phải là cái nào tốt hơn mà là ràng buộc nào đang giới hạn: kết nối và giấy phép ở một bên, ngữ cảnh, phương thức và quy mô ở bên kia. Hầu hết các hệ thống thực tế cuối cùng đều cần cả hai câu trả lời.

A generated two-column scoreboard headed 'TwIL-LM3-Pro vs Qwen3.8-Max - the scoreboard' with six shared dimension rows. TwIL-LM3-Pro: Parameters 3.66B dense; Where it runs local download; Context 131,072 tokens; Input text only; Licence non-commercial; Cost no per-token fee. Qwen3.8-Max: Parameters 2.4T total, sparse MoE; Where it runs hosted endpoint; Context 1,000,000 tokens; Input text, image, video; Licence hosted commercial API; Cost $2.00 in / $6.00 out. A footer line reads 'Qwen3.8-Max specs per its OrcaRouter catalogue page; TwIL figures vendor-reported by webAI.' The OrcaRouter logo is composited in the bottom-right corner.A screenshot of the OrcaRouter model page for qwen/qwen3.8-max, showing the Qwen author line and release date 2026-08-03, the Vision, Tools, JSON and Reasoning capability badges, the vendor description positioning Qwen3.8-Max against GPT-5.5, Claude Opus 4.7 and Gemini 3.1 Pro, the /v1/chat/completions, /v1/messages and /v1/responses wire formats, and the $2.00 input and $6.00 output rates.A screenshot of the OrcaRouter model page for qwen/qwen3.8-max-0902, headed 'Qwen3.8 Max (0902)', showing the dated snapshot identifier, the Vision, Tools, JSON and Reasoning badges, text plus image and video input, and a 131K maximum output length field.

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày