
Perceptron Mk1.5 so với Qwen 3.8: Robot cần cả hai và không cái nào thay thế được cái kia
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 610 tok/s
- openaiMỚIOpenAI: GPT-6 Luna2026-09-2237Trí tuệ
- openaiMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- anthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- grokMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token · 189 tok/s
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
Một robot phải nhặt một thứ gì đó cần hai thứ từ một mô hình, và không mô hình đơn lẻ nào trong cặp này cung cấp cho bạn cả hai. Perceptron Mk1.5 trả về hình học: khi được cung cấp các khung hình video, nó có thể trả lại một điểm, một hộp, một đa giác hoặc một phần tử <track> có dấu thời gian, và cửa sổ ngữ cảnh của nó là 36.864 token. Qwen 3.8 — cái tên trỏ đến lõi Qwen3.8-2.4T-A95B trọng số mở của nhà cung cấp — là một bộ suy luận hỗn hợp chuyên gia 2,4 nghìn tỷ tham số với cửa sổ gốc 262K mở rộng tới một triệu, và nó chỉ xử lý văn bản, nên hoàn toàn không thể nhìn vào các khung hình. Một bên là lớp nhận thức có giá 0,15 USD và 1,50 USD mỗi triệu token; bên kia là lõi suy luận có chi phí đầu vào cao hơn khoảng mười ba lần và đầu ra cao hơn bốn lần, và có điểm độc lập là 40 trên Artificial Analysis Intelligence Index trong khi mô hình nhận thức không có điểm độc lập nào ở bất kỳ đâu.
Khi được đặt cạnh nhau như những sản phẩm cạnh tranh, chúng thua nhau theo những hướng ngược nhau, và sự so sánh chẳng tạo ra được gì dùng được. Khi được đặt cạnh nhau như hai nửa của một pipeline, chúng giải thích gần như mọi quyết định về chi phí và độ tin cậy trong một embodied stack: nơi các frame được diễn giải, nơi kế hoạch được lập, và điều gì xảy ra với hóa đơn của bạn khi nửa suy luận ghi nhiều token hơn mức tác vụ cần.
Sự chia tách khiến cho sự ghép cặp này trở nên hợp lý.
Perceptron Mk1.5 được phát hành vào ngày 25 tháng 9 năm 2026 với tư cách là bản kế nhiệm của Perceptron Mk1, và nhiệm vụ của nó được xác định một cách hẹp. Nó chấp nhận văn bản, hình ảnh, video và âm thanh, rồi trả về văn bản cùng chú thích có cấu trúc tùy chọn — điểm, hộp bao, đa giác, clip và track. Đầu ra <track> mang cả một quan sát không gian lẫn dấu thời gian mà nó thuộc về, nên một clip 60 giây được trả về dưới dạng các vị trí theo thời gian thay vì một phỏng đoán trung bình duy nhất. Trường asset_idx cho phép một yêu cầu duy nhất xử lý riêng nhiều hình ảnh hoặc video, đúng như điều mà so sánh khung tham chiếu với khung trực tiếp cần. Phản hồi có ràng buộc có hai dạng, JSON Schema và regex, và mục đích của cả hai là đầu ra có kiểu.
Qwen 3.8 là kiểu công cụ ngược lại. Lõi 2.4T là một MoE phân mịn — 92 lớp, 512 chuyên gia mỗi lớp với 10 chuyên gia được định tuyến cộng thêm một chuyên gia chia sẻ, và 69 trong số 92 lớp đó dùng attention tuyến tính — đó là cách một kiến trúc lớn đến vậy đạt tới ngữ cảnh dài của nó. Điểm mạnh của nó là suy luận xuyên qua lượng lớn văn bản: phân tích nhiều bước phức tạp, các suy diễn dài, lập kế hoạch kiểu tác tử. Điểm nó không làm được nằm ở phía đầu vào. Lõi mở chỉ có văn bản, và khả năng suy luận của nó không thể tắt đi: mọi phản hồi đều mở đầu bằng một khối suy nghĩ dù bạn có muốn hay không.
Đó không phải là khiếm khuyết ở một mô hình suy luận; đó là khiếm khuyết ở một mô hình nhận thức, và Qwen 3.8 không phải là một mô hình như vậy. Đặt hai mô hình cạnh nhau theo trình tự và hình dạng sẽ hiện rõ — Mk1.5 trả lời “xe nâng ở đâu và nó đã di chuyển khi nào”, Qwen 3.8 trả lời “với dữ kiện đó, cánh tay nên làm gì”. Cả hai câu hỏi đều không thể được trả lời bởi mô hình còn lại.

Mỗi nửa tốn bao nhiêu, theo mức giá thực tế được tính
• Đầu vào — Perceptron Mk1.5 $0,15 mỗi triệu token. Qwen 3.8 $2,00 mỗi triệu trên bản dựng được lưu trữ mà bộ kiểm thử độc lập đo lường, với mức chiết khấu cache 88% được áp dụng, đưa một lần cache hit xuống khoảng $0,24.
• Đầu ra — Mk1.5 $1.50 mỗi triệu. Qwen 3.8 $6.00 mỗi triệu.
• Cache — Đầu vào được cache của Mk1.5 là $0,0375 mỗi triệu, đúng bằng một phần tư mức giá đầu vào tiêu chuẩn của nó. Mức giảm giá của Qwen 3.8 dựa trên tỷ lệ phần trăm nhưng sâu hơn, ở mức 88%, vì vậy mức giá cache của nó rẻ hơn trong hai mức xét theo giá trị tuyệt đối, và mức giá không cache của nó cao hơn mức của Mk1.5 hơn mười lần.
• Chi phí cho mỗi tác vụ hoàn thành — đây chính là chỗ mà thứ hạng đảo ngược. Artificial Analysis đặt chi phí mỗi tác vụ Chỉ số Trí tuệ của Qwen 3.8 ở mức 2,16 USD, xếp thứ 32 trong số 115 trong cùng phân khúc và được chấm bốn trên bốn đơn vị về chi phí — rẻ trên mỗi tác vụ hoàn thành dù token đắt đỏ, bởi vì mô hình đã tạo ra 170 triệu token đầu ra qua các lần chạy chỉ số, so với một nhóm đối thủ còn nói dài dòng hơn nữa. Mk1.5 không có con số tương đương nào được ai công bố.
• Ngữ cảnh — 36.864 token cho Mk1.5 so với 262K gốc của lõi Qwen, có thể mở rộng tới một triệu với cấu hình phục vụ phù hợp.
• Kiểm soát suy luận — Mk1.5 cho phép đặt reasoning_effort ở mức high, medium, low, minimal hoặc none và mặc định là high. Qwen 3.8 khóa chế độ suy nghĩ ở trạng thái bật, nên bạn phải trả tiền cho các token suy nghĩ trong mỗi lần gọi.
Đọc danh sách đó hai lần, vì hai mô hình đảo ngược nhau về chi phí. Tính theo mỗi token, Mk1.5 rẻ hơn đáng kể. Tính theo mỗi tác vụ đã hoàn thành trên một benchmark độc lập, Qwen 3.8 được đo là rẻ còn Mk1.5 thì chưa được đo. Hai phát biểu đó chỉ mâu thuẫn nếu bạn cho rằng chúng đang chạy cùng một công việc, mà thực tế thì không phải vậy.

Bằng chứng ở đây lại chỉ ra điều ngược lại
Trong phần lớn các so sánh của lô này, phía trọng số mở là bên có một loạt số liệu do nhà cung cấp báo cáo, còn API đóng là bên có một trang của bên thứ ba. Ở đây thì ngược lại, và việc đảo ngược này đáng được nêu rõ bởi vì nó thay đổi những gì bạn có thể và không thể xác minh.
Qwen 3.8 có phép đo độc lập. Chỉ số Trí tuệ Artificial Analysis xếp lõi 2.4T ở mức 40, đứng thứ 5 trong số 115 mô hình cùng loại ở thời điểm viết bài, với tốc độ đầu ra 39,6 token mỗi giây — thứ 56 trong số 115, tức mức trung bình và đáng để biết trước khi bất kỳ ai lên kế hoạch cho một vòng lặp tương tác xoay quanh nó. Các bản sửa đổi chỉ số thay đổi giữa các ảnh chụp nhanh và cách trung thực để đọc bất kỳ con số nào trong số này là xem chúng mang tính định hướng, nhưng luận điểm vẫn đứng vững: ai đó ngoài Alibaba đã chạy mô hình này và công bố một con số.
Perceptron Mk1.5 không có thứ như vậy. Không có mục Artificial Analysis nào và không có điểm arena nào cho Mk1.5 hay bản tiền nhiệm của nó, nên mọi con số năng lực đang tồn tại đều do Perceptron tạo ra về mô hình của chính Perceptron. Bộ số liệu đó đặc biệt cụ thể, một điểm có lợi — 0.9433 trên egocentric hand_box so với 0.4467 của Gemini 3.1 Pro trong chính lần chạy của nhà cung cấp; EgoSchema 80.40 so với 81.20 của cùng đối thủ, một thất bại sát nút trên benchmark hiểu rộng, bên cạnh lợi thế 12% được tuyên bố trên tập con EgoSchema khó hơn ở mức 63.75; 0.647 centre-F1 và 0.628 point-HOTA trên Molmo2-Track — nhưng cụ thể và được xác minh độc lập là hai thuộc tính khác nhau, và chỉ thuộc tính thứ hai mới cho bạn biết điều gì sẽ xảy ra trên cảnh quay của bạn.
Hai lưu ý khi đọc bảng của Perceptron, cả hai đều áp dụng cho bất kỳ trích dẫn nào về bảng đó. Con số 56.0 của LiveVQA-W khi bật công cụ đến từ bỏ phiếu đa số bốn mẫu, trong khi 53.2 mà nó được đặt đối chiếu cho Gemini 3.8 Flash với Google Search grounding thì không phải bỏ phiếu đa số; kỹ thuật này là chính đáng và nó làm điểm số trông đẹp hơn so với một lượt greedy duy nhất. Và dòng tracking liệt kê Qwen3-VL-8B ở mức 0.180 centre-F1 lấy từ bài báo của mô hình đó, nằm cùng cột với các con số đo lường cho một họ checkpoint khác. Một con số từ bài báo nằm trong một cột đo lường không phải là một dòng so sánh tương đương, và nó đúng là kiểu dòng bị trích dẫn mà không kèm nguồn gốc.
Lõi 2.4T không phải là thứ bạn có thể gọi từ chúng tôi — nhưng kiến trúc của nó thì có.

Đây là phần của so sánh mà câu trả lời trung thực khác với điều mà sự nổi tiếng của mô hình gợi ý. Qwen 3.8, xét như một cái tên, được dùng rộng rãi để chỉ lõi mở, và lõi mở là một bản tải xuống, không phải một endpoint: 2,4TB trọng số BF16 theo giấy phép Qwen3.8-Max tùy chỉnh của Alibaba, được công bố vào tháng 8 năm 2026. Chúng tôi không phục vụ nó, và hiện không có nhà cung cấp nào phục vụ nó ở phía chúng tôi — mục trong danh mục tồn tại như một trang theo dõi đã được công bố, chưa khả dụng, chứ không phải một tuyến đang hoạt động.
Thứ chúng tôi phục vụ là API chủ lực, được xây dựng trên chính kiến trúc 2.4T. Nó đang hoạt động với tên qwen/qwen3.8-max ở mức $2.00 và $6.00 mỗi triệu token, mức giá của chính Alibaba được chuyển thẳng qua với không cộng thêm gì trên mỗi token, mang cửa sổ đa phương thức 1M token — đầu vào văn bản, hình ảnh và video — cùng thiết kế attention lai giống như phần lõi mở. Nếu nửa suy luận của bạn cần nhìn thấy bất cứ điều gì, thì đó chính là tuyến đó, và cũng là tuyến mà một thay đổi giá từ nhà cung cấp sẽ rơi xuống phía chúng tôi ngay trong cùng ngày thay vì vào kỳ thanh toán tiếp theo của bạn. Song song đó, chúng tôi phục vụ người anh em dense của Alibaba là qwen/qwen3.8-27b trên hạ tầng của chính chúng tôi với mức $0.33 và $2.40 mỗi triệu, cùng cửa sổ 262.144 token và đầu vào văn bản, hình ảnh và video, cho những trường hợp mà một bộ suy luận 27B là đủ và chỉ số 40 của 2.4T là nhiều hơn mức tác vụ cần.
Kết nối hai nửa mà không cần hợp đồng thứ hai
Lý do thực tế khiến việc ghép cặp này quan trọng hơn lập luận benchmark là một ngăn xếp hiện thân vốn đã là hai mô hình, và chi phí tích hợp mô hình thứ ba chính là thứ âm thầm giết chết thiết kế. Mk1.5 không có trong danh mục của chúng tôi, nên để tiếp cận nó phải dùng API của chính nhà cung cấp — pip install "perceptron>=0.4.0", khóa trong PERCEPTRON_API_KEY, endpoint api.perceptron.inc. Phần Qwen chỉ cách một khóa.
Nơi một gateway khẳng định được giá trị của mình là ở điểm nối. Một quy tắc định tuyến gửi mọi khung hình kèm câu hỏi đến mô hình nhận thức và mọi kế hoạch chỉ có văn bản đến mô hình suy luận chỉ là một dòng cấu hình khi cả hai đều nằm sau một endpoint tương thích với OpenAI, và khả năng chuyển đổi dự phòng tự động nghĩa là sự cố từ phía nhà cung cấp ở bên nào cũng sẽ thoái hóa thành một phương án dự phòng thay vì một robot bị đình trệ. Một API bao phủ hơn 200 mô hình với giá niêm yết được chuyển nguyên ở mức chênh lệch 0% cũng là cách rẻ nhất để trả lời câu hỏi mà bài viết này không thể trả lời: liệu tác vụ theo dõi đối tượng của bạn có thực sự cần đến tọa độ của Mk1.5 hay không, hay liệu một mô hình thị giác tổng quát với cửa sổ lớn hơn nhiều cùng một điểm số độc lập đã là đủ. Việc định tuyến một phần lưu lượng thực giữa các ứng viên và đo lường trên chính các khung hình của bạn tốn ít chi phí hơn bất kỳ nghiên cứu đánh giá chuẩn nào mà bạn có thể đặt hàng.
Làm gì với cái này, một cách cụ thể
Nếu bạn đang tích hợp năng lực tri giác vào một hệ thống vật lý, Perceptron Mk1.5 là mô hình duy nhất trong cặp này trả lời bằng tọa độ, và đó là một năng lực chứ không phải một điểm số — hãy kiểm chứng tuyên bố hand-box trên video của chính bạn, đặt reasoning_effort một cách có chủ đích thay vì chấp nhận mặc định cao, và dự trù cho cửa sổ 36.864 token như một ràng buộc cứng chứ không phải ràng buộc mềm. Nếu bạn đang xây dựng lớp suy luận bên trên nó, Qwen 3.8 được đo ở những chỗ mà Mk1.5 không được đo, và chi phí cho mỗi tác vụ hoàn thành mới là con số để bạn lập kế hoạch dựa vào, chứ không phải mức $2,00 được nêu trên tiêu đề — với lưu ý rằng không thể tắt khả năng suy nghĩ của nó, nên một tác vụ không cần chuỗi suy luận vẫn đang phải trả tiền cho một chuỗi như vậy.
Những đội làm sai điều này là những đội cố bắt một mô hình làm cả hai việc. Một mô hình chuyên về nhận thức 36.864 token sẽ không giữ được lịch sử vận hành, và một mô hình lập luận 2,4T chỉ văn bản sẽ không bao giờ nhìn thấy khung hình. Việc ghép cặp này không phải là sự thỏa hiệp giữa hai sản phẩm. Đó chính là sự phân công lao động thực sự, và câu hỏi hữu ích chỉ là mỗi lệnh gọi của bạn thuộc về phía nào trong sự phân công đó.
So sánh trong bài viết này1
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
