Thẻ tiêu đề được tạo mang tiêu đề "Union Alpha vs Qwen3.8 Flash" với phụ đề "Cách nhau một điểm trên bài kiểm tra duy nhất đã chạy cả hai", phía trên ba thẻ bo tròn ghi "Official A: 136/157 so với 137/157", "Ngữ cảnh: 262,144 so với 1.000.000 token", và "Thời gian đến token đầu tiên: 10.00 s so với 6.62 s". Chân trang ghi Official A theo SMF Clearinghouse với độ trễ theo OrcaRouter trong 7 ngày qua.
Guides & Insights

Union Alpha vs Qwen3.8 Flash: Một Điểm Là Cả Câu Chuyện

Tác giả

Gideon Frost

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Union Alpha và Qwen3.8 Flash chỉ cách nhau một điểm trên bài kiểm tra duy nhất đã đo lường cả hai. Trên bộ SMF Clearinghouse Official A — 157 bài kiểm tra, tắt suy luận — Union Alpha đạt 136 điểm và một lần chạy cục bộ của Qwen3.8-Flash-Next đạt 137 điểm. Đó là kết quả đối đầu trực tiếp sát nút nhất mà mỗi mô hình từng có, và nó cũng là con số gây nhầm lẫn nhất trong so sánh này, bởi vì hai mục không chạy trong cùng điều kiện và chỉ một trong số đó là mô hình bạn thực sự có thể thuê ngay lúc này.

Khoảng cách một điểm cho bạn biết điều gì và không cho bạn biết điều gì

Hãy bắt đầu với những gì nó xác lập. Union Alpha không phải là một trò lừa bịp theo nghĩa tầm thường — một bộ kiểm thử rộng gồm 157 bài với 0 lỗi, suy luận hoàn hảo (30/30) và sử dụng công cụ hoàn hảo (2/2) không phải là thứ mà một endpoint rỗng tuếch tạo ra. Kết quả lập trình 26/30 và toán 24/30 của nó đặt nó vào vùng đáng tin cậy, còn điểm viết 2/5 khiến nó chẳng ở đâu gần công việc văn xuôi đa dụng.

Giờ đến những lưu ý, vốn mang tính trụ cột.

Mục Qwen3.8 Flash là một lần chạy cục bộ của Qwen3.8-Flash-Next — bản checkpoint trọng số mở — chứ không phải API Qwen3.8 Flash được lưu trữ. Phục vụ cục bộ nghĩa là lượng tử hóa của riêng bạn, ngăn xếp suy luận của riêng bạn, trình phân tích cú pháp gọi công cụ của riêng bạn. Không có thứ nào trong số đó được đảm bảo khớp với những gì endpoint được lưu trữ trả về, và những người thực hiện bài kiểm tra đã đánh dấu so sánh này là không mang tính quyết định vì đúng lý do đó.

Một bộ đánh giá không phải là một hồ sơ năng lực. Official A thì rộng nhưng nông ở từng hạng mục: công cụ chỉ có 2 bài kiểm thử. Một hạng mục công cụ chỉ với hai bài kiểm thử đạt 2/2 là một dấu hiệu tốt, chứ không phải bằng chứng về độ tin cậy agentic, và Union Alpha được định vị rõ ràng là một mô hình agentic và lập trình. Công cụ này đang đo một thứ gì đó cận kề với tuyên bố.

Và bản thân điểm đó nằm trong độ nhiễu của một bộ 157 bài kiểm tra. Hãy coi 136 và 137 là “chúng nằm trong cùng một dải”, chứ không phải là một thứ hạng.

Kề bên nhau

• Cửa sổ ngữ cảnh — Union Alpha 262.144 token so với Qwen3.8 Flash 1.000.000 token được phục vụ (262.144 gốc, mở rộng qua YaRN).

• Đầu ra tối đa — Union Alpha 131.072 token so với Qwen3.8 Flash 131.000 token. Thực tế là ngang nhau.

• Đầu vào — văn bản và hình ảnh trên Union Alpha so với văn bản, hình ảnh và video trên Qwen3.8 Flash.

• Giá — $0 trong giai đoạn xem trước của Union Alpha so với Qwen3.8 Flash ở mức $0.150/M đầu vào, $0.470/M đầu ra, $0.018/M đọc từ bộ nhớ đệm, $0.230/M ghi vào bộ nhớ đệm.

• Điều khiển suy luận — không có trên Union Alpha so với chế độ suy nghĩ trên Qwen3.8 Flash mặc định bật và có thể tắt.

• Thời gian đến token đầu tiên — Union Alpha 10,00 giây p50 so với Qwen3.8 Flash 6,62 giây p50, cả hai đều được đo trên endpoint của chúng tôi trong cùng cửa sổ bảy ngày. Tốc độ giải mã thô gần nhau hơn so với những gì danh tiếng gợi ý: 170 token mỗi giây so với 103.

• Nguồn gốc — nhà vận hành ẩn danh, không công bố trọng số, so với Alibaba/Qwen, với trọng số Qwen3.8-Flash-Next được mã nguồn mở trên Hugging Face và ModelScope.

Generated two-column comparison scoreboard for Union Alpha and Qwen3.8 Flash. Union Alpha column: context window 262,144 tokens, max output 131,072 tokens, text and image input, $0 preview price, no published weights, 10.00 s p50 time to first token. Qwen3.8 Flash column: context window 1,000,000 tokens served, max output 131,000 tokens, text, image and video input, $0.150 input and $0.470 output per 1M tokens, Qwen3.8-Flash-Next weights open-sourced, 6.62 s p50 time to first token. Footer reads Official A per SMF Clearinghouse with latency and errors per OrcaRouter over the last 7 days.

Qwen3.8 Flash: một canh bạc vào hiệu quả với 6B tham số hoạt động

Qwen3.8 Flash ra mắt vào ngày 26 tháng 8 năm 2026 với tư cách là phiên bản sản xuất, được quản lý của checkpoint open-weight Qwen3.8-Flash-Next, mà Alibaba đã phát hành đồng thời. Đây là mô hình mixture-of-experts 125 tỷ tham số, kích hoạt khoảng 6 tỷ tham số mỗi token, cộng thêm 51 tỷ tham số embedding N-gram, được xây dựng trên cơ chế attention lai kết hợp Gated DeltaNet với một bộ đánh chỉ mục sparse-attention.

Cách định khung của nhà cung cấp xoay quanh hiệu quả kinh tế trong huấn luyện: Alibaba báo cáo chi phí chạy chỉ bằng khoảng một phần chín so với Qwen3.7-Plus, với tuyên bố prefill nhanh hơn tới 7,6× và decode nhanh hơn tới 4,9× trên khối lượng công việc 1 triệu token có tỷ lệ cache hit cao. Đó là các số liệu của nhà cung cấp và chưa được tái lập độc lập.

Bảng benchmark của nó cũng do nhà cung cấp tự báo cáo và chưa được tái lập: SWE-bench Pro 62.5, DeepSWE v1.1 58.7, SWE-bench Multilingual 81.0, NL2Repo 48.1, CoWorkBench 73.9, JobBench 55.7, RealWorldQA 88.5, LVBench 76.6, AndroidWorld 84.5. Con số đáng để đem ra đối chất với đội marketing là Humanity's Last Exam ở mức 35.9, thấp hơn mức 40.0 của Claude Opus 4.6 trong cùng phép so sánh.

Trên trang mô hình của chính chúng tôi, phần benchmark công khai vẫn ghi là "đang chờ" — chưa có bên thứ ba nào chấm điểm nó. Thứ chúng tôi có là lưu lượng của chính mình: thời gian đến token đầu tiên trung vị là 6,62 giây, tốc độ đầu ra 103 token mỗi giây, và tỷ lệ lỗi 4,5%. Tỷ lệ lỗi đó đủ cao để đáng theo dõi, và đó là kiểu con số chỉ xuất hiện khi bạn đo một endpoint đang chạy thay vì đọc một bài đăng ra mắt.

The OrcaRouter model page for Qwen3.8 Flash, showing a 1M-token context window, 131K max output, text plus image and video input, $0.15 per million input tokens and $0.47 per million output tokens, a p50 time to first token of 6.62 s, and 2,322.0M tokens of traffic over seven days.

Union Alpha: mô hình không có chủ sở hữu

Union Alpha xuất hiện trên các danh mục của bên thứ ba vào ngày 16 tháng 9 năm 2026 và được cung cấp trên gói miễn phí của OrcaRouter. Nó không có phòng thí nghiệm nào được nêu tên, không có trọng số, không có giấy phép, không có số lượng tham số và không có ghi chú về kiến trúc. Trường nhà cung cấp của nó ghi là "Stealth".

Endpoint của nó, ít nhất, thì rõ ràng: ngữ cảnh 262,144 token, đầu ra tối đa 131,072 token, đầu vào văn bản và hình ảnh với đầu ra chỉ văn bản, gọi công cụ, đầu ra JSON, temperature, top_p và max_tokens, và hoàn toàn không có điều khiển suy luận. Lựa chọn công cụ trên thực tế chỉ chấp nhận "auto". Thời gian miễn phí của nó được mô tả là khoảng một tuần, bị giới hạn tần suất, với giá sau bản xem trước vẫn chưa được công bố.

Tuyên bố được đưa ra — “hiệu năng ở mức tiên phong trên một phạm vi rộng các tác vụ đa dụng” — do đơn vị vận hành báo cáo và chưa được kiểm toán. Kết quả 136/157 của Official A là phép đo độc lập duy nhất hiện có.

The OrcaRouter model page for Union Alpha (Free), listed under the stealth vendor, showing a FREE badge, a 262K-token context window, 131K max output, text and image input with text output, and pricing shown as Free and rate-limited with model usage at $0.

Tốc độ là lúc chúng không còn trông giống nhau nữa.

Các con số thông lượng nổi bật không phân tách chúng theo cách bạn mong đợi, và lý do đằng sau điều đó rất đáng để tìm hiểu.

Dựa trên dữ liệu đo từ xa định tuyến của chính chúng tôi trong bảy ngày qua, Qwen3.8 Flash truyền phát ở tốc độ 103 token đầu ra mỗi giây với thời gian đến token đầu tiên p50 là 6,62 giây và tỷ lệ lỗi 4,5%. Union Alpha, được đo theo cùng cách, truyền phát ở tốc độ 170 token mỗi giây. Xét về tốc độ giải mã thô, mô hình ẩn danh là mô hình nhanh hơn trong hai mô hình.

Điều mà nó không làm được là khởi động. p50 và p95 thời gian-tới-token-đầu-tiên của Union Alpha đều bị ghim ở mức 10,00 giây, nghĩa là ít nhất một nửa số yêu cầu phải chờ mười giây hoặc lâu hơn trước khi token đầu tiên xuất hiện, và tỷ lệ lỗi của nó trong cùng khoảng thời gian đó là 7,7% — gấp khoảng 1,7 lần Qwen. Lần chạy Official A gồm 157 bài kiểm tra mà các phần trước dựa vào mất 4,6 giờ đồng hồ thực, với độ trễ trung vị là 91,9 giây và giá trị trung bình là 104,8 giây mỗi bài kiểm tra, cùng bốn bài kiểm tra chạm ngưỡng hết giờ 300 giây của harness. Những người kiểm thử độc lập đã chạy nó vào ngày ra mắt báo cáo thông lượng thấp hơn nhiều so với mức mà endpoint của chúng tôi thể hiện, đúng như điều bạn có thể mong đợi ở một dịch vụ vẫn đang hấp thụ một khối lượng tải khổng lồ trong ngày đầu tiên.

Vậy nên khác biệt thực tế không nằm ở tốc độ giải mã. Mà nằm ở thời gian đến token đầu tiên và độ tin cậy. Union Alpha không dùng được cho bất kỳ thứ gì mang tính tương tác — không tự động hoàn thành, không trợ giúp nội tuyến, không vòng lặp agent chặt chẽ — vì mười giây im lặng thì không thể phân biệt với việc bị treo. Nó phù hợp với công việc bất đồng bộ: các tác vụ chạy theo lô qua đêm, những lượt xử lý tài liệu dài, các lượt chạy đánh giá ngoại tuyến khi không có gì đang chờ token đầu tiên và tỷ lệ thất bại 7,7% sẽ được hấp thụ bằng một lần thử lại.

Qwen3.8 Flash đạt 103 token mỗi giây với thời gian trung vị để có token đầu tiên là 6,62 giây cũng không nhanh. Nói một cách trung thực thì cả hai đều chậm, và chỉ một trong hai gặp lỗi với khoảng một trên mười ba yêu cầu.

Lập luận về hiệu quả, và ai mới có quyền đưa ra nó

Alibaba đưa ra một lập luận về chi phí huấn luyện: chi phí huấn luyện bằng một phần chín so với Qwen3.7-Plus, sáu tỷ tham số hoạt động trên mỗi token, nên rẻ để phục vụ. Đó là một tuyên bố về một mô hình mà trọng số đã tồn tại và nguồn gốc của nó được ghi chép lại.

Câu chuyện hiệu quả của Union Alpha được ngụ ý chứ không được nói rõ — một mô hình ẩn danh 256K được gọi miễn phí. Miễn phí không đồng nghĩa với rẻ. Ai đó đang trả tiền cho những GPU đó, bản xem trước có thời điểm kết thúc được nêu rõ, và việc chính đơn vị vận hành thừa nhận rằng họ đang tinh chỉnh để tăng tốc cho thấy kinh tế phục vụ vẫn chưa ổn định. Một mô hình miễn phí trong một tuần và không thể định giá sau đó có lập luận về hiệu quả sẽ hết hạn cùng với cửa sổ đó.

Thử điều chưa biết mà không đặt cược vào nó

Lý do cặp đối đầu cụ thể này đáng để bạn ghi nhớ trong đầu là vì nó là bài kiểm tra rẻ nhất có thể đối với một mô hình chưa được chứng minh. Qwen3.8 Flash là đại lượng đã biết: nhà cung cấp có tên tuổi, trọng số mở, các benchmark được công bố (dù mang hơi hướng nhà cung cấp), mức giá thực tế trên mỗi token là $0.150/$0.470. Union Alpha là ẩn số, có giá bằng không, với toàn bộ tuyên bố cạnh tranh chỉ dựa trên một kết quả 157 bài kiểm tra.

Thay vì chọn lựa, hãy đặt ẩn số phía sau một quy tắc chuyển đổi dự phòng. OrcaRouter chuyển tiếp đúng giá niêm yết của nhà cung cấp với 0% lợi nhuận chênh lệch và hỗ trợ chuyển đổi dự phòng tự động giữa các nhà cung cấp, nên một endpoint Union Alpha bị giới hạn tốc độ hoặc biến mất sẽ tự động chuyển sang một model vẫn đang phản hồi, thay vì hiện lên thành một job thất bại lúc 3 giờ sáng. Cả hai model dùng chung một key, nên thử nghiệm chỉ tốn một thay đổi cấu hình thay vì phải tích hợp thêm lần thứ hai — và không cái nào phải là quyết định mà bạn cần bảo vệ, vì bạn có thể đảo hướng định tuyến khi cửa sổ miễn phí đóng lại.

Phán quyết

Qwen3.8 Flash là mô hình để xây dựng dựa trên. Sáu tỷ tham số hoạt động, trọng số của các mô hình anh em được mở nguồn, cửa sổ 1M token, đầu vào video, tốc độ 103 token mỗi giây chạy được thực tế, và một mức giá công bố mà bạn có thể dự báo. Các điểm chuẩn của nó do nhà cung cấp báo cáo và tỷ lệ lỗi của nó đáng để theo dõi, nhưng nó thuộc về một ai đó và người đó đang tung sản phẩm ra.

Union Alpha là mô hình để đo lường. Khoảng cách một điểm trên Official A thực sự thú vị — nó gợi ý rằng dù thứ này là gì, nó không phải là đồ chơi — và ở mức $0 với giới hạn đầu ra 131K cùng đầu vào thị giác, nó đáng để bạn dành một tuần chú ý. Nhưng khoảng cách một điểm trên một bộ đánh giá, do một đơn vị vận hành ẩn danh tạo ra với tỷ lệ lỗi 7,7%, là lý do để tìm hiểu chứ không phải lý do để chuyển sang.

Điều đáng để ý chính là thứ luôn giải quyết được chuyện này: một cái tên. Ox Alpha, mục trước đó trong loạt này, đã lộ diện sáu ngày sau khi xuất hiện với tên gọi Zhipu's GLM-5.3-Flash. Nếu Union Alpha có một cái tên, cuộc so sánh sẽ không còn là về một điểm số nữa mà bắt đầu là về giá.

Đại lượng đã biết đã được niêm yết giá và ghi lại trong tài liệu: trang mô hình Qwen3.8 Flashhiển thị mức giá $0.150/$0.470, ngữ cảnh phục vụ 1M token và giới hạn đầu ra 131K, trong khi các chỉ số đánh giá công khai vẫn đang chờ.