Một thẻ tiêu đề được tạo ghi "Ember-1 vs Qwen3.8-Max" với tiêu đề phụ "Một bản phái sinh tiết kiệm token đối đầu với sản phẩm flagship", phía trên hai thẻ: Ember-1 — "tuyên bố dùng ít hơn 40% token" và "không công bố giá"; Qwen3.8-Max — "2 đô vào, 6 đô ra" và "ngữ cảnh 1 triệu token".
Guides & Insights

Ember-1 so với Qwen3.8-Max: Bản phái sinh tiết kiệm token đối đầu với mẫu flagship

Tác giả

Alistair Wren

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Hai mô hình trong cuộc so tài này đều có một con số thực tế trên cùng một benchmark, mà vẫn không giải quyết được điều gì. Ember-1 là phiên bản dẫn xuất chuyên biệt của Fireworks Research dựa trên Kimi K3 của Moonshot AI, công bố ngày 23 tháng 9 năm 2026, báo cáo đạt 82,0% trên Terminal Bench 2.1 với lượng token chỉ bằng khoảng một nửa so với mô hình cơ sở của nó. Qwen3.8-Max là mô hình chủ lực của Aliba​ba — một mô hình mixture-of-experts thưa với khoảng 2,4 nghìn tỷ tham số, trong đó khoảng 95 tỷ tham số hoạt động mỗi token — được cung cấp rộng rãi từ ngày 3 tháng 8 năm 2026, báo cáo đạt 86,6% trên cùng benchmark. Cả hai con số đó đều do nhà cung cấp báo cáo, cả hai phòng thí nghiệm đều tự chạy khung đánh giá của riêng mình, và khoảng cách 4,6 điểm giữa hai thiết lập đánh giá chưa công bố không phải là một phán quyết. Điều có thể so sánh được là tiền, và đó là chỗ cuộc so tài này trở nên thú vị: toàn bộ luận điểm của một mô hình là bạn không nên trả tiền cho những token mình không cần, còn mô hình kia là một mô hình chủ lực có giá $2 mỗi triệu token đầu vào và $6 mỗi triệu token đầu ra.

Mỗi mô hình thực sự là gì

Ember-1 không phải là một mô hình mới theo bất kỳ ý nghĩa kiến trúc nào. Đây là Kimi K3 được huấn luyện lại để suy luận súc tích hơn, do Fireworks Research xây dựng qua hơn 50 thí nghiệm huấn luyện và hơn 200 đánh giá trên ngăn xếp huấn luyện serverless của chính mình. Tuyên bố của phòng thí nghiệm là suy luận của K3 dài hơn mức các nhiệm vụ yêu cầu và phần dư thừa có thể được loại bỏ mà không làm thay đổi câu trả lời — độ dài suy luận giảm 35–50% mà không mất độ chính xác trên bảy bộ chuẩn đánh giá và hai thử nghiệm A/B trong sản xuất của khách hàng. Nó có sẵn dưới dạng bản xem trước nghiên cứu trên nền tảng serverless của chính nhà cung cấp, không công bố trọng số và không công bố giá.

Qwen3.8-Max là một loại đối tượng hoàn toàn khác. Nó là tầng tiên phong của Aliba​ba, đa phương thức gốc cho đầu vào văn bản, hình ảnh và video, mang cửa sổ ngữ cảnh một triệu token, và đã được làm mới hai lần kể từ khi ra mắt: một bản cập nhật hậu huấn luyện vào ngày 2 tháng 9 năm 2026 nhắm vào lập trình và công việc văn phòng chuyên nghiệp, và một tầng phục vụ nhanh hơn được công bố vào ngày 22 tháng 9 năm 2026. Aliba​ba định vị nó đối đầu với GPT-5.5, Claude Opus 4.7 và Gemini 3.1 Pro, và bảng đánh giá đã công bố của nó phản ánh tham vọng đó — GPQA Diamond 92.6, OSWorld-Verified 86.1, SWE-bench Pro 67.7, PaperBench 93.0, IFBench 82.8 và Humanity's Last Exam ở mức 43.6, tất cả đều do nhà cung cấp báo cáo.

A two-column scoreboard titled "Ember-1 vs Qwen3.8-Max — the scoreboard" comparing six dimensions. Ember-1: input/output price not published, computed from Kimi K3 rates of $3 and $15; context not published, base model carries 1M; text input; Terminal Bench 2.1 82.0% vendor-reported; research preview with a two-week window; not routed on OrcaRouter. Qwen3.8-Max: $2.00 in and $6.00 out per 1M tokens; 1,000,000-token context; text, image and video input; Terminal Bench 2.1 86.6% vendor-reported; generally available and priced; routed on OrcaRouter. The footer notes both Terminal Bench figures are vendor-reported and were produced on different harnesses.

Các bảng giá, đặt cạnh nhau

Một trong hai cái này có giá, còn cái kia thì không, và đó là sự bất đối xứng thực tiễn đầu tiên.

• Đầu vào — Ember-1: không có công bố nào; bảng tính benchmark tính số đô-la từ bảng giá của Kimi K3. Qwen3.8-Max: $2,00 mỗi một triệu token trên OrcaRouter.

• Đầu ra — Ember-1: không công bố. Qwen3.8-Max: 6,00 USD mỗi triệu token.

• Đầu vào đã lưu đệm — Ember-1: không áp dụng. Qwen3.8-Max: $0.25 mỗi triệu token cho lượt đọc từ bộ nhớ đệm, tức bằng một phần tám mức giá đầu vào và cực kỳ quan trọng trong các vòng lặp agent, nơi cùng một ngữ cảnh được gửi lại mỗi lượt.

• Cửa sổ ngữ cảnh — Ember-1: không được công bố cho bản xem trước; mô hình cơ sở của nó chứa 1.048.576 token. Qwen3.8-Max: 1.000.000 token.

• Tính đa phương thức — Ember-1: văn bản. Qwen3.8-Max: đầu vào văn bản, hình ảnh và video, đầu ra văn bản.

• Trọng số — Ember-1: không có. Qwen3.8-Max: có một bản phát hành trọng số mở, nhưng chỉ hỗ trợ văn bản và thiếu cửa sổ ngữ cảnh đầy đủ cùng đầu vào thị giác của endpoint được phục vụ.

• Truy cập — Ember-1: bản xem trước nghiên cứu, cửa sổ serverless hai tuần, sự tồn tại lâu dài gắn với nhu cầu. Qwen3.8-Max: được cung cấp rộng rãi và có giá.

Lưu ý một điều về mức giá Qwen3.8-Max trước khi mô hình hóa bất cứ điều gì: Alibaba đã nhiều lần sửa đổi cách đóng gói mô hình này kể từ khi ra mắt, và bảng giá quốc tế không phải lúc nào cũng khớp với mức công bố hồi tháng 8. Hãy coi $2.00 và $6.00 là giá tuyến hiện tại trên nền tảng của chúng tôi — nền tảng chuyển nguyên giá niêm yết của nhà cung cấp mà không cộng thêm markup, nên thay đổi từ nhà bán sẽ hiển thị ngay trong cùng ngày — và hãy kiểm tra bảng giá trước khi bạn phân bổ ngân sách cho nó.

Tại sao so sánh benchmark không hoạt động

82,0% của Ember-1 và 86,6% của Qwen3.8-Max đều là Terminal Bench 2.1, điều đó khiến chúng trông có vẻ có thể so sánh được, nhưng không có nghĩa là chúng có thể so sánh được với nhau. Bảng đánh giá của Ember-1 báo cáo con số của mình so với các biến thể Kimi K3 được Fireworks Research đánh giá, trên 89 mẫu, kèm theo các chênh lệch token và chi phí. Con số của Qwen3.8-Max đến từ bảng đánh giá của chính Alibaba. Các phòng thí nghiệm khác nhau, các harness khác nhau, các scaffold agent khác nhau, và trong một benchmark mà điểm số có thể thay đổi vài điểm chỉ vì lựa chọn scaffold, khoảng cách 4,6 điểm nằm trong ngưỡng nhiễu của phương pháp luận.

Điều bạn có thể đọc được từ bảng của Ember-1 là cột token, thứ duy nhất mà mô hình được huấn luyện để thay đổi. So với bản nền của chính nó, Ember-1 dùng ít hơn 51,9% token trên Terminal Bench 2.1, ít hơn 32,5% trên SWE-Interact, ít hơn 23,7% trên DeepSWE 1.1 và chỉ ít hơn 5,9% trên τ-2 Bench Airline. Mức chênh lệch ấy mới là thông điệp trung thực. Một mô hình cắt giảm việc cân nhắc kỹ càng thì đáng giá rất nhiều trên những benchmark mà mô hình nền suy nghĩ quá nhiều, và gần như chẳng đáng gì ở những nơi nó không như vậy, và bạn không thể biết mình đang có loại khối lượng công việc nào nếu không tự đo đạc trường hợp của chính mình.

Chi phí trên mỗi tác vụ đã hoàn thành, đã xử lý xong

Đây là phép tính thực sự quyết định điều này, sử dụng mức giá đã công bố của Kimi K3 làm đại diện cho chi phí của Ember-1, vì Ember-1 không có mức giá nào. Kimi K3 là $3.00 cho mỗi triệu token đầu vào, $0.30 cho token được cache và $15.00 cho đầu ra — đúng bằng bảng giá mà Fireworks Research đã dùng trong so sánh của chính mình. Qwen3.8-Max là $2.00 cho đầu vào và $6.00 cho đầu ra, với lượt đọc cache ở mức $0.25.

Về phía đầu vào, Qwen3.8-Max vốn đã rẻ hơn một phần ba. Về phía đầu ra, nó rẻ hơn 2,5 lần trên mỗi token. Điều đó có nghĩa là việc giảm token của Ember-1 không cạnh tranh với một hóa đơn cố định — nó đang cạnh tranh với một mô hình hàng đầu vốn đã rẻ hơn trên mỗi token trước khi bất kỳ nỗ lực tối ưu hiệu suất nào diễn ra. Thử nghiệm A/B trên môi trường sản xuất của chính Fireworks Research cho thấy số token đầu ra giảm từ 49,3K xuống 29,9K, tức mức giảm tổng cộng 39%; áp dụng điều đó vào mức giá đầu ra của Qwen3.8-Max thì bạn cũng có được mức tiết kiệm 39% tương tự, nhưng đó là một khoản lợi tuyệt đối nhỏ hơn so với việc áp dụng cùng tỷ lệ phần trăm đó vào mức giá 15 đô la của K3.

Do đó, lập luận về hiệu quả của Ember-1 là mạnh nhất khi đo với chính mô hình cơ sở của nó, và đó chính xác là lập luận mà bản phát hành đưa ra. Khi đối chiếu với Qwen3.8-Max, so sánh chuyển sang năng lực trên mỗi đô la, nơi ngữ cảnh lớn hơn, đầu vào đa phương thức và khả năng sẵn có được định giá của mô hình chủ lực là những lập luận phản bác — và nơi chưa ai công bố một so sánh đối đầu trực tiếp có thể phân định điều đó.

A screenshot of OrcaRouter's model page for Qwen3.8 Max, showing the qwen/qwen3.8-max listing priced at $2.00 per 1M input tokens and $6.00 per 1M output tokens, a p50 time-to-first-token of 1.98s, 33.3M tokens of traffic over seven days, a 1M-token context window accepting text, image and video, and a Python snippet calling api.orcarouter.ai/v1.

Dữ liệu định tuyến của chính chúng tôi cho thấy điều gì

Hai trong số ba mô hình liên quan ở đây là các tuyến đang hoạt động trên OrcaRouter, mang lại một góc nhìn mà không bảng điểm chuẩn nào có được. Qwen3.8-Max được phục vụ với ngữ cảnh 1.000.000 token, độ trễ token đầu tiên trung vị khoảng 2,0 giây và khoảng 52,7 token đầu ra mỗi giây trong bảy ngày qua, với tỷ lệ lỗi khoảng 4,2%. Kimi K3 — mô hình nền tảng của Ember-1, và là điểm tham chiếu cho mọi khoản tiết kiệm mà Ember-1 tuyên bố — chạy ở ngữ cảnh 1.048.576 token, độ trễ trung vị gần 8,0 giây, khoảng 43,6 token đầu ra mỗi giây và tỷ lệ lỗi khoảng 0,27%, trên lưu lượng cao hơn đáng kể. Bản thân Ember-1 không có trên OrcaRouter.

Những con số đó định hình lại quyết định. Kimi K3 chậm hơn đáng kể ở thời điểm token đầu tiên và đắt hơn khoảng gấp đôi cho mỗi token đầu ra so với Qwen3.8-Max, trong khi có tỷ lệ lỗi thấp hơn nhiều dưới mức tải nặng hơn hẳn. Một biến thể tiết kiệm token của K3 thu hẹp khoảng cách chi phí nhưng không khép lại được khoảng cách độ trễ, bởi vì rút ngắn phần suy luận chỉ rút ngắn giai đoạn sinh, chứ không rút ngắn hàng đợi. Nếu khối lượng công việc của bạn nhạy cảm với độ trễ hơn là nhạy cảm với chi phí, thì mẫu flagship là lựa chọn tốt hơn ở thời điểm hiện tại, và câu chuyện về hiệu quả chỉ là chuyện bên lề.

Cái nào để định tuyến

Định tuyến đến Qwen3.8-Max khi bạn cần cửa sổ ngữ cảnh, đầu vào đa phương thức, một mức giá được công bố và một dịch vụ mà bạn có thể dự trù ngân sách. Xét về cấu trúc, đây là lựa chọn an toàn hơn trong hai: được cung cấp rộng rãi, có niêm yết giá, và được làm mới hai lần trong hai tháng bởi một nhà cung cấp có thành tích duy trì endpoint luôn cập nhật.

Hãy thử Ember-1 khi hóa đơn của bạn bị chi phối bởi token suy luận trong các vòng lặp agent dài và bạn đang chạy trên một mô hình được lưu trữ thay vì phần cứng của riêng bạn. Phép thử đúng đắn là hai tuần mà bản xem trước mang lại cho bạn, chạy shadow song song với lưu lượng sản xuất, đo token trên mỗi tác vụ hoàn thành thay vì token trên mỗi yêu cầu. Điều bạn không nên làm là hoán đổi nó thành một bản thay thế tương đương cho một mô hình flagship chỉ dựa trên con số 40% vốn dao động từ 6% đến 52% tùy theo khối lượng công việc.

Nếu câu hỏi thực sự là có nên tiếp tục chạy Kimi K3 hay không, thì điều đó bạn có thể trả lời ngay hôm nay mà không cần bất kỳ bản xem trước nào: cả Kimi K3 và Qwen3.8-Max đều nằm trên OrcaRouter sau một khóa duy nhất, được định giá theo bảng giá niêm yết của nhà cung cấp, không cộng thêm phí, với khả năng tự động chuyển đổi dự phòng giữa các nhà cung cấp. Việc so sánh chi phí khối lượng công việc của bạn trên cả hai chỉ là một thay đổi định tuyến, không phải một dự án mua sắm — và nó mang lại cho bạn đường cơ sở giúp mọi tuyên bố về hiệu quả liên quan đến Ember-1 có thể đo lường được bằng chính số liệu của bạn thay vì số liệu của phòng thí nghiệm.

A screenshot of OrcaRouter's model page for Kimi K3, showing the MoonshotAI Kimi K3 listing priced at $3.00 per 1M input tokens and $15.00 per 1M output tokens, a p50 time-to-first-token of 8.00s, 749.2M tokens of traffic over seven days, a 1M-token context window and a Python snippet calling api.orcarouter.ai/v1.

Tóm tắt trung thực là hai mô hình này được tối ưu hóa dựa trên những ràng buộc khác nhau. Qwen3.8-Max được xây dựng để trở thành thứ có năng lực nhất hiện có và được định giá tương xứng; Ember-1 được xây dựng để khiến một mô hình vốn đã đắt đỏ trở nên rẻ hơn khi vận hành. Cả hai đều chính đáng, và lý do cuộc so tài này khó có một phán quyết dứt khoát là mức tiết kiệm của mô hình dẫn xuất được định nghĩa dựa trên một bảng giá mà mô hình chủ lực hạ thấp đáng kể.

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày