Thẻ tiêu đề hero được tạo với tiêu đề chính 'GPT-6 Luna vs Qwen3.8-Max', phụ đề 'Mô hình rẻ nhất ở đây không phải là mô hình xem video', chân trang ghi 'Giá theo OpenAI và Alibaba Cloud; số liệu chỉ số theo Artificial Analysis.', và logo OrcaRouter được ghép ở góc dưới bên phải.
Guides & Insights

GPT-6 Luna so với Qwen3.8-Max: Mô hình rẻ nhất trong so sánh này cũng là mẫu duy nhất xem được video

Tác giả

Gideon Frost

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Cách đặt vấn đề hiển nhiên cho cặp so sánh này lại là sai. Qwen3.8-Max niêm yết ở mức $2.00 mỗi triệu token đầu vào và $6.00 mỗi triệu token đầu ra, với lượt đọc bộ đệm ở mức $0.25. GPT-6 Luna niêm yết ở mức $0.10 và $0.50 với lượt đọc bộ đệm ở mức một xu. Gấp hai mươi lần ở đầu vào, mười hai lần ở đầu ra, năm mươi lần ở đầu vào được lưu đệm — một khoảng cách giá lớn đến mức cuộc so sánh trông như đã ngã ngũ ngay từ trước khi nó bắt đầu.

Vấn đề chưa được giải quyết, bởi vì hai mô hình không cạnh tranh cho cùng một yêu cầu. Qwen3.8-Max chấp nhận văn bản, hình ảnh và video, và mức trần đầu ra 131.072 token của nó cao hơn một chút so với 128.000 của GPT-6 Luna. GPT-6 Luna chỉ chấp nhận văn bản và hình ảnh. Mô hình của Alibaba đạt 58 điểm trên Chỉ số Trí tuệ độc lập — đứng đầu trong lớp của nó trên bảng tác tử — còn GPT-6 Luna đạt 37 điểm khi nỗ lực tối đa, 29 điểm ở chế độ mặc định. Một bên là mô hình chủ lực với dòng dõi trọng số mở và khả năng đầu vào video. Bên còn lại là một hạng phổ thông với con số tốc độ và mức giá bộ đệm một xu. Khoảng cách giá không phải là mức giảm giá cho cùng một thứ; đó là mô tả của hai thứ khác nhau.

Mỗi cái trong hai cái này là gì

Qwen3.8-Max là mẫu flagship thuộc thế hệ 3.8 của Alibaba, một checkpoint thuộc lớp Max mà mô hình nền tảng của nó — Qwen3.8-2.4T-A95B — đã được công bố công khai theo một giấy phép tùy chỉnh vào ngày 12 tháng 8 năm 2026, khiến nó trở thành mẫu Qwen lớp Max đầu tiên có trọng số mở. Bản flagship chạy trên hạ tầng được cung cấp vẫn được hội đồng độc lập xếp vào loại độc quyền. Mô hình sở hữu cửa sổ ngữ cảnh 1.000.000 token, giới hạn đầu ra 131.072 token, tiếp nhận văn bản, hình ảnh và video, cùng mức độ suy luận có thể chọn ở ba mức thấp, trung bình và cực cao. Một bản revision Qwen3.8-Max-0902 được ghim sẵn có sẵn ở cùng mức giá, một chi tiết nhỏ nhưng mang giá trị vận hành thực sự.

GPT-6 Luna là phân khúc hiệu quả của OpenAI từ ngày 22 tháng 9 năm 2026, nằm dưới GPT-6 Sol ở mức $2.00/$10.00 và GPT-6 Astra chủ lực ở mức $10.00/$50.00. Đầu vào văn bản và hình ảnh, đầu ra văn bản, cửa sổ 1,050,000 token với đầu vào tối đa 922,000, giới hạn đầu ra 128,000 token, và mức nỗ lực từ none đến low, medium, high, xhigh và max với medium là mặc định. Đóng, một định danh duy nhất, khả dụng cho bất kỳ ai có khóa API.

Một cái chấp nhận video và có thể được tải xuống ở dạng cơ bản. Một cái chấp nhận hình ảnh và nhanh. Cả hai đều được định giá để sử dụng với khối lượng lớn. Mức chồng lấn giữa hai nhận định đó nhỏ hơn so với điều mà tỷ lệ giá gợi ý.

Các thẻ, từng dòng một

Mỗi chiều một dòng, cả hai mặt trên mỗi dòng:

• Giá đầu vào mỗi 1M — GPT-6 Luna $0.10 so với Qwen3.8-Max $2.00

• Đầu ra trên mỗi 1M — GPT-6 Luna $0.50 so với Qwen3.8-Max $6.00

• Đầu vào được lưu đệm trên mỗi 1M — GPT-6 Luna $0.01 so với Qwen3.8-Max $0.25 cho các lần đọc bộ đệm ngầm, với lần đọc bộ đệm tường minh ở mức $0.17 và lần ghi bộ đệm tường minh ở mức $2.50

• Điều khoản ngữ cảnh dài — GPT-6 Luna tăng gấp đôi đầu vào và bộ nhớ đệm, đồng thời nâng đầu ra lên 1,5× trên 272.000 token đầu vào, áp dụng cho toàn bộ yêu cầu; so với Qwen3.8-Max, một hạng mức cố định xuyên suốt toàn cửa sổ, đây là điểm duy nhất mà thẻ Qwen vượt trội về mặt cấu trúc thay vì chỉ rẻ hơn đôi chút

• Cửa sổ ngữ cảnh — GPT-6 Luna 1,050,000 token so với Qwen3.8-Max 1,000,000 token

• Đầu ra tối đa — GPT-6 Luna 128.000 token so với Qwen3.8-Max 131.072 token

• Các phương thức đầu vào — GPT-6 Luna văn bản và hình ảnh so với Qwen3.8-Max văn bản, hình ảnh và video

• Mức độ suy luận — GPT-6 Luna: không, thấp, trung bình (mặc định), cao, xhigh, tối đa so với Qwen3.8-Max: thấp, trung bình và cực cao

• Chỉ số Trí tuệ, độc lập — GPT-6 Luna 37 ở mức nỗ lực tối đa so với Qwen3.8-Max 58

• Chỉ số Agentic, độc lập — Qwen3.8-Max 58, đứng đầu phân khúc; chưa công bố con số tương đương cho GPT-6 Luna

• Điểm ở mức nỗ lực mặc định — GPT-6 Luna 29 ở mức trung bình mặc định so với Qwen3.8-Max được đo ở cài đặt tối đa

• Chi phí mỗi tác vụ Index, độc lập — GPT-6 Luna khoảng $0,07 so với Qwen3.8-Max $5,41

• GDPval, độc lập — Qwen3.8-Max đạt 1.739 Elo với 64 lượt mỗi tác vụ, tương đương khoảng 1,14 USD cho mỗi tác vụ hoàn thành trong đánh giá đó; không có lần chạy GPT-6 Luna nào tương đương được công bố

• Tỷ lệ ảo giác trên AA-Omniscience — Qwen3.8-Max 40%, một bước thoái bộ so với 23% ở thế hệ trước; GPT-6 Luna 77%, giảm từ 93%

• Bản chụp nhanh có ghi ngày — GPT-6 Luna một định danh luân chuyển duy nhất so với Qwen3.8-Max-0902 có sẵn dưới dạng bản sửa đổi được ghim ngày 2 tháng 9 năm 2026 với cùng mức giá

• Trọng số — GPT-6 Luna đóng, chỉ có API, so với Qwen3.8-Max với checkpoint nền Qwen3.8-2.4T-A95B được công khai theo một giấy phép tùy chỉnh kể từ ngày 12 tháng 8 năm 2026, trong khi mô hình chủ lực dạng hosted được liệt kê là độc quyền

• Trên OrcaRouter — GPT-6 Luna không có trong danh mục của chúng tôi so với Qwen3.8-Max có thể định tuyến theo giá niêm yết của Alibaba

Generated two-column scoreboard titled 'GPT-6 Luna vs Qwen3.8-Max - the scoreboard'. Left column GPT-6 Luna rows: Price in/out $0.10 / $0.50, Cached input $0.01, AA Index 37 at max effort, Context 1,050,000, Input text + image, Cost per index task $0.07. Right column Qwen3.8-Max rows: Price in/out $2.00 / $6.00, Cached input $0.25, AA Index 58, Context 1,000,000, Input text + image + video, Cost per index task $5.41. Footer: 'Prices per OpenAI and Alibaba Cloud; index figures per Artificial Analysis.'

Video không phải là một dòng tính năng, mà là một khối lượng công việc khác biệt

Hàng phương thức là hàng quyết định nhiều so sánh thực tế hơn hàng giá, và nó thường được đọc như một hộp kiểm.

Qwen3.8-Max chấp nhận video. GPT-6 Luna thì không. Nếu quy trình xử lý của bạn cần suy luận về một bản ghi màn hình, một bản demo sản phẩm, một bản ghi bài giảng, một đoạn phim từ camera an ninh hay một lượt dạo qua giao diện người dùng, thì sự so sánh dừng lại ở ranh giới đó và mức chênh lệch giá gấp hai mươi lần trở nên không còn liên quan — bạn không chọn giữa một lựa chọn đắt và một lựa chọn rẻ, mà bạn đang chọn giữa một lựa chọn và không có lựa chọn nào. Trích xuất khung hình rồi truyền chúng dưới dạng ảnh là một cách xoay xở, không phải một phương án tương đương, và bất kỳ ai từng dựng một cách như vậy đều biết sự khác biệt cả về chi phí lẫn chất lượng.

Nếu pipeline của bạn là văn bản và hình ảnh, thì dòng về phương thức im lặng còn dòng về giá lên tiếng. Đó là sự phân tách trung thực, và đáng để nói thẳng rằng bạn đang ở phía nào trước khi đọc bất cứ điều gì khác trên trang này.

Khoảng cách agentic là có thật và nó là nửa đắt đỏ của phần chênh lệch giá.

Qwen3.8-Max đạt 58 điểm trên Intelligence Index độc lập. GPT-6 Luna đạt 37 điểm ở mức nỗ lực tối đa và 29 điểm ở mức trung bình mặc định. Hai mươi mốt điểm khi ở cùng thiết lập, hai mươi chín điểm ở thiết lập mặc định — trên một chỉ số tổng hợp mà chỉ một điểm cũng nằm trong độ nhiễu của một lần chạy lại, khoảng cách lớn như vậy không phải là nhiễu.

Vị thế của Qwen3.8-Max tập trung vào mảng công việc agentic. Nó đạt 58 điểm trên Agentic Index độc lập, đứng đầu trong phân khúc của mình, và 1.739 Elo trên GDPval ở 64 lượt mỗi tác vụ. Con số cuối cùng đó mới là con số đáng chú ý, vì nó là phép đo việc một mô hình giữ được mạch một tác vụ qua sáu mươi tư quyết định liên tiếp, và nó đi kèm một cái giá: khoảng $1,14 cho mỗi tác vụ hoàn thành trong đánh giá đó. So sánh với chi phí khoảng $0,07 mỗi tác vụ chỉ số của GPT-6 Luna, thì cách nói trung thực không phải là Qwen đắt đỏ. Mà là Qwen đang được yêu cầu làm một việc khó hơn nhiều, và đang làm được việc đó.

Hệ quả là mức chênh lệch hai mươi mốt điểm của GPT-6 Luna cũng không được phân bổ đồng đều trên khối lượng công việc của bạn. Với một tác vụ ngắn, được đặc tả rõ ràng, do chương trình xử lý — trích xuất trường này, phân loại ticket này, định tuyến yêu cầu này — cả hai mô hình sẽ gần như luôn tạo ra cùng một câu trả lời dùng được, và khoảng cách chỉ số sẽ vô hình trong bài đánh giá của bạn. Với một tác vụ đòi hỏi sáu mươi tư hành động tuần tự cùng một điểm kiểm tra ở cuối, khoảng cách ấy chính là sự khác biệt giữa việc hoàn thành và việc lặng lẽ dừng lại giữa chừng, và đó là loại tác vụ mà Qwen3.8-Max được xây dựng để làm còn GPT-6 Luna thì không.

Một con số lại đi theo hướng ngược lại và xứng đáng được nêu ra thay vì bị chôn vùi. Tỷ lệ ảo giác của Qwen3.8-Max trên bảng Omniscience là 40%, tăng từ 23% ở thế hệ trước — một bước lùi đáng kể, và là kiểu bước lùi thể hiện thành những câu trả lời sai đầy tự tin trong môi trường vận hành, chứ không phải một dòng trên bảng điểm chuẩn. Tỷ lệ của GPT-6 Luna là 77%, giảm từ 93%. Cả hai con số đều cao nếu xét theo giá trị tuyệt đối, và mô hình rẻ hơn vẫn là mô hình tệ hơn trong hai mô hình ở chỉ số này. Không con số nào là lý do để thích mô hình này hơn mô hình kia; cả hai đều là lý do để duy trì con người hoặc một hệ thống kiểm chứng trong quy trình đối với bất cứ việc gì mà một thông tin bịa đặt gây tốn kém.

Mệnh đề ngữ cảnh dài là điểm duy nhất mà Qwen chiếm ưu thế về cấu trúc.

GPT-6 Luna có một điều khoản mà Qwen3.8-Max không có: các yêu cầu trên 272.000 token đầu vào bị tính phí gấp đôi mức giá đầu vào và cache, cùng gấp 1,5 lần mức giá đầu ra, áp dụng cho toàn bộ yêu cầu thay vì phần vượt ngưỡng. Một cuộc gọi 300.000 token trên GPT-6 Luna bị tính phí $0,20 mỗi triệu token đầu vào cho toàn bộ 300.000 token vì nó vượt ngưỡng 28.000. Chia cùng một tài liệu thành hai cuộc gọi thì chi phí giảm một nửa mà không thay đổi prompt.

Qwen3.8-Max giữ mức phẳng trên toàn bộ cửa sổ 1,000,000 token của mình. Với những yêu cầu đơn lẻ thực sự khổng lồ, điều đó khiến khoảng cách giá đầu ra gấp mười hai lần trở nên nhỏ hơn vẻ bề ngoài, và thậm chí có thể đảo ngược: trên 272,000 token đầu vào, mức giá đầu vào hiệu dụng của GPT-6 Luna tăng gấp đôi lên $0.20, còn mức giá đầu ra tăng lên $0.75, so với mức phẳng $2.00 và $6.00 của Qwen. Khoảng cách thu hẹp từ hai mươi lần xuống còn mười lần ở đầu vào và từ mười hai xuống còn tám ở đầu ra. Vẫn còn rộng — nhưng những khối lượng công việc dễ có ngữ cảnh làm việc 300,000 token nhất lại đúng là những khối lượng mang tính agentic mà cả hai nhà cung cấp đang nhắm bán tới, và các đội ngũ vận hành chúng chính là những đội sẽ nhận ra điều đó.

Dòng cấu trúc còn lại là bản sửa đổi được ghim cố định. Qwen3.8-Max-0902 có sẵn với mức giá ngang bằng với định danh cuộn, nghĩa là một nhóm cần hành vi có thể tái lập xuyên suốt một lần cập nhật mô hình có thể có được điều đó mà không phải trả thêm phụ phí. GPT-6 Luna không đưa ra lựa chọn tương đương. Đó là một dòng nhỏ trên bảng giá và một dòng lớn trong bản tổng kết sau sự cố.

Chạy một trong hai, hoặc cả hai

Qwen3.8-Max đã có mặt trên OrcaRouter với đúng mức giá niêm yết của Alibaba, theo cơ chế định giá chuyển tiếp — nghĩa là khi nhà cung cấp thay đổi mức giá, phía chúng tôi cập nhật ngay trong cùng ngày. Có hai điểm ở lớp định tuyến của chúng tôi thực sự xứng đáng có mặt với riêng mô hình này: khả năng tự động chuyển đổi dự phòng, bởi một mô hình chủ lực dạng dịch vụ có phần nền trọng số mở được công bố sẽ có nhiều nguồn thượng nguồn hơn một mô hình đóng từ một nhà cung cấp duy nhất, đồng nghĩa với việc một trong số đó có nhiều khả năng bị suy giảm hơn; và cơ chế xử lý phiên bản được ghim, cho phép một tuyến giữ cố định Qwen3.8-Max-0902 một cách tường minh thay vì kế thừa bất cứ thứ gì mà định danh cuốn chiếu sẽ phân giải thành vào tuần sau.

GPT-6 Luna không có trong danh mục của chúng tôi tính đến thời điểm viết bài này và được truy cập qua API riêng của OpenAI, vì vậy một nhóm muốn có cả hai sẽ dùng một khóa cho Qwen3.8-Max bên cạnh thứ mà nhóm đó đã dùng cho OpenAI. Đây cũng là cặp kết hợp mà ở đó DSL định tuyến đáng giá hơn một cách chia tách tĩnh, bởi vì ranh giới giữa hai mô hình là một phép kiểm tra phương thức và một phép kiểm tra độ dài chứ không phải một sở thích: các yêu cầu có video sẽ được chuyển đến Qwen3.8-Max vì không có gì khác có thể phục vụ chúng, các yêu cầu trên 272.000 token đầu vào sẽ được chuyển đến Qwen3.8-Max vì mức giá nhảy vọt của mô hình kia khiến chúng đắt hơn ở đó, và mọi thứ còn lại sẽ đi đến mô hình có giá bằng một phần hai mươi. Đó là một quy tắc, và nó thuộc về cấu hình chứ không phải một nhánh trong ứng dụng.

Screenshot of OpenAI's developer documentation page for GPT-6 Luna, showing the model selector, the description 'Our most efficient model for focused, high-volume tasks', reasoning set to High, speed Fast, price $0.1 · $0.5, text and image input with text output, a 1,050,000-token context window, 128,000 maximum output tokens, a May 18, 2026 knowledge cutoff, and pricing cards of $0.10 input, $0.01 cached input, $0.125 cache writes and $0.50 output per 1M tokens.

Cái nào, và khi nào

Chọn Qwen3.8-Max nếu bất kỳ điều nào sau đây là đúng. Pipeline của bạn cần đầu vào video. Các yêu cầu của bạn thường xuyên vượt quá 272.000 token đầu vào, khi mà bậc giá phẳng của nó đánh bại mức tái định giá của GPT-6 Luna. Đầu ra của bạn vượt quá 128.000 token. Công việc của bạn là thực thi tác tử tầm xa với điểm cuối có thể kiểm chứng, nơi điểm 58 trên bảng tác tử và 1.739 Elo trên GDPval ở 64 lượt mỗi tác vụ chính là bằng chứng đáng quan tâm. Hoặc bạn cần một bản sửa đổi được ghim cố định để đảm bảo khả năng tái lập và sẵn sàng trả tiền cho nó — điều mà, với cùng mức giá như định danh cuốn chiếu, nghĩa là bạn không sẵn sàng.

Chọn GPT-6 Luna nếu không có tiêu chí nào ở trên áp dụng và khối lượng công việc của bạn thuộc dạng khối lượng lớn, do chương trình tiêu thụ, văn bản xen hình ảnh, và ngắn. Phân loại, trích xuất, định tuyến, tóm tắt hàng loạt, vòng lặp bên trong của một agent cần câu trả lời nhanh chứ không cần câu trả lời kỹ càng. Với mức $0.10/$0.50 cùng một xu cho mỗi lần đọc từ bộ nhớ đệm và chi phí cho mỗi tác vụ hoàn thành chỉ bằng khoảng một phần mười lăm của Qwen3.8-Max, phép tính chẳng cần phải cân nhắc gì nhiều. Hãy đặt tham số effort một cách tường minh — mặc định là medium còn con số 37 được quảng cáo là mức nỗ lực tối đa — và giữ các cuộc gọi dài ở phía đúng của ranh giới 272.000 token.

Sai lầm mà phép so sánh này mời gọi là đọc mức giá đầu vào gấp hai mươi lần như một phán quyết. Đó là phán quyết về một dạng khối lượng công việc, và nó im lặng trước ba dòng quyết định dạng còn lại: liệu yêu cầu có mang theo video không, liệu nó có vượt qua 272.000 token không, và liệu câu trả lời có phải trụ qua sáu mươi tư bước tuần tự không.

Screenshot of the OrcaRouter model page for Qwen3.8 Max (0902) showing the breadcrumb Home > Models > Qwen > Qwen3.8 Max (0902), a NEW badge, the model id qwen/qwen3.8-max-0902, Vision, Tools, JSON and Reasoning chips, a Qwen attribution dated 2026-09-02, the description of a September 2, 2026 snapshot accepting text, image and video input with a 1M-token context, input pricing of $2.00 and output of $6.00 per 1M tokens, a p50 time to first token of 3.50s, a p95 of 9.38s, and traffic of 196.6M tokens over seven days.

So sánh trong bài viết này3

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày