Ảnh chụp nhanh ngày 2 tháng 9 năm 2026 của Qwen3.8 Max, mô hình suy luận đa phương thức chủ lực của Alibaba: đầu vào văn bản + hình ảnh + video, đầu ra văn bản, ngữ cảnh 1M token. Có cùng khả năng và mức giá như mô hình cơ sở; ghim lại để đảm bảo hành vi tái lập được.
Qwen3.8 Max (0902) là một mục mô hình trên OrcaRouter từ nhà cung cấp qwen, được xuất bản với ID mô hình qwen/qwen3.8-max-0902. Ký hiệu 0902 được hiển thị trong danh sách, nhưng các dữ kiện được cung…
Mô hình hỗ trợ cửa sổ ngữ cảnh lên đến 1.000.000 token. Đây là tổng lượng đầu vào mà mô hình có thể xử lý trong một yêu cầu, bao gồm nội dung văn bản, hình ảnh và video trong prompt. Không có giới hạn nào khác được nêu trong dữ kiện, vì vậy giới hạn thực tế phụ thuộc vào cách OrcaRouter và nhà cung cấp thực thi việc token hóa và thời gian chờ yêu cầu. Đối với văn bản dài, 1.000.000 token cho phép đưa nhiều tài liệu lớn vào một prompt duy nhất, giảm nhu cầu chia nhỏ hoặc tóm tắt trước khi gọi mô hình. Đối với video, các dữ kiện không nêu rõ mỗi giây, mỗi khung hình hoặc mỗi tệp video tiêu tốn bao nhiêu token, vì vậy bạn nên ước tính từ siêu dữ liệu hoặc các cuộc gọi thử nghiệm. Điều quan trọng cần nhớ là kích thước cửa sổ ngữ cảnh không cho bạn biết mô hình chính xác đến mức nào trên một prompt 1.000.000 token; không có dữ liệu điểm chuẩn nào được cung cấp. Nếu ứng dụng của bạn cần chất lượng ngữ cảnh dài chính xác, hãy đánh giá trên một mẫu tài liệu của riêng bạn trước khi đưa vào sản xuất.
Với văn bản, hình ảnh và video được chấp nhận làm đầu vào, mô hình có thể được yêu cầu suy luận dựa trên tài liệu nguồn kết hợp các loại dữ liệu đó trong cùng một yêu cầu. Ví dụ bao gồm đọc hướng dẫn trong văn bản, xem xét một hình ảnh và tham chiếu đến một video khi tạo ra câu trả lời. Bảng thông tin của nhà cung cấp không liệt kê các khả năng theo tác vụ cụ thể như OCR, phát hiện đối tượng hoặc suy luận video theo thời gian, vì vậy không nên giả định các hành vi đó. Điều có thể mong đợi từ mô hình phụ thuộc chủ yếu vào các năng lực được huấn luyện, vốn không được ghi chép trong các dữ kiện được cung cấp. Cách thiết kế an toàn là sử dụng mô hình cho các tác vụ cần đầu ra văn bản từ lời nhắc đa phương thức và có thể chấp nhận chi phí lưu trữ hình ảnh cũng như video dưới dạng token đầu vào. Nếu khối lượng công việc chỉ gồm văn bản, một mô hình khác không có đầu vào hình ảnh và video có thể đơn giản hơn. Nếu một tác vụ cần các thao tác video chính xác đến từng mốc thời gian, thẻ mô hình không cung cấp bằng chứng nào cho thấy hành vi đó có đáng tin cậy hay không.
Việc chọn một mô hình rẻ hơn là hợp lý khi tác vụ không yêu cầu các tính năng xác định danh mục này. Một câu hỏi văn bản ngắn không cần ngữ cảnh 1.000.000 token hay giới hạn đầu ra 131.072 token. Một quy trình làm việc chỉ dùng văn bản không cần đầu vào hình ảnh hoặc video. OrcaRouter tính phí mô hình này ở mức $2,00 cho mỗi 1.000.000 token đầu vào và $6,00 cho mỗi 1.000.000 token đầu ra. Nếu một lựa chọn thay thế rẻ hơn có giá mỗi token thấp hơn và hỗ trợ ngữ cảnh cùng phương thức (modality) đầy đủ, nó sẽ giảm chi phí. Không có điểm chuẩn chất lượng hay tốc độ nào trong các dữ kiện được cung cấp, vì vậy việc chọn mô hình này thay vì các mô hình khác không thể được biện minh bằng độ chính xác đo lường được; nó nên được biện minh bằng các yêu cầu sản phẩm rõ ràng: ngữ cảnh lớn, đầu vào hỗn hợp văn bản/hình ảnh/video, hoặc đầu ra dài trong một lần sinh. Vì giá đầu vào áp dụng cho mọi token trong ngữ cảnh, các lệnh gọi có ngữ cảnh rất lớn có thể tốn kém hơn các lệnh gọi nhỏ hơn ngay cả khi câu hỏi người dùng ngắn, vì vậy hãy tránh nhồi nhét prompt.
Các thông số mô hình được cung cấp cho Qwen3.8 Max (0902) không bao gồm điểm benchmark, bộ đánh giá hoặc số liệu độ chính xác. Vì lý do đó, bất kỳ nhận định nào về chất lượng mô hình đều chỉ là suy đoán và OrcaRouter không công bố điểm số suy luận. Nếu bạn cần một con số để so sánh các ứng viên, hãy tự chạy thử nghiệm trên các đầu vào đại diện, bao gồm cả các trường hợp hình ảnh và video mà bạn dự định gửi. Một bài benchmark như bài kiểm tra kiến thức công khai sẽ không cho bạn biết mô hình xử lý tốt đến đâu đối với một prompt video cụ thể có 1.000.000 token. Hãy nhớ rằng một tên mô hình như Max chỉ là một nhãn, không phải bằng chứng về chất lượng. Các yếu tố có thể đo lường được trong bảng thông số này là cửa sổ ngữ cảnh, độ dài đầu ra tối đa, phương thức đầu vào và giá cả. Những thuộc tính đó ảnh hưởng đến việc khối lượng công việc có phù hợp hay không, nhưng chúng không mô tả độ chính xác, độ sâu suy luận, khả năng tuân theo chỉ dẫn hoặc hành vi an toàn. Hãy coi năng lực ở các lĩnh vực đó là chưa được xác minh trừ khi bạn tiến hành đánh giá.
Các thông tin về mô hình không cung cấp tốc độ token mỗi giây, số liệu thời gian đến token đầu tiên, hướng dẫn về thời gian chờ yêu cầu, hoặc bất kỳ phép đo hiệu suất nào khác. OrcaRouter không đưa ra con số độ trễ cho mô hình của nhà cung cấp này. Tốc độ sẽ phụ thuộc vào hạ tầng phục vụ của nhà cung cấp, kích thước đầu vào và lượng đầu ra được yêu cầu. Một đầu vào 1.000.000 token và đầu ra 131.072 token có thể sẽ mất nhiều thời gian hơn một yêu cầu ngắn, nhưng danh sách không đưa ra mối quan hệ chính xác nào. Đầu vào video cũng có thể làm tăng độ trễ vì video phải được xử lý thành token trước khi mô hình có thể xử lý; các thông tin không định lượng bước đó. Người đánh giá không nên cho rằng mức giá thấp trên mỗi token đồng nghĩa với việc giải mã nhanh. Quyết định duy nhất liên quan đến tốc độ được hỗ trợ bởi các thông tin là kiểm tra các kích thước yêu cầu tiêu biểu dưới tải dự kiến của bạn. Không suy luận khả năng phù hợp theo thời gian thực từ kích thước cửa sổ ngữ cảnh hoặc tên mô hình.
Các điểm mạnh được nêu mang tính cấu trúc. Mô hình có cửa sổ ngữ cảnh 1,000,000 token, đầu ra tối đa cao 131,072 token và chấp nhận đầu vào văn bản, hình ảnh và video. Các tính năng này hữu ích cho những ứng dụng cần một lần gọi mô hình để quan sát một khối lượng lớn hoặc hỗn hợp nội dung trước khi viết phản hồi dài. Các hạn chế cũng dễ nêu ra từ các dữ kiện hơn là các điểm mạnh. Không có điểm chuẩn chất lượng nào được công bố, vì vậy độ chính xác, khả năng suy luận và độ an toàn không được ghi nhận. Không có danh mục riêng cho dữ liệu huấn luyện, ghi chú phát hành hoặc phương pháp cập nhật đằng sau nhãn 0902. Đầu vào hình ảnh và video không đảm bảo khả năng hiểu chính xác về mặt thị giác hoặc thời gian. Giới hạn ngữ cảnh và đầu ra là mức tối đa, không phải mức sử dụng được khuyến nghị; đầu ra rất lớn có thể tốn kém ở mức $6.00 cho mỗi 1,000,000 token đầu ra. Một yêu cầu lấp đầy ngữ cảnh 1,000,000 token sẽ tiêu tốn $2.00 token đầu vào trước khi bất kỳ đầu ra nào được tạo ra, đây là một chi phí vận hành đáng kể.
Giá đơn vị được niêm yết là $2.00 cho mỗi 1,000,000 token đầu vào và $6.00 cho mỗi 1,000,000 token đầu ra. OrcaRouter lập hóa đơn cho mô hình theo giá của nhà cung cấp mà không cộng thêm phí, vì vậy giá được nêu chính là giá của nhà cung cấp được chuyển qua. Token đầu vào bao gồm các token văn bản, hình ảnh và video được gửi trong lời nhắc. Token đầu ra là các token phản hồi được tạo ra. Với các mức giá này, 1,000,000 token đầu vào có giá $2.00; 1,000,000 token đầu ra có giá $6.00. Một yêu cầu nhỏ hơn sẽ có chi phí thấp hơn tương ứng: 100,000 token đầu vào sẽ là $0.20 và 100,000 token đầu ra sẽ là $0.60, miễn là số lượng đó được đo bởi nhà cung cấp. Thẻ mô hình không bao gồm giá riêng cho đầu vào được lưu trong bộ nhớ cache, yêu cầu theo lô hoặc các gói tương tác, vì vậy không nên giả định có các mức giá như vậy. Số lượng token được tính phí chính xác cần được kiểm tra từ phản hồi sử dụng của OrcaRouter hoặc nhật ký cho mỗi lần gọi.
Khi OrcaRouter nói rằng một mô hình được tính phí theo giá của nhà cung cấp với biên độ lợi nhuận bằng không (zero markup), điều đó có nghĩa là OrcaRouter không cộng thêm phí riêng trên mỗi token vào giá của nhà cung cấp cho danh mục này. Số tiền cuối cùng cho việc sử dụng token do đó phải dựa trên mức giá $2.00 cho đầu vào và $6.00 cho đầu ra trên mỗi 1.000.000 token như đã nêu. Điều đó không nhất thiết có nghĩa là hóa đơn cuối cùng không có các khoản phí khác; thuế hoặc phí cấp tài khoản có thể được áp dụng tùy thuộc vào thỏa thuận của bạn, nhưng không có khoản phí nào như vậy được ghi nhận trong các dữ kiện này. Điều đó cũng không có nghĩa là mô hình được phục vụ miễn phí, vì mức giá trên mỗi token vẫn được áp dụng. Khi so sánh giữa các nhà cung cấp, mức giá hiển thị bởi OrcaRouter cho mô hình này phải thể hiện cùng đơn vị như danh mục này. Nếu một cổng kết nối (gateway) khác báo một mức giá khác, sự khác biệt nằm ở cấu trúc thanh toán, không phải là sự thay đổi trong cửa sổ ngữ cảnh của mô hình.
Quản lý chi phí nên bắt đầu từ độ dài prompt. Vì chi phí đầu vào là $2.00 cho mỗi 1,000,000 token, mỗi token bổ sung sẽ làm tăng phí đầu vào, và mọi hình ảnh hoặc video gửi trong một yêu cầu đều được chuyển đổi thành token theo các quy tắc không được cung cấp trong danh sách này. Việc cắt bỏ tài liệu nguồn không liên quan có thể giảm chi phí. Đầu ra có đơn giá gấp ba lần đơn giá đầu vào, vì vậy việc giới hạn độ dài đầu ra được yêu cầu cũng kiểm soát chi phí. Một mô hình có giới hạn đầu ra 131,072 token có thể tạo ra các phản hồi tốn kém; với mức $6.00 cho mỗi 1,000,000 token, 131,072 token đầu ra sẽ tiêu tốn khoảng $0.79 chỉ riêng token đầu ra. Việc tạo ra số token đó không phải là tự động, vì prompt kiểm soát kích thước phản hồi. Không có mức giá cache nào được công bố cho mô hình này, vì vậy đừng cho rằng ngữ cảnh lặp lại sẽ được giảm giá. Việc không có giá cache hoặc giá batch trong các dữ kiện không phải là bằng chứng cho thấy các tùy chọn đó không tồn tại; nó chỉ đơn giản có nghĩa là chúng không nằm trong danh sách này.
Qwen3.8 Max (0902) được cung cấp thông qua API tương thích OpenAI của OrcaRouter. Đặt base URL của client thành https://api.orcarouter.ai/v1 và sử dụng chính xác model ID qwen/qwen3.8-max-0902. Với SDK tương thích OpenAI, cấu trúc yêu cầu về cơ bản giống như mọi lệnh gọi chat-completions: truyền API key cho OrcaRouter, base URL nêu trên và model ID trong phần body. Không sử dụng tên chung chung như Qwen3.8 Max hoặc qwen3.8; danh mục yêu cầu phải dùng qwen/qwen3.8-max-0902. Model ID tương tự cũng cần được sử dụng trong các yêu cầu HTTP trực tiếp tới base URL, trong đó đường dẫn và payload tuân theo hợp đồng tương thích OpenAI do OrcaRouter cung cấp. Vì tương thích với OpenAI, mã nguồn hiện có viết cho OpenAI chat completions thường có thể được chuyển đổi bằng cách thay đổi các tham số base_url và model, mặc dù chi tiết xác thực phải khớp với yêu cầu của OrcaRouter.
Đối với một yêu cầu chat completion tương thích OpenAI, các tham số như model, messages và giới hạn token đầu ra được xử lý giống như các model tương thích khác. Các dữ kiện nêu rõ đầu ra tối đa là 131.072 token, vì vậy nếu bạn đặt giới hạn đầu ra thì không được vượt quá 131.072; giới hạn đầu ra mặc định không được nêu trong các dữ kiện. Temperature, top-p, stop và các tham số lấy mẫu khác không được ghi lại trong các dữ kiện model được cung cấp, vì vậy hãy tuân theo tài liệu API của OrcaRouter và ngữ nghĩa tham số chuẩn của OpenAI. Đối với đầu vào hình ảnh và video, hãy sử dụng định dạng nội dung đa phương thức mà API của OrcaRouter mong đợi; các dữ kiện không cung cấp mẫu. Nếu API trả về lỗi về tên tham số không được hỗ trợ, hãy kiểm tra xem SDK của bạn có đang gửi các tham số kế thừa (legacy) hay không. Cửa sổ ngữ cảnh là 1.000.000 token, vì vậy prompt phải giữ toàn bộ token đầu vào, bao gồm cả token hình ảnh và video, dưới giới hạn đó. Các phản hồi được tính riêng vào mức tối đa 131.072 token.
Do OrcaRouter cung cấp API tương thích OpenAI tại https://api.orcarouter.ai/v1, việc di chuyển phần lớn chỉ là thay đổi cấu hình. Thay URL gốc bằng https://api.orcarouter.ai/v1, thay trường khóa API bằng khóa OrcaRouter, và đặt model thành qwen/qwen3.8-max-0902. Nếu mã của bạn sử dụng thư viện client tương thích OpenAI, hãy cập nhật base_url và api_key của client, đồng thời giữ nguyên hầu hết cấu trúc message, giả định rằng định dạng đa phương thức khớp với model này. Các dữ kiện không đề cập liệu model này có hỗ trợ mọi tham số riêng của OpenAI hay không, vì vậy trước khi di chuyển, hãy rà soát các tham số mà ứng dụng của bạn gửi. Ngoài ra, do giới hạn ngữ cảnh là 1.000.000 và đầu ra tối đa là 131.072, hãy điều chỉnh logic cắt ngắn yêu cầu theo các giới hạn này. Mọi mã hiện có mà viết cứng một độ dài ngữ cảnh tối đa khác có thể cần được cập nhật. Cuối cùng, hãy xác nhận rằng kỳ vọng xử lý dữ liệu của ứng dụng phù hợp với điều khoản của OrcaRouter, vì bản thân các dữ kiện về model không đề cập đến việc lưu giữ dữ liệu.
Căn cứ chính để so sánh là điều kiện đầu vào. Qwen3.8 Max (0902) chấp nhận văn bản, hình ảnh và video, vì vậy một lựa chọn thay thế chỉ hỗ trợ văn bản sẽ loại bỏ các phương thức đó. Nếu khối lượng công việc thực tế của bạn chỉ chứa văn bản, một mô hình chỉ hỗ trợ văn bản với ngữ cảnh đủ lớn có thể phù hợp trực tiếp hơn và có thể có mức giá khác. Các thông số thực tế của mô hình không bao gồm so sánh độ chính xác hoặc tốc độ với bất kỳ mô hình nào khác, vì vậy bạn không thể chọn dựa trên điểm chất lượng công khai. Bạn có thể so sánh các thuộc tính cấu trúc: một lựa chọn thay thế chỉ hỗ trợ văn bản có thể có ngữ cảnh nhỏ hơn, giới hạn đầu ra ngắn hơn hoặc giá đầu vào thấp hơn. OrcaRouter tính phí cho mô hình này là $2.00 cho đầu vào và $6.00 cho đầu ra trên mỗi 1,000,000 token. Việc nó có đầu vào hình ảnh và video chỉ hữu ích nếu các đầu vào đó được sử dụng. Nếu các đầu vào đó không được sử dụng, bạn có thể đang trả tiền cho khả năng đa phương thức không liên quan đến tác vụ.
Chọn Qwen3.8 Max (0902) khi hồ sơ tác vụ phù hợp với các tính năng được liệt kê. Đầu tiên, bạn cần ngữ cảnh 1.000.000 token vì tài liệu nguồn không thể rút gọn để vừa với cửa sổ nhỏ hơn. Thứ hai, bạn cần đầu vào hình ảnh và video trong cùng một lời nhắc, hoặc bạn dự kiến các phương thức đó sẽ xuất hiện trong các yêu cầu trong tương lai. Thứ ba, bạn muốn đầu ra tối đa lên đến 131.072 token. Nếu khối lượng công việc của bạn không có bất kỳ yêu cầu nào trong số đó, nhiều lợi ích của danh sách này sẽ không được dùng đến. Đừng chọn nó chỉ vì cái tên Max nghe có vẻ mạnh mẽ; danh sách này không có bằng chứng điểm chuẩn nào. Vì OrcaRouter hiển thị các mô hình qua cùng một API tương thích OpenAI, việc hoán đổi ID mô hình rất dễ dàng, nên bạn có thể tự kiểm thử mô hình này với một ứng viên khác trên tác vụ của mình. Chỉ cần nhớ rằng giá đầu vào và đầu ra khác nhau, và không có mức giá bộ nhớ đệm nào được chỉ định cho mô hình này.
Khi so sánh chi phí, trước tiên hãy chuẩn hóa về cùng một cơ sở token. Mô hình này tính $2.00 cho mỗi 1,000,000 token đầu vào và $6.00 cho mỗi 1,000,000 token đầu ra, được chuyển tiếp trực tiếp từ nhà cung cấp mà không cộng thêm phí. Một mô hình cạnh tranh có giá mỗi token đầu vào thấp hơn có thể thực sự rẻ hơn đối với yêu cầu dùng toàn bộ ngữ cảnh, nhưng cửa sổ ngữ cảnh và giới hạn đầu ra tối đa cũng phải được xét đến. Ví dụ, một yêu cầu 1,000,000 token có thể dùng toàn bộ cửa sổ ngữ cảnh của mô hình này chỉ trong một lần gọi; còn mô hình có cửa sổ ngữ cảnh 200,000 token sẽ phải gọi nhiều lần và các bước tạo đầu ra hoặc tóm tắt phát sinh có thể làm thay đổi tổng chi phí. Các dữ kiện được cung cấp không nêu giá trị đo lường khách quan về độ chính xác hoặc độ trễ, nên bất kỳ sự so sánh chi phí trên mỗi câu trả lời đúng nào cũng phải dựa trên các bài kiểm tra của chính bạn. Đồng thời, hãy kiểm tra xem mô hình cạnh tranh có tính phí riêng cho token hình ảnh hoặc video hay không, vì các loại token này không được mô tả ở đây. Khi phân vân, hãy chạy một tác vụ điển hình trên OrcaRouter rồi so sánh mức sử dụng token đo được và chất lượng phản hồi thay vì chỉ dựa vào giá niêm yết.
Tương thích OpenAI — giữ nguyên SDK bạn đang dùng
https://api.orcarouter.ai/v1import os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="qwen/qwen3.8-max-0902",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)enable_thinkinginclude_reasoningmax_tokenspresence_penaltyreasoningreasoning_effortresponse_formatseedstopstructured_outputstemperaturetool_choicetoolstop_p| Đầu vào / 1M tokens | $2.00 |
| Đầu ra / 1M tokens | $6.00 |
| Đọc cache / 1M | $0.250 |
| Ghi cache / 1M | $2.50 |
| Tiền tệ | USD |
Ước tính theo giá niêm yết
Chỉ là ước tính — số token thực tế phụ thuộc vào bộ tách token của nhà cung cấp.
Điều các nhà phát triển đang nói tuần này
GET /api/public/models/qwen/qwen3.8-max-0902Mở @misc{orcarouter_qwen3_8_max_0902,
title = {Qwen3.8 Max (0902) API},
author = {Qwen},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/qwen/qwen3.8-max-0902}
}Qwen. (2026). Qwen3.8 Max (0902) API. OrcaRouter. https://www.orcarouter.ai/models/qwen/qwen3.8-max-0902