Qwen3.8-Max là mẫu flagship mới nhất của Alibaba trong dòng Qwen và là bậc năng lực cao nhất tính đến thời điểm hiện tại. Alibaba định vị mô hình này cạnh tranh trực tiếp với GPT-5.5, Claude Opus 4.7 và Gemini 3.1 Pro trong hướng dẫn di chuyển (migration guide) của mình, khuyến nghị sử dụng nó bất cứ khi nào một tác vụ cần khả năng suy luận mạnh nhất hiện có — phân tích đa bước phức tạp, suy diễn logic sâu và các công việc agent đòi hỏi cao. Mô hình này vốn dĩ đa phương thức, được Alibaba xếp vào cả nhóm sinh văn bản lẫn hiểu hình ảnh/video: nó nhận đầu vào là văn bản, hình ảnh và video, đồng thời trả về văn bản, với cửa sổ ngữ cảnh 1M token. Ma trận năng lực chính thức xác nhận hỗ trợ đầy đủ chế độ suy nghĩ (thinking mode), gọi hàm (function calling), công cụ tích hợp sẵn và đầu ra có cấu trúc, khiến nó trở thành giải pháp thay thế trực tiếp hoàn chỉnh cho các khung agent (agent frameworks) và pipeline gọi công cụ. Qwen3.8-Max được phục vụ qua ba định dạng wire — tương thích OpenAI, tương thích Anthropic và DashScope nguyên bản — trên khắp Bắc Kinh, Singapore, Tokyo, Frankfurt và Virginia. Chế độ suy nghĩ được bật/tắt bằng tham số enable_thinking (hoặc reasoning.effort trên Responses API). Đây là bậc cao cấp nhất của dòng sản phẩm: hãy dùng nó khi độ chính xác cho các bài toán khó quan trọng hơn chi phí, và hạ xuống Qwen3.7-Plus hoặc Qwen3.7-Flash cho các khối lượng công việc hàng ngày.
Qwen3.8 Max là một mô hình ngôn ngữ lớn đa phương thức thuộc dòng Qwen, có sẵn thông qua OrcaRouter với mã mô hình 'qwen/qwen3.8-max'. Nhà cung cấp là qwen. Mô hình có cửa sổ ngữ cảnh 1.000.000…
Dựa trên các thông tin trong danh mục, Qwen3.8 Max là một mô hình ngôn ngữ đa phương thức chấp nhận đầu vào văn bản, hình ảnh và video. Điều này khiến nó phù hợp cho các tác vụ như tóm tắt tài liệu dài, trả lời câu hỏi về hình ảnh hoặc phân tích nội dung video. Mô hình được kỳ vọng sẽ xử lý tốt việc sinh văn bản và lập luận thông thường, vì nó thuộc họ mô hình ngôn ngữ lớn Qwen. Tuy nhiên, không có danh sách tác vụ cụ thể hoặc điểm chuẩn (benchmark) nào được bao gồm trong danh mục OrcaRouter. Bạn nên thử nghiệm mô hình với các lời nhắc (prompt) của riêng mình để xác nhận nó tạo ra phong cách và độ chính xác mà bạn cần. Vì API tương thích với OpenAI, bạn có thể gửi một yêu cầu nhỏ qua OrcaRouter mà không cần thay đổi mã nguồn hiện có. Token đầu ra của mô hình được tính phí $6,00 cho mỗi 1 triệu token, vì vậy hãy lên kế hoạch cho chi phí sinh (generation) cũng như chi phí đầu vào. Để có kết quả tốt nhất, hãy cung cấp các lời nhắc rõ ràng và chỉ bao gồm ngữ cảnh liên quan.
Để sử dụng đầu vào hình ảnh và video với Qwen3.8 Max, hãy gửi chúng dưới dạng các phần nội dung bên trong tin nhắn trò chuyện đến API tương thích OpenAI của OrcaRouter. Định dạng trò chuyện chuẩn của OpenAI cho phép một mảng nội dung với phần văn bản và phần image_url. Đầu vào video có thể yêu cầu một định dạng cụ thể, không được nêu chi tiết trong mục danh mục; nhà cung cấp qwen liệt kê video là một phương thức được chấp nhận. Một cách tiếp cận phổ biến là truyền các khung hình video dưới dạng một chuỗi hình ảnh hoặc sử dụng mã hóa video riêng của nhà cung cấp nếu OrcaRouter hỗ trợ. Mô hình sau đó sẽ xử lý thông tin hình ảnh cùng với lời nhắc văn bản. Hãy nhớ rằng tất cả đầu vào hình ảnh đều được tính là token và token được tính phí $2.00 cho mỗi 1M token đầu vào. Nếu video của bạn dài, số lượng token có thể rất cao, vì vậy hãy kiểm tra với một mẫu nhỏ trước. Xác nhận lược đồ tin nhắn chính xác trong tài liệu của OrcaRouter trước khi xây dựng mã sản xuất.
Qwen3.8 Max có giá $2.00 cho mỗi 1M token đầu vào và $6.00 cho mỗi 1M token đầu ra. Nếu prompt của bạn ngắn, dữ liệu chỉ gồm văn bản hoặc bạn không cần ngữ cảnh 1,000,000 token, một mô hình rẻ hơn có thể sẽ cho kết quả tương tự với chi phí thấp hơn. Nhiều mô hình chỉ xử lý văn bản trên OrcaRouter có mức giá mỗi token thấp hơn và thời gian phản hồi nhanh hơn cho các tác vụ như phân loại, trích xuất, tóm tắt và trò chuyện thông thường. Bạn nên chọn Qwen3.8 Max khi tác vụ thực sự hưởng lợi từ ngữ cảnh lớn hoặc từ việc kết hợp văn bản với hình ảnh hoặc video. Bạn cũng nên so sánh chất lượng đầu ra trên khối lượng công việc cụ thể của mình, vì giá cả không phải là yếu tố duy nhất. Đối với các ứng dụng có khối lượng lớn, một mô hình rẻ với chất lượng chấp nhận được thường là quyết định kinh doanh tốt hơn. Hãy ước tính kích thước đầu vào trung bình cho mỗi yêu cầu và nhân với mức giá để xem điểm hòa vốn nằm ở đâu.
Các trường hợp sử dụng tốt nhất cho Qwen3.8 Max xuất phát từ các khả năng được liệt kê: cửa sổ ngữ cảnh 1.000.000 token và đầu vào văn bản, hình ảnh và video. Điều này bao gồm trả lời câu hỏi cho tài liệu dài, tóm tắt toàn bộ sách, phân tích hợp đồng, rà soát mã nguồn và các tác vụ đa phương thức nơi bạn cần hiểu ảnh chụp màn hình, biểu đồ hoặc khung hình video. Nó cũng hữu ích để xử lý toàn bộ bản ghi video trong một lần gọi, thay vì chia nhỏ thành các đoạn. Vì chi phí đầu ra là $6.00 trên 1M token, bạn nên hướng tới các câu trả lời ngắn gọn ngay cả khi đầu vào dài. Nếu bạn chỉ cần trả lời một câu hỏi ngắn từ một đoạn văn nhỏ, mô hình này là quá mức và tốn kém. Mô hình phù hợp mạnh mẽ khi đầu vào lớn, đa phương thức hoặc cả hai, và câu trả lời phụ thuộc vào toàn bộ nội dung đó. Sử dụng các mô hình nhỏ hơn cho các tác vụ tạo nội dung khối lượng lớn.
Mục danh mục cho Qwen3.8 Max trên OrcaRouter không liệt kê bất kỳ điểm benchmark nào. Chúng tôi không cung cấp số liệu từ các đánh giá bên ngoài vì không có số liệu nào dựa trên các dữ kiện được cung cấp. Nhìn chung, điểm benchmark đo lường hiệu suất của mô hình trên các tác vụ như kiến thức tổng quát, lập luận, lập trình và hiểu đa phương thức, tùy thuộc vào từng benchmark. Nếu không có điểm chính thức cho Qwen3.8 Max, bạn không thể dựa vào một chỉ số duy nhất. Cách phù hợp để đánh giá mô hình là chạy thử trên bộ xác thực của riêng bạn bằng API tương thích OpenAI của OrcaRouter. So sánh kết quả đầu ra trên nhiều prompt khác nhau và kiểm tra tính nhất quán. Nếu sau này bạn thấy điểm benchmark do nhà cung cấp công bố, hãy coi đó là một tín hiệu trong nhiều tín hiệu, không phải là bằng chứng rằng trường hợp sử dụng của bạn sẽ hoạt động. Một mô hình đạt điểm cao trên benchmark rộng vẫn có thể thất bại với dữ liệu chuyên biệt theo lĩnh vực, vì vậy việc kiểm thử trực tiếp là điều quan trọng.
Không có số liệu về độ trễ hay thông lượng nào được cung cấp cho Qwen3.8 Max trong danh sách danh mục trên OrcaRouter. Tốc độ phản hồi phụ thuộc vào cơ sở hạ tầng của nhà cung cấp qwen, kích thước đầu vào của bạn và tải hiện tại trên OrcaRouter. Một yêu cầu có 1.000.000 token đầu vào sẽ mất nhiều thời gian hơn một lời nhắc ngắn vì mô hình phải xử lý toàn bộ ngữ cảnh trước khi tạo đầu ra. Độ dài đầu ra cũng ảnh hưởng đến tổng thời gian; việc tạo nhiều token cần thời gian. Nếu tốc độ là yếu tố quan trọng, hãy giữ kích thước đầu vào và đầu ra càng nhỏ càng tốt. Bạn có thể đo thời gian đến token đầu tiên bằng cách phát trực tiếp phản hồi qua API của OrcaRouter. Vì không có số liệu tốc độ chính thức nào, đừng giả định một thời gian phản hồi cụ thể. Hãy tự chạy thử nghiệm với kích thước lời nhắc thực tế và đo lường nó. Độ trễ cũng có thể thay đổi theo khu vực và thời điểm trong ngày. Nhà cung cấp có thể hạn chế các yêu cầu lớn.
Điểm mạnh của Qwen3.8 Max dựa trên mô tả trong danh mục: cửa sổ ngữ cảnh 1.000.000 token và hỗ trợ đầu vào văn bản, hình ảnh và video. Sự kết hợp này hữu ích cho các tác vụ yêu cầu đọc một lượng lớn nội dung đa dạng trong một yêu cầu. Những hạn chế cần nêu rõ là không có điểm chuẩn (benchmark) hoặc số liệu tốc độ nào được liệt kê, vì vậy bạn không thể xác minh chất lượng chỉ từ danh mục. Giá đầu vào $2.00 cho mỗi 1M token cao hơn nhiều mô hình nhỏ hơn, và giá đầu ra $6.00 cho mỗi 1M token đồng nghĩa với việc các phản hồi dài không hề rẻ. Mô hình này có thể không phải là lựa chọn tốt nhất cho các ứng dụng ngắn, chỉ dùng văn bản hoặc nhạy cảm với độ trễ. Bạn nên đánh giá Qwen3.8 Max trên dữ liệu của chính mình thông qua OrcaRouter trước khi đưa nó vào môi trường sản xuất. Hãy dựa vào quan sát trực tiếp thay vì các tuyên bố tiếp thị. Đối với các tác vụ phù hợp với cửa sổ nhỏ, một mô hình rẻ hơn sẽ được ưu tiên.
Qwen3.8 Max được tính phí theo tỷ lệ của nhà cung cấp, là $2.00 cho mỗi 1 triệu token đầu vào và $6.00 cho mỗi 1 triệu token đầu ra. OrcaRouter áp dụng mức phụ giá bằng 0, vì vậy giá token bạn thấy chính là giá token bạn phải trả. Không có đề cập đến phí cố định cho mỗi yêu cầu trong mục danh mục. Chi phí của một yêu cầu được tính bằng cách đếm mọi token đầu vào, bao gồm cả token văn bản, hình ảnh và video, rồi nhân với $2.00 cho mỗi 1 triệu token. Token đầu ra được tính riêng và nhân với $6.00 cho mỗi 1 triệu token. Ví dụ: một yêu cầu có 250,000 token đầu vào và 5,000 token đầu ra sẽ có chi phí $0.50 cho đầu vào và $0.03 cho đầu ra. Các khoản phí thực tế sẽ xuất hiện trên hóa đơn OrcaRouter của bạn. Nếu bạn sử dụng đầy đủ ngữ cảnh 1M, riêng chi phí đầu vào đã là $2.00. Không có khoản phí nào khác được liệt kê.
Cửa sổ ngữ cảnh đầy đủ của Qwen3.8 Max là 1,000,000 token. Với mức giá $2.00 cho mỗi 1M token đầu vào, một yêu cầu sử dụng toàn bộ cửa sổ sẽ tốn $2.00 cho đầu vào trước khi tạo ra bất kỳ đầu ra nào. Nếu đầu ra lớn, bạn cũng phải trả $6.00 cho mỗi 1M token đầu ra. Đầu vào hình ảnh tiêu thụ token rất nhanh, vì vậy việc bao gồm các khung video hoặc nhiều hình ảnh có thể đẩy số lượng token đầu vào lên cao hơn nhiều so với những gì bạn có thể mong đợi khi chỉ dùng văn bản. Mô hình định giá này có nghĩa là không có chi phí cố định cho mỗi lần gọi; bạn chỉ trả tiền cho số token đã sử dụng. Điều này cũng có nghĩa là một prompt với 100,000 token tốn $0.20, trong khi một prompt với 1,000,000 token tốn $2.00. Nếu tác vụ của bạn chỉ cần vài nghìn token ngữ cảnh, giá trị của Qwen3.8 Max sẽ khó biện minh hơn. Hãy cân nhắc các mô hình nhỏ hơn cho những trường hợp đó.
Mục nhập danh mục cho Qwen3.8 Max không đề cập đến bộ nhớ đệm (caching). API tương thích OpenAI của OrcaRouter có thể hỗ trợ các lượt truy cập bộ nhớ đệm chuẩn do nhà cung cấp báo cáo, nhưng các dữ kiện về mô hình không xác nhận điều đó. Nếu không có bộ nhớ đệm được xác nhận, bạn nên giả định rằng mọi token đầu vào đều bị tính phí theo mức giá tiêu chuẩn là $2.00 cho mỗi 1 triệu token. Một số nhà cung cấp tự động lưu bộ nhớ đệm cho phần tiền tố của lời nhắc và tính phí thấp hơn cho các token lặp lại, nhưng điều đó không được nêu rõ cho mô hình này. Bạn có thể kiểm tra đối tượng usage trong phản hồi API của OrcaRouter để tìm các trường cached_token; nếu nhà cung cấp báo cáo chúng, bạn sẽ thấy khoản chiết khấu. Nếu không, hãy dự trù ngân sách cho toàn bộ chi phí đầu vào cho mỗi yêu cầu. Phương án an toàn nhất là thử nghiệm với các lời nhắc giống hệt nhau lặp đi lặp lại và kiểm tra mức sử dụng token trong phản hồi. Nếu không có bộ nhớ đệm, hóa đơn của bạn sẽ không được giảm bớt.
Để gọi Qwen3.8 Max, hãy sử dụng API tương thích OpenAI của OrcaRouter tại base URL https://api.orcarouter.ai/v1. Đặt model id là 'qwen/qwen3.8-max' trong request body. Endpoint là https://api.orcarouter.ai/v1/chat/completions. Bạn gửi một đối tượng JSON với mảng messages, trong đó mỗi message có role và content. Đối với đầu vào chỉ có văn bản, content là một chuỗi đơn giản. Đối với đầu vào hình ảnh hoặc video, content có thể là một mảng các phần, tuân theo định dạng vision của OpenAI. Xác thực bằng API key OrcaRouter của bạn trong header Authorization. OrcaRouter định tuyến yêu cầu đến nhà cung cấp qwen. Không cần base URL riêng của nhà cung cấp. Sử dụng SDK OpenAI tiêu chuẩn và đặt base_url thành URL của OrcaRouter để bắt đầu nhanh chóng. Phản hồi tuân theo định dạng chat completions giống như bạn đã biết.
Thông qua API tương thích OpenAI của OrcaRouter, bạn có thể đặt các tham số như temperature, top_p, max_tokens và chuỗi dừng (stop sequences). Các tham số được hỗ trợ có thể phụ thuộc vào backend của nhà cung cấp qwen. Qwen3.8 Max có cửa sổ ngữ cảnh 1.000.000 token, do đó tổng token đầu vào và đầu ra phải nằm trong giới hạn đó. Độ dài đầu ra tối đa không được liệt kê trong mục danh mục; hãy kiểm tra tài liệu mô hình hoặc thông báo lỗi để biết giới hạn đó. Bạn có thể sử dụng tham số stream để nhận token ngay khi chúng được tạo, giúp cải thiện độ trễ cảm nhận. Đối với đầu vào đa phương thức, mảng nội dung thông điệp cần bao gồm các loại phần chính xác. Nếu một tham số không được hỗ trợ, OrcaRouter sẽ trả về lỗi và bạn có thể điều chỉnh yêu cầu của mình. Hãy thử nghiệm với một payload nhỏ trước để xác nhận hành vi của tham số. Đây là thông lệ chuẩn khi tích hợp bất kỳ mô hình mới nào.
Nếu ứng dụng của bạn đã sử dụng API chat completions của OpenAI, việc chuyển sang Qwen3.8 Max trên OrcaRouter rất đơn giản. Thay đổi base URL thành https://api.orcarouter.ai/v1 và đặt API key thành khóa OrcaRouter của bạn. Đặt trường model thành 'qwen/qwen3.8-max'. Cấu trúc message vẫn giữ nguyên, bao gồm các message system, user và assistant. Đối với các yêu cầu đa phương thức (multimodal), hãy sử dụng định dạng content parts tương tự như API vision của OpenAI. Bạn có thể cần cập nhật prompt vì Qwen3.8 Max là một mô hình khác và có thể phản hồi khác đi. Hãy kiểm thử với một vài yêu cầu mẫu trước khi chuyển lưu lượng production. Cũng lưu ý rằng model id bao gồm tiền tố 'qwen/', đây là cách OrcaRouter xác định nhà cung cấp. Không cần viết lại mã nếu SDK của bạn cho phép tùy chỉnh base URL. Điều này giúp giảm công sức di chuyển. Bạn có thể giữ nguyên logic xử lý lỗi và thử lại (retry) như cũ.
Qwen3.8 Max nổi bật với cửa sổ ngữ cảnh 1.000.000 token và khả năng hỗ trợ đầu vào dạng văn bản, hình ảnh và video. Các mẫu Qwen nhỏ hơn thường có cửa sổ ngữ cảnh ngắn hơn và có thể không chấp nhận cả ba loại dữ liệu này. Vì không có điểm số benchmark nào được cung cấp cho Qwen3.8 Max trên OrcaRouter, nên không thể so sánh trực tiếp chất lượng với các mẫu nhỏ hơn dựa trên dữ liệu trong danh mục. Chênh lệch giá là rõ ràng: Qwen3.8 Max tính $2.00 cho mỗi 1M token đầu vào và $6.00 cho mỗi 1M token đầu ra. Các mẫu nhỏ hơn thường tính phí thấp hơn trên mỗi token và có thể nhanh hơn, nhưng giới hạn của chúng có thể buộc bạn phải chia nhỏ dữ liệu đầu vào hoặc bỏ qua dữ liệu hình ảnh. Nếu dự án của bạn nằm trong phạm vi ngữ cảnh nhỏ hơn và không cần đầu vào video, một mẫu nhỏ hơn có thể sẽ kinh tế hơn. Nếu bạn cần suy luận trên một tài liệu dài hoặc video, Qwen3.8 Max là lựa chọn được thiết kế cho mục đích đó.
OrcaRouter lưu trữ nhiều mô hình từ các nhà cung cấp khác nhau và Qwen3.8 Max là một trong các tùy chọn đa phương thức. Các tính năng đặc trưng của nó là cửa sổ ngữ cảnh 1.000.000 token và khả năng nhập văn bản, hình ảnh và video. Các mô hình đa phương thức khác có thể có cửa sổ ngữ cảnh nhỏ hơn hoặc mức giá token khác. Mục danh mục cho Qwen3.8 Max liệt kê $2,00 cho mỗi 1M token đầu vào và $6,00 cho mỗi 1M token đầu ra, với mức chênh lệch bằng 0 trên OrcaRouter. Không có điểm chuẩn, bạn không thể kết luận mô hình nào có năng lực vượt trội hơn. Bạn có thể so sánh trực tiếp chúng bằng cách gửi cùng một prompt đến từng mô hình qua API tương thích OpenAI của OrcaRouter và so sánh chất lượng đầu ra, thời gian phản hồi và chi phí. Sự lựa chọn phụ thuộc vào khối lượng công việc cụ thể của bạn và mức độ ngữ cảnh bạn thực sự cần. Hỗ trợ video không phải là tính năng phổ biến, vì vậy đó là một điểm khác biệt chính. Một mô hình có giá thấp hơn vẫn có thể tốt hơn nếu các prompt của bạn nhỏ.
Chọn Qwen3.8 Max khi tác vụ yêu cầu cửa sổ ngữ cảnh lớn lên đến 1,000,000 token hoặc yêu cầu đầu vào đa phương thức với văn bản, hình ảnh và video. Đây là lựa chọn hợp lý cho phân tích tài liệu dài, hiểu toàn bộ video và suy luận kết hợp hình ảnh và văn bản. Hãy chọn một phương án khác khi prompt của bạn ngắn, chỉ dùng văn bản hoặc nhạy cảm với độ trễ, và khi một mô hình nhỏ hơn với giá token thấp hơn có thể mang lại chất lượng chấp nhận được. Cũng cân nhắc các phương án khác nếu bạn cần điểm benchmark đã công bố hoặc thông lượng đảm bảo, vì những thông số này không được niêm yết cho Qwen3.8 Max. Quyết định đúng đắn phụ thuộc vào mức sử dụng token dự kiến, khả năng chấp nhận chi phí và yêu cầu chất lượng của bạn. Chạy một đánh giá nhỏ trên OrcaRouter với cả hai mô hình và tính tổng chi phí cho mỗi câu trả lời thành công trước khi đưa vào sản xuất. Không có mô hình tốt nhất duy nhất cho mọi tác vụ.
Tương thích OpenAI — giữ nguyên SDK bạn đang dùng
https://api.orcarouter.ai/v1https://api.orcarouter.aiimport os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="qwen/qwen3.8-max",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)enable_thinkinginclude_reasoningmax_tokenspresence_penaltyreasoningreasoning_effortresponse_formatseedstopstructured_outputstemperaturetool_choicetoolstop_p| Đầu vào / 1M tokens | $2.00 |
| Đầu ra / 1M tokens | $6.00 |
| Đọc cache / 1M | $0.250 |
| Ghi cache / 1M | $2.50 |
| Tiền tệ | USD |
Ước tính theo giá niêm yết
Chỉ là ước tính — số token thực tế phụ thuộc vào bộ tách token của nhà cung cấp.
Điều các nhà phát triển đang nói tuần này
GET /api/public/models/qwen/qwen3.8-maxMở @misc{orcarouter_qwen3_8_max,
title = {Qwen3.8 Max API},
author = {Qwen},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/qwen/qwen3.8-max}
}Qwen. (2026). Qwen3.8 Max API. OrcaRouter. https://www.orcarouter.ai/models/qwen/qwen3.8-max