Qwen3.7 Flash là mô hình nhanh, cực kỳ tiết kiệm chi phí trong dòng Qwen3.7 của Alibaba, nằm dưới Qwen3.7-Plus và Qwen3.7-Max ở bậc thông lượng cao. Mô hình này có khả năng đa phương thức tự nhiên ở phía đầu vào — chấp nhận văn bản, hình ảnh và video, đầu ra là văn bản — và phục vụ cửa sổ ngữ cảnh 1 triệu token với tối đa 64K token đầu ra, giúp các tài liệu dài, ảnh chụp màn hình và khung hình video luôn trong tầm với ngay cả ở mức giá Flash. Với giá khoảng $0,03 trên một triệu token đầu vào ở bậc cơ bản, đây là một trong những mô hình đa phương thức ngữ cảnh 1 triệu token rẻ nhất hiện có, khiến nó trở thành lựa chọn tự nhiên cho phân loại, trích xuất, định tuyến, tóm tắt, tác nhân nhẹ và bất kỳ pipeline nào chạy với khối lượng rất lớn. Mô hình hỗ trợ chế độ suy luận, gọi công cụ tự nhiên, đầu ra có cấu trúc qua response_format và các kiểm soát lấy mẫu thông thường (temperature / top_p / seed / logprobs). Lưu ý rằng giá được phân bậc theo độ dài prompt: chi phí tăng dần khi trên 32K token đầu vào và lại tăng tiếp khi trên 256K token đầu vào, vì vậy xử lý theo lô các yêu cầu ngắn sẽ rẻ hơn đáng kể so việc đệm dài. Hãy dùng Flash làm công cụ chủ lực cho khối lượng lớn và nâng cấp lên Qwen3.7-Plus hoặc Max khi tác vụ thực sự cần nhiều khả năng hơn.
Qwen3.7 Flash là một mô hình ngôn ngữ lớn đa phương thức được tạo ra bởi đội ngũ Qwen và được cung cấp thông qua OrcaRouter. Mô hình này xử lý các đầu vào dạng văn bản, hình ảnh và video, đồng thời…
Qwen3.7 Flash vượt trội trong khả năng hiểu đa phương thức với ngữ cảnh rất dài. Các trường hợp sử dụng chính bao gồm: xử lý và tóm tắt bản ghi video dài hoặc bản ghi bài giảng; phân tích hình ảnh y tế cùng với lịch sử bệnh nhân hoặc tài liệu pháp lý; xây dựng chatbot có thể nhớ toàn bộ lịch sử hội thoại (lên đến 1 triệu token); và thực hiện tạo sinh tăng cường truy xuất trên các kho tài liệu doanh nghiệp lớn, nơi toàn bộ ngữ cảnh vừa trong một prompt duy nhất. Khả năng đầu ra 65.536 token cũng phù hợp cho các tác vụ như tạo báo cáo chi tiết hoặc mã nguồn với chú thích mở rộng. Vì đây là biến thể “Flash”, nó có thể hiệu quả hơn về chi phí và thời gian so với các mô hình lớn hơn đối với các tác vụ không yêu cầu độ sâu suy luận cao nhất. Tuy nhiên, đối với các tác vụ thuần văn bản với yêu cầu ngữ cảnh vừa phải, các mô hình nhỏ hơn (ví dụ: mô hình chỉ xử lý văn bản nhanh) có thể rẻ hơn và nhanh hơn. Bản chất đa phương thức giúp Qwen3.7 Flash trở thành ứng cử viên mạnh mẽ cho các ứng dụng liên quan đến đa phương tiện, chẳng hạn như phân tích sản phẩm thương mại điện tử từ hình ảnh và mô tả, hoặc trợ lý giám sát video thời gian thực.
Trong khi Qwen3.7 Flash được tối ưu hóa về tốc độ và chi phí so với các mô hình flagship lớn hơn, nó vẫn có thể là quá mức cần thiết cho các trường hợp sử dụng đơn giản. Nếu ứng dụng của bạn chỉ xử lý các chuỗi văn bản ngắn (ví dụ: vài trăm token mỗi tin nhắn), một mô hình chỉ văn bản nhỏ hơn với chi phí mỗi token thấp hơn sẽ tiết kiệm hơn. Tương tự, nếu bạn không bao giờ cần phân tích hình ảnh hoặc video, một mô hình chỉ văn bản từ OrcaRouter sẽ giúp tránh phải trả tiền cho các khả năng thị giác không sử dụng. Các tác vụ yêu cầu suy luận tối thiểu, chẳng hạn như phân loại đơn giản hoặc dịch thuật cơ bản, có thể được xử lý bởi các mô hình nhẹ hơn với độ trễ thấp hơn. Đối với phát triển và tạo mẫu thử, sử dụng mô hình rẻ hơn trong quá trình lặp giúp tiết kiệm tín dụng. Ngữ cảnh 1 triệu token là một lợi thế lớn khi cần, nhưng nếu prompt trung bình của bạn dưới 10k token, chi phí xử lý các đầu vào theo lô lớn có thể không hợp lý. Hãy đánh giá khối lượng công việc điển hình và yêu cầu về phương thức trước khi cam kết sử dụng Qwen3.7 Flash.
Qwen3.7 Flash có thể không phải là lựa chọn tốt nhất cho các tác vụ yêu cầu độ chính xác toán học cực cao, suy luận biểu tượng đa bước, hoặc chuyên môn theo lĩnh vực cụ thể không có trong dữ liệu huấn luyện của nó. Biến thể “Flash” có thể hy sinh một phần chiều sâu để đổi lấy tốc độ, vì vậy các chuẩn mực suy luận phức tạp có thể được giải quyết tốt hơn bởi các mô hình lớn hơn không phải Flash. Ngoài ra, nếu ứng dụng của bạn yêu cầu xử lý âm thanh thời gian thực (ví dụ: chuyển giọng nói thành văn bản), các phương thức đầu vào của Qwen3.7 Flash chỉ giới hạn ở văn bản, hình ảnh và video; nó không trực tiếp chấp nhận luồng âm thanh. Đối với các tác vụ yêu cầu định dạng nhất quán trên các đầu ra rất dài, đầu ra tối đa 65.536 token của mô hình là hào phóng, nhưng các tạo sinh rất dài có thể dễ bị lặp lại hoặc lạc đề. Các ứng dụng nhạy cảm về an toàn cần được kiểm tra về độ phù hợp, vì không có đánh giá an toàn cụ thể nào được cung cấp trong các dữ kiện. Các tác vụ đa phương thức liên quan đến hình ảnh/video chất lượng kém hoặc mơ hồ cao có thể tạo ra kết quả không đáng tin cậy.
Không có điểm chuẩn nào được cung cấp trong các dữ liệu có sẵn cho Qwen3.7 Flash. Do đó, không thể trích dẫn các con số cụ thể. Nhìn chung, các biến thể flash của mô hình ngôn ngữ lớn được thiết kế để suy luận nhanh hơn và chi phí thấp hơn, thường có độ chính xác giảm vừa phải so với các phiên bản lớn hơn. Người dùng quan tâm đến đánh giá định lượng nên tự chạy các bài kiểm tra chuẩn của mình bằng API của OrcaRouter trên các tác vụ đại diện, chẳng hạn như các bài kiểm tra chuẩn NLP, bài kiểm tra hiểu đa phương thức và độ chính xác truy xuất ngữ cảnh dài. Khi so sánh với các mô hình khác, thường xem xét các chỉ số như MMLU, HumanEval, hoặc các bài kiểm tra chuẩn đa phương thức (ví dụ: MMMU, ChartQA). Không có điểm số được công bố, điểm mạnh và điểm yếu của mô hình nên được xác định bằng thực nghiệm. OrcaRouter có thể cung cấp thêm siêu dữ liệu hoặc bảng điều khiển hiệu suất. Đối với các quyết định sản xuất, nên tiến hành thử nghiệm A/B trên dữ liệu cụ thể của bạn.
Các con số cụ thể về độ trễ hoặc thông lượng cho Qwen3.7 Flash không được cung cấp trong các dữ kiện. Tuy nhiên, với tư cách là mô hình “Flash”, nó thường được tối ưu hóa để cung cấp phản hồi nhanh hơn so với các mô hình không phải Flash lớn hơn trong cùng họ. Tốc độ thực tế phụ thuộc vào các yếu tố như độ dài đầu vào, số lượng token đầu ra, kích thước lô, và cơ sở hạ tầng phần cứng cơ bản được sử dụng bởi OrcaRouter. Người dùng có thể mong đợi thời gian đến token đầu tiên thấp hơn cho các lời nhắc ngắn và số token hợp lý mỗi giây cho phản hồi phát trực tuyến. Xét bối cảnh 1M-token, việc xử lý các đầu vào rất dài sẽ mất nhiều thời gian hơn do cơ chế chú ý của mô hình. Đối với các ứng dụng yêu cầu độ trễ thấp, sử dụng bối cảnh nhỏ hơn (ngay cả khi giới hạn cao) sẽ cải thiện thời gian phản hồi. Kiểm tra qua API của OrcaRouter với kích thước tải trọng đại diện là cách tốt nhất để đánh giá hiệu suất thực tế. API hỗ trợ phát trực tuyến, cho phép hiển thị dần các token đầu ra, giảm độ trễ cảm nhận cho người dùng cuối.
Ưu điểm: Ngữ cảnh 1 triệu token của mô hình cho phép xử lý các tài liệu rất dài trong một lần, tránh được sự phức tạp của việc chia nhỏ hoặc cửa sổ trượt. Hỗ trợ đa phương thức (văn bản, hình ảnh, video) cho phép tương tác phong phú mà không cần các mô hình riêng biệt. Khả năng xuất ra 65.536 token là hào phóng cho việc tạo báo cáo hoặc mã nguồn toàn diện. Là một biến thể flash, nó có thể cân bằng tốc độ và chi phí một cách thuận lợi cho nhiều khối lượng công việc sản xuất. Hạn chế: Không có điểm chuẩn cụ thể nào được cung cấp, vì vậy khả năng suy luận và độ chính xác của nó so với các mô hình kích thước đầy đủ là không rõ. Khả năng đa phương thức có thể không sánh được với các mô hình thị giác chuyên dụng trong các tác vụ chi tiết. Giới hạn xử lý video không được xác định—người dùng có thể cần tiền xử lý video thành các khung hình ảnh. Không có đề cập đến hỗ trợ đầu vào âm thanh hoặc sử dụng công cụ. Như với bất kỳ mô hình nào, đầu ra cần được xem xét về tính chính xác và an toàn, đặc biệt trong các lĩnh vực nhạy cảm. Việc thiếu dữ liệu đào tạo được công bố khiến cho sự thiên vị và độ mạnh mẽ không được biết đến.
Không có thông tin định giá cụ thể cho từng token của Qwen3.7 Flash trong các dữ kiện hiện có. OrcaRouter thường tính phí dựa trên số lượng token đầu vào và token đầu ra được xử lý, với chi phí thay đổi theo cấp độ mô hình. Là một mô hình “Flash”, nó có khả năng được định giá thấp hơn các mô hình hàng đầu (ví dụ: Qwen3.7 Max) để phản ánh sự đánh đổi về tốc độ và hiệu suất. Thông tin chi tiết về giá nên được lấy từ trang định giá chính thức hoặc bảng điều khiển của OrcaRouter. Khi ước tính chi phí, cần lưu ý rằng cửa sổ ngữ cảnh 1 triệu token có thể dẫn đến số lượng token đầu vào lớn nếu bạn lấp đầy nó. Ví dụ: đầu vào 500k token sẽ phát sinh chi phí cao hơn tương ứng so với đầu vào 10k token. Người dùng có ngân sách eo hẹp nên điều chỉnh kích thước sử dụng ngữ cảnh cho phù hợp – chỉ bao gồm các token cần thiết. API được đo lường theo từng token, do đó các chiến lược lưu cache được thảo luận trong phần tiếp theo có thể giúp giảm chi phí đầu vào lặp lại.
Sự đánh đổi chính nằm giữa kích thước ngữ cảnh và chi phí. Trong khi mô hình hỗ trợ tới 1 triệu token, việc xử lý các đầu vào rất dài sẽ làm tăng hóa đơn một cách tuyến tính. Đối với các tác vụ không cần toàn bộ ngữ cảnh, việc cắt bớt hoặc tóm tắt nội dung cũ sẽ giảm chi phí. Tương tự, việc tạo ra các đầu ra rất dài (lên tới 65 nghìn token) sẽ tốn kém hơn so với các câu trả lời ngắn. So sánh Qwen3.7 Flash với các mô hình nhỏ hơn, chỉ xử lý văn bản: nếu khối lượng công việc của bạn không yêu cầu đa phương thức hoặc khả năng ngữ cảnh dài, một mô hình rẻ hơn có thể là lựa chọn khả thi. Vì không có bảng giá được công bố, chúng tôi không thể đưa ra so sánh chính xác. Tuy nhiên, các mô hình flash thường rẻ hơn 10–50% mỗi token so với các phiên bản đầy đủ, đồng thời có tốc độ tương đương. Hãy cân nhắc sử dụng bộ nhớ đệm (caching) để tránh xử lý lại các tiền tố đầu vào giống hệt nhau. OrcaRouter có thể cung cấp giảm giá cho bộ nhớ đệm lời nhắc (không được nêu rõ). Trong môi trường sản xuất, hãy theo dõi mức tiêu thụ token của bạn qua các chỉ số sử dụng của OrcaRouter và điều chỉnh các tham số như max_tokens và độ dài ngữ cảnh để kiểm soát chi phí.
OrcaRouter có thể cung cấp tính năng lưu cache tự động cho các tiền tố đầu vào nhằm giảm chi phí và độ trễ, nhưng chính sách lưu cache cụ thể cho Qwen3.7 Flash không được nêu chi tiết trong các thông tin được cung cấp. Nhiều nhà cung cấp API giảm giá token khi cùng một tiền tố prompt được sử dụng lại qua nhiều yêu cầu, thường có cửa sổ làm mới. Nếu bật cache, các system prompt lặp lại hoặc ngữ cảnh chung có thể được xử lý với chi phí thấp hơn. Người dùng nên kiểm tra tài liệu của OrcaRouter hoặc các header phản hồi API (ví dụ: liệu chúng có bao gồm chỉ báo cache hit hay không) để xác định cache có hoạt động hay không. Đối với đầu vào đa phương thức, cache kém hiệu quả hơn do sự đa dạng của nội dung hình ảnh. Để tối đa hóa lợi ích của cache, hãy cấu trúc prompt của bạn với một system message tĩnh và biến thiên tối thiểu ở tiền tố. Nếu không có sẵn cache, hãy cân nhắc gộp các yêu cầu hoặc sử dụng thư viện yêu cầu chuyên dụng hỗ trợ cơ chế lưu cache prompt.
Để gọi Qwen3.7 Flash với thư viện Python của OpenAI, hãy thiết lập base URL và API key cho OrcaRouter. Ví dụ đoạn mã: ```python import openai client = openai.OpenAI( api_key="your-orcarouter-api-key", base_url="https://api.orcarouter.ai/v1" ) response = client.chat.completions.create( model="qwen/qwen3.7-flash", messages=[ {"role": "user", "content": "Hello, what can you do?"} ], max_tokens=1024, temperature=0.7 ) print(response.choices[0].message.content) ``` Đối với đầu vào đa phương thức có hình ảnh hoặc video, hãy đưa phương tiện vào mảng content với loại "image_url" (đối với hình ảnh) hoặc một đối tượng có cấu trúc dành cho video (chi tiết phụ thuộc vào đặc tả của OrcaRouter). ID mô hình phải chính xác là "qwen/qwen3.7-flash". Tất cả các tham số tiêu chuẩn của OpenAI (stream, top_p, stop, v.v.) đều được hỗ trợ. Đảm bảo API key của bạn có quyền truy cập vào mô hình này.
Khi sử dụng API tương thích OpenAI của OrcaRouter, Qwen3.7 Flash hỗ trợ các tham số chat completions tiêu chuẩn: - model: chuỗi, phải là "qwen/qwen3.7-flash" - messages: mảng các đối tượng tin nhắn với role và content - max_tokens: số nguyên lên đến 65.536 (đầu ra tối đa của mô hình) - temperature: số thực (0 đến 2, thông thường 0.0-1.0) - top_p: số thực cho nucleus sampling - stream: boolean cho truyền phát token - stop: chuỗi hoặc mảng chuỗi cho token dừng tùy chỉnh - presence_penalty, frequency_penalty: điều chỉnh sự lặp lại - logprobs: yêu cầu log xác suất token - user: chuỗi để theo dõi yêu cầu Đối với đầu vào đa phương thức, trường content có thể là một danh sách các phần nội dung (văn bản hoặc image_url). Xử lý video có thể yêu cầu các tham số bổ sung không được đề cập ở đây. API cũng hỗ trợ gọi hàm và chế độ JSON nếu OrcaRouter triển khai chúng; hãy kiểm tra tài liệu. Không có chi tiết sử dụng công cụ nào được cung cấp trong các dữ kiện. Giá trị mặc định cho temperature và top_p thường lần lượt là 1.0 và 0.0.
Việc chuyển đổi từ bất kỳ mô hình tương thích với OpenAI nào (bao gồm các mô hình GPT của OpenAI) sang Qwen3.7 Flash trên OrcaRouter yêu cầu thay đổi tối thiểu: cập nhật base URL thành https://api.orcarouter.ai/v1, đặt tham số model thành "qwen/qwen3.7-flash", và lấy một khóa API OrcaRouter. Định dạng tin nhắn vẫn giống hệt cho các cuộc hội thoại chỉ văn bản. Đối với đầu vào đa phương thức, hãy đảm bảo bạn tuân theo lược đồ cụ thể của OrcaRouter cho hình ảnh và video—điều này có thể khác một chút so với định dạng của OpenAI. Nếu trước đây bạn chỉ sử dụng mô hình văn bản, giờ đây bạn có thể đưa nội dung trực quan vào. Bạn có thể cần điều chỉnh max_tokens nếu mô hình trước đây của bạn có giới hạn nhỏ hơn (OpenAI GPT-4o-mini có đầu ra 16k; mô hình này có 65k). Ngoài ra, cửa sổ ngữ cảnh lớn hơn nhiều (1M so với 128k thông thường), vì vậy bạn có thể gửi các prompt dài hơn. Hãy kiểm tra với một tập con dữ liệu của bạn để xác minh chất lượng phản hồi và độ trễ. API của OrcaRouter có thể có các giới hạn tốc độ khác; hãy kiểm tra tài liệu.
Xác thực được xử lý thông qua khóa API do OrcaRouter cung cấp. Bạn phải đưa khóa API vào header HTTP Authorization dưới dạng token Bearer: "Authorization: Bearer your-api-key". Trong client Python của OpenAI, truyền khóa qua tham số api_key. Đảm bảo khóa đã được cấp quyền truy cập vào mô hình "qwen/qwen3.7-flash"; một số khóa chỉ giới hạn ở các mô hình hoặc cấp độ cụ thể. Không chia sẻ khóa API của bạn công khai. Đối với môi trường sản xuất, hãy sử dụng biến môi trường hoặc trình quản lý bảo mật an toàn. OrcaRouter cũng có thể hỗ trợ các phương thức xác thực bổ sung (ví dụ: OAuth) nhưng endpoint tương thích với OpenAI thường sử dụng xác thực bằng khóa API. Nếu bạn nhận được lỗi 401 Unauthorized, hãy kiểm tra khóa có đúng và còn hiệu lực hay không. Khóa API cần được giữ bí mật; nếu bị lộ, hãy xoay vòng khóa qua bảng điều khiển của OrcaRouter.
Cả Qwen3.7 Flash và GPT-4o-mini đều là các mô hình đa phương thức được tối ưu hóa về tốc độ và chi phí, nhưng có những khác biệt chính dựa trên các dữ kiện hiện có. Qwen3.7 Flash cung cấp cửa sổ ngữ cảnh khổng lồ 1 triệu token, trong khi GPT-4o-mini hỗ trợ 128k token. Đối với các tác vụ yêu cầu ngữ cảnh rất dài hoặc xử lý video lớn, Qwen3.7 Flash có lợi thế rõ ràng. Đầu ra tối đa của GPT-4o-mini là 16.384 token; Qwen3.7 Flash cho phép lên đến 65.536 token. Không có điểm chuẩn nào được cung cấp cho cả hai mô hình trên trang này. Nhìn chung, GPT-4o-mini được hưởng lợi từ việc tinh chỉnh sâu rộng và hệ sinh thái hỗ trợ rộng lớn, trong khi Qwen3.7 Flash có thể vượt trội trong việc hiểu ngôn ngữ châu Á nhờ dữ liệu huấn luyện của nó (chưa được xác nhận). Khả năng tương thích API có nghĩa là việc chuyển đổi giữa chúng trên OrcaRouter rất đơn giản. Giá cả không được chỉ định, vì vậy so sánh chi phí phụ thuộc vào mức giá của OrcaRouter. Hãy lựa chọn dựa trên nhu cầu về độ dài ngữ cảnh và độ dài phản hồi mong muốn.
Qwen3.7 Flash là một biến thể của dòng Qwen 3.7 được thiết kế để suy luận nhanh hơn và chi phí thấp hơn, thường hy sinh một phần độ chính xác so với phiên bản chủ lực Qwen3.7 Max. Mặc dù không có số liệu benchmark cụ thể, nhưng các mô hình Max thường đạt điểm cao hơn trong các tác vụ suy luận và toán học, trong khi các mô hình Flash ưu tiên thông lượng. Cửa sổ ngữ cảnh và đầu ra tối đa của cả hai đều giống nhau (1M đầu vào, 65k đầu ra), do đó khác biệt chính nằm ở hiệu suất trên mỗi token và độ trễ. Nếu ứng dụng của bạn chấp nhận độ chính xác thấp hơn một chút nhưng yêu cầu độ trễ thấp hoặc đồng thời cao, Flash là lựa chọn phù hợp. Đối với các tác vụ đòi hỏi chất lượng cao nhất, chẳng hạn như tạo mã phức tạp hoặc suy luận nâng cao, Max có thể đáng giá với chi phí bổ sung. ID mô hình trên OrcaRouter khác nhau: một là "qwen/qwen3.7-flash", cái còn lại có thể là "qwen/qwen3.7-max". Người dùng nên đánh giá cả hai trên dữ liệu cụ thể của mình để xác định lựa chọn phù hợp nhất.
Qwen3.7 Flash, được truy cập qua OrcaRouter, cung cấp dịch vụ API được quản lý mà không có chi phí hạ tầng, trong khi LLaVA-Next (một mô hình đa phương thức mã nguồn mở) yêu cầu tự lưu trữ. Điều này ảnh hưởng đến chi phí, khả năng mở rộng và bảo trì. Qwen3.7 Flash hỗ trợ tới 1 triệu token ngữ cảnh và 65k đầu ra, nhìn chung lớn hơn cửa sổ ngữ cảnh của LLaVA-Next. Tuy nhiên, LLaVA-Next có thể được tinh chỉnh trên dữ liệu tùy chỉnh, một tùy chọn không được đề cập cho Qwen3.7 Flash qua API. Nếu không có điểm chuẩn, chúng tôi không thể so sánh độ chính xác. LLaVA-Next mạnh về trả lời câu hỏi trực quan; Qwen3.7 Flash có thể có phạm vi ngôn ngữ rộng hơn. OrcaRouter xử lý thời gian hoạt động và dung lượng, trong khi tự lưu trữ yêu cầu tài nguyên GPU. Đối với tạo mẫu nhanh và bảo trì thấp, mô hình API rất hấp dẫn. Đối với kiểm soát hoàn toàn và đào tạo chuyên biệt, mã nguồn mở có thể tốt hơn. Tài sản trí tuệ của mô hình API thuộc sở hữu của Qwen, do đó đầu ra có thể có các điều khoản sử dụng khác.
Tương thích OpenAI — giữ nguyên SDK bạn đang dùng
https://api.orcarouter.ai/v1import os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="qwen/qwen3.7-flash",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)include_reasoninglogprobsmax_tokenspresence_penaltyreasoningresponse_formatseedtemperaturetool_choicetoolstop_logprobstop_p| Bậc | Đầu vào / 1M tokens | Đầu ra / 1M tokens | Đọc cache / 1M | Ghi cache / 1M |
|---|---|---|---|---|
| ≤ 32K | $0.030 | $0.130 | $0.0060 | $0.038 |
| ≤ 256K | $0.100 | $0.400 | $0.020 | $0.125 |
| ≤ ∞ | $0.200 | $0.800 | $0.040 | $0.250 |
| Bậc được chọn theo số token đầu vào của mỗi yêu cầu | ||||
Ước tính theo giá niêm yết
Giá theo bậc — ước tính này dùng mức giá bậc cơ bản.
Chỉ là ước tính — số token thực tế phụ thuộc vào bộ tách token của nhà cung cấp.
Điều các nhà phát triển đang nói tuần này
GET /api/public/models/qwen/qwen3.7-flashMở @misc{orcarouter_qwen3_7_flash,
title = {Qwen3.7 Flash API},
author = {Qwen},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/qwen/qwen3.7-flash}
}Qwen. (2026). Qwen3.7 Flash API. OrcaRouter. https://www.orcarouter.ai/models/qwen/qwen3.7-flash