Qwen3.7 Flash

qwen/qwen3.7-flash
MớiNổi bật
Thị giácCông cụJSONSuy luận
bởi Qwen · 2026-07-27

Qwen3.7 Flash là mô hình nhanh, cực kỳ tiết kiệm chi phí trong dòng Qwen3.7 của Alibaba, nằm dưới Qwen3.7-Plus và Qwen3.7-Max ở bậc thông lượng cao. Mô hình này có khả năng đa phương thức tự nhiên ở phía đầu vào — chấp nhận văn bản, hình ảnh và video, đầu ra là văn bản — và phục vụ cửa sổ ngữ cảnh 1 triệu token với tối đa 64K token đầu ra, giúp các tài liệu dài, ảnh chụp màn hình và khung hình video luôn trong tầm với ngay cả ở mức giá Flash. Với giá khoảng $0,03 trên một triệu token đầu vào ở bậc cơ bản, đây là một trong những mô hình đa phương thức ngữ cảnh 1 triệu token rẻ nhất hiện có, khiến nó trở thành lựa chọn tự nhiên cho phân loại, trích xuất, định tuyến, tóm tắt, tác nhân nhẹ và bất kỳ pipeline nào chạy với khối lượng rất lớn. Mô hình hỗ trợ chế độ suy luận, gọi công cụ tự nhiên, đầu ra có cấu trúc qua response_format và các kiểm soát lấy mẫu thông thường (temperature / top_p / seed / logprobs). Lưu ý rằng giá được phân bậc theo độ dài prompt: chi phí tăng dần khi trên 32K token đầu vào và lại tăng tiếp khi trên 256K token đầu vào, vì vậy xử lý theo lô các yêu cầu ngắn sẽ rẻ hơn đáng kể so việc đệm dài. Hãy dùng Flash làm công cụ chủ lực cho khối lượng lớn và nâng cấp lên Qwen3.7-Plus hoặc Max khi tác vụ thực sự cần nhiều khả năng hơn.

ngữ cảnh1M token
Đầu ra tối đa65K
Đầu vàotext + image + video
Đầu ratext
TTFT p502.83 s
ĐẦU VÀO$0.03/ 1M token
ĐẦU RA$0.13/ 1M token
TTFT p502.83 s7 ngày
p95 TTFT9.64 s7 ngày
LƯU LƯỢNG13.5Mtokens / 7 ngày

Qwen3.7 Flash là một mô hình ngôn ngữ lớn đa phương thức được tạo ra bởi đội ngũ Qwen và được cung cấp thông qua OrcaRouter. Mô hình này xử lý các đầu vào dạng văn bản, hình ảnh và video, đồng thời…

Qwen3.7 Flash là gì và ai nên sử dụng nó?

Qwen3.7 Flash hỗ trợ những phương thức nhập liệu nào?

Kích thước cửa sổ ngữ cảnh của Qwen3.7 Flash là bao nhiêu?

Qwen3.7 Flash được truy cập qua OrcaRouter như thế nào?

Mã ví dụ

Gọi từ bất kỳ SDK nào

Tương thích OpenAI — giữ nguyên SDK bạn đang dùng

  • OpenAI SDKhttps://api.orcarouter.ai/v1
import os

from openai import OpenAI

client = OpenAI(
    base_url="https://api.orcarouter.ai/v1",
    api_key=os.environ["ORCAROUTER_API_KEY"],
)

response = client.chat.completions.create(
    model="qwen/qwen3.7-flash",
    messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)

Tham số được hỗ trợ

  • include_reasoning
  • logprobs
  • max_tokens
  • presence_penalty
  • reasoning
  • response_format
  • seed
  • temperature
  • tool_choice
  • tools
  • top_logprobs
  • top_p

Giá

BậcĐầu vào / 1M tokensĐầu ra / 1M tokensĐọc cache / 1MGhi cache / 1M
32K$0.030$0.130$0.0060$0.038
256K$0.100$0.400$0.020$0.125
$0.200$0.800$0.040$0.250
Bậc được chọn theo số token đầu vào của mỗi yêu cầu

Máy tính chi phí

Token / tháng10MM
Tỷ lệ đầu vào70%%
Ước tính / tháng $0.600 · Có cache prompt $0.516

Ước tính theo giá niêm yết

Giá theo bậc — ước tính này dùng mức giá bậc cơ bản.

Công cụ ước tính token & chi phí

Token đầu vào: 17Chi phí mỗi yêu cầu: $0.000066

Chỉ là ước tính — số token thực tế phụ thuộc vào bộ tách token của nhà cung cấp.

Hiệu suất

TTFT p50
2.83 s
Tốc độ đầu ra
333 tok/s
p95 TTFT
9.64 s
Tỷ lệ lỗi
0%

Benchmark công khai

Thảo luận cộng đồng

Điều các nhà phát triển đang nói tuần này

Hacker News0 lượt nhắc · 7 ngày

So sánh

Qwen3.7 Flashqwen/qwen3-max-previewQwen3.5 397B A17Bqwen/qwen3.5-plus
Đầu vào $/M$0.03$0.86$0.17$0.12
Đầu ra $/M$0.13$3.44$1.03$0.69
Ngữ cảnh1.0M262K33K1.0M
Chất lượng7/108/108/108/10
So sánh song songSo sánh song songSo sánh song songSo sánh song song

Câu hỏi thường gặp

Chi phí Qwen3.7 Flash trên OrcaRouter là bao nhiêu?
Không có mức giá cụ thể cho Qwen3.7 Flash trong các thông tin có sẵn. OrcaRouter thường tính phí theo token cho đầu vào và đầu ra. Là một mô hình Flash, nó có khả năng được định giá thấp hơn so với các mô hình hàng đầu. Truy cập trang giá của OrcaRouter hoặc liên hệ bộ phận hỗ trợ để biết mức giá hiện tại.
Kích thước cửa sổ ngữ cảnh của Qwen3.7 Flash là bao nhiêu?
Cửa sổ ngữ cảnh là 1.000.000 token. Điều này cho phép mô hình xử lý các tài liệu rất dài, các cuộc hội thoại kéo dài, hoặc các bộ ảnh/video lớn trong một lần nhắc duy nhất.
Những điểm mạnh của Qwen3.7 Flash là gì?
Các điểm mạnh của nó bao gồm ngữ cảnh 1M token, hỗ trợ đầu vào đa phương thức (văn bản, hình ảnh, video), tối đa 65k token đầu ra, và kiến trúc 'Flash' được tối ưu hóa giúp cân bằng tốc độ và chi phí. Nó phù hợp cho việc phân tích tài liệu dài và hiểu đa phương thức.
Qwen3.7 Flash so sánh thế nào với GPT-4o-mini?
Qwen3.7 Flash cung cấp cửa sổ ngữ cảnh lớn hơn đáng kể (1M so với 128k) và đầu ra tối đa cao hơn (65k so với 16k). GPT-4o-mini có thể có hỗ trợ hệ sinh thái rộng hơn. Không có thông tin về giá cả hay điểm chuẩn nào được cung cấp để so sánh trực tiếp.
OrcaRouter có lưu cache các prompt để giảm chi phí không?
OrcaRouter có thể cung cấp bộ nhớ đệm nhanh (prompt caching), nhưng chính sách cụ thể cho Qwen3.7 Flash không được nêu chi tiết trong dữ liệu. Hãy kiểm tra tài liệu của OrcaRouter để biết thông tin về chỉ báo trúng bộ nhớ đệm (cache hit indicators) và thông tin giảm giá.
Làm thế nào để gọi Qwen3.7 Flash thông qua API tương thích với OpenAI?
Đặt URL cơ sở thành https://api.orcarouter.ai/v1 và sử dụng ID mô hình "qwen/qwen3.7-flash". Bao gồm khóa API OrcaRouter của bạn. Điểm cuối (endpoint) hoàn thành cuộc trò chuyện hoạt động với các tham số OpenAI tiêu chuẩn. Đối với đầu vào đa phương thức, thêm các đối tượng hình ảnh hoặc video vào mảng nội dung tin nhắn.
Qwen3.7 Flash hỗ trợ những phương thức nhập liệu nào?
Nó hỗ trợ đầu vào văn bản, hình ảnh và video. Điều này cho phép các tác vụ như phân tích hình ảnh cùng với văn bản, tóm tắt video và kết hợp nhiều loại phương tiện trong một lời nhắc duy nhất.
Tôi có thể tinh chỉnh Qwen3.7 Flash trên dữ liệu của riêng mình không?
Các dữ kiện có sẵn không đề cập đến khả năng tinh chỉnh. Là một mô hình truy cập qua API thông qua OrcaRouter, tinh chỉnh có thể không được hỗ trợ. Để tinh chỉnh tùy chỉnh, hãy cân nhắc các giải pháp mã nguồn mở.
Độ dài đầu ra tối đa của Qwen3.7 Flash là bao nhiêu?
Giới hạn đầu ra tối đa là 65.536 token. Điều này cho phép tạo ra các phản hồi, báo cáo hoặc mã nguồn rất dài trong một lần gọi API duy nhất.
Làm thế nào để xử lý đầu vào video với Qwen3.7 Flash?
Chi tiết xử lý video cụ thể không được cung cấp. Thông thường, dữ liệu đầu vào video được xử lý dưới dạng chuỗi các khung hình. Bạn có thể cần tiền xử lý video thành một loạt ảnh và truyền chúng dưới dạng URL ảnh hoặc dữ liệu base64. Tham khảo tài liệu của OrcaRouter để biết định dạng chính xác.

Nhúng huy hiệu này

Qwen: Qwen3.7 Flash$0.03/M in2828ms p50qua OrcaRouter
HTML <a href="https://www.orcarouter.ai/models/qwen/qwen3.7-flash" target="_blank"> <img src="https://www.orcarouter.ai/embed/qwen/qwen3.7-flash.svg" alt="Qwen: Qwen3.7 Flash trên OrcaRouter" /> </a>
Markdown [![Qwen: Qwen3.7 Flash](https://www.orcarouter.ai/embed/qwen/qwen3.7-flash.svg)](https://www.orcarouter.ai/models/qwen/qwen3.7-flash)

Thẻ mô hình dạng dữ liệu

GET /api/public/models/qwen/qwen3.7-flashMở
Máy đọc được:/llms.txt/llms-full.txt