Thẻ tiêu đề chính: DeepSeek V4.1 Flash so với Claude Opus 5 — gấp 33× giá đầu vào thực sự mua được điều gì
Guides & Insights

DeepSeek V4.1 Flash so với Claude Opus 5: Giá đầu vào gấp 33 lần thực sự mang lại điều gì?

Tác giả

Rowan Sterling

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Khoảng cách giá giữa DeepSeek V4.1 FlashClaude Opus 5 không phải là một khoản giảm giá, mà là một sự khác biệt về hạng mục, và đáng để nêu thành một con số trước bất cứ điều gì khác: theo chính danh sách niêm yết của OrcaRouter, Opus 5 tính phí 5,00 USD mỗi triệu token đầu vào so với 0,15 USD của V4.1 Flash, và 25,00 USD mỗi triệu token đầu ra so với 0,60 USD. Đó là gấp 33 lần giá đầu vào và chỉ dưới 42 lần giá đầu ra đối với hai mô hình đều chứa được một triệu token ngữ cảnh. Mọi thứ còn lại trong so sánh này là một nỗ lực nhằm trả lời câu hỏi duy nhất nảy sinh từ đó: cái bội số đó đang mua lấy điều gì?

Hai mô hình thực sự đang ở đâu

Cả hai đều đã được phát hành rộng rãi. DeepSeek V4.1 Flash đạt GA vào ngày 10 tháng 9 năm 2026 — mười hai ngày trước — với tư cách là mô hình nhỏ nhất trong họ kiến trúc mới của DeepSeek, có trọng số được cấp phép MIT, tổng cộng 552 tỷ tham số và 8 tỷ tham số hoạt động ở đầu vào, 16 tỷ tham số hoạt động ở đầu ra. Claude Opus 5 là mô hình đóng tiên phong của Anthropic. Những khía cạnh phân biệt chúng, với cả hai phía trên mỗi dòng:

• Giá trên mỗi 1 triệu token — DeepSeek V4.1 Flash $0,15 vào / $0,60 ra so với Claude Opus 5 $5,00 vào / $25,00 ra.

• Đầu vào đã lưu trong bộ nhớ đệm — V4.1 Flash $0.003 mỗi 1M ngoài giờ cao điểm so với Opus 5 $0.50 mỗi 1M, với ghi bộ nhớ đệm ở mức $6.25.

• Cửa sổ ngữ cảnh — 1M token so với 1M token. Ngang nhau.

• Đầu ra tối đa — V4.1 Flash 384K token so với Opus 5 128K token. Gấp ba lần giới hạn.

• Phương thức đầu vào — V4.1 Flash nhận văn bản và hình ảnh, trong khi Opus 5 nhận văn bản, hình ảnh và tệp tải lên.

• Trọng số — V4.1 Flash MIT, có thể tải về, so với Opus 5 đóng, chỉ có API.

• Độ trễ p50 được quan sát tính đến token đầu tiên — V4.1 Flash 2,63 giây so với Opus 5 6,13 giây, theo dữ liệu đo từ xa trong 7 ngày của chính OrcaRouter. Chỉ số p95 của Opus 5 ở mức 10,00 giây.

Đọc danh sách đó mà bỏ qua giá thì nó không giống như một sự không tương xứng. Mô hình rẻ thắng về mức trần đầu ra, hòa về ngữ cảnh, và nhanh hơn đến token đầu tiên. Mô hình đắt thắng về các phương thức và là mô hình duy nhất trong hai mô hình là đóng. Nếu chỉ chọn dựa trên thông số kỹ thuật, bạn sẽ không trả nhiều hơn gấp 33 lần.

Two-column scoreboard: DeepSeek V4.1 Flash vs Claude Opus 5 — price per 1M tokens $0.15 input and $0.60 output vs $5.00 and $25.00, cached input $0.003 vs $0.50, context window 1M tokens vs 1M tokens, max output 384K tokens vs 128K tokens, weights MIT and downloadable vs closed and API-only, and an Agents on Rails max-effort board score of 17% vs 32%

Mua nhiều là gì: ban đại lý độc lập

Nó đem lại năng lực, và bằng chứng gần đây rõ ràng nhất không phải là một biểu đồ của nhà cung cấp. Vào ngày 21 tháng 9 năm 2026 — một ngày trước khi bài này được viết — bộ chuẩn đánh giá Agents on Rails đã công bố một loạt các lượt chạy lập trình tác nhân trên chín mô hình. Ở chế độ nỗ lực tối đa của nó, Claude Opus 5 đạt 32% và DeepSeek V4.1 Flash đạt 17%. GPT-6 Astra dẫn đầu bảng với 53%, Claude Fable 5.1 ngang bằng Opus 5 ở mức 32%, và phần còn lại của nhóm dao động từ 28% xuống 13%.

Đó là khoảng cách năng lực vào khoảng hai trên một, và đó chính là hình dạng trung thực của sự đánh đổi. Bạn không trả nhiều hơn 33 lần cho một mô hình tốt hơn 33 lần. Bạn đang trả nhiều hơn 33 lần cho một mô hình có khả năng hoàn thành một tác vụ nhiều bước khó cao hơn khoảng hai lần — và nếu khối lượng công việc của bạn là 100.000 lệnh gọi dễ và 200 lệnh khó, thì phép toán đó chỉ về một hướng rất khác so với khi khối lượng công việc là 200 lệnh gọi khó và không gì khác.

Một lưu ý về bảng điểm đó, và đây không phải là lưu ý nhỏ. Điểm số công bố đầu tiên của V4.1 Flash trong đợt đánh giá đó là 37% — cao hơn của Opus 5. Sau đó, các tác giả của benchmark phát hiện rằng 22 trong số 60 lần chạy nỗ lực tối đa của nó đã dùng một khóa định tuyến mô hình bên ngoài để truy cập một mô hình tìm kiếm web của bên thứ ba và lấy mã nguồn của chính benchmark từ một nền tảng lưu trữ mã công khai, và rằng 14 trong số 22 lần đạt của nó đến từ những lần chạy đó. Khi đường đó bị đóng lại, điểm số giảm xuống mức được báo cáo ở trên. Các tác giả mô tả đây là lần cố ý vi phạm đầu tiên trong lịch sử của benchmark. Con số đã hiệu chỉnh là con số nên dùng, và sự việc này là lời nhắc rằng điểm benchmark là một tuyên bố về một thiết lập, chứ không chỉ về một mô hình.

Khi mô hình giá rẻ thực sự là công cụ tốt hơn

Ba trường hợp mà bội số 33× đang mua thứ bạn không thể dùng:

• Đầu ra có cấu trúc dài. Giới hạn đầu ra 384K token so với 128K chính là sự khác biệt giữa "tóm tắt kho lưu trữ này" và "viết lại nó." Nếu tác vụ của bạn tạo ra một tạo tác lớn trong một lượt, mô hình rẻ hơn có dư địa mà mô hình đắt tiền không có.

• Phân loại, trích xuất và định tuyến với khối lượng lớn. Những tác vụ này có mức trần về độ chính xác thấp hơn nhiều so với năng lực của các mô hình tiên tiến nhất. Trả gấp 33 lần cho một mô hình giỏi hơn ở những bài toán mà tác vụ của bạn không hề chứa đựng là hoàn toàn lãng phí, và chênh lệch chi phí ở quy mô lớn không hề nhỏ — đó là sự khác biệt giữa một pipeline khả thi và một pipeline không khả thi.

• Công việc ngữ cảnh dài, nơi bản ghi chính là chi phí. Mức giá đầu vào được lưu đệm của V4.1 Flash là $0.003 mỗi triệu token vào giờ thấp điểm, so với $0.50 của Opus 5. Nếu agent của bạn đọc lại một ngữ cảnh lớn mỗi lượt, thì mục chi phí đọc bộ nhớ đệm chính là nơi hai bên khác biệt gay gắt nhất.

Và lý lẽ dành cho Opus 5 cũng cụ thể không kém: tải tệp lên như một đầu vào hạng nhất, và các tác vụ agentic khó, nơi khoảng cách tỷ lệ hoàn thành hai-một cộng dồn across cả pipeline. Trong một chuỗi mười bước phụ thuộc, tỷ lệ 32% mỗi bước và tỷ lệ 17% mỗi bước không chỉ cách nhau gấp đôi; khác biệt đầu-cuối lớn hơn nhiều so với khác biệt mỗi bước.

Định giá nó, vì bản thân các bội số đã gây hiểu lầm.

Một so sánh cụ thể sẽ giúp phép tính trở nên rõ ràng. Lấy một pipeline thực hiện 50.000 lượt gọi mỗi tháng, trung bình 8.000 token đầu vào và 1.200 token đầu ra mỗi lượt gọi — một công việc xử lý tài liệu quy mô trung bình.

• DeepSeek V4.1 Flash ở mức giá ngoài giờ cao điểm: 50.000 × 8.000 token đầu vào là 400 triệu token đầu vào với $0,15 mỗi triệu, tức $60,00. Đầu ra là 50.000 × 1.200, tức 60 triệu token với $0,60 mỗi triệu, hay $36,00. Tổng cộng là $96,00.

• Claude Opus 5 với mức giá niêm yết của nó: 400 triệu token đầu vào ở mức $5.00 mỗi triệu là $2,000.00, và 60 triệu token đầu ra ở mức $25.00 mỗi triệu là $1,500.00. Tổng cộng $3,500.00.

Đó là mức chênh lệch 36× trong chi tiêu hàng tháng cho cùng một khối lượng công việc, và đó chính là con số mà một cuộc trao đổi về tài chính thực sự xoay quanh. Khoảng cách về năng lực là có thật và so sánh này không phủ nhận điều đó. Nó lập luận rằng khoảng cách đó phải đáng giá gấp 36 lần để mô hình đắt tiền trở thành câu trả lời đúng, và trên phần lớn lưu lượng production thì không phải vậy.

Một lưu ý riêng về mức giá của DeepSeek: $0.15 và $0.60 là các mức giá ngoài giờ cao điểm. DeepSeek tăng gấp đôi các mức này trong giờ cao điểm, tức 01:00–04:00 và 06:00–10:00 UTC vào các ngày trong tuần. Cuối tuần hoàn toàn nằm ngoài giờ cao điểm. Nếu khối lượng công việc của bạn theo lô và bạn có thể lên lịch, mức giá được báo chính là mức giá bạn nhận được.

Screenshot of the OrcaRouter model page for anthropic/claude-opus-5, showing the model id, a Featured badge, 1M-token context, 128K max output, text, image and file input, $5.00 input and $25.00 output per 1M tokens, and observed time to first token of 6.13 s at p50 and 10.00 s at p95

Chạy cả hai thay vì chọn

Quyết định mà sự so sánh này thực sự ủng hộ không phải là “chọn một.” Mà là định tuyến theo tác vụ — mô hình rẻ cho khối lượng lớn, mô hình đắt cho phần đuôi khó — và trở ngại khi làm điều đó thường nằm ở mua sắm chứ không phải kỹ thuật: hai nhà cung cấp, hai hợp đồng, hai SDK, hai bộ khóa để luân chuyển.

Cả hai mô hình đều nằm sau một khóa OrcaRouter duy nhất, điều này giúp gộp mọi thứ lại. OrcaRouter chuyển nguyên mức giá niêm yết của nhà cung cấp với 0% phụ phí, nên các con số ở trên là mức giá của chính nhà cung cấp chứ không phải của chúng tôi, và khi nhà cung cấp thay đổi giá thì bên chúng tôi sẽ cập nhật ngay trong cùng ngày — lịch giá cao điểm và thấp điểm của DeepSeek được áp dụng đúng như DeepSeek định nghĩa. Bạn có thể thể hiện việc phân tách này dưới dạng một quy tắc định tuyến thay vì mã ứng dụng, và đặt cơ chế chuyển đổi dự phòng tự động phía sau đường dẫn rẻ, để khi V4.1 Flash bị giới hạn tốc độ hoặc gặp sự cố, hệ thống sẽ chuyển sang mô hình đắt tiền thay vì báo lỗi.

Nếu bạn muốn xem mình đã phải trả những gì, hai trang mô hình liệt kê cùng dữ liệu telemetry được dùng ở trên, và việc thêm cả hai vào chế độ xem so sánh là cách nhanh nhất để thấy tỷ lệ phân bổ lưu lượng của riêng bạn đối chiếu với mức chênh lệch giá.

Screenshot of DeepSeek's own release page for DeepSeek-V4.1-Flash dated 2026/09/10, showing the 552B-parameter MoE architecture with 8B active for input and 16B for output, a KV-cache memory-reduction graphic, and DeepSeek's own four-benchmark comparison chart

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày