
DeepSeek V4.1 Flash trong OpenCode: Cấu hình, Chi phí và Núm Effort không ai nhắc đến
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 151 tok/s
- OpenAIMỚIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 126 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 251 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
DeepSeek V4.1 Flash đã nằm trong OpenCode Go kể từ ngày 10 tháng 9, và hệ số nhân mà OpenCode gắn cho nó có ngày kết thúc được công bố: 20 tháng 9. Còn bốn ngày nữa kể từ bây giờ. Phần thú vị không phải là hạn chót — mà là cài đặt quyết định liệu mô hình này có dễ chịu khi lập trình cùng hay không đang thiếu khỏi mọi hướng dẫn thiết lập trên trang đầu kết quả, và trong ít nhất hai harness, nó bị âm thầm bỏ qua. Đây là cẩm nang để hướng một agent lập trình tới DeepSeek V4.1 Flash: các model id chính xác, ba tích hợp đã được xác minh hôm nay, điều khiển reasoning-effort do cộng đồng báo cáo, và dạng lỗi suy nghĩ quá mức cùng những biện pháp giảm thiểu thực sự hiệu quả.
Điều mà bạn thực sự đang hướng agent của mình tới
DeepSeek V4.1 Flash đã phát hành vào 2026-09-10 — ghi chú phát hành trên tài liệu API của chính DeepSeek được ghi ngày hôm đó, và đây là mô hình nhỏ nhất trong họ kiến trúc mới của nhà cung cấp. DeepSeek báo cáo một xương sống mixture-of-experts với 552B tham số, được xây dựng trên thiết kế mà hãng gọi là Causal Encoder–Decoder, kích hoạt khoảng 8B tham số mỗi token trong giai đoạn prefill và 16B trong giai đoạn decode. Mô hình nhận văn bản và hình ảnh làm đầu vào và trả về văn bản, phục vụ cửa sổ ngữ cảnh lên tới một triệu token, và sẽ tạo tối đa 384.000 token trong một phản hồi duy nhất — các giới hạn ngữ cảnh và đầu ra đều đến từ trang mô hình riêng của OrcaRouter cho mô hình này, trong đó liệt kê lần lượt là 1.048.576 và 384.000.
Các benchmark của nhà cung cấp, lấy từ biểu đồ trên trang phát hành của DeepSeek và do đó do nhà cung cấp báo cáo và chưa được kiểm toán: 30,0 trên Terminal-Bench 3.0, 74,2 trên DeepSWE v1.1, 88,1 trên CyberGym, 54,8 trên Automation-Bench và 90,9 trên GPQA Diamond. Điểm số độc lập ít ỏi hơn nhưng vẫn tồn tại — Artificial Analysis, đọc trực tiếp hôm nay, xếp DeepSeek V4.1 Flash ở mức 40 trên Chỉ số Thông minh của mình, đứng thứ 6 trong số 113 trong nhóm so sánh của nó. Một dòng từ chính trang đó quan trọng hơn đối với người đọc về coding-agent so với thứ hạng: Artificial Analysis dán nhãn cho mô hình là rất dài dòng, khi đã tiêu thụ 250M token đầu ra để hoàn thành lượt chạy Chỉ số Thông minh của nó, so với mức trung vị 140M. Chúng ta sẽ quay lại điều đó.
Hai sự thật về cách đặt tên giúp tiết kiệm thời gian gỡ lỗi thực sự. ID model API chính thức của DeepSeek hiện nay là code>deepseek-flash/code>. Các chuỗi cũ hơn code>deepseek-v4-flash/code> và code>deepseek-v4-flash-vision-exp/code> vẫn được chấp nhận, nhưng các model đằng sau chúng đã bị ngừng cung cấp và các request được phục vụ bởi V4.1 Flash với mức giá Flash. Riêng DeepSeek V4 Pro thì không hề biến mất: tài liệu của DeepSeek nêu rõ dịch vụ API V4 Pro vẫn tiếp tục sau ngày 2026-09-14 với mức tính phí không đổi. Nếu bạn được cho biết rằng mẫu flagship đã bị tắt, thì đó không phải là điều mà tài liệu của chính nhà cung cấp nói.

OpenCode: hai con đường để vào, và id mà bạn thực sự cần gõ
Có hai cách để đặt DeepSeek V4.1 Flash phía sau OpenCode, và chúng có những đặc tính kinh tế khác nhau.
Cách đăng ký là OpenCode Go, gói $10/tháng mà OpenCode mô tả là một bộ mô hình lập trình mở được tuyển chọn kỹ lưỡng, đã được họ kiểm thử và đánh giá chuẩn. Việc thiết lập gồm bốn bước và không có tệp cấu hình nào phải chỉnh sửa thủ công: đăng nhập vào OpenCode Zen, đăng ký Go, sao chép khóa API, sau đó chạy code>/connect/code> trong TUI, chọn OpenCode Go, và dán khóa vào. Sau đó code>/models/code> sẽ liệt kê những gì có sẵn. Các tham chiếu mô hình trong cấu hình có dạng code>opencode-go/<model-id>/code>.
Model id nào? Cả hai. Danh sách model riêng của Go gateway, được tải hôm nay từ code>https://opencode.ai/zen/go/v1/models/code>, trả về code>deepseek-flash/code> và code>deepseek-v4.1-flash/code> như hai mục riêng biệt, cùng với các phiên bản cũ code>deepseek-v4-flash/code> và code>deepseek-v4-pro/code>. Bất kỳ mục nào trong hai mục đầu tiên đều phân giải thành model bạn muốn; code>deepseek-flash/code> là tên chuẩn và là lựa chọn an toàn hơn cho bất cứ thứ gì bạn định tiếp tục chạy.
Tuyến trực tiếp bỏ qua hoàn toàn gói đăng ký: hãy chạy code>/connect, tìm DeepSeek và dán khóa nền tảng DeepSeek. Sau đó bạn sẽ được DeepSeek tính phí theo giá niêm yết thay vì dùng hạn mức của Go. DeepSeek công bố giá niêm yết cho giờ thấp điểm là $0.15 cho mỗi 1M token đầu vào và $0.60 cho mỗi 1M token đầu ra, với lượt đọc từ bộ đệm có giá $0.003 cho mỗi 1M — và đúng gấp đôi những con số đó vào giờ cao điểm. Cả tài liệu OpenCode Go lẫn trang model của OrcaRouter, đọc hôm nay, đều khớp với những con số đó.
Điều mà OpenCode Go bổ sung là cấu trúc hạn mức, và ở đây những con số đáng để đọc kỹ, vì chúng chính là lý do khiến thời hạn này quan trọng. Tài liệu của chính OpenCode liệt kê DeepSeek V4.1 Flash với hạn mức hàng tháng là 15 USD, hiện được nhân 4× thành 60 USD trong một chương trình khuyến mãi mà OpenCode ghi là “Kết thúc ngày 20 tháng 9”. Số lượt yêu cầu ước tính được công bố trong hai cột: 6.500 mỗi 5 giờ / 16.250 mỗi tuần / 32.500 mỗi tháng theo mức tiêu chuẩn, hoặc 26.000 / 65.000 / 130.000 khi áp dụng hệ số nhân 4×. Cách phân bổ hạn mức là nhất quán giữa các mô hình — hạn mức 5 giờ bằng 20% con số hàng tháng, hạn mức hàng tuần là 50%, và hạn mức hàng tháng là toàn bộ con số đó.
Đó là những con số đã được OpenCode công bố, đọc từ tài liệu Go của nó vào ngày hôm nay. Chương trình khuyến mãi là do họ quyết định kết thúc, và nó đã có ngày cụ thể.

Command Code: vẫn hoạt động, và một báo cáo lỗi đáng để biết
Danh mục của chính Command Code vẫn liệt kê mô hình này tính đến hôm nay, dưới id code>deepseek-v4-1-flash/code>, với cửa sổ ngữ cảnh 1M token và cơ chế giá chuyển tiếp tương tự: $0.15 / $0.60 giờ thấp điểm, $0.30 / $1.20 giờ cao điểm, $0.003 cho lượt đọc từ bộ nhớ đệm. Mức giá khớp nhau giữa hai harness độc lập không phải là sự trùng hợp ngẫu nhiên — cả hai đều đang chuyển tiếp giá niêm yết của DeepSeek thay vì tự đặt giá riêng.
Cơ chế rất đơn giản. Cài đặt bằng code>npm i -g command-code/code>, chạy nó từ thư mục dự án của bạn, xác thực bằng code>/login/code>, và sử dụng code>/connect/code> nếu bạn muốn dùng khóa nhà cung cấp của riêng mình. code>/model <id>/code> áp dụng thay đổi model trực tiếp, còn một mình code>/model/code> sẽ mở trình chọn, và code>/effort/code> đặt mức nỗ lực suy luận cho model hiện tại — cờ quan trọng nhất ở đây.
Một báo cáo lỗi từ cộng đồng đáng để ghi nhớ trong đầu trước khi bạn gỡ lỗi sai tầng. Một issue đang mở đối với một lớp định tuyến của bên thứ ba mô tả một bộ đệm phát lại suy luận không bao giờ được kích hoạt cho code>command-code/deepseek-v4.1-flash/code> id, vì mẫu mà lớp định tuyến so khớp mong đợi một code>v4./code> hoặc code>v4-/code> đoạn và chuỗi là code>v4.1/code>. Triệu chứng được báo cáo là lỗi 400 từ thượng nguồn phàn nàn rằng nội dung suy luận được tạo ra ở chế độ thinking phải được truyền trả lại cho API. Đó là báo cáo lỗi từ cộng đồng về một bộ so khớp phía máy khách, không phải hướng dẫn từ nhà cung cấp và cũng không phải vấn đề với mô hình — nhưng nó đúng kiểu thứ trông như lỗi mô hình lúc 2 giờ sáng.
Claude Code, Codex, và các client mà chính OpenCode đã xác thực
OpenCode Go không chỉ dành riêng cho OpenCode, và tài liệu của họ nói rõ điều đó: nó được thiết kế cho OpenCode và các coding agent khác tạo ra những mẫu yêu cầu tương tự, kèm theo danh sách công bố các client đã được xác thực là hoạt động. Danh sách đó hiện nêu tên Hermes, Claude Code, Codex, ZCode và Pi — và với Claude Code, ghi chú là nó "nhận diện session header gốc của chính mình. Không cần wrapper custom-header." Đi kèm với đó là hai yêu cầu: nhận diện client của bạn bằng user agent riêng thay vì một tên SDK chung chung, và gửi một session identifier ổn định trong header code>x-opencode-session/code> ở mỗi cuộc hội thoại, đây chính là thứ giúp cho việc routing và prompt caching của họ hoạt động. Với Hermes thì bản build đã được xác thực rất quan trọng — bản sửa header được merge sau v0.21.0, nên chỉ riêng bản phát hành đó không có nó.
Ngoài ra còn có một tuyến hoàn toàn không gắn với gói đăng ký nào, sử dụng trực tiếp endpoint tương thích Anthropic của DeepSeek. Đặt code>ANTHROPIC_BASE_URL/code> thành code>https://api.deepseek.com/anthropic/code>, code>ANTHROPIC_AUTH_TOKEN/code> thành khóa DeepSeek của bạn, và trỏ các biến model vào model đó. Tên các model Claude được ánh xạ lại khi đi vào: bất cứ thứ gì bắt đầu bằng code>claude-opus/code> đều chuyển sang DeepSeek V4 Pro và được tính giá theo mức giá V4 Pro, trong khi các tên code>claude-sonnet/code> và code>claude-haiku/code> đều chuyển sang model Flash. Hậu tố code>[1m]/code> trên chuỗi model yêu cầu biến thể ngữ cảnh một triệu token. Hướng dẫn riêng của DeepSeek cho thiết lập này cũng đặt code>CLAUDE_CODE_EFFORT_LEVEL=max/code> và ghim cửa sổ tự động nén ở 786432 token.
Biến cuối cùng đó chính là nơi một bản khắc phục từ cộng đồng nằm ở đó. Một proxy giải pháp tạm thời tồn tại vì các bản dựng Claude Code gần đây gửi code>thinking: {"type": "disabled"}/code> trên các yêu cầu subagent trong khi code>CLAUDE_CODE_EFFORT_LEVEL=max/code> thêm một tham số nỗ lực suy luận, và endpoint định dạng Anthropic của DeepSeek từ chối sự kết hợp đó bằng một thông báo về việc không thể vô hiệu hóa các tùy chọn thinking khi nỗ lực suy luận được đặt. Giải pháp tạm thời được báo cáo khá hẹp — chỉ loại bỏ tham số nỗ lực khỏi các yêu cầu subagent, giữ nguyên agent chính. Hãy coi đây là một phát hiện từ cộng đồng về sự không khớp trong hợp đồng giữa client và server, và hãy dự đoán rằng ranh giới phiên bản chính xác sẽ thay đổi.
Núm điều chỉnh mức nỗ lực: 1–100, và vì sao “thấp” lại có nghĩa là 50
Mọi thứ trong phần này là phát hiện từ cộng đồng chứ không phải hướng dẫn từ nhà cung cấp. DeepSeek không công bố ánh xạ preset sang số mà chúng tôi có thể xác minh, và những con số dưới đây đến từ các bài viết của người thực hành và tài liệu về harness của bên thứ ba. Chúng đủ nhất quán giữa các nguồn để hữu ích, và đủ chưa được xác nhận để bạn nên tự kiểm tra chúng trên công việc của mình.
DeepSeek V4.1 Flash được huấn luyện với một đại lượng vô hướng nỗ lực suy luận liên tục từ 1 đến 100. Đây không phải là giới hạn token — nó dịch chuyển vị trí của mô hình trên một đường cong mà quá trình huấn luyện đã học, trong đó nỗ lực thấp hơn tạo nhiều áp lực hơn để ngắn gọn và nỗ lực cao hơn khiến việc suy luận bổ sung trở nên ít tốn kém hơn. Ba cấu hình sẵn công khai ánh xạ lên thang đo đó:
• Low — 50, quãng đường ngắn nhất, và là cài đặt sẵn khiến bộ điều khiển bị mang tiếng rẻ tiền.
• High — 75, và là mức mà hầu hết các nguồn cộng đồng mô tả là mức trần hợp lý cho công việc của agent.
• Max — 100, trong đó hình phạt đối với độ dài suy luận được loại bỏ hoàn toàn.
Điều mà núm điều chỉnh này mang lại là có thật nhưng giảm dần rõ rệt. Một đợt quét benchmark cộng đồng báo cáo rằng việc nâng mức nỗ lực từ 25 lên 100 đã đưa Terminal-Bench 2.1 từ 82,4 lên 90,6, trong khi nhìn chung làm số token đầu ra tăng khoảng 2,5 lần. Các báo cáo đều hội tụ ở mức nỗ lực đâu đó trong khoảng 60 đến 80, vốn đạt được phần lớn độ chính xác sẵn có với chưa đến một nửa ngân sách token, còn mức tối đa làm tăng thêm 1,6–1,8 lần cho các quỹ đạo tác nhân để đổi lấy một mức lợi ích cận biên.
Giá trị mặc định là phần mà không ai đồng ý với nhau. Một số tài liệu về harness và báo cáo từ người thực hành nói rằng một effort chưa được đặt sẽ được phân giải thành high; những người khác mô tả mặc định của server đơn giản là không xác định. Điều được ghi nhận thay vì gây tranh cãi là hai tích hợp harness đã được phát hiện không gửi tham số này chút nào — cấu hình nhà cung cấp OpenCode Go và một cấu hình DeepSeek native đều bỏ qua việc phát ra code>reasoning_effort/code> cho code>deepseek-flash/code> slug, vì bộ bảo vệ khớp của chúng mong đợi một code>deepseek-v…/code> tiền tố mà id chuẩn không có. Trong cả hai trường hợp, cài đặt đã chọn của người dùng đã bị thay thế âm thầm bằng mặc định của nhà cung cấp. Nếu client của bạn hiển thị điều khiển effort, đó không phải bằng chứng rằng nó đang được truyền trên đường truyền. Hãy ghi log một request body và xem.
Một điểm lạ nữa từ cùng các báo cáo: endpoint OpenCode Go chấp nhận code>low/code>, code>medium/code>, code>high/code> và code>max/code>, nhưng từ chối một effort dạng số nguyên — giá trị 80 được báo cáo là trả về HTTP 400. Thang đo 1–100 tồn tại trong mô hình, nhưng nó không được hiển thị dưới dạng số thô ở mọi nơi, vì vậy "đặt effort thành 65" có thể không diễn đạt được trong client của bạn.
Chế độ thất bại của việc suy nghĩ quá nhiều, và điều thực sự khắc phục nó
Đây là kiểu thất bại quyết định liệu bạn có giữ mô hình trong vòng lặp của mình hay không. Các báo cáo từ cộng đồng mô tả DeepSeek V4.1 Flash tiếp tục suy luận sau khi công việc đã xong: tranh luận lại một điểm mà nó đã trả lời đúng, thuật lại việc sửa các giả định sai của chính nó, và tạo ra những chuỗi suy luận dài với mật độ thông tin thấp. Một người thực hành báo cáo đầu ra suy luận tiếp tục trong hơn một giờ bên trong một phiên CLI lập trình. Một người khác báo cáo không thể khiến nó hoàn thành một lượt chạy benchmark dài nào cả.
Một ghi chú về nguồn cho báo cáo thứ hai đó, vì đây là kiểu khẳng định thường bị tẩy nguồn. Nó đến từ một luồng thảo luận cộng đồng về cách chạy mô hình một cách đáng tin cậy, và Reddit chặn trình tìm nạp của chúng tôi, nên chúng tôi không thể đọc trực tiếp luồng đó — chúng tôi đang thuật lại báo cáo chứ không phải trích dẫn một trang mà chúng tôi đã mở. Điều chúng tôi có thể xác minh độc lập là diện mạo của vấn đề, và ở đó bằng chứng bên ngoài rõ ràng một cách bất thường: Artificial Analysis, trên chính trang của mình, chỉ ra rằng mô hình này rất dài dòng, tiêu thụ 250M token đầu ra để hoàn thành một lần chạy mà mô hình so sánh trung vị của nó hoàn thành trong 140M. Đó là khoảng 1,8×, được đo bởi một bên thứ ba, trên một tập tác vụ cố định. Các báo cáo trên diễn đàn và chỉ số độc lập đang mô tả cùng một hành vi.
Các biện pháp giảm thiểu rút ra từ những báo cáo đó, tất cả đều do cộng đồng đóng góp:
• Ghim effort ở mức high hoặc thấp hơn và không để nó tăng dần. Bản sửa rõ ràng nhất từng thấy trong thực tế là một routing plugin được viết riêng để chặn đà leo thang effort: độ sâu lượt không đóng góp gì vào điểm leo thang, chỉ kết quả công cụ thất bại hoặc một lần thử lại y hệt mới được tính, mức leo thang bị giới hạn trần, còn mức max thì phải bật thủ công và bị hạ mức theo mặc định. Nếu harness của bạn cho phép agent tự nâng effort khi một lượt chạy kéo dài hơn, thì đó chính là cơ chế cần tắt.
• Đừng chạy max như mặc định. Nhiều người thực hành báo cáo rằng max bị quay vòng thay vì hội tụ trên công việc thường ngày, và chuyển trở lại high sẽ khắc phục được điều đó.
• Đặt trần code>max_tokens/code> trên các đường dẫn tương tác. Mức trần đầu ra 384.000 token là một giới hạn, không phải mục tiêu, và một vòng lặp không chịu kết thúc thì rất tốn kém ở mức trần đó.
• Xác minh rằng tham số đang thực sự được gửi đi. Vì đã phát hiện hai harness âm thầm loại bỏ nó, nên “tôi đã đặt nó thành high” và “high đã đến được API” là hai khẳng định hoàn toàn khác nhau.
• Harness quan trọng hơn bạn tưởng. Những người thực hành chạy cùng một bộ trọng số báo cáo hành vi khác biệt rõ rệt giữa các shell — cùng một mô hình mà trong một harness thì tự tranh cãi với chính mình và chôn vùi tín hiệu, lại không nhận phải bất kỳ lời phàn nàn nào như thế trong một harness khác. Đó là quan sát của cộng đồng về hành vi của harness, không phải tuyên bố của nhà cung cấp về mô hình, nhưng lại là lời khuyên được lặp lại nhiều nhất trong các báo cáo.
Chi phí thực sự của một vòng lặp coding ở mức giá này
Giá niêm yết của DeepSeek là 0,15 USD cho mỗi 1 triệu token đầu vào và 0,60 USD cho mỗi 1 triệu token đầu ra vào giờ thấp điểm — token đầu ra đắt gấp bốn lần token đầu vào, và đó là điều đầu tiên cần khắc cốt ghi tâm về một tác nhân không chỉ tạo ra mã mà còn tạo ra cả lập luận.
Hãy lấy một lượt agent thực tế: 60.000 token ngữ cảnh (prompt hệ thống, schema công cụ, một phần repo, lịch sử hội thoại) đầu vào, và 3.000 token suy luận cùng một bản vá đầu ra. Tức là 60.000 × $0,15/1M = $0,009 đầu vào, cộng 3.000 × $0,60/1M = $0,0018 đầu ra, vậy khoảng 1,1 xu một lượt. Hai trăm lượt như vậy trong một ngày làm việc tốn khoảng $2,16, hay khoảng $47 trong một tháng các ngày trong tuần ở mức giá ngoài giờ cao điểm. Đó là phép tính khiến cho hạn mức $15 mỗi tháng cộng thêm khuyến mãi 4× trông có vẻ hào phóng — và cũng là phép tính khiến độ dài dòng trở thành thứ cần để mắt tới.
Bởi vì đây chính là đòn bẩy ẩn trong con số Artificial Analysis đó. Việc mô hình dùng 1,8× số token đầu ra trung vị trên một tập tác vụ cố định nghĩa là một vòng lặp bị giới hạn bởi đầu ra sẽ tốn 1,8× so với mức mà chỉ giá token gợi ý. Và nút điều chỉnh effort chính là cơ chế kiểm soát đúng cho điều đó. Các báo cáo cộng đồng cho thấy việc hạ từ max xuống high giúp giảm số token đầu ra khoảng một nửa — một mức dao động lớn hơn nhiều so với bất cứ điều gì mà lịch cao điểm/ngoài cao điểm sẽ gây ra cho bạn. Thiết lập effort là đòn bẩy lớn; còn lịch trình là thứ miễn phí.
Điều đáng biết trước khi bạn lên lịch bất cứ thứ gì: giờ cao điểm là 01:00–04:00 và 06:00–10:00 UTC, từ Thứ Hai đến Thứ Sáu, còn mọi khung giờ khác kể cả cuối tuần đều là giờ thấp điểm. Một nhóm ở châu Âu làm việc 09:00–18:00 CET không bao giờ chạm tới giờ cao điểm. Một nhóm ở Bắc Kinh làm cùng giờ địa phương sẽ rơi vào giờ cao điểm từ 09:00–12:00 và 14:00–18:00 — bảy trong chín giờ làm việc với giá gấp đôi. Cùng mô hình, cùng mã, hóa đơn gấp đôi, được quyết định hoàn toàn bởi múi giờ.
Khoản tiết kiệm miễn phí còn lại là mức giá đọc từ bộ nhớ đệm, 0,003 USD cho mỗi 1M so với 0,15 USD cho đầu vào mới — bằng một phần năm mươi. Prompt của một coding agent phần lớn là tiền tố ổn định: hướng dẫn hệ thống, định nghĩa công cụ, những phần của repo không thay đổi. Hãy giữ phần nội dung ổn định ở đầu và để nội dung thay đổi nối theo sau, rồi bộ nhớ đệm phía nhà cung cấp sẽ lo phần còn lại. Việc đầu vào được lưu đệm có được hưởng mức giá ưu đãi hay không, và trong những điều kiện nào, do DeepSeek quy định chứ không phải phía khách hàng, nên hãy kiểm chứng điều đó trong tài liệu hiện hành trước khi bạn xây dựng ngân sách dựa trên nó — trang mô hình của chính chúng tôi cho code>deepseek/deepseek-v4.1-flash/code> cũng nói điều tương tự, rằng mức giá đầu vào được lưu đệm tuân theo các điều khoản của nhà cung cấp.
Nếu bạn không muốn thêm một gói đăng ký thứ hai chỉ để đánh giá mô hình, thì cùng id đó cũng có sẵn thông qua một endpoint tương thích OpenAI đặt trước toàn bộ danh mục của chúng tôi, theo đúng mức giá của nhà cung cấp với mức markup 0% — nên khi DeepSeek thay đổi giá, ở đây sẽ cập nhật ngay trong cùng ngày thay vì phải chờ đến lần định giá lại kế tiếp. Điều đó đặc biệt quan trọng đúng với tình huống mà bài viết này mô tả: một mô hình có xu hướng đã được ghi nhận là cứ tiếp tục chạy mãi, trên một lộ trình bạn chưa đánh giá xong. Chuỗi dự phòng nghĩa là một lượt đi sai sẽ rơi vào một mô hình khác trước khi phản hồi bắt đầu, thay vì khiến yêu cầu thất bại.
552B, 748B hoặc 763B — câu hỏi về kích thước thực sự vẫn còn bỏ ngỏ
Đừng nhắc lại số lượng tham số của mô hình này như thể đã ngã ngũ, bởi vì ba con số khác nhau đang được lưu truyền và không con số nào trong đó hoàn toàn sai cả.
Thẻ mô hình của chính DeepSeek mô tả một mô hình có “552B tham số backbone”, và đó là con số do nhà cung cấp báo cáo — nó cũng là con số được ghi trong bảng thông số trên trang mô hình của chính chúng tôi. Cùng thẻ đó liệt kê riêng một mô-đun “Engram conditional memory” gồm 196B tham số, “được truy cập thưa thớt thông qua tra cứu dựa trên token”. Cộng hai con số lại thì được 748B, đó là phép tính mà phân tích cộng đồng đã đưa ra trong vòng vài giờ sau khi phát hành. Và metadata tệp trên cùng kho mô hình đó liệt kê kích thước mô hình là 763B tham số, lại là một con số thứ ba.
Sự tranh cãi bề ngoài này mang tính định nghĩa chứ không phải là một mâu thuẫn. Các tham số Engram được tra cứu tốn bộ nhớ nhưng gần như không tốn phép tính số học nào trên mỗi token, trong khi các tham số backbone được tính toán tốn thời gian trên mỗi token — đó chính xác là lý do nhà cung cấp báo cáo chúng riêng rẽ và lý do việc so sánh những con số nổi bật của hai mô hình có kiến trúc khác nhau cho bạn biết rất ít.
Điều không bị tranh cãi một cách nghiêm túc là số lượng tham số hoạt động: khoảng 8B mỗi token trong giai đoạn prefill và 16B trong giai đoạn decode, đây mới là con số thực sự chi phối chi phí suy luận. Các trọng số được mở theo giấy phép MIT nếu bạn muốn tự mình kiểm chứng bất kỳ điều nào trong số này. Hãy coi 552B là do nhà cung cấp báo cáo, 748B là tổng số đáng tin cậy từ cộng đồng, và mọi tuyên bố rằng câu hỏi về kích thước đã khép lại là quá sớm.

Làm gì trước ngày 20
Nếu bạn định thử DeepSeek V4.1 Flash trong một coding agent, thứ tự ít tốn thời gian nhất là: chọn harness trước, rồi cố định effort, rồi mới đo lường.
Trên harness, tóm tắt trung thực về buổi xác minh hôm nay là cả ba tuyến đường đều chạy được và chúng khác nhau ở những gì chúng đòi hỏi ở bạn. OpenCode Go là gói đăng ký $10/tháng với hệ số khuyến mãi hết hạn vào ngày 20 tháng 9, và việc thiết lập chỉ là code>/connect/code> cộng với code>/models/code>, không có tệp nào cần chỉnh sửa. Command Code liệt kê model trực tiếp trong danh mục riêng của nó, chuyển đổi bằng code>/model <id>/code>, và đưa effort ra như một lệnh hạng nhất. Claude Code tiếp cận nó hoặc qua đường dẫn validated-clients của OpenCode Go — nơi nó không cần lớp bọc header tùy chỉnh — hoặc trực tiếp tới endpoint định dạng Anthropic của DeepSeek, nơi xung đột effort của subagent là điểm gồ ghề đã biết.
Về effort, hãy đặt nó một cách tường minh và đặt hơi thấp một chút: high, hoặc mặc định của model nếu hóa ra high chính là giá trị đó, chứ không phải max. Sau đó xác nhận rằng nó đã rời khỏi máy bạn, vì người ta phát hiện hai harness đã làm rơi mất nó.
Về mặt đo lường, hãy theo dõi token đầu ra thay vì thời gian đồng hồ. Độ dài dòng là chi phí, núm điều chỉnh công sức là cơ chế kiểm soát, và lịch cao điểm chỉ là một tai nạn múi giờ mà bạn có thể tránh miễn phí.
Còn về những tuyên bố kích thước mà bạn sẽ thấy được trích dẫn cho mình trong tuần này — 552B, 748B, 763B — câu trả lời hữu ích là: nhà cung cấp báo cáo backbone của họ, cộng đồng thêm mô-đun bộ nhớ, còn metadata của kho lưu trữ lại nói một đằng khác. Ai trình bày một trong những con số đó như câu trả lời đã ngã ngũ thì chỉ là đã chọn một con số chứ không phải đã kiểm tra một con số.
