
Claude Fable 5 với vai trò Điều phối viên của bạn: Cẩm nang Subagent giúp kiểm soát chi phí Token
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0345Trí tuệ76Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Vào ngày 7 tháng 8, Anthropic đã thực hiện thay đổi đơn lẻ lớn nhất đối với Claude Fable 5 kể từ khi mô hình ra mắt vào ngày 9 tháng 6: họ cắt giảm các 'phương án dự phòng' liên quan đến sinh học khoảng 85%, nhờ đó các câu hỏi sức khỏe và giáo dục hàng ngày giờ đây nhận được câu trả lời trực tiếp thay vì âm thầm chuyển sang một mô hình yếu hơn. Tuy nhiên, mẫu hình thực sự đang lan truyền trong cộng đồng Claude Code tuần này lại không liên quan gì đến sinh học. Các nhà thực hành liên tục đăng tải một quy trình làm việc trong đó Claude Fable 5 đảm nhiệm vòng điều phối — làm rõ yêu cầu, phân rã kế hoạch, phân phối tác vụ, chấp nhận kết quả — trong khi việc thực thi được chuyển giao cho các trợ lý con Claude Opus 5. Lợi ích được nêu rõ: Fable 5 High trở thành lựa chọn mặc định cho phiên làm việc với chi phí hợp lý, và sự dài dòng của Claude Opus 5 không còn làm hao phí phiên làm việc nữa.
Ví dụ gần đây nhất là của @dotey, đăng ngày 14 tháng 8: một bổ sung ngắn vào ~/.claude/CLAUDE.md để hướng dẫn agent mở các subagent Opus để thực thi, giữ Claude Fable 5 ở mức reasoning effort cao làm mặc định cho phiên, với tác giả báo cáo rằng mức tiêu thụ token vẫn hợp lý — và một lý do thẳng thừng cho việc không chạy Claude Opus 5 làm mặc định: trong tay họ, nó quá chậm và đốt một lượng lớn token trong vòng lặp chính. Đó là một phát hiện từ cộng đồng, không phải hướng dẫn của Anthropic — và đáng để hiểu trước khi bạn sao chép nó, bởi vì trên lý thuyết nó trông có vẻ ngược đời.
Mô hình trong một đoạn văn. Trong Claude Code, các subagent theo mặc định kế thừa mô hình phiên của bạn, nên cách để duy trì một vòng lặp nhanh và rẻ là biến mô hình phiên thành người lập kế hoạch và chỉ định rõ ràng các trình thực thi dùng một mô hình khác. Claude Fable 5 — mô hình lớp Mythos của Anthropic được làm cho an toàn khi sử dụng đại trà, phát hành ngày 9 tháng 6 năm 2026, với giá $10/$50 mỗi triệu token — nắm giữ các yêu cầu, phân rã công việc, phân phối tác vụ và tiếp nhận kết quả. Claude Opus 5 — phát hành ngày 24 tháng 7 năm 2026, với giá $5/$25 mỗi triệu token — đảm nhận việc triển khai thực tế bên trong các subagent. Bạn dành phán đoán cấp Fable cho vài lượt điều phối và khả năng thực thi cấp Opus cho nhiều lượt thực thi — nơi phần lớn token đã dồn vào.
Tại sao mô hình main-loop lại là vấn đề chi phí thực sự
Trên các bài benchmark, đây trông như một bài toán đã được giải quyết — và câu trả lời dường như là {{1}}mặc định dùng Opus 5.{{/1}} Các số liệu của chính {{2}}Anthropic{{/2}} ({{3}}do hãng tự báo cáo, chưa được tái lập{{/3}}) cho thấy {{4}}Claude Opus 5{{/4}} vượt trội hơn {{5}}Claude Fable 5{{/5}} trên benchmark lập trình tác tử {{6}}Frontier-Bench v0.1{{/6}} ({{7}}43.3% so với 33.7%{{/7}}), trên {{8}}SWE-bench Verified{{/8}} ({{9}}96.0% so với 95.5%{{/9}}), và trên {{10}}ARC-AGI-3{{/10}} ({{11}}30.2%, gần gấp 4 lần mô hình công khai tốt nhất tiếp theo{{/11}}). {{12}}Anthropic{{/12}} định vị {{13}}Opus 5{{/13}} như đang tiến gần đến trí thông minh tiên phong của {{14}}Fable 5{{/14}} với {{15}}một nửa mức giá{{/15}}. Nếu bạn chọn {{16}}mặc định phiên{{/16}} hoàn toàn dựa trên benchmark của nhà cung cấp và giá theo token, thì {{17}}Opus 5{{/17}} là {{18}}lựa chọn hiển nhiên{{/18}}.
Những người thực hành thực sự chạy các phiên dài đang đi đến lựa chọn mặc định trái ngược, và lý do nằm ở token trên mỗi tác vụ, không phải giá trên mỗi token. Chế độ suy nghĩ của Opus 5 được bật theo mặc định và có tính thích ứng, và Anthropic cho biết nó tự xác minh công việc của mình mà không cần được nhắc — điều đó có nghĩa là, trong thực tế, mỗi lượt lặp phát ra nhiều token hơn đáng kể so với Fable 5. Việc tắt chế độ suy nghĩ đó bị giới hạn ở mức nỗ lực cao, vì vậy bạn không thể đẩy nó hoàn toàn về mức tối giản. Trong một phiên kéo dài hàng giờ, vòng lặp chính là thứ cộng dồn: mô hình rẻ nhất trên mỗi token có thể trở thành đắt nhất trên mỗi phiên, và mô hình nói ít nhất giúp vòng lặp luôn nhanh.
Điều đó khớp với những gì @dotey báo cáo. Thiết lập đảo ngược giữ mức tiêu thụ token "không tệ" chính xác là vì Opus 5 — bản dài dòng — bị cách ly trong các tác nhân phụ, nơi đầu ra của nó là sản phẩm chính thay vì chi phí chung.
Kiến trúc đảo ngược: Fable 5 lập kế hoạch, Opus thực thi
Kiến trúc này thì đơn giản để trình bày nhưng hơi phản trực giác khi vận hành:
• Mô hình phiên — Claude Fable 5 ở mức nỗ lực suy luận cao (chữ "High" trong cách gọi tắt "Fable 5 High" của cộng đồng). Nó nắm giữ cuộc trò chuyện, kế hoạch và định nghĩa hoàn thành.
• Các lượt điều phối — làm rõ yêu cầu, phân rã kế hoạch, giao nhiệm vụ và chấp nhận kết quả đều diễn ra trên Fable 5. Đây là số lượt ít và chiếm một phần nhỏ trong tổng số token.
• Lượt thực thi — mỗi nhiệm vụ được giao cho một subagent chạy Claude Opus 5. Đây là những lượt chính và là phần lớn chi phí token — và Opus 5 là nơi các điểm số tác tử do nhà cung cấp báo cáo là cao nhất.
Tính kinh tế đạt hiệu quả vì hai đường cong chi phí nằm ở hai hướng khác nhau. Điểm mạnh của Fable 5 là phán đoán; bạn dùng nó một cách tiết kiệm. Điểm mạnh của Opus 5 là thực thi; bạn dùng nó nhiều nhưng song song, tách biệt khỏi vòng lặp. Vòng lặp vẫn nhanh và rẻ, còn năng lực đắt tiền được dùng đúng vào nơi mà các token dù sao cũng đang được tiêu thụ.
Đây là một trong hai mẫu cộng đồng đang được lưu hành, và chúng phản chiếu lẫn nhau. Mẫu "kiến trúc sư" được khuyến nghị phổ biến hơn (ví dụ: được plugin fable-advisor sử dụng) vận hành Opus như một kiến trúc sư toàn thời gian và dành Fable 5 cho làn triển khai có độ phức tạp cao nhất cùng với bước đánh giá bắt buộc ở cuối mỗi bàn giao. Điểm khác biệt nằm ở mục tiêu tối ưu: mẫu kiến trúc sư tiêu tốn token hạng Opus cho việc điều phối và dùng Fable 5 như một con dao mổ; mẫu đảo ngược dùng Fable 5 cho việc điều phối và dùng Opus 5 cho khối lượng công việc. Cả hai đều là hướng dẫn từ cộng đồng — Anthropic không tài liệu hóa mẫu nào — và cả hai đều là nỗ lực chi tiêu token frontier vào những nơi mà chúng tạo ra sự khác biệt cho kết quả.
Thiết lập trong Claude Code
Claude Code không có chế độ "điều phối viên" tích hợp sẵn, vì vậy mô hình này được thực thi theo hai cách: hướng dẫn trong lời nhắc phiên và các ghim mô hình rõ ràng ở phía thực thi.
Lớp hướng dẫn nằm trong ~/.claude/CLAUDE.md — cùng tệp mà @dotey đã chỉnh sửa. Về hình thức, prompt yêu cầu tác nhân chính thực hiện bốn việc trước khi coi bất kỳ tác vụ nào là hoàn thành:
• Nhắc lại yêu cầu và xác nhận phạm vi trước khi viết mã.
• Phân chia công việc thành các tác vụ có thể chạy song song.
• Giao từng tác vụ thực thi cho một subagent được ghim vào Claude Opus 5.
• Xác minh từng kết quả so với kế hoạch trước khi chấp nhận.
Dạng thức đó đáng được trình bày như hướng dẫn thay vì như một đoạn mã để dán vào — yêu cầu và stack của bạn quyết định những gì nên nằm trong đó.
Tầng mô hình quan trọng hơn so với giả định của hầu hết các thiết lập. Trong Claude Code, thứ tự phân giải mô hình của subagent là: biến môi trường CLAUDE_CODE_SUBAGENT_MODEL, sau đó là tham số mô hình theo lần gọi, rồi frontmatter của định nghĩa agent, và cuối cùng là mô hình của phiên. Các agent không đặt mô hình sẽ kế thừa mô hình của phiên. Vì vậy, nếu phiên của bạn chạy trên Fable 5 và bạn dựa vào tham số mô hình của Agent tool, có một rủi ro được ghi nhận là nó có thể bị bỏ qua (GitHub issue #83920): các subagent vẫn kế thừa mô hình của phiên, và bạn phải trả giá theo Fable 5 cho việc thực thi mà bạn định chạy trên Opus 5.
Hai cách sửa đáng tin cậy: đặt CLAUDE_CODE_SUBAGENT_MODEL=claude-opus-5 cho phiên làm việc, hoặc ghim mô hình trong frontmatter của subagent. Biến đó chính là điểm khác biệt giữa việc mẫu hoạt động như thiết kế và việc âm thầm chạy toàn bộ phiên trên mô hình đắt tiền.
Phép toán đằng sau sự phân chia token
Dưới đây là hai mẫu sản phẩm với mức giá hiện tại (do nhà cung cấp công bố, và được áp dụng theo giá niêm yết trên OrcaRouter):
• Claude Fable 5 — $10 cho mỗi 1M token đầu vào, $50 cho mỗi 1M token đầu ra; ngữ cảnh 1M token, đầu ra 128K.
• Claude Opus 5 — $5 cho mỗi 1 triệu token đầu vào, $25 cho mỗi 1 triệu token đầu ra; ngữ cảnh 1 triệu token, đầu ra 128K.

Điều phản trực giác là Opus 5 có giá mỗi token chỉ bằng một nửa, vậy mà vẫn có thể thua cuộc chơi chi phí trong mỗi phiên. Bức tranh này dễ thấy với những con số gần đúng: nếu vòng lặp trên Opus 5 phát ra lượng token gấp hai đến ba lần vòng lặp trên Fable 5 — một con số minh họa phù hợp với báo cáo của các nhà thực hành về hành vi tự xác minh của Opus 5, chứ không phải con số được đo lường — thì ngay cả với mức giá mỗi token chỉ bằng một nửa, chi phí của vòng lặp vẫn xấp xỉ như nhau, và nếu chênh lệch lớn hơn, Opus trong vòng lặp sẽ tốn kém hơn. Trong khi đó, các token thực thi — phần lớn của phiên — nằm trên Opus 5 trong các subagent với mức giá rẻ hơn trong cả hai trường hợp.
Đó là toàn bộ lập luận cho mô hình đảo ngược: đặt mô hình có giá mỗi token cao hơn nhưng vòng lặp tinh gọn hơn vào vòng lặp, và đặt mô hình có giá mỗi token rẻ hơn vào phần khối lượng. Đó là một quyết định định tuyến được ngụy trang thành một quyết định về mô hình.
Vì OrcaRouter chuyển tiếp giá nhà cung cấp với mức tăng 0%, các con số ở trên là số tiền bạn thực sự phải trả tại đây — không có phí nền tảng phụ thêm — và nếu Anthropic giảm một trong hai mức giá, thay đổi sẽ hiển thị trên trang mô hình ngay trong ngày.
Khi mô hình đảo ngược chiến thắng — và khi không
Sao chép setup của @dotey mà không kiểm tra hình dạng khối lượng công việc của chính bạn là một sai lầm theo cả hai hướng.
Mẫu đảo ngược sẽ thắng khi:
• Yêu cầu còn mơ hồ hoặc kế hoạch có nhiều bộ phận chuyển động — phán đoán điều phối chính là nguồn lực khan hiếm.
Việc thực thi có thể được song song hóa thành các subagent — khối lượng công việc rời khỏi vòng lặp.
• Phiên làm việc dài — sự dài dòng trong vòng lặp cộng dồn thành chi phí thực tế.
Lời khuyên chuẩn sẽ thắng khi:
Phần lớn phiên làm việc của bạn là công việc cơ học có giới hạn — một trình lập kế hoạch cấp Fable là quá mức cần thiết, và giá thấp hơn cùng điểm benchmark cao hơn của Opus 5 khiến nó trở thành lựa chọn mặc định hiển nhiên. Đây là lý do tại sao tài liệu của chính Claude Code đặt Opus làm mặc định cho phiên và dành Fable 5 cho lựa chọn tường minh.
• Bạn không thể ghim các mô hình subagent một cách đáng tin cậy — lỗi kế thừa #83920 biến pattern đảo ngược thành "mọi thứ về giá của Fable 5."
Cũng có một con đường trung gian để tinh chỉnh. Opus 5 cung cấp tham số effort (từ thấp đến tối đa, mặc định là cao), vì vậy bạn có thể đẩy nó về phía hành vi gọn nhẹ hơn — nhưng không hoàn toàn, vì việc tắt suy nghĩ bị giới hạn ở mức effort cao. Nếu vấn đề của bạn là sự dài dòng của Opus 5, hạ effort xuống có thể là đủ, và bạn không bao giờ cần phải đảo ngược kiến trúc.
Thay đổi sinh học ngày 7 tháng 8 có ý nghĩa gì đối với thiết lập này
Bản cập nhật ngày 7 tháng 8 của Anthropic đã viết lại và huấn luyện lại bộ phân loại sinh học của Claude Fable 5 — hệ thống quyết định liệu một truy vấn có kích hoạt "phương án dự phòng" chuyển sang một mô hình kém khả năng hơn hay không. Theo số liệu tự công bố của Anthropic (do nhà cung cấp báo cáo), tỷ lệ chuyển dự phòng liên quan đến sinh học đã giảm khoảng 85% trên các bề mặt sản phẩm, với tổng tỷ lệ chuyển dự phòng giảm ~67% trên Claude.ai, ~55% trên Cowork, ~17% trên Claude Code và ~7% trên Claude Platform.

{{1}}Đối với thiết lập điều phối Fable 5, số Claude Code mới là con số đáng quan tâm.{{/1}} {{2}}Fallback là việc hệ thống âm thầm chuyển truy vấn của bạn sang một mô hình khác — trong trường hợp này là Opus 5.{{/2}} {{3}}Trong chat thông thường, đó là sự ma sát vô hình; trong phiên tác nhân, điều đó nghĩa là một phần pipeline của bạn chạy trên mô hình bạn không chọn, với mức chi phí bạn không lên kế hoạch.{{/3}} {{4}}Bản cập nhật không loại bỏ điều đó: virus học, độc chất học và thiết kế phân tử vẫn bị fallback.{{/4}} {{5}}Nhưng sinh học sức khỏe và giáo dục thường ngày — đọc kết quả xét nghiệm, hiểu triệu chứng, học sinh học — giờ vẫn nằm trên Fable 5.{{/5}}
Một lưu ý trước, được ghi rõ ràng: các báo cáo chưa được xác nhận từ cuối tháng 7 (36kr, WinCentral) cho thấy khả năng có bản làm mới Claude Fable 5.1 trong tháng này với mức giá không đổi. Anthropic chưa xác nhận tên, ngày phát hành hay ID mô hình API — hãy coi đó là suy đoán cho đến khi nó chính thức ra mắt.
Dùng thử mà không đánh cược quy trình làm việc của bạn.
Điều khiến mẫu đảo ngược đáng thử là nó có thể đảo ngược, và việc định tuyến cả hai mô hình qua một điểm cuối làm cho việc đảo ngược trở nên rẻ.
Trên OrcaRouter, Claude Fable 5 (anthropic/claude-fable-5) và Claude Opus 5 (anthropic/claude-opus-5) nằm sau một khóa API duy nhất. Bạn có thể chạy làn thực thi của phiên trên cả hai mô hình mà không cần hợp đồng thứ hai hay thay đổi mã — đây chính xác là điều một thí nghiệm như "Fable 5 làm bộ điều phối" cần, bởi vì toàn bộ ý nghĩa là đo chi phí mỗi phiên của riêng bạn trước khi cam kết.

Hai tính năng của OrcaRouter ánh xạ trực tiếp vào thiết lập này. Cơ chế chuyển đổi dự phòng tự động cho phép bạn định nghĩa một chuỗi dự phòng — nếu Fable 5 gặp lỗi hoặc hết thời gian chờ, yêu cầu sẽ được định tuyến đến Opus 5 hoặc một mô hình rẻ hơn thay vì bị lỗi. Và DSL định tuyến có thể kết hợp cặp này thành một lời gọi duy nhất: một bước lập kế hoạch Fable 5, tiếp theo là các bước thực thi Opus 5, đằng sau một endpoint. Đó chính là mô hình điều phối được thể hiện dưới dạng hạ tầng thay vì kỷ luật prompt.
Điểm mấu chốt
Kiến trúc đảo ngược — Claude Fable 5 lập kế hoạch, Claude Opus 5 thực thi — là một câu trả lời thực sự và khả thi cho một vấn đề thực tế: mô hình rẻ nhất trên mỗi token chưa chắc đã rẻ nhất trên mỗi phiên. Đây không phải là quyết định dựa trên điểm chuẩn; Opus 5 thắng hầu hết các cuộc so sánh về năng lực tác nhân do nhà cung cấp công bố. Đây là quyết định định tuyến token, và nó chỉ mang lại hiệu quả khi khả năng phán đoán điều phối còn khan hiếm và việc thực thi có thể được song song hóa.
Claude Fable 5 (ngày 9 tháng 6 năm 2026) và Claude Opus 5 (ngày 24 tháng 7 năm 2026) đều là các mô hình Anthropic hiện tại, và thay đổi về cơ chế bảo vệ ngày 7 tháng 8 khiến Fable 5 trở thành công cụ dùng hằng ngày ít bị gián đoạn hơn. Hãy để ý ba điều: liệu các báo cáo về Fable 5.1 có đáng kể hay không, liệu Anthropic có sửa lỗi kế thừa subagent có thể âm thầm vô hiệu hóa cách dùng này hay không, và — quan trọng nhất — chi phí cho mỗi tác vụ hoàn thành của bạn trông như thế nào qua một tuần phiên làm việc thực tế.
FAQ
Fable 5 có phải là mô hình mặc định trong Claude Code không?
Không. Tài liệu của chính Claude Code nêu rõ Fable 5 không phải là mặc định cho bất kỳ loại tài khoản nào — các phiên mặc định sử dụng mô hình Opus tiêu chuẩn, và bạn chọn Fable 5 qua /model, một cài đặt mô hình, hoặc bí danh "best". Mô hình trong bài viết này cố tình chạy ngược lại với mặc định đó.
Tại sao không chỉ dùng Opus 5 làm mặc định vì nó rẻ hơn mỗi token và đạt điểm cao hơn?
Vì chi phí mỗi phiên bằng số token mỗi tác vụ nhân với giá mỗi token. Các học viên báo cáo rằng khả năng tư duy thích ứng và tự xác minh của Opus 5 tạo ra nhiều token hơn đáng kể cho mỗi lượt, nên dù giá mỗi token chỉ bằng một nửa, nó vẫn có thể chậm hơn và đắt hơn trong một vòng lặp dài. Đó là phát hiện của cộng đồng mà playbook này dựa trên — hãy đo trên khối lượng công việc của chính bạn trước khi chọn bên.
Tôi có thể buộc các subagent của mình chạy một mô hình khác với mô hình của phiên không?
Đúng, nhưng đừng dựa vào tham số model theo từng lần gọi: GitHub issue #83920 ghi nhận tham số này bị bỏ qua, và các subagent sẽ kế thừa model của session thay vào đó. Hãy đặt CLAUDE_CODE_SUBAGENT_MODEL hoặc ghim model trong frontmatter của subagent — đó chính là sự khác biệt giữa việc thực thi chạy theo giá Opus 5 và âm thầm chạy theo giá Fable 5.
So sánh trong bài viết này1
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
