
Claude Opus 5.5 thực thi, Claude Fable 5.1 cố vấn: Định giá vòng lặp cố vấn của Claude Code
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0345Trí tuệ76Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Claude Fable 5.1viết kế hoạch thiết kế. Claude Opus 5.5thực thi nó trong một vòng lặp. Fable 5.1 quay trở lại với vai trò cố vấn và chấp nhận hoặc từ chối kết quả. Đó chính là mô hình mà X/@dotey đã đăng vào ngày 22 tháng 9 năm 2026 — ngày mà nhà cung cấp phát hành Claude Opus 5.5 — được trình bày như một cách sắp đặt tiết kiệm token ra đời dưới áp lực chi phí: đặt cố vấn thành Fable, chạy Opus, và để mô hình đắt đỏ chỉ lên tiếng tại các điểm quyết định. Thứ họ đang dùng giờ đây không còn là một mẹo prompt hay một cấu hình subagent nữa. Đó là công cụ cố vấn tích hợp sẵn của Claude Code, một tính năng phía máy chủ được tính phí theo mức giá của mô hình cố vấn, cộng thêm lên trên mọi thứ mà mô hình chính tiêu tốn. Và phần lời khuyên chỉ là phần rẻ mạt. Việc đọc lại toàn bộ cuộc hội thoại để tạo ra nó thì không — ngữ cảnh của bên thực thi đã trở nên rẻ để đọc lại, còn của cố vấn thì chưa bao giờ rẻ. Chính sự bất đối xứng đơn lẻ ấy quyết định liệu vòng lặp này có đáng để chạy hay không, và đó cũng là điều mà phần còn lại của bài viết này định giá.
Vòng lặp thực ra là gì
Công cụ cố vấn ghép mô hình chính của bạn với một mô hình thứ hai, thường mạnh hơn, mà Claude tham vấn vào những thời điểm then chốt — trước khi cam kết theo một hướng tiếp cận, khi một lỗi cứ lặp đi lặp lại, hoặc trước khi tuyên bố hoàn thành một tác vụ. Cố vấn nhận được toàn bộ cuộc hội thoại, bao gồm mọi lệnh gọi công cụ và kết quả của nó, rồi trả về hướng dẫn mà mô hình chính sau đó áp dụng. Nó không bao giờ gọi công cụ và không bao giờ tạo ra đầu ra dành cho người dùng. Bạn chọn mô hình nào sẽ cố vấn; Claude quyết định khi nào gọi nó.
Phần cuối đó chính là thứ phân biệt cái này với mô hình orchestrator-và-subagent mà cộng đồng Claude Code đã lan truyền vào tháng Tám. Subagent là giao việc: một planner phân rã công việc rồi gửi nó cho các worker, và bạn cấu hình mô hình của từng tuyến một cách tường minh. Còn advisor là chuyển cấp: một mô hình dẫn dắt toàn bộ nhiệm vụ, và mô hình đắt tiền được kéo vào giữa chừng để đưa ra quyết định mà bên dẫn dắt không thể tự làm một mình. Không có worker pool, không có task graph, và không có prompt điều phối nào phải duy trì. Vòng lặp thực tế mà @dotey mô tả — lập kế hoạch, thực thi, xác minh, lặp lại — chính là hình dạng của cơ chế đó khi bạn hướng advisor vào Fable 5.1 và để nó kiểm soát điều kiện thoát của vòng lặp.
Cách chính Anthropic diễn đạt về chiến lược này rất thẳng thắn về hình dạng của phần thắng: người cố vấn “chỉ có thể chuyển giao năng lực mà người thực thi còn thiếu.” Mọi điều bên dưới đều bắt nguồn từ việc thực sự còn thiếu bao nhiêu năng lực, và tần suất người thực thi thừa nhận điều đó.
Vì sao Claude Opus 5.5 đã thay đổi cục diện

Bảng giá được Anthropic công bố, trên mỗi triệu token. Đây là số liệu của nhà cung cấp, không phải ước tính:
• Claude Opus 5.5 — $4 đầu vào, $20 đầu ra, $0.20 đọc cache, $5 cho ghi cache 5 phút
• Claude Opus 5 — 5 USD đầu vào, 25 USD đầu ra, 0,50 USD đọc bộ nhớ đệm, 6,25 USD cho một lần ghi bộ nhớ đệm 5 phút
• Claude Fable 5.1 — 10 đô cho đầu vào, 50 đô cho đầu ra, 0,25 đô cho mỗi lần đọc bộ nhớ đệm, 12,50 đô cho một lần ghi bộ nhớ đệm 5 phút
Hai chi tiết trong danh sách đó quan trọng hơn mức giá được nêu ở tiêu đề. Thứ nhất, các lượt đọc cache trên Opus 5.5 chỉ bằng 5% đầu vào cơ sở, theo chú thích của chính Anthropic, trong khi hầu hết mô hình Claude ở mức 10% và Fable 5.1 ở mức 2,5%. Fable 5.1 có hệ số nhân tốt hơn nhưng vẫn thua về số đô-la tuyệt đối — 0,20 đô-la so với 0,25 đô-la — vì mức giá đầu vào cơ sở của nó cao gấp hai lần rưỡi.
Thứ hai, và đây là cơ chế mà vòng lặp dựa vào: việc bật/tắt advisor trong Claude Code không làm mất hiệu lực bộ nhớ đệm prompt của mô hình chính, nên ngữ cảnh dài, được gửi lại nhiều lần của executor vẫn rẻ ở mức $0.20 mỗi triệu. Việc advisor tự đọc cuộc hội thoại thì không được lưu vào bộ nhớ đệm. Mỗi lần tư vấn xử lý lại toàn bộ bản ghi từ đầu, với mức giá đầu vào $10 mỗi triệu của Fable 5.1. Một executor đọc lại ngữ cảnh 500K token mười lần thì trả tiền cho các lần đọc từ bộ nhớ đệm; một advisor được hỏi ý kiến mười lần thì trả mười hóa đơn đầu vào mới trên một bản ghi ngày càng dài ra trong suốt quá trình. Ngữ cảnh của executor càng rẻ, thì việc đọc không qua bộ nhớ đệm của advisor càng nổi bật — và Opus 5.5 vừa khiến ngữ cảnh của executor rẻ hơn 60% so với Opus 5.
Thiết lập trong Claude Code
Cố vấn đang trong giai đoạn thử nghiệm và Anthropic nói rõ điều đó trong biểu ngữ phiên — "Advisor Tool (experimental) đang bật và có thể dùng nhiều token hơn." Hành vi, giá cả và tính khả dụng có thể thay đổi. Sau khi đã nêu rõ lưu ý đó, cơ chế hoạt động được ghi lại như sau:

• Bật tính năng này bằng /advisor fable, hoặc chạy /advisor mà không có đối số để mở trình chọn. Lựa chọn sẽ được lưu vào cài đặt advisorModel trong cài đặt người dùng của bạn và vẫn giữ nguyên qua các phiên. /advisor off sẽ tắt nó.
• Đối với một phiên đơn lẻ mà không thay đổi mặc định đã lưu, hãy khởi chạy bằng claude --advisor fable. Cờ này không được liệt kê trong claude --help, và Claude Code sẽ thoát ngay khi khởi chạy nếu cặp ghép không hợp lệ, thay vì bắt đầu với một advisor bị bỏ qua một cách âm thầm.
• Đặt giá trị mặc định cố định trong tệp cài đặt của bạn bằng {"advisorModel": "fable"}.
• Để tắt hoàn toàn, hãy đặt CLAUDE_CODE_DISABLE_ADVISOR_TOOL=1 — lệnh /advisor sẽ biến mất và mọi advisorModel đã cấu hình đều bị bỏ qua.
• Cặp ghép phải có năng lực ít nhất ngang bằng mô hình chính. Claude Opus 5.5 chấp nhận Fable và Opus 5 trở lên làm cố vấn. Một cố vấn Opus 4.6 hoặc Sonnet bị Claude Code từ chối; một cố vấn Opus 4.7 hoặc Opus 4.8 được gắn vào rồi sau đó bị API từ chối. Fable 5.1 làm mô hình chính chỉ chấp nhận Fable 5.1.
Mức phiên bản tối thiểu: công cụ cố vấn cần Claude Code v2.1.98 trở lên; Fable khi là mô hình chính hoặc cố vấn cần v2.1.170 trở lên; Fable 5.1 cần v2.1.257 trở lên. Dạng token của /advisor — dạng hoạt động trong -p, Agent SDK, ứng dụng desktop và Remote Control — cần v2.1.260 trở lên.
• Cố vấn chỉ có trên Anthropic-API. Nó không khả dụng trên Amazon Bedrock, Claude Platform trên AWS, Agent Platform của Google Cloud hoặc Microsoft Foundry, và nó phụ thuộc vào việc tải cờ tính năng, vì vậy một phiên có biến như DISABLE_TELEMETRY được đặt sẽ giữ nó ở trạng thái tắt.
• Trên những gói mà việc dùng Fable được tính vào tín dụng sử dụng, Fable-as-advisor cũng được tính theo cùng cách và cần bạn đồng ý một lần. Cho đến khi bạn chấp nhận, /advisor fable sẽ không lưu và claude --advisor fable sẽ thoát ngay khi khởi chạy và hướng bạn đến /model fable để thay thế.
Các tác nhân con kế thừa bất kỳ cố vấn nào bạn đã cấu hình và chạy lại cùng một kiểm tra ghép cặp đối với mô hình của riêng chúng. Đó là tương tác duy nhất giữa mẫu này và mẫu tác nhân con: một tác nhân con chạy mô hình nhỏ hơn có thể được phép dùng một cố vấn mà tác nhân cha của nó không được phép.
Cấu trúc chi phí, được phân tích kỹ lưỡng
Không có gì dưới đây là một phép đo. Hình dạng token được bịa ra để làm cho phép tính trở nên rõ ràng; còn mức giá là giá niêm yết đã công bố của Anthropic. Giả sử có một phiên executor đọc 1M token đầu vào mới và tạo ra 500K token đầu ra, cùng ba lần tham vấn advisor, mỗi lần đọc lại một bản ghi 200K token và trả về khoảng 600 token hướng dẫn — đại khái là hai đến ba lần tham vấn mỗi tác vụ mà chính system prompt của Anthropic yêu cầu.
• Executor trên Claude Opus 5.5 — 1M đầu vào với $4.00 cộng 500K đầu ra với $10.00 = $14.00
• Cố vấn về Claude Fable 5.1 — 600K đầu vào với $6.00 cộng với khoảng 1.800 token đầu ra với khoảng $0.09 = $6.09
• Vòng lặp, tổng cộng — khoảng 20,09 USD
• Cùng một dạng chạy từ đầu đến cuối trên Fable 5.1 — $10.00 đầu vào cộng $25.00 đầu ra = $35.00
• Cùng hình dạng đó chỉ trên Opus 5.5 — $14.00
Vòng lặp nằm giữa hai phương án đó, đúng như cách Anthropic định vị nó: rẻ hơn khoảng 43% so với việc chạy Fable 5.1 xuyên suốt, và đắt hơn khoảng 44% so với chỉ riêng bộ thực thi. Hãy coi con số thứ hai mới là con số trung thực. Cố vấn không phải là một khoản tiết kiệm; đó là việc mua phán đoán đẳng cấp Fable cho ba quyết định, và nó chỉ đáng tiền nếu ba quyết định đó thay đổi kết quả. Đẩy bản ghi lên cửa sổ ngữ cảnh 1M, và mỗi lần tham vấn tự nó tốn $10. Để bộ thực thi bắt đầu hỏi ở hầu hết tác vụ thay vì chỉ một vài tác vụ, thì bạn đang trả mức giá của cố vấn cho toàn bộ khối lượng công việc — và khi đó, như Anthropic nói, chạy chính mô hình của cố vấn lại là con đường rẻ hơn để đạt cùng điểm số.
Những gì các phép đo của chính Anthropic cho thấy
Anthropic đã công bố các kết quả đo lường cho mẫu này, và chúng do nhà cung cấp tự báo cáo: được thực hiện bởi chính công ty bán cả hai mô hình, trên hệ thống đánh giá chuẩn của riêng mình. Chúng vẫn là những con số duy nhất thuộc loại này, và chúng bao gồm cả trường hợp chống lại mẫu này, đó là lý do chúng đáng được đọc kỹ.
• Opus 5 làm bộ thực thi với Fable 5.1 làm cố vấn đạt 7,69 USD cho mỗi lần thử trên bộ đánh giá lập trình tác tử nội bộ của Anthropic — cấu hình chính xác nhất mà Anthropic đo được. Con số đó cao hơn 3,5 điểm so với Opus 5 chạy một mình ở thiết lập mặc định, với chi phí thấp hơn một chút, và cao hơn khoảng 2,5 điểm so với Fable 5.1 chạy một mình, với chi phí cao hơn khoảng gấp rưỡi. Khoảng cách 3,5 điểm đã được tách khỏi nhiễu giữa các lần chạy bằng năm lần thử cho mỗi tác vụ.
• Cùng một cặp ghép như vậy trên tác vụ đọc biểu đồ thì ngang bằng với Fable 5.1 chạy đơn lẻ ở mức nỗ lực trung bình, nằm trong phạm vi nhiễu — 65,0 so với 67,5 — nhưng chi phí mỗi tác vụ cao gấp khoảng 2,6 lần, vì advisor được hỏi ý kiến ở gần như mọi tác vụ.
• Trên GPQA Diamond, mức tăng theo sát khoảng cách năng lực gần như hoàn hảo: một mô hình thực thi Haiku 4.5 tăng được rất nhiều, một mô hình thực thi Sonnet 5 tăng vài điểm, còn một mô hình thực thi tiên tiến nhất gần như không tăng gì.
• Tỷ lệ tham vấn là biến số mong manh. Một bộ thực thi Sonnet 5 với nỗ lực thấp đã tăng 23 điểm trên DeepSWE khi có cố vấn, rồi ngừng hỏi hoàn toàn trên SWE-bench Pro và chẳng đạt được gì.
• Độ trễ: khoảng hai lần gọi mô hình tiên tiến bổ sung cho mỗi tác vụ, mỗi lần đều nằm trên đường dẫn tới hạn.
Hai điều về bằng chứng đó liên quan trực tiếp đến vòng lặp ở hiện trạng trong tuần này. Các phép đo dùng Opus 5 làm bên thực thi, vì Opus 5.5 chưa tồn tại khi chúng được chạy. Và Anthropic báo cáo rằng Opus 5.5 thể hiện ở mức ngang với Fable 5.1 trong hầu hết công việc trong khi chi phí chạy thấp hơn 40% — cả hai đều là tuyên bố của nhà cung cấp, và không tuyên bố nào được tái lập độc lập. Nếu khoảng cách giữa bên thực thi và cố vấn là thứ mà cố vấn được trả tiền để thu hẹp, thì một khoảng cách hẹp hơn là một giao dịch mua nhỏ hơn. Mô thức này không trở nên tệ hơn khi Opus 5.5 ra mắt; thứ mà nó bán trở nên bớt khan hiếm hơn.
Những kiểu thất bại mà bạn thực sự sẽ gặp phải
Đây là những hành vi đã được tài liệu hóa, không phải suy đoán, và điều đầu tiên là lý do để đọc phần này trước khi bạn gỡ lỗi bất cứ thứ gì:
• Một cố vấn vắng mặt một cách âm thầm. Nếu API từ chối việc ghép cặp cố vấn, Claude Code gắn nó vào, API từ chối nó, và Claude Code gửi lại yêu cầu mà không có cố vấn. Phần còn lại của cuộc trò chuyện sau đó chạy mà không có cố vấn và không có thông báo lỗi. Nó vẫn tắt cho đến khi /clear hoặc /compact, ngay cả sau khi bạn chuyển sang một mô hình chính tương thích.
• Một trường hợp bị từ chối âm thầm. Với những cặp ghép mà chính Claude Code từ chối, cố vấn đơn giản là không bao giờ được gắn vào các yêu cầu của mô hình chính. Đầu ra của /advisor và một thông báo sẽ cho bạn biết — nhưng không có gì thất bại, nên một phiên mà bạn tưởng là đang được cố vấn có thể chưa từng được cố vấn.
• Sự đồng ý bạn chưa cấp. Khi Fable được chọn làm cố vấn cho một gói yêu cầu sự đồng ý dùng tín dụng sử dụng, các yêu cầu sẽ được gửi đi mà không có cố vấn cho đến khi bạn chấp nhận. Một phiên chạy nền được khởi động với --advisor fable sẽ bắt đầu mà không có cố vấn thay vì thoát ra.
• Một danh sách cho phép mà bạn không kiểm soát. Nếu availableModels, danh sách cho phép của tổ chức bạn, loại trừ model cố vấn, Claude Code sẽ không gọi nó, và bạn cần chọn một model được phép bằng /advisor.
• Ở mọi nơi nó không tồn tại. Chỉ có Anthropic API: không có Bedrock, không có Claude Platform trên AWS, không có Google Cloud Agent Platform, không có Microsoft Foundry. Thông qua một gateway, tính khả dụng phụ thuộc vào việc gateway có chuyển tiếp yêu cầu nguyên vẹn đến Anthropic API hay không — đó là một thuộc tính của gateway, không phải điều bạn có thể giả định.
OrcaRouter phù hợp ở đâu
Cả hai model trong vòng lặp này đều đã có trên OrcaRouter ngay hôm nay ở đúng mức giá niêm yết của chính Anthropic với 0% phụ trội — giá niêm yết của nhà cung cấp được chuyển nguyên vẹn, nên mức giá bạn thấy chính là mức giá Anthropic công bố. Claude Fable 5.1 nằm ở anthropic/claude-fable-5.1 và Claude Opus 5 ở anthropic/claude-opus-5, phía sau một API key duy nhất. Claude Opus 5.5 chưa phải là một trong các route của chúng tôi; nó hiện có sẵn qua API riêng của Anthropic và các cloud lớn, và chúng tôi sẽ nói rõ điều đó thay vì ngụ ý khác đi.

Điều mà một khóa duy nhất mang lại cho bạn ở đây là khả năng đổi ý với chi phí thấp. Tính kinh tế của vòng lặp phụ thuộc vào tỷ lệ giá giữa bên thực thi và bên cố vấn, và tỷ lệ đó đã dịch chuyển hai lần trong bảy tuần — Opus 5 lên Opus 5.5 vào ngày 22 tháng 9, và Fable 5 lên Fable 5.1 vào ngày 1 tháng 9, điều này cắt mức đọc cache của mô hình đó từ $1.00 xuống $0.25 mỗi triệu. Mỗi một thay đổi trong số đó đều làm thay đổi câu trả lời cho câu hỏi "liệu bên cố vấn có đáng không", và việc kiểm chứng câu trả lời đó không nên đòi hỏi một hợp đồng thứ hai. Chuyển đổi dự phòng tự động là nửa còn lại: nó cho phép bạn hướng một phần lưu lượng đến một mô hình mà bạn chưa mô tả đặc điểm, với phương án dự phòng là mô hình bạn đã có, thay vì đặt cược một đường dẫn vận hành vào một bảng ra mắt. Và nếu bạn tự xây dựng mẫu hình này thay vì dùng công cụ tích hợp sẵn của Claude Code, DSL định tuyến kết hợp nhiều mô hình vào một lời gọi duy nhất — một bước lập kế hoạch trên một mô hình, tiếp nối bằng các bước thực thi trên một mô hình khác, tất cả đằng sau một điểm cuối.
Một lưu ý trung thực về phạm vi: bản thân công cụ advisor là một công cụ phía máy chủ chạy trên API của Anthropic, nên một lớp định tuyến không thể thay thế nó. Điều chúng tôi có thể làm là đưa các mô hình đến mức chỉ cần một khóa là dùng được, với giá niêm yết, để quyết định giữ hay bỏ advisor là do bạn đưa ra dựa trên các con số của chính bạn.
Cách quyết định cho khối lượng công việc của riêng bạn
Hướng dẫn của chính Anthropic là điểm khởi đầu đúng đắn, và nó mang tính thực tế không chút ủy mị đến sảng khoái: hãy chạy bộ đánh giá của bạn với ba cấu hình — chỉ riêng bộ thực thi, bộ thực thi có một cố vấn, và chỉ riêng mô hình của cố vấn ở mức nỗ lực thấp — rồi kiểm tra lại ở mỗi bản phát hành mô hình, vì các bản phát hành làm thay đổi cả khoảng cách năng lực lẫn tỷ lệ giá. Cấu hình cuối cùng trong ba cấu hình đó là mốc cơ sở cần vượt qua. Nếu chỉ riêng mô hình của cố vấn ở mức nỗ lực thấp đạt điểm ngang bằng với vòng lặp với chi phí thấp hơn, thì bạn đã có câu trả lời.
Hai biến cần theo dõi là những biến do Anthropic đặt tên. Khoảng cách năng lực: khoảng cách lớn giữa bên thực thi và cố vấn là nơi cố vấn kiếm được phí của mình, và Opus 5.5 đã thu hẹp khoảng cách đó từ phía dưới. Tỷ lệ tham vấn: mức tăng gần như tương ứng một-một với nó, và nó nhạy cảm với prompt đến mức có thể sụp đổ — một bên thực thi ở mức nỗ lực thấp có thể ngừng nhận ra mình đang bế tắc, và một cặp đôi tham vấn ở hầu hết tác vụ tại mức nỗ lực mặc định có thể giảm xuống gần như không còn. System prompt do Anthropic cung cấp yêu cầu một lần gọi cố vấn trước khi làm việc thực chất và một lần trước khi kết thúc, rơi vào khoảng hai đến ba lần tham vấn mỗi tác vụ; cặp đôi lập trình tạo ra mức tăng 3,5 điểm đã chạy ở nhịp đó. Hãy dự trù ngân sách cho mức đó, đặt trần cho nó, và coi mỗi lần tham vấn vượt mức đó là dấu hiệu rằng bên thực thi của bạn bị cấu hình sai chứ không phải rằng tác vụ đó khó.
Đối với vòng lặp cụ thể trong bài viết này, ba cài đặt cụ thể đảm nhiệm phần lớn công việc. Hãy giữ Claude Opus 5.5 ở mức effort medium mặc định thay vì chọn high, vì effort ảnh hưởng trực tiếp đến chi phí và chính các con số Opus 5.5 của Anthropic cho thấy mức medium gần như chẳng đánh đổi bao nhiêu. Đặt advisor bằng /advisor fable và xác nhận banner thực sự xuất hiện — không có banner nghĩa là advisor đang vắng mặt một cách âm thầm. Và trước khi bạn nhân rộng mô hình này, hãy đo lượng token trên mỗi tác vụ đã hoàn thành thay vì giá trên mỗi token, vì đó mới là con số mà vòng lặp này được kỳ vọng sẽ cải thiện.
FAQ
Cố vấn có tiêu thụ cùng hạn mức Fable như một phiên Fable không?
Về tính phí API, token advisor được tính theo đúng mức giá đầu vào và đầu ra của Fable 5.1, và giới hạn tốc độ của advisor lấy từ cùng một bucket theo từng mô hình như các lệnh gọi trực tiếp đến mô hình đó — do đó, một lệnh gọi advisor bị giới hạn tốc độ sẽ hiện ra dưới dạng lỗi bên trong kết quả công cụ thay vì làm yêu cầu của bạn thất bại. Với các gói đăng ký, mức sử dụng advisor được tính vào giới hạn sử dụng của gói bạn, chỉ khác là advisor Fable được tính vào tín dụng sử dụng trên những gói mà mức sử dụng Fable cũng được tính như vậy. Hệ quả thực tế là advisor không phải một ngân sách riêng mà bạn có thể chi tiêu thoải mái; nó cạnh tranh với mọi thứ khác mà bạn làm trên mô hình đó.
Người cố vấn thực sự được thấy những gì?
Toàn bộ cuộc hội thoại, bao gồm mọi lệnh gọi công cụ và mọi kết quả công cụ — nội dung tệp, đầu ra lệnh, thông báo lỗi, tất tần tật. Nó chạy dưới lời nhắc hệ thống do Anthropic cung cấp riêng cho nó và trả về một kế hoạch, một chỉnh sửa hoặc một tín hiệu dừng. Từ đó suy ra hai chi tiết. Thứ nhất, mỗi lần tham vấn đều đọc lại toàn bộ bản ghi, đó là lý do chi phí tăng theo vòng lặp thay vì giữ nguyên. Thứ hai, nếu phiên của bạn động đến tài liệu mà bạn sẽ không gửi cho một mô hình thứ hai ở mức giá của cố vấn, thì cố vấn chính là một mô hình thứ hai đang đọc toàn bộ tài liệu đó.
Điều gì sẽ làm thay đổi câu trả lời
Hai điều, và cả hai đều gần hơn so với vẻ ngoài của chúng. Nếu các bên benchmark độc lập công bố một lần chạy Opus 5.5 đối đầu Fable 5.1 với cùng mức công sức và xác nhận mức thu hẹp mà Anthropic tuyên bố, thì lợi thế còn lại của cố vấn trên hầu hết tác vụ là rất mỏng — và vòng lặp trở thành một công cụ cho phần đuôi khó thay vì là mặc định. Ngược lại, nếu tỷ lệ hỏi cố vấn vẫn giữ nguyên và khoảng cách năng lực vẫn rộng trong công việc agentic dài hơi, thì phép tính ở trên chính là thứ bạn đang chọn giữa, và $6 tư vấn cho một lần chạy $14 là một quyền chọn rẻ để không phát hành nhầm thứ.
Điều sẽ không thay đổi là cơ chế nằm ở đầu bài viết này. Ngữ cảnh của executor được lưu đệm và rẻ; ngữ cảnh của advisor thì không hề như vậy. Bất kỳ vòng lặp nào tham vấn một mô hình đắt đỏ hơn ngay giữa tác vụ đều thừa hưởng sự bất đối xứng đó, bất kể bảng giá nói gì vào tháng sau.
So sánh trong bài viết này1
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
