
Muse Spark 1.2 vs Gemini 3.5 Flash-Lite: Hai Lab, Hai Định Nghĩa về Subagent
- metaMỚIMeta: Muse Spark 1.22026-08-0557Trí tuệ72Lập trình
- qwenMỚIQwen: Qwen3.8 Max2026-08-0358Trí tuệ72Lập trình
- deepseekMỚIDeepSeek: DeepSeek V4 Flash 07312026-07-3152Trí tuệ69Lập trình
- minimaxMỚIMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token · 2046 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Trí tuệ78Lập trình
- googleGoogle: Gemini 3.6 Flash2026-07-2152Trí tuệ69Lập trình
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Trí tuệ49Lập trình
- metaMeta: Muse Spark 1.12026-07-1653Trí tuệ71Lập trình
- kimiMoonshotAI: Kimi K32026-07-1560Trí tuệ76Lập trình
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Trí tuệ71Lập trình
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Trí tuệ77Lập trình
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Trí tuệ77Lập trình
- grokxAI: Grok 4.52026-07-0856Trí tuệ72Lập trình
- tencentTencent: Hy32026-07-0642Trí tuệ59Lập trình
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Trí tuệ42Lập trình
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Trí tuệ39Lập trình
- anthropicAnthropic: Claude Sonnet 52026-06-3055Trí tuệ72Lập trình
- klingKling: Kling 3.0 Turbo2026-06-1757Trí tuệ52Lập trình57Toán
Trong vòng hai tuần, hai phòng thí nghiệm đã phát hành mỗi bên một mô hình và mô tả nó bằng cùng một từ ngữ. Theo thẻ mô hình của chính nó, Gemini 3.5 Flash-Lite "phù hợp với các subagent thực hiện các tác vụ tập trung trong các quy trình làm việc đa tác nhân phức tạp." Meta cho biết Muse Spark 1.2 có thể đóng vai trò "là agent chính để lập kế hoạch và phân công hoặc là subagent thực hiện song song." Cùng một từ vựng, và phải đến khi Artificial Analysis cho cả hai chạy qua Intelligence Index mới thấy rõ chúng mang ý nghĩa khác nhau đến mức nào: Flash-Lite hoàn thành bộ bài kiểm tra với 43 triệu token đầu ra, còn Muse Spark 1.2 cần tới 95 triệu. Một trong những mô hình này suy nghĩ ngắn gọn và thường xuyên; mô hình kia suy nghĩ kỹ lưỡng và lâu dài. Cả hai đều gọi kết quả là một subagent.
Tỷ lệ token đó là con số quyết định nhất trong phép so sánh, vì một tầng subagent là thứ bạn phân nhánh — hai mươi con một lúc, một trăm con một lúc — và việc phân nhánh nhân lên mọi thói quen cho mỗi lần gọi của mô hình. Phần tiếp theo sẽ phân tích từng phòng lab thực sự đã xây dựng điều gì, phép toán phân nhánh trông ra sao ở mức giá thực tế, và nơi nào lựa chọn rẻ hóa ra lại là lựa chọn đắt đỏ.
Mỗi phòng thí nghiệm muốn nói gì qua từ này
Phiên bản Flash-Lite là một định nghĩa vai trò dựa trên kích thước. Gemini 3.5 Flash-Lite là bậc rẻ nhất trong họ của nó, và định vị đó đáng chú ý ở chỗ gắn trực tiếp mức độ suy luận với khối lượng công việc của các tác nhân con đa bước — lần đầu tiên một bậc trong họ đó được mô tả theo vai trò tác nhân thay vì theo kích thước hay tốc độ. Suy luận là bắt buộc nhưng mức nỗ lực mặc định là tối thiểu, núm điều chỉnh chỉ lên tới mức cao, và mô hình được thiết kế để tạo hàng loạt và phản hồi nhanh. Nhà cung cấp báo cáo 54,2% trên SWE-Bench Pro so với 49,6% của Gemini 3 Flash, và 74,0% trên OSWorld-Verified so với 65,1% — cả hai đều là số liệu do nhà cung cấp báo cáo, không được tái lập độc lập, và cả hai đều được đóng khung như những cải thiện về năng lực tác nhân thay vì những cải thiện về trí thông minh thô.
Phiên bản của Meta là một định nghĩa vai trò dựa trên cấu trúc liên kết. Phần giới thiệu sản phẩm của Muse Spark 1.2 mô tả một mô hình có thể thu thập ngữ cảnh, lập kế hoạch và ủy quyền thực thi trên các tác nhân phụ song song — hoặc tự mình trở thành một trong các tác nhân phụ đó. Núm điều chỉnh suy luận của nó chạy từ minimal đến xhigh với mặc định là medium, và Meta nêu rõ các tác vụ mục tiêu: tái cấu trúc đa tệp, phiên gỡ lỗi kéo dài, tạo toàn bộ kho mã. Đây là mô hình được thiết kế để làm bộ điều phối nhưng cũng có thể tự thực hiện công việc, khác hẳn với mô hình được thiết kế để tạo ra hai mươi bản cùng lúc.
Cả hai phòng thí nghiệm đều không công bố điểm chuẩn cho tuyên bố cụ thể đó. Meta đã phát hành phiên bản 1.2 vào ngày 5 tháng 8 mà không có bài đăng ra mắt nào cả — trang thông báo Muse Spark 1.1 của họ vẫn mô tả phiên bản trước.
Khoảng cách mà chỉ số thực sự đo lường

Điểm số độc lập, từ Artificial Analysis chạy cùng một tổ hợp chín bài đánh giá trên cả hai:
• Intelligence Index — Muse Spark 1.2 (xhigh) 54, xếp hạng #13/185. Gemini 3.5 Flash-Lite 36, xếp hạng #20/163. Chênh lệch 18 điểm, so với mức trung vị 32 của nhóm.
• Tốc độ đầu ra — 165,0 token mỗi giây so với 343,6. Flash-Lite truyền tải nhanh hơn gấp đôi.
• Thời gian đến token đầu tiên — 26,12 giây so với 10,30, cả hai ở mức nỗ lực tối đa. Artificial Analysis lưu ý rằng con số 10,30 giây của Flash-Lite tự nó đã ở mức cao đối với các mô hình suy luận trong phân khúc giá của nó.
• Độ dài dòng — 95 triệu token đầu ra so với 43 triệu cho cùng một bộ bài kiểm tra, với mức trung vị 65 triệu trên tất cả các mô hình. Muse Spark 1.2 cao hơn mức trung vị 46%; Flash-Lite thấp hơn 34%.
• Chi phí vận hành chỉ số — $637.85 so với $153.08.
• Theo từng chiều — Các chỉ số phụ của Artificial Analysis xếp Gemini 3.5 Flash-Lite ở mức 49.3 về lập trình và 26.8 về tác nhân. Hiện chưa có bảng phân tích chi tiết nào được công bố cho Muse Spark 1.2; phiên bản tiền nhiệm của nó đạt 71.3 và 37.5.
Mười tám điểm chỉ số không phải là khác biệt do làm tròn. Đây không phải là hai ứng viên cho cùng một vị trí.
Phép toán fan-out
Giá trên mỗi token không phải là lăng kính đúng để nhìn vào một hạng subagent, vì toàn bộ ý nghĩa của hạng này nằm ở việc bạn chạy rất nhiều subagent. Hãy thử một ví dụ ở mức giá niêm yết — $0.30 đầu vào và $2.50 đầu ra cho Gemini 3.5 Flash-Lite, $1.25 đầu vào và $4.25 đầu ra cho Muse Spark 1.2.
Một bộ điều phối giao việc cho hai mươi tác tử phụ. Mỗi tác tử phụ đọc 25.000 token ngữ cảnh trong phạm vi được giao và ghi trả về 1.500 token.
• Gemini 3.5 Flash-Lite — 20 × ($0,0075 + $0,00375) = khoảng 22,5 xu cho mỗi fan-out.
• Muse Spark 1.2 — 20 × ($0,03125 + $0,006375) = khoảng 75 xu cho mỗi fan-out.
Gấp 3⅓ lần, nghe có vẻ khả thi. Giờ hãy áp dụng chênh lệch độ dài phản hồi đã đo được. Nếu Muse Spark 1.2 viết nhiều hơn theo tỷ lệ so với Flash-Lite như nó đã làm trên chỉ mục — khoảng gấp 2,2 lần số token đầu ra cho cùng một công việc — thì những phản hồi 1.500 token đó trở thành khoảng 3.300, và chi phí fan-out tăng lên khoảng 91 xu. Bốn lần, không phải ba. Với một trăm lần fan-out mỗi giờ trong một hệ thống tác tử bận rộn, đó là chênh lệch giữa $22 và $91 mỗi giờ, tức là chênh lệch khoảng $600.000 mỗi năm khi hoạt động liên tục.
Hai chi tiết định giá khiến khoảng cách thực tế rộng hơn theo một hướng và hẹp hơn theo hướng còn lại:
• Flash-Lite tính phí suy luận nội bộ theo mức giá đầu ra. Nó niêm yết token suy luận nội bộ ở mức 2,50 đô la mỗi triệu — tương đương với đầu ra hiển thị. Suy nghĩ không miễn phí, nó chỉ vô hình trong phản hồi mà thôi. Nếu một subagent tiêu tốn 2.000 token để cân nhắc trước khi trả lời, hãy cộng thêm nửa xu cho mỗi lần gọi, hoặc 10 xu cho toàn bộ fan-out.
• Về mặt tỷ lệ, bộ nhớ đệm ưu ái Muse Spark 1.2.Đọc đầu vào từ bộ nhớ đệm có giá $0.15 mỗi triệu lượt so với mức niêm yết $1.25 — tức giảm 88%. Flash-Lite đọc đầu vào từ bộ nhớ đệm với giá $0.03 so với $0.30, giảm 90%, nhưng cũng tính phí khoảng $0.083 mỗi triệu lượt ghi vào bộ nhớ đệm, trong khi Muse Spark 1.2 không công bố phí ghi bộ nhớ đệm riêng. Đối với mô hình fan-out trong đó mọi subagent dùng chung cùng một tiền tố lớn, khoảng cách này được thu hẹp đáng kể.

Độ trễ trong môi trường sản xuất chính là nơi Flash-Lite vượt trội nhất, và các con số benchmark che giấu điều đó.thời gian p50 đến token đầu tiên là 816 mili giây và p95 là 4,57 giây. Muse Spark 1.1 — proxy gần nhất hiện có, vì 1.2 chưa có telemetry — cho thấy p50 là 1,84 giây và p95 là 6,00 giây. Khi 20 subagent chạy song song, agent chậm nhất sẽ quyết định thời gian thực, vì vậy p95 là con số chi phối độ trễ fan-out của bạn, không phải p50.
Nơi mà lựa chọn rẻ lại là quyết định sai.
Bốn hạn chế của Gemini 3.5 Flash-Lite không xuất hiện trong bảng so sánh giá nhưng sẽ xuất hiện trong đánh giá sự cố.
• Giới hạn đầu ra 65.536 token. Bằng một nửa mức mà hầu hết các mô hình cùng phân khúc cho phép, và là rào cản cứng đối với tác nhân phụ được yêu cầu tạo một tệp lớn hoặc trả về một tài liệu có cấu trúc dài. Endpoint của Muse Spark 1.2 không khai báo giới hạn độ dài hoàn thành tối đa nào cả — điều này đủ bất thường để cần kiểm tra thay vì tin tưởng, nhưng nó không phải là một giới hạn được ghi nhận chính thức.
• Đây là một điểm cuối không được kiểm duyệt. Mục Flash-Lite không có cờ kiểm duyệt; còn mục của Meta cho Muse Spark 1.2 thì có. Đó là một lợi thế thực sự đối với một số tác vụ nhưng lại là vấn đề tuân thủ đối với những tác vụ khác, và đó nên là một lựa chọn có chủ đích thay vì một phát hiện tình cờ.
• Tìm kiếm tích hợp đắt đỏ. Công cụ tìm kiếm web của Flash-Lite có giá khoảng 14 đô la cho một nghìn lượt gọi, so với 2,50 đô la cho Muse Spark 1.2. Nếu các tác nhân con của bạn nghiên cứu thay vì chỉ đọc, mô hình rẻ tiền trở thành mô hình đắt đỏ — gấp năm lần rưỡi — và khối lượng tìm kiếm trong kiến trúc fan-out tỉ lệ thuận với mức độ fan-out.
• Giá của nó tăng, không phải giảm. Gemini 3.5 Flash-Lite có giá $0.30 và $2.50, trong khi Gemini 3.1 Flash-Lite trước đây có giá $0.25 và $1.50. Giá đầu ra đắt hơn 67% so với mức mà nó thay thế. Nếu bạn đã tính ngân sách cho subagent dựa trên mô hình cũ, hãy tính lại.

Một bất đối xứng nữa đáng nói thẳng: Muse Spark 1.2 chỉ được phục vụ bởi đúng một nhà cung cấp — Meta — không có máy chủ bên thứ ba và không có phương án dự phòng. Gemini 3.5 Flash-Lite có hạ tầng phục vụ đa khu vực tiêu chuẩn của bên thứ nhất. Đối với một bộ điều phối, đó là điểm lỗi duy nhất cho toàn bộ cây agent của bạn; đối với tầng worker, đó là điểm lỗi duy nhất cho việc fan-out.
Sự kết hợp mà hầu hết các nhóm sẽ thực sự chọn
Khi đặt cạnh nhau để so sánh, hai mô hình này không hẳn là đối thủ cạnh tranh mà đúng hơn là hai nửa của cùng một kiến trúc, và chính nội dung mô tả sản phẩm của Meta cũng nói rõ điều đó khi mô tả vai trò primary-agent một cách tách biệt với vai trò subagent.
Hình dạng sinh ra từ những con số: Muse Spark 1.2 là bộ điều phối, Gemini 3.5 Flash-Lite là các worker. Một lần gọi đắt đỏ và có chủ đích để đọc kho mã nguồn, nắm giữ kế hoạch và quyết định việc cần ủy thác — nơi 26 giây suy nghĩ và độ dài dòng ở quy mô 95 triệu token mang lại cho bạn một kế hoạch đáng để thực thi — tiếp theo là hai mươi lần gọi rẻ, nhanh và có phạm vi hẹp, mỗi lần chỉ làm một việc cụ thể và trả về trong chưa đầy một giây ở p50. Bạn trả mức giá gần sát frontier một lần cho mỗi tác vụ và mức giá tiết kiệm cho từng đơn vị công việc — đúng là đường cong chi phí mà kiến trúc fan-out cần.
Đảo ngược nó lại, và tính kinh tế sẽ sụp đổ. Hai mươi tác tử phụ Muse Spark 1.2 với giá 91 xu mỗi fan-out sẽ tốn gấp bốn lần chi phí cho công việc mà một mô hình yếu hơn 18 điểm hoàn thành trong một phần ba thời gian, và một bộ điều phối Flash-Lite ở index 36 sẽ tạo ra các kế hoạch mà các tác tử phụ không thể cứu vãn.
Việc xây dựng một hệ thống phân chia giữa hai nhà cung cấp từng là phần khó xử. Gemini 3.5 Flash-Lite có trong danh mục OrcaRouter với giá $0.30 và $2.50 — giá niêm yết của nhà cung cấp, được chuyển qua với mức tăng giá 0%, nên thay đổi giá sẽ cập nhật về phía chúng tôi ngay trong ngày thay vì sau một chu kỳ hợp đồng — và Muse Spark 1.1 cũng ở đó với giá $1.25 và $4.25 trên cùng cơ sở đó, cả hai đều nằm sau một điểm cuối tương thích OpenAI. Điều đó có nghĩa là mô hình orchestrator-and-workers chỉ là hai chuỗi mô hình trong một mã nguồn thay vì hai SDK, hai khóa và hai hóa đơn, và cơ chế chuyển đổi dự phòng tự động sẽ xử lý trường hợp một nhà cung cấp gặp trục trặc giữa lúc fan-out. Để nói chính xác về những gì hiện có: Bản thân Muse Spark 1.2 vẫn chưa có trong danh mục — Meta trực tiếp cung cấp mô hình này với tư cách là nhà cung cấp duy nhất — nên hiện tại phiên bản sát nhất của stack này chạy 1.1 ở vị trí orchestrator.
Chọn theo vai trò, không phải theo điểm số
Nếu bạn đang chọn một tầng worker — phân tích tài liệu, trích xuất dữ liệu, chỉnh sửa tệp có phạm vi, phân loại, phần giữa hẹp lặp đi lặp lại của cây agent — Gemini 3.5 Flash-Lite là công cụ tốt hơn, và mức thiếu hụt 18 điểm chỉ số hầu như không liên quan vì bạn không yêu cầu nó suy luận. Hãy theo dõi trần đầu ra và mức giá tìm kiếm.
Nếu bạn đang chọn mô hình quyết định các worker làm gì, Muse Spark 1.2 là ứng viên mạnh hơn trong hai mô hình, với những lưu ý rằng nó không có điểm số agentic độc lập theo từng khía cạnh, không có bất kỳ hồ sơ arena nào, không có dữ liệu telemetry sản xuất, và chỉ có một nhà cung cấp. Đó là những khoảng trống cần được lấp trước khi nó có thể đảm nhiệm một kế hoạch sản xuất.
Và nếu bạn hy vọng một mô hình có thể đảm nhận cả hai công việc, câu trả lời thẳng thắn từ các phép đo là không mô hình nào làm được. Flash-Lite không thể lập kế hoạch ở chỉ số 36; Muse Spark 1.2 không thể khởi tạo hai mươi thể hiện cùng lúc với giá 91 xu cho mỗi lần fan-out. Từ "subagent" xuất hiện trong cả hai mô tả sản phẩm chỉ là một sự trùng hợp tiếp thị, không phải dấu hiệu cho thấy chúng thuộc cùng một vị trí.
So sánh trong bài viết này2
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
