
GPT-6 Sol vs Muse Spark 1.2: Một trong số chúng có tai
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 127 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 58 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 350 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
Đặt GPT-6 Sol và Muse Spark 1.2 cạnh nhau và các cột giá chỉ đơn thuần khác nhau, trong khi các cột phương thức thì không gần nhau chút nào. Muse Spark 1.2 chấp nhận văn bản, hình ảnh, video, tệp và âm thanh. GPT-6 Sol chấp nhận văn bản, hình ảnh và tệp. Âm thanh và video là điểm khác biệt, và chúng không phải là chi tiết nhỏ nhặt: chúng tách biệt một mô hình có thể được giao bản ghi âm cuộc họp khỏi một mô hình buộc phải được giao bản chép lời của cuộc họp đó. GPT-6 Sol, hạng trung của thế hệ đó, ra mắt ngày 22 tháng 9 năm 2026; Muse Spark 1.2, checkpoint hiện tại của Meta trong dòng Muse Spark, ra mắt ngày 5 tháng 8 năm 2026 dưới dạng bản cập nhật thay thế trực tiếp cho Muse Spark 1.1 trên cùng hạng Standard với mức giá y hệt.
Điểm cuối cùng đó quan trọng đối với cách đọc trang này. Muse Spark 1.2 không phải là một thế hệ mới và không nên được viết về nó như thể là một thế hệ mới — mô tả của chính Meta là một checkpoint được cập nhật với hiệu năng cao hơn một chút, được cung cấp với mức giá không đổi. Vậy nên câu hỏi thú vị không phải là 1.2 bổ sung những gì so với 1.1. Mà là dòng Muse Spark có những gì mà dòng GPT-6 không có, và liệu bạn có cần nó hay không.
Hai bảng thông số kỹ thuật, về những kích thước khác biệt
• Phương thức nhập liệu — GPT-6 Sol văn bản, hình ảnh và tệp so với Muse Spark 1.2 văn bản, hình ảnh, video, tệp và âm thanh
• Đầu ra — cả hai chỉ là văn bản
• Giá đầu vào — GPT-6 Sol $2.00 mỗi triệu so với Muse Spark 1.2 $1.25 mỗi triệu
• Giá đầu ra — GPT-6 Sol 10,00 USD mỗi triệu so với Muse Spark 1.2 4,25 USD mỗi triệu
• Đầu vào đã lưu trong bộ nhớ đệm — GPT-6 Sol $0,20 mỗi triệu so với Muse Spark 1.2 $0,15 mỗi triệu
• Cửa sổ ngữ cảnh — 1.050.000 token so với 1.048.576 token, thực chất là như nhau
• Bậc giá yêu cầu dài — GPT-6 Sol định giá lại toàn bộ yêu cầu vượt 272.000 token đầu vào ở mức $4.00 / $15.00, còn Muse Spark 1.2 không có bậc này trên bảng giá của nó
• GPQA Diamond — GPT-6 Sol 96,1 so với Muse Spark 1.2 90,4
• Humanity's Last Exam — GPT-6 Sol 47.9 so với Muse Spark 1.2 45.5
• Khả năng ghi nhớ ngữ cảnh dài — GPT-6 Sol 83.7 so với Muse Spark 1.2 79.0
• tau-banking — GPT-6 Sol không được công bố trong bản sửa đổi này so với Muse Spark 1.2 34.8
• Trọng số — cả hai đều đóng, chỉ API
Dòng yêu cầu dài đang âm thầm làm việc trong danh sách đó. Muse Spark 1.2 không có điều khoản định giá lại theo ngữ cảnh dài trên bảng giá công bố của nó, vì vậy mức $1.25 / $4.25 của nó được giữ nguyên trong toàn bộ cửa sổ. Mức giá tiêu đề của GPT-6 Sol thì không: vượt quá 272.000 token đầu vào, toàn bộ yêu cầu chuyển sang $4.00 / $15.00. Do đó, trên một prompt đầy đủ ngữ cảnh, so sánh đầu ra không phải là mười đô la so với $4.25, mà là mười lăm so với $4.25 — gấp ba lần rưỡi, chứ không phải hai và một phần ba.
Và khoảng cách điểm chuẩn hẹp hơn so với mức chênh lệch giá. GPQA Diamond, 96,1 so với 90,4, đại khái là mức chênh lệch bạn sẽ kỳ vọng từ hai thiết lập mức độ nỗ lực suy luận khác nhau chứ không phải từ sự khác biệt về năng lực, và ở Humanity's Last Exam, hai bên đạt 47,9 và 45,5, tức 2,4 điểm trên thang một trăm điểm. Muse Spark 1.2 là mô hình rẻ hơn và là công cụ đọc có năng lực toàn diện hơn; GPT-6 Sol dẫn trước về các chỉ số suy luận nhưng không phải với mức cách biệt mà giá cả ngụ ý. Không bên nào vượt trội hoàn toàn, và chính điều đó khiến lựa chọn này đáng để đưa ra một cách có cân nhắc.

Đầu vào âm thanh và video thực sự thay đổi điều gì
Một mô hình chấp nhận âm thanh có thể được đưa cho một bản ghi âm thay vì một bản chép lời. Điều đó nghe như một sự tiện lợi và thực ra là một thay đổi về những gì có thể làm được: chép lời là một bước gây mất mát, nơi bị loại bỏ giọng điệu, sự chồng lấn, tiếng cười, và sự khác biệt giữa một câu hỏi và một câu trần thuật khi chỉ đọc từ văn bản. Một mô hình nghe trực tiếp tệp sẽ thấy được tất cả những điều đó. Lập luận tương tự cũng áp dụng cho video, nơi mô tả từng khung hình làm mất đi yếu tố thời gian còn một mô hình tiếp nhận trực tiếp đoạn clip thì không.
Câu trả lời của GPT-6 Sol là một pipeline chứ không phải một phương thức — phiên âm hoặc tạo chú thích trước, rồi truyền văn bản. Đó là một kiến trúc hoàn toàn khả thi và với nhiều khối lượng công việc, nó là lựa chọn tốt hơn, vì bản phiên âm có thể kiểm tra, có thể lưu đệm và lưu trữ với chi phí thấp. Nó kém hơn đúng ở những trường hợp âm thanh hoặc chuyển động chính là tín hiệu: đánh giá chất lượng ở trung tâm cuộc gọi, ghi nhật ký phương tiện, bất cứ thứ gì mà sự ngập ngừng của người nói mang ý nghĩa.
Quan điểm của Meta về vấn đề này đáng để đọc kỹ, bởi vì thẻ audio không phải là thứ chỉ để trang trí. Muse Spark 1.2 được liệt kê có audio trong số các khả năng của mình, cùng với thị giác, công cụ, JSON và suy luận, và Meta đã phát hành dòng sản phẩm này như dòng đa phương thức của mình, trong khi Muse Glimmer nhỏ hơn được chưng cất từ một mô hình thầy Muse Spark. Nếu bạn đang lựa chọn giữa hai mô hình này dựa trên bề mặt đầu vào, thì lựa chọn không phải là giữa một bảng thông số hơi rộng hơn và một bảng hơi hẹp hơn. Mà là giữa việc sở hữu phương thức đó và việc xây dựng một pipeline để mô phỏng gần đúng nó.
Nơi hai thứ thực sự tách biệt
Sự tách biệt rõ ràng nhất là việc sử dụng công cụ dạng tác tử với một dịch vụ mô phỏng, và đây là chỗ duy nhất các con số cách xa nhau đủ để có thể hành động dựa trên đó. Muse Spark 1.2 đạt 34.8 trên tau-banking và chỉ 7.1 trên bản sửa đổi Terminal-Bench 4.0 mới hơn — cả hai đều là các đo lường của bên thứ ba, và cả hai đều mô tả cùng một điểm yếu từ hai hướng. Một mô hình đọc tốt một cuộc họp rồi sau đó tính sai số dư của khách hàng khi được yêu cầu gọi API không phải là một mô hình tồi; đó là một mô hình có phạm vi công việc được giới hạn rõ ràng.
Chạy cùng phép kiểm tra trên GPT-6 Sol và bức tranh vẫn nhất quán nhưng mỏng hơn. Khả năng nhớ lại ngữ cảnh dài của nó ở mức 83.7, SciCode ở mức 57.6 và Terminal-Bench 4.0 của nó ở mức 43.9, tất cả đều từ bên thứ ba. Các số liệu về lập trình và terminal-agent của nó trên bản sửa đổi v2.1 đơn giản là không có, và việc thiếu một con số không phải là một con số thấp — bất kỳ ai điền vào ô đó bằng một ước tính đều đang bịa đặt.
Một sự bất đối xứng đáng được gọi tên trước khi các con số bị đem ra so sánh một cách quá hấp tấp. Muse Spark 1.2 mang theo một bộ benchmark đầy đủ của nhà cung cấp từ Meta bên cạnh bộ của bên thứ ba, và phân tích ra mắt của chính Artificial Analysis đặt nó ở mức 54 trên Intelligence Index tại thiết lập suy luận xhigh, cao hơn Muse Spark 1.1 ba điểm. GPT-6 Sol đạt 47.6 trên cùng chỉ số đó trong danh mục của chúng tôi. Hai con số ấy không thể trừ cho nhau: chúng đến từ những cấu hình khác nhau được đo ở những thời điểm khác nhau, và một chỉ số được chỉnh sửa giữa hai thời điểm đó không phải là cùng một công cụ đo. Những tuyên bố so sánh trung thực là những tuyên bố dựa trên một benchmark đơn lẻ ở trên, nơi cả hai mô hình đều có một con số từ cùng một đơn vị đánh giá. Khi một mô hình có nhiều số liệu được công bố hơn, nó sẽ luôn trông được ghi chép đầy đủ hơn một mô hình có ít hơn, và ở cặp này, phần lớn khác biệt đó là về việc ai báo cáo chứ không phải về việc các mô hình có thể làm gì.

Phục vụ hai mô hình hoạt động khác nhau khi chịu tải
Cả hai đều nằm trên OrcaRouter, một khóa, và cặp đôi này là một sự phân tách định tuyến tự nhiên thay vì chọn một trong hai. Hãy gửi lưu lượng đa phương thức — các bản ghi âm, các clip, các gói tài liệu kèm tệp đính kèm được quét — đến Muse Spark 1.2 với mức $1.25 / $4.25 mà không có vực thẳm ngữ cảnh dài. Hãy gửi lưu lượng nặng về suy luận và tác tử đến GPT-6 Sol và chấp nhận mức giá cao hơn cho những yêu cầu mà câu trả lời phải trụ được dưới sự soi xét. Qua một điểm cuối duy nhất, sự phân tách đó là một quy tắc định tuyến, chứ không phải hai tích hợp.
Một con số ở phía phục vụ đi ngược lại logic giá. Muse Spark 1.2 được đo ở mức khoảng 420 token đầu ra mỗi giây trong cửa sổ bảy ngày cuốn chiếu của chúng tôi, so với khoảng 244 của GPT-6 Sol — mô hình của Meta vừa rẻ hơn vừa nhanh hơn trên các tuyến của chúng tôi. Độ trễ lại diễn ra theo hướng ngược lại ở token đầu tiên: thời gian đến token đầu tiên ở p50 khoảng 5,2 giây đối với Muse Spark 1.2, so với khoảng 6,8 đối với GPT-6 Sol trong cùng cửa sổ, nên mô hình rẻ hơn cũng bắt đầu trả lời sớm hơn. Cả hai đều là các phép đo cuốn chiếu trên hạ tầng dùng chung chứ không phải một bài đánh giá chuẩn có kiểm soát, và cả hai đều thay đổi giữa các lần đọc.
Chuyển đổi dự phòng tự động khẳng định được vị trí của mình trên một pipeline hỗn hợp như thế này. Khi một yêu cầu có thể đến dưới dạng âm thanh và rời đi dưới dạng văn bản qua một tuyến, hoặc dưới dạng một bước phiên âm bắt buộc qua một tuyến khác, chế độ lỗi mà bạn quan tâm là nhà cung cấp chấp nhận yêu cầu rồi bị treo ở bước tải lên phương tiện — một tuyến thứ hai đã được cấu hình biến điều đó thành một lần thử lại thay vì một tác vụ mà ai đó phải để ý và chạy lại. Danh mục của chúng tôi chuyển tiếp nguyên trạng giá niêm yết của nhà cung cấp, nên nếu Meta thay đổi mức $4.25, hoặc thêm điều khoản ngữ cảnh dài vào thẻ Muse Spark theo cách mà những thẻ khác đã có, thay đổi sẽ đến với bạn ngay trong ngày nó xảy ra thay vì sau khi một nhà bán lại phát hiện ra.

Quyết định, nói thẳng ra.
Nếu đầu vào của bạn là bản ghi âm hoặc một clip và thời lượng hoặc giọng điệu là một phần của ý nghĩa, hãy dùng Muse Spark 1.2. Không có cấu hình nào của GPT-6 Sol đạt được năng lực đó thông qua API, và không có mức giá nào khiến quy trình thay thế trở nên tương đương. Nếu đầu vào của bạn là văn bản và hình ảnh và đầu ra sẽ được hành động dựa trên đó, các chỉ số suy luận của GPT-6 Sol dẫn trước và hồ sơ sử dụng công cụ của nó là lựa chọn an toàn hơn — điểm tau-banking và Terminal-Bench 4.0 của Muse Spark 1.2 là tín hiệu rõ nhất trên cả hai bảng, và chúng chỉ ra xa rời công việc agentic.
Và hãy lưu ý Muse Spark 1.2 không phải là gì: một thế hệ mới. Đây là checkpoint hiện tại của Meta thuộc một dòng mô hình đã có, một bản thay thế trực tiếp cho 1.1 với mức giá không đổi, khiến quyết định nâng cấp trở nên miễn phí và việc so sánh với GPT-6 Sol là một câu hỏi riêng. Ở phía ngược lại, GPT-6 Sol đã bị GPT-6.1 Sol thay thế với mức giá ngữ cảnh ngắn y hệt, còn đầu vào được lưu đệm giảm một nửa từ $0.20 xuống $0.10, và trang mô hình của chính OpenAI giờ đây cũng hướng người đọc đến nó. Nếu lý do bạn cân nhắc Sol thay vì Muse Spark là bản tích hợp tám ngày tuổi, thì điều đó vẫn đúng. Còn nếu là về năng lực, hãy kiểm tra mô hình kế nhiệm trước.
So sánh trong bài viết này2
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
