Thẻ tiêu đề Muse Glimmer: Mô hình agent mã nguồn mở 30B của Meta dành cho GPU cục bộ, với các chip ghi Apache 2.0, chạy được trên GPU 24-32 GB, và được chưng cất từ Muse Spark 1.2.
Guides & Insights

Muse Glimmer: Mô hình Agent trọng số mở 30B của Meta tuyên bố đánh bại Gemma4-31B và Qwen3.6-27B

Tác giả

Rowan Sterling

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Một bài đăng trên X vào sáng ngày 10 tháng 8 năm 2026 đã nói điều đó thẳng thắn hơn bất kỳ thông cáo báo chí nào: “Holy meta đã trở lại.” Bản phát hành mà bài đăng đó phản hồi — Muse Glimmer, mô hình open-weight đầu tiên của Meta kể từ Llama 4 — ra mắt cùng ngày, và thông báo của chính Meta cũng quyết liệt không kém bài tweet. Bảng benchmark của mô hình 30 tỷ tham số này tuyên bố nó vượt qua Gemma4-31B của Go​ogle trên 19/24 hàng và Qwen3.6-27B của Alibaba trên 14/24, nổi bật là benchmark tác tử MCP-Atlas, nơi Meta báo cáo 75,5 so với lần lượt 54,2 và 62,5.

Trước khi "smoked" trở thành một sự thật trong đầu bạn, hãy lưu ý ai đã tạo ra những con số đó. Mọi điểm số trong bảng của Meta đều do chính Meta chạy, đối đầu với các mô hình đối thủ mà chính Meta cũng thừa nhận là chưa được tinh chỉnh. Muse Glimmer vẫn chưa có mục nào trên Artificial Analysis, bảng xếp hạng độc lập theo dõi chính xác phân khúc kích thước này — nơi Qwen3.6-27B hiện đang giữ Chỉ số Trí tuệ (Intelligence Index) là 46 và Gemma4-31B đứng ở mức 39. Vì vậy, đây đồng thời là hai câu chuyện: một bản phát hành open-weight thực sự quan trọng từ Meta, và một tuyên bố benchmark sẽ cần nhiều tuần để xác minh. Bài viết này giữ chúng tách biệt.

Muse Glimmer thực chất là gì

Muse Glimmer là mô hình đa phương thức dense 30B — nhận đầu vào văn bản và hình ảnh thông qua bộ mã hóa tri giác chuyên dụng — được huấn luyện trên hơn 100 ngôn ngữ và phát hành theo giấy phép Apache 2.0 cởi mở. Trọng số của mô hình nằm trên Hugging Face tại meta-models/Muse-Glimmer-30B. Đây là phiên bản chưng cất từ mô hình chủ lực độc quyền lớn hơn của Meta, Muse Spark 1.2, và quy trình huấn luyện cho thấy rõ điều đó: chưng cất logit từ mô hình giáo viên trong giai đoạn tiền huấn luyện, huấn luyện giữa kỳ trên dữ liệu ngữ cảnh dài và thiên về tác nhân, sau đó là tinh chỉnh có giám sát kết hợp với chưng cất on-policy và học tăng cường.

{{1}}Bản tóm tắt sản phẩm cụ thể như chính công nghệ vậy.{{/1}} {{2}}Meta xây dựng Glimmer cho{{/2}} {{3}}"quy trình tác nhân cục bộ luôn hoạt động"{{/3}} — {{4}}một tác nhân sống trên máy của bạn và có thể gọi công cụ, tuân theo kế hoạch nhiều bước, tự phục hồi khi lệnh gọi công cụ thất bại thay vì dừng lại, và điều chỉnh mức độ suy luận lên hoặc xuống.{{/4}} {{5}}Các tác vụ được nhắm đến là những việc kém hào nhoáng:{{/5}} {{6}}lập trình cục bộ,{{/6}} {{7}}gọi hàm,{{/7}} {{8}}quản lý lịch trình,{{/8}} {{9}}tổ chức tệp tin,{{/9}} {{10}}đánh giá dùng LLM làm giám khảo.{{/10}} {{11}}Nó tương thích với các khung điều phối tác nhân như OpenClaw,{{/11}} {{12}}đây là cách mà nhiều người sẽ thực sự vận hành nó.{{/12}}

Câu chuyện phần cứng là nửa còn lại của lời chào hàng. Ở độ chính xác đầy đủ, mô hình 30B cần hơn 55GB bộ nhớ; lượng tử hóa ~4-bit của Meta đưa con số đó xuống khoảng 17–20GB, vừa với card tiêu dùng 24GB hoặc 32GB (RTX 5090 là chuẩn tham chiếu) và các máy Mac cao cấp với bộ nhớ hợp nhất. Một bộ dự thảo giải mã suy đoán — mô hình đồng hành nhỏ mà Meta gọi là DFlash — tăng tốc độ sinh văn bản: Meta báo cáo khoảng 3,1 lần trên RTX 5090 (từ 74,9 lên 233 token/giây trong llama.cpp), 1,8 lần trên M5 Max và 1,5 lần trên M4 Max, nơi bộ nhớ hợp nhất vốn đã ít bị giới hạn băng thông hơn.

Vì sao bản phát hành này quan trọng vượt xa bảng thông số kỹ thuật

Bài tweet đó đã nắm đúng hình hài của vấn đề. Kể từ Llama 4 vào mùa xuân năm 2025, Meta đã im lặng về trọng số mở, rút lui vào một dòng sản phẩm tiên phong độc quyền dưới Meta Superintelligence Labs và Giám đốc AI Alexandr Wang. Muse Glimmer là sự trở lại công khai với chiến lược trọng số mở đã giúp Llama trở thành dòng mô hình AI được tải về nhiều nhất — và nó ra mắt đi kèm tín hiệu rõ ràng nhất về tham vọng: Zuckerberg đã xuất bản một bài luận dài 14 trang, "Tương lai dành cho mọi người", cùng với sự ra mắt, lập luận rằng rủi ro AI thực sự là sự kiểm soát tập trung và trọng số mở chính là cách nước Mỹ duy trì khả năng cạnh tranh với các phòng thí nghiệm mô hình mở của Trung Quốc. Ông kêu gọi Mỹ nới lỏng quy định đối với AI nguồn mở, và Meta đã công bố "Quỹ Tương lai dành cho mọi người" trị giá 1 tỷ đô la. Meta cũng cho biết họ dự định phát hành trọng số của Muse Spark 1.2, mô hình lớn hơn nhiều, "trong vài tuần tới."

Bối cảnh đó thay đổi cách bạn nên đọc bảng điểm chuẩn. Đây không phải là một thứ gây tò mò của phòng thí nghiệm nghiên cứu được phát hành lặng lẽ; đây là một tuyên bố chiến lược đi kèm với một mô hình. Glimmer là vị trí 'tác tử cục bộ giá rẻ' trong đội hình của Meta, cố tình phá vỡ lập luận rằng công việc tác tử nghiêm túc đòi hỏi một API đám mây. Liệu nó có thực sự đáp ứng được điều đó hay không chính là điều mà câu hỏi xác minh hướng tới.

Three-way scoreboard comparing Muse Glimmer, Gemma4-31B and Qwen3.6-27B: MCP-Atlas 75.5/54.2/62.5, DeepSearch QA 74.6/61.7/71.1, GAIA2 43.3/36.4/40.0, SWE-Bench Pro 51.2/36.9/50.2, TerminalBench 2.1 51.7/--/60.7, and AA Intelligence Index --/39/46. Footer: rows 1-5 vendor-reported by Meta; AA Index per Artificial Analysis (no Muse Glimmer entry yet).

Tuyên bố "hun khói", từng hàng một

Bảng của Meta so sánh Muse Glimmer với Gemma4-31B và Qwen3.6-27B trên 24 hàng benchmark. Ở những hạng mục được tuyên bố thắng lớn nhất, xu hướng nhất quán là: khả năng lý luận tác tử tổng quát và tìm kiếm.

• MCP-Atlas (sử dụng công cụ agentic) — Muse Glimmer 75.5, Gemma4-31B 54.2, Qwen3.6-27B 62.5. Đây là hàng tiêu đề và khoảng cách chênh lệch lớn nhất trong tập hợp.

• DeepSearch QA — 74.6 so với 61.7 và 71.1.

• GAIA2 (trợ lý tổng hợp) — 43.3 so với 36.4 và 40.0.

• WildClawBench (bộ công cụ agentic) — 47.6 so với 37.6 và 43.2.

• SWE-Bench Pro — 51.2 so với 36.9 và 50.2. Lưu ý số thứ ba: 50.2 là kết quả đo của chính Meta đối với Qwen3.6-27B, trong khi con số do chính Alibaba công bố là 53.5. Cùng một mô hình, hai điểm số khác nhau tùy thuộc vào ai chạy nó.

• AIME 2026 — 94.7, IFBench 77.0, và AA-LCR 80.0 so với 68.3 của Ge​mma.

Đó là một hàng đáng nể. Nhưng bảng này không phải là một cuộc quét sạch, và những hàng mà Muse Glimmer thua cũng giàu thông tin như những hàng nó thắng. Qwen3.6-27B giữ vững lợi thế trong các tác vụ sử dụng máy tính thực hành và công việc nặng về terminal: SWE-Bench Verified 77.2 so với 76.0 của Glimmer, OSWorld-Verified 75.6 so với 65.9, và TerminalBench 2.1 60.7 so với 51.7, cộng thêm lợi thế nhất quán trong các bài kiểm tra đa phương thức như ScreenSpot Pro, OmniDocBench và MMMU-Pro. Về phần mình, Gemma4-31B ghi nhận hồ sơ an toàn tốt hơn trên hai chỉ số mà Meta báo cáo — tỷ lệ vi phạm thấp nhất trên CI Memories và tỷ lệ tấn công thành công thấp nhất trên Siren AgentDojo — đồng thời nhỉnh hơn ở các bài kiểm tra suy luận hẹp (GPQA Diamond, Humanity's Last Exam).

Đọc thẳng ra, tuyên bố của Meta là “vượt hai mô hình còn lại trên hầu hết các benchmark tác nhân”, và trên bảng kết quả của chính họ thì điều đó gần như đúng. Điểm mấu chốt nằm ở các lưu ý. Meta đã tự mình chạy từng hàng dữ liệu và thừa nhận rằng các thiết lập thử nghiệm cho các mô hình đối thủ không được tinh chỉnh như cách dành cho mô hình của mình. Đó không phải là một cáo buộc gian lận — việc các thiết lập của đối thủ không được tinh chỉnh là một lỗi thường gặp, thậm chí được xem là chuyện hiển nhiên trong ngành này — nhưng đó chính là lý do vì sao các bảng kết quả do nhà cung cấp tự chạy cần được xác nhận một cách độc lập. Sự chênh lệch nói trên của Q​wen trong SWE-Bench Pro chính là toàn bộ vấn đề ở dạng thu nhỏ.

Bảng điểm độc lập nói gì

Artificial Analysis chưa liệt kê Muse Glimmer — mô hình này mới chỉ ra mắt được vài ngày, và chỉ số của AA được xây dựng từ các lần chạy của chính họ, vốn cần thời gian. Nhưng AA có theo dõi cả hai đối thủ, điều này cho bạn thấy bối cảnh được đo lường mà tân binh này tuyên bố sẽ gia nhập. Tính đến chỉ số hiện tại, Qwen3.6-27B đạt Intelligence Index 46, được AA mô tả là mô hình trọng số mở thông minh nhất dưới 150B tham số; Gemma4-31B đứng ở mức 39. Đó là những con số độc lập, không phải tuyên bố của nhà cung cấp.

Bức tranh độc lập cũng cho thấy một rắc rối về chi phí mà các con số chính đang che giấu. Dữ liệu hiệu suất của AA cho thấy Qwen3.6-27B tạo ra khoảng 54,6 token/giây so với 34,8 của Gemma4-31B, với thời gian đến token đầu tiên của Ge​mma nhanh hơn — nhưng Q​wen dùng lượng token đầu ra nhiều gấp khoảng 3,7 lần để chạy toàn bộ chỉ mục, khiến chi phí đánh giá đầu cuối đắt hơn khoảng 21 lần. Các mô hình ngốn token đắt hơn trong thực tế ngay cả khi điểm benchmark của chúng tốt hơn, và đó là một yếu tố đầu vào cho quyết định mà không bảng số liệu nào của nhà cung cấp tự nguyện tiết lộ.

Nói thẳng về tình hình thế giới tại thời điểm viết bài này: một kết quả mạnh do nhà cung cấp báo cáo, chưa có bất kỳ kết quả độc lập nào cho Muse Glimmer, và một nhóm đối thủ cạnh tranh được đo lường độc lập và phân theo từng tác vụ. "Đè bẹp Ge​mma và Q​wen" là một tuyên bố đáng tin cậy; nó chưa phải là một kết quả đã được xác minh. Các mốc xác minh cần theo dõi là một mục trong chỉ số AA, Elo LMArena và các bản tái lập của cộng đồng — tất cả thường xuất hiện trong vòng vài tuần sau một bản phát hành như thế này.

Screenshot of Artificial Analysis' Small Open Source Models comparison page, showing the 4B-40B open-weight class with Openness and Intelligence index columns and the header noting that Qwen3.6-27B and Qwen3.5-27B are the highest-intelligence small open-source models.

Chi phí thực sự để vận hành

Muse Glimmer hoàn toàn miễn phí — Apache 2.0, không thu phí theo token, không phải trả tiền cho Meta. Chi phí nằm ở phần cứng bạn dùng để chạy nó. Một mô hình 30B ở định dạng 4-bit cần khoảng 17–20GB bộ nhớ thường trú, cộng thêm chỗ cho KV cache, bộ mã hóa tri giác và DFlash drafter, đó là lý do vì sao hướng dẫn của chính Meta là một card đồ họa 24GB hoặc 32GB, hoặc một chiếc Mac cao cấp. Nếu bạn đã sở hữu phần cứng đó, chi phí biên để vận hành một tác tử cục bộ luôn bật gần như chỉ là tiền điện. Còn nếu chưa có, một GPU 24GB hoặc một chiếc Mac dòng M cấu hình tối đa là một khoản chi thực sự — và kể từ ngày 9 tháng 8 đã có lựa chọn thứ ba: thuê nó. Các danh mục API lưu trữ đầu tiên, hoạt động kể từ ngày đó, định giá Muse Glimmer ở mức 0,35 USD cho mỗi triệu token đầu vào và 1,50 USD cho mỗi triệu token đầu ra trên ngữ cảnh 131K. Đây là mức giá thị trường do nhà cung cấp niêm yết chứ không phải giá của Meta, nhưng đó là con số bạn thực sự có thể trả hôm nay nếu bạn không muốn mua phần cứng.

Đó là phép so sánh đáng được thực hiện một cách cẩn thận, bởi vì "trọng số mở, giá bằng không" chạm trán "API lưu trữ, giá theo token" trong những điều kiện rất khác nhau. Khi bạn chạy các con số, hãy định giá cả hai phía một cách trung thực. Về phía chúng tôi tại OrcaRouter, mức giá bạn thấy cho bất kỳ mô hình nào trong số hơn 200 mô hình lưu trữ là giá niêm yết của nhà cung cấp được chuyển thẳng qua với tỷ lệ tăng giá 0%, vì vậy việc giảm giá từ nhà cung cấp có hiệu lực ngay trong ngày thay vì sau khi tính toán lại biên lợi nhuận — điều này khiến việc so sánh giữa cục bộ và lưu trữ trở nên minh bạch. Bản thân Muse Glimmer vẫn chưa phải là một trong số hơn 200 mô hình đó, nên cơ chế chuyển giá này hôm nay không áp dụng cho nó. Nhưng kỷ luật này mới là điểm mấu chốt: cách định giá một mô hình trọng số mở chưa được kiểm chứng là lưu lượng truy cập của chính bạn, chứ không phải bảng giá của nhà cung cấp, và routing DSL tồn tại để chạy chính xác phép so sánh đó khi một mô hình nằm phía sau một API mà bạn có thể gọi.

Cách bạn thực sự sẽ dùng nó trong tuần này

Vì được phát hành dưới dạng trọng số mở, {{1}}"truy cập" không phải là đăng ký — mà là tải xuống{{/1}}. Kho lưu trữ gốc là {{2}}meta-models/Muse-Glimmer-30B{{/2}} trên {{3}}Hugging Face{{/3}}, với biến thể {{4}}GGUF{{/4}} đã được công bố và các biến thể lượng tử hóa đang đến từ các bên thứ ba. Hỗ trợ runtime vào ngày đầu ra mắt gồm {{5}}llama.cpp, MLX và ExecuTorch{{/5}}, với các tích hợp {{6}}Ollama, LM Studio, vLLM và SGLang{{/6}} được bổ sung trong những ngày sau khi phát hành, cùng các công việc tối ưu hóa phần cứng được liệt kê cho {{7}}AMD, Arm, Dell, Intel và Nvidia{{/7}}. Con đường thực tế cho hầu hết mọi người là: tải {{8}}GGUF{{/8}}, nạp nó vào {{9}}llama.cpp{{/9}} hoặc một trình chạy cục bộ, rồi trỏ khung tác nhân vào đó. Meta không lưu trữ API công khai nào cho chính Glimmer, và con đường cục bộ là con đường mà mô hình được xây dựng quanh — nhưng con đường lưu trữ không còn là giả thuyết nữa: các nền tảng bên thứ ba đã bắt đầu phục vụ nó từ ngày {{10}}9 tháng 8{{/10}}, vì vậy "tải xuống và chạy" lẫn "gọi API" đều là những tùy chọn khả dụng ngay bây giờ.

Một lưu ý thành thật cụ thể về chúng tôi: Muse Glimmer vẫn chưa có sẵn thông qua OrcaRouter. Chúng tôi định tuyến các API được lưu trữ, và tính đến bản cập nhật này, mô hình vẫn chưa nằm trong danh mục của chúng tôi — thỏa thuận chênh lệch 0% và một khóa cho mọi thứ áp dụng cho hơn 200 mô hình mà chúng tôi định tuyến, và đây vẫn chưa phải là một trong số đó. Khi nó có mặt, cùng một khóa truy cập đến phần còn lại của danh mục cũng sẽ truy cập được nó mà không cần hợp đồng mới, và cơ chế chuyển đổi dự phòng tự động là thứ giúp an toàn khi hướng lưu lượng thực đến một mô hình hoàn toàn mới do nhà cung cấp công bố trước khi mô hình đó có thành tích hoạt động độc lập. Đó cũng chính là lý do DSL định tuyến tồn tại: một mô hình chưa được kiểm chứng phải tự giành được đường vào sản xuất dựa trên dữ liệu của bạn, chứ không phải dựa vào thông cáo báo chí của chính nó.

Ảnh chụp màn hình bên dưới là thẻ Hugging Face như đã hiển thị vào ngày phát hành — dòng chữ "không được triển khai bởi bất kỳ nhà cung cấp suy luận nào" đề cập đến dịch vụ suy luận nội bộ của chính Hugging Face, một thứ khác biệt với các danh sách API được lưu trữ bởi bên thứ ba đã chính thức hoạt động vào ngày 9 tháng 8.

Screenshot of the Hugging Face model card for meta-models/Muse-Glimmer-30B, showing the Apache 2.0 license, 30B parameter size, Meta Superintelligence Lab authorship, and the line that the model is not deployed by any inference provider.

Xem gì

Ba điều sẽ quyết định câu chuyện này, theo thứ tự tốc độ. Thứ nhất, {{1}}bản phát hành open-weights Muse Spark 1.2 như đã cam kết — nếu mô hình giáo viên ra mắt trong "những tuần tới", Glimmer không còn là sản phẩm một lần mà trở thành khởi đầu của một dòng open-weights hoàn chỉnh, và đó là cách đọc chiến lược thực sự cho việc "Meta đã trở lại".{{/1}} Thứ hai, {{2}}đo lường độc lập: một mục trong bảng xếp hạng Artificial Analysis, thứ hạng trên LMArena và các bản tái hiện từ cộng đồng sẽ cho bạn biết liệu tuyên bố 19/24 có trụ vững khi được kiểm chứng bởi người không thuộc Meta hay không.{{/2}} Thứ ba, {{3}}làn sóng lưu trữ — làn sóng đó đã bắt đầu. Các nhà cung cấp bắt đầu phục vụ Glimmer từ ngày 9 tháng 8, vì vậy câu hỏi chạy cục bộ hay qua dịch vụ lưu trữ giờ là lựa chọn thực tế mà bạn có thể thực hiện chỉ với một khóa API; điều còn lại cần theo dõi là phạm vi lưu trữ sẽ mở rộng đến đâu và giá mỗi token sẽ biến động ra sao khi sự mới lạ của tuần phát hành qua đi.{{/3}}

Bài tweet đã đúng về tin tức. Liệu nó có đúng về kết luận hay không — đó là một câu hỏi kéo dài nhiều tuần, và quan điểm trung thực lúc này là chưa ai ngoài Meta chạy đủ để biết. Điều đã chắc chắn là một mô hình agent 30B theo Apache-2.0, chạy vừa trên GPU tiêu dùng và được hậu thuẫn bởi một chiến dịch chiến lược toàn diện, là một bản phát hành đáng để lên kế hoạch, dù điểm số độc lập cuối cùng của nó có ra sao.

Những câu hỏi thực sự đáng trả lời

Muse Glimmer có thực sự là mã nguồn mở không?

Nó là bản trọng số mở theo giấy phép Apache 2.0 cho phép — bất kỳ ai cũng có thể tải về, sửa đổi, tinh chỉnh và triển khai thương mại mà không phải trả phí cho Meta. Cách diễn đạt cẩn trọng là "trọng số mở" thay vì mã nguồn mở hoàn toàn theo định nghĩa của OSI, vì dữ liệu huấn luyện, trọng số của mô hình giáo viên Muse Spark và một số công cụ không nằm trong gói phát hành. Về mặt thực tiễn — bạn có thể chạy nó, phát hành nó và bán sản phẩm dựa trên nó — đây cũng chính là điều đã đưa Llama trở thành gia đình mô hình mở được triển khai rộng rãi nhất trong lĩnh vực AI.

Muse Glimmer có thực sự vượt trội hơn Gemma4-31B và Qwen3.6-27B không?

Trên bảng xếp hạng của chính Meta: có, trên hầu hết các benchmark về tác nhân AI và tìm kiếm, kèm lưu ý rằng Meta tự chạy phép so sánh và không tinh chỉnh cấu hình của các đối thủ. Bức tranh trung thực thì cụ thể hơn: Meta thắng các hạng mục suy luận tác nhân, Qwen3.6-27B thắng ở mảng sử dụng máy tính trực tiếp và làm việc trên terminal cùng hầu hết các bài kiểm tra đa phương thức, còn Gemma4-31B có hồ sơ an toàn tốt hơn. Tính đến ngày phát hành, hoàn toàn không có mục chỉ mục độc lập nào cho Muse Glimmer, vì vậy hãy coi tuyên bố 19/24 là số liệu do nhà cung cấp tự báo cáo cho đến khi có bên khác chạy thử nghiệm.

Tôi có thể chạy nó trên máy tính xách tay không?

Chỉ khi "laptop" có nghĩa là một chiếc máy có GPU rời 24GB hoặc 32GB, hoặc một chiếc Mac dòng M cao cấp với đủ bộ nhớ hợp nhất — một Muse Glimmer 4-bit cần khoảng 17–20GB cộng thêm khoảng trống cho KV cache, bộ mã hóa nhận thức và bộ dự thảo DFlash. Đó là một khoản đầu tư thực sự đối với hầu hết mọi người, và đó là chi phí ẩn bên trong một mô hình "miễn phí". Với đồ họa tích hợp hoặc một chiếc máy 16GB, bạn sẽ phải đối mặt với lượng tử hóa mạnh và tốc độ xuất ra chậm thay vì tác nhân luôn hoạt động mà bản phát hành được xây dựng xoay quanh.

Tôi lấy nó ở đâu — nó có trên API không?

Các trọng số nằm trên Hugging Face tại {{1}}meta-models/Muse-Glimmer-30B{{/1}} (có cả biến thể GGUF), và bạn chạy nó cục bộ qua llama.cpp, MLX, ExecuTorch, hoặc các trình chạy cục bộ hiện đang tích hợp nó. Quyền truy cập API lưu trữ cũng đã có hiệu lực, kể từ ngày 9 tháng 8, thông qua các nền tảng bên thứ ba với {{2}}mức giá niêm yết $0.35 cho mỗi triệu token đầu vào và $1.50 cho mỗi triệu token đầu ra{{/2}} — vì vậy bạn không còn cần sở hữu GPU 24GB để gọi nó nữa. Bản thân Meta vẫn chưa cung cấp API công khai nào cho Glimmer, và nó cũng chưa xuất hiện trên OrcaRouter. Khi nó có mặt trong danh mục của chúng tôi, cùng một khóa truy cập đến phần còn lại của danh mục sẽ truy cập được nó; cho đến lúc đó, hai con đường chính đáng là suy luận cục bộ hoặc một nền tảng lưu trữ bên thứ ba.

© 2026 OrcaRouter

Dành cho nhà cung cấp

Bạn vận hành nền tảng suy luận? Đưa mô hình của bạn lên OrcaRouter.

Liên hệ với chúng tôi

Tham gia cộng đồng

DiscordEmailXGitHubYouTube