Thẻ tiêu đề anh hùng cho video giải thích ra mắt Ornith-1.5, với tiêu đề 'Ornith-1.5 — Open Weights, Self-Improving', phụ đề 'Một dòng mô hình tự viết chương trình huấn luyện cho riêng mình — 397B MoE · 35B-A3B · 9B', cùng ba chip mô hình được liên kết bằng mũi tên vòng lặp tròn biểu thị chu kỳ tự cải thiện, với logo OrcaRouter được ghép ở góc.
Guides & Insights

Ornith-1.5: Dòng mô hình trọng số mở tự viết giáo trình huấn luyện của riêng mình — và tuyên bố đánh bại Claude Opus 4.8

Tác giả

Rowan Sterling

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Ornith-1.5, bộ mô hình open-weight từ Ornith AI tuyên bố đánh bại Claude Opus 4.8 trên bốn benchmark, được phát hành vào ngày 19 tháng 8 năm 2026 — và {{1}}điểm đáng dừng lại để xem xét là vòng lặp huấn luyện, chứ không phải số lượng tham số{{/1}}. Bộ ba mô hình gồm: Ornith-1.5-397B, mô hình mixture-of-experts chủ lực với 397 tỷ tham số; Ornith-1.5-35B-A3B, mô hình MoE 35B kích hoạt 3 tỷ tham số cho mỗi token; và Ornith-1.5-9B, mô hình dense 9B với bản build di động đã lượng tử hóa. {{2}}Mọi điểm số nổi bật ở đây đều do nhà cung cấp tự báo cáo{{/2}}: các con số đến từ các lần chạy đánh giá của chính Ornith AI, lấy trung bình của năm lần, và công cụ theo dõi bên thứ ba duy nhất có hồ sơ — BenchLM — {{3}}gắn nhãn toàn bộ 18 hàng benchmark của mình là do nhà cung cấp báo cáo và không xếp hạng bộ mô hình này cho đến khi có những đánh giá độc lập{{/3}}. Dưới đây là những gì thực sự được phát hành, "tự cải thiện" thực sự nghĩa là gì, và những gì bạn có thể chạy ngay hôm nay.

Đã phát hành: ba tỷ lệ, giấy phép MIT, không có API

Ornith AI — nhóm đứng sau mô hình trọng số mở Ornith-1.0 và gắn liền với công trình DeepReinforce về các hệ thống đa tác tử lập trình cạnh tranh (GrandCode) cũng như tối ưu hóa nhân GPU (CUDA-L2) — đã công bố bộ mô hình trên Hugging Face dưới giấy phép MIT, kèm theo các bản lượng tử hóa FP8, GGUF, MLX và NVFP4 cùng với các checkpoint thô. Cửa sổ ngữ cảnh 256K (262.144 token) được áp dụng cho toàn bộ bộ mô hình. Không có API lưu trữ từ đơn vị phát hành và không có giá token; đây là bản phát hành tự lưu trữ hoặc chạy cục bộ, và báo cáo ra mắt nói rõ điều đó.

Ba thang đo hướng tới ba thực tại khác nhau:

• {{1}}Ornith-1.5-397B — "nỗ lực biên giới mở"{{/1}}: mô hình MoE 397B nhắm đến biên giới đóng trên các tác vụ tác nhân và lập trình.

Ornith-1.5-35B-A3B — một MoE 35B chỉ kích hoạt 3B tham số cho mỗi token, là lựa chọn trung gian: năng lực gần flagship với chi phí suy luận mỗi token chỉ bằng một phần nhỏ so với mô hình dense 35B.

• Ornith-1.5-9B — mô hình dense 9B cho sử dụng cục bộ và trên thiết bị, cùng với bản dựng Ornith-1.5-9B-Mobile đã lượng tử hóa mà nhà cung cấp cho biết sẵn sàng triển khai trên iPhone và Android.

A screenshot of the Ornith AI launch page for Ornith-1.5, titled 'Ornith-1.5: From Self-Scaffolding to Self-Improvement', showing the three model scales 397b-moe, 35b-moe and 9b-dense and the opening paragraph describing the end-to-end self-improvement loop.

Trang ra mắt ở trên là toàn bộ thông báo: một báo cáo kỹ thuật thay vì một bài đăng tiếp thị, điều này phù hợp với hình ảnh của phòng thí nghiệm.

Lời khẳng định về sự tự hoàn thiện, được giải mã

Ornith-1.0, phát hành vào tháng 6 năm 2026, đã dạy một mô hình tạo ra khung xương xung quanh các tác vụ lập trình — gồm phần kết nối, phần phân rã và phần điều phối. Ornith-1.5 mở rộng vòng lặp đó sang chính việc tạo tác vụ. Trong quá trình huấn luyện, mô hình hiện thực hiện ba việc:

• Đề xuất các nhiệm vụ huấn luyện mới, khó hơn.

• Tạo khung chuyên dụng cho từng tác vụ để giải và đánh giá các tác vụ đó.

Tạo ra các rollout giải pháp trở thành dữ liệu huấn luyện cho vòng tiếp theo của nó.

{{1}}Phần thưởng chảy qua cả ba giai đoạn, được tối ưu hóa chung với GRPO.{{/1}} {{2}}Mỗi nhiệm vụ đề xuất được chấm điểm về tính hợp lệ{{/2}} (phải thực thi được và xác minh được), {{3}}độ khó tiên phong{{/3}} (tỷ lệ thành công mục tiêu được đặt ở mức 0,2 — những nhiệm vụ mô hình thường thất bại nhưng vẫn có thể học hỏi từ đó), và {{4}}tính mới{{/4}} (sự đa dạng so với mọi thứ đã thấy trước đây). {{5}}Khung scaffold nhận phần thưởng riêng cho sự liên kết, độ trung thực của phần thưởng và khả năng chống hack phần thưởng{{/5}}, và đường ống xử lý bao gồm các biện pháp bảo vệ chống hack: {{6}}hạn chế can thiệp vào môi trường kiểm thử{{/6}}, {{7}}giám sát truy cập vào đường dẫn bị giới hạn{{/7}}, và một {{8}}mô hình phân xử đóng băng{{/8}} để {{9}}ghi đè các kết quả bất thường{{/9}}.

Điểm cảnh báo quan trọng nằm ở từ "tự cải thiện": nó mô tả quy trình huấn luyện, chứ không phải sản phẩm tạo ra. Mô hình được tải về không tự huấn luyện lại trên máy tính của bạn. Thứ bạn nhận được là một mô hình có dữ liệu huấn luyện, một cách khác thường, được tạo ra bởi các phiên bản trước của chính nó — đây chính là loại tuyên bố đáng để kiểm chứng trước khi nó trở thành giáo điều.

Các tuyên bố về điểm chuẩn, được ghi nhãn một cách trung thực.

Tất cả các con số trong phần này là của riêng Ornith AI, từ báo cáo ra mắt, được tính trung bình qua năm lần chạy, và không được tái tạo một cách độc lập. Bốn chiến thắng được tuyên bố của sản phẩm chủ lực trước Claude Opus 4.8:

• Terminal-Bench 2.1 (bộ đánh giá Terminus-2): Ornith-1.5-397B 86.1 so với Claude Opus 4.8 85.0

• SWE-bench Verified: 86.0 so với 85.8

• WideSearch: 80.8 so với 72.9

• BrowseComp: 86.6 so với 84.3

Hãy đọc những con số đó như tuyên bố của nhà cung cấp, không phải sự thật. Điểm chuẩn chủ lực duy nhất mà Ornith AI không tuyên bố giành chiến thắng là DeepSWE, với 56.0 so với 59.0 của Claude Opus 4.8 — báo cáo mô tả đây là "ngang hàng," vốn là cách trung thực để đọc một thất bại. Các số liệu chủ lực khác từ cùng báo cáo: HLE 44.6 khi không dùng công cụ và 56.1 khi dùng công cụ, GPQA Diamond 92.8, và SWE-bench Pro 65.1.

Hai mô hình nhỏ hơn cũng rất mạnh trên giấy: Ornith-1.5-35B-A3B đạt 79.0 trên SWE-bench Verified và 68.5 trên Terminal-Bench 2.1 (bộ khung Claude Code), trong khi Ornith-1.5-9B đạt 70.6 trên SWE-bench Verified và 47.0 trên Terminal-Bench 2.1. So với các mô hình open-weights khác trong cùng báo cáo, Ornith AI so sánh mô hình 397B (86.1 Terminal-Bench / 56.0 DeepSWE) với DeepSeek-V4-Flash-0731 (82.7 / 54.4) và GLM-5.2 (81.0 / 46.2).

A single-column scoreboard for Ornith-1.5-397B listing: Size 397B MoE (open weights), Context 262K tokens, Terminal-Bench 2.1 86.1 (vendor), SWE-bench Verified 86.0 (vendor), License MIT, API none — self-hosted, with a footer noting all figures are vendor-reported and no independent scores yet exist.

Bảng điểm độc lập duy nhất — và lý do vì sao nó vẫn chỉ mang tính tạm thời

Hồ sơ của BenchLM về Ornith-1.5-397B hiện là trang bên thứ ba duy nhất cho mô hình này. Tiêu đề của nó: điểm công khai 68,5/100, xếp hạng #20 trong số 221, với Agentic là hạng mục mạnh nhất ở vị trí #13. Nhưng hãy đọc phần chữ in nhỏ, vì nó đang thực sự làm việc — tất cả 18 hàng benchmark đều được đánh dấu là do nhà cung cấp báo cáo, và hồ sơ nêu rõ mô hình "chưa có đủ độ phủ từ các nguồn để có vị trí đã xác minh." Vị trí chưa được xếp hạng trong danh sách đã xác minh không phải là phán quyết chống lại mô hình; đó là tuyên bố rằng chưa ai chạy thử nó một cách độc lập, đây chính xác là điều bạn có thể mong đợi ở một bản phát hành mới ra mắt vài ngày.

A screenshot of the BenchLM profile for Ornith-1.5-397B, showing the release date of August 18 2026, a score of 68.5 out of 100 and rank #20 of 221, with Agentic ranked #13, and a note that the profile lacks enough sourced coverage for a verified position.

Đó chính là khoảng chênh lệch giữa hai con số trong bài viết này: điểm Terminal-Bench 86.1 của nhà cung cấp là một tuyên bố, còn điểm 68.5 của BenchLM là một con số được xây dựng hoàn toàn từ các dòng dữ liệu do nhà cung cấp báo cáo. Cả hai đều không phải là phép đo độc lập. Phòng thí nghiệm đầu tiên đưa Ornith-1.5-397B chạy qua một bộ khung đánh giá công khai — SWE-bench Verified trên một tập hợp được kiểm soát, Terminal-Bench trên một phiên bản khung cố định — sẽ cho ra con số đầu tiên thực sự có ý nghĩa.

Những gì bạn thực sự có thể chạy ngay hôm nay

Đây là bản phát hành trọng số mở, vì vậy "chạy nó" có nghĩa là tải các trọng số về. Danh mục Ollama đã liệt kê ornith-1.5:9b (bản dựng ~6,6 GB) và ornith-1.5:35b (bản dựng ~23 GB), cả hai đều có ngữ cảnh 256K; bản dựng 9B cũng hỗ trợ đầu vào hình ảnh trong mục danh mục. Bản 397B lại thuộc một loại vấn đề khác: một MoE có 397B tham số không phải là mẫu dành cho máy tính xách tay, và bất kỳ triển khai nghiêm túc nào cũng cần nhiều GPU và sự điều phối thực sự.

{{1}}Điểm tối ưu thực tế cho hầu hết các nhóm là Ornith-1.5-35B-A3B{{/1}}: {{2}}3 tỷ tham số hoạt động mỗi token mang lại khả năng của MoE với chi phí chỉ bằng một phần nhỏ so với chi phí mỗi token của mô hình dense 35B{{/2}}, và {{3}}bản dựng Ollama 23 GB chạy được trên một card VRAM cao hoặc một cụm nhỏ{{/3}}. {{4}}Bản 9B là bản bạn cài trên điện thoại{{/4}}.

Đặc tính "3B active" đó cũng chính là nơi tính kinh tế của định tuyến trở nên thú vị. MoE có tham số hoạt động được định giá thấp hơn nhiều so với tổng quy mô của chúng, và khi các nhà cung cấp áp dụng một mô hình như thế này, giá mỗi token thường giảm nhanh — đây là trường hợp khi mua qua một bộ định tuyến chuyển tiếp giá niêm yết của nhà cung cấp với mức chênh lệch 0%, thay vì phải đàm phán một lần với một nhà cung cấp duy nhất. OrcaRouter thực hiện chính xác điều đó với hơn 200 mô hình, vì vậy khi nhà cung cấp giảm giá một mô hình mở trọng số mới, giá đó sẽ có hiệu lực ở phía chúng tôi ngay trong ngày. Và đối với một mô hình ra mắt chỉ với điểm chuẩn của nhà cung cấp, lập luận về chuyển đổi dự phòng là quan trọng nhất: một lớp định tuyến cho phép bạn trỏ một luồng thử nghiệm vào một mô hình hoàn toàn mới rồi quay lại mô hình đã được kiểm chứng ngay khi nó gặp sự cố — thử nghiệm một bản phát hành chưa được kiểm chứng mà không đặt cược một luồng sản xuất vào nó.

Còn thiếu gì nữa?

• Không có API lưu trữ từ xa. Nếu bạn muốn dùng Ornith-1.5 như một dịch vụ thì hiện tại chưa có; mọi lựa chọn đều là tự lưu trữ hoặc chạy cục bộ.

• Không có đánh giá độc lập. BenchLM khiến dòng mô hình không được xếp hạng; chưa có phòng thí nghiệm nào công bố một bài chạy có kiểm soát.

• Không có mức giá nào để cân nhắc. Không có tỷ lệ token, vì vậy trường hợp "biên giới mở giá rẻ" hoàn toàn phụ thuộc vào kinh tế GPU của chính bạn.

Các harness được trộn lẫn. Terminal-Bench có nhiều biến thể, và các con số của chính báo cáo trải dài trên chúng: 86.1 của 397B nằm trên harness Terminus-2, còn 68.5 của 35B nằm trên harness Claude Code. Các harness khác nhau là những cuộc chơi khác nhau, khiến việc so sánh sòng phẳng trở nên khó hơn so với bảng chính gợi ý.

Xem gì tiếp theo

Câu chuyện bền vững không phải là {{1}}"open model beats Claude Opus 4.8"{{/1}} — đó là một tuyên bố chưa được kiểm chứng mới chỉ một ngày tuổi. Mà là một phòng thí nghiệm đã khép kín vòng lặp với dữ liệu huấn luyện tự sinh và công bố các trọng số để mọi người kiểm định, và đó mới là phần đáng theo dõi. Những điều có thể biến bản phát hành đầy hứa hẹn này thành một bản đáng tin cậy: lần chạy độc lập đầu tiên của mô hình 397B trên {{2}}SWE-bench Verified{{/2}} và một bộ khung {{3}}Terminal-Bench{{/3}} đã được sửa lỗi; mã đánh giá thực sự được phát hành; và một đường dẫn lưu trữ xuất hiện để hồ sơ chi phí của 35B-A3B có thể được đo lường so với các tuyên bố của nó. Nếu các con số được giữ vững, {{4}}Ornith-1.5-35B-A3B{{/4}} sẽ là câu chuyện giá/hiệu năng của các trọng số mở trong quý này. Nếu không, phần trung thực — phương pháp tự cải thiện và các trọng số MIT — vẫn tồn tại trong cả hai trường hợp.

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày

© 2026 OrcaRouter

Dành cho nhà cung cấp

Bạn vận hành nền tảng suy luận? Đưa mô hình của bạn lên OrcaRouter.

providers@orcarouter.ai

Tham gia cộng đồng

Discordsupport@orcarouter.aiXGitHubYouTube