Thẻ tiêu đề cho 'DeepSeek Harness: The Black Whale Surfaces': headline 'DeepSeek Harness', phụ đề 'The Black Whale Surfaces — Những gì chúng ta biết cho đến nay về đối thủ Claude Code của DeepSeek', tagline 'Model + Harness = Agent', chip cho 'DeepSeek V4 Flash' và 'DeepSeek V4 Pro', và chân trang 'Leak / what-we-know-so-far — chưa có gì được phát hành'. Logo OrcaRouter ghép ở góc dưới bên phải.
Guides & Insights

DeepSeek Harness: Cá voi đen lộ diện — Những gì chúng ta biết cho đến nay về đối thủ cạnh tranh Claude Code của DeepSeek

Tác giả

Rowan Sterling

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

D​eepSeek Harness v0.1 đã ra mắt, và bản báo cáo thực địa đầu tiên đáng chú ý đã đến chưa đầy một ngày sau đó. Vào ngày 14 tháng 8, cũng chính tài khoản X từng ấn định thời điểm phát hành — teortaxesTex — mô tả một phiên làm việc trông có vẻ đã chết trong khi thực tế nó đang hoàn tất: luồng token chậm lại "theo cấp số nhân" đến mức gần như đứng yên, giao diện hiển thị 5/9 mục việc đã hoàn thành, và khi tải lại trang thì cả 9 mục đều đã hoàn thành. Giao diện đã hiển thị trạng thái từ khoảng năm mươi phút trước đó. "Đây có phải… điều mà anh gọi là khả năng tổ hợp không-thời gian?" — một lời châm chọc đúng lý, vì framework mà D​eepSeek dùng để xây dựng thứ này thực sự có một lý thuyết về thời gian. Bài viết này ban đầu là một bài theo dấu rò rỉ; dấu vết đã được giải quyết vào ngày 13 tháng 8, khi D​eepSeek phát hành mã nguồn mở của harness. Phần dưới đây là những gì thực sự đã được phát hành, cùng với những gì ngày đầu sử dụng thực tế cho thấy về tầng agent đang được xây dựng quanh DeepSeek V4 Flash 0731DeepSeek V4 Pro.

Cách trình bày trung thực đã thay đổi kể từ khi bài viết này lần đầu được đăng. Khi nó được xuất bản, chưa có thứ gì gọi là "D​eepSeek Harness" được phát hành, và bằng chứng chỉ là một loạt manh mối công khai — một tài khoản WeChat đã được xác thực, các tin tuyển dụng, một chú thích cuối trang về benchmark, một cuộc gọi thử nghiệm nội bộ. Điều đó không còn đúng nữa. Vào tối ngày 13 tháng 8 theo giờ Bắc Kinh, D​eepSeek đã phát hành v0.1 của harness dưới dạng bản xem trước dành cho nhà phát triển, được cấp phép MIT, tại github.com/deepseek-ai/deepseek-harness, có thể chạy chỉ bằng một lệnh npm, và repository đã thu hút hơn 30.000 sao GitHub chỉ trong vài giờ. Vụ rò rỉ đã trở thành một sản phẩm. Điều chưa được xác minh lúc này không phải là harness có tồn tại hay không, mà là cách nó hoạt động trong thực tế — và các báo cáo thực địa ban đầu chính là bằng chứng mới.

Mô hình + Harness = Agent: 'harness' thực chất là gì

{{1}}Công thức mà D​eepSeek sử dụng nội bộ là Model + Harness = Agent.{{/1}} {{2}}Mô hình là bộ não; harness là mọi thứ khác giúp một agent hoạt động trong thực tế — quản lý ngữ cảnh và bộ nhớ, gọi công cụ, lập kế hoạch tác vụ, đọc và ghi tệp, thực thi terminal, đưa phản hồi lỗi trở lại vòng lặp, và đánh giá xem một tác vụ đã thực sự hoàn thành hay chưa.{{/2}}

Thuật ngữ này được phổ biến bởi A​nthropic và trở thành cách ngành công nghiệp lý giải vì sao các tác nhân lập trình không chỉ đơn thuần là một LLM giỏi. Một mô hình đạt điểm cao trên các benchmark vẫn có thể thất bại trong vòng lặp tác nhân nếu bộ máy xung quanh — cách nó gọi công cụ, cách nó nhớ những gì đã làm mười phút trước, cách nó phục hồi khi một lệnh thất bại — yếu kém. D​eepSeek đã biến bộ máy đó thành chiến lược sản phẩm rõ ràng của mình, và đội ngũ Harness chính là bộ phận trong sơ đồ tổ chức đảm nhiệm việc này. Các mô hình bên dưới đã được phát hành: DeepSeek V4 Flash 0731 và DeepSeek V4 Pro đều mang điểm benchmark được tối ưu cho tác nhân mà D​eepSeek tạo ra ngay trong harness của chính mình, cho đến cả cái tên "D​eepSeek Harness minimal mode."

Chuỗi rò rỉ kết thúc vào ngày 13 tháng 8

Đây chưa bao giờ là một vụ rò rỉ đơn lẻ; nó là một chồng những mẩu vụn thông tin công khai tích lũy từ tháng Ba và rồi chốt lại ở một ngày phát hành. Theo thứ tự sơ bộ:

• Tháng 3 năm 2026 — Các báo cáo liên hệ Cui Tianyi (崔添翼), một cử nhân khoa học máy tính của Đại học Chiết Giang và từng là kỹ sư chín năm tại Jane Street, với công việc agent của DeepSeek; báo chí sau đó nhận định anh là trưởng nhóm Harness. Được đưa tin, nhưng chưa được DeepSeek xác nhận vào thời điểm đó.

• Ngày 24 tháng 4 năm 2026 — DeepSeek V4 ra mắt bản xem trước, được định vị rõ ràng cho các tác vụ agent và tinh chỉnh cho các công cụ agent như Claude Code.

• Tháng 5 năm 2026 — D​eepSeek đăng hai vị trí Harness trên Moka — một giám đốc sản phẩm Agent Harness và một kỹ sư nghiên cứu, cả hai đều có trụ sở tại Bắc Kinh. Nhà nghiên cứu Chen Deli của D​eepSeek viết công khai rằng mục tiêu, tóm lại, là để benchmark Claude Code và xây dựng một "D​eepSeek Code Harness."

• Tháng 6 năm 2026 — Chiến dịch tuyển dụng vẫn tiếp tục; trưởng nhóm mô tả bộ phận đang thiếu nhân sự với "những mục tiêu đầy tham vọng và khối lượng công việc nặng nề."

• Ngày 6–7 tháng 7 năm 2026 — Tài khoản WeChat "DeepSeek Harness team" được đăng ký và chứng nhận dưới pháp nhân Bắc Kinh của DeepSeek, với logo cá voi đen. Chưa ai bên ngoài để ý đến.

• Ngày 31 tháng 7 năm 2026 — API chính thức của DeepSeek V4 Flash bước vào giai đoạn beta công khai, và tài liệu API của D​eepSeek tiết lộ — lần đầu tiên — rằng các tác vụ CodeAgent trong các bài đánh giá công khai của nó được chạy trên "D​eepSeek Harness minimal mode," kèm theo chú thích "sắp ra mắt."

• Ngày 1 tháng 8 năm 2026 — Trưởng nhóm Harness mở đợt tuyển dụng thử nghiệm nội bộ nhắm đến các nhà phát triển dự án agent-harness mã nguồn mở. Báo chí công nghệ Trung Quốc đưa tin có 769 ứng viên, 712 kho lưu trữ duy nhất và hơn 1,2 triệu sao GitHub tích lũy.

• Ngày 11 tháng 8 năm 2026 — Phạm vi đưa tin về tài khoản được mở rộng; con cá voi đen nổi lên.

• Ngày 13 tháng 8 năm 2026 — v0.1 chính thức ra mắt: được cấp phép MIT, công khai trên GitHub, có thể chạy bằng npx @deepseek-ai/dsh web. Con đường đã thông.

A timeline infographic titled 'The DeepSeek Harness leak trail' with five milestones: 'Mar 2026 — Harness team lead joins DeepSeek'; 'May 2026 — Harness team formed; Model + Harness = Agent hiring push'; 'Jul 31 2026 — V4-Flash beta names Harness minimal mode (coming soon)'; 'Aug 1 2026 — Open-source agent-harness testing call draws 769 applicants'; 'Aug 11 2026 — Official DeepSeek Harness account surfaces (black whale)'. Footer: 'Timeline per DeepSeek API docs, job postings, and Chinese tech press — product unconfirmed.' OrcaRouter logo composited bottom-right.

Những gì v0.1 thực sự đã phát hành

Bản xem trước dành cho nhà phát triển là một môi trường chạy agent trên desktop và CLI trong namespace gói Node, được xây dựng trên meta-framework Cordis với nguyên tắc thiết kế đã nêu: "mọi thứ đều là plugin." Các mô hình, công cụ, kỹ năng, phiên làm việc, sandbox, lưu trữ, vòng lặp agent, lập lịch và giao diện người dùng đều là các plugin Cordis có thể thay thế. Bốn preset được cung cấp: Standard (bộ công cụ agent lập trình đầy đủ), PTC (mô hình viết chương trình TypeScript để điều phối các lời gọi công cụ nhiều bước), Minimal (một công cụ shell và trình soạn thảo tệp — chế độ mà các benchmark V4 chạy trên đó) và Creation (để xây dựng preset tùy chỉnh). Chế độ xem Trajectory ghi mọi thứ mô hình nhìn thấy vào một nhật ký phiên chỉ ghi (append-only), có thể phát lại từng nguồn một — câu trả lời của D​eepSeek cho lời phàn nàn về "hộp đen" của lịch sử agent được tóm tắt.

Điều quan trọng cần lưu ý là cảnh báo từ chính D​eepSeek: đây là bản xem trước dành cho nhà phát triển, kho mã nguồn có thông báo kiểm thử nội bộ, và các thay đổi phá vỡ được dự kiến sẽ xảy ra trong khi các plugin cốt lõi và API nền tảng đang phát triển. Cảnh báo đó hóa ra lại chính xác chỉ trong vài giờ — và nó định hình các báo cáo thực tế dưới đây.

Những gì các báo cáo hiện trường đầu tiên cho thấy

Bản báo cáo làm nên bản cập nhật này chỉ là lời kể của một người dùng và nên được đọc đúng như vậy: teortaxesTex, vào ngày 14 tháng 8, đã mô tả một phiên D​eepSeek Harness trong đó việc truyền token dần chậm rì lại, giao diện hiển thị năm trong số chín tác vụ đã hoàn thành, nhưng khi tải lại thì thấy cả chín tác vụ thực ra đã hoàn thành — giao diện đang hiển thị trạng thái từ khoảng năm mươi phút trước. Đó chỉ là một bài đăng trên X, không phải sự xác nhận của nhà cung cấp, và chưa được tái lập một cách độc lập. Nhưng nhóm triệu chứng này được chứng thực trong hồ sơ công khai của chính dự án, và chính điều đó khiến nó đáng được xem xét nghiêm túc.

Discussion #483 trên GitHub của repository chính thức, được mở vào ngày 13 tháng 8, ghi nhận chính xác nhóm lỗi này. Nội dung phiên được lưu bền vững thông qua một lô ghi trì hoãn có giới hạn — các sự kiện nằm trong hàng đợi đang chờ trên bộ nhớ cho đến khi một bộ hẹn giờ 200 mili giây kích hoạt một lần ghi bền vững — và giao diện chỉ hiển thị trạng thái đã commit. Dưới tải đồng thời cao, khoảng thời gian này bị kéo dãn nghiêm trọng; sau khi tắt máy không sạch sẽ, phần đuôi trong bộ nhớ không bao giờ được ghi ra, và backend JSONL hoặc SQLite chỉ tải lại phần tiền tố đã commit, vì vậy đầu vào của người dùng xuất hiện muộn hoặc không bao giờ, và lịch sử từng hiển thị trước đó biến mất. Cuộc thảo luận liên kết điều này với hai vấn đề đang mở: #477 (đầu vào văn bản của người dùng bị trễ trong thời gian dài dưới tải đồng thời cao) và #479 (các yêu cầu mới của người dùng không xuất hiện trong chế độ xem hội thoại). Báo cáo hiện trường "5/9 trên màn hình, 9/9 đã xong" chính là khoảng trống giữa dữ liệu đã commit và dữ liệu thực tế đang xuất hiện trong một phiên trực tiếp.

Phản hồi về Broader v0.1 đang phân cực theo cách dễ hiểu. Một số người thử nghiệm ca ngợi kiến trúc plugin như một "máy tính để bàn tự lắp ráp với các cổng kết nối phổ thông" bên cạnh các đối thủ mã nguồn đóng; số khác liệt kê những góc cạnh chưa mài giũa — một đường dẫn đa phương thức được mã hóa cứng, và một lỗi chính sách tác tử đã được ghi nhận khi bộ khung kiểm thử buộc mô hình phải điều tra mọi mã thoát khác không, trong khi mã thoát 1 của grep cho "không khớp" khiến các bài kiểm tra đạt yêu cầu trông như thất bại, dẫn đến một vòng lặp xác minh quá mức tự củng cố (61 yêu cầu so với 32, và $0,17 so với $0,05, trên cùng một nhiệm vụ trong bản so sánh được báo cáo). Các bài đánh giá ngay ngày đầu đọc giống như một bản xem trước dành cho nhà phát triển với tham vọng thực sự và các vấn đề thực sự ở tầng trạng thái, chứ không phải một đối thủ hoàn thiện của Claude Code.

"Khả năng kết hợp không-thời gian" không chỉ là một câu đùa.

Câu đùa ở cuối báo cáo hiện trường thực ra có một bài nghiên cứu đằng sau. DeepSeek Harness được xây dựng trên Cordis, thiết kế của Cordis bắt nguồn từ "A Programming Paradigm for Spatiotemporal Composability" — một công trình nghiên cứu chính quy dài 88 trang do Đại học Bắc Kinh và DeepSeek đồng tác giả, với tác giả chính là Yifan Shi (người tạo ra framework chatbot Koishi) cùng Wei Zhang và trưởng nhóm Harness, Cui Tianyi. Bài nghiên cứu phân tách sự kết hợp động thành hai trục trực giao: tính kết hợp theo thời gian, khi loại bỏ một thành phần sẽ hoàn tác sạch sẽ các tác dụng phụ của nó như thể nó chưa từng tồn tại; và tính kết hợp theo không gian, khi các thành phần khai báo dependency và runtime phản ứng kích hoạt và hủy kích hoạt các dependency này khi các nhà cung cấp xuất hiện và biến mất.

Câu chuyện cười này ăn khách vì trạng thái kết xuất giao diện từ năm mươi phút trước là một lỗi kết hợp thời gian theo nghĩa đen nhất: runtime vẫn tiếp tục thực thi trong khi trạng thái hiển thị đã được commit phía sau nó. Khoảng trống lưu trữ được ghi lại trong Discussion #483 — một batch ghi trễ có thể tụt hậu xa so với vòng lặp đang chạy — chính là loại điều mà các đảm bảo của bài báo được cho là sẽ ngăn chặn. Liệu tầng trạng thái của harness cuối cùng có tôn trọng những đảm bảo đó trong thực tế hay không là một trong những câu hỏi thực sự bỏ ngỏ của bản phát hành này, và các báo cáo ngày đầu ra mắt là bằng chứng đầu tiên cho cả hai hướng.

Các mô hình bên dưới

Bộ khung là sản phẩm; các mô hình là động cơ. Cả hai mô hình mà D​eepSeek có lẽ sẽ đặt dưới nó đều đã hoạt động, và cả hai đều có thể gọi qua OrcaRouter ngay hôm nay:

• D​eepSeek V4 Flash 0731 — bản phát hành chính thức được huấn luyện lại (re-post-trained) của MoE hiệu quả của D​eepSeek (284B tổng / 13B kích hoạt), ngữ cảnh 1M token, đầu ra tối đa 384K, chế độ suy luận bật mặc định, và thông thạo tự nhiên O​penAI Responses API — phương ngữ mà các tác nhân kiểu Codex sử dụng. Số liệu agent-benchmark do chính D​eepSeek công bố cho bản sửa đổi 0731: 82.7 trên Terminal-Bench 2.1, 76.7 trên Cybergym, 70.3 trên Toolathlon Verified, 68.7 trên DSBench-FullStack, 59.6 trên DSBench-Hard. Những con số này do nhà cung cấp báo cáo và chưa được tái lập, nhưng đó là những gì D​eepSeek chọn để dẫn dắt, và chúng thậm chí còn cao hơn cả D​eepSeek V4 Pro Preview trên cùng bộ bài kiểm tra.

• DeepSeek V4 Pro — mô hình MoE đầu bảng với tổng 1.6T / 49B tham số hoạt động, cùng ngữ cảnh 1M token, trọng số mở (phát hành tháng 4 năm 2026), giá $0,44 / $0,87 mỗi triệu token.

Về giá cả, điểm mấu chốt là D​eepSeek rất rẻ. DeepSeek V4 Flash 0731 có giá khoảng 0,147 USD cho mỗi triệu token đầu vào và 0,295 USD cho mỗi triệu token đầu ra — giá niêm yết của nhà cung cấp, được OrcaRouter chuyển thẳng mà không cộng thêm phụ phí. Khi harness được hoàn thiện hơn, bạn sẽ có thể trỏ nó vào chính những mô hình mà bạn đã có thể gọi ngay hôm nay, và việc thay harness vào hoặc gỡ ra sau này chỉ là một thay đổi cấu hình, chứ không phải một cuộc di chuyển. Hiện tại, bạn không cần D​eepSeek Harness để chạy bất kỳ mô hình nào trong hai mô hình này.

Screenshot of the OrcaRouter model page for DeepSeek V4 Flash: efficient MoE (284B total / 13B active params), 1M-token context, 384K max output, about $0.15 per million input tokens, reasoning and JSON tool support, OpenAI-compatible endpoints.

Cuộc chiến chi phí mà nó đang bước vào

Đây không phải là một thị trường ngoài lề. Claude Code được báo cáo đang đạt tốc độ doanh thu hằng năm vượt 2,5 tỷ USD vào đầu năm 2026, và thị trường mã hóa tác tử (agentic-coding) đang được định giá ở mức vài tỷ USD. Một đối thủ từ phòng thí nghiệm Trung Quốc cắt giảm giá API — và có các mô hình đã chạy bên trong chính Claude Code — là kiểu động thái làm định giá lại toàn bộ phân khúc.

Về chi phí, việc chọn harness cũng quan trọng không kém việc chọn mô hình. Một bài kiểm tra so sánh ngang của Composio chạy DeepSeek V4 Flash trên tám harness cho thấy harness rẻ nhất (harness mã nguồn mở "Pi") có chi phí suy luận khoảng 0,028 USD cho mỗi tác vụ thành công, so với khoảng 0,195 USD cho Claude Code trong cùng bài kiểm tra — chênh lệch gần 7 lần trên cùng một loại công việc. Cộng thêm chiết khấu prefix-cache mà D​eepSeek công bố và tỷ lệ trúng cache 99,93% mà các harness bên thứ ba báo cáo khi dùng với nó, chi phí thực tế cho mỗi tác vụ của một agent chạy bằng D​eepSeek sẽ nhanh chóng trở nên rất nhỏ.

Cũng đáng nhớ lại những gì vốn đã đúng ngay hôm nay: D​eepSeek cung cấp một endpoint tương thích A​nthropic (base URL https://api.deepseek.com/anthropic), và tài liệu của họ hướng dẫn cách trỏ Claude Code vào các mô hình D​eepSeek V4. Sản phẩm harness là việc D​eepSeek cố gắng sở hữu lớp đó thay vì thuê nó — và D​eepSeek đã thông báo rằng sắp có một đợt tăng giá đáng kể trên toàn bộ dòng V4. Vì OrcaRouter chuyển tiếp giá niêm yết của nhà cung cấp mà không cộng thêm lợi nhuận, mức giá mới có hiệu lực ở phía chúng tôi ngay trong ngày nó được phát hành, mà không cần đàm phán lại.

Screenshot of DeepSeek's API documentation page 'Using the Anthropic API', showing a 'Use DeepSeek in Claude Code' section and the Anthropic-compatible base URL https://api.deepseek.com/anthropic, with the DeepSeek API docs navigation sidebar.

Tại sao dây nịt là chiến trường mới

Sự chuyển dịch là từ năng lực mô hình sang việc bàn giao tác vụ. Một mô hình tiên phong giờ chỉ là điều kiện tối thiểu; điều quyết định liệu một đội ngũ có thực sự ra mắt một agent hay không là bộ máy xung quanh — và dữ liệu mà nó tạo ra. Các nhà phân tích nhận định về động thái của D​eepSeek, trong đó có CITIC Securities, lập luận rằng một harness trưởng thành là một lợi thế phòng thủ vì hai lý do cộng hưởng: nó khép kín vòng thương mại từ điểm đầu vào đến tác vụ hoàn thành, và nó tạo ra dữ liệu quỹ đạo tác vụ dài hạn để nuôi dưỡng việc huấn luyện mô hình. Các harness cộng đồng như Pi hay D​eepSeek-TUI chứng minh nhu cầu, nhưng chúng không đưa dữ liệu đó trở lại mô hình. Harness của riêng D​eepSeek sẽ làm được điều đó — và tính năng Trajectory ra mắt trong v0.1 chính là đường dẫn dữ liệu đó được hiển thị rõ ràng.

Đó cũng là lý do vì sao cách đọc “chỉ cần benchmark mô hình” là chưa đầy đủ. Chỉ số agent của DeepSeek V4 Flash rất mạnh, nhưng harness mới là nơi D​eepSeek kỳ vọng xây dựng lợi thế bền vững — điều này khiến các lỗi ở tầng trạng thái trong các báo cáo ngày đầu không chỉ mang tính hình thức. Một harness có UI có thể tụt lại phía sau vòng lặp tới năm mươi phút thì vẫn chỉ là bản developer preview; nó chưa phải là hào luỹ (moat).

Những gì chúng tôi đang xem ngay bây giờ

• Liệu tầng trạng thái có theo kịp hay không. Độ trễ ghi sau (write-behind) đã được ghi nhận, có thể tái hiện, và đang được nộp lên kho chính thức; hãy theo dõi xem đường dẫn flush được sửa nhanh đến đâu, và liệu thiết kế "UI chỉ hiển thị trạng thái đã cam kết" có thay đổi khi một phiên đang diễn ra hay không.

• Bài kiểm tra tái hiện trực tiếp. Toàn bộ lý do khiến bản phát hành này quan trọng là điểm số agent V4 của D​eepSeek được tạo ra trên "D​eepSeek Harness minimal mode" — giờ đây bất kỳ ai cũng có thể cài đặt bản xem trước và chạy các tác vụ đó một cách trực tiếp. Nếu các con số 82.7 / 87.9 tái hiện được, hai bản phát hành gần nhất sẽ được xem như một hệ thống nhất quán; nếu không, khoảng cách giữa điểm benchmark của nhà cung cấp và kết quả thực tế sẽ trở nên có thể đo lường được.

• Liệu hệ sinh thái plugin có cất cánh được hay không. Bề mặt plugin được gắn thẻ #dsh là có thật, nhưng liệu các bên thứ ba có phát hành thứ gì đáng cài đặt hay không vẫn còn bỏ ngỏ.

• Bảng giá. DeepSeek vẫn chưa tiết lộ gì về chi phí của bản thân bộ khung (harness), và mức tăng giá API V4 đã được công bố cũng là một ẩn số lớn khác.

• Liệu "khả năng kết hợp không-thời gian" sẽ trở thành một danh sách sửa lỗi hay một khẩu hiệu. Bài báo cung cấp cho D​eepSeek một từ vựng chặt chẽ để mô tả chính xác thất bại mà báo cáo hiện trường đã nêu ra; liệu lớp trạng thái v0.1 có hội tụ về những đảm bảo đó hay không chính là phép thử.

Đánh giá thẳng thắn: tín hiệu tiền phát hành mạnh nhất mà {{1}}D​eepSeek{{/1}} từng đưa ra giờ đã là một sản phẩm thực thụ, nhưng vẫn là bản xem trước dành cho nhà phát triển với những điểm chưa hoàn thiện đã được ghi nhận. Điều vững chắc hiện tại là cặp mô hình bên dưới nó — {{2}}DeepSeek V4 Flash 0731{{/2}} và {{3}}DeepSeek V4 Pro{{/3}}, cả hai đều đang hoạt động trên {{4}}OrcaRouter{{/4}} với giá niêm yết của nhà cung cấp, không phụ phí, cả hai đều dùng được trong các vòng lặp agent thông qua một API chuẩn. Khi bộ khung trưởng thành, cách để đánh giá nó mà không đặt cược lộ trình sản xuất vào một bản {{5}}v0.1{{/5}} là định tuyến: đặt bộ khung phía trước để đánh giá, giữ nguyên các mô hình phía sau một endpoint, và chuyển sang một tổ hợp đã được kiểm chứng ngay khi nó trục trặc. Việc chuyển đổi đó chỉ là thay đổi một dòng lệnh.

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày