Một thẻ tiêu đề được tạo với tiêu đề "Pareto 26.10 Preview vs Pareto" và phụ đề "Cùng một chuỗi model, hai bản phát hành khác nhau", phía trên ba thẻ ghi "Ngữ cảnh: 1M vs 262K", "Giá: $0.80 / $3.20 vs $2.50 / $7.50" và "Độ ổn định: preview vs stable", cùng phần chân trang ghi "Cả hai bản phát hành đều được Unbiased cung cấp dưới chuỗi model pareto; số liệu theo danh sách công khai."
Guides & Insights

Pareto 26.10 Preview so với Pareto: Cùng một chuỗi mô hình, hai mô hình khác nhau

Tác giả

Rowan Sterling

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Unbiased đã phát hành Pareto 26.10 Preview vào ngày 1 tháng 10 năm 2026 và để bản phát hành trước đó, Pareto, được liệt kê bên cạnh nó. Hai bản này không phải là các biến thể của một họ mà bạn chọn giữa chúng bằng một cờ. Chúng là hai bản phát hành thuộc cùng một thương hiệu, và chuỗi model của chính nhà cung cấp — pareto — giờ phân giải thành bản mới hơn, được nêu rõ là không ổn định. Vậy câu hỏi so sánh thật ra không phải là "cái nào tốt hơn." Mà là: yêu cầu của bạn thực sự đi tới bản nào, và điều gì xảy ra với câu trả lời khi thứ đó thay đổi ngay bên dưới bạn?

Nơi duy nhất cả hai được nhắc đến cùng lúc là danh mục kỹ thuật công khai của mô hình. Thẻ mô hình, trang định giá và FAQ của chính Unbiased đều mô tả một sản phẩm hợp nhất và không hề nhắc đến sự tách biệt. Chính sự bất đối xứng đó — một bên là bản so sánh khác biệt công khai chi tiết, bên kia là sự im lặng — là điểm khởi đầu trung thực cho một cuộc đối đầu trực tiếp, vì nó cho bạn biết mọi con số dưới đây đến từ đâu.

Sáu chiều, cả hai bên

Mọi thứ phân biệt các bản phát hành nằm gọn trong sáu dòng này. Bên trái là Pareto 26.10 Preview; bên phải là bản phát hành Pareto từ ngày 17 tháng 9, bản mà phần văn bản danh mục của bản xem trước gọi là lựa chọn ổn định.

• Cửa sổ ngữ cảnh — 1,048,576 token so với 262,144 token. Gấp bốn lần dung lượng, trên giấy tờ, mà không bên nào cung cấp gói nhỏ hơn.
• Đầu ra tối đa — 131,072 token so với 131,072 token. Không đổi. Cửa sổ lớn hơn không đi kèm với câu trả lời lớn hơn.
• Giá đầu vào, theo định tuyến — 0,80 USD mỗi triệu so với 2,50 USD mỗi triệu. Bản xem trước có giá khoảng một phần ba mức giá trong danh sách đó.
• Giá đầu ra, theo định tuyến — 3,20 USD mỗi triệu so với 7,50 USD mỗi triệu. Dưới một nửa.
• Đầu vào được lưu đệm, theo định tuyến — 0,03 USD mỗi triệu so với 0,25 USD mỗi triệu. Các quỹ đạo tác nhân dài nhất hưởng lợi nhiều nhất ở đây.
• Bảng điểm chuẩn đã công bố — bốn điểm số, được ghi rõ là "sơ bộ" và "có thể thay đổi trước khi công bố cuối cùng" so với không có bảng điểm chuẩn nào được công bố cả.

Hai trong số những hàng đó là những hàng quyết định công việc thực sự. Cửa sổ ngữ cảnh là thông tin gây chú ý mà nhà cung cấp sẽ không tự nêu trên trang web của mình — nó nằm trên trang niêm yết, chứ không phải trên thẻ mô hình — còn giá đầu vào được lưu đệm mới là thứ làm thay đổi hóa đơn của một agent chứ không phải mức trần của nó. Mọi thứ còn lại hoặc là một chênh lệch mang tính tiếp thị, hoặc — trong trường hợp điểm số đầu ra — là một sự thừa nhận: việc công bố các con số của một bản xem trước kèm nhãn "sơ bộ" thì trung thực hơn phương án thay thế, và đó cũng là một lời cảnh báo.

A generated two-column scoreboard titled "Pareto 26.10 Preview vs Pareto - the scoreboard". The left column, "Pareto 26.10 Preview", reads "Context: 1,048,576 tokens", "Max output: 131,072 tokens", "Input price: $0.80 / 1M", "Output price: $3.20 / 1M", "Cached input: $0.03 / 1M" and "Scores: four, preliminary". The right column, "Pareto", reads "Context: 262,144 tokens", "Max output: 131,072 tokens", "Input price: $2.50 / 1M", "Output price: $7.50 / 1M", "Cached input: $0.25 / 1M" and "Scores: none published". A footer reads "Both columns per the public listing; the vendor's own site lists $2.50 / $7.50 for both releases."

Giá bạn thấy phụ thuộc vào nơi bạn nhìn

Đặt hai bảng giá cạnh nhau thì chúng không khớp với nhau, và đó là phần của phép so sánh này mà chưa ai giải thích.

Nền tảng riêng của Unbiased, vào ngày 26.10 Preview trở thành bản phát hành hiện hành, vẫn liệt kê $2,50 mỗi triệu đầu vào, $0,25 đã lưu cache và $7,50 đầu ra. Đó là các con số của tháng Chín, không thay đổi, trên cả trang giá và thẻ mô hình. Bộ giá thấp hơn — $0,80, $0,03, $3,20 — xuất hiện trên danh mục được định tuyến cho cùng bản xem trước đó. Vậy nên một khách hàng gọi pareto trực tiếp qua API của nhà cung cấp sẽ trả theo bảng giá cũ cho mô hình mới, trong khi danh mục được định tuyến quảng cáo chỉ khoảng một phần ba mức đó. Cả hai đều đang hoạt động. Nhà cung cấp chưa công bố ngày kết thúc khuyến mãi nào và cũng không đưa ra tuyên bố nào để giải thích sự không nhất quán giữa chúng.

Đó là một câu hỏi về kênh phân phối, và trên một bản phát hành xem trước thì nó cũng là câu hỏi về thời điểm: dù bạn mô hình hóa chi phí của mình dựa trên con số nào, thì con số còn lại chỉ cách việc trở thành đúng đắn đúng một ghi chú phát hành. Một router truyền thẳng giá niêm yết của nhà cung cấp với mức markup 0% sẽ loại bỏ chính xác sự ma sát này — thay đổi giá của nhà cung cấp có hiệu lực ngay trong cùng ngày thay vì phải chờ đến kỳ rà soát hợp đồng tiếp theo — và đó là thứ mang tính cấu trúc duy nhất đáng để học hỏi từ OrcaRouter ở đây. Hiện nay chúng tôi không cung cấp bản phát hành Unbiased nào trong hai bản đó, nên câu trả lời trực tiếp cho câu hỏi "tôi gọi nó ở đâu" chính là API của Unbiased, tùy theo bộ giá nào trong hai bộ giá mà listing bạn mua qua đang có. Lý do để nói thẳng ra là vì mức chênh lệch lên tới ba lần, và bản xem trước không phải là nơi để phát hiện ra rằng bạn đã định giá nhầm bộ giá.

Bản xem trước mang lại cho bạn điều gì, và bạn phải đánh đổi điều gì

Phần mô tả trong danh mục của chính bản preview đặt ra các điều khoản: nó “có thể thay đổi mà không cần thông báo”, và bất kỳ ai cần hành vi có thể dự đoán được đều được chỉ ngược về bản phát hành tháng Chín. Đó không phải là văn bản rập khuôn — đó là định nghĩa sản phẩm. So sánh điều đó với hình dạng thực tế của một phiên agent dài, và sự đánh đổi trở nên cụ thể.

Một tác nhân duy trì cuộc trò chuyện sẽ tích lũy ngữ cảnh, và những cuộc trò chuyện dài chính là nơi prompt caching phát huy giá trị. Một mô hình đã thay đổi đằng sau một endpoint không đổi là cách kinh điển để đánh mất điều đó: cache gắn khóa với mô hình đã tạo ra các token, nên một lần âm thầm hoán đổi phiên bản giữa chừng có thể vô hiệu hóa những gì bạn đã cache và tính phí lại công việc bạn tưởng đã trả tiền rồi. Tài liệu của chính Unbiased lại lập luận điểm này theo hướng ngược lại — họ định vị giải pháp kết hợp của mình là ổn định với cache, trong khi một router chuyển đổi thì không — vì vậy đây là rủi ro mà nhà cung cấp hiểu rõ và chỉ đơn thuần chấp nhận để đổi lấy việc phát hành bản xem trước. Điều này đáng được gọi tên vì lỗi này vô hình trên bảng điều khiển: token của bạn vẫn bị tính phí, câu trả lời của bạn vẫn được trả về, và con số chỉ lớn hơn tuần trước.

Ưu điểm của bản xem trước là có thật và phản chiếu đúng nhược điểm. Ngữ cảnh gấp bốn lần, đầu vào được cache với mức bằng một phần tám giá của bản phát hành ổn định trên danh sách định tuyến, và thậm chí có cả bảng điểm chuẩn — bản phát hành tháng Chín chưa từng có điểm số được công bố. Nếu khối lượng công việc của bạn có ngữ cảnh dài và nhạy cảm về chi phí, bản xem trước là thứ bạn muốn, và cách để dùng nó mà không đặt cược cả stack là ghim nó một cách có chủ đích: một endpoint có tên cho bản xem trước, một endpoint có tên cho bản phát hành ổn định, và một phương án dự phòng giữa chúng được cấu hình một lần. DSL định tuyến tồn tại chính xác cho dạng vấn đề này — kết hợp hai cái đó thành hai nhánh riêng, gửi một phần lưu lượng thật qua mỗi nhánh, và để log yêu cầu cho bạn biết mỗi cái thực sự tốn bao nhiêu. Bản xem trước nên là một quyết định mà bạn có thể đảo ngược bằng một dòng config, không phải là một thuộc tính của endpoint mà bạn phát hiện qua hóa đơn.

A generated three-card graphic titled "Where the version reaches you", with cards reading "Vendor API: model string pareto leads to 26.10 Preview", "Vendor pricing card: $2.50 / $7.50, unchanged" and "Listing: $0.80 / $3.20, may change without notice", and a footer reading "Read Oct 1, 2026; which release pareto points at is set by the release calendar."

Một bức tranh hiệu suất chưa đủ ổn định để đáng tin cậy.

Mọi con số ở trên đều đến từ danh sách công khai, và chính bảng hiệu suất của danh sách đó đã thay đổi giữa các lần đọc trong ngày ra mắt. Một lần đọc trang 26.10 Preview báo cáo độ trễ trung vị là 5,28 giây và 35 token mỗi giây; một chế độ xem so sánh song song được công bố cùng ngày báo cáo 3,54 giây và 21 token mỗi giây cho bản preview và 1,05 giây và 45 token mỗi giây cho bản phát hành tháng 9. Đó không phải là những khác biệt nhỏ. Một mô hình hoàn toàn mới được cung cấp bởi một nhà cung cấp duy nhất có nền tảng đo lường mỏng, và một cửa sổ trượt qua nhiều giờ sẽ biến động.

Vị thế trung thực là không bản phát hành nào có con số thông lượng hay độ trễ đủ ổn định để lập kế hoạch dựa trên đó, và với bản xem trước thì điều đó nằm trong chính bản chất sản phẩm chứ không phải vấn đề của một ảnh chụp nhanh. Bản phát hành tháng Chín ít nhất đã có nhiều tuần lưu lượng — danh sách của nó cho thấy mức khả dụng nhiều ngày trong vùng 95–99% với lịch sử nhà cung cấp đầy đủ phía sau. Bản xem trước mới có vài giờ. Nếu lý do bạn chọn giữa chúng là tốc độ chứ không phải giá hay ngữ cảnh, thì bằng chứng để lựa chọn vẫn chưa tồn tại, và hành động có trách nhiệm là đo trên prompt của chính bạn thay vì đọc một con số từ một trong hai trang.

A screenshot of the OrcaRouter models catalogue headed "Models" and subtitled "208 models · 16 providers · one API key, one bill", with input-modality, context-length, input-price, status, series and supported-parameter filter rows, tabs for Models, Leaderboard, Offers and Playground, a "How to call any model" panel showing a POST to an OpenAI-compatible endpoint, and model cards including OpenAI: GPT-6.1 Sol.

Nên gọi cái nào, và làm sao để ngừng quan tâm

Hãy gọi bản xem trước nếu công việc của bạn có ngữ cảnh dài, nhạy cảm về chi phí và có thể đánh giá được — các phiên tác nhân, xử lý theo lô, bất cứ thứ gì mà cửa sổ gấp bốn lần và giá đầu vào bằng một phần ba bù đắp cho rủi ro thay đổi giữa tuần. Hãy coi đó là một bản thử nghiệm với một dòng cấu hình ở bên dưới, và giữ số liệu của riêng bạn, vì số liệu của nhà cung cấp sẽ thay đổi.

Hãy gọi stable Pareto nếu khối lượng công việc của bạn thuộc môi trường production, nhạy cảm với độ trễ hoặc thuộc diện đánh giá tuân thủ mà không muốn một mô hình được mô tả là có thể thay đổi mà không báo trước. Bạn từ bỏ cửa sổ 1M, bộ nhớ đệm rẻ hơn và các điểm số đã công bố; bạn giữ được một endpoint có thành tích đã được kiểm chứng và một cái tên vẫn mang cùng ý nghĩa vào tuần sau. Với rất nhiều đội nhóm, đó chính là toàn bộ yêu cầu.

Sai lầm là coi đây như một sự phân nhánh vĩnh viễn. Unbiased thiết kế sự chia tách này để chỉ mang tính tạm thời — bản xem trước tồn tại để được đánh giá rồi sau đó được hấp thụ — và quyết định thực sự quan trọng không phải là bạn chọn cái nào trong hai, mà là liệu việc chuyển đổi giữa chúng là một thay đổi năm phút hay một dự án kéo dài cả quý. Trên một endpoint với một chuỗi mô hình, hiện tại nó không phải cả hai: nó là một thông báo mà bạn phải kịp nắm bắt. Thay vào đó, hãy cấu hình lựa chọn như một quyết định định tuyến, và phiên bản bạn gọi sẽ trở thành một nút vặn, đó là tư thế duy nhất mà một bản phát hành xem trước từng thực sự đền đáp.