Một thẻ tiêu đề được tạo có tiêu đề "Unbiased's Pareto 26.10 Preview", với phụ đề "Một bản hoán đổi ngữ cảnh 1M ẩn sau cùng một chuỗi mô hình", phía trên ba thẻ ghi "Phát hành: 1 thg 10, 2026", "Ngữ cảnh: 1.048.576 token" và "Giá định tuyến: 0,80 USD / 3,20 USD mỗi 1M", với phần chân trang ghi "Các chỉ số đánh giá sơ bộ do nhà cung cấp thực hiện; chưa có điểm số độc lập nào được công bố tính đến ngày 1 tháng 10 năm 2026."
Guides & Insights

Bản xem trước Pareto 26.10 của Unbiased: Một sự hoán đổi ngữ cảnh 1M đằng sau cùng một chuỗi mô hình

Tác giả

Alistair Wren

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Tích hợp không thay đổi. Mô hình đằng sau nó thì thay đổi. Vào ngày 1 tháng 10 năm 2026, Unbiased đã chuyển chuỗi model của mình — pareto — sang Pareto 26.10 Preview, một bản phát hành mới với cửa sổ ngữ cảnh lớn gấp bốn lần, mức giá thấp hơn trên danh mục được định tuyến, và một bảng benchmark mà, theo chính nhà cung cấp thừa nhận, chỉ là sơ bộ và chưa được công bố ở dạng cuối cùng. Nếu hôm nay bạn gọi Pareto bằng tên của nó, tức là bạn đang gọi 26.10 Preview, và nhật ký thay đổi của nhà cung cấp nói rõ điều đó theo cách rõ ràng nhất có thể: "Pareto 26.10 Preview hiện là bản phát hành Pareto hiện tại… Chuỗi model vẫn là pareto."

Dòng duy nhất đó là toàn bộ câu chuyện đối với bất kỳ ai có Pareto trong một stack. Đây không phải là một sản phẩm thứ hai được ra mắt song song với sản phẩm đầu tiên. Đó là sản phẩm đầu tiên, được thay thế tại chỗ, dưới một cái tên không hề thay đổi — điều đó có nghĩa là phiên bản bạn nhận được do lịch phát hành quyết định, chứ không phải bởi bất cứ điều gì trong yêu cầu của bạn.

Điều gì thực sự đã thay đổi vào ngày 1 tháng 10

Bốn thứ đã thay đổi, và không phải tất cả chúng đều chỉ về cùng một hướng.

• Cửa sổ ngữ cảnh — 262.144 token ở bản phát hành Pareto tháng Chín, nay là 1.048.576. Tài liệu của chính Unbiased không hề nêu con số này; con số đó đến từ danh mục kỹ thuật công khai của mô hình, nơi nó là giới hạn cho mỗi yêu cầu và không có gói nào nhỏ hơn được cung cấp.
• Giá, theo cách định tuyến — mức giá thường được trích dẫn cho Pareto là 2,50 USD cho mỗi triệu token đầu vào và 7,50 USD cho mỗi triệu token đầu ra, với đầu vào được lưu đệm ở mức 0,25 USD. Danh mục 26.10 Preview ghi các mức tương ứng là 0,80 USD, 3,20 USD và 0,03 USD — khoảng một phần ba mức giá đầu vào và chỉ hơn 40% một chút so với mức giá đầu ra.
• Điểm chuẩn đánh giá — được công bố lần đầu cho bản phát hành này, và được chính nhà cung cấp dán nhãn là sơ bộ.
• Lựa chọn ổn định — 26.10 Preview là bản xem trước. Nội dung danh mục của Unbiased nói rằng nó "có thể thay đổi mà không cần thông báo" và hướng những ai cần hành vi có thể dự đoán được sang bản phát hành trước đó.

Mọi thứ khác vẫn giữ nguyên. Đầu ra tối đa vẫn là 131.072 token. Đầu vào vẫn là văn bản và hình ảnh; đầu ra vẫn chỉ là văn bản. Vẫn không có mã định danh Hugging Face trên danh sách niêm yết, vì vậy các trọng số vẫn đóng. Và vẫn có đúng một nhà cung cấp phục vụ — chính Unbiased — không có máy chủ thứ hai trong danh sách niêm yết.

A generated single-column card titled "Pareto 26.10 Preview - what changed" with six rows reading "Context: 262K to 1M", "Max output: 131,072 (unchanged)", "Input price: $2.50 to $0.80 per 1M", "Output price: $7.50 to $3.20 per 1M", "Benchmarks: four, preliminary" and "Providers: one, the vendor", with a footer reading "Preview figures per the public listing; the vendor's own site keeps the $2.50 / $7.50 card."

Giá là phần đáng để đọc lại lần thứ hai

Trên nền tảng của chính Unbiased, bảng giá không hề nhúc nhích. Cả thẻ mô hình lẫn trang định giá vẫn ghi $2.50 mỗi triệu đầu vào, $0.25 đã cache, $7.50 đầu ra — đúng ba con số mà bản phát hành tháng Chín mang theo — và vì chuỗi mô hình vẫn giữ nguyên pareto, một khách hàng dùng API của nhà cung cấp đang trả đúng những mức đó cho 26.10 Preview. Những con số thấp hơn là mức nằm trên danh mục được định tuyến, và khoảng cách giữa hai bên đúng là kiểu điều quyết định một cuộc chuyển đổi.

Có thể có hai cách hiểu, và nhà cung cấp chưa nói cách nào đúng. Hoặc là 26.10 Preview thực sự đang được cung cấp với giá rẻ hơn thông qua con đường đó như một đợt đẩy hàng giới thiệu, hoặc là danh sách niêm yết thể hiện một thỏa thuận thương mại khác với nền tảng trực tiếp. Unbiased không công bố ngày kết thúc khuyến mại, và mức giá được ấn định vào ngày ra mắt không phải là một cam kết.

Đây là phần duy nhất trong câu chuyện mà một router làm thay đổi cục diện. OrcaRouter chuyển thẳng giá niêm yết của nhà cung cấp với mức markup 0%, nên việc nhà cung cấp giảm giá sẽ có hiệu lực ngay phía chúng tôi trong cùng ngày nó được áp dụng, thay vì theo chu kỳ hợp đồng — và tính năng chuyển đổi dự phòng tự động nghĩa là một bản phát hành preview có thể hành xử khác vào tuần sau vẫn có thể được thay thế mà không cần thay đổi code. Chúng tôi không cung cấp Pareto 26.10 Preview của Unbiased, nên phiên bản trung thực là thế này: nếu bạn muốn mô hình cụ thể này, hãy gọi nó qua API riêng của Unbiased. Ý chính chỉ là ở một bản phát hành preview, cả giá lẫn phiên bản đều là biến số, và không cái nào nên bị cố định trong code.

Bảng benchmark, cùng với các nhãn đi kèm của nó

Unbiased đã công bố bốn điểm số cho 26.10 Preview, mỗi điểm được ghép với chi phí đo được cho mỗi tác vụ, và mỗi điểm đều kèm một lời cảnh báo do chính nhà cung cấp viết. Hãy đọc chúng như do nhà cung cấp tự thực hiện và chưa được tái lập, vì chúng đúng là như vậy:

• DeepSWE v1.1 (lập trình tác tử) — 69.9%, với $0.24 mỗi tác vụ
• Terminal-Bench 4.0 (sử dụng terminal tác tử) — 50.8%, với $0.48 mỗi tác vụ
• Humanity's Last Exam, chỉ văn bản (suy luận chuyên gia) — 49.9%, với $0.008 mỗi tác vụ
• GPQA-Diamond (suy luận khoa học) — 92.4%, với $0.004 mỗi tác vụ

A generated single-column scoreboard titled "Pareto 26.10 Preview - the benchmark sheet" listing six rows: "DeepSWE v1.1: 69.9% at $0.24 per task", "Terminal-Bench 4.0: 50.8% at $0.48 per task", "HLE text-only: 49.9% at $0.008 per task", "GPQA-Diamond: 92.4% at $0.004 per task", "Context: 1,048,576 tokens" and "Independent scores: none yet", with a footer reading "Vendor-run, preliminary results; not independently validated."

Cách nhà cung cấp đặt vấn đề là 26.10 Preview đang "đạt hoặc thiết lập đường biên Pareto trên cả bốn benchmark." Bảng dữ liệu mà họ công bố kèm theo tuyên bố đó cụ thể hơn, và việc nó được công bố là điều đáng ghi nhận cho Unbiased: trên Terminal-Bench 4.0, GPT 6 Astra được liệt kê ở mức 58 và Fable 5.1 ở mức 56, cả hai đều cao hơn mức 50.8 của Pareto, và mục "nơi các mô hình khác đạt điểm cao hơn" của chính nhà cung cấp cũng nói thẳng như vậy. Trên DeepSWE v1.1, bản phát hành nằm trong một cụm — GLM-5.3 và Kimi K3 đều được liệt kê ở mức 69.0 so với 69.9 của Pareto — thực tế là hòa nhau và nằm trong bất kỳ biên sai số nào mà một lần chạy duy nhất mang lại.

Các con số so sánh mang theo một lưu ý thứ hai còn quan trọng hơn lưu ý đầu tiên: chúng được chép lại từ một so sánh ngày 21 tháng 9 và, theo cách nói của nhà cung cấp, là “không được xác thực độc lập”, đồng thời chúng được tạo ra trong một đánh giá riêng đối với từng mô hình — vì vậy không nên ghép chúng với các số liệu chi phí trên mỗi tác vụ của Pareto như thể cả hai đều xuất phát từ cùng một bệ thử. Nhà cung cấp nói vậy trong phần chi tiết đánh giá. Người đọc bỏ qua dòng đó sẽ suy diễn quá mức từ biểu đồ.

Điều mà tất cả những thứ này không phải là: độc lập. Artificial Analysis, bảng xếp hạng mà hầu hết các nhóm kiểm tra trước khi tin một cái tên mới trên bảng giá, hoàn toàn không có trang nào cho Pareto. Mọi con số ở trên đều do công ty bán mô hình đó tạo ra. Điều duy nhất làm dịu bớt chuyện đó là bộ khung đánh giá được công khai — nhà cung cấp công bố một bộ đánh giá đối đầu có thể tái lập mà bất kỳ ai cũng có thể trỏ vào một endpoint — điều này biến "tin vào điểm số của chúng tôi" thành "chạy lại điểm số của chúng tôi". Đó là một đề nghị thực sự và nó không giống với một con số đã được xác minh. Chưa ai công bố lần chạy lại.

"Preview" có nghĩa là gì trong hợp đồng

Từ ngữ ở đây đang phải gánh nhiều việc hơn cả bản ghi chú phát hành. Tài liệu của chính Unbiased mô tả quyền truy cập hiện tại là quyền truy cập đánh giá theo các điều khoản của mình, và nêu rõ rằng việc sử dụng cho mục đích thương mại hoặc production cần một thỏa thuận bằng văn bản riêng. Các tài khoản mới được xem xét thủ công trước khi API key được cấp. API này tương thích với OpenAI và Anthropic — base URL, key, chuỗi model, không cần viết lại — nhưng bề mặt được tài liệu hóa chỉ gồm chat completions và messages, với những khoảng trống đã biết mà nhà cung cấp công khai liệt kê: GET /v1/models không được triển khai và các định danh model không xác định không bị từ chối, nên bên gọi phải gửi pareto một cách rõ ràng thay vì tự khám phá những gì đang có sẵn.

Ghép nhãn preview với hợp đồng private-beta lại, và lời khuyên vận hành tự nó thành hình. Đây là một mô hình để đánh giá đối chiếu với khối lượng công việc của chính bạn phía sau một lớp định tuyến, chứ không phải thứ để đặt trước lưu lượng doanh thu rồi quên đi. Cơ chế cho việc đó khá kém hào nhoáng: một chuỗi dự phòng được cấu hình một lần, để một bản phát hành thay đổi dưới chân bạn giữa tuần trở thành một thay đổi cấu hình thay vì một sự cố. Unbiased đã dành tháng 9 để sửa đúng loại vấn đề này ở phía họ — một mục changelog ngày 16 tháng 9 ghi lại rằng khoảng 13% yêu cầu dài không streaming gặp timeout 120 giây, và trần của gateway đã được nâng lên 300 giây. Đó là một nhà cung cấp thẳng thắn về một điểm còn gồ ghề. Đó cũng là lời nhắc rằng hồ sơ vận hành của một bản preview vẫn đang được viết.

A screenshot of the Unbiased Pareto 26.10 Preview model card page, headed "Pareto 26.10 Preview model card" and subtitled "Pareto is our blended AI model, available through the Unbiased AI platform. Send one request and receive one answer.", showing the DeepSWE v1.1 and Terminal-Bench cost-per-score chart with the Pareto 26.10 Preview point at 69.9% and $0.24 alongside other labs' published points, over an evaluation-details block stating the Pareto 26.10 Preview results are from October 1, 2026 runs and may change before final publication.

Những điều cần lưu ý trước khi bạn cam kết

Ba điều cụ thể sẽ giải quyết những câu hỏi còn bỏ ngỏ, và mỗi điều đều có thể kiểm chứng.

Đầu tiên là một điểm số độc lập. Cho đến khi một bên thứ ba chạy 26.10 Preview trên một bộ khung kiểm thử đã được công bố, con số 92,4 trên GPQA-Diamond và 50,8 trên Terminal-Bench vẫn chỉ là những tuyên bố của nhà cung cấp về công việc do chính nhà cung cấp thực hiện — đủ tốt để quyết định có nên kiểm thử hay không, nhưng chưa đủ tốt để quyết định có nên chuyển đổi hay không.

Điều thứ hai là bản xem trước tác động thế nào đến giá. Nếu danh sách được định tuyến vẫn ở mức $0,80 và $3,20 trong khi nền tảng riêng của nhà cung cấp giữ mức $2,50 và $7,50, thì sự khác biệt là một quyết định kênh đáng để hiểu rõ trước khi bạn xây dựng mô hình chi phí dựa trên một trong hai con số đó.

Điều thứ ba là ý nghĩa thực tế của cụm “có thể thay đổi mà không cần thông báo”. Một bản xem trước được sửa đổi hai lần trong một tháng là một công cụ khác với một bản bị đóng băng và đổi tên vào cuối quý, và nhật ký thay đổi chính là nơi điều đó sẽ xuất hiện đầu tiên.

Không có điều nào trong số này lập luận chống lại việc thử nó. Một mô hình đa phương thức 1M token báo cáo điểm số cận biên với chi phí 0,24 USD mỗi tác vụ thì đáng để bỏ ra một buổi chiều làm việc thực sự trên chính các prompt của bạn, và việc đánh giá đó tốn ít hơn cuộc tranh luận về nó. Nó lập luận chống lại việc giả định rằng mô hình bạn đánh giá chuẩn trong tuần này là mô hình bạn nhận được vào tuần sau — điều mà, đối với một bản phát hành mà chính nhà cung cấp gọi là bản xem trước, là giả định duy nhất cần phải đúng.

Bản phát hành xem trước chính là trường hợp mà tính năng chuyển đổi dự phòng tự động được tạo ra để xử lý: chuyển đổi dự phòng tự động biến một mô hình thay đổi ngay dưới chân bạn giữa tuần thành một thay đổi cấu hình thay vì một sự cố gián đoạn dịch vụ.