การ์ดชื่อเรื่องที่สร้างขึ้นโดยมีหัวข้อ "Unbiased's Pareto 26.10 Preview" พร้อมคำบรรยายรอง "การสลับบริบท 1M ภายใต้สตริงโมเดลเดียวกัน" เหนือการ์ดสามใบที่ระบุ "เปิดตัว: 1 ต.ค. 2026", "บริบท: 1,048,576 โทเค็น" และ "ราคาตามเส้นทาง: $0.80 / $3.20 ต่อ 1M" โดยมีส่วนท้ายที่ระบุ "เกณฑ์มาตรฐานเบื้องต้นที่ดำเนินการโดยผู้ขาย; ไม่มีคะแนนอิสระเผยแพร่ ณ วันที่ 1 ต.ค. 2026"
Guides & Insights

พรีวิว Pareto 26.10 ของ Unbiased: การสลับบริบท 1M ที่อยู่เบื้องหลังสตริงโมเดลเดียวกัน

ผู้เขียน

Alistair Wren

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

การผสานรวมไม่เปลี่ยนแปลง แต่โมเดลที่อยู่เบื้องหลังนั้นเปลี่ยนไป เมื่อวันที่ 1 ตุลาคม ค.ศ. 2026 Unbiased ได้ย้ายสตริงโมเดลของตน — pareto — ไปยัง Pareto 26.10 Preview ซึ่งเป็นเวอร์ชันใหม่ที่มีหน้าต่างบริบทใหญ่ขึ้นสี่เท่า ราคาที่ต่ำลงสำหรับแค็ตตาล็อกที่ถูกจัดเส้นทาง และตารางเกณฑ์มาตรฐานที่ตามคำยอมรับของผู้ขายเองนั้นยังเป็นเบื้องต้นและยังไม่ได้เผยแพร่ในรูปแบบสุดท้าย หากคุณเรียก Pareto วันนี้ด้วยชื่อของมัน คุณกำลังเรียก 26.10 Preview และบันทึกการเปลี่ยนแปลงของผู้ขายก็ระบุไว้อย่างตรงไปตรงมาที่สุดว่า "Pareto 26.10 Preview เป็นเวอร์ชัน Pareto ปัจจุบันแล้ว… สตริงโมเดลยังคงเป็น pareto."

ประโยคเดียวนั้นคือเรื่องราวทั้งหมดสำหรับทุกคนที่มี Pareto อยู่ในสแต็ก นี่ไม่ใช่ผลิตภัณฑ์ลำดับที่สองที่เปิดตัวควบคู่ไปกับผลิตภัณฑ์แรก มันคือผลิตภัณฑ์แรก ที่ถูกแทนที่ ณ ตำแหน่งเดิม ภายใต้ชื่อที่ไม่เปลี่ยนแปลง ซึ่งหมายความว่าเวอร์ชันที่คุณได้รับนั้นถูกกำหนดโดยปฏิทินการเปิดตัว ไม่ใช่จากสิ่งใดในคำขอของคุณ

จริง ๆ แล้วมีอะไรเปลี่ยนแปลงไปเมื่อวันที่ 1 ตุลาคม

มีสี่สิ่งเปลี่ยนไป และพวกมันไม่ได้ชี้ไปในทางเดียวกันทั้งหมด

• หน้าต่างบริบท — 262,144 โทเค็นในรุ่น Pareto ตอนนี้ 1,048,576 เอกสารของ Unbiased เองไม่ได้ระบุตัวเลขนี้ ตัวเลขดังกล่าวมาจากข้อมูลทางเทคนิคสาธารณะของโมเดล ซึ่งเป็นขีดจำกัดต่อคำขอโดยไม่มีระดับที่เล็กกว่าให้เลือก
• ราคา ตามที่จัดเส้นทาง — คู่ที่มักใช้กับ Pareto คือ $2.50 ต่อล้านโทเค็นอินพุต และ $7.50 ต่อล้านโทเค็นเอาต์พุต โดยอินพุตที่แคชไว้อยู่ที่ $0.25 รายการของ 26.10 Preview ระบุ $0.80, $3.20 และ $0.03 ตามลำดับ — คิดเป็นประมาณหนึ่งในสามของอัตราค่าอินพุต และเกิน 40% ของอัตราค่าเอาต์พุตเล็กน้อย
• คะแนน Benchmark — เผยแพร่เป็นครั้งแรกสำหรับรุ่นนี้ และเป็นข้อมูลเบื้องต้นตามที่ผู้ขายระบุเอง
• ตัวเลือกที่เสถียร — 26.10 Preview เป็นเวอร์ชันพรีวิว ข้อความในแคตตาล็อกของ Unbiased ระบุว่ามัน "อาจเปลี่ยนแปลงได้โดยไม่แจ้งให้ทราบ" และชี้ให้ผู้ที่ต้องการพฤติกรรมที่คาดเดาได้ไปที่รุ่นก่อนหน้าแทน

ทุกอย่างอื่นยังคงเดิม เอาต์พุตสูงสุดยังคงอยู่ที่ 131,072 โทเคน อินพุตยังคงเป็นข้อความและรูปภาพ เอาต์พุตยังคงเป็นข้อความเท่านั้น ยังไม่มีตัวระบุ Hugging Face บนรายการ ดังนั้นน้ำหนักโมเดลจึงยังคงปิดอยู่ และยังมีผู้ให้บริการเสิร์ฟโมเดลเพียงรายเดียวเท่านั้น — Unbiased เอง — โดยไม่มีโฮสต์รายที่สองอยู่ในรายการ

A generated single-column card titled "Pareto 26.10 Preview - what changed" with six rows reading "Context: 262K to 1M", "Max output: 131,072 (unchanged)", "Input price: $2.50 to $0.80 per 1M", "Output price: $7.50 to $3.20 per 1M", "Benchmarks: four, preliminary" and "Providers: one, the vendor", with a footer reading "Preview figures per the public listing; the vendor's own site keeps the $2.50 / $7.50 card."

ราคาคือส่วนที่คุ้มค่าที่จะอ่านซ้ำสองครั้ง

บนแพลตฟอร์มของ Unbiased เอง อัตราค่าบริการไม่ได้ขยับ การ์ดโมเดลและหน้าราคาต่างก็ยังระบุ $2.50 ต่ออินพุตหนึ่งล้าน $0.25 สำหรับแบบแคช $7.50 เอาต์พุต — ตัวเลขสามตัวเดียวกันกับที่การเปิดตัวในเดือนกันยายนมี — และเนื่องจากสตริงโมเดลยังคงเป็นpareto ลูกค้าที่ใช้ API ของผู้ให้บริการรายนี้จึงจ่ายในอัตราเหล่านั้นสำหรับ 26.10 Preview ตัวเลขที่ต่ำกว่าคือตัวเลขที่อยู่ในรายการแคตตาล็อกแบบจัดเส้นทาง และช่องว่างระหว่างทั้งสองก็เป็นสิ่งที่ตัดสินการโยกย้ายพอดี

สามารถตีความได้สองแบบ และผู้ขายยังไม่ได้ระบุว่าแบบใดเป็นจริง ไม่ว่าจะเป็น 26.10 Preview ที่ถูกให้บริการในราคาถูกกว่าผ่านช่องทางนั้นจริง ๆ ในฐานะการผลักดันช่วงแนะนำ หรือรายการดังกล่าวสะท้อนข้อตกลงทางการค้าที่แตกต่างจากแพลตฟอร์มโดยตรง Unbiased ไม่ได้ประกาศวันสิ้นสุดโปรโมชัน และราคาที่กำหนดในวันเปิดตัวก็ไม่ใช่คำมั่นสัญญา

นี่คือส่วนเดียวของเรื่องที่เราเตอร์เปลี่ยนรูปโฉม OrcaRouter ส่งผ่านราคาตามรายการของผู้ให้บริการโดยตรง โดยบวกเพิ่ม 0% ดังนั้นเมื่อผู้ขายลดราคา ฝั่งเราจะมีผลในวันเดียวกับที่ประกาศใช้ ไม่ใช่ตามรอบสัญญา — และการสลับสำรองอัตโนมัติหมายความว่ารีลีสพรีวิวที่พฤติกรรมเปลี่ยนไปในสัปดาห์หน้าสามารถถูกสลับออกได้โดยไม่ต้องแก้โค้ด เราไม่ได้ให้บริการ Pareto 26.10 Preview ของ Unbiased ดังนั้นแบบที่ตรงไปตรงมาก็คือ ถ้าคุณต้องการโมเดลนี้โดยเฉพาะ ให้เรียกใช้ผ่าน API ของ Unbiased เอง ประเด็นอยู่แค่ที่ว่า บนรีลีสพรีวิว ราคาและเวอร์ชันต่างก็เป็นตัวแปร และไม่ควรปักหมุดทั้งคู่ไว้ในโค้ด

แผ่นเบนช์มาร์ก พร้อมป้ายกำกับที่ติดมาด้วย

Unbiased เผยแพร่คะแนนสี่รายการสำหรับ 26.10 Preview โดยแต่ละรายการจับคู่กับต้นทุนต่องานที่วัดได้ และแต่ละรายการมีข้อแม้ที่ผู้ขายเขียนขึ้นเอง ให้อ่านสิ่งเหล่านี้ว่าดำเนินการโดยผู้ขายและยังไม่ได้ทำซ้ำ เพราะนั่นคือสิ่งที่มันเป็น:

• DeepSWE v1.1 (การเขียนโค้ดแบบเอเจนต์) — 69.9% ที่ $0.24 ต่องาน
• Terminal-Bench 4.0 (การใช้งานเทอร์มินัลแบบเอเจนต์) — 50.8% ที่ $0.48 ต่องาน
• Humanity's Last Exam แบบข้อความเท่านั้น (การให้เหตุผลระดับผู้เชี่ยวชาญ) — 49.9% ที่ $0.008 ต่องาน
• GPQA-Diamond (การให้เหตุผลทางวิทยาศาสตร์) — 92.4% ที่ $0.004 ต่องาน

A generated single-column scoreboard titled "Pareto 26.10 Preview - the benchmark sheet" listing six rows: "DeepSWE v1.1: 69.9% at $0.24 per task", "Terminal-Bench 4.0: 50.8% at $0.48 per task", "HLE text-only: 49.9% at $0.008 per task", "GPQA-Diamond: 92.4% at $0.004 per task", "Context: 1,048,576 tokens" and "Independent scores: none yet", with a footer reading "Vendor-run, preliminary results; not independently validated."

การวางกรอบของเจ้าของผลิตภัณฑ์คือ 26.10 Preview "เทียบเท่าหรือสร้างพรมแดนพาเรโต (Pareto frontier) ในทั้งสี่เบนช์มาร์ก" สเปรดชีตที่พวกเขาเผยแพร่ควบคู่กับคำกล่าวอ้างนั้นมีความเฉพาะเจาะจงมากกว่า และเป็นเครดิตของ Unbiased ที่เผยแพร่สิ่งนี้ออกมาทั้งหมด บน Terminal-Bench 4.0 มีการระบุ GPT 6 Astra ไว้ที่ 58 และ Fable 5.1 ที่ 56 ซึ่งทั้งคู่อยู่เหนือ 50.8 ของ Pareto และส่วน "จุดที่โมเดลอื่นได้คะแนนสูงกว่า" ของเจ้าของผลิตภัณฑ์เองก็ระบุเช่นนั้นโดยตรง บน DeepSWE v1.1 ตัวรีลีสอยู่ในกลุ่มเดียวกัน — GLM-5.3 และ Kimi K3 ถูกระบุไว้ที่ 69.0 เทียบกับ 69.9 ของ Pareto — ซึ่งในทางปฏิบัติถือว่าเสมอกัน และอยู่ในช่วงค่าความคลาดเคลื่อนใดก็ตามที่การรันครั้งเดียวมี

ตัวเลขการเปรียบเทียบมีข้อควรระวังประการที่สองที่สำคัญยิ่งกว่าประการแรก: ตัวเลขเหล่านี้ถูกถอดมาจากการเปรียบเทียบเมื่อวันที่ 21 กันยายน และตามคำพูดของผู้ขายแล้ว "ไม่ได้รับการตรวจสอบยืนยันอย่างเป็นอิสระ" อีกทั้งยังได้มาจากการประเมินแยกต่างหากของแต่ละโมเดล — ดังนั้นจึงไม่ควรนำไปจับคู่กับตัวเลขต้นทุนต่องานของ Pareto ราวกับว่าทั้งสองมาจากการทดสอบชุดเดียวกัน ผู้ขายระบุไว้เช่นนั้นในรายละเอียดการประเมิน ผู้อ่านที่ข้ามบรรทัดนั้นจะตีความกราฟเกินจริง

สิ่งที่ทั้งหมดนี้ไม่ได้เป็นก็คือ ความเป็นอิสระ Artificial Analysis ซึ่งเป็นบอร์ดที่ทีมส่วนใหญ่ตรวจสอบก่อนจะเชื่อชื่อใหม่บนตารางราคา ไม่มีหน้าสำหรับ Pareto เลย ตัวเลขทุกตัวข้างต้นล้วนมาจากบริษัทที่ขายโมเดลนี้ สิ่งเดียวที่ทำให้เรื่องนี้เบาลงคือ eval harness นั้นเปิดเผยต่อสาธารณะ — ผู้ขายเผยแพร่ชุดทดสอบเทียบตรงกัน (head-to-head) ที่ทำซ้ำได้ ซึ่งใครก็สามารถชี้ไปที่ endpoint หนึ่งได้ — ซึ่งเปลี่ยน "เชื่อคะแนนของเรา" ให้กลายเป็น "รันคะแนนของเราใหม่" นั่นเป็นข้อเสนอจริง และไม่เหมือนกับตัวเลขที่ผ่านการตรวจสอบยืนยันแล้ว ยังไม่มีใครเผยแพร่ผลการรันซ้ำนั้นเลย

ความหมายของ "preview" ในสัญญา

คำนี้ทำงานหนักกว่าที่บันทึกประจำรุ่นระบุไว้ เอกสารของ Unbiased เองอธิบายการเข้าถึงในปัจจุบันว่าเป็นการเข้าถึงเพื่อประเมินผลภายใต้ข้อกำหนดของตน และระบุว่าการใช้งานเชิงพาณิชย์หรือการใช้งานจริงต้องมีข้อตกลงเป็นลายลักษณ์อักษรแยกต่างหาก บัญชีใหม่จะถูกตรวจสอบด้วยมือก่อนที่จะออกคีย์ API API นี้เข้ากันได้กับ OpenAI และ Anthropic — base URL, คีย์, สตริงโมเดล ไม่ต้องเขียนใหม่ — แต่ส่วนที่ระบุในเอกสารมีเพียง chat completions และ messages เท่านั้น พร้อมช่องโหว่ที่รู้กันดีซึ่งผู้ให้บริการเปิดเผยอย่างตรงไปตรงมา: GET /v1/models ยังไม่ถูกนำไปใช้งาน และตัวระบุโมเดลที่ไม่รู้จักก็ไม่ถูกปฏิเสธ ดังนั้นผู้เรียกจึงต้องส่ง pareto อย่างชัดเจนแทนที่จะค้นหาว่ามีอะไรให้ใช้ได้บ้าง

รวมป้ายกำกับพรีวิวกับสัญญาไพรเวตเบตาเข้าด้วยกัน แล้วคำแนะนำด้านการดำเนินงานก็เขียนขึ้นมาเอง นี่คือโมเดลสำหรับประเมินเทียบกับเวิร์กโหลดของคุณเองหลังเลเยอร์การกำหนดเส้นทาง ไม่ใช่โมเดลที่จะเอาไปวางไว้หน้าทราฟฟิกสร้างรายได้แล้วลืมมันไป กลไกสำหรับเรื่องนั้นไม่หวือหวา: ห่วงโซ่สำรองที่ตั้งค่าไว้ครั้งเดียว ดังนั้นรีลีสที่เปลี่ยนไปภายใต้คุณกลางสัปดาห์จึงกลายเป็นการเปลี่ยนแปลงคอนฟิกแทนที่จะเป็นเหตุการณ์ผิดปกติ Unbiased ใช้เดือนกันยายนแก้ปัญหาประเภทนี้บนฝั่งของตัวเองโดยเฉพาะ — รายการเชนจ์ล็อกเมื่อวันที่ 16 กันยายนบันทึกว่าประมาณ 13% ของคำขอแบบไม่สตรีมมิ่งที่มีความยาวนั้นชนไทม์เอาต์ 120 วินาที และเพดานของเกตเวย์ถูกเพิ่มเป็น 300 วินาที นั่นคือผู้ขายที่พูดตรงไปตรงมาเกี่ยวกับขอบหยาบๆ มันยังเป็นเครื่องเตือนใจว่าโปรไฟล์การดำเนินงานของพรีวิวยังคงถูกเขียนอยู่

A screenshot of the Unbiased Pareto 26.10 Preview model card page, headed "Pareto 26.10 Preview model card" and subtitled "Pareto is our blended AI model, available through the Unbiased AI platform. Send one request and receive one answer.", showing the DeepSWE v1.1 and Terminal-Bench cost-per-score chart with the Pareto 26.10 Preview point at 69.9% and $0.24 alongside other labs' published points, over an evaluation-details block stating the Pareto 26.10 Preview results are from October 1, 2026 runs and may change before final publication.

สิ่งที่ต้องระวังก่อนตัดสินใจ

สามเรื่องเฉพาะเจาะจงจะช่วยคลี่คลายคำถามที่ยังค้างคาอยู่ และแต่ละเรื่องก็ตรวจสอบได้

อย่างแรกคือคะแนนที่เป็นอิสระ จนกว่าหน่วยงานภายนอกจะรัน 26.10 Preview บนฮาร์เนสที่เผยแพร่สาธารณะ คะแนน 92.4 บน GPQA-Diamond และ 50.8 บน Terminal-Bench ก็เป็นคำกล่าวอ้างของผู้ขายเกี่ยวกับงานของผู้ขายเอง — ดีพอที่จะตัดสินใจว่าจะทดสอบหรือไม่ แต่ไม่ดีพอที่จะตัดสินใจว่าจะย้ายระบบหรือไม่

อย่างที่สองคือผลที่พรีวิวมีต่อราคา หากลิสติ้งที่ถูกจัดเส้นทางยังคงอยู่ที่ $0.80 และ $3.20 ในขณะที่แพลตฟอร์มของผู้ขายเองตั้งไว้ที่ $2.50 และ $7.50 ความแตกต่างนี้คือการตัดสินใจเรื่องช่องทางที่ควรค่าแก่การทำความเข้าใจ ก่อนที่คุณจะสร้างโมเดลต้นทุนจากตัวเลขใดตัวเลขหนึ่ง

ประการที่สามคือสิ่งที่ “อาจเปลี่ยนแปลงได้โดยไม่ต้องแจ้งให้ทราบล่วงหน้า” หมายถึงในทางปฏิบัติจริง ๆ พรีวิวที่ถูกแก้ไขสองครั้งในหนึ่งเดือนเป็นเครื่องมือคนละแบบกับพรีวิวที่ถูกตรึงไว้และเปลี่ยนชื่อเมื่อสิ้นไตรมาส และบันทึกการเปลี่ยนแปลงคือจุดที่เรื่องนี้จะปรากฏขึ้นก่อน

ไม่มีข้อโต้แย้งใดในนี้ที่ต่อต้านการลองใช้มัน โมเดลมัลติโมดัลขนาด 1M โทเคนที่รายงานคะแนนใกล้เคียงระดับแนวหน้าในราคา $0.24 ต่อหนึ่งงานนั้นคุ้มค่ากับการลงมือทำงานจริงกับพรอมป์ของคุณเองสักบ่ายหนึ่ง และการประเมินนั้นมีค่าใช้จ่ายน้อยกว่าการถกเถียงเกี่ยวกับมันเสียอีก มันต่อต้านการสันนิษฐานว่าโมเดลที่คุณวัดผลในสัปดาห์นี้จะเป็นโมเดลที่คุณได้รับในสัปดาห์หน้า — ซึ่งสำหรับการเปิดตัวที่ผู้ขายเองเรียกมันว่าพรีวิว นั่นคือสมมติฐานเดียวที่จำเป็นต้องถูกต้อง

การเปิดตัวเวอร์ชันพรีวิวเป็นกรณีที่การสลับระบบสำรองอัตโนมัติถูกสร้างขึ้นมาเพื่อรองรับโดยเฉพาะ: การสลับระบบสำรองอัตโนมัติเปลี่ยนโมเดลที่เปลี่ยนแปลงไปภายใต้คุณกลางสัปดาห์ให้กลายเป็นการปรับคอนฟิกแทนที่จะเป็นเหตุระบบล่ม

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube