
พรีวิว Pareto 26.10 ของ Unbiased: การสลับบริบท 1M ที่อยู่เบื้องหลังสตริงโมเดลเดียวกัน
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 221 tok/s
- OpenAIใหม่OpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- Anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIใหม่Grok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 103 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
การผสานรวมไม่เปลี่ยนแปลง แต่โมเดลที่อยู่เบื้องหลังนั้นเปลี่ยนไป เมื่อวันที่ 1 ตุลาคม ค.ศ. 2026 Unbiased ได้ย้ายสตริงโมเดลของตน — pareto — ไปยัง Pareto 26.10 Preview ซึ่งเป็นเวอร์ชันใหม่ที่มีหน้าต่างบริบทใหญ่ขึ้นสี่เท่า ราคาที่ต่ำลงสำหรับแค็ตตาล็อกที่ถูกจัดเส้นทาง และตารางเกณฑ์มาตรฐานที่ตามคำยอมรับของผู้ขายเองนั้นยังเป็นเบื้องต้นและยังไม่ได้เผยแพร่ในรูปแบบสุดท้าย หากคุณเรียก Pareto วันนี้ด้วยชื่อของมัน คุณกำลังเรียก 26.10 Preview และบันทึกการเปลี่ยนแปลงของผู้ขายก็ระบุไว้อย่างตรงไปตรงมาที่สุดว่า "Pareto 26.10 Preview เป็นเวอร์ชัน Pareto ปัจจุบันแล้ว… สตริงโมเดลยังคงเป็น pareto."
ประโยคเดียวนั้นคือเรื่องราวทั้งหมดสำหรับทุกคนที่มี Pareto อยู่ในสแต็ก นี่ไม่ใช่ผลิตภัณฑ์ลำดับที่สองที่เปิดตัวควบคู่ไปกับผลิตภัณฑ์แรก มันคือผลิตภัณฑ์แรก ที่ถูกแทนที่ ณ ตำแหน่งเดิม ภายใต้ชื่อที่ไม่เปลี่ยนแปลง ซึ่งหมายความว่าเวอร์ชันที่คุณได้รับนั้นถูกกำหนดโดยปฏิทินการเปิดตัว ไม่ใช่จากสิ่งใดในคำขอของคุณ
จริง ๆ แล้วมีอะไรเปลี่ยนแปลงไปเมื่อวันที่ 1 ตุลาคม
มีสี่สิ่งเปลี่ยนไป และพวกมันไม่ได้ชี้ไปในทางเดียวกันทั้งหมด
• หน้าต่างบริบท — 262,144 โทเค็นในรุ่น Pareto ตอนนี้ 1,048,576 เอกสารของ Unbiased เองไม่ได้ระบุตัวเลขนี้ ตัวเลขดังกล่าวมาจากข้อมูลทางเทคนิคสาธารณะของโมเดล ซึ่งเป็นขีดจำกัดต่อคำขอโดยไม่มีระดับที่เล็กกว่าให้เลือก
• ราคา ตามที่จัดเส้นทาง — คู่ที่มักใช้กับ Pareto คือ $2.50 ต่อล้านโทเค็นอินพุต และ $7.50 ต่อล้านโทเค็นเอาต์พุต โดยอินพุตที่แคชไว้อยู่ที่ $0.25 รายการของ 26.10 Preview ระบุ $0.80, $3.20 และ $0.03 ตามลำดับ — คิดเป็นประมาณหนึ่งในสามของอัตราค่าอินพุต และเกิน 40% ของอัตราค่าเอาต์พุตเล็กน้อย
• คะแนน Benchmark — เผยแพร่เป็นครั้งแรกสำหรับรุ่นนี้ และเป็นข้อมูลเบื้องต้นตามที่ผู้ขายระบุเอง
• ตัวเลือกที่เสถียร — 26.10 Preview เป็นเวอร์ชันพรีวิว ข้อความในแคตตาล็อกของ Unbiased ระบุว่ามัน "อาจเปลี่ยนแปลงได้โดยไม่แจ้งให้ทราบ" และชี้ให้ผู้ที่ต้องการพฤติกรรมที่คาดเดาได้ไปที่รุ่นก่อนหน้าแทน
ทุกอย่างอื่นยังคงเดิม เอาต์พุตสูงสุดยังคงอยู่ที่ 131,072 โทเคน อินพุตยังคงเป็นข้อความและรูปภาพ เอาต์พุตยังคงเป็นข้อความเท่านั้น ยังไม่มีตัวระบุ Hugging Face บนรายการ ดังนั้นน้ำหนักโมเดลจึงยังคงปิดอยู่ และยังมีผู้ให้บริการเสิร์ฟโมเดลเพียงรายเดียวเท่านั้น — Unbiased เอง — โดยไม่มีโฮสต์รายที่สองอยู่ในรายการ

ราคาคือส่วนที่คุ้มค่าที่จะอ่านซ้ำสองครั้ง
บนแพลตฟอร์มของ Unbiased เอง อัตราค่าบริการไม่ได้ขยับ การ์ดโมเดลและหน้าราคาต่างก็ยังระบุ $2.50 ต่ออินพุตหนึ่งล้าน $0.25 สำหรับแบบแคช $7.50 เอาต์พุต — ตัวเลขสามตัวเดียวกันกับที่การเปิดตัวในเดือนกันยายนมี — และเนื่องจากสตริงโมเดลยังคงเป็นpareto ลูกค้าที่ใช้ API ของผู้ให้บริการรายนี้จึงจ่ายในอัตราเหล่านั้นสำหรับ 26.10 Preview ตัวเลขที่ต่ำกว่าคือตัวเลขที่อยู่ในรายการแคตตาล็อกแบบจัดเส้นทาง และช่องว่างระหว่างทั้งสองก็เป็นสิ่งที่ตัดสินการโยกย้ายพอดี
สามารถตีความได้สองแบบ และผู้ขายยังไม่ได้ระบุว่าแบบใดเป็นจริง ไม่ว่าจะเป็น 26.10 Preview ที่ถูกให้บริการในราคาถูกกว่าผ่านช่องทางนั้นจริง ๆ ในฐานะการผลักดันช่วงแนะนำ หรือรายการดังกล่าวสะท้อนข้อตกลงทางการค้าที่แตกต่างจากแพลตฟอร์มโดยตรง Unbiased ไม่ได้ประกาศวันสิ้นสุดโปรโมชัน และราคาที่กำหนดในวันเปิดตัวก็ไม่ใช่คำมั่นสัญญา
นี่คือส่วนเดียวของเรื่องที่เราเตอร์เปลี่ยนรูปโฉม OrcaRouter ส่งผ่านราคาตามรายการของผู้ให้บริการโดยตรง โดยบวกเพิ่ม 0% ดังนั้นเมื่อผู้ขายลดราคา ฝั่งเราจะมีผลในวันเดียวกับที่ประกาศใช้ ไม่ใช่ตามรอบสัญญา — และการสลับสำรองอัตโนมัติหมายความว่ารีลีสพรีวิวที่พฤติกรรมเปลี่ยนไปในสัปดาห์หน้าสามารถถูกสลับออกได้โดยไม่ต้องแก้โค้ด เราไม่ได้ให้บริการ Pareto 26.10 Preview ของ Unbiased ดังนั้นแบบที่ตรงไปตรงมาก็คือ ถ้าคุณต้องการโมเดลนี้โดยเฉพาะ ให้เรียกใช้ผ่าน API ของ Unbiased เอง ประเด็นอยู่แค่ที่ว่า บนรีลีสพรีวิว ราคาและเวอร์ชันต่างก็เป็นตัวแปร และไม่ควรปักหมุดทั้งคู่ไว้ในโค้ด
แผ่นเบนช์มาร์ก พร้อมป้ายกำกับที่ติดมาด้วย
Unbiased เผยแพร่คะแนนสี่รายการสำหรับ 26.10 Preview โดยแต่ละรายการจับคู่กับต้นทุนต่องานที่วัดได้ และแต่ละรายการมีข้อแม้ที่ผู้ขายเขียนขึ้นเอง ให้อ่านสิ่งเหล่านี้ว่าดำเนินการโดยผู้ขายและยังไม่ได้ทำซ้ำ เพราะนั่นคือสิ่งที่มันเป็น:
• DeepSWE v1.1 (การเขียนโค้ดแบบเอเจนต์) — 69.9% ที่ $0.24 ต่องาน
• Terminal-Bench 4.0 (การใช้งานเทอร์มินัลแบบเอเจนต์) — 50.8% ที่ $0.48 ต่องาน
• Humanity's Last Exam แบบข้อความเท่านั้น (การให้เหตุผลระดับผู้เชี่ยวชาญ) — 49.9% ที่ $0.008 ต่องาน
• GPQA-Diamond (การให้เหตุผลทางวิทยาศาสตร์) — 92.4% ที่ $0.004 ต่องาน

การวางกรอบของเจ้าของผลิตภัณฑ์คือ 26.10 Preview "เทียบเท่าหรือสร้างพรมแดนพาเรโต (Pareto frontier) ในทั้งสี่เบนช์มาร์ก" สเปรดชีตที่พวกเขาเผยแพร่ควบคู่กับคำกล่าวอ้างนั้นมีความเฉพาะเจาะจงมากกว่า และเป็นเครดิตของ Unbiased ที่เผยแพร่สิ่งนี้ออกมาทั้งหมด บน Terminal-Bench 4.0 มีการระบุ GPT 6 Astra ไว้ที่ 58 และ Fable 5.1 ที่ 56 ซึ่งทั้งคู่อยู่เหนือ 50.8 ของ Pareto และส่วน "จุดที่โมเดลอื่นได้คะแนนสูงกว่า" ของเจ้าของผลิตภัณฑ์เองก็ระบุเช่นนั้นโดยตรง บน DeepSWE v1.1 ตัวรีลีสอยู่ในกลุ่มเดียวกัน — GLM-5.3 และ Kimi K3 ถูกระบุไว้ที่ 69.0 เทียบกับ 69.9 ของ Pareto — ซึ่งในทางปฏิบัติถือว่าเสมอกัน และอยู่ในช่วงค่าความคลาดเคลื่อนใดก็ตามที่การรันครั้งเดียวมี
ตัวเลขการเปรียบเทียบมีข้อควรระวังประการที่สองที่สำคัญยิ่งกว่าประการแรก: ตัวเลขเหล่านี้ถูกถอดมาจากการเปรียบเทียบเมื่อวันที่ 21 กันยายน และตามคำพูดของผู้ขายแล้ว "ไม่ได้รับการตรวจสอบยืนยันอย่างเป็นอิสระ" อีกทั้งยังได้มาจากการประเมินแยกต่างหากของแต่ละโมเดล — ดังนั้นจึงไม่ควรนำไปจับคู่กับตัวเลขต้นทุนต่องานของ Pareto ราวกับว่าทั้งสองมาจากการทดสอบชุดเดียวกัน ผู้ขายระบุไว้เช่นนั้นในรายละเอียดการประเมิน ผู้อ่านที่ข้ามบรรทัดนั้นจะตีความกราฟเกินจริง
สิ่งที่ทั้งหมดนี้ไม่ได้เป็นก็คือ ความเป็นอิสระ Artificial Analysis ซึ่งเป็นบอร์ดที่ทีมส่วนใหญ่ตรวจสอบก่อนจะเชื่อชื่อใหม่บนตารางราคา ไม่มีหน้าสำหรับ Pareto เลย ตัวเลขทุกตัวข้างต้นล้วนมาจากบริษัทที่ขายโมเดลนี้ สิ่งเดียวที่ทำให้เรื่องนี้เบาลงคือ eval harness นั้นเปิดเผยต่อสาธารณะ — ผู้ขายเผยแพร่ชุดทดสอบเทียบตรงกัน (head-to-head) ที่ทำซ้ำได้ ซึ่งใครก็สามารถชี้ไปที่ endpoint หนึ่งได้ — ซึ่งเปลี่ยน "เชื่อคะแนนของเรา" ให้กลายเป็น "รันคะแนนของเราใหม่" นั่นเป็นข้อเสนอจริง และไม่เหมือนกับตัวเลขที่ผ่านการตรวจสอบยืนยันแล้ว ยังไม่มีใครเผยแพร่ผลการรันซ้ำนั้นเลย
ความหมายของ "preview" ในสัญญา
คำนี้ทำงานหนักกว่าที่บันทึกประจำรุ่นระบุไว้ เอกสารของ Unbiased เองอธิบายการเข้าถึงในปัจจุบันว่าเป็นการเข้าถึงเพื่อประเมินผลภายใต้ข้อกำหนดของตน และระบุว่าการใช้งานเชิงพาณิชย์หรือการใช้งานจริงต้องมีข้อตกลงเป็นลายลักษณ์อักษรแยกต่างหาก บัญชีใหม่จะถูกตรวจสอบด้วยมือก่อนที่จะออกคีย์ API API นี้เข้ากันได้กับ OpenAI และ Anthropic — base URL, คีย์, สตริงโมเดล ไม่ต้องเขียนใหม่ — แต่ส่วนที่ระบุในเอกสารมีเพียง chat completions และ messages เท่านั้น พร้อมช่องโหว่ที่รู้กันดีซึ่งผู้ให้บริการเปิดเผยอย่างตรงไปตรงมา: GET /v1/models ยังไม่ถูกนำไปใช้งาน และตัวระบุโมเดลที่ไม่รู้จักก็ไม่ถูกปฏิเสธ ดังนั้นผู้เรียกจึงต้องส่ง pareto อย่างชัดเจนแทนที่จะค้นหาว่ามีอะไรให้ใช้ได้บ้าง
รวมป้ายกำกับพรีวิวกับสัญญาไพรเวตเบตาเข้าด้วยกัน แล้วคำแนะนำด้านการดำเนินงานก็เขียนขึ้นมาเอง นี่คือโมเดลสำหรับประเมินเทียบกับเวิร์กโหลดของคุณเองหลังเลเยอร์การกำหนดเส้นทาง ไม่ใช่โมเดลที่จะเอาไปวางไว้หน้าทราฟฟิกสร้างรายได้แล้วลืมมันไป กลไกสำหรับเรื่องนั้นไม่หวือหวา: ห่วงโซ่สำรองที่ตั้งค่าไว้ครั้งเดียว ดังนั้นรีลีสที่เปลี่ยนไปภายใต้คุณกลางสัปดาห์จึงกลายเป็นการเปลี่ยนแปลงคอนฟิกแทนที่จะเป็นเหตุการณ์ผิดปกติ Unbiased ใช้เดือนกันยายนแก้ปัญหาประเภทนี้บนฝั่งของตัวเองโดยเฉพาะ — รายการเชนจ์ล็อกเมื่อวันที่ 16 กันยายนบันทึกว่าประมาณ 13% ของคำขอแบบไม่สตรีมมิ่งที่มีความยาวนั้นชนไทม์เอาต์ 120 วินาที และเพดานของเกตเวย์ถูกเพิ่มเป็น 300 วินาที นั่นคือผู้ขายที่พูดตรงไปตรงมาเกี่ยวกับขอบหยาบๆ มันยังเป็นเครื่องเตือนใจว่าโปรไฟล์การดำเนินงานของพรีวิวยังคงถูกเขียนอยู่

สิ่งที่ต้องระวังก่อนตัดสินใจ
สามเรื่องเฉพาะเจาะจงจะช่วยคลี่คลายคำถามที่ยังค้างคาอยู่ และแต่ละเรื่องก็ตรวจสอบได้
อย่างแรกคือคะแนนที่เป็นอิสระ จนกว่าหน่วยงานภายนอกจะรัน 26.10 Preview บนฮาร์เนสที่เผยแพร่สาธารณะ คะแนน 92.4 บน GPQA-Diamond และ 50.8 บน Terminal-Bench ก็เป็นคำกล่าวอ้างของผู้ขายเกี่ยวกับงานของผู้ขายเอง — ดีพอที่จะตัดสินใจว่าจะทดสอบหรือไม่ แต่ไม่ดีพอที่จะตัดสินใจว่าจะย้ายระบบหรือไม่
อย่างที่สองคือผลที่พรีวิวมีต่อราคา หากลิสติ้งที่ถูกจัดเส้นทางยังคงอยู่ที่ $0.80 และ $3.20 ในขณะที่แพลตฟอร์มของผู้ขายเองตั้งไว้ที่ $2.50 และ $7.50 ความแตกต่างนี้คือการตัดสินใจเรื่องช่องทางที่ควรค่าแก่การทำความเข้าใจ ก่อนที่คุณจะสร้างโมเดลต้นทุนจากตัวเลขใดตัวเลขหนึ่ง
ประการที่สามคือสิ่งที่ “อาจเปลี่ยนแปลงได้โดยไม่ต้องแจ้งให้ทราบล่วงหน้า” หมายถึงในทางปฏิบัติจริง ๆ พรีวิวที่ถูกแก้ไขสองครั้งในหนึ่งเดือนเป็นเครื่องมือคนละแบบกับพรีวิวที่ถูกตรึงไว้และเปลี่ยนชื่อเมื่อสิ้นไตรมาส และบันทึกการเปลี่ยนแปลงคือจุดที่เรื่องนี้จะปรากฏขึ้นก่อน
ไม่มีข้อโต้แย้งใดในนี้ที่ต่อต้านการลองใช้มัน โมเดลมัลติโมดัลขนาด 1M โทเคนที่รายงานคะแนนใกล้เคียงระดับแนวหน้าในราคา $0.24 ต่อหนึ่งงานนั้นคุ้มค่ากับการลงมือทำงานจริงกับพรอมป์ของคุณเองสักบ่ายหนึ่ง และการประเมินนั้นมีค่าใช้จ่ายน้อยกว่าการถกเถียงเกี่ยวกับมันเสียอีก มันต่อต้านการสันนิษฐานว่าโมเดลที่คุณวัดผลในสัปดาห์นี้จะเป็นโมเดลที่คุณได้รับในสัปดาห์หน้า — ซึ่งสำหรับการเปิดตัวที่ผู้ขายเองเรียกมันว่าพรีวิว นั่นคือสมมติฐานเดียวที่จำเป็นต้องถูกต้อง
การเปิดตัวเวอร์ชันพรีวิวเป็นกรณีที่การสลับระบบสำรองอัตโนมัติถูกสร้างขึ้นมาเพื่อรองรับโดยเฉพาะ: การสลับระบบสำรองอัตโนมัติเปลี่ยนโมเดลที่เปลี่ยนแปลงไปภายใต้คุณกลางสัปดาห์ให้กลายเป็นการปรับคอนฟิกแทนที่จะเป็นเหตุระบบล่ม
