
Pareto 26.10 Preview กับ Pareto: สตริงโมเดลเดียวกัน แต่เป็นสองโมเดลที่แตกต่างกัน
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 221 tok/s
- OpenAIใหม่OpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- Anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIใหม่Grok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 103 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
Unbiased ปล่อย Pareto 26.10 Preview เมื่อวันที่ 1 ตุลาคม 2026 และทิ้งรุ่นก่อนหน้าคือ Pareto ไว้ในรายการข้าง ๆ มัน ทั้งสองไม่ใช่ตัวแปรของตระกูลที่คุณเลือกอย่างใดอย่างหนึ่งด้วยแฟล็ก พวกมันคือสองรีลีสภายใต้แบรนด์เดียว และสตริงโมเดลของผู้ขายเอง — pareto — ตอนนี้ชี้ไปที่รุ่นใหม่กว่า ซึ่งไม่เสถียรอย่างชัดเจน ดังนั้นคำถามในการเปรียบเทียบจึงไม่ใช่ "อันไหนดีกว่า" จริง ๆ แต่คือ: คำขอของคุณไปถึงอันไหนกันแน่ และจะเกิดอะไรขึ้นกับคำตอบเมื่อสิ่งนั้นเปลี่ยนไปใต้เท้าคุณ?
ที่เดียวที่ทั้งสองถูกกล่าวถึงพร้อมกันคือรายการข้อมูลทางเทคนิคสาธารณะของโมเดล การ์ดโมเดล หน้าราคา และคำถามที่พบบ่อยของ Unbiased เอง อธิบายเป็นผลิตภัณฑ์แบบรวมเดียว และไม่เคยเอ่ยถึงการแยกส่วนนั้น ความไม่สมมาตรนั้น — ความแตกต่างโดยละเอียดที่เปิดเผยต่อสาธารณะในฝั่งหนึ่ง และความเงียบในอีกฝั่งหนึ่ง — คือจุดเริ่มต้นที่ซื่อตรงสำหรับการเปรียบเทียบแบบตัวต่อตัว เพราะมันบอกคุณว่าตัวเลขทุกตัวด้านล่างมาจากไหน
หกมิติ ทั้งสองด้าน
ทุกสิ่งที่ทำให้รีลีสเหล่านี้แตกต่างกันอยู่ในหกบรรทัดนี้ ด้านซ้ายคือ Pareto 26.10 Preview ส่วนด้านขวาคือ Pareto รีลีสจากวันที่ 17 กันยายน ซึ่งเป็นเวอร์ชันที่ข้อความแค็ตตาล็อกของพรีวิวเรียกว่า ตัวเลือกที่เสถียร
• หน้าต่างบริบท — 1,048,576 โทเคน เทียบกับ 262,144 โทเคน มากกว่าถึงสี่เท่าตามสเปก โดยทั้งสองแบบไม่มีระดับที่เล็กกว่าให้เลือก
• เอาต์พุตสูงสุด — 131,072 โทเคน เทียบกับ 131,072 โทเคน ไม่เปลี่ยนแปลง หน้าต่างที่ใหญ่ขึ้นไม่ได้มาพร้อมคำตอบที่ใหญ่ขึ้น
• ราคาอินพุต ตามเส้นทางที่กำหนด — $0.80 ต่อล้าน เทียบกับ $2.50 ต่อล้าน ตัวพรีวิวมีราคาประมาณหนึ่งในสามของราคาในรายการนั้น
• ราคาเอาต์พุต ตามเส้นทางที่กำหนด — $3.20 ต่อล้าน เทียบกับ $7.50 ต่อล้าน ต่ำกว่าครึ่ง
• อินพุตแคช ตามเส้นทางที่กำหนด — $0.03 ต่อล้าน เทียบกับ $0.25 ต่อล้าน เส้นทางการทำงานของเอเจนต์ที่ยาวที่สุดได้ประโยชน์มากที่สุดตรงนี้
• ตารางเกณฑ์มาตรฐานที่เผยแพร่ — คะแนนสี่รายการ ระบุชัดว่า "เบื้องต้น" และ "อาจเปลี่ยนแปลงก่อนการเผยแพร่ฉบับสมบูรณ์" เทียบกับไม่มีตารางเกณฑ์มาตรฐานที่เผยแพร่เลย
สองแถวในนั้นคือแถวที่ตัดสินงานจริง ๆ หน้าต่างบริบทคือพาดหัวที่ผู้ขายจะไม่ระบุบนเว็บไซต์ของตัวเอง — มันอยู่บนหน้าประกาศ ไม่ใช่บนการ์ดโมเดล — และราคาอินพุตแบบแคชคือสิ่งที่เปลี่ยนบิลของเอเจนต์ ไม่ใช่เพดานของมัน ทุกอย่างที่เหลือไม่ใช่ส่วนต่างทางการตลาด ก็เป็นการยอมรับอย่างหนึ่ง ในกรณีของคะแนนเอาต์พุต: การเผยแพร่ตัวเลขของพรีวิวพร้อมป้ายกำกับ "เบื้องต้น" นั้นซื่อสัตย์กว่าทางเลือกอื่น และมันยังเป็นคำเตือนอีกด้วย

ราคาที่คุณเห็นนั้นขึ้นอยู่กับว่าคุณดูจากที่ไหน
เอาตารางอัตราค่าบริการสองตารางมาเทียบเคียงกันแล้วมันกลับไม่สอดคล้องกัน ซึ่งนั่นคือส่วนหนึ่งของการเปรียบเทียบนี้ที่ยังไม่มีใครอธิบาย
แพลตฟอร์มของ Unbiased เอง ในวันที่ 26.10 Preview กลายเป็นเวอร์ชันเผยแพร่ปัจจุบัน ยังคงระบุ $2.50 ต่ออินพุตหนึ่งล้าน $0.25 สำหรับแคช และ $7.50 สำหรับเอาต์พุต ตัวเลขเหล่านี้เป็นตัวเลขของเดือนกันยายน ไม่เปลี่ยนแปลง ทั้งบนหน้าราคาและบนการ์ดโมเดล ชุดที่ต่ำกว่า — $0.80, $0.03, $3.20 — ปรากฏอยู่ในรายการแคตตาล็อกแบบ routed สำหรับพรีวิวเดียวกัน ดังนั้นลูกค้าที่เรียก pareto โดยตรงผ่าน API ของผู้ขาย จะจ่ายตามการ์ดราคาเดิมสำหรับโมเดลใหม่ ขณะที่รายการแบบ routed โฆษณาไว้เพียงประมาณหนึ่งในสามของราคานั้น ทั้งสองอย่างยังใช้งานอยู่ ผู้ขายไม่ได้ประกาศวันสิ้นสุดโปรโมชัน และไม่มีแถลงการณ์ที่ทำให้ทั้งสองอย่างสอดคล้องกัน
นั่นเป็นคำถามเรื่องช่องทาง และกับรีลีสพรีวิว มันยังเป็นคำถามเรื่องจังหวะเวลาด้วย: ไม่ว่าคุณจะจำลองต้นทุนจากตัวเลขไหน อีกตัวเลขหนึ่งก็ห่างจากการกลายเป็นตัวเลขที่ถูกต้องเพียงบันทึกการอัปเดตรีลีสฉบับเดียว เราเตอร์ที่ส่งต่อราคาตั้งของผู้ให้บริการโดยไม่บวกเพิ่ม 0% ขจัดความยุ่งยากนี้ไปได้พอดี — การเปลี่ยนแปลงราคาของผู้ขายมีผลทันทีในวันเดียวกัน แทนที่จะรอถึงการทบทวนสัญญาครั้งถัดไป — และนั่นคือสิ่งเชิงโครงสร้างเพียงอย่างเดียวที่คุ้มค่าจะยืมมาจาก OrcaRouterตรงนี้ วันนี้เราไม่ได้มีรีลีส Unbiased ตัวใดเลย ดังนั้นคำตอบตรง ๆ สำหรับ "ฉันจะเรียกมันจากที่ไหน" คือ API ของ Unbiased เอง โดยอิงกับชุดราคาชุดใดก็ตามจากสองชุดที่รายการซึ่งคุณซื้อผ่านนั้นมีอยู่ เหตุผลที่ต้องพูดออกมาดัง ๆ ก็คือความแตกต่างนั้นอยู่ที่ปัจจัยสามเท่า และพรีวิวไม่ใช่ที่สำหรับมาค้นพบว่าคุณตั้งราคาผิดตัว
สิ่งที่การแสดงตัวอย่างมอบให้คุณ และสิ่งที่คุณต้องแลกไป
คำอธิบายในแค็ตตาล็อกของตัวพรีวิวเองเป็นตัวกำหนดเงื่อนไขไว้: มัน "อาจเปลี่ยนแปลงได้โดยไม่ต้องแจ้งให้ทราบ" และใครก็ตามที่ต้องการพฤติกรรมที่คาดเดาได้ก็จะถูกชี้กลับไปที่รีลีสเดือนกันยายน นั่นไม่ใช่ข้อความสำเร็จรูป — มันคือคำนิยามของผลิตภัณฑ์ ลองนำไปเทียบกับลักษณะการใช้งานจริงของเซสชันเอเจนต์ที่ยาวนาน แล้วข้อแลกเปลี่ยนนั้นจะกลายเป็นรูปธรรมขึ้นมา
เอเจนต์ที่ทำให้บทสนทนาดำเนินต่อไปจะสะสมบริบท และบทสนทนายาว ๆ คือที่ที่ prompt caching คุ้มค่าตัวจริง ๆ โมเดลที่เปลี่ยนไปภายใต้ endpoint ที่ไม่เปลี่ยนคือวิธีคลาสสิกที่จะทำให้สูญเสียมันไป เพราะแคชผูกคีย์เข้ากับโมเดลที่สร้างโทเคนเหล่านั้น ดังนั้นการสลับเวอร์ชันแบบเงียบ ๆ ระหว่างทางอาจทำให้สิ่งที่คุณแคชไว้ใช้ไม่ได้ และเรียกเก็บเงินซ้ำสำหรับงานที่คุณคิดว่าจ่ายไปแล้ว เอกสารของ Unbiased เองโต้แย้งประเด็นนี้ในทิศทางตรงกันข้าม โดยวางตำแหน่งการผสมผสาน (blend) ของตนว่ามีความเสถียรต่อแคช ขณะที่เราเตอร์แบบสลับเปลี่ยนไม่เป็นเช่นนั้น นี่จึงเป็นความเสี่ยงที่ผู้ขายเข้าใจดีและเพียงยอมรับ เพื่อแลกกับการปล่อยพรีวิวออกมา ควรเอ่ยถึงเรื่องนี้เพราะความล้มเหลวดังกล่าวมองไม่เห็นในแดชบอร์ด: โทเคนของคุณยังถูกเรียกเก็บเงิน คำตอบของคุณยังส่งกลับมา และตัวเลขก็แค่สูงกว่าเมื่อสัปดาห์ที่แล้ว
ข้อดีของพรีวิวเป็นของจริงและสะท้อนข้อเสียในแบบเดียวกัน มีบริบทมากกว่า 4 เท่า อินพุตแบบแคชในอัตราหนึ่งในแปดของอัตรารุ่นเสถียรบนรายการที่จัดเส้นทางไว้ และมีตาราง benchmark ให้ด้วย — รุ่นที่เปิดตัวเดือนกันยายนไม่เคยมีคะแนนที่เผยแพร่เลย หากเวิร์กโหลดของคุณเป็นแบบบริบทขนาดยาวและไวต่อค่าใช้จ่าย พรีวิวคือตัวที่คุณต้องการ และวิธีใช้มันโดยไม่เดิมพันทั้งสแต็กคือปักหมุดไว้อย่างตั้งใจ: เอนด์พอยต์ที่ตั้งชื่อไว้สำหรับพรีวิว เอนด์พอยต์ที่ตั้งชื่อไว้สำหรับรุ่นเสถียร และ การสลับสำรองระหว่างทั้งสองที่ตั้งค่าไว้ครั้งเดียว DSL สำหรับจัดเส้นทางมีไว้สำหรับปัญหาที่มีรูปแบบแบบนี้โดยเฉพาะ — ประกอบทั้งสองเป็นขาแยกกัน ส่งทราฟฟิกจริงบางส่วนลงแต่ละขา และให้บันทึกคำขอบอกคุณว่าแต่ละขาใช้ค่าใช้จ่ายจริงเท่าไร พรีวิวควรเป็นการตัดสินใจที่คุณย้อนกลับได้ด้วยบรรทัดคอนฟิกเพียงบรรทัดเดียว ไม่ใช่คุณสมบัติของเอนด์พอยต์ที่คุณรู้จากใบแจ้งหนี้

ภาพรวมประสิทธิภาพที่ไม่เสถียรพอจะเชื่อถือได้
ตัวเลขทุกตัวข้างต้นมาจากหน้าประกาศสาธารณะ และแผงแสดงประสิทธิภาพของหน้านั้นเองก็เปลี่ยนแปลงไปมาระหว่างการอ่านแต่ละครั้งในวันเปิดตัว การอ่านหน้าตัวอย่าง 26.10 ครั้งหนึ่งรายงานค่าความหน่วงมัธยฐานที่ 5.28 วินาที และ 35 โทเคนต่อวินาที ส่วนมุมมองแบบเทียบเคียงที่เผยแพร่ในวันเดียวกันรายงานว่า 3.54 วินาที และ 21 โทเคนต่อวินาทีสำหรับตัวตัวอย่าง และ 1.05 วินาที และ 45 โทเคนต่อวินาทีสำหรับเวอร์ชันเปิดตัวเดือนกันยายน นั่นไม่ใช่ความคลาดเคลื่อนเล็กน้อย โมเดลใหม่เอี่ยมที่ให้บริการโดยผู้ให้บริการรายเดียวมีฐานการวัดที่บาง และหน้าต่างแบบเลื่อนที่ครอบคลุมหลายชั่วโมงย่อมเปลี่ยนแปลง
จุดยืนที่ซื่อสัตย์คือ ไม่มีรีลีสใดมี throughput หรือตัวเลขที่มั่นคงพอจะใช้วางแผนได้ และสำหรับพรีวิวนั้น สิ่งนี้เป็นคุณสมบัติที่ติดมากับผลิตภัณฑ์ ไม่ใช่ปัญหาจาก snapshot รีลีสเดือนกันยายนอย่างน้อยก็มีทราฟฟิกมาหลายสัปดาห์ — รายการของมันแสดงความพร้อมใช้งานหลายวันในระดับเก้าสิบปลาย ๆ โดยมีประวัติผู้ให้บริการเต็มรูปแบบรองรับอยู่ ส่วนพรีวิวมีเพียงไม่กี่ชั่วโมง ถ้าเหตุผลที่คุณเลือกระหว่างทั้งสองคือความเร็ว มากกว่าราคาหรือบริบท หลักฐานที่จะใช้ตัดสินใจยังไม่มี และสิ่งที่ควรทำอย่างมีความรับผิดชอบคือการวัดจากพรอมป์ต์ของคุณเอง ไม่ใช่ตัวเลขจากหน้าใดหน้าหนึ่ง

จะโทรหาใครดี และจะหยุดแคร์ได้อย่างไร
เรียกใช้พรีวิวหากงานของคุณเป็นงานบริบทยาว ไวต่อต้นทุน และประเมินผลได้ — เซสชันของเอเจนต์ การประมวลผลแบบแบตช์ อะไรก็ตามที่หน้าต่างใหญ่ขึ้นสี่เท่าและราคาอินพุตหนึ่งในสามคุ้มกับความเสี่ยงจากการเปลี่ยนแปลงกลางสัปดาห์ มองมันเป็นการทดลองที่มีบรรทัดกำหนดค่าอยู่ข้างใต้ และเก็บตัวเลขของคุณเองไว้ เพราะตัวเลขของผู้ขายจะเปลี่ยน
จงใช้ stable Pareto หากเวิร์กโหลดของคุณเป็นงานโปรดักชัน ไวต่อความหน่วง หรืออยู่ภายใต้การตรวจสอบด้านการปฏิบัติตามข้อกำหนดที่ไม่ต้องการโมเดลซึ่งถูกอธิบายว่าอาจเปลี่ยนแปลงได้โดยไม่แจ้งให้ทราบ คุณจะสละหน้าต่าง 1M แคชที่ถูกกว่า และคะแนนที่เผยแพร่ แต่คุณยังได้เอนด์พอยต์ที่มีประวัติผลงานที่ผ่านมาและชื่อที่ยังหมายถึงสิ่งเดียวกันในสัปดาห์หน้า สำหรับหลายทีม นั่นคือความต้องการทั้งหมด
ความผิดพลาดคือการมองว่านี่เป็นการแยกสาขาแบบถาวร Unbiased สร้างการแยกนี้ออกมาให้เป็นเพียงชั่วคราว — พรีวิวมีอยู่เพื่อให้ถูกประเมินแล้วจากนั้นจึงถูกผนวกรวมไป — และการตัดสินใจที่สำคัญไม่ใช่ว่าคุณจะเลือกอันใดจากสองอันนี้ แต่เป็นว่าการสลับระหว่างสองอันนี้เป็นงานห้านาทีหรือเป็นโปรเจกต์รายไตรมาส บนปลายทางเดียวที่มีสตริงโมเดลเดียว ตอนนี้มันไม่ใช่ทั้งสองอย่าง: มันคือประกาศที่คุณต้องคอยจับให้ทัน จงกำหนดค่าตัวเลือกนี้ให้เป็นการตัดสินใจด้านการกำหนดเส้นทางแทน แล้วเวอร์ชันที่คุณเรียกใช้จะกลายเป็นปุ่มหมุน ซึ่งเป็นท่าทีเดียวที่รีลีสพรีวิวเคยให้รางวัลจริง ๆ
