
Step 5 Preview เทียบกับ Claude Opus 5: เจ็ดคะแนนดัชนีแลกกับค่าใช้จ่ายที่แพงขึ้นเจ็ดเท่า
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0345ความฉลาด76การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
เอกสารเปิดตัวของ StepFun สำหรับ Step 5 Previewเปิดด้วยข้อกล่าวอ้างเชิงเปรียบเทียบเพียงข้อเดียว: งานหนึ่งงานที่รันบนโมเดลนี้มีค่าใช้จ่ายเป็นหนึ่งในแปดของงานเดียวกันที่รันบน Claude Opus 5 ตอนนี้ทั้งสองโมเดลอยู่ในกระดานจัดอันดับอิสระเดียวกัน ดังนั้นข้อกล่าวอ้างนั้นจึงตรวจสอบได้แทนที่จะต้องมาเถียงกัน Artificial Analysis รันแต่ละโมเดลผ่าน Intelligence Index v4.3.2 — การประเมินสิบรายการ — และเผยแพร่ว่าแต่ละการรันมีค่าใช้จ่ายเท่าใด โดย Claude Opus 5 ได้คะแนนที่การตั้งค่าความพยายามในการใช้เหตุผลสูงสุดของตัวเอง Step 5 Preview: 44 บนดัชนี, $922.84 เพื่อรันให้เสร็จสิ้น Claude Opus 5: 51 บนดัชนี, $7,274.74 นั่นคือเงิน 7.9 เท่าเพื่อคะแนน 7 คะแนน และอัตราส่วนที่ StepFun อ้างไว้กลับกลายเป็นอัตราส่วนที่ถูกต้อง สิ่งที่อัตราส่วนนี้ซ่อนไว้คือส่วนที่น่าสนใจ เพราะช่องว่างนี้ไม่ได้เป็นช่องว่างด้านราคาเป็นหลัก มันคือช่องว่างด้านความเยิ่นเย้อที่สวมเสื้อผ้าของช่องว่างด้านราคา และการแยกสองสิ่งนี้ออกจากกันจะเปลี่ยนว่าโมเดลใดควรถูกวางไว้กับงานแบบใด
ต้นทุนการรันสองรายการ หนึ่งบอร์ด และสิ่งที่อยู่ข้างในนั้นจริง ๆ
ต้นทุนการรันทั้งหมดเป็นการเปรียบเทียบเดี่ยวที่สะอาดที่สุดเท่าที่มีให้ใช้ตรงนี้ เพราะโมเดลทั้งสองตอบคำถามชุดเดียวกันภายใต้ฮาร์เนสเดียวกัน และไม่มีผู้ขายรายใดเป็นผู้สร้างตัวเลขนี้ขึ้นมาเอง มันยังเป็นตัวเลขที่มีแนวโน้มจะถูกตีความผิดมากที่สุดด้วย ดังนั้นจึงคุ้มค่าที่จะเปิดมันออกมาให้เห็นชัด
• คะแนน Index — Step 5 Preview 44 เทียบกับ Claude Opus 5 51 โดย Claude Opus 5 ได้คะแนนจากการตั้งค่าความพยายามในการใช้เหตุผลสูงสุด
• ค่าใช้จ่ายรวมในการทำดัชนีให้เสร็จสมบูรณ์ — Step 5 Preview $922.84 เทียบกับ Claude Opus 5 $7,274.74
• ราคาผสมที่ส่วนผสมของแคชฮิต / อินพุต / เอาต์พุต 7:2:1 — Step 5 Preview $0.51 ต่อ 1 ล้านโทเค็น เทียบกับ Claude Opus 5 $3.85
• โทเคนเอาต์พุตที่สร้างขึ้นระหว่างการรันดัชนี — Step 5 Preview 160M เทียบกับ Claude Opus 5 140M
• ราคาตามรายการ — Step 5 Preview อินพุต $1.00 / เอาต์พุต $2.70 เทียบกับ Claude Opus 5 อินพุต $5.00 / เอาต์พุต $25.00
ดูแถวที่สามและห้ารวมกัน แล้วการคำนวณก็ไม่ใช่การเปรียบเทียบราคาแบบตรงไปตรงมาอีกต่อไป อัตราแบบผสมของ Step 5 Preview ถูกกว่า 7.5 เท่า และอัตราตามรายการถูกกว่าสำหรับอินพุต 5 เท่า และถูกกว่าสำหรับเอาต์พุต 9.3 เท่า — ดังนั้นส่วนผสมจึงทำหน้าที่ในสิ่งที่ราคาอินพุตไม่ได้ทำ นั่นเป็นเพราะส่วนผสมให้น้ำหนักไปทางเอาต์พุต และเอาต์พุตคือจุดที่ทั้งสองโมเดลแตกต่างกันมากที่สุด Claude Opus 5 คิดราคาสูงกว่าอัตราเอาต์พุตของ Step 5 Preview ถึง 9.3 เท่า และทั้งสองโมเดลเขียนข้อความปริมาณมาก: โทเค็นเอาต์พุต 140 ล้านสำหรับ Claude Opus 5 เทียบกับค่ามัธยฐาน 92 ล้านจากโมเดลที่ดัชนีให้คะแนน และ 160 ล้านสำหรับ Step 5 Preview เทียบกับค่ามัธยฐาน 92 ล้านเดียวกัน
ดังนั้นการตีความอย่างตรงไปตรงมาจึงแคบกว่า “โมเดลราคาถูกคือของคุ้ม” Step 5 Preview ถูกกว่าในทุกมิติ และมันไม่ใช่โมเดลที่ประหยัด — มันเขียนเอาต์พุตมากกว่าโมเดลค่ามัธยฐานที่นำมาเปรียบเทียบด้วยถึง 74% ซึ่งเป็นพฤติกรรมที่ราคานี้ควรลงโทษพอดี Claude Opus 5 เขียนมากกว่าค่ามัธยฐาน 52% และคิดราคาสูงกว่า 9.3 เท่าสำหรับแต่ละโทเคนเหล่านั้น ผู้เรียกใช้ที่จำกัดความยาวเอาต์พุตจะได้อัตราส่วนที่ต่างจากผู้ที่ไม่จำกัด
คำถามไม่ใช่ว่าอันไหนดีกว่า แต่อยู่ที่ว่าจุดตัดอยู่ตรงไหน
สมมติว่าดัชนีนี้เป็นตัวแทนที่สมเหตุสมผลของงานที่คุณส่งจริง — งานแบบเอเจนต์ระยะยาว โค้ด และการใช้เครื่องมือหลายขั้นตอน จุดตัดก็พูดได้ง่าย ๆ ว่า Claude Opus 5 ต้องมีประโยชน์ต่องานมากกว่าอย่างน้อย 7.9 เท่า ก่อนที่มันจะคุ้มกับค่าใช้จ่ายของมัน และบนดัชนีนี้ มันดีกว่า 7 คะแนนบนสเกล 100 คะแนน ข้อเท็จจริงสองข้อนี้ไม่จำเป็นต้องชี้ไปทางเดียวกัน เพราะช่องว่างบนดัชนี 7 คะแนนไม่ได้หมายความว่าดีกว่า 16% ในทุกอย่าง มันคือผลรวมของการประเมินสิบรายการ และองค์ประกอบสำคัญกว่ายอดรวม
นั่นคือข้อโต้แย้งสำหรับการใส่ใจรูปร่างของคะแนนทั้งสองมากกว่าตัวเลขพาดหัว คะแนน Terminal-Bench 4.0 ของ Step 5 Preview อยู่ที่ 33.3% — เป็นผลลัพธ์แบบเอเจนต์ที่แท้จริง นำหน้า DeepSeek V4.1 Flash ที่ 26.8% — แต่ยังไม่มีสิ่งใดในบันทึกที่เผยแพร่ที่แสดงว่ามันเทียบเท่า Claude Opus 5 ในการประเมินระยะยาวซึ่งโมเดลของ Anthropic แข็งแกร่งที่สุด เอกสารของ StepFun เองยอมรับเรื่องนี้ผ่านถ้อยคำว่า บน ALE-CLI, FrontierFinance และ DRACO บริษัทจัดให้ Step 5 Preview อยู่อันดับสอง โดยมี GPT-6 Astra หรือ Claude Opus 5 อยู่ข้างหน้า และนำหน้าโมเดลแบบเปิดอื่น ๆ ในชุดเปรียบเทียบ การได้อันดับสองในราคาหนึ่งในห้าเป็นผลลัพธ์ที่ดีจริง ๆ และ它也ไม่ใช่อันดับหนึ่ง และงานที่โมเดลจบเป็นอันดับสองมักเป็นงานที่ต้องการอันดับหนึ่ง
ความไม่สมมาตรอีกประการหนึ่งคือสิ่งที่เกิดขึ้นเมื่อการเรียกครั้งนั้นผิดพลาด คำตอบที่ผิดจากโมเดลราคาถูกที่ใช้เวลา 4 วินาทีและ 2,000 โทเคนทำให้คุณต้องเสียการลองใหม่ คำตอบที่ผิดแบบเดียวกันจาก Claude Opus 5 ในราคา 25 ดอลลาร์ต่อโทเคนเอาต์พุตหนึ่งล้านทำให้คุณต้องเสียการลองใหม่บวกกับการครุ่นคิด หากไปป์ไลน์ของคุณลองใหม่เมื่อล้มเหลว — ลูปของเอเจนต์ส่วนใหญ่ทำเช่นนั้น — ต้นทุนที่มีประสิทธิผลต่องานที่สำเร็จคือตัวเลขที่สำคัญ และมันไม่ใช่อัตราส่วนเดียวกับราคาที่ประกาศไว้ เพราะโมเดลทั้งสองจะไม่ล้มเหลวในอัตราเดียวกัน ยังไม่มีใครเผยแพร่ตัวเลขนั้นสำหรับ Step 5 Preview

การเปรียบเทียบสเปก ทีละมิติ
• คะแนนดัชนี — Step 5 Preview 44 เทียบกับ Claude Opus 5 51 ทั้งคู่วัดบน Intelligence Index v4.3.2 โดย Claude Opus 5 อยู่ที่การตั้งค่า reasoning-effort สูงสุดของมัน
• ราคาต่อ 1M โทเคน — Step 5 Preview $1.00 ขาเข้า / $2.70 ขาออก เทียบกับ Claude Opus 5 $5.00 ขาเข้า / $25.00 ขาออก
• ส่วนลดแคช — Step 5 Preview 95% เทียบกับ Claude Opus 5 90%
• บริบท — ทั้งคู่ 1M โทเคน; StepFun ยังไม่เปิดเผยเพดานเอาต์พุต และของ Anthropic อยู่ที่ 128K
• อินพุต — ทั้งคู่รับข้อความและรูปภาพ ทั้งคู่ส่งออกเฉพาะข้อความเท่านั้น
• ความเร็วในการส่งออก — Step 5 Preview 99.8 โทเคน/วินาที เทียบกับ Claude Opus 5 55.3 โทเคน/วินาที
• พื้นผิวการควบคุม — Step 5 Preview เปิดให้ใช้งาน extended thinking; Claude Opus 5 แทนที่ temperature และ top_p ด้วยปุ่มปรับระดับความพยายามในการให้เหตุผลแบบปรับได้
• น้ำหนัก — Step 5 Preview ปิดวันนี้, เช็กพอยต์ BF16 กำหนดไว้สำหรับวันที่ 15 ตุลาคม; Claude Opus 5 เป็นกรรมสิทธิ์ตลอด
• หลักฐานอิสระ — ทั้งคู่ได้รับการให้คะแนนโดย Artificial Analysis; แถวเบนช์มาร์กแบบเอเจนต์ของ StepFun นั้นรันโดยผู้ขายและยังไม่มีการทำซ้ำ
สองแถวนี้สมควรได้รับการกล่าวถึงเป็นพิเศษ ช่องว่างด้านความเร็วนั้นมีอยู่จริง และในทางปฏิบัติก็มากกว่าที่ตารางบ่งชี้: 99.8 โทเคนต่อวินาที เทียบกับ 55.3 คือโมเดลที่ทำงานเสร็จเร็วกว่าประมาณสองเท่าบนเอาต์พุตเดียวกัน และเวลาถึงโทเคนแรกของ Step 5 Preview ที่ 2.96 วินาที เทียบกับ 56.84 วินาทีของ Claude Opus 5 บนบอร์ดเดียวกันนั้นเป็นคนละระดับกันโดยสิ้นเชิง — แม้ว่าตัวเลขหลังนั้นวัดจากการตั้งค่าการใช้เหตุผลแบบความพยายามสูงสุด ซึ่งโมเดลจะครุ่นคิดก่อนที่จะส่งอะไรออกมา นั่นไม่ใช่เวลาแฝงที่การเรียกใช้งานในโปรดักชันจะพบ เมื่อเทียบกับเอนด์พอยต์มาตรฐาน แค็ตตาล็อกของเราเองรายงานเวลา p50 ถึงโทเคนแรกที่ 6.73 วินาทีสำหรับ Claude Opus 5 ซึ่งเป็นตัวเลขที่ควรใช้ในการวางแผน หากคุณไม่ได้ตั้งใจขอการครุ่นคิดระดับสูงสุด
แถวส่วนลดแคชคือแถวที่ตัดสินเรื่องเวิร์กโหลดที่ทำซ้ำอย่างเงียบ ๆ และมันเอนไปทาง Step 5 Preview คือ 95% ต่อ 90% ลูปของเอเจนต์ที่ส่ง system prompt และบริบทของรีโพซิทอรีเดิมซ้ำในทุกครั้งที่เรียก จะอยู่ในส่วนลดนั้นเกือบทั้งหมด ความต่างห้าจุดจึงทบเพิ่มขึ้นตลอดเซสชันที่ยาวนาน

ในกรณีที่ Claude Opus 5 ยังคงเป็นคำตอบเดียวเท่านั้น
ไม่มีอะไรข้างต้นที่โต้แย้งโมเดลของ Anthropic มันมีราคาเท่าที่มันควรจะเป็น เพราะมันทำในสิ่งที่ดัชนีพยายามจะวัด และทำได้ใกล้จุดสูงสุดของตาราง — 51 บน Intelligence Index v4.3.2 นำ Step 5 Preview อยู่เจ็ดคะแนน และอยู่ในระยะไล่ทันผู้นำของรุ่นปัจจุบัน งานที่ช่องว่างคะแนนรวม 7 คะแนน portray ความแตกต่างได้ต่ำกว่าความเป็นจริง คือพวกงานที่ไม่ยอมรับคำตอบที่เป็นอันดับสองได้เลย: การรีแฟกเตอร์ที่กินเวลาหลายชั่วโมงซึ่งโหมดความล้มเหลวคือการเปลี่ยนพฤติกรรมอย่างแนบเนียน แบบจำลองทางการเงินที่สายการให้เหตุผลต้องตรวจสอบย้อนกลับได้ หรือการย้ายระบบที่การตัดสินใจผิดพลาดถูกค้นพบในอีกหนึ่งสัปดาห์ถัดมา ในงานเหล่านั้น การลองใหม่ไม่ใช่เรื่องถูก ๆ และการไตร่ตรองอย่างละเอียดคือตัวผลิตภัณฑ์เอง
งานที่ช่องว่างนั้นไม่มีความสำคัญ คือ งานที่ประกอบขึ้นจากการตัดสินใจเล็ก ๆ จำนวนมาก: ขั้นตอนการจำแนกประเภทและการกำหนดเส้นทาง การสกัดข้อมูล การสรุปความ โครงสำหรับการทดสอบ การเรียกหลายพันครั้งที่เอเจนต์ทำระหว่างการเรียกสองครั้งที่สำคัญจริง ๆ ในงานเหล่านั้น โมเดลที่ 44 ซึ่งตอบในเวลาเพียงครึ่งเดียวด้วยราคาอินพุตหนึ่งในห้า ไม่ใช่การประนีประนอม มันคือค่าเริ่มต้นที่ถูกต้อง โดยเก็บโมเดลราคาแพงไว้สำหรับขั้นตอนที่ต้องถูกต้องเท่านั้น
การรันการแยกโดยไม่ต้องรันการผสานรวมสองรายการ
เวอร์ชันที่ใช้ได้จริงของการเปรียบเทียบนี้คือไปป์ไลน์แบบแบ่งชั้น และเหตุผลที่ทีมต่างๆ ไม่ได้สร้างมันขึ้นมาคือเรื่องการจัดซื้อจัดจ้างมากกว่างานวิศวกรรม — ผู้ให้บริการสองราย สัญญาสองฉบับ SDK สองตัว คีย์สองอันที่ต้องหมุนเวียนClaude Opus 5 อยู่ในแคตตาล็อกของเราในราคา $5.00 และ $25.00 และโมเดลข้อความราคาถูกกว่าที่คุณจะวางไว้ข้างหน้าโมเดลนี้ก็อยู่ในแคตตาล็อกเดียวกัน ทั้งหมดอยู่หลังคีย์เดียวสำหรับโมเดลมากกว่า 200 รายการ โดยส่งผ่านราคาตามรายการของผู้ให้บริการที่บวกเพิ่ม 0% ส่วน Step 5 Preview ไม่อยู่ในรายการนั้น — มันทำงานบน API ของ StepFun เอง และจนกว่าเวตจะเปิดให้ใช้ ที่นั่นคือที่เดียวที่มันทำงานได้ การประกอบชั้นการทำงานข้ามโมเดลที่เรา route อยู่นั้นเป็นนิพจน์ routing-DSL มากกว่าที่จะเป็นการแก้โค้ด — ส่งการเรียกงานทั่วไปไปยังโมเดลเล็ก ยกระดับไปยังโมเดลแพงเมื่อเข้าเงื่อนไขด้านความมั่นใจหรือความซับซ้อน และเก็บทั้งสองเส้นทางไว้หลังเอนด์พอยต์เดียวกัน
การสลับใช้งานอัตโนมัติ (automatic failover) มีความสำคัญในกรณีนี้ด้วยเหตุผลเฉพาะ ไม่ใช่ในฐานะฟีเจอร์ทั่วไป Step 5 Preview เปิด API ของตนในวันประกาศ โดยไม่มีการเผยแพร่ weights และไม่เปิดเผย serving fleet เลย มันเป็น preview endpoint ที่เพิ่งมีอายุไม่กี่วัน และ preview endpoint ก็มีข้อจำกัดด้าน capacity ในแบบที่ endpoint ที่เป็นรุ่นสมบูรณ์แล้วไม่มี Claude Opus 5 ให้บริการโดยผู้ให้บริการอิสระหลายราย ซึ่งเป็นความซ้ำซ้อนที่ preview ให้ไม่ได้ การเก็บโมเดลที่ผ่านการพิสูจน์แล้วไว้เป็นขาสำรอง — ในฝั่งของเรา นั่นหมายถึงโมเดลระดับ production จากแคตตาล็อก ไม่ใช่ preview — คือวิธีที่คุณจะได้สัญญาณคุณภาพที่แท้จริงบนเวิร์กโหลดของคุณเอง โดยไม่ทำให้เส้นทาง production ของคุณต้องพึ่งพา fleet ที่ยังอยู่ระหว่างการกำหนดขนาด

กฎการตัดสินใจ
หากปริมาณงานของคุณคือกลุ่มงานที่ยากมากจำนวนน้อย Claude Opus 5 ไม่ใช่ตัวเลือกที่แพง — แต่เป็นตัวเลือกที่ถูก เพราะคำตอบที่ดีเป็นอันดับสองมีต้นทุนสูงกว่าส่วนต่างนั้น หากปริมาณงานของคุณคือกลุ่มงานทั่วไปจำนวนมากซึ่งมีงานยากปนอยู่จำนวนน้อย Step 5 Preview ที่ราคา $1.00 และ $2.70 พร้อมส่วนลดแคช 95% จะเป็นค่าเริ่มต้นที่ดีกว่า และช่องว่าง 7 จุดนั้นโดยส่วนใหญ่เป็นเพียงความคลาดเคลื่อนจากการปัดเศษสำหรับงานที่ไม่จำเป็นต้องใช้มัน
สิ่งที่จะเปลี่ยนการคำนวณนั้นคือหลักฐานอิสระเกี่ยวกับอัตราความล้มเหลวและแถวงานแบบเอเจนต์ระยะยาว ตัวเลขของ StepFun เองจัดให้โมเดลอยู่อันดับสองในการประเมินที่บริษัทใช้เป็นแกนในการเปิดตัว และยังไม่มีบุคคลที่สามรายใดทำซ้ำผลเหล่านั้นได้ จับตาจุดตรวจสอบวันที่ 15 ตุลาคมในสองเรื่อง: ว่าสัญญาอนุญาตให้ทำการปรับแต่งละเอียดที่จะช่วยให้คุณปิดช่องว่าง 7 จุดบนข้อมูลของคุณเองได้หรือไม่ และว่าความยืดยาวจะยังคงอยู่เมื่อถอดคำต่อท้าย preview ออกหรือไม่ อย่างแรกจะเปลี่ยนอัตราส่วน ส่วนอย่างหลังทำให้มันขยับมาแล้วครั้งหนึ่ง
