การ์ดชื่อเรื่องที่สร้างขึ้นชื่อ 'Step 5 Preview vs Claude Opus 5 — ส่วนต่างราคา' พร้อมด้วยสองคอลัมน์: Step 5 Preview ที่ AA Index 44 ราคา $1.00 ขาเข้า / $2.70 ขาออก ค่าใช้จ่ายในการรันอินเด็กซ์ $922.84 และความเร็วเอาต์พุต 99.8 โทเคน/วินาที; Claude Opus 5 ที่ AA Index 51 ราคา $5.00 ขาเข้า / $25.00 ขาออก ค่าใช้จ่ายในการรันอินเด็กซ์ $7,274.74 และความเร็วเอาต์พุต 55.3 โทเคน/วินาที ส่วนท้ายระบุว่า '7.9 เท่าของค่าใช้จ่ายสำหรับ 7 คะแนนอินเด็กซ์ ทั้งสองอ้างอิงตาม Artificial Analysis Intelligence Index v4.3.2 ที่ความพยายามในการใช้เหตุผลสูงสุด'
Guides & Insights

Step 5 Preview เทียบกับ Claude Opus 5: เจ็ดคะแนนดัชนีแลกกับค่าใช้จ่ายที่แพงขึ้นเจ็ดเท่า

ผู้เขียน

Alistair Wren

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

เอกสารเปิดตัวของ StepFun สำหรับ Step 5 Previewเปิดด้วยข้อกล่าวอ้างเชิงเปรียบเทียบเพียงข้อเดียว: งานหนึ่งงานที่รันบนโมเดลนี้มีค่าใช้จ่ายเป็นหนึ่งในแปดของงานเดียวกันที่รันบน Claude Opus 5 ตอนนี้ทั้งสองโมเดลอยู่ในกระดานจัดอันดับอิสระเดียวกัน ดังนั้นข้อกล่าวอ้างนั้นจึงตรวจสอบได้แทนที่จะต้องมาเถียงกัน Artificial Analysis รันแต่ละโมเดลผ่าน Intelligence Index v4.3.2 — การประเมินสิบรายการ — และเผยแพร่ว่าแต่ละการรันมีค่าใช้จ่ายเท่าใด โดย Claude Opus 5 ได้คะแนนที่การตั้งค่าความพยายามในการใช้เหตุผลสูงสุดของตัวเอง Step 5 Preview: 44 บนดัชนี, $922.84 เพื่อรันให้เสร็จสิ้น Claude Opus 5: 51 บนดัชนี, $7,274.74 นั่นคือเงิน 7.9 เท่าเพื่อคะแนน 7 คะแนน และอัตราส่วนที่ StepFun อ้างไว้กลับกลายเป็นอัตราส่วนที่ถูกต้อง สิ่งที่อัตราส่วนนี้ซ่อนไว้คือส่วนที่น่าสนใจ เพราะช่องว่างนี้ไม่ได้เป็นช่องว่างด้านราคาเป็นหลัก มันคือช่องว่างด้านความเยิ่นเย้อที่สวมเสื้อผ้าของช่องว่างด้านราคา และการแยกสองสิ่งนี้ออกจากกันจะเปลี่ยนว่าโมเดลใดควรถูกวางไว้กับงานแบบใด

ต้นทุนการรันสองรายการ หนึ่งบอร์ด และสิ่งที่อยู่ข้างในนั้นจริง ๆ

ต้นทุนการรันทั้งหมดเป็นการเปรียบเทียบเดี่ยวที่สะอาดที่สุดเท่าที่มีให้ใช้ตรงนี้ เพราะโมเดลทั้งสองตอบคำถามชุดเดียวกันภายใต้ฮาร์เนสเดียวกัน และไม่มีผู้ขายรายใดเป็นผู้สร้างตัวเลขนี้ขึ้นมาเอง มันยังเป็นตัวเลขที่มีแนวโน้มจะถูกตีความผิดมากที่สุดด้วย ดังนั้นจึงคุ้มค่าที่จะเปิดมันออกมาให้เห็นชัด

• คะแนน Index — Step 5 Preview 44 เทียบกับ Claude Opus 5 51 โดย Claude Opus 5 ได้คะแนนจากการตั้งค่าความพยายามในการใช้เหตุผลสูงสุด

• ค่าใช้จ่ายรวมในการทำดัชนีให้เสร็จสมบูรณ์ — Step 5 Preview $922.84 เทียบกับ Claude Opus 5 $7,274.74

• ราคาผสมที่ส่วนผสมของแคชฮิต / อินพุต / เอาต์พุต 7:2:1 — Step 5 Preview $0.51 ต่อ 1 ล้านโทเค็น เทียบกับ Claude Opus 5 $3.85

• โทเคนเอาต์พุตที่สร้างขึ้นระหว่างการรันดัชนี — Step 5 Preview 160M เทียบกับ Claude Opus 5 140M

• ราคาตามรายการ — Step 5 Preview อินพุต $1.00 / เอาต์พุต $2.70 เทียบกับ Claude Opus 5 อินพุต $5.00 / เอาต์พุต $25.00

ดูแถวที่สามและห้ารวมกัน แล้วการคำนวณก็ไม่ใช่การเปรียบเทียบราคาแบบตรงไปตรงมาอีกต่อไป อัตราแบบผสมของ Step 5 Preview ถูกกว่า 7.5 เท่า และอัตราตามรายการถูกกว่าสำหรับอินพุต 5 เท่า และถูกกว่าสำหรับเอาต์พุต 9.3 เท่า — ดังนั้นส่วนผสมจึงทำหน้าที่ในสิ่งที่ราคาอินพุตไม่ได้ทำ นั่นเป็นเพราะส่วนผสมให้น้ำหนักไปทางเอาต์พุต และเอาต์พุตคือจุดที่ทั้งสองโมเดลแตกต่างกันมากที่สุด Claude Opus 5 คิดราคาสูงกว่าอัตราเอาต์พุตของ Step 5 Preview ถึง 9.3 เท่า และทั้งสองโมเดลเขียนข้อความปริมาณมาก: โทเค็นเอาต์พุต 140 ล้านสำหรับ Claude Opus 5 เทียบกับค่ามัธยฐาน 92 ล้านจากโมเดลที่ดัชนีให้คะแนน และ 160 ล้านสำหรับ Step 5 Preview เทียบกับค่ามัธยฐาน 92 ล้านเดียวกัน

ดังนั้นการตีความอย่างตรงไปตรงมาจึงแคบกว่า “โมเดลราคาถูกคือของคุ้ม” Step 5 Preview ถูกกว่าในทุกมิติ และมันไม่ใช่โมเดลที่ประหยัด — มันเขียนเอาต์พุตมากกว่าโมเดลค่ามัธยฐานที่นำมาเปรียบเทียบด้วยถึง 74% ซึ่งเป็นพฤติกรรมที่ราคานี้ควรลงโทษพอดี Claude Opus 5 เขียนมากกว่าค่ามัธยฐาน 52% และคิดราคาสูงกว่า 9.3 เท่าสำหรับแต่ละโทเคนเหล่านั้น ผู้เรียกใช้ที่จำกัดความยาวเอาต์พุตจะได้อัตราส่วนที่ต่างจากผู้ที่ไม่จำกัด

คำถามไม่ใช่ว่าอันไหนดีกว่า แต่อยู่ที่ว่าจุดตัดอยู่ตรงไหน

สมมติว่าดัชนีนี้เป็นตัวแทนที่สมเหตุสมผลของงานที่คุณส่งจริง — งานแบบเอเจนต์ระยะยาว โค้ด และการใช้เครื่องมือหลายขั้นตอน จุดตัดก็พูดได้ง่าย ๆ ว่า Claude Opus 5 ต้องมีประโยชน์ต่องานมากกว่าอย่างน้อย 7.9 เท่า ก่อนที่มันจะคุ้มกับค่าใช้จ่ายของมัน และบนดัชนีนี้ มันดีกว่า 7 คะแนนบนสเกล 100 คะแนน ข้อเท็จจริงสองข้อนี้ไม่จำเป็นต้องชี้ไปทางเดียวกัน เพราะช่องว่างบนดัชนี 7 คะแนนไม่ได้หมายความว่าดีกว่า 16% ในทุกอย่าง มันคือผลรวมของการประเมินสิบรายการ และองค์ประกอบสำคัญกว่ายอดรวม

นั่นคือข้อโต้แย้งสำหรับการใส่ใจรูปร่างของคะแนนทั้งสองมากกว่าตัวเลขพาดหัว คะแนน Terminal-Bench 4.0 ของ Step 5 Preview อยู่ที่ 33.3% — เป็นผลลัพธ์แบบเอเจนต์ที่แท้จริง นำหน้า DeepSeek V4.1 Flash ที่ 26.8% — แต่ยังไม่มีสิ่งใดในบันทึกที่เผยแพร่ที่แสดงว่ามันเทียบเท่า Claude Opus 5 ในการประเมินระยะยาวซึ่งโมเดลของ Anthropic แข็งแกร่งที่สุด เอกสารของ StepFun เองยอมรับเรื่องนี้ผ่านถ้อยคำว่า บน ALE-CLI, FrontierFinance และ DRACO บริษัทจัดให้ Step 5 Preview อยู่อันดับสอง โดยมี GPT-6 Astra หรือ Claude Opus 5 อยู่ข้างหน้า และนำหน้าโมเดลแบบเปิดอื่น ๆ ในชุดเปรียบเทียบ การได้อันดับสองในราคาหนึ่งในห้าเป็นผลลัพธ์ที่ดีจริง ๆ และ它也ไม่ใช่อันดับหนึ่ง และงานที่โมเดลจบเป็นอันดับสองมักเป็นงานที่ต้องการอันดับหนึ่ง

ความไม่สมมาตรอีกประการหนึ่งคือสิ่งที่เกิดขึ้นเมื่อการเรียกครั้งนั้นผิดพลาด คำตอบที่ผิดจากโมเดลราคาถูกที่ใช้เวลา 4 วินาทีและ 2,000 โทเคนทำให้คุณต้องเสียการลองใหม่ คำตอบที่ผิดแบบเดียวกันจาก Claude Opus 5 ในราคา 25 ดอลลาร์ต่อโทเคนเอาต์พุตหนึ่งล้านทำให้คุณต้องเสียการลองใหม่บวกกับการครุ่นคิด หากไปป์ไลน์ของคุณลองใหม่เมื่อล้มเหลว — ลูปของเอเจนต์ส่วนใหญ่ทำเช่นนั้น — ต้นทุนที่มีประสิทธิผลต่องานที่สำเร็จคือตัวเลขที่สำคัญ และมันไม่ใช่อัตราส่วนเดียวกับราคาที่ประกาศไว้ เพราะโมเดลทั้งสองจะไม่ล้มเหลวในอัตราเดียวกัน ยังไม่มีใครเผยแพร่ตัวเลขนั้นสำหรับ Step 5 Preview

Screenshot of the Artificial Analysis model page for Step 5 Preview, showing StepFun as the creator and a September 2026 release date, an Intelligence Index of 44 at rank 24 of 200, output speed 99.8 tokens per second, cost per Intelligence Index task $0.71, verbosity 160M output tokens, pricing of $1.00 per million input tokens and $2.70 per million output tokens with a 95% cache discount, and technical specifications listing reasoning, text and image input, and a 1M-token context window.

การเปรียบเทียบสเปก ทีละมิติ

• คะแนนดัชนี — Step 5 Preview 44 เทียบกับ Claude Opus 5 51 ทั้งคู่วัดบน Intelligence Index v4.3.2 โดย Claude Opus 5 อยู่ที่การตั้งค่า reasoning-effort สูงสุดของมัน

• ราคาต่อ 1M โทเคน — Step 5 Preview $1.00 ขาเข้า / $2.70 ขาออก เทียบกับ Claude Opus 5 $5.00 ขาเข้า / $25.00 ขาออก

• ส่วนลดแคช — Step 5 Preview 95% เทียบกับ Claude Opus 5 90%

• บริบท — ทั้งคู่ 1M โทเคน; StepFun ยังไม่เปิดเผยเพดานเอาต์พุต และของ Anthropic อยู่ที่ 128K

• อินพุต — ทั้งคู่รับข้อความและรูปภาพ ทั้งคู่ส่งออกเฉพาะข้อความเท่านั้น

• ความเร็วในการส่งออก — Step 5 Preview 99.8 โทเคน/วินาที เทียบกับ Claude Opus 5 55.3 โทเคน/วินาที

• พื้นผิวการควบคุม — Step 5 Preview เปิดให้ใช้งาน extended thinking; Claude Opus 5 แทนที่ temperature และ top_p ด้วยปุ่มปรับระดับความพยายามในการให้เหตุผลแบบปรับได้

• น้ำหนัก — Step 5 Preview ปิดวันนี้, เช็กพอยต์ BF16 กำหนดไว้สำหรับวันที่ 15 ตุลาคม; Claude Opus 5 เป็นกรรมสิทธิ์ตลอด

• หลักฐานอิสระ — ทั้งคู่ได้รับการให้คะแนนโดย Artificial Analysis; แถวเบนช์มาร์กแบบเอเจนต์ของ StepFun นั้นรันโดยผู้ขายและยังไม่มีการทำซ้ำ

สองแถวนี้สมควรได้รับการกล่าวถึงเป็นพิเศษ ช่องว่างด้านความเร็วนั้นมีอยู่จริง และในทางปฏิบัติก็มากกว่าที่ตารางบ่งชี้: 99.8 โทเคนต่อวินาที เทียบกับ 55.3 คือโมเดลที่ทำงานเสร็จเร็วกว่าประมาณสองเท่าบนเอาต์พุตเดียวกัน และเวลาถึงโทเคนแรกของ Step 5 Preview ที่ 2.96 วินาที เทียบกับ 56.84 วินาทีของ Claude Opus 5 บนบอร์ดเดียวกันนั้นเป็นคนละระดับกันโดยสิ้นเชิง — แม้ว่าตัวเลขหลังนั้นวัดจากการตั้งค่าการใช้เหตุผลแบบความพยายามสูงสุด ซึ่งโมเดลจะครุ่นคิดก่อนที่จะส่งอะไรออกมา นั่นไม่ใช่เวลาแฝงที่การเรียกใช้งานในโปรดักชันจะพบ เมื่อเทียบกับเอนด์พอยต์มาตรฐาน แค็ตตาล็อกของเราเองรายงานเวลา p50 ถึงโทเคนแรกที่ 6.73 วินาทีสำหรับ Claude Opus 5 ซึ่งเป็นตัวเลขที่ควรใช้ในการวางแผน หากคุณไม่ได้ตั้งใจขอการครุ่นคิดระดับสูงสุด

แถวส่วนลดแคชคือแถวที่ตัดสินเรื่องเวิร์กโหลดที่ทำซ้ำอย่างเงียบ ๆ และมันเอนไปทาง Step 5 Preview คือ 95% ต่อ 90% ลูปของเอเจนต์ที่ส่ง system prompt และบริบทของรีโพซิทอรีเดิมซ้ำในทุกครั้งที่เรียก จะอยู่ในส่วนลดนั้นเกือบทั้งหมด ความต่างห้าจุดจึงทบเพิ่มขึ้นตลอดเซสชันที่ยาวนาน

Generated two-column comparison scoreboard titled 'Step 5 Preview vs Claude Opus 5 — the scoreboard'. The left column gives Step 5 Preview the rows AA Index 44, price $1.00 / $2.70, cache discount 95%, output speed 99.8 tokens/sec, context 1M tokens, and weights due October 15. The right column gives Claude Opus 5 the rows AA Index 51, price $5.00 / $25.00, cache discount 90%, output speed 55.3 tokens/sec, context 1M tokens, and weights proprietary. A footer reads 'Both per Artificial Analysis Intelligence Index v4.3.2 at maximum reasoning effort. StepFun agentic rows are vendor-run.'

ในกรณีที่ Claude Opus 5 ยังคงเป็นคำตอบเดียวเท่านั้น

ไม่มีอะไรข้างต้นที่โต้แย้งโมเดลของ Anthropic มันมีราคาเท่าที่มันควรจะเป็น เพราะมันทำในสิ่งที่ดัชนีพยายามจะวัด และทำได้ใกล้จุดสูงสุดของตาราง — 51 บน Intelligence Index v4.3.2 นำ Step 5 Preview อยู่เจ็ดคะแนน และอยู่ในระยะไล่ทันผู้นำของรุ่นปัจจุบัน งานที่ช่องว่างคะแนนรวม 7 คะแนน portray ความแตกต่างได้ต่ำกว่าความเป็นจริง คือพวกงานที่ไม่ยอมรับคำตอบที่เป็นอันดับสองได้เลย: การรีแฟกเตอร์ที่กินเวลาหลายชั่วโมงซึ่งโหมดความล้มเหลวคือการเปลี่ยนพฤติกรรมอย่างแนบเนียน แบบจำลองทางการเงินที่สายการให้เหตุผลต้องตรวจสอบย้อนกลับได้ หรือการย้ายระบบที่การตัดสินใจผิดพลาดถูกค้นพบในอีกหนึ่งสัปดาห์ถัดมา ในงานเหล่านั้น การลองใหม่ไม่ใช่เรื่องถูก ๆ และการไตร่ตรองอย่างละเอียดคือตัวผลิตภัณฑ์เอง

งานที่ช่องว่างนั้นไม่มีความสำคัญ คือ งานที่ประกอบขึ้นจากการตัดสินใจเล็ก ๆ จำนวนมาก: ขั้นตอนการจำแนกประเภทและการกำหนดเส้นทาง การสกัดข้อมูล การสรุปความ โครงสำหรับการทดสอบ การเรียกหลายพันครั้งที่เอเจนต์ทำระหว่างการเรียกสองครั้งที่สำคัญจริง ๆ ในงานเหล่านั้น โมเดลที่ 44 ซึ่งตอบในเวลาเพียงครึ่งเดียวด้วยราคาอินพุตหนึ่งในห้า ไม่ใช่การประนีประนอม มันคือค่าเริ่มต้นที่ถูกต้อง โดยเก็บโมเดลราคาแพงไว้สำหรับขั้นตอนที่ต้องถูกต้องเท่านั้น

การรันการแยกโดยไม่ต้องรันการผสานรวมสองรายการ

เวอร์ชันที่ใช้ได้จริงของการเปรียบเทียบนี้คือไปป์ไลน์แบบแบ่งชั้น และเหตุผลที่ทีมต่างๆ ไม่ได้สร้างมันขึ้นมาคือเรื่องการจัดซื้อจัดจ้างมากกว่างานวิศวกรรม — ผู้ให้บริการสองราย สัญญาสองฉบับ SDK สองตัว คีย์สองอันที่ต้องหมุนเวียนClaude Opus 5 อยู่ในแคตตาล็อกของเราในราคา $5.00 และ $25.00 และโมเดลข้อความราคาถูกกว่าที่คุณจะวางไว้ข้างหน้าโมเดลนี้ก็อยู่ในแคตตาล็อกเดียวกัน ทั้งหมดอยู่หลังคีย์เดียวสำหรับโมเดลมากกว่า 200 รายการ โดยส่งผ่านราคาตามรายการของผู้ให้บริการที่บวกเพิ่ม 0% ส่วน Step 5 Preview ไม่อยู่ในรายการนั้น — มันทำงานบน API ของ StepFun เอง และจนกว่าเวตจะเปิดให้ใช้ ที่นั่นคือที่เดียวที่มันทำงานได้ การประกอบชั้นการทำงานข้ามโมเดลที่เรา route อยู่นั้นเป็นนิพจน์ routing-DSL มากกว่าที่จะเป็นการแก้โค้ด — ส่งการเรียกงานทั่วไปไปยังโมเดลเล็ก ยกระดับไปยังโมเดลแพงเมื่อเข้าเงื่อนไขด้านความมั่นใจหรือความซับซ้อน และเก็บทั้งสองเส้นทางไว้หลังเอนด์พอยต์เดียวกัน

การสลับใช้งานอัตโนมัติ (automatic failover) มีความสำคัญในกรณีนี้ด้วยเหตุผลเฉพาะ ไม่ใช่ในฐานะฟีเจอร์ทั่วไป Step 5 Preview เปิด API ของตนในวันประกาศ โดยไม่มีการเผยแพร่ weights และไม่เปิดเผย serving fleet เลย มันเป็น preview endpoint ที่เพิ่งมีอายุไม่กี่วัน และ preview endpoint ก็มีข้อจำกัดด้าน capacity ในแบบที่ endpoint ที่เป็นรุ่นสมบูรณ์แล้วไม่มี Claude Opus 5 ให้บริการโดยผู้ให้บริการอิสระหลายราย ซึ่งเป็นความซ้ำซ้อนที่ preview ให้ไม่ได้ การเก็บโมเดลที่ผ่านการพิสูจน์แล้วไว้เป็นขาสำรอง — ในฝั่งของเรา นั่นหมายถึงโมเดลระดับ production จากแคตตาล็อก ไม่ใช่ preview — คือวิธีที่คุณจะได้สัญญาณคุณภาพที่แท้จริงบนเวิร์กโหลดของคุณเอง โดยไม่ทำให้เส้นทาง production ของคุณต้องพึ่งพา fleet ที่ยังอยู่ระหว่างการกำหนดขนาด

Screenshot of the OrcaRouter model page for Claude Opus 5 at www.orcarouter.ai/models/anthropic/claude-opus-5, showing the model id anthropic/claude-opus-5, the max output and context figures of 128K and 1M tokens, input pricing of $5.00 and output pricing of $25.00 per million tokens, a p50 time to first token of 6.73 seconds, 59.7M tokens of traffic over seven days, and the endpoints and SDK snippets behind the OrcaRouter API.

กฎการตัดสินใจ

หากปริมาณงานของคุณคือกลุ่มงานที่ยากมากจำนวนน้อย Claude Opus 5 ไม่ใช่ตัวเลือกที่แพง — แต่เป็นตัวเลือกที่ถูก เพราะคำตอบที่ดีเป็นอันดับสองมีต้นทุนสูงกว่าส่วนต่างนั้น หากปริมาณงานของคุณคือกลุ่มงานทั่วไปจำนวนมากซึ่งมีงานยากปนอยู่จำนวนน้อย Step 5 Preview ที่ราคา $1.00 และ $2.70 พร้อมส่วนลดแคช 95% จะเป็นค่าเริ่มต้นที่ดีกว่า และช่องว่าง 7 จุดนั้นโดยส่วนใหญ่เป็นเพียงความคลาดเคลื่อนจากการปัดเศษสำหรับงานที่ไม่จำเป็นต้องใช้มัน

สิ่งที่จะเปลี่ยนการคำนวณนั้นคือหลักฐานอิสระเกี่ยวกับอัตราความล้มเหลวและแถวงานแบบเอเจนต์ระยะยาว ตัวเลขของ StepFun เองจัดให้โมเดลอยู่อันดับสองในการประเมินที่บริษัทใช้เป็นแกนในการเปิดตัว และยังไม่มีบุคคลที่สามรายใดทำซ้ำผลเหล่านั้นได้ จับตาจุดตรวจสอบวันที่ 15 ตุลาคมในสองเรื่อง: ว่าสัญญาอนุญาตให้ทำการปรับแต่งละเอียดที่จะช่วยให้คุณปิดช่องว่าง 7 จุดบนข้อมูลของคุณเองได้หรือไม่ และว่าความยืดยาวจะยังคงอยู่เมื่อถอดคำต่อท้าย preview ออกหรือไม่ อย่างแรกจะเปลี่ยนอัตราส่วน ส่วนอย่างหลังทำให้มันขยับมาแล้วครั้งหนึ่ง

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube