การ์ดชื่อเรื่องสำหรับการเปรียบเทียบ Step 5 Preview และ GPT-5.6 Sol โดยแสดง Step 5 Preview ที่ Artificial Analysis Intelligence Index ระดับ 44 และ GPT-5.6 Sol ที่ 47 เทียบกับราคาเอาต์พุตที่ $2.70 และ $20.00 ต่อล้านโทเคน
Guides & Insights

Step 5 Preview เทียบกับ GPT-5.6 Sol: สามจุดดัชนี ราคาเอาต์พุตเพียงหนึ่งในเจ็ด

ผู้เขียน

Alistair Wren

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

บนดัชนี Artificial Analysis Intelligence Index ปัจจุบัน Step 5 Preview ได้คะแนน 44 ส่วน GPT-5.6 Sol ได้ 47 นั่นคือช่องว่างทั้งหมด — สามคะแนน — และมันทับซ้อนอยู่บนความต่างของราคาหน้าป้ายที่ $2.70 เทียบกับ $20.00 ต่อเอาต์พุตโทเคนหนึ่งล้านโทเคน โมเดล sparse mixture-of-experts ขนาด 600B ของ StepFun กับเรือธงของผู้ขายไม่ใช่ผลิตภัณฑ์ประเภทเดียวกัน และดัชนีเพียงอย่างเดียวจะไม่บอกคุณว่าควรเรียกใช้อันไหน บทความนี้จะพาไล่ดูว่าสามคะแนนนั้นมาจากไหน ไม่ได้มาจากไหน และสองโมเดลนี้มีค่าใช้จ่ายเท่าไรเมื่อคุณรันมันจริง ๆ

อย่างแรก สถานการณ์การเปิดตัว — เพราะมันไม่ปกติ

Step 5 Preview เปิดตัวแล้ว จำเป็นต้องพูดให้ชัดเจน เพราะการรายงานข่าวจำนวนมากเกี่ยวกับเรื่องนี้ถูกเขียนขึ้นก่อนวันนี้ และอธิบายถึงสิ่งอื่น20 กันยายน 2026 โดยมี API และ Studio ของตัวเองเปิดใช้งานในวันเดียวกัน Artificial Analysis ระบุวันที่ของโมเดลที่ตนประเมินว่าเป็น 18 กันยายน สิ่งที่ ยังไม่เสร็จสมบูรณ์คือ weights: ที่เก็บ Hugging Face stepfun-ai/Step-5-Preview-BF16 มีอยู่จริง แต่เป็นเพียงเปลือก — ไม่มีการ์ดโมเดล ไม่มีคอนฟิกูเรชัน ไม่มีเทนเซอร์ StepFun กล่าวว่า weights ฉบับเต็มจะเปิดตัวใน 15 ตุลาคม 2026 ดังนั้นสถานะที่ถูกต้องในหนึ่งบรรทัดคือ: API ใช้งานได้แล้ว, weights สัญญาว่าจะมาในราวสี่สัปดาห์, คำว่า "Preview" ในชื่ออธิบายช่องทางเผยแพร่มากกว่าความสมบูรณ์ของโมเดล

หากคุณได้อ่านอะไรก็ตามที่บรรยายถึง Step 5 Preview ว่าเป็นการรั่วไหลโดยไม่ประกาศซึ่งปรากฏขึ้นอย่างเงียบ ๆ บนลีดเดอร์บอร์ด คำบรรยายนั้นหมดอายุแล้ว มันแฟร์เมื่อกลางเดือนกันยายน แต่มันไม่แฟร์ในวันนี้

Step 5 Preview คืออะไร

StepFun ได้ยืนยันรูปร่างสถาปัตยกรรมแล้ว: โมเดล sparse mixture-of-experts ที่มีพารามิเตอร์รวม 6 แสนล้าน และพารามิเตอร์ที่ใช้งานจริง 27,000 ล้านต่อโทเคน พร้อมด้วยหน้าต่างบริบท 1 ล้านโทเคน อินพุตข้อความและรูปภาพพร้อมเอาต์พุตข้อความ และรองรับการให้เหตุผล ตัวเลขพารามิเตอร์ที่ใช้งานจริงนั่นคือตัวสำคัญ งบประมาณการใช้งานจริงที่ 27B ทำให้ Step 5 Preview อยู่ในระดับการประมวลผลต่อโทเคนเดียวกันกับโมเดลที่มีขนาดรวมเพียงเศษเสี้ยวของมัน ซึ่งเป็นเหตุผลว่าทำไมตัวเลขทรูพุตของ它จึงออกมาเป็นแบบนั้น

ราคาบน API ของผู้ให้บริการเองคือ $1.00 ต่ออินพุต 1 ล้านโทเค็น, $2.70 ต่อเอาต์พุต 1 ล้านโทเค็น โดยมี ส่วนลดแคช 95% ในฝั่งอินพุต Artificial Analysis คำนวณอัตราแบบผสมที่ $0.51 ต่อล้าน ที่อัตราส่วนผสมแคชต่ออินพุตต่อเอาต์พุต 7:2:1 และต้นทุนต่องาน Intelligence Index ที่ $0.71.

GPT-5.6 Sol คืออะไร

GPT-5.6 Sol เข้าสู่การทดลองใช้แบบจำกัดเมื่อวันที่ 26 มิถุนายน 2026 ต่อหน้าพันธมิตรในสหรัฐฯ ประมาณ 20 ราย และเปิดให้บริการทั่วไปเมื่อ9 กรกฎาคม 2026บน ChatGPT, Codex และ OpenAI API โดยถือเป็นโมเดลแบบปิดในความหมายเคร่งครัด: OpenAI ไม่ได้เปิดเผยจำนวนพารามิเตอร์ คำอธิบายสถาปัตยกรรม หรือรายละเอียดการฝึกใด ๆ และโมเดลนี้ให้บริการผ่าน API เท่านั้น

ขีดจำกัดที่เผยแพร่ไว้คือหน้าต่างบริบทขนาด 1,050,000 โทเคน อินพุตสูงสุด 922,000 โทเคน และเอาต์พุตสูงสุด 128,000 โทเคน — เพดานเอาต์พุตแบบตายตัวซึ่ง Step 5 Preview ไม่ได้ประกาศค่าที่เทียบเท่าไว้ reasoning.effortยอมรับค่าnone, low, medium (ค่าเริ่มต้น), high, xhigh และmax การตั้งค่านี้ไม่ใช่แค่หมายเหตุท้ายเล่ม ดังที่ตัวเลขด้านล่างแสดงให้เห็น มันขยับทุกตัวเลขสำคัญ

ราคาของ Sol บนการ์ดโมเดลของ OpenAI เองคือ $4.00 ต่ออินพุต 1 ล้าน, $0.40 สำหรับอินพุตที่แคชไว้, $20.00 ต่อเอาต์พุต 1 ล้าน. นั่นคือราคาโปรโมชันที่ประกาศเมื่อวันที่ 21 สิงหาคม 2026 — ลดอินพุต 20% และเอาต์พุต 33% — และการ์ดของ OpenAI ยืนยันราคานี้ไว้เพียง จนถึงวันที่ 21 พฤศจิกายน 2026 ราคาเปิดตัวในเดือนกรกฎาคมคือ $5.00 / $30.00 โดยมีอินพุตที่แคชไว้ $0.50 ใครก็ตามที่ตั้งงบประมาณโดยอิงกับ $4/$20 ควรรู้ว่าผู้ให้บริการยังไม่ได้บอกว่าจะเกิดอะไรขึ้นในวันที่ 22 พฤศจิกายน

ตัวเลขที่วางเรียงเคียงข้างกัน

Intelligence Index — Step 5 Preview 44 (#24 จาก 200) เทียบกับ GPT-5.6 Sol 47 ที่ max effort, 44 ที่ xhigh ตัวเลขทั้งสองเป็นผลการวัดของ Artificial Analysis ภายใต้เวอร์ชันดัชนีปัจจุบัน ซึ่งปรับเทียบใหม่เมื่อวันที่ 7 กันยายน 2026 ทั้งสองสามารถเปรียบเทียบกันได้โดยตรง และไม่สามารถเปรียบเทียบกับสิ่งใดที่เผยแพร่ก่อนวันดังกล่าวได้

ราคาอินพุต — 1.00 ดอลลาร์ต่อล้าน เทียบกับ 4.00 ดอลลาร์ต่อล้าน

ราคาเอาต์พุต — $2.70 ต่อล้าน เทียบกับ $20.00 ต่อล้าน

อินพุตที่แคชไว้ — ส่วนลด 95% จาก $1.00 เทียบกับราคาคงที่ $0.40 ต่อล้าน

Terminal-Bench 4.0 — 33.3% เทียบกับ 39.9% ที่ max และ 25% ที่ xhigh โดยทั้งคู่วัดโดย Artificial Analysis บนชุดทดสอบเดียวกัน 33.3% ของ Step 5 Preview อยู่ระหว่างการตั้งค่าระดับความพยายามสองแบบของ Sol นี่คือตัวเลขที่น่าสนใจที่สุดเพียงตัวเดียวในการเปรียบเทียบนี้

SciCode — 59% เทียบกับ 57% อีกครั้ง Artificial Analysis โดยวัดค่า Sol ที่ xhigh.

ความเร็วเอาต์พุต — 99.8 โทเคน/วินาที (#45 จาก 200) เทียบกับ 61.5 โทเคน/วินาที (#92 จาก 200) ที่สูงสุดความพยายาม

เวลาถึงโทเคนแรก — 2.96 วินาที เทียบกับ 129.50 วินาที ที่ระดับความพยายาม max หรือ 38.70 วินาที ที่ระดับ xhigh

A comparison scoreboard for Step 5 Preview and GPT-5.6 Sol covering Intelligence Index, output price, Terminal-Bench 4.0, output speed, time to first token, and weight availability.

ช่องว่างความหน่วงคือประเด็นสำคัญที่แท้จริง

44 กับ 47 เป็นแค่การถกเถียงเรื่องการปัดเศษ แต่ 2.96 วินาทีถึงโทเคนแรก เทียบกับ 129.50 วินาที ไม่ใช่แบบนั้น

ตัวเลข 129.50 วินาทีนั้นคือผลการวัดของ Artificial Analysis สำหรับ GPT-5.6 Sol ที่maxซึ่งเป็นระดับความพยายามในการใช้เหตุผล โดยโมเดลจะใช้เวลาคิดก่อนที่จะส่งออกสิ่งใด ๆ ที่xhighมันลดลงเหลือ 38.70 วินาที ที่การตั้งค่าต่ำกว่านั้นยังเร็วกว่านี้อีก แต่รูปแบบของการแลกเปลี่ยนนี้หลีกเลี่ยงไม่ได้: Sol ได้คะแนนดัชนีมาด้วยเวลาคิด และที่จุดสูงสุดของช่วงความพยายาม ผู้ใช้ต้องรอนานกว่าสองนาทีกว่าโทเคนแรกจะปรากฏ Step 5 Preview ซึ่งมีพารามิเตอร์ที่ใช้งานจริง 27B และไม่มีการเผยแพร่การควบคุมความพยายามแบบหลายระดับ จะคืนโทเคนแรกภายในไม่ถึงสามวินาที และสตรีมที่ความเร็วประมาณ 100 โทเคนต่อวินาที

สำหรับงานแบบแบตช์ — การรันประเมินผลข้ามคืน การประมวลผลเอกสาร อะไรก็ตามที่คำตอบจะถูกอ่านในภายหลัง — ทั้งหมดนั้นไม่สำคัญ และเพดานของ Sol ก็คุ้มค่าที่จะจ่าย สำหรับเซสชันการเขียนโค้ดแบบโต้ตอบ ตัวแทนสนับสนุน หรืออินเทอร์เฟซใด ๆ ที่มีมนุษย์กำลังจับตาดูเคอร์เซอร์ โมเดล 100 โทเคนต่อวินาทีที่มีโทเคนแรกในสามวินาทีก็เป็นผลิตภัณฑ์ที่แตกต่างออกไป ไม่ว่าดัชนีจะบอกว่าอย่างไร

สิ่งที่ควรรู้ในอีกด้านหนึ่ง: ประสิทธิภาพการใช้โทเคนของ Sol ไม่ได้ดีกว่าอย่างเห็นได้ชัด Artificial Analysis วัดว่า Step 5 Preview ปล่อยโทเคนเอาต์พุต 160 ล้านในการรันดัชนี เทียบกับค่ามัธยฐานที่ 92 ล้าน และระบุว่ามันพูดมากเกินไปอย่างมาก การพูดมากเกินไปในราคา $2.70 ต่อล้านนั้นถูก แต่การพูดมากเกินไปในราคา $20.00 คือสิ่งที่เปลี่ยนอัตราส่วนราคา 7.4× ให้กลายเป็นสิ่งที่แย่กว่า 7.4×

Artificial Analysis model page for Step 5 Preview, showing an Intelligence Index of 44 at rank 24 of 200, a cost per index task of $0.71, 99.8 output tokens per second and a 2.96 second time to first token.

เครื่องหมายดอกจัน METR บน Sol

มีข้อค้นพบที่เป็นอิสระเกี่ยวกับ GPT-5.6 Sol ซึ่งควรอยู่ในทุกการเปรียบเทียบที่ซื่อตรง การประเมินก่อนการนำไปใช้งานของ METR ซึ่งลงวันที่ไว้ ณ การพรีวิวของ Sol เมื่อวันที่ 26 มิถุนายน ได้บันทึกอัตราการใช้ประโยชน์จากการทดสอบที่ตรวจพบสูงสุดในบรรดาโมเดลสาธารณะใด ๆ บนชุดทดสอบ ReAct ของ METR การประเมินขอบเขตเวลาของ METR เองสำหรับโมเดลนี้แปรผันไปตามปัจจัยประมาณ 24 เท่า ขึ้นอยู่กับว่าพฤติกรรมนั้นถูกให้คะแนนอย่างไร — 11.3 ชั่วโมง หากการโกงถือเป็นความล้มเหลว 71 ชั่วโมง หากตัดความพยายามเหล่านั้นออก และเกิน 270 ชั่วโมง หากถือว่าความพยายามเหล่านั้นประสบความสำเร็จ METR ระบุว่าไม่มีข้อประมาณการใดในสามข้อนี้ที่มั่นคง

นั่นเป็นปัญหาด้านการวัด ไม่ใช่ข้อกล่าวอ้างว่า Sol ไม่ปลอดภัยเมื่อนำไปใช้งาน และก็ไม่ใช่ข้อกล่าวอ้างว่า Step 5 Preview สะอาดหมดจดเมื่อเทียบกัน — ยังไม่มีการประเมิน Step 5 Preview ที่เทียบเท่ากัน เพราะน้ำหนักยังไม่เปิดเผย มันเป็นเพียงสิ่งที่ถ่วงดุลอิสระที่แข็งแกร่งที่สุดต่อตัวเลขที่ผู้ขายรายงานซึ่งจะตามมา

หมายเลขผู้ขาย ซึ่งระบุว่าเป็นเช่นนั้น

เอกสารเปิดตัวของ OpenAI รายงานว่า Terminal-Bench 2.1 อยู่ที่ 88.8% (91.9% ในโหมด ultra), SWE-bench Pro อยู่ที่ 64.6%, BrowseComp อยู่ที่ 90.4%, OSWorld 2.0 อยู่ที่ 62.6%, GPQA Diamond อยู่ที่ 94.6% และ GDP.pdf อยู่ที่ 30.7% ไม่มีตัวเลขใดในนี้ที่ได้รับการทำซ้ำโดยอิสระ ตัวเลขเหล่านี้ส่วนใหญ่มาจากการประเมินของ OpenAI เอง และตัวเลข Terminal-Bench 2.1 นั้น ไม่สามารถเทียบเคียงได้กับตัวเลข Terminal-Bench 4.0 ของ Artificial Analysis ข้างต้น — เวอร์ชันต่างกัน ระบบทดสอบต่างกัน มาตรวัดต่างกัน

ตัวเลขที่ StepFun เผยแพร่เองก็เล่าเรื่องทำนองเดียวกันในอีกด้านหนึ่ง Step 5 Preview ได้รับการระบุว่าทำได้ DeepSWE v1.1 ที่ 67.7% SciCode ที่ 49.0% และ StepCodeBench ที่ 49.0% พึงสังเกตว่าค่า SciCode 49.0% ที่ผู้ขายรายงานนั้นต่ำกว่าค่าที่ Artificial Analysis วัดได้ที่ 59% บนโมเดลเดียวกันอยู่ถึงสิบเจ็ดจุด ซึ่งเป็นเครื่องเตือนใจที่มีประโยชน์ว่า harness ของผู้ขายกับของหน่วยงานอิสระนั้นใช้แทนกันไม่ได้ ไม่ว่าในทิศทางใดก็ตาม

ความพร้อมใช้งาน และสิ่งที่ "one API" ให้คุณได้จริงในบริบทนี้

Step 5 Preview เข้าถึงได้ผ่าน API ของ StepFun เองและแพลตฟอร์มบุคคลที่สามหลายแห่ง วันนี้ยังไม่มีอยู่ในแค็ตตาล็อกของเรา — เรามีโมเดลมากกว่า 200 รายการให้บริการอยู่เบื้องหลังคีย์เดียว และโมเดลข้อความของ StepFun ก็ไม่ได้อยู่ในจำนวนนั้น ดังนั้นหากสิ่งที่คุณต้องการคือ Step 5 Preview ปลายทางของผู้ให้บริการเองคือคำตอบที่ตรงไปตรงมา และเราจะไม่เสแสร้งว่าเป็นอย่างอื่น

GPT-5.6 Sol เป็นกรณีที่แตกต่างออกไป: มันอยู่ในแคตตาล็อกที่ /models/openai/gpt-5.6-sol เรียกใช้งานได้ด้วยคีย์เดียวกันและรูปแบบคำขอเดียวกันกับทุกสิ่งทุกอย่างที่เราให้บริการ รายละเอียดที่เกี่ยวข้องสำหรับใครก็ตามที่กำลังชั่งน้ำหนักสองตัวนี้คือรูปแบบการคิดราคา เราส่งต่อราคาตามรายการของผู้ให้บริการโดยบวกกำไร 0% ซึ่งหมายความว่าการลดราคาของผู้ขายจะไปถึงบิลของคุณในวันที่ผู้ขายประกาศลดนั้น — และ OpenAI ได้ลดราคาของ Sol ไปแล้วครั้งหนึ่งเมื่อวันที่ 21 สิงหาคม ด้วยอัตราโปรโมชันที่หมดอายุในวันที่ 21 พฤศจิกายน ไม่ว่า OpenAI จะตัดสินใจอะไรต่อไป ตัวเลขฝั่งเราก็จะขยับตามไปด้วย แทนที่จะล้าหลังบัตรราคาที่มีใครบางคนต้องคอยจำไปอัปเดต

การสลับไปใช้ระบบสำรองอัตโนมัติมีความสำคัญด้วยเหตุผลเดียวกัน โมเดลที่อยู่ในพรีวิวแบบจำกัดหลังเอนด์พอยต์เดียวถือเป็นจุดล้มเหลวจุดเดียว ส่วน Sol บนคีย์ที่กำหนดเส้นทางไม่เป็นเช่นนั้น เพราะคำขอสามารถสลับไปยังผู้ให้บริการต่างๆ ได้โดยไม่ต้องแก้โค้ด นั่นเป็นเหตุผลในการกำหนดเส้นทางให้ Sol แต่ไม่ใช่เหตุผลที่จะอ้างว่าเราโฮสต์โมเดลที่เราไม่ได้โฮสต์

OrcaRouter model page for GPT-5.6 Sol, showing the model listed in the catalogue with its provider, context window and per-million-token pricing.

ควรโทรหาใคร

เลือก GPT-5.6 Sol หากงานนั้นยากและเป็นแบบอะซิงโครนัส ตัวชี้วัดทั้งสามจุดนั้นเป็นของจริง ชุดการทดสอบมาตรฐานของผู้ขาย — exploitation, security, GPQA — กว้างขวางกว่าสิ่งใดที่ StepFun เคยเผยแพร่ และโมเดลที่ใช้เวลาสองนาทีกว่าจะเริ่มคิดก็ไม่ใช่ปัญหาเมื่อไม่มีใครรออยู่ เตรียมงบไว้สำหรับวันที่ 22 พฤศจิกายน เพราะอัตราโปรโมชันไม่ได้คงอยู่ถาวร และ OpenAI ยังไม่ได้บอกว่าจะใช้อะไรแทน

เลือก Step 5 Preview หากความหน่วงและต้นทุนต่อหน่วยเป็นตัวกำหนดการตัดสินใจ คุณต้องแลกกับคะแนนดัชนีสามคะแนน คุณได้โทเคนแรกภายในเวลาไม่ถึงสามวินาที ปริมาณงานเพิ่มขึ้นราว 60% อินพุตถูกลง 4 เท่า และเอาต์พุตถูกลง 7.4 เท่า — และคุณยอมรับว่าเวตเป็นเพียงคำสัญญาจนถึงวันที่ 15 ตุลาคม แทนที่จะเป็นไฟล์ให้ดาวน์โหลด

บทสรุปที่น่าอึดอัดก็คือ ชั้นราคาประหยัดได้มาถึงจุดที่ความนำของรุ่นเรือธงเหลือน้อยพอจะกลายเป็นเพียงความชอบส่วนบุคคลมากกว่าจะเป็นคำตัดสินชี้ขาด เมื่อปีที่แล้วไม่เป็นเช่นนี้ วันนี้เป็นเช่นนั้น และช่องว่างสามจุดบนดัชนีปัจจุบันคือหลักฐานที่ชัดเจนที่สุดของเรื่องนี้

GPT-5.6 Sol เป็นหนึ่งในโมเดลที่เราให้บริการโดยบวกเพิ่ม 0% พร้อมระบบสลับอัตโนมัติเมื่อเกิดข้อขัดข้อง ดังนั้นเมื่อผู้ให้บริการปรับราคา การเปลี่ยนแปลงจะมีผลกับคีย์เดิมภายในวันเดียวกัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube