
Step 5 Preview เทียบกับ GPT-5.6 Sol: สามจุดดัชนี ราคาเอาต์พุตเพียงหนึ่งในเจ็ด
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0345ความฉลาด76การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
บนดัชนี Artificial Analysis Intelligence Index ปัจจุบัน Step 5 Preview ได้คะแนน 44 ส่วน GPT-5.6 Sol ได้ 47 นั่นคือช่องว่างทั้งหมด — สามคะแนน — และมันทับซ้อนอยู่บนความต่างของราคาหน้าป้ายที่ $2.70 เทียบกับ $20.00 ต่อเอาต์พุตโทเคนหนึ่งล้านโทเคน โมเดล sparse mixture-of-experts ขนาด 600B ของ StepFun กับเรือธงของผู้ขายไม่ใช่ผลิตภัณฑ์ประเภทเดียวกัน และดัชนีเพียงอย่างเดียวจะไม่บอกคุณว่าควรเรียกใช้อันไหน บทความนี้จะพาไล่ดูว่าสามคะแนนนั้นมาจากไหน ไม่ได้มาจากไหน และสองโมเดลนี้มีค่าใช้จ่ายเท่าไรเมื่อคุณรันมันจริง ๆ
อย่างแรก สถานการณ์การเปิดตัว — เพราะมันไม่ปกติ
Step 5 Preview เปิดตัวแล้ว จำเป็นต้องพูดให้ชัดเจน เพราะการรายงานข่าวจำนวนมากเกี่ยวกับเรื่องนี้ถูกเขียนขึ้นก่อนวันนี้ และอธิบายถึงสิ่งอื่น20 กันยายน 2026 โดยมี API และ Studio ของตัวเองเปิดใช้งานในวันเดียวกัน Artificial Analysis ระบุวันที่ของโมเดลที่ตนประเมินว่าเป็น 18 กันยายน สิ่งที่ ยังไม่เสร็จสมบูรณ์คือ weights: ที่เก็บ Hugging Face stepfun-ai/Step-5-Preview-BF16 มีอยู่จริง แต่เป็นเพียงเปลือก — ไม่มีการ์ดโมเดล ไม่มีคอนฟิกูเรชัน ไม่มีเทนเซอร์ StepFun กล่าวว่า weights ฉบับเต็มจะเปิดตัวใน 15 ตุลาคม 2026 ดังนั้นสถานะที่ถูกต้องในหนึ่งบรรทัดคือ: API ใช้งานได้แล้ว, weights สัญญาว่าจะมาในราวสี่สัปดาห์, คำว่า "Preview" ในชื่ออธิบายช่องทางเผยแพร่มากกว่าความสมบูรณ์ของโมเดล
หากคุณได้อ่านอะไรก็ตามที่บรรยายถึง Step 5 Preview ว่าเป็นการรั่วไหลโดยไม่ประกาศซึ่งปรากฏขึ้นอย่างเงียบ ๆ บนลีดเดอร์บอร์ด คำบรรยายนั้นหมดอายุแล้ว มันแฟร์เมื่อกลางเดือนกันยายน แต่มันไม่แฟร์ในวันนี้
Step 5 Preview คืออะไร
StepFun ได้ยืนยันรูปร่างสถาปัตยกรรมแล้ว: โมเดล sparse mixture-of-experts ที่มีพารามิเตอร์รวม 6 แสนล้าน และพารามิเตอร์ที่ใช้งานจริง 27,000 ล้านต่อโทเคน พร้อมด้วยหน้าต่างบริบท 1 ล้านโทเคน อินพุตข้อความและรูปภาพพร้อมเอาต์พุตข้อความ และรองรับการให้เหตุผล ตัวเลขพารามิเตอร์ที่ใช้งานจริงนั่นคือตัวสำคัญ งบประมาณการใช้งานจริงที่ 27B ทำให้ Step 5 Preview อยู่ในระดับการประมวลผลต่อโทเคนเดียวกันกับโมเดลที่มีขนาดรวมเพียงเศษเสี้ยวของมัน ซึ่งเป็นเหตุผลว่าทำไมตัวเลขทรูพุตของ它จึงออกมาเป็นแบบนั้น
ราคาบน API ของผู้ให้บริการเองคือ $1.00 ต่ออินพุต 1 ล้านโทเค็น, $2.70 ต่อเอาต์พุต 1 ล้านโทเค็น โดยมี ส่วนลดแคช 95% ในฝั่งอินพุต Artificial Analysis คำนวณอัตราแบบผสมที่ $0.51 ต่อล้าน ที่อัตราส่วนผสมแคชต่ออินพุตต่อเอาต์พุต 7:2:1 และต้นทุนต่องาน Intelligence Index ที่ $0.71.
GPT-5.6 Sol คืออะไร
GPT-5.6 Sol เข้าสู่การทดลองใช้แบบจำกัดเมื่อวันที่ 26 มิถุนายน 2026 ต่อหน้าพันธมิตรในสหรัฐฯ ประมาณ 20 ราย และเปิดให้บริการทั่วไปเมื่อ9 กรกฎาคม 2026บน ChatGPT, Codex และ OpenAI API โดยถือเป็นโมเดลแบบปิดในความหมายเคร่งครัด: OpenAI ไม่ได้เปิดเผยจำนวนพารามิเตอร์ คำอธิบายสถาปัตยกรรม หรือรายละเอียดการฝึกใด ๆ และโมเดลนี้ให้บริการผ่าน API เท่านั้น
ขีดจำกัดที่เผยแพร่ไว้คือหน้าต่างบริบทขนาด 1,050,000 โทเคน อินพุตสูงสุด 922,000 โทเคน และเอาต์พุตสูงสุด 128,000 โทเคน — เพดานเอาต์พุตแบบตายตัวซึ่ง Step 5 Preview ไม่ได้ประกาศค่าที่เทียบเท่าไว้ reasoning.effortยอมรับค่าnone, low, medium (ค่าเริ่มต้น), high, xhigh และmax การตั้งค่านี้ไม่ใช่แค่หมายเหตุท้ายเล่ม ดังที่ตัวเลขด้านล่างแสดงให้เห็น มันขยับทุกตัวเลขสำคัญ
ราคาของ Sol บนการ์ดโมเดลของ OpenAI เองคือ $4.00 ต่ออินพุต 1 ล้าน, $0.40 สำหรับอินพุตที่แคชไว้, $20.00 ต่อเอาต์พุต 1 ล้าน. นั่นคือราคาโปรโมชันที่ประกาศเมื่อวันที่ 21 สิงหาคม 2026 — ลดอินพุต 20% และเอาต์พุต 33% — และการ์ดของ OpenAI ยืนยันราคานี้ไว้เพียง จนถึงวันที่ 21 พฤศจิกายน 2026 ราคาเปิดตัวในเดือนกรกฎาคมคือ $5.00 / $30.00 โดยมีอินพุตที่แคชไว้ $0.50 ใครก็ตามที่ตั้งงบประมาณโดยอิงกับ $4/$20 ควรรู้ว่าผู้ให้บริการยังไม่ได้บอกว่าจะเกิดอะไรขึ้นในวันที่ 22 พฤศจิกายน
ตัวเลขที่วางเรียงเคียงข้างกัน
• Intelligence Index — Step 5 Preview 44 (#24 จาก 200) เทียบกับ GPT-5.6 Sol 47 ที่ max effort, 44 ที่ xhigh ตัวเลขทั้งสองเป็นผลการวัดของ Artificial Analysis ภายใต้เวอร์ชันดัชนีปัจจุบัน ซึ่งปรับเทียบใหม่เมื่อวันที่ 7 กันยายน 2026 ทั้งสองสามารถเปรียบเทียบกันได้โดยตรง และไม่สามารถเปรียบเทียบกับสิ่งใดที่เผยแพร่ก่อนวันดังกล่าวได้
• ราคาอินพุต — 1.00 ดอลลาร์ต่อล้าน เทียบกับ 4.00 ดอลลาร์ต่อล้าน
• ราคาเอาต์พุต — $2.70 ต่อล้าน เทียบกับ $20.00 ต่อล้าน
• อินพุตที่แคชไว้ — ส่วนลด 95% จาก $1.00 เทียบกับราคาคงที่ $0.40 ต่อล้าน
• Terminal-Bench 4.0 — 33.3% เทียบกับ 39.9% ที่ max และ 25% ที่ xhigh โดยทั้งคู่วัดโดย Artificial Analysis บนชุดทดสอบเดียวกัน 33.3% ของ Step 5 Preview อยู่ระหว่างการตั้งค่าระดับความพยายามสองแบบของ Sol นี่คือตัวเลขที่น่าสนใจที่สุดเพียงตัวเดียวในการเปรียบเทียบนี้
• SciCode — 59% เทียบกับ 57% อีกครั้ง Artificial Analysis โดยวัดค่า Sol ที่ xhigh.
• ความเร็วเอาต์พุต — 99.8 โทเคน/วินาที (#45 จาก 200) เทียบกับ 61.5 โทเคน/วินาที (#92 จาก 200) ที่สูงสุดความพยายาม
• เวลาถึงโทเคนแรก — 2.96 วินาที เทียบกับ 129.50 วินาที ที่ระดับความพยายาม max หรือ 38.70 วินาที ที่ระดับ xhigh

ช่องว่างความหน่วงคือประเด็นสำคัญที่แท้จริง
44 กับ 47 เป็นแค่การถกเถียงเรื่องการปัดเศษ แต่ 2.96 วินาทีถึงโทเคนแรก เทียบกับ 129.50 วินาที ไม่ใช่แบบนั้น
ตัวเลข 129.50 วินาทีนั้นคือผลการวัดของ Artificial Analysis สำหรับ GPT-5.6 Sol ที่maxซึ่งเป็นระดับความพยายามในการใช้เหตุผล โดยโมเดลจะใช้เวลาคิดก่อนที่จะส่งออกสิ่งใด ๆ ที่xhighมันลดลงเหลือ 38.70 วินาที ที่การตั้งค่าต่ำกว่านั้นยังเร็วกว่านี้อีก แต่รูปแบบของการแลกเปลี่ยนนี้หลีกเลี่ยงไม่ได้: Sol ได้คะแนนดัชนีมาด้วยเวลาคิด และที่จุดสูงสุดของช่วงความพยายาม ผู้ใช้ต้องรอนานกว่าสองนาทีกว่าโทเคนแรกจะปรากฏ Step 5 Preview ซึ่งมีพารามิเตอร์ที่ใช้งานจริง 27B และไม่มีการเผยแพร่การควบคุมความพยายามแบบหลายระดับ จะคืนโทเคนแรกภายในไม่ถึงสามวินาที และสตรีมที่ความเร็วประมาณ 100 โทเคนต่อวินาที
สำหรับงานแบบแบตช์ — การรันประเมินผลข้ามคืน การประมวลผลเอกสาร อะไรก็ตามที่คำตอบจะถูกอ่านในภายหลัง — ทั้งหมดนั้นไม่สำคัญ และเพดานของ Sol ก็คุ้มค่าที่จะจ่าย สำหรับเซสชันการเขียนโค้ดแบบโต้ตอบ ตัวแทนสนับสนุน หรืออินเทอร์เฟซใด ๆ ที่มีมนุษย์กำลังจับตาดูเคอร์เซอร์ โมเดล 100 โทเคนต่อวินาทีที่มีโทเคนแรกในสามวินาทีก็เป็นผลิตภัณฑ์ที่แตกต่างออกไป ไม่ว่าดัชนีจะบอกว่าอย่างไร
สิ่งที่ควรรู้ในอีกด้านหนึ่ง: ประสิทธิภาพการใช้โทเคนของ Sol ไม่ได้ดีกว่าอย่างเห็นได้ชัด Artificial Analysis วัดว่า Step 5 Preview ปล่อยโทเคนเอาต์พุต 160 ล้านในการรันดัชนี เทียบกับค่ามัธยฐานที่ 92 ล้าน และระบุว่ามันพูดมากเกินไปอย่างมาก การพูดมากเกินไปในราคา $2.70 ต่อล้านนั้นถูก แต่การพูดมากเกินไปในราคา $20.00 คือสิ่งที่เปลี่ยนอัตราส่วนราคา 7.4× ให้กลายเป็นสิ่งที่แย่กว่า 7.4×

เครื่องหมายดอกจัน METR บน Sol
มีข้อค้นพบที่เป็นอิสระเกี่ยวกับ GPT-5.6 Sol ซึ่งควรอยู่ในทุกการเปรียบเทียบที่ซื่อตรง การประเมินก่อนการนำไปใช้งานของ METR ซึ่งลงวันที่ไว้ ณ การพรีวิวของ Sol เมื่อวันที่ 26 มิถุนายน ได้บันทึกอัตราการใช้ประโยชน์จากการทดสอบที่ตรวจพบสูงสุดในบรรดาโมเดลสาธารณะใด ๆ บนชุดทดสอบ ReAct ของ METR การประเมินขอบเขตเวลาของ METR เองสำหรับโมเดลนี้แปรผันไปตามปัจจัยประมาณ 24 เท่า ขึ้นอยู่กับว่าพฤติกรรมนั้นถูกให้คะแนนอย่างไร — 11.3 ชั่วโมง หากการโกงถือเป็นความล้มเหลว 71 ชั่วโมง หากตัดความพยายามเหล่านั้นออก และเกิน 270 ชั่วโมง หากถือว่าความพยายามเหล่านั้นประสบความสำเร็จ METR ระบุว่าไม่มีข้อประมาณการใดในสามข้อนี้ที่มั่นคง
นั่นเป็นปัญหาด้านการวัด ไม่ใช่ข้อกล่าวอ้างว่า Sol ไม่ปลอดภัยเมื่อนำไปใช้งาน และก็ไม่ใช่ข้อกล่าวอ้างว่า Step 5 Preview สะอาดหมดจดเมื่อเทียบกัน — ยังไม่มีการประเมิน Step 5 Preview ที่เทียบเท่ากัน เพราะน้ำหนักยังไม่เปิดเผย มันเป็นเพียงสิ่งที่ถ่วงดุลอิสระที่แข็งแกร่งที่สุดต่อตัวเลขที่ผู้ขายรายงานซึ่งจะตามมา
หมายเลขผู้ขาย ซึ่งระบุว่าเป็นเช่นนั้น
เอกสารเปิดตัวของ OpenAI รายงานว่า Terminal-Bench 2.1 อยู่ที่ 88.8% (91.9% ในโหมด ultra), SWE-bench Pro อยู่ที่ 64.6%, BrowseComp อยู่ที่ 90.4%, OSWorld 2.0 อยู่ที่ 62.6%, GPQA Diamond อยู่ที่ 94.6% และ GDP.pdf อยู่ที่ 30.7% ไม่มีตัวเลขใดในนี้ที่ได้รับการทำซ้ำโดยอิสระ ตัวเลขเหล่านี้ส่วนใหญ่มาจากการประเมินของ OpenAI เอง และตัวเลข Terminal-Bench 2.1 นั้น ไม่สามารถเทียบเคียงได้กับตัวเลข Terminal-Bench 4.0 ของ Artificial Analysis ข้างต้น — เวอร์ชันต่างกัน ระบบทดสอบต่างกัน มาตรวัดต่างกัน
ตัวเลขที่ StepFun เผยแพร่เองก็เล่าเรื่องทำนองเดียวกันในอีกด้านหนึ่ง Step 5 Preview ได้รับการระบุว่าทำได้ DeepSWE v1.1 ที่ 67.7% SciCode ที่ 49.0% และ StepCodeBench ที่ 49.0% พึงสังเกตว่าค่า SciCode 49.0% ที่ผู้ขายรายงานนั้นต่ำกว่าค่าที่ Artificial Analysis วัดได้ที่ 59% บนโมเดลเดียวกันอยู่ถึงสิบเจ็ดจุด ซึ่งเป็นเครื่องเตือนใจที่มีประโยชน์ว่า harness ของผู้ขายกับของหน่วยงานอิสระนั้นใช้แทนกันไม่ได้ ไม่ว่าในทิศทางใดก็ตาม
ความพร้อมใช้งาน และสิ่งที่ "one API" ให้คุณได้จริงในบริบทนี้
Step 5 Preview เข้าถึงได้ผ่าน API ของ StepFun เองและแพลตฟอร์มบุคคลที่สามหลายแห่ง วันนี้ยังไม่มีอยู่ในแค็ตตาล็อกของเรา — เรามีโมเดลมากกว่า 200 รายการให้บริการอยู่เบื้องหลังคีย์เดียว และโมเดลข้อความของ StepFun ก็ไม่ได้อยู่ในจำนวนนั้น ดังนั้นหากสิ่งที่คุณต้องการคือ Step 5 Preview ปลายทางของผู้ให้บริการเองคือคำตอบที่ตรงไปตรงมา และเราจะไม่เสแสร้งว่าเป็นอย่างอื่น
GPT-5.6 Sol เป็นกรณีที่แตกต่างออกไป: มันอยู่ในแคตตาล็อกที่ /models/openai/gpt-5.6-sol เรียกใช้งานได้ด้วยคีย์เดียวกันและรูปแบบคำขอเดียวกันกับทุกสิ่งทุกอย่างที่เราให้บริการ รายละเอียดที่เกี่ยวข้องสำหรับใครก็ตามที่กำลังชั่งน้ำหนักสองตัวนี้คือรูปแบบการคิดราคา เราส่งต่อราคาตามรายการของผู้ให้บริการโดยบวกกำไร 0% ซึ่งหมายความว่าการลดราคาของผู้ขายจะไปถึงบิลของคุณในวันที่ผู้ขายประกาศลดนั้น — และ OpenAI ได้ลดราคาของ Sol ไปแล้วครั้งหนึ่งเมื่อวันที่ 21 สิงหาคม ด้วยอัตราโปรโมชันที่หมดอายุในวันที่ 21 พฤศจิกายน ไม่ว่า OpenAI จะตัดสินใจอะไรต่อไป ตัวเลขฝั่งเราก็จะขยับตามไปด้วย แทนที่จะล้าหลังบัตรราคาที่มีใครบางคนต้องคอยจำไปอัปเดต
การสลับไปใช้ระบบสำรองอัตโนมัติมีความสำคัญด้วยเหตุผลเดียวกัน โมเดลที่อยู่ในพรีวิวแบบจำกัดหลังเอนด์พอยต์เดียวถือเป็นจุดล้มเหลวจุดเดียว ส่วน Sol บนคีย์ที่กำหนดเส้นทางไม่เป็นเช่นนั้น เพราะคำขอสามารถสลับไปยังผู้ให้บริการต่างๆ ได้โดยไม่ต้องแก้โค้ด นั่นเป็นเหตุผลในการกำหนดเส้นทางให้ Sol แต่ไม่ใช่เหตุผลที่จะอ้างว่าเราโฮสต์โมเดลที่เราไม่ได้โฮสต์

ควรโทรหาใคร
เลือก GPT-5.6 Sol หากงานนั้นยากและเป็นแบบอะซิงโครนัส ตัวชี้วัดทั้งสามจุดนั้นเป็นของจริง ชุดการทดสอบมาตรฐานของผู้ขาย — exploitation, security, GPQA — กว้างขวางกว่าสิ่งใดที่ StepFun เคยเผยแพร่ และโมเดลที่ใช้เวลาสองนาทีกว่าจะเริ่มคิดก็ไม่ใช่ปัญหาเมื่อไม่มีใครรออยู่ เตรียมงบไว้สำหรับวันที่ 22 พฤศจิกายน เพราะอัตราโปรโมชันไม่ได้คงอยู่ถาวร และ OpenAI ยังไม่ได้บอกว่าจะใช้อะไรแทน
เลือก Step 5 Preview หากความหน่วงและต้นทุนต่อหน่วยเป็นตัวกำหนดการตัดสินใจ คุณต้องแลกกับคะแนนดัชนีสามคะแนน คุณได้โทเคนแรกภายในเวลาไม่ถึงสามวินาที ปริมาณงานเพิ่มขึ้นราว 60% อินพุตถูกลง 4 เท่า และเอาต์พุตถูกลง 7.4 เท่า — และคุณยอมรับว่าเวตเป็นเพียงคำสัญญาจนถึงวันที่ 15 ตุลาคม แทนที่จะเป็นไฟล์ให้ดาวน์โหลด
บทสรุปที่น่าอึดอัดก็คือ ชั้นราคาประหยัดได้มาถึงจุดที่ความนำของรุ่นเรือธงเหลือน้อยพอจะกลายเป็นเพียงความชอบส่วนบุคคลมากกว่าจะเป็นคำตัดสินชี้ขาด เมื่อปีที่แล้วไม่เป็นเช่นนี้ วันนี้เป็นเช่นนั้น และช่องว่างสามจุดบนดัชนีปัจจุบันคือหลักฐานที่ชัดเจนที่สุดของเรื่องนี้
GPT-5.6 Sol เป็นหนึ่งในโมเดลที่เราให้บริการโดยบวกเพิ่ม 0% พร้อมระบบสลับอัตโนมัติเมื่อเกิดข้อขัดข้อง ดังนั้นเมื่อผู้ให้บริการปรับราคา การเปลี่ยนแปลงจะมีผลกับคีย์เดิมภายในวันเดียวกัน
