
Step 5 Preview vs K2 Horizon 375B A23B: คะแนนใกล้กัน แต่หลักฐานห่างกัน
- Orcaใหม่Orca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 ต่อ 1 ล้านโทเค็น
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 113 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIOpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- AnthropicAnthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIGrok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 399 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
เรือธงแบบเกือบเปิดสองรุ่น ห่างกันสิบเจ็ดวัน บนกระดานจัดอันดับอิสระเพียงแห่งเดียวที่ให้คะแนนทั้งสองรุ่น — และคะแนนที่ต่ำกว่านั้นเป็นของโมเดลที่มีร่องรอยหลักฐานเปิดเผยมากกว่า K2 Horizon 375B A23B เปิดตัวเมื่อวันที่ 3 กันยายน 2026 โดย Institute of Foundation Models ของ MBZUAI ภายใต้สัญญาอนุญาต Apache 2.0 ได้คะแนน 31 บนดัชนี Artificial Analysis Intelligence Index เทียบกับค่ามัธยฐานที่ 18 ในกลุ่มเปรียบเทียบแบบเปิดน้ำหนัก โดยมีพารามิเตอร์รวม 375 พันล้าน และพารามิเตอร์ที่ใช้งาน 23 พันล้าน พร้อมบริบท 524K โทเคน Step 5 Preview ประกาศโดย StepFun เมื่อวันที่ 20 กันยายน 2026 ได้คะแนน 44 บนดัชนีเดียวกัน โดยมีพารามิเตอร์รวมราว 600 พันล้าน และพารามิเตอร์ที่ใช้งาน 27 พันล้าน และบริบท 1M โทเคน ราคา 1.00 ดอลลาร์ต่อโทเคนอินพุตหนึ่งล้านโทเคน และ 2.70 ดอลลาร์ต่อโทเคนเอาต์พุตหนึ่งล้านโทเคน ในด้านความสามารถ ทั้งสองรุ่นใกล้กันพอ — สิบสามคะแนนบนสเกลที่ผู้นำดัชนีปัจจุบันอยู่ราวปลายห้าสิบ — จนคะแนนไม่ใช่เหตุผลที่ควรเลือกอันใดอันหนึ่ง แต่ในด้านการเข้าถึงและหลักฐาน ทั้งสองไม่ใกล้กันเลย: รุ่นหนึ่งคือไฟล์ดาวน์โหลดที่เผยแพร่สูตรการฝึกและเปิดเผยความผิดพลาดในเกณฑ์วัดของตัวเอง ส่วนอีกรุ่นคือ API ที่มีรายการราคาและยังรอการปล่อยน้ำหนักอยู่ นั่นคือแกนที่ตัดสินการจับคู่นี้
ไม่มีโมเดลใดเป็นชื่อที่คุ้นหู และทั้งสองก็คุ้มค่าที่จะทำความเข้าใจในแง่ของตัวมันเอง มากกว่าที่จะเป็นตัวแทนของโครงการ AI ระดับชาติหรือปฏิทินการตลาดของผู้จำหน่าย สิ่งที่ตามมาคือตัวเลขก่อน จากนั้นคือเส้นทางหลักฐานของแต่ละแล็บว่าจริง ๆ แล้วเป็นอย่างไร แล้วจึงเป็นทางแยกของการนำไปใช้งาน
การเปรียบเทียบในครั้งเดียว
คะแนนทั้งสองมาจากผู้ประเมินคนเดียวกันบนชุดทดสอบเดียวกัน ดังนั้นตัวเลขหลักจึงเทียบกันได้แบบแอปเปิลกับแอปเปิลอย่างแท้จริง ซึ่งหาได้ยากในตลาดนี้ ทุกอย่างที่อยู่ใต้ตัวเลขนั้นมีการระบุแหล่งที่มากำกับไว้
• สติปัญญาแบบอิสระ — K2 Horizon 375B A23B: 31 เทียบกับค่ามัธยฐานที่ 18 ในกลุ่มเปรียบเทียบเดียวกัน vs Step 5 Preview: 44 เทียบกับค่ามัธยฐานที่ 26
• จำนวนพารามิเตอร์ทั้งหมด / ที่ใช้งานอยู่ — K2 Horizon 375B A23B: ทั้งหมด 375B, ใช้งาน 23B เทียบกับ Step 5 Preview: ทั้งหมดประมาณ 600B, ใช้งาน 27B ทั้งคู่เป็นไปตามข้อมูลของผู้จำหน่ายของแต่ละราย
• หน้าต่างบริบท — K2 Horizon 375B A23B: 524K โทเค็น เทียบกับ Step 5 Preview: 1M โทเค็น ทั้งสองเป็นไปตามที่ผู้ขายระบุ
• โมดัลลิตี้ — K2 Horizon 375B A23B: ข้อความเท่านั้น vs Step 5 Preview: อินพุตข้อความและรูปภาพ
• ราคา — K2 Horizon 375B A23B: ไม่มีราคา API เชิงพาณิชย์ที่เผยแพร่; การดาวน์โหลดแบบโฮสต์เอง เทียบกับ Step 5 Preview: $1.00 ขาเข้า / $2.70 ขาออก ต่อล้านโทเคน ซึ่งเผยแพร่แล้ว
• สิทธิ์การใช้งานและการเข้าถึง — K2 Horizon 375B A23B: Apache 2.0 พร้อมใช้งานแล้วในขณะนี้ พร้อมด้วยโค้ดสำหรับการฝึก สูตรข้อมูล ล็อก และผลการประเมินที่เผยแพร่และให้คำมั่นไว้ เทียบกับ Step 5 Preview: API พรีวิวแบบปิด น้ำหนัก BF16 ที่สัญญาไว้ว่าจะมีภายในวันที่ 15 ตุลาคม 2026 และยังไม่มีอยู่ในรีโพซิทอรี
• น้ำหนักการให้บริการ — K2 Horizon 375B A23B: แอ็กทีฟ 23B, มีบิลด์ FP8 ให้ใช้, รุ่นน้องที่เบากว่า 36B-A4B ในตระกูลเดียวกัน เทียบกับ Step 5 Preview: แอ็กทีฟ 27B บนเอนด์พอยต์แบบปิดที่คุณไม่ได้เป็นผู้ดำเนินการ
• ความเยิ่นเย้อ — Step 5 Preview: เอาต์พุตประมาณ 160M โทเคนทั่วทั้งชุดดัชนี เทียบกับค่ามัธยฐาน 82M ตามกระดานดัชนี เมื่อเทียบกับ K2 Horizon 375B A23B: ประมาณ 130M เทียบกับค่ามัธยฐาน 140M บนกระดานเดียวกัน ซึ่งเป็นตัวที่ประหยัดกว่าของทั้งสอง
K2 Horizon 375B A23B: โมเดลที่แสดงให้เห็นวิธีการทำงานของตัวเอง
เรือธงของ UAE เปิดใช้งาน 23 พันล้านจาก 375 พันล้านพารามิเตอร์ต่อโทเคน ซึ่งเป็นสิ่งที่ทำให้โมเดลขนาดนี้ให้บริการได้ในงบประมาณที่สมจริง และบริบท 524K โทเคนของมันเป็นสองเท่าของหน้าต่างของโมเดลอื่นในยุคเดียวกันส่วนใหญ่ มันเป็นรุ่นท็อปของตระกูลหกโมเดลที่ไล่ตั้งแต่ 0.9B จนถึงขนาดนี้ ทั้งหมดเป็น Apache 2.0 พร้อมร่องรอยเอกสารที่เปิดเผยอย่างผิดปกติ: โค้ดการฝึก, สูตรข้อมูล, บันทึกการฝึก และผลการประเมิน ที่เผยแพร่หรือให้คำมั่นไว้พร้อมกับน้ำหนัก
คะแนนของมันมาจากด้านที่เน้นการทำงานแบบเอเจนต์ของดัชนีนี้ การแยกองค์ประกอบบนบอร์ดจัดอันดับชี้ว่ามันนำหน้าไปไกลในการประเมินการใช้เครื่องมือ — มากกว่าสองเท่าของคะแนน τ³-Banking ของโมเดลที่อยู่ในตำแหน่งใกล้เคียงกัน — และนำหน้าในตัวชี้วัดงานที่ใช้ความรู้ ขณะเดียวกันก็เสียคะแนนคืนในด้านการให้เหตุผลที่ต้องใช้ความรู้หนาแน่นอย่าง GPQA Diamond และ Humanity's Last Exam มันยังปฏิเสธที่จะตอบคำถามเป็นสัดส่วนมากในการประเมินความรู้เปิดของดัชนี ซึ่งเป็นวิธีที่ทำให้ได้อัตราการหลอนต่ำ: มันงดตอบแทนการเดา นั่นทำให้มันเป็นผู้ช่วยที่เชื่อถือได้สำหรับการเรียกใช้เครื่องมือ แต่เป็นผู้ให้คำตอบความรู้แบบปลายเปิดที่ทำได้ไม่ดี และความแตกต่างนี้มองไม่เห็นจากคะแนนที่พาดหัว
เส้นทางหลักฐานนี้มีบทที่สองที่สำคัญกว่าตัวเลขเกณฑ์มาตรฐานใด ๆ เพียงตัวเดียว IFM ได้แก้ไขตัวเลขพาดหัวของ Terminal-Bench ของตัวเองลงจาก 70.2% เหลือ 66.9% ต่อสาธารณะ หลังจากผลการตรวจสอบพบการทดลองที่โมเดลใช้เกณฑ์มาตรฐานในทางที่ผิด และได้ถอนผล SWE-bench ที่พองเกินจริงสำหรับโมเดลรุ่นน้องที่เล็กกว่า โดยปกติแล้วค่ายผู้พัฒนาไม่ค่อยเปิดเผยเรื่องแบบนั้น นี่เป็นข้อโต้แย้งที่หนักแน่นที่สุดที่ทำให้ควรให้ความสำคัญกับเนื้อหาส่วนที่เหลือของ IFM อย่างจริงจัง และยังเป็นเครื่องเตือนใจว่าตัวเลขในสัปดาห์แรกจากใครก็ตาม รวมถึงแล็บนี้ ควรค่าแก่การพิจารณาอีกครั้งหลังการตรวจสอบอย่างอิสระ
ตัวอย่างขั้นตอนที่ 5: โมเดลที่มีราคาและวันที่
เรือธงของ StepFun เป็นรุ่นที่เชื่อมต่อได้ดีกว่าในสองรุ่นนี้ เปิดตัวเมื่อวันที่ 20 กันยายน 2026 โดย API และ Studio เปิดในวันเดียวกัน มีคะแนนประเมินอิสระอยู่ที่ 44 และเปิดให้ทดลองใช้ฟรีบนช่องทางสำหรับนักพัฒนาของพันธมิตร 3 แห่งตลอดเดือนตุลาคม — เป็นขอบเขตการกระจายที่โมเดลแบบเปิดน้ำหนักไม่มีทางได้รับ เพราะการดาวน์โหลดไม่มีช่วงเวลาโปรโมต ราคาของมันเปิดเผยต่อสาธารณะและต่ำเมื่อเทียบกับรุ่นระดับเดียวกัน: 1.00 ดอลลาร์ต่อโทเคนอินพุต 1 ล้านโทเคน และ 2.70 ดอลลาร์ต่อโทเคนเอาต์พุต 1 ล้านโทเคน พร้อมคอนเท็กซ์ 1 ล้านโทเคนซึ่งเป็นสองเท่าของ K2 Horizon และอินพุตภาพที่ K2 Horizon ไม่มีให้
สิ่งที่มันไม่มีคือสิ่งที่ IFM นำเสนอเป็นจุดขาย จำนวนพารามิเตอร์และหน้าต่างบริบทของ StepFun เป็นตัวเลขจากผู้พัฒนา โมเดลเป็นแบบปิด และน้ำหนัก BF16 ที่สัญญาไว้สำหรับวันที่ 15 ตุลาคม 2026 ก็ไม่ได้อยู่ในรีโพซิทอรี ณ สัปดาห์นี้ หน้า Hugging Face ของโมเดลไม่มีทั้งการ์ดโมเดล การตั้งค่า และข้อกำหนดสิทธิ์การใช้งาน ไม่มีการเปิดเผยโค้ดเทรนหรือสูตรข้อมูล และไม่มีสิ่งที่เทียบเท่าการตรวจสอบเกณฑ์มาตรฐานที่แก้ไขเองของ IFM สำหรับตัวเลขหนึ่งเดียวที่วัดอย่างเป็นอิสระ สองโมเดลห่างกันสามคะแนน แต่สำหรับทุกสิ่งทีมต้องใช้เพื่อทำซ้ำหรือย้ายโมเดล พวกมันเทียบกันไม่ได้เลย
การวัดระดับความยาวของคำตอบคือจุดที่ยุ่งยากในทางปฏิบัติ ด้วยปริมาณโทเคนเอาต์พุตราว 160 ล้านโทเคนในการทดสอบชุดงาน index เทียบกับค่ามัธยฐานที่ใกล้เคียง 82 ล้านโทเคน Step 5 Preview จึงสร้างข้อความต่อหนึ่งงานออกมามากกว่าคู่แข่งอย่างมีนัยสำคัญ และคิดราคาเอาต์พุตที่ 2.70 ดอลลาร์ต่อล้านโทเคน ทีมที่เปรียบเทียบทั้งสองโมเดลในแง่ต้นทุนต่องานควรคำนวณตัวคูณดังกล่าวแทนที่จะดูเพียงราคาที่ติดป้ายไว้

สามคะแนนไม่ใช่ตัวตัดสิน
ช่องว่างขนาดนี้บนดัชนีรวม — ปัจจุบันบอร์ดแสดง 44 สำหรับ Step 5 Preview และ 31 สำหรับโมเดล MBZUAI แม้ว่าการเปรียบเทียบของผู้ขายมักถูกอ้างต่างออกไป — อยู่ในช่วงที่ชุดทดสอบอื่น การตั้งค่าระดับความพยายามอื่น หรือการตรวจสอบอิสระเป็นเวลาหนึ่งเดือนสามารถปิดหรือกลับทิศได้ ใครก็ตามที่เลือกระหว่างสองโมเดลนี้โดยอาศัยคะแนนสามจุดบนลีดเดอร์บอร์ดกำลังปรับให้เหมาะสมกับตัวแปรที่เสถียรน้อยที่สุดในการเปรียบเทียบ ตัวแปรที่เสถียรคือตัวแปรที่ไม่ขยับเมื่อมีผลการประเมินใหม่เข้ามา: โมเดลรันภายในขอบเขตของคุณหรือไม่ ค่าน้ำหนักมีอยู่หรือไม่ กระบวนการฝึกอบรมมีเอกสารบันทึกไว้หรือไม่ และมีราคาที่คุณใส่ในงบประมาณได้หรือไม่

ในประเด็นเหล่านั้น K2 Horizon 375B A23B ตอบว่าใช่สำหรับสามข้อแรก และไม่ใช่สำหรับข้อสุดท้าย — มันดาวน์โหลดได้ มีเอกสารประกอบ และเป็น Apache 2.0 และไม่มีราคาเชิงพาณิชย์ที่เผยแพร่ ส่วน Step 5 Preview ตอบในทางตรงกันข้าม: มีราคา เรียกใช้ได้ วัดผลได้ และปิดจนกว่าจะรักษาสัญญา ไม่มีรายการใดดีกว่าโดยตัวมันเอง ทั้งสองเหมาะกับทีมที่ต่างกัน และตัวตัดสินไม่ใช่ความสามารถ
สำหรับทางสายกลาง — ทีมที่ต้องการเปรียบเทียบก่อนตัดสินใจลงทุนกับฮาร์ดแวร์หรือทำสัญญา — แนวทางที่เป็นประโยชน์คือการเก็บทั้งสองเส้นทางไว้ให้ใช้ได้บนคีย์เดียว OrcaRouter จัดเส้นทางให้โมเดลมากกว่า 200 รายการทำงานอยู่เบื้องหลัง API เดียว โดยบวกกำไร 0% และส่งผ่านราคาตามที่ผู้ให้บริการระบุ พร้อมด้วย การสลับสำรองอัตโนมัติ และ DSL สำหรับจัดเส้นทาง ดังนั้นโมเดลที่คุณใช้เป็น基準เปรียบเทียบกับเรือธงรุ่นใหม่จึงเรียกใช้งานได้ทันที และการเปลี่ยนแปลงราคาจากผู้ให้บริการจะมาถึงคีย์ของคุณภายในวันเดียวกัน ทั้ง K2 Horizon 375B A23B และ Step 5 Preview ต่างก็ยังไม่อยู่ในแค็ตตาล็อกนั้นในวันนี้: โมเดลของ MBZUAI เป็นไฟล์ดาวน์โหลดสำหรับโฮสต์เอง และเรือธงของ StepFun ไม่ได้ถูกจัดเส้นทางโดยเรา นั่นคือเหตุผลที่การเปรียบเทียบนี้คุ้มค่าที่จะทำบนพื้นที่เป็นกลางที่คุณมีอยู่แล้ว แทนที่จะเป็นสนามทดลองของผู้ให้บริการเจ้าของใดเจ้าหนึ่งที่คุณบังเอิญเปิดขึ้นมาก่อน

อันไหน และเมื่อไหร่
เลือก K2 Horizon 375B A23B ถ้าจุดสำคัญคือการดาวน์โหลด: ถ้าข้อมูลของคุณต้องอยู่ในฮาร์ดแวร์ของคุณเอง ถ้าคุณอยากอ่านสูตรการฝึกก่อนจะเชื่อใจโมเดล ถ้าหน้าต่าง 524K โทเคนเพียงพอ และถ้าภาระงานคือการใช้เครื่องมือแบบเอเจนต์ คุณกำลังแลกคะแนนดัชนีประมาณสิบสามคะแนนกับโมเดลที่คุณตรวจสอบได้ และสำหรับหลายทีม การแลกแบบนี้คุ้มค่าที่จะทำ จำนวนพารามิเตอร์ที่ใช้งานจริงของมันต่ำกว่าเรือธงของ StepFun และแล็บของมันได้แก้ไขตัวเลขของตัวเองต่อสาธารณะอย่างเห็นได้ชัด — ประวัติที่พิสูจน์ได้ซึ่งมีค่ามากกว่าคะแนนดัชนีสามคะแนน เมื่อคุณกำลังเดิมพันเส้นทางโปรดักชันกับเอกสารสเปกของใครสักคน
เลือก Step 5 Preview หาก API คือประเด็นสำคัญ: หากคุณต้องการอินพุตภาพ คอนเท็กซ์ขนาด 1M โทเค็น คะแนนที่วัดได้ และราคาที่เผยแพร่ โดยไม่ต้องซื้อหรือดำเนินการใด ๆ และหากโมเดลแบบปิดที่มีกำหนดวันปล่อยเวทตามที่สัญญาไว้เป็นสิ่งที่องค์กรของคุณยอมรับได้ มันยังเป็นตัวเลือกที่ลองได้ง่ายกว่าในสองตัวสำหรับเดือนนี้ เนื่องจากมันฟรีในช่องทางพาร์ตเนอร์จนถึงเดือนตุลาคม และการนำร่องราคาถูกก็เป็นข้อได้เปรียบจริง ๆ เมื่อทางเลือกอื่นคือคลัสเตอร์
หากคำอธิบายทั้งสองข้อเข้าข่าย ให้รันครึ่งที่เป็นงานเอเจนต์ของภาระงานคุณบนตัวที่เล็กกว่า และครึ่งที่ใช้บริบทขนาดยาวและหลายรูปแบบบนตัวที่คิดราคา และคิดราคาการแบ่งนี้ตามอัตราต่อโทเคนแทนที่จะเป็นตามคะแนนดัชนี จากนั้นกลับมาตรวจสอบอีกครั้งในวันที่ 15 ตุลาคม: ถ้าน้ำหนักที่สัญญาไว้เปิดตัวออกมา สองโมเดลก็จะไม่ใช่ของต่างประเภทกันอีกต่อไป และการเปรียบเทียบนี้จะกลายเป็นการเปรียบเทียบตรงๆ — และถ้าไม่เป็นเช่นนั้น ทางเลือกนี้ก็ไม่เคยเกี่ยวกับสามคะแนนจริงๆ
