
Solar Mini 4 vs MathForm 8B: โมเดลหนึ่งตอบคำถาม อีกโมเดลทำให้ตรวจสอบได้
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-29$2.00 / $10.00 ต่อ 1 ล้านโทเค็น
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-28$2.00 / $10.00 ต่อ 1 ล้านโทเค็น · 159 tok/s
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 220 tok/s
- OpenAIใหม่OpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- Anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIใหม่Grok 4.72026-09-2146ความฉลาด
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 118 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 102 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 217 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
วาง Solar Mini 4 ไว้ข้าง ๆ MathForm 8B แล้วคุณกำลังเปรียบเทียบโมเดลสองตัวที่ไม่ได้แข่งขันกันในโทเคนเดียวกัน Solar Mini 4 คือ sparse mixture-of-experts ขนาด 3.5 หมื่นล้านพารามิเตอร์ของ Upstage เปิดตัวเมื่อวันที่ 22 กันยายน 2026 โดยมีพารามิเตอร์ที่ทำงานอยู่ราว 3 พันล้านตัวต่อโทเคน และมันตอบคำถาม: อ่านเอกสารยาว ๆ ให้เหตุผลเหนือเอกสารนั้น แล้วคืนผลลัพธ์ออกมาเป็นข้อความ MathForm 8B คือ autoformalizer ขนาด 8 พันล้านพารามิเตอร์ของ OpenBMB เผยแพร่เมื่อวันที่ 14 สิงหาคม 2026 ภายใต้ Apache 2.0 และมันทำในสิ่งที่โมเดลให้เหตุผลใด ๆ ไม่ทำเลยสักนิด — มันนำข้อความทางคณิตศาสตร์ในภาษาธรรมชาติมาเขียนใหม่เป็นทฤษฎีบท Lean 4 ที่คอมไพเลอร์ของ proof assistant จะตรวจสอบชนิดได้ ตัวหนึ่งผลิตคำตอบ อีกตัวผลิตคำถามที่เครื่องตรวจสอบได้ และอย่างหลังคือสินค้าที่หายากกว่า
การเปรียบเทียบนี้ก็ยังคุ้มค่าที่จะทำอยู่ดี เพราะทั้งสองลงเอยในไปป์ไลน์แบบเดียวกัน และเพราะทั้งคู่มีจุดแข็งที่ตรงข้ามกันในลักษณะที่ทำให้การเลือกนั้นชัดเจนเป็นพิเศษ โมเดลของ Upstage เก่งเรื่องเอกสารยาว อ่อนเรื่องการให้เหตุผลที่ยาก และมีค่าใช้จ่ายสูงต่อหนึ่งงานที่ทำเสร็จ โมเดลของ OpenBMB นั้นแคบจนถึงขั้นไร้ประโยชน์นอกเหนือจากกลุ่มเฉพาะทางของมัน ไม่เคยถูกให้คะแนนโดยผู้ประเมินอิสระเลยแม้แต่ครั้งเดียว และไม่มีค่าใช้จ่ายใด ๆ ในการรันเมื่อคุณมี GPU แล้ว
เคียงข้างกัน ในสิ่งที่แตกต่าง
• คืออะไร — Solar Mini 4 เป็นโมเดลสำหรับการให้เหตุผลทั่วไปที่มีบริบทขนาด 1M โทเคน (512K ตามเอกสารของ Upstage เอง) และมีคะแนนที่วัดได้ 24.1 บน Artificial Analysis Intelligence Index ส่วน MathForm 8B เป็นตัวแปลงเป็นรูปแบบทางการอัตโนมัติแบบงานเดียวที่ไม่มีคะแนนดัชนีเผยแพร่ ไม่มีการประเมินโดยอิสระ และไม่มีการกล่าวอ้างความสามารถทั่วไป
• พารามิเตอร์ — 35B รวม / 3B ที่ใช้งานอยู่, แบบสแปร์ส, สำหรับ Solar Mini 4; 8.19B แบบเดนส์สำหรับ MathForm 8B, ไฟน์ทูนจาก Qwen3-8B บนคลังข้อมูล FormalVerse ของ OpenBMB ซึ่งมีตัวอย่าง Lean 4 ที่ผ่านการตรวจสอบแล้วประมาณ 367,000 ตัวอย่าง
• ใบอนุญาตและการส่งมอบ — Solar Mini 4 เป็นซอฟต์แวร์เฉพาะ เข้าถึงได้ผ่าน API ของ Upstage และแพลตฟอร์มของบุคคลที่สาม MathForm 8B เป็น weights ภายใต้ Apache-2.0 พร้อมเทมเพลตแชต, safetensors สี่ชาร์ด และเส้นทางการดีพลอยด้วย Transformers, vLLM หรือ SGLang ผ่านเอนด์พอยต์ที่เข้ากันได้กับ OpenAI
• ราคา — Solar Mini 4 อยู่ที่ $0.10 / $0.01 สำหรับแคช / $0.40 ต่อล้านโทเคน ปัจจุบันลด 50% ถึงวันที่ 22 ตุลาคม 2026 ส่วน MathForm 8B ไม่มีตารางราคา ค่าใช้จ่ายของมันคือ GPU ที่คุณใส่ให้มัน
• ความเร็ว — 204 โทเคนเอาต์พุตต่อวินาทีสำหรับ Solar Mini 4 บนชุดทดสอบของ Artificial Analysis โดยมี 88,300 โทเคนเอาต์พุตต่องานดัชนี และใช้เวลาทำงานประมาณ 430 วินาทีต่องาน เอาต์พุตของ MathForm 8B คือส่วนหัวทฤษฎีบท Lean 4 เพียงหนึ่งอัน ซึ่งมีไม่เกินไม่กี่ร้อยโทเคน
• ความเป็นอิสระของตัวเลข — Solar Mini 4 ถูกรันโดยบุคคลที่สามแล้ว ส่วน MathForm 8B ยังไม่ถูกรัน: ตัวเลขทุกตัวในเปเปอร์ของมันเป็นของผู้เขียนเอง และโมเดลนี้ใหม่เกินไปและเฉพาะทางเกินไปจนไม่ดึงดูดให้มีการรันโดยอิสระ
จุดที่โมเดลทั้งสองบรรจบกัน และจุดที่ไม่ได้บรรจบกัน

โหมดความล้มเหลวคือสิ่งที่ทำให้การจับคู่นี้น่าสนใจ เพราะมันเป็นสิ่งที่ตรงกันข้ามกันโดยสิ้นเชิง ผลลัพธ์ที่ตีพิมพ์ที่อ่อนแอที่สุดของ Solar Mini 4 คือ Terminal-Bench 4.0 ที่ 1% โดยมี AutomationBench-AA ที่ 22.3% — มันแย่ในการตรวจสอบงานของตัวเองในสภาพแวดล้อมที่ให้ข้อเสนอแนะแก่มัน หลักการออกแบบทั้งหมดของ MathForm 8B คือการตรวจสอบ: OpenBMB แยกความแตกต่างระหว่าง Syntax Check ซึ่งถามว่าข้อความ Lean 4 คอมไพล์หรือไม่ กับ Consistency Check ซึ่งถามว่าข้อความที่คอมไพล์แล้วนั้นมีความหมายเหมือนกับปัญหาที่ไม่เป็นทางการจริงหรือไม่ ความล้มเหลวแบบคลาสสิกที่มันมีอยู่เพื่อป้องกันคือข้อความที่ผ่านการตรวจสอบชนิดแต่แอบลดทอนข้อกล่าวอ้างลงอย่างเงียบ ๆ
นั่นเป็นความแตกต่างจริง ๆ และเป็นการดีที่จะพูดให้แม่นยำเกี่ยวกับเรื่องนี้ โมเดลที่ให้เหตุผลซึ่งสร้างบทพิสูจน์มีปัญหาการตรวจสอบตนเองที่รู้กันดี: ไม่มีอะไรในการสร้างคำตอบที่บอกคุณได้ว่าคำตอบนั้นถูกต้องหรือไม่ คอมไพเลอร์ทำได้ ถ้ากระบวนการทำงานของคุณคือ "แปลงคลังโจทย์ให้เป็นสิ่งที่เครื่องสามารถตรวจสอบได้" แล้ว MathForm 8B กำลังทำครึ่งหนึ่งของงานที่ Solar Mini 4 ทำไม่ได้เลย และส่วนที่เหลือก็ไม่ใช่เรื่องของระดับความมากน้อย
ตัวเลขจากผู้ขาย ซึ่งระบุไว้เช่นนั้น: บทความของ OpenBMB รายงานค่าเฉลี่ย Pass@8 ที่ 88.06% ภายใต้ Syntax Check และ 72.37% ภายใต้ Consistency Check จากหกเบนช์มาร์ก และอ้างว่าตัวเลขเหล่านั้นเอาชนะ autoformalizer ขนาด 32B เฉพาะทางหลายตัวได้ ไม่มีส่วนใดเลยที่ถูกทำซ้ำโดยบุคคลที่สาม การลดลง 16 จุดระหว่างการตรวจสอบทั้งสองเป็นตัวเลขที่ให้ข้อมูลมากกว่า — มันวัดว่าบ่อยครั้งแค่ไหนที่ข้อความที่คอมไพล์แล้วไม่ตรงกับโจทย์ที่คุณถามเสียทีเดียว และนี่คือเหตุผลที่ Consistency Check มีอยู่เป็นคอลัมน์แยกต่างหาก
ทำไมทีมหนึ่งจึงจะรันทั้งสองอย่าง
เพราะไปป์ไลน์ตามธรรมชาติมีขั้นตอนที่ถูกและมีปริมาณสูง กับขั้นตอนที่แพงและมีปริมาณต่ำ MathForm 8B รันบนฮาร์ดแวร์ของคุณเองและแปลงปัญหาที่ไม่เป็นทางการให้เป็นเฮดเดอร์ Lean 4 โดยมีคอมไพเลอร์ที่พร้อมใช้คอยปฏิเสธผลลัพธ์ที่ไม่ดีก่อนที่มนุษย์จะได้เห็น Solar Mini 4 จัดการสิ่งที่เกิดขึ้นรอบๆ งานนั้น: อ่านบทความสนับสนุน สกัดสมมติฐาน สรุปผลลัพธ์เป็นภาษาเกาหลีหรืออังกฤษ และจัดเส้นทางงาน ทั้งสองไม่เคยแข่งขันกันสำหรับคำขอเดียวกัน และตัวที่เล็กกว่าคือตัวที่รับผิดชอบส่วนของงานซึ่งมีสัญญาณผ่าน/ไม่ผ่านเชิงภาวิสัย
ทั้งสองโมเดลไม่ใช่สิ่งที่เราให้บริการ routing ถึงคุณได้ — โมเดลของ Upstage ไม่ได้อยู่บน OrcaRouter และของ OpenBMB ก็เช่นกัน — ดังนั้นถ้าคุณต้องการ Solar Mini 4 มันต้องมาจาก API ของ Upstage เอง และถ้าคุณต้องการ MathForm 8B มันก็มาจาก Hugging Face และ GPU ของคุณเอง สิ่งที่เราทำได้คือวางส่วนที่เหลือของไปป์ไลน์นั้นไว้หลังคีย์เดียว: โมเดลมากกว่า 200 รายการ โดยบวกเพิ่ม 0% จากราคาตามรายการของผู้ให้บริการ พร้อมระบบ failover อัตโนมัติข้ามผู้ให้บริการ และ routing DSL ที่ให้คุณเชื่อมโมเดลต่างๆ เข้าเป็นการเรียกครั้งเดียว ในเวิร์กโฟลว์ที่โมเดลเฉพาะทางขนาดเล็กทำงานในขั้นตอนการทำ formalisation และโมเดลอเนกประสงค์ขนาดใหญ่ทำงานในทุกส่วนที่เหลือ การที่สามารถเปลี่ยนโมเดลอเนกประสงค์ได้เพียงแก้สตริงชื่อโมเดล — แทนที่จะต้องปล่อย integration ใหม่ — คือความต่างระหว่างการเปลี่ยนแปลงที่ใช้เวลาสองสัปดาห์กับการใช้เวลาหนึ่งบ่าย

สิ่งที่ควรนำกลับไป
ถ้าคำถามของคุณคือ "ฉันควรใช้ตัวไหนในบรรดาตัวเลือกเหล่านี้" คำตอบที่ตรงไปตรงมาคือมันขึ้นอยู่กับว่าคุณต้องการคำตอบหรือการทำให้เป็นรูปแบบทางการ และไม่มีเบนช์มาร์กใดจะชี้ขาดได้ ถ้าคำถามของคุณคือ "MathForm 8B คุ้มค่าที่จะดาวน์โหลดไหม" คำตอบคือคุ้มสำหรับงานแคบ ๆ เพียงหนึ่งงาน และไม่คุ้มสำหรับอย่างอื่นเลย — มันเป็นตัวจัดรูปแบบ ไม่ใช่ตัวพิสูจน์ และภาระการพิสูจน์ยังคงเปิดค้างอยู่ในเอาต์พุตที่มันสร้างขึ้น ถ้าคำถามของคุณคือ "Solar Mini 4 คุ้มค่าไหมที่ $0.36 ต่องาน" คำตอบคือคุ้มสำหรับเอกสารยาวในปริมาณมาก และไม่คุ้มสำหรับสิ่งใดก็ตามที่ต้องให้มันตรวจงานของตัวเอง

การจัดหาแหล่งที่มา เพื่อปิดท้าย ตัวเลขทุกตัวของ Solar Mini 4 ข้างต้นเป็นการวัดที่เป็นอิสระโดย Artificial Analysis ยกเว้นหน้าต่างบริบท ซึ่งเป็นตัวเลขของ Upstage เองและไม่ตรงกับของ Artificial Analysis ตัวเลขทุกตัวของ MathForm 8B เป็นข้อมูลที่ผู้จำหน่ายรายงานจาก arXiv 2608.14221 และยังไม่มีการทำซ้ำ อีกทั้งการเปิดตัวก็ไม่ได้ประกาศล่วงหน้า — น้ำหนักโมเดล ชุดข้อมูล FormalVerse และบทความ ต่างปรากฏขึ้นพร้อมกันในวันที่ 14 สิงหาคม 2026 โดยไม่มีโพสต์บล็อกของผู้จำหน่ายและไม่มีการรันเบนช์มาร์กอิสระใด ๆ จนถึงปัจจุบัน
