การ์ดชื่อเรื่องแบบฮีโร่ที่สร้างขึ้นซึ่งมีข้อความว่า 'Solar Mini 4 vs MathForm 8B' พร้อมคำโปรยว่า 'ตัวหนึ่งตอบคำถาม อีกตัวทำให้ตรวจสอบได้' และป้ายสองป้ายที่ระบุว่า 'โมเดลเอนกประสงค์ปะทะตัวจัดรูปแบบอัตโนมัติ' และ 'การคอมไพล์ Lean 4 ในลูป'
Guides & Insights

Solar Mini 4 vs MathForm 8B: โมเดลหนึ่งตอบคำถาม อีกโมเดลทำให้ตรวจสอบได้

ผู้เขียน

Magnus Corvin

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

วาง Solar Mini 4 ไว้ข้าง ๆ MathForm 8B แล้วคุณกำลังเปรียบเทียบโมเดลสองตัวที่ไม่ได้แข่งขันกันในโทเคนเดียวกัน Solar Mini 4 คือ sparse mixture-of-experts ขนาด 3.5 หมื่นล้านพารามิเตอร์ของ Upstage เปิดตัวเมื่อวันที่ 22 กันยายน 2026 โดยมีพารามิเตอร์ที่ทำงานอยู่ราว 3 พันล้านตัวต่อโทเคน และมันตอบคำถาม: อ่านเอกสารยาว ๆ ให้เหตุผลเหนือเอกสารนั้น แล้วคืนผลลัพธ์ออกมาเป็นข้อความ MathForm 8B คือ autoformalizer ขนาด 8 พันล้านพารามิเตอร์ของ OpenBMB เผยแพร่เมื่อวันที่ 14 สิงหาคม 2026 ภายใต้ Apache 2.0 และมันทำในสิ่งที่โมเดลให้เหตุผลใด ๆ ไม่ทำเลยสักนิด — มันนำข้อความทางคณิตศาสตร์ในภาษาธรรมชาติมาเขียนใหม่เป็นทฤษฎีบท Lean 4 ที่คอมไพเลอร์ของ proof assistant จะตรวจสอบชนิดได้ ตัวหนึ่งผลิตคำตอบ อีกตัวผลิตคำถามที่เครื่องตรวจสอบได้ และอย่างหลังคือสินค้าที่หายากกว่า

การเปรียบเทียบนี้ก็ยังคุ้มค่าที่จะทำอยู่ดี เพราะทั้งสองลงเอยในไปป์ไลน์แบบเดียวกัน และเพราะทั้งคู่มีจุดแข็งที่ตรงข้ามกันในลักษณะที่ทำให้การเลือกนั้นชัดเจนเป็นพิเศษ โมเดลของ Upstage เก่งเรื่องเอกสารยาว อ่อนเรื่องการให้เหตุผลที่ยาก และมีค่าใช้จ่ายสูงต่อหนึ่งงานที่ทำเสร็จ โมเดลของ OpenBMB นั้นแคบจนถึงขั้นไร้ประโยชน์นอกเหนือจากกลุ่มเฉพาะทางของมัน ไม่เคยถูกให้คะแนนโดยผู้ประเมินอิสระเลยแม้แต่ครั้งเดียว และไม่มีค่าใช้จ่ายใด ๆ ในการรันเมื่อคุณมี GPU แล้ว

เคียงข้างกัน ในสิ่งที่แตกต่าง

• คืออะไร — Solar Mini 4 เป็นโมเดลสำหรับการให้เหตุผลทั่วไปที่มีบริบทขนาด 1M โทเคน (512K ตามเอกสารของ Upstage เอง) และมีคะแนนที่วัดได้ 24.1 บน Artificial Analysis Intelligence Index ส่วน MathForm 8B เป็นตัวแปลงเป็นรูปแบบทางการอัตโนมัติแบบงานเดียวที่ไม่มีคะแนนดัชนีเผยแพร่ ไม่มีการประเมินโดยอิสระ และไม่มีการกล่าวอ้างความสามารถทั่วไป

• พารามิเตอร์ — 35B รวม / 3B ที่ใช้งานอยู่, แบบสแปร์ส, สำหรับ Solar Mini 4; 8.19B แบบเดนส์สำหรับ MathForm 8B, ไฟน์ทูนจาก Qwen3-8B บนคลังข้อมูล FormalVerse ของ OpenBMB ซึ่งมีตัวอย่าง Lean 4 ที่ผ่านการตรวจสอบแล้วประมาณ 367,000 ตัวอย่าง

• ใบอนุญาตและการส่งมอบ — Solar Mini 4 เป็นซอฟต์แวร์เฉพาะ เข้าถึงได้ผ่าน API ของ Upstage และแพลตฟอร์มของบุคคลที่สาม MathForm 8B เป็น weights ภายใต้ Apache-2.0 พร้อมเทมเพลตแชต, safetensors สี่ชาร์ด และเส้นทางการดีพลอยด้วย Transformers, vLLM หรือ SGLang ผ่านเอนด์พอยต์ที่เข้ากันได้กับ OpenAI

• ราคา — Solar Mini 4 อยู่ที่ $0.10 / $0.01 สำหรับแคช / $0.40 ต่อล้านโทเคน ปัจจุบันลด 50% ถึงวันที่ 22 ตุลาคม 2026 ส่วน MathForm 8B ไม่มีตารางราคา ค่าใช้จ่ายของมันคือ GPU ที่คุณใส่ให้มัน

• ความเร็ว — 204 โทเคนเอาต์พุตต่อวินาทีสำหรับ Solar Mini 4 บนชุดทดสอบของ Artificial Analysis โดยมี 88,300 โทเคนเอาต์พุตต่องานดัชนี และใช้เวลาทำงานประมาณ 430 วินาทีต่องาน เอาต์พุตของ MathForm 8B คือส่วนหัวทฤษฎีบท Lean 4 เพียงหนึ่งอัน ซึ่งมีไม่เกินไม่กี่ร้อยโทเคน

• ความเป็นอิสระของตัวเลข — Solar Mini 4 ถูกรันโดยบุคคลที่สามแล้ว ส่วน MathForm 8B ยังไม่ถูกรัน: ตัวเลขทุกตัวในเปเปอร์ของมันเป็นของผู้เขียนเอง และโมเดลนี้ใหม่เกินไปและเฉพาะทางเกินไปจนไม่ดึงดูดให้มีการรันโดยอิสระ

จุดที่โมเดลทั้งสองบรรจบกัน และจุดที่ไม่ได้บรรจบกัน

A two-column comparison scoreboard titled 'Solar Mini 4 vs MathForm 8B', subtitled 'One produces answers, the other produces machine-checkable questions'. Solar Mini 4: parameters 35B total / 3B active; job reads long documents and answers; weights proprietary; price per 1M $0.10 / $0.01 / $0.40; Intelligence Index 24.05 independently measured; cost per index task $0.36; core skill long-context reasoning at 83.3% on AA-LCR; weakest result Terminal-Bench 4.0 at 1%. MathForm 8B: parameters 8.19B dense, from Qwen3-8B; job writes Lean 4 statements for a compiler; weights Apache 2.0 on Hugging Face; price per 1M self-hosted on your own GPU; Intelligence Index none, never independently scored; cost per index task not applicable; core skill a consistency check at 72.37% Pass@8 claimed; weakest result untested outside formalisation.

โหมดความล้มเหลวคือสิ่งที่ทำให้การจับคู่นี้น่าสนใจ เพราะมันเป็นสิ่งที่ตรงกันข้ามกันโดยสิ้นเชิง ผลลัพธ์ที่ตีพิมพ์ที่อ่อนแอที่สุดของ Solar Mini 4 คือ Terminal-Bench 4.0 ที่ 1% โดยมี AutomationBench-AA ที่ 22.3% — มันแย่ในการตรวจสอบงานของตัวเองในสภาพแวดล้อมที่ให้ข้อเสนอแนะแก่มัน หลักการออกแบบทั้งหมดของ MathForm 8B คือการตรวจสอบ: OpenBMB แยกความแตกต่างระหว่าง Syntax Check ซึ่งถามว่าข้อความ Lean 4 คอมไพล์หรือไม่ กับ Consistency Check ซึ่งถามว่าข้อความที่คอมไพล์แล้วนั้นมีความหมายเหมือนกับปัญหาที่ไม่เป็นทางการจริงหรือไม่ ความล้มเหลวแบบคลาสสิกที่มันมีอยู่เพื่อป้องกันคือข้อความที่ผ่านการตรวจสอบชนิดแต่แอบลดทอนข้อกล่าวอ้างลงอย่างเงียบ ๆ

นั่นเป็นความแตกต่างจริง ๆ และเป็นการดีที่จะพูดให้แม่นยำเกี่ยวกับเรื่องนี้ โมเดลที่ให้เหตุผลซึ่งสร้างบทพิสูจน์มีปัญหาการตรวจสอบตนเองที่รู้กันดี: ไม่มีอะไรในการสร้างคำตอบที่บอกคุณได้ว่าคำตอบนั้นถูกต้องหรือไม่ คอมไพเลอร์ทำได้ ถ้ากระบวนการทำงานของคุณคือ "แปลงคลังโจทย์ให้เป็นสิ่งที่เครื่องสามารถตรวจสอบได้" แล้ว MathForm 8B กำลังทำครึ่งหนึ่งของงานที่ Solar Mini 4 ทำไม่ได้เลย และส่วนที่เหลือก็ไม่ใช่เรื่องของระดับความมากน้อย

ตัวเลขจากผู้ขาย ซึ่งระบุไว้เช่นนั้น: บทความของ OpenBMB รายงานค่าเฉลี่ย Pass@8 ที่ 88.06% ภายใต้ Syntax Check และ 72.37% ภายใต้ Consistency Check จากหกเบนช์มาร์ก และอ้างว่าตัวเลขเหล่านั้นเอาชนะ autoformalizer ขนาด 32B เฉพาะทางหลายตัวได้ ไม่มีส่วนใดเลยที่ถูกทำซ้ำโดยบุคคลที่สาม การลดลง 16 จุดระหว่างการตรวจสอบทั้งสองเป็นตัวเลขที่ให้ข้อมูลมากกว่า — มันวัดว่าบ่อยครั้งแค่ไหนที่ข้อความที่คอมไพล์แล้วไม่ตรงกับโจทย์ที่คุณถามเสียทีเดียว และนี่คือเหตุผลที่ Consistency Check มีอยู่เป็นคอลัมน์แยกต่างหาก

ทำไมทีมหนึ่งจึงจะรันทั้งสองอย่าง

เพราะไปป์ไลน์ตามธรรมชาติมีขั้นตอนที่ถูกและมีปริมาณสูง กับขั้นตอนที่แพงและมีปริมาณต่ำ MathForm 8B รันบนฮาร์ดแวร์ของคุณเองและแปลงปัญหาที่ไม่เป็นทางการให้เป็นเฮดเดอร์ Lean 4 โดยมีคอมไพเลอร์ที่พร้อมใช้คอยปฏิเสธผลลัพธ์ที่ไม่ดีก่อนที่มนุษย์จะได้เห็น Solar Mini 4 จัดการสิ่งที่เกิดขึ้นรอบๆ งานนั้น: อ่านบทความสนับสนุน สกัดสมมติฐาน สรุปผลลัพธ์เป็นภาษาเกาหลีหรืออังกฤษ และจัดเส้นทางงาน ทั้งสองไม่เคยแข่งขันกันสำหรับคำขอเดียวกัน และตัวที่เล็กกว่าคือตัวที่รับผิดชอบส่วนของงานซึ่งมีสัญญาณผ่าน/ไม่ผ่านเชิงภาวิสัย

ทั้งสองโมเดลไม่ใช่สิ่งที่เราให้บริการ routing ถึงคุณได้ — โมเดลของ Upstage ไม่ได้อยู่บน OrcaRouter และของ OpenBMB ก็เช่นกัน — ดังนั้นถ้าคุณต้องการ Solar Mini 4 มันต้องมาจาก API ของ Upstage เอง และถ้าคุณต้องการ MathForm 8B มันก็มาจาก Hugging Face และ GPU ของคุณเอง สิ่งที่เราทำได้คือวางส่วนที่เหลือของไปป์ไลน์นั้นไว้หลังคีย์เดียว: โมเดลมากกว่า 200 รายการ โดยบวกเพิ่ม 0% จากราคาตามรายการของผู้ให้บริการ พร้อมระบบ failover อัตโนมัติข้ามผู้ให้บริการ และ routing DSL ที่ให้คุณเชื่อมโมเดลต่างๆ เข้าเป็นการเรียกครั้งเดียว ในเวิร์กโฟลว์ที่โมเดลเฉพาะทางขนาดเล็กทำงานในขั้นตอนการทำ formalisation และโมเดลอเนกประสงค์ขนาดใหญ่ทำงานในทุกส่วนที่เหลือ การที่สามารถเปลี่ยนโมเดลอเนกประสงค์ได้เพียงแก้สตริงชื่อโมเดล — แทนที่จะต้องปล่อย integration ใหม่ — คือความต่างระหว่างการเปลี่ยนแปลงที่ใช้เวลาสองสัปดาห์กับการใช้เวลาหนึ่งบ่าย

A screenshot of the Hugging Face model card for openbmb/MathForm-8B showing the Apache-2.0 licence, the English language tag, the openbmb/FormalVerse dataset, the formal-verification and autoformalization tags, three safetensors shards at an 8B BF16 model size, the paper title 'MathForm: Scaling Mathematical Autoformalization with Knowledge Retrieval and Verification-Guided Refinement', the description that MathForm 8B translates natural-language mathematical statements into Lean 4 and was trained on FormalVerse through supervised fine-tuning followed by reinforcement learning using Lean compilation and semantic-consistency feedback, and a model tree showing Qwen/Qwen3-8B-Base as its base model.

สิ่งที่ควรนำกลับไป

ถ้าคำถามของคุณคือ "ฉันควรใช้ตัวไหนในบรรดาตัวเลือกเหล่านี้" คำตอบที่ตรงไปตรงมาคือมันขึ้นอยู่กับว่าคุณต้องการคำตอบหรือการทำให้เป็นรูปแบบทางการ และไม่มีเบนช์มาร์กใดจะชี้ขาดได้ ถ้าคำถามของคุณคือ "MathForm 8B คุ้มค่าที่จะดาวน์โหลดไหม" คำตอบคือคุ้มสำหรับงานแคบ ๆ เพียงหนึ่งงาน และไม่คุ้มสำหรับอย่างอื่นเลย — มันเป็นตัวจัดรูปแบบ ไม่ใช่ตัวพิสูจน์ และภาระการพิสูจน์ยังคงเปิดค้างอยู่ในเอาต์พุตที่มันสร้างขึ้น ถ้าคำถามของคุณคือ "Solar Mini 4 คุ้มค่าไหมที่ $0.36 ต่องาน" คำตอบคือคุ้มสำหรับเอกสารยาวในปริมาณมาก และไม่คุ้มสำหรับสิ่งใดก็ตามที่ต้องให้มันตรวจงานของตัวเอง

A screenshot of Upstage's blog post headlined 'Solar Mini 4: Built for High-Volume Agent Workloads', with the summary line 'Only 3B active parameters per token, with leading performance in its class and lower costs for repetitive agent workloads' and a View API Docs link.

การจัดหาแหล่งที่มา เพื่อปิดท้าย ตัวเลขทุกตัวของ Solar Mini 4 ข้างต้นเป็นการวัดที่เป็นอิสระโดย Artificial Analysis ยกเว้นหน้าต่างบริบท ซึ่งเป็นตัวเลขของ Upstage เองและไม่ตรงกับของ Artificial Analysis ตัวเลขทุกตัวของ MathForm 8B เป็นข้อมูลที่ผู้จำหน่ายรายงานจาก arXiv 2608.14221 และยังไม่มีการทำซ้ำ อีกทั้งการเปิดตัวก็ไม่ได้ประกาศล่วงหน้า — น้ำหนักโมเดล ชุดข้อมูล FormalVerse และบทความ ต่างปรากฏขึ้นพร้อมกันในวันที่ 14 สิงหาคม 2026 โดยไม่มีโพสต์บล็อกของผู้จำหน่ายและไม่มีการรันเบนช์มาร์กอิสระใด ๆ จนถึงปัจจุบัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube