การ์ดชื่อเรื่องที่สร้างขึ้นซึ่งมีข้อความว่า 'AREX-2 vs MathForm-8B - สองวิธีในการถูกตรวจสอบ' พร้อมด้วยสองแผง แผงด้านซ้าย ซึ่งมีหัวข้อว่า MathForm-8B แสดงรายการ: 8B dense, เปิดตัวเมื่อ ส.ค. 2026; เขียนข้อความทฤษฎีบท Lean 4; ตรวจสอบโดยคอมไพเลอร์ Lean; Pass@8 88.06% ตรวจสอบไวยากรณ์แล้ว แผงด้านขวา ซึ่งมีหัวข้อว่า AREX-2 แสดงรายการ: repo สร้างเมื่อ 29 ก.ย. 2026; ไม่มีไฟล์ ไม่มีการ์ด; ไม่มีอะไรให้ดาวน์โหลดหรือรัน; ไม่มีตัวเลขให้ตรวจสอบ ข้อความส่วนท้ายอ่านว่า 'หนึ่งถูกประเมินโดยคอมไพเลอร์ อีกหนึ่งยังไม่มีอะไรให้ประเมิน' โลโก้ OrcaRouter ถูกวางซ้อนไว้ที่มุมขวาล่าง
Guides & Insights

AREX-2 กับ MathForm-8B: ตัวตรวจสอบการพิสูจน์และลูปการค้นหาเป็นรูปแบบการตรวจสอบที่แตกต่างกัน

ผู้เขียน

Gideon Frost

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

MathForm-8B และ AREX-2 เป็นสองโมเดลที่ตรวจสอบยืนยันได้อย่างเข้มงวดที่สุดในซีรีส์นี้ และทั้งสองตรวจสอบยืนยันด้วยวิธีที่ตรงกันข้าม MathForm-8B คือออโตฟอร์มาลไลเซอร์ขนาด 8 พันล้านพารามิเตอร์ของ OpenBMB เปิดตัวในเดือนสิงหาคม 2026: เพียงป้อนโจทย์คณิตศาสตร์ที่เขียนด้วยภาษาอังกฤษธรรมดาให้มัน มันจะสร้างข้อความ Lean 4 ที่ถูกต้องเชิงรูปแบบของโจทย์นั้น ซึ่งคอมไพเลอร์ของตัวช่วยพิสูจน์จะตรวจสอบต่อไป AREX-2 เป็นที่เก็บบน Hugging Face ที่ BAAI สร้างขึ้นเมื่อวันที่ 29 กันยายน 2026 เวลา 17:56 UTC โดยมีเฉพาะ .gitattributes และไม่มีไฟล์น้ำหนัก ไม่มีการ์ดโมเดล ไม่มีแท็กสัญญาอนุญาต และไม่มีการประกาศใด ๆ — เป็นชื่อที่จองไว้สำหรับรุ่นที่สองซึ่งน่าจะเป็นไปได้ของเอเจนต์วิจัยเชิงลึก AREX ของ BAAI ซึ่งรุ่นแรกตรวจสอบยืนยันตัวเองโดยการตรวจคำตอบของตัวเองซ้ำกับข้อจำกัดที่ได้รับมา

ดังนั้น คำถามที่น่าสนใจตรงนี้จึงไม่ใช่ว่าโมเดลไหนดีกว่า แต่คือการที่โมเดลจะตรวจสอบได้หมายถึงอะไร เพราะหนึ่งในสองนี้ถูกตรวจสอบโดยคอมไพเลอร์ที่ไม่สนใจว่าใครเชื่ออะไร ส่วนอีกอันถูกตรวจสอบ—หากแนวปฏิบัติเดิมของตระกูลยังใช้ได้—โดยลูปที่โมเดลเดียวกันนั้นเป็นตัวรัน ความแตกต่างนี้ยังคงอยู่แม้ว่าอีกฝั่งของการจับคู่จะยังไม่เปิดตัว และนี่คือเหตุผลที่สองสิ่งนี้สมควรอยู่ในบทสนทนาเดียวกันตั้งแต่แรก

ด้านที่มีอยู่ และเหตุผลที่它可以ตรวจสอบได้

MathForm-8B มีคำอธิบายลักษณะงานที่แคบ และเป็นสิ่งที่ควรกล่าวอย่างแม่นยำเพราะความแคบนั้นคือประเด็นสำคัญ มันไม่ได้แก้ปัญหาทางคณิตศาสตร์และไม่ได้อ้างว่าแก้ได้ มันถูกปรับละเอียดบน FormalVerse ซึ่งเป็นคลังข้อมูลประมาณ 367,000 ตัวอย่าง Lean 4 ที่ผ่านการตรวจสอบแล้ว และรางวัลในการฝึกของมันมาจากคอมไพเลอร์ Lean แทนที่จะมาจากโมเดลความชอบของมนุษย์ เมื่อได้รับข้อความอย่างไม่เป็นทางการ มันจะส่งออกคำสั่ง import, ชนิด และส่วนหัวของทฤษฎีบท — โดยปล่อยให้ภาระการพิสูจน์นั้นเปิดอยู่ — เพื่อให้คอมไพเลอร์สามารถยืนยันได้ว่าการทำให้เป็นทางการกล่าวตรงกับสิ่งที่โจทย์อย่างไม่เป็นทางการกล่าวไว้

ตัวเลขที่เผยแพร่ของมัน ซึ่งทั้งหมดเป็นรายงานจากผู้ขายโดย OpenBMB และไม่มีใครทำซ้ำอย่างอิสระ คือค่าเฉลี่ย Pass@8 ที่ 88.06% ภายใต้การตรวจสอบไวยากรณ์ และ 72.37% ภายใต้การตรวจสอบความสอดคล้องที่เข้มงวดกว่า ในหกเบนช์มาร์ก โดยลดลงเหลือ 63% และ 37% บนซับเซต FATE-H และ FATE-X ที่ยากที่สุด อ่านตัวเลขเหล่านั้นตามสิ่งที่มันเป็น: โมเดลที่ถูกวัดเทียบกับระบบรูปนัย โดยที่คำตอบผิดคือความล้มเหลวในการคอมไพล์ ไม่ใช่ความไม่ลงรอยกันเรื่องคุณภาพ นั่นเป็นคุณสมบัติที่พบได้ยาก ข้ออ้างเรื่องเบนช์มาร์กส่วนใหญ่ในบล็อกนี้ตั้งอยู่บนตัวให้คะแนนที่ต้องเชื่อใจ ส่วนอันนี้ตั้งอยู่บนเลขคณิตที่เครื่องจักรทำเอง

ด้านที่ยังไม่มีอยู่จริง และเหตุใดการตรวจสอบยืนยันของมันจึงแตกต่างออกไป

ข้อเท็จจริงเดียวที่ยืนยันได้ของ AREX-2 คือองค์กร ชื่อ และการประทับเวลา ยังไม่มีการอัปโหลดอะไรเลย และ BAAI ก็ไม่ได้พูดอะไร อย่างไรก็ตาม ครอบครัวที่อยู่เบื้องหลังชื่อนี้มีอยู่จริง และเปิดตัวเมื่อวันที่ 23 กรกฎาคม 2026 ในชื่อ AREX-Base — โมเดลแบบ mixture-of-experts ขนาด 122 พันล้านพารามิเตอร์ ที่มีพารามิเตอร์ทำงาน 10 พันล้านตัวบนฐาน Qwen3.5-122B-A10B — พร้อมกับ AREX-Turbo ซึ่งเป็นโมเดล dense ขนาด 4B ทั้งคู่ใช้ Apache 2.0 ทั้งคู่เป็นเอเจนต์มากกว่าโมเดลแชต

การออกแบบของ AREX เป็นกรอบงานวิจัยแบบสองลูป โดยลูปนอกเป็นขั้นตอนการตรวจสอบ ลูปในจะรวบรวมหลักฐานจากการค้นหาและการท่องเว็บ ผสานรวมเข้าด้วยกัน และสร้างคำตอบที่เสนอพร้อมค่าความเชื่อมั่นที่แนบมาด้วย จากนั้นลูปนอกจะตรวจสอบคำตอบที่เสนอนั้นเทียบกับข้อจำกัดเดิม และตัดสินใจว่า: ยอมรับคำตอบนั้น ปรับปรุงให้ดีขึ้น หรือทิ้งเส้นทางการดำเนินงานและเริ่มใหม่ ระหว่างการทำซ้ำ โมเดลจะคงไว้ซึ่งบล็อกบริบทของสิ่งที่ค้นพบซึ่งยืนยันแล้ว คำตอบที่เสนอที่ยังเปิดอยู่ ข้อจำกัดที่ยังไม่คลี่คลาย และแผนถัดไป ซึ่งเป็นสิ่งที่ทำให้โมเดลติดตามแนวทางการสอบถามที่ยาวนานได้โดยไม่หลงประเด็น BAAI รายงานว่า 82.5 บน BrowseComp, 85.4 บน GAIA และ 89.9 บน DeepSearch QA สำหรับรุ่น Base และ 70.7 / 81.6 / 78.5 สำหรับรุ่น Turbo — เป็นตัวเลขของผู้ขายเอง ยังไม่มีการทำซ้ำ

นั่นเป็นรูปแบบหนึ่งของการตรวจสอบตนเองที่มีอยู่จริงและมีประโยชน์ แต่ในเชิงประเภทแล้วมันอ่อนกว่าคอมไพเลอร์อย่างสิ้นเชิง เมื่อวงรอบนอกของ AREX ตัดสินว่าคำตอบหนึ่งเป็นไปตามข้อจำกัดของมัน การตัดสินนั้นมาจากโมเดลภาษาที่อ่านข้อจำกัดเหล่านั้น เมื่อ Lean ยอมรับการทำให้เป็นรูปแบบทางการของ MathForm-8B การตัดสินนั้นมาจากตัวตรวจสอบชนิดที่ใช้แคลคูลัสตายตัว ไม่มีอันใดอันหนึ่งที่ปราศจากข้อผิดพลาด — การทำให้เป็นรูปแบบทางการอาจเป็น Lean ที่ถูกต้องแต่จับทฤษฎีบทผิด — แต่มีเพียงอันเดียวเท่านั้นที่สามารถผิดได้โดยไม่มีใครสังเกต และความต่างนั้นไม่ใช่เรื่องของระดับความมากน้อย

• ความพร้อมใช้งาน — MathForm-8B สามารถดาวน์โหลดได้จาก OpenBMB พร้อมการ์ดที่เผยแพร่แล้ว AREX-2 เป็นรีโพซิทอรีที่ไม่มีไฟล์อยู่ภายใน

• พารามิเตอร์ — แบบ dense 8B สำหรับ MathForm-8B ไม่ทราบสำหรับ AREX-2; ตระกูลนี้ครอบคลุม mixture-of-experts ขนาด 122B และแบบ dense 4B

• สิ่งที่มันสร้างขึ้น — ข้อความทฤษฎีบท Lean 4 สำหรับ MathForm-8B โดยเจตนาทิ้งการพิสูจน์ไว้ให้เปิดอยู่ ไม่ทราบสำหรับ AREX-2; การสร้างครั้งแรกให้คำตอบที่ผ่านการค้นคว้าพร้อมตัวเลขความเชื่อมั่น

• วิธีการตรวจสอบ — คอมไพเลอร์ Lean สำหรับ MathForm-8B วงจรการตรวจสอบภายในโมเดลเดียวกัน โดยอ้างอิงหลักฐานจาก AREX-Base

• สัญญาอนุญาต — ข้อกำหนดของ OpenBMB เองสำหรับ MathForm-8B; ยังไม่มีการประกาศใด ๆ สำหรับ AREX-2 AREX รุ่นแรกใช้ Apache 2.0

• ตัวเลขสำคัญ — Pass@8 ที่ผ่านการตรวจสอบไวยากรณ์ 88.06% และผ่านการตรวจสอบความสอดคล้อง 72.37% สำหรับ MathForm-8B ซึ่งเป็นข้อมูลที่ผู้ขายรายงานเอง โดยไม่มีข้อมูลดังกล่าวสำหรับ AREX-2

A screenshot of the Hugging Face model card for openbmb/MathForm-8B, showing the OpenBMB author line, tags for Text Generation, Transformers, Safetensors, the openbmb/FormalVerse training dataset and arXiv 2608.14221, and the opening of the card describing MathForm: Scaling Mathematical Autoformalization with Knowledge Retrieval and Verification-Guided Refinement, with the note that the model is trained on FormalVerse through supervised fine-tuning followed by reinforcement learning using Lean compilation and semantic-consistency feedback.A generated card headed 'Two ways a model can be checked' with rows contrasting MathForm-8B (8B dense, shipped August 2026; emits a Lean 4 theorem statement with the proof obligation left open; checked by the Lean compiler, a type checker implementing a fixed calculus; published figures Pass@8 88.06% syntax-checked and 72.37% consistency-checked, vendor-reported, with FATE-H and FATE-X at 63% and 37%) against AREX-2 (repository created 29 Sep 2026 with no weights, card or licence tag; nothing to check yet), and a row noting the AREX-Base outer loop re-reads the agent's own answer against its constraints - a model reading a model - with BrowseComp 82.5, GAIA 85.4 and DeepSearch QA 89.9 for the 122B Base, unreproduced. A footer reads 'A compiler fails a wrong answer. A verification loop has to notice one.' The OrcaRouter logo is composited in the bottom-right corner.

สองงานที่สแตกสามารถเก็บไว้ได้พร้อมกัน

โมเดลเหล่านี้ไม่มีหน้าที่ทับซ้อนกัน และควรกล่าวเช่นนี้ก่อนที่ใครจะตีความคำว่า "versus" ว่าเป็นทางเลือก MathForm-8B เป็นส่วนหน้า (front-end) สำหรับผู้ช่วยพิสูจน์ ผลลัพธ์ของมันคือข้อความทฤษฎีบทที่นักคณิตศาสตร์หรือตัวพิสูจน์อัตโนมัติจะนำไปทำงานต่อ ตำแหน่งที่เหมาะสมตามธรรมชาติของมันคือภายในไปป์ไลน์การตรวจสอบสำหรับงานคณิตศาสตร์ วิธีรูปนัย หรืองานด้านข้อกำหนด โดยคุณค่าอยู่ที่ว่าเครื่องมือปลายน้ำสามารถนำผลลัพธ์ไปใช้ได้โดยไม่ต้องเชื่อถือโมเดล

AREX-2 หากยังคงสืบสานตระกูลของมันต่อไป ถือเป็นแบ็กเอนด์สำหรับคำถามที่ไม่มีคอมไพเลอร์ "ในบรรดาเอกสารยื่นสามฉบับนี้ ฉบับใดไม่สอดคล้องกับอีกสองฉบับ" ไม่มีระบบทางการใดให้ตรวจสอบเทียบเคียง และวิธีป้องกันเดียวที่มีคือการรวบรวมหลักฐานเพิ่มเติมและทบทวนเหตุผลของคุณเองอีกครั้ง — ซึ่งนั่นก็คือลูปภายนอกของ AREX ทีมที่ต้องการทั้งสองอย่างจะรันมันในที่ที่แตกต่างกัน: การทำให้เป็นทางการสำหรับส่วนของปัญหาที่สามารถทำให้เป็นทางการได้ และเอเจนต์ค้นหาและตรวจสอบสำหรับส่วนที่ทำไม่ได้

การแยกแบบนั้นก็เป็นคำตอบที่ตรงไปตรงมาสำหรับคำถามว่าในบรรดาสิ่งเหล่านี้ คุณลงมือทำกับอันไหนได้ในสัปดาห์นี้ MathForm-8B ถูกปล่อยออกแล้ว มีเอกสารประกอบ และใช้งานได้แล้วตอนนี้ ส่วน AREX-2 เป็นเพียงชื่อ

เรื่องราวการจัดเส้นทางจะมีหน้าตาอย่างไรเมื่อการตรวจสอบยืนยันเป็นประธาน

เนื่องจากทั้งสองถูกนำไปใช้แตกต่างกันมาก คำถามด้านโครงสร้างพื้นฐานจึงแยกออกจากกันไปด้วย

สำหรับ MathForm-8B ภาระงานคือการสร้างข้อความสั้นแบบกำหนดได้แน่นอนที่เกิดขึ้นเป็นชุด ๆ โดยผลลัพธ์ส่งตรงเข้าไปในคอมไพเลอร์ สิ่งที่สำคัญคือโมเดลต้องเข้าถึงได้ และการเรียกที่ล้มเหลวต้องถูกเรียกซ้ำ เพราะไปป์ไลน์การทำให้เป็นรูปแบบ (formalization) ที่ทำคำขอหล่นหายนั้นดูเหมือนกับไปป์ไลน์การทำให้เป็นรูปแบบที่ล้มเหลวทุกประการ และมีเพียงหนึ่งในสองกรณีนั้นเท่านั้นที่เป็นข้อเท็จจริงเกี่ยวกับตัวโมเดล การสลับไปยังผู้ให้บริการรายอื่นโดยอัตโนมัติเมื่อเกิดความล้มเหลวคือฟีเจอร์เฉพาะที่ช่วยแยกสองกรณีนี้ออกจากกันปัจจุบัน OrcaRouter ไม่ได้ให้บริการทั้ง MathForm-8B และ AREX-2 ดังนั้นเวทโมเดลของ OpenBMB จึงมาจากช่องทางเผยแพร่ของ OpenBMB เอง และเอนด์พอยต์แบบโฮสต์ใด ๆ ก็เป็นของคนอื่น สิ่งที่เราเสนอคือการจัดเส้นทาง (routing) ที่อยู่ด้านหน้า โดยส่งผ่านราคาตามรายการของผู้ให้บริการโดยตรง และไม่บวกเพิ่มต่อโทเค็น

สำหรับเอเจนต์อย่าง AREX-Base รูปแบบนั้นยากกว่า และเหตุผลสนับสนุนการจัดเส้นทางก็แข็งแกร่งกว่า เส้นทางการวิจัยเชิงลึกทำให้เกิดการเรียกโมเดลหลายสิบครั้งต่อหนึ่งคำถาม โดยแต่ละครั้งอ่านบริบทซ้ำซึ่งขยายใหญ่ขึ้นเมื่อหลักฐานสะสมตัว และรูปแบบความล้มเหลวก็ทบต้นกัน: ผู้ให้บริการที่หมดเวลาที่ขั้นตอนที่สิบเก้าจากยี่สิบห้าไม่ได้ทำให้คำตอบด้อยลง แต่กลับสร้างคำตอบที่ผิดอย่างมั่นใจ นั่นคือเหตุผลที่ควรวางลูปไว้เบื้องหลัง API เดียวสำหรับโมเดลมากกว่า 200 ตัว พร้อมกฎการสลับสำรองที่ตัดสินใจขณะรันไทม์ ดังนั้นผู้ให้บริการเพียงรายเดียวที่ไม่ดีจึงกลายเป็นการลองใหม่แทนที่จะเป็นการอ้างอิงที่ผิด

สิ่งหนึ่งที่ต้องระวัง และสิ่งหนึ่งที่ไม่ควรสันนิษฐาน

ข้อเท็จจริงสามประการจะตอบคำถามที่ยังไม่มีคำตอบส่วนใหญ่เกี่ยวกับ AREX-2 และทั้งสามประการก็มองเห็นได้จากภายนอก: ว่าไฟล์ปรากฏในที่เก็บนั้นหรือไม่ การ์ดอ้างว่ามีจำนวนพารามิเตอร์เท่าใด และว่ามันมีแท็ก Apache 2.0 ที่รุ่นก่อนสองรุ่นมีหรือไม่ จนกว่าสิ่งเหล่านั้นจะปรากฏ ข้อความเดียวที่สามารถยืนยันได้อย่างสมเหตุสมผลเกี่ยวกับ AREX-2 ก็คือ BAAI ได้จองชื่อไว้เมื่อวันที่ 29 กันยายน 2026 และยังไม่ได้ประกาศอะไรเลย

สิ่งที่ไม่ควรสันนิษฐานคือรุ่นที่สองจะสืบทอดรูปร่างของรุ่นแรก "2" เป็นชื่อผลิตภัณฑ์ ไม่ใช่สถาปัตยกรรม มันอาจมีขนาดใหญ่กว่า 122B Base หรืออาจเป็นการกลั่นขนาดเล็กจากเฟรมเวิร์กเดียวกัน — และเนื่องจากตระกูลนี้เปิดตัวทั้งระดับคุณภาพและระดับต้นทุนการให้บริการพร้อมกันแล้ว การตีความทั้งสองแบบจึงเป็นไปได้ สิ่งที่ไม่น่าเป็นไปได้ในขณะนี้ คือการเผยแพร่สเปกสำหรับมัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube