
AREX-2 กับ MathForm-8B: ตัวตรวจสอบการพิสูจน์และลูปการค้นหาเป็นรูปแบบการตรวจสอบที่แตกต่างกัน
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 507 tok/s
- OpenAIใหม่OpenAI: GPT-6 Luna2026-09-2237ความฉลาด
- OpenAIใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- Anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIใหม่Grok 4.72026-09-2146ความฉลาด
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น · 194 tok/s
- Orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1143 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 55 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- xAISpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
MathForm-8B และ AREX-2 เป็นสองโมเดลที่ตรวจสอบยืนยันได้อย่างเข้มงวดที่สุดในซีรีส์นี้ และทั้งสองตรวจสอบยืนยันด้วยวิธีที่ตรงกันข้าม MathForm-8B คือออโตฟอร์มาลไลเซอร์ขนาด 8 พันล้านพารามิเตอร์ของ OpenBMB เปิดตัวในเดือนสิงหาคม 2026: เพียงป้อนโจทย์คณิตศาสตร์ที่เขียนด้วยภาษาอังกฤษธรรมดาให้มัน มันจะสร้างข้อความ Lean 4 ที่ถูกต้องเชิงรูปแบบของโจทย์นั้น ซึ่งคอมไพเลอร์ของตัวช่วยพิสูจน์จะตรวจสอบต่อไป AREX-2 เป็นที่เก็บบน Hugging Face ที่ BAAI สร้างขึ้นเมื่อวันที่ 29 กันยายน 2026 เวลา 17:56 UTC โดยมีเฉพาะ .gitattributes และไม่มีไฟล์น้ำหนัก ไม่มีการ์ดโมเดล ไม่มีแท็กสัญญาอนุญาต และไม่มีการประกาศใด ๆ — เป็นชื่อที่จองไว้สำหรับรุ่นที่สองซึ่งน่าจะเป็นไปได้ของเอเจนต์วิจัยเชิงลึก AREX ของ BAAI ซึ่งรุ่นแรกตรวจสอบยืนยันตัวเองโดยการตรวจคำตอบของตัวเองซ้ำกับข้อจำกัดที่ได้รับมา
ดังนั้น คำถามที่น่าสนใจตรงนี้จึงไม่ใช่ว่าโมเดลไหนดีกว่า แต่คือการที่โมเดลจะตรวจสอบได้หมายถึงอะไร เพราะหนึ่งในสองนี้ถูกตรวจสอบโดยคอมไพเลอร์ที่ไม่สนใจว่าใครเชื่ออะไร ส่วนอีกอันถูกตรวจสอบ—หากแนวปฏิบัติเดิมของตระกูลยังใช้ได้—โดยลูปที่โมเดลเดียวกันนั้นเป็นตัวรัน ความแตกต่างนี้ยังคงอยู่แม้ว่าอีกฝั่งของการจับคู่จะยังไม่เปิดตัว และนี่คือเหตุผลที่สองสิ่งนี้สมควรอยู่ในบทสนทนาเดียวกันตั้งแต่แรก
ด้านที่มีอยู่ และเหตุผลที่它可以ตรวจสอบได้
MathForm-8B มีคำอธิบายลักษณะงานที่แคบ และเป็นสิ่งที่ควรกล่าวอย่างแม่นยำเพราะความแคบนั้นคือประเด็นสำคัญ มันไม่ได้แก้ปัญหาทางคณิตศาสตร์และไม่ได้อ้างว่าแก้ได้ มันถูกปรับละเอียดบน FormalVerse ซึ่งเป็นคลังข้อมูลประมาณ 367,000 ตัวอย่าง Lean 4 ที่ผ่านการตรวจสอบแล้ว และรางวัลในการฝึกของมันมาจากคอมไพเลอร์ Lean แทนที่จะมาจากโมเดลความชอบของมนุษย์ เมื่อได้รับข้อความอย่างไม่เป็นทางการ มันจะส่งออกคำสั่ง import, ชนิด และส่วนหัวของทฤษฎีบท — โดยปล่อยให้ภาระการพิสูจน์นั้นเปิดอยู่ — เพื่อให้คอมไพเลอร์สามารถยืนยันได้ว่าการทำให้เป็นทางการกล่าวตรงกับสิ่งที่โจทย์อย่างไม่เป็นทางการกล่าวไว้
ตัวเลขที่เผยแพร่ของมัน ซึ่งทั้งหมดเป็นรายงานจากผู้ขายโดย OpenBMB และไม่มีใครทำซ้ำอย่างอิสระ คือค่าเฉลี่ย Pass@8 ที่ 88.06% ภายใต้การตรวจสอบไวยากรณ์ และ 72.37% ภายใต้การตรวจสอบความสอดคล้องที่เข้มงวดกว่า ในหกเบนช์มาร์ก โดยลดลงเหลือ 63% และ 37% บนซับเซต FATE-H และ FATE-X ที่ยากที่สุด อ่านตัวเลขเหล่านั้นตามสิ่งที่มันเป็น: โมเดลที่ถูกวัดเทียบกับระบบรูปนัย โดยที่คำตอบผิดคือความล้มเหลวในการคอมไพล์ ไม่ใช่ความไม่ลงรอยกันเรื่องคุณภาพ นั่นเป็นคุณสมบัติที่พบได้ยาก ข้ออ้างเรื่องเบนช์มาร์กส่วนใหญ่ในบล็อกนี้ตั้งอยู่บนตัวให้คะแนนที่ต้องเชื่อใจ ส่วนอันนี้ตั้งอยู่บนเลขคณิตที่เครื่องจักรทำเอง
ด้านที่ยังไม่มีอยู่จริง และเหตุใดการตรวจสอบยืนยันของมันจึงแตกต่างออกไป
ข้อเท็จจริงเดียวที่ยืนยันได้ของ AREX-2 คือองค์กร ชื่อ และการประทับเวลา ยังไม่มีการอัปโหลดอะไรเลย และ BAAI ก็ไม่ได้พูดอะไร อย่างไรก็ตาม ครอบครัวที่อยู่เบื้องหลังชื่อนี้มีอยู่จริง และเปิดตัวเมื่อวันที่ 23 กรกฎาคม 2026 ในชื่อ AREX-Base — โมเดลแบบ mixture-of-experts ขนาด 122 พันล้านพารามิเตอร์ ที่มีพารามิเตอร์ทำงาน 10 พันล้านตัวบนฐาน Qwen3.5-122B-A10B — พร้อมกับ AREX-Turbo ซึ่งเป็นโมเดล dense ขนาด 4B ทั้งคู่ใช้ Apache 2.0 ทั้งคู่เป็นเอเจนต์มากกว่าโมเดลแชต
การออกแบบของ AREX เป็นกรอบงานวิจัยแบบสองลูป โดยลูปนอกเป็นขั้นตอนการตรวจสอบ ลูปในจะรวบรวมหลักฐานจากการค้นหาและการท่องเว็บ ผสานรวมเข้าด้วยกัน และสร้างคำตอบที่เสนอพร้อมค่าความเชื่อมั่นที่แนบมาด้วย จากนั้นลูปนอกจะตรวจสอบคำตอบที่เสนอนั้นเทียบกับข้อจำกัดเดิม และตัดสินใจว่า: ยอมรับคำตอบนั้น ปรับปรุงให้ดีขึ้น หรือทิ้งเส้นทางการดำเนินงานและเริ่มใหม่ ระหว่างการทำซ้ำ โมเดลจะคงไว้ซึ่งบล็อกบริบทของสิ่งที่ค้นพบซึ่งยืนยันแล้ว คำตอบที่เสนอที่ยังเปิดอยู่ ข้อจำกัดที่ยังไม่คลี่คลาย และแผนถัดไป ซึ่งเป็นสิ่งที่ทำให้โมเดลติดตามแนวทางการสอบถามที่ยาวนานได้โดยไม่หลงประเด็น BAAI รายงานว่า 82.5 บน BrowseComp, 85.4 บน GAIA และ 89.9 บน DeepSearch QA สำหรับรุ่น Base และ 70.7 / 81.6 / 78.5 สำหรับรุ่น Turbo — เป็นตัวเลขของผู้ขายเอง ยังไม่มีการทำซ้ำ
นั่นเป็นรูปแบบหนึ่งของการตรวจสอบตนเองที่มีอยู่จริงและมีประโยชน์ แต่ในเชิงประเภทแล้วมันอ่อนกว่าคอมไพเลอร์อย่างสิ้นเชิง เมื่อวงรอบนอกของ AREX ตัดสินว่าคำตอบหนึ่งเป็นไปตามข้อจำกัดของมัน การตัดสินนั้นมาจากโมเดลภาษาที่อ่านข้อจำกัดเหล่านั้น เมื่อ Lean ยอมรับการทำให้เป็นรูปแบบทางการของ MathForm-8B การตัดสินนั้นมาจากตัวตรวจสอบชนิดที่ใช้แคลคูลัสตายตัว ไม่มีอันใดอันหนึ่งที่ปราศจากข้อผิดพลาด — การทำให้เป็นรูปแบบทางการอาจเป็น Lean ที่ถูกต้องแต่จับทฤษฎีบทผิด — แต่มีเพียงอันเดียวเท่านั้นที่สามารถผิดได้โดยไม่มีใครสังเกต และความต่างนั้นไม่ใช่เรื่องของระดับความมากน้อย
• ความพร้อมใช้งาน — MathForm-8B สามารถดาวน์โหลดได้จาก OpenBMB พร้อมการ์ดที่เผยแพร่แล้ว AREX-2 เป็นรีโพซิทอรีที่ไม่มีไฟล์อยู่ภายใน
• พารามิเตอร์ — แบบ dense 8B สำหรับ MathForm-8B ไม่ทราบสำหรับ AREX-2; ตระกูลนี้ครอบคลุม mixture-of-experts ขนาด 122B และแบบ dense 4B
• สิ่งที่มันสร้างขึ้น — ข้อความทฤษฎีบท Lean 4 สำหรับ MathForm-8B โดยเจตนาทิ้งการพิสูจน์ไว้ให้เปิดอยู่ ไม่ทราบสำหรับ AREX-2; การสร้างครั้งแรกให้คำตอบที่ผ่านการค้นคว้าพร้อมตัวเลขความเชื่อมั่น
• วิธีการตรวจสอบ — คอมไพเลอร์ Lean สำหรับ MathForm-8B วงจรการตรวจสอบภายในโมเดลเดียวกัน โดยอ้างอิงหลักฐานจาก AREX-Base
• สัญญาอนุญาต — ข้อกำหนดของ OpenBMB เองสำหรับ MathForm-8B; ยังไม่มีการประกาศใด ๆ สำหรับ AREX-2 AREX รุ่นแรกใช้ Apache 2.0
• ตัวเลขสำคัญ — Pass@8 ที่ผ่านการตรวจสอบไวยากรณ์ 88.06% และผ่านการตรวจสอบความสอดคล้อง 72.37% สำหรับ MathForm-8B ซึ่งเป็นข้อมูลที่ผู้ขายรายงานเอง โดยไม่มีข้อมูลดังกล่าวสำหรับ AREX-2


สองงานที่สแตกสามารถเก็บไว้ได้พร้อมกัน
โมเดลเหล่านี้ไม่มีหน้าที่ทับซ้อนกัน และควรกล่าวเช่นนี้ก่อนที่ใครจะตีความคำว่า "versus" ว่าเป็นทางเลือก MathForm-8B เป็นส่วนหน้า (front-end) สำหรับผู้ช่วยพิสูจน์ ผลลัพธ์ของมันคือข้อความทฤษฎีบทที่นักคณิตศาสตร์หรือตัวพิสูจน์อัตโนมัติจะนำไปทำงานต่อ ตำแหน่งที่เหมาะสมตามธรรมชาติของมันคือภายในไปป์ไลน์การตรวจสอบสำหรับงานคณิตศาสตร์ วิธีรูปนัย หรืองานด้านข้อกำหนด โดยคุณค่าอยู่ที่ว่าเครื่องมือปลายน้ำสามารถนำผลลัพธ์ไปใช้ได้โดยไม่ต้องเชื่อถือโมเดล
AREX-2 หากยังคงสืบสานตระกูลของมันต่อไป ถือเป็นแบ็กเอนด์สำหรับคำถามที่ไม่มีคอมไพเลอร์ "ในบรรดาเอกสารยื่นสามฉบับนี้ ฉบับใดไม่สอดคล้องกับอีกสองฉบับ" ไม่มีระบบทางการใดให้ตรวจสอบเทียบเคียง และวิธีป้องกันเดียวที่มีคือการรวบรวมหลักฐานเพิ่มเติมและทบทวนเหตุผลของคุณเองอีกครั้ง — ซึ่งนั่นก็คือลูปภายนอกของ AREX ทีมที่ต้องการทั้งสองอย่างจะรันมันในที่ที่แตกต่างกัน: การทำให้เป็นทางการสำหรับส่วนของปัญหาที่สามารถทำให้เป็นทางการได้ และเอเจนต์ค้นหาและตรวจสอบสำหรับส่วนที่ทำไม่ได้
การแยกแบบนั้นก็เป็นคำตอบที่ตรงไปตรงมาสำหรับคำถามว่าในบรรดาสิ่งเหล่านี้ คุณลงมือทำกับอันไหนได้ในสัปดาห์นี้ MathForm-8B ถูกปล่อยออกแล้ว มีเอกสารประกอบ และใช้งานได้แล้วตอนนี้ ส่วน AREX-2 เป็นเพียงชื่อ
เรื่องราวการจัดเส้นทางจะมีหน้าตาอย่างไรเมื่อการตรวจสอบยืนยันเป็นประธาน
เนื่องจากทั้งสองถูกนำไปใช้แตกต่างกันมาก คำถามด้านโครงสร้างพื้นฐานจึงแยกออกจากกันไปด้วย
สำหรับ MathForm-8B ภาระงานคือการสร้างข้อความสั้นแบบกำหนดได้แน่นอนที่เกิดขึ้นเป็นชุด ๆ โดยผลลัพธ์ส่งตรงเข้าไปในคอมไพเลอร์ สิ่งที่สำคัญคือโมเดลต้องเข้าถึงได้ และการเรียกที่ล้มเหลวต้องถูกเรียกซ้ำ เพราะไปป์ไลน์การทำให้เป็นรูปแบบ (formalization) ที่ทำคำขอหล่นหายนั้นดูเหมือนกับไปป์ไลน์การทำให้เป็นรูปแบบที่ล้มเหลวทุกประการ และมีเพียงหนึ่งในสองกรณีนั้นเท่านั้นที่เป็นข้อเท็จจริงเกี่ยวกับตัวโมเดล การสลับไปยังผู้ให้บริการรายอื่นโดยอัตโนมัติเมื่อเกิดความล้มเหลวคือฟีเจอร์เฉพาะที่ช่วยแยกสองกรณีนี้ออกจากกันปัจจุบัน OrcaRouter ไม่ได้ให้บริการทั้ง MathForm-8B และ AREX-2 ดังนั้นเวทโมเดลของ OpenBMB จึงมาจากช่องทางเผยแพร่ของ OpenBMB เอง และเอนด์พอยต์แบบโฮสต์ใด ๆ ก็เป็นของคนอื่น สิ่งที่เราเสนอคือการจัดเส้นทาง (routing) ที่อยู่ด้านหน้า โดยส่งผ่านราคาตามรายการของผู้ให้บริการโดยตรง และไม่บวกเพิ่มต่อโทเค็น
สำหรับเอเจนต์อย่าง AREX-Base รูปแบบนั้นยากกว่า และเหตุผลสนับสนุนการจัดเส้นทางก็แข็งแกร่งกว่า เส้นทางการวิจัยเชิงลึกทำให้เกิดการเรียกโมเดลหลายสิบครั้งต่อหนึ่งคำถาม โดยแต่ละครั้งอ่านบริบทซ้ำซึ่งขยายใหญ่ขึ้นเมื่อหลักฐานสะสมตัว และรูปแบบความล้มเหลวก็ทบต้นกัน: ผู้ให้บริการที่หมดเวลาที่ขั้นตอนที่สิบเก้าจากยี่สิบห้าไม่ได้ทำให้คำตอบด้อยลง แต่กลับสร้างคำตอบที่ผิดอย่างมั่นใจ นั่นคือเหตุผลที่ควรวางลูปไว้เบื้องหลัง API เดียวสำหรับโมเดลมากกว่า 200 ตัว พร้อมกฎการสลับสำรองที่ตัดสินใจขณะรันไทม์ ดังนั้นผู้ให้บริการเพียงรายเดียวที่ไม่ดีจึงกลายเป็นการลองใหม่แทนที่จะเป็นการอ้างอิงที่ผิด
สิ่งหนึ่งที่ต้องระวัง และสิ่งหนึ่งที่ไม่ควรสันนิษฐาน
ข้อเท็จจริงสามประการจะตอบคำถามที่ยังไม่มีคำตอบส่วนใหญ่เกี่ยวกับ AREX-2 และทั้งสามประการก็มองเห็นได้จากภายนอก: ว่าไฟล์ปรากฏในที่เก็บนั้นหรือไม่ การ์ดอ้างว่ามีจำนวนพารามิเตอร์เท่าใด และว่ามันมีแท็ก Apache 2.0 ที่รุ่นก่อนสองรุ่นมีหรือไม่ จนกว่าสิ่งเหล่านั้นจะปรากฏ ข้อความเดียวที่สามารถยืนยันได้อย่างสมเหตุสมผลเกี่ยวกับ AREX-2 ก็คือ BAAI ได้จองชื่อไว้เมื่อวันที่ 29 กันยายน 2026 และยังไม่ได้ประกาศอะไรเลย
สิ่งที่ไม่ควรสันนิษฐานคือรุ่นที่สองจะสืบทอดรูปร่างของรุ่นแรก "2" เป็นชื่อผลิตภัณฑ์ ไม่ใช่สถาปัตยกรรม มันอาจมีขนาดใหญ่กว่า 122B Base หรืออาจเป็นการกลั่นขนาดเล็กจากเฟรมเวิร์กเดียวกัน — และเนื่องจากตระกูลนี้เปิดตัวทั้งระดับคุณภาพและระดับต้นทุนการให้บริการพร้อมกันแล้ว การตีความทั้งสองแบบจึงเป็นไปได้ สิ่งที่ไม่น่าเป็นไปได้ในขณะนี้ คือการเผยแพร่สเปกสำหรับมัน
