
TwIL-LM3-Pro กับ MathForm 8B: ข้อความและการอนุมานเป็นสองส่วนที่แตกต่างกันของการทำให้เป็นทางการ
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 219 tok/s
- OpenAIใหม่OpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- Anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIใหม่Grok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 118 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 47 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
TwIL-LM3-Pro และ MathForm-8Bต่างมุ่งเป้าไปที่ปัญหากว้างเดียวกัน — การทำให้เครื่องจักรสร้างข้อความเชิงรูปแบบที่ตรวจสอบได้ มากกว่าจะสร้างร้อยแก้วที่ฟังดูสมเหตุสมผล — และทั้งสองกำลังแก้ปัญหาคนละครึ่ง MathForm-8B เป็นตัวแปลงอัตโนมัติให้เป็นรูปแบบทางการขนาด 8 พันล้านพารามิเตอร์ของ OpenBMB เปิดตัวในเดือนสิงหาคม 2026: เมื่อให้โจทย์คณิตศาสตร์ในภาษาธรรมชาติ มันจะสร้างข้อความสั่งใน Lean 4 ของโจทย์นั้น โดยปล่อยภาระการพิสูจน์ให้เปิดไว้สำหรับคอมไพเลอร์ตรวจสอบ TwIL-LM3-Pro เป็นโมเดลตรรกะเชิงรูปแบบขนาด 3.66B ของ webAI จากเดือนกันยายน 2026 และผลลัพธ์เป้าหมายของมันคือป้ายกำกับการอนุมาน การแปลเป็นตรรกะอันดับหนึ่ง การแยกวิเคราะห์เชิงความหมาย และบทวิจารณ์การพิสูจน์ใน Lean ตัวหนึ่งสร้างสิ่งที่ต้องถูกตรวจสอบ อีกตัวบอกคุณว่าสิ่งที่คุณมีนั้นอนุมานถึงสิ่งที่คุณอ้างหรือไม่
เพราะทั้งสองทับซ้อนกันในด้านเดียวเท่านั้น — การทำให้เป็นทางการด้วย Lean — หน้าเปรียบเทียบจึงทั้งน่าดึงดูดและทำให้เข้าใจผิด คำถามที่มีประโยชน์กว่าคือแต่ละแบบถูกฝึกให้ได้รับรางวัลจากอะไร เพราะสัญญาณรางวัลคือจุดที่การออกแบบทั้งสองแตกต่างกันอย่างคมชัดที่สุด และเป็นจุดที่ทางเลือกที่ฉลาดกว่าอยู่จริง ๆ
ข้อความกับการบังคับเชิงตรรกะ
MathForm-8B ถูกฝึกบน FormalVerse ซึ่งเป็นคลังข้อมูล Lean 4 ที่บทความของ OpenBMB ระบุว่ามีตัวอย่างที่ผ่านการตรวจสอบแล้วประมาณ 367,000 ตัวอย่าง โดยใช้การปรับละเอียดแบบมีผู้สอนตามด้วยการเรียนรู้แบบเสริมกำลัง ไปป์ไลน์ที่อยู่รอบ ๆ มันจะดึงคำจำกัดความที่เกี่ยวข้องและงานทำให้เป็นรูปแบบทางการที่มีอยู่จาก Mathlib ก่อนการสร้าง จากนั้นปรับให้ละเอียดขึ้นโดยใช้การวินิจฉัยของคอมไพเลอร์และการตรวจสอบความสอดคล้องเชิงความหมาย ผลลัพธ์ของมันคือข้อความเชิงรูปนัย — การนำเข้า ชนิด ส่วนหัวทฤษฎีบท — ซึ่งคอมไพเลอร์ภายนอกจะยอมรับหรือปฏิเสธ การ์ดโมเดลระบุชัดเจนว่ามันไม่ได้แก้ปัญหาและไม่ได้อ้างว่าแก้ การพิสูจน์เป็นงานของคนอื่น
TwIL-LM3-Pro เข้าสู่โดเมนเดียวกันจากฝั่งตรรกศาสตร์ ไปป์ไลน์ของมันมุ่งเป้าไปที่วัตถุประสงค์หกประการ ได้แก่ การแปลตรรกะอันดับหนึ่ง การติดป้ายความสัมพันธ์เชิงนัย การแยกวิเคราะห์เชิงความหมาย การทำเป็นรูปแบบทางการใน Lean การวิจารณ์การพิสูจน์ใน Lean และการอุปนัยกฎ ในขณะที่ MathForm ถูกสร้างมาเพื่อเปล่งประพจน์ TwIL-LM3-Pro ถูกสร้างมาเพื่อตัดสินเกี่ยวกับประพจน์ — ประพจน์นี้เป็นผลตามมาหรือไม่ การแยกวิเคราะห์นี้ถูกต้องหรือไม่ ความพยายามพิสูจน์นี้สมเหตุสมผลหรือไม่ มันยังทำเป็นรูปแบบทางการด้วย และนั่นคือจุดเดียวที่โมเดลทั้งสองเปรียบเทียบกันได้อย่างแท้จริง ไม่ใช่แค่ใกล้เคียงกันเท่านั้น
รางวัลจากคอมไพเลอร์เทียบกับรางวัลจากตัวให้คะแนน
นี่คือความแตกต่างด้านการออกแบบที่มีความสำคัญ และผู้จำหน่ายทั้งสองรายได้บันทึกเรื่องนี้ไว้ในเอกสาร
รางวัลจากการฝึกของ MathForm มาจากการคอมไพล์ด้วย Lean และฟีดแบ็กด้านความสอดคล้องเชิงความหมาย คอมไพเลอร์เปรียบเสมือนออราเคิล: มันจะยอมรับการทำฟอร์มาลไลเซชันหรือไม่ยอมรับเท่านั้น ไม่มีเครดิตบางส่วนและไม่มีอะไรให้โต้แย้ง นั่นคือสัญญาณรางวัลที่สะอาดที่สุดในมุมนี้ของการเรียนรู้ของเครื่อง และเป็นเหตุผลว่าทำไมเบนช์มาร์กด้านออโตฟอร์มาลไลเซชันจึงถูกรายงานเป็นอัตราการผ่าน — เมตริกนี้เป็นผลปลายน้ำของโปรแกรมที่ไม่สนใจว่าใครเชื่ออะไร
ขั้นตอนสุดท้ายของ TwIL-LM3-Pro คือการรัน GRPO แบบถ่วงน้ำหนักด้วยเอนโทรปีกับตัวตรวจสอบเชิงโปรแกรม โดยการ์ดของโมเดลเองอธิบายถึงคะแนนบางส่วนสำหรับการจับคู่แบบหลวมและ token-F1 เพื่อให้กลุ่มพรอมต์ที่ทุกอย่างล้มเหลวยังคงสร้างเกรเดียนต์ได้ เกตมาโครหลักของมันคือค่าเฉลี่ยถ่วงน้ำหนักเท่ากันของสี่เลนการจำแนกประเภทที่มีขอบเขตบวกกับการเหนี่ยวนำกฎ และในเกตนั้น เลนแบบปรนัยและเลนเชิงกระบวนการได้รับการให้เครดิตเป็น `max(exact_match, loose_match)` — กฎที่การ์ดระบุไว้อย่างชัดเจน เพราะคำตอบที่ถูกต้องซึ่งจัดรูปแบบต่างออกไปเป็นสิ่งประดิษฐ์ทางการจัดรูปแบบมากกว่าความล้มเหลวในการให้เหตุผล
ไม่มีดีไซน์ใดแย่กว่า ทั้งสองถูกปรับจูนมาสำหรับผลลัพธ์ที่แตกต่างกัน รางวัลที่ให้คะแนนโดยคอมไพเลอร์สร้างโมเดลที่คุณสามารถชี้ไปที่ปัญหาการทำให้เป็นทางการที่ยาก แล้วเชื่อถือผลลัพธ์ได้ เพราะผลลัพธ์นั้นตรวจสอบได้ รางวัลที่ให้คะแนนโดยผู้ประเมินพร้อมคะแนนบางส่วนสร้างโมเดลที่ฝึกได้บนการตัดสินที่คลุมเครือกว่า — การอนุมานเชิงนัย การวิพากษ์วิจารณ์ การเหนี่ยวนำกฎ — ซึ่งไม่มีคอมไพเลอร์อยู่เพื่อชี้ขาด และทางเลือกอื่นก็คือไม่ฝึกบนเส้นทางเหล่านั้นเลย ต้นทุนก็คือ ตัวเลขที่ได้จะดีได้เพียงเท่าระบบทดสอบ และ webAI ก็บอกเช่นนั้น: แถว strict-7 ของมัน ซึ่งตัดเครดิตจากการจับคู่แบบหลวมออกจนหมดสิ้น มีอยู่ก็เพื่อให้ผู้อ่านเห็นตัวเลขที่โหดกว่าเทียบเคียงกับตัวเลขพาดหัว
คะแนนไม่ได้อยู่บนไม้บรรทัดเดียวกัน
ทั้งสองโมเดลเผยแพร่ตัวเลขที่เกี่ยวเนื่องกับ Lean และไม่สามารถนำมาลบกันได้ บทความของ MathForm รายงานค่าเฉลี่ย Pass@8 ที่ 88.06% ภายใต้ Syntax Check และ 72.37% ภายใต้ Consistency Check จากเบนช์มาร์ก Lean หกชุด โดยมีอัตราการผ่าน Consistency Check 63% และ 37% บนชุดย่อย FATE-H และ FATE-X ที่ยากกว่า และอ้างว่าทำได้ดีกว่าตัว autoformalizer ขนาด 32B เฉพาะทางหลายตัว การ์ดของ TwIL-LM3-Pro รายงานค่า token-F1 ของ `lean_formalize` ที่ 0.5092 และความแม่นยำของ `lean_critic` ที่ 0.7950 บนฮาร์เนส Track A ของตัวเอง
Pass@8 ภายใต้การตรวจสอบของคอมไพเลอร์และ token-F1 เทียบกับสตริงอ้างอิงนั้นวัดสิ่งที่แตกต่างกัน Pass@8 ให้โมเดลลองแปดครั้งและถามว่ามีครั้งใดที่คอมไพล์ผ่านและยังคงสอดคล้องกันหรือไม่ ส่วน token-F1 ให้คะแนนว่าผลลัพธ์ที่สร้างขึ้นครั้งเดียวตรงกับข้อมูลอ้างอิงมากเพียงใด โมเดลอาจได้คะแนนดีในตัวหนึ่งและได้คะแนนแย่ในอีกตัวหนึ่ง และไม่มีสิ่งใดในเอกสารทั้งสองฉบับที่สนับสนุนให้นำสองค่านี้มาเทียบเคียงกัน
สรุปที่ตรงไปตรงมาของบันทึกผลการวัดประสิทธิภาพคือ หลักฐานของ MathForm-8B มาจากงานวิจัยที่มีคอมไพเลอร์อยู่ในกระบวนการ และของ TwIL-LM3-Pro มาจากชุดทดสอบของผู้ขายที่มีตัวให้คะแนนอยู่ในกระบวนการ และยังไม่มีบุคคลที่สามรายใดนำทั้งสองไปทดสอบผ่านเกณฑ์ชุดเดียวกัน ให้ถือว่าหน้าใดที่วาง "88.06%" ไว้ข้าง "0.5092" ราวกับว่ามันเป็นสกอร์ไลน์ เป็นหน้าที่ไม่ได้อ่านคำนิยาม
ข้อมูลจำเพาะ แบบเทียบเคียง
• พารามิเตอร์ — TwIL-LM3-Pro 3.66B แบบ dense เทียบกับ MathForm-8B 8B ซึ่งมีขนาดใหญ่กว่าประมาณ 2.2 เท่า
• โมเดลพื้นฐาน — `ibm-granite/granite-4.2-3b` เทียบกับ `Qwen/Qwen3-8B`
• ข้อมูลการฝึก: คลังข้อความตรรกะเชิงรูปแบบสังเคราะห์ที่ครอบคลุมวัตถุประสงค์ 6 ประการ เทียบกับ FormalVerse ตัวอย่าง Lean 4 ประมาณ 367,000 รายการ
• รางวัล — ตัวตรวจสอบเชิงโปรแกรมที่ให้คะแนนบางส่วนและยอมรับความคลาดเคลื่อนของการจับคู่แบบหลวม เทียบกับการคอมไพล์ Lean และข้อเสนอแนะด้านความสอดคล้องเชิงความหมาย
• ผลลัพธ์หลัก — ป้ายกำกับ entailment, คำแปล FOL, การแยกวิเคราะห์เชิงความหมาย, ข้อความ Lean และคำวิจารณ์การพิสูจน์ เทียบกับข้อความ Lean 4 สำหรับให้คอมไพเลอร์ตรวจสอบ
• หน้าต่างบริบท — 131,072 โทเคนสำหรับ TwIL-LM3-Pro โดยวัดภายใน 8,192 โทเคน; MathForm-8B ให้บริการด้วยงบประมาณการสร้างสูงสุด 16,384 โทเคนในตัวอย่างการใช้งานของตัวเอง
• สัญญาอนุญาต — webAI Non-Commercial License ver. 1.0 เทียบกับ Apache 2.0
• ขนาดหลังการควอนไทซ์ — TwIL-LM3-Pro มาพร้อมไฟล์ Q4_K_M GGUF ขนาด 2.09 GiB สำหรับ CPU หรือ VRAM 4 GB; MathForm-8B ไม่เผยแพร่ GGUF ในที่เก็บของตัวเอง
ใบอนุญาตเป็นตัวตัดสินคำถามเรื่องการผลิตอีกครั้ง
MathForm-8B อยู่ภายใต้สัญญาอนุญาต Apache 2.0 คุณสามารถปรับแต่งแบบละเอียด (fine-tune) แจกจ่ายต่อ และให้บริการภายในผลิตภัณฑ์เชิงพาณิชย์ได้ ส่วน TwIL-LM3-Pro ไม่ใช่เชิงพาณิชย์: อนุญาตให้ใช้เพื่อการวิจัยและใช้ส่วนตัว และการนำไปใช้งานที่สร้างรายได้ต้องมีข้อตกลงแยกต่างหากกับ webAI โดยเส้นทางเชิงพาณิชย์ของ webAI เป็นข้อตกลงระดับองค์กร มากกว่าที่จะเป็นอัตราค่าบริการที่ประกาศไว้
สำหรับกลุ่มวิจัยหรือนักศึกษา ความแตกต่างนั้นไม่สำคัญ — ทั้งคู่เป็นการดาวน์โหลดแบบไม่ต้องผ่านการอนุมัติบน Hugging Face สำหรับบริษัท มันเป็นตัวชี้ขาด และมันชี้ไปที่ MathForm-8B สำหรับงาน autoformalization ระดับโปรดักชันใด ๆ ไม่ว่าโมเดลใดจะทำคะแนนได้ดีกว่าในเลนที่ผู้จำหน่ายทั้งสองไม่ได้วัดด้วยวิธีเดียวกัน
เราเตอร์อยู่ตรงไหนในไปป์ไลน์นี้
ทั้ง TwIL-LM3-Pro และ MathForm-8B ต่างก็ไม่ใช่เส้นทางในแคตตาล็อกของ OrcaRouter และเหตุผลก็แตกต่างกัน ตัวหนึ่งมีสัญญาอนุญาตแบบไม่ใช่เชิงพาณิชย์และไม่มีปลายทางแบบโฮสต์ อีกตัวหนึ่งเผยแพร่เป็นเช็กพอยต์แบบเปิดสำหรับการโฮสต์เอง คำถามเรื่องการจัดเส้นทางในไปป์ไลน์การทำให้เป็นรูปแบบนั้นคือชั้นที่อยู่รอบ ๆ สิ่งเหล่านี้ การสร้างคลังข้อมูลแบบ FormalVerse หมายถึงการสร้างโจทย์แบบไม่เป็นทางการหลายพันข้อ การกรองความถูกต้องตามรูปแบบ และการเขียนการตรวจสอบความสอดคล้องเชิงความหมายที่ให้คะแนนผลลัพธ์ ทั้งหมดล้วนเป็นการเรียกข้อความ และเป็นงานประเภทที่คุณอยากสลับโมเดลที่สร้างข้อมูลจำนวนมากกับโมเดลที่ตัดสินข้อมูลนั้นโดยไม่ต้องมีสัญญาฉบับที่สอง บน ปลายทางเดียวที่เข้ากันได้กับ OpenAI ซึ่งอยู่หน้าโมเดลกว่า 200 ตัว ในราคาทะเบียนของผู้ให้บริการโดยบวกเพิ่ม 0% การสลับนั้นเป็นเพียงการเปลี่ยนการตั้งค่า และการลดราคาของผู้ขายสำหรับโมเดลที่ใช้สร้างก็มีผลในวันเดียวกัน การสลับไปยังระบบสำรองอัตโนมัติเป็นสิ่งที่จำเป็นอย่างยิ่งในการสร้างคลังข้อมูล โดยเฉพาะอย่างยิ่งเพราะงานที่ล้มกลางทางเมื่อผ่านไปสองในสามของรอบการสร้างย่อมทำให้ทั้งรอบสูญเปล่า.

การแบ่งงานกันทำ
ถ้างานคือการเปลี่ยนคณิตศาสตร์จากตำราให้เป็นข้อความ Lean ที่คอมไพล์ได้ในระดับสเกลใหญ่ และผลลัพธ์ต้องส่งมอบในผลิตภัณฑ์เชิงพาณิชย์ MathForm-8B คือเครื่องมือที่ใช่ และสัญญาอนุญาต Apache 2.0 คือเหตุผลว่าทำไม ถ้างานคือการตัดสินว่าข้อความชุดหนึ่งมีความเป็นนัยต่อข้อกล่าวอ้างหรือไม่ การติดป้ายความเป็นนัย การแยกวิเคราะห์เชิงความหมาย หรือการวิพากษ์วิจารณ์ความพยายามพิสูจน์ TwIL-LM3-Pro ครอบคลุมพื้นที่ที่ MathForm ไม่เคยได้มุ่งเป้าไว้เลย — และสัญญาอนุญาตแบบไม่ใช้เชิงพาณิชย์ของมันเป็นขอบเขตว่าความสามารถนั้นใช้ได้ที่ไหน ไม่ใช่ข้อตำหนิต่อตัวความสามารถนั้นเอง
การรวมกันที่สมเหตุสมผลคือไปป์ไลน์สองขั้นตอน มากกว่าจะเป็นการเลือกอย่างใดอย่างหนึ่ง: โมเดลหนึ่งสร้างข้อความเชิงรูปแบบ อีกโมเดลหนึ่งตัดสินข้อความนั้น ทั้งคู่ได้เผยแพร่ไปป์ไลน์ที่ผลิตพวกมันขึ้นมา ซึ่งเป็นเรื่องไม่ปกติสำหรับขนาดนี้ และเป็นเหตุผลที่ทำให้การเปรียบเทียบนี้ทำได้ตั้งแต่แรก


