การ์ดชื่อเรื่องที่สร้างขึ้น มีหัวข้อว่า 'TwIL-LM3-Pro vs MathForm 8B' คำบรรยายใต้หัวข้อว่า 'ข้อความ vs การอนุมาน' พร้อมการ์ดมุมโค้งสองใบที่ระบุว่า 'MathForm 8B - สร้างข้อความ Lean 4' และ 'TwIL-LM3-Pro - ตัดสินข้อความ' โลโก้ OrcaRouter ถูกคอมโพสิตไว้ที่มุมขวาล่าง
Guides & Insights

TwIL-LM3-Pro กับ MathForm 8B: ข้อความและการอนุมานเป็นสองส่วนที่แตกต่างกันของการทำให้เป็นทางการ

ผู้เขียน

Alistair Wren

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

TwIL-LM3-Pro และ MathForm-8Bต่างมุ่งเป้าไปที่ปัญหากว้างเดียวกัน — การทำให้เครื่องจักรสร้างข้อความเชิงรูปแบบที่ตรวจสอบได้ มากกว่าจะสร้างร้อยแก้วที่ฟังดูสมเหตุสมผล — และทั้งสองกำลังแก้ปัญหาคนละครึ่ง MathForm-8B เป็นตัวแปลงอัตโนมัติให้เป็นรูปแบบทางการขนาด 8 พันล้านพารามิเตอร์ของ OpenBMB เปิดตัวในเดือนสิงหาคม 2026: เมื่อให้โจทย์คณิตศาสตร์ในภาษาธรรมชาติ มันจะสร้างข้อความสั่งใน Lean 4 ของโจทย์นั้น โดยปล่อยภาระการพิสูจน์ให้เปิดไว้สำหรับคอมไพเลอร์ตรวจสอบ TwIL-LM3-Pro เป็นโมเดลตรรกะเชิงรูปแบบขนาด 3.66B ของ webAI จากเดือนกันยายน 2026 และผลลัพธ์เป้าหมายของมันคือป้ายกำกับการอนุมาน การแปลเป็นตรรกะอันดับหนึ่ง การแยกวิเคราะห์เชิงความหมาย และบทวิจารณ์การพิสูจน์ใน Lean ตัวหนึ่งสร้างสิ่งที่ต้องถูกตรวจสอบ อีกตัวบอกคุณว่าสิ่งที่คุณมีนั้นอนุมานถึงสิ่งที่คุณอ้างหรือไม่

เพราะทั้งสองทับซ้อนกันในด้านเดียวเท่านั้น — การทำให้เป็นทางการด้วย Lean — หน้าเปรียบเทียบจึงทั้งน่าดึงดูดและทำให้เข้าใจผิด คำถามที่มีประโยชน์กว่าคือแต่ละแบบถูกฝึกให้ได้รับรางวัลจากอะไร เพราะสัญญาณรางวัลคือจุดที่การออกแบบทั้งสองแตกต่างกันอย่างคมชัดที่สุด และเป็นจุดที่ทางเลือกที่ฉลาดกว่าอยู่จริง ๆ

ข้อความกับการบังคับเชิงตรรกะ

MathForm-8B ถูกฝึกบน FormalVerse ซึ่งเป็นคลังข้อมูล Lean 4 ที่บทความของ OpenBMB ระบุว่ามีตัวอย่างที่ผ่านการตรวจสอบแล้วประมาณ 367,000 ตัวอย่าง โดยใช้การปรับละเอียดแบบมีผู้สอนตามด้วยการเรียนรู้แบบเสริมกำลัง ไปป์ไลน์ที่อยู่รอบ ๆ มันจะดึงคำจำกัดความที่เกี่ยวข้องและงานทำให้เป็นรูปแบบทางการที่มีอยู่จาก Mathlib ก่อนการสร้าง จากนั้นปรับให้ละเอียดขึ้นโดยใช้การวินิจฉัยของคอมไพเลอร์และการตรวจสอบความสอดคล้องเชิงความหมาย ผลลัพธ์ของมันคือข้อความเชิงรูปนัย — การนำเข้า ชนิด ส่วนหัวทฤษฎีบท — ซึ่งคอมไพเลอร์ภายนอกจะยอมรับหรือปฏิเสธ การ์ดโมเดลระบุชัดเจนว่ามันไม่ได้แก้ปัญหาและไม่ได้อ้างว่าแก้ การพิสูจน์เป็นงานของคนอื่น

TwIL-LM3-Pro เข้าสู่โดเมนเดียวกันจากฝั่งตรรกศาสตร์ ไปป์ไลน์ของมันมุ่งเป้าไปที่วัตถุประสงค์หกประการ ได้แก่ การแปลตรรกะอันดับหนึ่ง การติดป้ายความสัมพันธ์เชิงนัย การแยกวิเคราะห์เชิงความหมาย การทำเป็นรูปแบบทางการใน Lean การวิจารณ์การพิสูจน์ใน Lean และการอุปนัยกฎ ในขณะที่ MathForm ถูกสร้างมาเพื่อเปล่งประพจน์ TwIL-LM3-Pro ถูกสร้างมาเพื่อตัดสินเกี่ยวกับประพจน์ — ประพจน์นี้เป็นผลตามมาหรือไม่ การแยกวิเคราะห์นี้ถูกต้องหรือไม่ ความพยายามพิสูจน์นี้สมเหตุสมผลหรือไม่ มันยังทำเป็นรูปแบบทางการด้วย และนั่นคือจุดเดียวที่โมเดลทั้งสองเปรียบเทียบกันได้อย่างแท้จริง ไม่ใช่แค่ใกล้เคียงกันเท่านั้น

รางวัลจากคอมไพเลอร์เทียบกับรางวัลจากตัวให้คะแนน

นี่คือความแตกต่างด้านการออกแบบที่มีความสำคัญ และผู้จำหน่ายทั้งสองรายได้บันทึกเรื่องนี้ไว้ในเอกสาร

รางวัลจากการฝึกของ MathForm มาจากการคอมไพล์ด้วย Lean และฟีดแบ็กด้านความสอดคล้องเชิงความหมาย คอมไพเลอร์เปรียบเสมือนออราเคิล: มันจะยอมรับการทำฟอร์มาลไลเซชันหรือไม่ยอมรับเท่านั้น ไม่มีเครดิตบางส่วนและไม่มีอะไรให้โต้แย้ง นั่นคือสัญญาณรางวัลที่สะอาดที่สุดในมุมนี้ของการเรียนรู้ของเครื่อง และเป็นเหตุผลว่าทำไมเบนช์มาร์กด้านออโตฟอร์มาลไลเซชันจึงถูกรายงานเป็นอัตราการผ่าน — เมตริกนี้เป็นผลปลายน้ำของโปรแกรมที่ไม่สนใจว่าใครเชื่ออะไร

ขั้นตอนสุดท้ายของ TwIL-LM3-Pro คือการรัน GRPO แบบถ่วงน้ำหนักด้วยเอนโทรปีกับตัวตรวจสอบเชิงโปรแกรม โดยการ์ดของโมเดลเองอธิบายถึงคะแนนบางส่วนสำหรับการจับคู่แบบหลวมและ token-F1 เพื่อให้กลุ่มพรอมต์ที่ทุกอย่างล้มเหลวยังคงสร้างเกรเดียนต์ได้ เกตมาโครหลักของมันคือค่าเฉลี่ยถ่วงน้ำหนักเท่ากันของสี่เลนการจำแนกประเภทที่มีขอบเขตบวกกับการเหนี่ยวนำกฎ และในเกตนั้น เลนแบบปรนัยและเลนเชิงกระบวนการได้รับการให้เครดิตเป็น `max(exact_match, loose_match)` — กฎที่การ์ดระบุไว้อย่างชัดเจน เพราะคำตอบที่ถูกต้องซึ่งจัดรูปแบบต่างออกไปเป็นสิ่งประดิษฐ์ทางการจัดรูปแบบมากกว่าความล้มเหลวในการให้เหตุผล

ไม่มีดีไซน์ใดแย่กว่า ทั้งสองถูกปรับจูนมาสำหรับผลลัพธ์ที่แตกต่างกัน รางวัลที่ให้คะแนนโดยคอมไพเลอร์สร้างโมเดลที่คุณสามารถชี้ไปที่ปัญหาการทำให้เป็นทางการที่ยาก แล้วเชื่อถือผลลัพธ์ได้ เพราะผลลัพธ์นั้นตรวจสอบได้ รางวัลที่ให้คะแนนโดยผู้ประเมินพร้อมคะแนนบางส่วนสร้างโมเดลที่ฝึกได้บนการตัดสินที่คลุมเครือกว่า — การอนุมานเชิงนัย การวิพากษ์วิจารณ์ การเหนี่ยวนำกฎ — ซึ่งไม่มีคอมไพเลอร์อยู่เพื่อชี้ขาด และทางเลือกอื่นก็คือไม่ฝึกบนเส้นทางเหล่านั้นเลย ต้นทุนก็คือ ตัวเลขที่ได้จะดีได้เพียงเท่าระบบทดสอบ และ webAI ก็บอกเช่นนั้น: แถว strict-7 ของมัน ซึ่งตัดเครดิตจากการจับคู่แบบหลวมออกจนหมดสิ้น มีอยู่ก็เพื่อให้ผู้อ่านเห็นตัวเลขที่โหดกว่าเทียบเคียงกับตัวเลขพาดหัว

คะแนนไม่ได้อยู่บนไม้บรรทัดเดียวกัน

ทั้งสองโมเดลเผยแพร่ตัวเลขที่เกี่ยวเนื่องกับ Lean และไม่สามารถนำมาลบกันได้ บทความของ MathForm รายงานค่าเฉลี่ย Pass@8 ที่ 88.06% ภายใต้ Syntax Check และ 72.37% ภายใต้ Consistency Check จากเบนช์มาร์ก Lean หกชุด โดยมีอัตราการผ่าน Consistency Check 63% และ 37% บนชุดย่อย FATE-H และ FATE-X ที่ยากกว่า และอ้างว่าทำได้ดีกว่าตัว autoformalizer ขนาด 32B เฉพาะทางหลายตัว การ์ดของ TwIL-LM3-Pro รายงานค่า token-F1 ของ `lean_formalize` ที่ 0.5092 และความแม่นยำของ `lean_critic` ที่ 0.7950 บนฮาร์เนส Track A ของตัวเอง

Pass@8 ภายใต้การตรวจสอบของคอมไพเลอร์และ token-F1 เทียบกับสตริงอ้างอิงนั้นวัดสิ่งที่แตกต่างกัน Pass@8 ให้โมเดลลองแปดครั้งและถามว่ามีครั้งใดที่คอมไพล์ผ่านและยังคงสอดคล้องกันหรือไม่ ส่วน token-F1 ให้คะแนนว่าผลลัพธ์ที่สร้างขึ้นครั้งเดียวตรงกับข้อมูลอ้างอิงมากเพียงใด โมเดลอาจได้คะแนนดีในตัวหนึ่งและได้คะแนนแย่ในอีกตัวหนึ่ง และไม่มีสิ่งใดในเอกสารทั้งสองฉบับที่สนับสนุนให้นำสองค่านี้มาเทียบเคียงกัน

สรุปที่ตรงไปตรงมาของบันทึกผลการวัดประสิทธิภาพคือ หลักฐานของ MathForm-8B มาจากงานวิจัยที่มีคอมไพเลอร์อยู่ในกระบวนการ และของ TwIL-LM3-Pro มาจากชุดทดสอบของผู้ขายที่มีตัวให้คะแนนอยู่ในกระบวนการ และยังไม่มีบุคคลที่สามรายใดนำทั้งสองไปทดสอบผ่านเกณฑ์ชุดเดียวกัน ให้ถือว่าหน้าใดที่วาง "88.06%" ไว้ข้าง "0.5092" ราวกับว่ามันเป็นสกอร์ไลน์ เป็นหน้าที่ไม่ได้อ่านคำนิยาม

ข้อมูลจำเพาะ แบบเทียบเคียง

• พารามิเตอร์ — TwIL-LM3-Pro 3.66B แบบ dense เทียบกับ MathForm-8B 8B ซึ่งมีขนาดใหญ่กว่าประมาณ 2.2 เท่า

• โมเดลพื้นฐาน — `ibm-granite/granite-4.2-3b` เทียบกับ `Qwen/Qwen3-8B`

• ข้อมูลการฝึก: คลังข้อความตรรกะเชิงรูปแบบสังเคราะห์ที่ครอบคลุมวัตถุประสงค์ 6 ประการ เทียบกับ FormalVerse ตัวอย่าง Lean 4 ประมาณ 367,000 รายการ

• รางวัล — ตัวตรวจสอบเชิงโปรแกรมที่ให้คะแนนบางส่วนและยอมรับความคลาดเคลื่อนของการจับคู่แบบหลวม เทียบกับการคอมไพล์ Lean และข้อเสนอแนะด้านความสอดคล้องเชิงความหมาย

• ผลลัพธ์หลัก — ป้ายกำกับ entailment, คำแปล FOL, การแยกวิเคราะห์เชิงความหมาย, ข้อความ Lean และคำวิจารณ์การพิสูจน์ เทียบกับข้อความ Lean 4 สำหรับให้คอมไพเลอร์ตรวจสอบ

• หน้าต่างบริบท — 131,072 โทเคนสำหรับ TwIL-LM3-Pro โดยวัดภายใน 8,192 โทเคน; MathForm-8B ให้บริการด้วยงบประมาณการสร้างสูงสุด 16,384 โทเคนในตัวอย่างการใช้งานของตัวเอง

• สัญญาอนุญาต — webAI Non-Commercial License ver. 1.0 เทียบกับ Apache 2.0

• ขนาดหลังการควอนไทซ์ — TwIL-LM3-Pro มาพร้อมไฟล์ Q4_K_M GGUF ขนาด 2.09 GiB สำหรับ CPU หรือ VRAM 4 GB; MathForm-8B ไม่เผยแพร่ GGUF ในที่เก็บของตัวเอง

ใบอนุญาตเป็นตัวตัดสินคำถามเรื่องการผลิตอีกครั้ง

MathForm-8B อยู่ภายใต้สัญญาอนุญาต Apache 2.0 คุณสามารถปรับแต่งแบบละเอียด (fine-tune) แจกจ่ายต่อ และให้บริการภายในผลิตภัณฑ์เชิงพาณิชย์ได้ ส่วน TwIL-LM3-Pro ไม่ใช่เชิงพาณิชย์: อนุญาตให้ใช้เพื่อการวิจัยและใช้ส่วนตัว และการนำไปใช้งานที่สร้างรายได้ต้องมีข้อตกลงแยกต่างหากกับ webAI โดยเส้นทางเชิงพาณิชย์ของ webAI เป็นข้อตกลงระดับองค์กร มากกว่าที่จะเป็นอัตราค่าบริการที่ประกาศไว้

สำหรับกลุ่มวิจัยหรือนักศึกษา ความแตกต่างนั้นไม่สำคัญ — ทั้งคู่เป็นการดาวน์โหลดแบบไม่ต้องผ่านการอนุมัติบน Hugging Face สำหรับบริษัท มันเป็นตัวชี้ขาด และมันชี้ไปที่ MathForm-8B สำหรับงาน autoformalization ระดับโปรดักชันใด ๆ ไม่ว่าโมเดลใดจะทำคะแนนได้ดีกว่าในเลนที่ผู้จำหน่ายทั้งสองไม่ได้วัดด้วยวิธีเดียวกัน

เราเตอร์อยู่ตรงไหนในไปป์ไลน์นี้

ทั้ง TwIL-LM3-Pro และ MathForm-8B ต่างก็ไม่ใช่เส้นทางในแคตตาล็อกของ OrcaRouter และเหตุผลก็แตกต่างกัน ตัวหนึ่งมีสัญญาอนุญาตแบบไม่ใช่เชิงพาณิชย์และไม่มีปลายทางแบบโฮสต์ อีกตัวหนึ่งเผยแพร่เป็นเช็กพอยต์แบบเปิดสำหรับการโฮสต์เอง คำถามเรื่องการจัดเส้นทางในไปป์ไลน์การทำให้เป็นรูปแบบนั้นคือชั้นที่อยู่รอบ ๆ สิ่งเหล่านี้ การสร้างคลังข้อมูลแบบ FormalVerse หมายถึงการสร้างโจทย์แบบไม่เป็นทางการหลายพันข้อ การกรองความถูกต้องตามรูปแบบ และการเขียนการตรวจสอบความสอดคล้องเชิงความหมายที่ให้คะแนนผลลัพธ์ ทั้งหมดล้วนเป็นการเรียกข้อความ และเป็นงานประเภทที่คุณอยากสลับโมเดลที่สร้างข้อมูลจำนวนมากกับโมเดลที่ตัดสินข้อมูลนั้นโดยไม่ต้องมีสัญญาฉบับที่สอง บน ปลายทางเดียวที่เข้ากันได้กับ OpenAI ซึ่งอยู่หน้าโมเดลกว่า 200 ตัว ในราคาทะเบียนของผู้ให้บริการโดยบวกเพิ่ม 0% การสลับนั้นเป็นเพียงการเปลี่ยนการตั้งค่า และการลดราคาของผู้ขายสำหรับโมเดลที่ใช้สร้างก็มีผลในวันเดียวกัน การสลับไปยังระบบสำรองอัตโนมัติเป็นสิ่งที่จำเป็นอย่างยิ่งในการสร้างคลังข้อมูล โดยเฉพาะอย่างยิ่งเพราะงานที่ล้มกลางทางเมื่อผ่านไปสองในสามของรอบการสร้างย่อมทำให้ทั้งรอบสูญเปล่า.

A generated two-column scoreboard headed 'TwIL-LM3-Pro vs MathForm 8B - the scoreboard' with six shared dimension rows. TwIL-LM3-Pro: Parameters 3.66B dense; Base granite-4.2-3b; Reward programmatic verifier; Primary output entailment and critiques; Context 131,072 tokens; Licence non-commercial. MathForm 8B: Parameters 8B; Base Qwen3-8B; Reward Lean compilation; Primary output Lean 4 statements; Generation budget 16,384 tokens; Licence Apache 2.0. A footer line reads 'MathForm figures from the OpenBMB paper; TwIL figures vendor-reported by webAI.' The OrcaRouter logo is composited in the bottom-right corner.

การแบ่งงานกันทำ

ถ้างานคือการเปลี่ยนคณิตศาสตร์จากตำราให้เป็นข้อความ Lean ที่คอมไพล์ได้ในระดับสเกลใหญ่ และผลลัพธ์ต้องส่งมอบในผลิตภัณฑ์เชิงพาณิชย์ MathForm-8B คือเครื่องมือที่ใช่ และสัญญาอนุญาต Apache 2.0 คือเหตุผลว่าทำไม ถ้างานคือการตัดสินว่าข้อความชุดหนึ่งมีความเป็นนัยต่อข้อกล่าวอ้างหรือไม่ การติดป้ายความเป็นนัย การแยกวิเคราะห์เชิงความหมาย หรือการวิพากษ์วิจารณ์ความพยายามพิสูจน์ TwIL-LM3-Pro ครอบคลุมพื้นที่ที่ MathForm ไม่เคยได้มุ่งเป้าไว้เลย — และสัญญาอนุญาตแบบไม่ใช้เชิงพาณิชย์ของมันเป็นขอบเขตว่าความสามารถนั้นใช้ได้ที่ไหน ไม่ใช่ข้อตำหนิต่อตัวความสามารถนั้นเอง

การรวมกันที่สมเหตุสมผลคือไปป์ไลน์สองขั้นตอน มากกว่าจะเป็นการเลือกอย่างใดอย่างหนึ่ง: โมเดลหนึ่งสร้างข้อความเชิงรูปแบบ อีกโมเดลหนึ่งตัดสินข้อความนั้น ทั้งคู่ได้เผยแพร่ไปป์ไลน์ที่ผลิตพวกมันขึ้นมา ซึ่งเป็นเรื่องไม่ปกติสำหรับขนาดนี้ และเป็นเหตุผลที่ทำให้การเปรียบเทียบนี้ทำได้ตั้งแต่แรก

A screenshot of the Hugging Face model card for openbmb/MathForm-8B, showing the OpenBMB author line, tags for Text Generation, Transformers, Safetensors, the openbmb/FormalVerse training dataset, English and arXiv 2608.14221, the apache-2.0 licence badge, and the opening of the paper abstract 'MathForm: Scaling Mathematical Autoformalization with Knowledge Retrieval and Verification-Guided Refinement'.A screenshot of the Hugging Face model card for webAI-Official/TwIL-LM3-Pro, showing the webAI author line, the granite, granite-4.2, formal-logic, reasoning, lora, reinforcement-learning and grpo tags, and the licence badge reading 'License: webai-non-commercial-license-ver.-1.0'.
© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube