
Clef vs MathForm-8B: ตัวหนึ่งตอบคำถามของคุณ อีกตัวหนึ่งเขียนบทพิสูจน์
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 219 tok/s
- OpenAIใหม่OpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- Anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIใหม่Grok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
เหตุผลที่ต้องวางCloudflare/clefไว้ข้าง ๆ openbmb/MathForm-8Bก็คือทั้งสองเป็นสองสิ่งที่สับสนได้ง่ายที่สุดใน open weights ตอนนี้ และการสับสนระหว่างทั้งสองทำให้ต้องเสียการรันฝึกหนึ่งรอบ ทั้งคู่เป็น fine-tune ที่สร้างบนเช็กพอยต์ Qwen3.8-27B และ Qwen3-8B ตามลำดับ ทั้งคู่ใช้ Apache-2.0 ทั้งคู่เผยแพร่ภายในสิบสัปดาห์ที่ผ่านมา ทั้งคู่เป็นโมเดลขอบเขตแคบ สร้างขึ้นเพื่อจุดประสงค์เฉพาะ และผู้สร้างอธิบายว่าเป็นแบบเฉพาะทางมากกว่าอเนกประสงค์ และทั้งสองไม่มีความเกี่ยวข้องกันเลยแม้แต่น้อย เพราะตัวหนึ่งสร้างตัวเลขที่เลือกจากรายการที่คุณให้มา ส่วนอีกตัวสร้างซอร์สโค้ด Lean 4 ทีละโทเคน เพื่อให้ผู้ช่วยพิสูจน์ตรวจสอบ
Clef คือโมเดลการตัดสินใจแบบมัลติโมดัลขนาด 27 พันล้านพารามิเตอร์ของ Cloudflare: คุณให้สถานะและสคีมาของคำถามที่มีการระบุชนิดแก่มัน แล้วมันจะคืนค่าความน่าจะเป็นที่ปรับเทียบแล้วสำหรับทุกคำตอบที่อนุญาตในการประมวลผลแบบไม่ออโตเรเกรสซีฟเพียงรอบเดียว โดยไม่มีกระบวนการสร้างข้อความใด ๆ ในเส้นทางเลย MathForm-8B จาก OpenBMB เป็นโมเดลออโตฟอร์มาลไลเซชัน — ข้อความทางคณิตศาสตร์ภาษาธรรมชาติป้อนเข้าไป Lean 4 ถูกส่งออกมา และไปป์ไลน์ที่ใช้ฝึกมันได้รับการอธิบายไว้ใน preprint ของ arXiv ที่เผยแพร่พร้อมกับน้ำหนักในวันที่ 14 สิงหาคม 2026 เพดานของโมเดลหนึ่งคือขนาดของรายการตัวเลือกของคุณ เพดานของอีกโมเดลคือความแข็งแกร่งของทฤษฎีชนิดของ Lean การถามว่าอันไหนดีกว่ากันเป็นความผิดพลาดเชิงหมวดหมู่ และข้อเท็จจริงที่ว่าทั้งสองเป็นไฟน์จูนน้ำหนักเปิด Apache-2.0 ขนาดแปดถึงสองหมื่นเจ็ดพันล้านพารามิเตอร์นั้นเองคือสิ่งที่ทำให้ความผิดพลาดนี้เกิดขึ้นได้ง่าย
สิ่งที่อินเทอร์เฟซของแต่ละโมเดลห้ามไว้ในทางกายภาพ
วิธีที่เร็วที่สุดที่จะเห็นความแตกต่างคือการอ่านว่าสิ่งที่แต่ละตัวสามารถคืนค่าได้คืออะไร
• อินพุต — Clef รับสถานะ (ข้อความ, JSON, รูปภาพ หรือเฟรมวิดีโอ) พร้อมคำถามที่มีชื่อกำกับและระบุชนิดได้ตั้งแต่ 1 ถึง 64 ข้อ; MathForm-8B รับข้อความทางคณิตศาสตร์ในภาษาธรรมชาติ
• เอาต์พุต — Clef จะคืนค่าความน่าจะเป็นหนึ่งค่าต่อตัวเลือกที่อนุญาต โดยผ่านการทำ softmax แยกต่อคำถาม ส่วน MathForm-8B จะคืนซอร์สโค้ด Lean 4
• ประเภทคำถาม — ของ Clef ได้แก่ noul (จริง/เท็จ โดยมีความน่าจะเป็นที่คำตอบเป็นจริง), choice (ตัวเลือกที่มีชื่อ 2 ถึง 26 รายการ) และ score (2 ถึง 26 ระดับที่มีการเรียงลำดับ); MathForm-8B ไม่มีแนวคิดเรื่องคำถามเลย
• การปรับเทียบ — Clef เผยแพร่ฟิลด์ความเชื่อมั่นสำหรับแต่ละคำตอบ; MathForm-8B เผยแพร่อัตรา Pass@8 ภายใต้การตรวจสอบไวยากรณ์และความสอดคล้อง
• การให้บริการ — Clef ถูกให้บริการผ่าน POST /v1/systemone ที่เข้ากันได้กับ Jev/SystemOne บอดี้, โฮสต์หรือรันเอง; MathForm-8B มาพร้อมกับคำแนะนำสำหรับ Transformers, vLLM และ SGLang ซึ่งทั้งหมดเปิดให้ใช้เอนด์พอยต์คอมพลีชันที่เข้ากันได้กับ OpenAI ที่บริบทขนาด 16,384 โทเค็น โดย max_new_tokensถูกตั้งค่าเป็น 16,384.
ผลที่ตามมาในทางปฏิบัติเกิดขึ้นทันที หากคุณต้องการการตัดสินแบบใช่/ไม่ใช่เกี่ยวกับข้อความชิ้นหนึ่ง Clef เป็นเพียงตัวเดียวในสองตัวที่สามารถให้สิ่งนั้นได้ — ไม่มีทางถาม MathForm-8B ด้วยคำถามที่ไม่ใช่ "เขียน Lean 4 สำหรับสิ่งนี้" หากคุณต้องการ Lean 4 Clef เป็นเพียงตัวเดียวในสองตัวที่ไม่อาจให้สิ่งนั้นได้อย่างเด็ดขาด และไม่ใช่เพราะความอ่อนแอ: การขอให้ตัวให้คะแนนที่ผูกกับสคีมาทำการทำให้ทฤษฎีบทเป็นทางการ ไม่เข้ากับสัญญาของมัน ดังนั้นคำขอจึงถูกปฏิเสธโดยโครงสร้าง แทนที่จะตอบอย่างแย่ ๆ

ไปป์ไลน์ที่ทั้งคู่เป็นส่วนหนึ่ง
มีสถาปัตยกรรมจริงที่โมเดลทั้งสองนี้วางเคียงข้างกัน และมันคุ้มค่าที่จะพิจารณาไปทีละส่วน เพราะจะทำให้การแยกนี้ออกมาเป็นรูปธรรมมากกว่านามธรรม ลองพิจารณาบริการที่ทำหน้าที่จัดทำให้คณิตศาสตร์เป็นทางการสำหรับนักวิจัยและนักศึกษา
ข้อความต่างๆ มาถึงในภาษาธรรมชาติ โดยไม่จำกัดประเภท ก่อนที่สิ่งใดจะถูกทำให้เป็นทางการได้ ต้องมีบางสิ่งตัดสินใจว่าสิ่งที่มาถึงคืออะไร นี่คือทฤษฎีบทที่ต้องพิสูจน์ นิยามที่ต้องเพิ่ม คำขอให้ตรวจสอบการพิสูจน์ที่มีอยู่ หรือคำถามที่ต้องขอความกระจ่างก่อนที่ใครจะแตะ Lean หรือไม่? มันครบในตัวเอง หรือว่ามันพึ่งพาบริบทที่ผู้ใช้ไม่ได้ให้มา? สัญลักษณ์เหล่านี้เป็นแบบแผนปกติ หรือว่าสัญกรณ์นี้เป็นสิ่งที่ระบบไม่เคยเห็น? แต่ละข้อเหล่านี้เป็นคำถามที่มีขอบเขตจำกัดพร้อมชุดตัวเลือกเล็กๆ — รูปแบบที่แน่นอนของ Clef — และความน่าจะเป็นที่ปรับเทียบแล้วซึ่งผูกกับแต่ละคำตอบ คือสิ่งที่ทำให้บริการสามารถทำสิ่งที่มีเหตุผลกับคำตอบที่ไม่แน่นอนได้: ส่งสิ่งใดก็ตามที่ต่ำกว่าเกณฑ์ให้มนุษย์ แทนที่จะเดา
ขั้นตอนที่สองเป็นของ MathForm-8B นำข้อความที่ถูกจำแนกแล้วว่าเป็นทฤษฎีบทที่ครบในตัวเองซึ่งมีสัญกรณ์ที่รู้จัก แล้วส่งออกเป็น Lean 4 นั่นคือปัญหาด้านการสร้าง และคำถามเรื่องคุณภาพคือผลลัพธ์คอมไพล์ผ่านบ่อยแค่ไหน และบ่อยแค่ไหนที่มันมีความหมายเดียวกันกับต้นฉบับ — ซึ่งเป็นสิ่งที่แกนการประเมินสองแกนของผู้ขายวัดอย่างแม่นยำ นี่คือรูปแบบทั่วไปที่ควรสกัดออกมาจากการจับคู่นี้: ตัวจำแนกแบบมีขอบเขตที่ราคาถูกซึ่งวางไว้ข้างหน้าเครื่องสร้างเฉพาะทางราคาแพง มักถูกกว่าและเชื่อถือได้มากกว่าการพรอมต์ให้เครื่องสร้างตัดสินใจว่าตัวมันควรทำงานหรือไม่ตั้งแต่แรก
ตัวเลขในแต่ละด้านวัดอะไรกันแน่
บทคัดย่อ arXiv ของ OpenBMB รายงานว่า MathForm-8B ทำอัตรา Pass@8 เฉลี่ยได้ 88.06% ภายใต้ Syntax Check และ 72.37% ภายใต้ Consistency Check ในหกเบนช์มาร์ก และบนชุดย่อย FATE-H และ FATE-X มันทำอัตราผ่านด้านความสอดคล้องได้ 63% และ 37% ซึ่งทั้งคู่อยู่เหนือเบสไลน์เฉพาะทางที่แข็งแกร่งที่สุดที่เปเปอร์นำมาเปรียบเทียบ ส่วนที่น่าสนใจของข้ออ้างนี้คือไปป์ไลน์การฝึก: ตัววางแผนการดึงข้อมูล (retrieval planner) จะดึงคำนิยามที่เกี่ยวข้องและงานทำให้เป็นรูปแบบ (formalisations) ที่มีอยู่แล้วออกจาก Mathlib ก่อนการสร้าง จากนั้นข้อความที่สร้างขึ้นจะถูกแก้ไขโดยใช้ข้อมูลวินิจฉัยจากคอมไพเลอร์และฟีดแบ็กความสอดคล้องเชิงความหมาย ซึ่งเป็นวิธีที่ชุดข้อมูล FormalVerse ที่มีตัวอย่าง Lean 4 ที่ผ่านการตรวจสอบแล้วราว 367,000 ตัวอย่างถูกสร้างขึ้นก่อนการปรับละเอียดแบบมีผู้สอนและการเรียนรู้แบบเสริมกำลัง ตัวเลขเหล่านี้เป็นตัวเลขที่ผู้ขายรายงานจากเปเปอร์และโมเดลการ์ด ยังไม่มีผู้ใดที่เป็นอิสระรันซ้ำตัวเลขเหล่านี้เลย
ตัวเลขของ Clef วัดสิ่งอื่นโดยสิ้นเชิงและไม่สามารถเปรียบเทียบกันได้ การรัน Decision Index ของ Cloudflare รายงานค่า macro-F1 ของเจตนา BANKING77 ที่ 94.2, CLINC150 ที่มีการจัดการนอกขอบเขตที่ 97.4, GPQA Diamond ที่ 48.0 — โดยที่ Jev ที่เก่ากว่าทำคะแนนได้ 78.3 — และค่ามัธยฐานความหน่วงของคำขอที่ 209.3 มิลลิวินาที มันเป็นตารางเกี่ยวกับการจำแนกประเภทและการกำหนดเส้นทาง ที่ผลิตโดยผู้ขายบนชุดทดสอบของผู้ขายเอง โฮสต์อยู่บนลีดเดอร์บอร์ดของผู้ขายเอง และไม่ได้รับการทำซ้ำ
ประโยคที่ซื่อตรงเพียงประโยคเดียวที่ควรเขียนเกี่ยวกับสองคอลัมน์นี้ก็คือ ทั้งสองไม่ได้ใช้เบนช์มาร์กเดียวกัน ไม่ได้ใช้หน่วยวัดเดียวกัน และไม่ได้ใช้ปรัชญาการประเมินเดียวกัน ตัวเลข 37% ของ MathForm-8B บนชุดย่อยการทำให้เป็นทางการแบบยาก และ 97.4 ของ Clef ในการตรวจจับเจตนาที่อยู่นอกขอบเขต ต่างก็เป็นคำกล่าวอ้างจริงของผู้สร้างของแต่ละตัวเกี่ยวกับงานที่แตกต่างกัน และผู้อ่านที่นำตัวเลขเหล่านี้มาเทียบเคียงกันก็ไม่ได้รับความรู้อะไรเลย นอกจากว่าตัวเลขทั้งสองนั้นมีอยู่จริง
สิ่งที่คุณจะรัน และค่าใช้จ่ายที่ตามมา
ไม่มีโมเดลใดเป็น route บน OrcaRouter และบทความนี้ไม่ได้อ้างถึงความพร้อมให้บริการใด ๆ — แคตตาล็อกตอบกลับ 404 สำหรับ cloudflare/clef และสำหรับ MathForm-8B พื้นที่จัดเก็บของ MathForm มีขนาดราว 16.4 GB และทั้งสองโมเดลใช้สัญญาอนุญาต Apache-2.0 ดังนั้นทั้งคู่จึงสามารถโฮสต์เองได้ตั้งแต่วันพรุ่งนี้โดยใครก็ตามที่มีฮาร์ดแวร์
Clef บน Cloudflare — $0.24 ต่อโทเคนอินพุตหนึ่งล้านโทเคนบน Workers AI โดยมีความหน่วงที่เผยแพร่ซึ่งวัดบน H200 เพียงตัวเดียว
• MathForm-8B โฮสต์ด้วยตนเอง — ไม่มีการโฮสต์โดยผู้ขาย ไม่มีราคาต่อโทเคน และมีคอนเท็กซ์ 16,384 โทเคนตามเอกสาร ซึ่งเป็นข้อจำกัดที่ควรสังเกต: ส่วนของบทความยาวจะไม่สามารถประมวลผลในครั้งเดียวได้
• ทางเลือกที่กำหนดเส้นทางไว้สำหรับครึ่งที่เป็นตัวจำแนกประเภท — Jev 1.13 ของ TypeSafe ในราคา $0.042 ต่อโทเคนอินพุตหนึ่งล้านโทเคน ภายในบริบท 65,536 โทเคน ให้บริการผ่านบอดี้ POST /v1/systemone เดียวกับที่ Clef ใช้ ซึ่งทำให้มันเสียบใช้ได้ทันทีสำหรับขั้นตอนแรกของไปป์ไลน์ข้างต้น
นั่นคือจุดที่เลเยอร์การจัดเส้นทางเข้ามามีบทบาทในคู่ผสมแบบเฉพาะนี้ รูปแบบนี้ประกอบด้วยตัวตัดสินใจและตัวสร้าง และครึ่งที่เป็นตัวตัดสินใจคือส่วนที่มีตัวแทนที่ใช้งานได้จริง — เอนด์พอยต์เดียวที่วางอยู่หน้าอีกกว่า 200 โมเดลราคาตามรายการของผู้ให้บริการที่ส่งต่อโดยไม่บวกเพิ่มต่อโทเคน และ การสลับสำรองอัตโนมัติ เพื่อให้ช่วงบ่ายที่ผู้ให้บริการมีปัญหาไม่ทำให้ประตูหน้าของไปป์ไลน์ของคุณหยุดชะงัก ครึ่งที่เป็นตัวสร้างคืออาร์ติแฟกต์ขนาด 16.4 GB ที่คุณรันเอง และไม่มีเอนด์พอยต์ใดเปลี่ยนสิ่งนั้นได้

อีกหนึ่งสิ่งที่ขนาดเหล่านั้นซ่อนไว้
จำนวนพารามิเตอร์ชวนให้เกิดการเปรียบเทียบที่ไม่สมเหตุสมผล Clef มี 27B และ MathForm-8B มี 8B จึงเป็นเรื่องธรรมดาที่จะสรุปว่าโมเดลที่ใหญ่กว่าคือตัวที่ความสามารถสูงกว่า และโมเดลที่เล็กกว่าคือผู้เชี่ยวชาญ แต่ในเชิงประเภทแล้วกลับตรงกันข้าม Clef ใหญ่เพราะมันแบกโครงหลังแบบมัลติโมดัลที่ถูกแช่แข็งไว้ ซึ่งจำเป็นสำหรับการอ่านภาพหน้าจอและใบแจ้งหนี้ ส่วนที่ถูกเทรนด้านบนเป็นเฮดสคีมาเล็ก ๆ พร้อมอะแดปเตอร์แบบ rank-256 MathForm-8B เล็กเพราะ Lean 4 เป็นเป้าหมายที่แคบ และฐาน Qwen3-8B ก็เพียงพอที่จะไปถึงเป้านั้น โดยงานวิศวกรรมจริงอยู่ที่ไปป์ไลน์ retrieval และ verification ที่สร้างข้อมูลฝึกของมัน มากกว่าจะอยู่ที่จำนวนพารามิเตอร์
ในอีกนัยหนึ่ง ขนาดบอกคุณว่าแต่ละโมเดลต้องแบกอะไรไว้ ไม่ได้บอกว่าปัญหาที่มันแก้ยากแค่ไหน โมเดล 27B ที่อ่านใบเสร็จแล้วคืนค่า "billing, 0.98" กับโมเดล 8B ที่สร้าง Lean ที่คอมไพล์ได้ ต่างก็ทำในสิ่งที่ถูกสร้างมาให้ทำพอดี และกรอบคิดแบบแปดพันล้านเทียบกับสองหมื่นเจ็ดพันล้านจะพาคุณไปเลือกตัวที่ผิดประมาณครึ่งหนึ่งของเวลา

การตัดสินใจ และคำถามที่ไม่มีผู้ขายรายใดตอบ
หากคุณมีไปป์ไลน์ที่รับข้อความภาษาธรรมชาติแบบไม่จำกัด และจำเป็นต้องจัดเส้นทางมันก่อนที่จะใช้ทรัพยากรคำนวณกับมัน ขั้นแรกคือตัวจำแนกแบบมีขอบเขต — Clef ในกรณีที่อินพุตหลายรูปแบบของมันสำคัญและตัวเลขของมันดูดีบนข้อมูลของคุณ หรือ Jev 1.13 ในกรณีที่คุณต้องการรูปร่างคำขอแบบเดียวกันในราคาตั้งที่ต่ำกว่า และโดยไม่ผูกสถาปัตยกรรมของคุณกับผู้ขายที่ไม่มีใครทำการประเมินซ้ำได้ ขั้นที่สองคือตัวสร้างเฉพาะทาง และหากตัวสร้างนั้นคือ Lean 4 แล้ว MathForm-8B คือโมเดลเปิดที่สร้างมาเพื่อสิ่งนั้นโดยเฉพาะ พร้อมไปป์ไลน์ที่เผยแพร่และคลังข้อมูลที่รองรับอยู่เบื้องหลัง
สิ่งที่ขาดหายไปในทั้งสองฝ่ายคือหลักฐานชนิดเดียวกัน การรัน Decision Index ของ Clef เป็นของ Cloudflare เอง และไม่เคยมีใครทำซ้ำอย่างอิสระ ตัวเลข Pass@8 ของ MathForm-8B มาจากบทความของมันเอง ทั้งคู่เป็นข้อกล่าวอ้างที่ทะเยอทะยานในด้านที่การทดสอบอย่างซื่อสัตย์นั้นบรรยายได้ง่ายแต่ทำได้แพง — นำข้อมูลที่ไม่มีผู้ขายรายใดใช้ฝึก ใช้ไปป์ไลน์เดียวกัน แล้วเผยแพร่ผลลัพธ์ จนกว่าจะมีใครทำเช่นนั้นกับโมเดลใดโมเดลหนึ่ง สิ่งที่มีประโยชน์ซึ่งการเปรียบเทียบนี้บอกคุณได้คือโครงร่าง: หนึ่งในสองนี้ควรอยู่ที่ด้านหน้าของไปป์ไลน์ของคุณเพื่อตัดสินว่าอะไรจะเข้ามา และอีกอันควรอยู่ด้านหลังเพื่อทำงานที่ยากและแคบ และไม่มีอันใดทดแทนอีกอันได้ที่จำนวนพารามิเตอร์ใด ๆ
