การ์ดชื่อเรื่องที่สร้างขึ้นซึ่งมีข้อความว่า 'Clef vs MathForm-8B' คำบรรยายใต้ภาพว่า 'ตัวหนึ่งตอบคำถามของคุณ อีกตัวเขียนบทพิสูจน์' พร้อมชิปที่อ่านว่า 'Apache 2.0 ทั้งคู่' และ 'Qwen ไฟน์จูนสองตัว' โลโก้ OrcaRouter ถูกคอมโพสิตไว้ที่มุมขวาล่าง
Engineering & Research

Clef vs MathForm-8B: ตัวหนึ่งตอบคำถามของคุณ อีกตัวหนึ่งเขียนบทพิสูจน์

ผู้เขียน

Elias Hawthorne

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

เหตุผลที่ต้องวางCloudflare/clefไว้ข้าง ๆ openbmb/MathForm-8Bก็คือทั้งสองเป็นสองสิ่งที่สับสนได้ง่ายที่สุดใน open weights ตอนนี้ และการสับสนระหว่างทั้งสองทำให้ต้องเสียการรันฝึกหนึ่งรอบ ทั้งคู่เป็น fine-tune ที่สร้างบนเช็กพอยต์ Qwen3.8-27B และ Qwen3-8B ตามลำดับ ทั้งคู่ใช้ Apache-2.0 ทั้งคู่เผยแพร่ภายในสิบสัปดาห์ที่ผ่านมา ทั้งคู่เป็นโมเดลขอบเขตแคบ สร้างขึ้นเพื่อจุดประสงค์เฉพาะ และผู้สร้างอธิบายว่าเป็นแบบเฉพาะทางมากกว่าอเนกประสงค์ และทั้งสองไม่มีความเกี่ยวข้องกันเลยแม้แต่น้อย เพราะตัวหนึ่งสร้างตัวเลขที่เลือกจากรายการที่คุณให้มา ส่วนอีกตัวสร้างซอร์สโค้ด Lean 4 ทีละโทเคน เพื่อให้ผู้ช่วยพิสูจน์ตรวจสอบ

Clef คือโมเดลการตัดสินใจแบบมัลติโมดัลขนาด 27 พันล้านพารามิเตอร์ของ Cloudflare: คุณให้สถานะและสคีมาของคำถามที่มีการระบุชนิดแก่มัน แล้วมันจะคืนค่าความน่าจะเป็นที่ปรับเทียบแล้วสำหรับทุกคำตอบที่อนุญาตในการประมวลผลแบบไม่ออโตเรเกรสซีฟเพียงรอบเดียว โดยไม่มีกระบวนการสร้างข้อความใด ๆ ในเส้นทางเลย MathForm-8B จาก OpenBMB เป็นโมเดลออโตฟอร์มาลไลเซชัน — ข้อความทางคณิตศาสตร์ภาษาธรรมชาติป้อนเข้าไป Lean 4 ถูกส่งออกมา และไปป์ไลน์ที่ใช้ฝึกมันได้รับการอธิบายไว้ใน preprint ของ arXiv ที่เผยแพร่พร้อมกับน้ำหนักในวันที่ 14 สิงหาคม 2026 เพดานของโมเดลหนึ่งคือขนาดของรายการตัวเลือกของคุณ เพดานของอีกโมเดลคือความแข็งแกร่งของทฤษฎีชนิดของ Lean การถามว่าอันไหนดีกว่ากันเป็นความผิดพลาดเชิงหมวดหมู่ และข้อเท็จจริงที่ว่าทั้งสองเป็นไฟน์จูนน้ำหนักเปิด Apache-2.0 ขนาดแปดถึงสองหมื่นเจ็ดพันล้านพารามิเตอร์นั้นเองคือสิ่งที่ทำให้ความผิดพลาดนี้เกิดขึ้นได้ง่าย

สิ่งที่อินเทอร์เฟซของแต่ละโมเดลห้ามไว้ในทางกายภาพ

วิธีที่เร็วที่สุดที่จะเห็นความแตกต่างคือการอ่านว่าสิ่งที่แต่ละตัวสามารถคืนค่าได้คืออะไร

• อินพุต — Clef รับสถานะ (ข้อความ, JSON, รูปภาพ หรือเฟรมวิดีโอ) พร้อมคำถามที่มีชื่อกำกับและระบุชนิดได้ตั้งแต่ 1 ถึง 64 ข้อ; MathForm-8B รับข้อความทางคณิตศาสตร์ในภาษาธรรมชาติ

• เอาต์พุต — Clef จะคืนค่าความน่าจะเป็นหนึ่งค่าต่อตัวเลือกที่อนุญาต โดยผ่านการทำ softmax แยกต่อคำถาม ส่วน MathForm-8B จะคืนซอร์สโค้ด Lean 4

• ประเภทคำถาม — ของ Clef ได้แก่ noul (จริง/เท็จ โดยมีความน่าจะเป็นที่คำตอบเป็นจริง), choice (ตัวเลือกที่มีชื่อ 2 ถึง 26 รายการ) และ score (2 ถึง 26 ระดับที่มีการเรียงลำดับ); MathForm-8B ไม่มีแนวคิดเรื่องคำถามเลย

• การปรับเทียบ — Clef เผยแพร่ฟิลด์ความเชื่อมั่นสำหรับแต่ละคำตอบ; MathForm-8B เผยแพร่อัตรา Pass@8 ภายใต้การตรวจสอบไวยากรณ์และความสอดคล้อง

• การให้บริการ — Clef ถูกให้บริการผ่าน POST /v1/systemone ที่เข้ากันได้กับ Jev/SystemOne บอดี้, โฮสต์หรือรันเอง; MathForm-8B มาพร้อมกับคำแนะนำสำหรับ Transformers, vLLM และ SGLang ซึ่งทั้งหมดเปิดให้ใช้เอนด์พอยต์คอมพลีชันที่เข้ากันได้กับ OpenAI ที่บริบทขนาด 16,384 โทเค็น โดย max_new_tokensถูกตั้งค่าเป็น 16,384.

ผลที่ตามมาในทางปฏิบัติเกิดขึ้นทันที หากคุณต้องการการตัดสินแบบใช่/ไม่ใช่เกี่ยวกับข้อความชิ้นหนึ่ง Clef เป็นเพียงตัวเดียวในสองตัวที่สามารถให้สิ่งนั้นได้ — ไม่มีทางถาม MathForm-8B ด้วยคำถามที่ไม่ใช่ "เขียน Lean 4 สำหรับสิ่งนี้" หากคุณต้องการ Lean 4 Clef เป็นเพียงตัวเดียวในสองตัวที่ไม่อาจให้สิ่งนั้นได้อย่างเด็ดขาด และไม่ใช่เพราะความอ่อนแอ: การขอให้ตัวให้คะแนนที่ผูกกับสคีมาทำการทำให้ทฤษฎีบทเป็นทางการ ไม่เข้ากับสัญญาของมัน ดังนั้นคำขอจึงถูกปฏิเสธโดยโครงสร้าง แทนที่จะตอบอย่างแย่ ๆ

A two-column comparison scoreboard titled 'Clef vs MathForm-8B — the scoreboard'. The left column 'Clef' reads: Parameters: 27B multimodal; Trained from: Qwen3.8-27B; Output: probability per option, no text; Context: 65,536 tokens; Interface: /v1/systemone, 1 to 64 typed questions; Evidence: vendor run, unreproduced. The right column 'MathForm-8B' reads: Parameters: 8B text-only; Trained from: Qwen3-8B; Output: Lean 4 source code; Context: 16,384 tokens; Interface: OpenAI-compatible completion; Evidence: paper, Pass@8 88.06% SC, 72.37% CC. A footer reads 'Clef figures per Cloudflare; MathForm figures per OpenBMB's paper. Neither independently reproduced.' The OrcaRouter logo is composited in the bottom-right corner.

ไปป์ไลน์ที่ทั้งคู่เป็นส่วนหนึ่ง

มีสถาปัตยกรรมจริงที่โมเดลทั้งสองนี้วางเคียงข้างกัน และมันคุ้มค่าที่จะพิจารณาไปทีละส่วน เพราะจะทำให้การแยกนี้ออกมาเป็นรูปธรรมมากกว่านามธรรม ลองพิจารณาบริการที่ทำหน้าที่จัดทำให้คณิตศาสตร์เป็นทางการสำหรับนักวิจัยและนักศึกษา

ข้อความต่างๆ มาถึงในภาษาธรรมชาติ โดยไม่จำกัดประเภท ก่อนที่สิ่งใดจะถูกทำให้เป็นทางการได้ ต้องมีบางสิ่งตัดสินใจว่าสิ่งที่มาถึงคืออะไร นี่คือทฤษฎีบทที่ต้องพิสูจน์ นิยามที่ต้องเพิ่ม คำขอให้ตรวจสอบการพิสูจน์ที่มีอยู่ หรือคำถามที่ต้องขอความกระจ่างก่อนที่ใครจะแตะ Lean หรือไม่? มันครบในตัวเอง หรือว่ามันพึ่งพาบริบทที่ผู้ใช้ไม่ได้ให้มา? สัญลักษณ์เหล่านี้เป็นแบบแผนปกติ หรือว่าสัญกรณ์นี้เป็นสิ่งที่ระบบไม่เคยเห็น? แต่ละข้อเหล่านี้เป็นคำถามที่มีขอบเขตจำกัดพร้อมชุดตัวเลือกเล็กๆ — รูปแบบที่แน่นอนของ Clef — และความน่าจะเป็นที่ปรับเทียบแล้วซึ่งผูกกับแต่ละคำตอบ คือสิ่งที่ทำให้บริการสามารถทำสิ่งที่มีเหตุผลกับคำตอบที่ไม่แน่นอนได้: ส่งสิ่งใดก็ตามที่ต่ำกว่าเกณฑ์ให้มนุษย์ แทนที่จะเดา

ขั้นตอนที่สองเป็นของ MathForm-8B นำข้อความที่ถูกจำแนกแล้วว่าเป็นทฤษฎีบทที่ครบในตัวเองซึ่งมีสัญกรณ์ที่รู้จัก แล้วส่งออกเป็น Lean 4 นั่นคือปัญหาด้านการสร้าง และคำถามเรื่องคุณภาพคือผลลัพธ์คอมไพล์ผ่านบ่อยแค่ไหน และบ่อยแค่ไหนที่มันมีความหมายเดียวกันกับต้นฉบับ — ซึ่งเป็นสิ่งที่แกนการประเมินสองแกนของผู้ขายวัดอย่างแม่นยำ นี่คือรูปแบบทั่วไปที่ควรสกัดออกมาจากการจับคู่นี้: ตัวจำแนกแบบมีขอบเขตที่ราคาถูกซึ่งวางไว้ข้างหน้าเครื่องสร้างเฉพาะทางราคาแพง มักถูกกว่าและเชื่อถือได้มากกว่าการพรอมต์ให้เครื่องสร้างตัดสินใจว่าตัวมันควรทำงานหรือไม่ตั้งแต่แรก

ตัวเลขในแต่ละด้านวัดอะไรกันแน่

บทคัดย่อ arXiv ของ OpenBMB รายงานว่า MathForm-8B ทำอัตรา Pass@8 เฉลี่ยได้ 88.06% ภายใต้ Syntax Check และ 72.37% ภายใต้ Consistency Check ในหกเบนช์มาร์ก และบนชุดย่อย FATE-H และ FATE-X มันทำอัตราผ่านด้านความสอดคล้องได้ 63% และ 37% ซึ่งทั้งคู่อยู่เหนือเบสไลน์เฉพาะทางที่แข็งแกร่งที่สุดที่เปเปอร์นำมาเปรียบเทียบ ส่วนที่น่าสนใจของข้ออ้างนี้คือไปป์ไลน์การฝึก: ตัววางแผนการดึงข้อมูล (retrieval planner) จะดึงคำนิยามที่เกี่ยวข้องและงานทำให้เป็นรูปแบบ (formalisations) ที่มีอยู่แล้วออกจาก Mathlib ก่อนการสร้าง จากนั้นข้อความที่สร้างขึ้นจะถูกแก้ไขโดยใช้ข้อมูลวินิจฉัยจากคอมไพเลอร์และฟีดแบ็กความสอดคล้องเชิงความหมาย ซึ่งเป็นวิธีที่ชุดข้อมูล FormalVerse ที่มีตัวอย่าง Lean 4 ที่ผ่านการตรวจสอบแล้วราว 367,000 ตัวอย่างถูกสร้างขึ้นก่อนการปรับละเอียดแบบมีผู้สอนและการเรียนรู้แบบเสริมกำลัง ตัวเลขเหล่านี้เป็นตัวเลขที่ผู้ขายรายงานจากเปเปอร์และโมเดลการ์ด ยังไม่มีผู้ใดที่เป็นอิสระรันซ้ำตัวเลขเหล่านี้เลย

ตัวเลขของ Clef วัดสิ่งอื่นโดยสิ้นเชิงและไม่สามารถเปรียบเทียบกันได้ การรัน Decision Index ของ Cloudflare รายงานค่า macro-F1 ของเจตนา BANKING77 ที่ 94.2, CLINC150 ที่มีการจัดการนอกขอบเขตที่ 97.4, GPQA Diamond ที่ 48.0 — โดยที่ Jev ที่เก่ากว่าทำคะแนนได้ 78.3 — และค่ามัธยฐานความหน่วงของคำขอที่ 209.3 มิลลิวินาที มันเป็นตารางเกี่ยวกับการจำแนกประเภทและการกำหนดเส้นทาง ที่ผลิตโดยผู้ขายบนชุดทดสอบของผู้ขายเอง โฮสต์อยู่บนลีดเดอร์บอร์ดของผู้ขายเอง และไม่ได้รับการทำซ้ำ

ประโยคที่ซื่อตรงเพียงประโยคเดียวที่ควรเขียนเกี่ยวกับสองคอลัมน์นี้ก็คือ ทั้งสองไม่ได้ใช้เบนช์มาร์กเดียวกัน ไม่ได้ใช้หน่วยวัดเดียวกัน และไม่ได้ใช้ปรัชญาการประเมินเดียวกัน ตัวเลข 37% ของ MathForm-8B บนชุดย่อยการทำให้เป็นทางการแบบยาก และ 97.4 ของ Clef ในการตรวจจับเจตนาที่อยู่นอกขอบเขต ต่างก็เป็นคำกล่าวอ้างจริงของผู้สร้างของแต่ละตัวเกี่ยวกับงานที่แตกต่างกัน และผู้อ่านที่นำตัวเลขเหล่านี้มาเทียบเคียงกันก็ไม่ได้รับความรู้อะไรเลย นอกจากว่าตัวเลขทั้งสองนั้นมีอยู่จริง

สิ่งที่คุณจะรัน และค่าใช้จ่ายที่ตามมา

ไม่มีโมเดลใดเป็น route บน OrcaRouter และบทความนี้ไม่ได้อ้างถึงความพร้อมให้บริการใด ๆ — แคตตาล็อกตอบกลับ 404 สำหรับ cloudflare/clef และสำหรับ MathForm-8B พื้นที่จัดเก็บของ MathForm มีขนาดราว 16.4 GB และทั้งสองโมเดลใช้สัญญาอนุญาต Apache-2.0 ดังนั้นทั้งคู่จึงสามารถโฮสต์เองได้ตั้งแต่วันพรุ่งนี้โดยใครก็ตามที่มีฮาร์ดแวร์

Clef บน Cloudflare — $0.24 ต่อโทเคนอินพุตหนึ่งล้านโทเคนบน Workers AI โดยมีความหน่วงที่เผยแพร่ซึ่งวัดบน H200 เพียงตัวเดียว

• MathForm-8B โฮสต์ด้วยตนเอง — ไม่มีการโฮสต์โดยผู้ขาย ไม่มีราคาต่อโทเคน และมีคอนเท็กซ์ 16,384 โทเคนตามเอกสาร ซึ่งเป็นข้อจำกัดที่ควรสังเกต: ส่วนของบทความยาวจะไม่สามารถประมวลผลในครั้งเดียวได้

• ทางเลือกที่กำหนดเส้นทางไว้สำหรับครึ่งที่เป็นตัวจำแนกประเภท — Jev 1.13 ของ TypeSafe ในราคา $0.042 ต่อโทเคนอินพุตหนึ่งล้านโทเคน ภายในบริบท 65,536 โทเคน ให้บริการผ่านบอดี้ POST /v1/systemone เดียวกับที่ Clef ใช้ ซึ่งทำให้มันเสียบใช้ได้ทันทีสำหรับขั้นตอนแรกของไปป์ไลน์ข้างต้น

นั่นคือจุดที่เลเยอร์การจัดเส้นทางเข้ามามีบทบาทในคู่ผสมแบบเฉพาะนี้ รูปแบบนี้ประกอบด้วยตัวตัดสินใจและตัวสร้าง และครึ่งที่เป็นตัวตัดสินใจคือส่วนที่มีตัวแทนที่ใช้งานได้จริง — เอนด์พอยต์เดียวที่วางอยู่หน้าอีกกว่า 200 โมเดลราคาตามรายการของผู้ให้บริการที่ส่งต่อโดยไม่บวกเพิ่มต่อโทเคน และ การสลับสำรองอัตโนมัติ เพื่อให้ช่วงบ่ายที่ผู้ให้บริการมีปัญหาไม่ทำให้ประตูหน้าของไปป์ไลน์ของคุณหยุดชะงัก ครึ่งที่เป็นตัวสร้างคืออาร์ติแฟกต์ขนาด 16.4 GB ที่คุณรันเอง และไม่มีเอนด์พอยต์ใดเปลี่ยนสิ่งนั้นได้

A headless capture of the openbmb/MathForm-8B model card on Hugging Face, showing the model title, the TextGeneration, Transformers and Safetensors tags, a link to the openbmb/FormalVerse dataset, the English language marker, and the qwen3, lean4, autoformalization, mathematics, formal-verification and reasoning subject tags.

อีกหนึ่งสิ่งที่ขนาดเหล่านั้นซ่อนไว้

จำนวนพารามิเตอร์ชวนให้เกิดการเปรียบเทียบที่ไม่สมเหตุสมผล Clef มี 27B และ MathForm-8B มี 8B จึงเป็นเรื่องธรรมดาที่จะสรุปว่าโมเดลที่ใหญ่กว่าคือตัวที่ความสามารถสูงกว่า และโมเดลที่เล็กกว่าคือผู้เชี่ยวชาญ แต่ในเชิงประเภทแล้วกลับตรงกันข้าม Clef ใหญ่เพราะมันแบกโครงหลังแบบมัลติโมดัลที่ถูกแช่แข็งไว้ ซึ่งจำเป็นสำหรับการอ่านภาพหน้าจอและใบแจ้งหนี้ ส่วนที่ถูกเทรนด้านบนเป็นเฮดสคีมาเล็ก ๆ พร้อมอะแดปเตอร์แบบ rank-256 MathForm-8B เล็กเพราะ Lean 4 เป็นเป้าหมายที่แคบ และฐาน Qwen3-8B ก็เพียงพอที่จะไปถึงเป้านั้น โดยงานวิศวกรรมจริงอยู่ที่ไปป์ไลน์ retrieval และ verification ที่สร้างข้อมูลฝึกของมัน มากกว่าจะอยู่ที่จำนวนพารามิเตอร์

ในอีกนัยหนึ่ง ขนาดบอกคุณว่าแต่ละโมเดลต้องแบกอะไรไว้ ไม่ได้บอกว่าปัญหาที่มันแก้ยากแค่ไหน โมเดล 27B ที่อ่านใบเสร็จแล้วคืนค่า "billing, 0.98" กับโมเดล 8B ที่สร้าง Lean ที่คอมไพล์ได้ ต่างก็ทำในสิ่งที่ถูกสร้างมาให้ทำพอดี และกรอบคิดแบบแปดพันล้านเทียบกับสองหมื่นเจ็ดพันล้านจะพาคุณไปเลือกตัวที่ผิดประมาณครึ่งหนึ่งของเวลา

A headless capture of the OrcaRouter model page for typesafe/jev-1.13, showing the TypeSafe breadcrumb, the Jev 1.13 title, text input and output modality labels, a p50 TTFT latency figure, the Performance and Public benchmarks tabs, and the code-sample panel.

การตัดสินใจ และคำถามที่ไม่มีผู้ขายรายใดตอบ

หากคุณมีไปป์ไลน์ที่รับข้อความภาษาธรรมชาติแบบไม่จำกัด และจำเป็นต้องจัดเส้นทางมันก่อนที่จะใช้ทรัพยากรคำนวณกับมัน ขั้นแรกคือตัวจำแนกแบบมีขอบเขต — Clef ในกรณีที่อินพุตหลายรูปแบบของมันสำคัญและตัวเลขของมันดูดีบนข้อมูลของคุณ หรือ Jev 1.13 ในกรณีที่คุณต้องการรูปร่างคำขอแบบเดียวกันในราคาตั้งที่ต่ำกว่า และโดยไม่ผูกสถาปัตยกรรมของคุณกับผู้ขายที่ไม่มีใครทำการประเมินซ้ำได้ ขั้นที่สองคือตัวสร้างเฉพาะทาง และหากตัวสร้างนั้นคือ Lean 4 แล้ว MathForm-8B คือโมเดลเปิดที่สร้างมาเพื่อสิ่งนั้นโดยเฉพาะ พร้อมไปป์ไลน์ที่เผยแพร่และคลังข้อมูลที่รองรับอยู่เบื้องหลัง

สิ่งที่ขาดหายไปในทั้งสองฝ่ายคือหลักฐานชนิดเดียวกัน การรัน Decision Index ของ Clef เป็นของ Cloudflare เอง และไม่เคยมีใครทำซ้ำอย่างอิสระ ตัวเลข Pass@8 ของ MathForm-8B มาจากบทความของมันเอง ทั้งคู่เป็นข้อกล่าวอ้างที่ทะเยอทะยานในด้านที่การทดสอบอย่างซื่อสัตย์นั้นบรรยายได้ง่ายแต่ทำได้แพง — นำข้อมูลที่ไม่มีผู้ขายรายใดใช้ฝึก ใช้ไปป์ไลน์เดียวกัน แล้วเผยแพร่ผลลัพธ์ จนกว่าจะมีใครทำเช่นนั้นกับโมเดลใดโมเดลหนึ่ง สิ่งที่มีประโยชน์ซึ่งการเปรียบเทียบนี้บอกคุณได้คือโครงร่าง: หนึ่งในสองนี้ควรอยู่ที่ด้านหน้าของไปป์ไลน์ของคุณเพื่อตัดสินว่าอะไรจะเข้ามา และอีกอันควรอยู่ด้านหลังเพื่อทำงานที่ยากและแคบ และไม่มีอันใดทดแทนอีกอันได้ที่จำนวนพารามิเตอร์ใด ๆ

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube