การ์ดไตเติลหลักสำหรับการเปรียบเทียบ 'AuK-Flash กับ MathForm-8B' พร้อมคำบรรยายใต้ชื่อว่า 'ผู้เชี่ยวชาญเงียบสองคนบนสมอง Qwen ที่ยืมมา' โดยแสดงชิปกลางที่ติดป้ายว่า 'สมอง Qwen ที่ยืมมา' แตกกิ่งไปยังไทล์ส่งออกเสียงของ AuK-Flash และไทล์ส่งออก Lean-4 ของ MathForm-8B โดยมีโลโก้ OrcaRouter ประกอบอยู่ที่มุม
Guides & Insights

AuK-Flash ปะทะ MathForm-8B: สองผู้เชี่ยวชาญเงียบๆ บนสมอง Qwen ที่ยืมมา

ผู้เขียน

Elias Hawthorne

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

AuK-Flash และ MathForm-8B มีจุดร่วมกันมากกว่าที่ห้องแล็บทั้งสองแห่งอาจจะรู้ตัวเสียอีก และจุดร่วมนั้นไม่ใช่งานที่แต่ละโมเดลทำอยู่ MathForm-8B คือโมเดลออโตฟอร์แมลไลเซชันขนาด 8B ของ OpenBMB — เป็นการ fine-tune จาก Qwen3-8B ภายใต้สัญญาอนุญาต Apache-2.0 ซึ่งแปลงคณิตศาสตร์ในภาษาธรรมชาติให้เป็นคำสั่ง Lean 4 ที่คอมไพเลอร์ตรวจสอบได้ ส่วน AuK-Flash คือโมเดลเสียงแบบกลั่น (distilled speech model) ของ Tencent — เจเนอเรเตอร์แบบ diffusion ภายใต้ใบอนุญาต MIT สำหรับการสังเคราะห์และแก้ไขเสียง โดยป้อนคำสั่งผ่านเอนโค้ดเดอร์ Qwen2.5-Omni-3B ก่อนสร้างเสียงออกมา โมเดลหนึ่งแปลงคณิตศาสตร์ที่เขียนเป็นภาษาธรรมชาติให้เป็นข้อความรูปนัยที่ตรวจสอบความถูกต้องได้ อีกโมเดลหนึ่งแปลงข้อความและคำสั่งให้เป็นเสียง ทั้งคู่ใช้กลยุทธ์ทางสถาปัตยกรรมแบบเดียวกันแต่มาจากทิศทางตรงกันข้าม: ไม่มีโมเดลใดฝึกภาษาเอนกประสงค์ขึ้นจากศูนย์ — แต่ละตัวห่อหุ้มโมเดลโอเพนซอร์สที่มีอยู่เดิมเอาไว้ และทุ่มเทความพยายามหลักไปที่โมดาลิตี้ของเอาต์พุตของตน ทั้งคู่ยังถูกเผยแพร่ออกมาในลักษณะเดียวกันด้วย — อัปโหลดค่าน้ำหนักขึ้น Hugging Face อย่างเงียบ ๆ ไม่มีการแถลงข่าว — และทั้งคู่คือการปล่อยโมเดลแบบเฉพาะทางที่ให้ผู้ใช้โฮสต์เอง ซึ่งเกณฑ์ชี้วัดของโมเดลระดับแนวหน้าไม่สามารถวัดผลได้

รูปแบบที่รวมพวกมันเข้าด้วยกัน

ลองดูรุ่นเผยแพร่ทั้งสองเทียบกันจะเห็นว่าแทบเป็นภาพสะท้อนกัน คลัง AuK-Flash ของ Tencent ระบุวันที่ 21 สิงหาคมบน Hugging Face (ส่วน AuK ฐานที่เป็นพี่น้องกัน วันที่ 18 สิงหาคม) ส่วนประกาศโอเพนซอร์ส — ทั้งโค้ด น้ำหนัก และลิงก์เดโม — เพิ่งมาถึงในสัปดาห์นี้ โดยระบุวันที่ 7 กันยายนบนการ์ด Hugging Face และวันที่ 9 กันยายนบนที่เก็บ GitHub ที่เชื่อมโยงกัน ส่วนคลัง MathForm-8B ของ OpenBMB ปรากฏวันที่ 14 สิงหาคมโดยไม่มีการประกาศใดๆ เลย ในทั้งสองกรณี การ์ดโมเดลคือการเปิดตัว น้ำหนักไม่ได้ถูกจำกัดสิทธิ์ภายใต้ไลเซนส์แบบอนุญาต และไม่มี API โฮสต์ไว้ให้ลอง — คุณดาวน์โหลด checkpoint แล้วรันบนฮาร์ดแวร์ที่คุณควบคุมเอง สำหรับผู้อ่านที่กำลังตัดสินใจว่าจะนำไปใช้ รูปแบบที่เหมือนกันนี้สำคัญกว่าความแตกต่างในโดเมน: ทั้งคู่คือการเดิมพันว่าโมเดลโอเพนที่มีขอบเขตจำกัดอย่างมุ่งเป้าสามารถตอบสนองกลุ่มเฉพาะที่นายพลทำได้ไม่ดี และทั้งคู่ขอให้คุณจัดหาการประเมินผลที่ผู้ขายไม่ได้จัดเตรียมไว้ให้

กระดานคะแนนที่ซื่อตรง

เนื่องจากโมเดลทั้งสองไม่มีการทับซ้อนกันบนเกณฑ์มาตรฐานใด ๆ เลย ตารางคะแนนจึงเป็นภาพสะท้อนของการเดิมพันที่แตกต่างกันสองแบบ มากกว่าจะเป็นการจัดอันดับ แหล่งที่มาของข้อมูลมีความสำคัญในทุกแถว — ข้ออ้างของ AuK-Flash เป็นคำแถลงบนการ์ดของ Tencent ที่เก่าไปหลายวันและยังไม่มีการพิสูจน์ซ้ำ; ส่วนตัวเลขของ MathForm-8B มาจากรายงานของ OpenBMB ใน arXiv 2608.14221 และยังไม่มีการพิสูจน์ซ้ำ:

• มันคืออะไร — AuK-Flash: โมเดลสร้างและแก้ไขเสียงพูดขนาด ~1.5B ของ Tencent ที่ถูกกลั่นเป็นรูปแบบ diffusion แบบ 4 ขั้นตอน ส่วน MathForm-8B: โมเดล autoformalizer ขนาด 8B ของ OpenBMB ที่แปลงคณิตศาสตร์แบบไม่เป็นทางการให้เป็น Lean 4

• ผลลัพธ์ — AuK-Flash: เสียง 24 kHz — คำพูด, คำพูดที่แก้ไขแล้ว, แหล่งเสียงที่แยกออกจากกัน MathForm-8B: ข้อความ Lean 4 ที่มีส่วนหัวและทฤษฎีบทที่มีชื่อ

การสร้าง — AuK-Flash: ทรานส์ฟอร์มเมอร์แบบดิฟฟิวชันที่ถูกกลั่นให้มี NFE คงที่ 4 / CFG 0 โดยใช้ Qwen2.5-Omni-3B เป็นตัวเข้ารหัสคำสั่ง MathForm-8B: Qwen3-8B ที่ปรับแต่งด้วย SFT จากนั้นจึงทำ RL บนชุดข้อมูล FormalVerse ซึ่งมี ~367,000 ตัวอย่าง

• ภาษาป้อนเข้า — AuK-Flash: จีนและอังกฤษ (ตามบัตรโมเดล) MathForm-8B: อังกฤษ ในรูปแบบข้อความปัญหาคณิตศาสตร์

• การปล่อย — AuK-Flash: ที่เก็บโค้ด 18/21 สิงหาคม; ประกาศโอเพนซอร์ส 7–9 กันยายน. MathForm-8B: ที่เก็บโค้ด 14 สิงหาคม; ยังไม่มีการประกาศ ณ เวลาที่เขียน

• หลักฐาน — AuK-Flash: ยังไม่มีนอกเหนือจากรายการความสามารถของการ์ด MathForm-8B: ผู้จำหน่ายรายงาน 88.06% Pass@8 ภายใต้การตรวจสอบไวยากรณ์ และ 72.37% ภายใต้การตรวจสอบความสอดคล้อง โดยมี FATE-H 63% และ FATE-X 37% ในชุดความสอดคล้องแบบยาก

A two-column scoreboard comparing AuK-Flash and MathForm-8B: AuK-Flash with 24 kHz audio output, Qwen2.5-Omni-3B encoder, speech generation and editing specialty, MIT license, no hosted API, vendor-card-only evidence; MathForm-8B with Lean 4 statement output, a fine-tune of Qwen3-8B, math autoformalization specialty, Apache-2.0, no hosted API, and vendor-reported Pass@8 of 88.06 under syntax check and 72.37 under consistency check; a footer notes AuK-Flash claims are Tencent-reported and MathForm-8B figures are OpenBMB-reported and unreproduced.

กระดานคะแนนในหกแถว: ทั้งคู่เป็นผู้เชี่ยวชาญด้าน open-weights ที่ยืมสมองของ Qwen มาใช้และมีหลักฐานอิสระบางๆ — พวกมันต่างกันที่สิ่งที่ผลิตออกมา ไม่ใช่วิธีที่ปล่อยวาง

AuK-Flash: คำพูดในฐานะผลลัพธ์ของผู้เชี่ยวชาญ

ข้อกล่าวอ้างเรื่อง “สมองยืม” ของ AuK-Flash เป็นความหมายตามตัวอักษร ไม่ใช่เชิงวาทศิลป์ เช็คพอยต์ที่เทนเซ็นต์เผยแพร่ประกอบด้วยน้ำหนักของดิฟฟิวชันทรานส์ฟอร์มเมอร์และเลเยอร์ฟิวชัน ส่วนโมเดลที่เข้าใจคำสั่งของคุณจริง ๆ — Qwen2.5-Omni-3B — ถูกดาวน์โหลดแยกต่างหากและโหลดในขณะรันไทม์ และ BigVGANFlowVAE ที่แปลงค่าแฝงกลับเป็นรูปคลื่นเสียง 24 kHz ก็เช่นกัน ดังนั้นสิ่งที่เทนเซ็นต์ฝึกจึงไม่ใช่โมเดลภาษาโดยแท้จริง แต่เป็นเครื่องกำเนิดแบบ flow-matching แบบมีเงื่อนไข: เมื่อได้รับแผนเชิงความหมายจากตัวเข้ารหัส Qwen มันจะสังเคราะห์เสียงออกมาในไม่กี่ขั้นตอน AuK-Flash เป็นเวอร์ชันกลั่นสี่ขั้นตอนของเครื่องกำเนิดนั้น และรีโพของมัน — เช็คพอยต์ Flash ในรูปแบบ BF16 ประมาณ 6.1 GB พร้อม VAE ขนาด 637 MB — มาพร้อม CLI, เอนจิน Python, โหนด Gradio และ ComfyUI และสคริปต์ปรับละเอียด รายการความสามารถกว้างขวางสำหรับโมเดลเสียงพูด: TTS แบบ zero-shot และแบบใช้คำสั่ง, การแก้ไขเนื้อหาและเนื้อเพลง, การเปลี่ยนระดับเสียง/ความเร็ว/ความดัง และอารมณ์/โทนเสียง, การกำจัดสำเนียง, การแปลงเสียงกระซิบ, การเพิ่มคุณภาพเสียง และการแยกแหล่งเสียง ทั้งหมดอยู่ภายใต้อินเทอร์เฟซคำสั่งภาษาธรรมชาติเดียวในภาษาจีนและอังกฤษ ไม่ว่าแต่ละอย่างจะทำงานได้ตามที่อธิบายหรือไม่นั้นยังไม่ผ่านการทดสอบนอกเทนเซ็นต์ ส่วนข้อกล่าวอ้างทางสถาปัตยกรรม — Qwen เล็ก ๆ ที่เข้าใจคำสั่ง กับโมเดลดิฟฟิวชันแบบกลั่นที่สร้างเสียง — นั้นเห็นได้ในรีโพเอง

A screenshot of the Hugging Face model page for tencent/AuK-Flash, showing the model card title 'AuK-Flash: Fast 4-Step Speech Generation and Editing', the MIT license tag, and the text-to-speech and diffusion tags.

หน้า repository ของ tencent/AuK-Flash — น้ำหนักโมเดลที่อยู่ภายใต้สัญญาอนุญาต MIT สำหรับโมเดลเสียงพูดแบบกลั่น 4 ขั้นตอน โดยตัวเข้ารหัส Qwen2.5-Omni-3B และ VAE จะถูกโหลดจากไฟล์แยกต่างหากในขณะรันไทม์

MathForm-8B: บทพิสูจน์แบบรูปนัยในฐานะผลลัพธ์ของผู้เชี่ยวชาญ

MathForm-8B เป็นรูปแบบเดียวกันในอีกโดเมนหนึ่ง OpenBMB นำ Qwen3-8B ซึ่งเป็นโมเดลทั่วไปที่ฝึกฝนบน 119 ภาษา และทุ่มความสามารถทั้งหมดไปกับรูปแบบเอาต์พุตเดียว: ข้อความทฤษฎีบท Lean 4 ที่ได้มาจากโจทย์ภาษาธรรมชาติ ขั้นตอน SFT บน FormalVerse สอนการแมประหว่างภาษาที่ไม่เป็นทางการไปเป็นทางการ จากนั้นขั้น RL ทำให้คมชัดยิ่งขึ้นด้วยการเทียบกับคำตัดสินของคอมไพเลอร์ Lean ซึ่งเป็นเหตุผลที่โมเดลไม่ได้รายงานคะแนนคุณภาพคลุมเครือ แต่รายงาน Pass@8 ภายใต้การตรวจไวยากรณ์ และการผ่านที่เข้มงวดยิ่งขึ้นภายใต้การตรวจความสอดคล้องเชิงความหมาย ตัวเลขจากผู้ผลิตอยู่ในเกณฑ์แข็งแกร่ง — 88.06% และ 72.37% จากหกเบนช์มาร์ก เอาชนะเบสไลน์เฉพาะทางขนาด 7B–32B ของรายงาน — และก็ยังไม่มีการทำซ้ำผลเช่นเดียวกับคำกล่าวอ้างของ AuK-Flash คลังโค้ดอยู่ภายใต้ Apache-2.0 ให้บริการผ่าน Transformers, vLLM หรือ SGLang และแลกมาด้วยการยอมสละแทบทุกอย่างที่ Qwen3-8B มีชื่อเสียง นั่นคือ ไม่มีการแชททั่วไปสำหรับ 119 ภาษา งบประมาณเอาต์พุตประมาณ 16K โทเคนสำหรับ Lean และไม่มีความสามารถที่ได้รับการบันทึกไว้นอกเหนือจากการทำให้เป็นทางการ

A screenshot of the Hugging Face model page for openbmb/MathForm-8B, showing the model card title 'MathForm: Scaling Mathematical Autoformalization with Knowledge Retrieval and Verification-Guided Refinement', base model Qwen3-8B in the metadata, and the Apache-2.0 license.

พื้นที่เก็บข้อมูล openbmb/MathForm-8B — น้ำหนัก Apache-2.0 ของตัวจัดรูปแบบอัตโนมัติ (autoformalizer) โดยระบุให้ Qwen3-8B เป็นโมเดลฐาน และนี่คือทั้งหมดที่ MathForm-8B เปิดเผยสู่สาธารณะ

การตรวจสอบคือประเด็นที่เกณฑ์มาตรฐานทั้งสองไม่ครอบคลุม

ลองวางผลลัพธ์ทั้งสองไว้ข้างกัน จะเห็นความสมมาตรที่แปลกประหลาด การออกแบบทั้งหมดของ MathForm-8B มีขึ้นเพราะคณิตศาสตร์ในภาษาธรรมชาติไม่มีสัญญาณความถูกต้อง — คอมไพล์เลอร์ของ Lean เป็นตัวให้สัญญาณนั้น โมเดลจึงถูกฝึกกับผลตัดสินผ่าน/ไม่ผ่านที่มันสัมผัสได้จริง โดเมนของ AuK-Flash เจอปัญหาเดียวกันแต่มีวิธีแก้ที่ต่างออกไป: ไม่มีคอมไพล์เลอร์สำหรับคำถามที่ว่า “คลิปนี้ฟังดูเหมือนคนพูดคนนั้นไหม ในแบบกระซิบ และไม่มีเสียงไอ” ดังนั้นสัญญาณผ่าน/ไม่ผ่านจึงเป็นหูของมนุษย์ เกณฑ์วัดรวมแบบรวมกลุ่มไม่ได้วัดสิ่งนั้น—ค่า Elo บนตัวหนังสือหรือคะแนนคุณภาพบนเสียงสังเคราะห์บอกคุณได้น้อยมากว่าคำมั่นหลักของโมเดลเฉพาะทาง (Lean ที่ตรวจสอบแล้ว หรือเสียงที่แก้ไขและเลียนแบบได้) จะยืนหยัดในเวิร์กโฟลว์ของคุณหรือไม่ ผลในทางปฏิบัติคือ โมเดลทั้งสองต้องถูกประเมินในแบบที่ผู้ขายไม่สามารถประเมินได้: MathForm-8B ด้วยการนำเอาต์พุตไปรันผ่าน Lean และ AuK-Flash ด้วยการฟังเอาต์พุตจากข้อมูลของคุณเอง จนกว่าจะมีใครลงมือทำแบบนั้น คำกล่าวอ้างพาดหัวบนการ์ดของทั้งคู่ก็เป็นเพียงทิศทาง ไม่ใช่ผลลัพธ์

แต่ละอย่างเหมาะกับใคร และใครที่ควรจะรอ

• เลือก MathForm-8B เมื่องานของคุณจบลงที่การจัดรูปแบบ (formalization) — การแปลงคลังข้อสอบ การสร้างคลังข้อมูล Lean การป้อนระบบพิสูจน์อัตโนมัติ — และคุณต้องการผู้เชี่ยวชาญโอเพนซอร์สที่แข็งแกร่งที่สุดในขนาดนี้ มันไม่ใช่โมเดลทั่วไป ดังนั้นจับคู่กับโมเดลอื่นสำหรับทุกอย่างที่เกี่ยวข้องกับขั้นตอนการจัดรูปแบบ

• เลือก AuK-Flash เมื่อเวิร์กโหลดของคุณให้ผลลัพธ์สุดท้ายเป็นเสียง — เสียงอ่านข้อความ ไฟล์บันทึกเสียงที่ต้องตัดต่อ หรือมิกซ์ที่ต้องแยกต้นเสียง — และคุณต้องการโมเดลแบบเปิดที่ทำทั้งการสร้างและการแก้ไขเป็นขั้นตอนเดียว ควรเผื่องบประมาณสำหรับ Qwen encoder ที่ใช้คู่กัน และสำหรับการทดสอบด้วยการฟังของคุณเอง

• หากคุณต้องการโครงสร้างพื้นฐานที่พิสูจน์แล้วและได้รับการสนับสนุน ควรรอทั้งสองตัวก่อน: ทั้งคู่ยังไม่มีผลลัพธ์จากการประเมินอย่างอิสระ ทั้งคู่ไม่มี hosted API และทั้งคู่เพิ่งเกิดขึ้นได้เพียงไม่กี่วันถึงไม่กี่สัปดาห์ รูปแบบที่ควรขโมยไปใช้คือเชิงสถาปัตยกรรม — สมองภาษาขนาดเล็กที่ยืมมาเสริมกับหัวเอาต์พุตเฉพาะทางมีต้นทุนถูกกว่ามากในการฝึกและปรับปรุงวนซ้ำกว่าโมเดลความสามารถทั่วไปเต็มรูปแบบ — และเป็นรูปแบบที่คุณสามารถนำไปปรับใช้ในการ fine-tuning ของคุณเองได้ ไม่ว่าคุณจะได้รันเช็คพอยต์ทั้งสองนี้หรือไม่ก็ตาม

การเปิดตัวทั้งสองครั้งยังแสดงให้เห็นอีกด้วยว่าเลเยอร์การจัดเส้นทาง (routing layer) สมควรได้รับบทบาทในสแตกแบบผสมอย่างไร: เมื่อไปป์ไลน์ของคุณข้ามจากโมเดล reasoning ทั่วไปไปสู่โมเดลผู้เชี่ยวชาญเฉพาะทาง เช่น หนึ่งในโมเดลผู้เชี่ยวชาญที่กล่าวถึงนี้ จุดประสงค์ของเราเตอร์ก็คือคุณไม่จำเป็นต้องผูกสถาปัตยกรรมไว้กับคำตอบเดียว การมี API เดียวที่ครอบคลุมโมเดลกว่า 200 รุ่น การเฟลโอเวอร์อัตโนมัติเมื่อผู้ให้บริการมีประสิทธิภาพลดลง และการส่งผ่านราคารายการของผู้ให้บริการโดยไม่บวกมาร์กอัป (0%) หมายความว่าคุณสามารถให้โมเดลทั่วไปทำงานบนเส้นทางเริ่มต้น และเรียกใช้โมเดลผู้เชี่ยวชาญเฉพาะกับกลุ่มคำขอที่ต้องการมันจริงๆ เท่านั้น — และสามารถสลับโมเดลผู้เชี่ยวชาญได้ทันทีในวันที่โมเดลที่ดีกว่าออกมา

การเปรียบเทียบที่ควรยึดถือไม่ใช่ AuK-Flash สู้กับ MathForm-8B เพราะทั้งคู่ไม่มีวันแข่งขันกันเพื่อคำขอเดียวกัน หากแต่คือสองโมเดลนี้ที่สู้กับสมมติฐานที่ว่าโมเดลอเนกประสงค์ระดับแนวหน้าเท่านั้นที่คุ้มค่าที่จะนำมารัน การตัดต่อเสียงพูดและการแปลงเป็นรูปนัยที่ตรวจสอบได้ต่างก็เป็นโดเมนที่โมเดลโอเพนซอร์สขนาดเล็กซึ่งมุ่งเฉพาะทางและมีสมองยืมมาใช้สามารถเอาชนะโมเดลที่ใหญ่กว่ามากซึ่งไม่เคยถูกเล็งมาที่ปัญหานั้นได้ — ซึ่งคือข้อเดิมพันที่ทั้ง Tencent และ OpenBMB เพิ่งเผยแพร่ และยังเป็นสิ่งที่ต้องการการพิสูจน์โดยอิสระ

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube