การ์ดชื่อเรื่องที่สร้างขึ้นซึ่งมีหัวข้อว่า 'TwIL-LM3-Pro vs LFM2.5 2.6B Base' คำบรรยายใต้หัวข้อว่า 'อันหนึ่งเสร็จสมบูรณ์แล้ว อีกอันคือจุดเริ่มต้น' พร้อมการ์ดขอบมนสองใบที่ระบุว่า 'TwIL-LM3-Pro - ผ่านการฝึกหลังและผสานแล้ว' และ 'LFM2.5 2.6B Base - เช็กพอยต์ที่ผ่านการฝึกมาก่อน' โลโก้ OrcaRouter ถูกประกอบไว้ที่มุมขวาล่าง
Guides & Insights

TwIL-LM3-Pro กับ LFM2.5 2.6B Base: ตัวหนึ่งเสร็จสมบูรณ์แล้ว อีกตัวหนึ่งเป็นจุดเริ่มต้น

ผู้เขียน

Magnus Corvin

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

สิ่งที่เปิดเผยมากที่สุดเกี่ยวกับการเปรียบเทียบที่เผยแพร่ระหว่าง TwIL-LM3-Pro และ LFM2.5 2.6B Base คือ webAI ไม่ได้เผยแพร่การเปรียบเทียบกับรุ่น 2.6B เลย ตาราง Track A และ Track B ของ webAI นำผู้เชี่ยวชาญด้านตรรกะเชิงรูปแบบขนาด 3.66B ของตนไปเทียบกับคู่ต่อสู้หลายราย — Granite base ของตัวเอง, VibeThinker-3B, Qwen3-8B, Qwen3.5-4B, Llama-3.2-3B, gpt-oss-120b — และรายการ Liquid AI ที่พวกเขาเลือกคือ LFM2.5-8B-A1B ไม่ใช่ 2.6B ส่วน 2.6B ที่ปรากฏในตารางคือ `LFM2-2.6B` ซึ่งเป็นรุ่นก่อนหน้า เป็นโมเดลที่ต่างกันซึ่งมีรอบการพรีเทรนที่ต่างกัน การละเว้นนั้นไม่ใช่ความผิดพลาด LFM2.5 2.6B Base เป็นเช็กพอยต์ที่ผ่านการพรีเทรนโดยไม่มีการปรับแต่งตามคำสั่ง และเกณฑ์มาตรฐานการทำตามคำสั่งไม่ใช่การทดสอบที่มันถูกสร้างมาเพื่อทำ

ดังนั้นหน้านี้จึงเปรียบเทียบอาร์ติแฟกต์ที่เสร็จสมบูรณ์กับวัตถุดิบ กรอบแบบ Aion — โมเดลหนึ่งมีคะแนนและอีกโมเดลหนึ่งไม่มี — เข้ากันได้ แต่เหตุผลนั้นเฉพาะเจาะจงและน่าสนใจกว่า: ตัวหนึ่งผ่านการฝึกภายหลัง (post-training) และถูกรวมเข้าด้วยกันแล้ว ส่วนอีกตัวหนึ่งจงใจหยุดก่อนการฝึกภายหลัง และเอกสารสองฉบับที่อธิบายทั้งสองสิ่งนี้กำลังตอบคำถามที่แตกต่างกันโดยเจตนา

จำนวนพารามิเตอร์สองค่าที่ไม่ใช่การวัดเดียวกัน

TwIL-LM3-Pro มีพารามิเตอร์ 3.66B เป็นแบบ dense และทุกตัวทำงานในทุกโทเคน มันสืบทอดมาจาก `ibm-granite/granite-4.2-3b` ผ่านการ fine-tuning ด้วย LoRA, การกลั่นแบบหลายเส้นทาง, การฟิวชันเช็กพอยต์, การ merge ด้วย WiSE-FT กลับเข้าหาโมเดลฐาน และขั้นตอน GRPO ที่ถ่วงน้ำหนักด้วยเอนโทรปี — และอาร์ติแฟกต์ที่ webAI ส่งมอบคือพอลิซีที่ merge แล้ว ไม่ใช่ LoRA adapter ดังนั้นจึงรันแบบ standalone ได้

LFM2.5 2.6B Base มีพารามิเตอร์ 2.69B ตัวใน 30 เลเยอร์: 22 บล็อก short-convolution แบบ double-gated สลับกับ 8 เลเยอร์ grouped-query-attention การออกแบบไฮบริด conv/attention นี้เป็นสถาปัตยกรรม on-device ของ Liquid และนั่นคือเหตุผลที่ตัวเลข throughput ของตระกูลนี้เป็นอย่างที่มันเป็น แทนที่จะเป็นฟังก์ชันของจำนวนพารามิเตอร์เพียงอย่างเดียว มันถูกฝึกด้วยโทเค็น 34 ล้านล้านโทเค็นด้วยคำศัพท์ 128,000 โทเค็น และมีหน้าต่างบริบท 131,072 โทเค็น

จำนวนทั้งสองอยู่ห่างกันประมาณ 36% และได้มาจากสถาปัตยกรรมที่แตกต่างกันโดยสิ้นเชิง ดังนั้นไม่ว่า "3.66B ชนะ 2.69B" หรือในทางกลับกัน ก็ไม่มีความหมายในฐานะข้ออ้างเรื่องคุณภาพ การ์ดโมเดลของ webAI เองก็ชี้ให้เห็นประเด็นนี้ทางอ้อมเมื่อมันปฏิเสธที่จะเปรียบเทียบ perplexity ของคลังข้อความข้ามโทเคนไนเซอร์ — คำศัพท์ของ TwIL-LM3-Pro คือ 100,352 ของ LFM2.5-2.6B คือ 128,000 และ perplexity คิดต่อโทเคน

สิ่งที่ “Base” ลบออก และทำไมมันถึงเปลี่ยนสกอร์บอร์ด

Liquid AI เปิดตัว LFM2.5 2.6B ในสองรูปแบบ: เช็กพอยต์ที่ผ่านการฝึกภายหลัง (post-trained checkpoint) ซึ่งปรับแต่งมาสำหรับงานที่ขับเคลื่อนด้วยเอเจนต์ในฮาร์เนสเอเจนต์ยอดนิยม และ Base ซึ่งอธิบายไว้ในคาร์ดของตัวเองว่า "เช็กพอยต์ข้อความล้วนที่ผ่านการฝึกก่อน ซึ่งใช้สร้างตัวแปรทั้งหมดของ LFM2.5-2.6B" Base คืออินพุตสำหรับการปรับละเอียด ไม่ใช่ผลิตภัณฑ์ มันไม่มีการปรับแต่งตามคำสั่ง ไม่มีเทมเพลตแชทที่เรียกได้เต็มปาก และไม่มีการประเมินที่เผยแพร่ — เพราะการประเมินโมเดลฐานบนงานที่ต้องปฏิบัติตามคำสั่งนั้นวัดสิ่งที่ผิด

จุดยืนของ TwIL-LM3-Pro ตรงกันข้าม คุณค่าทั้งหมดของมันอยู่ที่สแต็กการฝึกหลังการฝึก (post-training stack): webAI รายงานว่าบนฮาร์เนสของตัวเอง ไปป์ไลน์นี้ยกระดับเกตมาโครในโดเมนจาก 0.4313 ของโมเดลฐานเป็น 0.5539 โดยที่ค่ามาโครจาก 10 ชุดข้อมูลที่กันไว้ (held-out) ยังทรงตัว (0.7942 เป็น 0.7901) แทนที่จะทรุดตัวลง การรักษาสมรรถนะบนชุดที่กันไว้ (held-out retention) คือส่วนที่ยากของการฝึกหลังการฝึกสำหรับผู้เชี่ยวชาญ และเป็นส่วนที่ Base ตอบไม่ได้

นี่ก็เป็นจุดที่การเปรียบเทียบขนาดในตารางของ webAI คุ้มค่าเช่นกัน มีรายงานว่า TwIL-LM3-Pro นำหน้า LFM2.5-8B-A1B ในค่า held-out macro ทั้งสอง — 0.7901 เทียบกับ 0.7884 บนชุดข้อมูลสิบชุด, 0.7425 เทียบกับ 0.7378 บนชุดข้อมูลสิบสี่ชุด — ด้วยจำนวนพารามิเตอร์ที่น้อยกว่าครึ่งหนึ่งของโมเดล MoE นั้น นั่นเป็นผลลัพธ์แบบ like-for-like ที่แท้จริง และผลลัพธ์นี้มีให้ใช้ได้ก็เพราะ LFM2.5-8B-A1B เป็นโมเดลที่ผ่าน post-training ซึ่งสามารถรันผ่าน instruction harness ได้ ส่วน Base ทำไม่ได้ ซึ่งเป็นเหตุผลว่าทำไม 2.6B จึงไม่เคยได้คอลัมน์

มิติที่คุ้มค่าต่อการจัดให้สอดคล้องกัน

• พารามิเตอร์ — TwIL-LM3-Pro 3.66B แบบ dense เทียบกับ LFM2.5 2.6B Base 2.69B (30 เลเยอร์: 22 conv + 8 GQA)

• Post-training — LoRA SFT, ดิสทิลเลชัน, การรวม WiSE-FT และ GRPO ที่สเต็ป 2580 เทียบกับไม่ใช้เลย; Base เป็นเอาต์พุตของพรีเทรนนิงโดยการออกแบบ

• หน้าต่างบริบท — 131,072 โทเค็นทั้งคู่ สืบทอดมาจากโมเดลฐานของแต่ละตัว

• คำศัพท์ — 100,352 โทเคน เทียบกับ 128,000 ซึ่งเป็นเหตุผลว่าทำไมค่า perplexity ของทั้งสองจึงไม่สามารถเปรียบเทียบกันได้

• ภาษา — อังกฤษเท่านั้น กับ สิบเจ็ดภาษา รวมถึงอาหรับ จีน ญี่ปุ่น เกาหลี สเปน และไทย

• รูปแบบการคิด — TwIL-LM3-Pro ปล่อยบล็อก `<think>` โดยค่าเริ่มต้นและให้เหตุผลอย่างยาว (เฉลี่ย 1,902 โทเคนในโดเมน, 24.2% ของการสร้างชนเพดานความยาว) เทียบกับเช็กพอยต์พื้นฐานที่ไม่มีรูปแบบคำสั่งใด ๆ เลย

• สัญญาอนุญาต — webAI Non-Commercial License ver. 1.0 เทียบกับ Liquid's LFM Open License v1.0

• จุดประสงค์ของมันคืออะไร — เอนด์พอยต์การอนุมานตรรกศาสตร์เชิงรูปแบบ เทียบกับจุดเริ่มต้นสำหรับการไฟน์ทูน

บรรทัดบริบทเหล่านั้นสมควรมีเชิงอรรถที่ทั้งสองโมเดลให้ไว้: แต่ละตัวส่งผ่าน 131,072 โทเคนตั้งแต่การฝึกก่อน และผู้ขายทั้งสองรายไม่ได้ตรวจสอบพฤติกรรมบริบทแบบยาว — การ์ดของ TwIL-LM3-Pro ระบุว่าคะแนนที่เผยแพร่ทุกค่าถูกวัดภายในหน้าต่างขนาด 8,192 โทเคน ตัวเลขที่ตรงกันตรงนี้เป็นค่าที่สืบทอดมา ไม่ใช่ค่าที่พิสูจน์ให้เห็น

ใบอนุญาต และแต่ละใบมีไว้สำหรับอะไรตามกฎหมาย

webAI Non-Commercial License ของ TwIL-LM3-Pro อนุญาตให้ใช้เพื่อการวิจัยและการใช้งานส่วนบุคคล และกำหนดให้ต้องมีข้อตกลงแยกต่างหากกับ webAI สำหรับการนำไปใช้งานที่สร้างรายได้ LFM2.5 2.6B Base เผยแพร่ภายใต้ LFM Open License v1.0 ของ Liquid เอง ซึ่ง Hugging Face API รายงานว่าเป็น `license: other` แทนที่จะเป็นตัวระบุ SPDX มาตรฐาน — โปรดอ่านไฟล์สัญญาอนุญาตก่อนวางแผนโดยอิงจากสิ่งนี้ เพราะข้อกำหนดเป็นของ Liquid เอง ไม่ใช่เทมเพลตที่ได้รับการยอมรับ

สัญญาอนุญาตทั้งสองฉบับไม่ใช่ Apache 2.0 และการถือว่า “open weights” เป็นคำพ้องความหมายของ “commercially permissive” นั้นเป็นความผิดพลาด ความแตกต่างในทางปฏิบัติระหว่างสองฉบับอยู่ที่สิ่งที่สัญญาอนุญาตเหล่านี้กำลังคุ้มครอง: นักวิจัยที่ไม่ใช้เชิงพาณิชย์สามารถใช้ได้ทั้งสองฉบับ บริษัทที่สร้างผลิตภัณฑ์จำเป็นต้องตรวจสอบทั้งสองฉบับ และจุดประสงค์ทั้งหมดของ Base — การถูก fine-tune ให้กลายเป็นผลิตภัณฑ์ของคนอื่น — ทำให้ข้อกำหนดที่แน่ชัดของมันมีความสำคัญมากกว่าที่เห็น

ตำแหน่งที่แต่ละรายการอยู่ภายในสแต็ก

Base เป็นตัวเลือกที่ถูกต้องเมื่อคุณตั้งใจจะฝึก หากปัญหาของคุณคืองานติดป้ายกำกับแบบแคบ ๆ หัวจำแนกประเภทเฉพาะโดเมน หรือการไฟน์จูนบนตัวอย่างที่มีป้ายกำกับเพียงไม่กี่พันตัวอย่าง การเริ่มจากเช็กพอยต์ที่ผ่านการฝึกมาแล้วขนาด 2.69B ซึ่งมีคำศัพท์หลายภาษาที่กว้างขวางและสถาปัตยกรรมคอนโวลูชันแบบไฮบริดที่ออกแบบมาเพื่อทรูพุต ถือเป็นการตัดสินใจเชิงวิศวกรรมที่สมเหตุสมผล และค่าใช้จ่ายของการฝึกภายหลังการฝึกที่คุณจะข้ามไป ก็คือค่าใช้จ่ายที่คุณจงใจจ่ายแทนนั่นเอง

TwIL-LM3-Pro เป็นตัวเลือกที่เหมาะสมเมื่อคุณไม่ได้ตั้งใจจะเทรน และงานนั้นเป็นตรรกะเชิงรูปแบบอยู่แล้ว ป้ายกำกับ entailment, การทำให้ข้อความ Lean อยู่ในรูปแบบทางการ, การแยกวิเคราะห์เชิงความหมาย และการวิจารณ์การพิสูจน์ ล้วนเป็นงานที่ไปป์ไลน์ทั้งหมดของมันมุ่งเป้าไว้ และการเริ่มจากเช็กพอยต์ที่ผ่านขั้นตอนการรวมและการเสริมกำลังมาแล้ว ช่วยให้คุณประหยัดส่วนหนึ่งของเรื่องนี้ที่ยากจะทำซ้ำได้จริง ๆ — การรักษาระดับของชุดทดสอบ held-out ไว้ให้คงที่ในขณะที่ได้ประสิทธิภาพในโดเมนเพิ่มขึ้น

ความผิดพลาดคือการตีความว่า "3.66B post-trained specialist" ดีกว่า "2.69B base checkpoint" อย่างเด็ดขาด ทั้งสองอยู่ในขั้นตอนที่แตกต่างกันของสายการผลิตเดียวกัน

ให้บริการแก่พวกเขา หรือให้บริการรอบ ๆ พวกเขา

ทั้งสองโมเดลไม่ใช่เส้นทางในแคตตาล็อกของ OrcaRouter ในวันนี้ และเหตุผลก็แตกต่างกันไปในแต่ละโมเดล TwIL-LM3-Pro มีสัญญาอนุญาตแบบไม่ใช่เชิงพาณิชย์และไม่มีเอนด์พอยต์ที่โฮสต์ไว้ให้บริการ ส่วน LFM2.5 2.6B Base เป็นอาร์ติแฟกต์สำหรับการปรับแต่งละเอียด (fine-tuning) ที่ไม่มีใครตั้งใจจะให้บริการเป็นเอนด์พอยต์สำหรับการอนุมาน จุดที่เราเตอร์พิสูจน์คุณค่าของตัวเองได้คือชั้นที่สูงขึ้นไปหนึ่งชั้น ในงานที่อยู่รอบ ๆ ผู้เชี่ยวชาญเฉพาะทาง ไม่ว่าจะเป็นการสร้างและกรองข้อมูลฝึกที่คุณจะใช้ปรับแต่งละเอียด Base การขยายพรอมป์ต์ที่คุณจะป้อนให้โมเดลตรรกะเชิงรูปแบบ และการให้คะแนนผลลัพธ์ สิ่งเหล่านี้คือการเรียกข้อความ และรันผ่าน เอนด์พอยต์เดียวที่เข้ากันได้กับ OpenAI เทียบกับโมเดลกว่า 200 รุ่น ในราคาตามที่ผู้ให้บริการประกาศ โดยบวกเพิ่ม 0% ดังนั้นเมื่อผู้ให้บริการลดราคา คุณก็ได้ราคานั้นในวันเดียวกัน และการสลับจากโมเดลสำหรับสร้างข้อมูลรุ่นหนึ่งไปยังอีกรุ่นหนึ่งก็เป็นเพียงการแก้ไขคอนฟิก ไม่ใช่การต้องไปสร้างความสัมพันธ์กับผู้ขายอีกราย

การสลับไปใช้ระบบสำรองอัตโนมัติสำคัญกว่าปกติในไปป์ไลน์การปรับแต่งละเอียด เพราะงานแบบแบตช์ที่ล้มเหลวที่ 80% ทำให้การรันทั้งหมดเสียเปล่า การใช้คีย์เดียวกับโมเดลสำหรับสร้างทั้งหมด โดยมีระบบสำรองที่ส่งคำขอซ้ำเมื่อผู้ให้บริการเกิดข้อผิดพลาด เป็นชิ้นส่วนโครงสร้างพื้นฐานที่เล็กกว่าการเชื่อมต่อ API สามรายการ

A generated two-column scoreboard headed 'TwIL-LM3-Pro vs LFM2.5 2.6B Base - the scoreboard' with six shared dimension rows. TwIL-LM3-Pro: Parameters 3.66B dense; Post-training SFT, merge, GRPO; Context 131,072 tokens; Vocabulary 100,352; Languages English; Licence non-commercial. LFM2.5 2.6B Base: Parameters 2.69B (30 layers); Post-training none by design; Context 131,072 tokens; Vocabulary 128,000; Languages 17; Licence LFM Open License v1.0. A footer line reads 'Both vendor-reported; neither model has a third-party evaluation.' The OrcaRouter logo is composited in the bottom-right corner.

อันไหน ขึ้นอยู่กับเจตนาของคุณ

หากคุณกำลังเทรน ให้ใช้ Base หากคุณกำลังทำ inference กับตรรกศาสตร์เชิงรูปแบบ และใบอนุญาตให้คุณใช้งานได้ ให้ใช้ TwIL-LM3-Pro หากคุณต้องการโมเดลขนาดเล็กที่ปฏิบัติตามคำสั่งได้ในวันนี้ และไม่มีข้อจำกัดใดในสองข้อนั้นเหมาะกับคุณ ให้ใช้โมเดลพี่น้องที่ผ่าน post-training ของ LFM2.5 2.6B — โมเดลที่ Liquid เผยแพร่จริงเพื่อจุดประสงค์นั้น — และเก็บ Base ไว้สำหรับการ fine-tuning ที่คุณวางแผนไว้อยู่แล้ว

A screenshot of the Hugging Face model card for LiquidAI/LFM2.5-2.6B-Base, showing the Liquid AI author line, the 16-languages tag, the LFM2 and liquid tags, and the card's opening description of LFM2.5 as a family of hybrid models designed for on-device deployment, built on the LFM2 architecture with extended pre-training and reinforcement learning.A screenshot of the Hugging Face model card for LiquidAI/LFM2.5-2.6B, the post-trained sibling, showing the 16-languages and LFM2 tags and the card's description of LFM2.5-2.6B as part of the LFM2.5 family with a 128K context window and agentic post-training.
© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube