
Liquid AI d1-3B กับ Qwen 3 8B: งาน Classification ขนาด 8B ควรย้ายไปใช้ Decision Model หรือไม่?
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIOpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- AnthropicAnthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIGrok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 60 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 356 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
ในสแต็กการผลิตส่วนใหญ่ ตรงใดที่หนึ่งมักมี Qwen 3 8B ที่ถูกจ้างให้ตอบว่าใช่หรือไม่ใช่ มันทำหน้าที่กลั่นกรองความคิดเห็น ติดแท็กตั๋วสนับสนุน ตัดสินว่าข้อความที่ดึงมานั้นเกี่ยวข้องหรือไม่ หรือให้คะแนนเอาต์พุตของโมเดลอื่นเทียบกับเกณฑ์ rubric — และมันทำเช่นนั้นด้วยการสร้างข้อความซึ่งมีบางสิ่งในลำดับถัดไปคอยแยกวิเคราะห์ Liquid AI d1-3B โมเดลตัดสินใจขนาด 3.12B พารามิเตอร์ที่ Liquid AI เปิดน้ำหนักให้ใช้งานเมื่อวันที่ 7 ตุลาคม 2026 ถูกสร้างขึ้นมาเพื่อทำงานนั้นโดยเฉพาะ โดยไม่ต้องสร้างอะไรเลย: ป้อนสถานะเข้าไป ป้อนชุดคำถามที่มีชื่อกำกับเข้าไป แล้วได้ความน่าจะเป็น ป้ายกำกับ และค่าความเชื่อมั่นออกมาในการส่งต่อเพียงครั้งเดียว โดยไม่มีโทเค็นเอาต์พุตเลย Qwen 3 8B คือม้าใช้งานแบบเปิดน้ำหนักของเจ้าของโมเดลที่ออกเมื่อเดือนเมษายน 2025 — พารามิเตอร์แบบ dense ราว 8.2B รองรับ 119 ภาษา เปิดหรือปิดโหมดคิดตามแต่ละคำขอ และมีประวัติการนำไปติดตั้งในชุมชนมายาวสิบหกเดือน คำถามที่การจับคู่นี้ถามจริง ๆ นั้นแคบและใช้งานได้จริง: สำหรับช่วงของทราฟฟิกของคุณที่เป็นงานจำแนกประเภท การใช้โมเดลอเนกประสงค์ขนาด 8B เป็นวิธีที่ประหยัดที่สุดในการได้ป้ายกำกับในปี 2026 หรือรูปร่างของงานนั้นเปลี่ยนไปแล้ว beneath it?
สิ่งที่คุณกำลังจ่ายให้ 8B ทำจริง ๆ
เมื่อวางสัญญาเอาต์พุตทั้งสองฉบับไว้เคียงข้างกัน ความไร้ประสิทธิภาพที่เห็นก็เป็นเชิงโครงสร้าง ไม่ใช่แค่เชิงส่วนเพิ่ม
การเรียกจำแนกประเภทของ Qwen 3 8B ถือเป็นการสร้างหนึ่งครั้ง คุณเขียนพรอมป์ต์ที่อธิบายป้ายกำกับ โมเดลอาจให้เหตุผลเกี่ยวกับอินพุต — และบนโมเดลนี้คุณสามารถเปิดหรือปิดการใช้เหตุผลนั้นต่อคำขอ ซึ่งเป็นปุ่มปรับที่มีประโยชน์ที่สุดเพียงหนึ่งเดียวสำหรับงานประเภทนี้ — จากนั้นมันจะเขียนคำตอบกลับมา คำตอบนั้นคือข้อความ หากคุณขอ JSON คุณมักจะได้ JSON และบางครั้งคุณจะได้ JSON ที่อยู่ในประโยค หรือคำนำ หรือคำอธิบายต่อท้ายที่คุณไม่ต้องการ ป้ายกำกับที่คุณสนใจอยู่ที่ใดที่หนึ่งในสตรีมโทเค็น และตัวแยกวิเคราะห์จะดึงมันออกมา คุณจะถูกคิดค่าบริการสำหรับทุกโทเค็นที่โมเดลเขียน รวมถึงโทเค็นที่คุณทิ้งไป
Liquid AI d1-3B ไม่มีโทเค็นสตรีม คำถามถูกประกาศด้วยประเภท: noul สำหรับใช่/ไม่ใช่ ตอบเป็น P(yes) ระหว่าง 0 ถึง 1; choice สำหรับหนึ่งเลเบลจากชุดตัวเลือกที่มีชื่อ ตอบเป็นเลเบลบวกค่าความมั่นใจบวกความน่าจะเป็นต่อตัวเลือก; score สำหรับตำแหน่งบนสเกลสองถึงสิบแบบเรียงลำดับ ตอบเป็นระดับที่คาดหวังพร้อมการแจกแจงและคำอธิบายสัญลักษณ์ การตอบสนองมีผลรวมสะสมที่อ่านว่า output_tokens: 0. ไม่มีอะไรต้องแยกวิเคราะห์เพราะไม่มีอะไรถูกเขียน และมี probabilities แอคเซสเซอร์เมื่อคุณต้องการการแจกแจงแบบไม่ปัดเศษแทนที่จะเป็น argmax.
ส่วนที่ทำให้บิลของคุณเปลี่ยนไปคือสิ่งที่เกิดขึ้นเมื่อมีหลายคำถาม state หนึ่งตัวรองรับได้หลายคำถาม: นี่เป็นคำขอคืนเงินหรือไม่ ทีมไหนควรเป็นเจ้าของเรื่องนี้ เร่งด่วนแค่ไหน state และรูปภาพของมันถูกอ่านเพียงครั้งเดียว และ Liquid รายงานว่าคำถามสามข้อบน state เดียวใช้เวลา 1.3 เท่าของคำถามเดียว ไม่ใช่ 3 เท่า สิ่งที่มันไม่ได้ยุบรวมคือค่าใช้จ่ายอินพุต — บันทึกการเรียกเก็บเงินของผู้ให้บริการระบุชัดเจนว่าแต่ละคำถามถูกคิดเงินเป็นพรอมป์ต์ของตัวเอง รวมถึงข้อความและรูปภาพทั้งหมดของคำถามนั้น ความหน่วงน้อยลง แต่จำนวนโทเคนอินพุตเท่าเดิม นั่นคือเครื่องหมายดอกจันที่ซื่อตรงบนพาดหัว และเป็นเรื่องแบบที่คุณจะรู้ได้ก็ต่อเมื่ออ่านย่อหน้าเรื่องราคา ไม่ใช่จากเบนช์มาร์ก

สิบหกเดือนของ Qwen 3 8B ให้อะไรคุณได้บ้าง
ก่อนจะมองว่าโมเดลที่เล็กกว่าเป็นการอัปเกรด ควรระบุให้ชัดเจนว่าโมเดลเดิมนำอะไรมาให้ เพราะมันมากกว่าจำนวนพารามิเตอร์
• บริบท — Qwen 3 8B ทำงานที่ 32,768 โทเคนได้โดยกำเนิด และขยายได้ถึง 131,072 ซึ่งผ่านการตรวจสอบยืนยันด้วย YaRN ส่วน Liquid AI d1-3B ทำงานที่ 32,768 โทเคนแบบคงที่ โดยไม่มีเส้นทางการขยายที่มีการบันทึกไว้ สำหรับสถานะที่เป็นเอกสารยาว 8B เป็นรุ่นเดียวในสองรุ่นนี้ที่สามารถรองรับได้
• ภาษา — 119 ภาษาและภาษาถิ่นสำหรับ Qwen 3 8B เทียบกับ 16 ภาษาที่มีเอกสารระบุสำหรับ Liquid AI d1-3B
• การควบคุมการให้เหตุผล — Qwen 3 8B ให้คุณเปิดหรือปิดการคิดได้ตามแต่ละคำขอ ส่วน Liquid AI d1-3B ไม่มีโหมดการให้เหตุผลให้ควบคุม ซึ่งอาจเป็นการทำให้ง่ายขึ้นหรือเป็นข้อจำกัด ขึ้นอยู่กับว่าคุณใช้การคิดนั้นเพื่ออะไร
• ความกว้าง — 8B เขียน อธิบาย สรุป แปล และเขียนโค้ด ส่วน Liquid AI d1-3B ไม่ทำสิ่งเหล่านั้นเลย การ์ดของมันระบุไว้ตรง ๆ ว่า มันไม่ใช่โมเดลแชท และมันไม่เขียนข้อความ
• หลักฐาน — Qwen 3 8B มีประวัติการทดสอบมาตรฐานสาธารณะ การควอนไทเซชัน การปรับละเอียด และการใช้งานจริงในโปรดักชันมานานสิบหกเดือน คะแนน Decision Index 48.57 ของ Liquid AI d1-3B ถูกสร้างโดย Liquid ด้วยตัวให้คะแนนอย่างเป็นทางการ แทนที่จะถูกส่งเข้าสู่ลีดเดอร์บอร์ดสาธารณะ และคะแนนนี้มีอายุเพียงไม่กี่วันโดยยังไม่มีการทำซ้ำจากบุคคลที่สาม
• Vision — แถวนี้ไปในทางตรงกันข้าม Liquid AI d1-3B รับภาพ โดยผู้ขายรายงาน 74.1 จากเกณฑ์มาตรฐานภาพสาธารณะ 11 รายการ ซึ่งตีความเป็นผลการตัดสินใจต่อชุดตัวเลือกของแต่ละเกณฑ์มาตรฐาน และรายงานว่าการตัดภาพออกทำให้คำถามเดียวกันลดลงเหลือ 45.1 Qwen 3 8B แบบข้อความล้วนจำเป็นต้องมีโมเดลวิชันแยกต่างหากวางไว้ข้างหน้าเพื่อทำสิ่งเหล่านั้น
• ความเร็ว — หนึ่งคำถามใน 8 มิลลิวินาทีบน RTX 4090, 16 มิลลิวินาทีบน Jetson AGX Thor, 50 มิลลิวินาทีบน Jetson Orin Nano และ 64 สถานะที่แพ็กไว้ต่อรอบ ที่ 475 รอบต่อวินาทีบน 4090 ตัวจำแนกประเภทที่อิงการสร้างไม่มีตัวเลขที่เทียบเคียงได้ เพราะความหน่วงของมันขึ้นอยู่กับว่าคำตอบยาวแค่ไหน
สรุปตามตรงก็คือ 8B เป็นเครื่องมือทั่วไปที่ดีกว่า และโมเดลตัดสินใจ 3B เป็นแบบเฉพาะทางที่ดีกว่า และคำถามเดียวที่สำคัญคือปริมาณทราฟฟิกของคุณที่เป็นกรณีเฉพาะทางมีมากแค่ไหน
การคำนวณต้นทุนอย่างรอบคอบ
นี่คือจุดที่การเปรียบเทียบจะคุ้มค่ากับสิ่งที่ลงทุนลงไปหรือไม่ ดังนั้นจึงคุ้มค่าที่จะทำอย่างมีโครงสร้างจริง ๆ มากกว่าจะเป็นเพียงสโลแกน
คำกล่าวอ้างที่ Liquid เผยแพร่สองวันก่อนการเปิดตัวโมเดลแบบเปิดน้ำหนักคือโมเดลการตัดสินใจแบบโฮสต์ของบริษัทเทียบเท่าหรือเอาชนะ GPT-6.1 Sol ได้ในสี่จากหกแอปพลิเคชันจริง ด้วยต้นทุนที่ต่ำกว่า 19x ถึง 200x และตอบได้เร็วกว่าในทุกงาน อ่านระเบียบวิธีก่อนจะกล่าวซ้ำ: แต่ละแอปพลิเคชันรันหนึ่งครั้งต่อโมเดลเมื่อวันที่ 5 ตุลาคม 2026 โมเดลแชตตอบเป็น JSON ที่การตั้งค่าการให้เหตุผลเริ่มต้นของตน และต้นทุนของ d1 คำนวณที่ $0.04 ต่อล้านโทเค็นอินพุต ตัวเลข $0.04 นั้นคืออัตราอินพุตแบบโฮสต์ของ d1 และมันเป็นอัตราเดียวที่มีอยู่ — ไม่มีบรรทัดเอาต์พุตให้เพิ่ม
ตอนนี้สร้างรูปแบบการประเมินแบบเดียวกันสำหรับตัวจำแนก Qwen 3 8B แล้วความไม่สมมาตรก็มองเห็นได้โดยไม่ต้องอ้างราคาของผู้ให้บริการรายใด ส่วน 8B มีสองรายการที่คิดค่าใช้จ่าย ขณะที่โมเดลตัดสินใจมีเพียงรายการเดียว และรายการที่สองคือรายการที่เติบโตขึ้น: การจำแนกที่คิดเหตุผลก่อนจะจ่ายค่าการคิดเหตุผล และการจำแนกที่เติม JSON ให้ยาวเกินจำเป็นจะจ่ายค่าส่วนที่เติมเข้าไปนั้น ค่าใช้จ่ายฝั่งอินพุตของโมเดลตัดสินใจถูกกำหนดตายตัวจากสถานะและคำถาม ส่วนของ 8B ไม่ได้ถูกกำหนดตายตัวจากสิ่งใดที่คุณคาดเดาได้จากสถานะเพียงอย่างเดียว
ตัวถ่วงดุลสองประการช่วยไม่ให้เรื่องนี้กลายเป็นความพ่ายแพ้อย่างราบคาบ อย่างแรก โมเดลสำหรับการตัดสินใจคิดค่าถามแต่ละข้อเป็นพรอมป์ต์ของตัวเอง ดังนั้นการถามห้าคำถามเกี่ยวกับเอกสารยาวหนึ่งฉบับจึงทำให้อินพุตเพิ่มเป็นห้าเท่า — ตัว 8B ถามทั้งห้าในครั้งเดียวและจ่ายค่าเอกสารเพียงครั้งเดียว อย่างที่สอง และสำคัญกว่า โมเดลสำหรับการตัดสินใจตอบได้เฉพาะคำถามที่มันถูกฝึกภายหลังให้ตอบในรูปแบบนั้นเท่านั้น อะไรก็ตามที่ต้องใช้อธิบาย สรุป หรือการตัดสินที่แสดงออกเป็นคำพูด จะทำให้คุณกลับไปใช้โมเดลอเนกประสงค์ และในทางปฏิบัติ ก็กลับไปจ่ายทั้งสองแบบ

สิ่งที่ทั้งสองเก่งจริง ๆ
ถ้าตัดการ benchmark ออกไป การแบ่งแยกจะชัดเจนกว่าที่จำนวนพารามิเตอร์บ่งชี้
Liquid AI d1-3B เหมาะสำหรับงานใช่/ไม่ การเลือกจากรายการ และการให้คะแนน ที่ระดับความหน่วงต่ำสุดซึ่งไม่มีโมเดลเจเนอเรทีฟใดเข้าถึงได้ บนฮาร์ดแวร์ที่รวมถึง Jetson Orin Nano ที่ 50 มิลลิวินาที และแล็ปท็อป แอปพลิเคชันที่ Liquid สาธิตในเดือนตุลาคมล้วนเป็นรูปแบบดังกล่าว — เพรดิเคต SQL ที่ตอบใช่หรือไม่สำหรับตั๋วสนับสนุน 150 ใบ, ลูปการบีบอัดบริบทของเอเจนต์ที่เก็บ ตัด หรือทิ้งเอาต์พุตของเครื่องมือแต่ละรายการ และลดโทเค็นลง 52%, แอปตรวจสอบที่คัดแยกชิ้นส่วนดีและชำรุดจากสายการผลิตสี่สายด้วยความแม่นยำ 85 ถึง 97% ในงานที่มันไม่เคยได้รับการฝึกและเข้าใจจากคำอธิบายสั้น ๆ เดโมสุดท้ายนั้นเป็นข้อความที่ชัดเจนที่สุดว่าหมวดหมู่นี้มีไว้เพื่ออะไร: งานที่คำตอบเป็นหนึ่งในไม่กี่อย่าง สถานะเป็นภาพ และไม่เคยมีการร้องขอคำอธิบาย
Qwen 3 8B เหมาะสำหรับงานที่ต้องได้ผลลัพธ์กลับมาเป็นภาษา หรือครอบคลุม 119 ภาษา หรือรองรับเอกสารที่ยาวเกินสามหมื่นสองพันโทเคน หรือใช้เหตุผลแบบคิดออกเสียงก่อนตัดสินใจ นอกจากนี้ยังเป็นคำตอบที่ถูกต้องเมื่อการจำแนกประเภทไม่ใช่หนึ่งในสามรูปแบบข้างต้น — เมื่อชุดป้ายกำกับเป็นแบบปลายเปิด เมื่อเกณฑ์มีความละเอียดอ่อนพอที่คุณต้องการกระบวนการคิด เมื่อการเรียกใช้เดียวกันต้องจัดการทั้งกรณีง่ายและกรณียากโดยที่คุณไม่ต้องจัดเส้นทางระหว่างสองโมเดล และเป็นตัวเลือกที่ปลอดภัยเมื่อผู้ตรวจสอบถามว่ามีเบนช์มาร์กอิสระอะไรบ้าง เพราะคำตอบคือ มีเยอะมาก ย้อนหลังไปหนึ่งปีครึ่ง
ทีมที่ทำสิ่งนี้ได้ถูกต้องจะไม่เลือก พวกเขาวางโมเดลการตัดสินใจไว้ข้างหน้าโมเดลทั่วไป บนส่วนของทราฟฟิกที่คำตอบเป็นตัวเลข และปล่อยให้ 8B จัดการทุกอย่างที่ต้องใช้ประโยค ตัวกรองคือ 3B และ 8 มิลลิวินาที; 8B ยังคงอยู่สำหรับเพย์โหลด
กำลังปรับใช้คู่
Liquid AI d1-3B มาในรูปแบบเวทพร้อมงานด้านการดีพลอยที่ทำเสร็จไว้ให้แล้ว: การรองรับ llama.cpp ตั้งแต่วันแรก สแตก NVIDIA แบบครบชุดตั้งแต่ DGX ลงไปจนถึง Jetson การควอนไทซ์ NVFP4 ตัวแปรแบบ 8 บิตทั้งเวทและแอกติเวชัน และการแปลงเป็น GGUF บน Hugging Face ส่วน Qwen 3 8B มีระบบนิเวศการโฮสต์เองที่ลึกที่สุดในบรรดาโมเดลใด ๆ ในระดับน้ำหนักนี้ ทั้งสองไม่ได้อยู่ในแคตตาล็อกของเรา และไม่มีสิ่งใดในที่นี้เป็นการอ้างว่ามีให้บริการสำหรับทั้งสอง เส้นทางแบบโฮสต์สำหรับ Liquid AI d1-3B คือ API ของผู้พัฒนาเองและแพลตฟอร์มของบุคคลที่สาม โดยที่d1แบบโฮสต์คิดราคาตามโทเคนอินพุตเท่านั้นที่ 0.04 ดอลลาร์ต่อล้านโทเคน โดยรูปภาพคิดค่าบริการที่ 1.5 โทเคนต่อแพตช์ขนาด 32×32 พิกเซล
เมื่อทั้งสองอยู่ในไปป์ไลน์เดียวกัน ปัญหาการจัดเส้นทางก็ไม่ใช่เรื่องทฤษฎีอีกต่อไป คุณมีโมเดลเล็กที่เป็นของคุณเอง มี 8B ที่คุณอาจโฮสต์หรือเช่า และมีการเรียกใช้แบบเจเนอเรทีฟที่คุณเช่าอย่างแน่นอน — และการตัดสินใจต่อคำขอว่าอินพุตหนึ่ง ๆ ควรไปที่ตัวไหน นั่นคือการตัดสินใจที่เลเยอร์จัดเส้นทางมีอยู่เพื่อทำพอดี เอนด์พอยต์เดียวครอบคลุม 200+ โมเดล ราคาตามรายการของผู้ให้บริการถูกส่งผ่านโดยมีมาร์กอัป 0% ดังนั้นการเปลี่ยนแปลงราคาของผู้ขายจึงมีผลฝั่งคุณภายในวันเดียวกัน การสลับไปใช้ระบบสำรองอัตโนมัติ ดังนั้นช่วงเวลาที่แย่ของผู้ให้บริการต้นทางจะไม่กลายเป็นเหตุระบบล่มของคุณ เมื่อทราฟฟิกการจำแนกประเภทของคุณถูกวัดเป็นการเรียกหลายพันล้านครั้งต่อปี เลเยอร์นั้นคือจุดที่เงินประหยัดจากโมเดลตัดสินใจขนาด 3B ถูกเก็บรวบรวมได้จริง
คำตัดสิน
ถ้า 8B ของคุณกำลังถูกถามคำถามปลายปิด — แบบนี้เป็นพิษไหม สิ่งนี้เกี่ยวข้องไหม มันควรอยู่ในคิวไหน เร่งด่วนแค่ไหน — คุณกำลังจ่ายค่าคำตอบสั้น ๆ สองบรรทัดของโมเดลเอนกประสงค์ และความหน่วงของการสร้างคำตอบ เพื่อแลกกับป้ายกำกับหนึ่งป้าย และ Liquid AI d1-3B ก็เป็นตัวแทนที่ใช้แทนได้ตรง ๆ โดยมีร่องรอยหลักฐานที่อ่อนกว่าและมีความแตกต่างด้านสัญญาอนุญาตที่ต้องชั่งน้ำหนักจริง ๆ ยอมรับเพดานบริบท 32K, สิบหกภาษา, และความจริงที่ว่ายังไม่มีใครนอก Liquid ให้คะแนนมันเลย
ถ้า 8B ของคุณถูกขอให้อธิบาย สรุป แปล เก็บเอกสารยาว ๆ หรือใช้เหตุผลก่อนตัดสินใจ การเปรียบเทียบนี้ใช้ไม่ได้กับคุณ เก็บ 8B ไว้ และพิจารณาโมเดลตัดสินใจเพียงเป็นตัวกรองล่วงหน้าสำหรับทราฟฟิกที่คุณระบุล่วงหน้าได้ว่าเป็นประเภทง่ายเท่านั้น
ตัวเลขที่น่าสนใจที่ต้องจับตาดูไม่ใช่คะแนน benchmark ของโมเดลใดเลยจากสองตัวนี้ แต่คือความเร็วที่การทำซ้ำโดยอิสระครั้งแรกของ d1 Decision Index จะเกิดขึ้น เพราะนั่นคือช่วงเวลาที่การเปรียบเทียบเลิกเป็นคำกล่าวอ้างของผู้ขายและเริ่มเป็นข้อเท็จจริงที่คุณใช้เป็นฐานในการวางแผนได้

