
Ling-3.1-flash vs Gemini 3.8 Flash: โมเดลทดลองขนาด 256K กับโมเดลใช้งานจริงขนาด 1M โทเคน
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 219 tok/s
- OpenAIใหม่OpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- Anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIใหม่Grok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 117 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
ลองวาง Ling-3.1-flash กับ Gemini 3.8 Flash ไว้เคียงข้างกัน แล้วความไม่สอดคล้องกันนั้นไม่ใช่เรื่องของความฉลาด — แต่เป็นเรื่องของสถานะ Ling-3.1-flash โมเดลมิกซ์เจอร์ออฟเอ็กซ์เพิร์ตส์ขนาดประมาณ 560B พารามิเตอร์ของ Ant Group ซึ่งประกาศเมื่อวันที่ 29 ถึง 30 กันยายน 2026 เป็นการทดลองใช้ฟรีสองสัปดาห์ ด้วยบริบทที่ให้บริการขนาด 256K เพดานเอาต์พุต 32,768 โทเคน อินพุตแบบข้อความเท่านั้น และไม่มีการเผยแพร่ค่าน้ำหนัก สัญญาอนุญาต หรือราคา ส่วน Gemini 3.8 Flash โมเดลให้เหตุผลระดับ Flash ของ Google ที่เปิดตัวเมื่อวันที่ 2 กันยายน 2026 เป็น API ที่พร้อมใช้งานทั่วไป พร้อมหน้าต่างขนาด 1,048,576 โทเคนเต็มรูปแบบ เอาต์พุต 65,536 โทเคน อินพุตมัลติโมดัล และตารางราคาสาธารณะ ในทางทฤษฎี นั่นคือการเปรียบเทียบโมเดลสองตัว แต่ในทางปฏิบัติ มันคือการเปรียบเทียบระหว่างโมเดลที่คุณสร้างต่อยอดได้ในวันนี้ กับโมเดลที่คุณทดสอบได้เพียงเดือนนี้
นั่นไม่ใช่เหตุผลที่จะปัดตก Ling-3.1-flash โมเดล MoE ขนาด 560B แบบฟรีที่มีความโน้มเอียงเชิงเอเจนต์นั้นคุ้มค่ากับเวลาประเมินสองสัปดาห์ของใครก็ตาม แต่สิ่งนี้เปลี่ยนจุดประสงค์ของการเทียบแบบตัวต่อตัว: ไม่ใช่ "ฉันควรยึดตัวไหนเป็นมาตรฐาน" แต่เป็น "โมเดลทดลองดีพอหรือไม่ที่ฉันควรเผื่อทางไว้กับคำตอบในอีกสิบห้าวันข้างหน้า" นั่นเป็นคำถามที่แตกต่างกัน และคำถามเหล่านั้นมีคำตอบที่แตกต่างกันในทุกแกนด้านล่างนี้
สามสิ่งที่ตัดสินเรื่องนี้ก่อนที่เบนช์มาร์กใด ๆ จะตัดสิน
การเปรียบเทียบส่วนใหญ่เริ่มจากคะแนน แต่อันนี้ควรเริ่มจากความพร้อมใช้งาน เพราะช่องว่างตรงนั้นไม่ใช่เรื่องของระดับ
• ราคา — Ling-3.1-flash ฟรีตลอดระยะเวลาทดลองใช้ และไม่มีตารางราคาหลังช่วงทดลองใช้ที่เผยแพร่เลย Gemini 3.8 Flash ระบุราคาที่ $0.75 ต่อล้านโทเค็นอินพุต และ $3.75 ต่อล้านโทเค็นเอาต์พุตในช่วงโปรโมชัน โดยจะกลับไปเป็น $1.50 / $7.50 ในวันที่ 1 มกราคม 2027 ราคาที่ผู้ขายรายงาน; ทั้งสองอาจมีการเปลี่ยนแปลง
• บริบท — Ling-3.1-flash ให้บริการ 262,144 โทเค็นในเวอร์ชันทดลอง โดยมี 1,000,000 ที่อ้างถึงเป็นเป้าหมายสุดท้าย Gemini 3.8 Flash ให้บริการเต็ม 1,048,576 โทเค็นในวันนี้ หากเวิร์กโหลดของคุณต้องพึ่งพาหน้าต่างหนึ่งล้านโทเค็น มีเพียงหนึ่งในสองตัวนี้เท่านั้นที่มีให้ใช้ในตอนนี้
• น้ำหนักโมเดล — Ling-3.1-flash ไม่มีเผยแพร่เลย: ไม่มีที่เก็บโค้ด ไม่มีสัญญาอนุญาต ไม่มีเช็กพอยต์ มีเพียงเจตนาที่ระบุไว้ว่าจะเปิดซอร์สหลังการทดลองใช้ Gemini 3.8 Flash เป็นแบบปิดและจะเป็นเช่นนี้ตลอดไป แต่เป็น API แบบจัดการที่คุณเรียกใช้ได้อย่างชัดเจนในวันนี้
เมื่ออ่านรวมกัน ทั้งสามข้อนี้ชี้ให้เห็นประเด็นเดียว: ข้อได้เปรียบหลักของโมเดล Ling นั้นเป็นได้ทั้งข้อได้เปรียบเชิงโปรโมชัน (ฟรี) หรือไม่ก็เป็นเพียงศักยภาพในอนาคต (บริบท 1M, น้ำหนักเปิด) ในขณะที่ข้อได้เปรียบของโมเดล Gemini นั้นเป็นไปตามสัญญา ความไม่สมมาตรนี้แทรกอยู่ในทุกสิ่งที่จะตามมา
จุดที่โมเดล Ling ชนะอย่างแท้จริง
สองแห่ง และทั้งสองแห่งก็มีอยู่จริง
ข้อแรกคือค่าใช้จ่ายระหว่างการประเมิน การทดลองใช้ฟรีสองสัปดาห์กับโมเดลขนาดนี้ไม่ใช่กลเม็ดการตลาดที่ปัดทิ้งได้ — มันเป็นวิธีที่ถูกที่สุดในการดูว่า mixture-of-experts ขนาด 560B รับมือกับพรอมป์ของคุณได้หรือไม่ Gemini 3.8 Flash ไม่ว่าราคาจะเป็นเท่าใดก็ไม่ฟรี และการประเมินอย่างจริงจังจากการเรียกใช้หลายพันครั้งก็ต้องใช้เงินจริง
ประการที่สองคือทิศทางความเปิดกว้าง Ling-3.1-flash เป็นรุ่นสืบทอดของโมเดลที่เผยแพร่น้ำหนักภายใต้สัญญาอนุญาต MIT จริง และ Ant ประกาศต่อสาธารณะว่าตั้งใจจะเปิดซอร์สโมเดลนี้เช่นกัน หากมันออกมาพร้อมสัญญาอนุญาตแบบผ่อนปรน คุณจะได้สิ่งที่ Gemini 3.8 Flash ไม่มีทางมอบให้ได้: ตัวเลือกในการโฮสต์เอง ไฟน์จูน หรือดิสทิลโมเดลฐานขนาด 560B แต่ข้อที่ต้องระวังคือประเด็นที่สำคัญที่สุด — คุณกำลังเดิมพันกับคำสัญญา และคำสัญญาของรุ่นก่อนหน้าก็ถูกรักษาไว้โดยล่าช้าสองสัปดาห์ ไม่ใช่การรับประกัน
ที่ Gemini 3.8 Flash ยังห่างไกลจากการแพ้
ถ้าตัดประเด็นการพิจารณาคดีและคำถามเรื่องความเปิดกว้างออกไป การเปรียบเทียบในเชิงปฏิบัติก็เอนเอียงไปทาง Google อย่างเห็นได้ชัด
• อินพุต — Gemini 3.8 Flash รับข้อความ รูปภาพ วิดีโอ ไฟล์ และเสียง ส่วน Ling-3.1-flash รับข้อความและส่งคืนข้อความ สำหรับเวิร์กโฟลว์ด้านเอกสาร ภาพหน้าจอ หรือวิดีโอ นี่ไม่ใช่เรื่องของความชอบ แต่เป็นขอบเขตของความสามารถ
• เพดานเอาต์พุต — 65,536 โทเคน เทียบกับ 32,768 มีความสำคัญทันทีที่คุณสร้างรายงาน ไฟล์โค้ด หรือเอาต์พุตแบบมีโครงสร้างยาว ๆ ในครั้งเดียว
• อัตราการประมวลผล — การทดสอบอิสระพบว่าความเร็วเอาต์พุตมัธยฐานของ Gemini 3.8 Flash อยู่ที่ประมาณ 249 โทเคนต่อวินาที โดยเทเลเมทรีเจ็ดวันของ OrcaRouter เองวัดได้ 552 โทเคนต่อวินาที ที่ p50 เท่ากับ 4.95 วินาทีถึงโทเคนแรก การโฮสต์ทดลองของ Ling-3.1-flash มีรายงานว่าอยู่ที่ประมาณ 63 โทเคนต่อวินาที โมเดล Gemini อยู่ในระดับความเร็วที่ต่างชั้นกันโดยสิ้นเชิง
• ความลึกของข้อมูลอ้างอิง — Gemini 3.8 Flash มีผลการวัดที่เป็นอิสระจำนวนมากรองรับอยู่เบื้องหลัง ขณะที่ตัวเลขของ Ling-3.1-flash ล้วนเป็นข้อมูลจากฝ่ายแรก บนเอนด์พอยต์ใหม่เอี่ยม โดยยังไม่มีบุคคลที่สามมาทดสอบซ้ำ
• เอเจนต์แบบมัลติโมดัล — อะไรก็ตามที่ต้องอ่านสกรีนช็อต ไฟล์ PDF หรือบันทึกการสนทนา ถือเป็นงานของ Gemini โดยโครงสร้าง ไม่ใช่โดยคุณภาพ

เกณฑ์มาตรฐาน และเหตุใดชุดทั้งสองจึงเทียบกันไม่ได้จริง ๆ
กรณีที่ผู้ขายรายงานสำหรับ Ling-3.1-flash คือคะแนนรวม 81.0 จากเบนช์มาร์กเอเจนต์ห้ารายการ โดยได้ 40.4% บน Terminal-Bench 4.0, 55.9% บน SWE-Atlas และ 65.35% บน HealthBench Professional; รายงานของ Ant เองเพิ่ม 1,673 Elo บน GDPVal-AA v2.1 และ 75.16 บน FrontierSWE ทุกตัวเลขเหล่านั้นเป็นการวัดของ Ant เอง ไม่มีการเผยแพร่ฮาร์เนส และที่สำคัญยิ่งกว่านั้น ไม่มีเวตให้นำไปรันชุดทดสอบซ้ำ
ภาพของ Gemini 3.8 Flash แตกต่างโดยเนื้อแท้ บนบิลด์ Intelligence Index ปัจจุบันของ Artificial Analysis (v4.3.2) โมเดลได้คะแนน 40.9 ที่ความพยายามในการใช้เหตุผลระดับสูง 39.8 ที่ระดับกลาง และ 33.5 ที่ระดับต่ำ และเป็นเรื่องที่ควรระบุว่า ดัชนีนี้เพิ่งได้รับการปรับปรุงเมื่อไม่นานมานี้ ดังนั้นตัวเลขที่เผยแพร่เกี่ยวกับโมเดลนี้เมื่อช่วงต้นฤดูใบไม้ร่วงจึงคำนวณบนบิลด์ที่แตกต่างกัน และไม่สามารถเปรียบเทียบโดยตรงกับตัวเลขเหล่านี้ได้ ข้ออ้างของ Google เองสำหรับโมเดลนี้รวมถึงคะแนน 54.9 บน HLE-Verified และผลลัพธ์ Terminal-Bench 2.1 ที่แข็งแกร่งในช่วง 80 ปลาย ๆ ตัวเลขจากฝ่ายอิสระและจากผู้ขาย เมื่อวางเคียงข้างกัน ต่างก็มีความชอบธรรมของตัวเอง แต่ไม่สามารถใช้แทนกันได้
มีการเปรียบเทียบข้ามหนึ่งรายการที่ตรงไปตรงมาและคุ้มค่าที่จะทำ เพราะทั้งสองอยู่ในตระกูลเบนช์มาร์กเดียวกัน บน Terminal-Bench 4.0 ตัวเลขจากผู้ขายของ Ling-3.1-flash อยู่ที่ 40.4% ส่วน Claude Sonnet 5.5 ซึ่งเป็นโมเดลระดับกลาง ไม่ใช่เรือธง ทำคะแนนได้ 70.6% บนเวอร์ชันเดียวกันนั้น แถวข้อมูลแถวเดียวนี้เป็นข้อโต้แย้งที่แข็งแกร่งที่สุดต่อการตีความการ์ดของ Ant ว่า "ใกล้เคียงระดับแนวหน้า": โมเดลนี้แข่งขันได้ดีในมาตรวัดด้านเอเจนต์ที่ Ant เลือกเน้น และตามหลังอย่างชัดเจนในมาตรวัดด้านการเขียนโค้ดบนเทอร์มินัลซึ่งมีตัวเลขจากภายนอกอยู่

รูปร่างเชิงปฏิบัติของทางเลือก
ถ้าคุณต้องสร้างอะไรบางอย่างภายในสองสัปดาห์ข้างหน้า คำตอบไม่ได้ใกล้เคียงกันเลย และนี่ไม่ใช่การตำหนิ Ling-3.1-flash ในสองตัวนี้ Gemini 3.8 Flash เป็นเพียงตัวเดียวที่ให้เอนด์พอยต์ที่เสถียร ราคาที่ประกาศไว้ หน้าต่างบริบทเต็มหนึ่งล้านโทเคน อินพุตแบบมัลติโมดัล และใบอนุญาตที่คุณอ่านได้ มันเป็นโมเดลระดับ Flash สำหรับงานโปรดักชัน
Ling-3.1-flash เป็นเป้าหมายในการประเมิน คุณค่าของมันในตอนนี้คือการประเมินนั้นฟรีและโมเดลนี้น่าสนใจ: MoE ขนาด 560B ที่มีเพียง ~25B active ต่อโทเคนเป็นการเดิมพันกับ sparsity และ Ant วางตำแหน่งมันไว้สำหรับเวิร์กโหลดอย่าง agent, search และ office-automation โดยเฉพาะ ซึ่งเป็นกลุ่มที่โมเดลระดับ Flash แข่งขันกัน การรันพรอมป์ของคุณเองผ่านมันในช่วงทดลองใช้ถือว่าคุ้มค่า เพราะยังไม่มีใครนอก Ant ทำสิ่งนี้มาก่อน — คุณจะอยู่ในกลุ่มแรกที่มีความเห็นแบบไม่ใช่จากผู้ขาย
แผนผังการตัดสินใจที่สมเหตุสมผลในเดือนนี้: ส่งงานโปรดักชันไปที่ Gemini 3.8 Flash, ใช้ช่วงทดลองฟรีในการรัน Ling-3.1-flash กับพรอมป์ที่ยากที่สุดของคุณ และมองคำถามเรื่องโมเดลน้ำหนักเปิดไว้เป็นทางแยกที่แท้จริง หากน้ำหนักโมเดลออกมาแบบเปิดกว้างและราคาลงมาใกล้ระดับ Flash, Ling-3.1-flash จะกลายเป็นตัวเลือกที่สองอย่างแท้จริง — ตัวเลือกที่คุณโฮสต์เองได้ ซึ่ง Gemini ไม่มีวันทำได้ หากมันออกมาพร้อมเงื่อนไขผูกมัด การทดลองก็จบลง และการเปรียบเทียบก็จบลงด้วยเช่นกัน
รันทั้งคู่จากคีย์เดียว และพูดตรง ๆ เกี่ยวกับสิ่งที่ยังขาดอยู่
Gemini 3.8 Flash อยู่ในแคตตาล็อกของ OrcaRouter วันนี้ภายใต้รหัสโมเดล google/gemini-3.8-flash ในราคาตามที่ Google ตั้งไว้เองโดยไม่บวกเพิ่ม — ดังนั้นเมื่อราคาโปรโมชันสิ้นสุดลงในเดือนมกราคม ราคาที่คุณจ่ายที่นี่จะปรับตามโดยอัตโนมัติ ไม่จำเป็นต้องทำสัญญาใหม่ DeepSeek-V4.1-Flash ซึ่งเป็นโมเดลระดับ Flash ราคาถูกอีกตัวที่ควรค่าแก่การวัดผลในการทดลองเดียวกัน อยู่ในแคตตาล็อกเดียวกันในราคาตามที่ผู้ให้บริการตั้งไว้ ดังนั้นการทดสอบแบบสามทางระหว่างโมเดลทดลองกับตัวเลือกระดับ Flash ที่มีอยู่แล้ว จึงทำได้ด้วยคีย์ API เพียงคีย์เดียว พร้อมระบบสลับใช้งานอัตโนมัติระหว่างกัน
Ling-3.1-flash ไม่ได้อยู่ในแค็ตตาล็อกของเรา และการค้นหาผ่าน API โมเดลสาธารณะของเราส่งคืนค่า not-found สำหรับทั้งรุ่นนี้และรุ่นก่อนหน้า — ดังนั้นการอธิบายที่ตรงไปตรงมาคือ การทดลองใช้จะเกิดขึ้นที่ใดก็ตามที่มันเกิดขึ้น ผ่านช่องทางของผู้ขายเองและแพลตฟอร์มการอนุมานของบุคคลที่สาม และเราไม่ได้อ้างว่าเราโฮสต์มัน นั่นคือส่วนของการเปรียบเทียบนี้ที่อาจเปลี่ยนแปลงได้เร็วที่สุด: โมเดลที่อยู่ในการทดลองใช้ฟรีโดยที่ยังไม่ประกาศราคาเป็นสิ่งที่ลงเอยบนเลเยอร์การกำหนดเส้นทางทันทีที่ Ant และโฮสต์ของมันเผยแพร่ตารางราคา และการส่งผ่านแบบไม่มีมาร์กอัปหมายความว่าในวันที่มันทำเช่นนั้น ราคาที่นี่ก็เท่ากับราคาที่นั่น
ดังนั้น ข้อสรุปจึงแคบกว่าที่จำนวนพารามิเตอร์ชี้ให้เห็น Ling-3.1-flash เป็นโมเดลที่ทะเยอทะยานกว่า และเป็นผลการวิจัยที่น่าสนใจกว่า ส่วน Gemini 3.8 Flash คือตัวที่คุณนำไปใช้งานจริงได้ จนกว่าจะมีใบอนุญาตและราคา นั่นคือความแตกต่างทั้งหมด — และมันไม่ใช่ความแตกต่างที่แถวหนึ่งในตารางการทดสอบมาตรฐานจะตัดสินได้

การเปรียบเทียบในบทความนี้1
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
