การ์ดฮีโร่เชิงบรรณาธิการที่สร้างขึ้น หัวข้อ "Ling-3.1-flash vs Qwen3.8-Flash" พร้อมคำโปรย "สองคำตอบสำหรับคำถามเดียวกัน: คุณสร้างระดับความเร็วสูงได้อย่างไร?" แผงด้านซ้ายหัวข้อ "ขยายขนาดและประกาศ" มีคำบรรยายว่า "รวม ~560B · ใช้งาน ~25B · คอนเท็กซ์ 1M" และแท็กที่ระบุว่า "เวต: เร็ว ๆ นี้" แผงด้านขวาหัวข้อ "ย่อขนาดและปล่อย" มี "รวม 125B · ใช้งาน 6B · พรีวิว Qwen4" และแท็กที่ระบุว่า "เวต: บน Hugging Face"
Engineering & Research

Ling-3.1-flash vs Qwen3.8-Flash: สองวิธีในการสร้างระดับความเร็วสูง และมีเพียงหนึ่งเดียวเท่านั้นที่พร้อมใช้งานจริง

ผู้เขียน

Rowan Sterling

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

ห้องปฏิบัติการจีนสองแห่งมองปัญหาเดียวกันในฤดูใบไม้ร่วงนี้ — คุณจะสร้างโมเดลที่ถูกและเร็วพอจะอยู่ในลูปเอเจนต์ได้อย่างไร — และได้คำตอบที่ตรงกันข้าม Ling-3.1-flash ซึ่ง Ant Group ประกาศเมื่อวันที่ 30 กันยายน 2026 เป็น mixture-of-experts ขนาดประมาณ 5.6 แสนล้านพารามิเตอร์ เปิดใช้งานประมาณ 2.5 หมื่นล้านพารามิเตอร์ต่อโทเคน โดยมีหน้าต่างบริบทที่ระบุว่าสูงถึง 1 ล้านโทเคน และมีความตั้งใจที่ระบุว่าจะเปิดซอร์ส "เร็ว ๆ นี้" Qwen3.8-Flash ซึ่งทีม Aliba​s Qwe​n เปิดตัวเมื่อวันที่ 26 สิงหาคม 2026 เป็น mixture-of-experts แบบมัลติโมดัลขนาด 1.25 แสนล้านพารามิเตอร์ เปิดใช้งานประมาณ 6 พันล้านพารามิเตอร์ต่อโทเคน โดยมีน้ำหนักโมเดลอยู่บน Hugging Face แล้วในชื่อ Qwen3.8-Flash-Next เป็นโมเดลสำหรับใช้งานจริงบน QwenCloud API ในราคา 0.15 ดอลลาร์ต่อโทเคนอินพุตหนึ่งล้านโทเคน และ 0.47 ดอลลาร์ต่อเอาต์พุตหนึ่งล้านโทเคน และรองรับใน SGLang ตั้งแต่วันแรก แล็บหนึ่งขยายขนาดขึ้นแล้วประกาศ อีกแล็บหนึ่งย่อขนาดลงแล้วส่งมอบ ความแตกต่างนั้นให้บทเรียนมากกว่าผลเบนช์มาร์กใด ๆ ที่ทั้งสองแล็บเผยแพร่

นี่ก็เป็นเหตุผลที่ทำให้การเปรียบเทียบนี้ต้องอ่านอย่างระมัดระวัง Ling-3.1-flash ไม่มีเวท ไม่มีใบอนุญาต ไม่มีการ์ดโมเดล ไม่มีราคา API และไม่มีการประเมินที่เป็นอิสระ บันทึกที่เผยแพร่ทั้งหมดมีเพียงโพสต์ประกาศ แผนภูมิ benchmark จากผู้ขาย และช่องหนึ่งในผลิตภัณฑ์ Ling Studio ของ Ant เอง Qwen3.8-Flash มีสิ่งเหล่านั้นทั้งหมด และมีความได้เปรียบจากการเริ่มต้นก่อนสี่สัปดาห์ในการถูกใช้งานโดยผู้ที่ไม่ได้ทำงานให้ Alibaba การเปรียบเทียบการเลือกสถาปัตยกรรมเป็นธรรม แต่การเปรียบเทียบความสามารถยังไม่เป็นธรรม

การตัดสินใจด้านการออกแบบสองเรื่อง และเหตุใดมันจึงแตกต่างกัน

การเดิมพันของ Qwen คือระดับเร็วควรมีโครงสร้างที่แตกต่างจากรุ่นเรือธง ไม่ใช่แค่เล็กกว่า Qwen3.8-Flash เปิดใช้งานพารามิเตอร์ 6 พันล้านจากทั้งหมด 125 พันล้าน — คิดเป็นความเบาบางประมาณ 95% — และได้ความสามารถมาจากตำแหน่งที่การประมวลผลถูกกำหนดเส้นทางไป มากกว่าจากความกว้างแบบดิบ ๆ Alibaba ระบุชัดเจนว่าสถาปัตยกรรมเบื้องหลัง ซึ่งจับคู่ Gated DeltaNet กับ Qwen Sparse Attention และตาราง embedding แบบ N-gram เป็นการดูตัวอย่างช่วงแรกของเจเนอเรชัน Qwen4 ที่เผยแพร่ก่อนกำหนดโดยเจตนา เพื่อให้เอนจินอินเฟอเรนซ์ เครื่องมือควอนไทเซชัน และรูปแบบการดีพลอยสามารถเติบโตเต็มที่รอบ ๆ มัน ก่อนที่โมเดลราคาแพงจะถูกสร้างทับขึ้นไป ผลลัพธ์คือโมเดลที่ถูกต่อโทเคนโดยโครงสร้าง: งานประมาณ 6 พันล้านพารามิเตอร์ในทุกโทเคน ในราคาที่ Alibaba ตั้งไว้ที่ $0.15 ขาเข้า และ $0.47 ขาออก ต่อล้าน

การเดิมพันของ Ant เท่าที่การประกาศเปิดเผย ใกล้เคียงกับการสเกลแบบเดิมพร้อมบริบทที่ยาวมาก Ling-3.1-flash รักษาสัดส่วนที่เปิดใช้งานไว้สูง — ประมาณ 25 พันล้านพารามิเตอร์ต่อโทเคน จากทั้งหมด 560 พันล้าน หรือประมาณหนึ่งในยี่สิบสอง — และระบุหน้าต่างสูงสุดถึง 1 ล้านโทเคน ซึ่งมากกว่าที่ Ling เจนเนอเรชันก่อนหน้าให้บริการถึงสี่เท่า แอป Ling Studio อธิบายว่าได้รับการสร้างมาสำหรับ "เอเจนต์อเนกประสงค์ การค้นหา งานสำนักงานประจำ และการพัฒนาซอฟต์แวร์/โค้ด" ซึ่งเป็นการวางตำแหน่งระดับเร็ว แต่เศรษฐศาสตร์ของพารามิเตอร์กลับเป็นของโมเดลที่หนักกว่ามาก เมื่ออินพุตเหมือนกัน โทเคนที่ผ่านพารามิเตอร์ที่เปิดใช้งาน 25B จะใช้คอมพิวต์ประมาณสี่เท่าของโทเคนที่ผ่าน 6B ก่อนที่การตัดสินใจเรื่องราคาใด ๆ จะเข้ามาเกี่ยวข้อง

ไม่มีแนวทางไหนผิด และทั้งสองก็เป็นคำตอบที่ปกป้องได้ต่อคำถามที่ว่า "อะไรคือสิ่งที่จำกัดโมเดลราคาถูก" Qwen เดิมพันว่าความเบาบางและชุดสแต็กแอตเทนชันใหม่คือเพดานจำกัด ส่วน Ant เดิมพันว่าเพดานจำกัดคือบริบทและองค์ความรู้เกี่ยวกับโลก และมันสามารถแบกรับต้นทุนการประมวลผลได้ สิ่งที่แยกสองฝ่ายนี้ออกจากกันสำหรับผู้อ่านไม่ใช่ปรัชญาการออกแบบ แต่คือการนำส่งต่างหาก: การออกแบบที่คุณดาวน์โหลดและวัดผลได้ เทียบกับการออกแบบที่คุณได้แค่อ่านเกี่ยวกับมัน

Ant Group's own Ling-3.1-flash benchmark card, published 30 September 2026. Panels compare Ling-3.1-flash with GPT-5.6 Sol, Claude Opus 5, Kimi K3, GLM 5.3, GLM 5.3 Flash and DeepSeek-V4.1-Flash across GDPval-AA v2.1 (1,673 Elo for Ling-3.1-flash), tau-Banking, SkillsBench, Automationbench, Terminal-Bench 4.0, CyberGym, FrontierSWE (75.16), SWE Atlas Codebase QnA, Finance Agent v2, HealthBench Professional (65.35), DRACO and MultiChallenge. A footnote states HealthBench Professional was evaluated in the AQ environment.

แต่ละอย่างมีต้นทุนกับคุณเท่าไร และนั่นหมายความว่าอย่างไรในทางปฏิบัติ

ช่องว่างราคาไม่ใช่เรื่องเล็กน้อยและไม่ใกล้เคียง Qwen3.8-Flash เปิดเผยราคาที่ $0.15 ต่อล้านโทเค็นอินพุต, $0.47 ต่อล้านเอาต์พุต, และ $0.018 ต่อล้านในการอ่านแคช — ตัวเลขเดียวกันกับที่ประกาศของ Alibaba, บนการ์ดโมเดลโปรดักชันของผู้ขาย, และบนหน้าโมเดลที่เราให้บริการ ซึ่งเป็นสิ่งที่การส่งผ่านแบบมาร์กอัป 0% ดูเป็นอย่างไรเมื่อคุณตรวจสอบกับสามแหล่ง Ant ไม่ได้เผยแพร่อัตราสำหรับ Ling-3.1-flash เลย — ไม่มีราคา API, ไม่มีส่วนลดแคช, ไม่มีอะไรที่เทียบเคียงได้ ตัวเลขที่เผยแพร่เพียงอย่างเดียวสำหรับสาย Ling คือของรุ่นก่อนหน้า ซึ่งระบุไว้ที่ $0.075 อินพุต และ $0.22 เอาต์พุตต่อล้าน ประมาณครึ่งหนึ่งของอัตราอินพุตของ Qwen และน้อยกว่าครึ่งหนึ่งของอัตราเอาต์พุต หากระดับ Ling ใหม่ตั้งราคาใกล้เคียงกับที่รุ่นเก่าอยู่ มันจะตัดราคา Qwen3.8-Flash บนกระดาษ; หากมันตั้งราคาใกล้เคียงกับคอมพิวต์ที่พารามิเตอร์ที่ใช้งาน 25B ของมันบ่งบอก มันจะไม่เป็นเช่นนั้น นั่นเป็นการคาดเดาไม่ว่าจะทางไหน เพราะตัวเลขนั้นไม่มีอยู่

บริบทคือจุดที่ข้ออ้างของ Ling ใหญ่กว่าจริง ๆ Ant ระบุสูงสุด 1 ล้านโทเค็นสำหรับ Ling-3.1-flash ส่วน Qwen3.8-Flash มาพร้อมบริบทเริ่มต้น 1M โทเค็นบน API สำหรับโปรดักชัน และหน้าต่างเนทีฟ 262,144 โทเค็นบนเวตเปิด ซึ่งขยายได้ มีข้อควรระวังสองข้อที่อยู่กับตัวเลขของ Ling และยังไม่มีข้อใดถูกปิด ข้อแรก "สูงสุด 1M" เป็นข้อกำหนด ไม่ใช่การวัด — ยังไม่มีใครเผยแพร่พฤติกรรมการดึงคืนข้อมูลบริบทยาวสำหรับโมเดลที่ไม่มีใครนอก Ant เรียกใช้ได้ ข้อสอง เจเนอเรชัน Ling ก่อนหน้ามีช่องว่างแบบเดียวกันเป๊ะระหว่างหน้าต่างที่โฆษณาไว้กับเรื่องราวทางสถาปัตยกรรมที่รองรับมัน และคำตอบก็มาถึงเมื่อเวต รูปแบบ และขีดจำกัดบริบทถูกเผยแพร่ในที่สุด 1M ที่พาดหัวคือคำสัญญา ส่วน 1M บน Qwen3.8-Flash เป็นค่าเริ่มต้นที่ให้บริการจริง ซึ่งคุณใช้เทียบกับข้ออ้างของ Ant ได้

ทำไม "preview" จึงเป็นคำที่ตรงไปตรงมาในด้านหนึ่งของเรื่องนี้

การวางกรอบของ Alibaba เองต่อ Qwen3.8-Flash คือว่ามันเป็นพรีวิวสถาปัตยกรรมที่เปิดตัวภายใต้ชื่อระดับโปรดักชัน — น้ำหนักแบบเปิดใช้คำต่อท้าย “Next” ก็เพื่อไม่ให้ใครสับสนต้นแบบกับโมเดลเสิร์ฟที่ปรับแต่งแล้ว การวางกรอบเช่นนี้ได้รับการยืนยันจากเหตุการณ์จริงมากกว่าจากการตลาด: SGLang ให้การรองรับ Qwen3.8-Flash-Next ตั้งแต่วันแรกที่เปิดตัว โดยโมเดลยังได้รับการกำหนดค่าสำหรับ Transformers, vLLM และ TokenSpeed ด้วย และนับจากนั้นน้ำหนักก็ถูกนำไปใช้ในชุมชนด้านควอนไทเซชันต่าง ๆ เวอร์ชันต่าง ๆ กลายเป็นเรื่องธรรมดาไปอย่างรวดเร็ว ซึ่งนั่นคือสิ่งที่โมเดลที่เปิดตัวจริงดูเป็นเช่นนั้น

ประกาศของ Ant มีรูปแบบเดียวกันโดยเกิดขึ้นก่อนหนึ่งก้าว: การปล่อยสเปกก่อนการเปิดตัว พร้อมข้อความระบุชัดเจนว่าโมเดลจะเปิดซอร์สในไม่ช้า นี่เป็นวิธีเปิดตัวที่ชอบธรรม — Ling-3.0-flash เดินตามเส้นทางนี้เป๊ะเมื่อเดือนกรกฎาคม และเวตก็ถูกปล่อยภายใต้ MIT เมื่อวันที่ 7 สิงหาคม ราวสองสัปดาห์ถัดมา แต่สภาพของสองโครงการในวันนี้เทียบกันไม่ได้ และการอ่านกราฟไม่ว่าจะมากแค่ไหนก็ไม่ปิดช่องว่างนี้ได้ ควรพูดให้เจาะจงว่าคนนอกสามารถนำอะไรมาสู่แต่ละโครงการได้

สิ่งที่ตรวจสอบได้อย่างอิสระสำหรับ Ling-3.1-flash วันนี้ ได้แก่: ประกาศดังกล่าวมีอยู่จริงและลงวันที่ 30 กันยายน; ตัวเลขพารามิเตอร์ พารามิเตอร์ที่ใช้งาน และบริบทเป็นของ Ant เอง; โมเดลปรากฏอยู่ในผลิตภัณฑ์ Ling Studio ของ Ant; และยังไม่มีการเผยแพร่ค่าน้ำหนัก สัญญาอนุญาต หรือการ์ดโมเดล สิ่งที่ตรวจสอบได้อย่างอิสระสำหรับ Qwen3.8-Flash ได้แก่: ค่าน้ำหนักดาวน์โหลดได้ในรูปแบบ BF16 และ FP8; ข้อกำหนดสัญญาอนุญาตอ่านได้; ราคา API ถูกเผยแพร่; และข้ออ้างด้านเบนช์มาร์กของ Alibaba เปิดให้ทำซ้ำได้ตั้งแต่ปลายเดือนสิงหาคม รายการที่สองยาวกว่า และนั่นคือการเปรียบเทียบทั้งหมดในแบบย่อ

Headless capture of the OrcaRouter model page for Qwen3.8 Flash, showing the routed model ID qwen/qwen3.8-flash, a 1M-token context window, 131K maximum output, text, image and video input with text output, capability badges for Vision, Tools, JSON and Reasoning, a production date of 2026-08-26, a pricing block reading $0.15 per 1M input tokens, $0.47 per 1M output tokens, $0.018 cache read and $0.230 cache write, and a performance panel with a 4.47 s p50 time-to-first-token, 10.00 s p95, 105 tok/s output and a 2.9% error rate over the last seven days.

ว่าทั้งสองจะถูกประเมินจริง ๆ อย่างไร

Ant ได้เผยแพร่การ์ด benchmark กับ Ling-3.1-flash ซึ่งนำมันไปเทียบกับ GPT-5.6 Sol, Claude Opus 5, Kimi K3, GLM สองเวอร์ชัน และ DeepSeek-V4.1-Flash โดยมีตัวเลขสำคัญคือ 1,673 Elo บน GDPVal-AA v2.1, 75.16 บน FrontierSWE และ 65.35 บน HealthBench Professional มีปัญหาสองประการบนการ์ดนั้นก่อนที่ใครจะโต้แย้งเกี่ยวกับตัวเลข ปัญหาแรกคือชุดการเปรียบเทียบ: โมเดลแนวหน้าทั้งสองที่ Ant เลือกนั้นล้าหลังไปหนึ่งรุ่น เนื่องจาก Claude Opus 5.5 และ GPT-6 Sol เปิดใช้งานเมื่อวันที่ 22 กันยายน 2026 และสามารถเรียกใช้ได้แล้วในตอนนี้ ซึ่งหมายความว่าการ์ดนี้เปรียบเทียบโมเดลเดือนตุลาคมกับแนวหน้าของเดือนกรกฎาคม แทนที่จะเป็นรุ่นปัจจุบัน ปัญหาที่สองคือเชิงอรรถบนการ์ดเอง ซึ่งระบุว่าผลลัพธ์ HealthBench Professional มาจาก "AQ environment" และความสามารถด้านการดูแลสุขภาพของโมเดลในปัจจุบันสามารถใช้งานได้เฉพาะใน AQ — สภาพแวดล้อมที่ไม่มีเอกสารสาธารณะใดนิยามไว้ คะแนนหลักที่สภาพแวดล้อมในการประเมินไม่ถูกระบุชื่อนั้นไม่สามารถทำซ้ำได้แม้แต่ในหลักการ

ในทางตรงกันข้าม ข้อกล่าวอ้างที่เทียบเคียงได้ของ Qwen3.8-Flash เกิดขึ้นหลังจากที่เวตเปิดตัวไปแล้ว และ Alibaba ก็วางตำแหน่งของตนบนข้อกล่าวอ้างที่ใครก็ทดสอบได้ นั่นคือ อัตราส่วนความเบาบาง ไม่ใช่จำนวนพารามิเตอร์ ต่างหากที่เป็นแหล่งของความสามารถ การใช้งานสี่สัปดาห์ไม่ใช่คำตัดสินชี้ขาด แต่ก็ยาวนานพอที่ข้อกล่าวอ้างเหล่านั้นจะไม่ถูกมองว่าไม่มีข้อโต้แย้งอีกต่อไป ซึ่งเป็นสภาวะที่มีประโยชน์สำหรับโมเดล

วันนี้จะทำอะไรกับสิ่งนี้ได้จริง ๆ

สำหรับนักพัฒนา เส้นแบ่งในทางปฏิบัติก็ง่าย ๆ Ling-3.1-flash ไม่ใช่คอมโพเนนต์ที่คุณจะนำมาใช้ได้ในสัปดาห์นี้: ไม่มีเอนด์พอยต์ให้เรียก ไม่มีเวตให้นำไปโฮสต์ ไม่มีไลเซนส์ให้ตรวจสอบ และไม่มีราคาให้ตั้งงบเทียบ ไม่ว่าโมเดลสุดท้ายจะออกมาเป็นอย่างไร สิ่งที่มีประโยชน์ที่ควรทำตอนนี้คือตั้งทริกเกอร์ — เผยแพร่เวตแล้ว ไลเซนส์เปิดกว้าง มีคะแนนอิสระบน FrontierSWE ที่ใกล้เคียง 75.16 — แล้วกลับมาพิจารณาใหม่ ประวัติของรุ่นก่อนเองแสดงให้เห็นว่าเวตอาจมาถึงภายในสองสัปดาห์หลังการประกาศ ทริกเกอร์นั้นจึงอาจทำงานอย่างรวดเร็ว

Qwen3.8-Flash เป็นส่วนประกอบอยู่แล้ว มันพร้อมใช้งานบนแคตตาล็อกของเราในฐานะโมเดลแบบ routedในราคาตั้งต้นของผู้ให้บริการโดยไม่มีการบวกเพิ่ม — การ์ดแบบ routed ระบุราคาขาเข้า $0.15 ขาออก $0.47 และ $0.018 ต่อการอ่านแคชหนึ่งล้านครั้ง ซึ่งเป็นตัวเลขชุดเดียวกับที่ Alibaba ประกาศ นี่คือความหมายของนโยบายมาร์กอัป 0% ในทางปฏิบัติ ไม่ใช่ในสไลด์ภายใต้คีย์เดียวมันอยู่เคียงข้าง Claude Opus 5, GPT-5.6 Sol และ DeepSeek-V4.1-Flash ดังนั้นการเปรียบเทียบที่ Ant กำลังเชิญชวน — ผู้ท้าชิงกับแนวหน้าปัจจุบัน — จึงทำได้โดยชี้คอนฟิกไปที่สองเส้นทาง แทนที่จะต้องดูแลการเชื่อมต่อสองชุด โดยมีระบบ failover อัตโนมัติคอยจัดการในสุดสัปดาห์ที่ผู้ให้บริการสะดุด นั่นคือความแตกต่างระหว่างการถกเถียงเรื่องสถาปัตยกรรมกับการทดลอง

คำตัดสิน เท่าที่จะให้ได้ก็คือ: Qwen เดิมพันเชิงสถาปัตยกรรมที่กล้ากว่า และมั่นใจพอจะเปิดเผยตั้งแต่เนิ่น ๆ แล้วปล่อยให้ผู้คนรื้อถอนตรวจสอบกัน Ant เดิมพันที่หนักกว่า — พารามิเตอร์มากกว่า พลังประมวลผลที่ทำงานจริงต่อโทเคนมากกว่า คอนเท็กซ์มากกว่า — และจนถึงตอนนี้กลับเผยแพร่แผนภูมิแทนที่จะเป็นโมเดล แผนภูมิดูดี แผนภูมิยังเป็นสิ่งเดียวที่ใคร ๆ มี

Generated three-lane information card. Lane one, "Shipped, priced, licensed", holds "Qwen3.8-Flash — weights on Hugging Face as Qwen3.8-Flash-Next" and "$0.15 in / $0.47 out per 1M tokens, cache $0.018". Lane two, "Announced, unpriced, unlicensed", holds "Ling-3.1-flash — no repository, no licence", "no published API price" and "no independent evaluation". Lane three, "What a reader should do", holds "test the shipped model this week" and "set a trigger for the announced one".

การเปรียบเทียบในบทความนี้1

ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube