
Claude Haiku 5.5 vs Ling 3.1 Flash: โมเดลขนาด 560 พันล้านพารามิเตอร์ที่มีค่าใช้จ่ายต่อคำตอบสูงกว่าถึงสี่เท่า
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIOpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- AnthropicAnthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIGrok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 58 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 347 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
ห่างกันหกวัน InclusionAI เปิดตัว Ling 3.1 Flash เมื่อวันที่ 1 ตุลาคม 2026 ส่วนผู้ให้บริการเปิดตัว Claude Haiku 5.5 เมื่อวันที่ 7 ตุลาคม ทั้งคู่ถูกวางจำหน่ายเป็นโมเดลระดับแฟลช ทั้งคู่มีหน้าต่างบริบทหนึ่งล้านโทเคน และในแถวการให้เหตุผลของบอร์ดอิสระเพียงแห่งเดียวที่ได้รันทั้งสอง โมเดลทั้งคู่ก็ใกล้กันมากจนความแตกต่างอยู่ในระดับความคลาดเคลื่อน จากนั้นเมื่อมาถึงแถวที่วัดว่าเอเจนต์ทำงานจนสำเร็จจริงหรือไม่ ทั้งสองก็ห่างกัน 26 คะแนน และแถวที่วัดว่าต้นทุนของงานที่ทำเสร็จนั้นเป็นเท่าไร โมเดลที่มีพารามิเตอร์ 5.6 แสนล้านตัวกลับมีราคาสูงกว่าโมเดลที่ไม่มีใครเผยแพร่จำนวนพารามิเตอร์ถึงสี่เท่าครึ่ง
ไม่มีตารางราคาใดคาดการณ์เช่นนั้น Ling 3.1 Flash ระบุราคาที่ $0.30 ต่อล้านโทเคนอินพุต และ $0.90 ต่อล้านโทเคนเอาต์พุต Claude Haiku 5.5 ระบุราคาที่ $0.10 และ $0.50 สำหรับพรอมป์ต์ไม่เกิน 100,000 โทเคน และเพิ่มเป็น $0.50 และ $2.50 เมื่อเกินกว่านั้น เมื่ออ่านเป็นราคาต่อโทเคน Ling มีค่าใช้จ่ายเป็นสามเท่าในส่วนอินพุต และน้อยกว่าสองเท่าเล็กน้อยในส่วนเอาต์พุต ซึ่งเป็นช่องว่างแบบที่ทำให้การเปรียบเทียบจบได้ในบรรทัดเดียว
มันไม่ได้จบเรื่องนี้ เพราะเรตการ์ดคิดราคาต่อโทเคน และการตัดสินใจคิดราคาต่องาน ตัวเลขสองตัวนี้ออกมาจากการจับคู่นี้ด้วยเครื่องหมายที่ตรงกันข้าม และเหตุผลไม่ใช่ความเยิ่นเย้อ
ต้นทุนต่องานที่เสร็จแล้ว ไม่ใช่ต้นทุนต่อโทเคน
บน Artificial Analysis Intelligence Index v4.3.2 ค่าใช้จ่ายที่วัดได้สำหรับการทำภารกิจ index หนึ่งภารกิจเต็มคือ $0.21 สำหรับ Claude Haiku 5.5 และ $0.99 สำหรับ Ling 3.1 Flash นั่นคือช่องว่าง 4.6 เท่า — ซึ่งกว้างกว่าอัตราส่วนอินพุต 3 เท่า และอยู่ในทิศทางเดียวกัน
คำอธิบายที่เห็นได้ชัด — ว่าโมเดลที่แพงกว่ากำลังพูดมากกว่า — เป็นคำอธิบายที่ผิด Ling 3.1 Flash สร้างโทเคนเอาต์พุต 100,671 โทเคนต่องานจัดทำดัชนี; Claude Haiku 5.5 สร้าง 162,164 โทเคน โมเดลที่ถูกกว่าคือตัวที่พูดมากกว่า โดยมากกว่า 60% ดังนั้นเงินก็ไม่ได้ไปในที่ที่เรตการ์ดบ่งชี้เช่นกัน
แยกต้นทุนต่อภารกิจออกมา แล้วจะเห็นว่ามันไปตกอยู่ตรงที่ระเบียบวิธีของดัชนีใช้จ่ายจริง ๆ จาก $0.21 ของ Claude Haiku 5.5 ประมาณ 62% อยู่ฝั่งอินพุต ส่วนจาก $0.99 ของ Ling 3.1 Flash ประมาณ 91% ก็เช่นกัน นี่คือการรันงานให้เหตุผลที่ใช้แคชหนัก และผู้ขายทั้งสองรายตั้งราคาโทเคนอินพุตที่แคชไว้แตกต่างกันมาก คือ $0.01 ต่อล้านโทเคนสำหรับ Claude Haiku 5.5 เทียบกับ $0.06 ต่อล้านโทเคนสำหรับ Ling 3.1 Flash — ส่วนต่าง 6 เท่าในรายการเดียวที่ครองค่าใช้จ่ายส่วนใหญ่ ตารางราคาที่ประกาศไว้เปรียบเทียบ $0.10 กับ $0.30 ส่วนรายการที่ตัดสินใบแจ้งหนี้เปรียบเทียบ $0.01 กับ $0.06
แคตตาล็อกของเราเองส่งต่อราคาตามรายการของผู้ให้บริการโดยบวกเพิ่ม 0% ซึ่งเป็นวิธีที่คุณจะแยกแยะสองสถานการณ์นี้ออกจากกันได้บนบิลจริง而不是บิลที่จำลองขึ้น Ling 3.1 Flash ไม่ได้อยู่ในแคตตาล็อกไม่ว่าจะสะกดเส้นทางของผู้จำหน่ายรูปแบบใดที่เราหาได้ — ไม่ใช่อยู่ภายใต้ InclusionAI ไม่ใช่อยู่ภายใต้ Ling ไม่ใช่อยู่ภายใต้รูปแบบใดในแปดรูปแบบที่เราลอง — ดังนั้น $0.30 และ $0.90 ข้างต้นจึงเป็นอัตราที่ผู้จำหน่ายประกาศเอง และไม่ใช่สิ่งที่เราจัดเส้นทางให้คุณได้ในวันนี้ Claude Haiku 5.5 ก็ไม่อยู่ในแคตตาล็อกเช่นกัน มันทำงานผ่าน API ของ Anthropic เองสิ่งที่แคตตาล็อกมีจากละแวกเดียวกับการเปรียบเทียบนี้คือ GLM 5.3 Flash, DeepSeek V4.1 Flash, Qwen3.8 Flash และ Gemini 3.8 Flash โดยแต่ละตัวในราคาตามรายการของผู้ให้บริการ บวกเพิ่ม 0%ดังนั้นเมื่อผู้ให้บริการเปลี่ยนอัตรา ฝั่งเราก็ได้รับในวันเดียวกับที่ฝั่งเขาได้รับ หากข้อค้นพบด้านล่างคือโปรไฟล์แบบเอเจนต์ของ Ling 3.1 Flash เป็นสิ่งที่เวิร์กโหลดของคุณต้องการ ขั้นตอนถัดไปที่ปฏิบัติได้จริงคือการเทียบแบบตัวต่อตัวกับโมเดลที่รองรับการทำงานแบบเอเจนต์ที่เราจัดเส้นทางให้อยู่ บนคีย์เดียวที่มี การสลับสำรองอัตโนมัติอยู่ข้างใต้ และใช้ DSL การจัดเส้นทางเมื่อเพดานค่าใช้จ่ายควรอยู่ในเส้นทางมากกว่าในโค้ดแอปพลิเคชัน

เจ็ดแถวที่ทั้งสองค่าถูกวัด
Artificial Analysis เป็นบอร์ดเดียวที่ได้รันทั้งสองโมเดล และส่วนที่ทับซ้อนกันนั้นแคบแต่ให้ข้อมูลที่เป็นประโยชน์ แถวข้อมูลต่างๆ ไม่สอดคล้องกัน และทิศทางของความไม่สอดคล้องนั้นไม่ได้เกิดขึ้นแบบสุ่ม
• ดัชนี Intelligence Index v4.3.2 — Claude Haiku 5.5 (Max) ได้ 43.40 เทียบกับ 41.09 ของ Ling 3.1 Flash โดย Anthropic นำอยู่ 2.31 คะแนน
• ต้นทุนต่องาน Index ที่เสร็จแล้ว — $0.21 เทียบกับ $0.99 บนบอร์ดเดียวกัน
• เวลาต่อหนึ่งงาน Index — 424.6 วินาทีสำหรับ Claude Haiku 5.5 เทียบกับ 360.4 วินาทีสำหรับ Ling 3.1 Flash นี่คือแถวที่ความคาดหมายพังทลาย: โมเดลขนาด 560 พันล้านพารามิเตอร์เป็นตัวที่เร็วกว่าในสองตัวนี้เมื่อมองทั้งดัชนีโดยรวม เร็วกว่าประมาณ 15%
• Terminal Bench 4.0 — 0.3283 เทียบกับ 0.3333 Ling 3.1 Flash นำอยู่ครึ่งจุด ซึ่งบนเบนช์มาร์กที่ทั้งสองเจ้านำมาอ้างอิง ถือว่าเสมอกัน
• SciCode — 0.5498 เทียบกับ 0.5405 Claude Haiku 5.5 นำอยู่ 0.9 คะแนน และยังเสมอกันอีกด้วย
• Humanity's Last Exam แบบไม่ใช้เครื่องมือ — 0.4439 เทียบกับ 0.3943 Claude Haiku 5.5 นำอยู่ 5 คะแนน เป็นการแยกตัวออกจากกันอย่างแท้จริงครั้งแรก
• AutomationBench, คะแนนบางส่วน — 0.3541 เทียบกับ 0.6174 Ling 3.1 Flash นำอยู่ 26 คะแนน และมีส่วนต่างที่มากกว่าผลต่างอื่น ๆ ทั้งหมดในรายการนี้รวมกัน
มีอีกสองแถวที่อยู่นอกชุดที่ใช้ร่วมกันนั้น และคุ้มค่าที่จะใส่ไว้ เพราะมันคือแถวที่ผู้ซื้อสังเกตเห็นมากที่สุด บน GDPval-AA ซึ่ง Artificial Analysis ดำเนินการครอบคลุม 44 อาชีพ ทั้งสองมีค่า 1620.05 และ 1621.75 — เสมอกันทางสถิติ บน AA-Briefcase v1.1 ซึ่งเป็นการประเมินงานวิชาชีพรูปแบบยาวที่คิดคะแนนแบบ Elo Claude Haiku 5.5 ทำได้ 1577.72 เทียบกับ 1400.35 ของ Ling 3.1 Flash เป็นช่องว่าง 177 คะแนนในความได้เปรียบของ Anthropic นั่นคือช่องว่างที่ไม่เกี่ยวกับเอเจนต์ที่กว้างที่สุดระหว่างทั้งสองในทุกที่บนบอร์ด
แถวเดียวที่ควรเป็นตัวตัดสินบทสนทนาเหล่านี้ส่วนใหญ่
ค่าเฉลี่ยระดับดัชนีซ่อนว่าเวลาและเงินจริง ๆ นั้นหมดไปอยู่ที่ไหน และคู่นี้คือกรณีที่ชัดเจนที่สุดของเรื่องนั้นในชุดนี้ ตัวเลขต่อการประเมินแต่ละครั้งบน Terminal Bench 4.0 ไม่ใกล้เคียงกันในมิติใดเลย ยกเว้นคะแนน
• Terminal Bench 4.0, Ling 3.1 Flash — 0.3333 ที่ $5.49 ต่อหนึ่งงาน และ 1,283 วินาทีต่อหนึ่งงาน
• Terminal Bench 4.0, Claude Haiku 5.5 — 0.3283 ที่ $0.65 ต่องาน และ 908 วินาทีต่องาน
คะแนนห่างกันเพียงห้าในพันของหนึ่งคะแนน ค่าใช้จ่ายอยู่ที่ 8.4× และเวลาที่ใช้จริงอยู่ที่ 1.4× ทีมที่อ่านตาราง benchmark แล้วเลือกโมเดลที่ได้คะแนน 0.3333 ตามการคำนวณของ Artificial Analysis เอง ได้เลือกจ่ายแพงกว่าแปดเท่าเพื่อไปถึงช้ากว่าหนึ่งในสามของนาทีโดยได้คำตอบเดียวกัน
นี่ไม่ใช่ข้อโต้แย้งว่าคะแนนไม่มีความหมาย แต่เป็นข้อโต้แย้งว่าคะแนนคืออัตราส่วนระหว่างงานที่ทำสำเร็จกับงานที่พยายามทำ และไม่ได้บอกอะไรเกี่ยวกับทรัพยากรที่ใช้ไปกว่าจะไปถึงตรงนั้นเลย เบนช์มาร์กของงานที่ทำสำเร็จโดยเอเจนต์เป็นบริบทที่ความแตกต่างนี้ส่งผลหนักที่สุดพอดี เพราะเอเจนต์ที่ลองใหม่คือเอเจนต์ที่จ่ายเต็มราคาทุกครั้งที่ลองใหม่ และโมเดลที่มีต้นทุนต่อความพยายามสูงกว่าแปดเท่าจะเปลี่ยนลูปการลองใหม่ให้กลายเป็นรายการงบประมาณ

พารามิเตอร์ 560 พันล้านตัวโดยไม่มีอะไรต้องดาวน์โหลด
นี่คือส่วนของตารางสเปกของ Ling 3.1 Flash ที่แปลกอย่างแท้จริง และมันไม่ใช่เรื่องขนาด
Ling 3.1 Flash เป็นโมเดล sparse mixture-of-experts — มีพารามิเตอร์รวม 5.6 แสนล้านตัว และเปิดใช้งาน 2.5 หมื่นล้านตัวต่อโทเคน — และ Artificial จัดประเภทให้เป็นโมเดลแบบกรรมสิทธิ์ ไม่มีน้ำหนักโมเดล ไม่มีไฟล์สัญญาอนุญาต และไม่มีรีโพซิทอรี โมเดลสแปร์สที่มีลักษณะเช่นนี้ปกติจะเปิดให้ใช้แบบเปิด เพราะนั่นคือสิ่งที่โมเดลอื่นในระดับนี้ทำ: GLM 5.3 Flash เผยแพร่น้ำหนักโมเดลภายใต้ MIT โดยมีพารามิเตอร์รวม 3.2 แสนล้านตัวและเปิดใช้งาน 1.8 หมื่นล้านตัว และ DeepSeek V4.1 Flash เผยแพร่น้ำหนักโมเดลภายใต้ MIT โดยมีพารามิเตอร์รวม 5.52 แสนล้านตัวและเปิดใช้งาน 1.6 หมื่นล้านตัว Ling 3.1 Flash เป็นสถาปัตยกรรมชนิดเดียวกันในระดับขนาดเดียวกัน แต่เผยแพร่เป็น API เท่านั้น
ทางเลือกนั้นมีผลที่ตามมาซึ่งแถวใน benchmark ไม่ได้แสดงให้เห็น โมเดลที่มีพารามิเตอร์ active 25 พันล้านต้องถูกเสิร์ฟที่ใดที่หนึ่ง และถ้าคุณถือเช็กพอยต์เองไม่ได้ คุณก็เลือกไม่ได้ว่าจะเสิร์ฟที่ไหนหรือที่อัตรากำไรเท่าใด — คุณต้องเช่าการเสิร์ฟโมเดลนั้นจากผู้ขาย ราคาต่อ task บน Terminal Bench ที่ 5.49 ดอลลาร์ข้างต้นไม่ใช่ผลจากอัตราค่าโทเคนเป็นหลัก แต่เป็นค่าใช้จ่ายในการเช่าโมเดล sparse ขนาดใหญ่จากฝ่ายเดียวที่รันมันได้ โมเดล open-weights พี่น้องในระดับเดียวกันนี้ให้ทางเลือกแก่คุณในการขยับตัวเลขนั้นด้วยตัวเอง
มันก็ให้ผลในทางกลับกันเช่นกัน และความซื่อสัตย์แบบเดียวกันก็ใช้เช่นกัน การเปิดตัวแบบเปิดไม่ได้หมายความว่าเป็นผลิตภัณฑ์ที่ดีกว่าอัตโนมัติ: คุณต้องรับภาระการให้บริการ การเลือก quantization และลู่วิ่งการอัปเกรดไปพร้อมกับ weights และไฟล์สัญญาอนุญาตไม่ใช่สัญญาการสนับสนุน Anthropic เผยแพร่คำมั่นเรื่องการเลิกให้บริการสำหรับ Claude Haiku 5.5 ว่าไม่ก่อนวันที่ 7 ตุลาคม 2027 บน first-party API พร้อม system card การที่คุณต้องการรูปแบบใดในสองแบบนั้นเป็นคำถามเกี่ยวกับทีมของคุณ ไม่เกี่ยวกับโมเดลใดในสองตัวนี้
Ling 3.1 Flash ใช้สำหรับอะไร
อ่านโปรไฟล์ทั้งหมดแล้วจะเห็นว่ามันอธิบายผลิตภัณฑ์ที่สอดคล้องเป็นเนื้อเดียวมากกว่าผลิตภัณฑ์ที่ต้องประนีประนอม นั่นคือโมเดลบริบทขนาดยาวแบบกระจัดกระจายขนาดใหญ่ที่ทำงานหลายขั้นตอนอัตโนมัติได้จนจบดีกว่าสิ่งอื่นใดที่วัดในช่วงราคานี้ ไม่โดดเด่นในการให้เหตุผลแบบครั้งเดียวที่ยาก และทำเช่นนั้นในอัตราคงที่โดยไม่มีความชันจากความยาวพรอมป์ต บน AutomationBench มันนำ Claude Haiku 5.5 อยู่ 26 คะแนน และคะแนน AA-Briefcase ของมันเป็นจุดเดียวในการเปรียบเทียบนี้ที่มันอยู่หลังกลางกลุ่มแทนที่จะอยู่แนวหน้า
นั่นเป็นคำอธิบายที่สมเหตุสมผลของเวิร์กเกอร์แบบเอเจนต์ที่ทำงานเป็นชุด: ให้มันทำงานกับคิวของงานที่มีโครงสร้างซึ่งแต่ละงานต้องทำให้เสร็จ ยอมรับว่างานนี้วัดกันเป็นนาที คงพรอมป์ตให้ยาวพอที่ขั้นเกณฑ์หนึ่งจะกลายเป็นเรื่องลงโทษ และให้ความสำคัญกับความน่าเชื่อถือ ณ เส้นชัยเหนือต้นทุนของโทเคนใด ๆ เพียงหนึ่งโทเคน สิ่งที่มันไม่เหมาะจะทำคือสิ่งที่โมเดลระดับ flash-tier มักถูกซื้อมาเพื่อทำ มันรับข้อความเท่านั้น — ไม่มีอินพุตรูปภาพเลย ในขณะที่ Claude Haiku 5.5 รับทั้งข้อความและรูปภาพ เวลางาน index ของมันสั้นกว่า แต่เวลางาน Terminal Bench ของมันยาวกว่า และที่ $0.99 ต้องาน index ที่เสร็จสิ้นหนึ่งงาน เทียบกับ $0.21 มันใช้จ่ายมากกว่าถึงสี่เท่าครึ่งเพื่อไปให้ถึงคะแนนคอมโพสิตที่เกือบเท่ากัน

อันไหนในสองอัน จากหลักฐานที่มีอยู่
ถ้างานของคุณคือข้อความเข้า ข้อความออก คิดราคาต่อโทเคนในระดับปริมาณมาก Claude Haiku 5.5 ชนะการเปรียบเทียบนี้ในทุกรายการที่ไปถึงใบแจ้งหนี้: ต้นทุนงานตามดัชนีต่ำกว่า ต้นทุนงานจริงต่ำกว่าในเบนช์มาร์กที่สำคัญที่สุดสำหรับเอเจนต์ คะแนนรวมสูงกว่า คะแนนงานมืออาชีพระยะยาวดีกว่า ความเที่ยงตรงดีกว่า และการป้อนภาพที่โมเดลอีกตัวไม่มีให้เลย
ถ้างานของคุณคือเอเจนต์ที่ไม่ต้องมีคนดูแลและต้องทำเวิร์กโฟลว์หลายขั้นตอนให้เสร็จ Ling 3 Flash ทำคะแนนสูงกว่า Claude Haiku 5.5 อยู่ 26 คะแนนบนเบนช์มาร์กที่ใช้ร่วมกันเพียงตัวเดียวที่วัดสิ่งนี้โดยตรง และนั่นก็คุ้มค่าที่จะทดสอบ มากกว่าจะตัดทิ้งเพราะเรื่องราคา ทดสอบมันกับ trace ของคุณเอง ไม่ใช่บนตารางนี้ — และคิดราคาการทดสอบต่อหนึ่งงานที่ทำเสร็จ เพราะนั่นคือตัวเลขที่เปลี่ยนไปเมื่อเอเจนต์ลองใหม่
หากคุณจำเป็นต้องถือเวตเอง ทั้งสองตัวนี้ก็ไม่ใช่โมเดลของคุณ Ling 3.1 Flash เป็นโมเดลปิดที่มี 560 พันล้านพารามิเตอร์; Claude Haiku 5.5 เป็นโมเดลปิดโดยไม่มีการเปิดเผยจำนวน ส่วนรุ่นเปิดในระดับนี้อยู่ที่อื่นบนบอร์ด และการเปรียบเทียบนั้นเริ่มจากชุดแถวที่แตกต่างออกไปทั้งหมด
คะแนนรวมบอกว่า 2.31 คะแนน เบนช์มาร์กแบบเอเจนติกบอกว่า 26 ไปในทิศทางตรงกันข้าม ตารางราคาบอก 3× สำหรับอินพุต ส่วนต้นทุนเมื่องานเสร็จบอก 4.6× ในทิศทางเดียวกับตารางราคา ตัวเลขสี่ตัว สองทิศทาง — ซึ่งเป็นเหตุผลว่าวิธีเดียวที่เชื่อถือได้ในการสะสางเรื่องนี้ คือรันทั้งคู่กับเทรซงานของคุณเอง แล้วอ่านต้นทุนจากงานที่ทำเสร็จ แทนที่จะอ่านจากโทเคน
การเปรียบเทียบในบทความนี้1
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
