การ์ดฮีโร่ที่มีหัวข้อว่า 'Claude Haiku 5.5 vs Ling 3.1 Flash' โดยมีบรรทัดด้านบนว่า 'พารามิเตอร์ 560B ไม่มีเวต' พร้อมค่าความต่างระหว่าง Index กับ AutomationBench ที่ระบุว่า 0.3541 เทียบกับ 0.6174 บรรทัดค่าใช้จ่ายที่ระบุว่า $0.21 ต่องาน เทียบกับ $0.99 ต่องาน และบรรทัดเวลาที่ระบุว่า 424.6s ต่องาน เทียบกับ 360.4s ต่องาน
Engineering & Research

Claude Haiku 5.5 vs Ling 3.1 Flash: โมเดลขนาด 560 พันล้านพารามิเตอร์ที่มีค่าใช้จ่ายต่อคำตอบสูงกว่าถึงสี่เท่า

ผู้เขียน

Rowan Sterling

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

ห่างกันหกวัน InclusionAI เปิดตัว Ling 3.1 Flash เมื่อวันที่ 1 ตุลาคม 2026 ส่วนผู้ให้บริการเปิดตัว Claude Haiku 5.5 เมื่อวันที่ 7 ตุลาคม ทั้งคู่ถูกวางจำหน่ายเป็นโมเดลระดับแฟลช ทั้งคู่มีหน้าต่างบริบทหนึ่งล้านโทเคน และในแถวการให้เหตุผลของบอร์ดอิสระเพียงแห่งเดียวที่ได้รันทั้งสอง โมเดลทั้งคู่ก็ใกล้กันมากจนความแตกต่างอยู่ในระดับความคลาดเคลื่อน จากนั้นเมื่อมาถึงแถวที่วัดว่าเอเจนต์ทำงานจนสำเร็จจริงหรือไม่ ทั้งสองก็ห่างกัน 26 คะแนน และแถวที่วัดว่าต้นทุนของงานที่ทำเสร็จนั้นเป็นเท่าไร โมเดลที่มีพารามิเตอร์ 5.6 แสนล้านตัวกลับมีราคาสูงกว่าโมเดลที่ไม่มีใครเผยแพร่จำนวนพารามิเตอร์ถึงสี่เท่าครึ่ง

ไม่มีตารางราคาใดคาดการณ์เช่นนั้น Ling 3.1 Flash ระบุราคาที่ $0.30 ต่อล้านโทเคนอินพุต และ $0.90 ต่อล้านโทเคนเอาต์พุต Claude Haiku 5.5 ระบุราคาที่ $0.10 และ $0.50 สำหรับพรอมป์ต์ไม่เกิน 100,000 โทเคน และเพิ่มเป็น $0.50 และ $2.50 เมื่อเกินกว่านั้น เมื่ออ่านเป็นราคาต่อโทเคน Ling มีค่าใช้จ่ายเป็นสามเท่าในส่วนอินพุต และน้อยกว่าสองเท่าเล็กน้อยในส่วนเอาต์พุต ซึ่งเป็นช่องว่างแบบที่ทำให้การเปรียบเทียบจบได้ในบรรทัดเดียว

มันไม่ได้จบเรื่องนี้ เพราะเรตการ์ดคิดราคาต่อโทเคน และการตัดสินใจคิดราคาต่องาน ตัวเลขสองตัวนี้ออกมาจากการจับคู่นี้ด้วยเครื่องหมายที่ตรงกันข้าม และเหตุผลไม่ใช่ความเยิ่นเย้อ

ต้นทุนต่องานที่เสร็จแล้ว ไม่ใช่ต้นทุนต่อโทเคน

บน Artificial Analysis Intelligence Index v4.3.2 ค่าใช้จ่ายที่วัดได้สำหรับการทำภารกิจ index หนึ่งภารกิจเต็มคือ $0.21 สำหรับ Claude Haiku 5.5 และ $0.99 สำหรับ Ling 3.1 Flash นั่นคือช่องว่าง 4.6 เท่า — ซึ่งกว้างกว่าอัตราส่วนอินพุต 3 เท่า และอยู่ในทิศทางเดียวกัน

คำอธิบายที่เห็นได้ชัด — ว่าโมเดลที่แพงกว่ากำลังพูดมากกว่า — เป็นคำอธิบายที่ผิด Ling 3.1 Flash สร้างโทเคนเอาต์พุต 100,671 โทเคนต่องานจัดทำดัชนี; Claude Haiku 5.5 สร้าง 162,164 โทเคน โมเดลที่ถูกกว่าคือตัวที่พูดมากกว่า โดยมากกว่า 60% ดังนั้นเงินก็ไม่ได้ไปในที่ที่เรตการ์ดบ่งชี้เช่นกัน

แยกต้นทุนต่อภารกิจออกมา แล้วจะเห็นว่ามันไปตกอยู่ตรงที่ระเบียบวิธีของดัชนีใช้จ่ายจริง ๆ จาก $0.21 ของ Claude Haiku 5.5 ประมาณ 62% อยู่ฝั่งอินพุต ส่วนจาก $0.99 ของ Ling 3.1 Flash ประมาณ 91% ก็เช่นกัน นี่คือการรันงานให้เหตุผลที่ใช้แคชหนัก และผู้ขายทั้งสองรายตั้งราคาโทเคนอินพุตที่แคชไว้แตกต่างกันมาก คือ $0.01 ต่อล้านโทเคนสำหรับ Claude Haiku 5.5 เทียบกับ $0.06 ต่อล้านโทเคนสำหรับ Ling 3.1 Flash — ส่วนต่าง 6 เท่าในรายการเดียวที่ครองค่าใช้จ่ายส่วนใหญ่ ตารางราคาที่ประกาศไว้เปรียบเทียบ $0.10 กับ $0.30 ส่วนรายการที่ตัดสินใบแจ้งหนี้เปรียบเทียบ $0.01 กับ $0.06

แคตตาล็อกของเราเองส่งต่อราคาตามรายการของผู้ให้บริการโดยบวกเพิ่ม 0% ซึ่งเป็นวิธีที่คุณจะแยกแยะสองสถานการณ์นี้ออกจากกันได้บนบิลจริง而不是บิลที่จำลองขึ้น Ling 3.1 Flash ไม่ได้อยู่ในแคตตาล็อกไม่ว่าจะสะกดเส้นทางของผู้จำหน่ายรูปแบบใดที่เราหาได้ — ไม่ใช่อยู่ภายใต้ InclusionAI ไม่ใช่อยู่ภายใต้ Ling ไม่ใช่อยู่ภายใต้รูปแบบใดในแปดรูปแบบที่เราลอง — ดังนั้น $0.30 และ $0.90 ข้างต้นจึงเป็นอัตราที่ผู้จำหน่ายประกาศเอง และไม่ใช่สิ่งที่เราจัดเส้นทางให้คุณได้ในวันนี้ Claude Haiku 5.5 ก็ไม่อยู่ในแคตตาล็อกเช่นกัน มันทำงานผ่าน API ของ Anthropic เองสิ่งที่แคตตาล็อกมีจากละแวกเดียวกับการเปรียบเทียบนี้คือ GLM 5.3 Flash, DeepSeek V4.1 Flash, Qwen3.8 Flash และ Gemini 3.8 Flash โดยแต่ละตัวในราคาตามรายการของผู้ให้บริการ บวกเพิ่ม 0%ดังนั้นเมื่อผู้ให้บริการเปลี่ยนอัตรา ฝั่งเราก็ได้รับในวันเดียวกับที่ฝั่งเขาได้รับ หากข้อค้นพบด้านล่างคือโปรไฟล์แบบเอเจนต์ของ Ling 3.1 Flash เป็นสิ่งที่เวิร์กโหลดของคุณต้องการ ขั้นตอนถัดไปที่ปฏิบัติได้จริงคือการเทียบแบบตัวต่อตัวกับโมเดลที่รองรับการทำงานแบบเอเจนต์ที่เราจัดเส้นทางให้อยู่ บนคีย์เดียวที่มี การสลับสำรองอัตโนมัติอยู่ข้างใต้ และใช้ DSL การจัดเส้นทางเมื่อเพดานค่าใช้จ่ายควรอยู่ในเส้นทางมากกว่าในโค้ดแอปพลิเคชัน

A two-column scoreboard titled 'Claude Haiku 5.5 vs Ling 3.1 Flash - the scoreboard' with rows Index v4.3.2 43.40 against 41.09, cost per task $0.21 against $0.99, time per task 424.6s against 360.4s, Terminal Bench 4.0 0.3283 against 0.3333, AutomationBench 0.3541 against 0.6174 and output tokens per task 162,164 against 100,671, footed 'All figures per Artificial Analysis Intelligence Index v4.3.2.'

เจ็ดแถวที่ทั้งสองค่าถูกวัด

Artificial Analysis เป็นบอร์ดเดียวที่ได้รันทั้งสองโมเดล และส่วนที่ทับซ้อนกันนั้นแคบแต่ให้ข้อมูลที่เป็นประโยชน์ แถวข้อมูลต่างๆ ไม่สอดคล้องกัน และทิศทางของความไม่สอดคล้องนั้นไม่ได้เกิดขึ้นแบบสุ่ม

• ดัชนี Intelligence Index v4.3.2 — Claude Haiku 5.5 (Max) ได้ 43.40 เทียบกับ 41.09 ของ Ling 3.1 Flash โดย Anthropic นำอยู่ 2.31 คะแนน

• ต้นทุนต่องาน Index ที่เสร็จแล้ว — $0.21 เทียบกับ $0.99 บนบอร์ดเดียวกัน

• เวลาต่อหนึ่งงาน Index — 424.6 วินาทีสำหรับ Claude Haiku 5.5 เทียบกับ 360.4 วินาทีสำหรับ Ling 3.1 Flash นี่คือแถวที่ความคาดหมายพังทลาย: โมเดลขนาด 560 พันล้านพารามิเตอร์เป็นตัวที่เร็วกว่าในสองตัวนี้เมื่อมองทั้งดัชนีโดยรวม เร็วกว่าประมาณ 15%

• Terminal Bench 4.0 — 0.3283 เทียบกับ 0.3333 Ling 3.1 Flash นำอยู่ครึ่งจุด ซึ่งบนเบนช์มาร์กที่ทั้งสองเจ้านำมาอ้างอิง ถือว่าเสมอกัน

• SciCode — 0.5498 เทียบกับ 0.5405 Claude Haiku 5.5 นำอยู่ 0.9 คะแนน และยังเสมอกันอีกด้วย

• Humanity's Last Exam แบบไม่ใช้เครื่องมือ — 0.4439 เทียบกับ 0.3943 Claude Haiku 5.5 นำอยู่ 5 คะแนน เป็นการแยกตัวออกจากกันอย่างแท้จริงครั้งแรก

• AutomationBench, คะแนนบางส่วน — 0.3541 เทียบกับ 0.6174 Ling 3.1 Flash นำอยู่ 26 คะแนน และมีส่วนต่างที่มากกว่าผลต่างอื่น ๆ ทั้งหมดในรายการนี้รวมกัน

มีอีกสองแถวที่อยู่นอกชุดที่ใช้ร่วมกันนั้น และคุ้มค่าที่จะใส่ไว้ เพราะมันคือแถวที่ผู้ซื้อสังเกตเห็นมากที่สุด บน GDPval-AA ซึ่ง Artificial Analysis ดำเนินการครอบคลุม 44 อาชีพ ทั้งสองมีค่า 1620.05 และ 1621.75 — เสมอกันทางสถิติ บน AA-Briefcase v1.1 ซึ่งเป็นการประเมินงานวิชาชีพรูปแบบยาวที่คิดคะแนนแบบ Elo Claude Haiku 5.5 ทำได้ 1577.72 เทียบกับ 1400.35 ของ Ling 3.1 Flash เป็นช่องว่าง 177 คะแนนในความได้เปรียบของ Anthropic นั่นคือช่องว่างที่ไม่เกี่ยวกับเอเจนต์ที่กว้างที่สุดระหว่างทั้งสองในทุกที่บนบอร์ด

แถวเดียวที่ควรเป็นตัวตัดสินบทสนทนาเหล่านี้ส่วนใหญ่

ค่าเฉลี่ยระดับดัชนีซ่อนว่าเวลาและเงินจริง ๆ นั้นหมดไปอยู่ที่ไหน และคู่นี้คือกรณีที่ชัดเจนที่สุดของเรื่องนั้นในชุดนี้ ตัวเลขต่อการประเมินแต่ละครั้งบน Terminal Bench 4.0 ไม่ใกล้เคียงกันในมิติใดเลย ยกเว้นคะแนน

• Terminal Bench 4.0, Ling 3.1 Flash — 0.3333 ที่ $5.49 ต่อหนึ่งงาน และ 1,283 วินาทีต่อหนึ่งงาน

• Terminal Bench 4.0, Claude Haiku 5.5 — 0.3283 ที่ $0.65 ต่องาน และ 908 วินาทีต่องาน

คะแนนห่างกันเพียงห้าในพันของหนึ่งคะแนน ค่าใช้จ่ายอยู่ที่ 8.4× และเวลาที่ใช้จริงอยู่ที่ 1.4× ทีมที่อ่านตาราง benchmark แล้วเลือกโมเดลที่ได้คะแนน 0.3333 ตามการคำนวณของ Artificial Analysis เอง ได้เลือกจ่ายแพงกว่าแปดเท่าเพื่อไปถึงช้ากว่าหนึ่งในสามของนาทีโดยได้คำตอบเดียวกัน

นี่ไม่ใช่ข้อโต้แย้งว่าคะแนนไม่มีความหมาย แต่เป็นข้อโต้แย้งว่าคะแนนคืออัตราส่วนระหว่างงานที่ทำสำเร็จกับงานที่พยายามทำ และไม่ได้บอกอะไรเกี่ยวกับทรัพยากรที่ใช้ไปกว่าจะไปถึงตรงนั้นเลย เบนช์มาร์กของงานที่ทำสำเร็จโดยเอเจนต์เป็นบริบทที่ความแตกต่างนี้ส่งผลหนักที่สุดพอดี เพราะเอเจนต์ที่ลองใหม่คือเอเจนต์ที่จ่ายเต็มราคาทุกครั้งที่ลองใหม่ และโมเดลที่มีต้นทุนต่อความพยายามสูงกว่าแปดเท่าจะเปลี่ยนลูปการลองใหม่ให้กลายเป็นรายการงบประมาณ

A capture of the Artificial Analysis model page for Claude Haiku 5.5 (Max), showing its standing chips of Intelligence #21/182, Speed #91/182, Cost #46/182 and Verbosity #62/182, the rates $0.10 in and $0.50 out with a 90% cache discount, a cost of $0.21 per task, 440M generated tokens, and the summary line that Claude Haiku 5.5 scores 43 on the Intelligence Index against a median of 13.

พารามิเตอร์ 560 พันล้านตัวโดยไม่มีอะไรต้องดาวน์โหลด

นี่คือส่วนของตารางสเปกของ Ling 3.1 Flash ที่แปลกอย่างแท้จริง และมันไม่ใช่เรื่องขนาด

Ling 3.1 Flash เป็นโมเดล sparse mixture-of-experts — มีพารามิเตอร์รวม 5.6 แสนล้านตัว และเปิดใช้งาน 2.5 หมื่นล้านตัวต่อโทเคน — และ Artificial จัดประเภทให้เป็นโมเดลแบบกรรมสิทธิ์ ไม่มีน้ำหนักโมเดล ไม่มีไฟล์สัญญาอนุญาต และไม่มีรีโพซิทอรี โมเดลสแปร์สที่มีลักษณะเช่นนี้ปกติจะเปิดให้ใช้แบบเปิด เพราะนั่นคือสิ่งที่โมเดลอื่นในระดับนี้ทำ: GLM 5.3 Flash เผยแพร่น้ำหนักโมเดลภายใต้ MIT โดยมีพารามิเตอร์รวม 3.2 แสนล้านตัวและเปิดใช้งาน 1.8 หมื่นล้านตัว และ DeepSeek V4.1 Flash เผยแพร่น้ำหนักโมเดลภายใต้ MIT โดยมีพารามิเตอร์รวม 5.52 แสนล้านตัวและเปิดใช้งาน 1.6 หมื่นล้านตัว Ling 3.1 Flash เป็นสถาปัตยกรรมชนิดเดียวกันในระดับขนาดเดียวกัน แต่เผยแพร่เป็น API เท่านั้น

ทางเลือกนั้นมีผลที่ตามมาซึ่งแถวใน benchmark ไม่ได้แสดงให้เห็น โมเดลที่มีพารามิเตอร์ active 25 พันล้านต้องถูกเสิร์ฟที่ใดที่หนึ่ง และถ้าคุณถือเช็กพอยต์เองไม่ได้ คุณก็เลือกไม่ได้ว่าจะเสิร์ฟที่ไหนหรือที่อัตรากำไรเท่าใด — คุณต้องเช่าการเสิร์ฟโมเดลนั้นจากผู้ขาย ราคาต่อ task บน Terminal Bench ที่ 5.49 ดอลลาร์ข้างต้นไม่ใช่ผลจากอัตราค่าโทเคนเป็นหลัก แต่เป็นค่าใช้จ่ายในการเช่าโมเดล sparse ขนาดใหญ่จากฝ่ายเดียวที่รันมันได้ โมเดล open-weights พี่น้องในระดับเดียวกันนี้ให้ทางเลือกแก่คุณในการขยับตัวเลขนั้นด้วยตัวเอง

มันก็ให้ผลในทางกลับกันเช่นกัน และความซื่อสัตย์แบบเดียวกันก็ใช้เช่นกัน การเปิดตัวแบบเปิดไม่ได้หมายความว่าเป็นผลิตภัณฑ์ที่ดีกว่าอัตโนมัติ: คุณต้องรับภาระการให้บริการ การเลือก quantization และลู่วิ่งการอัปเกรดไปพร้อมกับ weights และไฟล์สัญญาอนุญาตไม่ใช่สัญญาการสนับสนุน Anthropic เผยแพร่คำมั่นเรื่องการเลิกให้บริการสำหรับ Claude Haiku 5.5 ว่าไม่ก่อนวันที่ 7 ตุลาคม 2027 บน first-party API พร้อม system card การที่คุณต้องการรูปแบบใดในสองแบบนั้นเป็นคำถามเกี่ยวกับทีมของคุณ ไม่เกี่ยวกับโมเดลใดในสองตัวนี้

Ling 3.1 Flash ใช้สำหรับอะไร

อ่านโปรไฟล์ทั้งหมดแล้วจะเห็นว่ามันอธิบายผลิตภัณฑ์ที่สอดคล้องเป็นเนื้อเดียวมากกว่าผลิตภัณฑ์ที่ต้องประนีประนอม นั่นคือโมเดลบริบทขนาดยาวแบบกระจัดกระจายขนาดใหญ่ที่ทำงานหลายขั้นตอนอัตโนมัติได้จนจบดีกว่าสิ่งอื่นใดที่วัดในช่วงราคานี้ ไม่โดดเด่นในการให้เหตุผลแบบครั้งเดียวที่ยาก และทำเช่นนั้นในอัตราคงที่โดยไม่มีความชันจากความยาวพรอมป์ต บน AutomationBench มันนำ Claude Haiku 5.5 อยู่ 26 คะแนน และคะแนน AA-Briefcase ของมันเป็นจุดเดียวในการเปรียบเทียบนี้ที่มันอยู่หลังกลางกลุ่มแทนที่จะอยู่แนวหน้า

นั่นเป็นคำอธิบายที่สมเหตุสมผลของเวิร์กเกอร์แบบเอเจนต์ที่ทำงานเป็นชุด: ให้มันทำงานกับคิวของงานที่มีโครงสร้างซึ่งแต่ละงานต้องทำให้เสร็จ ยอมรับว่างานนี้วัดกันเป็นนาที คงพรอมป์ตให้ยาวพอที่ขั้นเกณฑ์หนึ่งจะกลายเป็นเรื่องลงโทษ และให้ความสำคัญกับความน่าเชื่อถือ ณ เส้นชัยเหนือต้นทุนของโทเคนใด ๆ เพียงหนึ่งโทเคน สิ่งที่มันไม่เหมาะจะทำคือสิ่งที่โมเดลระดับ flash-tier มักถูกซื้อมาเพื่อทำ มันรับข้อความเท่านั้น — ไม่มีอินพุตรูปภาพเลย ในขณะที่ Claude Haiku 5.5 รับทั้งข้อความและรูปภาพ เวลางาน index ของมันสั้นกว่า แต่เวลางาน Terminal Bench ของมันยาวกว่า และที่ $0.99 ต้องาน index ที่เสร็จสิ้นหนึ่งงาน เทียบกับ $0.21 มันใช้จ่ายมากกว่าถึงสี่เท่าครึ่งเพื่อไปให้ถึงคะแนนคอมโพสิตที่เกือบเท่ากัน

A capture of InclusionAI's Ling Studio playground with the model selector reading Ling-3.1-flash, a Model Settings panel showing temperature 0.6, top_k 20 and Thinking enabled, tabs for Chat, Prompt, Agent, explore and Tools, and tool toggles for Web Search, Time Query and Weather Query.

อันไหนในสองอัน จากหลักฐานที่มีอยู่

ถ้างานของคุณคือข้อความเข้า ข้อความออก คิดราคาต่อโทเคนในระดับปริมาณมาก Claude Haiku 5.5 ชนะการเปรียบเทียบนี้ในทุกรายการที่ไปถึงใบแจ้งหนี้: ต้นทุนงานตามดัชนีต่ำกว่า ต้นทุนงานจริงต่ำกว่าในเบนช์มาร์กที่สำคัญที่สุดสำหรับเอเจนต์ คะแนนรวมสูงกว่า คะแนนงานมืออาชีพระยะยาวดีกว่า ความเที่ยงตรงดีกว่า และการป้อนภาพที่โมเดลอีกตัวไม่มีให้เลย

ถ้างานของคุณคือเอเจนต์ที่ไม่ต้องมีคนดูแลและต้องทำเวิร์กโฟลว์หลายขั้นตอนให้เสร็จ Ling 3 Flash ทำคะแนนสูงกว่า Claude Haiku 5.5 อยู่ 26 คะแนนบนเบนช์มาร์กที่ใช้ร่วมกันเพียงตัวเดียวที่วัดสิ่งนี้โดยตรง และนั่นก็คุ้มค่าที่จะทดสอบ มากกว่าจะตัดทิ้งเพราะเรื่องราคา ทดสอบมันกับ trace ของคุณเอง ไม่ใช่บนตารางนี้ — และคิดราคาการทดสอบต่อหนึ่งงานที่ทำเสร็จ เพราะนั่นคือตัวเลขที่เปลี่ยนไปเมื่อเอเจนต์ลองใหม่

หากคุณจำเป็นต้องถือเวตเอง ทั้งสองตัวนี้ก็ไม่ใช่โมเดลของคุณ Ling 3.1 Flash เป็นโมเดลปิดที่มี 560 พันล้านพารามิเตอร์; Claude Haiku 5.5 เป็นโมเดลปิดโดยไม่มีการเปิดเผยจำนวน ส่วนรุ่นเปิดในระดับนี้อยู่ที่อื่นบนบอร์ด และการเปรียบเทียบนั้นเริ่มจากชุดแถวที่แตกต่างออกไปทั้งหมด

คะแนนรวมบอกว่า 2.31 คะแนน เบนช์มาร์กแบบเอเจนติกบอกว่า 26 ไปในทิศทางตรงกันข้าม ตารางราคาบอก 3× สำหรับอินพุต ส่วนต้นทุนเมื่องานเสร็จบอก 4.6× ในทิศทางเดียวกับตารางราคา ตัวเลขสี่ตัว สองทิศทาง — ซึ่งเป็นเหตุผลว่าวิธีเดียวที่เชื่อถือได้ในการสะสางเรื่องนี้ คือรันทั้งคู่กับเทรซงานของคุณเอง แล้วอ่านต้นทุนจากงานที่ทำเสร็จ แทนที่จะอ่านจากโทเคน

การเปรียบเทียบในบทความนี้1

ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube