การ์ดฮีโร่ที่สร้างขึ้นชื่อ 'Claude Haiku 5.5 กับ Nemotron 3.5 Lightning 30B A3B Base' พร้อมคำโปรย 'ตัวที่ถูกกว่าตอบคำถามไม่ได้' และชิปที่ระบุ $0.10 กับ $0.06 ต่อโทเค็นอินพุตหนึ่งล้าน, AA Index 43 เทียบกับ 13, และพร้อมตอบ เทียบกับเช็กพอยต์ฐาน
Guides & Insights

Claude Haiku 5.5 vs Nemotron 3.5 Lightning 30B A3B Base: ตัวที่ราคาถูกตอบคำถามไม่ได้

ผู้เขียน

Elias Hawthorne

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

ในตัวเลขสองตัวที่สเปรดชีตจัดซื้อให้ความสำคัญมากที่สุด โมเดลที่ถูกกว่าและเร็วกว่าคือผู้ชนะ Nemotron 3.5 Lightning 30B A3B Base ทำงานที่ 298.9 โทเคนเอาต์พุตต่อวินาที เร็วที่สุดในบรรดา 142 โมเดลที่ติดตามอย่างอิสระ และมีค่าใช้จ่าย $0.06 ต่อล้านโทเคนอินพุต เทียบกับ $0.10 ของ Claude Haiku 5.5 มันยังไม่ใช่ผู้ช่วย อย่างที่คำว่า "Base" ในชื่อกำลังเตือนคุณอยู่ มันเป็นเช็กพอยต์ที่ผ่านการฝึกมาก่อน — ไม่มีการปรับละเอียดแบบมีผู้สอน ไม่มีการเรียนรู้แบบเสริมกำลัง ไม่มีเทมเพลตแชตที่เรียกได้เต็มปาก — เผยแพร่ภายใต้สัญญาอนุญาต OpenMDW-1.1 เมื่อวันที่ 11 สิงหาคม 2026 เพื่อให้คนอื่นสร้างต่อยอดบนมันได้ Claude Haiku 5.5 ซึ่งเปิดตัวเมื่อวันที่ 7 ตุลาคม 2026 เป็นผลิตภัณฑ์สำเร็จรูปที่คุณส่งคำถามไปถามได้ การเปรียบเทียบราคาของทั้งสองก็เหมือนการเปรียบเทียบต้นทุนของแป้งกับต้นทุนของขนมปัง และส่วนที่น่าสนใจของการจับคู่นี้คือการหาว่างานของคุณต้องการตัวไหนจริง ๆ

ไม่มีใครในการรายงานข่าวการเปิดตัวพูดประเด็นนั้นอย่างชัดเจน เพราะ "ถูกกว่าและเร็วกว่า Claude Haiku 5.5" เป็นพาดหัวข่าวที่ดีกว่า "ถูกกว่า เร็วกว่า และใช้งานไม่ได้หากไม่รัน fine-tuning สักรอบ" ข้อความทั้งสองเป็นความจริง มีเพียงข้อเดียวเท่านั้นที่มีประโยชน์

แต่ละโมเดลจริงๆ แล้วคืออะไร

Claude Haiku 5.5 — Anthropic, ID claude-haiku-5-5 เปิดตัวเมื่อวันที่ 7 ตุลาคม 2026 รับข้อความและภาพเข้า ส่งออกเป็นข้อความ คอนเท็กซ์ขนาด 1M โทเคน เอาต์พุตสูงสุด 128,000 โทเคน (300,000 โทเคนเมื่อใช้ beta header บน Batch API) จุดตัดการฝึกอบรมคือมิถุนายน 2026 จะไม่ถูกยกเลิกก่อนวันที่ 7 ตุลาคม 2027 ปรับระดับความพยายามได้ตั้งแต่ Low, Medium, High, Xhigh และ Max โดยค่าเริ่มต้นคือ Medium พร้อมเปิดใช้ adaptive thinking เป็นค่าเริ่มต้น คิดค่าบริการผ่าน API แบบมิเตอร์ โดยการอ่านแคชราคา $0.01 ต่อล้าน และ Batch คิดครึ่งราคา ใช้งานได้ผ่าน API ของ Anthropic และจากตรงนั้น ผ่านช่องทางใดก็ตามที่มีการจำหน่ายโมเดลของ Anthropic ต่อ

Nemotron 3.5 Lightning 30B A3B Base — NVIDIA ประกาศเมื่อวันที่ 11 สิงหาคม 2026 เป็นเช็กพอยต์แบบไฮบริด mixture-of-experts ขนาด 3 หมื่นล้านพารามิเตอร์ โดยมีพารามิเตอร์ที่ทำงานจริงราว 3 พันล้านตัวต่อโทเคน สร้างอยู่บนสแต็ก Mamba-2 ร่วมกับ MoE และ attention กลั่นมาจาก Nemotron 3 Ultra และจัดส่งมาพร้อมการถอดรหัสแบบคาดการณ์ล่วงหน้า MTP, DFlash และ DSpark บริบทรองรับได้ถึง 1 ล้านโทเคน แม้ว่าประมาณ 256,000 จะเป็นเพดานที่ใช้ได้จริงบน H100 เครื่องเดียว เป็นแบบข้อความล้วน น้ำหนักโมเดลเปิดให้ใช้ภายใต้ OpenMDW-1.1 และเป็นเช็กพอยต์พื้นฐาน: น้ำหนักดิบที่ฝึกมาก่อนโดยไม่มีการปรับแต่งตามคำสั่ง ซึ่งหมายความว่ามันเติมข้อความต่อมากกว่าที่จะทำตามคำสั่ง

A generated two-column scoreboard titled 'Claude Haiku 5.5 vs Nemotron 3.5 Lightning 30B A3B Base — the scoreboard'. Claude Haiku 5.5 reads output speed 243.4 tokens per second, AA Index 43, proprietary weights, instruction-tuned yes, $0.10 per million input and $0.21 per task; the Nemotron column reads output speed 298.9 tokens per second, AA Index 13, weights open under OpenMDW-1.1, instruction-tuned no — base checkpoint, $0.06 per million input and $0.09 per task. A footer notes the Artificial Analysis figures are independently run and the NVIDIA figures are vendor-reported and unreproduced.

• ขนาดต่าง ๆ บรรทัดละหนึ่งช่อง

• ราคาอินพุต — Claude Haiku 5.5 $0.50 ต่อล้านโทเคนถึง 100K โทเคน จากนั้น $0.50; Nemotron 3.5 Lightning 30B A3B Base $0.06 ต่อล้าน

• ราคาเอาต์พุต — 0.50 ดอลลาร์ต่อล้านโทเคน จนถึง 100K โทเคน จากนั้น 2.50 ดอลลาร์ เทียบกับ 0.20 ดอลลาร์ต่อล้าน

• ต้นทุนต่องานที่เสร็จสมบูรณ์ — $0.21 ต่องานจัดทำดัชนีอิสระหนึ่งงานสำหรับ Claude Haiku 5.5 เทียบกับ $0.09 สำหรับ Nemotron — โมเดลที่ถูกกว่ามีต้นทุนต่องานที่ต่ำกว่า ไม่ใช่แค่ต่อโทเคน

• ความเร็วเอาต์พุต — 243.4 โทเคนต่อวินาทีสำหรับ Claude Haiku 5.5 เป็นอันดับที่ 9 จาก 182; 298.9 โทเคนต่อวินาทีสำหรับ Nemotron เป็นอันดับที่ 1 จาก 142

• เวลาถึงโทเคนแรก — ประมาณ 0.3 วินาทีสำหรับ Claude Haiku 5.5 เทียบกับ 0.54 วินาทีสำหรับ Nemotron

• คะแนนอิสระ — Artificial Analysis Intelligence Index 43 สำหรับ Claude Haiku 5.5 เป็นอันดับที่ 2 จาก 182 โดยการตั้งค่า Max อยู่ที่ 43.40; Index 13 สำหรับ Nemotron เป็นอันดับที่ 29 จาก 142

• หน้าต่างบริบท — 1,000,000 โทเค็นแต่ละรายการ โดยใช้งานได้จริงประมาณ 256,000 สำหรับ Nemotron บน H100 เครื่องเดียว

• โมดัลลิตี — อินพุตข้อความและรูปภาพสำหรับ Claude Haiku 5.5; อินพุตเฉพาะข้อความสำหรับ Nemotron

• เวต — แบบปิด (proprietary) เมื่อเทียบกับแบบเปิดภายใต้ OpenMDW-1.1 เป็น MoE แบบไฮบริดที่มีพารามิเตอร์รวม 30B และพารามิเตอร์ที่แอคทีฟ 3B

• Instruction tuning — มีอยู่ใน Claude Haiku 5.5 แต่ไม่มีใน Base checkpoint

ปัญหา "Base" ที่กล่าวอย่างตรงไปตรงมา

เช็กพอยต์ฐานจะทำนายโทเคนถัดไป เมื่อคุณถามคำถามกับมัน มันมักจะเขียนข้อความต่อในสไตล์ของเอกสารที่อาจมีคำถามลักษณะนั้นอยู่ แทนที่จะตอบคำถาม หากป้อนพรอมป์ต์ว่า “สรุปสัญญานี้” โมเดลฐานอาจสร้างข้อความต่อที่ดูสมเหตุสมผลของเอกสารฝึกด้านกฎหมาย แทนที่จะเป็นบทสรุปสัญญาของคุณ NVIDIA เผยแพร่เช็กพอยต์ BF16 แยกต่างหาก และโมเดลพี่น้องที่ปรับแต่งตามคำสั่งแยกต่างหาก ก็เพราะน้ำหนักฐานเป็นเพียงวัตถุดิบ

บนการ์ดโมเดลของ NVIDIA เอง — ซึ่งเป็นข้อมูลที่ผู้ขายรายงาน ไม่ได้ทำซ้ำโดยอิสระ — เช็กพอยต์ฐานได้คะแนน 78.59 บน MMLU, 67.94 บน MMLU-Pro, 91.28 บน GSM8K, 77.44 บน HumanEval และ 69.62 บน RULER ที่ 1M โทเคน การ์ด Lightning สำหรับรุ่นพี่น้องที่ปรับแต่งแล้วรายงานว่า MMLU-Pro 81.94, GPQA Diamond 75.44, SWE-Bench Verified 51.56 และ 86% บน PinchBench โดยมีการอนุมานเร็วขึ้นราว 30% เมื่อเทียบกับโมเดลที่มันเข้ามาแทนที่ แม้แต่ตัวเลขของรุ่นที่ปรับแต่งแล้วก็ยังเป็นของ NVIDIA เอง และตัวเลขฐานคือชุดที่ใช้กับเช็กพอยต์ที่ระบุชื่อในชื่อเรื่องของบทความนี้ เมื่อเทียบกับตัวเลขเหล่านั้น คะแนน 43.40 ที่วัดอย่างอิสระของ Claude Haiku 5.5 — ซึ่งเป็นอันดับสองจาก 182 ในดัชนีของ Artificial Analysis เป็นดัชนีที่แตกต่างซึ่งวัดสิ่งที่แตกต่างกัน — ไม่สามารถเปรียบเทียบกันได้โดยตรง และการตีความอย่างซื่อตรงก็คือ เช็กพอยต์ฐานขนาด 30B กับโมเดลเล็กที่เสร็จสมบูรณ์แล้วกำลังถูกให้คะแนนด้วยเครื่องมือที่แตกต่างกันเพื่อจุดประสงค์ที่แตกต่างกัน

สิ่งที่กล่าวได้อย่างไม่มีข้อกำกับใด ๆ คือรูปร่างของช่องว่างนั้น เช็กพอยต์พื้นฐานที่ต้องมีไปป์ไลน์ fine-tuning, สแต็กสำหรับให้บริการ และชุดเครื่องมือประเมินผล ก่อนที่จะตอบอะไรได้นั้น ไม่ใช่สิ่งทดแทนโมเดลแบบโฮสต์ที่ราคา $0.10 ต่อล้าน มันเป็นจุดเริ่มต้นสำหรับคนที่อยากเป็นเจ้าของโมเดลเอง

จุดที่ Nemotron ชนะอย่างแท้จริง และมันไม่ใช่รางวัลปลอบใจ

ความเร็วต้องมาก่อน ด้วย 298.9 โทเค็นเอาต์พุตต่อวินาที ทำให้มันอยู่บนสุดของลีดเดอร์บอร์ดที่มี 142 โมเดล — เร็วกว่าค่า 243.4 ของ Claude Haiku 5.5 ถึง 23% สำหรับไปป์ไลน์ที่ไวต่อความหน่วง นั่นคือความแตกต่างจริงและวัดผลได้ และเป็นเหตุผลที่ชื่อ "Lightning" อยู่บนกล่อง

ความเป็นโอเพนเวตส์มาเป็นอันดับสอง และนี่คือข้อที่ใหญ่กว่า ภายใต้ OpenMDW-1.1 คุณสามารถดาวน์โหลดเช็กพอยต์ ปรับจูนด้วยข้อมูลของคุณเอง และให้บริการด้วยตัวเองได้ Claude Haiku 5.5 ไม่สามารถปรับจูนได้เลย และไม่สามารถโฮสต์เองได้ไม่ว่าจะจ่ายราคาใด สำหรับทีมที่มีงานเฉพาะทาง การกระจายอินพุตที่ผิดปกติ หรือข้อกำหนดด้านการปฏิบัติตามกฎระเบียบที่ว่าทราฟฟิกต้องไม่ออกจากโครงสร้างพื้นฐานของตนเอง ความแตกต่างนี้ถือเป็นตัวชี้ขาด ไม่ว่าหน้าเบนช์มาร์กจะระบุว่าอย่างไร โมเดลขนาดรวม 30B ที่มี 3B แอ็กทีฟก็เล็กพอที่จะให้บริการได้อย่างคุ้มค่าในเชิงเศรษฐกิจ — สถาปัตยกรรมนี้ออกแบบมาเพื่อสิ่งนั้นโดยเฉพาะ

ราคาอยู่อันดับที่สาม: $0.06 สำหรับอินพุต และ $0.20 สำหรับเอาต์พุตต่อล้าน พร้อมส่วนลดแคช 17% และ $0.09 ต่องานจัดทำดัชนี คิดเป็นประมาณครึ่งหนึ่งของ $0.21 ของ Claude Haiku 5.5 ทั้งสองโมเดลมีราคาถูก โดย Nemotron ถูกกว่า

ในจุดที่ Claude Haiku 5.5 เหนือกว่า ซึ่งก็คือทุกมิติที่ต้องอาศัยคำตอบ

การทำตามคำสั่ง เพราะมันถูกฝึกมาเพื่อสิ่งนี้ ความสามารถอิสระ ที่ Index 43 เทียบกับ 13 — ช่องว่าง 30 คะแนนบนบอร์ดที่ให้คะแนนทั้งสอง ซึ่งเป็นช่องว่างแบบนี้ที่ใหญ่ที่สุดในชุดการเปรียบเทียบนี้ อินพุตรูปภาพ ซึ่ง Nemotron ไม่รองรับเลย เอาต์พุตสูงสุดที่ 128,000 โทเค็น เทียบกับตัวเลขที่ยังไม่เปิดเผย โดยมีเส้นทางเบต้า 300,000 โทเค็นบน Batch และปุ่มปรับ effort ซึ่งให้คุณได้ต้นทุนคืนมาโดยการลด reasoning effort แทนที่จะสร้างโมเดลใหม่

ข้อแม้เรื่องความเยิ่นเย้อใช้ได้ทั้งสองทางตรงนี้ บนชุดทดสอบของ Artificial Analysis นั้น Claude Haiku 5.5 ปล่อยโทเคนเอาต์พุตประมาณ 440 ล้านโทเคน เทียบกับค่ามัธยฐานที่ราว 100 ล้านโทเคน — มันคิดเยอะมากทีเดียว ส่วน Nemotron ปล่อยราว 120 ล้าน ซึ่งแหล่งเดียวกันอธิบายว่าค่อนข้างช่างพูดเมื่อเทียบกับขนาดของมัน ถึงกระนั้น ต้นทุนต่องานของ Haiku 5.5 ก็อยู่ที่ $0.21 เทียบกับ $0.09 ของ Nemotron ดังนั้นแม้แต่โมเดลที่ช่างพูดก็ไม่ใช่ตัวที่แพง สิ่งที่บอกได้จากตรงนี้คือ ราคาต่อโทเคนทำให้เข้าใจผิดได้ทั้งสองทาง และตัวเลขต่องานคือตัวที่ควรใช้ตั้งงบประมาณ

โฮสต์เองเทียบกับเอนด์พอยต์เดียว

Nemotron 3.5 Lightning 30B A3B Base ถูกเผยแพร่ในรูปแบบโอเพนเวท (open weights) และให้บริการโดยผู้ให้บริการอินเฟอเรนซ์หลายราย ส่วน NVIDIA ก็เผยแพร่รุ่นพี่น้องที่ผ่านการปรับแต่งด้วย Claude Haiku 5.5 เปิดให้ใช้งานผ่าน API ของ Anthropic และจากตรงนั้นก็ไปถึงทุกที่ที่มีการขายต่อโมเดลของ Anthropic ทั้งสองรุ่นไม่ได้อยู่ในแคตตาล็อกของ OrcaRouter และเราจะไม่แกล้งทำเป็นอย่างอื่น — สิ่งที่เราเราเตอร์จากย่านนี้คือ anthropic/claude-haiku-4.5, anthropic/claude-sonnet-5.5, anthropic/claude-opus-5.5 และ anthropic/claude-fable-5.1 ซึ่งเป็นระดับที่สูงขึ้นไปจากหัวข้อของบทความนี้

สองเส้นทางที่การเปรียบเทียบนี้กล่าวถึงนั้นมีโครงสร้างพื้นฐานที่แตกต่างกันจริง ๆ และก็คุ้มค่าที่จะเอ่ยชื่อทั้งสองออกมา เส้นทางแบบโฮสต์เองหมายถึง GPU หนึ่งตัว เฟรมเวิร์กสำหรับให้บริการ การตัดสินใจเรื่องการควอนไทซ์ และการหมุนเวียนทีมปฏิบัติการ ส่วนเส้นทางแบบโฮสต์หมายถึงคีย์หนึ่งอันกับสตริงชื่อโมเดลหนึ่งสตริง OrcaRouter มีอยู่เพื่อรองรับเส้นทางที่สอง: API เดียวสำหรับโมเดลกว่า 200 รายการ คีย์เดียวและบิลเดียว โดยราคาตั้งต้นของผู้ให้บริการถูกส่งผ่านด้วยมาร์กอัป 0% ส่วนแบ่งของผู้ขายจึงเปิดใช้งานได้ในวันเดียวกัน พร้อมกับระบบสลับสำรองอัตโนมัติที่อยู่เบื้องหลัง มันไม่ใช่เส้นทางไปสู่เช็กพอยต์ฐานขนาด 30B และการซื้อเครื่องระดับ DGX ก็ไม่ใช่เส้นทางไปสู่โมเดลขนาดเล็กแบบโฮสต์

A capture of Anthropic's Claude Platform models documentation showing the current Claude lineup — Claude Fable 5.1, Claude Opus 5.5, Claude Sonnet 5.5 and Claude Haiku 5.5 — with each model's context window, maximum output and per-million input and output pricing.

ใครควรเลือกอันไหน

หากงานของคุณมีนิยามชัดเจนแล้ว ข้อมูลฝึกของคุณมีมากพอที่จะมีความสำคัญ และทราฟฟิกของคุณไม่สามารถออกจากโครงสร้างพื้นฐานของคุณเองได้ Nemotron 3.5 Lightning 30B A3B Base คือสิ่งที่่น่าสนใจกว่า: เร็วที่สุดในบรรดา 142 ตัวในด้านความเร็วเอาต์พุต ราคาต่อโทเคนถูกกว่าครึ่ง และเป็นของคุณที่จะปรับแก้ได้ ตั้งงบสำหรับการรัน fine-tuning และต้นทุนการให้บริการก่อนที่คุณจะนับผลประหยัด เพราะอัตราอินพุต $0.06 นั้นสมมติว่ามีใครบางคนทำงานที่เปลี่ยนเช็กพอยต์ให้กลายเป็นผู้ช่วยไปแล้ว

ถ้าคุณต้องการส่งพรอมต์แล้วได้คำตอบภายในบ่ายนี้ Claude Haiku 5.5 คือตัวที่ทำได้ — ได้ 43 คะแนนบนดัชนีอิสระ เทียบกับ 13 รับอินพุตรูปภาพได้ เพดานเอาต์พุต 128,000 โทเคน และราคาที่น้อยจริง ๆ การเปรียบเทียบดูใกล้เคียงกันแค่บนตารางราคาเท่านั้น มันจะเลิกดูใกล้เคียงทันทีที่งานคือการตอบคำถาม แทนที่จะเป็นการเขียนเอกสารต่อ

A capture of the Artificial Analysis page for Nemotron 3.5 Lightning showing its Intelligence Index of 13 and rank of 29 of 142, the $0.06 per-million input and $0.20 output pricing, the $0.09 cost per index task, the 298.9 tokens-per-second output speed ranked first of 142, the 0.54-second time to first token, the 1M-token context window, text-only input and open weights.
© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube