
Claude Haiku 5.5 vs Nemotron 3.5 Lightning 30B A3B Base: ตัวที่ราคาถูกตอบคำถามไม่ได้
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIOpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- AnthropicAnthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIGrok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 56 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 347 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
ในตัวเลขสองตัวที่สเปรดชีตจัดซื้อให้ความสำคัญมากที่สุด โมเดลที่ถูกกว่าและเร็วกว่าคือผู้ชนะ Nemotron 3.5 Lightning 30B A3B Base ทำงานที่ 298.9 โทเคนเอาต์พุตต่อวินาที เร็วที่สุดในบรรดา 142 โมเดลที่ติดตามอย่างอิสระ และมีค่าใช้จ่าย $0.06 ต่อล้านโทเคนอินพุต เทียบกับ $0.10 ของ Claude Haiku 5.5 มันยังไม่ใช่ผู้ช่วย อย่างที่คำว่า "Base" ในชื่อกำลังเตือนคุณอยู่ มันเป็นเช็กพอยต์ที่ผ่านการฝึกมาก่อน — ไม่มีการปรับละเอียดแบบมีผู้สอน ไม่มีการเรียนรู้แบบเสริมกำลัง ไม่มีเทมเพลตแชตที่เรียกได้เต็มปาก — เผยแพร่ภายใต้สัญญาอนุญาต OpenMDW-1.1 เมื่อวันที่ 11 สิงหาคม 2026 เพื่อให้คนอื่นสร้างต่อยอดบนมันได้ Claude Haiku 5.5 ซึ่งเปิดตัวเมื่อวันที่ 7 ตุลาคม 2026 เป็นผลิตภัณฑ์สำเร็จรูปที่คุณส่งคำถามไปถามได้ การเปรียบเทียบราคาของทั้งสองก็เหมือนการเปรียบเทียบต้นทุนของแป้งกับต้นทุนของขนมปัง และส่วนที่น่าสนใจของการจับคู่นี้คือการหาว่างานของคุณต้องการตัวไหนจริง ๆ
ไม่มีใครในการรายงานข่าวการเปิดตัวพูดประเด็นนั้นอย่างชัดเจน เพราะ "ถูกกว่าและเร็วกว่า Claude Haiku 5.5" เป็นพาดหัวข่าวที่ดีกว่า "ถูกกว่า เร็วกว่า และใช้งานไม่ได้หากไม่รัน fine-tuning สักรอบ" ข้อความทั้งสองเป็นความจริง มีเพียงข้อเดียวเท่านั้นที่มีประโยชน์
แต่ละโมเดลจริงๆ แล้วคืออะไร
Claude Haiku 5.5 — Anthropic, ID claude-haiku-5-5 เปิดตัวเมื่อวันที่ 7 ตุลาคม 2026 รับข้อความและภาพเข้า ส่งออกเป็นข้อความ คอนเท็กซ์ขนาด 1M โทเคน เอาต์พุตสูงสุด 128,000 โทเคน (300,000 โทเคนเมื่อใช้ beta header บน Batch API) จุดตัดการฝึกอบรมคือมิถุนายน 2026 จะไม่ถูกยกเลิกก่อนวันที่ 7 ตุลาคม 2027 ปรับระดับความพยายามได้ตั้งแต่ Low, Medium, High, Xhigh และ Max โดยค่าเริ่มต้นคือ Medium พร้อมเปิดใช้ adaptive thinking เป็นค่าเริ่มต้น คิดค่าบริการผ่าน API แบบมิเตอร์ โดยการอ่านแคชราคา $0.01 ต่อล้าน และ Batch คิดครึ่งราคา ใช้งานได้ผ่าน API ของ Anthropic และจากตรงนั้น ผ่านช่องทางใดก็ตามที่มีการจำหน่ายโมเดลของ Anthropic ต่อ
Nemotron 3.5 Lightning 30B A3B Base — NVIDIA ประกาศเมื่อวันที่ 11 สิงหาคม 2026 เป็นเช็กพอยต์แบบไฮบริด mixture-of-experts ขนาด 3 หมื่นล้านพารามิเตอร์ โดยมีพารามิเตอร์ที่ทำงานจริงราว 3 พันล้านตัวต่อโทเคน สร้างอยู่บนสแต็ก Mamba-2 ร่วมกับ MoE และ attention กลั่นมาจาก Nemotron 3 Ultra และจัดส่งมาพร้อมการถอดรหัสแบบคาดการณ์ล่วงหน้า MTP, DFlash และ DSpark บริบทรองรับได้ถึง 1 ล้านโทเคน แม้ว่าประมาณ 256,000 จะเป็นเพดานที่ใช้ได้จริงบน H100 เครื่องเดียว เป็นแบบข้อความล้วน น้ำหนักโมเดลเปิดให้ใช้ภายใต้ OpenMDW-1.1 และเป็นเช็กพอยต์พื้นฐาน: น้ำหนักดิบที่ฝึกมาก่อนโดยไม่มีการปรับแต่งตามคำสั่ง ซึ่งหมายความว่ามันเติมข้อความต่อมากกว่าที่จะทำตามคำสั่ง

• ขนาดต่าง ๆ บรรทัดละหนึ่งช่อง
• ราคาอินพุต — Claude Haiku 5.5 $0.50 ต่อล้านโทเคนถึง 100K โทเคน จากนั้น $0.50; Nemotron 3.5 Lightning 30B A3B Base $0.06 ต่อล้าน
• ราคาเอาต์พุต — 0.50 ดอลลาร์ต่อล้านโทเคน จนถึง 100K โทเคน จากนั้น 2.50 ดอลลาร์ เทียบกับ 0.20 ดอลลาร์ต่อล้าน
• ต้นทุนต่องานที่เสร็จสมบูรณ์ — $0.21 ต่องานจัดทำดัชนีอิสระหนึ่งงานสำหรับ Claude Haiku 5.5 เทียบกับ $0.09 สำหรับ Nemotron — โมเดลที่ถูกกว่ามีต้นทุนต่องานที่ต่ำกว่า ไม่ใช่แค่ต่อโทเคน
• ความเร็วเอาต์พุต — 243.4 โทเคนต่อวินาทีสำหรับ Claude Haiku 5.5 เป็นอันดับที่ 9 จาก 182; 298.9 โทเคนต่อวินาทีสำหรับ Nemotron เป็นอันดับที่ 1 จาก 142
• เวลาถึงโทเคนแรก — ประมาณ 0.3 วินาทีสำหรับ Claude Haiku 5.5 เทียบกับ 0.54 วินาทีสำหรับ Nemotron
• คะแนนอิสระ — Artificial Analysis Intelligence Index 43 สำหรับ Claude Haiku 5.5 เป็นอันดับที่ 2 จาก 182 โดยการตั้งค่า Max อยู่ที่ 43.40; Index 13 สำหรับ Nemotron เป็นอันดับที่ 29 จาก 142
• หน้าต่างบริบท — 1,000,000 โทเค็นแต่ละรายการ โดยใช้งานได้จริงประมาณ 256,000 สำหรับ Nemotron บน H100 เครื่องเดียว
• โมดัลลิตี — อินพุตข้อความและรูปภาพสำหรับ Claude Haiku 5.5; อินพุตเฉพาะข้อความสำหรับ Nemotron
• เวต — แบบปิด (proprietary) เมื่อเทียบกับแบบเปิดภายใต้ OpenMDW-1.1 เป็น MoE แบบไฮบริดที่มีพารามิเตอร์รวม 30B และพารามิเตอร์ที่แอคทีฟ 3B
• Instruction tuning — มีอยู่ใน Claude Haiku 5.5 แต่ไม่มีใน Base checkpoint
ปัญหา "Base" ที่กล่าวอย่างตรงไปตรงมา
เช็กพอยต์ฐานจะทำนายโทเคนถัดไป เมื่อคุณถามคำถามกับมัน มันมักจะเขียนข้อความต่อในสไตล์ของเอกสารที่อาจมีคำถามลักษณะนั้นอยู่ แทนที่จะตอบคำถาม หากป้อนพรอมป์ต์ว่า “สรุปสัญญานี้” โมเดลฐานอาจสร้างข้อความต่อที่ดูสมเหตุสมผลของเอกสารฝึกด้านกฎหมาย แทนที่จะเป็นบทสรุปสัญญาของคุณ NVIDIA เผยแพร่เช็กพอยต์ BF16 แยกต่างหาก และโมเดลพี่น้องที่ปรับแต่งตามคำสั่งแยกต่างหาก ก็เพราะน้ำหนักฐานเป็นเพียงวัตถุดิบ
บนการ์ดโมเดลของ NVIDIA เอง — ซึ่งเป็นข้อมูลที่ผู้ขายรายงาน ไม่ได้ทำซ้ำโดยอิสระ — เช็กพอยต์ฐานได้คะแนน 78.59 บน MMLU, 67.94 บน MMLU-Pro, 91.28 บน GSM8K, 77.44 บน HumanEval และ 69.62 บน RULER ที่ 1M โทเคน การ์ด Lightning สำหรับรุ่นพี่น้องที่ปรับแต่งแล้วรายงานว่า MMLU-Pro 81.94, GPQA Diamond 75.44, SWE-Bench Verified 51.56 และ 86% บน PinchBench โดยมีการอนุมานเร็วขึ้นราว 30% เมื่อเทียบกับโมเดลที่มันเข้ามาแทนที่ แม้แต่ตัวเลขของรุ่นที่ปรับแต่งแล้วก็ยังเป็นของ NVIDIA เอง และตัวเลขฐานคือชุดที่ใช้กับเช็กพอยต์ที่ระบุชื่อในชื่อเรื่องของบทความนี้ เมื่อเทียบกับตัวเลขเหล่านั้น คะแนน 43.40 ที่วัดอย่างอิสระของ Claude Haiku 5.5 — ซึ่งเป็นอันดับสองจาก 182 ในดัชนีของ Artificial Analysis เป็นดัชนีที่แตกต่างซึ่งวัดสิ่งที่แตกต่างกัน — ไม่สามารถเปรียบเทียบกันได้โดยตรง และการตีความอย่างซื่อตรงก็คือ เช็กพอยต์ฐานขนาด 30B กับโมเดลเล็กที่เสร็จสมบูรณ์แล้วกำลังถูกให้คะแนนด้วยเครื่องมือที่แตกต่างกันเพื่อจุดประสงค์ที่แตกต่างกัน
สิ่งที่กล่าวได้อย่างไม่มีข้อกำกับใด ๆ คือรูปร่างของช่องว่างนั้น เช็กพอยต์พื้นฐานที่ต้องมีไปป์ไลน์ fine-tuning, สแต็กสำหรับให้บริการ และชุดเครื่องมือประเมินผล ก่อนที่จะตอบอะไรได้นั้น ไม่ใช่สิ่งทดแทนโมเดลแบบโฮสต์ที่ราคา $0.10 ต่อล้าน มันเป็นจุดเริ่มต้นสำหรับคนที่อยากเป็นเจ้าของโมเดลเอง
จุดที่ Nemotron ชนะอย่างแท้จริง และมันไม่ใช่รางวัลปลอบใจ
ความเร็วต้องมาก่อน ด้วย 298.9 โทเค็นเอาต์พุตต่อวินาที ทำให้มันอยู่บนสุดของลีดเดอร์บอร์ดที่มี 142 โมเดล — เร็วกว่าค่า 243.4 ของ Claude Haiku 5.5 ถึง 23% สำหรับไปป์ไลน์ที่ไวต่อความหน่วง นั่นคือความแตกต่างจริงและวัดผลได้ และเป็นเหตุผลที่ชื่อ "Lightning" อยู่บนกล่อง
ความเป็นโอเพนเวตส์มาเป็นอันดับสอง และนี่คือข้อที่ใหญ่กว่า ภายใต้ OpenMDW-1.1 คุณสามารถดาวน์โหลดเช็กพอยต์ ปรับจูนด้วยข้อมูลของคุณเอง และให้บริการด้วยตัวเองได้ Claude Haiku 5.5 ไม่สามารถปรับจูนได้เลย และไม่สามารถโฮสต์เองได้ไม่ว่าจะจ่ายราคาใด สำหรับทีมที่มีงานเฉพาะทาง การกระจายอินพุตที่ผิดปกติ หรือข้อกำหนดด้านการปฏิบัติตามกฎระเบียบที่ว่าทราฟฟิกต้องไม่ออกจากโครงสร้างพื้นฐานของตนเอง ความแตกต่างนี้ถือเป็นตัวชี้ขาด ไม่ว่าหน้าเบนช์มาร์กจะระบุว่าอย่างไร โมเดลขนาดรวม 30B ที่มี 3B แอ็กทีฟก็เล็กพอที่จะให้บริการได้อย่างคุ้มค่าในเชิงเศรษฐกิจ — สถาปัตยกรรมนี้ออกแบบมาเพื่อสิ่งนั้นโดยเฉพาะ
ราคาอยู่อันดับที่สาม: $0.06 สำหรับอินพุต และ $0.20 สำหรับเอาต์พุตต่อล้าน พร้อมส่วนลดแคช 17% และ $0.09 ต่องานจัดทำดัชนี คิดเป็นประมาณครึ่งหนึ่งของ $0.21 ของ Claude Haiku 5.5 ทั้งสองโมเดลมีราคาถูก โดย Nemotron ถูกกว่า
ในจุดที่ Claude Haiku 5.5 เหนือกว่า ซึ่งก็คือทุกมิติที่ต้องอาศัยคำตอบ
การทำตามคำสั่ง เพราะมันถูกฝึกมาเพื่อสิ่งนี้ ความสามารถอิสระ ที่ Index 43 เทียบกับ 13 — ช่องว่าง 30 คะแนนบนบอร์ดที่ให้คะแนนทั้งสอง ซึ่งเป็นช่องว่างแบบนี้ที่ใหญ่ที่สุดในชุดการเปรียบเทียบนี้ อินพุตรูปภาพ ซึ่ง Nemotron ไม่รองรับเลย เอาต์พุตสูงสุดที่ 128,000 โทเค็น เทียบกับตัวเลขที่ยังไม่เปิดเผย โดยมีเส้นทางเบต้า 300,000 โทเค็นบน Batch และปุ่มปรับ effort ซึ่งให้คุณได้ต้นทุนคืนมาโดยการลด reasoning effort แทนที่จะสร้างโมเดลใหม่
ข้อแม้เรื่องความเยิ่นเย้อใช้ได้ทั้งสองทางตรงนี้ บนชุดทดสอบของ Artificial Analysis นั้น Claude Haiku 5.5 ปล่อยโทเคนเอาต์พุตประมาณ 440 ล้านโทเคน เทียบกับค่ามัธยฐานที่ราว 100 ล้านโทเคน — มันคิดเยอะมากทีเดียว ส่วน Nemotron ปล่อยราว 120 ล้าน ซึ่งแหล่งเดียวกันอธิบายว่าค่อนข้างช่างพูดเมื่อเทียบกับขนาดของมัน ถึงกระนั้น ต้นทุนต่องานของ Haiku 5.5 ก็อยู่ที่ $0.21 เทียบกับ $0.09 ของ Nemotron ดังนั้นแม้แต่โมเดลที่ช่างพูดก็ไม่ใช่ตัวที่แพง สิ่งที่บอกได้จากตรงนี้คือ ราคาต่อโทเคนทำให้เข้าใจผิดได้ทั้งสองทาง และตัวเลขต่องานคือตัวที่ควรใช้ตั้งงบประมาณ
โฮสต์เองเทียบกับเอนด์พอยต์เดียว
Nemotron 3.5 Lightning 30B A3B Base ถูกเผยแพร่ในรูปแบบโอเพนเวท (open weights) และให้บริการโดยผู้ให้บริการอินเฟอเรนซ์หลายราย ส่วน NVIDIA ก็เผยแพร่รุ่นพี่น้องที่ผ่านการปรับแต่งด้วย Claude Haiku 5.5 เปิดให้ใช้งานผ่าน API ของ Anthropic และจากตรงนั้นก็ไปถึงทุกที่ที่มีการขายต่อโมเดลของ Anthropic ทั้งสองรุ่นไม่ได้อยู่ในแคตตาล็อกของ OrcaRouter และเราจะไม่แกล้งทำเป็นอย่างอื่น — สิ่งที่เราเราเตอร์จากย่านนี้คือ anthropic/claude-haiku-4.5, anthropic/claude-sonnet-5.5, anthropic/claude-opus-5.5 และ anthropic/claude-fable-5.1 ซึ่งเป็นระดับที่สูงขึ้นไปจากหัวข้อของบทความนี้
สองเส้นทางที่การเปรียบเทียบนี้กล่าวถึงนั้นมีโครงสร้างพื้นฐานที่แตกต่างกันจริง ๆ และก็คุ้มค่าที่จะเอ่ยชื่อทั้งสองออกมา เส้นทางแบบโฮสต์เองหมายถึง GPU หนึ่งตัว เฟรมเวิร์กสำหรับให้บริการ การตัดสินใจเรื่องการควอนไทซ์ และการหมุนเวียนทีมปฏิบัติการ ส่วนเส้นทางแบบโฮสต์หมายถึงคีย์หนึ่งอันกับสตริงชื่อโมเดลหนึ่งสตริง OrcaRouter มีอยู่เพื่อรองรับเส้นทางที่สอง: API เดียวสำหรับโมเดลกว่า 200 รายการ คีย์เดียวและบิลเดียว โดยราคาตั้งต้นของผู้ให้บริการถูกส่งผ่านด้วยมาร์กอัป 0% ส่วนแบ่งของผู้ขายจึงเปิดใช้งานได้ในวันเดียวกัน พร้อมกับระบบสลับสำรองอัตโนมัติที่อยู่เบื้องหลัง มันไม่ใช่เส้นทางไปสู่เช็กพอยต์ฐานขนาด 30B และการซื้อเครื่องระดับ DGX ก็ไม่ใช่เส้นทางไปสู่โมเดลขนาดเล็กแบบโฮสต์

ใครควรเลือกอันไหน
หากงานของคุณมีนิยามชัดเจนแล้ว ข้อมูลฝึกของคุณมีมากพอที่จะมีความสำคัญ และทราฟฟิกของคุณไม่สามารถออกจากโครงสร้างพื้นฐานของคุณเองได้ Nemotron 3.5 Lightning 30B A3B Base คือสิ่งที่่น่าสนใจกว่า: เร็วที่สุดในบรรดา 142 ตัวในด้านความเร็วเอาต์พุต ราคาต่อโทเคนถูกกว่าครึ่ง และเป็นของคุณที่จะปรับแก้ได้ ตั้งงบสำหรับการรัน fine-tuning และต้นทุนการให้บริการก่อนที่คุณจะนับผลประหยัด เพราะอัตราอินพุต $0.06 นั้นสมมติว่ามีใครบางคนทำงานที่เปลี่ยนเช็กพอยต์ให้กลายเป็นผู้ช่วยไปแล้ว
ถ้าคุณต้องการส่งพรอมต์แล้วได้คำตอบภายในบ่ายนี้ Claude Haiku 5.5 คือตัวที่ทำได้ — ได้ 43 คะแนนบนดัชนีอิสระ เทียบกับ 13 รับอินพุตรูปภาพได้ เพดานเอาต์พุต 128,000 โทเคน และราคาที่น้อยจริง ๆ การเปรียบเทียบดูใกล้เคียงกันแค่บนตารางราคาเท่านั้น มันจะเลิกดูใกล้เคียงทันทีที่งานคือการตอบคำถาม แทนที่จะเป็นการเขียนเอกสารต่อ

