
Claude Haiku 5.5 vs GPT-6 Luna: ราคาที่ติดป้ายเท่ากัน แต่บิลสามเท่า
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIOpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- AnthropicAnthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIGrok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 65 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 360 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
Claude Haiku 5.5 และ GPT-6 Luna มีราคาเท่ากันบนกระดาษ: 0.10 ดอลลาร์ต่อโทเคนอินพุตหนึ่งล้านโทเคน และ 0.50 ดอลลาร์ต่อโทเคนเอาต์พุตหนึ่งล้านโทเคน เป็นตัวเลขสองตัวเดียวกันเป๊ะถึงระดับเซนต์ จากผู้ขายสองรายที่แทบไม่เคยเห็นตรงกันในเรื่องใด ๆ โพสต์เปิดตัวของ Anthropic ยังพิมพ์คะแนนของ Luna ไว้ในคอลัมน์ข้าง ๆ ของตัวเองด้วยซ้ำ ซึ่งไม่ใช่สิ่งที่ผู้ขายทั้งหลายทำกันกับโมเดลที่พวกเขามองว่าไม่เป็นภัยคุกคาม
การ์ดทั้งสองใบแยกทางกันในทุกสิ่งทุกอย่างที่สติกเกอร์ปิดบังไว้ Luna คงอัตรานั้นไว้จนถึง 272,000 โทเค็นก่อนจะปรับขึ้น ส่วน Claude Haiku 5.5 ปรับขึ้นที่ 100,000 Claude Haiku 5.5 ทำคะแนนได้ 43.40 บน Artificial Analysis Intelligence Index v4.3.2 เทียบกับ 38.12 ของ Luna — และมีค่าใช้จ่าย $0.21 ต่องาน Index ที่ทำเสร็จ เทียบกับ $0.07 ของ Luna ราคาเดียวกัน บิลสามเท่า ฉลาดกว่าห้าคะแนน นั่นคือการแลกเปลี่ยนทั้งหมด และเป็นการแลกเปลี่ยนที่สะอาดตากว่าการเทียบกันตัวต่อตัวส่วนใหญ่ในช่วงระดับนี้
การ์ดสองใบวางเคียงข้างกัน
ต่อหนึ่งล้านโทเคนในหน่วยดอลลาร์สหรัฐ จากอัตราที่เผยแพร่ของ Antropic และ OpenAI ตามที่ปรากฏในแคตตาล็อกของเราเอง โดยมีการวัดผลอิสระที่อ้างอิงจาก Artificial Analysis แคชเมื่อ 2026-10-08

• อินพุต — Claude Haiku 5.5 $0.10 สูงสุด 100,000 โทเคน, $0.50 เมื่อเกินกว่านั้น. GPT-6 Luna $0.10 สูงสุด 272,000 โทเคน, $0.20 เมื่อเกินกว่านั้น
• เอาต์พุต — Claude Haiku 5.5 ราคา $0.50 สำหรับไม่เกิน 100,000 โทเค็น และ $2.50 สำหรับส่วนที่เกินกว่านั้น GPT-6 Luna ราคา $0.50 สำหรับไม่เกิน 272,000 โทเค็น และ $0.75 สำหรับส่วนที่เกินกว่านั้น
• อินพุตที่แคชไว้และการเขียนแคช — ทั้งคู่ราคา $0.01 และ $0.125 ภายใต้เกณฑ์แรก โดย Claude Haiku 5.5 จะเปลี่ยนเป็น $0.05 และ $0.625 เมื่อเกิน 100,000 โทเค็น และ GPT-6 Luna เป็น $0.02 และ $0.25 เมื่อเกิน 272,000
• Context และ output — 1M โทเคนสำหรับทั้งคู่; เอาต์พุตสูงสุด 128,000 สำหรับทั้งคู่ สองสิ่งนี้มีรูปแบบเดียวกันจริง ๆ
• Thinking — เป็นแบบปรับตัวได้ทั้งสอง โดยทั้งคู่มีพารามิเตอร์ effort ค่า effort เริ่มต้นของ Claude Haiku 5.5 คือ medium; ไม่ใช่คะแนนที่เผยแพร่ทั้งหมดจะอยู่ที่การตั้งค่านั้น
• คะแนนอิสระ — Claude Haiku 5.5 (Max) 43.40 อยู่อันดับที่สองจาก 182 โมเดล GPT-6 Luna (Max) 38.12 อยู่อันดับที่แปดจาก 182
• ต้นทุนอิสระต่องาน — $0.21 เทียบกับ $0.07
• ความเร็ว — 241.9 โทเคนเอาต์พุตต่อวินาที เทียบกับ 129.4 วัดโดยเครื่องมือประเมินเดียวกัน
เกณฑ์คือจุดที่ความแตกต่างอยู่
ผู้ขายทั้งสองรายสร้างตารางอัตราค่าบริการแบบสองระดับ พวกเขาทำในตำแหน่งที่แตกต่างกันมาก และการวางตำแหน่งนั้นสำคัญกว่าตัวเลขที่อยู่ด้านบนมาก
ขั้นของ Anthropic อยู่ที่ 100,000 โทเคน ต่ำกว่านั้นคุณจ่าย $0.10 และ $0.50; สูงกว่านั้น ห้าเท่าและห้าเท่า — $0.50 และ $2.50 Anthropic กล่าวว่าพรอมป์ที่ต่ำกว่าเกณฑ์คิดเป็นประมาณ 90% ของคำขอที่ส่งไปยังโมเดล Haiku รุ่นก่อนหน้าของบริษัท ซึ่งเป็นสัดส่วนทราฟฟิกของผู้ขายเอง และเป็นคำอธิบายที่สมเหตุสมผลของเวิร์กโหลดแบบเรียกสั้นโดยทั่วไป
ขั้นของ OpenAI อยู่ที่ 272,000 โทเคน ต่ำกว่านั้นคือ $0.10 และ $0.50 — เหมือนกับ Anthropic ทุกประการ สูงกว่านั้นคือ $0.20 และ $0.75 เพิ่มเป็นสองเท่าและเพิ่มขึ้น 50% นั่นเป็นขั้นที่ค่อยเป็นค่อยไปกว่ามาก และเริ่มไกลออกไปเกือบสามเท่า
ลองนึกถึงพรอมป์ต์ขนาด 200,000 โทเคน ซึ่งเป็นขนาดที่เป็นไปได้สำหรับไปป์ไลน์เอกสารยาว และสมเหตุสมผลอย่างยิ่งสำหรับหน้าต่าง 1M โทเคน บน Claude Haiku 5.5 คำขอนั้นถูกคิดเงินในระดับที่สอง: ขาเข้า $0.50 ขาออก $2.50 บน GPT-6 Luna ยังคงเป็นระดับแรก: ขาเข้า $0.10 ขาออก $0.50 อัตราขาเข้าเป็นห้าเท่า และอัตราขาออกเป็นห้าเท่า สำหรับคำขอเดียวกัน ระหว่างสองโมเดลที่มีราคาที่ประกาศไว้เท่ากัน นั่นไม่ใช่รายละเอียดเล็กน้อย — สำหรับงานที่ใช้พรอมป์ต์ยาว นั่นคือการเปรียบเทียบทั้งหมด
ทำไมอัตราเดียวกันจึงทำให้บิลสูงขึ้นสามเท่า
ต้นทุนต่องานคือตัวเลขที่ควรใช้ตัดสินไปป์ไลน์ปริมาณสูง และในจุดนี้เองที่โมเดลทั้งสองแยกทางกันในแบบที่ตารางราคาไม่อาจอธิบายได้
Artificial Analysis ระบุว่า GPT-6 Luna (Max) อยู่ที่ $0.07 ต่องาน Intelligence Index และ Claude Haiku 5.5 (Max) อยู่ที่ $0.21 — คิดเป็นสามเท่า บนอัตราค่าบริการที่ประกาศไว้เท่ากัน สำหรับความต่างของคะแนน 5.28 คะแนน สาเหตุอยู่ในหน้าเดียวกันและไม่ใช่เรื่องที่ต้องตีความให้ลึกเลย Claude Haiku 5.5 สร้างโทเค็นเอาต์พุต 440 ล้านโทเค็นขณะรัน Index เทียบกับค่ามัธยฐาน 100 ล้าน และผู้ประเมินเรียกว่าพูดมากเป็นพิเศษ GPT-6 Luna สร้าง 140 ล้าน เทียบกับค่ามัธยฐาน 100 ล้านเดียวกัน โดยถูกอธิบายว่าค่อนข้างพูดมาก โทเค็นเอาต์พุตสามเท่าคือค่าใช้จ่ายสามเท่า เมื่อเอาต์พุตเป็นมาตรวัดที่มีน้ำหนักมากที่สุด
ตัวเลขของ Anthropic เองก็ชี้ไปในทิศทางเดียวกัน แผนภูมิเปรียบเทียบต้นทุนกับความแม่นยำของผู้ขายรายนี้วาง Haiku 5.5 ไว้ครอบคลุมช่วงของความพยายาม และคำกล่าวที่ยกมาเด่นจากการเปิดตัวก็คือ Sonnet 5.5 และ Opus 5.5 ยังคงเป็นตัวเลือกที่ดีกว่าสำหรับงานเขียนโค้ดแบบเอเจนต์ที่ซับซ้อน โดยวาง Haiku 5.5 ไว้สำหรับการบีบอัด การสรุปความ และซับเอเจนต์แทน ยิ่งงานเล็กเท่าไร คุณก็ยิ่งได้ปัญหาความเยิ่นเย้อนั้นน้อยลงเท่านั้น ซึ่งเป็นภาระงานที่โมเดลนี้ถูกสร้างขึ้นมาสำหรับพอดี และเป็นภาระงานที่ช่องว่างต้นทุนถึงสามเท่าควรค่าแก่การตรวจสอบเทียบกับบันทึกของคุณเอง มากกว่าของบอร์ดจัดอันดับ
อีกรายการหนึ่งในบัญชี จากเอกสารของ Anthropic ไม่ใช่ของผู้ประเมิน: Claude Haiku 5.5 ใช้โทเคไนเซอร์รุ่นใหม่ที่ใช้ร่วมกับ Claude 4.7 และรุ่นหลังจากนั้น ดังนั้นข้อความเดียวกันจะถูกนับเป็นโทเคนมากกว่าประมาณ 30% เมื่อเทียบกับ Haiku รุ่นก่อน อัตราค่าใช้จ่ายเท่ากับของ Luna แต่โทเคไนเซอร์ไม่เหมือนกัน

ตารางของ Anthropic เองบอกอะไรเกี่ยวกับ Luna
หน้าเปิดตัวของ Anthropic แสดง GPT-6 Luna เป็นคอลัมน์ในตาราง benchmark ของตน และวิธีรายงานอย่างตรงไปตรงมาคือต้องแนบ attribution มาด้วย: นี่คือการประเมินของ Anthropic ซึ่งรันบน harness ของ Anthropic กับโมเดลของคู่แข่ง พวกมันเป็นข้อมูลที่ผู้ขายรายงาน ไม่ได้ถูกทำซ้ำอย่างอิสระ และการที่ผู้ขายรายหนึ่งรันชุดทดสอบของตนเองเทียบกับคะแนนของคู่แข่งนั้น เป็นการเปรียบเทียบที่ต้องชั่งน้ำหนักมากกว่าจะยอมรับ
• งานด้านความรู้ — GDPval-AA v2.1 อยู่ที่ 1620 สำหรับ Claude Haiku 5.5 เทียบกับ 1437 สำหรับ GPT-6 Luna โดย AA-Briefcase v1.1 อยู่ที่ 1578 เทียบกับ 1336
• การใช้คอมพิวเตอร์ — ชุดย่อยออฟไลน์ OSWorld 2.1 ที่ 72.4% เทียบกับ 48.9%
• การเขียนโค้ดแบบเอเจนติก — Terminal-Bench 4.0 อยู่ที่ 39.2% เทียบกับ 16.4%; FrontierCode 1.1 (Main) อยู่ที่ 46.4% เทียบกับ 42.4%
• การใช้เหตุผลเชิงภาพ — Chartography อยู่ที่ 46.4% เมื่อไม่ใช้เครื่องมือ เทียบกับ 29.1%
บนชุดทดสอบของเจ้าของผลิตภัณฑ์เอง Claude Haiku 5.5 ขึ้นนำในทุกแถว บนกระดานจัดอันดับอิสระ มันขึ้นนำด้วยส่วนต่างที่เล็กกว่า — 43.40 เทียบกับ 38.12 — ซึ่งเป็นความสัมพันธ์ตามปกติระหว่างตารางของผู้ขายกับของบุคคลที่สาม และเป็นเหตุผลที่ทั้งสองถูกพิมพ์ไว้ที่นี่ ทั้งสองเห็นตรงกันในเรื่องทิศทางและไม่ตรงกันในเรื่องขนาด
ร่างกฎหมายคือคะแนนเสียงชี้ขาด
เอาข้อเท็จจริงสี่ข้อที่สำคัญจริง ๆ มาจับมาเทียบกัน แล้วสำหรับภาระงานส่วนใหญ่ ทางเลือกก็จะไม่สูสีกันอีกต่อไป
GPT-6 Luna มีต้นทุนต่อหนึ่งงานที่ทำเสร็จถูกกว่าเป็นสามเท่าในการวัดผลโดยอิสระ ชั้นราคาแรกของมันเข้าถึงได้ไกลกว่าถึงสิบแปดเท่าในหน้าต่างบริบท อัตราการเกินเกณฑ์ของมันต่ำกว่าทั้งสองมิเตอร์ และมันเป็นเพียงหนึ่งในสองตัวที่มีบทลงโทษจากบริบทยาวเพิ่มเป็นสองเท่า ไม่ใช่ก้าวกระโดดถึงห้าเท่า ส่วน Claude Haiku 5.5 นำด้านความฉลาดที่วัดได้ด้วยส่วนต่างที่เป็นจริงแต่ไม่มาก เร็วกว่าเกือบสองเท่าในด้านเอาต์พุต และ — บนฮาร์เนสของผู้ขายเอง ซึ่งเป็นที่ที่ช่องว่างกว้างที่สุด — นำในทุกแถวของเบนช์มาร์กที่เผยแพร่
หากการเรียกใช้ของคุณสั้น หากปริมาณงานเป็นข้อจำกัด หรือหากความแตกต่างด้านคุณภาพปรากฏในการประเมินของคุณเอง ก็จ่ายแพงขึ้นสามเท่าไปเลย หากการเรียกใช้ของคุณยาว หากมันถูกสร้างโดยเครื่องและไม่มีมนุษย์อ่าน หรือหากคุณกำลังรันชั้นการจำแนกประเภทที่ถูกเรียกใช้ล้านครั้งต่อวัน ราคา $0.10 และ $0.50 แบบเดิมจะทำให้บิลของคุณมีขนาดเพียงหนึ่งในสามเมื่ออยู่อีกฝั่ง และความสามารถที่คุณยอมแลกไปคือห้าคะแนนบนลีดเดอร์บอร์ดที่ทั้งสองโมเดลอยู่ใกล้หัวตาราง
การเรียกใช้ตัวใดตัวหนึ่งจากจุดเดียว
สิ่งที่มีประโยชน์ของการเปรียบเทียบที่สูสีขนาดนี้ก็คือ คุณไม่ควรต้องเชื่อคำพูดของใคร รวมถึงของเราด้วย GPT-6 Luna อยู่ในแค็ตตาล็อกของ OrcaRouter วันนี้ในอัตราของผู้ให้บริการ โดยบวกเพิ่ม 0% — โครงสร้างอัตราเดียวกันกับที่พิมพ์ไว้ด้านบน ส่งผ่านตรง ๆ ไม่ได้ผสมรวม — และ Claude Sonnet 5.5 กับ Claude Opus 5.5 ก็เช่นกัน ซึ่งทำให้การทดสอบการยกระดับจากขาแบบราคาถูกขึ้นไปยังระดับกลางกลายเป็นเพียงการตั้งค่า ไม่ใช่โปรเจกต์ คีย์เดียว SDK ตัวเดียว, มีระบบ failover อัตโนมัติรองรับอยู่ด้านล่าง และมี routing DSL หากการยกระดับนั้นควรอยู่ในเส้นทางแทนที่จะอยู่ในแอปพลิเคชันของคุณ.
Claude Haiku 5.5 ยังไม่ปรากฏอยู่ในแค็ตตาล็อก การพูดแบบตรงไปตรงมานั้นมีประโยชน์กว่าการสื่อเป็นนัยเป็นอย่างอื่น: ฝั่ง Luna ของการเปรียบเทียบนี้เราสามารถเรียกใช้ได้ตั้งแต่เช้านี้ ส่วนฝั่ง Anthropic ยังต้องติดต่อผ่าน Anthropic ไปก่อนจนกว่าจะไม่เป็นเช่นนั้น

อะไรจะเปลี่ยนคำตอบ
สองเรื่อง และทั้งสองเรื่องก็ควรค่าแก่การเฝ้าดูมากกว่าการคาดเดา
ประการแรกคือความละเอียดของคำตอบจะเปลี่ยนไปหรือไม่ ต้นทุนต่องานของ Claude Haiku 5.5 เป็นฟังก์ชันของจำนวนโทเค็นที่ใช้ต่อคำตอบเมื่อตั้งค่า effort สูงสุด และพารามิเตอร์ effort คือคันโยกที่ควบคุมสิ่งนั้น ทีมที่ตั้งค่า effort ให้ต่ำลง — ค่าเริ่มต้นของโมเดลเองคือ medium ไม่ใช่ max — จะเห็นต้นทุนต่องานใกล้เคียงกับของ Luna และคะแนนก็ใกล้เคียงกับ Luna เช่นกัน การแลกเปลี่ยนนี้มีอยู่จริง; สิ่งที่มันคุ้มค่าหรือไม่เป็นคำถามเกี่ยวกับ eval ของคุณ ไม่ใช่เกี่ยวกับตัวโมเดล
ประการที่สองคือ ตัวเลขต้นทุนต่องานที่เป็นอิสระนั้นยังคงเป็นจริงหรือไม่ เมื่อทั้งสองโมเดลสะสมการรันที่วัดผลได้มากขึ้น การจัดวางบนบอร์ดเพียงครั้งเดียวเป็นแค่ภาพ ณ ขณะหนึ่ง และช่องว่างสามเท่าที่ปรากฏในภาพนั้นควรค่าแก่การยืนยันกับใบแจ้งหนี้ของคุณเองก่อนที่จะสร้างไปป์ไลน์ใหม่โดยยึดจากมัน นั่นคือสิ่งที่เอ็นด์พอยต์ที่ใช้ร่วมกันมีไว้เพื่อ
การเปรียบเทียบในบทความนี้1
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
