
Claude Haiku 5.5 vs Claude Sonnet 5.5: เรตการ์ดต่างกัน 20 เท่า แต่บิลที่วัดได้จริงต่างกัน 36 เท่า
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 112 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIOpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- AnthropicAnthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIGrok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 399 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
Claude Haiku 5.5 และ Claude Sonnet 5.5 ห่างกันหกวันและหนึ่งระดับในตระกูลเดียวกัน ใช้หน้าต่างบริบทหนึ่งล้านโทเคนร่วมกัน และตอบสนองผ่านรูปแบบ API เดียวกัน บนตารางราคาที่ประกาศไว้ ตัวที่ถูกกว่าเสียค่าใช้จ่ายเป็นหนึ่งในห้าของตัวที่แพงกว่าในช่วงที่คำขอส่วนใหญ่ตกอยู่ บนบอร์ด Artificial Analysis ที่เป็นอิสระ ช่องว่างนั้นกว้างกว่านี้: 0.21 ดอลลาร์สำหรับทำหนึ่งงาน Intelligence Index บน Claude Haiku 5.5 เทียบกับ 7.60 ดอลลาร์บน Claude Sonnet 5.5 สำหรับค่า Intelligence Index ที่ 43 เทียบกับ 56 สัญญาณที่จุดประกายบทความนี้ระบุว่า Claude Haiku 5.5 "ดีกว่า GPT-6 Luna มาก" และ "ใกล้ Sonnet 5.5 (กว่า)" ครึ่งแรกของข้อความนั้นใกล้เคียงกับสิ่งที่ชุดเปรียบเทียบของผู้ขายเองแสดงไว้ ครึ่งหลังคือจุดที่การวัดหยุดสอดคล้องกับการตลาด และคุ้มค่าที่จะระบุให้ชัดเจนว่าคือส่วนไหน
สองโมเดล ห่างกันหกวันและหนึ่งระดับ
Claude Haiku 5.5 เปิดตัวเมื่อวันที่ 7 ตุลาคม 2026 ภายใต้รหัสโมเดล claude-haiku-5-5 โดยเป็นรุ่นแทนที่ Claude Haiku 4.5 โดยตรง รับข้อความและรูปภาพเข้าและคืนข้อความออกมา และเป็นโมเดลคลาส Haiku รุ่นแรกที่ Anthropic กำหนดค่าความพยายามแบบปรับได้ให้ — Low, Medium, High, Xhigh และ Max โดยมี medium เป็นค่าเริ่มต้นของ API Anthropic เรียกมันว่า "โมเดลขนาดเล็กที่ถูกที่สุด เร็วที่สุด และความสามารถสูงสุดที่เราเคยเปิดตัว" และเชิงอรรถของคำกล่าวนี้อธิบายเพิ่มเติมว่า เร็วที่สุดเมื่อเทียบกับความเร็วมาตรฐานของแต่ละโมเดล แต่ยังตามหลังโมเดลตระกูล Opus เมื่อรันในโหมด Fast
Claude Sonnet 5.5 เปิดตัวก่อนหน้านั้นหกวัน เมื่อวันที่ 28 กันยายน 2026 ในชื่อ claude-sonnet-5-5 — เป็นระดับที่ Anthropic วางตำแหน่งไว้ว่าเป็นการผสมผสานที่ดีที่สุดระหว่างความเร็วและความฉลาด และเป็นรุ่นที่แนะนำสำหรับงานเขียนโค้ดแบบเอเจนต์ที่ซับซ้อน มีหน้าต่างบริบทขนาดหนึ่งล้านโทเคนเช่นเดียวกัน ต่างจาก Claude Haiku 5.5 ตรงที่ไม่มีช่วงราคาตามความยาวพรอมป์ต์ ซึ่งกลายเป็นว่าสำคัญยิ่งกว่าการได้เปรียบจากการเปิดตัวก่อนหกวันเสียอีก
ทั้งสองรุ่นพร้อมใช้งานแล้วบนทุกแพลตฟอร์ม รวมถึง Amazon Web Services, Google Cloud และ Microsoft Azure และทั้งคู่มีข้อผูกมัดเรื่องการยุติให้บริการไม่เร็วกว่าหนึ่งปีหลังเปิดตัว — วันที่ 7 ตุลาคม 2027 สำหรับ Claude Haiku 5.5 และวันที่ 28 กันยายน 2027 สำหรับ Claude Sonnet 5.5 Anthropic กล่าวว่า Claude Sonnet 5.5 พร้อมใช้งานโดยไม่มีการเก็บรักษาข้อมูล (zero data retention) ซึ่งสอดคล้องกับ Claude Opus 5.5 และ Claude Sonnet 5
การ์ดอัตราค่าบริการ ทั้งสองด้าน ในที่เดียว
ต่อหนึ่งล้านโทเค็น เป็นดอลลาร์สหรัฐ ตามอัตราที่ Anthropic ประกาศไว้:
• อินพุต — Claude Haiku 5.5 ราคา $0.10 สำหรับพรอมต์ไม่เกิน 100,000 โทเค็น และ $0.50 สำหรับที่เกินขีดนั้น; Claude Sonnet 5.5 ราคาคงที่ $2.00 ไม่มีขั้นบันได
• เอาต์พุต — Claude Haiku 5.5 $0.50 สูงสุด 100,000 โทเค็น, $2.50 สำหรับส่วนที่เกิน; Claude Sonnet 5.5 $10.00 แบบคงที่
• การอ่านแคช — Claude Haiku 5.5 $0.01 ในช่วงล่าง และ $0.05 เมื่อสูงกว่านั้น; Claude Sonnet 5.5 $0.10 Anthropic ลดการอ่านแคชของ Claude Sonnet 5.5 ลงครึ่งหนึ่งจาก $0.20 ในเวลาเดียวกับการเปิดตัว Haiku และกล่าวว่า เนื่องจากการอ่านแคชเป็นสัดส่วนขนาดใหญ่ของการใช้โทเค็นแบบ agentic ตอนนี้ Claude Sonnet 5.5 จึงมีค่าใช้จ่ายน้อยลงประมาณ 20% ในงานแบบ agentic ส่วนใหญ่
• การเขียนแคช — Claude Haiku 5.5 ราคา $0.125 สำหรับการเขียนแบบห้านาที และ $0.20 สำหรับการเขียนแบบหนึ่งชั่วโมงในช่วงล่าง, $0.625 และ $1.00 ในช่วงที่สูงกว่านั้น; Claude Sonnet 5.5 ราคา $2.50 สำหรับการเขียนแบบห้านาที และ $4.00 สำหรับการเขียนแบบหนึ่งชั่วโมง
• Batch — Batch API ลดราคา 50% ทั้งอินพุตและเอาต์พุต ซึ่งทำให้ Claude Haiku 5.5 อยู่ที่ $0.05 และ $0.25 เมื่อใช้งานต่ำกว่า 100,000 โทเคน และอยู่ที่ $0.25 และ $1.25 เมื่อใช้งานสูงกว่านั้น เมื่อเทียบกับ Claude Sonnet 5.5 ที่ $1.00 และ $5.00
เมื่ออ่านไล่ตามบรรทัดเหล่านั้น รูปแบบก็สอดคล้องกัน: ในแถบล่าง คุณกำลังเห็นช่องว่างอินพุต 20 เท่า และช่องว่างเอาต์พุต 20 เท่า; เหนือเส้นขึ้นไป 4 เท่าและ 4 เท่า พาดหัวของ Anthropic คือ "ค่าใช้จ่ายในการรันน้อยลงราว 75%" โดยเฉลี่ยเมื่อเทียบกับ Claude Haiku 4.5 ซึ่งปรับให้ชัดเจนขึ้นในเชิงอรรถว่าถูกกว่า 90% เมื่อต่ำกว่า 100,000 โทเคน และถูกกว่า 50% เมื่อสูงกว่านั้น โดยนับรวมการเปลี่ยนแปลงของ tokenizer เข้าไว้ในค่าเฉลี่ยนั้นด้วย
ขั้น 100,000 โทเค็นคือจุดที่การคำนวณเปลี่ยนทิศ
มีสองสิ่งที่ดึงไปคนละทิศทาง และมีเพียงหนึ่งในนั้นเท่านั้นที่อยู่ในตารางอัตราค่าบริการ ราคาร่วงลงอย่างหนักเมื่อเทียบกับ Claude Haiku 4.5 ในขณะเดียวกัน Claude Haiku 5.5 มาพร้อมโทเคไนเซอร์เวอร์ชันอัปเดต ซึ่งคล้ายกับที่อยู่ใน Claude Sonnet 5.5 และ Claude Opus 5.5 โดย Anthropic กล่าวว่า "ใช้โทเคนต่องานมากขึ้นเล็กน้อย" — ดังนั้นพรอมป์ต์ที่เหมือนกันจะถูกนับเป็นโทเคนที่เรียกเก็บเงินได้จำนวนมากกว่าที่จะเป็นในรุ่นก่อนหน้า ค่าเฉลี่ย 75% คือผลสุทธิของทั้งสองอย่าง และเป็นตัวเลขจากฝั่งผู้ขาย
เส้นแบ่ง 100,000 โทเคนคือจุดที่ทำให้หลายคนสะดุด Anthropic กำหนดราคาของ Claude Haiku 5.5 ตามความยาวพรอมป์ต์: คำขอที่มีพรอมป์ต์เกิน 100,000 โทเคนจะต้องจ่ายในราคาที่สูงกว่าสำหรับทั้งคำขอ ไม่ใช่เฉพาะโทเคนที่เกินเกณฑ์เท่านั้น ความยาวพรอมป์ต์นับรวมโทเคนอินพุตทั้งหมด รวมถึงการอ่านแคชและการเขียนแคช และแต่ละคำขอจะคิดราคาแยกกัน — คำขอที่ยาวจะจ่ายในช่วงราคาที่สูงกว่าแม้ว่าบางส่วนของพรอมป์ต์จะเป็นการอ่านจากแคชก็ตาม และคำขอก่อนหน้าก็ยังคงราคาที่ถูกเรียกเก็บไปแล้ว ไปป์ไลน์การดึงข้อมูลที่ใช้งานได้สบาย ๆ ที่ 90,000 โทเคนจ่าย $0.10 และ $0.50 เพียงขยับหน้าต่างขึ้นอีกหนึ่งระดับ ทั้งคำขอก็จะถูกคิดราคาใหม่เป็น $0.50 และ $2.50 Claude Sonnet 5.5 ไม่มีพฤติกรรมแบบนี้ เพราะหน้าต่างหนึ่งล้านโทเคนเต็มรูปแบบถูกเรียกเก็บในราคามาตรฐาน
ผลที่ตามมาสองประการตามมา ซึ่งชี้ไปในทิศทางตรงกันข้าม ประการแรก จุดตัดที่ผู้คนคาดหวัง — บริบทแบบยาวที่ทำให้โมเดลราคาแพงกลายเป็นโมเดลที่ถูกกว่า — ไม่ได้เกิดขึ้น: Claude Haiku 5.5 ที่อยู่เหนือเส้นยังคงเป็นหนึ่งในสี่ของ Claude Sonnet 5.5 บนตารางราคา ประการที่สอง ช่องว่างที่คุณพึ่งพาแคบลงจาก 20 เท่าเหลือ 4 เท่าในจังหวะที่ปริมาณงานของคุณหนักขึ้น ซึ่งเป็นจังหวะที่ตัวเลขสัมบูรณ์เริ่มมีความสำคัญ การเปลี่ยนแปลงแบบขั้นนี้คือเหตุผลที่ไปป์ไลน์ที่ไวต่อต้นทุนจำเป็นต้องมีรายการงบประมาณของตัวเอง แทนที่จะเป็นอัตราต่อโทเคน
สิ่งที่ผู้ขายแต่ละรายรายงานว่าตนได้คะแนนเท่าใด
ทุกอย่างในส่วนนี้เป็นข้อมูลที่ผู้ขายรายงานเองและยังไม่มีบุคคลที่สามทำซ้ำได้ Anthropic เผยแพร่ชุดการเปรียบเทียบเดียวกันบนหน้า Claude Haiku 5.5 และ Claude Sonnet 5.5 และในส่วนที่ทั้งสองหน้ามีร่วมกัน ข้อมูลก็สอดคล้องกัน:
• GDPval-AA v2.1 งานองค์ความรู้ — 1,620 สำหรับ Claude Haiku 5.5 เทียบกับ 1,840 สำหรับ Claude Sonnet 5.5, 735 สำหรับ Claude Haiku 4.5 และ 1,437 สำหรับ GPT-6 Luna
• AA-Briefcase v1.1 — 1,578 สำหรับ Claude Haiku 5.5 เทียบกับ 1,824 สำหรับ Claude Sonnet 5.5, 614 สำหรับ Claude Haiku 4.5 และ 1,336 สำหรับ GPT-6 Luna
• OSWorld 2.1, การใช้งานคอมพิวเตอร์, ชุดย่อยแบบออฟไลน์ — 72.4% สำหรับ Claude Haiku 5.5 เทียบกับ 83.9% สำหรับ Claude Sonnet 5.5, 15.7% สำหรับ Claude Haiku 4.5 และ 48.9% สำหรับ GPT-6 Luna
• Terminal-Bench 4.0, การเขียนโค้ดแบบเอเจนติก — 39.2% สำหรับ Claude Haiku 5.5 เทียบกับ 70.6% สำหรับ Claude Sonnet 5.5, 0.0% สำหรับ Claude Haiku 4.5 และ 16.4% สำหรับ GPT-6 Luna
• FrontierCode 1.1, Main — 46.4% สำหรับ Claude Haiku 5.5 เทียบกับ 52.1% สำหรับ Claude Sonnet 5.5 ที่ระดับความพยายาม Xhigh และ 42.4% สำหรับ GPT-6 Luna Anthropic ยังชี้ให้เห็นว่า Claude Sonnet 5.5 ได้คะแนนต่ำกว่าที่ระดับความพยายาม Max เมื่อเทียบกับ Xhigh ในรายการนี้ ซึ่ง Anthropic อธิบายว่าเป็นเพราะการใช้สกิลการรีวิวโค้ดบ่อยขึ้น ทำให้เกิดการหมดเวลาหรือการแก้ไขนอกขอบเขต
• Chartography การให้เหตุผลเชิงภาพโดยไม่ใช้เครื่องมือ — 46.4% สำหรับ Claude Haiku 5.5 เทียบกับ 61.6% สำหรับ Claude Sonnet 5.5, 6.4% สำหรับ Claude Haiku 4.5 และ 29.1% สำหรับ GPT-6 Luna
• Humanity's Last Exam — 45.9% โดยไม่ใช้เครื่องมือ และ 57.4% เมื่อใช้เครื่องมือ สำหรับ Claude Haiku 5.5; 64.5% เมื่อใช้เครื่องมือสำหรับ Claude Sonnet 5.5, 18.7% สำหรับ Claude Haiku 4.5 และ 56.9% โดยไม่ใช้เครื่องมือสำหรับ Claude Sonnet 5.5 ในหน้าเดียวกัน Anthropic ตั้งข้อสังเกตว่าตัวเลขของตระกูล GPT-6 อาจล้าสมัย เนื่องจาก OpenAI แก้ไขบั๊กด้านความเข้าใจภาพและคะแนนจากบุคคลที่สามยังไม่ได้รับการอัปเดตทั้งหมด
สองในบรรทัดเหล่านั้นคุ้มค่าที่จะอ่านซ้ำ บน FrontierCode โมเดลทั้งสองใกล้กันเลย — 46.4% ต่อ 52.1% — และบน Chartography ซึ่งไม่มีเครื่องมือให้หลบซ่อน ช่องว่างคือ 15 คะแนน Terminal-Bench 4.0 ไม่ใกล้กันเลย: 39.2% ต่อ 70.6% เป็นความสามารถคนละชั้น นั่นคือเหตุผลที่หน้าเพจ Claude Sonnet 5.5 ของ Anthropic ยังชี้ไปที่ Claude Sonnet 5.5 และ Claude Opus 5.5 สำหรับงานเขียนโค้ดแบบเอเจนต์ที่ซับซ้อน และวางตำแหน่ง Claude Haiku 5.5 ว่าเป็นโมเดลสำหรับงานที่มีขอบเขตแคบแต่ปริมาณสูง
สิ่งที่คณะกรรมการอิสระเพิ่มเข้ามา
ตัวเลขของ Anthropic เปรียบเทียบโมเดลของตัวเองกับกันและกัน และกับคู่แข่งหนึ่งราย คณะกรรมการอิสระนำทั้งสองไปเทียบกับคู่แข่งทั้งหมดในสนาม และตัวเลขที่คณะกรรมการรายงานแต่ผู้จำหน่ายไม่รายงานก็คือต้นทุนต่องานที่ทำเสร็จ
Artificial Analysis ให้คะแนน Claude Haiku 5.5 ที่ Max effort ด้วย Intelligence Index 43 ซึ่งสูงกว่าค่ามัธยฐานที่ 13 อย่างมากในกลุ่มโมเดลที่เทียบเคียงได้ โดยสร้างเอาต์พุต 440M โทเคนบน Index เทียบกับค่ามัธยฐานที่ 100M — ซึ่งตอบยาวมาก — ที่ราคาอินพุต $0.10 และเอาต์พุต $0.50 ต่อล้านโทเคน และ 242 โทเคนเอาต์พุตต่อวินาที ต้นทุนที่วัดได้ของมันคือ $0.21 ต่อหนึ่งงาน Intelligence Index
บอร์ดเดียวกันให้คะแนน Claude Sonnet 5.5 ที่ 56 เทียบกับค่ามัธยฐานที่ 26 โดยสร้างเอาต์พุตโทเค็น 410M เทียบกับค่ามัธยฐานที่ 88M ที่ราคาอินพุต $2.00 และเอาต์พุต $10.00 พร้อมส่วนลดแคช 90% ต้นทุนที่วัดได้อยู่ที่ $7.60 ต่องาน Intelligence Index


วางสองบรรทัดนั้นไว้ข้างกัน แล้วอัตราส่วนคือเรื่องราว $0.21 เทียบกับ $7.60 นั้นมากกว่า 36 เท่าเล็กน้อย และทั้งสองโมเดลแทบจะพอ ๆ กันในด้านความยาวของคำตอบ — 440M โทเค็นเอาต์พุต เทียบกับ 410M — ดังนั้นตัวคูณนั้นเกือบทั้งหมดเป็นเพราะเรตการ์ดทำในสิ่งที่เรตการ์ดบอกว่าจะทำ บนเรตการ์ดของผู้ขายเอง การเปรียบเทียบเดียวกันคือ 20 เท่า ส่วนที่เพิ่มขึ้นมาจากสิ่งที่ราคาต่อโทเค็นไม่อาจแสดงได้: โมเดลที่ถูกกว่าได้คำตอบด้วยจำนวนโทเค็นที่คิดเงินต่องานน้อยกว่า ณ การตั้งค่าระดับความพยายามนี้ และการอ่านแคชถูกคิดในอัตราหนึ่งในสิบของอัตราของ Claude Sonnet 5.5 ชุดทดสอบเดียวกัน งานเดียวกัน วัดอย่างอิสระ

จุดที่แพ็กเกจราคาถูกหมดจริง ๆ
ตัวเลขลูกค้าที่ Anthropic เผยแพร่มีอิทธิพลต่อการตัดสินใจเลือกใช้มากกว่าผลการทดสอบมาตรฐานเสียอีก และทั้งหมดชี้ไปในทิศทางเดียวกัน Asana รายงานว่าความหน่วงในการทำงานให้เสร็จลดลงกว่า 30% และการประมวลผลต่อเทิร์นของเอเจนต์เร็วขึ้นสูงสุดถึง 2.5 เท่า Box รายงานคะแนนสูงกว่า Claude Haiku 4.5 อยู่ 11 คะแนน โดยมีความหน่วงประมาณครึ่งหนึ่ง HubSpot รายงานคะแนนดีที่สุดเท่าที่เคยเห็นในชุดทดสอบของตนเอง ที่ 92.8% เมื่อเฉลี่ยจากการรันสามครั้ง โดยมีอัตราการตรวจพบสูงที่สุดและอัตราการแจ้งผลบวกลวงต่ำที่สุด AlphaSense เรียกใช้งานประมาณ 8 ล้านครั้งต่อสัปดาห์ผ่าน "Ask in Document" และรายงานการปรับปรุงที่มีนัยสำคัญทางสถิติเมื่อเทียบกับ Claude Haiku 4.5 คือ 0.84 ต่อ 0.76 Cognition รายงานว่าเมื่อใช้ Claude Haiku 5.5 เป็นผู้ช่วย เอเจนต์ Fusion ของบริษัทมีคะแนน FrontierCode อยู่ที่ 66.2
ไม่มีอันใดในนั้นเป็นเอเจนต์แบบระยะยาว ทั้งหมดเป็นโซลูชันเฉพาะจุด — หนึ่งขั้นตอนที่นิยามไว้อย่างชัดเจน ซึ่งเร็วขึ้นและถูกลง นั่นคือลักษณะที่ Claude Haiku 5.5 ถูกสร้างมาสำหรับ และยังเป็นลักษณะที่ข้อได้เปรียบด้านต้นทุน 36 เท่าเป็นเงินจริง ไม่ใช่แค่เศษที่เกิดจากการปัดเศษ ข้อได้เปรียบนี้ทบต้นตามปริมาณการเรียกใช้งาน และระเหยไปตามความลึกของการเรียกใช้งาน การเรียกจำแนกประเภทหนึ่งแสนครั้งต่อวัน ในราคา $0.10 ขาเข้าและ $0.50 ขาออก เป็นรายการค่าใช้จ่ายที่คุณสังเกตเห็นได้ว่าหายไป ในขณะที่รอบการทำงานของเอเจนต์หนึ่งร้อยรอบต่อเซสชัน โดยแต่ละรอบอ่านบริบทซ้ำ เป็นรายการที่เติบโตแบบเหนือเชิงเส้น เพราะทุกเทิร์นที่เกินเกณฑ์จะจ่ายในอัตราที่สูงขึ้น
ข้อโต้แย้งของ Claude Sonnet 5.5 คือต้นทุนต่อครั้งที่ลอง ไม่ใช่ต้นทุนต่อโทเคน Anthropic กล่าวว่าโมเดลนี้ทำงานเร็วกว่า Claude Sonnet 5 มากกว่า 30% และมีค่าใช้จ่ายต่ำกว่าถึง 30% สำหรับงานส่วนใหญ่ โดยการประหยัดนั้นมาจากการที่ต้องใช้โทเคนน้อยลง ไม่ได้มาจากอัตราค่าบริการที่ต่ำลง ผู้ทดสอบจากบุคคลที่สามได้ให้ตัวเลขรองรับเรื่องนี้: Slack รายงานว่าโทเคนเอาต์พุตน้อยลงราว 14% Balyasny ใช้ประมาณ 121k โทเคนต่อคำตอบ เทียบกับ 497k Box เร็วขึ้น 2.4 เท่า โดยใช้โทเคนน้อยลง 12% Lovable เรียกใช้เครื่องมือน้อยลงราวหนึ่งในสาม และรันเชลล์ราวครึ่งหนึ่ง Atlassian ทำให้ Rovo Agents เร็วขึ้นถึง 30% และ Base44 ใช้ 3.6 รอบต่อการสร้าง เทียบกับ 7.7 สำหรับ Claude Opus 5 หนึ่งรอบที่สำเร็จ ดีกว่าสี่รอบที่ไม่สำเร็จ
ยังมีปัจจัยที่สามที่ผลักไปในทิศทางตรงกันข้าม Anthropic ได้ย้ายการปรับระดับความพยายามไปเป็นปุ่มหมุนระดับโมเดลในรุ่นนี้ — การตั้งค่าความพยายามของ Claude Haiku 5.5 ถูกกำหนดครั้งเดียวต่อคำขอ แทนที่จะถูกปรับขนาดเป็นงบประมาณการคิดต่อคำขอ และโหมด budget_tokensแบบเดิมก็ถูกเลิกใช้ (deprecated) บนโมเดลตระกูล 4.6 และไม่รับรองบนรุ่นหลังจากนั้น สำหรับฟลีตที่เรียกใช้ ID โมเดลเดียวจากหลายบริการ นั่นถือเป็นการทำให้ง่ายขึ้น แต่สำหรับอะไรก็ตามที่ปรับขนาดการให้เหตุผลของตัวเองในแต่ละครั้งที่เรียก มันคือการเขียนใหม่ทั้งหมด
รันทั้งคู่ไว้หลังเอนด์พอยต์เดียว
เหตุผลที่การตัดสินใจนี้ควรทำให้ถูกตั้งแต่แรกก็คือ การย้อนกลับครึ่งที่ผิดนั้นมีค่าใช้จ่ายสูง: การเปลี่ยนเส้นทางโปรดักชันจากโมเดล ID หนึ่งไปยังอีก ID หนึ่งหมายถึงต้องแก้ทุกจุดที่เรียกใช้งานซึ่งสมมติว่าพฤติกรรมเป็นของตัวเดิม วิธีที่ถูกกว่าในการค้นหาว่าเวิร์กโหลดหนึ่งควรอยู่บนระดับชั้นใด คือรันทั้งสองตัวไว้หลังเอนด์พอยต์เดียวและย้ายทราฟฟิกระหว่างกันด้วยการตั้งค่าแทนการรีแฟกเตอร์
นั่นคือสิ่งที่ OrcaRouter มีไว้เพื่อ Claude Sonnet 5.5 อยู่ในแคตตาล็อกในชื่อ anthropic/claude-sonnet-5.5 ควบคู่ไปกับ Claude Sonnet 5, Claude Opus 5.5 และ Claude Haiku 4.5 — ระดับ Haiku รุ่นเก่ายังคงพร้อมใช้งานเป็นจุดอ้างอิงระหว่างที่คุณย้ายออกจากมัน แพลตฟอร์มส่งผ่านราคาตามรายการของผู้ให้บริการโดยไม่บวกเพิ่มเลย ดังนั้น $2.00 และ $10.00 ข้างต้นคืออัตราที่คุณจ่าย และในทางกลับกันก็เป็นเช่นเดียวกัน เมื่อผู้ขายปรับราคา ราคาใหม่จะมีผลที่นี่ภายในวันเดียวกัน ซึ่งเป็นวิธีที่การลดราคาการอ่านแคชของ Claude Sonnet 5.5 มาถึงเรา ฟีเจอร์สองอย่างทำงานในส่วนที่การตัดสินใจครั้งนี้ต้องใช้ การสลับใช้งานอัตโนมัติช่วยให้โมเดลที่คุณยังประเมินอยู่พ้นจากเส้นทางวิกฤตของคุณได้เอง และ routing DSL ช่วยให้คุณส่งคำขอที่ต่ำกว่า 100,000 โทเคนไปยังระดับราคาถูก และยกคำขอที่ใช้บริบทขนาดยาวหรือระยะยาวให้ระดับที่แพงกว่าได้ในกระแสคำขอเดียวกัน โดยไม่ต้องมีสัญญาที่สองหรือ SDK ที่สอง
เพื่อให้ชัดเจนว่าอะไรถูกโฮสต์และอะไรไม่ถูกโฮสต์: Claude Sonnet 5.5 สามารถกำหนดเส้นทางผ่านเราได้ในวันนี้ ส่วน Claude Haiku 5.5 ยังไม่อยู่ในแค็ตตาล็อก จนกว่าจะเป็นเช่นนั้น มันอยู่บน API ของ Anthropic เอง และแพลตฟอร์มคลาวด์สามแห่งที่ระบุไว้ข้างต้น
วิธีตัดสินใจ
เลือก Claude Haiku 5.5 เมื่องานนั้นแคบ มีปริมาณสูง และตรวจสอบได้ — การจำแนกประเภท การสกัดข้อมูล การจัดเส้นทาง การสรุปย่อ งานต่อรอบภายในเอเจนต์ที่คุณสร้างเสร็จแล้ว ช่องว่างอัตรา 20 เท่าคือประเด็นทั้งหมดตรงนั้น ขั้นตอน 100,000 โทเค็นสามารถหลีกเลี่ยงได้โดยการออกแบบ และค่าใช้จ่าย $0.21 ต่องานที่วัดอย่างอิสระบอกว่าชัยชนะยังคงอยู่แม้นอกห้องแล็บของผู้ขายเอง ตั้งหน้าปัดความพยายามตามระดับชั้นของงานแทนที่จะปล่อยให้เป็นค่าเริ่มต้น บนโมเดลระดับ Haiku ความแตกต่างระหว่าง Low กับ Max คือตัวคูณต้นทุน ไม่ใช่ความชอบด้านคุณภาพ
เลือก Claude Sonnet 5.5 เมื่องานเป็นงานระยะยาว ต้องทำงานแบบเอเจนต์ หรือตรวจสอบยืนยันไม่ได้ — โค้ดที่ต้องคอมไพล์ได้ การใช้คอมพิวเตอร์ที่ต้องทิ้งหน้าจอไว้ในสถานะที่รู้แน่ชัด งานใดก็ตามที่คำตอบผิดมีต้นทุนสูงกว่าการเรียกใช้ Terminal-Bench 4.0 ที่ 70.6% เทียบกับ 39.2% ไม่ใช่ความแตกต่างเล็กน้อย แต่เป็นคนละระดับความสามารถ และการคิดราคาแบบเหมาจ่ายหมายความว่าบริบทยาวไม่ได้ปรับราคาคำขอทั้งหมดใหม่อย่างเงียบ ๆ หากภาระงานของคุณอยู่กึ่งกลางจริง ๆ คำตอบที่ซื่อสัตย์คือยังไม่มีโมเดลไหนที่มีการทำซ้ำโดยบุคคลที่สามอย่างกว้างขวางรองรับอยู่เบื้องหลัง คะแนนดัชนีมาจากฮาร์เนสเพียงตัวเดียว และตัวเลขผู้ขายที่อ้างถึงข้างต้นเป็นข้อมูลของผู้ขายเอง
อะไรจะทำให้คำตอบนี้เปลี่ยนไป
มีสามสิ่งที่ควรจับตา และไม่มีข้อใดเป็นการเปิดตัว benchmark ข้อแรกคือการประเมินโดยอิสระของ Claude Haiku 5.5 ที่ระดับความพยายาม Low, High และ Xhigh — ไม่ใช่แค่ Max — ว่าจะให้อัตราส่วนต้นทุนต่องานเท่ากันหรือไม่ เพราะปุ่มปรับความพยายามเป็นคันโยกที่ถูกที่สุดในการเปรียบเทียบ และเป็นสิ่งที่ถูกวัดน้อยที่สุด ข้อที่สองคือขั้น 100,000 โทเคนจะยังคงอยู่หรือไม่; การมีแบนด์ที่สาม หรือไม่มีแบนด์เลยในรุ่นถัดไป จะเปลี่ยนการคำนวณสำหรับไปป์ไลน์การค้นคืนทุกรายในสายนี้ มากกว่าคะแนน benchmark ใด ๆ เพียงค่าเดียว ข้อที่สามคือโทเคไนเซอร์ หากเช็กพอยต์ภายหลังแบ่งโทเคนข้อความเดิมด้วยอัตราเก่า ค่าเฉลี่ย 75% ของ Anthropic จะกลายเป็นค่าพื้นแทนที่จะเป็นเป้าหมาย และช่องว่างเมื่อเทียบกับ Claude Sonnet 5.5 จะกว้างขึ้นโดยที่ราคาไม่ขยับทั้งคู่
การเปรียบเทียบในบทความนี้2
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
