
Claude Haiku 5.5 กับ Gemini 3.7 Flash: หนึ่งในสองนี้ถูกปลดระวางไปแล้ว
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIOpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- AnthropicAnthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIGrok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 60 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 356 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
มีข้อเท็จจริงที่น่าอึดอัดแฝงอยู่ใต้การเปรียบเทียบClaude Haiku 5.5กับGemini 3.7 Flashใด ๆ ที่เขียนขึ้นในวันนี้: Gemini 3.7 Flash ถูกเลิกใช้แล้ว ผู้จำหน่ายเปิดตัวมันเมื่อวันที่ 13 สิงหาคม 2026 แทนที่ด้วย Gemini 3.8 Flash เมื่อวันที่ 2 กันยายน และปัจจุบัน Artificial Analysis มีหน้า 3.7 พร้อมแฟล็กแจ้งการเลิกใช้ติดอยู่ ในทางตรงกันข้าม Claude Haiku 5.5 เปิดตัวเมื่อวันที่ 7 ตุลาคม 2026 และมีคำมั่นว่าจะเลิกให้บริการไม่เร็วกว่าเดือนตุลาคม 2027
นั่นไม่ได้ทำให้การเปรียบเทียบนี้ไร้ประโยชน์ แต่เปลี่ยนคำถามไป สิ่งนี้ไม่ใช่คำถามที่ว่า "ในสองตัวนี้ ฉันควรเรียกใช้ตัวไหน" อีกต่อไป — สำหรับทีมส่วนใหญ่ คำตอบคือไม่ใช่ทั้งคู่ เพราะสาย 3.7 ถูกแทนที่แล้วภายในตระกูลของมันเอง สิ่งที่มันมีประโยชน์คือสิ่งที่ละเอียดอ่อนกว่า และอาจกล่าวได้ว่ามีประโยชน์มากกว่า: การอ่านได้อย่างชัดเจนว่าระดับ flash ของ Google เคลื่อนไปเร็วแค่ไหนในสามสัปดาห์ และส่วนใดของสเปกโมเดลระดับ flash ที่กำหนดจริง ๆ ว่าจะถูกนำไปใช้หรือไม่
สิ่งที่คุณยังสามารถวัดได้
โมเดลทั้งสองได้รับการรันบนบอร์ดอิสระเดียวกัน ซึ่งเป็นที่เดียวที่ทั้งสองจะถูกนำมาเทียบเคียงกันได้เลย บน Artificial Analysis Intelligence Index v4.3.2 Claude Haiku 5.5 ทำคะแนนได้ 43.40 ในคอนฟิกูเรชัน Max เทียบกับ 39.06 ของ Gemini 3.7 Flash ในคอนฟิกูเรชัน High — ห่างกัน 4.33 คะแนน
ผู้จำหน่ายทั้งสองรายยังเผยแพร่ชุดการประเมินของตนเอง และชุดเหล่านี้ไม่ทับซ้อนกันในลักษณะที่ทำให้สามารถเปรียบเทียบโดยตรงได้ แถวอิสระที่มีร่วมกันคือสี่แถวที่ Artificial Analysis ทดสอบกับทั้งสองระบบ:
• Terminal Bench 4.0 — 0.3283 สำหรับ Claude Haiku 5.5 เทียบกับ 0.1364 สำหรับ Gemini 3.7 Flash ช่องว่างสัมบูรณ์ 19 จุด และเป็นความไม่สมมาตรที่กว้างที่สุดในชุดนี้
• SciCode — 0.5498 เทียบกับ 0.5718 Gemini 3.7 Flash เหนือกว่าอยู่ 2.2 คะแนน
• Humanity's Last Exam — 0.4439 เทียบกับ 0.4787 Gemini 3.7 Flash ต่างกัน 3.5 คะแนน
• AutomationBench, คะแนนบางส่วน — 0.3541 เทียบกับ 0.6203 Gemini 3.7 Flash นำอยู่ 27 คะแนน
อ่านชุดข้อมูลนั้นให้ดี เพราะมันมีผลลัพธ์ที่น่าสนใจอยู่ในนั้น Gemini 3.7 Flash ชนะสามในสี่ของเบนช์มาร์กที่ใช้ร่วมกัน และยังแพ้ดัชนีคอมโพสิตอยู่ 4.3 คะแนน ดัชนีคือการผสมแบบถ่วงน้ำหนัก และการถ่วงน้ำหนักนั้นจัดให้แถวเทอร์มินัลและโค้ด — ที่ซึ่งช่องว่างวิ่งสวนทางกันด้วยส่วนต่างที่มากกว่ามาก — มาก่อนผลรวมของแถวอื่น ๆ นั่นไม่ใช่ความคลาดเคลื่อนของระบบให้คะแนนเท่าไรนัก แต่เป็นข้อความเกี่ยวกับว่าดัชนีนี้มีไว้เพื่ออะไร: มันพยายามทำนายว่าโมเดลจะทำงานให้เสร็จได้หรือไม่ และในคำถามนั้น สาย 3.7 อ่อนแอในแบบที่คะแนนเบนช์มาร์กวิทยาศาสตร์อันน่าพอใจของมันซ่อนไว้ไม่ได้

สิ่งที่สาย 3.7 จริงๆ แล้วทำได้ไม่ดี
สองแถวเล่าเรื่องได้ดีกว่าดัชนี
Terminal Bench 4.0 ที่ 0.1364 เป็นตัวเลขต่ำ และมันอยู่ถัดจาก 0.8577 บน Terminal Bench รุ่นก่อนหน้าจากโมเดลเดียวกัน นั่นไม่ใช่โมเดลที่แย่ลง แต่เป็นเบนช์มาร์กที่เปลี่ยนสิ่งที่มันวัด และ Gemini 3.7 Flash ไม่ได้ปรับตัวเข้ากับการเปลี่ยนแปลงนั้น Claude Haiku 5.5 บนเบนช์มาร์กฉบับปรับปรุงเดียวกัน ทำคะแนนได้ 0.3283 — ไม่น่าตื่นเต้นเมื่อเทียบเป็นค่าสัมบูรณ์ แต่ก็เกือบสองเท่าครึ่งของตัวเลข 3.7 Flash ในแถวที่ทำนายประสิทธิภาพการเขียนโค้ดแบบเอเจนต์ได้ตรงที่สุด
แถวที่สองคือ Tau-Bench Banking ซึ่ง Gemini 3.7 Flash ได้คะแนน 0.3278 ความน่าเชื่อถือในการใช้เครื่องมือในโดเมนที่มีโครงสร้างเป็นสิ่งที่โมเดลราคาถูกถูกนำไปใช้งานจริง และคะแนนที่ต่ำกว่า 0.33 เป็นตัวเลขประเภทที่ฆ่าโครงการนำร่องอย่างเงียบๆ Claude Haiku 5.5 ไม่มีตัวเลข Tau-Bench ที่เผยแพร่ในตารางเดียวกัน ดังนั้นจึงไม่มีการเปรียบเทียบที่พร้อมใช้งานตรงนั้น — สิ่งที่ซื่อสัตย์คือการบอกเช่นนั้นแทนที่จะอนุมานขึ้นมา
จุดที่ Gemini 3.7 Flash ยืนหยัดได้ก็คือจุดที่มันยืนหยัดได้เสมอมา: GPQA ที่ 0.9455 และ MMMU-Pro ที่ 0.8549 ต่างเป็นจุดแข็งที่แท้จริง และอินพุตแบบมัลติโมดัลของมันไม่เคยเป็นที่น่าสงสัยเลย ความล้มเหลวอยู่ที่ส่วนของสเปกชีตที่ตัดสินว่าลูปของเอเจนต์จะทำงานได้หรือไม่ ไม่ใช่ส่วนที่คว้าแถวบนกระดานผู้นำ
อะไรเปลี่ยนแปลงไปในสามสัปดาห์หลังจากนั้น
Gemini 3.8 Flash เปิดตัวเมื่อวันที่ 2 กันยายน 2026 และความเคลื่อนไหวภายในระดับ Flash ของ Google เองคือการเปรียบเทียบที่มีประโยชน์กว่า สำหรับใครก็ตามที่กำลังวางแผนไปป์ไลน์สำหรับปี 2027
บนดัชนีเดียวกัน Gemini 3.8 Flash วัดได้ 40.93 เทียบกับ 39.06 ของสาย 3.7 — เพิ่มขึ้น 1.87 จุดในสามสัปดาห์ Terminal Bench 4.0 ขยับจาก 0.1364 เป็น 0.1970 Tau-Bench Banking ขยับจาก 0.3278 เป็น 0.4495 นั่นคือแถวที่โมเดล 3.7 ทำได้แย่ที่สุดพอดี ซึ่งบ่งชี้ว่ารุ่นสืบทอดถูกมุ่งเป้าไปที่จุดอ่อนนี้โดยเฉพาะ มากกว่าที่จะเป็นการยกระดับความสามารถโดยทั่วไป
ราคาไม่ขยับเลยแม้แต่นิดเดียว Gemini 3.7 Flash ถูกตั้งราคาไว้ที่ $0.75 สำหรับอินพุต และ $3.75 สำหรับเอาต์พุต ต่อล้านโทเค็น และ Gemini 3.8 Flash เปิดตัวที่ราคา $0.75 และ $3.75 เท่ากัน — ตารางราคาชุดเดียวกันเป๊ะ ผูกอยู่กับโมเดลที่ดีขึ้นสองจุดดัชนีในแถวที่สำคัญสำหรับเอเจนต์

เรทการ์ดคือจุดที่การเปรียบเทียบนี้พลิกผันอย่างแท้จริง
เมื่อเทียบกับ Claude Haiku 5.5 ราคาของ Google คือทั้งหมดที่ต้องพูด และมันไม่ใกล้เคียงเลย
• อินพุต — Claude Haiku 5.5 $0.10 ต่อล้านโทเค็นจนถึง 100,000, $0.50 สำหรับส่วนที่เกิน; Gemini 3.7 Flash $0.75 แบบคงที่ หรือ 7.5 เท่าของอัตรา Anthropic ภายในระดับแรก
• เอาต์พุต — $0.50 สำหรับ Claude Haiku 5.5 ในระดับแรก, $2.50 เมื่อเกินระดับนั้นขึ้นไป; $3.75 สำหรับ Gemini 3.7 Flash
• อินพุตที่แคชไว้ — $0.01 และ $0.125 สำหรับ Claude Haiku 5.5; อ่าน $0.075 และเขียน $0.75 สำหรับ Gemini 3.7 Flash
• บริบท — หนึ่งล้านโทเคนสำหรับทั้งคู่ เอาต์พุตสูงสุด — 128,000 โทเคนสำหรับ Claude Haiku 5.5 เทียบกับ 65,536 สำหรับ Gemini 3.7 Flash
• รูปแบบอินพุต — ข้อความและรูปภาพสำหรับ Claude Haiku 5.5; ข้อความ รูปภาพ เสียงพูด และวิดีโอสำหรับ Gemini 3.7 Flash นี่คือบรรทัดเดียวที่สเปกของ Google ยาวกว่าอย่างแท้จริง และยังคงอยู่เหมือนเดิมเมื่อสืบทอดมาถึง 3.8
• ต้นทุนอิสระต่อหนึ่งงาน Index ที่เสร็จสมบูรณ์ — $0.21 สำหรับ Claude Haiku 5.5 เทียบกับ $0.93 สำหรับ Gemini 3.7 Flash ช่องว่าง 4.4 เท่านี้กว้างกว่าที่อัตราส่วนอินพุต 7.5 ต่อ 1 จะชี้ให้เห็น เพราะโมเดลของ Anthropic เป็นฝ่ายใช้คำมากกว่าในกรณีนี้: 162,164 โทเคนเอาต์พุตต่องาน Index เทียบกับ 58,387 สำหรับ Gemini 3.7 Flash Anthropic ยังระบุด้วยว่าใช้โทเคไนเซอร์ร่วมกับ Claude 4.7 และรุ่นหลังจากนั้น ซึ่งนับโทเคนมากกว่าประมาณ 30% สำหรับข้อความเดียวกัน ซึ่งยิ่งส่งผลไปในทิศทางเดียวกัน
• ความเร็ว — 212.3 วินาทีต่องาน Index สำหรับ Gemini 3.7 Flash เทียบกับ 424.6 สำหรับ Claude Haiku 5.5 โมเดลของ Google เร็วกว่าอีกตัวหนึ่งเป็นสองเท่า ซึ่งเป็นบรรทัดเดียวในส่วนนี้ที่โมเดลที่ถูกกว่าไม่ได้เป็นตัวที่ดีกว่าไปด้วย
สิ่งนี้หมายความว่าอย่างไรหากคุณกำลังเลือกในวันนี้
การตีความในทางปฏิบัติก็คือ ทั้งสองอย่างนี้ไม่ใช่คำตอบที่ถูกต้อง ด้วยเหตุผลที่แตกต่างกัน
Gemini 3.7 Flash ถูกจัดเป็นรุ่นที่เลิกสนับสนุนแล้ว มีราคาในอัตราเดียวกับรุ่นสืบทอด และแย่กว่ารุ่นสืบทอดนั้นในแถวที่โมเดลโปรดักชันราคาถูกจำเป็นต้องใช้พอดี การแนะนำมันจึงเท่ากับการแนะนำเรตการ์ดที่ผูกอยู่กับโมเดลที่ถูกแทนที่แล้ว — รุ่นสืบทอดราคาเท่ากันและทำได้มากกว่า ไม่มีใครที่กำลังเลือกระหว่างสองรุ่นนี้ในเดือนตุลาคม 2026 ควรลงเอยที่ไลน์ 3.7 และการที่เรตการ์ดของมันไม่เปลี่ยนแปลงคือสิ่งที่ชี้ขาด
Claude Haiku 5.5 เป็นโมเดลที่ใช้งานจริง และสำหรับงานแบบข้อความเข้า-ข้อความออก มันมีราคาถูกกว่าในทุกตัวชี้วัด มีคะแนนคอมโพสิตสูงกว่า และดีกว่าอย่างมากในสองแถวที่ทำนายความสำเร็จแบบเอเจนต์ นอกจากนี้ยังเป็นตัวที่ช้ากว่า และไม่สามารถรับเสียงหรือวิดีโอได้ ว่าสิ่งนั้นสำคัญหรือไม่นั้นเป็นคำถามเกี่ยวกับไปป์ไลน์ของคุณ ไม่ใช่เกี่ยวกับตัวโมเดล
ทางเลือกที่สาม ซึ่งช่องว่างคะแนนดัชนีระหว่าง 3.8 กับ 3.7 ทำให้เห็นได้ชัด ก็คือระดับ Flash ของ Google เคลื่อนที่เร็วพอจนการเปรียบเทียบที่มีอายุสามสัปดาห์กลายเป็นเรื่องในอดีตไปแล้ว ให้ถือว่าการเปรียบเทียบระดับ Flash แบบตัวต่อตัวใด ๆ มีอายุการใช้งานนับเป็นสัปดาห์ ไม่ใช่ไตรมาส
ดูแลไม่ว่าคุณจะลงเอยที่ฝั่งไหน
Gemini 3.8 Flash — รุ่นสืบทอด ไม่ใช่ 3.7 ที่เลิกใช้แล้ว — อยู่ในแคตตาล็อกของ OrcaRouter ในราคาที่ Google ประกาศ โดยบวกเพิ่ม 0% ดังนั้นอัตราที่ Google ประกาศคืออัตราที่ไปถึงบิลของคุณ และการเปลี่ยนแปลงฝั่งพวกเขามีผลบนฝั่งเราในวันเดียวกัน Claude Sonnet 5.5 และ Claude Opus 5.5 ก็อยู่ในแคตตาล็อกเช่นกัน ซึ่งทำให้การทดสอบการกำหนดเส้นทางแบบสองผู้ให้บริการเป็นเพียงการตั้งค่า ไม่ใช่โปรเจกต์: API เดียวสำหรับกว่า 200 โมเดล คีย์เดียว การสลับสำรองอัตโนมัติอยู่เบื้องหลัง และมี routing DSL ไว้ใช้เมื่อคุณอยากเก็บการยกระดับไว้ในเส้นทางมากกว่าในโค้ด
ตัว Gemini 3.7 Flash เองไม่มีอยู่ในแค็ตตาล็อกของเรา และ Claude Haiku 5.5 ก็เช่นกัน ทั้งสองยังคงเข้าถึงได้ผ่าน API ของผู้ขายเอง และในกรณีของ Google ยังเข้าถึงได้ผ่านแพลตฟอร์มของบุคคลที่สามหลายแห่ง เรื่องนี้ควรระบุให้ชัดเจนแทนที่จะปล่อยให้ผู้อ่านไปค้นพบเอง

จำนวนที่ต้องหักออก
มันไม่ใช่ช่องว่างของดัชนี 4.33 จุด แต่เป็นเพราะ Gemini 3.7 Flash ชนะสามในสี่ของเบนช์มาร์กที่ใช้ร่วมกัน และยังแพ้คะแนนรวมอยู่สี่จุด เพราะเบนช์มาร์กที่ดัชนีให้น้ำหนักมากที่สุดคืออันที่มันได้คะแนน 0.1364 คะแนนด้านวิทยาศาสตร์ของโมเดลระดับ flash อาจดูดีได้ ในขณะที่มันล้มเหลวในสิ่งที่โมเดลราคาถูกถูกซื้อมาเพื่อทำ
ข้อสรุปที่ตามมาคือผู้สืบทอดตำแหน่งได้แก้ไขแถวเหล่านั้นอย่างแม่นยำภายในสามสัปดาห์ ในราคาที่ไม่เปลี่ยนแปลง จากหลักฐานนี้ แรงกดดันด้านการแข่งขันในระดับนี้ไม่ใช่ราคา แต่คือว่าโมเดลสามารถทำงานหลายขั้นตอนจนเสร็จได้หรือไม่ และตอนนี้สิ่งนั้นเคลื่อนไหวเร็วกว่าที่ตารางราคาจะตามทัน
