การ์ดหลักที่มีหัวข้อ 'Claude Haiku 5.5 vs Gemini 3.7 Flash' แสดง Claude Haiku 5.5 ซึ่งเปิดตัวเมื่อวันที่ 7 ตุลาคม 2026 ทางด้านซ้าย เทียบกับ Gemini 3.7 Flash ที่ถูกทำเครื่องหมายว่าเลิกใช้งานแล้วทางด้านขวา แถว Intelligence Index v4.3.2 ที่แสดงค่า 43.40 เทียบกับ 39.06 และแถว Terminal Bench 4.0 ที่แสดงค่า 0.3283 เทียบกับ 0.1364
Guides & Insights

Claude Haiku 5.5 กับ Gemini 3.7 Flash: หนึ่งในสองนี้ถูกปลดระวางไปแล้ว

ผู้เขียน

Gideon Frost

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

มีข้อเท็จจริงที่น่าอึดอัดแฝงอยู่ใต้การเปรียบเทียบClaude Haiku 5.5กับGemini 3.7 Flashใด ๆ ที่เขียนขึ้นในวันนี้: Gemini 3.7 Flash ถูกเลิกใช้แล้ว ผู้จำหน่ายเปิดตัวมันเมื่อวันที่ 13 สิงหาคม 2026 แทนที่ด้วย Gemini 3.8 Flash เมื่อวันที่ 2 กันยายน และปัจจุบัน Artificial Analysis มีหน้า 3.7 พร้อมแฟล็กแจ้งการเลิกใช้ติดอยู่ ในทางตรงกันข้าม Claude Haiku 5.5 เปิดตัวเมื่อวันที่ 7 ตุลาคม 2026 และมีคำมั่นว่าจะเลิกให้บริการไม่เร็วกว่าเดือนตุลาคม 2027

นั่นไม่ได้ทำให้การเปรียบเทียบนี้ไร้ประโยชน์ แต่เปลี่ยนคำถามไป สิ่งนี้ไม่ใช่คำถามที่ว่า "ในสองตัวนี้ ฉันควรเรียกใช้ตัวไหน" อีกต่อไป — สำหรับทีมส่วนใหญ่ คำตอบคือไม่ใช่ทั้งคู่ เพราะสาย 3.7 ถูกแทนที่แล้วภายในตระกูลของมันเอง สิ่งที่มันมีประโยชน์คือสิ่งที่ละเอียดอ่อนกว่า และอาจกล่าวได้ว่ามีประโยชน์มากกว่า: การอ่านได้อย่างชัดเจนว่าระดับ flash ของ Google เคลื่อนไปเร็วแค่ไหนในสามสัปดาห์ และส่วนใดของสเปกโมเดลระดับ flash ที่กำหนดจริง ๆ ว่าจะถูกนำไปใช้หรือไม่

สิ่งที่คุณยังสามารถวัดได้

โมเดลทั้งสองได้รับการรันบนบอร์ดอิสระเดียวกัน ซึ่งเป็นที่เดียวที่ทั้งสองจะถูกนำมาเทียบเคียงกันได้เลย บน Artificial Analysis Intelligence Index v4.3.2 Claude Haiku 5.5 ทำคะแนนได้ 43.40 ในคอนฟิกูเรชัน Max เทียบกับ 39.06 ของ Gemini 3.7 Flash ในคอนฟิกูเรชัน High — ห่างกัน 4.33 คะแนน

ผู้จำหน่ายทั้งสองรายยังเผยแพร่ชุดการประเมินของตนเอง และชุดเหล่านี้ไม่ทับซ้อนกันในลักษณะที่ทำให้สามารถเปรียบเทียบโดยตรงได้ แถวอิสระที่มีร่วมกันคือสี่แถวที่ Artificial Analysis ทดสอบกับทั้งสองระบบ:

• Terminal Bench 4.0 — 0.3283 สำหรับ Claude Haiku 5.5 เทียบกับ 0.1364 สำหรับ Gemini 3.7 Flash ช่องว่างสัมบูรณ์ 19 จุด และเป็นความไม่สมมาตรที่กว้างที่สุดในชุดนี้

• SciCode — 0.5498 เทียบกับ 0.5718 Gemini 3.7 Flash เหนือกว่าอยู่ 2.2 คะแนน

• Humanity's Last Exam — 0.4439 เทียบกับ 0.4787 Gemini 3.7 Flash ต่างกัน 3.5 คะแนน

• AutomationBench, คะแนนบางส่วน — 0.3541 เทียบกับ 0.6203 Gemini 3.7 Flash นำอยู่ 27 คะแนน

อ่านชุดข้อมูลนั้นให้ดี เพราะมันมีผลลัพธ์ที่น่าสนใจอยู่ในนั้น Gemini 3.7 Flash ชนะสามในสี่ของเบนช์มาร์กที่ใช้ร่วมกัน และยังแพ้ดัชนีคอมโพสิตอยู่ 4.3 คะแนน ดัชนีคือการผสมแบบถ่วงน้ำหนัก และการถ่วงน้ำหนักนั้นจัดให้แถวเทอร์มินัลและโค้ด — ที่ซึ่งช่องว่างวิ่งสวนทางกันด้วยส่วนต่างที่มากกว่ามาก — มาก่อนผลรวมของแถวอื่น ๆ นั่นไม่ใช่ความคลาดเคลื่อนของระบบให้คะแนนเท่าไรนัก แต่เป็นข้อความเกี่ยวกับว่าดัชนีนี้มีไว้เพื่ออะไร: มันพยายามทำนายว่าโมเดลจะทำงานให้เสร็จได้หรือไม่ และในคำถามนั้น สาย 3.7 อ่อนแอในแบบที่คะแนนเบนช์มาร์กวิทยาศาสตร์อันน่าพอใจของมันซ่อนไว้ไม่ได้

A two-column scoreboard titled 'Claude Haiku 5.5 vs Gemini 3.7 Flash - the scoreboard' with rows Index v4.3.2 43.40 against 39.06, Terminal Bench 4.0 0.3283 against 0.1364, SciCode 0.5498 against 0.5718, Humanity's Last Exam 0.4439 against 0.4787, cost per task $0.21 against $0.93 and input price $0.10 against $0.75, footed 'Gemini 3.7 Flash is listed as deprecated; all figures per Artificial Analysis v4.3.2.'

สิ่งที่สาย 3.7 จริงๆ แล้วทำได้ไม่ดี

สองแถวเล่าเรื่องได้ดีกว่าดัชนี

Terminal Bench 4.0 ที่ 0.1364 เป็นตัวเลขต่ำ และมันอยู่ถัดจาก 0.8577 บน Terminal Bench รุ่นก่อนหน้าจากโมเดลเดียวกัน นั่นไม่ใช่โมเดลที่แย่ลง แต่เป็นเบนช์มาร์กที่เปลี่ยนสิ่งที่มันวัด และ Gemini 3.7 Flash ไม่ได้ปรับตัวเข้ากับการเปลี่ยนแปลงนั้น Claude Haiku 5.5 บนเบนช์มาร์กฉบับปรับปรุงเดียวกัน ทำคะแนนได้ 0.3283 — ไม่น่าตื่นเต้นเมื่อเทียบเป็นค่าสัมบูรณ์ แต่ก็เกือบสองเท่าครึ่งของตัวเลข 3.7 Flash ในแถวที่ทำนายประสิทธิภาพการเขียนโค้ดแบบเอเจนต์ได้ตรงที่สุด

แถวที่สองคือ Tau-Bench Banking ซึ่ง Gemini 3.7 Flash ได้คะแนน 0.3278 ความน่าเชื่อถือในการใช้เครื่องมือในโดเมนที่มีโครงสร้างเป็นสิ่งที่โมเดลราคาถูกถูกนำไปใช้งานจริง และคะแนนที่ต่ำกว่า 0.33 เป็นตัวเลขประเภทที่ฆ่าโครงการนำร่องอย่างเงียบๆ Claude Haiku 5.5 ไม่มีตัวเลข Tau-Bench ที่เผยแพร่ในตารางเดียวกัน ดังนั้นจึงไม่มีการเปรียบเทียบที่พร้อมใช้งานตรงนั้น — สิ่งที่ซื่อสัตย์คือการบอกเช่นนั้นแทนที่จะอนุมานขึ้นมา

จุดที่ Gemini 3.7 Flash ยืนหยัดได้ก็คือจุดที่มันยืนหยัดได้เสมอมา: GPQA ที่ 0.9455 และ MMMU-Pro ที่ 0.8549 ต่างเป็นจุดแข็งที่แท้จริง และอินพุตแบบมัลติโมดัลของมันไม่เคยเป็นที่น่าสงสัยเลย ความล้มเหลวอยู่ที่ส่วนของสเปกชีตที่ตัดสินว่าลูปของเอเจนต์จะทำงานได้หรือไม่ ไม่ใช่ส่วนที่คว้าแถวบนกระดานผู้นำ

อะไรเปลี่ยนแปลงไปในสามสัปดาห์หลังจากนั้น

Gemini 3.8 Flash เปิดตัวเมื่อวันที่ 2 กันยายน 2026 และความเคลื่อนไหวภายในระดับ Flash ของ Google เองคือการเปรียบเทียบที่มีประโยชน์กว่า สำหรับใครก็ตามที่กำลังวางแผนไปป์ไลน์สำหรับปี 2027

บนดัชนีเดียวกัน Gemini 3.8 Flash วัดได้ 40.93 เทียบกับ 39.06 ของสาย 3.7 — เพิ่มขึ้น 1.87 จุดในสามสัปดาห์ Terminal Bench 4.0 ขยับจาก 0.1364 เป็น 0.1970 Tau-Bench Banking ขยับจาก 0.3278 เป็น 0.4495 นั่นคือแถวที่โมเดล 3.7 ทำได้แย่ที่สุดพอดี ซึ่งบ่งชี้ว่ารุ่นสืบทอดถูกมุ่งเป้าไปที่จุดอ่อนนี้โดยเฉพาะ มากกว่าที่จะเป็นการยกระดับความสามารถโดยทั่วไป

ราคาไม่ขยับเลยแม้แต่นิดเดียว Gemini 3.7 Flash ถูกตั้งราคาไว้ที่ $0.75 สำหรับอินพุต และ $3.75 สำหรับเอาต์พุต ต่อล้านโทเค็น และ Gemini 3.8 Flash เปิดตัวที่ราคา $0.75 และ $3.75 เท่ากัน — ตารางราคาชุดเดียวกันเป๊ะ ผูกอยู่กับโมเดลที่ดีขึ้นสองจุดดัชนีในแถวที่สำคัญสำหรับเอเจนต์

A capture of Google's Gemini API pricing documentation page, headed 'Gemini Developer API pricing', with the banner 'Gemini 3.8 Flash is now available. Try it out.' and the documentation's left-hand model list showing Gemini 3.8 Flash, Gemini 3.7 Flash, Gemini 3.6 Flash and Gemini 3.5 Flash.

เรทการ์ดคือจุดที่การเปรียบเทียบนี้พลิกผันอย่างแท้จริง

เมื่อเทียบกับ Claude Haiku 5.5 ราคาของ Google คือทั้งหมดที่ต้องพูด และมันไม่ใกล้เคียงเลย

• อินพุต — Claude Haiku 5.5 $0.10 ต่อล้านโทเค็นจนถึง 100,000, $0.50 สำหรับส่วนที่เกิน; Gemini 3.7 Flash $0.75 แบบคงที่ หรือ 7.5 เท่าของอัตรา Anthropic ภายในระดับแรก

• เอาต์พุต — $0.50 สำหรับ Claude Haiku 5.5 ในระดับแรก, $2.50 เมื่อเกินระดับนั้นขึ้นไป; $3.75 สำหรับ Gemini 3.7 Flash

• อินพุตที่แคชไว้ — $0.01 และ $0.125 สำหรับ Claude Haiku 5.5; อ่าน $0.075 และเขียน $0.75 สำหรับ Gemini 3.7 Flash

• บริบท — หนึ่งล้านโทเคนสำหรับทั้งคู่ เอาต์พุตสูงสุด — 128,000 โทเคนสำหรับ Claude Haiku 5.5 เทียบกับ 65,536 สำหรับ Gemini 3.7 Flash

• รูปแบบอินพุต — ข้อความและรูปภาพสำหรับ Claude Haiku 5.5; ข้อความ รูปภาพ เสียงพูด และวิดีโอสำหรับ Gemini 3.7 Flash นี่คือบรรทัดเดียวที่สเปกของ Google ยาวกว่าอย่างแท้จริง และยังคงอยู่เหมือนเดิมเมื่อสืบทอดมาถึง 3.8

• ต้นทุนอิสระต่อหนึ่งงาน Index ที่เสร็จสมบูรณ์ — $0.21 สำหรับ Claude Haiku 5.5 เทียบกับ $0.93 สำหรับ Gemini 3.7 Flash ช่องว่าง 4.4 เท่านี้กว้างกว่าที่อัตราส่วนอินพุต 7.5 ต่อ 1 จะชี้ให้เห็น เพราะโมเดลของ Anthropic เป็นฝ่ายใช้คำมากกว่าในกรณีนี้: 162,164 โทเคนเอาต์พุตต่องาน Index เทียบกับ 58,387 สำหรับ Gemini 3.7 Flash Anthropic ยังระบุด้วยว่าใช้โทเคไนเซอร์ร่วมกับ Claude 4.7 และรุ่นหลังจากนั้น ซึ่งนับโทเคนมากกว่าประมาณ 30% สำหรับข้อความเดียวกัน ซึ่งยิ่งส่งผลไปในทิศทางเดียวกัน

• ความเร็ว — 212.3 วินาทีต่องาน Index สำหรับ Gemini 3.7 Flash เทียบกับ 424.6 สำหรับ Claude Haiku 5.5 โมเดลของ Google เร็วกว่าอีกตัวหนึ่งเป็นสองเท่า ซึ่งเป็นบรรทัดเดียวในส่วนนี้ที่โมเดลที่ถูกกว่าไม่ได้เป็นตัวที่ดีกว่าไปด้วย

สิ่งนี้หมายความว่าอย่างไรหากคุณกำลังเลือกในวันนี้

การตีความในทางปฏิบัติก็คือ ทั้งสองอย่างนี้ไม่ใช่คำตอบที่ถูกต้อง ด้วยเหตุผลที่แตกต่างกัน

Gemini 3.7 Flash ถูกจัดเป็นรุ่นที่เลิกสนับสนุนแล้ว มีราคาในอัตราเดียวกับรุ่นสืบทอด และแย่กว่ารุ่นสืบทอดนั้นในแถวที่โมเดลโปรดักชันราคาถูกจำเป็นต้องใช้พอดี การแนะนำมันจึงเท่ากับการแนะนำเรตการ์ดที่ผูกอยู่กับโมเดลที่ถูกแทนที่แล้ว — รุ่นสืบทอดราคาเท่ากันและทำได้มากกว่า ไม่มีใครที่กำลังเลือกระหว่างสองรุ่นนี้ในเดือนตุลาคม 2026 ควรลงเอยที่ไลน์ 3.7 และการที่เรตการ์ดของมันไม่เปลี่ยนแปลงคือสิ่งที่ชี้ขาด

Claude Haiku 5.5 เป็นโมเดลที่ใช้งานจริง และสำหรับงานแบบข้อความเข้า-ข้อความออก มันมีราคาถูกกว่าในทุกตัวชี้วัด มีคะแนนคอมโพสิตสูงกว่า และดีกว่าอย่างมากในสองแถวที่ทำนายความสำเร็จแบบเอเจนต์ นอกจากนี้ยังเป็นตัวที่ช้ากว่า และไม่สามารถรับเสียงหรือวิดีโอได้ ว่าสิ่งนั้นสำคัญหรือไม่นั้นเป็นคำถามเกี่ยวกับไปป์ไลน์ของคุณ ไม่ใช่เกี่ยวกับตัวโมเดล

ทางเลือกที่สาม ซึ่งช่องว่างคะแนนดัชนีระหว่าง 3.8 กับ 3.7 ทำให้เห็นได้ชัด ก็คือระดับ Flash ของ Google เคลื่อนที่เร็วพอจนการเปรียบเทียบที่มีอายุสามสัปดาห์กลายเป็นเรื่องในอดีตไปแล้ว ให้ถือว่าการเปรียบเทียบระดับ Flash แบบตัวต่อตัวใด ๆ มีอายุการใช้งานนับเป็นสัปดาห์ ไม่ใช่ไตรมาส

ดูแลไม่ว่าคุณจะลงเอยที่ฝั่งไหน

Gemini 3.8 Flash — รุ่นสืบทอด ไม่ใช่ 3.7 ที่เลิกใช้แล้ว — อยู่ในแคตตาล็อกของ OrcaRouter ในราคาที่ Google ประกาศ โดยบวกเพิ่ม 0% ดังนั้นอัตราที่ Google ประกาศคืออัตราที่ไปถึงบิลของคุณ และการเปลี่ยนแปลงฝั่งพวกเขามีผลบนฝั่งเราในวันเดียวกัน Claude Sonnet 5.5 และ Claude Opus 5.5 ก็อยู่ในแคตตาล็อกเช่นกัน ซึ่งทำให้การทดสอบการกำหนดเส้นทางแบบสองผู้ให้บริการเป็นเพียงการตั้งค่า ไม่ใช่โปรเจกต์: API เดียวสำหรับกว่า 200 โมเดล คีย์เดียว การสลับสำรองอัตโนมัติอยู่เบื้องหลัง และมี routing DSL ไว้ใช้เมื่อคุณอยากเก็บการยกระดับไว้ในเส้นทางมากกว่าในโค้ด

ตัว Gemini 3.7 Flash เองไม่มีอยู่ในแค็ตตาล็อกของเรา และ Claude Haiku 5.5 ก็เช่นกัน ทั้งสองยังคงเข้าถึงได้ผ่าน API ของผู้ขายเอง และในกรณีของ Google ยังเข้าถึงได้ผ่านแพลตฟอร์มของบุคคลที่สามหลายแห่ง เรื่องนี้ควรระบุให้ชัดเจนแทนที่จะปล่อยให้ผู้อ่านไปค้นพบเอง

A capture of the OrcaRouter model page for Gemini 3.8 Flash under google/gemini-3.8-flash, showing a 65K maximum output, text, image, video, file and audio input, benchmarks published by Google on 2026-09-02, a p50 time to first token of 3.838 seconds, and the rates $0.75 input and $3.75 output per million tokens.

จำนวนที่ต้องหักออก

มันไม่ใช่ช่องว่างของดัชนี 4.33 จุด แต่เป็นเพราะ Gemini 3.7 Flash ชนะสามในสี่ของเบนช์มาร์กที่ใช้ร่วมกัน และยังแพ้คะแนนรวมอยู่สี่จุด เพราะเบนช์มาร์กที่ดัชนีให้น้ำหนักมากที่สุดคืออันที่มันได้คะแนน 0.1364 คะแนนด้านวิทยาศาสตร์ของโมเดลระดับ flash อาจดูดีได้ ในขณะที่มันล้มเหลวในสิ่งที่โมเดลราคาถูกถูกซื้อมาเพื่อทำ

ข้อสรุปที่ตามมาคือผู้สืบทอดตำแหน่งได้แก้ไขแถวเหล่านั้นอย่างแม่นยำภายในสามสัปดาห์ ในราคาที่ไม่เปลี่ยนแปลง จากหลักฐานนี้ แรงกดดันด้านการแข่งขันในระดับนี้ไม่ใช่ราคา แต่คือว่าโมเดลสามารถทำงานหลายขั้นตอนจนเสร็จได้หรือไม่ และตอนนี้สิ่งนั้นเคลื่อนไหวเร็วกว่าที่ตารางราคาจะตามทัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube