
Claude Sonnet 5.5 vs Gemini 3.1 Pro: ถูกกว่าต่อโทเคน แพงกว่า 11 เท่าต่องาน
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 984 tok/s
- openaiใหม่OpenAI: GPT-6 Luna2026-09-2237ความฉลาด
- openaiใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- grokใหม่Grok 4.72026-09-2146ความฉลาด
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น · 195 tok/s
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
บนตารางราคา Claude Sonnet 5.5 เป็นโมเดลที่ถูกกว่า และในด้านความสามารถก็ไม่ใกล้เคียงกันเลย มันเปิดให้ใช้งานทั่วไปเมื่อวันที่ 28 กันยายน 2026 ในราคา 2.00 ดอลลาร์ต่อโทเค็นอินพุตหนึ่งล้านโทเค็น และ 10.00 ดอลลาร์ต่อโทเค็นเอาต์พุตหนึ่งล้านโทเค็น; ส่วน Gemini 3.1 Pro ซึ่งประกาศเมื่อวันที่ 19 กุมภาพันธ์ 2026 และยังให้บริการผ่านปลายทางพรีวิว อยู่ที่ 2.00 และ 12.00 ดอลลาร์ Sonnet 5.5 ยังได้คะแนน 56 บน Intelligence Index v4.3 ของ Artificial Analysis เทียบกับ 30 ของ Gemini 3.1 Pro Preview — ช่องว่าง 26 จุดบนฮาร์เนสเดียว บริบท 1,048,576 โทเค็นของ Gemini เป็นตัวเลขพาดหัวเพียงตัวเดียวที่มันชนะแบบชัดเจน อย่างไรก็ตาม ผู้ประเมินรายเดิมรายงานว่าการทำภารกิจปลายเปิดหนึ่งงานให้เสร็จมีค่าใช้จ่าย 0.67 ดอลลาร์บนโมเดลของ Google และ 7.60 ดอลลาร์บนโมเดลของ Anthropic ซึ่งเป็นปัจจัย 11 เท่าที่ไปในทิศทางตรงกันข้าม ตัวเลขทั้งสองถูกต้อง และเหตุผลที่ทั้งสองอยู่ร่วมกันได้ — เพดานเอาต์พุต 65,536 โทเค็นในด้านหนึ่ง กับปัญหาความยาวเกินจำเป็นอีกด้านหนึ่ง — คือทั้งหมดของการเปรียบเทียบนี้
endpoint แต่ละตัวจริง ๆ แล้วคืออะไร
ตรวจสอบตัวตนให้ถูกต้องก่อนจะคำนวณ สิ่งที่กำลังพูดถึงตรงนี้คือ anthropic/claude-sonnet-5.5 เปิดตัวเมื่อวันที่ 28 กันยายน 2026 รับอินพุตเป็นข้อความ รูปภาพ และไฟล์ บริบทขนาด 1,000,000 โทเคน เอาต์พุตสูงสุด 128,000 โทเคน ใช้ adaptive thinking พร้อมพารามิเตอร์ effort ที่มีค่าเริ่มต้นเป็น high บน Claude Platform คู่แข่งคือ google/gemini-3.1-pro-preview เปิดตัวเมื่อวันที่ 19 กุมภาพันธ์ 2026 รับอินพุตเป็นข้อความ รูปภาพ วิดีโอ เสียง และไฟล์ บริบทขนาด 1,048,576 โทเคน เอาต์พุตสูงสุด 65,536 โทเคน หนึ่งในสองชื่อนั้นมีคำหนึ่งที่อีกชื่อไม่มี และมันไม่ใช่คำประดับ
คำต่อท้าย preview ถูกแนบไว้มาเจ็ดเดือนแล้ว Google เปิดตัว Flash หลายเวอร์ชันในช่วงเวลานั้น และไม่มีรุ่นสืบทอดของระดับ Pro โดยโมเดลที่ 3.1 Pro เข้าแทนที่ถูกระบุว่าปิดให้บริการแล้ว ไม่มีข้อใดในนั้นเป็นข้อบกพร่องของโมเดล — มันเปิดให้บริการจริง เสถียร และตั้งราคาอย่างถูกต้องมาตลอด — แต่ก็หมายความว่า endpoint ที่คุณกำลังเชื่อมต่อด้วยไม่ได้อยู่ภายใต้คำมั่นด้านวงจรชีวิตแบบ general availability และตระกูลนี้ได้ปลดระวางโมเดล Pro ไปแล้วหนึ่งรุ่น มองสิ่งนี้เป็นรายการถาวรที่ต้องนับในแผน มากกว่าจะเป็นหมายเหตุท้ายเรื่อง เพราะมันเปลี่ยนว่าการตัดสินใจด้านสถาปัตยกรรมระยะหลายปีจะมีต้นทุนเท่าใดหากคุณทำพลาด
ตัวเลขสองตัวที่ชี้ไปในทิศทางตรงกันข้าม
การเปรียบเทียบแบบต่อโทเคนก่อน เพราะมันเป็นวิธีที่ทุกคนใช้กัน และมันเอื้อต่อโมเดลที่ใหม่กว่า
• อินพุต — $2.00 ต่อล้านสำหรับทั้งสองแบบ; เสมอกันพอดีที่อัตราราคาหลัก
• เอาต์พุต — 10.00 ดอลลาร์สำหรับ Claude Sonnet 5.5 เทียบกับ 12.00 ดอลลาร์สำหรับ Gemini 3.1 Pro; โมเดลของ Anthropic ถูกกว่า 17%
• Cache read — $0.20 ต่อล้านสำหรับทั้งสองรายการที่ต่ำกว่าขอบเขต tier
• การเขียนแคช — $2.50 ต่อล้านสำหรับหน้าต่างห้านาทีบน Claude Sonnet 5.5 เทียบกับ $0.375 สำหรับ Gemini 3.1 Pro; Google ถูกกว่าประมาณเจ็ดเท่าในการเขียนรายการแคช
• บริบท — 1,000,000 กับ 1,048,576; ความแตกต่างที่ไม่มีผลในทางปฏิบัติ
• เอาต์พุตสูงสุด — 128,000 โทเคน เทียบกับ 65,536; โมเดลของ Anthropic มีเพดานสูงกว่าเกือบสองเท่า
• รูปแบบอินพุต — ข้อความ รูปภาพ และไฟล์ เทียบกับ ข้อความ รูปภาพ วิดีโอ เสียง และไฟล์
จากนั้นการเปรียบเทียบต่องาน จากผู้ประเมินรายเดียวกัน ในสัปดาห์เดียวกัน ในการตั้งค่าที่ใช้ความพยายามสูงสุดทั้งสองฝ่าย: 7.60 ดอลลาร์สำหรับ Claude Sonnet 5.5 เทียบกับ 0.67 ดอลลาร์สำหรับ Gemini 3.1 Pro สิบเอ็ดเท่า กลไกนี้ได้รับการบันทึกไว้ในหน้าเดียวกัน แทนที่จะเป็นการอนุมานเอา — Sonnet 5.5 สร้าง 410 ล้านโทเค็นทั่วชุดดัชนี เทียบกับค่ามัธยฐานที่ 88 ล้านของกลุ่มนี้ ซึ่งผู้ประเมินอธิบายว่าเขียนยาวมากเกินไป ในขณะที่ Gemini 3.1 Pro ถูกอธิบายว่ากระชับพอสมควร เมื่อโมเดลหนึ่งเขียนมากกว่าอีกโมเดลหลายเท่า ข้อได้เปรียบ 17% ในอัตราผลลัพธ์ก็ไม่รอดเมื่อต้องเจอกับใบแจ้งหนี้
บทเรียนนี้สรุปเกินกว่าสองโมเดลนี้: ใบอัตราค่าใช้จ่ายกำหนดราคาต่อโทเคน และคุณถูกเรียกเก็บเงินสำหรับงานที่เสร็จสมบูรณ์ การเปรียบเทียบใดก็ตามที่หยุดอยู่แค่ตารางราคากำลังวัดปริมาณที่ผิด
เส้นแบ่งระดับที่ 200,000 โทเค็น
ราคาของ Gemini 3.1 Pro ไม่ได้เป็นอัตราแบบคงที่ และการเปลี่ยนขั้นนี้ก็มากพอที่จะพลิกผลการเปรียบเทียบข้างต้นบางส่วนได้ สำหรับพรอมป์ตที่ต่ำกว่า 200,000 โทเคน อัตราคืออินพุต $2.00 และเอาต์พุต $12.00 พร้อมการอ่านแคช $0.20 เหนือเส้นนั้นขึ้นไป การเรียกใช้ทั้งครั้งจะถูกคิดราคาใหม่ที่อินพุต $4.00 เอาต์พุต $18.00 และการอ่านแคช $0.40 — อัตราอินพุตเพิ่มเป็นสองเท่า ซึ่งเท่ากับสองเท่าของ Claude Sonnet 5.5 พอดี และเอาต์พุตเปลี่ยนจากถูกกว่า 17% ในฝั่ง Anthropic ไปเป็นแพงกว่า 80% ในฝั่ง Google
เส้นแบ่งนี้ไม่ใช่เรื่องแปลกใหม่ พรอมป์ต์ขนาด 200,000 โทเคนก็คือโค้ดเบสเล็ก ๆ ชุดสัญญายาว ๆ บทถอดเสียงไม่กี่ชั่วโมง หรือเอเจนต์ที่ทำงานมาสักพักหนึ่งแล้ว งานที่ใช้บริบทขนาดยาวคือสิ่งที่หน้าต่าง 1M โทเคนถูกขายมาเพื่อรองรับโดยตรง ดังนั้นระดับที่ให้ผลตอบแทนจากหน้าต่างนี้มากที่สุดก็คือระดับที่ข้อได้เปรียบด้านราคาหายไปเช่นกัน หากพรอมป์ต์ของคุณข้าม 200,000 โทเคนเป็นประจำ ให้ประเมิน Gemini 3.1 Pro ที่ราคา $4.00 และ $18.00 ไม่ใช่ที่อัตราบนหน้าแลนดิ้ง
การเขียนแคชควรมีประโยคเป็นของตัวเอง เพราะมันกลับทิศทางในด้านตรงกันข้าม และยังคงอยู่รอดเมื่อมีการเปลี่ยนระดับชั้น ที่ $0.375 ต่อล้าน เทียบกับ $2.50 การใช้ Gemini เพื่อเติมแคชถูกกว่ามาก และอัตรานั้นไม่ขยับเมื่อคุณข้ามขอบเขต สำหรับเอเจนต์ที่สร้างคำนำหน้าขนาดใหญ่ใหม่ทุกเทิร์นแทนที่จะใช้ซ้ำ บรรทัดเดียวนั้นอาจเป็นข้อได้เปรียบเชิงโครงสร้างที่ใหญ่กว่าอัตราอินพุต และเป็นบรรทัดเดียวในการเปรียบเทียบนี้ที่ไม่มีขอบเขตระดับชั้นใดแตะต้อง
เพดาน 65,536 โทเคน และเหตุใดมันจึงเป็นตัวกำหนดสถาปัตยกรรม
ตัวเลขที่เปลี่ยนแปลงสิ่งที่คุณสร้างได้มากที่สุดคือจำนวนเอาต์พุตสูงสุด: 65,536 โทเคนบน Gemini 3.1 Pro เทียบกับ 128,000 บน Claude Sonnet 5.5 เพดานไม่ใช่ตัวชี้วัดประสิทธิภาพ แต่เป็นข้อจำกัดว่างานจะพอดีกับการเรียกใช้เพียงครั้งเดียวหรือไม่
สิ่งใดก็ตามที่ส่งออกอาร์ติแฟกต์ขนาดใหญ่ — ไฟล์ซอร์สโค้ดที่สมบูรณ์ รายงานยาว เอกสารฉบับเต็ม ชุดข้อมูลที่มีโครงสร้าง — ที่สูงกว่า 65,536 โทเค็นในกรณีของ Gemini จะต้องถูกแยกย่อยเป็นห่วงโซ่ของการเรียกโดยมีสถานะส่งต่อระหว่างกัน การแยกย่อยมีต้นทุนเป็นโทเค็นอินพุตที่มากขึ้นในทุกขั้นตอน โค้ดจัดการที่มากขึ้น และโหมดความล้มเหลวใหม่ที่รอยต่อซึ่งชิ้นส่วนหนึ่งสิ้นสุดและอีกชิ้นเริ่มต้น ข้อจำกัดที่สองยิ่งซ้ำเติม: เอกสารของ Anthropic เองระบุว่าเกณฑ์การใช้งานจริงของ Sonnet 5.5 สำหรับงานยาวที่เชื่อถือได้นั้นสูงกว่าอย่างมีนัยสำคัญ และเพดานของ Gemini นั้นต่ำกว่าอีกฝ่ายเป็นสองเท่า หากอาร์ติแฟกต์ที่ยาวที่สุดของคุณคือ 40,000 โทเค็น ส่วนนี้ก็ไม่เกี่ยวข้อง และคุณควรเปรียบเทียบจากต้นทุนต่องาน หากเป็น 100,000 เพดานก็ได้ตัดสินใจแทนคุณแล้ว
โมดัลลิตี ซึ่งเป็นแกนเดียวที่ Gemini ครองได้อย่างเบ็ดเสร็จ
Gemini 3.1 Pro รองรับวิดีโอและเสียง; Claude Sonnet 5.5 รองรับข้อความ รูปภาพ และไฟล์ และไม่สามารถรับทั้งวิดีโอและเสียงได้ สำหรับเวิร์กโหลดที่เน้นสื่อเป็นหลัก — การบันทึกสายสนทนา, การจับภาพหน้าจอ, วิดีโอผลิตภัณฑ์, เสียงการประชุม — ไม่มีสิ่งทดแทนให้ใช้ได้ในการจับคู่นี้ และการเปรียบเทียบราคาก็ไม่มีความหมาย เพราะมีเพียงหนึ่งในสองเอนด์พอยต์เท่านั้นที่สามารถรับอินพุตได้เลย สำหรับเวิร์กโหลดประเภทข้อความและรูปภาพ ชุดความสามารถทับซ้อนกัน และการคำนวณราคาข้างต้นเป็นตัวกำหนด
ตัวเลขการดำเนินงานอีกค่าของ Gemini นั้นน่าพูดถึง เพราะมองข้ามได้ง่ายบนหน้าที่เน้นเรื่องความฉลาดเป็นหลัก แคตตาล็อกของเราวัดค่ามัธยฐานความหน่วงของโทเคนแรกได้ 10,000 ms ที่ p50 และอัตราการส่งออกใกล้เคียง 1,283 โทเคนต่อวินาที โดยมีอัตราข้อผิดพลาดในเจ็ดวันอยู่ที่ 56.8% นั่นคือโมเดลที่เร็วสุด ๆ แต่มีอัตราล้มเหลวที่สังเกตได้สูงมาก — การผสมผสานนี้เหมาะกับงานแบบแบตช์ที่มีงบสำหรับการลองใหม่เพียงพอ มากกว่าจะเหมาะกับสิ่งใดก็ตามที่ผู้ใช้กำลังรออยู่ เมื่อเทียบกันแล้ว Claude Sonnet 5.5 เป็นโปรไฟล์ที่ช้ากว่าแต่เสถียรกว่า อัตราข้อผิดพลาดไม่ปรากฏบนหน้าแลนดิ้งของทั้งสองผู้ให้บริการ; มันเป็นตัวเลขประเภทที่จะโผล่ขึ้นมาก็ต่อเมื่อผู้เข้าแข่งขันทั้งสองอยู่หลังเอนด์พอยต์เดียวที่วัดพวกมัน ซึ่งเป็นเหตุผลหนึ่งที่ควรประเมินทั้งสองจากที่เดียวแทนที่จะดูจากแดชบอร์ดสองแห่ง
กำหนดเส้นทางอะไรไปที่ไหน
ส่งไปที่ Claude Sonnet 5.5 เมื่องานเป็นข้อความหรือภาพ เมื่อมาตรฐานคุณภาพสูงพอที่ช่องว่างดัชนี 26 จุดจะมีความสำคัญ เมื่อผลลัพธ์ที่ส่งออกยาวพอที่จะต้องใช้เพดาน 128,000 โทเคน หรือเมื่อภาระงานเป็นแบบโต้ตอบและอัตราความผิดพลาด 56.8% เป็นสิ่งที่ยอมรับไม่ได้ สำหรับงานที่มีโครงสร้างและมีขอบเขตจำกัด บทลงโทษจากความยาวที่ทำให้เกิดตัวเลข $7.60 นั้นแทบจะหายไป และข้อได้เปรียบต่อโทเคนก็กลายเป็นเงินจริง
ส่งไปที่ Gemini 3.1 Pro เมื่ออินพุตมีวิดีโอหรือเสียง เมื่อพรอมป์ต์อยู่ต่ำกว่า 200,000 โทเคนและปริมาณงานสูง เมื่อคุณเขียนแคชขนาดใหญ่บ่อยครั้งและค่าเขียนแคชที่ $0.375 ทบเพิ่มขึ้นเรื่อย ๆ หรือเมื่องานมีลักษณะเป็นแบบแบตช์และต้นทุนต่อ task เป็นคอลัมน์เดียวที่สำคัญ — ที่ $0.67 ต่อ task เทียบกับ $7.60 คุณมีงบให้ลองใหม่ได้อีกมากมาย
ทั้งสองสามารถกำหนดเส้นทางได้บน OrcaRouter แล้วในวันนี้ google/gemini-3.1-pro-preview และ anthropic/claude-sonnet-5 ต่างเป็นรายการในแคตตาล็อกที่ใช้งานได้จริงภายใต้ข้อมูลรับรองชุดเดียว ในราคาตามที่ผู้ให้บริการกำหนดโดยบวกเพิ่ม 0% ซึ่งหมายความว่าการแบ่งสัดส่วนข้างต้น สามารถแสดงเป็นกฎการกำหนดเส้นทางแทนที่จะเป็นการผสานรวมสองรายการ — คำขอที่เกี่ยวกับสื่อไปยังปลายทางหนึ่ง ส่วนคำขอแบบข้อความและรูปภาพไปยังอีกปลายทางหนึ่ง พร้อมการสลับสำรองหากฝ่ายใดฝ่ายหนึ่งเริ่มเกิดข้อผิดพลาด Claude Sonnet 5.5 ยังไม่ใช่เส้นทางบนแพลตฟอร์มของเรา เมื่อมีการลงทะเบียนไว้ กฎเดียวกันนี้ก็ครอบคลุมได้โดยไม่ต้องใช้คีย์ใหม่
คำตัดสินที่ตรงไปตรงมาสำหรับการเปรียบเทียบนี้: Claude Sonnet 5.5 เป็นโมเดลที่ดีกว่าอย่างมากและถูกกว่าต่อโทเค็น และ Gemini 3.1 Pro นั้นถูกกว่าราวสิบเอ็ดเท่าต่องานที่เสร็จสมบูรณ์ในงานแบบปลายเปิด ถูกกว่าหกเท่าในการเขียนแคช และเป็นเพียงตัวเดียวในสองตัวที่ดูวิดีโอได้ ใครก็ตามที่ยกตารางราคามาให้คุณดู กำลังบรรยายถึงการเปรียบเทียบที่ไม่มีอยู่จริง สิ่งที่มีอยู่จริงคือคำถามว่าคำขอใดที่คุณสามารถจำกัดขอบเขตได้



การเปรียบเทียบในบทความนี้2
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
