
ขั้นของ Argon ในบันได Gemini 4 — และเหตุใดจึงไม่มี G4 Ultra
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 221 tok/s
- OpenAIใหม่OpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- Anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIใหม่Grok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 110 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
คำตอบสั้น ๆ สำหรับคำถามที่จุดประกายบทความนี้ก็คือ Gemini 4 Argon เป็นโมเดลระดับท็อปของ Google ไม่ใช่ระดับสูงสุดของมัน เพราะระดับที่อยู่เหนือมันยังไม่มีอยู่จริง — และอาจจะไม่มีในรูปแบบที่ใคร ๆ คาดหวัง Google เผยแพร่โมเดล Gemini 4 เพียงรุ่นเดียวเท่านั้น คือ Argon และหน้าเพจของบริษัทเองเพียงหน้าเดียวบนโดเมนของตัวเองภายใต้พาธ /models/gemini/ultra/ไม่ใช่หน้าโมเดลเลยด้วยซ้ำ: มันเปลี่ยนเส้นทางไปยังแผนสมัครสมาชิก Google AI การเปลี่ยนเส้นทางนั้นคือข้อเท็จจริงที่มีประโยชน์ที่สุดเพียงหนึ่งเดียวในบทความนี้ และสามารถตรวจสอบได้ในบรรทัดเดียวจากเทอร์มินัล ส่วนที่เหลือทั้งหมดในที่นี้เป็นเรื่องเกี่ยวกับตำแหน่งที่แท้จริงของ Argon เมื่อคุณเลิกอ่านราคาของมันเป็นป้ายระดับชั้น แล้วเริ่มอ่านมันเป็นตัวเลข
มีสองสิ่งที่เป็นจริงพร้อมกัน และเป็นเรื่องง่ายที่จะสับสนระหว่างสองสิ่งนั้น Argon เป็น Gemini ที่มีความสามารถสูงสุดที่มีอยู่ และ Argon ไม่ใช่โมเดลระดับฟรอนเทียร์ มันนำหน้าโมเดล Google ทุกตัวที่เปิดตัวแล้ว ด้วยส่วนต่างที่กว้างพอจนการเปรียบเทียบไม่ใช่การเปรียบเทียบจริง ๆ และมันอยู่ใน Artificial Analysis’s Intelligence Index ห่างจากโมเดลเรือธงคู่แข่งสองตัวเพียงเศษเสี้ยวของคะแนน ทั้งที่ทั้งสองตัวนั้นตามหลังผู้นำปัจจุบันอยู่เต็มห้าคะแนน Google ตั้งราคามันราวกับว่ามันอยู่ต่ำกว่าฟรอนเทียร์หนึ่งขั้น และการวัดผลอิสระก็สอดคล้องกัน ดังนั้นราคาจึงไม่ใช่การตัดสินใจทางการตลาดที่ทำให้โมเดลดูด้อยกว่าความเป็นจริง แต่เป็นคำกล่าวที่แม่นยำเกี่ยวกับตัวโมเดล
นี่คือบทความว่าด้วยสิ่งที่เรารู้จนถึงตอนนี้ Gemini 4 Argon ได้รับการประกาศเมื่อวันที่ 2026-09-30 ในโพสต์ของ Google DeepMind ที่ระบุเครดิตผู้เขียนว่า Koray Kavukcuoglu และกำลังทยอยเปิดให้ใช้งานกลุ่มแรกกับกลุ่มนักป้องกันไซเบอร์ที่ระบุชื่อไว้ผ่านโครงการ Fairwind ของ Google — ไม่ใช่สำหรับนักพัฒนา ไม่ใช่สำหรับองค์กร ไม่ใช่สำหรับผู้บริโภค และไม่ใช่สำหรับใครก็ตามที่มีบัตรเครดิต มันไม่มี model ID ใน Gemini API ไม่มี endpoint และไม่มีราคาต่อโทเคนที่ประกาศไว้ให้เรียกเก็บเงินได้ ตัวระบุโมเดล อัตราการประมวลผล และความน่าเชื่อถือที่วัดจากทราฟฟิกจริงยังไม่มีสำหรับโมเดลนี้ ซึ่งหมายความว่าการวัดด้านล่างนี้คือการรันเบนช์มาร์กของห้องแล็บแห่งหนึ่งเท่านั้น ไม่ใช่สิ่งอื่นใด ตัวเลขใดที่มาจาก Google จะมีป้ายกำกับว่าเป็นของ Google ส่วนตัวเลขใดที่มาจาก Artificial Analysis จะมีป้ายกำกับว่าเป็นของพวกเขา ไม่มีสิ่งใดในที่นี้ที่ควรตีความว่าเป็นข้ออ้างว่า Argon เป็นผลิตภัณฑ์ที่ซื้อได้
บันไดที่ Google ปล่อยออกมาจริง อ่านจากหน้าของตัวเอง
วิธีที่เร็วที่สุดในการตอบคำถามว่า “Argon อยู่ตรงไหนในไลน์อัป Gemini 4” คือเลิกถามเกี่ยวกับไลน์อัป แล้วเริ่มไล่รายชื่อรุ่นที่ Google เผยแพร่หน้าเว็บสำหรับรุ่นเหล่านั้น ไลน์อัปคือแนวคิดทางการตลาด; หน้าเว็บคือข้อเท็จจริง นี่คือสิ่งที่เส้นทางแบบ first-party ชี้ไป ณ วันที่ 1 ตุลาคม 2026
• deepmind.google/models/gemini/pro/ ตอบกลับด้วยสถานะ 200 และชื่อเรื่องคือ “Gemini 3.1 Pro — Google DeepMind” ช่อง Pro บนเว็บไซต์ของ Google เองยังคงเป็นโมเดลรุ่นที่ 3.1
• deepmind.google/models/gemini/flash/ ตอบกลับด้วยสถานะ 200 และชื่อเรื่องคือ “Gemini 3.8 Flash — Google DeepMind” ช่อง Flash ได้ขยับมาแล้วสามครั้ง — 3.5, 3.6, 3.7, 3.8 — ในขณะที่ช่อง Pro ไม่ได้ขยับเลย
• deepmind.google/models/gemini/argon/ ส่งคืน 404 Argon ไม่มีพาธเฉพาะต่อโมเดล หน้าแรกของมันคือหน้าเพจของตระกูลที่ deepmind.google/models/gemini/ ซึ่งเป็นที่ที่ Google วางโมเดลที่กำลังใช้เป็นตัวหลักอยู่ในปัจจุบัน
• deepmind.google/models/gemini/ultra/ ส่งคืน 302 และไปลงที่ one.google.com/about/google-ai-plans/ ซึ่งเป็นหน้าสมัครสมาชิกสำหรับผู้บริโภค เช่นเดียวกันกับพาธเก่ากว่า deepmind.google/technologies/gemini/ultra/ “Ultra” บนพาธโมเดลของ Google เป็นระดับการเรียกเก็บเงิน ไม่ใช่เช็กพอยต์
• deepmind.google/models/gemini/nano/ส่งคืน 301 ไปยังหน้าตระกูล Gemini และไม่มีช่อง Nano ในรูปแบบหน้าโมเดลแบบสแตนด์อโลนเช่นกัน
• deepmind.google/models/gemini/model-cards/ — ดัชนีที่ Google ดูแลรวบรวมการ์ดโมเดลทุกใบที่ได้เผยแพร่ — ไม่มีรายการสำหรับ Argon และไม่มีรายการใดที่มีคำว่า “Gemini 4” อยู่ในชื่อ แถว Gemini ใหม่ล่าสุดของมันคือ 3.8 Flash, 3.8 Audio, 3.7 Flash, 3.6 Flash, 3.5 Flash, 3.5 Flash-Lite และ 3.1 Pro ดัชนีการ์ดเป็นเอกสารที่เคลื่อนไหวช้าที่สุดในชุดนี้ ดังนั้นความเงียบของมันจึงไม่ใช่หลักฐานว่า Argon จะไม่มีวันมีการ์ดสักใบ มันเป็นหลักฐานว่างานเอกสารยังตามประกาศไม่ทัน
• deepmind.google/models/ดัชนีโมเดลระบุ “Gemini 4 Argon” เป็นการ์ดเรือธง พร้อมสโลแกน “ยุคถัดไปของปัญญาระดับแนวหน้าของเรา” โดยอยู่เหนือ “Gemini 3.8 Flash — เหมาะที่สุดสำหรับจัดการงานแบบเอเจนต์ที่ซับซ้อนในวงกว้าง” ขึ้นไปโดยตรง การ์ด Gemini สองใบ ต่างกันหนึ่งรุ่น เรียงตามลำดับนั้น
เมื่อนำสิ่งเหล่านั้นมารวมกัน โครงสร้างของบันไดก็ไม่กำกวม พื้นที่โมเดลสาธารณะของ Google ในปัจจุบันมีหนึ่งรายการที่ขั้น Gemini 4 หนึ่งรายการที่ขั้น Gemini 3.8 มีขั้น Pro ที่ล้าสมัยอยู่ย้อนหลังไปสามรุ่นครึ่ง และไม่มีอะไรอยู่เหนือขึ้นไปกว่านั้นเลย คำว่า “Ultra” บนโดเมนของ Google ชี้ไปที่บริการสมัครสมาชิก ไม่มีหน้า Gemini 4 Pro ไม่มีหน้า Gemini 4 Flash ไม่มีหน้า Gemini 4 Ultra และไม่มีการ์ดโมเดล Gemini 4 Google ประกาศโมเดล ไม่ใช่ตระกูลโมเดล
มี Gemini 4 Ultra จริงหรือไม่? หลักฐาน และอะไรจะหักล้างข้อกล่าวอ้างนี้ได้
เรื่องนี้สมควรมีหัวข้อเป็นของตัวเอง เพราะเป็นส่วนของคำถามที่มีแนวโน้มมากที่สุดว่าจะได้คำตอบที่ต่างออกไปภายในหนึ่งสัปดาห์ และเพราะคำตอบที่ซื่อสัตย์นั้นมีอายุการใช้งานจำกัด
หลักฐานเชิงลบนี้มีความเฉพาะเจาะจงมากกว่าจะคลุมเครือ การตอบกลับ 302 บนเส้นทาง Ultra ที่ไปยังหน้าของแผนการสมัครสมาชิกไม่ใช่สัญญาณอ่อน ๆ แต่เป็นรีไดเรกต์ที่ทีมเว็บของ Google เองเป็นผู้กำหนดค่า รูปแบบ URL หลายรูปแบบของ blog.google สำหรับโพสต์ Gemini 4 Ultra ส่งคืน 404 — ทั้งเส้นทาง products เส้นทาง innovation-and-ai models-and-research และเส้นทางประกาศทั่วไป การตั้งชื่อ Ultra มีรูปแบบอยู่ตรงนี้ และรูปแบบนั้นชี้ไปในทางที่ขัดกับ Gemini 4 Ultra คำประกาศเปิดตัว Gemini ครั้งแรกของ Google ได้แนะนำ Gemini 1.0 “ที่ปรับให้เหมาะสำหรับสามขนาดที่แตกต่างกัน ได้แก่ Ultra, Pro และ Nano” โดย Gemini Ultra ถูกอธิบายว่าเป็น “โมเดลที่ใหญ่ที่สุดและมีความสามารถมากที่สุดของเรา” โพสต์เปิดตัวที่ระบุชื่อสามขนาดคือสิ่งที่การประกาศเปิดตัวกลุ่มผลิตภัณฑ์ดูเป็นเช่นนั้น โพสต์ของ Argon ระบุชื่อโมเดลเพียงหนึ่งเดียวและไม่ได้ระบุอะไรเลย ต่อมา Google ได้เลิกใช้ชื่อโมเดล Ultra แล้วหันมาใช้ระดับแบบตัวเลขแทน และย้ายคำนี้ไปไว้ฝั่งธุรกิจที่เกี่ยวกับการสมัครสมาชิก ซึ่งตอนนี้คำนี้ใช้เรียกแผนสำหรับผู้บริโภคระดับสูงสุด หน้าโมเดลที่รีไดเรกต์ไปยังหน้าแผนการสมัครสมาชิกคือสิ่งที่ชื่อโมเดลที่ถูกเลิกใช้ดูเป็นเช่นนั้น เมื่อเว็บไซต์การตลาดถูกจัดระเบียบใหม่ไปรอบ ๆ มัน
นอกจากนี้ ยังไม่มีสิ่งใดในประกาศที่สัญญาว่าจะมีรุ่นพี่ที่ใหญ่กว่า โพสต์เปิดตัว Argon อธิบายว่า Argon เป็น “โมเดลแนวหน้าใหม่ของเรา” และอธิบายการเปิดตัวเป็นระยะ งานด้านมาตรการป้องกัน และการนำไปใช้งานภายใน แล้วก็จบลงเท่านั้น ไม่ได้พูดว่า “รุ่นแรกในตระกูล Gemini 4” ไม่ได้เปิดตัวอย่าง Pro หรือ Ultra และไม่ได้ระบุชื่อรุ่นสืบทอด การวางกรอบของ Google เองมอง Argon เป็นตัวหลัก ไม่ใช่รุ่นเล็ก
สิ่งที่ทำให้ข้อสรุปนี้เป็นเท็จนั้นพูดได้ง่ายและควรจับตามอง เพราะสิ่งใดสิ่งหนึ่งในเหล่านี้จะพลิกข้อสรุปนี้ได้ภายในหนึ่งวัน
• การตอบกลับ 200 บน deepmind.google/models/gemini/ultra/ ที่แสดงหน้าโมเดลแทนหน้าแผน หรือพาธลูกใหม่ models/gemini/ ที่ปรากฏควบคู่กับ pro และ flash.
• แถวของ Gemini 4 Ultra ที่ปรากฏบนดัชนี model-cards ซึ่งเป็นวิธีที่ Google ใช้ยืนยันมาโดยตลอดว่าโมเดลหนึ่งมีอยู่จริงในฐานะอาร์ติแฟกต์ที่ได้รับการบันทึกเป็นเอกสาร
• ID โมเดลตัวที่สองใน Gemini API ในgemini-4-*เนมสเปซ ปัจจุบัน Argon ยังไม่มี ดังนั้น ID รุ่น Pro หรือ Ultra จะเป็นหลักฐานชิ้นแรกว่าตระกูลนี้มีอยู่จริง
• รายการหนึ่งในรายการโมเดลของ Artificial Analysis หรือตาราง benchmark บนหน้า family ที่มีคอลัมน์ที่สี่ ทั้งสองอย่างนั้นติดตามการเปิดตัวของ Google อย่างใกล้ชิดพอที่จะได้ข้อมูลก่อนใคร
• โพสต์ประกาศจาก Google I/O, Cloud Next หรือ DeepMind ที่ใช้คำว่า “family” เกี่ยวกับ Gemini 4 โพสต์ของ Argon ไม่ได้ใช้คำดังกล่าว
จนกว่าอย่างน้อยหนึ่งในสิ่งเหล่านั้นจะเกิดขึ้น ชิ้นงานที่อ้างว่า Gemini 4 Ultra กำลังจะมา ก็คือการคาดเดาที่สวมคราบของรายงาน จงปฏิบัติต่อมันตามนั้น รวมถึงชิ้นงานจากเราด้วย

การอ่านบันไดราคาในฐานะข้อความแสดงระดับชั้น
การตั้งราคาเป็นส่วนเดียวในเรื่องนี้ที่ Google ตั้งใจเผยแพร่ พร้อมเชิงอรรถ และเป็นข้อความที่ชัดเจนที่สุดเกี่ยวกับเจตนาด้านระดับชั้นในการเปิดตัวทั้งหมด ราคาแนะนำเริ่มต้นของ Argon อยู่ที่ 2 ดอลลาร์ต่ออินพุต 1 ล้านโทเคน และ 10 ดอลลาร์ต่อเอาต์พุต 1 ล้านโทเคน โดยอินพุตที่แคชไว้ลด 95% และเชิงอรรถข้อหนึ่งของ Google เองกล่าวว่า หลังจากช่วงแนะนำซึ่งระบุไม่ได้ชัดเจน “ราคา 4 ดอลลาร์ต่ออินพุต 1M โทเคน และ 20 ดอลลาร์ต่อเอาต์พุต 1M โทเคน จะมีผลบังคับใช้”
อ่านสองคู่นั้นเทียบกับทั้งฟิลด์ แล้วข้ออ้างเรื่องเทียร์ก็เขียนขึ้นมาเอง
• $4 / $20 เป็นราคาตามรายการของ Claude Opus 5.5 ส่วนราคาหลังช่วงแนะนำของ Google สำหรับ Argon นั้นตกตรงกับเรตการ์ดของผู้นำแนวหน้าปัจจุบันพอดี สำหรับโมเดลที่ทำคะแนนตามหลังมันอยู่ห้าคะแนน
• $2 / $10 คือช่วงราคาโปรโมชันที่ทั้ง GPT-6 Sol และ Claude Sonnet 5.5 อยู่ในช่วงเดียวกัน อัตราเปิดตัวของ Argon ก็เป็น $2 / $10 เท่ากัน ซึ่งทำให้ราคาเปิดตัวของ Argon อยู่ในช่วงเดียวกับ Sol ระดับกลาง แทนที่จะอยู่ในช่วงระดับแนวหน้า
• $10 / $50 คือระดับราคาที่ทั้ง Claude Fable 5.1 และ GPT-6 Astra อยู่ Argon มีราคาอินพุตเป็นหนึ่งในห้าของ Fable 5.1 และราคาเอาต์พุตก็เป็นหนึ่งในห้าของ Fable 5.1 เช่นกัน และทำคะแนนได้ต่างจากมันไม่เกิน 0.8
• $0.75 / $3.75 คือ Gemini 3.8 Flash. Argon คิดเป็น 2.7 เท่าของราคานั้นสำหรับอินพุต และ 2.7 เท่าสำหรับเอาต์พุต — เป็นการเพิ่มขึ้นอย่างเป็นขั้น ไม่ใช่หน้าผา
ดังนั้น Google จึงตั้งราคา Argon ไว้ในฐานะโมเดลที่ควรอยู่ต่ำกว่า $10/$50 และสูงกว่า $0.75/$3.75 โดยมีจุดลงเอยสุดท้ายที่ $4/$20 ไม่มีอะไรในบันไดราคานั้นที่บอกว่า “แนวหน้า” มันบอกว่า “ส่วนบนของช่วงกลาง ด้วยตัวเลขพาดหัวที่จะลงเอยที่อัตราเดียวกับที่ผู้นำตลาดเรียกเก็บในวันนี้ แต่ให้ความสามารถที่น้อยกว่า” นั่นเป็นทางเลือกเชิงพาณิชย์ที่มีเหตุผลรองรับได้ แต่มันไม่ใช่การตั้งราคาของโมเดลที่ถูกวางตำแหน่งสูงกว่าสิ่งอื่นใดอยู่สองระดับ
ประเด็นเชิงโครงสร้างหนึ่งที่น่าจดจำไว้: การปรับขั้นราคาของ Argon เป็นการปรับขั้นจริง ระบุไว้ในเชิงอรรถ และไม่ระบุวันที่ ตระกูล Sonnet 5.5 และ GPT-6 ก็ทำคล้ายกันกับระดับบริบทแบบยาว และ Sol ปรับขั้นเป็น $4/$15 เมื่อเกิน 272K การปรับขั้นของ Argon ขึ้นอยู่กับเวลา ไม่ใช่ความยาวบริบท — อัตรา $2/$10 เดียวกันใช้กับหน้าต่าง 1M ทั้งหมด และมีเพียงปฏิทินเท่านั้นที่เปลี่ยนอัตรา นี่เป็นรูปแบบที่ผิดปกติ และทำให้การเปรียบเทียบต้นทุนใด ๆ กับ Argon เป็นแบบฝึกหัดสองคอลัมน์: ช่วงใด และการใช้งานใด
Argon อยู่ตรงจุดใดเมื่อเทียบกับคู่แข่ง เมื่อดูจากตัวเลขที่มีอยู่
Artificial Analysis มีการวัดผลของ Gemini 4 Argon ออกมาเร็วพอที่มันจะเป็นแหล่งข้อมูลอิสระเพียงแหล่งเดียวที่มีให้ใช้ บนรีวิชันที่ใช้อยู่ในวันที่ 1 ตุลาคม — v4.3.2 — Argon ได้คะแนน 52.56 บน Intelligence Index โดยตั้งค่าไว้ที่ high reasoning effort โมเดลที่อยู่รอบ ๆ มันไม่ใช่ตัวอย่างแบบสุ่มของวงการ
• Claude Opus 5.5 อยู่ที่ 57.62 โดยวัดที่ max effort พร้อม fallback ซึ่งสูงกว่า Argon ราวห้าจุดกว่า ๆ และตอนนี้เป็นอันดับหนึ่งของกระดานคะแนน
• Claude Fable 5.1 อยู่ที่ 53.35 โดยวัดที่ความพยายามสูงสุดและใช้ fallback ส่วน Argon ตามหลังอยู่ 0.79
• GPT-6 Astra อยู่ที่ 52.67 ซึ่งวัดที่ค่าสูงสุด โดย Argon ตามหลังอยู่ 0.11
• Claude Sonnet 5.5 อยู่ที่ 55.98 และยังเป็นค่าสูงสุดเมื่อใช้ fallback เช่นกัน นั่นคือโมเดลระดับกลางที่ทำคะแนนได้เหนือกว่า Argon อยู่ 3.4 คะแนน และนี่คือตัวเลขที่ควรทำให้ใครก็ตามที่กำลังจะหยิบยกประโยค “Gemini 4 Argon เป็นโมเดลที่ดีที่สุดเป็นอันดับสองของโลก” ต้องกังวล
• GPT-6 Sol อยู่ที่ 47.63 เมื่อวัดที่ค่าสูงสุด บนหน้าต่างบริบทขนาด 872K Argon นำอยู่ 4.9
• Gemini 3.8 Flash อยู่ที่ 40.93 เมื่อใช้ความพยายามสูง Argon นำอยู่ 11.6
• Gemini 3.1 Pro Preview อยู่ที่ 29.72 โดย Argon นำอยู่ 22.8 ซึ่งเป็นข้อบ่งชี้ที่ชัดเจนที่สุดเพียงหนึ่งเดียวว่ารุ่น Pro ที่ Google วางจำหน่ายนั้นตามหลังงานวิจัยของตัวเองมาไกลเพียงใด
สามสิ่งตามออกมาจากรายการนั้น ประการแรก Argon อยู่ในระดับเดียวกับคู่แข่งสองราย คือ Fable 5.1 และ Astra และตามหลังโมเดลของ Anthropic สองตัวอย่างชัดเจน คือ Opus 5.5 และที่น่าอึดอัดยิ่งกว่าคือ Sonnet 5.5 ประการที่สอง ช่องว่างระหว่าง Argon กับโมเดลที่ดีที่สุดที่ Google เปิดตัวแล้วของ Google เอง ถือเป็นการก้าวกระโดดข้ามรุ่นที่ใหญ่ที่สุดในไลน์อัปปัจจุบัน และห่างกันมาก ประการที่สาม การวางกรอบของสัญญาณที่ว่า “แนวหน้าอยู่ข้างหน้าอย่างน้อยสองระดับ” นั้นถูกต้องในเนื้อหา แต่คลาดเคลื่อนเล็กน้อยในเชิงโครงสร้าง: มีโมเดลหนึ่งระดับที่อยู่เหนือ Argon อย่างชัดเจน (Opus 5.5 ที่ 57.6) และมีโมเดลอีกตัวในระดับที่ถูกกว่าแต่ก็ยังอยู่เหนือ Argon เช่นกัน (Sonnet 5.5 ที่ 56.0) ซึ่งเป็นปัญหาที่คมกว่าการต้องลงไปสองขั้นบนบันไดที่จริง ๆ แล้ว Argon อยู่บนนั้น
การวางกรอบเปรียบเทียบราคาในคำถามเดิม — “ราคาบ่งชี้ว่านี่คือรุ่นเทียบเท่า Sol/Sonnet ของพวกเขา” — ปรากฏว่าถูกต้องโดยประมาณเมื่อพูดถึงราคาเปิดตัว และผิดเมื่อพูดถึงราคาสุดท้าย Argon เปิดตัวที่ราคาระดับเดียวกับ Sol และ Sonnet 5.5 และไปจบที่ราคาระดับ Opus 5.5 มันถูกตั้งราคาเป็นรุ่นระดับกลางที่ตั้งใจจะกลายเป็นรุ่นที่ตั้งราคาระดับแนวหน้า ขณะที่เมื่อวัดประสิทธิภาพแล้วไม่ถึงระดับใดเลยในสองระดับนั้น
ภาพต้นทุนต่องานคือจุดที่ Argon แข็งแกร่งที่สุด และเป็นจุดที่เรื่องราวของระดับชั้นได้มิติที่สอง ในงาน Index, Argon มีค่าใช้จ่าย $1.99 และปล่อยโทเคนเอาต์พุต 142,374 โทเคน Opus 5.5 มีค่าใช้จ่าย $5.98 และปล่อย 338,099 Sonnet 5.5 มีค่าใช้จ่าย $7.62 สำหรับ 599,849 Fable 5.1 มีค่าใช้จ่าย $7.63 สำหรับ 187,455 Astra มีค่าใช้จ่าย $3.26 สำหรับ 68,691 Gemini 3.8 Flash มีค่าใช้จ่าย $1.24 สำหรับ 154,230 Argon เป็นวิธีที่ถูกที่สุดในการซื้อคะแนนที่ใกล้เคียงระดับแนวหน้า และถูกกว่าโมเดล Flash ซึ่งมีคะแนนสูงกว่ามันอยู่ไม่ถึงหนึ่งดอลลาร์ต่องาน
การตั้งค่าความพยายาม (effort settings) เป็นเครื่องหมายดอกจันที่กำกับทั้งหมดที่กล่าวมาข้างต้น และวงการนี้ไม่ได้รายงานค่าเหล่านี้อย่างเป็นมาตรฐานเดียวกัน Argon ถูกวัดที่ระดับ high; Opus 5.5, Fable 5.1 และ Sonnet 5.5 ที่ระดับ max พร้อม fallback; Astra และ Sol ที่ระดับ max การรันที่ใช้ความพยายามระดับ high กับการรันที่ใช้ความพยายามระดับ max ไม่ใช่การวัดเดียวกัน และบันไดความพยายามของ Anthropic เองก็เลื่อนโมเดลไปหลายจุดระหว่างการตั้งค่าแต่ละระดับ หาก Argon ที่วัดที่ความพยายามระดับ max ทำคะแนนได้สูงกว่า 52.6 อย่างมีนัยสำคัญ ข้อโต้แย้งเรื่องระดับชั้นก็จะเปลี่ยนไป ยังไม่มีใครเผยแพร่การรันนั้นเลย
สิ่งที่ตารางของ Google เองอ้างไว้ และแตกต่างจากตารางอิสระอย่างไร
หน้าเพจตระกูล Gemini มีตารางประสิทธิภาพที่ Google เป็นผู้จัดทำ โดยมีสี่คอลัมน์ — Gemini 4 Argon, GPT-6 Astra, Claude Fable 5.1, Claude Opus 5.5 — และมีแถวการทดสอบมาตรฐานทั้งหมดสิบเก้าแถว นี่คือชุดคำกล่าวอ้างที่มีรายละเอียดมากที่สุดที่ Google เผยแพร่สำหรับโมเดลนี้ และตลอดทั้งชุดเป็นข้อมูลที่ผู้ขายรายงานเอง การนำไปอ่านเทียบกับ Index อิสระนั้นให้ข้อคิดอย่างยิ่ง เพราะทั้งสองไม่เห็นพ้องกันเกี่ยวกับภาพรวมของวงการ
ในตารางของ Google Argon ชนะแบบเด็ดขาดหรือเสมอเป็นที่หนึ่งใน 13 จาก 19 แถว รวมถึง Vals Index Knowledge work ที่ 68.9, AutomationBench ที่ 51.3, Harvey’s Legal Agent Benchmark ที่ 19.6, DeepSWE v1.1 ที่ 77.9, LABBench 2 ที่ 88.8, GraphWalks ที่ 99.7 สำหรับช่วง ≤128K และ 84.2 สำหรับช่วง 256K–1M, Agent’s Last Exam ที่ 39.5, LVBench ที่ 91.7 และ Chartography ที่ 71.6
• Claude Opus 5.5 ชนะในแถวที่อ่านแล้วเหมือนงานวิศวกรรมที่ทำต่อเนื่องระยะยาว: FrontierSWE v2 อยู่ที่ 62.3 เทียบกับ 55.0 ของ Argon, Terminal-bench 4.0 อยู่ที่ 66.4 เทียบกับ 57.4, Terminal-Bench Science 0.1 อยู่ที่ 63.3 เทียบกับ 57.6 และ PostTrainBench อยู่ที่ 49.3 เทียบกับ 45.3
• GPT-6 Astra ทำคะแนน Terminal-Bench Science 0.1 ได้ 68.1 และ OSWorld-2.0 offline subset ได้ 72.6 และเสมอ Argon บน CWE-bench v1 ที่ 68.0 Claude Fable 5.1 แพ้ทุกแถว ยกเว้นเสมอกันบน Vibe Code Bench
• บน Index ฉบับอิสระ ลำดับคือ Opus 5.5 เป็นอันดับแรก ตามด้วย Sonnet 5.5 จากนั้น Fable 5.1 แล้วจึงเป็น Argon กับ Astra ซึ่งอยู่ในระดับเดียวกันจริง ๆ ตารางของ Google ไม่มีคอลัมน์ Sonnet 5.5 อยู่เลย ซึ่งนับเป็นการละเว้นที่มีนัยสำคัญที่สุดในตารางนั้น: คอลัมน์ทั้งสี่ของตารางเป็นคอลัมน์ที่ถูกเลือกมา และโมเดลที่อยู่อันดับสูงกว่า Argon บน Index ในราคาที่ต่ำกว่า กลับไม่อยู่ในจำนวนนั้น
ทั้งหมดนั้นไม่ได้ทำให้ตารางของ Google ไม่ซื่อสัตย์ ตารางเบนช์มาร์กของผู้ขายถูกคัดเลือก ไม่ได้มาจากการสุ่มตัวอย่าง และของทุกห้องแล็บก็เป็นเช่นนั้น มันทำให้ตารางนี้เป็นข้อกล่าวอ้างมากกว่าการวัด และหมายความว่าคำถามเรื่องระดับชั้นไม่อาจตัดสินได้จากตารางนี้ จุดเดียวที่ตารางนี้มีบทบาทสำคัญจริง ๆ ต่อบทความนี้คือประเด็นเชิงปฏิเสธ: สิบเก้าแถว สี่คอลัมน์ และไม่มีคอลัมน์ที่ห้าสำหรับ Ultra

สิ่งเดียวเกี่ยวกับ Argon ที่ไม่ใช่คำถามเรื่องระดับเลยแม้แต่น้อย
ทุกข้อโต้แย้งเรื่องระดับชั้นข้างต้นต่างตั้งอยู่บนสมมติฐานว่า Argon คือโมเดลที่คุณจะเรียกใช้ได้ในที่สุด จึงควรแยกเรื่องนี้ออกจากคำถามด้านการวางตำแหน่ง เพราะทั้งสองเรื่องมีคำตอบที่ต่างกัน และมีเพียงเรื่องเดียวเท่านั้นที่เกี่ยวกับขีดความสามารถ
ขีดจำกัดโทเค็นเอาต์พุตของ Argon อยู่ที่ 1 ล้านโทเค็น เพิ่มขึ้นจาก 64K และ Google ระบุเช่นนั้นโดยตรง นั่นคือเพดานเอาต์พุต ไม่ใช่หน้าต่างบริบท ความแตกต่างนี้สำคัญเพราะสองสิ่งนี้มักถูกนำมาปนกันอยู่ตลอดในการรายงานข่าวเกี่ยวกับการเปิดตัวครั้งนี้ และเพราะขีดจำกัดเอาต์พุต 1M เป็นข้ออ้างทางวิศวกรรมที่ต่างจากหน้าต่างบริบท 1M — อย่างแรกเกี่ยวกับความยาวที่วิถีเดียวสามารถดำเนินไปได้ อย่างที่สองเกี่ยวกับปริมาณที่คุณมอบให้โมเดลได้ในครั้งเดียว Google ชัดเจนเรื่องขีดจำกัดเอาต์พุตและเงียบเรื่องหน้าต่างบริบท Artificial Analysis บันทึก 1,000,000 โทเค็นสำหรับบริบทของ Argon เช่นกัน แต่นั่นเป็นฟิลด์ของตัวติดตาม ไม่ใช่คำแถลงของ Google ดังนั้นให้ถือว่าตัวเลขทั้งสองนี้มาจากคนละห้อง แม้ว่าจะดูเหมือนกันก็ตาม
สิ่งที่ไม่มีให้บริการอย่างไม่ต้องสงสัยเลยคือการเข้าถึง Argon ไม่ได้เปิดให้ใช้โดยทั่วไป ไม่ได้อยู่ใน Gemini API ภายใต้ตัวระบุใด ๆ และไม่ได้อยู่ในแคตตาล็อกของบุคคลที่สามใด ๆ มันพร้อมให้ใช้สำหรับนักป้องกันไซเบอร์ที่ผ่านการตรวจสอบแล้วผ่าน Fairwind Program และสำหรับวิศวกรของ Google เอง และขั้นตอนถัดไปที่ Google ระบุชื่อ — “เริ่มต้นด้วยลูกค้า API ที่ชำระเงินและผู้สมัครใช้บริการ Google AI Ultra” — ยังไม่มีวันที่แนบมาด้วย คุณไม่สามารถนำมันมาวัดประสิทธิภาพบนเวิร์กโหลดของคุณเองได้ ดังนั้น ตัวเลขทุกตัวในบทความนี้จึงเป็นการวัดของคนอื่นที่มีต่อโมเดลที่คุณไม่สามารถใช้งานได้
อะไรจะทำให้ Argon เลื่อนขึ้นไปอีกขั้น
การตัดสินจัดระดับเป็นเพียงภาพ ณ ขณะหนึ่ง และมีอยู่ประมาณห้าสิ่งที่จะเปลี่ยนการตัดสินนี้ โดยเรียงตามลำดับคร่าว ๆ ว่าสิ่งใดจะมีผลมากน้อยเพียงใด
• การรันที่วัดแบบความพยายามสูงสุดอย่างเป็นอิสระ ปัจจุบัน Argon เป็นการวัดแบบความพยายามสูงที่ 52.56 บันไดความพยายามของ Anthropic เองทำให้โมเดลขยับหลายจุดเมื่อเปลี่ยนการตั้งค่า และหากโมเดลของ Google มีพฤติกรรมคล้ายกันที่ค่าสูงสุด ตำแหน่งจริงของ Argon เมื่อเทียบกับ Fable 5.1 และ Astra ก็ดีกว่าที่บทความนี้กล่าวไว้ นี่คือการเปลี่ยนแปลงที่เป็นไปได้มากที่สุดเพียงเรื่องเดียว
• แหล่งการวัดแหล่งที่สอง ตัวติดตามหนึ่งตัวเท่ากับการวัดหนึ่งครั้ง ห้องแล็บอิสระแห่งที่สองที่ให้คะแนน Argon บนฮาร์เนสของตนเองจะมีส่วนช่วยต่อข้อกล่าวอ้างเรื่องระดับได้มากกว่าการเพิ่มแถวผลเบนช์มาร์กใด ๆ จาก Google
• Gemini 4 Pro หนึ่งรุ่น หาก Google เปิดรุ่น Pro ของเจเนอเรชันที่ 4 ที่ต่ำกว่า Argon ไลน์อัปจะกลายเป็นครอบครัวที่มีโครงสร้างชัดเจน ตำแหน่งของ Argon จะเลิกเป็น “หนึ่งเดียว” และเริ่มเป็น “รุ่นบนสุดของสามรุ่น” และทุกข้อโต้แย้งในบทความนี้เกี่ยวกับครอบครัวที่หายไปก็ต้องเขียนใหม่ น่าจับตามอง และใกล้กว่าคำถามเรื่อง Ultra
• ราคาที่ไม่ปรับขึ้นเป็นขั้น ๆ หากช่วงราคาเริ่มต้นเพียงแต่ไม่หมดอายุไปเลย — Google ยังไม่ได้กำหนดว่ามันสิ้นสุดเมื่อใด — ราคาที่หยุดนิ่งซึ่งมีผลจริงของ Argon จะอยู่ที่ $2/$10 แทนที่จะเป็น $4/$20 และข้อได้เปรียบด้านต้นทุนต่อภารกิจเหนือ Opus 5.5 จะเพิ่มจากราว 3× เป็นราว 6× นั่นเป็นเหตุการณ์เชิงพาณิชย์ ไม่ใช่เหตุการณ์ด้านความสามารถ แต่ก็เปลี่ยนภาพว่าการตัดสินใจจัดซื้อจัดจ้างเป็นอย่างไร
• การ์ดโมเดล Argon การ์ดระบบ หรือหน้าอธิบายวิธีการประเมิน ตารางประสิทธิภาพมีลิงก์ไปยังหน้าอธิบายวิธีการบนโดเมนของ Google การ์ดโมเดลฉบับเต็มจะบันทึกหน้าต่างบริบท การกำหนดค่าการติดตั้งใช้งาน และกรอบความปลอดภัยไว้อย่างเป็นทางการ และจะเป็นเอกสารชิ้นแรกที่ทำให้คนนอกกลุ่ม Fairwind ตรวจสอบตัวเลขของ Google ได้ แทนที่จะเพียงอ่านมัน
ในทางกลับกัน สิ่งที่มีแนวโน้มมากที่สุดที่จะทำให้ Argon ตกลงมาไม่ใช่เบนช์มาร์กเลย แต่มันคือรายงานของ Bloomberg ฉบับวันที่ 30 กันยายน ซึ่งอ้างคำพูดของพนักงาน Google ที่มีสิทธิ์เข้าถึงโมเดลว่า โมเดลทำงานจริงได้ไม่ดีเท่าที่คะแนนของมันบ่งชี้ ข้อกล่าวอ้างนั้นยังไม่ได้รับการยืนยันจากใครก็ตามนอก Google และมันไม่ใช่การวัดผล แต่มันเป็นข้อกล่าวอ้างประเภทที่เบนช์มาร์กอิสระตัวที่สองจะยืนยันหรือหักล้างก็ได้ จนถึงตอนนั้น มันยังคงอยู่ในบันทึกในฐานะข้อกล่าวหาที่มีสำนักข่าวซึ่งระบุชื่อและแหล่งข่าวที่ไม่ระบุชื่อ และมันควรอยู่ในวงอภิปรายเรื่องระดับชั้น เพราะโมเดลที่มีช่องว่างระหว่างผลเบนช์มาร์กกับผลงานจริงเป็นที่โต้แย้ง ไม่สามารถได้รับการเลื่อนระดับโดยอาศัยเบนช์มาร์กเพียงอย่างเดียว
สิ่งนี้หมายความว่าอย่างไรหากคุณกำลังเลือกโมเดลในเดือนนี้
หากตัดข้อโต้แย้งเรื่องการวางตำแหน่งออกไป ภาพในทางปฏิบัติก็ตรงไปตรงมาพอที่ย่อหน้าหนึ่งจะอธิบายได้ครบ Gemini 4 Argon เป็น Gemini ที่ดีที่สุดที่ Google สร้างมา และคุณไม่สามารถใช้งานมันได้ ดังนั้นโมเดล Google ที่คุณเลือกได้จริงในวันนี้คือรุ่นที่วางจำหน่ายแล้ว ได้แก่ Gemini 3.8 Flash ซึ่งทำคะแนนได้ 40.93 บน Index ในราคา $0.75/$3.75 และ Gemini 3.1 Pro Preview ซึ่งทำคะแนนได้ 29.72 ในราคา $2/$12 หากคุณต้องการ Gemini ตอนนี้ นั่นคือตัวเลือกที่แท้จริง และ Argon ไม่ได้อยู่ในตัวเลือกนั้น
หากคุณกำลังเลือกจากผู้ให้บริการหลายรายแทนที่จะเลือกภายใน Google การประกาศของ Argon ก็ไม่เปลี่ยนแปลงการตัดสินใจในวันนี้ อันดับต้น ๆ ของดัชนีคือ Claude Opus 5.5 ที่ 57.62 โดยมี Claude Sonnet 5.5 ที่ 55.98 ตามมาติด ๆ ในอัตราหนึ่งในห้าสำหรับอินพุตและครึ่งหนึ่งสำหรับเอาต์พุต Gemini 4 Argon ที่ 52.56 ไม่มีเส้นทางไปยังแอปพลิเคชันของคุณ ดังนั้นจึงไม่ใช่ตัวเลือก ไม่ว่าคะแนนสุดท้ายจะออกมาดีเพียงใดก็ตาม

OrcaRouter คือ API เดียวที่วางอยู่ข้างหน้าโมเดลกว่า 200 รายการ โดยส่งผ่านราคาตามรายการของผู้ให้บริการในอัตรากำไรเป็นศูนย์ พร้อมการสลับไปยังผู้ให้บริการรายอื่นโดยอัตโนมัติเมื่อเกิดข้อขัดข้อง ซึ่งหมายความว่าการตัดสินใจเปลี่ยนโมเดลไม่ต้องรื้อระบบใหม่ใด ๆ ทั้งสิ้น: id ใน body ของคำขอคือการเปลี่ยนแปลงทั้งหมด โมเดล Google ที่อยู่ในแคตตาล็อกของเราวันนี้คือรุ่นที่ Google เปิดตัวจริงแล้ว — google/gemini-3.8-flash, google/gemini-3.6-flash, google/gemini-3.5-flash และ google/gemini-3.1-pro-preview ส่วน Gemini 4 Argon ไม่ได้อยู่ในนั้น และจะไม่รวมอยู่ด้วยตราบใดที่ยังไม่มีตัวระบุโมเดลสาธารณะและไม่มีตารางราคาที่เผยแพร่ ดังนั้นไม่ควรมีใครตีความข้อความข้างต้นว่าเป็นการกล่าวอ้างเรื่องการจัดเส้นทาง เมื่อ Google นำ Argon ขึ้น API พร้อม ID เมื่อใด มันก็จะกลายเป็นคำถามเรื่องการจัดเส้นทางทันที จนถึงตอนนั้น คำตอบของ OrcaRouter ฉบับที่ตรงไปตรงมาที่สุดคือยังใช้ไม่ได้ และสิ่งที่มีประโยชน์ซึ่งแคตตาล็อกทำได้สำหรับการตัดสินใจครั้งนี้ คือให้คุณเทียบราคา โมเดลที่เรียกใช้งานได้จริงเคียงข้างกัน โดยไม่ต้องเปิดสี่บัญชีเพื่อหาคำตอบ
สรุป
Gemini 4 Argon เป็นเรือธงของ Google และไม่ใช่โมเดลแนวหน้าสุดของบริษัท มันทำคะแนนได้ 52.56 บนดัชนี v4.3.2 ของ Artificial Analysis ที่โหมด high effort อยู่ในระดับเดียวกับ Claude Fable 5.1 และ GPT-6 Astra ตามหลัง Claude Opus 5.5 อยู่ห้าคะแนน และตามหลัง Claude Sonnet 5.5 ซึ่งเป็นโมเดลที่ถูกกว่าจากแล็บคู่แข่ง Google ตั้งราคาเปิดตัวไว้ที่ $2/$10 และจะขยับเป็น $4/$20 ซึ่งทำให้ราคาสุดท้ายของมันอยู่ที่ระดับเดียวกับ Claude Opus 5.5 พอดี ทั้งที่มีความสามารถด้อยกว่าอย่างวัดได้ ส่วนช่องว่าง 11.6 คะแนนที่มันนำ Gemini 3.8 Flash นั้นเป็นช่องว่างระหว่างรุ่นที่กว้างที่สุดในไลน์อัปของ Google เอง และเป็นหลักฐานที่หนักแน่นที่สุดว่ายุค Gemini 4 เป็นการยกระดับที่แท้จริง ไม่ใช่แค่การติดป้ายใหม่
สำหรับคำถามที่ทำให้เรื่องทั้งหมดนี้เกิดขึ้น: ไม่มี Gemini 4 Ultra อยู่จริง เส้นทาง Ultra ของ Google บนโดเมนของตัวเองเปลี่ยนเส้นทางไปยังหน้าของแผนการสมัครสมาชิก ดัชนีการ์ดโมเดลไม่มีรายการ Gemini 4 อยู่เลย รูปแบบ URL ของประกาศสำหรับโพสต์ Gemini 4 Ultra ทุกแบบขึ้น 404 และโพสต์เปิดตัวประกาศโมเดลเดียวโดยไม่ได้สัญญาว่าจะมีทั้งตระกูล นั่นคือข้อค้นพบจริง และเป็นหลักฐานจากต้นทางโดยตรง ไม่ใช่การอนุมาน แต่ก็เป็นข้อเท็จจริงที่มีครึ่งชีวิตสั้น — 200 เพียงครั้งเดียวบนเส้นทางหนึ่งก็พลิกกลับข้อสรุปนี้ได้ และขั้น Pro ของรุ่น Gemini 4 คือขั้นที่มีแนวโน้มจะปรากฏก่อน
ข้อควรระวังสองข้อที่ควรนำออกไปจากบทความนี้ ตัวเลข Argon ทุกตัวในที่นี้เป็นการวัดของคนอื่นต่อโมเดลที่ไม่มีใครนอกกลุ่มนักป้องกันไซเบอร์ที่ผ่านการตรวจสอบแล้วสามารถเรียกใช้ได้ และตารางสิบเก้าแถวของ Google เองก็เป็นคำกล่าวอ้างมากกว่าการวัด — มีประโยชน์ในแบบที่มันเป็น และไม่ใช่สิ่งทดแทน Index อิสระ และคำตัดสินที่ยุติธรรมต่อคำถามเรื่องระดับนั้นเป็นเพียงชั่วคราว: Argon ถูกวัดที่ความพยายามสูง ไม่ใช่สูงสุด และการรันที่ความพยายามสูงสุดเป็นวิธีที่ประหยัดที่สุดเท่าที่เป็นไปได้สำหรับบทความนี้ที่จะผิด
การเปรียบเทียบในบทความนี้4
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
