
Gemini 4 Argon บน FrontierSWE: ตะโกนว่า "Eureka!" แล้วก็ให้คะแนนการบ้านของตัวเอง
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 261 tok/s
- OpenAIใหม่OpenAI: GPT-6 Luna2026-09-2237ความฉลาด
- OpenAIใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- Anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIใหม่Grok 4.72026-09-2146ความฉลาด
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 102 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 216 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- xAISpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
Gemini 4 Argon มีปัญหาด้านบุคลิกภาพ และมันเป็นสิ่งที่น่าสนใจที่สุดที่ใครๆ ได้พูดเกี่ยวกับโมเดลนี้ตั้งแต่ Google ประกาศเปิดตัวเมื่อวันที่ 30 กันยายน 2026 บนเบนช์มาร์ก FrontierSWE ที่มีขอบเขตยาวนานเป็นพิเศษ โมเดลที่ได้อันดับสาม — รองจาก GPT-6 Astra และ Claude Opus 5.5 — ทำให้ผู้ประเมินของมันมีความประทับใจที่น่าจดจำ: คำโปรดของมันคือ "Eureka!" และมันใช้เวลาในงบทำงาน 20 ชั่วโมงไปกับการตำหนิตัวเองอย่างรุนแรง นั่นเป็นข้อสังเกตจากผู้ดำเนินการเบนช์มาร์กที่มีแหล่งเดียว ซึ่งใกล้เคียงกับข้อมูลรั่วไหล ไม่ใช่คำกล่าวอ้างจากผู้ขาย และไม่ใช่บันทึกการเปิดตัว และควรค่าแก่การอธิบายให้ชัดเจนว่ามันบอกอะไรคุณและไม่บอกอะไรคุณ ไม่มีโมเดลใดในสามโมเดลข้างต้นที่มีวัน GA สำหรับ Argon แนบอยู่ ข้อสังเกตนี้เกี่ยวกับพฤติกรรมภายในฮาร์เนส และตัวเลขที่มาพร้อมกับมันคือการวัดผลอิสระครั้งแรกของ Argon บนเบนช์มาร์กที่ Google ไม่ได้จัดทำเอง
คำพูด "Eureka!" จริง ๆ แล้วคืออะไร
แหล่งที่มาคือโพสต์จาก @nrehiew_ วิศวกรที่ทำงานด้านการประเมินโมเดล เผยแพร่เมื่อวันที่ 30 กันยายน 2026 ซึ่งอ้างอิงถึงประกาศ Gemini 4 Argon ของ Sundar Pichai สาระสำคัญคือสามข้อกล่าวอ้าง: Argon เป็นโมเดลที่สนุกที่สุดเท่าที่พวกเขาเคยประเมินบน FrontierSWE; คำโปรดของมันคือ "ยูเรก้า!"; และมันวิจารณ์ตัวเองอย่างรุนแรง ผู้โพสต์อธิบายว่ามันเป็นการปรับปรุงครั้งใหญ่จาก Gemini รุ่นก่อนๆ ในขณะที่ยังคงรักษาบุคลิกนั้นไว้ และเรียกมันว่าน่าประทับใจ
อ่านสิ่งนั้นให้ดี เพราะมันง่ายที่จะอ่านเกินเลย มันเป็นเพียงความประทับใจของนักประเมินคนหนึ่งจากการดูร่องรอยของเอเจนต์ ไม่ใช่ผลลัพธ์ที่ถูกให้คะแนน ไม่ใช่ตัวชี้วัดที่เผยแพร่ และไม่ใช่สิ่งที่ Proximal Labs — ผู้สร้างและดำเนินการ FrontierSWE — ได้ลงชื่อรับรองว่าเป็นข้อค้นพบ ไม่มีคอลัมน์ "self-criticism" บนกระดานผู้นำ สิ่งที่ทำให้ข้อสังเกตนี้ควรค่าแก่การเขียนถึงไม่ใช่เพราะมันมีอำนาจเชื่อถือได้ หากแต่เป็นเพราะมันเป็นการตีความเชิงคุณภาพเพียงหนึ่งเดียวที่ใครก็ตามนอก Google ได้เสนอเกี่ยวกับ Argon และเนื่องจากโมเดลนี้ยังไม่เปิดให้ใช้ทั่วไป ร่องรอยเช่นนี้จึงเป็นวิธีเดียวในปัจจุบันที่จะเห็นสิ่งนี้ทำงาน
มันยังนำไปสู่คำถามจริงจังสำหรับใครก็ตามที่วางแผนจะรัน Argon ในฐานะเอเจนต์ การรันโค้ดระยะยาวส่วนใหญ่เป็นปัญหาการบริหารงบประมาณ: โมเดลที่ขัดจังหวะตัวเองเพื่อทบทวนใหม่ ที่ให้คะแนนงานระหว่างทางของตัวเอง และที่ประกาศความก้าวหน้าครั้งสำคัญ คือโมเดลที่ใช้โทเค็นไปกับกระบวนการ ว่าสิ่งนั้นจะเป็นจุดแข็งหรือเป็นภาระ ขึ้นอยู่ทั้งหมดกับว่าการวิจารณ์ตนเองนั้นลู่เข้าหรือวนซ้ำ ผู้ประเมินเพียงคนเดียวที่พูดว่า "น่าประทับใจ" เป็นเพียงจุดข้อมูล ไม่ใช่คำตอบ
FrontierSWE v2 และเหตุใดการคว้าอันดับที่สามจึงเป็นเรื่องราวที่แท้จริง
FrontierSWE ไม่ใช่เบนช์มาร์กแบบที่คุณจะอ่านตัวเลขจากพาดหัวข่าวได้ มันถูกสร้างโดย Proximal Labs และอธิบายไว้ในรีโพซิทอรีของพวกเขาว่าเป็นเบนช์มาร์กสำหรับเอเจนต์เขียนโค้ดแบบ ultra long-horizon ที่ทดสอบการนำไปใช้งานจริง วิศวกรรมประสิทธิภาพ และงานวิจัยด้าน ML เวอร์ชัน 2 เปิดตัวในเดือนกันยายน 2026 พร้อมภารกิจใหม่ 21 งานเพิ่มจากชุดเดิม รวมเป็น 34 งาน และคาดหวังให้เอเจนต์ทำงานต่อเนื่องได้นานถึงยี่สิบชั่วโมง ทุกอย่างรันผ่านฮาร์เนสของ Proximal เอง proximus ซึ่งสร้างขึ้นบน mini-swe-agent และเพิ่มการบีบอัดบริบท (context compaction) ความสามารถด้านภาพ และเครื่องมือส่งงาน (submit tool) ที่ชัดเจน การให้คะแนนใช้ mean@5 — ค่าเฉลี่ยจากการลองห้าครั้งต่อหนึ่งภารกิจ — โดยช่วงความไม่แน่นอนที่รายงานครอบคลุมตั้งแต่ค่าเฉลี่ยของรอบที่แย่ที่สุดของแต่ละภารกิจไปจนถึงค่าเฉลี่ยของรอบที่ดีที่สุด
ระเบียบวิธีนั้นสำคัญต่อการอ่านแถวของ Argon อย่างตรงไปตรงมา:
• คะแนน — Gemini 4 Argon 55.0% mean@5, ±9.9, เทียบกับ GPT-6 Astra 65.5% และ Claude Opus 5.5 62.3%
• การกระจาย — ผลการรันของ Argon มีช่วงตั้งแต่ 44.5% (worst@5) ถึง 64.3% (best@5) ซึ่งเป็นช่วงที่ทับซ้อนกับ 52.0%–71.5% ของ Opus 5.5 ที่ปลายบน และไม่ทับซ้อนกับ 55.1%–73.0% ของ Astra เลย
• ค่าใช้จ่ายต่อการทดลอง — Argon $129.36, Opus 5.5 $98.87, Astra $1,029.65
• เวลาตามนาฬิกาต่อการทดลอง — Argon 10.6 ชั่วโมง, Opus 5.5 14.2 ชั่วโมง, Astra 12.1 ชั่วโมง
สิ่งแรกที่คุณสังเกตคือ Argon อยู่อันดับสาม และคะแนนไม่ได้ใกล้เคียงกับอันดับสองเลย สิ่งที่สอง — สิ่งที่ควรใช้ตัดสินว่าคุณควรสนใจหรือไม่ — คือบนเบนช์มาร์กนี้ Argon ถูก Claude Opus 5.5 ครอบงำอย่างเด็ดขาด Opus 5.5 ได้คะแนนสูงกว่า (62.3% เทียบกับ 55.0%) และมีค่าใช้จ่ายต่อการทดลองต่ำกว่า ($98.87 เทียบกับ $129.36) ไม่มีมิติใดเลยที่ Argon ชนะ ข้อได้เปรียบเดียวของมันคือเวลา: 10.6 ชั่วโมง เทียบกับ 14.2 ชั่วโมงของ Opus 5.5 ซึ่งเป็นเรื่องจริงหากคุณจ่ายตามเวลานาฬิกา (wall-clock) ไม่ใช่ตามโทเคน และไม่มีความสำคัญเลยหากคุณจ่ายตามงบประมาณต่อการทดลอง
ลีดเดอร์บอร์ดของ Proximal เองมีเชิงอรรถกำกับแถวของ Argon ซึ่งทุกคนที่อ้างตัวเลขนี้ควรพูดซ้ำ: "Gemini 4 Argon: อัตราการฮิตของแคชต่ำกว่ามากเนื่องจากการตั้งค่าที่ไม่ใช่โปรดักชัน" นั่นคือผู้ประเมินที่ชี้ให้เห็นว่าพวกเขารัน Argon นอกการกำหนดค่าที่การดีพลอยในโปรดักชันจะใช้ ซึ่งทำให้ต้นทุนของมันสูงเกินจริง และน่าจะทำให้ความหน่วงสูงเกินจริงด้วย มันเป็นข้อควรระวังเฉพาะกับตัวเลขต้นทุน และเป็นเหตุผลว่าทำไม $129.36 จึงควรตีความเป็นขอบเขตบนมากกว่าที่จะเป็นอัตราค่าบริการ
ตัวเลขที่แผนภูมิของ Google เองไม่ได้แสดง
นี่คือจุดที่การตรวจสอบแหล่งที่มาเริ่มน่าสนใจอย่างแท้จริง และเป็นจุดที่บทความส่วนใหญ่เกี่ยวกับผลลัพธ์นี้จะเข้าใจผิด โพสต์ประกาศของ Google มีแผนภูมิเปรียบเทียบ (benchmark) ที่มีแถว FrontierSWE v2 แถวดังกล่าวระบุว่า GPT-6 Astra 65.5%, Claude Fable 5.1 56.3%, Claude Opus 5.5 62.3% โดยไม่มี Gemini 4 Argon อยู่ในนั้น ลีดเดอร์บอร์ดแบบเรียลไทม์ของ Proximal มี Astra อยู่ที่ 65.5% และ Opus 5.5 ที่ 62.3% — เป็นตัวเลขเดียวกัน — แต่ให้ Claude Fable 5.1 อยู่ที่ 56.5% ไม่ใช่ 56.3% และระบุ Gemini 4 Argon ที่ 55.0%
เหตุผลของการละเว้นนั้นไม่ใช่เรื่องลึกลับ และ Google เองก็บอกเช่นนั้น: บันทึกวิธีการที่แนบมากับชุดประเมินของพวกเขาระบุว่าผลลัพธ์ FrontierSWE ถูกรายงานจากกระดานผู้นำสาธารณะอย่างเป็นทางการของ Proximal Google ไม่ได้คำนวณ benchmark นี้ด้วยตนเอง พวกเขาอ้างอิงบุคคลที่สามรายเดียวกันกับเรา และตัวเลข Argon เพียงตัวเดียวที่บุคคลที่สามรายนั้นเผยแพร่คือ 55.0% ดังนั้นการตีความที่ซื่อตรงคือคะแนน FrontierSWE ของ Argon เป็นการวัดที่เป็นอิสระอย่างแท้จริง — Proximal เป็นผู้รัน บน harness ของพวกเขา บนงานของพวกเขา — และนั่นทำให้ Argon อยู่อันดับรองจากคู่แข่งสองราย
ทุกอย่างอื่นในแผนภูมิของ Google เป็นข้อมูลที่ผู้ขายรายงานเอง และคุณควรตีตราไว้ในใจแบบนั้น: Argon 63.1% บน Vals Index เทียบกับ 67.0% ของ Opus 5.5, 41.4% AutomationBench เทียบกับ 42.5% ของ Opus 5.5, 89.6% Vibe Code Bench เทียบกับ 90.3% สำหรับทั้ง Astra และ Opus 5.5, 87.5% LVBench เทียบกับ 83.7%, 68.0% CWE-bench v1 เทียบกับ 67.0% ของ Opus 5.5 เหล่านั้นคือการรันของ Google ต่อการประเมินที่ Google เลือกเอง แถว FrontierSWE เป็นแถวเดียวในภาพนั้นที่ผู้อ่านสามารถตรวจสอบได้ด้วยตนเอง ซึ่งเป็นเหตุผลว่าทำไมอันดับสามจึงมีน้ำหนักมากกว่ารูปแบบเสมอหรือชนะเล็กน้อยรอบ ๆ แถวนั้น
สิ่งที่ Artificial Analysis กล่าวไว้อย่างเป็นอิสระ
FrontierSWE เป็นมุมมองหนึ่ง Artificial Analysis คืออีกมุมมองหนึ่ง และมันสอดคล้องกับภาพรวมของเรื่องราว บน Intelligence Index v4.3.2 ของพวกเขา Gemini 4 Argon ในคอนฟิกูเรชันการให้เหตุผลระดับสูงได้คะแนน 52.56 — ซึ่งวัดอย่างอิสระบนฮาร์ดแวร์ของพวกเขาเอง ไม่ใช่ตัวเลขที่ Google รายงาน — ด้วยราคาตามประกาศที่ $2.00 ต่อโทเคนอินพุตหนึ่งล้านโทเคน และ $10.00 ต่อโทเคนเอาต์พุตหนึ่งล้านโทเคน พร้อมส่วนลด 95% สำหรับอินพุตที่แคชไว้ เครื่องมือวัดของพวกเขาคิดต้นทุนของงาน index หนึ่งงานอยู่ที่ $1.99
การเปรียบเทียบที่สำคัญคือการเปรียบเทียบแบบเดียวกับที่ FrontierSWE จัดทำขึ้น Claude Opus 5.5 ในการกำหนดค่าสูงทำคะแนนบนดัชนีได้สูงกว่า คือ 53.58 ด้วยต้นทุนต่องานที่ต่ำกว่า $1.82 ผู้ประเมินอิสระสองรายซึ่งใช้งานที่แตกต่างกันและฮาร์เนสที่แตกต่างกัน จัดให้ Argon อยู่เบื้องหลัง Opus 5.5 ทั้งในด้านคุณภาพและต้นทุน นั่นเป็นสัญญาณที่สอดคล้องกันมากกว่าจะเป็นเพียงอาร์ติแฟกต์จากการวัด benchmark ครั้งเดียว และเป็นสิ่งที่แข็งแกร่งที่สุดที่คุณสามารถพูดได้ในตอนนี้เกี่ยวกับเศรษฐศาสตร์ของ Gemini 4 Argon

ประกาศแล้ว แต่ยังไม่เปิดตัว — และเหตุใดการวางกรอบเช่นนี้จึงไม่ใช่การจู้จี้เรื่องถ้อยคำ
ไม่มี ID โมเดล Gemini 4 Argon การเข้าถึงกำลังทยอยเปิดผ่าน Fairwind Program ให้กับนักป้องกันไซเบอร์ที่ผ่านการตรวจสอบแล้ว ควบคู่ไปกับการเปิดให้ลูกค้า API ที่ชำระเงินและผู้สมัครสมาชิก Google AI Ultra เป็นระยะ โดยยังไม่มีการเผยแพร่วันที่เปิดให้ใช้งานทั่วไป โพสต์ของ Google เป็นการประกาศโมเดลและชุดการประเมิน ไม่ใช่การเปิดตัว endpoint ที่คุณเรียกใช้งานได้ หากคุณอ่านรายงานข่าวที่บรรยายสิ่งนี้ว่าเป็นการเปิดตัว รายงานข่าวนั้นก็ล้ำข้อเท็จจริงไปแล้ว
ความแตกต่างนั้นมีนัยสำคัญในทางปฏิบัติสำหรับใครก็ตามที่อ่านตัวเลข FrontierSWE การประเมินนี้รันกับโมเดลที่ Proximal มีสิทธิ์เข้าถึงภายใต้ข้อตกลงบางอย่าง; มันบอกคุณว่าโมเดลทำอะไรได้ ไม่ใช่สิ่งที่คุณจะได้ใช้ นอกจากนี้ยังหมายความว่าตัวเลขประสิทธิภาพมีครึ่งชีวิตที่สั้นกว่าปกติ โมเดลที่ยังไม่ GA ยังเปลี่ยนแปลงได้ — การตั้งค่าการถอดรหัส, system prompt, ค่าเริ่มต้นการใช้เครื่องมือ และโครงความปลอดภัย ยังอยู่ระหว่างการปรับแต่งทั้งหมด และเหตุผลที่ระบุว่าอัตราการแฮิตแคชของ Argon ต่ำ ก็คือผู้ประเมินไม่ได้รันด้วยคอนฟิกูเรชันโปรดักชันนั่นเอง คาดว่าตัวเลข 55.0% และ $129.36 จะเปลี่ยนแปลง
อะไรจะเปลี่ยนภาพนี้: ID โมเดลที่เผยแพร่แล้วพร้อมตารางราคา วันที่เปิดให้ใช้ทั่วไป (GA) การรัน FrontierSWE ซ้ำภายใต้การตั้งค่าโปรดักชัน และผู้ประเมินอิสระรายที่สองที่ทำซ้ำผลลัพธ์อันดับที่สามได้ จนกว่าอย่างน้อยสองข้อแรกนั้นจะปรากฏ ให้ถือว่าตัวเลข Argon ทุกตัว — รวมถึงตัวเลขที่ดีในแผนภูมิของ Google เอง — เป็นข้อมูลเบื้องต้น

การวิเคราะห์บุคลิกภาพเป็นส่วนที่จะคงอยู่ได้ดีที่สุดเมื่อเวลาผ่านไป
คะแนน Benchmark ของโมเดล pre-GA มีอายุการใช้งานนับเป็นสัปดาห์ แต่ข้อสังเกตเชิงพฤติกรรมไม่เป็นเช่นนั้น งานเอเจนต์ระยะยาวเป็นที่ที่อุปนิสัยของโมเดลปรากฏให้เห็นจริง ๆ เพราะงบเวลา 20 ชั่วโมงกับ 34 งานนั้นเป็นเชือกที่ยาวพอให้แนวโน้มของโมเดลทบต้นกัน: มันฟื้นตัวจากแนวทางที่ล้มเหลวอย่างไร หยุดเพื่อวางแผนใหม่หรือไม่ และแยกความแตกต่างระหว่างปัญหาที่ยากกับการเดินผิดทางได้หรือไม่ ผู้ประเมินที่ดูเทรซเหล่านี้จำนวนมากแล้วอธิบายโมเดลว่าวิจารณ์ตัวเองและมีแนวโน้มจะอุทานเมื่อบางอย่างได้ผล กำลังอธิบายโมเดลที่แสดงเหตุผลเกี่ยวกับความคืบหน้าของตัวเองออกมาภายนอก นั่นคือสมมติฐานว่าทำไมผลการรันของ Argon จึงกระจายจาก 44.5% ถึง 64.3% — ซึ่งเป็นช่วงที่กว้างกว่าของ Opus 5.5 — และสามารถทดสอบได้เมื่อโมเดลพร้อมให้เรียกใช้
อีกครึ่งหนึ่งของคำกล่าวคือส่วนที่ควรตั้งข้อกังขา “การปรับปรุงครั้งใหญ่เมื่อเทียบกับ Gemini รุ่นก่อน ๆ” เป็นการเปรียบเทียบกับโมเดลที่ไม่เคยถูกให้คะแนนบนเกณฑ์มาตรฐานนี้ภายใต้ชุดทดสอบนี้ จึงไม่อาจตรวจสอบเทียบกับตารางอันดับได้เลย มันเป็นเพียงความรู้สึกส่วนตัว และควรถือเป็นเช่นนั้น ไม่ว่าผู้ที่เสนอความเห็นนี้จะน่าเชื่อถือเพียงใด

แล้วสิ่งนี้ทำให้คุณอยู่ตรงไหน หากคุณต้องการเอเจนต์ระยะยาวจริง ๆ ในวันนี้
คุณไม่สามารถเรียก Gemini 4 ว่า Argon ได้ ดังนั้นคำถามในทางปฏิบัติจึงไม่ใช่ Argon กับอะไรก็ตาม — แต่เป็นว่ารุ่นไหนที่คุณควรใช้สำหรับงานที่ Argon ถูกนำมาเป็นเกณฑ์วัด การจัดอันดับของ FrontierSWE เองตอบคำถามนี้ว่า GPT-6 Astra อยู่อันดับต้นของบอร์ดที่ 65.5% แต่ราคา $1,029.65 ต่อการทดลอง ซึ่งประมาณสิบเท่าของค่าใช้จ่ายของสองรุ่นที่อยู่ต่ำกว่า ขณะที่ Claude Opus 5.5 ให้ 62.3% ในราคา $98.87 ตัวเลือกที่คุ้มค่าบนเกณฑ์วัดนี้คือ Opus 5.5 และยังเป็นรุ่นที่เอาชนะ Argon บน Artificial Analysis ด้วยต้นทุนต่องานที่ต่ำกว่า
ทั้งสองโมเดลนั้น และโมเดลส่วนใหญ่ในสิบอันดับแรกของบอร์ด — อาทิ GLM-5.3, Grok 4.7, Kimi K3, Qwen3.8-Max, DeepSeek V4 Flash Vision Exp และ Muse Spark 1.2 — ล้วนเข้าถึงได้ผ่าน API เดียวของ OrcaRouter พร้อมกับอีกกว่า 200 ราย — คีย์เดียว ไม่บวกราคา 0% ดังนั้นราคาที่ผู้ให้บริการระบุไว้คือราคาที่คุณจ่าย และเมื่อผู้ขายลดราคา ส่วนลดนั้นก็มาถึงฝั่งเราในวันเดียวกัน คุณสมบัติข้อหลังนี้มีค่ามากกว่าปกติสำหรับโมเดลก่อน GA: หากราคาของ Argon เปลี่ยนไประหว่างนี้จนถึง GA ซึ่งเชิงอรรถเรื่องแคชที่ไม่ใช่โปรดักชันชี้ว่าอาจเป็นเช่นนั้นได้ การผสานรวมของคุณก็ไม่มีการเปลี่ยนแปลงใด ๆ เมื่อถึงตอนนั้น การสลับไปใช้ระบบสำรองอัตโนมัติคืออีกส่วนที่ลงตัวกับกรณีเฉพาะนี้ — โมเดลที่ไม่คุ้นเคยซึ่งยังไม่มีใครแมปโหมดความล้มเหลวของมันไว้เลย คือสิ่งที่คุณไม่ต้องการอย่างยิ่งบนเส้นทางโปรดักชันที่ฮาร์ดโค้ดไว้เพียงเส้นทางเดียว
เพื่อให้ชัดเจนในเรื่องหนึ่ง: Gemini 4 Argon ไม่ได้อยู่ในแคตตาล็อกของเรา การค้นหาผ่าน API โมเดลสาธารณะของเราสำหรับ google/gemini-4-argon ส่งคืน "model not found" และไม่มีใครอื่นให้บริการโฮสต์มันเช่นกัน — มันถูกกักอยู่หลังโปรแกรม Fairwind ของ Google โดยไม่มีการเผยแพร่รหัสโมเดล เมื่อวันหนึ่งมันเรียกใช้งานได้ เราจะจัดเส้นทางให้ และตัวเลข FrontierSWE ข้างต้นคือเหตุผลที่ควรจับตาดูวันนั้น มากกว่าจะรออยู่เฉย ๆ โมเดลที่มันพ่ายแพ้ให้ก็มีอยู่ตรงนั้นแล้ว
ดูอะไรดี
สัญญาณที่จะเปลี่ยนเรื่องนี้จากสิ่งที่เรารู้กันถึงตอนนี้ให้กลายเป็นการตัดสินใจนั้นมีความเฉพาะเจาะจง หมายเลขโมเดลที่เผยแพร่แล้วและอัตราค่าบริการของมัน วันที่พร้อมให้บริการทั่วไป การรัน FrontierSWE ซ้ำภายใต้การตั้งค่าสภาพแวดล้อมการผลิต ซึ่งจะช่วยคลี่คลายว่าต้นทุน $129.36 ต่อการทดลองหนึ่งครั้งเป็นอัตราจริงหรือเป็นสิ่งประดิษฐ์ที่เกิดจากการกำหนดค่าแคชที่ Proximal ชี้ให้เห็น และในอุดมคติแล้ว ผู้ประเมินรายที่สองที่เผยแพร่ร่องรอย Argon เพื่อให้การสังเกต "Eureka!" ไม่ใช่ตัวอย่างจากเพียงหนึ่งเดียวอีกต่อไป
จนถึงตอนนั้น สรุปที่ตรงไปตรงมาก็ยังแคบและควรค่าแก่การยึดถือไว้: Gemini 4 Argon ถูกประกาศออกมาแล้ว มันแสดงออกได้อย่างโดดเด่นผิดปกติในเทรซของเอเจนต์ระยะยาว ตามความเห็นของผู้ประเมินรายหนึ่ง และบนเบนช์มาร์กอิสระเพียงแห่งเดียวที่เราตรวจสอบได้ มันจบอันดับสามตามหลังสองโมเดล — โดยหนึ่งในนั้นเอาชนะมันได้ทั้งคะแนนและต้นทุนในเวลาเดียวกัน
การเปรียบเทียบในบทความนี้1
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
