การ์ดหัวเรื่องหลัก Gemini 4 Argon บน FrontierSWE: มันตะโกนว่า “ยูเรกา” แล้วตรวจการบ้านของตัวเอง พร้อมชิปที่ระบุว่า FrontierSWE v2 ค่าเฉลี่ย 55.0 เปอร์เซ็นต์ที่ 5 ชิปที่ระบุว่าเป็นอันดับสามจากสิบโมเดล และชิปที่ระบุว่า 129 ดอลลาร์ 36 ต่อการทดลอง และบรรทัดส่วนท้ายที่ระบุว่า ตัวเลข FrontierSWE ตามกระดานผู้นำสาธารณะของ Proximal Labs 2026-09-30
Guides & Insights

Gemini 4 Argon บน FrontierSWE: ตะโกนว่า "Eureka!" แล้วก็ให้คะแนนการบ้านของตัวเอง

ผู้เขียน

Magnus Corvin

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

Gemini 4 Argon มีปัญหาด้านบุคลิกภาพ และมันเป็นสิ่งที่น่าสนใจที่สุดที่ใครๆ ได้พูดเกี่ยวกับโมเดลนี้ตั้งแต่ Google ประกาศเปิดตัวเมื่อวันที่ 30 กันยายน 2026 บนเบนช์มาร์ก FrontierSWE ที่มีขอบเขตยาวนานเป็นพิเศษ โมเดลที่ได้อันดับสาม — รองจาก GPT-6 Astra และ Claude Opus 5.5 — ทำให้ผู้ประเมินของมันมีความประทับใจที่น่าจดจำ: คำโปรดของมันคือ "Eureka!" และมันใช้เวลาในงบทำงาน 20 ชั่วโมงไปกับการตำหนิตัวเองอย่างรุนแรง นั่นเป็นข้อสังเกตจากผู้ดำเนินการเบนช์มาร์กที่มีแหล่งเดียว ซึ่งใกล้เคียงกับข้อมูลรั่วไหล ไม่ใช่คำกล่าวอ้างจากผู้ขาย และไม่ใช่บันทึกการเปิดตัว และควรค่าแก่การอธิบายให้ชัดเจนว่ามันบอกอะไรคุณและไม่บอกอะไรคุณ ไม่มีโมเดลใดในสามโมเดลข้างต้นที่มีวัน GA สำหรับ Argon แนบอยู่ ข้อสังเกตนี้เกี่ยวกับพฤติกรรมภายในฮาร์เนส และตัวเลขที่มาพร้อมกับมันคือการวัดผลอิสระครั้งแรกของ Argon บนเบนช์มาร์กที่ Google ไม่ได้จัดทำเอง

คำพูด "Eureka!" จริง ๆ แล้วคืออะไร

แหล่งที่มาคือโพสต์จาก @nrehiew_ วิศวกรที่ทำงานด้านการประเมินโมเดล เผยแพร่เมื่อวันที่ 30 กันยายน 2026 ซึ่งอ้างอิงถึงประกาศ Gemini 4 Argon ของ Sundar Pichai สาระสำคัญคือสามข้อกล่าวอ้าง: Argon เป็นโมเดลที่สนุกที่สุดเท่าที่พวกเขาเคยประเมินบน FrontierSWE; คำโปรดของมันคือ "ยูเรก้า!"; และมันวิจารณ์ตัวเองอย่างรุนแรง ผู้โพสต์อธิบายว่ามันเป็นการปรับปรุงครั้งใหญ่จาก Gemini รุ่นก่อนๆ ในขณะที่ยังคงรักษาบุคลิกนั้นไว้ และเรียกมันว่าน่าประทับใจ

อ่านสิ่งนั้นให้ดี เพราะมันง่ายที่จะอ่านเกินเลย มันเป็นเพียงความประทับใจของนักประเมินคนหนึ่งจากการดูร่องรอยของเอเจนต์ ไม่ใช่ผลลัพธ์ที่ถูกให้คะแนน ไม่ใช่ตัวชี้วัดที่เผยแพร่ และไม่ใช่สิ่งที่ Proximal Labs — ผู้สร้างและดำเนินการ FrontierSWE — ได้ลงชื่อรับรองว่าเป็นข้อค้นพบ ไม่มีคอลัมน์ "self-criticism" บนกระดานผู้นำ สิ่งที่ทำให้ข้อสังเกตนี้ควรค่าแก่การเขียนถึงไม่ใช่เพราะมันมีอำนาจเชื่อถือได้ หากแต่เป็นเพราะมันเป็นการตีความเชิงคุณภาพเพียงหนึ่งเดียวที่ใครก็ตามนอก Google ได้เสนอเกี่ยวกับ Argon และเนื่องจากโมเดลนี้ยังไม่เปิดให้ใช้ทั่วไป ร่องรอยเช่นนี้จึงเป็นวิธีเดียวในปัจจุบันที่จะเห็นสิ่งนี้ทำงาน

มันยังนำไปสู่คำถามจริงจังสำหรับใครก็ตามที่วางแผนจะรัน Argon ในฐานะเอเจนต์ การรันโค้ดระยะยาวส่วนใหญ่เป็นปัญหาการบริหารงบประมาณ: โมเดลที่ขัดจังหวะตัวเองเพื่อทบทวนใหม่ ที่ให้คะแนนงานระหว่างทางของตัวเอง และที่ประกาศความก้าวหน้าครั้งสำคัญ คือโมเดลที่ใช้โทเค็นไปกับกระบวนการ ว่าสิ่งนั้นจะเป็นจุดแข็งหรือเป็นภาระ ขึ้นอยู่ทั้งหมดกับว่าการวิจารณ์ตนเองนั้นลู่เข้าหรือวนซ้ำ ผู้ประเมินเพียงคนเดียวที่พูดว่า "น่าประทับใจ" เป็นเพียงจุดข้อมูล ไม่ใช่คำตอบ

FrontierSWE v2 และเหตุใดการคว้าอันดับที่สามจึงเป็นเรื่องราวที่แท้จริง

FrontierSWE ไม่ใช่เบนช์มาร์กแบบที่คุณจะอ่านตัวเลขจากพาดหัวข่าวได้ มันถูกสร้างโดย Proximal Labs และอธิบายไว้ในรีโพซิทอรีของพวกเขาว่าเป็นเบนช์มาร์กสำหรับเอเจนต์เขียนโค้ดแบบ ultra long-horizon ที่ทดสอบการนำไปใช้งานจริง วิศวกรรมประสิทธิภาพ และงานวิจัยด้าน ML เวอร์ชัน 2 เปิดตัวในเดือนกันยายน 2026 พร้อมภารกิจใหม่ 21 งานเพิ่มจากชุดเดิม รวมเป็น 34 งาน และคาดหวังให้เอเจนต์ทำงานต่อเนื่องได้นานถึงยี่สิบชั่วโมง ทุกอย่างรันผ่านฮาร์เนสของ Proximal เอง proximus ซึ่งสร้างขึ้นบน mini-swe-agent และเพิ่มการบีบอัดบริบท (context compaction) ความสามารถด้านภาพ และเครื่องมือส่งงาน (submit tool) ที่ชัดเจน การให้คะแนนใช้ mean@5 — ค่าเฉลี่ยจากการลองห้าครั้งต่อหนึ่งภารกิจ — โดยช่วงความไม่แน่นอนที่รายงานครอบคลุมตั้งแต่ค่าเฉลี่ยของรอบที่แย่ที่สุดของแต่ละภารกิจไปจนถึงค่าเฉลี่ยของรอบที่ดีที่สุด

ระเบียบวิธีนั้นสำคัญต่อการอ่านแถวของ Argon อย่างตรงไปตรงมา:

• คะแนน — Gemini 4 Argon 55.0% mean@5, ±9.9, เทียบกับ GPT-6 Astra 65.5% และ Claude Opus 5.5 62.3%

• การกระจาย — ผลการรันของ Argon มีช่วงตั้งแต่ 44.5% (worst@5) ถึง 64.3% (best@5) ซึ่งเป็นช่วงที่ทับซ้อนกับ 52.0%–71.5% ของ Opus 5.5 ที่ปลายบน และไม่ทับซ้อนกับ 55.1%–73.0% ของ Astra เลย

• ค่าใช้จ่ายต่อการทดลอง — Argon $129.36, Opus 5.5 $98.87, Astra $1,029.65

• เวลาตามนาฬิกาต่อการทดลอง — Argon 10.6 ชั่วโมง, Opus 5.5 14.2 ชั่วโมง, Astra 12.1 ชั่วโมง

สิ่งแรกที่คุณสังเกตคือ Argon อยู่อันดับสาม และคะแนนไม่ได้ใกล้เคียงกับอันดับสองเลย สิ่งที่สอง — สิ่งที่ควรใช้ตัดสินว่าคุณควรสนใจหรือไม่ — คือบนเบนช์มาร์กนี้ Argon ถูก Claude Opus 5.5 ครอบงำอย่างเด็ดขาด Opus 5.5 ได้คะแนนสูงกว่า (62.3% เทียบกับ 55.0%) และมีค่าใช้จ่ายต่อการทดลองต่ำกว่า ($98.87 เทียบกับ $129.36) ไม่มีมิติใดเลยที่ Argon ชนะ ข้อได้เปรียบเดียวของมันคือเวลา: 10.6 ชั่วโมง เทียบกับ 14.2 ชั่วโมงของ Opus 5.5 ซึ่งเป็นเรื่องจริงหากคุณจ่ายตามเวลานาฬิกา (wall-clock) ไม่ใช่ตามโทเคน และไม่มีความสำคัญเลยหากคุณจ่ายตามงบประมาณต่อการทดลอง

ลีดเดอร์บอร์ดของ Proximal เองมีเชิงอรรถกำกับแถวของ Argon ซึ่งทุกคนที่อ้างตัวเลขนี้ควรพูดซ้ำ: "Gemini 4 Argon: อัตราการฮิตของแคชต่ำกว่ามากเนื่องจากการตั้งค่าที่ไม่ใช่โปรดักชัน" นั่นคือผู้ประเมินที่ชี้ให้เห็นว่าพวกเขารัน Argon นอกการกำหนดค่าที่การดีพลอยในโปรดักชันจะใช้ ซึ่งทำให้ต้นทุนของมันสูงเกินจริง และน่าจะทำให้ความหน่วงสูงเกินจริงด้วย มันเป็นข้อควรระวังเฉพาะกับตัวเลขต้นทุน และเป็นเหตุผลว่าทำไม $129.36 จึงควรตีความเป็นขอบเขตบนมากกว่าที่จะเป็นอัตราค่าบริการ

ตัวเลขที่แผนภูมิของ Google เองไม่ได้แสดง

นี่คือจุดที่การตรวจสอบแหล่งที่มาเริ่มน่าสนใจอย่างแท้จริง และเป็นจุดที่บทความส่วนใหญ่เกี่ยวกับผลลัพธ์นี้จะเข้าใจผิด โพสต์ประกาศของ Google มีแผนภูมิเปรียบเทียบ (benchmark) ที่มีแถว FrontierSWE v2 แถวดังกล่าวระบุว่า GPT-6 Astra 65.5%, Claude Fable 5.1 56.3%, Claude Opus 5.5 62.3% โดยไม่มี Gemini 4 Argon อยู่ในนั้น ลีดเดอร์บอร์ดแบบเรียลไทม์ของ Proximal มี Astra อยู่ที่ 65.5% และ Opus 5.5 ที่ 62.3% — เป็นตัวเลขเดียวกัน — แต่ให้ Claude Fable 5.1 อยู่ที่ 56.5% ไม่ใช่ 56.3% และระบุ Gemini 4 Argon ที่ 55.0%

เหตุผลของการละเว้นนั้นไม่ใช่เรื่องลึกลับ และ Google เองก็บอกเช่นนั้น: บันทึกวิธีการที่แนบมากับชุดประเมินของพวกเขาระบุว่าผลลัพธ์ FrontierSWE ถูกรายงานจากกระดานผู้นำสาธารณะอย่างเป็นทางการของ Proximal Google ไม่ได้คำนวณ benchmark นี้ด้วยตนเอง พวกเขาอ้างอิงบุคคลที่สามรายเดียวกันกับเรา และตัวเลข Argon เพียงตัวเดียวที่บุคคลที่สามรายนั้นเผยแพร่คือ 55.0% ดังนั้นการตีความที่ซื่อตรงคือคะแนน FrontierSWE ของ Argon เป็นการวัดที่เป็นอิสระอย่างแท้จริง — Proximal เป็นผู้รัน บน harness ของพวกเขา บนงานของพวกเขา — และนั่นทำให้ Argon อยู่อันดับรองจากคู่แข่งสองราย

ทุกอย่างอื่นในแผนภูมิของ Google เป็นข้อมูลที่ผู้ขายรายงานเอง และคุณควรตีตราไว้ในใจแบบนั้น: Argon 63.1% บน Vals Index เทียบกับ 67.0% ของ Opus 5.5, 41.4% AutomationBench เทียบกับ 42.5% ของ Opus 5.5, 89.6% Vibe Code Bench เทียบกับ 90.3% สำหรับทั้ง Astra และ Opus 5.5, 87.5% LVBench เทียบกับ 83.7%, 68.0% CWE-bench v1 เทียบกับ 67.0% ของ Opus 5.5 เหล่านั้นคือการรันของ Google ต่อการประเมินที่ Google เลือกเอง แถว FrontierSWE เป็นแถวเดียวในภาพนั้นที่ผู้อ่านสามารถตรวจสอบได้ด้วยตนเอง ซึ่งเป็นเหตุผลว่าทำไมอันดับสามจึงมีน้ำหนักมากกว่ารูปแบบเสมอหรือชนะเล็กน้อยรอบ ๆ แถวนั้น

สิ่งที่ Artificial Analysis กล่าวไว้อย่างเป็นอิสระ

FrontierSWE เป็นมุมมองหนึ่ง Artificial Analysis คืออีกมุมมองหนึ่ง และมันสอดคล้องกับภาพรวมของเรื่องราว บน Intelligence Index v4.3.2 ของพวกเขา Gemini 4 Argon ในคอนฟิกูเรชันการให้เหตุผลระดับสูงได้คะแนน 52.56 — ซึ่งวัดอย่างอิสระบนฮาร์ดแวร์ของพวกเขาเอง ไม่ใช่ตัวเลขที่ Google รายงาน — ด้วยราคาตามประกาศที่ $2.00 ต่อโทเคนอินพุตหนึ่งล้านโทเคน และ $10.00 ต่อโทเคนเอาต์พุตหนึ่งล้านโทเคน พร้อมส่วนลด 95% สำหรับอินพุตที่แคชไว้ เครื่องมือวัดของพวกเขาคิดต้นทุนของงาน index หนึ่งงานอยู่ที่ $1.99

การเปรียบเทียบที่สำคัญคือการเปรียบเทียบแบบเดียวกับที่ FrontierSWE จัดทำขึ้น Claude Opus 5.5 ในการกำหนดค่าสูงทำคะแนนบนดัชนีได้สูงกว่า คือ 53.58 ด้วยต้นทุนต่องานที่ต่ำกว่า $1.82 ผู้ประเมินอิสระสองรายซึ่งใช้งานที่แตกต่างกันและฮาร์เนสที่แตกต่างกัน จัดให้ Argon อยู่เบื้องหลัง Opus 5.5 ทั้งในด้านคุณภาพและต้นทุน นั่นเป็นสัญญาณที่สอดคล้องกันมากกว่าจะเป็นเพียงอาร์ติแฟกต์จากการวัด benchmark ครั้งเดียว และเป็นสิ่งที่แข็งแกร่งที่สุดที่คุณสามารถพูดได้ในตอนนี้เกี่ยวกับเศรษฐศาสตร์ของ Gemini 4 Argon

A two-column scoreboard comparing Gemini 4 Argon and Claude Opus 5.5 on six dimensions. Gemini 4 Argon reads: FrontierSWE v2 mean at 5 55.0 percent, FrontierSWE spread 44.5 to 64.3 percent, FrontierSWE cost per trial 129 dollars 36, FrontierSWE wall clock 10.6 hours, AA Intelligence Index 52.6, AA cost per index task 1 dollar 99. Claude Opus 5.5 reads: FrontierSWE v2 mean at 5 62.3 percent, FrontierSWE spread 52.0 to 71.5 percent, FrontierSWE cost per trial 98 dollars 87, FrontierSWE wall clock 14.2 hours, AA Intelligence Index 53.6, AA cost per index task 1 dollar 82. A footer line reads that FrontierSWE v2 figures are per Proximal Labs' public leaderboard as of 2026-09-30 with Argon's cost marked as a non-production cache setting, and that AA figures are per Artificial Analysis Intelligence Index v4.3.2.

ประกาศแล้ว แต่ยังไม่เปิดตัว — และเหตุใดการวางกรอบเช่นนี้จึงไม่ใช่การจู้จี้เรื่องถ้อยคำ

ไม่มี ID โมเดล Gemini 4 Argon การเข้าถึงกำลังทยอยเปิดผ่าน Fairwind Program ให้กับนักป้องกันไซเบอร์ที่ผ่านการตรวจสอบแล้ว ควบคู่ไปกับการเปิดให้ลูกค้า API ที่ชำระเงินและผู้สมัครสมาชิก Google AI Ultra เป็นระยะ โดยยังไม่มีการเผยแพร่วันที่เปิดให้ใช้งานทั่วไป โพสต์ของ Google เป็นการประกาศโมเดลและชุดการประเมิน ไม่ใช่การเปิดตัว endpoint ที่คุณเรียกใช้งานได้ หากคุณอ่านรายงานข่าวที่บรรยายสิ่งนี้ว่าเป็นการเปิดตัว รายงานข่าวนั้นก็ล้ำข้อเท็จจริงไปแล้ว

ความแตกต่างนั้นมีนัยสำคัญในทางปฏิบัติสำหรับใครก็ตามที่อ่านตัวเลข FrontierSWE การประเมินนี้รันกับโมเดลที่ Proximal มีสิทธิ์เข้าถึงภายใต้ข้อตกลงบางอย่าง; มันบอกคุณว่าโมเดลทำอะไรได้ ไม่ใช่สิ่งที่คุณจะได้ใช้ นอกจากนี้ยังหมายความว่าตัวเลขประสิทธิภาพมีครึ่งชีวิตที่สั้นกว่าปกติ โมเดลที่ยังไม่ GA ยังเปลี่ยนแปลงได้ — การตั้งค่าการถอดรหัส, system prompt, ค่าเริ่มต้นการใช้เครื่องมือ และโครงความปลอดภัย ยังอยู่ระหว่างการปรับแต่งทั้งหมด และเหตุผลที่ระบุว่าอัตราการแฮิตแคชของ Argon ต่ำ ก็คือผู้ประเมินไม่ได้รันด้วยคอนฟิกูเรชันโปรดักชันนั่นเอง คาดว่าตัวเลข 55.0% และ $129.36 จะเปลี่ยนแปลง

อะไรจะเปลี่ยนภาพนี้: ID โมเดลที่เผยแพร่แล้วพร้อมตารางราคา วันที่เปิดให้ใช้ทั่วไป (GA) การรัน FrontierSWE ซ้ำภายใต้การตั้งค่าโปรดักชัน และผู้ประเมินอิสระรายที่สองที่ทำซ้ำผลลัพธ์อันดับที่สามได้ จนกว่าอย่างน้อยสองข้อแรกนั้นจะปรากฏ ให้ถือว่าตัวเลข Argon ทุกตัว — รวมถึงตัวเลขที่ดีในแผนภูมิของ Google เอง — เป็นข้อมูลเบื้องต้น

A capture of the Google DeepMind blog post announcing Gemini 4 Argon, dated 2026-09-30, credited to Koray Kavukcuoglu, with a standfirst describing frontier performance in complex workflows, cyber defense and software engineering and a benchmark chart whose FrontierSWE v2 row lists GPT-6 Astra, Claude Fable 5.1 and Claude Opus 5.5 but omits Gemini 4 Argon.

การวิเคราะห์บุคลิกภาพเป็นส่วนที่จะคงอยู่ได้ดีที่สุดเมื่อเวลาผ่านไป

คะแนน Benchmark ของโมเดล pre-GA มีอายุการใช้งานนับเป็นสัปดาห์ แต่ข้อสังเกตเชิงพฤติกรรมไม่เป็นเช่นนั้น งานเอเจนต์ระยะยาวเป็นที่ที่อุปนิสัยของโมเดลปรากฏให้เห็นจริง ๆ เพราะงบเวลา 20 ชั่วโมงกับ 34 งานนั้นเป็นเชือกที่ยาวพอให้แนวโน้มของโมเดลทบต้นกัน: มันฟื้นตัวจากแนวทางที่ล้มเหลวอย่างไร หยุดเพื่อวางแผนใหม่หรือไม่ และแยกความแตกต่างระหว่างปัญหาที่ยากกับการเดินผิดทางได้หรือไม่ ผู้ประเมินที่ดูเทรซเหล่านี้จำนวนมากแล้วอธิบายโมเดลว่าวิจารณ์ตัวเองและมีแนวโน้มจะอุทานเมื่อบางอย่างได้ผล กำลังอธิบายโมเดลที่แสดงเหตุผลเกี่ยวกับความคืบหน้าของตัวเองออกมาภายนอก นั่นคือสมมติฐานว่าทำไมผลการรันของ Argon จึงกระจายจาก 44.5% ถึง 64.3% — ซึ่งเป็นช่วงที่กว้างกว่าของ Opus 5.5 — และสามารถทดสอบได้เมื่อโมเดลพร้อมให้เรียกใช้

อีกครึ่งหนึ่งของคำกล่าวคือส่วนที่ควรตั้งข้อกังขา “การปรับปรุงครั้งใหญ่เมื่อเทียบกับ Gemini รุ่นก่อน ๆ” เป็นการเปรียบเทียบกับโมเดลที่ไม่เคยถูกให้คะแนนบนเกณฑ์มาตรฐานนี้ภายใต้ชุดทดสอบนี้ จึงไม่อาจตรวจสอบเทียบกับตารางอันดับได้เลย มันเป็นเพียงความรู้สึกส่วนตัว และควรถือเป็นเช่นนั้น ไม่ว่าผู้ที่เสนอความเห็นนี้จะน่าเชื่อถือเพียงใด

A capture of the FrontierSWE public leaderboard showing ten models ranked by mean at 5. GPT-6 Astra leads at 65.5 percent, Claude Opus 5.5 second at 62.3 percent, Gemini 4 Argon third at 55.0 percent with a spread of 9.9, followed by GLM-5.3, Grok 4.7, Kimi K3, Qwen3.8-Max, DeepSeek V4 Flash Vision Exp, Muse Spark 1.2 and Inkling, with per-trial average cost and time columns and a footnote that Gemini 4 Argon's cache hit rate is much lower due to a non-production setting.

แล้วสิ่งนี้ทำให้คุณอยู่ตรงไหน หากคุณต้องการเอเจนต์ระยะยาวจริง ๆ ในวันนี้

คุณไม่สามารถเรียก Gemini 4 ว่า Argon ได้ ดังนั้นคำถามในทางปฏิบัติจึงไม่ใช่ Argon กับอะไรก็ตาม — แต่เป็นว่ารุ่นไหนที่คุณควรใช้สำหรับงานที่ Argon ถูกนำมาเป็นเกณฑ์วัด การจัดอันดับของ FrontierSWE เองตอบคำถามนี้ว่า GPT-6 Astra อยู่อันดับต้นของบอร์ดที่ 65.5% แต่ราคา $1,029.65 ต่อการทดลอง ซึ่งประมาณสิบเท่าของค่าใช้จ่ายของสองรุ่นที่อยู่ต่ำกว่า ขณะที่ Claude Opus 5.5 ให้ 62.3% ในราคา $98.87 ตัวเลือกที่คุ้มค่าบนเกณฑ์วัดนี้คือ Opus 5.5 และยังเป็นรุ่นที่เอาชนะ Argon บน Artificial Analysis ด้วยต้นทุนต่องานที่ต่ำกว่า

ทั้งสองโมเดลนั้น และโมเดลส่วนใหญ่ในสิบอันดับแรกของบอร์ด — อาทิ GLM-5.3, Grok 4.7, Kimi K3, Qwen3.8-Max, DeepSeek V4 Flash Vision Exp และ Muse Spark 1.2 — ล้วนเข้าถึงได้ผ่าน API เดียวของ OrcaRouter พร้อมกับอีกกว่า 200 ราย — คีย์เดียว ไม่บวกราคา 0% ดังนั้นราคาที่ผู้ให้บริการระบุไว้คือราคาที่คุณจ่าย และเมื่อผู้ขายลดราคา ส่วนลดนั้นก็มาถึงฝั่งเราในวันเดียวกัน คุณสมบัติข้อหลังนี้มีค่ามากกว่าปกติสำหรับโมเดลก่อน GA: หากราคาของ Argon เปลี่ยนไประหว่างนี้จนถึง GA ซึ่งเชิงอรรถเรื่องแคชที่ไม่ใช่โปรดักชันชี้ว่าอาจเป็นเช่นนั้นได้ การผสานรวมของคุณก็ไม่มีการเปลี่ยนแปลงใด ๆ เมื่อถึงตอนนั้น การสลับไปใช้ระบบสำรองอัตโนมัติคืออีกส่วนที่ลงตัวกับกรณีเฉพาะนี้ — โมเดลที่ไม่คุ้นเคยซึ่งยังไม่มีใครแมปโหมดความล้มเหลวของมันไว้เลย คือสิ่งที่คุณไม่ต้องการอย่างยิ่งบนเส้นทางโปรดักชันที่ฮาร์ดโค้ดไว้เพียงเส้นทางเดียว

เพื่อให้ชัดเจนในเรื่องหนึ่ง: Gemini 4 Argon ไม่ได้อยู่ในแคตตาล็อกของเรา การค้นหาผ่าน API โมเดลสาธารณะของเราสำหรับ google/gemini-4-argon ส่งคืน "model not found" และไม่มีใครอื่นให้บริการโฮสต์มันเช่นกัน — มันถูกกักอยู่หลังโปรแกรม Fairwind ของ Google โดยไม่มีการเผยแพร่รหัสโมเดล เมื่อวันหนึ่งมันเรียกใช้งานได้ เราจะจัดเส้นทางให้ และตัวเลข FrontierSWE ข้างต้นคือเหตุผลที่ควรจับตาดูวันนั้น มากกว่าจะรออยู่เฉย ๆ โมเดลที่มันพ่ายแพ้ให้ก็มีอยู่ตรงนั้นแล้ว

ดูอะไรดี

สัญญาณที่จะเปลี่ยนเรื่องนี้จากสิ่งที่เรารู้กันถึงตอนนี้ให้กลายเป็นการตัดสินใจนั้นมีความเฉพาะเจาะจง หมายเลขโมเดลที่เผยแพร่แล้วและอัตราค่าบริการของมัน วันที่พร้อมให้บริการทั่วไป การรัน FrontierSWE ซ้ำภายใต้การตั้งค่าสภาพแวดล้อมการผลิต ซึ่งจะช่วยคลี่คลายว่าต้นทุน $129.36 ต่อการทดลองหนึ่งครั้งเป็นอัตราจริงหรือเป็นสิ่งประดิษฐ์ที่เกิดจากการกำหนดค่าแคชที่ Proximal ชี้ให้เห็น และในอุดมคติแล้ว ผู้ประเมินรายที่สองที่เผยแพร่ร่องรอย Argon เพื่อให้การสังเกต "Eureka!" ไม่ใช่ตัวอย่างจากเพียงหนึ่งเดียวอีกต่อไป

จนถึงตอนนั้น สรุปที่ตรงไปตรงมาก็ยังแคบและควรค่าแก่การยึดถือไว้: Gemini 4 Argon ถูกประกาศออกมาแล้ว มันแสดงออกได้อย่างโดดเด่นผิดปกติในเทรซของเอเจนต์ระยะยาว ตามความเห็นของผู้ประเมินรายหนึ่ง และบนเบนช์มาร์กอิสระเพียงแห่งเดียวที่เราตรวจสอบได้ มันจบอันดับสามตามหลังสองโมเดล — โดยหนึ่งในนั้นเอาชนะมันได้ทั้งคะแนนและต้นทุนในเวลาเดียวกัน

การเปรียบเทียบในบทความนี้1

ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube