
GPT-Live-1 ขึ้นอันดับหนึ่งใน Speech to Speech Index ด้วยคะแนน 81.5 — แต่การจัดอันดับนั้นเป็นของแบ็กเอนด์เบื้องหลัง
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0345ความฉลาด76การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
GPT-Live-1 โมเดลเสียงแบบฟูลดูเพล็กซ์ที่เปิดตัวครั้งแรกภายใน ChatGPT เมื่อวันที่ 8 กรกฎาคม 2026 ตอนนี้อยู่อันดับหนึ่งบนดัชนี Speech to Speech ของ Artificial Analysis ด้วยคะแนน 81.5 — แถวที่ดำรงอยู่ได้เพียงเพราะโมเดลนี้ถูกกำหนดให้ใช้ GPT-6 Astra เป็นตัวคิด หากรันส่วนหน้าเสียงเดียวกันโดยใช้ GPT-5.6 Sol เป็นแบ็กเอนด์ที่ได้รับมอบหมายในโหมดใช้ความสามารถในการให้เหตุผลต่ำ จะได้คะแนน 80.1 ซึ่งอยู่อันดับสาม อันดับสอง ด้วยคะแนน 81.3 เป็นของ Grok Voice Think Fast 2.0 High
สองเรื่องที่ต้องพูดกันตรง ๆ ก่อนถึงตัวเลข โมเดลนี้ไม่ใช่ของใหม่: GPT-Live-1 เปิดให้ใช้บน developer API เมื่อวันที่ 10 กันยายน 2026 หลังจากเป็นเสียงเริ่มต้นของ ChatGPT มาสองเดือน สิ่งที่ใหม่ ซึ่งวัดเมื่อวันที่ 15 กันยายน คือมีผู้ประเมินจากภายนอกให้คะแนนมันแล้ว — สิ่งเดียวที่ขาดหายไปจากงานเขียนถึงโมเดลนี้ทุกชิ้นจนถึงตอนนี้ รวมถึงของเราเอง ซึ่งตัวเลขเดียวที่มีให้ใช้คือตัวเลขที่ OpenAI เผยแพร่เกี่ยวกับตัวเอง และส่วนต่าง 0.2 จุดที่นำอันดับสองนั้นเล็กกว่าช่องว่าง 1.4 จุดระหว่างการตั้งค่าสองแบบของ GPT-Live-1 เอง ซึ่งเป็นตัวเลขที่มีประโยชน์ที่สุดบนกระดานคะแนน
ดังนั้นพาดหัวที่ว่า "GPT-Live-1 เป็นโมเดลเสียงที่ดีที่สุด" จึงไม่ตรงกับสิ่งที่ดัชนีระบุเสียทีเดียว ดัชนีบอกว่า GPT-Live-1 ที่ใช้ GPT-6 Astra ในระดับความพยายามปานกลางเป็นฝ่ายนำอยู่หนึ่งในห้าของคะแนน และการเลือกแบ็กเอนด์ส่งผลต่อผลลัพธ์มากกว่าที่โมเดลคู่แข่งตัวใดก็ตามทำได้
ดัชนีวัดอะไรจริงๆ
Artificial Analysis สร้าง Speech to Speech Index ขึ้นจากองค์ประกอบถ่วงน้ำหนักเท่ากันสี่ส่วน ได้แก่ Speech Reasoning ซึ่งวัดด้วย Big Bench Audio; Agentic Performance ซึ่งวัดด้วย τ-Voice; Arena Preference ซึ่งเป็น Elo ความชอบของมนุษย์แบบจับคู่; และ Task Success Rate เฉพาะโมเดลที่มีองค์ประกอบครบทั้งสี่เท่านั้นจึงจะได้ค่าดัชนี — ส่วนอื่น ๆ จะแสดงเป็นขีด ซึ่งเป็นเหตุผลว่าทำไมตารางจึงมีแถวมากกว่าคะแนนอย่างมาก ดัชนีนี้เปิดตัวเมื่อวันที่ 23 มิถุนายน 2026 และได้รับการแก้ไขสองครั้งนับตั้งแต่นั้น โดยครั้งล่าสุดเปลี่ยน Conversational Dynamics ออกและใช้ Task Success แทน ดังนั้นคะแนนจากการแก้ไขครั้งหนึ่งจึงไม่สามารถเปรียบเทียบกับคะแนนจากการแก้ไขอีกครั้งหนึ่งได้อย่างเคร่งครัด
มีรายละเอียดด้านระเบียบวิธีอีกสองข้อที่สำคัญเมื่อคุณอ่านการจัดอันดับ Arena Elo ถูกตรึงไว้ที่ค่าตอนที่โมเดลหนึ่งกลายเป็นเผยแพร่ได้เป็นครั้งแรก ดังนั้นองค์ประกอบด้านความชอบจึงให้รางวัลกับการมาถึงก่อน มากกว่าการเป็นโมเดลที่ดีที่สุดในปัจจุบัน และดัชนีให้คะแนนทั้งระบบไม่ใช่โมเดลเดียว: สำหรับ GPT-Live-1 ตัวเลขนั้นครอบคลุมทั้งส่วนหน้าเสียง (voice front end) บวกกับโมเดลแบ็กเอนด์ใดก็ตามที่ระบบส่งงานไปให้ นั่นคือทางเลือกการออกแบบโดยเจตนา และเป็นเหตุผลว่าทำไมโมเดลเดียวกันจึงปรากฏสองครั้งด้วยคะแนนที่ต่างกัน
สุดยอดของวงการ ตามที่เผยแพร่:
• GPT-Live-1 (Astra, ขนาดกลาง) — ดัชนี 81.5, ที่หนึ่ง
• Grok Voice Think Fast 2.0 High — ดัชนี 81.3, อันดับที่สอง
• GPT-Live-1 (Sol, ต่ำ) — ดัชนี 80.1, อันดับสาม
• GPT-Realtime-2.1 High — ดัชนี 73.9 เป็นอันดับที่สี่
• GPT-Realtime-2 High — ดัชนี 73.6, อันดับที่ห้า
• Grok Voice Think Fast 1.0 — ดัชนี 72.3, ลำดับที่หก
• Gemini 3.1 Flash Live High — ดัชนี 71.5, ที่เจ็ด

เพื่อให้เห็นภาพ โมเดลที่ GPT-Live-1 เข้าแทนที่นั้นต่ำกว่ามันอยู่ 7.6 จุด นี่คือช่องว่างระหว่างรุ่นที่แท้จริง และไม่เป็นที่โต้แย้ง
ชัยชนะ 0.2 คะแนนมาจากองค์ประกอบเพียงหนึ่งเดียวเท่านั้น
พอแยกคอมโพสิตออก ผู้นำสองรายก็ไม่ดูเป็นโมเดลประเภทเดียวกันอีกต่อไป ในส่วนขององค์ประกอบต่างๆ ตามข้อมูลจาก Artificial Analysis:
• ประสิทธิภาพแบบเอเจนต์ (τ-Voice) — GPT-Live-1 67.9% เทียบกับ Grok Voice Think Fast 2.0 High 56.5%
• การใช้เหตุผลด้านเสียงพูด (Big Bench Audio) — 90% เทียบกับ 97%
• อัตราความสำเร็จของงาน — 87.4% เทียบกับ 94.6%
• อารีนา Elo — 1048 กับ 1011
• เวลาถึงเสียงแรก — 1.34s vs 0.70s
• ค่าใช้จ่ายต่อชั่วโมง รวมระบบหลังบ้าน — $5.83 เทียบกับ $4.80

GPT-Live-1 ชนะสองจากหกบรรทัดและแพ้สี่ แต่กลับได้ที่หนึ่งในดัชนี การคำนวณไม่ใช่เรื่องลึกลับ: ช่องว่าง τ-Voice อยู่ที่ 11.4 คะแนน มากกว่าความแตกต่างอื่นใดในตารางอย่างมาก และเมื่อให้น้ำหนักเท่ากัน มันก็ดึงคะแนนรวมให้ข้ามเส้นไป พูดง่าย ๆ คือ GPT-Live-1 เป็นเอเจนต์ที่ดีกว่า และ Grok Voice Think Fast 2.0 High เป็นผู้ฟังที่ดีกว่าและเร็วกว่า และดัชนีก็บังเอิญให้น้ำหนักกับสิ่งที่ GPT-Live-1 เก่งมากพอที่จะทำให้มันเป็นที่หนึ่ง
หากผลิตภัณฑ์ของคุณเป็น voice agent ที่จอง แก้ไข หรือทำธุรกรรม คะแนนนำ 11.4 จุดของ τ-Voice คือตัวเลขที่ทำนายประสบการณ์ของคุณ หากผลิตภัณฑ์ของคุณคือบทสนทนาที่ต้องให้ความรู้สึกรวดเร็วทันใจและไม่พูดทับผู้ใช้ เวลา 0.70 วินาทีถึงเสียงแรกคือตัวเลขที่ทำนายประสบการณ์ของคุณ และ Grok ชนะในเรื่องนี้ด้วยปัจจัยประมาณสองเท่า ในการดำเนินงานตามงานที่อยู่ภายใต้การกำกับดูแล มีคำเตือนที่สอง: อัตราความสำเร็จของงาน 94.6% ของ Grok สูงที่สุดในตารางที่มองเห็น และ 87.4% ของ GPT-Live-1 หมายความว่าประมาณหนึ่งในแปดของงานไม่เสร็จสมบูรณ์ ทั้งคู่เป็นการปรับปรุงเมื่อเทียบกับรุ่นก่อนหน้า ไม่มีอันใดเป็นปัญหาที่แก้ไขแล้ว
แถว #1 เป็นการตั้งค่าเราเตอร์ (routing configuration) ไม่ใช่โมเดล
นี่คือส่วนที่ควรได้รับความสนใจมากกว่าอันดับบนลีดเดอร์บอร์ด GPT-Live-1 เป็นเลเยอร์เสียงแบบฟูลดูเพล็กซ์ที่จัดการการฟัง การพูด การขัดจังหวะ และการผลัดกันพูดด้วยตัวเอง และมอบหมายการให้เหตุผล การเรียกใช้เครื่องมือ และการค้นหาให้กับโมเดลแบ็กเอนด์แยกต่างหากในขณะที่บทสนทนายังดำเนินต่อไป Artificial Analysis ให้คะแนนการจับคู่สองรูปแบบนั้นเป็นรายการแยกกัน Astra ที่ความพยายามระดับกลางทำคะแนนได้ 81.5 Sol ที่ความพยายามระดับต่ำทำคะแนนได้ 80.1
ส่วนต่าง 1.4 จุดนั่นแหละคือเรื่องทั้งหมด ช่องว่างระหว่างอันดับหนึ่งกับอันดับสองคือ 0.2 จุด ช่องว่างระหว่างการกำหนดค่าที่ได้คะแนนสองแบบของ GPT-Live-1 นั้นใหญ่กว่าเจ็ดเท่า ไม่มีอะไรเกี่ยวกับโมเดลเสียงเปลี่ยนไประหว่างแถวเหล่านั้น — มีเพียงว่าโมเดลไหนเป็นตัวคิด และคิดด้วยระดับความพยายามเท่าไร ลีดเดอร์บอร์ดที่จัดอันดับระบบกำลังบอกคุณอย่างแม่นยำว่า การกำหนดค่าคือตัวผลิตภัณฑ์
มันยังแก้ไขรายงานของเราเองอีกด้วย เมื่อวันที่ 11 กันยายน 2026 เราบันทึก GPT-Live-1 ไว้ที่ 69.8% ในดัชนีนี้ เป็นรองทั้ง GPT-Realtime-2.1 และ Grok นั่นคือค่าที่อ่านได้ซึ่งมีอยู่ในขณะนั้น และมันสนับสนุนข้อสรุปที่สมเหตุสมผล — ว่า OpenAI สร้างกลไกการสนทนาที่ดีที่สุด ไม่ใช่วอยซ์เอเจนต์ที่ดีที่สุด ตอนนี้ดัชนีมีคอนฟิกูเรชัน GPT-Live-1 แบบ delegated สองรายการที่ 81.5 และ 80.1 Artificial Analysis ไม่เผยแพร่ changelog และได้ปรับแก้ส่วนประกอบของดัชนีไปเมื่อเดือนสิงหาคม ดังนั้นเราจึงไม่อาจกล่าวได้อย่างแน่ชัดว่าตัวเลขก่อนหน้านั้นเป็นการกำหนดค่าที่ไม่ได้ให้คะแนนหรือให้คะแนนบางส่วน หรือเป็นการรันภายใต้น้ำหนักแบบเก่า สิ่งที่สังเกตได้คือการจับคู่แบบ delegated ตอนนี้ปรากฏเป็นแถวที่สมบูรณ์ของตัวเอง และคำตอบก็เปลี่ยนไปเมื่อสิ่งเหล่านั้นเกิดขึ้น
ผลที่ตามมาในทางปฏิบัติก็คือ "โมเดลเสียงตัวไหน" เป็นคำถามที่ผิด และ "โมเดลเสียงตัวไหน บวกกับแบ็กเอนด์ตัวไหน ที่ระดับความพยายามเท่าไร" ต่างหากที่เป็นคำถามที่ถูกต้อง นั่นคือคำถามเรื่องการจัดเส้นทาง และเป็นคำถามที่ผลิตภัณฑ์ของเราเองถูกสร้างขึ้นมาเพื่อตอบ OrcaRouter เปิดให้เข้าถึงแบ็กเอนด์สำหรับมอบงานต่อของ GPT-Live-1 ซึ่งก็คือ GPT-6 Astra ผ่านปลายทางที่รองรับ OpenAI-compatible แห่งเดียวกับโมเดลอื่นอีกกว่า 200 โมเดล ดังนั้นการสลับชั้นการคิดจึงเป็นการเปลี่ยนเพียง ID ของโมเดล ไม่ใช่การอินทิเกรชัน DSL สำหรับจัดเส้นทาง ช่วยประกอบโมเดลหลายตัวให้เป็นการเรียกครั้งเดียว และการสลับสำรองอัตโนมัติหมายความว่าการจับคู่ที่ยังไม่ได้พิสูจน์ไม่ใช่การเดิมพันในระดับโปรดักชัน — หากแบ็กเอนด์มีประสิทธิภาพลดลง คำขอจะไปลงที่อื่นแทนที่จะล้มเหลว เพื่อให้ชัดเจนถึงสิ่งที่เราไม่ได้ทำ: ตัว GPT-Live-1 เองไม่ได้อยู่ในแค็ตตาล็อกของเรา และเราไม่ได้ให้บริการมัน ส่วนแบ็กเอนด์ที่มันมอบงานต่อให้นั้นเป็นอีกเรื่องหนึ่ง
หนึ่งชั่วโมงของสิ่งนี้มีค่าใช้จ่ายเท่าไร
ฟรอนต์เอนด์ของ GPT-Live-1 คิดค่าบริการที่ $0.05 ต่อนาทีเสียง โดยคิดเป็นรายวินาที ซึ่งเท่ากับ $3.00 สำหรับการเปิดสายหนึ่งชั่วโมง นั่นไม่ใช่บิลทั้งหมด: การให้เหตุผลที่มอบหมาย การเรียกใช้เครื่องมือ และการค้นหาเว็บจะถูกคิดค่าบริการแยกกันตามอัตราที่โมเดลแบ็กเอนด์เรียกเก็บ Artificial Analysis วัดตัวเลขรวมทุกอย่างไว้ ซึ่งเป็นเหตุผลว่าคอลัมน์ค่าใช้จ่ายของมันคือคอลัมน์ที่ควรใช้:
• GPT-Live-1 (Sol, low) — $4.47 ต่อชั่วโมง
• Grok Voice Think Fast 2.0 High — 4.80 ดอลลาร์ต่อชั่วโมง
• GPT-Live-1 (Astra, medium) — $5.83 ต่อชั่วโมง
• GPT-Realtime-2.1 High — $10.75 ต่อชั่วโมง
ผู้ชนะอันดับในการจัดอันดับคือตัวเลือกที่แพงที่สุดในบรรดาสามตัวเลือกปัจจุบัน และการตั้งค่าที่ชนะนั้นมีค่าใช้จ่ายต่อชั่วโมงสูงกว่าการตั้งค่าที่ได้อันดับสามอยู่ 30% เมื่อมองอีกทาง การแบ่งสัดส่วนนี้ให้ข้อมูลที่เป็นประโยชน์: ทุก ๆ ชั่วโมง 3.00 ดอลลาร์เป็นเลเยอร์เสียง และส่วนที่เหลือ — 1.47 ดอลลาร์บน Sol, 2.83 ดอลลาร์บน Astra — เป็นโทเค็นแบ็กเอนด์ เลเยอร์การคิดอยู่ที่ประมาณหนึ่งในสามถึงครึ่งหนึ่งของบิลของคุณ ซึ่งถือเป็นสัดส่วนที่มากสำหรับองค์ประกอบที่ลีดเดอร์บอร์ดมองเป็นเพียงเชิงอรรถ

เมื่อเทียบกับโมเดลที่มันเข้าแทนที่ ทั้งตระกูลมีราคาถูกกว่าประมาณครึ่งหนึ่ง — ส่วนหน้าบ้านที่คิดราคานาทีละ $0.05 เป็นการลดราคาจริง ไม่ใช่แค่การรีแพ็กเกจ เนื่องจากโทเค็นฝั่งแบ็กเอนด์คิดค่าบริการในอัตราของแบ็กเอนด์ ต้นทุนของการดีพลอย GPT-Live-1 จึงขึ้นอยู่กับว่าเราเลือกเส้นทางไปยังโมเดล reasoning ตัวใดเป็นหลัก และแบ็กเอนด์จะเป็นโมเดลของ OpenAI เองหรือของบุคคลที่สามก็ได้ บน OrcaRouter แบ็กเอนด์เหล่านั้นถูกส่งต่อในราคาตามที่ผู้ให้บริการประกาศไว้ โดยบวกกำไร 0% ดังนั้นหากผู้ขายปรับราคาในชั้นการคิดวิเคราะห์ การเปลี่ยนแปลงจะมีผลในวันเดียวกัน แทนที่จะเป็นรอบบิลถัดไป
สิ่งที่ดัชนีไม่ได้ชี้ขาด
ข้อควรระวังสามข้อ ที่แหล่งข้อมูลระบุไว้เอง ไม่ใช่การอนุมานเอาเอง ทั้งรายการ GPT-Live-1 และ Grok Voice Think Fast 2.0 High ถูกระบุว่าอิงจากการทดลองเพียงครั้งเดียว ซึ่งถือว่าน้อยเกินไปสำหรับการตัดสินใจที่ต่างกันเพียง 0.2 คะแนน — การรันซ้ำอาจสลับอันดับหนึ่งกับอันดับสอง โดยไม่มีอะไรเปลี่ยนแปลงเกี่ยวกับโมเดลทั้งสองเลย Arena Elo ตามที่ระบุไว้ ถูกตรึงไว้ที่ผลการวัดครั้งแรกที่เผยแพร่ได้ของแต่ละโมเดล และดัชนีนี้ไม่มีรายการสำหรับพฤติกรรมของระบบเหล่านี้ในการสนทนาเสียงแบบยาว: องค์ประกอบต่างๆ ถูกออกแบบให้เป็นระยะสั้นโดยโครงสร้าง ขณะที่โหมดความล้มเหลวที่ฆ่าเอเจนต์เสียงในการใช้งานจริงได้จริงคือการดริฟต์ตลอดบทสนทนายาว 20 นาที
แยกต่างหาก และมาจากผู้ขายโดยตรง plutôt กว่า จากดัชนี: API ของ GPT-Live-1 เปิดตัวโดยไม่มีอินพุตรูปภาพหรือวิดีโอ ไม่มีเอาต์พุตแบบมีโครงสร้าง และไม่มีแพ็กเกจฟรี อีกทั้งขีดจำกัดอัตราการใช้งานนับเป็นเซสชันที่ทำงานพร้อมกัน ไม่ใช่จำนวนคำขอต่อนาที ทั้งหมดนี้เป็นข้อจำกัดในวันเปิดตัวที่อาจเปลี่ยนแปลงไปแล้ว ตรวจสอบก่อนที่คุณจะออกแบบโดยอิงกับสิ่งเหล่านี้
จะทำอะไรกับสิ่งนี้ดี
หากสัปดาห์นี้คุณกำลังเลือกสถาปัตยกรรม ไม่ใช่เลือกโมเดล ดัชนีจะให้คะแนนแก่รูปแบบการมอบหมายงานในงานแบบเอเจนต์ และให้คะแนนแก่รูปแบบคาสเคดในด้านความหน่วง GPT-Live-1 ที่ 81.5 เป็นหลักฐานที่หนักแน่นที่สุดเท่าที่มีมาว่า การแยกบทสนทนาออกจากกระบวนการคิดวิเคราะห์คือโครงสร้างที่ถูกต้องสำหรับเอเจนต์เสียงที่ทำงานจนสำเร็จ ส่วน Grok Voice Think Fast 2.0 High ที่ 81.3 ด้วยเวลา 0.70 วินาทีถึงเสียงแรกและอัตราความสำเร็จของงาน 94.6% เป็นหลักฐานที่หนักแน่นที่สุดว่าโครงสร้างแบบมอบหมายงานไม่ใช่โครงสร้างเดียวที่ได้ผล — และยังไม่ใช่โครงสร้างที่เร็วที่สุดด้วย
การตัดสินใจที่ตามมาจากตัวเลขนั้นถูกกว่าที่ดูไว้ ทั้งสองคอนฟิกูเรชันของ GPT-Live-1 และโมเดลที่เอาชนะมันได้ในสี่จากหกองค์ประกอบ อยู่ในช่วงห่างกันไม่เกิน $1.36 ต่อชั่วโมง เมื่อส่วนต่างเป็นเช่นนี้ สิ่งที่ควรทำคือเลิกอ่านลีดเดอร์บอร์ด แล้วลองรันทรานสคริปต์ของคุณเองผ่านทั้งสองแบบ ดัชนีบอกคุณถึงรูปร่างของข้อแลกเปลี่ยน แต่มันบอกไม่ได้ว่าผู้ใช้ของคุณอยู่ฝั่งไหนของข้อแลกเปลี่ยนนั้น
คำถามที่ตัวเลขเชิญชวนให้ตั้ง
GPT-Live-1 เป็นโมเดลเสียงที่ดีที่สุดในตอนนี้แล้วหรือยัง
หากดูที่คะแนนรวม ใช่ — นำอยู่ 0.2 คะแนน และมีเพียงการทดลองครั้งเดียวรองรับเท่านั้น หากดูรายองค์ประกอบ ทุกอย่างขึ้นอยู่กับว่าคุณกำลังสร้างอะไร: มันนำในด้านประสิทธิภาพแบบเอเจนต์และความชื่นชอบในอารีนา และตามหลังในด้านการให้เหตุผลด้านเสียง อัตราความสำเร็จของงาน และเวลาถึงเสียงแรก การนำด้วยคะแนนรวม 0.2 คะแนนซึ่งอาศัยความได้เปรียบจากองค์ประกอบเดียว 11.4 คะแนนนั้นเป็นที่หนึ่งที่ป้องกันไว้ได้ ไม่ใช่ที่หนึ่งที่ชี้ขาด
คุณจำเป็นต้องใช้ GPT-6 Astra ถึงจะได้ 81.5 หรือเปล่า
สำหรับแถวนั้นโดยเฉพาะ ใช่ — ค่า 81.5 เป็นของ GPT-Live-1 ที่ตั้งค่าให้ใช้ Astra ที่ระดับความพยายามในการให้เหตุผลปานกลาง Sol ที่ระดับความพยายามต่ำเป็นทางเลือกที่มีการบันทึกไว้ที่ 80.1 และถูกกว่าชั่วโมงละ 1.36 ดอลลาร์ และ OpenAI รองรับการนำโมเดลของบุคคลที่สามมาใช้เป็นแบ็กเอนด์ ดังนั้นรายการบนกระดานผู้นำจึงเป็นเพียงสองจุดบนเส้นโค้ง ไม่ใช่ตัวเลือกเดียวที่มี การจับคู่แบบไหนดีที่สุดสำหรับภาระงานของคุณ ไม่ใช่สิ่งที่ดัชนีสาธารณะจะตอบแทนคุณได้
ทำไมโมเดลเดียวกันถึงได้คะแนน 69.8 ในการรายงานของเราก่อนหน้านี้ และ 81.5 ในตอนนี้
ตัวเลขสองตัวนี้ครอบคลุมสิ่งที่ต่างกัน การอ่านครั้งก่อนวาง GPT-Live-1 ไว้บนดัชนีเป็นรายการเดียว ตารางปัจจุบันแสดงการกำหนดค่าที่ได้รับมอบหมายสองแบบของมันเป็นแถวที่มีการให้คะแนนครบถ้วนแยกจากกัน โดยคู่ Astra อยู่ที่ 81.5 และคู่ Sol อยู่ที่ 80.1 Artificial Analysis ได้ปรับแก้องค์ประกอบของดัชนีในเดือนสิงหาคมและไม่เผยแพร่บันทึกการเปลี่ยนแปลง ดังนั้นให้ถือว่าส่วนต่างนี้เป็นการเปลี่ยนแปลงในสิ่งที่ถูกวัด มากกว่าจะเป็นหลักฐานว่าโมเดลดีขึ้น และให้ถือว่าคะแนนรวมค่าเดียวใด ๆ สำหรับโมเดลที่มอบหมายงาน เป็นข้อความเกี่ยวกับการกำหนดค่าแบบหนึ่ง
