
GPT-6 Astra Ultrafast รันบน Blackwell: NVIDIA ระบุชื่อฮาร์ดแวร์ที่อยู่เบื้องหลัง 8x
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 223 tok/s
- OpenAIใหม่OpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- Anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIใหม่Grok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 125 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
เมื่อวันที่ 1 ตุลาคม 2026 NVIDIA ได้เผยแพร่โพสต์โดย Dion Harris ชื่อ "How NVIDIA GPUs Help Accelerate OpenAI's GPT-6 Astra Ultrafast" และประโยคที่เป็นแกนกลางของโพสต์นั้นถือเป็นครั้งแรกที่บริษัทใดบริษัทหนึ่งในสองแห่งนี้บอกว่าชั้นบริการนี้รันอยู่บนอะไร: "GPT-6 Astra Ultrafast ซึ่งรันบน NVIDIA Blackwell GPUs พร้อมใช้งานแล้วใน OpenAI API และสำหรับผู้ใช้ ChatGPT Work และ Codex ที่มีสิทธิ์" นั่นคือข่าว และมันแคบกว่าที่พาดหัวชวนให้คิด GPT-6 Astra ตัวโมเดล เปิดตัวเมื่อวันที่ 3 กันยายน 2026 ชั้นบริการ Ultrafast ที่อยู่เหนือโมเดลนี้เปิดให้ใช้อย่างกว้างขวางเมื่อวันที่ 29 กันยายน 2026 ข้ออ้างเรื่องความเร็ว — การสร้างโทเคนเร็วขึ้นสูงสุด 8 เท่าเมื่อเทียบกับโหมดมาตรฐานของ Astra — มีอายุสองวันแล้วในตอนที่ NVIDIA กล่าวซ้ำ
ซึ่งทำให้เกิดคำถามที่โพสต์นี้กำลังตอบอยู่จริง ๆ ไม่ใช่ "มันเร็วแค่ไหน" แต่เป็น "ซิลิคอนของใคร"

สามสิ่งที่โพสต์เพิ่มเข้ามาจริงๆ
ตัดส่วนที่พูดซ้ำออกไป แล้วโพสต์วันที่ 1 ตุลาคมก็จะให้ข้อเท็จจริงสามข้อ
• ฮาร์ดแวร์ — Blackwell เอกสาร Ultrafast ของ OpenAI เอง ซึ่งเผยแพร่เมื่อวันที่ 30 กันยายน อธิบายความเร็วของระดับนี้ การกำหนดค่า และขีดจำกัดอัตราการใช้งาน โดยไม่ได้ระบุชื่อ GPU ใดเลย ดังนั้นการอ้างอิงว่าเป็นชิปซิลิคอนจึงมีแหล่งที่มาเพียงแหล่งเดียวคือผู้จำหน่ายฮาร์ดแวร์ นั่นไม่ได้ทำให้ข้อกล่าวอ้างนั้นเป็นเท็จ แต่ทำให้มันเป็นการกล่าวอ้างของผู้จำหน่ายเกี่ยวกับอุปกรณ์ของตนเอง และควรติดป้ายกำกับว่าเป็นเช่นนั้น
• วิศวกรสองคนที่เปิดเผยชื่อ — Philippe Tillet หัวหน้าฝ่ายอินเฟอเรนซ์ของ OpenAI และ Uday Ruddarraju ประธานเจ้าหน้าที่ฝ่ายเทคโนโลยีด้านการประมวลผลของ OpenAI ทั้งคู่ให้สัมภาษณ์อย่างเปิดเผยว่าการเร่งความเร็วนั้นมาจากอะไร
• กลุ่มเป้าหมาย — "ผู้ใช้ ChatGPT Work และ Codex ที่มีสิทธิ์" ซึ่งกว้างกว่ากรอบที่จำกัดเฉพาะผู้ใช้ API ที่แพ็กเกจนี้เปิดตัวมาด้วย เอกสารของ OpenAI เองยังระบุว่า Ultrafast สำหรับ GPT-6 Astra "พร้อมให้ผู้ใช้ API ทุกคนใช้งานได้โดยมีขีดจำกัดอัตราต่ำ" และข้อแม้เรื่องขีดจำกัดต่ำนั้นก็ยังไม่ถูกยกเลิกอย่างเป็นทางการ
คำพูดทั้งสอง และเหตุใดจึงเป็นส่วนที่น่าสนใจ
ผลงานของ Tillet คือลูปมากกว่าเป็นเบนช์มาร์ก การลงทุนของ NVIDIA ในด้านเครื่องมือและเอกสาร เขากล่าวว่า "ได้ช่วยให้เราทำให้โมเดลของเรายอดเยี่ยมเป็นพิเศษในการเขียนโปรแกรม" และ Astra ก็สามารถ "เปลี่ยนความรู้นั้นให้เป็นเคอร์เนลประสิทธิภาพสูงที่ทำให้ฮาร์ดแวร์ของ NVIDIA น่าสนใจ" Ruddarraju พูดตรงกว่าเกี่ยวกับทิศทางของงานนี้: "เราใช้โมเดลภายในของเราเพื่อเพิ่มประสิทธิภาพการอนุมานบน GPU ของ NVIDIA"
เมื่ออ่านรวมกันแล้ว นั่นเป็นข้ออ้างเกี่ยวกับการนำไปใช้งานมากกว่าความสามารถ: โมเดลระดับแนวหน้าของ OpenAI ตอนนี้เก่งพอที่จะเขียนเคอร์เนล GPU จน OpenAI ใช้โมเดลเหล่านี้เพื่อปรับแต่งสแตกการให้บริการของตัวเองให้เหมาะสมยิ่งขึ้น ยังสอดคล้องกับส่วนหนึ่งในโพสต์ของ NVIDIA ที่ไม่เกี่ยวกับสัปดาห์เปิดตัวเลย — หัวข้อที่อ่านว่า "ปรับปรุงประสิทธิภาพอย่างต่อเนื่อง" ซึ่งโต้แย้งว่าอินเฟอเรนซ์ที่นำไปใช้งานแล้วจะเร็วขึ้นเรื่อย ๆ เพราะ OpenAI ยังคงนำโมเดลของตัวเองไปทำงานกับซอฟต์แวร์ NVIDIA ที่ระบบรันอยู่
ทั้งหมดนี้ไม่ใช่การวัด มันคือวิศวกรสองคนที่กำลังอธิบายกระบวนการหนึ่ง ซึ่งเผยแพร่โดยบริษัทที่ขาย GPU การตีความอย่างตรงไปตรงมาคือ กระบวนการนี้ดูสมเหตุสมผล เชื่อได้ง่าย และไม่อาจถูกพิสูจน์ว่าผิดได้จากภายนอก — ซึ่งก็เป็นจริงเช่นเดียวกันกับตัวเลขความเร็วทุกตัวในเรื่องนี้
Blackwell ตรงนี้ Cerebras ตรงนั้น
ประโยชน์ที่สุดของโพสต์นี้คือการเผยให้เห็นความไม่สอดคล้องที่ไม่มีใครอธิบายไว้ เมื่อวันที่ 13 สิงหาคม 2026 OpenAI ได้เปิดให้เห็นตัวอย่างระดับเร็วบนโมเดลอื่น — GPT-5.6 Sol ที่ทำงานเร็วขึ้น "สูงสุด 14×" — และระบุชื่อ Cerebras เป็นพันธมิตรเบื้องหลัง โดยอธิบายถึงฮาร์ดแวร์ระดับเวเฟอร์ที่สร้างโทเคนเอาต์พุตได้สูงสุด 750 โทเคนต่อวินาที เจ็ดสัปดาห์ต่อมา ระดับเร็วบน Astra ทำงานบน Blackwell และตัวเลขคือ 8x
สองระดับที่รวดเร็ว คำตอบด้านฮาร์ดแวร์สองแบบ โดยแบบหนึ่งเป็นพันธมิตรผู้เชี่ยวชาญ และอีกแบบเป็นซัพพลายเออร์รายใหญ่ที่สุดของบริษัทเอง ไม่มีผู้จำหน่ายรายใดเผยแพร่การเปรียบเทียบระหว่างเส้นทางการให้บริการทั้งสอง และไม่มีผู้ประเมินอิสระรายใดวัดผลทั้งสองเส้นทางนี้ ขอสังเกตด้วยว่าโพสต์ของ NVIDIA ทำอะไรกับชื่อที่สอง: "Rubin" ปรากฏเพียงครั้งเดียว ภายในคำพูดของ Tillet เกี่ยวกับโมเดลที่เขียนเคอร์เนลสำหรับ "Blackwell and Rubin GPUs" นั่นเป็นข้อความเกี่ยวกับสิ่งที่โมเดลของ OpenAI สามารถโปรแกรมได้ ไม่ใช่ข้อความว่ามีสิ่งใดกำลังให้บริการบน Rubin ในวันนี้
ตัวเลขที่ NVIDIA ไม่ได้พิมพ์
ในเรื่องนี้มีตัวเลขหนึ่งที่ทั้งสองบริษัทไม่ได้วางไว้ข้าง ๆ 8x และมันคือตัวเลขที่ตัดสินว่าทีมจะเปิดใช้ระดับนั้นหรือไม่ ใบอัตราค่าบริการ Ultrafast ที่ OpenAI เผยแพร่ระบุ gpt-6-astraไว้ที่ 60.00 ดอลลาร์ต่ออินพุตหนึ่งล้านโทเคน อินพุตแบบแคช 6.00 ดอลลาร์ การเขียนแคช 75.00 ดอลลาร์ และเอาต์พุต 300.00 ดอลลาร์ โมเดลเดียวกันในระดับมาตรฐานอยู่ที่ 10.00 และ 50.00 ดอลลาร์ โดยอินพุตแบบแคชอยู่ที่ 1.00 ดอลลาร์ และการเขียนแคช 12.50 ดอลลาร์ ทุกคอลัมน์มีค่าเป็นหกเท่าของอัตรามาตรฐานพอดี
• ตัวคูณ — 6.00x สำหรับอินพุต เอาต์พุต อินพุตแคช และการเขียนแคช ไม่ใช่ "สูงสุด" แต่หกเท่าเต็ม ๆ
• เพดาน — 8x ตัวเลขที่ผู้ขายทั้งสองรายอ้างถึง โดยแนบคำว่า “สูงสุด” กำกับไว้ และไม่ได้ระบุเงื่อนไขใด ๆ
• ความหมายของเรื่องนี้ — ตัวคูณราคาอยู่ต่ำกว่ากรณีดีที่สุดที่ระดับนี้กล่าวอ้างเอง เมื่อถึงเพดาน การแลกเปลี่ยนนี้ก็คุ้มค่า แต่ถ้าต่ำกว่า 6x บนทราฟฟิกของคุณ คุณกำลังจ่ายต่อหน่วยเวลาที่ประหยัดได้มากกว่าที่การตลาดบอกเป็นนัย ซึ่งเป็นเหตุผลว่าทำไมการทดสอบที่มีความหมายเพียงอย่างเดียวของระดับนี้คือการวัดบนคำขอของคุณเอง
• ขั้นบริบทยาว — เมื่อโทเค็นอินพุตเกิน 272,000 อัตราของ Ultrafast จะกลายเป็น 120.00 ดอลลาร์สำหรับอินพุต และ 450.00 ดอลลาร์สำหรับเอาต์พุต ซึ่งเป็นหกเท่าของอัตราแบบขั้นบันไดของระดับมาตรฐานเอง
• รายละเอียดปลีกย่อยในการดำเนินงาน — OpenAI ระบุถึงบันไดโทเคนต่อนาทีของ Ultrafast ที่ 500,000 สำหรับระดับการใช้งาน 1 ถึง 3, 1,000,000 สำหรับระดับ 4 และ 5,000,000 สำหรับระดับ 5; Ultrafast รองรับเฉพาะการจัดเก็บข้อมูลในสหรัฐฯ และการประมวลผลทั่วโลกเท่านั้น โดยไม่มีปลายทางการประมวลผลระดับภูมิภาคในสหภาพยุโรปหรือภูมิภาคอื่นนอกสหรัฐฯ; และเอกสารแนะนำให้ใช้ WebSockets สำหรับ Ultrafast "โดยเฉพาะอย่างยิ่งสำหรับแอปพลิเคชันแบบเอเจนต์ที่เรียกใช้เครื่องมือหลายครั้งอย่างรวดเร็วต่อเนื่อง" พร้อมเตือนว่า "หากไม่มีการเชื่อมต่อแบบถาวร ภาระของเครือข่ายอาจลดทอนประโยชน์ด้านความหน่วงที่ได้มา"

ประเด็นสุดท้ายคือสิ่งที่ต้องลงมือทำจริง ๆ ทีมที่เปิดใช้งานระดับบริการนั้นแต่ยังปล่อยให้มี HTTP แบบต่อคำขออยู่ข้างใต้ ก็ได้จ่ายไปในอัตราสูงถึงหกเท่า เพียงเพื่อคืนความเร็วที่ได้มาบางส่วนกลับไปให้กับการตั้งค่าการเชื่อมต่อ ซึ่งเป็นวิธีผลาญเงินที่หลีกเลี่ยงได้และมีบันทึกให้เห็นอยู่แล้ว
สิ่งที่ดูเป็นอย่างไรเมื่อมองจาก endpoint เดียว
GPT-6 Astra อยู่บน OrcaRouter ในชื่อ openai/gpt-6-astra: หน้าต่างบริบทขนาด 1,050,000 โทเคน เอาต์พุตสูงสุด 128,000 โทเคน รองรับอินพุตแบบข้อความ รูปภาพ และไฟล์ พร้อมราคาตามที่ OpenAI ประกาศไว้โดยตรงที่ 10.00 ดอลลาร์สำหรับอินพุต และ 50.00 ดอลลาร์สำหรับเอาต์พุตต่อล้านโทเคน โดยปรับขึ้นเป็น 20.00 และ 75.00 ดอลลาร์เมื่ออินพุตเกิน 272,000 โทเคน ผลเบนช์มาร์กเด่นในแค็ตตาล็อกอยู่ที่ 96.1 บน GPQA Diamond
ระดับ Ultrafast ไม่มีบน OrcaRouter และเป็นไปไม่ได้ที่จะมี เพราะมันเป็นคุณสมบัติที่ควบคุมการเข้าถึงของบัญชี OpenAI ไม่ใช่ model id ซึ่งเป็นเหตุผลว่าทำไม openai/gpt-6-astra-ultrafast จึงคืนค่าเป็น model-not-found หากคุณเปิดระดับนี้ มันจะอยู่ในอินทิเกรชัน OpenAI แบบตรงของคุณ สิ่งที่ เอนด์พอยต์ที่มีโมเดลมากกว่า 200 ตัวที่ บวกกำไร 0%มอบให้คุณในสถานการณ์นี้ไม่ใช่เลน rápido — แต่คือการควบคุม เพราะราคาตามรายการของผู้ให้บริการถูกส่งผ่านมาโดยไม่บวกกำไร การเปลี่ยนแปลงอัตราของ OpenAI จึงตกมาถึงฝั่งเราวันเดียวกับที่ตกถึงฝั่ง他们 และเนื่องจากเลนมาตรฐาน Astra มีอยู่แล้ว การทดลองที่ยุติการตัดสินใจนี้คือการตั้งค่าหนึ่งบรรทัด: พรอมป์ต์เดียวกัน ระดับมาตรฐาน และโมเดลที่ถูกกว่าเคียงข้างกัน บนคีย์เดียวกัน นี่คือสิ่งใกล้เคียงที่สุดกับการวัดความหน่วงที่ทีมส่วนใหญ่จะได้ลองทำ และไม่มีค่าใช้จ่ายใด ๆ ในการตั้งค่า

อะไรที่ยังไม่ได้รับการวัด
วันนี้มีสามสิ่งที่ตรวจสอบได้ เทียร์นี้มีอยู่จริง อยู่ในตารางราคาโดยคิดเป็นหกเท่าของอัตรามาตรฐานพอดี และนับตั้งแต่วันที่ 1 ตุลาคมเป็นต้นไป มีการระบุต่อสาธารณะว่ามาจาก NVIDIA Blackwell GPUs
สิ่งหนึ่งที่ไม่ใช่เรื่องจริงคือตัวคูณบนทราฟฟิกของคุณ ไม่มีผู้ขายรายใดเผยแพร่การกระจายความหน่วงของระดับชั้นนั้นที่ระดับ concurrency ที่ระบุไว้ และไม่มีบุคคลที่สามรายใดทำซ้ำผล 8x ได้ ยังไม่มี benchmark ที่เปรียบเทียบ Astra บน Ultrafast กับ Astra ที่โหมดมาตรฐาน และก็ไม่ควรมี benchmark ที่ดูเข้าข้างเช่นนั้น — เพราะมันเป็น checkpoint เดียวกันบนเส้นทางที่เร็วกว่า การตั้งค่าเดียวกันจึงควรให้คำตอบเดียวกันที่ความเร็วต่างกัน ถ้าสองเลนของคุณให้ผลต่างกันกับพรอมป์ต์ชุดเดียวกัน นั่นคือรายงานบั๊ก ไม่ใช่ฟีเจอร์
สรุปที่มีประโยชน์ของวันที่ 1 ตุลาคมจึงเล็กกว่าที่ประกาศเขียนไว้ มันเป็นระดับเดียวกันในราคาเดียวกัน ด้วยเพดานความเร็วที่ยังไม่ได้รับการยืนยันเหมือนเดิม ตอนนี้เพียงแค่ติดป้ายฮาร์ดแวร์ ป้ายนั้นสำคัญ — มันบอกคุณว่า OpenAI กำลังสเกลสิ่งนี้บนไลน์ตัวเร่งความเร็วตัวไหน และบอกว่าเรื่องราวของระดับเร็วได้ย้ายจากพันธมิตรผู้เชี่ยวชาญไปสู่ซัพพลายเออร์ GPU รายใหญ่ที่สุดของอุตสาหกรรมภายในไม่ถึงสองเดือน แต่มันไม่ได้บอกอะไรเกี่ยวกับงบความหน่วงของคุณเองเลย และไม่มีโพสต์ไหนจะบอกได้
