การ์ดชื่อเรื่องหลักสำหรับ GPT-6 Astra ที่มีข้อความว่า 'วิธีเรียก GPT-6 Astra' พร้อมคำบรรยายย่อย 'รหัสโมเดล เอนด์พอยต์ และค่าใช้จ่ายของการรันแบบระยะยาว' โดยมีบรรทัดวันที่ว่า 'โมเดลเปิดตัวเมื่อวันที่ 3 กันยายน 2026 — ตรวจสอบรายละเอียด API เมื่อวันที่ 16 กันยายน 2026' และมีการ์ดสามใบด้านล่าง: 'รหัสโมเดล: gpt-6-astra', 'บริบท: 1,050,000 โทเค็น' และ 'มาตรฐาน: $10.00 ขาเข้า / $50.00 ขาออก' พร้อมโลโก้ OrcaRouter ที่ประกอบไว้ที่มุมขวาล่าง
Guides & Insights

GPT-6 Astra API: Model ID, Endpoint และค่าใช้จ่ายที่แท้จริงของงานระยะยาว

ผู้เขียน

Alistair Wren

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

The short version: GPT-6 Astra is callable today at https://api.openai.com/v1 under a single model id, gpt-6-astra, at $10.00 per million input tokens, $1.00 cached input and $50.00 output — the figures Ope​nAI's own pricing page carried on September 16, 2026. The model itself is from September 3, 2026, thirteen days before this page was written, so nothing here is launch coverage and nothing here is framed as an announcement. This is the reference page for the developer question that comes after availability: what string to pass, which endpoint takes it, what the 1,050,000-token window really buys, what the account has to look like first, and what one genuine long-horizon agent run costs on a rate card that quietly reprices itself above 272,000 input tokens. GPT-5.6 Sol appears throughout only as the price baseline it is sold above, never as the subject.

เหตุผลที่โมเดลอายุสิบสามวันสมควรมีหน้าหนึ่งในสัปดาห์นี้ก็คือ เส้นทางเข้าสู่โมเดลนี้เปลี่ยนไปหลังการเปิดตัว และเส้นทางผ่าน API ตอนนี้ก็กลายเป็นเส้นทางปกติ เมื่อ Ope​nAI ปล่อย Astra ในวันที่ 3 กันยายน ได้อธิบายว่าเป็นการทยอยเปิดให้ใช้ มากกว่าจะเป็นการเปิดให้ใช้ได้ทั่วไป ภายในวันที่ 8 กันยายน กำลังระบุว่าโมเดลนี้ได้เปิดให้ใช้อย่างเต็มรูปแบบกับผู้ใช้ Plus, Pro, Business และ Enterprise ใน Co​dex และ ChatGPT Work แล้ว และภายในสัปดาห์ของวันที่ 14 กันยายน AWS ได้ขึ้นทะเบียนไว้บน Bedrock และ Microsoft Foundry ก็มีให้บริการแบบพร้อมใช้ทั่วไป สำหรับผู้เรียกใช้ API ลำดับเหตุการณ์นั้นสำคัญน้อยกว่าที่ฟังดู — ปลายทางนี้เปิดใช้งานและมีเอกสารมาตลอด — แต่ก็หมายความว่าคำถามด้านการจัดซื้อจัดจ้างที่เกี่ยวข้องกับมันตอนนี้มีคำตอบที่ไม่มีในวันเปิดตัว ทุกอย่างด้านล่างนี้อ่านจากเอกสารโมเดล หน้าราคา และหน้าควบคุมข้อมูลของ Ope​nAI เองเมื่อวันที่ 16 กันยายน 2026 และสิ่งใดที่มาจากที่อื่นจะระบุไว้ในประโยคที่มีสิ่งนั้น

ID ของโมเดล และคำถามเรื่อง snapshot ที่ตอบตามจริง

สตริงที่ต้องส่งคือ gpt-6-astra — ตัวพิมพ์เล็ก คั่นด้วยเครื่องหมายยัติภังค์ ไม่มีคำนำหน้าผู้ให้บริการ นี่คือรหัสเดียวที่ OpenAI ระบุไว้ในเอกสารสำหรับโมเดลนี้

หากคุณกำลังมองหาสแนปช็อตที่ระบุวันที่เพื่อปักหมุด ก็ไม่มีให้หา และเราจะไม่ประดิษฐ์คำต่อท้ายที่ดูน่าเชื่อถือขึ้นมา หน้าโมเดลของ Ope​nAI สำหรับ GPT-6 Astra แสดงรายการเพียงรายการเดียวภายใต้ Snapshots และมันคือ gpt-6-astra เปล่า ๆ ไม่มี -2026-09-03 รูปแบบที่ระบุวันที่ในลักษณะนี้ และไม่มี -latest นามแฝงทางฝั่งผู้ให้บริการ ระหว่างการค้นคว้า เราเห็นนามแฝงเคลื่อนที่ในรูปแบบ ~openai/gpt-astra-latest บนรายการเราเตอร์ นั่นคือโครงสร้างเกตเวย์ที่สร้างทับอยู่บน id ของผู้ให้บริการ ไม่ใช่สิ่งที่ Ope​nAI เผยแพร่ และไม่ควรนำมันใส่ลงในคอนฟิกของคุณเสมือนว่ามันเป็นเช่นนั้น

ผลลัพธ์ในทางปฏิบัติมีไม่มากแต่ก็ควรค่าแก่การกล่าวถึง คุณสามารถดึงออบเจ็กต์โมเดลเพื่อยืนยันว่าคุณกำลังสื่อสารกับสิ่งใดอยู่:

curl https://api.openai.com/v1/models/gpt-6-astra -H "Authorization: Bearer $OPENAI_API_KEY"

ปักหมุด bare id ไว้ในค่าคอนฟิก แทนที่จะพิมพ์มันลงในจุดเรียกใช้เป็นสิบ ๆ แห่ง หากภายหลัง Ope​nAI เพิ่มสแนปช็อตที่มีวันที่กำกับ bare id จะกลายเป็นเป้าเคลื่อนที่ และค่าที่คุณปักหมุดไว้จะเริ่มเปลี่ยนไปโดยที่คุณไม่ทันรู้ตัว — การมีจุดให้แก้เพียงจุดเดียวคือความต่างระหว่างการเปลี่ยนแปลงสองนาทีกับการ grep ทั้งบ่าย

จุดปลายทาง: URL ฐาน ความเข้ากันได้ และคำขอที่ทำงานได้

The base URL is https://api.openai.com/v1. Per Ope​nAI's model documentation, GPT-6 Astra is supported on Responses (/v1/responses), Chat Completions (/v1/chat/completions) and Batch (/v1/batch). It is explicitly not supported on Realtime, Assistants, Fine-tuning, Embeddings, image generation and editing, video, audio, moderation, or the legacy Completions endpoint — and those absences matter as much as the presence list, because a team that planned around the Assistants API or a fine-tuned variant has to replan rather than rewrite.

เกี่ยวกับความเข้ากันได้: นี่คือ API แบบ first-party ของ Ope​nAI เอง ซึ่งเป็นรูปแบบการรับส่งข้อมูล (wire format) ที่ SDK และไคลเอนต์ที่เข้ากันได้กับ Ope​nAI ทุกตัวถูกเขียนขึ้นมาให้ทำงานด้วย อะไรก็ตามที่สื่อสารด้วยรูปแบบนั้นจะคุยกับ gpt-6-astra ได้โดยไม่ต้องมีชิม (shim) — คุณเพียงเปลี่ยนสตริงชื่อโมเดล และหากคุณกำลังย้ายจากโมเดล Ope​nAI รุ่นเก่า ก็เปลี่ยนชื่อพารามิเตอร์ด้านล่าง งานใหม่ควรใช้ Responses API: มันเป็นอินเทอร์เฟซที่ Ope​nAI ใช้จัดทำเอกสารเกี่ยวกับการควบคุมการให้เหตุผลของโมเดลนี้ เป็นที่รวมของเครื่องมือในตัว และการรองรับ Chat Completions สำหรับโมเดลใหม่ล่าสุดนั้น ในอดีตที่ผ่านมาเป็นฝั่งที่ตื้นกว่าของทั้งสอง

การเรียกแบบสตรีมมิงขั้นต่ำ พร้อมตั้งค่าความพยายามในการให้เหตุผล:

curl https://api.openai.com/v1/responses \

-H "Authorization: Bearer $OPENAI_API_KEY" \

-H "Content-Type: application/json" \

-d '{"model": "gpt-6-astra", "input": "ระบุไฟล์ที่คุณจะเปลี่ยนแปลงเพื่อย้ายบริการนี้ออกจาก API การยืนยันตัวตนแบบเดิม", "reasoning": {"effort": "high"}, "max_output_tokens": 16000, "stream": true}'

และสิ่งเดียวกันใน Python ซึ่งเป็นที่ที่ผู้อ่านส่วนใหญ่จะอยู่จริง ๆ:

from openai import OpenAI

client = OpenAI()

stream = client.responses.create(model="gpt-6-astra", input="ระบุรายชื่อไฟล์ที่คุณจะแก้ไขเพื่อย้ายบริการนี้ออกจาก API การยืนยันตัวตนแบบเดิม", reasoning={"effort": "high"}, max_output_tokens=16000, stream=True)

สำหรับเหตุการณ์ในสตรีม:

if event.type == "response.output_text.delta": print(event.delta, end="")

สามสิ่งเกี่ยวกับคำขอนั้นเป็นลักษณะเฉพาะของโมเดลนี้ ไม่ใช่สิ่งที่คัดลอกจากคู่มือเริ่มต้นแบบทั่วไป

ระดับความพยายามในการใช้เหตุผลเป็นปุ่มปรับต้นทุน ไม่ใช่แค่ปุ่มปรับคุณภาพ หน้าโมเดลของ Ope​nAI ระบุค่าที่รองรับไว้เป็น low, medium, high, xhigh และ max สังเกตว่าลิสต์นั้นเริ่มต้นตรงไหน: ไม่มี none หรือ minimal สำหรับ GPT-6 Astra ดังนั้นพื้นขั้นต่ำจึงถูกยกสูงขึ้น โทเคนการใช้เหตุผลถูกคิดเงินเป็นโทเคนเอาต์พุตในราคา 50.00 ดอลลาร์ต่อล้านโทเคน ซึ่งหมายความว่าการปรับระดับความพยายามจาก high ไปเป็น max เป็นการตัดสินใจที่มีราคาติดมาด้วย ไม่ใช่การอัปเกรดคุณภาพแบบฟรี

รองรับการสตรีมมิ่ง และมันเป็นวิธีที่ซื่อตรงในการรันเทิร์นยาว ๆ คำขอเดียวบนโมเดลนี้สามารถปล่อยโทเค็นเอาต์พุตได้สูงสุดถึง 128,000 โทเค็น การรอให้ทั้งหมดนั้นมาอยู่ในเนื้อหาการตอบกลับเพียงก้อนเดียว โดยมองไม่เห็นเลยว่ามันกำลังดำเนินไปอยู่หรือไม่ นั่นแหละคือวิธีที่ทำให้คุณต้องเดาเรื่องไทม์เอาต์

การแคชพรอมต์ที่นี่เป็นแบบ explicit Responses API มีเอกสารระบุถึง prompt_cache_breakpoint บนเนื้อหาประเภทข้อความ รูปภาพ และไฟล์ โดยมีโหมดเป็น explicit ซึ่งทำเครื่องหมาย "จุดสิ้นสุดที่แน่นอนของคำนำหน้าพรอมต์ที่นำกลับมาใช้ซ้ำได้" และสืบทอด TTL มาจาก prompt_cache_options.ttl ของคำขอ บนโมเดลที่อัตราอินพุตแบบแคชมีค่าเพียงหนึ่งในสิบของอัตราที่ไม่แคช ตำแหน่งที่คุณวางขอบเขตนั้นคือจุดที่สร้างผลตอบแทนได้สูงสุดในคำขอของคุณ

Screenshot of OpenAI's developer documentation page for GPT-6 Astra, captured 16 September 2026, showing the model id gpt-6-astra described as the company's most capable model, a 1,050,000-token context window, 128,000 maximum output tokens, an Apr 30, 2026 knowledge cutoff, reasoning token support with reasoning.effort values of low, medium, high, xhigh and max, input modalities of text and image with text output and audio and video marked not supported, Standard pricing of $10.00 input, $1.00 cached input, $12.50 cache writes and $50.00 output per million tokens, the note that prompts with more than 272K input tokens are priced at 2x input and cache rates and 1.5x output for the full request, and supported endpoints of Responses, Chat Completions and Batch with Fine-tuning, Assistants, Embeddings and Images marked unsupported.

หน้าต่าง 1,050,000 โทเค็นหมายความว่าอย่างไรกันแน่

ตัวเลขที่ระบุไว้ในเอกสารคือหน้าต่างบริบทขนาด 1,050,000 โทเคน, อินพุตสูงสุด 922,000 โทเคน, เอาต์พุตสูงสุด 128,000 โทเคน และจุดตัดความรู้คือวันที่ 30 เมษายน 2026

เริ่มจากเลขคณิตที่หลายคนมองข้าม: 922,000 บวก 128,000 เท่ากับ 1,050,000 หน้าต่างนี้ถูกใช้ร่วมกันระหว่างสิ่งที่คุณส่งไปกับสิ่งที่โมเดลอาจส่งกลับ และเพดานเอาต์พุตถูกกันไว้จากส่วนนี้ คุณไม่สามารถส่งอินพุต 1,050,000 โทเคนได้ เพดานที่ทำได้จริงสำหรับคำขอเดียวคือ 922,000 และน้อยกว่านั้นหากคุณต้องการพื้นที่สำหรับคำตอบจริง ๆ

หนึ่งล้านโทเคนซื้ออะไรได้บ้างในหน่วยที่คุณทำงานจริง? การแปลงโทเคนเป็นข้อความเป็นค่าประมาณ และนี่เป็นของเราไม่ใช่ของ OpenAI แต่ก็อยู่ในลำดับขนาดที่ถูกต้อง: ที่ประมาณสี่ตัวอักษรต่อโทเคน 1,050,000 โทเคนก็ราว ๆ 750,000 คำ หรือประมาณหนึ่งแสนบรรทัดของโค้ด นั่นคือรีโพซิทอรีขนาดกลางทั้งแห่ง โดยยังมีที่เหลือพอสำหรับเอาต์พุตจากเครื่องมือที่เอเจนต์สร้างขึ้นระหว่างทำงาน กรณีระยะยาวที่โมเดลนี้ถูกนำเสนอขายก็คือสิ่งนี้แหละ: เอเจนต์ที่อ่านไฟล์เมื่อชั่วโมงที่แล้วและยังเห็นได้ว่ามันระบุอะไรไว้ แทนที่จะเป็นเอเจนต์ที่บีบอัดช่วงเช้าให้เหลือแค่ย่อหน้าสรุป

ต่อไปคือส่วนที่ควรอยู่บนหน้าต้นทุนมากกว่าหน้าข้อมูลจำเพาะ เอกสารโมเดลของ OpenAI ระบุว่าพรอมป์ที่มี 272,000 โทเค็นอินพุตขึ้นไป คิดราคาที่ อัตราอินพุตและแคช 2 เท่า และเอาต์พุต 1.5 เท่าสำหรับคำขอทั้งหมด หน้าตั้งราคาระบุไว้เป็นแถวที่สอง: ลองคอนเท็กซ์บน GPT-6 Astra อยู่ที่อินพุต $20.00 อินพุตแคช $2.00 และเอาต์พุต $75.00 ดังนั้นสามในสี่ส่วนบนของหน้าต่างนี้จึงเป็นช่วงราคา ไม่ใช่แค่พื้นที่เผื่อ การรันที่มีทรานสคริปต์สูงกว่า 272,000 โทเค็นต้องจ่ายเป็นสองเท่าในทุกโทเค็นอินพุต — รวมถึงโทเค็นที่แคชไว้ — สำหรับคำขอทั้งหมด และนั่นคือความผันผวนที่ใหญ่ที่สุดในเศรษฐศาสตร์ของโมเดลนี้ มีรายละเอียดครบถ้วนด้านล่าง

กลไกอีกอย่างหนึ่งที่ควรรู้ เพราะมันคือการยอมรับของผู้ขายเองว่าหน้าต่างเดียวไม่ใช่คำตอบทั้งหมด สำหรับ Co​dex Ope​nAI อธิบายแนวทางบริบทแบบทดลองที่มาพร้อมกับ Astra ซึ่งบันทึกจะคงอยู่ข้ามหน้าต่างบริบท แทนที่จะถูกบีบอัดซ้ำ ๆ ให้เป็นสรุปเดียว โดยหน้าต่างก่อนหน้ายังคงค้นหาได้ เพื่อให้ข้อกำหนดและผลการทดสอบจากข้อความก่อนหน้าและเอาต์พุตของเครื่องมือยังคงหาเจอ Ope​nAI เรียกสิ่งนี้ว่าการทดลอง บอกว่าเปิดใช้งานใน Co​dex config.toml และบอกว่าจะกลายเป็นค่าเริ่มต้นสำหรับ Astra หากคุณกำลังสร้างสิ่งที่เทียบเท่าด้วยตัวเองบน API นั่นคือรูปแบบที่ควรลอกเลียน: บันทึกที่คงทนบวกประวัติที่เรียกค้นได้ แทนที่จะเป็นพรอมป์ต์วีรบุรุษเพียงอันเดียว

และข้อจำกัดของตัวเลขนั้นเอง: หน้าต่างขนาดใหญ่เป็นความจุ ไม่ใช่การรับประกันว่าจะได้รับความสนใจตลอดหน้าต่างนั้น ตัวเลขระยะยาวที่ผู้ขายรายงานเป็นแนวทางบอกพฤติกรรมได้ดีกว่าจำนวนโทเคน — OpenAI รายงานว่า OSWorld 2.0 อยู่ที่ 72.6% ที่ประมาณ 40 นาทีต่องาน และ Terminal-Bench 4.0 อยู่ที่ 57.9% เทียบกับ 37.3% สำหรับ GPT-5.6 Sol นั่นเป็นตัวเลขของ OpenAI เอง ซึ่งเราไม่ได้ทำซ้ำ และภาพจากแหล่งอิสระก็ใกล้เคียงแต่ไม่เหมือนกันทั้งหมด: Artificial Analysis วัด Astra ได้ 59.1% บน Terminal-Bench v4.0 เทียบกับ 52.0% สำหรับ Claude Fable 5.1 และ 39.9% สำหรับ GPT-5.6 Sol ทั้งคู่เห็นพ้องว่าช่องว่างระยะยาวเมื่อเทียบกับรุ่นก่อนหน้านั้นมีอยู่จริง; ไม่มีสิ่งใดทดแทนการรันงานของคุณเองได้

รูปแบบอินพุต และคำถามเกี่ยวกับไฟล์ที่ถูกปล่อยให้เปิดอยู่อย่างตรงไปตรงมา

หน้าเพจโมเดลของ Ope​nAI ระบุรูปแบบอินพุตไว้คือ ข้อความและรูปภาพ โดยมีเอาต์พุตเป็นข้อความ ไม่มีเสียง ไม่มีวิดีโอ และไม่มีการสร้างรูปภาพบนโมเดลนี้

อินพุตรูปภาพจะถูกใส่เป็นพาร์ตเนื้อหาภายในข้อความของผู้ใช้ ประเภทของพาร์ตคือ input_image และรูปภาพจะถูกส่งมาเป็น URL แบบเต็มรูปแบบ หรือเป็น data URL แบบ base64 ใน image_url หรือเป็น file_id จาก Files API มี detail แบบไม่บังคับซึ่งเป็นได้ทั้ง auto, low, high หรือ original โดยค่าเริ่มต้นคือ auto รูปแบบคือ:

{"model": "gpt-6-astra", "input": [{"role": "user", "content": [{"type": "input_text", "text": "ในภาพหน้าจอนี้มีอะไรเปลี่ยนแปลงไป?"}, {"type": "input_image", "image_url": "data:image/png;base64,...", "detail": "high"}]}]}

เอกสารด้านวิชันของ Ope​nAI ระบุว่า PNG, JPEG, WEBP และ GIF แบบไม่เคลื่อนไหวเป็นรูปแบบที่รองรับ โดยมีเพย์โหลดรวมต่อคำขอสูงสุด 512 MB และรับภาพได้สูงสุด 1,500 ภาพต่อคำขอ โดยภาพที่มีแพตช์เกิน 30,000 แพตช์จะถูกปฏิเสธแทนที่จะย่อขนาดลง สิ่งเหล่านี้เป็นข้อจำกัดด้านวิชันทั่วไปของแพลตฟอร์ม ไม่ใช่ข้อจำกัดเฉพาะของ Astra และภาพจะถูกคิดค่าใช้จ่ายเป็นโทเค็นเช่นเดียวกับอินพุตอื่น ๆ

ตอนนี้คือคำถามที่ผู้อ่านมาพร้อมกับมันจริง ๆ และคำตอบที่ตรงไปตรงมา คุณส่งไฟล์หรือ PDF ได้ไหม เราไม่สามารถยืนยันการป้อนเอกสารสำหรับโมเดลนี้ได้จากเอกสารประกอบของ Ope​nAI และเราจะไม่สื่อเป็นนัยว่ามันทำงานได้ Responses API นิยาม content part ประเภท input_file ไว้จริง ดังนั้นโครงสร้างพื้นฐานจึงมีอยู่ใน API โดยทั่วไป แต่หน้าของ Ope​nAI สำหรับ GPT-6 Astra ระบุว่า text และ image เป็น modality อินพุต และไม่ได้ระบุ file และเราไม่พบคำแถลงของ Ope​nAI ที่ยืนยันการป้อน PDF สำหรับ endpoint นี้ รายการของ router สำหรับโมเดลเดียวกันแสดง file ควบคู่ไปกับ text และ image — ให้ถือว่านั่นเป็นข้อมูลที่ router รายงาน ซึ่งเป็นสิ่งที่ router บันทึกเกี่ยวกับเส้นทาง มากกว่าสิ่งที่ผู้ขายรับประกัน หากการนำเอกสารเข้าเป็นส่วนสำคัญของงานของคุณ ให้ทดสอบกับ endpoint จริงก่อนที่คุณจะสร้างบนพื้นฐานนั้น และเตรียม fallback แบบ OCR-to-text ไว้ให้พร้อม นั่นคือความแตกต่างระหว่างการทดสอบหนึ่งบ่ายกับการเขียนใหม่ทั้งหมด

เส้นราคาแบบเต็ม และการรันระยะยาวหนึ่งครั้งที่คิดราคาออกมาแล้ว

ตัวเลขทุกตัวในส่วนนี้ดึงมาจากหน้าสนราคาของ Ope​nAI เองเมื่อวันที่ 16 กันยายน 2026 และทั้งหมดคิดต่อหนึ่งล้านโทเคนในระดับ Standard เว้นแต่บรรทัดนั้นจะระบุไว้เป็นอย่างอื่น

บริบทสั้น อินพุตสูงสุด 272K — อินพุต $10.00, อินพุตที่แคชไว้ $1.00, เขียนแคช $12.50, เอาต์พุต $50.00.

บริบทแบบยาว เมื่ออินพุตเกิน 272K — อินพุต $20.00, อินพุตแคช $2.00, การเขียนแคช $25.00, เอาต์พุต $75.00 โดยคิดกับคำขอทั้งหมด

Batch และ Flex — ครึ่งหนึ่งของ Standard: $5.00 / $0.50 / $6.25 / $25.00 สำหรับ context สั้น, $10.00 / $1.00 / $12.50 / $37.50 สำหรับ context ยาว

โหมดเร็ว — คิดเป็นสองเท่าของ Standard: $20.00 / $2.00 / $25.00 / $100.00 สำหรับบริบทสั้น, $40.00 / $4.00 / $50.00 / $150.00 สำหรับบริบท{long}. OpenAI ระบุว่าโหมดเร็วไม่พร้อมใช้งานสำหรับ GPT-6 Astra ที่มีที่ตั้งข้อมูลในสหภาพยุโรป

การเก็บข้อมูลในภูมิภาค — เอนด์พอยต์ที่ใช้งานฟีเจอร์นี้จะมีการบวกเพิ่ม 10% สำหรับโมเดลที่เปิดตัวตั้งแต่วันที่ 5 มีนาคม 2026 เป็นต้นไป GPT-6 Astra เข้าเกณฑ์ดังกล่าว ดังนั้นการติดตั้งแบบเก็บข้อมูลในภูมิภาคจึงสูงกว่าตัวเลขทุกตัวข้างต้น 10%

ประเด็นที่ต้องซึมซับคืออัตราค่าอินพุตแบบแคช $1.00 เทียบกับ $10.00 คือส่วนลด 90% สำหรับส่วนของพรอมป์ที่คุณส่งซ้ำ — และในภาระงานของเอเจนต์ นั่นเกือบคือพรอมป์ทั้งหมด การเขียนแคชถูกคิดค่าบริการที่ $12.50 หรือ 1.25 เท่าของอัตราอินพุตที่ไม่ได้แคช ดังนั้นจุดคุ้มทุนจึงง่ายมาก: การส่ง 100,000 โทเค็นแบบไม่แคชสองครั้งมีค่าใช้จ่าย $2.00 ขณะที่การเขียนคำนำหน้านั้นหนึ่งครั้งแล้วอ่านกลับหนึ่งครั้งมีค่าใช้จ่าย $1.35 การแคชให้ผลตอบแทนตั้งแต่การนำกลับมาใช้ครั้งที่สองเป็นต้นไป และเอเจนต์ที่ทำงานกับทรานสคริปต์เดิมหนึ่งร้อยเทิร์นก็ใช้ซ้ำถึงหนึ่งร้อยครั้ง

ซึ่งนำเรามาสู่การคำนวณที่ตัดสินจริง ๆ ว่าโมเดลนี้จ่ายไหวหรือไม่ เพราะอัตราที่โฆษณาไว้ไม่ใช่ตัวเลขที่ไปอยู่บนใบแจ้งหนี้ นี่คือการรันแบบจำลอง — ของเราเอง สร้างจากอัตราที่ Ope​nAI เผยแพร่ ไม่ใช่บิลที่วัดได้จริง — สำหรับงานประเภทที่โมเดลนี้ถูกขายให้ทำ: เอเจนต์เขียนโค้ดอัตโนมัติที่ทำงาน migration ระดับทั้ง repo เป็นเวลาหลายชั่วโมง เรียกโมเดล 120 ครั้ง ทรานสคริปต์การทำงานซึ่งเมื่อสะสมไปเรื่อย ๆ จะมีค่าเฉลี่ยประมาณ 500,000 โทเคนอินพุตต่อการเรียกหนึ่งครั้ง 80% ของอินพุตนั้นเสิร์ฟจากแคช และโทเคนเอาต์พุต 400,000 โทเคนตลอดการรัน รวมถึงการให้เหตุผล

ที่อัตรา Standard แบบบริบทสั้น:

• อินพุตที่ไม่ได้แคช — 12 ล้านโทเคน × $10.00 = $120.00

• อินพุตที่แคชไว้ — 48M โทเคน × $1.00 = $48.00

• เอาต์พุต — 0.4M โทเค็น × $50.00 = $20.00

รวม ≈ $188.00 สำหรับการรันครั้งนี้

การรันเดียวกันในช่วงบริบทแบบยาว ซึ่งเป็นสิ่งที่บทถอดเสียงที่อยู่เหนือ 272,000 โทเค็นต่อการเรียกได้รับจริง:

• อินพุตที่ไม่ได้แคช — 12M โทเค็น × $20.00 = $240.00

• อินพุตที่แคชไว้ — 48M โทเค็น × $2.00 = $96.00

• เอาต์พุต — 0.4M โทเค็น × $75.00 = $30.00

รวม ≈ $366.00 สำหรับการรัน

มีสองข้อสรุปที่ตามมาจากเรื่องนี้ และไม่มีข้อใดมองเห็นได้จากอัตราที่พาดหัวข่าว ประการแรก ตำแหน่งที่บทสนทนาของคุณถูกจัดเก็บมีค่าเท่ากับการเลือกโมเดล — งานเดียวกันมีค่าใช้จ่ายเพิ่มขึ้นราวสองเท่า ขึ้นอยู่กับว่ามันข้ามเกณฑ์ 272K หรือไม่ ซึ่งทำให้วินัยด้านบริบท (การดึงข้อมูล 100K ที่ถูกต้องแทนการแบก 600K ไว้) กลายเป็นเทคนิคควบคุมต้นทุนบนโมเดลนี้ ไม่ใช่แค่เรื่องประสิทธิภาพ ประการที่สอง แคชมีค่ามากกว่าที่ส่วนลดบ่งชี้: หากไม่มี cache hit เลย สถานการณ์แรกจะมีอินพุตมูลค่า $600.00 แทนที่จะเป็น $168.00 และการรันมีค่าใช้จ่ายประมาณ $620 แทนที่จะเป็น $188 เปิดใช้แคชก่อนที่คุณจะเพิ่มระดับความพยายามในการให้เหตุผล

สำหรับเส้นฐาน ส่วนผสมโทเค็นเดียวกันบน GPT-5.6 Sol ในอัตราที่หน้าเพจราคาของ Ope​nAI แสดงเมื่อวันที่ 16 กันยายน — อินพุต $4.00, อินพุตแคช $0.40, เอาต์พุต $20.00 ที่บริบทสั้น — คิดเป็นประมาณ $75.20 และที่แถวบริบทยาวของ Sol ($8.00 / $0.80 / $30.00) ประมาณ $146.40 นั่นทำให้การรันนี้อยู่ที่ประมาณ 2.5x ในทั้งสองช่วง มีข้อควรระวังสองข้อเกี่ยวกับตัวคูณนั้น เพราะมันทำให้เกิดความสับสนที่อื่นแล้ว: ตัวเลขของ Sol เป็นอัตราโปรโมชัน — Ope​nAI กล่าวว่าโปรโมชันมีอย่างน้อยถึงวันที่ 21 พฤศจิกายน 2026 — ในขณะที่ของ Astra เป็นราคาปกติ ดังนั้นตัวคูณจึงวัดจากตารางราคาสองตารางของวันนี้ ไม่ใช่ข้อเท็จจริงที่มั่นคงเกี่ยวกับโมเดล และจะลดลงหากโปรโมชันสิ้นสุด และ "2.5x" แบบเก่าที่แพร่หลายสำหรับ Astra บางครั้งถูกคำนวณเทียบกับราคาปกติก่อนโปรโมชันของ Sol ที่ $5.00/$30.00 ซึ่งให้ 2x ที่อินพุตและประมาณ 1.67x ที่เอาต์พุต ระบุว่าคุณหมายถึงอัตรา Sol แบบใด ไม่อย่างนั้นตัวเลขก็ไร้ค่า

อีกหนึ่งบรรทัด: ระดับ Batch จะลดทุกอย่างลงครึ่งหนึ่ง ทำให้การรันครั้งแรกอยู่ที่ประมาณ $94 ว่าคุณจะใช้มันได้หรือไม่นั้นขึ้นอยู่กับส่วนถัดไป

Single-column scoreboard titled 'GPT-6 Astra API — the scoreboard' with six rows reading 'Model id: gpt-6-astra', 'Context window: 1,050,000 tokens', 'Max output: 128,000 tokens', 'Price (Standard): $10.00 in / $50.00 out', 'Cached input: $1.00, a 90% discount' and 'Above 272K input: 2x input, 1.5x output', above a footer reading 'All figures per OpenAI's model and pricing pages, read September 16, 2026.', with the OrcaRouter logo composited in the bottom-right corner.

Zero Data Retention และส่วนลดที่ทำให้ตัวเองหมดสิทธิ์

OpenAI ระบุว่า Zero Data Retention มีให้สำหรับลูกค้า API ที่มีคุณสมบัติเหมาะสมบนเอนด์พอยต์ที่รองรับ โดยขึ้นอยู่กับการอนุมัติ — และทั้งสองส่วนของประโยคนั้นล้วนมีความหมายสำคัญ ไม่ใช่ตัวเลือกที่เปิดใช้ได้เอง: การมีคุณสมบัติต้องได้รับการอนุมัติล่วงหน้าจาก OpenAI และการยอมรับข้อกำหนดเพิ่มเติม และคุณเริ่มต้นได้โดยการติดต่อฝ่ายขาย เมื่อได้รับอนุมัติแล้ว จะตั้งค่าได้ในระดับองค์กรหรือโปรเจกต์ภายใต้ การตั้งค่า → องค์กร → การควบคุมข้อมูล บนแท็บการเก็บรักษาข้อมูล ซึ่งโปรเจกต์สามารถสืบทอดค่าเริ่มต้นขององค์กร ตั้งค่า ZDR อย่างชัดเจน เลือก Modified Abuse Monitoring หรือปิดใช้งานทั้งสองอย่าง

สิ่งที่เปลี่ยนแปลงในทางปฏิบัติ: ZDR ตัดเนื้อหาของลูกค้าออกจากบันทึกการเฝ้าระวังการใช้งานในทางที่ผิด แทนที่การเก็บรักษาตามค่าเริ่มต้นสูงสุด 30 วัน และพารามิเตอร์ store บน /v1/responses และ /v1/chat/completions จะถือเป็น false แม้ว่าคำขอจะพยายามตั้งค่าเป็น true

รายละเอียดที่สำคัญที่สุดในหน้าซึ่งว่าด้วยค่าใช้จ่าย: /v1/batches ไม่ได้อยู่ในรายการปลายทางที่มีสิทธิ์ใช้ ZDR หน้าด้านการควบคุมข้อมูลของ OpenAI ระบุว่าไม่มีสิทธิ์ โดยสถานะของแอปพลิเคชันจะถูกเก็บไว้จนกว่าจะถูกลบ ดังนั้นบน GPT-6 Astra ส่วนลด 50% ของระดับ Batch กับ Zero Data Retention จึงไม่สามารถมีพร้อมกันได้ — เวิร์กโหลดที่ต้องปฏิบัติตามข้อกำหนดด้านการปฏิบัติตามกฎระเบียบซึ่งจำเป็นต้องใช้ ZDR ควรตั้งงบประมาณที่อัตรามาตรฐาน ไม่ใช่อัตราแบบ batch และตัวเลข $94 ข้างต้นไม่สามารถใช้กับเวิร์กโหลดนั้นได้

ข้อควรระวังเพิ่มเติมอีกสามข้อ กล่าวไว้ตรง ๆ เพราะหน้าที่โฆษณา ZDR เกินจริงย่อมแย่กว่าหน้าที่ละเว้นไม่กล่าวถึงเลย ZDR ไม่ใช่เรื่องสัมบูรณ์: ภายใต้ "Eyes Off" OpenAI ขอสงวนสิทธิ์ที่จะทำให้โมเดลไม่มีสิทธิ์ได้รับ ZDR สำหรับลูกค้าเฉพาะราย โดยมีหนังสือแจ้งล่วงหน้า และภายใต้ "Safety Retention" เนื้อหาอาจถูกเก็บไว้และตรวจสอบโดยมนุษย์ในกรณีที่ตัวจำแนกประเภท (classifier) ระบุความเสี่ยงรุนแรง อินพุตรูปภาพและไฟล์ที่ถูกตั้งค่าสถานะว่าอาจเป็น CSAM จะถูกเก็บไว้เพื่อการตรวจสอบด้วยมือแม้ภายใต้ ZDR และ ZDR สิ้นสุดที่ขอบเขตของ OpenAI — หากเอเจนต์ของคุณเรียกเซิร์ฟเวอร์ MCP ระยะไกลหรือ API ของผู้ให้บริการรายอื่น การรับส่งข้อมูลนั้นอยู่ภายใต้นโยบายการเก็บรักษาของฝ่ายนั้น ไม่ใช่ของนโยบายนี้ ในอีกเรื่องหนึ่ง ข้อกำหนดถิ่นที่อยู่ของข้อมูล (data residency) เป็นการควบคุมที่แตกต่างจาก ZDR ต้องได้รับการอนุมัติของตัวเองและข้อแก้ไข Modified Retention นอกสหรัฐอเมริกา และมีส่วนเพิ่ม 10% ตามที่ระบุไว้ข้างต้น หากคุณอาศัยแคชภายใต้ ZDR โปรดอ่านหน้าควบคุมข้อมูลของ OpenAI เพื่อดูว่าแคชเก็บข้อมูลใดไว้ เราจะไม่พิมพ์ตัวเลขการเก็บรักษาสำหรับเรื่องนั้นซึ่งตัวเราเองก็อ่านไม่พบจากที่นั่น

ขีดจำกัดอัตราตามที่เอกสารระบุ และตัวที่กัดก่อน

หน้าโมเดลของ Ope​nAI เผยแพร่ขีดจำกัดตามระดับเหล่านี้สำหรับ GPT-6 Astra — คำขอและโทเคนต่อนาที จากนั้นขีดจำกัดคิวแบบแบตช์:

ระดับ 1 — 500 RPM, 500,000 TPM, คิวแบบกลุ่ม 1,500,000

ระดับ 2 — 5,000 RPM, 1,000,000 TPM, คิวแบบแบตช์ 3,000,000

Tier 3 — 5,000 RPM, 2,000,000 TPM, คิวงานแบบกลุ่ม 100,000,000

ระดับ 4 — 10,000 รอบต่อนาที, 4,000,000 TPM, คิวแบบแบตช์ 200,000,000

Tier 5 — 15,000 RPM, 40,000,000 TPM, คิวแบบแบตช์ 15,000,000,000

สองขีดจำกัดที่เราจะเรียกว่า ไม่มีการบันทึกไว้ แทนที่จะเติมข้อมูลลงไป: ไม่มีขีดจำกัดระดับฟรีที่ประกาศไว้ เพราะ GPT-6 Astra ไม่ได้อยู่ในระดับฟรีเลย; และเราไม่พบเพดานที่ประกาศไว้เหนือ Tier 5 ขึ้นไป และไม่มีตารางขีดจำกัดแยกต่างหากสำหรับโหมด Fast หากผู้ให้บริการรายใดไม่ได้ประกาศขีดจำกัดไว้ ให้ถือว่าการไม่มีข้อมูลนั้นยังไม่มีข้อสรุป — อย่าสันนิษฐานว่ามันไม่จำกัด

ตัวเลขที่กัดภาระงานของเอเจนต์เป็นอันดับแรกคือ 500,000 TPM ของ Tier 1 การเรียกครั้งเดียวบนโมเดลนี้สามารถบรรทุกทรานสคริปต์ขนาด 500,000 โทเคน ซึ่งหมายความว่า หนึ่งคำขอสามารถใช้งบโทเคนของคุณเต็มหนึ่งนาทีในระดับเริ่มต้นได้ หน้าต่างบริบทหนึ่งล้านโทเคนไม่ได้มีประโยชน์มากนักกับเอเจนต์ที่ยึดทรานสคริปต์เดิมไว้ตลอด 120 เทิร์น หากระดับนั้นไม่สามารถดันโทเคนได้ ให้กำหนดขนาดระดับตามปริมาณโทเคนจากตัวอย่างที่คำนวณไว้ข้างต้น ไม่ใช่ตามจำนวนคำขอ — และโปรดทราบว่าการเลื่อนระดับขึ้นอยู่กับค่าใช้จ่ายและประวัติบัญชี ดังนั้นจึงคุ้มค่าที่จะจัดตั้งไว้ก่อนถึงกำหนดส่ง มากกว่าในระหว่างนั้น

Azure และ AWS Bedrock อย่างละหนึ่งบรรทัด

Microsoft Azure — GPT-6 Astra สามารถปรับใช้ได้ใน Microsoft Foundry ภายใต้ id gpt-6-astra เดียวกัน โดยความครอบคลุมของ Foundry กำหนดวันเปิดให้บริการทั่วไปเป็นต้นเดือนกันยายน 2026 และรายงานการปรับใช้แบบ Global Standard และ US Data Zone โดยไม่มี EU Data Zone ตอนเปิดตัว และอัตราอยู่ที่หรือใกล้เคียงกับรายการราคาของ OpenAI พร้อมแถวสำหรับบริบทยาว เราอ่านข้อมูลนั้นจากความครอบคลุมของ Foundry ไม่ใช่จากหน้าคาตาล็อกของ Microsoft เอง ซึ่งวันนี้เราเข้าถึงไม่ได้ — โปรดตรวจสอบรายการการปรับใช้ ชุดภูมิภาค และอัตราค่าบริการปัจจุบันจากเอกสารของ Microsoft เองก่อนวางแผนการปรับใช้บนระบบนี้

AWS Bedrock — ระบุเป็น openai.gpt-6-astra ใช้งานได้ผ่าน Bedrock APIs ที่รองรับ และได้รับการยืนยันในรายงานสรุปรายสัปดาห์ของ AWS ลงวันที่ 15 กันยายน 2026 โดยมีขอบเขตการกำกับดูแลของ Bedrock เอง (การแยกจุดเชื่อมต่อ VPC, การเข้ารหัส KMS, Guardrails) และคำแถลงของ AWS ว่าข้อมูลการอนุมานไม่ถูกนำไปใช้ฝึกโมเดล การอนุมานภายในภูมิภาคและข้ามภูมิภาคตามภูมิศาสตร์บน Bedrock ที่มีรายงานมีการคิดค่าบริการสูงกว่าอัตราพื้นฐาน 10%; ตัวเลขนั้นเป็นข้อมูลจากแหล่งทุติยภูมิในการอ่านของเรา ดังนั้นโปรดตรวจสอบหน้าเพจราคาของ AWS เอง

ไม่มีเส้นทางไหนเปลี่ยนตัวโมเดล ทั้งสองเส้นทางเปลี่ยนเรื่องการจัดหา ซึ่งสำหรับผู้อ่านในระดับองค์กรแล้วนั่นแหละคือประเด็นทั้งหมด: การติดตั้งบน Foundry หรือ Bedrock สามารถอยู่ภายในข้อผูกพันด้านคลาวด์ที่มีอยู่แล้ว สืบทอด IAM การทำ logging และขอบเขตเครือข่ายของคลาวด์นั้น และไปปรากฏบนใบแจ้งหนี้ที่ฝ่ายการเงินอนุมัติไปแล้ว — ซึ่งบ่อยครั้งคือความแตกต่างระหว่างการเป็นแค่โครงการนำร่องกับสิ่งที่ส่งมอบใช้งานได้จริง ข้อแลกเปลี่ยนก็คือคุณต้องรับวงจรชีวิตของโมเดลตามที่คลาวด์กำหนดและอัตราราคาของคลาวด์นั้น และคลาวด์ทั้งสองรายมีรายงานว่าราคาอยู่ในระดับเดียวกับหรือสูงกว่าราคาที่ OpenAI ประกาศไว้ ไม่ใช่ต่ำกว่า

จุดที่เราเตอร์เหมาะสม รวมถึงส่วนที่โต้แย้งมัน

GPT-6 Astra อยู่ในแคตตาล็อกของ OrcaRouter ในชื่อ openai/gpt-6-astra และ OrcaRouter ส่งต่อราคาตามรายการของผู้ให้บริการโดยคิด มาร์กอัป 0% — ราคาของผู้ขายคือราคาของเรา และเมื่อราคาจากผู้ขายเปลี่ยนแปลง ยอดในบิลของคุณก็เปลี่ยนตามในวันเดียวกัน ไม่ใช่รอถึงรอบต่ออายุ สำหรับโมเดลในราคานี้ นี่ไม่ใช่ข้อกล่าวอ้างที่ต่างกันแค่เศษปัดเศษ: ตัวเลขที่คำนวณข้างต้นก็เป็นตัวเลขเดียวกันกับที่คุณจะจ่ายหากซื้อตรง

Screenshot of the OrcaRouter catalogue page for GPT-6 Astra, captured 16 September 2026, showing the listing openai/gpt-6-astra from provider OpenAI, a 1M-token context, 128K maximum output, input of text, image and file with text output, a p50 time to first token of 6.70 s and p95 of 10.00 s, $10.00 input and $50.00 output per million tokens, 181.0M tokens of routed traffic over seven days, and an OpenAI-compatible Python sample using base_url https://api.orcarouter.ai/v1.

เหตุผลที่ตรงไปตรงมาสำหรับการใช้ routing ตรงนี้ไม่ใช่ราคา แต่คือความสามารถในการย้อนกลับ Astra มีราคาประมาณ 2.5 เท่าของโมเดลที่อยู่ต่ำลงไปหนึ่งขั้น และค่าใช้จ่ายของมันผันแปรตามเกณฑ์ที่สถาปัตยกรรมของคุณควบคุม ดังนั้นทีมส่วนใหญ่จึงอยากลองใช้กับทราฟฟิกจริงบางส่วนก่อนจะผูกเป็นเส้นทางโปรดักชัน ด้วยคีย์เดียว คุณสามารถวางมันไว้หลังเอนด์พอยต์เดียวกับโมเดลที่คุณรันอยู่แล้ว ส่งทราฟฟิกส่วนหนึ่งไปให้มัน และสลับไปใช้ตัวสำรองที่ถูกกว่าโดยอัตโนมัติเมื่อมันไม่ได้สร้างความคุ้มค่าให้กับส่วนต่าง — เป็นการเปลี่ยนคอนฟิก ไม่ใช่การโยกย้าย โดยมี API หนึ่งตัวที่ครอบคลุมโมเดล 200 กว่าตัว, routing DSL ที่ประกอบโมเดลหลายตัวเข้าเป็นการเรียกครั้งเดียว และ model fusion เมื่อคุณต้องการให้คณะโมเดลช่วยกันตอบ

ส่วนที่โต้แย้งเรื่องนี้ พูดกันตรง ๆ เราเตอร์คือฮอปเพิ่มอีกหนึ่งจุดในเส้นทางคำขอ และเป็นอีกฝ่ายหนึ่งในเส้นทางการไหลของข้อมูล — และในโมเดลนี้ นั่นไม่ใช่เรื่องสมมติ เพราะ ZDR ได้รับอนุมัติเป็นรายองค์กรที่ OpenAI และคำขอที่ผ่านการจัดเส้นทางจะไม่ได้รับการคุ้มครองโดยอัตโนมัติจากการอนุมัติ ZDR ของคุณ หากคุณกำลังส่งข้อมูลที่อยู่ภายใต้การกำกับดูแล ให้ยืนยันข้อกำหนดด้านข้อมูลของเส้นทางก่อนส่ง และเตรียมติดต่อผู้ให้บริการโดยตรงสำหรับเวิร์กโหลดนั้น การจัดเส้นทางยังเพิ่มองค์ประกอบที่อาจล้มเหลวหรือเพิ่มความหน่วง และทำให้การสลับโมเดลง่ายจนอาจเปลี่ยนสิ่งที่ตอบผู้ใช้ของคุณโดยไม่ตรวจสอบได้ ไม่มีข้อใดในนั้นที่มีน้ำหนักมากกว่าข้อโต้แย้งเรื่องการทดลองใช้และการย้อนกลับได้สำหรับทีมส่วนใหญ่ ทั้งหมดนี้คุ้มค่าที่จะรู้ก่อนคุณตัดสินใจว่าเราเตอร์นั้นไม่มีค่าใช้จ่าย เราเปรียบเทียบแพลตฟอร์มการจัดเส้นทางกันในบทความแยกต่างหาก แทนที่จะกล่าวถึงการเปรียบเทียบซ้ำที่นี่

สามคำถามที่ไม่ใช่คำตอบแบบอนุประโยคเดียว

ฉันสามารถ fine-tune GPT-6 Astra หรือใช้งานมันกับ Assistants API ได้หรือไม่ ไม่ได้ครับ ทั้งสองอย่าง และนี่คือขอบเขตเชิงการออกแบบ ไม่ใช่การตั้งค่าที่คุณมองข้ามไป หน้าโมเดลของ Ope​nAI ระบุว่า Chat Completions, Responses และ Batch เป็น endpoint ที่รองรับ และระบุอย่างชัดเจนว่า Fine-tuning และ Assistants เป็นสิ่งที่ไม่รองรับ อีกทั้งไม่มีแถว GPT-6 Astra ในตารางราคา fine-tuning ของ Ope​nAI หากสถาปัตยกรรมของคุณพึ่งพาโมเดลเรือธงที่ผ่านการ fine-tune แล้ว Astra ก็ต้องใช้วิธีป้อนพรอมต์แทน ซึ่งเป็นการย้ายต้นทุนจากการเทรนไปเป็นโทเค็นอินพุต และด้วยราคา $10.00 ต่อล้านโทเค็นสำหรับ system prompt ขนาดใหญ่ นั่นจึงเป็นรายการงบประมาณจริง ไม่ใช่แค่หมายเหตุท้ายหน้า

โมเดลจะปฏิเสธงานด้านความปลอดภัยที่ฉันได้รับอนุญาตให้ทำหรือไม่ บางครั้งก็ใช่ และควรรู้ไว้ก่อนที่คุณจะสร้าง GPT-6 Astra เป็นโมเดล OpenAI ตัวแรกที่ไปถึงเกณฑ์ขีดความสามารถด้านความมั่นคงปลอดภัยไซเบอร์ระดับวิกฤตภายใต้ Preparedness Framework ของบริษัท และเมื่อจัดส่งออกมา โมเดลจะปฏิเสธงานไซเบอร์ขั้นสูง เช่น การเขียน exploit แบบ proof-of-concept OpenAI กล่าวว่ามีแผนจะขยายการเข้าถึงด้วยมาตรการป้องกันที่เข้มงวดน้อยลงผ่านโครงการ Daybreak สำหรับฝ่ายป้องกัน สิ่งนี้จะปรากฏเป็นการปฏิเสธที่ไม่ใช่การจำกัดอัตราการเรียกใช้งานและไม่ใช่บั๊ก — ให้เผื่องบไว้ในระบบจัดการข้อผิดพลาดของคุณ แทนที่จะพยายามลองซ้ำเข้าไปในการปฏิเสธนั้น

ฉันจำเป็นต้องได้รับการอนุมัติพิเศษเพื่อเรียกใช้โมเดลนี้หรือไม่ ไม่จำเป็นสำหรับเอนด์พอยต์มาตรฐาน — ไม่มีรายการรอ และไม่มีขั้นตอนการอนุมัติเพื่อเรียก gpt-6-astra เพียงแค่มีบัญชีที่ผูกวิธีการเรียกเก็บเงินไว้ สิ่งที่คุณอาจต้องขออนุมัติคือทุกอย่างที่อยู่รอบ ๆ มัน: Zero Data Retention ซึ่งถูกควบคุมด้วยการสมัครเป็นรายกรณี; การเก็บข้อมูลในภูมิภาคนอกสหรัฐอเมริกา ซึ่งต้องมีข้อแก้ไขเพิ่มเติมของตัวเอง; และการเลื่อนระดับ tier หากคุณตั้งใจจะผลักดันปริมาณโทเค็นในระดับเอเจนต์ผ่านบัญชี Tier 1 โมเดลเป็นส่วนที่ง่ายที่สุดของการจัดซื้อจัดจ้าง

สิ่งที่ต้องจับตา และใครควรเคลื่อนไหวตอนนี้

ถ้าคุณกำลังสร้างบนโมเดลนี้ สี่สิ่งที่ควรจับตาดูนั้นล้วนอยู่ฝั่งผู้ขายและล้วนมีวันที่กำกับ ไม่ว่า OpenAI จะเผยแพร่สแนปช็อตที่มีวันที่สำหรับ gpt-6-astra หรือไม่ — ซึ่งจะเปลี่ยน id เปล่า ๆ ให้กลายเป็นเป้าที่เคลื่อนไหว และทำให้การ pin มีความหมาย ไม่ว่าเพดาน 272,000 โทเค็นจะขยับหรือไม่ เพราะบรรทัดเดียวนั้นส่งผลต่อบิลของคุณมากกว่าเบนช์มาร์กใด ๆ บนหน้านั้น ไม่ว่าอัตราของ Bedrock และ Foundry จะลู่เข้าหาหรือยังคงสูงกว่าลิสต์ของ OpenAI เพราะเรื่องนั้นกำหนดเส้นทางการจัดซื้อได้พอ ๆ กับตัวโมเดล และไม่ว่าโครงการ Daybreak จะเปลี่ยนสิ่งที่ endpoint จะปฏิเสธหรือไม่ ซึ่งสำหรับทีมความปลอดภัยแล้ว นั่นคือความแตกต่างระหว่างเครื่องมือที่ใช้งานได้จริงกับเดโม

ส่วนคำถามว่าใครควรลงมือนั้น การแบ่งฝ่ายชัดเจน ถ้าคุณจ่ายค่า GPT-5.6 Sol ในอัตราโปรโมชันอยู่แล้วสำหรับงานเอเจนต์ระยะยาว ตัวคูณ 2.5 เท่าก็เป็นของจริง และคำถามก็เหลือแคบ ๆ ข้อเดียว: อัตราการทำงานสำเร็จบนปริมาณงานของคุณเองนั้นชนะส่วนต่างราคาได้หรือไม่ ลองรันกับทราฟฟิกจริงสักส่วนหนึ่งแล้วดูเอาคำตอบ ตัวอย่างที่คำนวณให้ดูข้างต้นบอกคุณได้ว่าส่วนนั้นมีค่าใช้จ่ายเท่าไรก่อนที่คุณจะเริ่ม ถ้างานของคุณคือแชตบริบทสั้นหรือการจำแนกปริมาณมาก นี่ไม่ใช่โมเดลสำหรับคุณ การปรับราคาใหม่สำหรับบริบท{long และอัตราค่าเอาต์พุต 50.00 ดอลลาร์ทำให้มันเป็นวิธีที่แพงในการทำสิ่งที่ GPT-5.6 Luna ทำได้ในราคาเสี้ยวเดียว และถ้าคุณเป็นองค์กรที่มีข้อกำหนดด้านการปฏิบัติตามกฎระเบียบ ให้เริ่มคุยเรื่อง ZDR ก่อน เพราะมันเป็นตัวกำหนดส่วนลด Batch ค่าเพิ่มสำหรับการเก็บข้อมูลในพื้นที่ และการเลือกเส้นทางของคุณ และไม่มีสิ่งใดในนั้นเป็นสิ่งที่คุณตัดสินใจได้ในวันที่คุณต้องการมัน

การเปรียบเทียบในบทความนี้2

ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube