
Step 5 Preview so với GPT-6 Astra: Giá đầu vào gấp mười lần để đổi lấy chín điểm chỉ số
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0345Trí tuệ76Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Hai mô hình này được công bố cách nhau mười bảy ngày và được định giá như thể dành cho hai hành tinh khác nhau. Step 5 Preview, mô hình hỗn hợp chuyên gia thưa 600 tỷ tham số của StepFun công bố ngày 20 tháng 9 năm 2026, thu 1,00 USD mỗi triệu token đầu vào và 2,70 USD mỗi triệu token đầu ra. GPT-6 Astra, mẫu flagship của nhà cung cấp ra mắt ngày 3 tháng 9 năm 2026, thu 10,00 USD và 50,00 USD cho cùng đơn vị đó khi đầu vào dưới ngưỡng 272K token — và 20,00 USD cùng 75,00 USD khi vượt ngưỡng. Đó là gấp mười lần giá đầu vào và khoảng mười tám lần giá đầu ra cho một mô hình đạt điểm cao hơn chín điểm trên Chỉ số Thông minh độc lập, 53 so với 44. Việc Astra có tốt hơn hay không thì không còn gì phải bàn. Nhưng liệu khoảng cách đó có đáng để trả thêm ba mươi đô-la mỗi triệu token đầu ra trên khối lượng công việc của bạn hay không thì lại là chuyện khác, và câu trả lời sẽ thay đổi hai lần trong suốt bài viết này.
Mỗi mô hình dùng để làm gì
Step 5 Preview được xây dựng và bán cho công việc agentic: lập trình AI, kỹ thuật phần mềm, công việc tri thức chuyên nghiệp, tài chính. Kiến trúc được tinh chỉnh cho việc đó — tổng cộng 600B tham số với khoảng 27B hoạt động trên mỗi token, ngữ cảnh 1M token, đầu vào văn bản và hình ảnh, cùng khả năng suy luận với chế độ suy nghĩ mở rộng. StepFun đã bỏ qua toàn bộ dòng Step 4.x để đến đây, chuyển thẳng từ Step-3.7-Flash sang Step 5.
GPT-6 Astra là mô hình chủ lực đa dụng của OpenAI: ngữ cảnh 1M token, đầu ra tối đa 128K token, đầu vào dạng văn bản, hình ảnh và tệp, đầu ra dạng văn bản, điểm cắt kiến thức là ngày 30 tháng 4 năm 2026, và hỗ trợ các quy trình suy luận, lập trình và tác tử. Đây là mô hình mà doanh nghiệp tìm đến khi câu trả lời phải chính xác và hóa đơn token không phải là ràng buộc giới hạn.
• Chỉ số Trí tuệ — Step 5 Preview 44 so với GPT-6 Astra 53
• Tham số — Step 5 Preview tổng 600B / 27B kích hoạt so với GPT-6 Astra không được tiết lộ
• Ngữ cảnh và giới hạn đầu ra — cả hai đều có ngữ cảnh 1M token; Astra liệt kê cửa sổ 1,050,000 token và giới hạn đầu ra 128K, StepFun chưa công bố giới hạn đầu ra nào
• Phương thức đầu vào — văn bản và hình ảnh so với văn bản, hình ảnh và tệp
• Tốc độ đầu ra — Step 5 Preview 99,8 token/giây so với GPT-6 Astra 59,3 token/giây
• Giá trên mỗi 1 triệu token — $1.00 đầu vào / $2.70 đầu ra so với $10.00 đầu vào / $50.00 đầu ra khi đầu vào dưới 272K, tăng lên $20.00 / $75.00 khi trên mức đó
• Cache — Step 5 Preview giảm giá 95% so với GPT-6 Astra, mức giảm 90% cho lượt đọc với giá ghi vào bộ đệm $12,50 mỗi triệu
• Chi phí mỗi tác vụ Intelligence Index — Step 5 Preview $0.71 so với GPT-6 Astra $3.26

Hóa đơn, từng dòng một
Giá của Step 5 Preview là cố định và rẻ: 1,00 USD đầu vào, 2,70 USD đầu ra, với mức giảm giá bộ nhớ đệm 95% khiến đầu vào được lưu trong bộ nhớ đệm chỉ còn gần 0,05 USD mỗi triệu token. Với tỷ lệ trúng bộ nhớ đệm 7:2:1 cho hỗn hợp đầu vào và đầu ra — quy ước mà blog này dùng cho lưu lượng tác nhân — mức giá hỗn hợp rơi vào khoảng 0,51 USD mỗi triệu token, và chi phí cho mỗi tác vụ Intelligence Index là 0,71 USD, đứng thứ 27 trong số 200. Điều cần lưu ý là độ dài dòng: mô hình tạo ra 160M token đầu ra trên Index đó so với mức trung vị 92M, nên số token thô cao hơn mức mà giá niêm yết gợi ý.
Giá của GPT-6 Astra được chia theo bậc, và bậc chính là phần đáng đọc kỹ. Dưới 272K token đầu vào mỗi yêu cầu, mức giá là $10.00 và $50.00; trên ngưỡng đó là $20.00 và $75.00. Bậc được chọn dựa trên số token đầu vào của chính từng yêu cầu, điều này quan trọng hơn vẻ ngoài của nó đối với một mô hình được bán với ngữ cảnh 1M token — một lệnh gọi ngữ cảnh lớn duy nhất vượt qua ranh giới và nhân đôi mức giá cho toàn bộ yêu cầu. Đọc bộ nhớ đệm tốn $1.00 mỗi triệu, tức mức giảm giá 90%, và ghi bộ nhớ đệm tốn $12.50 mỗi triệu. Với cùng tỷ lệ pha trộn 7:2:1, mức giá hỗn hợp rơi vào khoảng $7.70 mỗi triệu token, và chi phí cho mỗi tác vụ Index là $3.26, đứng thứ 71 trong số 200.
Astra lại đi ngược lại về độ dài dòng, và nó là mô hình ngắn gọn ở đây: 60M token đầu ra trên Index so với 160M của Step 5 Preview, đứng thứ 27 trong 200 ở chỉ số đó. Ít token hơn với mức giá cao hơn thu hẹp khoảng cách theo cách mà bội số thô phóng đại. Nó không khép lại được khoảng cách đó — con số chi phí trên mỗi tác vụ đã tính gộp cả độ dài dòng, hành vi cache và giá cả lại với nhau, và $3.26 so với $0.71 vẫn là chênh lệch 4,6 lần.
Chín điểm chỉ số mua được những gì
Các con số nổi bật của Astra là do chính OpenAI đưa ra và chưa được tái lập: 96.1 trên GPQA Diamond, 72.6% trên OSWorld 2.0, 97.6% trên FrontierMath Tier 4, 57.2% trên Humanity's Last Exam khi dùng công cụ, và khoảng 57.9% trên Terminal-Bench 4.0. Con số ARC-AGI-3 là con số cần xử lý cẩn thận — OpenAI báo cáo 99.9% theo harness bộ điều hợp nhà cung cấp của chính mình và 62.7% trên harness tiêu chuẩn, và mức chênh lệch 37 điểm giữa các harness là một nhận định về harness ít nhất cũng nhiều như về mô hình.
Các con số được công bố của Step 5 Preview cũng nằm trong cùng một khoảng trên những tác vụ agentic mà nó được xây dựng để xử lý, và cũng đi kèm lưu ý tương tự: 33,3% trên Terminal-Bench 4.0, 80,5 trên ProgramBench, 67,7 trên DeepSWE v1.1 và 49,0 trên StepCodeBench, tất cả đều từ StepFun và không con số nào được tái lập một cách độc lập. Nhà cung cấp khác nhau, khung đánh giá khác nhau, không có lần chạy chung nào — đó chính xác là lý do vì sao khoảng cách chín điểm được đo độc lập lại là con số hữu ích hơn bất kỳ con số nào trong số này.
Khoảng cách đó là thật và nó không hề nhỏ. Trên một bảng xếp hạng 200 mô hình, 53 và 44 nằm ở vị trí thứ ba và thứ hai mươi tư, và sự tách biệt thể hiện ở một loại tác vụ khác chứ không phải ở điểm số khác trên cùng một tác vụ: những chiến thắng được Astra công bố tập trung vào suy luận dài hạn và sử dụng máy tính, đúng nơi nhóm dẫn đầu bảng bứt phá. Nếu khối lượng công việc của bạn nằm ở đó, chín điểm đáng giá hơn hóa đơn.
Một lưu ý về điểm số của Astra. Artificial Analysis có điều chỉnh Intelligence Index, và các con số cho cùng một mô hình có thể xê dịch giữa các bản chụp được thực hiện cách nhau vài tuần — 52,8, 53 và 54,7 đều xuất hiện trong tài liệu công bố về mô hình này trong cùng một tháng. Con số 53 trên trang mô hình hiện tại là con số nên dùng, và bất kỳ so sánh nào đặt một bản chụp Astra cũ bên cạnh một con số Step 5 Preview hiện tại là đang đo bằng hai cây thước khác nhau.

Tốc độ và độ trễ là hai câu hỏi khác nhau
Về tốc độ tạo, bảng độc lập là rõ ràng: 99,8 token đầu ra mỗi giây cho Step 5 Preview so với 59,3 cho GPT-6 Astra, cũng chậm hơn mức trung bình 70 token mỗi giây của các mô hình được đo. Trong một vòng lặp lập trình tương tác, đó là sự khác biệt giữa một gợi ý và một khoảng dừng, và nó tích lũy qua một phiên như cách giảm giá bộ nhớ đệm vậy.
Độ trễ là câu chuyện phức tạp hơn, và một con số đơn lẻ sẽ gây hiểu nhầm về nó. Astra định tuyến phần suy luận trước khi phát ra, nên thời gian đến token đầu tiên và thời gian đến một câu trả lời dùng được không phải là cùng một phép đo, và các con số được công bố cho nó chênh lệch rất rộng tùy thuộc vào việc phần suy luận có được tính hay không. Trên lưu lượng của chính chúng tôi trong bảy ngày qua, thời gian đến token đầu tiên trung vị của GPT-6 Astra là 6,72 giây với phân vị thứ 95 là 10,00 giây — con số mà người gọi thực sự trải nghiệm qua endpoint của chúng tôi. Artificial Analysis đưa ra thời gian đến token đầu tiên của Step 5 Preview là 2,96 giây trên harness riêng của họ, và hai con số đó không được đo theo cùng một cách, nên không nên trừ chúng cho nhau.
Nơi sự bất đối xứng cache thực sự diễn ra
Cả hai mô hình đều giảm giá mạnh cho các tiền tố lặp lại và cả hai đều tính phí khi ghi chúng, và sự khác biệt giữa chúng là gấp 20 lần ở phần đọc. Mức giảm giá bộ nhớ đệm 95% của Step 5 Preview đưa đầu vào được lưu trong bộ nhớ đệm xuống gần $0.05 mỗi triệu token. GPT-6 Astra đọc bộ nhớ đệm với giá $1.00 mỗi triệu — mức giảm giá 90% so với mức giá cơ bản cao gấp mười lần — và ghi vào bộ nhớ đệm với giá $12.50 mỗi triệu.
Đối với một vòng lặp agent gửi lại cùng một system prompt và ngữ cảnh kho mã ở mỗi lượt, chính tốc độ đọc (read rate) là thứ tích lũy, và mức chiết khấu sâu hơn trên mô hình rẻ hơn có giá trị lớn hơn mức chiết khấu nông hơn trên mô hình đắt đỏ. Mức pha trộn của Astra vẫn nằm quanh 7,70 đô la mỗi triệu token, so với 0,51 đô la của Step 5 Preview ở cùng tỷ lệ pha 7:2:1 — một chênh lệch gấp mười lăm lần mà một phiên dài không thu hẹp lại được mà còn nới rộng thêm.
Chạy cả hai từ một phím
GPT-6 Astra đã có mặt trên OrcaRouter với mã openai/gpt-6-astra ở đúng mức giá niêm yết của OpenAI — 10,00 USD và 50,00 USD mỗi triệu token dưới ngưỡng 272K, 20,00 USD và 75,00 USD trên ngưỡng đó — được chuyển tiếp nguyên giá, không cộng thêm bất kỳ khoản phụ trội nào, nên khi nhà cung cấp thay đổi giá thì phía chúng tôi cập nhật ngay trong cùng ngày thay vì phải chờ đến kỳ thanh toán kế tiếp. Dữ liệu đo từ xa bảy ngày của chính chúng tôi trên endpoint đó cho thấy thời gian đến token đầu tiên trung vị là 6,72 giây và phân vị 95 là 10,00 giây như nêu ở trên, cùng với 277,9 triệu token lưu lượng đi qua endpoint này trong tuần vừa qua.
Step 5 Preview không có trong danh mục của chúng tôi và chúng tôi không định tuyến nó. Nó chạy trên API và Studio riêng của StepFun, và đó là nơi duy nhất nó chạy cho đến khi mốc kiểm tra ngày 15 tháng 10 đến. Sự bất đối xứng đó không phải là một khiếm khuyết của phép so sánh; nó chính là phép so sánh. Nửa rẻ hơn của cuộc đối đầu này là nửa bạn phải đi nơi khác để gọi, còn nửa bạn có thể đưa vào sản xuất ngay hôm nay nằm sau một API cho hơn 200 mô hình: GPT-6 Astra ở mức giá trên, GLM-5.3 với $1.26 và $3.96, DeepSeek V4 Pro, Claude Opus 5 và phần còn lại, cùng với khả năng chuyển đổi dự phòng tự động giữa các nhà cung cấp giữ cho đường đi luôn ổn định khi năng lực của một nhà cung cấp thay đổi, và DSL định tuyến cho phép một tác vụ khởi đầu với chi phí thấp rồi chỉ nâng cấp khi buộc phải làm vậy. Quy tắc nâng cấp đó chính là câu trả lời thực sự cho khoảng cách giá gấp mười lần: phần lớn khối lượng công việc không cần đến đỉnh bảng xếp hạng, và một lớp định tuyến là cách bạn ngừng trả tiền cho phần không cần đến.

Ai nên chọn cái nào
Nếu khối lượng công việc của bạn là một tác nhân dài hạn phải hoàn thành đúng một nhiệm vụ khó — sử dụng máy tính, nghiên cứu nhiều bước, công việc mà một câu trả lời sai tốn kém hơn số token — thì lợi thế chín điểm của GPT-6 Astra là phần rẻ nhất trong quyết định, và hóa đơn mới là cái giá của năng lực đó. Hãy chạy nó như mục tiêu leo thang, không phải lựa chọn mặc định, và để ý ngưỡng 272K: một yêu cầu quá khổ duy nhất sẽ tăng gấp đôi đơn giá cho mọi thứ trong đó.
Nếu khối lượng công việc của bạn là văn bản agentic quy mô lớn — sinh mã, tái cấu trúc mã, trích xuất có cấu trúc, vòng lặp bên trong của một trợ lý lập trình — thì Step 5 Preview đang dẫn đầu ở mọi thứ mà hóa đơn và đồng hồ quan tâm, và chín điểm chỉ số khó lòng trụ nổi khi chạm trán với một phân bố tác vụ không nằm ở đỉnh bảng xếp hạng. Vấn đề không nằm ở hiệu năng: mô hình này là độc quyền, không có giấy phép được công bố, không có quyền sử dụng thương mại và không có checkpoint nào cho đến ngày 15 tháng 10. Bạn có thể gọi nó; bạn không thể sở hữu, tinh chỉnh hay phát hành một sản phẩm phái sinh từ nó.
Nếu câu trả lời không rõ ràng, thì mô hình ở đây là chia tầng chứ không phải chọn một bên. Định tuyến lưu lượng thông thường đến một mô hình tầm trung và để dành Astra cho những yêu cầu cần đến mức cao nhất — cả hai đầu của quy tắc đó đều nằm sau một khóa duy nhất ở phía chúng tôi, nên việc chia tách chỉ tốn một quy tắc định tuyến chứ không phải thêm một hợp đồng thứ hai. Trả mức giá của dòng flagship cho công việc mà một mô hình tầm trung vẫn hoàn thành chính xác mới là sai lầm mà so sánh này thực sự muốn nói tới.
