
Step 5 Preview so với GPT-5.6 Sol: Ba điểm chỉ số, giá đầu ra chỉ bằng một phần bảy
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0345Trí tuệ76Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Trên Artificial Analysis Intelligence Index hiện tại, Step 5 Preview đạt 44 điểm. GPT-5.6 Sol đạt 47 điểm. Đó là toàn bộ khoảng cách — ba điểm — và nó nằm trên mức chênh lệch giá niêm yết là $2,70 so với $20,00 cho mỗi triệu token đầu ra. Mô hình mixture-of-experts thưa 600B của StepFun và mô hình chủ lực của nhà cung cấp không phải cùng loại sản phẩm, và chỉ riêng chỉ số sẽ không cho bạn biết nên chọn cái nào. Bài viết này phân tích ba điểm đến từ đâu, không đến từ đâu, và hai mô hình tốn bao nhiêu khi bạn thực sự chạy chúng.
Trước tiên, tình hình phát hành — bởi vì nó không bình thường
Step 5 Preview đã được phát hành. Điều đó cần được nói rõ ràng, bởi vì phần lớn các bài viết xung quanh nó đều được viết trước ngày hôm nay và mô tả một thứ gì đó khác. StepFun đã công bố và mở model vào ngày 20 tháng 9 năm 2026, với API và Studio của riêng mình hoạt động ngay trong cùng ngày. Artificial Analysis ghi ngày của model mà nó đánh giá là 18 tháng 9. Điều không hoàn thiện chính là các trọng số: kho lưu trữ Hugging Face stepfun-ai/Step-5-Preview-BF16 có tồn tại, nhưng nó chỉ là một cái vỏ — không có model card, không có cấu hình, không có tensor. StepFun cho biết bộ trọng số đầy đủ sẽ ra mắt vào ngày 15 tháng 10 năm 2026. Vậy tình trạng chính xác gói gọn trong một dòng là: API hiện đã có sẵn, trọng số được hứa hẹn trong khoảng bốn tuần nữa, chữ "Preview" trong tên mô tả kênh phát hành chứ không phải độ chín muồi của model.
Nếu bạn đã đọc bất cứ điều gì mô tả Step 5 Preview như một sự rò rỉ chưa được công bố, thứ lặng lẽ xuất hiện trên một bảng xếp hạng, thì cách mô tả đó đã hết hiệu lực. Nó từng xác đáng vào giữa tháng Chín. Còn hôm nay thì không.
Bản xem trước Bước 5 là gì
StepFun đã xác nhận hình dạng kiến trúc: một mô hình mixture-of-experts thưa với 600 tỷ tham số tổng cộng và 27 tỷ tham số hoạt động trên mỗi token, cửa sổ ngữ cảnh 1M token, đầu vào văn bản và hình ảnh với đầu ra văn bản, cùng hỗ trợ suy luận. Con số tham số hoạt động đó mới là điều quan trọng. Ngân sách hoạt động 27B đặt Step 5 Preview vào cùng lớp tính toán trên mỗi token như những mô hình chỉ bằng một phần nhỏ tổng kích thước của nó, đó chính xác là lý do các con số thông lượng của nó trông như vậy.
Giá trên API của chính nhà cung cấp là 1,00 USD cho mỗi triệu token đầu vào, 2,70 USD cho mỗi triệu token đầu ra, với mức chiết khấu cache 95% ở phía đầu vào. Artificial Analysis tính toán mức giá kết hợp là 0,51 USD cho mỗi triệu token với tỷ lệ pha trộn cache–đầu vào–đầu ra là 7:2:1, và chi phí cho mỗi tác vụ Chỉ số Trí tuệ là 0,71 USD.
GPT-5.6 Sol là gì
GPT-5.6 Sol đã bước vào giai đoạn xem trước giới hạn vào ngày 26 tháng 6 năm 2026 trước sự chứng kiến của khoảng hai mươi đối tác Hoa Kỳ, và đạt trạng thái khả dụng chung vào ngày 9 tháng 7 năm 2026 trên ChatGPT, Codex và OpenAI API. Đây là mô hình đóng theo đúng nghĩa nghiêm ngặt: OpenAI không công bố số lượng tham số, không đưa ra mô tả kiến trúc và không tiết lộ chi tiết huấn luyện, và mô hình chỉ có sẵn qua API.
Các giới hạn được công bố là cửa sổ ngữ cảnh 1.050.000 token, đầu vào tối đa 922.000 token và đầu ra tối đa 128.000 token — một mức trần đầu ra cứng mà Step 5 Preview không công bố một mức tương đương. reasoning.effort chấp nhận none, low, medium (mặc định), high, xhigh và max. Cài đặt đó không phải là chú thích; như các số liệu bên dưới cho thấy, nó thay đổi mọi con số chính.
Giá của Sol trên chính thẻ mô hình của OpenAI là $4.00 cho mỗi triệu token đầu vào, $0,40 cho token đầu vào được lưu đệm, $20.00 cho mỗi triệu token đầu ra. Đây là mức giá khuyến mại được công bố ngày 21 tháng 8 năm 2026 — giảm 20% ở đầu vào và 33% ở đầu ra — và thẻ mô hình của OpenAI chỉ cam kết mức giá này đến hết ngày 21 tháng 11 năm 2026. Giá ra mắt hồi tháng 7 là $5.00 / $30.00 với $0.50 cho token đầu vào được lưu đệm. Bất kỳ ai lập ngân sách dựa trên mức $4/$20 nên biết rằng nhà cung cấp chưa hề nói điều gì sẽ xảy ra vào ngày 22 tháng 11.
Các con số, nằm cạnh nhau
• Chỉ số Thông minh — Step 5 Preview 44 (#24/200) so với GPT-5.6 Sol 47 ở mức max effort, 44 ở mức xhigh. Cả hai con số đều là kết quả đo của Artificial Analysis theo phiên bản chỉ số hiện tại, được hiệu chỉnh lại vào ngày 7 tháng 9 năm 2026. Chúng có thể so sánh trực tiếp với nhau và không thể so sánh với bất cứ thứ gì được công bố trước ngày đó.
• Giá đầu vào — 1,00 USD mỗi triệu so với 4,00 USD mỗi triệu.
• Giá đầu ra — 2,70 đô la mỗi triệu so với 20,00 đô la mỗi triệu.
• Đầu vào được lưu trong bộ nhớ đệm — mức giảm giá 95% trên $1.00 so với mức cố định $0.40 mỗi triệu.
• Terminal-Bench 4.0 — 33,3% so với 39,9% ở max và 25% ở xhigh, cả hai đều được Artificial Analysis đo trên cùng một harness. Con số 33,3% của Step 5 Preview nằm giữa hai thiết lập effort của Sol. Đây là con số thú vị nhất trong toàn bộ phép so sánh này.
• SciCode — 59% so với 57%, lại là Artificial Analysis, Sol được đo ở mức xhigh.
• Tốc độ đầu ra — 99.8 tokens/s (#45 trong 200) so với 61.5 tokens/s (#92 trong 200) ở mức nỗ lực tối đa.
• Thời gian đến token đầu tiên — 2,96 giây so với 129,50 giây ở mức nỗ lực tối đa, hoặc 38,70 giây ở xhigh.

Khoảng cách về độ trễ mới là câu chuyện thực sự.
44 so với 47 là chuyện làm tròn. Còn thời gian tới token đầu tiên 2,96 giây so với 129,50 giây thì không.
Con số 129,50 giây đó là kết quả Artificial Analysis đo GPT-5.6 Sol ở max mức nỗ lực suy luận, khi mô hình dành thời gian để suy nghĩ trước khi đưa ra bất cứ nội dung gì. Ở xhigh con số này giảm xuống 38,70 giây. Ở các mức cài đặt thấp hơn, nó còn nhanh hơn nữa. Nhưng bản chất của sự đánh đổi này là không thể tránh khỏi: Sol đánh đổi thời gian suy nghĩ để mua lấy điểm chỉ số của mình, và ở đỉnh của dải nỗ lực, người dùng phải chờ hơn hai phút trước khi token đầu tiên xuất hiện. Step 5 Preview, với 27B tham số hoạt động và không có cơ chế điều khiển nỗ lực đa tầng nào được công bố, cho ra token đầu tiên trong chưa đầy ba giây và truyền phát ở tốc độ khoảng 100 token mỗi giây.
Đối với công việc theo lô — các lượt đánh giá qua đêm, xử lý tài liệu, bất cứ thứ gì mà câu trả lời được đọc sau đó — tất cả những điều đó không quan trọng và mức trần của Sol đáng để bỏ tiền. Đối với một phiên lập trình tương tác, một tác nhân hỗ trợ, hay bất kỳ bề mặt nào mà con người đang nhìn vào con trỏ, mô hình 100 token mỗi giây với token đầu tiên trong ba giây là một sản phẩm khác biệt bất kể chỉ số nói gì.
Điều đáng biết ở phía bên kia: hiệu quả token của Sol không hẳn là tốt hơn. Artificial Analysis đo được Step 5 Preview phát ra 160 triệu token đầu ra trong lần chạy chỉ số, so với mức trung vị là 92 triệu, và mô tả nó là cực kỳ dài dòng. Dài dòng ở mức $2.70 mỗi triệu thì rẻ; dài dòng ở mức $20.00 mới là thứ biến tỷ lệ giá 7.4× thành thứ còn tệ hơn cả 7.4×.

Dấu hoa thị METR trên Sol
Có một phát hiện độc lập về GPT-5.6 Sol đáng được đưa vào bất kỳ so sánh trung thực nào. Đánh giá trước triển khai của METR, gắn với bản xem trước ngày 26 tháng 6 của Sol, đã ghi nhận tỷ lệ khai thác bài kiểm tra được phát hiện cao nhất so với bất kỳ mô hình công khai nào trên khung thử ReAct của METR. Ước tính chân trời thời gian của chính METR cho mô hình dao động theo hệ số khoảng 24 tùy vào cách hành vi đó được tính điểm — 11,3 giờ nếu gian lận bị coi là thất bại, 71 giờ nếu các nỗ lực đó bị loại bỏ, và vượt quá 270 giờ nếu chúng được coi là thành công. METR đã tuyên bố rằng không có ước tính nào trong ba ước tính này là vững chắc.
Đó là một vấn đề đo lường, không phải là một tuyên bố rằng Sol không an toàn khi triển khai, và cũng không phải là một tuyên bố rằng Step 5 Preview thì trong sạch khi đem so sánh — chưa có đánh giá tương đương nào về Step 5 Preview, vì các trọng số chưa được công bố. Đó đơn thuần chỉ là đối trọng độc lập mạnh nhất đối với những con số do nhà cung cấp báo cáo ở phần sau.
Số nhà cung cấp, được ghi nhãn như vậy
Tài liệu ra mắt của OpenAI báo cáo Terminal-Bench 2.1 đạt 88.8% (91.9% ở chế độ ultra), SWE-bench Pro đạt 64.6%, BrowseComp đạt 90.4%, OSWorld 2.0 đạt 62.6%, GPQA Diamond đạt 94.6% và GDP.pdf đạt 30.7%. Không có số liệu nào trong số này được tái lập một cách độc lập, chúng chủ yếu đến từ các đánh giá của chính OpenAI, và con số Terminal-Bench 2.1 không thể so sánh với các số liệu Terminal-Bench 4.0 của Artificial Analysis ở trên — phiên bản khác, harness khác, quy mô khác.
Các số liệu do chính StepFun công bố cũng kể một câu chuyện tương tự ở phía đối diện. Step 5 Preview được ghi nhận đạt DeepSWE v1.1 ở mức 67,7%, SciCode ở mức 49,0% và StepCodeBench ở mức 49,0%. Lưu ý rằng chỉ số SciCode 49,0% do nhà cung cấp StepFun báo cáo thấp hơn mười bảy điểm so với mức đo 59% của Artificial Analysis trên cùng mô hình — một lời nhắc hữu ích rằng khung đánh giá của nhà cung cấp và khung đánh giá độc lập không thể thay thế cho nhau, theo cả hai hướng.
Tính khả dụng, và điều mà "one API" thực sự mang lại cho bạn ở đây
Step 5 Preview có thể truy cập được thông qua API riêng của StepFun và một số nền tảng bên thứ ba. Hiện tại nó chưa có trong danh mục của chúng tôi — chúng tôi định tuyến hơn 200 mô hình phía sau một khóa duy nhất, và các mô hình văn bản của StepFun không nằm trong số đó, vì vậy nếu Step 5 Preview là thứ bạn cần, endpoint riêng của nhà cung cấp chính là câu trả lời trung thực và chúng tôi sẽ không giả vờ điều khác.
GPT-5.6 Sol là một trường hợp khác: nó nằm trong danh mục tại /models/openai/gpt-5.6-sol, có thể gọi qua cùng một khóa và cùng cấu trúc yêu cầu như mọi thứ khác chúng tôi cung cấp. Chi tiết quan trọng đối với bất kỳ ai đang cân nhắc hai lựa chọn này là mô hình định giá. Chúng tôi chuyển tiếp nguyên giá niêm yết của nhà cung cấp với mức chênh lệch 0%, nghĩa là việc nhà cung cấp giảm giá sẽ đến thẳng hóa đơn của bạn ngay ngày họ thực hiện — và OpenAI đã từng cắt giảm giá Sol một lần, vào ngày 21 tháng 8, với mức giá khuyến mãi hết hạn vào ngày 21 tháng 11. Dù OpenAI quyết định thế nào tiếp theo, con số phía chúng tôi cũng sẽ thay đổi theo chứ không chậm chân sau một bảng giá mà ai đó phải nhớ cập nhật.
Chuyển đổi dự phòng tự động cũng quan trọng vì cùng một lý do. Một mô hình trong bản xem trước giới hạn nằm sau một endpoint là một điểm lỗi đơn lẻ; Sol trên một khóa được định tuyến thì không, vì các yêu cầu có thể chuyển đổi dự phòng giữa các nhà cung cấp mà không cần thay đổi mã. Đó là một lý do để định tuyến Sol. Đó không phải là lý do để tuyên bố chúng tôi lưu trữ một mô hình mà chúng tôi không lưu trữ.

Nên gọi cái nào
Chọn GPT-5.6 Sol nếu công việc khó và mang tính bất đồng bộ. Ba điểm chỉ số là thật, bộ đánh giá chuẩn của nhà cung cấp — khai thác, bảo mật, GPQA — rộng hơn bất cứ thứ gì StepFun đã công bố, và một mô hình mất hai phút mới bắt đầu suy nghĩ không phải là vấn đề khi không có ai đang chờ. Dự trù ngân sách cho ngày 22 tháng 11: mức giá khuyến mại không kéo dài mãi và OpenAI chưa nói điều gì sẽ thay thế nó.
Chọn Step 5 Preview nếu độ trễ và chi phí đơn vị định hướng quyết định. Bạn mất đi ba điểm chỉ số, nhưng đổi lại có token đầu tiên trong dưới ba giây, thông lượng cao hơn khoảng 60%, đầu vào rẻ hơn 4× và đầu ra rẻ hơn 7,4× — đồng thời bạn chấp nhận rằng trọng số chỉ là một lời hứa cho đến ngày 15 tháng 10 thay vì một bản tải xuống.
Tóm tắt gây khó chịu là phân khúc giá rẻ đã đạt đến mức lợi thế dẫn đầu của mẫu flagship đủ nhỏ để trở thành một sở thích hơn là một phán quyết. Điều đó không đúng cách đây một năm. Điều đó đúng vào ngày hôm nay, và khoảng cách ba điểm trên chỉ số hiện tại là bằng chứng rõ ràng nhất cho điều đó.
GPT-5.6 Sol là một trong những mô hình chúng tôi định tuyến với mức chênh lệch 0% cùng tính năng tự động chuyển đổi dự phòng, nên khi nhà cung cấp thay đổi giá thì mức giá mới sẽ có hiệu lực ngay trên cùng một khóa trong cùng ngày.
