Thẻ tiêu đề hero cho bản so sánh GPT-6 và Kimi K3. Dòng tiêu đề ghi 'GPT-6 so với Kimi K3'. Một chip ghi 'Kimi K3: ngữ cảnh 1,048,576, $3.00 / $15.00, phát hành ngày 2026-07-15'. Một chip-6 Sol: ngữ cảnh 1,050,000, $2.00 / $10.00'. Chân trang ghi 'Cả hai đều nhận đầu vào; chúng định giá và tính điểm khác nhau.'
Guides & Insights

GPT-6 so với Kimi K3: Hai mô hình hai triệu token chuyên biệt hóa theo những cách khác nhau

Tác giả

Elias Hawthorne

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

GPT-6 Sol và Kimi K3 là hai mô hình có khả năng cao nhất được đưa vào danh sách rút gọn cho cùng một công việc: cửa sổ ngữ cảnh một triệu token, đầu vào hình ảnh, và mức giá khiến tài liệu dài trở nên khả thi về chi phí. Chúng đạt được điều đó từ hai hướng đối lập. Kimi K3 là chuyên gia ngữ cảnh dài của MoonshotAI, ra mắt ngày 15 tháng 7 năm 2026, và hồ sơ năng lực của nó được xây dựng xoay quanh khả năng hồi tưởng — nó đạt 88,7% trong bài kiểm tra khả năng hồi tưởng ngữ cảnh dài của Artificial Analysis, vượt qua mọi mô hình từ nhà cung cấp mà chúng ta có thể so sánh với nó. GPT-6 Sol là mô hình đa dụng tầm trung của nhà cung cấp, được phát hành ngày 22 tháng 9 năm 2026 với giá 2,00 USD mỗi triệu token đầu vào và 10,00 USD mỗi triệu token đầu ra, và lợi thế của nó là độ bao quát: cửa sổ lớn hơn một chút, chỉ số tổng hợp suy luận tổng quát cao hơn, và token đầu ra rẻ hơn.

Vậy cách đặt vấn đề trung thực không phải là tốt hơn so với kém hơn. Mà là truy hồi so với suy luận, và điều đó được quyết định bởi việc bạn đang làm gì với một triệu token sau khi đã nạp chúng.

Các cửa sổ đều có cùng kích thước trên giấy.

Cả hai card đều ghi khoảng một triệu token, và khác biệt chỉ là bề ngoài. Cửa sổ của Kimi K3 là 1.048.576 token — đúng bằng 2^20, con số "triệu" theo hệ nhị phân mà mọi mô hình ngữ cảnh dài đều viện dẫn. Còn của GPT-6 Sol là 1.050.000, một con số thập phân tròn trịa, lớn hơn khoảng 1.400 token. Với bất kỳ khối lượng công việc nào bạn thực sự chứa vừa, đó vẫn là cùng một cửa sổ. Đừng chọn dựa trên điều này.

Điều khác biệt lại nằm ở phần còn lại của phong bì, và đó là một danh sách ngắn.

• Ngữ cảnh: Kimi K3 1.048.576 token, GPT-6 Sol 1.050.000 — thực tế là tương đương
• Phương thức đầu vào: Kimi K3 chấp nhận văn bản và hình ảnh; GPT-6 Sol chấp nhận văn bản, hình ảnh và tệp
• Giới hạn đầu ra: GPT-6 Sol 128.000 token trong một phản hồi; thẻ của Kimi K3 không công bố con số đầu ra tối đa
• Giá tiêu chuẩn: Kimi K3 3,00 USD vào / 15,00 USD ra mỗi triệu, GPT-6 Sol 2,00 USD vào / 10,00 USD ra
• Đầu vào được lưu đệm: Kimi K3 0,30 USD mỗi triệu, GPT-6 Sol 0,20 USD mỗi triệu
• Định giá ngữ cảnh dài: Kimi K3 niêm yết một mức giá duy nhất, không có bậc nào được ghi nhận; GPT-6 Sol định giá lại toàn bộ yêu cầu trên 272.000 token đầu vào thành 4,00 USD vào / 15,00 USD ra
• Các điều khiển suy luận: GPT-6 Sol cung cấp reasoning.effort có thể cấu hình; Kimi K3 cung cấp các tham số suy luận và nỗ lực suy luận thông qua cùng giao diện tương thích OpenAI

Việc thiếu trần đầu ra trên Kimi K3 đáng được nêu ra hơn là che lấp đi: MoonshotAI công bố một con số ngữ cảnh và không công bố con số đầu ra tối đa, nên một hệ thống phụ thuộc vào giới hạn đầu ra cứng để lập ngân sách không thể đọc được con số đó từ thẻ thông số. Tầng ngữ cảnh dài là điểm bất đối xứng còn lại, và nó đi theo một hướng phản trực giác — mức giá niêm yết của GPT-6 Sol thấp hơn, nhưng việc định giá lại toàn bộ yêu cầu trên 272K của nó nghĩa là một cuộc gọi 300.000 token bị tính ở $4.00 / $15.00 ngay từ token đầu tiên, trong khi mức giá đơn nhất $3.00 / $15.00 của Kimi K3 không được tài liệu hóa là có bước tăng nào cả. Với một tài liệu rất dài, Kimi K3 có thể hóa ra lại rẻ hơn trong hai lựa chọn về chi phí đầu vào bất chấp mức giá niêm yết cao hơn.

Recall là sản phẩm thực sự của Kimi K3

Lý do để chọn Kimi K3 không phải là nó có cửa sổ lớn — một số mô hình cũng có. Mà là nó giữ được những gì nằm trong đó. Trong bài đánh giá khả năng gợi nhớ ngữ cảnh dài của Artificial Analysis, có trong danh mục mô hình, Kimi K3 đạt 88,7% so với 83,7% của GPT-6 Sol. Đó là khoảng cách năm điểm trong đúng bài kiểm tra đo xem một mô hình có thể tìm và sử dụng một chi tiết bị chôn vùi trong đầu vào dài hay không, và đó là kiểu khoảng cách thể hiện thành những thất bại thực tế trong môi trường sản xuất — công cụ tóm tắt bỏ sót mệnh đề ở trang 400, công cụ rà soát hợp đồng bỏ qua mục bồi thường.

Kimi K3 cũng dẫn đầu về lập trình, và với khoảng cách lớn hơn mức mà chỉ số tổng hợp gợi ý. Trên chỉ số lập trình, nó đạt 76,2 điểm với thứ hạng nằm trong top 10 mô hình được đánh giá, và đạt 85,0% trên terminal-bench v2.1 — chuẩn đánh giá dòng lệnh dạng tác tử mà mức độ hữu ích của một coding agent phụ thuộc vào. Điểm GPQA Diamond của nó, 93,5%, nằm trong nhóm dẫn đầu của bảng xếp hạng.

Nơi GPT-6 Sol đáp trả là ở các chỉ số tổng hợp và trên mã khoa học. Chỉ số trí tuệ tổng quát của nó, 47.6, cao hơn 4 điểm so với 43.6 của Kimi K3 và gần nhóm 10% dẫn đầu; hai mô hình ngang bằng nhau trên SciCode với tỷ lệ lần lượt là 57.6% và 59.5%, nằm trong ngưỡng nhiễu của một lần chạy đơn lẻ; và trên Humanity's Last Exam, GPT-6 Sol đạt 47.9%, nhích hơn so với 46.9% của Kimi K3. Không có khác biệt đơn lẻ nào trong số đó đủ lớn để tự nó làm căn cứ lựa chọn.

Screenshot of the OrcaRouter model page for Kimi K3, showing the MoonshotAI Kimi K3 card with a 1,048,576-token context window, text and image input, and a flat rate of $3.00 per million input tokens and $15.00 per million output tokens with a $0.30 cached-input rate.

Tính phí dựa trên chi phí, không dựa trên bảng giá.

Bảng giá gây hiểu lầm vì tỷ lệ token đầu vào trên token đầu ra khác nhau ở mỗi công việc, và hai mô hình này không đồng ý về việc bên nào của giao dịch rẻ hơn. Kimi K3 rẻ hơn theo giả định rằng công việc của bạn chủ yếu là đầu vào — tài liệu dài đưa vào, câu trả lời ngắn đưa ra. GPT-6 Sol rẻ hơn theo giả định rằng công việc của bạn cân bằng hoặc nặng về đầu ra, vì mức giá đầu ra của nó thấp hơn một phần ba.

• Dạng đọc một cuốn sách rồi tóm tắt nó (đầu vào 900K, đầu ra 4K): Kimi K3 ≈ 2,76 USD, GPT-6 Sol ≈ 3,64 USD trước khi áp dụng mức định giá lại 272K; nếu tính theo mức định giá lại, toàn bộ lượt gọi của GPT-6 Sol chuyển sang bậc cao hơn và khoảng cách nới rộng
• Dạng tác tử cân bằng (đầu vào 60K, đầu ra 20K): Kimi K3 ≈ 0,48 USD, GPT-6 Sol ≈ 0,32 USD
• Dạng sinh mã (đầu vào 30K, đầu ra 60K): Kimi K3 ≈ 0,99 USD, GPT-6 Sol ≈ 0,66 USD

Đó là phép tính token thô dựa trên mức giá công bố của từng nhà cung cấp và không tính phần đầu vào được lưu đệm, vốn có lợi cho mô hình nào mà bạn lưu đệm nhiều nhất. Hình dạng của câu trả lời mới là điều quan trọng: với công việc truy xuất thuần túy trên đầu vào dài, mức giá cố định của Kimi K3 thắng thế, còn với bất cứ việc gì ghi trả về nhiều, mức giá đầu ra thấp hơn của GPT-6 Sol thắng thế. Không mô hình nào rẻ hơn một cách phổ quát, và một so sánh chỉ nêu tên một bên thắng về giá mà không nêu tỷ lệ token thì chẳng đo lường được gì cả.

Nguồn gốc là một phần của quyết định

Kimi K3 được xây dựng bởi MoonshotAI, một phòng thí nghiệm Trung Quốc, còn GPT-6 Sol do OpenAI. Sự khác biệt đó không phải là một phép đo chuẩn và nó không xuất hiện trên bảng giá, nhưng với các khối lượng công việc được quản lý chặt, nó quyết định danh sách rút gọn trước khi bàn đến giá. Thẻ của MoonshotAI trong danh mục không công bố trường giấy phép, nên không có gì ở đây nên được hiểu là một tuyên bố về việc có sẵn trọng số theo bất kỳ hướng nào — nếu trọng số mở quan trọng với triển khai của bạn, hãy xác minh tại nguồn thay vì giả định dựa trên tên dòng sản phẩm.

Với những đội ngũ cần cả hai — một mô hình từ phòng lab Trung Quốc cho một phần của pipeline và một mô hình OpenAI cho phần khác, với câu chuyện định tuyến, thanh toán và lưu trú dữ liệu được xử lý ở một nơi — đó chính là lý do nên có một gateway duy nhất thay vì hai bộ thông tin xác thực. Trên OrcaRouter, cả kimi/kimi-k3 và GPT-6 Sol đều là những route đang hoạt động trong cùng một danh mục, theo đúng giá niêm yết của nhà cung cấp với mức markup 0%, nên khi MoonshotAI hay OpenAI thay đổi mức giá thì mức giá mới có hiệu lực ngay trong cùng ngày. Tự động chuyển đổi dự phòng nghĩa là một route bị suy giảm ở bất kỳ nhà cung cấp nào cũng không làm sập pipeline, và DSL định tuyến cho phép bạn gửi công việc nặng về truy xuất cho Kimi K3 và công việc nặng về sinh nội dung cho GPT-6 Sol theo quy tắc thay vì phải đoán.

A six-row comparison card titled 'GPT-6 Sol vs Kimi K3'. Rows read 'Context: 1,050,000 vs 1,048,576'; 'Input: $2.00 vs $3.00'; 'Output: $10.00 vs $15.00'; 'AA Intelligence: 47.6 vs 43.6'; 'Long-context recall: 83.7% vs 88.7%'; 'Coding index: top-decile on both'. A footer reads 'Figures per each vendor's published card and Artificial Analysis; GPT-6 Sol output ceiling is 128K, Kimi K3 publishes no maximum output.'

Nên đưa cái nào vào pipeline

Chọn Kimi K3 khi công việc là truy xuất và ghi nhớ trên những đầu vào rất dài — rà soát tài liệu pháp lý và y tế, hiểu toàn bộ kho mã nguồn, phân tích bản ghi chép xuyên suốt hàng trăm tài liệu — và khi các câu lệnh của bạn nặng về đầu vào đến mức mức giá cố định $3.00 đánh bại cách tính giá lại của GPT-6 Sol. Lợi thế về khả năng ghi nhớ và vị trí trong top mười về lập trình là hai con số biện minh cho lựa chọn này.

Hãy chọn GPT-6 Sol khi công việc là một trợ lý đa dụng được hậu thuẫn bởi cửa sổ một triệu token: suy luận hỗn hợp, tuần tự hóa sang JSON, các vòng lặp agentic ghi trả về rất nhiều, và bất kỳ quy trình nào mà trần đầu ra 128.000 token là một tính năng chứ không phải một ràng buộc. Nó rẻ hơn ở phần đầu ra, nó cho phép điều khiển mức nỗ lực suy luận một cách tường minh, và chỉ số tổng hợp của nó là tín hiệu tổng quát mạnh hơn. Ở những nơi mà một pipeline thực sự làm cả hai, câu trả lời trung thực là định tuyến thay vì chọn lựa — đó là một phát biểu về hình dạng lưu lượng của bạn, chứ không phải về bất kỳ mô hình nào.

Screenshot of the OrcaRouter model page for GPT-6 Sol, showing the OpenAI GPT-6 Sol card with a 1,050,000-token context window, 128,000 maximum output, text/image/file input, and the tiered rate of $2.00 per million input and $10.00 per million output up to 272,000 tokens, stepping to $4.00 and $15.00 above that.

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày