Đã tạo thẻ tiêu đề hero với tiêu đề chính 'GPT-6 Luna vs Kimi K3', phụ đề 'Thông lượng gấp bốn lần, giá chỉ bằng một phần ba mươi', phần chân trang ghi 'Giá theo OpenAI và Moonshot AI; số liệu chỉ số theo Artificial Analysis.', và logo OrcaRouter được ghép ở góc dưới bên phải.
Guides & Insights

GPT-6 Luna so với Kimi K3: Thông lượng gấp bốn lần, giá chỉ bằng một phần ba mươi, một ngoại lệ thực sự

Tác giả

Elias Hawthorne

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Hai mô hình, đều ra mắt trong vòng ba tháng qua, đều được định vị là phân khúc giá rẻ của một dòng tiên phong, và cả hai đều cùng sai về ý nghĩa của "phân khúc giá rẻ" theo một kiểu giống hệt nhau — mà thật ra là không hề sai chút nào. Kimi K3 là mô hình chủ lực trọng số mở của Moonshot AI, công khai theo giấy phép MIT sửa đổi kể từ ngày 27 tháng 7 năm 2026, với mức giá 3,00 USD mỗi triệu token đầu vào và 15,00 USD mỗi triệu token đầu ra, còn lượt đọc bộ nhớ đệm ở mức 0,30 USD. GPT-6 Luna là bậc khối lượng lớn của nhà cung cấp, được cung cấp rộng rãi kể từ ngày 22 tháng 9 năm 2026 ở mức 0,10 USD và 0,50 USD, với lượt đọc bộ nhớ đệm chỉ một xu. Gấp ba mươi lần ở đầu vào, gấp ba mươi lần ở đầu ra, và một giấy phép ở một bên mà bên kia không thể cung cấp dù ở bất kỳ mức giá nào.

Tuy nhiên, bảng giá không phải là thứ quyết định sự kết hợp này, bởi vì nó không đủ sát nhau để cần phải quyết định. Thứ quyết định nó là một con số mà cả hai nhà cung cấp đều không đưa lên tiêu đề: tốc độ đầu ra đo được. Kimi K3 tạo ra 38,7 token mỗi giây. GPT-6 Luna tạo ra 153,9. Đó là khoảng cách gấp bốn lần, và với bất kỳ khối lượng công việc nào mà mô hình là một thành phần bên trong một vòng lặp thay vì một điểm cuối mà một người trò chuyện cùng, thì mức chênh lệch thông lượng gấp bốn lần sẽ thay đổi kiến trúc chứ không phải hóa đơn.

Hai thứ này thực sự là gì

Kimi K3 là một mô hình mixture-of-experts 2,8 nghìn tỷ tham số với 104 tỷ tham số hoạt động trên mỗi token, cửa sổ ngữ cảnh 1.048.576 token, giới hạn đầu ra 1.048.576 token, và trọng số được công bố trên Hugging Face theo giấy phép Modified MIT. Đây là mô hình trọng số mở có điểm cao nhất trên bảng xếp hạng độc lập — đứng đầu trong số 112 mô hình trọng số mở — và giữ vị trí hàng đầu trên bảng xếp hạng WebDev của Code Arena với 1.679 Elo. Moonshot báo cáo 88,3% trên Terminal-Bench 2.0, đây là số liệu từ nhà cung cấp và chưa được tái lập độc lập.

GPT-6 Luna là phiên bản bậc nhỏ thuộc thế hệ GPT-6 của OpenAI, nằm dưới GPT-6 Sol ở mức $2.00/$10.00 và thấp hơn nhiều so với mô hình chủ lực GPT-6 Astra ở mức $10.00/$50.00. Đầu vào văn bản và hình ảnh, đầu ra văn bản, cửa sổ 1.050.000 token với đầu vào tối đa 922.000 và trần đầu ra 128.000 token, cùng mức nỗ lực suy luận có thể chọn từ none đến low, medium, high, xhigh và max, với medium là mặc định. Đây là mô hình đóng, dùng một định danh duy nhất và khả dụng cho bất kỳ ai có khóa API.

Một cái là bản tải xuống. Một cái là endpoint. Cả hai đều được định giá theo khối lượng. Đó chính là hình dạng của sự so sánh.

Các thẻ, từng dòng một

Mỗi chiều một dòng, cả hai mặt trên mỗi dòng:

• Đầu vào mỗi 1M — GPT-6 Luna $0.10 so với Kimi K3 $3.00

• Đầu ra trên 1M — GPT-6 Luna $0.50 so với Kimi K3 $15.00

• Input đã cache trên mỗi 1M — GPT-6 Luna $0.01 so với Kimi K3 $0.30, chỉ bằng một phần mười mức giá input của chính nó trên cả hai thẻ

• Điều khoản ngữ cảnh dài — GPT-6 Luna tăng gấp đôi đầu vào và bộ nhớ đệm, đồng thời nâng đầu ra lên 1,5× khi vượt quá 272.000 token đầu vào, áp dụng cho toàn bộ yêu cầu; so với Kimi K3, không có điều khoản tương đương nào được công bố trên card của nó

• Cửa sổ ngữ cảnh — GPT-6 Luna 1.050.000 token với đầu vào tối đa 922.000 so với Kimi K3 1.048.576 token

• Đầu ra tối đa — GPT-6 Luna 128.000 token so với Kimi K3 1.048.576 token, gấp tám lần mức trần

• Chỉ số Thông minh, độc lập — GPT-6 Luna 37 ở nỗ lực tối đa so với Kimi K3 44 ở nỗ lực tối đa, cùng bản sửa đổi chỉ số

• Điểm số nỗ lực mặc định — GPT-6 Luna 29 ở mức trung bình mặc định của nó so với Kimi K3 được đo ở thiết lập tối đa

Chi phí cho mỗi tác vụ Index, độc lập — GPT-6 Luna khoảng $0.07 so với Kimi K3 $2.00

• Token đầu ra trong lượt chạy chỉ số — GPT-6 Luna 150M so với Kimi K3 160M, so với trung vị của bảng là 88M; cả hai đều dài dòng hơn nhiều so với mô hình trung vị của bảng

• Tốc độ đầu ra, độc lập — GPT-6 Luna 153,9 token/giây so với Kimi K3 38,7 token/giây

• Trọng số — GPT-6 Luna đóng kín, chỉ qua API so với Kimi K3 công khai trên Hugging Face từ ngày 27 tháng 7 năm 2026

• Giấy phép — GPT-6 Luna không áp dụng so với Kimi K3 Modified MIT, vốn không phải cùng một văn bản pháp lý như MIT

• Tổng số tham số — GPT-6 Luna không được tiết lộ so với Kimi K3 2.800 tỷ, trong đó 104 tỷ tham số hoạt động trên mỗi token

• Bằng chứng nổi bật — gọi công cụ và vòng lặp agentic của GPT-6 Luna ở mức một phần mười xu cho mỗi nghìn token đầu vào được lưu đệm, so với Kimi K3 Code Arena WebDev #1 ở 1.679 Elo, Terminal-Bench 2.0 đạt 88,3% theo báo cáo của nhà cung cấp, điểm số mô hình trọng số mở cao nhất trên bảng xếp hạng độc lập

• Trên OrcaRouter — GPT-6 Luna không có trong danh mục của chúng tôi so với Kimi K3 có thể định tuyến theo giá niêm yết của Moonshot

Generated two-column scoreboard titled 'GPT-6 Luna vs Kimi K3 - the scoreboard'. Left column GPT-6 Luna rows: Price in/out $0.10 / $0.50, Cached input $0.01, AA Index at max effort 37, Output speed 153.9 tok/s, Context 1,050,000, Weights closed. Right column Kimi K3 rows: Price in/out $3.00 / $15.00, Cached input $0.30, AA Index at max effort 44, Output speed 38.7 tok/s, Context 1,048,576, Weights Modified MIT. Footer: 'Prices per OpenAI and Moonshot AI; index and speed per Artificial Analysis.'

Thông lượng là thông số chẳng ai đưa lên tiêu đề

Một mô hình 38,7 token mỗi giây và một mô hình 153,9 token mỗi giây không phải là cùng một sản phẩm với những mức giá khác nhau. Chúng là những sản phẩm khác nhau.

Lấy một tác vụ mà mô hình phải tạo ra câu trả lời dài 1.500 token — một bản tóm tắt, một trích xuất có cấu trúc, một bản vá mã kèm phần giải thích. Ở tốc độ 153,9 token mỗi giây, câu trả lời đó mất khoảng mười giây. Ở tốc độ 38,7, câu trả lời mất khoảng ba mươi chín giây. Cả hai con số đều không bao gồm thời gian suy luận hay độ trễ mạng, nên khoảng cách trên thực tế còn rộng hơn mức gấp bốn lần theo tỷ lệ, chứ không hẹp hơn.

Bây giờ hãy đặt nó vào một vòng lặp. Một tác nhân thực hiện ba mươi lệnh gọi mô hình để hoàn thành một nhiệm vụ — lập kế hoạch, chọn công cụ, đọc kết quả, quyết định bước tiếp theo, lặp lại — tạo ra có lẽ 15.000 token đầu ra trong các lệnh gọi đó. GPT-6 Luna mất khoảng 97 giây để tạo sinh. Kimi K3 mất khoảng 388. Đó là sự khác biệt giữa một nhiệm vụ mà người dùng chờ đợi và một nhiệm vụ mà người dùng lên lịch, và không có mức độ dễ dãi nào của giấy phép thay đổi được điều đó.

Việc dài dòng càng làm trầm trọng thêm vấn đề tốc độ chứ không hề bù đắp cho nó. Kimi K3 đã tạo ra 160 triệu token đầu ra khi hoàn thành chỉ số độc lập, so với 150 triệu của GPT-6 Luna — vậy trong đánh giá đó, mô hình chậm hơn cũng tạo ra lượng token nhiều hơn một chút, chứ không phải ít hơn. Hai mô hình dài dòng tương đương nhau; đơn giản là chúng không nhanh tương đương nhau, và trên bảng giá tính theo đầu ra, việc dài dòng là tốn kém gấp đôi.

Cần nói thẳng rằng đây không phải là một khiếm khuyết của Kimi K3. Một mô hình 2,8 nghìn tỷ tham số với 104 tỷ tham số hoạt động đang thực hiện nhiều công việc tính toán hơn trên mỗi token so với một mô hình phân hạng nhỏ, và con số thông lượng là thước đo cho khối lượng công việc đó. Câu hỏi đáng đặt ra là liệu khối lượng công việc của bạn có cần sự tính toán đó hay không. Nếu có, 38,7 token mỗi giây là cái giá phải trả cho năng lực đó. Nếu không, bạn đang trả tiền cho việc suy xét mà bạn không hề yêu cầu, gấp ba mươi lần.

Nơi bảy điểm của K3 nằm

Kimi K3 đạt 44 điểm trên Intelligence Index độc lập ở mức nỗ lực tối đa. GPT-6 Luna đạt 37 điểm ở cùng thiết lập. Bảy điểm, trên một chỉ số tổng hợp mà một điểm nằm trong ngưỡng nhiễu của một lần chạy lại — và hai mô hình cách nhau khoảng hai mươi tám lần về chi phí cho mỗi tác vụ hoàn thành, 2,00 đô la so với khoảng 0,07 đô la.

Bảy điểm đó không được phân bố đều. Danh tiếng của Kimi K3 tập trung vào lập trình và công việc phần mềm dạng tác tử, và đó là lý do mô hình này tồn tại: bảng xếp hạng WebDev của Code Arena xếp nó ở vị trí đầu tiên với 1.679 Elo, và con số 88,3% của Terminal-Bench 2.0 do nhà cung cấp công bố là một phép đo tác tử lập trình. Vị trí lập trình của chính GPT-6 Luna là một bước lùi thay vì tiến — Coding Agent Index của nó ở mức 41, thấp hơn hai điểm so với GPT-5.6 Luna mà nó thay thế, với mức giảm tập trung ở SWE-Atlas-QnA và DeepSWE v1.1. Nếu công việc của bạn là một tác tử viết phần mềm dựa trên một kho lưu trữ thực, thì đó là khoảng cách chỉ số bảy điểm và sự thoái bộ thế hệ hai điểm cùng chỉ về một hướng, và lý lẽ dành cho hạng giá rẻ trở nên yếu đi đáng kể.

Nơi mà bảy điểm không hiện diện chính là loại công việc mà GPT-6 Luna được định giá để đảm nhận. Phân loại, trích xuất, định tuyến, tóm tắt hàng loạt, vòng lặp bên trong của một agent cần câu trả lời có/không nhanh chóng — ở những tác vụ đó, hai mô hình sẽ tạo ra cùng một đầu ra hữu dụng trong đại đa số trường hợp, và sự khác biệt sẽ không trụ nổi khi đối chiếu với bộ đánh giá của chính bạn. Chỉ số này đo lường một tổ hợp đánh trọng số nặng cho suy luận tầm xa và viết mã, và cả hai đều không phải là thứ mà một quyết định định tuyến cần đến.

Một lưu ý đáng gắn kèm cho các con số chỉ mục ở cả hai phía: bảng này là một đánh giá cuốn chiếu và việc nó được sửa đổi có ý nghĩa quan trọng. Những ảnh chụp trước đó của cùng bảng xếp hạng đã đặt Kimi K3 cao hơn đáng kể so với mức 44 mà bản ghi nhận hôm nay của chúng tôi cho thấy, bởi vì chỉ số tổng hợp, bộ khung đánh giá và tập mô hình đều thay đổi. Bất kỳ so sánh nào dựa vào khoảng cách chính xác giữa hai mô hình trên một chỉ mục cuốn chiếu đều đang dựa vào một thứ sẽ không đứng yên. Cách hiểu trung thực là hai mô hình này nằm trong những dải năng lực liền kề ở mức trần của chúng, và chỉ mục không thể cho bạn biết mô hình nào tốt hơn cho tác vụ của bạn.

Ngoại lệ: Modified MIT thực sự mang lại cho bạn điều gì

Giấy phép của Kimi K3 là khía cạnh duy nhất mà GPT-6 Luna không có câu trả lời ở bất kỳ mức giá nào, và nó xứng đáng được chính xác hơn mức mà cụm từ "trọng số mở" thường nhận được.

Các trọng số được công khai trên Hugging Face và giấy phép là Modified MIT, không phải MIT. Sự phân biệt đó rất quan trọng: giấy phép Modified MIT thường đi kèm các điều kiện — thường là yêu cầu hiển thị ghi công khi mô hình được sử dụng trong một sản phẩm vượt quá một quy mô nào đó — và bất kỳ ai có kế hoạch xây dựng sản phẩm thương mại dựa trên các trọng số nên đọc văn bản thực tế thay vì tên họ mà nó giống. Đây không phải là lý do để tránh nó. Đó là lý do để không mô tả nó là MIT trong một tài liệu mua sắm.

Những gì bản tải xuống mang lại là có thật và có giới hạn. Nó mang lại một mức sàn về chi phí, theo nghĩa là một lượng GPU cố định có thể thắng hóa đơn tính theo mức sử dụng khi khối lượng đủ lớn. Nó mang lại sự độc lập khỏi lộ trình của nhà cung cấp — một mô hình do bạn tự vận hành không thể bị ngừng hỗ trợ sau lưng bạn. Nó mang lại khả năng tinh chỉnh trên phân phối dữ liệu của riêng bạn. Và nó mang lại tùy chọn giữ các prompt bên trong ranh giới của riêng bạn, điều mà với một số đội nhóm, kết thúc việc so sánh trước cả khi giá được nhắc đến.

Điều tốn kém là phần cứng. Một mô hình hỗn hợp chuyên gia 2,8 nghìn tỷ tham số với 104 tỷ tham số hoạt động không phải là mô hình chạy được trên một máy trạm. Phục vụ nó ở thông lượng sản xuất là một cam kết quy mô cụm với chi phí vốn, chi phí vận hành và đặc tính độ trễ mà bạn sở hữu thay vì thuê. Đó không phải là lập luận chống lại việc tự vận hành Kimi K3 — đó là lập luận rằng so sánh đúng không phải là $15,00 cho mỗi triệu token đầu ra với $0,00, mà là $15,00 cho mỗi triệu token đầu ra với chi phí toàn phần trên mỗi token bao gồm cả silicon và nhân lực. Với một số ít tổ chức, con số đó thấp hơn. Với hầu hết thì không, và điểm giao nhau xa hơn so với cảm giác mà giấy phép tạo ra.

Chạy một trong hai, hoặc cả hai

Kimi K3 có mặt trên OrcaRouter với mức giá niêm yết của Moonshot, theo cơ chế định giá chuyển tiếp, nghĩa là khi nhà cung cấp thay đổi mức giá thì phía chúng tôi cập nhật ngay trong cùng ngày. Tự động chuyển đổi dự phòng chính là phần làm nên giá trị của nó, đặc biệt đối với mô hình này: một endpoint Kimi K3 tự vận hành hoặc của bên thứ ba bị suy giảm đúng là tình huống mà bạn muốn tuyến được chuyển đi mà không cần triển khai, và một mô hình đạt 38.7 token mỗi giây có ít dư địa hơn để hấp thụ một nguồn cấp thượng nguồn chậm so với một mô hình nhanh.

Tính đến thời điểm viết bài này, GPT-6 Luna chưa có trong danh mục của chúng tôi và được truy cập qua API riêng của OpenAI, vì vậy một nhóm muốn dùng cả hai sẽ chạy một khóa cho Kimi K3 song song với bất cứ thứ gì họ đã dùng cho OpenAI. Đây cũng là cặp kết hợp mà DSL định tuyến làm được điều mà một cách chia tách cứng nhắc không thể: một quy tắc gửi công việc lập trình và công việc dài hạn cho Kimi K3 còn mọi thứ do chương trình tiêu thụ và ngắn thì cho GPT-6 Luna thể hiện một ranh giới dịch chuyển mỗi khi một trong hai nhà cung cấp tung ra sản phẩm mới, và nó dịch chuyển dưới dạng cấu hình chứ không phải một nhánh mã. Hợp nhất mô hình là cấu hình khác đáng được nhắc tên ở đây — một hội đồng gồm một mô hình chậm kỹ lưỡng và một mô hình nhanh rẻ cùng trả lời, trong đó thành viên rẻ đảm nhiệm khối lượng lớn còn thành viên đắt tiền phân xử những trường hợp quan trọng, là một hình dạng mà cặp mô hình này phù hợp một cách đặc biệt tốt, bởi vì mức bất đối xứng chi phí giữa chúng đủ lớn để việc dành một lượt gọi Kimi K3 cho một phần nhỏ lưu lượng là chấp nhận được.

Screenshot of OpenAI's developer documentation page for GPT-6 Luna, showing the model selector, the description 'Our most efficient model for focused, high-volume tasks', reasoning set to High, speed Fast, price $0.1 · $0.5, text and image input with text output, a 1,050,000-token context window, 128,000 maximum output tokens, a May 18, 2026 knowledge cutoff, and pricing cards of $0.10 input, $0.01 cached input, $0.125 cache writes and $0.50 output per 1M tokens.

Cái nào, và khi nào

Chọn GPT-6 Luna nếu khối lượng công việc của bạn lớn, được tiêu thụ bởi chương trình và nhạy cảm với độ trễ. Phân loại, trích xuất, định tuyến, tóm tắt hàng loạt, vòng lặp bên trong của một agent. Với mức $0.10/$0.50 cùng một lần đọc từ bộ nhớ đệm giá một xu và thông lượng gấp bốn lần Kimi K3, phép tính không hề sít sao và chênh lệch độ trễ không hề nhỏ. Hãy đặt tham số effort một cách tường minh, vì mặc định là medium và con số 37 được nhắc đến là mức nỗ lực tối đa, và hãy giữ các lệnh gọi dài ở phía đúng của ranh giới 272.000 token.

Hãy chọn Kimi K3 nếu bạn cần trọng số, nếu công việc của bạn là lập trình agentic trên một kho mã thực tế, nơi vị trí WebDev của nó và mức 88,3% trên Terminal-Bench 2.0 do nhà cung cấp báo cáo là bằng chứng quan trọng, nếu bạn cần mức trần đầu ra trên 128.000 token, hoặc nếu tổ chức của bạn không thể gửi prompt đến một endpoint đóng. Hãy chấp nhận 38,7 token mỗi giây như một phần của thỏa thuận, và hãy đọc các điều khoản Modified MIT thay vì tự giả định về chúng.

Sai lầm mà phép so sánh này dễ khơi ra là coi tỷ lệ gấp ba mươi lần là câu trả lời cho một câu hỏi về năng lực. Nó là câu trả lời cho một câu hỏi về token. Câu hỏi về năng lực được quyết định bởi việc bạn cần trọng số hay tốc độ, và hai câu trả lời đó chỉ về hai hướng ngược nhau.

Screenshot of the OrcaRouter model page for Kimi K3 showing the breadcrumb Home > Models > MoonshotAI > Kimi K3, a FEATURED badge, the model id kimi/kimi-k3, Vision, Tools, JSON and Reasoning chips, a MoonshotAI attribution dated 2026-07-15, the description of a 2.8-trillion-parameter mixture-of-experts model with a 1M-token context window, input pricing of $3.00 and output of $15.00 per 1M tokens, a p50 time to first token of 8.11s, a p95 of 10.00s, and traffic of 1163.7M tokens over seven days.

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày