
Bài đánh giá mô hình Inkling AI: Mô hình mã nguồn mở đầu tiên của Thinking Machines, đã được kiểm tra và giải thích.
- metaMỚIMeta: Muse Spark 1.22026-08-0557Trí tuệ72Lập trình
- qwenMỚIQwen: Qwen3.8 Max2026-08-0358Trí tuệ72Lập trình
- deepseekMỚIDeepSeek: DeepSeek V4 Flash 07312026-07-3152Trí tuệ69Lập trình
- qwenMỚIQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token · 2031 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Trí tuệ78Lập trình
- googleGoogle: Gemini 3.6 Flash2026-07-2152Trí tuệ69Lập trình
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Trí tuệ49Lập trình
- metaMeta: Muse Spark 1.12026-07-1653Trí tuệ71Lập trình
- kimiMoonshotAI: Kimi K32026-07-1560Trí tuệ76Lập trình
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Trí tuệ71Lập trình
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Trí tuệ77Lập trình
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Trí tuệ77Lập trình
- grokxAI: Grok 4.52026-07-0856Trí tuệ72Lập trình
- tencentTencent: Hy32026-07-0642Trí tuệ59Lập trình
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Trí tuệ42Lập trình
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Trí tuệ39Lập trình
- anthropicAnthropic: Claude Sonnet 52026-06-3055Trí tuệ72Lập trình
- klingKling: Kling 3.0 Turbo2026-06-1757Trí tuệ52Lập trình57Toán
- z-aiZ.ai: GLM 5.22026-06-1653Trí tuệ69Lập trình60Toán
này bài đánh giá mô hình Inkling AIxem xét kỹ lưỡng bản phát hành đầu tiên từ Thinking Machines Lab, công ty khởi nghiệp do cựu CTO OpenAI Mira Murati lãnh đạo. Inkling là một mô hình hỗn hợp các chuyên gia (MoE) đa phương thức, trọng số mở với cửa sổ ngữ cảnh 1 triệu token và một nút điều chỉnh “nỗ lực suy nghĩ” có thể kiểm soát. Nó nhanh, chi phí tự lưu trữ thấp, và được xây dựng để tùy chỉnh thay vì thống trị bảng xếp hạng. Bên dưới, chúng tôi tách biệt các điểm chuẩn do nhà cung cấp tự báo cáo khỏi các phép đo độc lập, xem xét kiến trúc, chỉ cho bạn cách chạy mô hình, và giải thích chính xác ai nên (và không nên) áp dụng nó.
Tính đến: 2026-07-16 — một ngày sau khi ra mắt. Đây là bài đánh giá dựa trên nghiên cứu; chưa có thử nghiệm dài hạn thực tế nào cho bất kỳ mẫu máy mới nào, và chúng tôi gắn cờ mọi con số chưa được xác minh dưới đây.
Một lưu ý dành cho các nhà phát triển: nếu bạn muốn dùng thử Inkling cùng với các mô hình khác, OrcaRouter cung cấp giao diện cho các mô hình có sẵn qua API với một endpoint tương thích OpenAI duy nhất, vì vậy bạn có thể so sánh và chuyển đổi mà không cần tích hợp mới.
- TL;DR Kết luận:Inkling là một mô hình mở thực sự có năng lực và hiệu quả, nổi bật trong việc tinh chỉnh và triển khai nhạy cảm về chi phí, nhưng nó không phải là một nhà lãnh đạo tiên phong và nhà sản xuất của nó thừa nhận điều đó một cách công khai. Nếu bạn muốn một nền tảng có thể tùy chỉnh, miễn phí bản quyền với cửa sổ ngữ cảnh khổng lồ, thì đây là một trong những bản ra mắt thú vị nhất của năm 2026. Nếu bạn muốn mô hình mạnh nhất duy nhất hiện có, hãy tìm nơi khác.
- Nó là gì: Một mô hình suy luận MoE có trọng số mở (Apache 2.0). Dành cho ai: Những người thực hành muốn tinh chỉnh và tự lưu trữ thay vì trả tiền cho một API biên giới đóng.
Những điểm chính rút ra
Nhà sản xuất & ngày: Phòng thí nghiệm Thinking Machines; phát hành ngày 15 tháng 7 năm 2026 với tư cách là mô hình đầu tiên của phòng thí nghiệm.
Kiến trúc: Sparse MoE, tổng 975B / 41B tham số hoạt động, 66 lớp, ngữ cảnh lên tới 1M token trong trọng số (256K qua API được lưu trữ).
Giấy phép: Apache 2.0 — trọng số đầy đủ trên Hugging Face, miễn phí cho sử dụng thương mại và tự lưu trữ.
Định vị trung thực: Công ty tuyên bố thẳng thắn rằng nó “không phải là mô hình mạnh nhất hiện nay, dù đóng hay mở.”
Điểm độc lập: 41/100 trên Artificial Analysis Intelligence Index — #10 trong số 97 mô hình, và vượt trước một số đối thủ mở (xem phần đối chiếu bên dưới).
Giá: Các trọng số được miễn phí bản quyền để tự lưu trữ; quyền truy cập được lưu trữ bắt đầu từ khoảng $1,87 / 1M token đầu vào.
Lưu ý: Hầu như tất cả các điểm chuẩn tiêu đề đều do nhà cung cấp tự báo cáo và không được kiểm toán độc lập.
Ai đứng sau Inkling?
- Hộp người sáng lập.Inkling là mô hình đầu tiên từ Thinking Machines Lab (thinkingmachines.ai), được thành lập bởi Mira Murati, trước đây là Giám đốc Công nghệ tại OpenAI. Phòng thí nghiệm hoạt động khá kín đáo trước lần ra mắt này và đã áp dụng lập trường mở về trọng số (open-weights) — điều này đối lập với cách tiếp cận flagship đóng của cố chủ cũ của Murati. Thinking Machines không kiếm tiền từ chính mô hình đó — doanh thu đến từ Tinker nền tảng tinh chỉnh (fine-tuning) và các đối tác lưu trữ bên thứ ba. Mô hình kinh doanh này là trọng tâm để hiểu về Inkling: trọng số (weights) là lối vào miễn phí, và công ty kiếm tiền khi bạn tùy chỉnh hoặc mở rộng quy mô.
Inkling là gì?
Inkling là một mô hình ngôn ngữ và suy luận lớn, đa phương thức, hỗn hợp chuyên gia (Mixture-of-Experts) với trọng số mở, được Thinking Machines Lab công bố vào ngày 15 tháng 7 năm 2026 và phát hành dưới giấy phép cho phép Apache 2.0 với đầy đủ trọng số trên Hugging Face.
Điều làm nên sự đáng chú ý của lần ra mắt này chính là cách định khung. Thay vì tuyên bố chiếm ngôi vương tiên phong, Thinking Machines mô tả Inkling là một mô hình mở linh hoạt, hiệu quả và có thể tùy chỉnh. Trong một lời thừa nhận hiếm hoi thẳng thắn vào ngày ra mắt, công ty tuyên bố rằng Inkling “không phải là mô hình mạnh nhất hiện có, dù là đóng hay mở.” Sự trung thực đó tạo nên giọng điệu cho toàn bộ bài đánh giá này: Inkling là một công cụ được thiết kế để thích ứng, tự lưu trữ và tinh chỉnh, chứ không phải một chiếc cúp điểm chuẩn.
Phạm vi đưa tin từ Fortune và TechCrunch lặp lại nhận định này. TechCrunch cho rằng Inkling không đe dọa OpenAI, Anthropic hay Google ở cấp độ tiên phong, mà thay vào đó gây áp lực lên tầng trung gian của các nhà cung cấp lưu trữ trọng số mở và nền tảng tinh chỉnh. Forbes mô tả chiến lược trọng số mở của Murati gần với sách lược mô hình mở của Trung Quốc (DeepSeek, Qwen, Kimi) hơn là so với các đầu tàu đóng của Mỹ — một câu chuyện về trọng số mở giữa Mỹ và Trung Quốc xuyên suốt phần lớn các bình luận ra mắt.
Kiến trúc và thông số kỹ thuật
Bên trong, Inkling là một sparse Mixture-of-Experts transformer. Chỉ một phần nhỏ các tham số của nó được kích hoạt cho mỗi token, điều này giúp suy luận hiệu quả mặc dù tổng số tham số lớn. Chi tiết được ghi lại trong thẻ mô hình chính thức và blog Hugging Face.
Tổng số tham số: 975B
Tham số hoạt động: 41B (sparse MoE)
Các lớp: bộ biến đổi chỉ giải mã 66 lớp
Chuyên gia: 256 định tuyến + 2 dùng chung; 6 trên 256 định tuyến mỗi token (2 dùng chung luôn hoạt động)
Định tuyến: Sigmoid / aux-loss-free
Chú ý: Kết hợp, cửa sổ trượt 5:1 (cục bộ) đến toàn cầu; 8 đầu KV
Mã hóa vị trí: Đã học embedding vị trí tương đối (không phải RoPE)
Đa phương thức: Không cần bộ mã hóa — âm thanh dưới dạng phổ đồ dMel, hình ảnh dưới dạng các mảnh 40×40, được đưa trực tiếp
Phần bổ sung: Tích chập ngắn (SConv); lớp MTP cho giải mã suy diễn
Số học: BF16, MXFP8, NVFP4 (NVFP4 checkpoint cho NVIDIA Blackwell)
Cửa sổ ngữ cảnh: Lên đến 1,000,000 token trong các trọng số (256K trên các API được lưu trữ)
Biến thể nhỏ hơn: Inkling-Small, tổng 276B / 12B hoạt động (xem trước, trọng số chưa được phát hành)

Một vài lựa chọn thiết kế làm cho Inkling khác biệt so với MoE thuần túy:
Bố cục chuyên gia. Với 256 chuyên gia được định tuyến cộng với 2 chuyên gia dùng chung, và 6 chuyên gia được định tuyến kích hoạt mỗi token, cặp dùng chung hoạt động như một “bể chứa chuyên gia” luôn bật, thu thập các tính toán phổ biến trong khi các chuyên gia được định tuyến chuyên môn hóa. Định tuyến sigmoid không mất mát phụ trợ tránh được thuật ngữ phạt cân bằng tải được sử dụng bởi nhiều thiết kế MoE.
Embeddings vị trí tương đối, không phải RoPE. Hầu hết các mô hình ngữ cảnh dài hiện đại đều dựa vào rotary embeddings; Inkling thay vào đó sử dụng embeddings vị trí tương đối đã được học, một lựa chọn bất thường ở quy mô này.
Đa phương thức không cần bộ mã hóa. Thay vì gắn thêm các bộ mã hóa hình ảnh/âm thanh riêng biệt, Inkling đưa trực tiếp các mảnh ảnh 40×40 và phổ âm thanh dMel vào ngăn xếp transformer. Điều này đơn giản hóa quy trình và là một phần lý do tại sao mô hình được mô tả là đa phương thức bản địa.
MTP cho giải mã suy luận. Các lớp dự đoán nhiều token (MTP) hoạt động như một bộ soạn thảo tích hợp, tăng tốc quá trình sinh mà không cần một mô hình phác thảo riêng biệt.
Ghi chú biên tập — thêm hình ảnh minh họa:Một sơ đồ khối có chú thích của một lớp Inkling — chú ý cửa sổ trượt so với chú ý toàn cục (5:1), bộ định tuyến chuyên gia 256+2 với 6 chuyên gia được tô sáng, SConv và đầu soạn thảo MTP.
Huấn luyện và núm xoay “mức độ suy nghĩ”
Inkling đã được huấn luyện trước trên 45 nghìn tỷ token đa phương thức bao gồm văn bản, hình ảnh, âm thanh và video, sử dụng trình tối ưu hóa lai (Muon cho trọng số ma trận lớn, Adam cho phần còn lại) trên hệ thống NVIDIA GB300 NVL72. Quá trình hậu huấn luyện sử dụng học tăng cường bất đồng bộ quy mô lớn, mở rộng qua 30 triệu+ lần chạy thử trong hai lần chạy liên tục dài, được khởi động từ quá trình tinh chỉnh có giám sát ban đầu trên dữ liệu tổng hợp.
Một tính năng đặc biệt là tham số nỗ lực suy luận có thể điều khiển được, được trình diễn quét từ khoảng 0.2 đến 0.99, trong đó giá trị cao hơn có nghĩa là suy luận nhiều hơn và chi phí cao hơn. Điều này cho phép người vận hành đánh đổi độ trễ và chi tiêu so với độ sâu của suy nghĩ. Tất cả các số liệu điểm chuẩn dưới đây đều được chạy ở Effort = 0.99.
Nỗ lực tư duy có thể kiểm soát: Hướng dẫn vận hành
Trong triển khai, kiểm soát nỗ lực được hiển thị dưới dạng enum reasoning_effort với các mức không / tối thiểu / thấp / trung bình / cao / rất cao / tối đa. Không có một cài đặt “đúng” duy nhất — đó là một đòn bẩy trực tiếp cho sự đánh đổi giữa độ trễ, chi phí và chất lượng. Sử dụng bảng bên dưới như một bản đồ khởi đầu (hướng dẫn tương đối; chất lượng cấp benchmark được đo ở mức cao nhất của phạm vi):
không có / tối thiểu. Độ trễ tương đối & chi phí token: Thấp nhất; Tốt nhất cho: Phân loại, trích xuất, định dạng, định tuyến, keo truy xuất
thấp. Độ trễ tương đối và chi phí token: Thấp; Phù hợp nhất cho: Hỏi đáp ngắn, tóm tắt đơn giản, các công việc hàng loạt khối lượng lớn
trung bình. Độ trễ tương đối và chi phí token: Vừa phải; Phù hợp nhất cho: Trò chuyện chung, soạn thảo, hầu hết các cuộc gọi công cụ của tác nhân
cao. Độ trễ tương đối & chi phí token: Cao hơn; Phù hợp nhất cho: Lập luận nhiều bước, sinh mã, phân tích
xhigh / tối đa. Độ trễ tương đối & chi phí token: Cao nhất; Tốt nhất cho: Toán khó, suy luận kiểu thi đấu, ngang bằng điểm chuẩn (Effort=0.99)

Bạn có thể chạy nó cục bộ không? Phần cứng và VRAM.
Vì Inkling là mô hình có 975B tham số, thuật ngữ “cục bộ” theo nghĩa thực tế có nghĩa là một máy chủ đa GPU, không phải máy tính xách tay. Yêu cầu gần đúng (theo thông tin ra mắt và công cụ cộng đồng):
BF16 (đầy đủ). Dung lượng VRAM tổng hợp xấp xỉ: ~2 TB; Ví dụ cấu hình: 8× NVIDIA B300, hoặc 16× H200
NVFP4 (đã lượng tử hóa). Tổng VRAM gộp xấp xỉ: ~600 GB; Ví dụ cấu hình: 4× NVIDIA B300, hoặc 8× H200
GGUF (cộng đồng). VRAM tổng hợp gần đúng: Thay đổi theo quant; Ví dụ cấu hình: Các bản dựng Unsloth GGUF tồn tại cho footprint nhỏ hơn/lượng tử hóa
Checkpoint NVFP4 — được xuất xưởng đặc biệt cho NVIDIA Blackwell — giảm hóa đơn bộ nhớ xuống khoảng hai phần ba so với BF16, đó là sự khác biệt giữa một node B300 8-GPU và 4-GPU. Đối với hầu hết các nhóm, điều này vẫn hướng tới một nhà cung cấp dịch vụ lưu trữ hoặc một node GPU thuê hơn là phần cứng sở hữu. Các lượng tử hóa Unsloth GGUF mở rộng phạm vi tiếp cận xuống thấp hơn nữa trên bậc thang phần cứng để thử nghiệm, với một số chi phí về chất lượng.
Khởi động nhanh triển khai
Inkling cung cấp một API tương thích với OpenAI, vì vậy hầu hết mã client hiện có có thể hoạt động thay thế trực tiếp chỉ với việc thay đổi URL cơ sở và tên mô hình. Ba đường dẫn phục vụ phổ biến:
vLLM — máy chủ một lệnh (mặc định cổng 8000):
vllm serve thinkingmachines/Inkling --port 8000
# sau đó gọi endpoint tương thích OpenAI tại http://localhost:8000/v1
SGLang — phân mảnh trên 8 GPU (mặc định là cổng 30000):
python -m sglang.launch_server \
--model-path thinkingmachines/Inkling \
--tp 8 --port 30000
Hugging Face transformers — tải qua lớp tự động đa phương thức:
từ transformers nhập AutoModelForMultimodalLM, AutoProcessor
model = AutoModelForMultimodalLM.from_pretrained("thinkingmachines/Inkling")
processor = AutoProcessor.from_pretrained("thinkingmachines/Inkling")
# truyền reasoning_effort trong {none, minimal, low, medium, high, xhigh, max}
Vì endpoint tương thích với OpenAI, việc chuyển đổi ứng dụng hiện tại thường chỉ cần trỏ SDK của bạn đến base URL mới và đặt reasoning_effort theo ý muốn. Các runtime bổ sung khi ra mắt bao gồm TokenSpeed và Unsloth.
Nơi để chạy: khả dụng của nhà cung cấp suy luận
Nếu bạn không muốn quản lý GPU, một số đối tác lưu trữ Inkling. Các tùy chọn “Run Inkling on X” khi ra mắt:
Tinker (Thinking Machines). Vai trò: Tinh chỉnh; Ghi chú: Tùy chọn ngữ cảnh 64K và 256K; giảm giá ra mắt giới hạn 50% (trả phí)
Together AI. Vai trò: Suy luận được lưu trữ; Ghi chú: Các điểm cuối tương thích với OpenAI
Fireworks. Vai trò: Suy luận được lưu trữ; Ghi chú: —
Modal. Vai trò: Suy luận được lưu trữ / GPU không máy chủ; Ghi chú: —
Databricks. Vai trò: Suy luận được lưu trữ; Ghi chú: thông qua Unity AI Gateway
Baseten. Vai trò: Suy luận được lưu trữ; Ghi chú: —
Điểm chuẩn: tuyên bố của nhà cung cấp so với đo lường độc lập
Đây là phần quan trọng nhất của bất kỳ bài trung thực Inkling review 2026, bởi vì các con số đến từ hai nơi rất khác nhau.
Công bố: Ngoại trừ duy nhất Chỉ số Artificial Analysis, mọi điểm chuẩn Inkling dưới đây đều là do nhà cung cấp tự báo cáo khi ra mắt (Effort = 0.99, temperature 1.0) và đã không được kiểm toán độc lập. Các con số của đối thủ được lấy từ bên thứ ba (MarkTechPost, Artificial Analysis) hoặc được chạy lại bởi Thinking Machines, và cũng không được kiểm toán độc lập ở đây. Một số số liệu có kèm theo bộ tiêu chí hoặc bộ phận con. Hãy coi tất cả chỉ là ước lượng hướng dẫn, không phải là chân lý.
Điểm số tự báo cáo của nhà cung cấp
Theo tài liệu ra mắt của Thinking Machines:
AIME 2026 (toán): 97.1%
GPQA Diamond (suy luận khoa học): 87.2%
SWE-bench Verified (lập trình, khung bash-only): 77.6%
SWE-bench Pro (Công khai): 54.3%
MMMU Pro (đa phương thức): 73.3%
VoiceBench (âm thanh): 91.4%
MMAU (âm thanh): 77.2%
IFBench (làm theo hướng dẫn): 79.8%
Terminal Bench 2.1 (terminal tác nhân): 63.8
FORTRESS Adversarial: 78.0%
Đã xác minh bởi SimpleQA: 43.9%
Trên lý thuyết, những con số này trông rất ấn tượng, đặc biệt là các chỉ số suy luận toán học và khoa học. Nhưng công ty đã đo điểm chuẩn Inkling so với các phiên bản đối thủ trong tương lai gần (GPT 5.6 Sol, Claude Fable 5, Gemini 3.1 Pro, DeepSeek V4 Pro, Kimi K2.5/K2.6, GLM 5.2, Nemotron 3 Ultra) sử dụng điểm số do chính nó tạo ra. Những con số đối thủ đó có thể không khớp với số liệu được báo cáo của chính các đối thủ, vì vậy các so sánh trực tiếp nên được xem xét một cách thận trọng.
So sánh trực tiếp đa mô hình (đối thủ có trọng số mở)
So sánh trực diện rõ ràng nhất giữa Inkling và các mô hình mở khác đến từ bảng so sánh của MarkTechPost (được sao chép bên dưới, ghi công MarkTechPost). Nó hữu ích chính xác vì nó đặt các đối thủ trong cùng một khung hình:
HLE. Inkling: 29.7%; Nemotron 3 Ultra: 26.6%; Kimi K2.6: 35.9%; GLM 5.2: 40.1%; DeepSeek V4 Pro: 35.9%
AIME 2026. Inkling: 97.1%; Nemotron 3 Ultra: 94.2%; Kimi K2.6: 96.4%; GLM 5.2: 99.2%; DeepSeek V4 Pro: 96.7%
SWE-bench Verified. Inkling: 77.6%; Nemotron 3 Ultra: 70.7%; Kimi K2.6: 80.2%; GLM 5.2: 80.0%; DeepSeek V4 Pro: 80.6%
Terminal Bench 2.1. Inkling: 63,8%; Nemotron 3 Ultra: 56,4%; Kimi K2.6: 71,3%; GLM 5.2: 82,7%; DeepSeek V4 Pro: 64%
FORTRESS (đối kháng). Inkling: 78.0%; Nemotron 3 Ultra: 77.6%; Kimi K2.6: 65.6%; GLM 5.2: 71.3%; DeepSeek V4 Pro: 36.0%
MarkTechPost. Không được kiểm toán độc lập.
Mô hình rõ ràng và nhất quán với sự khiêm tốn của Thinking Machines. Inkling dẫn đầu trên FORTRESS (an toàn đối nghịch) và đánh bại Nemotron 3 Ultra trên mọi phương diện, nhưng nó thua GLM 5.2, Kimi K2.6, và DeepSeek V4 Pro trên HLE, SWE-bench Verified, và đặc biệt là Terminal Bench 2.1 (63.8% so với 82.7% của GLM 5.2). Nếu lập trình tác nhân và các tác vụ terminal là ưu tiên của bạn, các mô hình mở hàng đầu của Trung Quốc đang dẫn đầu hiện nay.
Đo lường độc lập (Artificial Analysis)
Để có một bài đánh giá trung lập hơn, Artificial Analysis đã đánh giá Inkling vào ngày 2026-07-15 và xếp nó ở mức 41/100 trên Intelligence Index, xếp hạng #10 trong số 97 mô hình. Hai điểm để đọc thứ hạng đó một cách công bằng:
Đây là một màn trình diễn mạnh mẽ của mô hình mở, không phải là số một tổng thể. Theo Artificial Analysis, chỉ số 41 của Inkling đứng ở vị trí trước Nemotron 3 Ultra (38), Gemma 4 31B (29) và gpt-oss-120b (24) — vì vậy trong số các đối thủ có trọng số mở, nó có tính cạnh tranh đến hàng đầu. Nhưng vị trí thứ 10 trong số 97 có nghĩa là chín mô hình xếp hạng cao hơn tổng thể, phù hợp với khuôn khổ 'có năng lực, không phải tiên phong'.
Hiệu quả là điểm nổi bật của nó. Artificial Analysis ghi nhận hiệu suất token mạnh mẽ — khoảng 25K token để hoàn thành bộ đánh giá của nó so với 37–43K của các mô hình đối chiếu — và một Elo GDPval-AA v2 là 1238, vượt qua Kimi (1190) và DeepSeek V4 Flash (1189), cộng thêm một lợi thế nhỏ (+2) trên AA-Omniscience.
Tốc độ đầu ra đo được 72.7 token/giây với thời gian đến token đầu tiên là 1.75 giây. Tóm lại: một vị trí trong top 10 đáng kính trọng, và một kết quả thực sự hiệu quả — nhưng chúng tôi cố tình tránh phóng đại nó như một chiến thắng trên bảng xếp hạng.

Khả năng đa phương thức và ngữ cảnh dài
Inkling chấp nhận văn bản (UTF-8), hình ảnh (40px đến 4096px qua bộ mã hóa patch phân cấp), và âm thanh (WAV 16kHz, tối đa khoảng 20 phút, sử dụng mã hóa token rời rạc). Đầu ra chỉ là văn bản — không có khả năng tạo hình ảnh hay âm thanh, vì vậy hãy lên kế hoạch cho một mô hình hiểu, không phải mô hình tạo sinh. Video đã được sử dụng trong quá trình tiền huấn luyện nhưng không phải là đầu vào được hỗ trợ hoặc đánh giá khi ra mắt, vì vậy đừng lên kế hoạch xoay quanh nó.
Khả năng chính là cửa sổ ngữ cảnh 1 triệu token trong các trọng số đã phát hành, điều này mở ra cánh cửa cho phân tích mã toàn bộ kho, tổng hợp tài liệu dài và các phiên tác nhân đa lượt kéo dài mà không cần phân khúc mạnh. Lưu ý sự khác biệt thực tế: các API được lưu trữ cung cấp tới 256K token, vì vậy toàn bộ 1M là một tính năng tự lưu trữ hiện nay. Kết hợp với thiết kế chú ý cửa sổ trượt và giải mã suy luận, câu chuyện về ngữ cảnh dài vẫn là một trong những điểm bán hàng thực tế nhất của Inkling.
Giá cả, các cấp và tổng chi phí sở hữu
Inkling thực sự mở. Các trọng số đầy đủ (một checkpoint BF16 cộng với một checkpoint NVFP4) có trên Hugging Face theo Apache 2.0, vì vậy tự lưu trữ miễn phí bản quyền — bạn chỉ trả tiền cho tính toán. Thinking Machines không kiếm tiền từ chính mô hình; doanh thu đến từ Tinker và các máy chủ bên thứ ba.
Định giá theo token được lưu trữ (theo Artificial Analysis), theo bậc ngữ cảnh:
64K. Đầu vào / 1M: $1.87; Đầu vào được lưu trong bộ nhớ đệm / 1M: $0.374; Đầu ra / 1M: $4.68
256K. Đầu vào / 1M: $3.74; Đầu vào được lưu cache / 1M: $0.748; Đầu ra / 1M: $9.36
Phản ánh mức giảm giá ra mắt 50% có thời hạn; các con số chính xác của Tinker cho mỗi token có trong tài liệu và sẽ thay đổi.
Tự lưu trữ so với API — cách suy nghĩ về TCO. Các yếu tố kinh tế xoay quanh khối lượng và mức sử dụng:
API (Tinker / đối tác): chi phí cố định bằng 0, trả tiền theo token, khởi động gần như tức thì. Phù hợp nhất với khối lượng thấp hoặc dao động đột ngột, hoặc khi đang xây dựng nguyên mẫu.
Tự lưu trữ (GPU thuê hoặc sở hữu): bạn trả tiền cho một nút GPU 4–8 dù nó có bận hay không, nhưng chi phí biên cho mỗi token tiệm cận giá điện thô. Vì Inkling chỉ kích hoạt 41 tỷ tham số và tiết kiệm token (~25K so với 37–43K theo bộ Artificial Analysis), thông lượng trên mỗi giờ GPU là thuận lợi, và các khối lượng công việc nặng, ổn định có thể rẻ hơn đáng kể so với định giá API trên mỗi token khi nút được sử dụng tốt. Các bình luận xung quanh buổi ra mắt cho rằng tự lưu trữ trọng số mở rẻ hơn khoảng 40–60% so với sử dụng API đóng ở quy mô lớn — một tuyên bố định hướng, không phải con số đã được kiểm toán.
Ghi chú biên tập viên — thêm hình ảnh minh họa: Biểu đồ hòa vốn — khối lượng token hàng tháng (x) so với tổng chi phí (y) với ba đường: API frontier đóng, API được Inkling lưu trữ, và Inkling tự lưu trữ trên một node GPU thuê — cho thấy điểm giao nhau nơi tự lưu trữ thắng thế.
An toàn, căn chỉnh và kiểm duyệt
An toàn là một trong những câu chuyện mạnh mẽ và khác biệt hơn của Inkling. Trên FORTRESS adversarial chuẩn nó đạt 78.0% — tốt nhất trong số các mô hình trọng lượng mở trong so sánh của MarkTechPost, vượt qua GLM 5.2 (71.3%), Kimi K2.6 (65.6%), và vượt xa DeepSeek V4 Pro (36.0%). Thinking Machines cũng nhấn mạnh đến độ không chắc chắn đã được hiệu chỉnh trong các đầu ra của mô hình.
Bài báo của VentureBeat đã nêu bật một thuộc tính liên quan: khả năng chống kiểm duyệt. Kết hợp với giấy phép Apache 2.0 cho phép, điều này đặt Inkling vào vị trí một mô hình mở mà các nhóm có thể điều chỉnh theo chính sách riêng của họ thay vì kế thừa một chế độ nội dung mờ đục do nhà cung cấp áp đặt — một yếu tố đáng cân nhắc cho các triển khai trong các lĩnh vực được quản lý hoặc theo khu vực. Như thường lệ với một mô hình ra mắt, chưa có cuộc kiểm tra an ninh độc lập (red-team) hay kiểm toán an toàn của bên thứ ba nào xuất hiện tại thời điểm viết bài, do đó hãy coi thông tin về FORTRESS là từ nhà cung cấp/bên thứ ba chứ không phải được chứng nhận bên ngoài.
Bạn có nên tinh chỉnh Inkling?
Tinh chỉnh có thể được coi là lý do tồn tại của Inkling. Một khung ra quyết định nhanh:
Tinh chỉnh (thông qua Tinker hoặc pipeline của riêng bạn) nếu: bạn có dữ liệu độc quyền, một lĩnh vực hẹp, hoặc một tác vụ mà một mô hình chuyên biệt nhỏ hơn đánh bại một mô hình đa năng; bạn cần sở hữu các trọng số; hoặc bạn muốn tích hợp một giọng văn, định dạng, hoặc chính sách cụ thể. Các tùy chọn ngữ cảnh Tinker 64K/256K và chiết khấu ra mắt giúp giảm rào cản.
Chỉ sử dụng mô hình cơ bản (tự lưu trữ hoặc API) nếu: tác vụ của bạn là mục đích chung, khối lượng thấp, hoặc bạn chưa xác thực rằng việc tinh chỉnh (fine-tuning) cải thiện chỉ số của bạn. Kỹ thuật prompt (prompt engineering) kết hợp với núm điều chỉnh reasoning_effort thường đủ dùng.
Hãy tìm nơi khác nếu: bạn cần khả năng mã hóa tác tử đẳng cấp tiên tiến ngay hôm nay (GLM 5.2 và Kimi K2.6 dẫn đầu các chuẩn đánh giá đó) hoặc bạn yêu cầu các đảm bảo chất lượng được kiểm toán độc lập.
Ưu điểm và nhược điểm
Ưu điểm
Trọng số hoàn toàn mở dưới Apache 2.0, miễn phí bản quyền để tự lưu trữ và miễn phí sử dụng thương mại.
MoE thưa hiệu quả (chỉ 41B hoạt động) cộng với hiệu suất token mạnh mẽ giúp chi phí suy luận và tốc độ duy trì tính cạnh tranh.
Khổng lồ ngữ cảnh 1M-token trong các trọng số (256K qua API).
Đa phương thức thực sự (văn bản, hình ảnh, âm thanh đầu vào).
Núm xoay nỗ lực suy luận có thể điều chỉnh (không → tối đa) để cân bằng chi phí/chất lượng theo thời gian thực.
An toàn đối kháng trọng số mở hàng đầu (FORTRESS 78,0%, theo MarkTechPost) và “khả năng chống kiểm duyệt.”
Đứng độc lập mạnh mẽ — top 10 trong số 97 trên Artificial Analysis Index, vượt qua Nemotron 3 Ultra, Gemma 4 31B và gpt-oss-120b.
Nhược điểm
Rõ ràng không phải là một mô hình tiên phong, theo chính lời thừa nhận của nhà sản xuất.
Theo sau các đối thủ mở hàng đầu (GLM 5.2, Kimi K2.6, DeepSeek V4 Pro) trên các chuẩn mực tác nhân và lập trình (Terminal Bench 2.1, SWE-bench Verified, HLE).
Hầu hết các điểm chuẩn đều do nhà cung cấp tự báo cáo và không được kiểm toán độc lập.
Chỉ xuất văn bản; không tạo hình ảnh/âm thanh; không có đầu vào video khi ra mắt; Inkling-Small vẫn đang trong bản xem trước.
Sử dụng "cục bộ" thực tế cần một nút đa GPU (~600GB VRAM ngay cả khi được lượng tử hóa).
Không có đánh giá phê bình độc lập hoặc đánh giá an toàn/đội đỏ nào mang tính thực chất xuất hiện khi ra mắt.
Ai nên sử dụng Inkling?
Inkling là một lựa chọn phù hợp nếu bạn là một chuyên gia hoặc nhóm muốnsở hữu và tùy chỉnh mô hình của bạn thay vì thuê một API đóng. Các trường hợp sử dụng lý tưởng bao gồm:
Các nhóm tinh chỉnh đang xây dựng các mô hình chuyên ngành thông qua Tinker hoặc pipeline của riêng họ.
Các triển khai nhạy cảm về chi phí, khối lượng lớn nơi tự lưu trữ miễn phí bản quyền đánh bại giá cước biên giới theo token.
các tác vụ có ngữ cảnh dài chẳng hạn như hỗ trợ mã trên toàn bộ kho lưu trữ, phân tích tài liệu và các phiên tác nhân dài.
Ứng dụng đa phương thức cần khả năng hiểu kết hợp văn bản, hình ảnh và âm thanh.
Triển khai nhạy cảm với chính sách muốn một nền tảng mở có tính an toàn mạnh mẽ, chống kiểm duyệt để tự liên kết.
Đây là một lựa chọn không phù hợp nếu bạn cần khả năng suy luận mạnh nhất hoặc hiệu suất lập trình tác nhân, cần đầu vào video hoặc đầu ra sinh tạo, hoặc yêu cầu các chuẩn mực được kiểm toán độc lập trước khi triển khai.
Phán quyết và đánh giá cuối cùng
Hãy nói thẳng về vấn đề: Inkling không phải là mô hình mạnh nhất hiện nay, và Thinking Machines cũng nói rõ điều đó. Đọc với thái độ hoài nghi, đó là một mức chuẩn thấp. Đọc công bằng, đó chính là mục đích — Inkling được tối ưu hóa cho một mục tiêu khác với việc đứng đầu bảng xếp hạng. Nó hiệu quả (41B active, ngân sách tác vụ ~25K-token), được cấp phép mở (Apache 2.0), an toàn theo tiêu chuẩn trọng số mở (FORTRESS 78%), và được xây dựng để tinh chỉnh và tự lưu trữ. Sự kết hợp đó khiến nó trở thành một trong những bản phát hành mô hình mở có suy nghĩ nhất của năm 2026, ngay cả khi nó xếp sau GLM 5.2 và Kimi K2.6 trên các bài kiểm tra tác nhân và lập trình khó nhất.
Các dấu hoa thị còn lại là các điểm chuẩn phần lớn tự báo cáo và sự thiếu vắng bất kỳ đánh giá phê bình độc lập nào ở thời điểm sớm này. Nhưng đối với đối tượng mục tiêu của nó — những người xây dựng coi trọng quyền sở hữu, tùy chỉnh, kiểm soát chi phí và một cửa sổ ngữ cảnh lớn hơn là quyền khoe khoang tiên phong — Inkling đáp ứng.
Đánh giá: 4 trên 5 dành cho đối tượng mục tiêu là các nhà xây dựng và tinh chỉnh; thấp hơn nếu bạn đang mua sắm chỉ vì khả năng tiên tiến.
Câu hỏi thường gặp
Inkling là gì và ai đã tạo ra nó? Inkling là mô hình đầu tiên từ Thinking Machines Lab, công ty khởi nghiệp AI do Mira Murati (cựu CTO của OpenAI) lãnh đạo. Nó được ra mắt vào ngày 15 tháng 7 năm 2026 như một mô hình suy luận mở, đa phương thức Mixture-of-Experts.
Inkling có phải là mô hình AI tốt nhất không? Không, và công ty không tuyên bố như vậy — họ nói Inkling “không phải là mô hình mạnh nhất hiện nay, dù là đóng hay mở.” Đo lường độc lập (Artificial Analysis) xếp hạng nó thứ 10 trên tổng số 97 về tổng thể, mặc dù nó dẫn đầu một số đối thủ mã nguồn mở.
Inkling có bao nhiêu tham số và cửa sổ ngữ cảnh của nó là gì?Tổng cộng 975B với 41B đang hoạt động (sparse MoE), trên 66 lớp. Cửa sổ ngữ cảnh lên tới 1,000,000 token trong các trọng số đã phát hành và lên tới 256K trên các API được lưu trữ.
Inkling có phải là mã nguồn mở không, và giấy phép là gì? Các trọng số được phát hành theo Apache 2.0, cho phép sử dụng thương mại và tự lưu trữ. Đây là “open weights” — toàn bộ trọng số mô hình có trên Hugging Face.
Inkling có miễn phí sử dụng không?Các trọng số được miễn phí và miễn phí bản quyền để tự lưu trữ. Tinh chỉnh trên Tinker và suy luận được lưu trữ thông qua các nhà cung cấp như Together AI, Fireworks, Modal, Databricks hoặc Baseten là các dịch vụ trả phí. Quyền truy cập được lưu trữ bắt đầu từ khoảng $1.87 / 1 triệu token đầu vào (giảm giá ra mắt có thời hạn).
Làm thế nào để chạy hoặc tải xuống Inkling, và tôi cần phần cứng gì?Tải trọng số từ Hugging Face và phục vụ chúng với vLLM, SGLang, hoặc Hugging Face transformers thông qua API tương thích với OpenAI. Dự kiến khoảng ~2TB VRAM tổng hợp cho BF16 (8× B300 / 16× H200) hoặc ~600GB cho checkpoint lượng tử hóa NVFP4 (4× B300 / 8× H200). Các bản dựng Community Unsloth GGUF hạ thấp rào cản cho thử nghiệm.
Làm thế nào để tinh chỉnh Inkling? Sử dụng Thinking Machines’ Tinker nền tảng, cung cấp các tùy chọn ngữ cảnh 64K và 256K cùng với ưu đãi giảm 50% trong thời gian có hạn khi ra mắt, hoặc tinh chỉnh trọng số mở trong pipeline của riêng bạn.
Nỗ lực suy nghĩ có thể kiểm soát là gì? Một cài đặt reasoning_effort (none / minimal / low / medium / high / xhigh / max) đánh đổi độ trễ và chi phí token lấy độ sâu suy luận. Mức low phù hợp cho phân loại và trích xuất; mức max phù hợp cho toán khó và khớp với cấu hình benchmark (Effort=0.99).
Inkling so sánh như thế nào với Kimi, GLM, DeepSeek và Nemotron?Theo so sánh của MarkTechPost, Inkling dẫn đầu về FORTRESS (an toàn) và đánh bại Nemotron 3 Ultra một cách rộng rãi, nhưng lại thua GLM 5.2, Kimi K2.6 và DeepSeek V4 Pro trên Terminal Bench 2.1, SWE-bench Verified và HLE. Nó có tính cạnh tranh nhưng không phải là mô hình mở mạnh nhất về mã hóa tác nhân.
Inkling có thể xử lý hình ảnh, âm thanh và video không? Nó chấp nhận văn bản, hình ảnh (40px–4096px) và âm thanh (16kHz WAV, tối đa ~20 phút) làm đầu vào. Đầu ra chỉ là văn bản — không có tạo hình ảnh hay âm thanh. Video đã được sử dụng trong quá trình tiền huấn luyện nhưng không phải là đầu vào được hỗ trợ khi ra mắt.
Điểm benchmark của Inkling có đáng tin cậy không? Hãy thận trọng khi sử dụng chúng. Ngoài Chỉ số Artificial Analysis Intelligence độc lập, các con số tiêu đề do nhà cung cấp tự báo cáo khi ra mắt và không được kiểm toán độc lập. Các số liệu của đối thủ đến từ bên thứ ba (MarkTechPost) hoặc được Thinking Machines chạy lại và có thể không khớp với số liệu báo cáo của chính đối thủ.
Inkling-Small là gì và lộ trình phát triển như thế nào?Inkling-Small là một biến thể nhỏ hơn (tổng 276B / 12B hoạt động). Tại thời điểm ra mắt, nó vẫn đang trong giai đoạn xem trước, với các trọng số chưa được phát hành. Mô hình chính đã có sẵn các lớp MTP để giải mã suy diễn.
So sánh trong bài viết này2
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
