
Inkling-Small: Mô hình chỉ bằng một phần tư kích thước đánh bại chính bản flagship của mình, nhưng vẫn xếp sau chỉ số.
- qwenMỚIQwen: Qwen3.8 Max2026-08-03$2.00 / $6.00 trên 1 triệu token · 56 tok/s
- deepseekMỚIDeepSeek: DeepSeek V4 Flash 07312026-07-3150Trí tuệ69Lập trình
- qwenMỚIQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token · 201 tok/s
- orcaMỚIOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicMỚIAnthropic: Claude Opus 52026-07-2461Trí tuệ78Lập trình
- googleGoogle: Gemini 3.6 Flash2026-07-2150Trí tuệ69Lập trình
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Trí tuệ49Lập trình
- metaMeta: Muse Spark 1.12026-07-1651Trí tuệ71Lập trình
- kimiMoonshotAI: Kimi K32026-07-1557Trí tuệ76Lập trình
- openaiOpenAI: GPT-5.6 Luna2026-07-0951Trí tuệ71Lập trình
- openaiOpenAI: GPT-5.6 Terra2026-07-0955Trí tuệ77Lập trình
- openaiOpenAI: GPT-5.6 Sol2026-07-0959Trí tuệ77Lập trình
- grokxAI: Grok 4.52026-07-0854Trí tuệ72Lập trình
- tencentTencent: Hy32026-07-0641Trí tuệ59Lập trình
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Trí tuệ42Lập trình
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Trí tuệ39Lập trình
- anthropicAnthropic: Claude Sonnet 52026-06-3053Trí tuệ72Lập trình
- klingKling: Kling 3.0 Turbo2026-06-1757Trí tuệ52Lập trình57Toán
- z-aiZ.ai: GLM 5.22026-06-1651Trí tuệ69Lập trình60Toán
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242Trí tuệ61Lập trình61Toán
Thinking Machines Lab đã dành hai tuần sau khi phát hành mô hình open-weights đầu tiên để xây dựng một mô hình có kích thước chỉ bằng một phần tư, và trên chính bảng điểm của phòng lab, mô hình nhỏ hơn lại thắng. Inkling-Small đạt 80,2% trên SWE-bench Verified so với Inkling ở mức 77,6%, 89,5% trên GPQA Diamond so với 87,2%, 64,7% trên Terminal-Bench 2.1 so với 63,8%, và 31,6% trên Humanity's Last Exam so với 29,7% — từ 276B tổng tham số với 12B hoạt động, thay vì 975B với 41B. Trong các con số chính mà hai thẻ mô hình cùng có, mô hình hàng đầu 975B chỉ giữ được đúng một: AIME 2026, với chênh lệch 1,6 điểm.
Sau đó, Artificial Analysis đã chạy thử nghiệm độc lập cả hai mô hình và xếp Inkling-Small ở mức 40 trên Intelligence Index, so với 41 của Inkling — mô hình nhỏ hơn kém một điểm. Cả hai kết quả đó đều có thật, và khoảng cách giữa chúng là điều hữu ích nhất trong đợt ra mắt này. Mọi thứ dưới đây phân biệt rõ những gì Thinking Machines báo cáo về mô hình của mình với những gì người khác đo được: số liệu từ nhà cung cấp lấy từ thông báo ra mắt và hai thẻ mô hình trên Hugging Face, số liệu độc lập từ các lần chạy của chính Artificial Analysis, còn số liệu giá cả và độ dài ngữ cảnh lấy từ dữ liệu endpoint trực tiếp của OpenRouter, được kiểm tra vào ngày viết bài này. Ở những chỗ ba nguồn này bất đồng — và về độ dài ngữ cảnh chúng có bất đồng — chúng tôi nói rõ điều đó thay vì chọn con số đẹp hơn.
Những gì thực sự được phát hành vào ngày 30 tháng 7
Inkling-Small là một transformer hỗn hợp chuyên gia thưa: tổng cộng 276B tham số, 12B hoạt động cho mỗi token, 42 lớp, với mỗi token được định tuyến đến 6 trong số 256 chuyên gia, cộng thêm 2 chuyên gia dùng chung xử lý mọi token. Cơ chế attention xen kẽ giữa các lớp cục bộ và toàn cục. Trọng số được đăng tải trên Hugging Face theo giấy phép Apache 2.0, không có hạn chế thương mại, mô hình có thể tinh chỉnh trên Tinker API của Thinking Machines, và bạn có thể trò chuyện với nó bằng văn bản, hình ảnh và âm thanh trong Tinker Playground. Phòng thí nghiệm cho biết mô hình được huấn luyện trên hệ thống NVIDIA GB300 NVL72.

Tính đa phương thức vốn có chứ không phải ghép thêm vào, và thẻ mô hình đặc biệt cụ thể về cách thức thực hiện. Không có bộ mã hóa thị giác hay âm thanh riêng biệt: âm thanh đến dưới dạng phổ dMel, hình ảnh dưới dạng các mảng 40×40 pixel được đưa qua hMLP bốn lớp, và cả hai được nhúng trực tiếp vào cùng một luồng token như văn bản. Đầu vào là văn bản, hình ảnh và âm thanh; đầu ra chỉ là văn bản, điều này đáng nói rõ vì "đa phương thức" thường bị hiểu nhầm là "nó có thể nói" — đủ thường xuyên để làm hỏng cả một buổi chiều. Mức độ tư duy là một núm xoay có năm cài đặt — tối thiểu, thấp, trung bình, cao, cực cao — nên cùng một bộ trọng số có thể chạy nhẹ hoặc chạy mạnh.
Phần thú vị của công thức này nằm ở giai đoạn hậu huấn luyện. Inkling-Small được chưng cất theo phương pháp on-policy với bản Inkling đầy đủ làm giáo viên, sau đó được huấn luyện thêm khoảng hai tuần bằng học tăng cường được mở rộng quy mô trên tác vụ lập trình tác nhân. Chính thứ tự đó giải thích hình dạng của kết quả: học sinh kế thừa năng lực chung của giáo viên, rồi được huấn luyện thêm đúng trên trục mà hiện nay nó vượt trội hơn giáo viên.
{{1}}Bảng xếp hạng do Thinking Machines công bố{{/1}}
Điểm chuẩn của hãng chỉ mang tính tiếp thị cho đến khi có ai đó tái lập được, nên hãy đọc phần này như những gì phòng thí nghiệm công bố, chứ không phải những gì đã được xác minh. Đây vẫn là một bộ đánh giá rộng, và rộng theo hướng bất lợi cho sản phẩm chủ lực.

Ngoài bốn con số dùng chung, card hoàn thiện nốt bức tranh — tất cả các lần chạy của riêng Thinking Machines:
• Công việc tác nhân — 1269 Elo trên GDPval-AA v2, một chuẩn đánh giá các tác vụ kinh tế thực tế thay vì các câu đố.
• Biểu đồ và tài liệu — 77.4% trên CharXiv RQ, tăng lên 81.3% khi mô hình được phép viết và chạy Python. Mức tăng 3.9 điểm đó là một gợi ý hữu ích rằng quyền truy cập công cụ mang lại nhiều lợi ích hơn cho công việc suy luận trực quan so với kỹ thuật prompt.
• Vision — 74.0% trên MMMU Pro, nhỉnh hơn một chút so với mức 73.5% của Inkling.
• Audio — 90.1% VoiceBench và 77.0% MMAU, cả hai đều hơi thấp hơn 91.4% và 77.2% của bản flagship. Audio là một trong hai khía cạnh mà việc thu nhỏ rõ ràng đã phải trả giá.
• An toàn — 98,4% StrongREJECT và 96,9% trên các prompt lành tính FORTRESS, nhưng chỉ 71,6% trên FORTRESS đối kháng so với 78,0% của mẫu chủ lực. Đó là cái giá khác: độ hồi quy 6,4 điểm về khả năng chống đối kháng, điều quan trọng hơn bất kỳ lợi ích mã hóa nào nếu mô hình sẽ được đặt sau một hộp văn bản công khai.
• Dự báo — Chỉ số Brier 61.3 ± 0.46 trên ForecastBench khi không có quyền truy cập tìm kiếm, và điểm Brier 0.1238 ± 0.0086 trên Prophet Arena. Việc công bố cả khoảng sai số ngay từ đầu đã thể hiện sự nghiêm túc hơn hầu hết các bài viết giới thiệu ra mắt.
Một khoảng trống: thẻ của flagship liệt kê 54,3% trên SWE-bench Pro, phiên bản khó hơn của SWE-bench Verified. Thẻ của Inkling-Small không báo cáo SWE-bench Pro. Với việc con số Verified được nêu bật rầm rộ đến vậy, sự vắng mặt của nó là con số mà chúng tôi rất muốn được điền vào.
Chỉ số độc lập nói gì thay vào đó
Artificial Analysis xếp Inkling-Small ở mức 40 {{1}}trên phiên bản 4.1 của Chỉ số Trí tuệ{{/1}}, kém {{2}}Inkling một điểm ở mức 41{{/2}}. Chỉ số này là tổng hợp của {{3}}chín bài đánh giá{{/3}} — {{KEEP}}GDPval-AA v2, τ³-Banking, Terminal-Bench v2.1{{/KEEP}}, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience và AA-LCR — {{4}}và danh sách đó giải thích phần lớn sự mâu thuẫn rõ ràng{{/4}}. Chỉ {{5}}hai trong số chín bài trùng với phần trình diễn lập luận trên thẻ của Thinking Machines{{/5}}. Phần còn lại nghiêng về {{6}}sử dụng công cụ tác nhân, truy xuất ngữ cảnh dài và khả năng chống ảo giác{{/6}}, và một mô hình có thể thắng {{7}}các điểm chuẩn mà phòng thí nghiệm chọn công bố{{/7}} trong khi thua {{8}}những bài mà bên thứ ba chọn chạy{{/8}}. Không bên nào nói dối; họ đang {{9}}đo lường những thứ khác nhau{{/9}}.

Còn có một chi tiết trong phần chữ in nhỏ đáng giá hơn cả tiêu đề một điểm kia: Artificial Analysis liệt kê mục của mẫu flagship là Inkling (xhigh) — cài đặt mức nỗ lực tư duy cao nhất của nó — trong khi hàng Inkling-Small không có hậu tố nỗ lực. Vậy nên, lợi thế một điểm của mẫu flagship được ghi nhận với mức suy luận được vặn lên hết cỡ. Nếu việc khớp mức nỗ lực làm so sánh đó thay đổi dù chỉ một chút, thì lập luận cuối cùng cho mô hình lớn hơn chỉ dựa trên khả năng cũng sẽ biến mất theo.
Nơi dữ liệu độc lập không hề gần nhau là tốc độ và chi phí, và ở đây nó ủng hộ mô hình nhỏ với mức chênh lệch mà không bảng so sánh nào thể hiện được:
• Tốc độ đầu ra — 133 token mỗi giây so với 80 của Inkling (xhigh). Artificial Analysis xếp hạng Inkling-Small #7 trong số 101 mô hình cùng phân khúc về tốc độ, so với mức trung bình của phân khúc là 66.
• Thời gian đến token đầu tiên — 1.63s so với 1.84s. Một lợi thế thực nhưng nhỏ.
• Giá hỗn hợp cho mỗi 1 triệu token — 0,22 USD so với 0,72 USD theo cách tính trọng số của họ. Chi phí chỉ bằng khoảng một phần ba, nhưng chỉ số thấp hơn một điểm.
• Xếp hạng trí tuệ — #15 trên 101, so với điểm trung vị của lớp là 25. Trên mức trung bình một cách thoải mái, nhưng còn xa mức tiên phong.
• Sự dài dòng — và đây chính là điểm hóc búa. Nó đã tiêu tốn 130 triệu token đầu ra để vượt qua chỉ số, so với mức trung vị 100 triệu. Bản tóm tắt của Artificial Analysis gọi điều này là "nhanh đáng chú ý, tuy nhiên hơi dài dòng." Nó suy nghĩ nhiều hơn khoảng 30% so với thông thường, điều này âm thầm bào mòn một phần mức chiết khấu theo token.
Một lưu ý nhỏ về sổ sách, vì bất kỳ ai so sánh các nguồn sẽ gặp phải điều này: Artificial Analysis liệt kê tổng số tham số là 266B, trong khi thông báo, cả hai thẻ mô hình và OpenRouter đều nói 276B. Chúng tôi đã sử dụng 276B xuyên suốt. Điều này không làm thay đổi bất kỳ kết luận nào, nhưng đây là loại chênh lệch đáng biết trước khi bạn trích dẫn một con số trong tài liệu thiết kế.
Những gì bạn thực sự có thể thuê hôm nay lại không giống như những gì bảng thông số kỹ thuật ghi.
Khoảng cách giữa việc công bố trọng số mở và một endpoint có thể sử dụng là nơi mà hầu hết các bài đưa tin về ra mắt ngừng chú ý. Thinking Machines quảng bá một cửa sổ ngữ cảnh lên tới 1 triệu token, và Artificial Analysis cũng liệt kê 1 triệu. Trên OpenRouter, cả hai nhà cung cấp hiện đang phục vụ Inkling-Small đều giới hạn nó ở mức 524,288 token — bằng một nửa con số được quảng bá. Đó không phải là mâu thuẫn mà là sự khác biệt giữa những gì kiến trúc hỗ trợ và những gì đã được đưa vào sản xuất. Ngược lại, mẫu Inkling chủ lực có một endpoint với đầy đủ 1,048,576 token, mặc dù cùng endpoint đó giới hạn phần sinh ra ở mức 32,768 token.
Phần còn lại của bức tranh trực tiếp, đọc từ dữ liệu endpoint của OpenRouter:
• Hai nhà cung cấp, hai mức giá — $0.45 mỗi 1M đầu vào và $1.20 mỗi 1M đầu ra từ một nhà cung cấp, $0.50 và $1.20 từ nhà cung cấp kia. Artificial Analysis liệt kê mức giá trực tiếp từ chính Thinking Machines thấp hơn nữa, ở $0.30 và $1.20, với đầu vào đã lưu cache ở mức $0.06. Các bên lưu trữ bên thứ ba đang tính phí cao hơn 50–67% cho đầu vào với cùng một bộ trọng số.
• Bộ nhớ đệm prompt — 0,10 USD cho mỗi 1M token đầu vào được lưu trong bộ nhớ đệm qua OpenRouter, so với 0,17 USD cho mô hình hàng đầu.
• Các số liệu bạn thuê không phải là các số liệu đã được benchmark — model card liệt kê BF16 và NVFP4. Endpoint rẻ hơn phục vụ fp8; cái còn lại không khai báo lượng tử hóa nào cả. Điểm benchmark của nhà cung cấp không được đo trên phiên bản fp8 của các trọng số này, và ảnh hưởng của lượng tử hóa đối với các phiên chạy agent dài chính là loại thứ mà mức chênh lệch 0,9 điểm trên Terminal-Bench không thể sống sót. Nếu bạn muốn tái hiện một con số, hãy ghi chú endpoint bạn đã sử dụng.
• Phạm vi tính năng không đồng đều giữa các nhà cung cấp — cả hai endpoint đều có reasoning và reasoning_effort, vì vậy nút xoay suy luận năm mức hoạt động. Nhưng chỉ một endpoint quảng cáo tool calling và logprobs, và hiện tại cả hai đều không quảng cáo response_format, tham số chế độ đầu ra có cấu trúc/JSON. Inkling chủ lực có một endpoint làm được điều đó. Nếu pipeline của bạn phụ thuộc vào JSON có ràng buộc schema, đây là chi tiết sẽ gây đau đầu ngay từ ngày đầu, và đó là giới hạn của nhà cung cấp chứ không phải của mô hình.
• Trần hoàn thành — 262,144 token trên endpoint fp8; cái còn lại tuyên bố không có giới hạn.
Trường hợp chi phí, dựa trên số token đo được
Giá trên mỗi triệu token là một cách tồi để so sánh các mô hình lập luận, vì toàn bộ biến số nằm ở số token chúng đốt để suy nghĩ. Artificial Analysis công bố chi phí thực tế, một công cụ tốt hơn nhiều: đưa Inkling-Small qua toàn bộ Intelligence Index tiêu thụ khoảng 130 triệu token đầu ra và chi phí $192.37, tức là khoảng $0,07 cho mỗi tác vụ theo bình quân gia quyền của họ.
Đối chiếu điều đó với cùng một thước đo cho các mô hình mà mọi người thực sự triển khai: DeepSeek V4 Flash với giá $0.03 mỗi tác vụ, gpt-oss-120b với giá $0.08, Gemini 3.6 Flash với giá $0.56, GLM-5.2 với giá $0.57, Kimi K3 với giá $0.86, GPT-5.6 Sol với giá $1.23, Claude Opus 5 với giá $2.34, Claude Fable 5 với giá $3.15. Inkling-Small là mô hình rẻ thứ hai trong nhóm đó và rẻ hơn khoảng 18 lần mỗi tác vụ so với GPT-5.6 Sol, vốn đạt 59 điểm so với 40 điểm của nó.
Cũng có một cách rõ ràng hơn để thấy vì sao giá lại giảm xuống mức đó. Số tham số hoạt động giảm từ 41B xuống 12B, tức gấp 3.4 lần. Giá đầu ra giảm từ $4.05 xuống $1.20 mỗi triệu, tức gấp 3.375 lần. Giá thuê của một MoE thưa thực chất chỉ là chi phí tính toán trên mỗi token, và Thinking Machines đã định giá theo đúng vậy thay vì định giá theo điểm chuẩn.
Một lưu ý thực tế khi tự chạy phép so sánh đó: Inkling-Small hiện không nằm trong danh mục OrcaRouter, nên bạn sẽ phải thuê nó từ các endpoint riêng của nó. Các mô hình đóng mà bạn sẽ đem so sánh với nó — GPT-5.6 Sol, Claude Opus 5, Gemini 3.6 Flash và phần còn lại của danh sách đó — đều có trên OrcaRouter với một khóa duy nhất ở mức phụ giá 0%, nghĩa là bạn trả đúng giá niêm yết của từng nhà cung cấp mà không bị cộng thêm gì lên trên. Điều đó đặc biệt quan trọng đối với một mô hình chi phí: con số bạn đưa vào bảng tính chính là con số được xuất hóa đơn, và khi nhà cung cấp giảm giá, điều đó sẽ được phản ánh phía chúng tôi ngay trong ngày thay vì sau khi đàm phán lại. Tự động chuyển đổi dự phòng giữa các nhà cung cấp bao trùm nửa còn lại của một cuộc đánh giá, đó là nhánh cơ sở gặp sự cố giữa chừng và âm thầm làm sai lệch số liệu của bạn.
Vị trí thực sự của nó trong số các mô hình mở trọng số
Đọc trong tương quan với flagship, Inkling-Small trông như một thắng lợi. Đọc trong tương quan với toàn thị trường, nó trông như một mô hình open-weights ở giữa bảng khá vững chắc, và phần lớn các bài đưa tin ra mắt đã bỏ qua cách đọc thứ hai này.
Trên chỉ số Artificial Analysis Intelligence Index, các mô hình xếp trước cả hai Inklings bao gồm Claude Opus 5 với 61 điểm, Claude Fable 5 với 60 điểm, GPT-5.6 Sol với 59 điểm, Kimi K3 với 57 điểm, Grok 4.5 với 54 điểm, GLM-5.2 và Muse Spark 1.1 với 51 điểm, và Gemini 3.6 Flash với 50 điểm. Điều đó là điều dễ hiểu — đó là các hệ thống tiên phong, hầu hết là hệ thống đóng, một số có quy mô rất lớn.
Mô hình thực sự nên thay đổi quyết định là DeepSeek V4 Flash, đạt 50 điểm so với 40 của Inkling-Small ở tổng 284B và 13B tham số hoạt động — thực tế cùng phân khúc kích thước và cùng mức giá hời của mô hình mở trọng số, với chi phí mỗi tác vụ chưa đến một nửa. Nếu thứ bạn cần là mô hình mở trọng số rẻ nhất có năng lực, số liệu độc lập chỉ về đó, không phải ở đây. Ngoài ra, không như Inkling-Small, mô hình này khả dụng qua OrcaRouter, nên việc thử nghiệm phương án thay thế đó với khối lượng công việc của bạn chỉ là thay đổi chuỗi mô hình chứ không phải một quy trình mua sắm.
Điều mà Inkling-Small có mà DeepSeek V4 Flash không có là đầu vào âm thanh và hình ảnh được tích hợp sẵn trong cùng một bộ trọng số, một nút xoay tư duy năm cấp độ, và tinh chỉnh Tinker từ phòng thí nghiệm đã huấn luyện nó. Đó là những điểm khác biệt thực sự đối với một tác nhân đa phương thức, và đó là lý do trung thực để chọn nó — không phải điểm chỉ số.
Ai nên di chuyển, và ai nên ở lại
Quyết định được phân chia một cách rõ ràng, điều này đủ bất thường để đáng được nêu rõ như vậy.
• Chuyển từ Inkling sang Inkling-Small nếu bạn đang chạy các tác nhân mã hóa. Các số liệu của nhà cung cấp nghiêng về mô hình nhỏ trên SWE-bench Verified và Terminal-Bench, lý do được ghi nhận là RL agentic bổ sung, và nó có chi phí chỉ bằng khoảng một phần ba và trả về token nhanh hơn 1,66 lần. Trả gấp 3,3 lần cho một điểm chỉ số được đo ở mức nỗ lực suy nghĩ tối đa là một lập luận khó có thể biện minh.
• Hãy chuyển nếu chi phí cho mỗi tác vụ suy luận là ràng buộc quyết định và bạn chấp nhận được mức 40 trên chỉ số. 0,07 USD mỗi tác vụ với mức giá cache-hit 0,06 USD mỗi triệu trên endpoint của bên thứ nhất là một mức giá rất cạnh tranh cho một mô hình có âm thanh và thị giác tích hợp sẵn.
• Chuyển sang nếu bạn đang tinh chỉnh. Mô hình 276B/12B rẻ hơn đáng kể để điều chỉnh và phục vụ so với 975B/41B, và Tinker hỗ trợ cả hai.
• Hãy ở lại với Inkling nếu bạn cần âm thanh dài. Đây là mức suy giảm rõ rệt nhất trong bản phát hành và nó được giấu trong các thẻ mô hình: mô hình hàng đầu khuyến nghị đầu vào âm thanh dưới 20 phút, trong khi thẻ của Inkling-Small khuyến nghị dưới 2 phút. Mức cắt giảm gấp mười lần. Nếu bạn đang phiên âm hoặc suy luận về các cuộc họp, mô hình nhỏ không phải là giải pháp thay thế trực tiếp ở bất kỳ mức giá nào.
• Hãy chọn nếu bạn cần ngữ cảnh vượt quá 512K từ một endpoint được lưu trữ, hoặc các phản hồi dài hơn 262K token. Hiện tại, chỉ phiên bản flagship có endpoint phục vụ đủ một triệu token.
• Hãy ở lại nếu bạn cần JSON tuân thủ schema mà không cần tự viết vòng lặp xác thực và thử lại, cho đến khi nhà cung cấp hỗ trợ response_format cho mô hình nhỏ.
• Giữ nguyên nếu độ bền vững đối kháng là yếu tố then chốt. 71.6% so với 78.0% trên FORTRESS adversarial là hướng sai đối với bất kỳ sản phẩm nào hướng tới người dùng, và đó là con số của chính phòng thí nghiệm.
Ba câu hỏi mà bài đưa tin về vụ phóng để ngỏ
Inkling-Small có phải chỉ là một Inkling được chưng cất không?
Một phần, và phần không phải như vậy mới là phần quan trọng. Chưng cất on-policy với Inkling làm giáo viên là một giai đoạn trong quá trình hậu huấn luyện, nên phần lớn năng lực chung thực sự được kế thừa. Nhưng đây là một mô hình có kiến trúc riêng — 42 lớp so với 66 lớp của mô hình chủ lực, với cùng cấu trúc định tuyến gồm 6 chuyên gia hoạt động trong số 256 cộng 2 chuyên gia dùng chung, nghĩa là các chuyên gia tự thân hẹp hơn chứ không phải ít đi. Và nó nhận được khoảng hai tuần RL lập trình tác nhân mà mô hình giáo viên chưa từng được nhận. Chính giai đoạn cuối đó là lý do khiến một học viên được chưng cất đạt điểm cao hơn giáo viên của mình trên các bài chuẩn về lập trình, điều mà bình thường không nên xảy ra.
Liệu tôi có thực sự tự lưu trữ được nó không?
Chỉ trên phần cứng thực sự mạnh mẽ. 276B tham số tương đương khoảng 276GB trọng số ở 8-bit và khoảng 552GB ở BF16, chưa tính bộ đệm KV — dù sao cũng cần một node đa GPU, không phải máy trạm. Ưu điểm của sparse MoE là chi phí suy luận, không phải dung lượng bộ nhớ; bạn lưu trữ toàn bộ 276B nhưng chỉ tính toán với 12B. Thẻ thông tin nêu tên SGLang, vLLM, TokenSpeed, Unsloth và Hugging Face Transformers là các đường dẫn phục vụ được hỗ trợ và liệt kê kiểu số BF16, NVFP4. Cũng lưu ý rằng cả hai endpoint đang lưu trữ hiện nay đều phục vụ phiên bản lượng tử hóa, vì vậy "cùng một mô hình" khi tự lưu trữ ở BF16 sẽ không hoạt động giống hệt như API bạn đã thử nghiệm.
975B Inkling có còn lý do để tồn tại không?
Ba điểm, và tất cả đều hẹp: toàn bộ {{1}}ngữ cảnh phục vụ 1M-token{{/1}}, đầu vào âm thanh dài hơn {{2}}hai phút{{/2}}, và hành vi an toàn đối kháng tốt hơn. Đáng chú ý là, {{3}}"thông minh hơn"{{/3}} không thể chắc chắn nằm trong danh sách đó — một điểm chỉ số ở mức nỗ lực suy luận tối đa, so với một bộ benchmark của nhà cung cấp mà mô hình nhỏ hơn hầu như thắng, không phải là một lập luận về năng lực. Hai tuần sau khi ra mắt mô hình chủ lực 975B, Thinking Machines đã phát hành mô hình khiến cho việc khuyến nghị trở nên khó khăn. Đó hoặc là sự thẳng thắn bất thường hoặc là tốc độ bất thường, và dù thế nào đi nữa, đó là một dấu hiệu tốt về phòng nghiên cứu này.
Xem gì tiếp theo
Ba điều sẽ quyết định cách bản phát hành này được đánh giá theo thời gian. Liệu một endpoint có xuất hiện phục vụ ngữ cảnh 1M như quảng cáo hay không, điều này sẽ xóa bỏ lợi thế rõ ràng nhất còn lại của mẫu flagship. Liệu có ai công bố một so sánh độc lập với mức nỗ lực tương đương giữa hai mô hình hay không, đó là cách duy nhất để biết liệu điểm index đó có thật hay không. Và liệu khuyến nghị âm thanh 2 phút là giới hạn huấn luyện hay mặc định phục vụ — bởi nếu là trường hợp sau, lý do lớn nhất để tiếp tục dùng mô hình lớn hơn sẽ tan biến. Cho đến lúc đó, tóm tắt trung thực là Thinking Machines đã phát hành một mô hình có giá chỉ bằng một phần ba, nhanh hơn hai phần ba, tốt hơn về lập trình theo bằng chứng của chính họ, hơi kém hơn về điểm tổng hợp độc lập, và rõ ràng kém hơn một đối thủ cùng kích thước mà hầu hết các bài viết không đề cập đến.
