Một thẻ tiêu đề được tạo có tiêu đề 'TwIL-LM3-Pro', phụ đề 'Mô hình logic hình thức 3.66B', với ba thẻ số liệu bo tròn ghi '3.66B tham số', '2.09 GiB Q4_K_M' và 'ngữ cảnh 131,072 token'. Một dòng chân trang ghi 'Điểm chuẩn nhà cung cấp: webAI Track A / Track B harness.' Logo OrcaRouter được ghép ở góc dưới bên phải.
Guides & Insights

TwIL-LM3-Pro: Mô hình logic hình thức 3,66B được phân phối theo yêu cầu qua email

Tác giả

Alistair Wren

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

TwIL-LM3-Pro là một mô hình suy luận 3,66 tỷ tham số đến từ webAI, được xây dựng riêng cho logic hình thức thay vì cho hội thoại thông thường, và nó đã có mặt trên Hugging Face kể từ ngày 3 tháng 9 năm 2026. Đây không phải là một bản phát hành mới, và cách diễn đạt đang lan truyền xung quanh nó trong tuần này — rằng webAI "đã phát hành một mô hình 3,66B" — đã muộn một tháng so với thời điểm trọng số ra mắt. Điều thực sự thay đổi trong vài ngày qua thì nhỏ hơn và hữu ích hơn: checkpoint đã được chỉnh sửa vào ngày 30 tháng 9, và vào ngày 1 tháng 10, webAI đã công bố bản dựng LiteRT-LM của mô hình để suy luận trên thiết bị Android và iOS. Vậy nên câu hỏi thú vị không phải là TwIL-LM3-Pro là gì, mà là liệu bạn có thể có được nó hay không, và câu trả lời phụ thuộc vào việc bạn đang đứng ở kênh nào trong ba kênh phân phối — bởi vì một trong số đó là một biểu mẫu.

Sự khác biệt đó quan trọng hơn mức nó thường có, vì TwIL-LM3-Pro không phải là một sản phẩm mà bạn chỉ cần gọi. Nó là một checkpoint bạn tải về, chạy trên phần cứng của riêng mình và chấp nhận các điều khoản của một giấy phép cấm sử dụng thương mại. Phép so sánh mà chính thẻ mô hình của nó mời gọi — với Qwen3-8B, một mô hình có số tham số nhiều hơn gấp đôi — là có thật, nhưng đó là so sánh các benchmark do nhà cung cấp chạy trên một harness do nhà cung cấp dựng, và chính thẻ mô hình cũng nói rõ điều đó ở nhiều chỗ hơn hầu hết. Bài viết này đọc kỹ thẻ đó và tách bạch những gì webAI đã đo với những gì bất kỳ ai khác có được.

Mô hình thực sự là gì

`. Keep exact code/brand names, URLs. Translate text. Need output only translated text. We need translate accurately. Vietnamese. Technical terms: dense Granite decoder — bộ giải mã Granite dày đặc? "dense" in model architecture = "dense" (dày đặc / kết nối đầy đủ). Could keep "dense" maybe "decoder Granite dày đặc". 40 layers = 40 lớp, hidden size = kích thước ẩn, attention heads = đầu chú ý, key-value heads = đầu khóa-giá trị. derived from = có nguồn gốc từ. parameter count = số lượng tham số. context window = cửa sổ ngữ cảnh. carried through unchanged = giữ nguyên không đổi. emits a block before answering = phát ra một khối `<think>…</think>` trước khi trả lời. evaluated with greedy decoding at a 2,048-token budget = được đánh giá bằng giải mã tham lam với ngân sách 2.048 token. Use comma for thousands? Vietnamese uses dots for thousands and comma decimal. But numbers maybe preserve? 3,659,737,600 could be 3.659.737.600? In Vietnamese, thousand separator is dot. But technical numbers maybe keep as original? We should translate text. The number 3.66B and 3,659,737,600. Could write 3,66 tỷ? But likely preserve numeric formatting? The instruction says preserve URLs and brand/product names, not necessarily numbers. We can localize number formatting. But "3.66B" maybe "3,66 tỷ". However "3,659,737,600" exact total. In Vietnamese, "3.659.737.600". But if exact count, changing separators is normal. Should we keep 3,659,737,600 to avoid confusion? Vietnamese readers understand comma thousands too. But localization engine might convert. The prompt says "The 3.66B parameter count is the real total, 3,659,737,600". Maybe translate: "Số lượng tham số 3,66 tỷ là tổng thực, 3.659.737.600". But "3.66B" = 3.66 billion. In Vietnamese 3,66 tỷ. The exact number 3,659,737,600 = 3.659.737.600. Hmm. Need output only translated text. No markers to worry. But maybe there are hidden markers? The user's message as displayed includes no markers. We can ignore marker instructions. Let's craft: "TwIL-LM3-Pro là một bộ giải mã Granite dense — `GraniteForCausalLM`, 40 lớp, kích thước ẩn 2.560, 40 đầu chú ý so với 8 đầu khóa-giá trị — được phát triển từ `granite-4.2-3b` của IBM. Số lượng tham số 3,66 tỷ là tổng thực, 3.659.737.600, và cửa sổ ngữ cảnh là 131.072 token của mô hình cơ sở được giữ nguyên không đổi. Nó phát ra một khối `<think>…</think>` trước khi trả lời và được đánh giá bằng giải mã tham lam với ngân sách 2.048 token." Need "dense Granite decoder" maybe "bộ giải mã Granite dày đặc" or "bộ giải mã Granite dense". In Vietnamese ML, "mô hình dense" often kept. "decoder" = bộ giải mã. "dense Granite decoder" -> "bộ giải mã Granite dense". Good. "40 attention heads against 8 key-value heads" = "40 đầu chú ý so với 8 đầu khóa-giá trị" or "40 đầu attention so với 8 đầu key-value". Vietnamese often uses "đầu attention" and "đầu key-value". But translation could use "đầu chú ý" and "đầu khóa-giá trị". Maybe better to keep "attention" as technical term? The instruction says translate. Could use "đầu attention" is common. "key-value heads" = "đầu key-value". Hmm. "hidden size 2,560" -> "kích thước ẩn 2.560". In Vietnamese, 2,560 -> 2.560. Yes. "context window" -> "cửa sổ ngữ cảnh". "base model's 131,072 tokens" -> "131.072 token của mô hình cơ sở". "token" maybe "token" unchanged, not "mã thông báo". Usually keep token. "greedy decoding" -> "giải mã tham lam". "2,048-token budget" -> "ngân sách 2.048 token". "emits a `<think>…</think>` block before answering" -> "nó phát ra một khối `<think>…</think>` trước khi trả lời". Preserve `<think>…</think>` exactly. The ellipsis character … inside. Keep. "TwIL-LM3-Pro" brand, keep. "GraniteForCausalLM" code, keep. "granite-4.2-3b" code, keep. "IBM" maybe IBM. Need ensure no extra quotes. Output plain. Potential issue: "3.66B parameter count" maybe "Số lượng tham số 3,66 tỷ". "3,66 tỷ" is correct Vietnamese. But if original "3.66B" maybe "3,66B" could be acceptable too. Better "3,66 tỷ tham số". Rephrase: "Số lượng tham số thực tế là 3,66 tỷ, tức 3.659.737.600, ..." This is smoother. Original: "The 3.66B parameter count is the real total, 3,659,737,600, and the context window..." So "Số lượng tham số 3,66 tỷ là tổng thực, 3.659.737.600, và..." Fine. Should we translate "dense" as "dày đặc"? In ML, "dense layer" = lớp dày đặc. "dense decoder" maybe "bộ giải mã dense" is clearer. I think "dense" is technical and often kept. But to translate, "bộ giải mã Granite dày đặc" sounds odd. "dense" here means not mixture-of-experts. Vietnamese might say "bộ giải mã Granite dày đặc (dense)"? But no. I can say "bộ giải mã Granite dense". That's acceptable localization. The instruction says translate, but brand/technical names preserved. "dense" is not a brand. Could use "dày đặc". Hmm. "dense Granite decoder" -> "bộ giải mã Granite dày đặc". I think that's okay. But "dense" in architecture is a type, often left as "dense". I'll use "bộ giải mã Granite dày đặc" to be fully Vietnamese. Yet "dense Granite decoder" = "bộ giải mã Granite dày đặc" is understandable. Maybe "bộ giải mã Granite dạng dense" clearer. But "dạng dense" mixes. I'll choose "bộ giải mã Granite dày đặc". "40 attention heads against 8 key-value heads" -> "40 đầu chú ý so với 8 đầu khóa-giá trị". Maybe "đầu attention so với 8 đầu key-value" more common. Since "attention" is technical term, could keep "attention". But translation engine should translate. Vietnamese ML documents often use "đầu attention" and "đầu key-value". Let's use "đầu attention" and "đầu key-value" to be natural. But then "key-value" not translated. It's a technical term. The instruction says preserve brand/product names, not necessarily technical. However "key-value" is standard. I can use "đầu khóa-giá trị" which is literal. Both okay. I think "đầu attention" is more natural for Vietnamese AI readers. I'll use "đầu attention" and "đầu key-value". "hidden size" -> "kích thước ẩn". Good. "derived from IBM's granite-4.2-3b" -> "được dẫn xuất từ granite-4.2-3b của IBM" or "có nguồn gốc từ granite-4.2-3b của IBM". Use "được dẫn xuất từ". "dẫn xuất" is fine. "carried through unchanged" -> "được giữ nguyên không đổi". Good. "evaluated with greedy decoding at a 2,048-token budget" -> "được đánh giá bằng giải mã tham lam với ngân sách 2.048 token". Good. "emits" -> "phát ra". "It emits a `<think>…</think>` block before answering" -> "Nó phát ra một khối `<think>…</think>` trước khi trả lời". Good. Need ensure exact `<think>…</think>` preserved. I must not alter the ellipsis. It's "…" (single char). Keep. Final. No markers. Output only translated text. Ensure no preamble.TwIL-LM3-Pro là một bộ giải mã Granite dày đặc — `GraniteForCausalLM`, 40 lớp, kích thước ẩn 2.560, 40 đầu attention so với 8 đầu key-value — được dẫn xuất từ `granite-4.2-3b` của IBM. Số lượng tham số 3,66 tỷ là tổng thực, 3.659.737.600, và cửa sổ ngữ cảnh là 131.072 token của mô hình cơ sở được giữ nguyên không đổi. Nó phát ra một khối `<think>…</think>` trước khi trả lời và được đánh giá bằng giải mã tham lam với ngân sách 2.048 token.

Ngăn xếp hậu huấn luyện là phần mà webAI thực sự muốn bạn xem xét, và nó được ghi chép đầy đủ một cách bất thường đối với một mô hình cỡ này: một tinh chỉnh có giám sát LoRA rank-64 trên một tập dữ liệu logic hình thức tổng hợp, chưng cất đa đường để tạo ra nhiều dấu vết suy luận cho mỗi lời nhắc, hợp nhất checkpoint trong không gian tham số thay vì lấy checkpoint cuối cùng, một nội suy WiSE-FT tại α = 0.15 được hợp nhất trở lại về mô hình cơ sở đã tiền huấn luyện với TIES và DARE-SLERP, và cuối cùng là một giai đoạn GRPO có trọng số entropy — webAI gọi nó là MGPO — đối chiếu với một trình xác minh lập trình, chạy đến bước 2580, đó là checkpoint đã được phát hành.

Sản phẩm được công bố là policy đã hợp nhất chứ không phải một LoRA adapter, và đây mới là chi tiết thực tế: bạn có thể chạy nó như một mô hình độc lập, ở bf16 với 6.82 GiB, hoặc dưới dạng Q4_K_M GGUF với 2.09 GiB trên CPU hoặc 4 GB VRAM. Đó là tuyên bố "chạy được trên laptop", và đây là tuyên bố duy nhất trong toàn bộ thẻ mô hình có thể kiểm chứng một cách dễ dàng và vì thế đáng để tin.

So sánh Qwen3-8B, hãy đọc kỹ

Tiêu đề mà webAI gán cho mô hình là TwIL-LM3-Pro đạt vị trí cao nhất trong các hàng tóm tắt Track A của chính nó ở 3,66B tham số. Bốn hàng tóm tắt là macro gate 0,5539, strict-7 0,2879, trung bình sáu làn 0,5389 và macro_primary 0,5875. So với Qwen3-8B, macro gate là 0,5539 so với 0,5336 — và chính thẻ mô hình viết câu mà một trang tiếp thị hẳn đã xóa: “mức dẫn đầu về gate so với Qwen3-8B là 0,020 — nhỏ hơn nhiễu lấy mẫu ở n = 200 mỗi làn — nên hãy đọc kết quả đó là ngang bằng, không phải một chiến thắng.”

Đó là dòng quan trọng nhất trên trang. Cách tự diễn giải của chính webAI về kết quả chính là nó hòa. Ở những chỗ mà so sánh không phải là hòa:

• Strict-7 — TwIL-LM3-Pro 0.2879 so với Qwen3-8B 0.2093, và dòng này không sử dụng bất kỳ điểm khớp lỏng nào ở bất cứ đâu, nên nó không thể được tạo ra nhờ may mắn về định dạng.

• Trắc nghiệm nghiêm ngặt — TwIL-LM3-Pro 0.4100 so với Qwen3-8B 0.0000, khoảng cách lớn nhất trong số mười một hàng được báo cáo.

• Quy nạp quy tắc — TwIL-LM3-Pro 0.4195 so với Qwen3-8B 0.3680.

• Độ phù hợp với corpus — perplexity `lm_corpus` thấp nhất ở bất kỳ arm nào là 2.3130, với Qwen3-8B là 2.5478.

• Tham số — 3,66 tỷ so với khoảng 8 tỷ, đây chính là toàn bộ cơ sở cho tuyên bố "ít hơn một nửa số tham số".

Có hai lưu ý gắn với bảng đó và webAI nêu rõ cả hai. Các kết quả tạo sinh Track A từ TwIL-LM3-Pro trung bình đạt 1.902 token và 24,2% trong số đó chạm giới hạn độ dài, so với 564 token của phiên bản tiền nhiệm TwIL-LM3 của chính nó; từ mà thẻ dùng cho khoảng cách thu được là “mang tính chỉ báo hơn là chính xác”. Và các số liệu thông lượng trong bảng được đo trong một phiên sau đó trên vLLM mới hơn (0.19.1) so với các cột so sánh (0.11.2), nên các hàng token mỗi giây có thể so sánh với nhau và chỉ tương đối với phần còn lại.

Ở nơi nó không giành chiến thắng

Trên bộ kiểm thử held-out, thẻ mô hình nói thẳng: "TwIL-LM3-Pro không dẫn đầu bộ này." Macro trên 10 bộ dữ liệu là 0.7901, ngang bằng về mặt thống kê với mô hình cơ sở của chính nó ở mức 0.7942, và kém xa Qwen3-8B ở mức 0.8493 cùng gpt-oss-120b ở mức 0.8689. Macro trên 14 bộ dữ liệu của nó là 0.7425, cao hơn mô hình cơ sở 0.0093, và toàn bộ mức tăng đó đến từ BBH-logic (0.9540 so với 0.9013 của mô hình cơ sở) — bỏ riêng hàng đó ra thì mô hình đạt trung bình 0.7263 trên mười ba hàng còn lại, thấp hơn mức 0.7350 của VibeThinker-3B.

Có ba điểm yếu thực sự bên trong chuyên môn hóa, tất cả đều được công bố: đối sánh chính xác của bản dịch FOL ở mức 0,0100, `procedural` ở mức 0,1200 theo tiêu chí nghiêm ngặt, và đối sánh chính xác của phân tích ngữ nghĩa ở mức 0,0000. Quy nạp luật chỉ phân tích được 56,5% đầu ra của nó. Và mô hình dài dòng do thiết kế — khoảng 792 token cho mỗi câu trả lời Track B so với 482 của phiên bản tiền nhiệm — đó là một chi phí, chứ không phải một năng lực.

Đây không phải là lời chỉ trích bản phát hành. Đây chính là hình mẫu của một model card được viết tốt, và đó là lý do vì sao những con số ở đây có thể được trích dẫn.

Ba cách để có được nó, và một trong số đó là một biểu mẫu

Tình hình phân phối chính là tin tức thực sự của tuần này và đáng được nêu chính xác.

Các trọng số nằm trên Hugging Face, không bị hạn chế truy cập, theo webAI Non-Commercial License ver. 1.0 — giấy phép cho phép nghiên cứu và sử dụng cá nhân, đồng thời yêu cầu một thỏa thuận riêng với webAI cho việc triển khai tạo doanh thu. Giấy phép đó là ràng buộc có tính bắt buộc đối với toàn bộ bản phát hành, và đó là lý do TwIL-LM3-Pro không phải là một mô hình mà hầu hết các nhóm sản phẩm có thể dễ dàng áp dụng.

webAI cho biết dòng này đã vượt qua nửa triệu lượt tải xuống trong một tháng, một con số mà công ty đã công bố trong thông báo của chính mình và chưa được kiểm toán độc lập. Các lượt tải xuống của một checkpoint miễn phí phi thương mại không phải là chỉ số thay thế cho việc sử dụng trong sản xuất, và webAI không trình bày chúng như vậy.

Trong khi đó, nền tảng riêng của nhà cung cấp không phải là một điểm cuối công khai. webAI tự mô tả mình là một nền tảng doanh nghiệp mang AI đến dữ liệu của bạn, với một ứng dụng mô hình ưu tiên cục bộ, và con đường thương mại của nó là một thỏa thuận doanh nghiệp chứ không phải là bảng giá theo token được công bố. TwIL-LM3-Pro cũng vắng mặt trên các nền tảng suy luận bên thứ ba lớn, những nền tảng lập chỉ mục các checkpoint mở — chúng tôi đã kiểm tra, và nó cũng không có trong danh mục của OrcaRouter — vậy nên câu trả lời thực tế cho câu hỏi "tôi gọi thứ này từ API ở đâu" là hiện tại phần lớn bạn không thể; bạn tải nó về.

Kênh thứ ba là kênh mới. Kho `TwIL-LM3-Pro-LiteRT-LM` xuất hiện vào ngày 1 tháng 10 năm 2026, mang các tạo phẩm `.litertlm` và được gắn thẻ cho Android và iOS — gói runtime LiteRT-LM của chính webAI cho cùng bộ trọng số. Liệu bản dựng đó có kế thừa giấy phép phi thương mại hay không là câu hỏi cần trả lời trước khi lập kế hoạch dựa trên nó, bởi vì kho cha thì có.

Vì sao một chuyên gia logic hình thức ở quy mô này lại đáng để theo dõi

Lý do khiến bản phát hành này cứ liên tục nổi lên trở lại không phải là bảng benchmark. Mà là việc webAI đã công bố toàn bộ pipeline, chạy cùng một công thức hệt nhau trên năm mô hình nền khác nhau và báo cáo điều đã xảy ra. Bảng so sánh họ mô hình ghi nhận mức dịch chuyển macro-gate của Track A từ +0,012 đến +0,145 tùy theo mô hình nền, với bộ held-out vẫn nằm trong khoảng ±0,013 — phiên bản có đầy đủ dấu vết tài liệu cho câu “điều này tổng quát hóa được”. Hệ số duy nhất được chọn cho mỗi mô hình là trọng số hợp nhất, được quét trên hiệu năng held-out: 0,15 cho SmolLM3, 0,20 cho Granite và TwIL base, 0,50 cho VibeThinker-3B.

Đó là một công thức có thể tái sử dụng để biến một mô hình tổng quát nhỏ thành một chuyên gia hẹp mà không phá hủy những gì nó đã biết, được công bố kèm cả những kết quả tiêu cực. Với bất kỳ ai cần nhãn entailment, hình thức hóa phát biểu Lean, hay phân tích ngữ nghĩa thay vì văn xuôi trôi chảy, một GGUF 2,09 GiB chạy ngoại tuyến, không phí mỗi lần gọi và không phụ thuộc mạng là một đề xuất khác hẳn so với bất kỳ mô hình chạy trên máy chủ nào, bất kể bảng Elo nói gì.

Câu hỏi còn bỏ ngỏ là liệu các trọng số có bao giờ xuất hiện dưới một giấy phép cho phép sử dụng thương mại hay không, và liệu bản chuyển LiteRT-LM có được phát hành kèm cùng hạn chế đó hay không. Cho đến lúc đó, TwIL-LM3-Pro là một sản phẩm nghiên cứu với một thẻ mô hình trung thực một cách bất thường — điều đó không phải là không có gì.

A generated single-column scoreboard headed 'TwIL-LM3-Pro - the scoreboard' with six rows: Macro gate 0.5539; Strict-7 0.2879; Strict MCQ 0.4100; Rule induction 0.4195; Held-out 10-set macro 0.7901; Parameters 3.66B dense. A footer line reads 'All figures vendor-reported by webAI; no independent evaluation yet.' The OrcaRouter logo is composited in the bottom-right corner.

Nếu bạn cần khả năng này trong môi trường production ngay hôm nay

Đối với một triển khai thương mại, rào cản nằm ở giấy phép chứ không phải ở các phép đo hiệu năng, và giải pháp thay thế thực tế là một mô hình được lưu trữ mà bạn có thể định tuyến tới. Đó chính là lớp mà OrcaRouter vận hành: một endpoint tương thích OpenAI đặt trước hơn 200 mô hình với mức giá niêm yết của nhà cung cấp, không cộng thêm phụ phí, nhờ đó việc nhà cung cấp giảm giá có hiệu lực ngay trong cùng ngày thay vì phải chờ hết một chu kỳ hợp đồng. Với số ít trường hợp mà một checkpoint logic hình thức nhỏ thực sự phù hợp — gán nhãn theo lô ngoại tuyến, một lượt suy diễn entailment trong môi trường cách ly hoàn toàn, một bước tiền xử lý mà đầu ra là nhãn chứ không phải văn xuôi — thì cách phân chia trung thực là chạy mô hình cục bộ ở nơi khối lượng công việc là chuyển văn bản thành nhãn, và định tuyến phần suy luận, mở rộng prompt cùng QA xung quanh tới các mô hình được lưu trữ bằng cùng một khóa.

Một lưu ý đáng nhắc lại riêng trong phần này: với chuyển đổi dự phòng tự động, bạn cũng có thể trỏ đến một mô hình trước khi tin tưởng nó trên luồng production, và khôi phục bằng cách sửa một quy tắc định tuyến thay vì triển khai lại. Đó là mẫu phù hợp với một mô hình như thế này khi trạng thái thương mại của nó chưa được giải quyết.

A screenshot of the Hugging Face model card for webAI-Official/TwIL-LM3-Pro, showing the webAI author line, the tags for Text Generation, Transformers, Safetensors, GGUF, English, granite-4.2, formal-logic, reasoning, lora, reinforcement-learning and grpo, and the licence badge reading 'License: webai-non-commercial-license-ver.-1.0'.

Xem gì

Ba điều sẽ thay đổi câu chuyện này. Một thay đổi giấy phép, hoặc một bản port LiteRT-LM được cấp phép rõ ràng, sẽ đưa TwIL-LM3-Pro từ sản phẩm nghiên cứu thành thành phần có thể triển khai. Việc xuất hiện trên một nền tảng suy luận hosted lớn sẽ mang lại cho nó một API thật. Và một đánh giá độc lập — bất kỳ ai không phải webAI chạy bộ khung Track A — sẽ cho chúng ta biết liệu lợi thế strict-7 so với Qwen3-8B có còn giữ được khi được đo bởi người không xây dựng bộ khung đó hay không. Cả ba điều trên đều chưa xảy ra, và thẻ mô hình đủ trung thực để bạn thấy chính xác điều gì cần phải đúng thì chúng mới có ý nghĩa.

A screenshot of the Hugging Face model card for webAI-Official/TwIL-LM3-Pro-LiteRT-LM, created 1 October 2026, showing the tags TextGeneration, LiteRT-LM, on-device, android, ios, granite, granite-4.2 and reasoning, and the card text describing TwIL-LM3-Pro converted to Google's LiteRT-LM (.litertlm) format for on-device inference, requiring LiteRT-LM 0.16 or newer, preserving the ChatML prompt format and pre-opening the think block.