Một thẻ tiêu đề được tạo mang tiêu đề 'TwIL-LM3-Pro so với Gemma 4 12B', phụ đề 'Hai mô hình cục bộ, hai giấy phép', với hai thẻ bo tròn ghi 'TwIL-LM3-Pro - Phi thương mại' và 'Gemma 4 12B - Apache 2.0'. Một dòng chân trang ghi 'Giấy phép quyết định nhiều lượt triển khai hơn bất kỳ hàng benchmark nào.' Logo OrcaRouter được ghép vào góc dưới cùng bên phải.
Guides & Insights

TwIL-LM3-Pro vs Gemma 4 12B: Hai mô hình cục bộ chẳng có gì chung ngoài chiếc laptop

Tác giả

Alistair Wren

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Đặt TwIL-LM3-Pro và Gemma 4 12B cạnh nhau và những điểm tương đồng là có thật nhưng hời hợt: cả hai đều là các checkpoint mở mà bạn có thể tải về ngay hôm nay, cả hai đều chạy trên phần cứng tiêu dùng mà không cần tài khoản đám mây, và cả hai đều sẽ trả lời câu hỏi ngoại tuyến. Mọi thứ vượt ra ngoài đó đều khác biệt, và sự khác biệt sắc nét nhất mang tính pháp lý chứ không phải kỹ thuật. TwIL-LM3-Pro, chuyên gia logic hình thức 3,66B của webAI, được phát hành theo webAI Non-Commercial License ver. 1.0 — bạn có thể nghiên cứu với nó và bạn không được xây dựng doanh nghiệp trên nó nếu không có một thỏa thuận riêng. Gemma 4 12B, mô hình đa phương thức không dùng bộ mã hóa của Google DeepMind, được phát hành theo Apache 2.0. Chỉ một dòng đó quyết định nhiều triển khai hơn cả bảng benchmark, vì vậy đáng để bắt đầu từ đó thay vì kết thúc ở đó.

Đây là sự so sánh giữa một mô hình chuyên biệt và một mô hình đa dụng, dù chúng tình cờ cùng thuộc một loại đối tượng. TwIL-LM3-Pro chỉ làm một việc — logic hình thức — và làm việc đó tốt hơn cả những mô hình có kích thước gấp nhiều lần nó. Gemma 4 12B làm được nhiều việc, vừa nhìn vừa nghe chẳng khác gì đọc, và được chủ đích tạo ra để trở thành mô hình nhỏ mặc định trong sản phẩm của người khác. Đem bảng thông số của hai mô hình ra so với nhau như thể chúng đang cạnh tranh cho cùng một vị trí chính là sai lầm mà trang này ra đời để ngăn chặn.

Giấy phép là đặc tả đầu tiên

Giấy phép của TwIL-LM3-Pro cho phép sao chép, nghiên cứu và sử dụng cho mục đích cá nhân, đồng thời yêu cầu rõ ràng một thỏa thuận riêng với webAI đối với việc triển khai tạo doanh thu. Giấy phép này cũng hạn chế việc sử dụng tên thương mại và nhãn hiệu của webAI nếu không có sự đồng ý bằng văn bản. Đối với một người làm vì sở thích, một nghiên cứu sinh tiến sĩ hoặc một nhóm nghiên cứu nội bộ, đó là sự cho phép trọn vẹn. Đối với bất kỳ ai đang đưa sản phẩm ra thị trường, đó là một rào cản cứng cho đến khi có thỏa thuận — và con đường thương mại của webAI là một thỏa thuận dành cho doanh nghiệp, không phải bảng giá được công bố.

Gemma 4 12B dùng giấy phép Apache 2.0. Bạn có thể tinh chỉnh nó, phân phối lại bản phái sinh, cung cấp nó cho khách hàng và đưa nó vào một sản phẩm thương mại, với điều kiện tuân thủ chính sách sử dụng của Google. Đó không phải là một khác biệt nhỏ về mức độ; đó là sự khác biệt giữa một mô hình bạn có thể đánh giá và một mô hình bạn có thể xây dựng dựa trên.

Cả hai đều là các bản tải xuống không cần cổng kiểm soát trên Hugging Face, vì vậy giấy phép là rào cản duy nhất, và đó thực sự là một rào cản.

Mỗi mô hình thực sự dùng để làm gì

TwIL-LM3-Pro bắt nguồn từ `ibm-granite/granite-4.2` thông qua một quy trình gồm năm giai đoạn — tinh chỉnh có giám sát LoRA trên một tập ngữ liệu logic hình thức tổng hợp, chưng cất đa nhánh, hợp nhất checkpoint, nội suy WiSE-FT ngược về mô hình nền đã tiền huấn luyện, và một giai đoạn GRPO có trọng số entropy đối chiếu với một bộ xác minh lập trình. Đầu ra mục tiêu của nó không phải văn xuôi mà là: các công thức logic bậc nhất, nhãn kéo theo, phân tích ngữ nghĩa, phát biểu Lean, và phê bình Lean. webAI nói rõ rằng mô hình này không phải là một trợ lý tổng quát và không mang theo bất kỳ tinh chỉnh an toàn hay sở thích nào ngoài những gì Granite 4.2 đã có.

Gemma 4 12B là cấu trúc đối lập. Nó là thành viên dense 11,95 tỷ tham số của dòng Gemma 4 — 48 lớp, vốn từ 262K, cửa sổ ngữ cảnh 256K token — và nó có tính đa phương thức gốc, xử lý văn bản, hình ảnh và âm thanh thông qua kiến trúc không dùng encoder thay vì gắn thêm các tháp thị giác và âm thanh riêng biệt. Tất cả mô hình Gemma 4 đều đi kèm các chế độ suy nghĩ có thể cấu hình, hỗ trợ system-prompt gốc và gọi hàm. Nó được thiết kế để trở thành một cỗ máy chủ lực suy luận tổng quát và đa phương thức ở kích thước vừa vặn với một GPU tiêu dùng.

Yêu cầu TwIL-LM3-Pro mô tả một bức ảnh không phải là một phép thử công bằng, và đó cũng không phải là phép thử mà mô hình được tạo ra để thực hiện. Yêu cầu Gemma 4 12B đưa ra một phân tích ngữ nghĩa theo lược đồ cố định cũng không phải là công việc mà nó được tinh chỉnh để làm. Sự giao thoa là có thật nhưng hẹp: cả hai đều có thể suy luận, và cả hai đều có thể chạy ngoại tuyến.

Những kích thước thực sự khác biệt

• Tham số — TwIL-LM3-Pro 3,66B dense so với Gemma 4 12B 11,95B dense, hệ số khoảng 3,3.

• Cửa sổ ngữ cảnh — TwIL-LM3-Pro 131.072 token, được kế thừa nguyên vẹn từ nền tảng Granite của nó; Gemma 4 12B 256.000 token.

• Các phương thức đầu vào — TwIL-LM3-Pro chỉ văn bản; Gemma 4 12B văn bản, hình ảnh, video và âm thanh.

• Giấy phép — webAI Non-Commercial License ver. 1.0 so với Apache 2.0.

• Mô hình cơ sở — `ibm-granite/granite-4.2-3b` so với quá trình tiền huấn luyện Gemma 4 của chính Google, được công bố cùng với một báo cáo kỹ thuật.

• Định dạng suy nghĩ — TwIL-LM3-Pro mặc định phát ra một khối `<think>` trước khi trả lời; Gemma 4 cung cấp các chế độ suy nghĩ có thể cấu hình trên toàn bộ dòng mô hình.

• Dấu chân bộ nhớ đã lượng tử hóa — TwIL-LM3-Pro Q4_K_M ở mức 2,09 GiB, chạy trên CPU hoặc 4 GB VRAM; Gemma 4 12B ở bf16 vào khoảng 24 GiB, có kích thước dành cho GPU tiêu dùng thay vì đồ họa tích hợp của laptop.

Dòng cuối cùng đó chính là dòng làm suy yếu cách diễn đạt "cả hai đều chạy cục bộ" một cách sắc bén nhất, và đáng để nói chính xác về điều đó. Tuyên bố cục bộ của TwIL-LM3-Pro là tuyên bố dành cho laptop. Tuyên bố cục bộ của Gemma 4 12B là tuyên bố dành cho GPU trạm làm việc, với các mô hình E2B và E4B nhỏ hơn của Google phục vụ phân khúc thực sự dành cho điện thoại và laptop. Hai mô hình đều được gọi là cục bộ không có cùng ngưỡng phần cứng.

Thực trạng của bằng chứng đánh giá

Mọi số liệu hiệu năng của TwIL-LM3-Pro đều đến từ thẻ mô hình của chính webAI, được đo trên các harness Track A và Track B của chính công ty. Hiện vẫn chưa có đánh giá độc lập nào. So sánh mà chính thẻ mô hình nhấn mạnh là với Qwen3-8B, không phải với bất kỳ mô hình Gemma nào — macro gate của webAI là 0,5539 so với 0,5336 của Qwen3-8B, với mức dẫn đầu mà thẻ mô tả là nằm trong nhiễu lấy mẫu, và strict-7 là 0,2879 so với 0,2093, khi mà khoảng cách không phụ thuộc vào điểm khớp lỏng. So với nền tảng Granite 4.2 3B của chính nó, macro gate trong miền tăng từ 0,4313 lên 0,5539 trong khi macro trên 10 bộ dữ liệu held-out giữ nguyên ở mức 0,7901 so với 0,7942.

Gemma 4 12B có một báo cáo kỹ thuật đã công bố và một lượng lớn đánh giá từ bên thứ ba. Nó cũng có một vị trí benchmark do nhà cung cấp tự báo cáo trong chính gia đình của mình — Google xếp bản 12B Unified thấp hơn bản 31B và 26B A4B trên các bảng suy luận và lập trình của chính mình. Thứ hạng đó là của Google, và đáng được trích dẫn đúng như vậy.

Phát biểu trung thực về một cuộc so sánh trực tiếp đối đầu là: không có cuộc so sánh nào như vậy. Chưa ai chạy TwIL-LM3-Pro và Gemma 4 12B qua cùng một khung kiểm thử chung rồi công bố kết quả. Hai mô hình này chưa từng được ai chấm điểm theo cùng một bộ tiêu chí, bởi vì các bộ tiêu chí mà chúng được chấm không trùng nhau. Độ chính xác suy luận logic hình thức và tỷ lệ phần trăm MMLU-Pro không phải là cùng một đơn vị đo.

Khi mỗi lựa chọn đều là quyết định đúng đắn

Hãy chọn TwIL-LM3-Pro khi đầu ra bạn cần là một cấu trúc có thể kiểm tra bằng máy — một nhãn entailment, một câu lệnh Lean, một phân tích ngữ nghĩa — và khối lượng công việc là theo lô hoặc ngoại tuyến, còn giấy phép không phải là ràng buộc đối với việc bạn làm gì với kết quả. Bản dựng lượng tử hóa 2.09 GiB của nó chạy trên CPU mà không phụ thuộc mạng là một lợi thế thực sự cho một pipeline biệt lập mạng hoặc một lượt gán nhãn phải chạy trên máy tính xách tay.

Hãy chọn Gemma 4 12B khi bạn cần một mô hình tổng quát có thể triển khai, khi đầu vào không phải văn bản, khi ngữ cảnh dài, hoặc khi bạn cần tinh chỉnh và phân phối lại. Apache 2.0 cùng khả năng đa phương thức gốc và cửa sổ 256K là sự kết hợp mà không một chuyên gia hẹp nào cung cấp được.

Hai cách tiếp cận này cũng có thể cùng tồn tại. Một pipeline sử dụng Gemma 4 12B để đọc và chuẩn hóa đầu vào đa phương thức, rồi chuyển một phát biểu có cấu trúc cho một chuyên gia logic hình thức, là một cách phân chia công việc hợp lý, và nó có cùng dạng với việc dùng một mô hình tiên tiến để soạn thảo và một mô hình nhỏ để xác minh.

Phục vụ một trong hai từ cùng một endpoint

Cả TwIL-LM3-Pro lẫn bản dựng Gemma 4 12B Unified hiện đều không phải là một tuyến trong danh mục OrcaRouter, và điều đó đáng được nêu ra trước khuyến nghị thay vì sau đó. Những gì được định tuyến từ cùng dòng họ là các bậc Gemma 4 lớn hơn — `gemma-4-26b-a4b-it` và `gemma-4-31b-it` — vì vậy mẫu phổ biến ở đây là tạo nguyên mẫu prompt và schema dựa trên một bậc Gemma 4 được lưu trữ qua một endpoint tương thích OpenAI ở giá niêm yết của nhà cung cấp với 0% markup được thêm vào, sau đó chuyển khối lượng công việc đã ổn định sang checkpoint 12B trên phần cứng của riêng bạn. Cùng một endpoint phục vụ hơn 200 mô hình, vì vậy mô hình tiên tiến bạn dùng để tạo dữ liệu đánh giá và mô hình nhỏ bạn dùng để kiểm tra nó chỉ cách nhau một key và một định dạng request, với tính năng chuyển đổi dự phòng tự động nếu một nhà cung cấp gặp trục trặc giữa chừng.

Đó là một phiên bản yếu hơn so với thường lệ của câu chuyện định tuyến, và nó nên được trình bày đúng như vậy: chúng tôi không lưu trữ mô hình mà bạn đang so sánh, nên lời khuyên trung thực là một quy trình làm việc chứ không phải một công tắc.

A generated two-column scoreboard headed 'TwIL-LM3-Pro vs Gemma 4 12B - the scoreboard' with six shared dimension rows. TwIL-LM3-Pro: Parameters 3.66B dense; Context 131,072 tokens; Input text only; Licence non-commercial; Base granite-4.2-3b; Quantised size 2.09 GiB Q4_K_M. Gemma 4 12B: Parameters 11.95B dense; Context 256,000 tokens; Input text, image, audio; Licence Apache 2.0; Base Google Gemma 4 pretraining; Quantised size about 24 GiB in bf16. A footer line reads 'Gemma figures per Google model card; TwIL figures vendor-reported by webAI.' The OrcaRouter logo is composited in the bottom-right corner.

Quy tắc quyết định

Nếu sản phẩm bàn giao phải có thể triển khai thương mại, giấy phép sẽ trả lời câu hỏi trước bất kỳ benchmark nào, và nó hướng đến Gemma 4 12B. Nếu sản phẩm bàn giao là đầu ra logic hình thức được tạo ngoại tuyến và dùng nội bộ, TwIL-LM3-Pro là công cụ mạnh hơn với kích thước chỉ bằng một phần ba. Nếu bạn cần cả hai, phần kỹ thuật thú vị không nằm ở việc chọn ra một người thắng — mà ở việc định nghĩa giao diện nơi một mô hình đa phương thức tổng quát dừng lại và một chuyên gia logic hình thức bắt đầu.

A screenshot of the OrcaRouter model page for google/gemma-4-31b-it, dated 2026-04-02, showing the 30.7B dense multimodal description, a 256K token context window, the $0.13 input and $0.38 output rate, and the OrcaRouter chrome with Code samples, Pricing, Performance, Public benchmarks and FAQ sections.A screenshot of the Hugging Face model card for google/gemma-4-12B-it, showing the Google author line, the Any-to-Any, Transformers, Safetensors and gemma4_unified tags, the Apache 2.0 licence badge, and the opening text describing the Gemma 4 12B Unified model as part of the Gemma 4 family with native audio and vision understanding and no separate encoders.