
Tencent Hy-MT2-7B เปิดตัว Hosted API แล้ว: นักแปลราคา $0.295 ต่อล้านเอาต์พุตจะเปลี่ยนอะไร
- DeepSeekใหม่DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 ต่อ 1 ล้านโทเค็น
- z-aiใหม่Z.ai: GLM 5.32026-08-1860ความฉลาด75การเขียนโค้ด
- obsidianใหม่Qwen3.8 27B2026-08-1552ความฉลาด68การเขียนโค้ด
- qwenใหม่Qwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekใหม่DeepSeek: DeepSeek V4 Pro 08132026-08-1253ความฉลาด69การเขียนโค้ด
- grokใหม่SpaceXAI: Grok 4.62026-08-1261ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0557ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0358ความฉลาด72การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463ความฉลาด78การเขียนโค้ด
- googleGoogle: Gemini 3.6 Flash2026-07-2152ความฉลาด69การเขียนโค้ด
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137ความฉลาด49การเขียนโค้ด
- metaMeta: Muse Spark 1.12026-07-1653ความฉลาด71การเขียนโค้ด
- kimiMoonshotAI: Kimi K32026-07-1560ความฉลาด76การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Luna2026-07-0952ความฉลาด71การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Terra2026-07-0957ความฉลาด77การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Sol2026-07-0961ความฉลาด77การเขียนโค้ด
Tencent Hy-MT2-7B โมเดลแปลภาษาโอเพนซอร์สที่ Tencent Hunyuan เปิดตัวเมื่อวันที่ 21 พฤษภาคม 2026 กลายเป็นโมเดลที่สามารถเรียกใช้ได้ผ่าน API แบบโฮสต์ในสัปดาห์นี้: ประมาณวันที่ 19 สิงหาคม 2026 โมเดล 7B แบบ dense เปิดใช้งานบนเอนด์พอยต์โฮสต์ของ Tencent Cloud ในราคา $0.074 ต่อโทเคนอินพุตหนึ่งล้านตัว และ $0.295 ต่อโทเคนเอาต์พุตหนึ่งล้านตัว พร้อมหน้าต่างบริบท 8,192 โทเคน มันไม่ได้มาลำพัง — Tencent Hy-MT2-1.8B และ Tencent Hy-MT2-30B-A3B ขึ้นบนแบ็กเอนด์เดียวกันภายในหนึ่งวัน น้ำหนักโมเดลอยู่บน Hugging Face และ ModelScope เป็นเวลาสามเดือนแล้ว สิ่งที่ใหม่คือทีมงานสามารถเรียกใช้มันได้โดยไม่ต้องเช่า GPU สร้าง llama.cpp จากซอร์สโค้ด หรือจัดส่งชุดเครื่องมือบนอุปกรณ์แบบ 1.25 บิต สำหรับงานแปลภาษา นี่คือความแตกต่างระหว่างการทดลองกับการตัดสินใจด้านผลิตภัณฑ์
มีอะไรเพิ่งเปิดตัวบ้าง
เอนด์พอยต์เชิงพาณิชย์เป็นของ Tencent Cloud เอง โดยเปิดเผยผ่าน API ของผู้ขายและแพลตฟอร์มบุคคลที่สามหลายแห่ง ขนาดทั้งสามแต่ละขนาดทำงานในบริบท 8K พร้อมการสร้างผลลัพธ์สูงสุด 4,096 โทเคน; ทั้งสามรองรับเอาต์พุตแบบมีโครงสร้างผ่าน JSON schema ในฟิลด์ response_format และไม่มีรุ่นใดรองรับการเรียกฟังก์ชัน สเปกเชิงปฏิบัติ หนึ่งบรรทัดต่อมิติ:
• Tencent Hy-MT2-7B — $0.074 อินพุต / $0.295 เอาต์พุต ต่อ 1M โทเคน, คอนเทกซ์ 8,192, dense ~7B, รองรับเอาต์พุตแบบมีโครงสร้าง, ไม่รองรับการเรียกใช้เครื่องมือ.
• Tencent Hy-MT2-1.8B — $0.044 ต่อ 1M token สำหรับอินพุต / $0.177 สำหรับเอาต์พุต, บริบท 8,192, dense 1.8B, ไม่มีการเรียกใช้เครื่องมือ
• Tencent Hy-MT2-30B-A3B — อินพุต $0.074 / เอาต์พุต $0.295 ต่อ 1M โทเค็น, บริบท 8,192, MoE 30B ทั้งหมด / 3B แอ็กทีฟ, รองรับผลลัพธ์แบบมีโครงสร้าง, ไม่รองรับการเรียกใช้เครื่องมือ
จุดเด่นด้านราคาหลักคืออัตราการสร้างเอาต์พุตของรุ่น 7B: ต่ำกว่าสามในสิบเซนต์ต่อพันโทเค็นเอาต์พุต สำหรับโมเดลที่เทนเซ็นต์อ้างว่าสู้กับโมเดลที่ใหญ่กว่าถึงสิบเท่าได้ การแปลเป็นหนึ่งในเวิร์กโหลด LLM ไม่กี่ประเภทที่โทเค็นเอาต์พุตคิดเป็นเกือบทั้งหมดของค่าใช้จ่าย ดังนั้นราคาเอาต์พุตจึงเป็นตัวเลขที่กำหนดว่าไปป์ไลน์จะคุ้มค่าในระดับปริมาณมากหรือไม่

โมเดลที่อยู่เบื้องหลังเอนด์พอยต์
{{1}}Hy-MT2{{/1}} คือตระกูล "{{2}}การคิดเร็ว{{/2}}" ของเทนเซ็นต์: {{3}}แทนที่จะใช้ห่วงโซ่การคิดยาวเหยียดกับทุกประโยค มันถูกออกแบบให้ตอบสนองแบบนักแปลมืออาชีพ — ไตร่ตรองเมื่อต้นฉบับคลุมเครือ และรวดเร็วเมื่อไม่คลุมเครือ{{/3}}. รุ่น 7B คือรุ่นกลางที่สมดุลของตระกูล เป็นโมเดลแบบ dense ที่ใช้สัญญาอนุญาต {{4}}Apache-2.0{{/4}} ครอบคลุม 33 ภาษา บวกกับภาษาชนกลุ่มน้อยและภาษาถิ่นของจีนอีก 5 คู่ภาษา ({{5}}รวมถึงทิเบต คาซัค มองโกเลีย อุยกูร์ และกวางตุ้ง{{/5}}) สิ่งที่ทำให้มันแตกต่างจาก LLM ทั่วไปที่ใช้แปลภาษาคือการทำตามคำสั่ง (instruction-following): มันจะคงคำศัพท์เฉพาะไว้ตลอดทั้งเอกสาร ใช้สไตล์ที่กำหนด คงตัวคั่นและคีย์ JSON ไว้ไม่แตะต้อง และรับคำสั่งการปรับแต่งเป็นภาษาธรรมดา เทนเซ็นต์เผยแพร่ {{6}}IFMTBench{{/6}} ซึ่งเป็นเกณฑ์มาตรฐานแบบเปิดสำหรับทักษะดังกล่าว พร้อมกับน้ำหนักของโมเดล และส่วนที่ผู้บริโภคใช้ — มินิโปรแกรม {{7}}Tencent Hy Translate{{/7}} ซึ่งมีแอป iOS และ Android อยู่ในระหว่างพัฒนา — สร้างบนตระกูลนี้.

ตัวเลขที่มีเครื่องหมายดอกจันติดอยู่
ทุกอย่างด้านล่างนี้เป็นการประเมินของ Tencent เอง ซึ่งเผยแพร่บนโมเดลการ์ดและในรายงานประกอบ; ยังไม่มีรายการใดที่ถูกทำซ้ำอย่างอิสระ ณ เวลาที่เขียนนี้ ในการติดตามการแปลทั่วไป XX⇔XX ของ FLORES-200 โมเดล 7B ได้คะแนน 86.89 XCOMET-XXL ซึ่ง Tencent ประเมินว่าอยู่ที่ประมาณ 97.9% ของ Gemini 3.1 Pro (Think) ในโหมด "คิดเร็ว" (fast-thinking) มีการอ้างว่าเร็วกว่าโมเดลทั่วไปแบบโอเพนซอร์สรวมถึง DeepSeek-V4-Pro, Kimi K2.6, Qwen3.5-397B-A17B และ Gemma4-26B-A4B ใน WMT25 คะแนนดีขึ้นในทุกด้านเมื่อเทียบกับรุ่นก่อนหน้า — 63.86/71.21/82.24 เทียบกับ Hy-MT1.5-7B ที่ได้ 61.59/68.85/75.91 โดยเพิ่มขึ้นมากที่สุดใน GEMBA — และใน DomainMTBench (การเงิน การเมือง การศึกษา) ทำได้ 94.92 XCOMET / 92.79 GEMBA ความสามารถในการทำตามคำสั่งคือจุดที่แตกต่างจากโมเดลแปลภาษาของปีที่แล้วอย่างเห็นได้ชัดที่สุด: 89.73 ง่าย / 72.67 ซับซ้อน / 83.14 รวม ใน IFMTBench
สิ่งที่โฮสต์ API เปลี่ยนแปลงสำหรับไปป์ไลน์การแปล
การโฮสต์เองสำหรับ 7B นั้นง่ายจริง ๆ เท่าที่เรื่องแบบนี้จะเป็นได้ — มันรันบน A100 หรือ RTX 4090 ตัวเดียว และมีบิลด์ FP8 และ GGUF แบบ quantized ให้ใช้ แต่ “โฮสต์ง่าย” ไม่ได้แปลว่า “ไม่มีงานปฏิบัติการ” เส้นทาง GGUF ตอนนี้ต้องพึ่ง llama.cpp พร้อมเคอร์เนล STQ ของ Tencent เส้นทาง FP8 ต้องมีสแต็กที่ถูกต้อง และต้องมีคนดูแลมัน เอนด์พอยต์แบบโฮสต์ยกทุกอย่างนั้นออกไป: ไม่ต้องใช้ GPU ไม่ต้องคอมไพล์เคอร์เนล ไม่ต้องวางแผนความจุ และราคาต่อโทเคนคงที่ไม่ว่าการใช้งานจะเป็นอย่างไร สำหรับทีมที่ประมวลผลประโยคแปลนับล้านต่อวัน ความสามารถในการคาดเดานี้สำคัญกว่าค่า benchmark ที่เป็นพาดหัว — และนี่คือเหตุผลที่สัปดาห์นี้สำคัญกว่าการเปิดตัวในเดือนพฤษภาคม

คำถามเกี่ยวกับการกำหนดเส้นทางที่ยังไม่มีใครถาม
เนื่องจากโมเดลนี้เพิ่งเปิดตัวบนฝั่ง API ได้เพียงสามวัน วิธีการนำไปใช้งานที่สมจริงก็คือวิธีเดียวกับที่คุณใช้กับผู้ให้บริการรายใหม่รายใดก็ตาม: วางมันไว้หลังกฎการกำหนดเส้นทาง (routing rule) ที่มีการเฟลโอเวอร์อัตโนมัติ เพื่อให้เอนด์พอยต์ที่ยังไม่ผ่านการทดสอบไม่มีวันทำให้เส้นทางในระบบผลิตล่มได้ และปล่อยให้ปริมาณการใช้งานเป็นคนตัดสินว่ามันคู่ควรกับตำแหน่งถาวรหรือไม่ นั่นคือรูปแบบที่ OrcaRouter ประกอบขึ้นผ่าน routing DSL ของมันบนโมเดลกว่า 200 รุ่นที่เรามีอยู่จริง ๆ — และควรพูดให้ชัดเจนตรงนี้ว่า ณ ตอนที่เขียนนี้ Tencent Hy-MT2-7B ยังไม่อยู่ในแคตตาล็อกของ OrcaRouter ดังนั้นนี่จึงไม่ใช่เรื่องราวแบบ "เรียกใช้ผ่านเรา" สิ่งที่ตรงประเด็นคือรูปแบบการคิดราคา OrcaRouter ส่งผ่านราคารายการของแต่ละผู้ให้บริการโดยไม่บวกเพิ่มใด ๆ (0% markup) ดังนั้นเมื่อผู้ให้บริการลดอัตราค่าใช้บริการ การลดราคานั้นก็จะมีผลบนแพลตฟอร์มในวันเดียวกัน สำหรับงานแปลที่มีปริมาณสูง คำถามที่ควรถามเอนด์พอยต์ใด ๆ ไม่ใช่ "วันนี้ราคาบนพอร์ทัลเท่าไหร่" แต่เป็น "ราคารายการจริงต่อโทเคนที่ผู้ให้บริการเรียกเก็บคือเท่าไหร่ และมีอะไรคั่นอยู่ระหว่างราคานั้นกับฉันหรือไม่" ด้วยราคา $0.295/M ต่อ output Tencent Hy-MT2-7B ก็ทำให้คำถามนั้นน่าสนใจขึ้นมาทันที
สิ่งที่ควรดูต่อไป
มีสามสิ่งที่ตามมาจากสัปดาห์นี้ ประการแรก 1.8B และ 30B-A3B ซึ่งเป็นรุ่นพี่น้องกัน ตอนนี้สามารถเรียกใช้ได้เท่าเทียมกัน ดังนั้นการตัดสินใจเรื่อง "ขนาดไหน" จึงเป็นคำถามเกี่ยวกับ API จริง ๆ มากกว่าจะเป็นการตัดสินใจโฮสต์ด้วยตนเอง (ตระกูลนี้มีหน้าสำหรับเปรียบเทียบของตัวเอง แต่สรุปสั้น ๆ คือ: 1.8B สำหรับใช้งานบนอุปกรณ์และระดับที่ถูกที่สุด, 30B-A3B สำหรับงานระดับมืออาชีพ, ส่วน 7B อยู่ตรงกลาง) ประการที่สอง ความร่วมมือ WMT26 ของ Tencent มอบรางวัลให้ทีมที่ใช้โมเดล Hy-MT ในงาน General Machine Translation และ Video Subtitle Translation ซึ่งเป็นสัญญาณว่า Tencent ต้องการให้ตระกูลนี้เป็นค่าเริ่มต้นสำหรับการแปลแบบเปิดในการแข่งขัน MT ประการที่สาม แอป iOS และ Android ที่มีการอนุมานบนอุปกรณ์ หากเปิดตัวตามที่ประกาศไว้ จะทำให้ 1.8B กลายเป็นโมเดลแปลแบบเปิดที่ถูกติดตั้งมากที่สุดในโลก API ที่โฮสต์ไว้คือส่วนที่เปลี่ยนไปในสัปดาห์นี้ ส่วนทิศทางของตระกูลนี้ถูกกำหนดไว้แล้วตั้งแต่เดือนพฤษภาคม
