
FrogNano-4B-2609 เทียบกับ Qwen 3.8: ต้นทุนของเอเจนต์เขียนโค้ดเมื่อเวตเป็นของคุณเอง
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 219 tok/s
- OpenAIใหม่OpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- Anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIใหม่Grok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
microsoft/FrogNano-4B-2609เป็นเอเจนต์สำหรับรีโพซิทอรีระดับสี่พันล้านที่ได้มาจาก Qwen3.5-4B ซึ่งคุณดาวน์โหลดและให้บริการเอง Qwen3.8-Maxคือเรือธงที่โฮสต์ให้บริการ — โมเดล sparse mixture-of-experts ขนาด 2.4 ล้านล้านพารามิเตอร์ โดยมีพารามิเตอร์ที่ทำงานอยู่ราว 95 พันล้านตัวต่อโทเคน หน้าต่างมัลติโมดัลขนาดหนึ่งล้านโทเคน และอัตราค่าบริการ $2.00 ต่อโทเคนอินพุตหนึ่งล้านโทเคน และ $6.00 ต่อโทเคนเอาต์พุตหนึ่งล้านโทเคน — เข้าถึงได้ด้วยคีย์ API ตั้งแต่ 3 สิงหาคม 2026 หนึ่งในนั้นต้องแลกมาด้วย GPU และเวลาหนึ่งบ่าย อีกตัวไม่มีค่าใช้จ่ายจนกว่าคุณจะใช้งานมัน และจากนั้นจะคิดค่าบริการตามโทเคนบนเส้นทางที่ยาวที่สุดที่ใช้กันทั่วไป การเปรียบเทียบที่แท้จริงคือข้อแลกเปลี่ยนนี้ ไม่ใช่ตาราง benchmark
ตัวเลขของ FrogNano ที่นี่มาจากการ์ดโมเดลและรายงานทางเทคนิคของ Microsoft; ตัวเลขของ Qwen3.8-Max มาจากราคาที่ Alibaba เผยแพร่และบันทึกโมเดลในแค็ตตาล็อกของเราเอง โดยคะแนนอิสระจะถูกกำกับว่าเป็นตัวเลขจาก Artificial Analysis ทุกที่ที่ปรากฏ โปรดสังเกตการตั้งชื่อให้ดี: Qwen3.8 รุ่นที่ปล่อยแบบโอเพนเวตส์ได้ประกาศแล้วแต่ยังไม่เปิดให้ใช้งาน ขณะที่ Qwen3.8-Max เปิดใช้งานและมีราคาแล้ววันนี้ ทุกสิ่งที่เรียกใช้งานได้ในบทความนี้คือตัวหลัง
เลขคณิตที่ตัดสินการเปรียบเทียบ
เริ่มจากสิ่งที่งานเพียงงานเดียวต้องแลกมา เพราะมันไม่ใช่เรื่องที่เห็นได้ชัด และก็ไม่ใช่เรื่องเล็ก
การประเมินของ FrogNano รันทุก trajectory ด้วยงบประมาณ 150 สเต็ปภายในขอบเขตประมาณ 131K โทเค็นรวม ที่สูงสุด 8,192 โทเค็นที่สร้างต่อหนึ่งเทิร์นของผู้ช่วย และเพดานเวลา 10,800 วินาที คูณขีดจำกัดที่เผยแพร่ทั้งสองค่าเข้าด้วยกัน แล้วคุณจะได้เพดานประมาณ 1.23 ล้านโทเค็นที่สร้างขึ้นสำหรับ trajectory กรณีเลวร้ายที่สุดหนึ่งครั้ง — ซึ่งที่ราคา $6.00 ต่อล้านโทเค็นเอาต์พุตของ Qwen3.8-Max คิดเป็นประมาณ $7.38 สำหรับงานเดียวที่รันจนถึงสิ้นสุดงบประมาณ นั่นคือการคำนวณทางคณิตศาสตร์จากตัวเลขที่เผยแพร่สองตัว ไม่ใช่การวัด: trajectory จริงหยุดก่อนเวลา ค่าเฉลี่ยต่ำกว่าเพดานมาก และผลลัพธ์ของเครื่องมือกับเอาต์พุตของเชลล์ถูกคิดค่าใช้จ่ายในอัตราอินพุตที่ถูกกว่าแทนอัตราเอาต์พุต แต่ก็ทำให้เห็นรูปร่างของสิ่งนี้ เอเจนต์เขียนโค้ดไม่ได้ใช้โทเค็นเพียงไม่กี่ร้อยโทเค็นกับคำถามหนึ่งข้อ; มันใช้บทสนทนาที่ยาวนานและเน้นการใช้เหตุผลกับตัวเอง และทุกโทเค็นของบทสนทนานั้นถูกสร้างขึ้น
ตอนนี้วางอีกด้านหนึ่งของบัญชีไว้ข้างๆ มัน FrogNano-4B-2609 เป็นเวต BF16 ขนาด 9.32 GB ในสองชาร์ด ดาวน์โหลดได้โดยไม่มีด่าน การให้บริการมันต้องการ SGLang พร้อมตัวแยกวิเคราะห์การให้เหตุผลของ Qwen3 และตัวแยกวิเคราะห์การเรียกใช้เครื่องมือของ Qwen3 coder บวกกับแซนด์บ็อกซ์ที่แยกออกต่างหากสำหรับเครื่องมือทั้งห้า หลังจากนั้นต้นทุนส่วนเพิ่มของวิถีหนึ่งคือไฟฟ้า และหน่วยความจำที่มันใช้คือขนาดที่บริบทของคุณเติบโตขึ้น ไม่ใช่น้ำหนักของเวต
• โมเดลต้นทุน — FrogNano-4B-2609 มีต้นทุนฮาร์ดแวร์คงที่และต้นทุนส่วนเพิ่มเกือบเป็นศูนย์ Qwen3.8-Max มีต้นทุนคงที่เป็นศูนย์และคิดค่าบริการต่อโทเคน โดยมีการแบ่ง $2.00 / $6.00 ที่ไม่คิดล่วงหน้าเลย และผลักภาระทั้งหมดไปที่อัตราเอาต์พุต
• สิ่งที่เงินซื้อได้ — เอเจนต์ระดับ 4B บนฮาร์ดแวร์ของคุณเอง เทียบกับโมเดลระดับแนวหน้าที่คุณไม่ต้องคอยวางแผนกำลังความจุให้เลย
• จุดคุ้มทุน — จะถึงเมื่อปริมาณ trajectory ต่อเดือนของคุณคูณกับค่าท็อกเกนเฉลี่ยต่อ trajectory แล้วมากกว่าค่าใช้จ่ายของ GPU ที่คุณจะต้องเช่าอยู่ดี สำหรับทีมที่รันงานใน repository แค่วันละไม่กี่งาน เส้นนั้นยังห่างไกลมาก และโมเดลแบบโฮสต์ชนะด้วยความสะดวกเพียงอย่างเดียว
สองโมเดลที่ทำงานไม่เหมือนกัน
การเปรียบเทียบต้นทุนจะยุติธรรมก็ต่อเมื่อผลลัพธ์นั้นเทียบเคียงกันได้ และในกรณีนี้กลับเทียบเคียงกันไม่ได้ ซึ่งเป็นส่วนที่เอกสารสเปกส่วนใหญ่มักปิดบังไว้
FrogNano-4B-2609 ถูก post-train โดยเฉพาะกับงานวิศวกรรมซอฟต์แวร์ระดับ repository อินเทอร์เฟซทั้งหมดของมันคือลูปห้าเครื่องมือ — Read, Write, Edit, Glob และ Bash — ทำงานโดย Leaf harness ใน sandbox ที่แยกออกมา วนซ้ำจนกว่าโมเดลจะหยุดเรียก การ์ดของ Microsoft ระบุภาษาที่รองรับว่าเป็นภาษาอังกฤษ และโดเมนการเขียนโปรแกรมที่ผ่านการตรวจสอบว่าเป็น Python และบอกตรง ๆ ว่าองค์ประกอบภาพและวิดีโอใน checkpoint ไม่เคยถูก post-train และไม่รองรับ มันไม่คิดวิเคราะห์สถาปัตยกรรมของคุณ ไม่ตอบคำถามเกี่ยวกับธุรกิจของคุณ หรืออ่านภาพหน้าจอ
Qwen3.8-Max เป็นโมเดลทั่วไป บันทึกแค็ตตาล็อกของ Alibaba ระบุว่ามีอินพุตข้อความ รูปภาพ และวิดีโอ พร้อมเอาต์พุตข้อความ และหน้าต่างบริบท 1,000,000 โทเคน มันให้เหตุผล เขียน อ่านเอกสาร และสนทนาได้ และการเรียกใช้ฟังก์ชันเป็นคุณสมบัติของโมเดลทั่วไป ไม่ใช่จุดประสงค์ทั้งหมดของเช็กพอยต์ ตัวเลข Artificial Analysis ของมัน ซึ่งอ่านจากบันทึกเมื่อวันที่ 2 กันยายน 2026 มีค่า Intelligence Index อยู่ที่ 45.4 และ Coding Index อยู่ที่ 76.2
• อินพุต — FrogNano-4B-2609 รองรับเฉพาะข้อความเท่านั้น Qwen3.8-Max รองรับข้อความ รูปภาพ และวิดีโอ
• บริบท — ประมาณ 131K โทเค็นรวมสำหรับการกำหนดค่าที่ประเมินของ FrogNano เทียบกับ 1,000,000 สำหรับ Qwen3.8-Max นั่นคือ 7.5 เท่า และมันสำคัญที่สุดพอดีกับอินพุตขนาดเท่ารีพอซิทอรีที่เอเจนต์เขียนโค้ดได้รับ
• เอาต์พุตต่อเทิร์น — การตั้งค่าที่ผ่านการตรวจสอบของ FrogNano จำกัดเทิร์นของผู้ช่วยหนึ่งเทิร์นไว้ที่ 8,192 โทเค็น Qwen3.8-Max ไม่ได้เปิดเผยเพดานต่อการตอบกลับที่เทียบเท่า
• รูปแบบเอาต์พุต — FrogNano ส่งการเรียกใช้เครื่องมือ Leaf แบบมีโครงสร้าง และต้องมีฮาร์เนสเพื่อรันการเรียกเหล่านั้น Qwen3.8-Max จะคืนข้อความร้อยเรียงหรือการเรียกฟังก์ชันไปยังไคลเอนต์ใดก็ตามที่คุณมีอยู่แล้ว
• คะแนนอิสระ — ไม่มีสำหรับ FrogNano-4B-2609 นอกเหนือจากที่มีในการ์ดของตัวเอง; ตัวเลขของ Qwen3.8-Max ข้างต้นเป็นข้อมูลของบุคคลที่สาม จาก Artificial Analysis
• พารามิเตอร์ — ประมาณ 4.66B สำหรับ FrogNano ตามคำอธิบายบนการ์ดของมันเอง เทียบกับ 2.4 ล้านล้านทั้งหมด และ active ประมาณ 95B สำหรับ Qwen3.8-Max

จุดที่ 4B พิสูจน์คุณค่าของตัวเองได้จริง ๆ
มีมิติหนึ่งที่เอเจนต์ขนาด 4B เอาชนะโมเดลระดับแนวหน้าได้อย่างเด็ดขาด และมิติ้นั้นไม่ใช่ความแม่นยำ
บทความของ FrogNano เริ่มต้นจาก Qwen3.5-4B ซึ่งทำคะแนนได้ 39.4% บน SWE-bench Verified ผ่านฮาร์เนส Leaf ในฐานะโมเดลทั่วไปธรรมดา การวนซ้ำด้วยการเรียนรู้แบบเสริมกำลังห้ารอบบนงานสังเคราะห์ราว 1,500 งาน ดันคะแนนขึ้นไปถึง 61.5% โดยภาคผนวกของบทความเดียวกันรายงานความก้าวหน้าในแต่ละรอบเป็น 48.2%, 53.4%, 58.3%, 58.6% และ 61.6% วิธีการนี้ — การสร้างงานที่ปรับเทียบให้เข้ากับพรมแดนความสามารถในการเรียนรู้ของนโยบายปัจจุบัน โดยไม่มีการกลั่นองค์ความรู้จากโมเดลที่แข็งแกร่งกว่า — คือผลงานที่นำเสนอ และเป็นเหตุผลที่กลุ่มวิจัยซึ่งไม่มีงบประมาณสำหรับโมเดลระดับแนวหน้าจะให้ความสนใจ
อ่านถึงนัยที่สิ่งนี้บอกเกี่ยวกับการเปรียบเทียบ การ์ดของ Microsoft เปิดเผยอย่างตรงไปตรงมาว่า FrogNano ไม่ได้ดีกว่าโมเดลต้นทางอย่างสม่ำเสมอในทุกด้าน: อัตราการเรียกใช้เครื่องมือแบบขนานของมันอยู่ที่ 1.71% เพราะการปรับปรุงในรอบหลัง ๆ สูญเสียความสามารถในการยิงการเรียกพร้อมกัน และทีมได้เพิ่มขั้นตอนการรวมเข้าด้วยกันเพื่อพยายามกู้ความสามารถนั้นกลับคืนมา โมเดลที่แก้ปัญหาได้มากขึ้นแต่กลับแย่ลงในพฤติกรรมหนึ่งโดยเฉพาะถือเป็นชิ้นงานทางวิศวกรรมของจริงที่มองเห็นรอยต่อได้ และการ์ดของมันก็บอกเช่นนั้นแทนที่จะปกปิดเรื่องนี้ไว้
และตัวเลข SWE-bench ก็เป็นวงจรปิด ค่าพื้นฐานของโมเดลฐาน ฮาร์เนส และคะแนนสุดท้ายล้วนมาจากแล็บเดียวกัน และตารางสองตารางในเปเปอร์เดียวกันก็ให้บันไดสองแบบที่ต่างกันสำหรับการทดลองเดียวกัน ในทางตรงกันข้าม ตัวเลขด้านการเขียนโค้ดของ Qwen3.8-Max กลับมาจาก Artificial Analysis ไม่ใช่จาก Alibaba — หลักฐานคนละชนิด ความมั่นใจคนละระดับ และสองสิ่งนี้ไม่ควรถูกนำมาหักลบกันเด็ดขาด
4B ที่คุณยังไม่อาจวางแผนรับมือได้อย่างเต็มที่นัก
มีสองสิ่งขวางกั้นระหว่าง FrogNano-4B-2609 กับตำแหน่งขึ้นโปรดักชัน และทั้งสองสิ่งนั้นอยู่ในเอกสารของมันเอง ไม่ใช่ในความเห็นของผู้ตรวจสอบคนใด
ประการแรกคือฮาร์ดแวร์ การ์ดระบุข้อกำหนดน้ำหนัก BF16 ไว้ที่ประมาณ 9.3 GB จากนั้นเสริมว่าหน่วยความจำ "จะเพิ่มขึ้นอย่างมากเมื่อบริบทรวมเข้าใกล้ประมาณ 131K โทเคน" ก่อนจะระบุว่าโมเดล GPU ขั้นต่ำที่แน่ชัด การกำหนดค่า VRAM เวอร์ชันรันไทม์ และโปรไฟล์ประสิทธิภาพ "ยังต้องได้รับการตรวจสอบยืนยันก่อนเปิดตัว" — ประโยคที่ปรากฏอยู่บนโมเดลที่ดาวน์โหลดได้แล้ว ไม่มีใครเผยแพร่ตัวเลข VRAM สำหรับการกำหนดค่าที่ประเมินไว้ และการ์ดก็ไม่มีตัวเลขดังกล่าวเช่นกัน
ประการที่สองคือจุดยืนด้านความปลอดภัย บันทึก alignment ของ Microsoft เองระบุว่า การ post-training ที่เฉพาะสำหรับ agent ไม่ได้ใช้ชุดข้อมูลด้าน safety-preference, refusal, harmful-content หรือ adversarial เลย แต่กลับปรับให้เหมาะกับความถูกต้องเชิงฟังก์ชันและการหลีกเลี่ยง regression แทน และโมเดลนี้ "ไม่ควรถือว่าถูกจัดแนวด้านความปลอดภัยอย่างอิสระสำหรับการปรับใช้แบบ autonomous โดยไม่มีข้อจำกัด" การ์ดปิดท้ายด้วยการระบุความเสี่ยงที่เป็นรูปธรรม: แพตช์อาจไม่ถูกต้องหรือไม่ปลอดภัยแม้ว่าจะผ่านการทดสอบ ประสิทธิภาพอ่อนไหวต่อคุณภาพของการทดสอบเหล่านั้น และแพตช์ที่เสนอทุกรายการจำเป็นต้องได้รับการตรวจทานจากมนุษย์ที่มีคุณสมบัติเหมาะสม รวมถึงการทดสอบ regression และความปลอดภัยอย่างอิสระก่อนนำไปใช้ โมเดลที่โฮสต์แบบทั่วไปไม่มีข้อควรระวังเฉพาะเหล่านั้น และจะไม่รันคำสั่ง shell ใน repository ของคุณเช่นกัน
กุญแจหนึ่งดอกสำหรับฝ่ายใดก็ตามที่คุณเลือก
สิ่งที่มีประโยชน์ของการรันการเปรียบเทียบนี้ในทางปฏิบัติก็คือ มีเพียงครึ่งเดียวเท่านั้นที่เป็นการดาวน์โหลด Qwen3.8-Max และโมเดลทั่วไปที่คุณจะใช้เป็นเกณฑ์เปรียบเทียบกับเอเจนต์ที่โฮสต์เองนั้น ล้วนเข้าถึงได้ผ่านปลายทางที่เข้ากันได้กับ OpenAI เพียงจุดเดียวบน OrcaRouter โดยบวกเพิ่ม 0% — ราคาตามรายการของผู้ให้บริการถูกส่งผ่านตรง ๆ ดังนั้นเมื่อผู้ให้บริการเปลี่ยนราคา มันจะมาถึงฝั่งเราภายในวันเดียวกัน ซึ่งเป็นตัวเลขที่ขยับจริงเมื่อค่าใช้จ่ายโทเคนเอาต์พุตของเอเจนต์เขียนโค้ดคือสิ่งที่คุณกำลังพยายามควบคุม นั่นยังทำให้คำถามเรื่อง failover ง่ายขึ้นด้วย: หากครึ่งที่เป็นโฮสต์ของไปป์ไลน์คุณเสื่อมประสิทธิภาพลง ระบบจะลองใหม่โดยอัตโนมัติ และการทดลองก็ดำเนินต่อไป
FrogNano-4B-2609 ไม่ใช่หนึ่งในเส้นทางของเรา และยังไม่มีกำหนดการสำหรับมัน น้ำหนักโมเดลเป็นของคุณที่จะนำไปให้บริการ และการ์ดก็ระบุไว้ตรงไปตรงมาว่าการตั้งค่าสำหรับการให้บริการยังไม่ได้รับการตรวจสอบยืนยันอย่างเต็มที่ สิ่งที่เราทำได้คือทำให้อีกฝั่งของการเปรียบเทียบไม่มีค่าใช้จ่ายใด ๆ ในการตั้งค่า เพื่อให้คำถามที่คุณลงเอยด้วยการตอบนั้นเป็นคำถามที่แท้จริง — ว่าเอเจนต์ SWE-bench ที่ผู้ขายรายงานผลไว้ 61.5% บน GPU ของคุณเอง จะเอาชนะโมเดลระดับแนวหน้าที่คิดค่าบริการตามปริมาณการใช้งาน บนงานของคุณเอง ในปริมาณการใช้งานของคุณเองได้หรือไม่

ควรเลือกอันไหนดี
เลือกใช้ Qwen3.8-Max เมื่องานเป็นงานทั่วไป เมื่อทีมปฏิบัติการของคนอื่นควรเป็นฝ่ายแบกรับ capacity เมื่อข้อมูลนำเข้าอาจมีรูปภาพหรือเอกสารยาว หรือเมื่อคุณต้องการคำตอบภายในวันนี้ ไม่ใช่รอสร้าง serving stack ให้เสร็จภายในวันศุกร์ คะแนนจากบุคคลที่สามของมันทำให้คุณประเมินได้คร่าว ๆ ว่ากำลังซื้ออะไรอยู่ และค่าบริการต่อโทเคนเป็นต้นทุนผันแปรที่คุณเห็นได้ก่อนตัดสินใจ สำหรับทีมที่รันงานใน repository จำนวนไม่มากต่อเดือน ตัวเลขที่คำนวณได้ไม่ได้ใกล้เคียงกันเลย
เลือกใช้ FrogNano-4B-2609 เมื่อปริมาณงานสูงพอที่การคิดค่าบริการต่อโทเคนบนเส้นทางระยะยาวกลายเป็นข้อจำกัด เมื่อข้อมูลไม่สามารถออกจากโครงสร้างพื้นฐานของคุณได้ หรือเมื่อคำถามวิจัย — เอเจนต์ขนาดเล็กสามารถฝึกให้มีความสามารถระดับรีพอซิทอรีโดยไม่มีครูได้หรือไม่ — คือสิ่งที่คุณกำลังทดสอบจริง ๆ เข้าไปโดยรู้สามสิ่งนี้: 61.5% เป็นการวัดของห้องแล็บเองบนฮาร์เนสที่ห้องแล็บดูแลเอง ไม่มีใครเผยแพร่ตัวเลข VRAM สำหรับการกำหนดค่าที่ถูกประเมิน และการ์ดเองระบุว่าการตั้งค่าการให้บริการยังไม่ได้รับการตรวจสอบยืนยัน
สิ่งที่ทำให้คู่นี้คุ้มค่าแก่การเขียนถึงก็คือ ทั้งคู่มีบรรพบุรุษร่วมกันย้อนไปสองรุ่น FrogNano สืบทอดมาจาก Qwen3.5-4B — โมเดลทั่วไปจากบริษัทเดียวกัน ซึ่งมีเรือธงขนาด 2.4 ล้านล้านพารามิเตอร์อยู่อีกฟากของหน้านี้ ไมโครซอฟต์เลือกตัวเล็ก นำไปผ่านการวนซ้ำ RL ห้ารอบบนรีโพซิทอรีสังเคราะห์ และได้ผู้เชี่ยวชาญเฉพาะทางออกมา อาลีบาบาไปอีกทางและขยายขนาดขึ้น ทั้งสองคำตอบได้รับการเผยแพร่ และช่องว่างระหว่างต้นทุนการดาวน์โหลดกับต้นทุน API คือวิธีที่ตรงไปตรงมาในการเลือกระหว่างสองสิ่งนี้

การเปรียบเทียบในบทความนี้1
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
