ข่าว
อาลีบาบาเปิดตัวโมเดล AI มัลติโมดัล Qwen3.8-Flash สถาปัตยกรรม MoE ลดต้นทุนประมวลผล
สำนักข่าวบริคอินโฟ – อาลีบาบา (Alibaba) เปิดตัว Qwen3.8-Flash โมเดลประมวลผลมัลติโมดัลแบบเปิดเผยค่าน้ำหนัก (open-weight) ที่พัฒนาขึ้นบนสถาปัตยกรรม Mixture-of-Experts (MoE) โดยมุ่งเน้นการเพิ่มประสิทธิภาพการประมวลผลควบคู่กับการควบคุมต้นทุน โครงสร้างโมเดลประกอบด้วยพารามิเตอร์หลักจำนวน 125,000 ล้านพารามิเตอร์ (125B) เสริมด้วย N-gram Embeddings อีก 51,000 ล้านพารามิเตอร์ (51B) และใช้การประมวลผลจริงเพียง 6,000 ล้านพารามิเตอร์ (6B) ต่อหนึ่งโทเคน ทั้งนี้ ตัวโมเดลได้รับการออกแบบมาเพื่อรองรับงานที่มีปริมาณข้อมูลสูง ระบบช่วยเขียนโค้ด การทำงานร่วมกับเครื่องมือภายนอก และใช้เป็นสถาปัตยกรรมต้นแบบสำหรับซีรีส์ Qwen4 ในอนาคต
ด้านการทดสอบเกณฑ์มาตรฐาน Qwen3.8-Flash มีผลการประเมินเทียบเคียงกับโมเดลอย่าง DeepSeek-V4-Flash และ Claude-Opus-4.6 ในหลายด้าน เช่น SWE-bench Pro สำหรับการเขียนโค้ดด้วยระบบอัตโนมัติ (agentic coding), CoWorkBench สำหรับการจัดการงานสำนักงานที่มีขั้นตอนต่อเนื่อง, Toolathlon Verified ด้านการเชื่อมต่อเครื่องมือเพื่อแก้ปัญหาหลายขั้นตอน, MathVision ด้านการแก้โจทย์คณิตศาสตร์ผ่านภาพ, AndroidWorld ด้านการควบคุมระบบสมาร์ตโฟน และ ERQA ด้านปัญญาประดิษฐ์เชิงกายภาพ
โมเดลดังกล่าวรองรับบริบท (context) พื้นฐานที่ 262K โทเคน และสามารถขยายได้สูงสุด 1 ล้านโทเคน โดยเปิดให้นักพัฒนาเข้าใช้งานค่าน้ำหนักโมเดลผ่านแพลตฟอร์ม Hugging Face และ ModelScope ขณะเดียวกัน อาลีบาบาได้เปิดให้บริการเชื่อมต่อผ่าน Application Programming Interface (API) บนระบบ Model Studio และ Qwen Cloud โดยกำหนดอัตราค่าบริการอินพุต 1 หยวน (ราว 0.16 ดอลลาร์สหรัฐ) ต่อ 1 ล้านโทเคน และเอาต์พุต 3 หยวน (ราว 0.47 ดอลลาร์สหรัฐ) ต่อ 1 ล้านโทเคน นอกจากนี้ยังนำไปใช้งานบนแพลตฟอร์ม QwenWork ในโหมดมาตรฐาน (standard mode) ซึ่งช่วยลดปริมาณการใช้โทเคนลง 75% และเพิ่มความเร็วในการประมวลผลผลลัพธ์เกือบเท่าตัว
ในเชิงเทคนิค มีการปรับใช้สถาปัตยกรรมแบบ hybrid attention ผสานระหว่าง Gated DeltaNet (GDN) เพื่อช่วยบีบอัดข้อมูลย้อนหลัง และ Qwen Sparse Attention (QSA) ที่ใช้ระบบดัชนีบีบอัดเพื่อเลือกข้อมูลบริบท ช่วยลดภาระการประมวลผลลำดับข้อมูลขนาดยาว เสริมด้วยกลไก Gated Residual (GR) เพื่อควบคุมการไหลเวียนข้อมูลระหว่างเลเยอร์ การนำเทคนิค N-gram Embedding มาช่วยเพิ่มขีดความสามารถของโมเดล และใช้ Muon Optimizer ในกระบวนการเทรน ส่งผลให้ใช้ทรัพยากรการเทรนเพียงประมาณ 1 ใน 9 ของรุ่นก่อนหน้าอย่าง Qwen3.7-Plus แต่ให้ประสิทธิภาพในการประมวลผลงานเขียนโค้ดและงานสำนักงานที่สูงขึ้น
ปัจจุบัน อาลีบาบาได้เผยแพร่โมเดลโอเพนซอร์สสู่ชุมชนนักพัฒนาแล้วมากกว่า 460 โมเดล ซึ่งนำไปสู่การพัฒนาต่อยอดเป็นโมเดลอนุพันธ์ (derivative models) มากกว่า 300,000 โมเดล และมีสถิติการดาวน์โหลดทั่วโลกรวมกว่า 3,000 ล้านครั้ง
