MiniMax H3 เปิดตัวแบบโอเพนซอร์สที่ 33 พันล้าน: โมเดลวิดีโอข้ามเส้นตายการผลิต
MiniMax ได้เปิดตัวโมเดลวิดีโอ H3 ที่มีพารามิเตอร์ 33 พันล้านในวันสุดท้ายของเดือนกรกฎาคม โดยได้รับการยอมรับว่าอยู่ในสถานะ SOTA เราจะวิเคราะห์ว่ามันทำอะไรได้บ้าง ทำไม 33 พันล้านจึงเป็นข้อความหัวข่าว และวิดีโอยูเซอร์บน videobao สามารถใช้งานมันได้อย่างไรในปัจจุบัน
ในวันสุดท้ายของเดือนกรกฎาคม MiniMax ได้เปิดตัว H3 โมเดลวิดีโอที่มีพารามิเตอร์ 33 พันล้านที่ได้รับการยอมรับว่าอยู่ในสถานะ SOTA บนแบบชี้วัดวิดีโอหลัก ในวันเดียวกันนั้นน้ำหนักของโมเดลได้ถูกเปิดตัวแบบโอเพนซอร์ส เรื่องนี้ไม่ใช่แค่ว่าห้องปฏิบัติการอื่นได้ตามรอย ByteDance's Seedance เรื่องนี้คือว่าการสร้างวิดีโอได้ข้ามเส้นตายจาก 'การสาธิตที่น่าสนใจ' ไปสู่ 'เครื่องมือการผลิต' และ MiniMax ได้เลือกที่จะเปิดตัวในตอนนี้
บน videobao มันเปลี่ยนแปลงสิ่งที่คุณสามารถทำได้ในหนึ่งเซสชัน โปรดอ่านต่อสำหรับการวิเคราะห์ H3 ข้อโต้แย้ง 'ทำไม 33 พันล้านจึงเป็นข้อความหัวข่าว' และวิธีการใช้โมเดลรุ่นนี้ในโครงการต่อไปของคุณ
MiniMax H3 ทำอะไรได้บ้าง
H3 ถูกสร้างขึ้นโดยอิงตามสองแนวคิด: การประมวลผลหลายรูปแบบแบบพื้นฐานและการแก้ไขข้ามรูปแบบที่แม่นยำ ข้อความ รูปภาพ เสียง และวิดีโอสามารถใช้เป็นการอ้างอิงใน prompt เดียวกันได้ นั่นหมายความว่าคุณสามารถส่งคลิปสั้นให้กับโมเดล ชี้ไปที่ตัวละครหนึ่งด้วยคำสั่งข้อความ และแทนที่เฉพาะตัวละครนั้นโดยที่สิ่งรอบข้างยังคงไม่เปลี่ยนแปลง
การสาธิตในช่วงแรกของ MiniMax เน้นไปที่สถานการณ์ที่ทีมผลิตต้องการมันจริงๆ: การออกแบบ UI walkthroughs การตลาดแบรนด์ MV-style cuts การถ่ายภาพเกม AR และผลกระทบการเปลี่ยนแปลง และการลองใส่ e-commerce คำขายไม่ใช่ 'AI สามารถสร้างวิดีโอ' แต่ 'AI สามารถสร้างวิดีโอที่คุณต้องการ โดยมีสิ่งที่เปลี่ยนแปลงเฉพาะส่วนนั้น'
H3 ยังสร้าง 2K แบบพื้นฐาน ด้วยตัว tokenizer ใหม่ที่สร้างขึ้นบนโครงสร้าง Hailuo-02 การบีบอัดมีประสิทธิภาพมากขึ้น ต้นทุนการฝึกอบรมและการอ้างอิงต่ำลง และโมเดลมีขนาดเล็กพอ (33B) ที่ทีมผลิตที่มีความเข้มงวดสามารถเป็นเจ้าภาพได้
ทำไม 33B จึงเป็นข่าวใหญ่กว่าสถานะ SOTA
SOTA เป็นข้อความหัวข่าว 33B เป็นข่าวจริง ส่วนใหญ่ของโมเดลวิดีโอ SOTA ในปี 2025 มีพารามิเตอร์มากกว่า 70B ซึ่งหมายความว่าต้นทุนการคำนวณที่สูง การทำซ้ำที่ช้า และ API ที่ปิด โมเดล 33B ที่อยู่ในสถานะ SOTA หมายถึงสามสิ่ง
ก่อนอื่น การฝึกอบรมมีความสามารถในการเข้าถึงมากขึ้น ทีมที่ไม่สามารถอุ้มต้นทุนฝึกอบรมโมเดลวิดีโอขอบเขตในปีที่แล้ว ตอนนี้สามารถปรับแต่งหรือแยกส่วนของมันได้ ที่สอง การอ้างอิงมีต้นทุนต่ำลง ต้นทุนต่อการสร้างบน videobao ถูกจำกัดโดยต้นทุนด้านบน และโมเดลที่เล็กลงจะผลักดันตัวเลขนั้นลง �ที่สาม การใช้งานเป็นเรื่องที่เป็นไปได้ คุณสามารถรันโมเดลวิดีโอ 33B บนฮาร์ดแวร์การผลิตที่มีความเข้มงวดโดยไม่ต้องสร้างศูนย์ข้อมูลที่กำหนดเอง
อีกนัยหนึ่ง SOTA ที่ 33B เป็นสิ่งที่เปลี่ยนผลลัพธ์การวิจัยให้เป็นผลิตภัณฑ์ สิ่งเดียวกันเกิดขึ้นกับโมเดลภาษาเมื่อการโอเพนซอร์สที่มีประสิทธิภาพถูกตีตรงกับเกณฑ์คุณภาพ GPT-3 ในขนาดเพียงเศษเสี้ยว วิดีโอกำลังผ่านการเปลี่ยนแปลงเดียวกัน เพียงแต่เวลาห้าเดือนต่อหลัง
จากการสาธิตเล่นตลกไปสู่เครื่องมือการผลิต
หนึ่งปีที่แล้ว AI วิดีโอถูกตัดสินจากการสาธิตว่ากระต่ายมีความสอดคล้อง ทั้งฟิลด์ทั้งหมดจะเพ่งเล็งไปที่ความสอดคล้องในระดับ prompt และแม้กระทั่งนั้นก็ยาก เกณฑ์ปี 2026 แตกต่างกัน โมเดลเช่น Veo 3.1 Kling 2.5 Sora 2 และตอนนี้ H3 ไม่เพียงแต่สร้าง พวกมันแทนที่ตัวละครโดยไม่ทำให้พื้นหลังเลอะ พวกมันไม่เพียงแต่รวมเสียง Veo 3.1 ส่งออกเสียง 48 kHz แบบพื้นฐาน และส่วนใหญ่ของโมเดลหลักกระแสตอนนี้ผลิตวิดีโอที่เป็นไปตามภาพพูดในการผ่านเดียว
กรณีการใช้งานเคลื่อนไปกับความสามารถ ปีที่แล้วเป็น 'ดูตัวอย่างผลลัพธ์ที่น่าสนใจ' ปีนี้เป็น TVC โฆษณาสินค้าแบรนด์ และการสาธิตผลิตภัณฑ์ การเปลี่ยนจาก 'แสดงโมเดล' ไปสู่ 'ใช้โมเดลเพื่อส่งมอบแคมเปญ' เป็นเส้นที่อุตสาหกรรมเพิ่งข้าม
ถ้าคุณลอง AI วิดีโอในปี 2025 และไม่ติด รุ่นโมเดลปี 2026 เป็นผลิตภัณฑ์ที่แตกต่างกัน บน videobao ตอนนี้คุณสามารถใช้ Hailuo 02 Veo 3.1 Kling 2.5 และ Sora 2 ในเซสชันเดียวและเลือกที่เหมาะสมกับข้อเขียน
ทำไมการรวมตัวจึงเป็นชนะเมื่อโมเดลเปิดตัวแบบโอเพนซอร์ส
MiniMax เลือกที่จะเปิดตัว H3 แม้ว่าพวกมันมีความสามารถในการแสดงผล SOTA และมีข้อได้เปรียบด้านต้นทุน นั่นดูไม่ดีต่อทางตรงกันข้าม แต่การเล่นโอเพนซอร์สกำลังกลายเป็นมาตรฐานสำหรับห้องปฏิบัติการวิดีโอที่มีความเข้มงวด เหตุผลนั้นเรียบง่าย: โมเดลวิดีโอกำลังจะมีทุกที่ และการเป็นผู้ขายที่ปิดตัวของรุ่นที่ดีกว่าอย่างเล็กน้อยนั้นมีค่าน้อยกว่าการเป็นแพลตฟอร์มที่ให้ผู้ใช้เปรียบเทียบพวกมันทั้งหมด
ดู LTX-2.3 นั่นเป็นโมเดลวิดีโอโอเพนซอร์สต่างประเทศที่ข้าม 18 ล้านการดาวน์โหลดบน Hugging Face 18 ล้าน ระบบนิเวศโอเพนซอร์สวิดีโอเป็นเรื่องจริง มันมีความแข็งแรง และมันคือที่ที่มากมายของการทำงานผลิตภัณฑ์ใหม่ พลาตฟอร์มการรวมตัวเช่น videobao อยู่เหนือนี้: พวกเราบรรจุโอเพนซอร์ส ปิดตัว จีน และโมเดลตะวันตกด้านหลังหนึ่ง login และยอดเครดิตเดียว เพื่อให้คุณไม่ต้องเลือก
นั่นคือคำตอบที่เป็นไปได้สำหรับคำถาม 'โอเพนซอร์สหรือปิดตัว' สำหรับผู้ใช้สุดท้าย คุณไม่ได้เลือก คุณใช้แพลตฟอร์ม และแพลตฟอร์มเลือกโมเดลที่เหมาะสมกับงาน ในบางครั้งนั้นคือ MiniMax H3 ตอนนี้อยู่บน videobao ในบางครั้งนั้นคือ Veo 3.1 สำหรับภาพยนตร์ ในบางครั้งนั้นคือ Kling 2.5 สำหรับสัญชาติเสียงแบบต่ำต้นทุน ในบางครั้งนั้นคือ Sora 2 สำหรับการเล่าเรื่องหลายฉากยาว แนวคิดคือว่าแพลตฟอร์มสามารถทำทั้งหมด
วิธีการใช้ H3 บน videobao ตอนนี้
H3 ตอนนี้อยู่บน videobao เลือกเมื่อคุณต้องการการแก้ไขข้ามรูปแบบที่แม่นยำบนผืนผ้าวาด 2K แบบพื้นฐาน แนวทาง: อัปโหลดรูปภาพอ้างอิงหรือคลิปสั้น เขียน prompt ที่ระบุสิ่งที่คุณต้องการเปลี่ยนแปลง และ H3 จะทำให้ส่วนที่เหลือของฉากยังคงมีความเป็น pixel-stable Hailuo 02 Kling 2.5 และ Veo 3.1 อยู่ในเซสชันเดียวถ้าคุณต้องการ workflow เดียวกันในระดับราคาหรือระดับความละเอียดที่ต่างกัน
บน videobao H3 ทำงานที่ 7 เครดิตต่อวินาทีสำหรับ 2K แบบพื้นฐาน ที่มีช่วงระยะเวลา 4-15 วินาที โหมดการใช้งานแบบบูรณาการประกอบด้วย: text-to-video, ภาพจากเฟรมแรก, เฟรมสุดท้าย หรือเฟรมแรก+สุดท้ายไปยังวิดีโอ และโหมดที่ขับเคลื่อนด้วยการอ้างอิงที่มีภาพอ้างอิงได้ถึง 5 ภาพ พร้อมคลิปวิดีโอและเสียงอ้างอิงเพิ่มเติม การแก้ไขข้ามรูปแบบที่แม่นยำเป็นกรณีการใช้งานหลัก Hailuo 02 เป็นการสำรองที่ถูกกว่าสำหรับ workflow เดียวกัน Veo 3.1 เป็นการเลือกที่ถูกต้องถ้าคุณต้องการ 4K Kling 2.5 เป็นการเลือกที่ถูกต้องถ้าคุณต้องการเสียงแบบต่ำต้นทุนที่มีเสียงในตัว Sora 2 เป็นการเลือกที่ถูกต้องสำหรับการเล่าเรื่องหลายฉากยาว H3 เป็นแบบ premium-tier เท่านั้นบน videobao เนื่องจากการสร้าง 2K มีค่าแพงกว่า 1080p
คลื่นโอเพนซอร์ส 33B จะทำให้ต้นทุนต่ำลงตลอดช่วงสองไตรมาสต่อไป การเคลื่อนไปในทางที่ถูกต้องคือการล็อก workflow การแก้ไขข้ามรูปแบบตอนนี้ ในขณะที่ H3 เป็น SOTA ที่สดใหม่ และโมเดลอื่นๆ ยังคงหดตัวไปใต้มัน