
MAGI 2 是一个同时生成视频与音频的统一模型。文本、画面与声音处于同一条 token 序列中,让语音、音乐、动作与情绪自然同步。
文本、视频与音频由同一个主干网络处理,而非多个独立分支。
对白、音乐、音效与画面同时生成。
MagiMoE 保持 114B 容量,每个 token 仅激活 6B 参数。
把视频压缩为可生成、可组合的世界知识。
效率与表现力协同设计——从模型架构到训练系统再到数据方法。
MAGI-2 Preview 为音视频生成带来的能力。
精准的对白、演唱与情绪表达,口型、表情与肢体协调一致。
从音乐生成画面,节奏感知的场景流动。
MagiMoE:12 个头 x 256 维路由子空间,每个头 256 个专家取 Top-6。
同一个 Transformer 主干同时处理文本、视频与音频。
Head Parallel 结合 NVLink 与 InfiniBand,让 114B 训练切实可行。
越来越多创作者用它制作广告、电影、MV 等作品。
关于 MAGI 2 的问题。更多信息请访问 sand.ai。