MAGI-2 Preview 已发布

MAGI 2

统一的音视频生成模型。
114B 参数,每个 token 仅激活 6B。

MAGI 2 电影感生成画面

什么是 MAGI 2

MAGI 2 是一个同时生成视频与音频的统一模型。文本、画面与声音处于同一条 token 序列中,让语音、音乐、动作与情绪自然同步。

统一架构

文本、视频与音频由同一个主干网络处理,而非多个独立分支。

一个模型,多种输出

对白、音乐、音效与画面同时生成。

面向规模化设计

MagiMoE 保持 114B 容量,每个 token 仅激活 6B 参数。

通向物理 AGI 的基础

把视频压缩为可生成、可组合的世界知识。

为什么选择 MAGI 2

效率与表现力协同设计——从模型架构到训练系统再到数据方法。

对白、演唱与情绪变化,配合自然的口型、表情、眼神与肢体语言。

核心能力

MAGI-2 Preview 为音视频生成带来的能力。

角色表演

精准的对白、演唱与情绪表达,口型、表情与肢体协调一致。

音乐生成视频

从音乐生成画面,节奏感知的场景流动。

高效 MoE 扩展

MagiMoE:12 个头 x 256 维路由子空间,每个头 256 个专家取 Top-6。

统一音视频序列

同一个 Transformer 主干同时处理文本、视频与音频。

系统协同设计

Head Parallel 结合 NVLink 与 InfiniBand,让 114B 训练切实可行。

创意伙伴

越来越多创作者用它制作广告、电影、MV 等作品。

常见问题

关于 MAGI 2 的问题。更多信息请访问 sand.ai。






体验 MAGI 2

阅读 MAGI-2 Preview 公告,探索统一音视频生成的可能性。