即刻关注流8/3 23:5275 分精选
MiniMax H3视频生成模型:多模态输入+立体声输出,权重已公开
超级峰: 最近看到一个视频生成模型挺有意思,叫 MiniMax H3。它能同时理解文字、图片、视频和音频,再生成带立体声的视频。
推荐理由:值得看:MiniMax H3 能一次生成带立体声的视频,对一个人做内容的超级个体来说,直接省掉配音和音画对齐的步骤,比单纯堆参数更实用。注意它是自定义许可证,不是无条件开源。
MiniMax 发布了名为 H3 的视频生成模型,该模型能够同时理解文字、图片、视频和音频,并生成带有立体声的视频。官方模型卡显示,H3 支持最高 2K 分辨率、最长 15 秒的视频生成。MiniMax 已公开 H3 的模型权重,但采用自定义许可证,并非无条件开源。该模型的一大亮点是画面与声音可在同一次生成中完成,减少了后期配音和音画对齐的工作量,对个人内容创作者尤为实用。相关链接指向 Hugging Face 上的模型页面。