开源中国资讯8/3 11:1979 分精选
MiniMax H3 开源:33B 全模态模型,可生成原生立体声 2K 视频
MiniMax H3 开源:33B 全模态模型,一个视觉语言模型只够当它的编码器
推荐理由:值得看:MiniMax H3 开源了 33B 全模态模型,能生成带立体声的 2K 视频,架构上直接用视觉语言模型当编码器。对 AI 创作者和产品孵化者来说,这是可以直接抄的架构思路,也是国内视频生成模型追赶国际标杆的重要信号。
MiniMax 今日开源了 H3 模型,这是一个拥有 33B 参数的全模态生成模型,能够生成带有原生立体声的 2K 视频。该模型由三个模块组成,其中两个已开源,权重已上传至 Hugging Face。H3 的发布标志着国内视频生成模型在架构和许可上的重要进展,其全模态能力涵盖视觉、语言和音频处理,一个视觉语言模型仅作为其编码器使用。该模型在公开平台上获得了广泛关注,热度持续上升。