开源中国资讯8/3 11:1979精选

MiniMax H3 开源:33B 全模态模型,可生成原生立体声 2K 视频

MiniMax H3 开源:33B 全模态模型,一个视觉语言模型只够当它的编码器

阅读原文

推荐理由:值得看:MiniMax H3 开源了 33B 全模态模型,能生成带立体声的 2K 视频,架构上直接用视觉语言模型当编码器。对 AI 创作者和产品孵化者来说,这是可以直接抄的架构思路,也是国内视频生成模型追赶国际标杆的重要信号。

MiniMax 今日开源了 H3 模型,这是一个拥有 33B 参数的全模态生成模型,能够生成带有原生立体声的 2K 视频。该模型由三个模块组成,其中两个已开源,权重已上传至 Hugging Face。H3 的发布标志着国内视频生成模型在架构和许可上的重要进展,其全模态能力涵盖视觉、语言和音频处理,一个视觉语言模型仅作为其编码器使用。该模型在公开平台上获得了广泛关注,热度持续上升。

关联讨论 · 5

来源与依据

时间证据
8/3 11:19
收录于 8/3 12:00
交叉线索
5 个独立来源
内容可信度: