IT之家8/3 10:5277精选

MiniMax H3 通用视频模型正式开源,支持多模态上下文与2K分辨率

通用视频模型 MiniMax H3 正式开源,支持多模态上下文、2K 分辨率

阅读原文

推荐理由:AI 创作者和产品孵化者可以直接抄:MiniMax H3 开源了全模态视频生成模型,支持文本、图像、视频、音频混合输入并输出 2K 视频,预训练即具备多模态理解能力,对做多模态 AI 应用或视频生成工具的人来说是现成的技术基座。

IT之家 8 月 3 日消息,MiniMax 正式开源新一代通用视频模型 MiniMax H3。该模型是一个全模态生成系统,能统一理解文本、图像、视频和音频构成的多模态上下文,并生成最高 2K 分辨率、最长 15 秒、带原生立体声音频的视频。H3 在预训练阶段已具备广泛的多模态上下文理解与生成能力,可遵循复杂多模态指令。输出规格包括多种宽高比、24 FPS、32 kHz 立体声,稳定支持 11 种语言。模型提供两个版本:H3-Base-FL2VA(首尾帧模式)和 H3-Base-Ref2VA(全模态参考模式),后者支持最多 9 张图像、3 段视频、3 段音频混合输入。完整系统由 H3-Context-IR(上下文处理)、H3-Base(生成768p结果)和 H3-Regenerate-2K(提升至2K分辨率)三模块组成。模型基于 MiniMax H3 Community License 发布,开源地址为 huggingface.co/MiniMaxAI/MiniMax-H3。

关联讨论 · 5

来源与依据

时间证据
8/3 10:52
收录于 8/3 12:00
交叉线索
5 个独立来源
内容可信度: