
7月31日,MiniMax发布新一代多模态生成模型MiniMax H3,并宣布将在近期开放模型权重。与过去分别处理图片、视频和声音的专项模型不同,H3更强调对多模态上下文的统一理解,试图从“完成单项生成任务”进一步转向通用多模态创作。

MiniMax
据CNMO科技了解,MiniMax H3支持文本、图片、音频和视频等多种输入形式,可以直接输出2K分辨率内容,最长生成15秒的音画作品。用户可将不同类型的素材放在同一上下文中,由模型统一理解画面、声音、文字与创作要求,再完成连贯的内容生成或编辑。

MiniMax H3
视频编辑是H3此次展示的重点能力。该模型支持V2V Motion Transfer,即将一段参考视频中的人物动作和运动轨迹迁移到另一段视频中,同时尽量保持主体形象与画面风格。对于广告、品牌和电商内容,H3还强化了指令遵循、文字呈现以及品牌信息还原能力,减少生成内容中经常出现的文字错误和标识变形。

CNMO科技了解到,MiniMax H3在Artificial Analysis音频视频编辑榜单中位列全球第一。随着H3后续开源,高质量音画生成及视频编辑的使用门槛将进一步降低。
红腾网配资提示:文章来自网络,不代表本站观点。