细致的场景指导
在提示词中指定角色、动作、镜头顺序、运镜、对白、音乐和音效。
MiniMax H3 · Hailuo 03 多模态视频
从文字创建视频,让首帧和可选尾帧动起来,或组合图片、视频与音频参考。生成带原生声音的 4–15 秒 768P 或 2K 视频。
输出
视频会显示在这里
选择 MiniMax H3 模式,填写提示词和所需参考素材后提交任务。
模型介绍
MiniMax H3 又称 Hailuo 03,是能在同一创作语境中理解文字、图片、视频和音频的多模态视频模型。
它支持文生视频、首尾帧图生视频和多模态参考生成,可输出 4–15 秒的 768P 或 2K 视频。
FramePack 会异步提交并跟踪任务,再将完成的视频保存到私有存储供预览和下载。
统一视听创作
从提示词或混合参考素材生成带同步声音的完整视频。
在提示词中指定角色、动作、镜头顺序、运镜、对白、音乐和音效。
使用首尾帧,或组合多张图片、视频和音频参考。
选择 4–15 秒时长、合适画幅和符合最终用途的分辨率。
渲染期间跟踪任务,完成后预览或下载私有保存的结果。
三个关键步骤
选择工作流、明确指导每项输入,然后查看完成片段。
从文字、首帧与可选尾帧,或一组多模态参考素材开始。
写提示词、说明每个参考的用途,再设置时长、分辨率和画幅。
提交异步任务、跟踪状态,并在完成后下载保存的视频。
结构清晰的指令有助于画面与声音在整个片段中保持连贯。
常见问题
它可以根据文字、首尾帧或图片、视频、音频组合参考,生成 4–15 秒的 768P 或 2K 视听片段。
图生视频支持 1–2 张图片;参考模式支持最多 9 张图片、3 个 MP4/MOV 视频和 3 个 MP3/WAV 音频。
会。模型支持原生立体声,参考模式还可以用上传音频指导人声、音乐或音效。
生成成功后,FramePack 会私有保存视频,并提供需要登录访问的预览和下载链接。
组合清晰的提示词和用途明确的参考素材,使用 MiniMax H3 生成视频。
使用 MiniMax H3 创建