AI 对口型视频生成
丢一张照片进来,打上它该说的话,拿回一条会说话的视频——声音跟着一起出来,所以不用先做音频文件。4 到 15 秒,最高 2K,11 种语言。
真实 MiniMax H3 出片 · 按「试这条」载入完整提示词,不是摘要
8s · 16:9 · 768P一张照片,一句话
一张静态照片,
和跟着它一起出来的声音
没有任何东西被画到你的照片上。这张照片成了一个镜头的首帧,镜头里那个人正在说话,而声音在同一次生成里出来——所以你不用先做音频文件。

你的照片
生成出来的——画面与声音一起
4 到 15 秒之间的任意整秒,24 fps,768P 或 2K,11 种我们完整跑过的语言。JPG、PNG、WEBP、HEIC、HEIF 都能直接传,这一点值得说,因为人物照片大多是手机拍的,而大多数工具会不声不响地让你先转格式。手机随手拍常常比精修头像动得更好——修图会把动起来所需要的那层质感抹掉。能选的话让牙齿露出来:闭着的嘴不携带任何关于唇后是什么的信息,模型只能自己编一个口腔,而编出来的口腔正是让人一眼觉得不对的地方。
- 你的照片是第一帧
- 001
- 任意整秒
- 4–15 秒
- 完整跑过的语言
- 11
- 声音来自同一次生成
- 立体声
你的照片是第一帧
任意整秒
完整跑过的语言
声音来自同一次生成
- 不用先做音频文件
- 不用逐帧对时间轴
- 不用单独跑一遍对口型
AI 对口型做对了是什么样
你看到的就是出来的样子——没有放大、没有调色、没有第二遍。旁边印的是产出它的完整提示词,不是摘要。按「试这条」,它直接落进上面那个框,长度和画幅都照原样,你改一句就能看出哪里跟着变。把声音打开:你听到的和那张嘴是同一次生成出来的。
更多写好的提示词 ↗
16:9 · 6s完整提示词,不是摘要
Reference the Hitchcock camera movement from Video 1, have the character in Image 2 sing, with the vocals matching Audio 3.
上面那张照片,和它变成的那六秒
一次生成,一条提示词,就是模型返回的原样
不一定非得是
一张真人照片
16:9 · 15s一个人照片一张参考照片撑过了每一个镜头,包括嘴部特写——对口型能不能在原尺寸下站得住,就看这里。
16:9 · 15s一帧里两个人165 个字符两个人交替开口,而整条提示词只有一句话。说话人标记是在你需要指明谁先开口时才用的;这一条没有用。
16:9 · 15s画出来的角色插画手绘感 2D,嘴和画面其余部分出自同一支笔。整个镜头里没有任何写实的东西。
16:9 · 15s动物角色动物一只猫和一只老鼠,各说一句。这些脸不是人脸,嘴还是落在音节上。
这四条是别人跑的,不是我们跑的——所以它们角上带着 Hailuo 的标,而这一页其他片子没有。那个标就是出处:每一条都由 @SimplyAnnisa、@heydin_ai 和 @ManuAGI01 连同提示词一起公开,四条的每一个字都能在那些链接里读到。
这里没有的,是我们自己没跑过的:真狗真猫的照片,还有油画肖像。两样都不被拦,也都值得试——和这一页对十一种之外的语言持的是同一个立场。没看着它跑回来的东西,我们不写。
怎么给一张照片做对口型,三步
决定结果的是第一步,而把它做对大概要四秒钟。前两张卡是这一页顶上那个生成框正在干活的样子——它接住的文件,打进去的那行台词。第三张是回来的东西。

放一张脸进去
一张照片就行,2 到 15 秒的素材也行。一张脸,看着镜头,嘴上不要有遮挡。iPhone 的 HEIC 直接传,框会把文件读回给你——尺寸、比例、大小——在你花钱之前。
一张脸JPG · PNG · WEBP · HEIC![这一页那个提示词框,里面打好了一行台词——(S1) speaks warmly, [English] I have used this every morning for a month——计数器显示 73 / 7000](/_next/image?url=%2Fmedia%2Ftools%2Fls-ui-prompt.webp&w=1280&q=70)
写他们要说的话
把句子和一个语言标记打进去,声音就跟着一起到——不用先做音频文件。框里那行是 7,000 个字符里的七十三个;其余的都是用来描述镜头的。
7,000 里的 73 个字符不用找配音
音轨 · 32 kHzLIP-SYNC.MP4播一遍,然后改一个词
片子到手时声音已经在文件里了。多数人留下的是第二条或第三条,不是第一条——每一次尝试都存着,所以你是在改,不是从头再来。
4–15s · 最高 2K声音已经封装进去
前两张卡是这一页顶上那个框的截图,不是示意图。你上传的照片一个像素都不会被改——回来的是一个新文件。第三张卡上的片子是 MiniMax 自己的,连同提示词发布在 H3 发布文:静图定了脸,一段人声定了唱,一段影片定了运镜。那次走的是音频路线;上面那个框两条路都收。
大家拿 AI 对口型 来做什么
四个起手处。每一个都会把一条成片背后的完整提示词落进顶上的生成框,长度和画幅都照它出片时的样子。
16:9 · 8s一句话,直接对镜头
整条片子就是一个人和一句话。六秒的话控制在十二个词以内——短时长配长句子,是第一次尝试让人失望的常见原因。
9:16 · 9s给一个场景配一句对白
让角色在你已经想好的镜头里说出这句话。除了台词,也把人描述出来——衣服、头发、一个辨识特征——脸就能在整条片子里稳住。
9:16 · 15s有人在讲一个产品
人物静图加产品静图,台词一个镜头一个镜头地写。这一条跑满十五秒,所以它也是让你看到上限在哪的那一条。
16:9 · 15s唱,而不是说
把语气设成唱,或者上传人声让它带动嘴型。上传的音轨会直接成为成片的声音,而不是拿来做参考,而且上传不计费。片子的长度至少要和音轨一样长。
从一段视频出发,而且原来的像素必须留下来?那是配音,剪贴式的工具做得比这一页好——这里的一切都是把镜头重建出来,不是在原片上改。
你能查验什么,跑一条多少钱,换套餐又改变什么
先把话说在前面:这是一个付费工具。没有声音的对口型不叫对口型,所以这一页跑的是 MiniMax H3,不是那个只出画面的无声引擎,也就没有一条试跑可以给你。不花钱能做的是查验:上面每一条片子都不用账号就能播、能下载,产出它的提示词也在。一次生成从 18 积分起——768P 四秒,模型能出的最短一档。每一次尝试都存着,真正算数的是第二次,因为几乎没有人会留第一条。往上换套餐,买到的是每月更多积分、更长的片子也能上 2K 而不用省着用,以及更低的每秒成本。
两种付法每月积分一样多
- 免费不用绑卡
不用账号出一条,跑的是免费引擎。MiniMax H3 本身是付费的。
$0永久全程不需要信用卡
免费开始只做机器人校验,不要邮箱
1 条,不用账号
Agnes Video V2.0 · 16:9 · 5 秒 · 无声
登录仍然免费,Agnes 引擎每天 3 条,无声$9.9 起的任意积分包都能解锁 MiniMax H3,所有模式,768P 与 2K
- MiniMax H3 原生 2K仅付费
- 声音与画面一起生成仅付费
- 一条,不用账号
- 同时跑 1 个任务
- 失败的片子不花钱
- 生成内容私有
- 任意积分包都能解锁 MiniMax H3 的全部模式
免费档是另一个引擎。看套餐
速度与排队
- 队列
- 免费通道
- 同时任务数
- 1
- 批量
- 1
- 历史保留
- 24 小时 · 登录后 7 天
- 支持
- 社区
- Lite省 33%
解锁 MiniMax H3 原生 2K。最小的付费档,大多数人选的是 Pro。
$9.9/mo$14.9按年扣 $118.8 · 一年省 $60
7 天退款 · 随时取消
每月 1,000 积分 · 约 55 条
4 秒 · 768P · 文生视频
或 4 秒 2K 约 29 条
月付年付,每月积分一样多
- MiniMax H3 原生 2K:音画同生
- 对白、音效与配乐在同一个文件里
- 最长 15 秒15s
- 每月约 55 条 4 秒 768P 文生视频
- 失败的片子不花钱
- 积分未使用可 7 天退款
- 同时跑 1 个任务
- 同一条提示词可批量出 2 个版本
仅限个人与评估用途:商用权利来自 MiniMax
速度与排队
- 队列
- 标准
- 同时任务数
- 1
- 批量
- 2
- 历史保留
- 7 天
- 支持
- 邮件 · 48 小时
- 多数人推荐Pro省 33%
比 Lite 多 $30。每月约 166 条,同样的 MiniMax H3,队列更快。
$29.9/mo$44.9按年扣 $358.8 · 一年省 $180
7 天退款 · 随时取消
每月 3,000 积分 · 约 166 条
4 秒 · 768P · 文生视频
或 4 秒 2K 约 88 条
月付年付,每月积分一样多
- 包含 Lite 的全部
- 每月约 166 条 4 秒 768P 文生视频
- 同时跑 3 个任务3×
- 视频反推提示词
- 同一条提示词可批量出 4 个版本
- 历史保留 7 天
- 积分未使用可 7 天退款
仅限个人与评估用途:商用权利来自 MiniMax
速度与排队
- 队列
- 快速
- 同时任务数
- 3
- 批量
- 4
- 历史保留
- 7 天
- 支持
- 邮件 · 12 小时
- Studio省 33%
一整个月的产量,排队最优先,还有 4 小时内回你的真人。
$99.9/mo$149.9按年扣 $1,198.8 · 一年省 $600
7 天退款 · 随时取消
每月 10,000 积分 · 约 555 条
4 秒 · 768P · 文生视频
或 4 秒 2K 约 294 条
月付年付,每月积分一样多
- 包含 Pro 的全部
- 每月约 555 条 4 秒 768P 文生视频
- 同时跑 8 个任务8×
- 同一条提示词可批量出 4 个版本
- 历史保留 7 天
- 优先支持,4 小时内响应
- 我们能给到的最低积分消耗
- 积分未使用可 7 天退款
仅限个人与评估用途:商用权利来自 MiniMax
速度与排队
- 队列
- 优先,排在最前面
- 同时任务数
- 8
- 批量
- 4
- 历史保留
- 7 天
- 支持
- 优先 · 4 小时
为什么这张嘴
在原分辨率下站得住
其他每一种对口型工具,都是在你的画面里找到嘴,然后把它换掉。这一个从来不去找——而这一个差别,就是那张嘴不像一块补丁的全部原因。
一张和皮肤对不上的嘴
一块分辨率和周围面部不同的补丁,还有一条沿着下颌线、脑袋一转就在爬的接缝。看见过一次就再也看不见别的了——而这从来不是你那张照片的错。
一个 96 像素的方块,贴回去
通行的做法是找到嘴,在它周围裁一个小方块——常见是 96×96——在那个尺寸上生成新的嘴型,再贴回你的画面。方块之外的一切从来没有进过模型。
看一个工具怎么描述自己
把嘴型映射到你视频里的脸上。把它们融合进原图。映射、融合——不管哪个词,都是有东西被盖在一张已经存在的脸上,而下颌线就是它的边界。
一帧新画面,连声音一起,一次出完
MiniMax H3 从来不去找你的嘴,因为它根本不是在编辑你的画面。没有裁剪、没有粘贴、没有边缘要跟:嘴和脸颊是同一个分辨率,因为整张画面只有一个分辨率。声音也出自同一次生成,所以你不会拿到一段激动的配音配一张平淡的脸。
你原来的画面不会留下来。你拿到的是照着它建出来的一条新片子,不是你那条片子换了一张嘴。如果你需要拿回自己的像素——比如一门四十分钟的课程要配西班牙语——那么剪贴式的工具会比这一页更合用。
台词决定的事,
照片决定不了
照片决定这件事能不能成。台词决定你拿到什么、它跑多长、以及它多少钱——而这三件其实是同一个决定。
长度是一份预算
输出是 4 到 15 之间的整数秒。按平常的语速,大概是十到四十个词。先写台词,数一遍,再挑时长——反过来做,就会得到一段追着钟表跑却追不上的表演。
4–15 秒,整秒
有一个标记是承重的
[Language] 选定嘴型所依据的音素集,所以它是那个会改变画面的标记。(S1) 只有在画面里不止一个可能的说话人时才有用——面对一张脸,它不会改变任何你看得见的东西。
(S1) … [English] …
字符上限不是给台词用的
7,000 个字符覆盖的是整条提示词。一句台词是几十个字符;剩下的都是镜头——谁、在哪、怎么打光、怎么取景。写不下是描述的问题,从来不是对白的问题。
7,000 个字符
秒数就是账单
768P 每输出秒 $0.08,2K 每秒 $0.13。台词定长度,长度定账单,所以一条十五秒的片子差不多是四秒那条的四倍。值得听的台词大多都短。
$0.08 / 秒 · 768P
这些都不是对模型的猜测——时长和字符上限都是公开的限制,每秒价格就是价格页上那些。想让人替你把镜头描述好?提示词生成器会把剩下的 6,900 个字符写出来。
你可以用谁的脸
你自己的、你拿到许可的,或者因为是你生成的所以不属于任何人的。
- 人脸让一个真人看起来说了他没说过的话,H3 许可证禁止——公众人物不行,陌生人的照片也不行。
- 声音上传的音轨如果克隆的是某个特定的人的声音,那它必须是你自己的、拿到授权的,或者合成的。
- 举报举报入口在每一页、每一条结果上都有。反复出现的账号会被关掉。
- 未成年人绝不要上传含未成年人的照片或片子。
- 你的上传不用于训练任何东西。你随时可以删掉它们,也可以删掉账号。
- 商用权利每个套餐(含付费档)都可以个人使用与评估使用。商用权利要直接从 MiniMax 拿,走 Hailuo 或官方 API。这是摘要,不是法律意见。
AI 对口型常见问题
跑第一条台词之前该知道的事
这个 AI 对口型工具免费吗?
怎么少花钱地试一试?
我需要音频文件吗?
成片自带声音吗?
我已经有一条视频,能拿来做对口型吗?
片子最长能到多少?
哪些语言能用?
我以前用的那个工具,为什么嘴是糊的?
出来还会像我照片里的人吗?
该用什么样的照片?
如果我的音频比片子长怎么办?
它能唱而不是说吗?
能出 2K 吗?
我需要账号吗?
我的成品会带水印吗?
我按下「生成」之后会发生什么?
这些片子能商用吗?
支持哪些照片格式和尺寸?
照片里可以有不止一个人吗?
台词最长能多长?
由 MiniMax H3 AI Video Generator 编辑团队撰写与维护发布于 最后更新
