AI 对口型视频生成

丢一张照片进来,打上它该说的话,拿回一条会说话的视频——声音跟着一起出来,所以不用先做音频文件。4 到 15 秒,最高 2K,11 种语言。

从一张照片

生成图片

JPG · PNG · WEBP · HEIC · ≤30MB · 一张脸

0 / 7000

说话的人全程保持同一张脸、同样的发型、服装与配色;只有镜头和描述过的动作在变。

免费注册 · 送 1 条 MiniMax H3

This run spends credits — the free clip is 4s · 768P · 16:9.

Sign up free and your first MiniMax H3 clip renders 4s · 768P · 16:9, with sound. A plan raises the ceiling to 15s, 2K and four at a time — the free clip is a size, not a different model.

这一页上的每条片子不用账号就能播、能下载。跑你自己的台词按输出秒计费——18 积分买到 768P 四秒这个底价。

真实 MiniMax H3 出片 · 按「试这条」载入完整提示词,不是摘要

一位戴耳机的播客主持人在桌面话筒前笑着说出她那句台词,MiniMax H3 对口型8s · 16:9 · 768P

一张照片,一句话

你的照片会经历什么

一张静态照片,和跟着它一起出来的声音

没有任何东西被画到你的照片上。这张照片成了一个镜头的首帧,镜头里那个人正在说话,而声音在同一次生成里出来——所以你不用先做音频文件。

输入的那张照片:一位女士坐在街边咖啡座,低头看着一杯 espresso,没有说话

你的照片

生成出来的——画面与声音一起

4 到 15 秒之间的任意整秒,24 fps,768P 或 2K,11 种我们完整跑过的语言。JPG、PNG、WEBP、HEIC、HEIF 都能直接传,这一点值得说,因为人物照片大多是手机拍的,而大多数工具会不声不响地让你先转格式。手机随手拍常常比精修头像动得更好——修图会把动起来所需要的那层质感抹掉。能选的话让牙齿露出来:闭着的嘴不携带任何关于唇后是什么的信息,模型只能自己编一个口腔,而编出来的口腔正是让人一眼觉得不对的地方。

你的照片是第一帧
001

你的照片是第一帧

任意整秒
4–15 秒

任意整秒

完整跑过的语言
11

完整跑过的语言

声音来自同一次生成
立体声

声音来自同一次生成

  • 不用先做音频文件
  • 不用逐帧对时间轴
  • 不用单独跑一遍对口型

这一条成片

AI 对口型做对了是什么样

你看到的就是出来的样子——没有放大、没有调色、没有第二遍。旁边印的是产出它的完整提示词,不是摘要。按「试这条」,它直接落进上面那个框,长度和画幅都照原样,你改一句就能看出哪里跟着变。把声音打开:你听到的和那张嘴是同一次生成出来的。

更多写好的提示词 ↗
上面那张照片里的女士,现在正对镜头,嘴张在半句话上,身后还是同一张桌子、同一条街16:9 · 6s

完整提示词,不是摘要

Reference the Hitchcock camera movement from Video 1, have the character in Image 2 sing, with the vocals matching Audio 3.

6s · 16:9

上面那张照片,和它变成的那六秒

一次生成,一条提示词,就是模型返回的原样

什么能开口说话

不一定非得是一张真人照片

  • 一位女士坐在打了灯的梳妆镜前举着唇油对镜头说话,每一次剪切她的脸都对得上那张参考照片16:9 · 15s
    一个人照片一张参考照片撑过了每一个镜头,包括嘴部特写——对口型能不能在原尺寸下站得住,就看这里。
  • 一男一女在客厅里争吵,手持镜头,两人轮流说一句16:9 · 15s
    一帧里两个人165 个字符两个人交替开口,而整条提示词只有一句话。说话人标记是在你需要指明谁先开口时才用的;这一条没有用。
  • 一个戴草帽的女孩在温室里和一朵戴花冠的小雨云说话,两者都是手绘感 2D16:9 · 15s
    画出来的角色插画手绘感 2D,嘴和画面其余部分出自同一支笔。整个镜头里没有任何写实的东西。
  • 一只戴软呢帽的黑猫和一只穿波点裙的老鼠,在夕照下的公园长椅上交谈16:9 · 15s
    动物角色动物一只猫和一只老鼠,各说一句。这些脸不是人脸,嘴还是落在音节上。

这四条是别人跑的,不是我们跑的——所以它们角上带着 Hailuo 的标,而这一页其他片子没有。那个标就是出处:每一条都由 @SimplyAnnisa@heydin_ai@ManuAGI01 连同提示词一起公开,四条的每一个字都能在那些链接里读到。

这里没有的,是我们自己没跑过的:真狗真猫的照片,还有油画肖像。两样都不被拦,也都值得试——和这一页对十一种之外的语言持的是同一个立场。没看着它跑回来的东西,我们不写。

整个流程

怎么给一张照片做对口型,三步

决定结果的是第一步,而把它做对大概要四秒钟。前两张卡是这一页顶上那个生成框正在干活的样子——它接住的文件,打进去的那行台词。第三张是回来的东西。

  1. 这一页那个生成框的上传行,照片已被接受:街边咖啡座那位女士的缩略图、文件名 ref-espresso.webp,以及一个绿色对勾写着 1280×724 · 1.77:1 · 62 KB

    放一张脸进去

    一张照片就行,2 到 15 秒的素材也行。一张脸,看着镜头,嘴上不要有遮挡。iPhone 的 HEIC 直接传,框会把文件读回给你——尺寸、比例、大小——在你花钱之前。

    一张脸JPG · PNG · WEBP · HEIC
  2. 这一页那个提示词框,里面打好了一行台词——(S1) speaks warmly, [English] I have used this every morning for a month——计数器显示 73 / 7000

    写他们要说的话

    把句子和一个语言标记打进去,声音就跟着一起到——不用先做音频文件。框里那行是 7,000 个字符里的七十三个;其余的都是用来描述镜头的。

    7,000 里的 73 个字符不用找配音
  3. 这条成片,音频已经在文件里面
    音轨 · 32 kHzLIP-SYNC.MP4

    播一遍,然后改一个词

    片子到手时声音已经在文件里了。多数人留下的是第二条或第三条,不是第一条——每一次尝试都存着,所以你是在改,不是从头再来。

    4–15s · 最高 2K声音已经封装进去

前两张卡是这一页顶上那个框的截图,不是示意图。你上传的照片一个像素都不会被改——回来的是一个新文件。第三张卡上的片子是 MiniMax 自己的,连同提示词发布在 H3 发布文:静图定了脸,一段人声定了唱,一段影片定了运镜。那次走的是音频路线;上面那个框两条路都收。

使用场景

大家拿 AI 对口型 来做什么

四个起手处。每一个都会把一条成片背后的完整提示词落进顶上的生成框,长度和画幅都照它出片时的样子。

  • 一位播客主持人在桌面话筒前笑着说出一句台词,MiniMax H3 对口型
    16:9 · 8s

    一句话,直接对镜头

    整条片子就是一个人和一句话。六秒的话控制在十二个词以内——短时长配长句子,是第一次尝试让人失望的常见原因。

  • 两个角色在昏暗的城堡内景里进行一段紧张的交锋,两人的身份贯穿整场都稳住
    9:16 · 9s

    给一个场景配一句对白

    让角色在你已经想好的镜头里说出这句话。除了台词,也把人描述出来——衣服、头发、一个辨识特征——脸就能在整条片子里稳住。

  • 一位女士站在面包店外对镜头讲她手上那个巨大的可颂,对口型跨五个镜头都撑住
    9:16 · 15s

    有人在讲一个产品

    人物静图加产品静图,台词一个镜头一个镜头地写。这一条跑满十五秒,所以它也是让你看到上限在哪的那一条。

  • 一位女士在蓝色影棚里跟着一段说唱对口型,她的脸锁在参考静图上
    16:9 · 15s

    唱,而不是说

    把语气设成唱,或者上传人声让它带动嘴型。上传的音轨会直接成为成片的声音,而不是拿来做参考,而且上传不计费。片子的长度至少要和音轨一样长。

从一段视频出发,而且原来的像素必须留下来?那是配音,剪贴式的工具做得比这一页好——这里的一切都是把镜头重建出来,不是在原片上改。

语言

十一种语言,以及驱动它们的台词格式

十一种我们完整跑过——每一种里,嘴型都是照那门语言自己的发音塑出来的,不是照英语的近似音。把台词用它本来的语言写,表演就落得住;用英语写再挂一个语言标记,就落不住。台词该怎么写里有格式。

对口型实测过十一种

11

  • 阿拉伯语
  • 中文
  • 英语
  • 法语
  • 德语
  • 意大利语
  • 日语
  • 韩语
  • 葡萄牙语
  • 俄语
  • 西班牙语

有个参照:Google 自己给 Veo 3.1 写的文档说,英语完全支持,其他语言未经评估。要在好几条片子里保住同一张脸或同一个声音?用参考生视频

跑一条多少钱

你能查验什么,跑一条多少钱,换套餐又改变什么

先把话说在前面:这是一个付费工具。没有声音的对口型不叫对口型,所以这一页跑的是 MiniMax H3,不是那个只出画面的无声引擎,也就没有一条试跑可以给你。不花钱能做的是查验:上面每一条片子都不用账号就能播、能下载,产出它的提示词也在。一次生成从 18 积分起——768P 四秒,模型能出的最短一档。每一次尝试都存着,真正算数的是第二次,因为几乎没有人会留第一条。往上换套餐,买到的是每月更多积分、更长的片子也能上 2K 而不用省着用,以及更低的每秒成本。

这是怎么计费的

计费依据
输出秒数
生成失败
退回积分
你上传的音频
不计费
这一页上的片子
能播 · 不用账号

完整价格

两种付法每月积分一样多

  • 免费不用绑卡

    不用账号出一条,跑的是免费引擎。MiniMax H3 本身是付费的。

    $0永久

    全程不需要信用卡

    免费开始

    只做机器人校验,不要邮箱

    1 条,不用账号

    Agnes Video V2.0 · 16:9 · 5 秒 · 无声
    登录仍然免费,Agnes 引擎每天 3 条,无声

    $9.9 起的任意积分包都能解锁 MiniMax H3,所有模式,768P 与 2K

    • MiniMax H3 原生 2K仅付费
    • 声音与画面一起生成仅付费
    • 一条,不用账号
    • 同时跑 1 个任务
    • 失败的片子不花钱
    • 生成内容私有
    • 任意积分包都能解锁 MiniMax H3 的全部模式

    免费档是另一个引擎。看套餐

    速度与排队

    队列
    免费通道
    同时任务数
    1
    批量
    1
    历史保留
    24 小时 · 登录后 7 天
    支持
    社区
  • Lite省 33%

    解锁 MiniMax H3 原生 2K。最小的付费档,大多数人选的是 Pro。

    $9.9/mo$14.9

    按年扣 $118.8 · 一年省 $60

    7 天退款 · 随时取消

    每月 1,000 积分 · 约 55 条

    4 秒 · 768P · 文生视频

    或 4 秒 2K 约 29 条

    月付年付,每月积分一样多

    • MiniMax H3 原生 2K:音画同生
    • 对白、音效与配乐在同一个文件里
    • 最长 15 秒15s
    • 每月约 55 条 4 秒 768P 文生视频
    • 失败的片子不花钱
    • 积分未使用可 7 天退款
    • 同时跑 1 个任务
    • 同一条提示词可批量出 2 个版本

    仅限个人与评估用途:商用权利来自 MiniMax

    速度与排队

    队列
    标准
    同时任务数
    1
    批量
    2
    历史保留
    7 天
    支持
    邮件 · 48 小时
  • 多数人推荐
    Pro省 33%

    比 Lite 多 $30。每月约 166 条,同样的 MiniMax H3,队列更快。

    $29.9/mo$44.9

    按年扣 $358.8 · 一年省 $180

    7 天退款 · 随时取消

    每月 3,000 积分 · 约 166 条

    4 秒 · 768P · 文生视频

    或 4 秒 2K 约 88 条

    月付年付,每月积分一样多

    • 包含 Lite 的全部
    • 每月约 166 条 4 秒 768P 文生视频
    • 同时跑 3 个任务
    • 视频反推提示词
    • 同一条提示词可批量出 4 个版本
    • 历史保留 7 天
    • 积分未使用可 7 天退款

    仅限个人与评估用途:商用权利来自 MiniMax

    速度与排队

    队列
    快速
    同时任务数
    3
    批量
    4
    历史保留
    7 天
    支持
    邮件 · 12 小时
  • Studio省 33%

    一整个月的产量,排队最优先,还有 4 小时内回你的真人。

    $99.9/mo$149.9

    按年扣 $1,198.8 · 一年省 $600

    7 天退款 · 随时取消

    每月 10,000 积分 · 约 555 条

    4 秒 · 768P · 文生视频

    或 4 秒 2K 约 294 条

    月付年付,每月积分一样多

    • 包含 Pro 的全部
    • 每月约 555 条 4 秒 768P 文生视频
    • 同时跑 8 个任务
    • 同一条提示词可批量出 4 个版本
    • 历史保留 7 天
    • 优先支持,4 小时内响应
    • 我们能给到的最低积分消耗
    • 积分未使用可 7 天退款

    仅限个人与评估用途:商用权利来自 MiniMax

    速度与排队

    队列
    优先,排在最前面
    同时任务数
    8
    批量
    4
    历史保留
    7 天
    支持
    优先 · 4 小时

它是怎么做出来的

为什么这张嘴在原分辨率下站得住

其他每一种对口型工具,都是在你的画面里找到嘴,然后把它换掉。这一个从来不去找——而这一个差别,就是那张嘴不像一块补丁的全部原因。

  • 破绽

    一张和皮肤对不上的嘴

    一块分辨率和周围面部不同的补丁,还有一条沿着下颌线、脑袋一转就在爬的接缝。看见过一次就再也看不见别的了——而这从来不是你那张照片的错。

  • 成因

    一个 96 像素的方块,贴回去

    通行的做法是找到嘴,在它周围裁一个小方块——常见是 96×96——在那个尺寸上生成新的嘴型,再贴回你的画面。方块之外的一切从来没有进过模型。

  • 怎么提前认出来

    看一个工具怎么描述自己

    把嘴型映射到你视频里的脸上。把它们融合进原图。映射、融合——不管哪个词,都是有东西被盖在一张已经存在的脸上,而下颌线就是它的边界。

  • 这里发生的事

    一帧新画面,连声音一起,一次出完

    MiniMax H3 从来不去找你的嘴,因为它根本不是在编辑你的画面。没有裁剪、没有粘贴、没有边缘要跟:嘴和脸颊是同一个分辨率,因为整张画面只有一个分辨率。声音也出自同一次生成,所以你不会拿到一段激动的配音配一张平淡的脸。

上传之前,先看这笔代价

你原来的画面不会留下来。你拿到的是照着它建出来的一条新片子,不是你那条片子换了一张嘴。如果你需要拿回自己的像素——比如一门四十分钟的课程要配西班牙语——那么剪贴式的工具会比这一页更合用。

台词

台词决定的事,照片决定不了

照片决定这件事能不能成。台词决定你拿到什么、它跑多长、以及它多少钱——而这三件其实是同一个决定。

  1. 01长度是一份预算

    输出是 4 到 15 之间的整数秒。按平常的语速,大概是十到四十个词。先写台词,数一遍,再挑时长——反过来做,就会得到一段追着钟表跑却追不上的表演。

    4–15 秒,整秒

  2. 02有一个标记是承重的

    [Language] 选定嘴型所依据的音素集,所以它是那个会改变画面的标记。(S1) 只有在画面里不止一个可能的说话人时才有用——面对一张脸,它不会改变任何你看得见的东西。

    (S1) … [English] …

  3. 03字符上限不是给台词用的

    7,000 个字符覆盖的是整条提示词。一句台词是几十个字符;剩下的都是镜头——谁、在哪、怎么打光、怎么取景。写不下是描述的问题,从来不是对白的问题。

    7,000 个字符

  4. 04秒数就是账单

    768P 每输出秒 $0.08,2K 每秒 $0.13。台词定长度,长度定账单,所以一条十五秒的片子差不多是四秒那条的四倍。值得听的台词大多都短。

    $0.08 / 秒 · 768P

这些都不是对模型的猜测——时长和字符上限都是公开的限制,每秒价格就是价格页上那些。想让人替你把镜头描述好?提示词生成器会把剩下的 6,900 个字符写出来。

负责任使用

你可以用谁的脸

你自己的、你拿到许可的,或者因为是你生成的所以不属于任何人的。

  • 人脸让一个真人看起来说了他没说过的话,H3 许可证禁止——公众人物不行,陌生人的照片也不行。
  • 声音上传的音轨如果克隆的是某个特定的人的声音,那它必须是你自己的、拿到授权的,或者合成的。
  • 举报举报入口在每一页、每一条结果上都有。反复出现的账号会被关掉。
  • 未成年人绝不要上传含未成年人的照片或片子。
  • 你的上传不用于训练任何东西。你随时可以删掉它们,也可以删掉账号。
  • 商用权利每个套餐(含付费档)都可以个人使用与评估使用。商用权利要直接从 MiniMax 拿,走 Hailuo 或官方 API。这是摘要,不是法律意见。

完整政策:负责任使用

大家真正会问的问题

AI 对口型常见问题

跑第一条台词之前该知道的事

这个 AI 对口型工具免费吗?

不——跑一条是要花钱的。没有声音的对口型不叫对口型,所以这一页跑的是 MiniMax H3,不是那个只出画面的无声引擎,一次生成从 18 积分起:768P 四秒。不需要账号的是证据——这里每一条成片,以及它背后的完整提示词,都原样能播、能下载。

怎么少花钱地试一试?

先跑四秒。计费按输出秒算,所以最短的一条是最便宜的一次查看——看脸稳不稳、嘴落不落得住,18 积分对上跑满十五秒的 62 积分。在四秒上把照片和台词调对,再去挑你真正想要的时长。

我需要音频文件吗?

不需要,这也是它和这一类里多数工具最主要的差别。把台词打进去,选一门语言,声音就和嘴型一起生成。如果你手上已经有录音或歌,那就传上来,它会直接成为成片的声音。

成片自带声音吗?

带——32 kHz 立体声,和画面在同一次生成里做出来,装在同一个 MP4 里。没有单独的音频步骤,也没有什么要封装的。

我已经有一条视频,能拿来做对口型吗?

能,但有一件事要先说清楚:H3 是把镜头重新生成,不是在你的帧上重画嘴。你的素材引导结果,但它不会留在结果里。所以想要同一个想法的一次新表演时,这一页是对的;而当原来的像素本身就是重点时它就不对了——比如一门四十分钟的课程要配西班牙语,或者客户的素材谁都不许重画。那些情况下,剪贴式的配音工具会比我们更合用。

片子最长能到多少?

4 到 15 之间的任意整数秒,24 fps。十五秒是模型的上限,不是套餐的限制——没有哪一档能把它抬高。

哪些语言能用?

实测过十一种:阿拉伯语、中文、英语、法语、德语、意大利语、日语、韩语、葡萄牙语、俄语和西班牙语。其他语言通常也能用,我们没有拦;只是我们没跑过,所以不做承诺。

我以前用的那个工具,为什么嘴是糊的?

几乎可以肯定是因为它在嘴周围裁一小块,在那个尺寸上生成,再贴回去。在一帧 1080p 的画面上,那块补丁是唯一穿过低分辨率瓶颈的部分,所以它挨着脸颊看上去就是软的。这跟你的照片没有关系。

出来还会像我照片里的人吗?

当提示词除了说什么、也把人描述出来时,脸就稳得住;只描述说话内容时就会漂。正面源图明显更稳。和图片生视频是同一条规律、同一个解法,外观锁定会替你把那句话写好。

该用什么样的照片?

一张脸、正面、光线均匀、嘴上没有遮挡,能选的话让牙齿露出来。手机随手拍通常胜过精修头像——修图会把动起来所需要的那层质感抹掉。

如果我的音频比片子长怎么办?

它会按片子的长度被切掉;不会压缩,也不会加速。把时长设成至少和你的音轨一样长——生成框会比对两者,并主动提出替你修正。

它能唱而不是说吗?

能。把语气设成唱,或者上传人声让它带动嘴型。同样是十五秒上限。

能出 2K 吗?

能。2K 是从原始上下文重新生成的,不是把像素放大,所以嘴部细节能撑过这一步,而不是被插值出来。

我需要账号吗?

在这一页播放或下载任何东西都不需要。要跑你自己的就需要,还需要积分,因为这一页跑的是付费的 MiniMax H3。你的每次尝试都存着,所以第二次是在改,不是重新上传。

我的成品会带水印吗?

不带。你下载到的就是模型产出的那一条。

我按下「生成」之后会发生什么?

它会送到模型那边,然后作为一个做好的 MP4 回到你的历史记录里,声音已经在文件中。你不用守在页面上——浏览器再没回来过的那一次生成会在服务端跑完,而供应商弄丢的任何一条都会被判失败并自动退回积分。

这些片子能商用吗?

每个套餐都可以个人使用与评估使用。商用条款要直接从 MiniMax 拿,走 Hailuo 或官方 API。这是摘要,不是法律意见。

支持哪些照片格式和尺寸?

JPG、JPEG、PNG、WEBP、HEIC 和 HEIF,单个文件最大 30 MB,每条边在 256 到 5,760 像素之间,宽高比落在 2:5 与 5:2 之间。HEIC 和 HEIF 直接传,所以 iPhone 拍的照片不用先转格式。这些是公开的限制,上传框会在你花钱之前拿你的文件对一遍。

照片里可以有不止一个人吗?

可以,一行台词就能处理。画面里有两张脸时,你不指名,模型就自己挑一个说话人,所以给它们打上标记:(S1) asks, [English] Did you send it? (S2) replies firmly, [English] Two hours ago. 面对一张脸,这个标记不会改变任何你看得见的东西,所以它只在你真的需要时才值得知道。

台词最长能多长?

7,000 个字符覆盖的是整条提示词,而一句台词是几十个字符——其余都是镜头。真正的上限是钟表:四到十五秒,按平常语速大概是十到四十个词。先写台词,数一遍,再挑时长。写不下是描述的问题,从来不是对白的问题。

一张照片,一句话。

这就是全部输入——而上面的一切,你登不登录都能播。

免费生成 · 排队

MiniMax H3 AI Video Generator 编辑团队撰写与维护发布于 最后更新