AI リップシンク動画生成
写真を 1 枚置いて、何を話すかを打ち込むと、話す動画が返ってきます。声も一緒に出るので、音声ファイルを先に作る必要はありません。4〜15 秒、最大 2K、11 言語。
MiniMax H3 の実出力 ・「これを試す」でプロンプト全文を読み込みます(要約ではありません)
8s · 16:9 · 768P写真 1 枚と 1 文
静止した写真 1 枚と、
それと一緒に出てくる声
写真の上に何かを描き足すわけではありません。その写真が、その人が話しているショットの最初のフレームになり、声は同じパスから生成されます。だから音声ファイルを先に作る必要がないのです。

あなたの写真
生成されたもの — 映像と音が一緒に
24 fps で 4 から 15 までの任意の整数秒、768P または 2K、通しで確認した 11 言語。JPG・PNG・WEBP・HEIC・HEIF はそのまま入ります。人物の写真はたいていスマホの写真で、たいていのツールは黙って変換を求めてくるので、これは言っておく価値があります。磨き上げた宣材写真より、スマホのスナップのほうがよく動くことが多い——レタッチは、動きに必要な質感を消してしまうからです。選べるなら歯が見えているものを:閉じた口は唇の奥の情報を持たないので、モデルは口の中を作り出します。その作り出された口の中こそが、結果を「なんか違う」と感じさせる正体です。
- 写真が最初のフレーム
- 001
- 任意の整数秒
- 4〜15 秒
- 通しで確認した言語
- 11
- 同じパスから出る音
- ステレオ
写真が最初のフレーム
任意の整数秒
通しで確認した言語
同じパスから出る音
- 音声ファイルを先に作らなくていい
- フレームごとのタイミング合わせがいらない
- リップシンクの工程を別に回さなくていい
AI リップシンクがうまくいったときの見え方
見えているものが、そのまま出てきたものです。高解像度化も色調整も二度目のパスもありません。隣に印刷してあるのは、それを作ったプロンプトの全文で、要約ではありません。「これを試す」を押せば、上のボックスにそのまま入ります。長さもアスペクト比も作られたときのままなので、1 行変えて何が動くかを見られます。音を出してください。聞こえている声は、話している口と同じパスから出たものです。
作例プロンプトをもっと ↗
16:9 · 6sプロンプト全文、要約ではありません
Reference the Hitchcock camera movement from Video 1, have the character in Image 2 sing, with the vocals matching Audio 3.
上の写真と、それが変わった 6 秒
1 回の生成、1 つのプロンプト、モデルが返したそのまま
人の写真である
必要はありません
16:9 · 15s1 人写真参照した 1 枚の写真が、口元のアップも含めてすべてのショットで保たれています。リップシンクが原寸で通用するかどうかは、まさにそこで決まります。
16:9 · 15s1 フレームに 2 人165 文字二人が交互に話し、それでいてプロンプト全体は 1 文でした。話し手タグは、どちらが先に話すかを指定したいときのためのもので、この回では使っていません。
16:9 · 15s描かれたキャラクターイラスト絵画的な 2D で、口も画面のほかの部分と同じ筆で描かれています。ショットのどこにも写実的な要素はありません。
16:9 · 15s動物のキャラクター動物猫とねずみが 1 行ずつ話します。人間の顔ではないのに、口はちゃんと音節に乗っています。
この 4 本は他の人が回したもので、私たちのものではありません——だから隅に Hailuo のマークが入っていて、このページの他の動画には入っていません。あのマークは出どころの証明です。4 本ともプロンプトつきで @SimplyAnnisa・@heydin_ai・@ManuAGI01 が公開しており、4 本すべての一字一句をそのリンクで読めます。
ここにないのは、私たちがまだ回していないものです。本物の犬や猫の写真と、描かれた肖像画。どちらも禁止されてはいませんし、試す価値もあります——確認済みの 11 言語より先の言語について、このページが取っているのと同じ立場です。返ってくるのを自分で見ていないことは、書きません。
写真をリップシンクさせる 3 つの手順
結果を決めるのは最初の手順で、正しくやるのに 4 秒ほどしかかかりません。前の 2 枚のカードは、このページの上にある生成ボックスの作業中の姿です——受け取ったファイルと、そこに打ち込まれた 1 行。3 枚目が返ってきたものです。

顔を 1 つ入れる
写真でもいいですし、2 秒から 15 秒の素材でもかまいません。顔は 1 つ、カメラを見ていて、口に何もかかっていないこと。iPhone の HEIC はそのまま入り、ボックスはファイルの中身を読み返してくれます——寸法、比率、容量——お金を使う前に。
顔は 1 つJPG ・PNG ・WEBP ・HEIC![このページのプロンプトボックスに 1 行が打ち込まれた状態 — (S1) speaks warmly, [English] I have used this every morning for a month — カウンターは 73 / 7000 と表示](/_next/image?url=%2Fmedia%2Ftools%2Fls-ui-prompt.webp&w=1280&q=70)
話す内容を書く
文と言語タグを打ち込めば、声も一緒に届きます——音声ファイルを先に作る必要はありません。ボックスの中の 1 行は、与えられた 7,000 文字のうちの 73 文字。残りはすべてショットを描写するためのものです。
7,000 のうち 73 文字声を選ぶ手間なし
音声トラック · 32 kHzLIP-SYNC.MP4再生して、1 語だけ変える
動画は、音がすでにファイルに入った状態で届きます。多くの人が残すのは 1 本目ではなく 2 本目か 3 本目です——どの試行も保存されるので、やり直すのではなく手直しになります。
4〜15s · 最大 2K音はすでに多重化済み
前の 2 枚は、このページの上にあるボックスのスクリーンショットで、描いた図ではありません。アップロードした写真は決して書き換えられません——返ってくるのは新しいファイルです。3 枚目のカードの動画は MiniMax 自身のもので、プロンプトつきで H3 の発表記事 に公開されています。静止画が顔を、ボーカルトラックが歌を、映画のクリップがカメラの動きを決めました。あの回は音声のルートを通りましたが、上のボックスはどちらのルートも受け付けます。
みんなが AI リップシンク を使う場面
始めやすい 4 つの入口。どれも、仕上がった動画の裏にあるプロンプト全文を、作られたときの長さとアスペクト比のまま上の生成ボックスに入れます。
16:9 · 8sカメラに向かって 1 行
動画まるごとが 1 人と 1 文です。6 秒なら 12 語くらいまでに抑えてください——短い尺に長い文を入れるのが、最初の 1 本でがっかりするいちばんの原因です。
9:16 · 9s場面に 1 行のセリフを
すでに頭の中にあるショットで、キャラクターにその 1 行を言わせます。言葉だけでなく人物も描写してください——服、髪、目立つ特徴を 1 つ——そうすれば顔は動画のあいだ動きません。
9:16 · 15s商品について話す人
人物の静止画に商品の静止画を足し、セリフはショットごとに書きます。これは 15 秒をフルに使う 1 本なので、上限がどこにあるかも見えます。
16:9 · 15s話すのではなく歌う
トーンを「歌う」に設定するか、ボーカルをアップロードして口を動かさせてください。アップロードしたトラックは参照ではなく完成音声そのものになり、アップロードに請求はありません。動画の尺は、少なくともトラックと同じ長さにしてください。
動画から始めて、元のピクセルがそのまま残らないと困る? それは吹き替えで、切り貼り式のツールのほうがこのページより得意です——ここでのすべては、元の映像を編集するのではなくショットを作り直しています。
11 言語と、それを動かすセリフの書式
通しで確認したのは 11 言語です。どの言語でも、口はその言語自身の音から形づくられ、英語による近似からではありません。話すセリフはその言語で書けば言い方が決まりますし、英語で書いて言語タグを付けただけでは決まりません。セリフの書き方 に書式があります。
リップシンクで確認済み 11 言語
11
- アラビア語
- 中国語
- 英語
- フランス語
- ドイツ語
- イタリア語
- 日本語
- 韓国語
- ポルトガル語
- ロシア語
- スペイン語
目安として、Google 自身の Veo 3.1 のドキュメントには、英語は完全対応で他の言語は評価していないと書かれています。何本かの動画で同じ顔や同じ声を保ちたいときは 参照素材から動画 をお使いください。
確かめられること、1 本の費用、プランで変わること
先にお伝えします。これは有料のツールです。音のないリップシンクはリップシンクではないので、このページが回すのは映像だけの無音エンジンではなく MiniMax H3 で、お試しの 1 回をお渡しすることはできません。お金を使わずにできるのは、仕事を確かめることです。上の動画はどれもアカウントなしで再生もダウンロードもでき、それを作ったプロンプトも付いています。1 回の生成は 18 クレジットから——768P の 4 秒、モデルが作れるいちばん短い尺です。どの試行も保存され、意味を持つのは 2 本目です。1 本目を残す人はほとんどいないからです。プランを上げると、毎月のクレジットが増え、長い動画でも節約せずに 2K が使え、仕上がり 1 秒あたりの費用が下がります。
毎月のクレジットはどちらでも同じ
- 無料カード不要
アカウントなしで 1 本、無料エンジンで。MiniMax H3 自体は有料です。
$0ずっとクレジットカードは一度も要りません
無料で開始ボット確認だけ — メール不要
1 本、アカウント不要
Agnes Video V2.0 · 16:9 · 5 秒 · 無音
無料でログイン — Agnes で 1 日 3 本、無音$9.9 からのどのパックでも MiniMax H3 が解放されます — 全モード、768P と 2K
- ネイティブ 2K の H3有料のみ
- 映像と一緒のネイティブ音声有料のみ
- 1 本、アカウント不要
- 同時 1 本
- 失敗した分は無料
- 非公開で生成
- どのパックでも全モードで H3 が解放
無料枠は別のエンジンです。プランを見る
速度と順番待ち
- 順番待ち
- 無料レーン
- 同時実行
- 1
- まとめ生成
- 1
- 履歴の保存
- 24 時間 · ログイン時は 7 日
- サポート
- コミュニティ
- Lite33% お得
ネイティブ 2K の MiniMax H3 を解放。いちばん小さい有料プランです — 多くの人が選ぶのは Pro です。
$9.9/mo$14.9年額 $118.8 · 年間 $60 お得
7 日返金 · いつでも解約
毎月 1,000 クレジット · 約 55 本
4 秒 · 768P · テキストから動画
4 秒 2K なら約 29 本
月払いでも年払いでもクレジットは同じ
- ネイティブ 2K の H3 — ネイティブ音声つき
- セリフ・効果音・音楽が同じファイルに
- 最長 15 秒15 秒
- 4 秒 768P のテキストから動画で毎月約 55 本
- 失敗した分は無料
- クレジット未使用なら 7 日返金
- 同時実行 1 本
- 1 つのプロンプトから 2 通り
個人利用・評価目的 — 商用権は MiniMax から
速度と順番待ち
- 順番待ち
- 標準
- 同時実行
- 1
- まとめ生成
- 2
- 履歴の保存
- 7 日間
- サポート
- メール · 48 時間
- 多くの人が選ぶPro33% お得
Lite より $30 高いだけ。毎月およそ 125 本、同じ MiniMax H3、順番待ちも速い。
$29.9/mo$44.9年額 $358.8 · 年間 $180 お得
7 日返金 · いつでも解約
毎月 3,000 クレジット · 約 166 本
4 秒 · 768P · テキストから動画
4 秒 2K なら約 88 本
月払いでも年払いでもクレジットは同じ
- Lite の全部に加えて
- 4 秒 768P のテキストから動画で毎月約 166 本
- 同時 3 本3×
- 動画→プロンプト
- 1 つのプロンプトから 4 通り
- 履歴は 7 日間保存
- クレジット未使用なら 7 日返金
個人利用・評価目的 — 商用権は MiniMax から
速度と順番待ち
- 順番待ち
- 高速
- 同時実行
- 3
- まとめ生成
- 4
- 履歴の保存
- 7 日間
- サポート
- メール · 12 時間
- Studio33% お得
ひと月ぶんの本数、順番待ちの先頭、そして 4 時間以内に人が返します。
$99.9/mo$149.9年額 $1,198.8 · 年間 $600 お得
7 日返金 · いつでも解約
毎月 10,000 クレジット · 約 555 本
4 秒 · 768P · テキストから動画
4 秒 2K なら約 294 本
月払いでも年払いでもクレジットは同じ
- Pro の全部に加えて
- 4 秒 768P のテキストから動画で毎月約 555 本
- 同時 8 本8×
- 1 つのプロンプトから 4 通り
- 履歴は 7 日間保存
- 4 時間以内の優先サポート
- 当サイトで最も安い消費レート
- クレジット未使用なら 7 日返金
個人利用・評価目的 — 商用権は MiniMax から
速度と順番待ち
- 順番待ち
- 優先 — 順番待ちの先頭
- 同時実行
- 8
- まとめ生成
- 4
- 履歴の保存
- 7 日間
- サポート
- 優先 · 4 時間
口元が原寸でも
崩れない理由
ほかのリップシンクツールはどれも、あなたの写真の中から口を見つけて置き換えます。これはそもそも探しません——その一点の違いが、口がパッチに見えない理由のすべてです。
肌と合っていない口
まわりの顔とは解像度の違うパッチと、頭が動くたびに這う顎のラインの線。一度気づくともう見えないふりはできません——そしてそれは、あなたの写真のせいだったことは一度もありません。
96 ピクセルの正方形を貼り戻す
よくある方法は、口を見つけてそのまわりを小さな正方形——多くは 96 × 96——で切り抜き、そのサイズで新しい口の形を生成して、あなたのコマに貼り戻します。正方形の外側は、一度もモデルを通っていません。
ツールが自分を説明する動詞を読む
動画の顔に口の形をマッピングします。元の画像にブレンドします。マッピング、ブレンド——どちらにしても、すでにそこにある顔の上に何かが重ねられていて、顎のラインがその境目です。
音も含めた新しいコマが、1 回のパスで
MiniMax H3 はあなたの口を探しません。あなたのコマを編集していないからです。切り抜きも貼り付けも、追いかける境目もありません。口が頬と同じ解像度を持つのは、絵の中に解像度が 1 つしかないからです。声も同じパスから出るので、平坦な顔に興奮した音声がかぶることがありません。
元の映像は残りません。返ってくるのは、それをもとに作られた新しい動画であって、あなたの動画に新しい口が付いたものではありません。自分のピクセルを取り戻す必要があるなら——たとえば 40 分の講座にスペイン語の音声を付けたい場合——切り貼り式のツールのほうがこのページより役に立ちます。
写真では決められないことを、
セリフが決める
そもそも成立するかどうかは写真が決めます。何が返ってくるか、何秒になるか、いくらかかるかはセリフが決めます——そしてこの 3 つは同じ 1 つの決定です。
長さは予算です
出力は 4 から 15 までの整数秒です。ふつうの話す速さなら、だいたい 10 語から 40 語。先にセリフを書き、数えてから尺を選んでください——逆の順番でやると、追いつけない時計と競走する話し方になります。
4〜15 秒、整数秒
効いているタグは 1 つ
[Language] は口の形のもとになる音素セットを選ぶので、映像を変えるのはこのタグです。(S1) が意味を持つのは、画面に話し手の候補が 2 人以上いるときだけです——顔が 1 つなら、目に見える変化は起こりません。
(S1) … [Japanese] …
文字数の上限はセリフのためのものではありません
7,000 文字はプロンプト全体の上限です。話すセリフは数十文字で、残りはすべてショット——誰が、どこで、どんな光で、どんな画角で。書ききれないのは描写の問題であって、セリフの問題ではありません。
7,000 文字
秒数が請求書です
768P は出力 1 秒あたり $0.08、2K は $0.13。セリフが長さを決め、長さが請求額を決めるので、15 秒のテイクは 4 秒のものの 4 倍近くかかります。聞く価値のあるセリフは、たいてい短いものです。
$0.08 / 秒 · 768P
ここに書いたことはモデルについての推測ではありません——尺と文字数の上限は公開されている制限ですし、秒あたりの価格は 料金ページ にあるものです。ショットの描写を任せたいときは、プロンプト生成 が残りの 6,900 文字を書きます。
誰の顔なら使えるか
自分の顔、許可を得た顔、または生成したもので誰のものでもない顔です。
- 顔実在の人物が言っていないことを言ったように見せることは、H3 のライセンスで禁じられています——著名人も、見知らぬ人の写真も同じです。
- 声特定の人物の声を再現するトラックをアップロードする場合、それは自分の声か、許諾を得たものか、合成されたものでなければなりません。
- 通報通報リンクはすべてのページと、すべての結果に付いています。繰り返すアカウントは停止されます。
- 未成年未成年が写っている写真や動画は、決してアップロードしないでください。
- アップロード学習には一切使いません。いつでも削除できますし、アカウントごと消すこともできます。
- 商用利用の権利個人利用と評価目的の利用は、有料を含むすべてのプランで可能です。商用利用の権利は MiniMax から直接、Hailuo または公式 API を通じて取得します。これは要約であり、法的助言ではありません。
AI リップシンクのよくある質問
最初の 1 行を回す前に知っておきたいこと
この AI リップシンクは無料で使えますか?
あまりお金をかけずに試すには?
音声ファイルは必要ですか?
動画に音は付いてきますか?
手元にある動画をリップシンクできますか?
動画は何秒まで作れますか?
どの言語が使えますか?
前に使ったツールで口元がぼやけたのはなぜですか?
写真の人物に似たまま仕上がりますか?
どんな写真を使えばいいですか?
音声が動画より長い場合はどうなりますか?
話すのではなく歌わせられますか?
2K で出せますか?
アカウントは必要ですか?
仕上がりに透かしは入りますか?
「生成」を押したあとはどうなりますか?
できた動画を商用に使えますか?
対応している写真の形式とサイズは?
写真に 2 人以上写っていてもいいですか?
セリフはどのくらい長くできますか?
MiniMax H3 AI Video Generator 編集部が執筆・更新しています公開 最終更新
