AI リップシンク動画生成

写真を 1 枚置いて、何を話すかを打ち込むと、話す動画が返ってきます。声も一緒に出るので、音声ファイルを先に作る必要はありません。4〜15 秒、最大 2K、11 言語。

写真から

画像を作る

JPG ・PNG ・WEBP ・HEIC ・30MB 以下 ・顔は 1 つ

0 / 7000

話し手は最後まで同じ顔・髪・服・色を保ちます。変わるのはカメラと、書かれた動きだけです。

無料登録 · MiniMax H3 を 1 本

This run spends credits — the free clip is 4s · 768P · 16:9.

Sign up free and your first MiniMax H3 clip renders 4s · 768P · 16:9, with sound. A plan raises the ceiling to 15s, 2K and four at a time — the free clip is a size, not a different model.

このページの動画は、どれもアカウントなしで再生もダウンロードもできます。自分のセリフを回すぶんは出力秒あたりの請求です。768P の 4 秒という下限が 18 クレジットです。

MiniMax H3 の実出力 ・「これを試す」でプロンプト全文を読み込みます(要約ではありません)

ヘッドホンをつけたポッドキャストの司会者が、卓上マイクの前で笑いながらセリフを言う。MiniMax H3 のリップシンク8s · 16:9 · 768P

写真 1 枚と 1 文

あなたの写真に起きること

静止した写真 1 枚と、それと一緒に出てくる声

写真の上に何かを描き足すわけではありません。その写真が、その人が話しているショットの最初のフレームになり、声は同じパスから生成されます。だから音声ファイルを先に作る必要がないのです。

入力した写真:路上のカフェ席で、エスプレッソのカップに目を落とし、話していない女性

あなたの写真

生成されたもの — 映像と音が一緒に

24 fps で 4 から 15 までの任意の整数秒、768P または 2K、通しで確認した 11 言語。JPG・PNG・WEBP・HEIC・HEIF はそのまま入ります。人物の写真はたいていスマホの写真で、たいていのツールは黙って変換を求めてくるので、これは言っておく価値があります。磨き上げた宣材写真より、スマホのスナップのほうがよく動くことが多い——レタッチは、動きに必要な質感を消してしまうからです。選べるなら歯が見えているものを:閉じた口は唇の奥の情報を持たないので、モデルは口の中を作り出します。その作り出された口の中こそが、結果を「なんか違う」と感じさせる正体です。

写真が最初のフレーム
001

写真が最初のフレーム

任意の整数秒
4〜15 秒

任意の整数秒

通しで確認した言語
11

通しで確認した言語

同じパスから出る音
ステレオ

同じパスから出る音

  • 音声ファイルを先に作らなくていい
  • フレームごとのタイミング合わせがいらない
  • リップシンクの工程を別に回さなくていい

仕上がった 1 本

AI リップシンクがうまくいったときの見え方

見えているものが、そのまま出てきたものです。高解像度化も色調整も二度目のパスもありません。隣に印刷してあるのは、それを作ったプロンプトの全文で、要約ではありません。「これを試す」を押せば、上のボックスにそのまま入ります。長さもアスペクト比も作られたときのままなので、1 行変えて何が動くかを見られます。音を出してください。聞こえている声は、話している口と同じパスから出たものです。

作例プロンプトをもっと ↗
上の写真の女性が、いまはカメラを向き、言葉の途中で口を開けている。後ろにあるのは同じテーブル、同じ通り16:9 · 6s

プロンプト全文、要約ではありません

Reference the Hitchcock camera movement from Video 1, have the character in Image 2 sing, with the vocals matching Audio 3.

6s · 16:9

上の写真と、それが変わった 6 秒

1 回の生成、1 つのプロンプト、モデルが返したそのまま

口を開けられるもの

人の写真である必要はありません

  • 照明のついたドレッサーの鏡の前で、リップオイルを持った女性がカメラに話しかける。どのカットでも顔は参照した写真に保たれている16:9 · 15s
    1 人写真参照した 1 枚の写真が、口元のアップも含めてすべてのショットで保たれています。リップシンクが原寸で通用するかどうかは、まさにそこで決まります。
  • リビングで言い争う男女。カメラは手持ちで、二人が交互に 1 行ずつ話す16:9 · 15s
    1 フレームに 2 人165 文字二人が交互に話し、それでいてプロンプト全体は 1 文でした。話し手タグは、どちらが先に話すかを指定したいときのためのもので、この回では使っていません。
  • 麦わら帽子の女の子が、温室の中で花冠をかぶった小さな雨雲と話している。どちらも絵画的な 2D16:9 · 15s
    描かれたキャラクターイラスト絵画的な 2D で、口も画面のほかの部分と同じ筆で描かれています。ショットのどこにも写実的な要素はありません。
  • 中折れ帽の黒猫と水玉のワンピースを着たねずみが、夕暮れの公園のベンチで話し合っている16:9 · 15s
    動物のキャラクター動物猫とねずみが 1 行ずつ話します。人間の顔ではないのに、口はちゃんと音節に乗っています。

この 4 本は他の人が回したもので、私たちのものではありません——だから隅に Hailuo のマークが入っていて、このページの他の動画には入っていません。あのマークは出どころの証明です。4 本ともプロンプトつきで @SimplyAnnisa@heydin_ai@ManuAGI01 が公開しており、4 本すべての一字一句をそのリンクで読めます。

ここにないのは、私たちがまだ回していないものです。本物の犬や猫の写真と、描かれた肖像画。どちらも禁止されてはいませんし、試す価値もあります——確認済みの 11 言語より先の言語について、このページが取っているのと同じ立場です。返ってくるのを自分で見ていないことは、書きません。

手順のすべて

写真をリップシンクさせる 3 つの手順

結果を決めるのは最初の手順で、正しくやるのに 4 秒ほどしかかかりません。前の 2 枚のカードは、このページの上にある生成ボックスの作業中の姿です——受け取ったファイルと、そこに打ち込まれた 1 行。3 枚目が返ってきたものです。

  1. このページの生成ボックスのアップロード行。写真が受理された状態で、カフェ席の女性のサムネイル、ファイル名 ref-espresso.webp、そして 1280×724 · 1.77:1 · 62 KB と読める緑のチェック

    顔を 1 つ入れる

    写真でもいいですし、2 秒から 15 秒の素材でもかまいません。顔は 1 つ、カメラを見ていて、口に何もかかっていないこと。iPhone の HEIC はそのまま入り、ボックスはファイルの中身を読み返してくれます——寸法、比率、容量——お金を使う前に。

    顔は 1 つJPG ・PNG ・WEBP ・HEIC
  2. このページのプロンプトボックスに 1 行が打ち込まれた状態 — (S1) speaks warmly, [English] I have used this every morning for a month — カウンターは 73 / 7000 と表示

    話す内容を書く

    文と言語タグを打ち込めば、声も一緒に届きます——音声ファイルを先に作る必要はありません。ボックスの中の 1 行は、与えられた 7,000 文字のうちの 73 文字。残りはすべてショットを描写するためのものです。

    7,000 のうち 73 文字声を選ぶ手間なし
  3. 仕上がった動画。音声はすでにファイルの中
    音声トラック · 32 kHzLIP-SYNC.MP4

    再生して、1 語だけ変える

    動画は、音がすでにファイルに入った状態で届きます。多くの人が残すのは 1 本目ではなく 2 本目か 3 本目です——どの試行も保存されるので、やり直すのではなく手直しになります。

    4〜15s · 最大 2K音はすでに多重化済み

前の 2 枚は、このページの上にあるボックスのスクリーンショットで、描いた図ではありません。アップロードした写真は決して書き換えられません——返ってくるのは新しいファイルです。3 枚目のカードの動画は MiniMax 自身のもので、プロンプトつきで H3 の発表記事 に公開されています。静止画が顔を、ボーカルトラックが歌を、映画のクリップがカメラの動きを決めました。あの回は音声のルートを通りましたが、上のボックスはどちらのルートも受け付けます。

使い道

みんなが AI リップシンク を使う場面

始めやすい 4 つの入口。どれも、仕上がった動画の裏にあるプロンプト全文を、作られたときの長さとアスペクト比のまま上の生成ボックスに入れます。

  • 卓上マイクの前で笑いながら 1 行を言うポッドキャストの司会者。MiniMax H3 のリップシンク
    16:9 · 8s

    カメラに向かって 1 行

    動画まるごとが 1 人と 1 文です。6 秒なら 12 語くらいまでに抑えてください——短い尺に長い文を入れるのが、最初の 1 本でがっかりするいちばんの原因です。

  • 暗い城の室内で張りつめたやり取りをする 2 人のキャラクター。場面を通して二人の人物像が保たれる
    9:16 · 9s

    場面に 1 行のセリフを

    すでに頭の中にあるショットで、キャラクターにその 1 行を言わせます。言葉だけでなく人物も描写してください——服、髪、目立つ特徴を 1 つ——そうすれば顔は動画のあいだ動きません。

  • パン屋の前で、手に持った巨大なクロワッサンについてカメラに話す女性。リップシンクは 5 つのショットを通して保たれている
    9:16 · 15s

    商品について話す人

    人物の静止画に商品の静止画を足し、セリフはショットごとに書きます。これは 15 秒をフルに使う 1 本なので、上限がどこにあるかも見えます。

  • 青いスタジオでラップに合わせて口を動かす女性。顔は参照した静止画に固定されている
    16:9 · 15s

    話すのではなく歌う

    トーンを「歌う」に設定するか、ボーカルをアップロードして口を動かさせてください。アップロードしたトラックは参照ではなく完成音声そのものになり、アップロードに請求はありません。動画の尺は、少なくともトラックと同じ長さにしてください。

動画から始めて、元のピクセルがそのまま残らないと困る? それは吹き替えで、切り貼り式のツールのほうがこのページより得意です——ここでのすべては、元の映像を編集するのではなくショットを作り直しています。

言語

11 言語と、それを動かすセリフの書式

通しで確認したのは 11 言語です。どの言語でも、口はその言語自身の音から形づくられ、英語による近似からではありません。話すセリフはその言語で書けば言い方が決まりますし、英語で書いて言語タグを付けただけでは決まりません。セリフの書き方 に書式があります。

リップシンクで確認済み 11 言語

11

  • アラビア語
  • 中国語
  • 英語
  • フランス語
  • ドイツ語
  • イタリア語
  • 日本語
  • 韓国語
  • ポルトガル語
  • ロシア語
  • スペイン語

目安として、Google 自身の Veo 3.1 のドキュメントには、英語は完全対応で他の言語は評価していないと書かれています。何本かの動画で同じ顔や同じ声を保ちたいときは 参照素材から動画 をお使いください。

1 本いくらか

確かめられること、1 本の費用、プランで変わること

先にお伝えします。これは有料のツールです。音のないリップシンクはリップシンクではないので、このページが回すのは映像だけの無音エンジンではなく MiniMax H3 で、お試しの 1 回をお渡しすることはできません。お金を使わずにできるのは、仕事を確かめることです。上の動画はどれもアカウントなしで再生もダウンロードもでき、それを作ったプロンプトも付いています。1 回の生成は 18 クレジットから——768P の 4 秒、モデルが作れるいちばん短い尺です。どの試行も保存され、意味を持つのは 2 本目です。1 本目を残す人はほとんどいないからです。プランを上げると、毎月のクレジットが増え、長い動画でも節約せずに 2K が使え、仕上がり 1 秒あたりの費用が下がります。

請求のしかた

請求の単位
出力秒
生成の失敗
返還されます
アップロードした音声
請求なし
このページの動画
再生可 · アカウント不要

料金の全体像

毎月のクレジットはどちらでも同じ

  • 無料カード不要

    アカウントなしで 1 本、無料エンジンで。MiniMax H3 自体は有料です。

    $0ずっと

    クレジットカードは一度も要りません

    無料で開始

    ボット確認だけ — メール不要

    1 本、アカウント不要

    Agnes Video V2.0 · 16:9 · 5 秒 · 無音
    無料でログイン — Agnes で 1 日 3 本、無音

    $9.9 からのどのパックでも MiniMax H3 が解放されます — 全モード、768P と 2K

    • ネイティブ 2K の H3有料のみ
    • 映像と一緒のネイティブ音声有料のみ
    • 1 本、アカウント不要
    • 同時 1 本
    • 失敗した分は無料
    • 非公開で生成
    • どのパックでも全モードで H3 が解放

    無料枠は別のエンジンです。プランを見る

    速度と順番待ち

    順番待ち
    無料レーン
    同時実行
    1
    まとめ生成
    1
    履歴の保存
    24 時間 · ログイン時は 7 日
    サポート
    コミュニティ
  • Lite33% お得

    ネイティブ 2K の MiniMax H3 を解放。いちばん小さい有料プランです — 多くの人が選ぶのは Pro です。

    $9.9/mo$14.9

    年額 $118.8 · 年間 $60 お得

    7 日返金 · いつでも解約

    毎月 1,000 クレジット · 約 55 本

    4 秒 · 768P · テキストから動画

    4 秒 2K なら約 29 本

    月払いでも年払いでもクレジットは同じ

    • ネイティブ 2K の H3 — ネイティブ音声つき
    • セリフ・効果音・音楽が同じファイルに
    • 最長 15 秒15 秒
    • 4 秒 768P のテキストから動画で毎月約 55 本
    • 失敗した分は無料
    • クレジット未使用なら 7 日返金
    • 同時実行 1 本
    • 1 つのプロンプトから 2 通り

    個人利用・評価目的 — 商用権は MiniMax から

    速度と順番待ち

    順番待ち
    標準
    同時実行
    1
    まとめ生成
    2
    履歴の保存
    7 日間
    サポート
    メール · 48 時間
  • 多くの人が選ぶ
    Pro33% お得

    Lite より $30 高いだけ。毎月およそ 125 本、同じ MiniMax H3、順番待ちも速い。

    $29.9/mo$44.9

    年額 $358.8 · 年間 $180 お得

    7 日返金 · いつでも解約

    毎月 3,000 クレジット · 約 166 本

    4 秒 · 768P · テキストから動画

    4 秒 2K なら約 88 本

    月払いでも年払いでもクレジットは同じ

    • Lite の全部に加えて
    • 4 秒 768P のテキストから動画で毎月約 166 本
    • 同時 3 本
    • 動画→プロンプト
    • 1 つのプロンプトから 4 通り
    • 履歴は 7 日間保存
    • クレジット未使用なら 7 日返金

    個人利用・評価目的 — 商用権は MiniMax から

    速度と順番待ち

    順番待ち
    高速
    同時実行
    3
    まとめ生成
    4
    履歴の保存
    7 日間
    サポート
    メール · 12 時間
  • Studio33% お得

    ひと月ぶんの本数、順番待ちの先頭、そして 4 時間以内に人が返します。

    $99.9/mo$149.9

    年額 $1,198.8 · 年間 $600 お得

    7 日返金 · いつでも解約

    毎月 10,000 クレジット · 約 555 本

    4 秒 · 768P · テキストから動画

    4 秒 2K なら約 294 本

    月払いでも年払いでもクレジットは同じ

    • Pro の全部に加えて
    • 4 秒 768P のテキストから動画で毎月約 555 本
    • 同時 8 本
    • 1 つのプロンプトから 4 通り
    • 履歴は 7 日間保存
    • 4 時間以内の優先サポート
    • 当サイトで最も安い消費レート
    • クレジット未使用なら 7 日返金

    個人利用・評価目的 — 商用権は MiniMax から

    速度と順番待ち

    順番待ち
    優先 — 順番待ちの先頭
    同時実行
    8
    まとめ生成
    4
    履歴の保存
    7 日間
    サポート
    優先 · 4 時間

作られ方

口元が原寸でも崩れない理由

ほかのリップシンクツールはどれも、あなたの写真の中から口を見つけて置き換えます。これはそもそも探しません——その一点の違いが、口がパッチに見えない理由のすべてです。

  • 兆候

    肌と合っていない口

    まわりの顔とは解像度の違うパッチと、頭が動くたびに這う顎のラインの線。一度気づくともう見えないふりはできません——そしてそれは、あなたの写真のせいだったことは一度もありません。

  • 原因

    96 ピクセルの正方形を貼り戻す

    よくある方法は、口を見つけてそのまわりを小さな正方形——多くは 96 × 96——で切り抜き、そのサイズで新しい口の形を生成して、あなたのコマに貼り戻します。正方形の外側は、一度もモデルを通っていません。

  • 先に見分ける

    ツールが自分を説明する動詞を読む

    動画の顔に口の形をマッピングします。元の画像にブレンドします。マッピング、ブレンド——どちらにしても、すでにそこにある顔の上に何かが重ねられていて、顎のラインがその境目です。

  • ここで起きること

    音も含めた新しいコマが、1 回のパスで

    MiniMax H3 はあなたの口を探しません。あなたのコマを編集していないからです。切り抜きも貼り付けも、追いかける境目もありません。口が頬と同じ解像度を持つのは、絵の中に解像度が 1 つしかないからです。声も同じパスから出るので、平坦な顔に興奮した音声がかぶることがありません。

アップロード前のトレードオフ

元の映像は残りません。返ってくるのは、それをもとに作られた新しい動画であって、あなたの動画に新しい口が付いたものではありません。自分のピクセルを取り戻す必要があるなら——たとえば 40 分の講座にスペイン語の音声を付けたい場合——切り貼り式のツールのほうがこのページより役に立ちます。

セリフ

写真では決められないことを、セリフが決める

そもそも成立するかどうかは写真が決めます。何が返ってくるか、何秒になるか、いくらかかるかはセリフが決めます——そしてこの 3 つは同じ 1 つの決定です。

  1. 01長さは予算です

    出力は 4 から 15 までの整数秒です。ふつうの話す速さなら、だいたい 10 語から 40 語。先にセリフを書き、数えてから尺を選んでください——逆の順番でやると、追いつけない時計と競走する話し方になります。

    4〜15 秒、整数秒

  2. 02効いているタグは 1 つ

    [Language] は口の形のもとになる音素セットを選ぶので、映像を変えるのはこのタグです。(S1) が意味を持つのは、画面に話し手の候補が 2 人以上いるときだけです——顔が 1 つなら、目に見える変化は起こりません。

    (S1) … [Japanese] …

  3. 03文字数の上限はセリフのためのものではありません

    7,000 文字はプロンプト全体の上限です。話すセリフは数十文字で、残りはすべてショット——誰が、どこで、どんな光で、どんな画角で。書ききれないのは描写の問題であって、セリフの問題ではありません。

    7,000 文字

  4. 04秒数が請求書です

    768P は出力 1 秒あたり $0.08、2K は $0.13。セリフが長さを決め、長さが請求額を決めるので、15 秒のテイクは 4 秒のものの 4 倍近くかかります。聞く価値のあるセリフは、たいてい短いものです。

    $0.08 / 秒 · 768P

ここに書いたことはモデルについての推測ではありません——尺と文字数の上限は公開されている制限ですし、秒あたりの価格は 料金ページ にあるものです。ショットの描写を任せたいときは、プロンプト生成 が残りの 6,900 文字を書きます。

責任ある利用

誰の顔なら使えるか

自分の顔、許可を得た顔、または生成したもので誰のものでもない顔です。

  • 実在の人物が言っていないことを言ったように見せることは、H3 のライセンスで禁じられています——著名人も、見知らぬ人の写真も同じです。
  • 特定の人物の声を再現するトラックをアップロードする場合、それは自分の声か、許諾を得たものか、合成されたものでなければなりません。
  • 通報通報リンクはすべてのページと、すべての結果に付いています。繰り返すアカウントは停止されます。
  • 未成年未成年が写っている写真や動画は、決してアップロードしないでください。
  • アップロード学習には一切使いません。いつでも削除できますし、アカウントごと消すこともできます。
  • 商用利用の権利個人利用と評価目的の利用は、有料を含むすべてのプランで可能です。商用利用の権利は MiniMax から直接、Hailuo または公式 API を通じて取得します。これは要約であり、法的助言ではありません。

全文:責任ある利用

実際によく聞かれること

AI リップシンクのよくある質問

最初の 1 行を回す前に知っておきたいこと

この AI リップシンクは無料で使えますか?

いいえ、1 本回すのは有料です。音のないリップシンクはリップシンクではないので、このページが回すのは映像だけの無音エンジンではなく MiniMax H3 で、1 回の生成は 18 クレジットから、768P の 4 秒です。アカウントが要らないのは証拠のほうです——ここにある仕上がりと、その裏にあるプロンプト全文は、そのまま再生もダウンロードもできます。

あまりお金をかけずに試すには?

まず 4 秒を回してください。請求は出力秒あたりなので、顔が保たれるか、口が合うかを見るのにいちばん安いのが最短のテイクです——15 秒フルの 62 クレジットに対して 18 クレジット。4 秒で写真とセリフを詰めてから、本当に欲しい尺を選んでください。

音声ファイルは必要ですか?

いいえ、そこがこの分野の多くのツールとの一番の違いです。セリフを打ち、言語を選べば、声は口と一緒に生成されます。すでに録音や曲があるなら、それをアップロードすれば完成音声のほうになります。

動画に音は付いてきますか?

はい——32 kHz ステレオで、映像と同じパスで作られ、1 つの MP4 の中に入っています。音声だけの別工程はありませんし、多重化する作業もありません。

手元にある動画をリップシンクできますか?

できます。ただし先に 1 つだけ。H3 はあなたのコマに口を描き直すのではなく、ショットを生成し直します。あなたの素材は結果を導きますが、結果の中には残りません。ですから、同じ着想の新しいテイクが欲しいときにはこのページが正解で、元のピクセルそのものが目的のときには不正解です——40 分の講座にスペイン語の音声を付けたい、誰にも描き直させられないクライアントの素材、といった場合です。そういうときは、切り貼り式の吹き替えツールのほうが役に立ちます。

動画は何秒まで作れますか?

24 fps で、4 から 15 までの任意の整数秒です。15 秒はモデル側の上限であってプランの制限ではありません——どの段階でも引き上げられません。

どの言語が使えますか?

確認済みは 11 言語です:アラビア語・中国語・英語・フランス語・ドイツ語・イタリア語・日本語・韓国語・ポルトガル語・ロシア語・スペイン語。ほかの言語もたいていは動きますし、止めてもいません。ただ回していないので、対応しているとは言いません。

前に使ったツールで口元がぼやけたのはなぜですか?

ほぼ間違いなく、口のまわりの狭い領域を切り抜き、そのサイズで生成して貼り戻しているからです。1080p のコマでは、そのパッチだけが低解像度のボトルネックを通っているので、頬の横で見ると眠く見えます。あなたの写真が原因ではありません。

写真の人物に似たまま仕上がりますか?

話す内容だけでなく人物も描写したプロンプトなら保たれ、話すことしか書かないと崩れます。正面を向いた素材のほうが目に見えて安定します。画像から動画と同じ法則、同じ対処で、見た目の固定がその一文を書いてくれます。

どんな写真を使えばいいですか?

顔は 1 つ、正面向き、均一な光、口に何もかかっていないこと。選べるなら歯が見えているものを。磨き上げた宣材写真より、スマホのスナップのほうがたいてい上です——レタッチは、動きに必要な質感を消してしまいます。

音声が動画より長い場合はどうなりますか?

動画の尺で切られます。圧縮も早送りもされません。尺は少なくともトラックと同じ長さに設定してください——生成ボックスが両方を突き合わせて、直しますかと聞いてくれます。

話すのではなく歌わせられますか?

はい。トーンを「歌う」に設定するか、ボーカルをアップロードして口を動かさせてください。上限は同じく 15 秒です。

2K で出せますか?

出せます。2K はピクセルを引き伸ばすのではなく、元の文脈から生成し直すので、口元のディテールは補間されるのではなくその工程を生き延びます。

アカウントは必要ですか?

このページで再生やダウンロードをするだけなら要りません。自分で回すには必要で、クレジットも要ります。このページが回すのは有料の MiniMax H3 だからです。試行は保存されるので、2 回目はアップロードし直しではなく手直しになります。

仕上がりに透かしは入りますか?

入りません。ダウンロードできるのは、モデルが出したそのものです。

「生成」を押したあとはどうなりますか?

モデルに送られ、音がすでにファイルに入った MP4 として履歴に戻ってきます。ページで待っている必要はありません——ブラウザが戻ってこなかった回もサーバー側で完了しますし、提供元が取りこぼしたものは失敗として処理され、クレジットは自動的に返ります。

できた動画を商用に使えますか?

個人利用と評価目的の利用は、すべてのプランで可能です。商用の条件は MiniMax から直接、Hailuo または公式 API を通じて取得します。これは要約であり、法的助言ではありません。

対応している写真の形式とサイズは?

JPG・JPEG・PNG・WEBP・HEIC・HEIF で、1 ファイル 30 MB まで、辺の長さは 256 から 5,760 ピクセルのあいだ、アスペクト比は 2:5 から 5:2 のあいだです。HEIC と HEIF はそのまま入るので、iPhone で撮った写真を先に変換する必要はありません。これは 公開されている制限 で、アップロードのボックスがお金を使う前にファイルを突き合わせます。

写真に 2 人以上写っていてもいいですか?

はい、1 行で扱えます。画面に顔が 2 つあると、指定しないかぎりモデルが話し手を選ぶので、タグを付けてください:(S1) asks, [English] Did you send it? (S2) replies firmly, [English] Two hours ago. 顔が 1 つなら、このタグで目に見える変化は起きません。だからこそ、必要になったときにだけ知っていれば十分なのです。

セリフはどのくらい長くできますか?

7,000 文字はプロンプト全体の上限で、話すセリフは数十文字——残りはすべてショットです。本当の上限は時計のほうで、4 秒から 15 秒はふつうの話す速さでだいたい 10 語から 40 語。先にセリフを書き、数えてから尺を選んでください。書ききれないのは描写の問題であって、セリフの問題ではありません。

写真 1 枚と、1 文。

入力はそれだけです——そして上にあるものは、ログインしてもしなくても再生できます。

無料で生成 · 順番待ち

MiniMax H3 AI Video Generator 編集部が執筆・更新しています公開 最終更新