MiniMax H3 テキストから動画
見たいものを打ち込んでください。MiniMax H3 のテキストから動画が、4〜15 秒の仕上がった 1 本を返します。画・セリフ・音が 1 本の MP4 に入って、768P か 2K で。素材も編集ソフトも要りません。
実際の映像 13 本 · 「これで試す」で読み込み
11 秒 · 16:9 · 768P4 つの場面、1 人の人物
プロンプト 1 本で何が返ってくるか
MiniMax H3 のテキストから動画
テキストから動画の試みは、たいてい同じ死に方をします。一文だけ書き、モデルが書かなかった部分をすべて埋め、返ってくるのは頭の中にあったものとは似ても似つかないもの。
女性が通りを歩いている。
モデルが埋めた残り
- 時間帯は?
- 服装は?
- カメラの動きは?
- 天気は?
- 音は?
- レンズは?
MiniMax H3 · 16:9 · 768P · 8 秒MiniMax H3 のテキストから動画は、もっと書ける余白——7,000 文字まで——を用意し、4 秒から 15 秒までの任意の整数秒を、24 fps・768P か 2K で、セリフ・効果音・音楽をすでに画と同じファイルに入れて返します。元画像も、絵コンテも、編集ソフトも要りません。
- 書ける文字数
- 7,000
- 任意の整数秒
- 4〜15 秒
- フレームレート
- 24 fps
- 解像度
- 768P / 2K
- 画・セリフ・効果音・音楽
- MP4 1 本
書ける文字数
任意の整数秒
フレームレート
解像度
画・セリフ・効果音・音楽
- 元画像なし
- 絵コンテなし
- 編集ソフトなし
一行からショットへ:MiniMax H3 の
プロンプトの書き方 3 段階
同じ発想を 3 通りで、それぞれ出てきた映像つき。3 つとも回してみれば、MiniMax H3 のテキストから動画が実際に何を読んでいるかが見えます。
レベル 1
6 語

A woman walks down a street.
流れる
被写体がコマ間で流れます。カメラは自分で動きを決めます。
レベル 2
30 語
30 語A woman in a red coat walks down a wet Tokyo alley at night, neon reflected in puddles, slow push-in with small amplitude, rain on metal and distant traffic.
使える
カメラは頼んだとおりに動き、雨もちゃんとそこにあります。
- このモデルが訓練された構造
レベル 3
公式の項目
公式の項目- integrated_multimodal_description
- [Shot 1] Red coat, wet Tokyo alley, slow push-in.
- overall_soundscape
- 金属を打つ雨、遠くの車、足音。
- non_diegetic_music
- 低いシンセパッド、ゆっくりした脈動、セリフの下に。
納品できる
そう書いたから、セリフが音楽の手前に立ちます。
仕上げ済みの例は プロンプト実例 にもっとあります。どれも構造化プロンプトの全文つきです。
テキストから動画のプロンプト構造を、項目ごとに
3 つの欄を埋めると、プロンプトが組み上がっていくのが見えます。そのまま生成へ送れます。
ここは当てずっぽうでやる必要がありません。H3 は 3 項目の構造に対して訓練されていて、その形で書きさえすれば、モデルが勝手に空欄を埋めるのをやめます。
順序は固定
どこに何を書くか
integrated_multimodal_description — 画
あなたのショットが出るか、他人のショットが出るかを決めます。
- 画角
- 被写体
- 環境
- アクション
- カメラ
- 画面上の音
この順で書いてください。画角、被写体、環境、アクション、カメラ、そして画面上で鳴る音。ショットには [Shot 1]、[Shot 2] と番号を振ります。
overall_soundscape — その場がどう聞こえるか
音楽がセリフを埋めてしまうのを止めます。
環境音、フォーリー、そしてシーンの中に立てたマイクが拾うであろうものを、時間順に書いてください。聞かせたいセリフがあるなら、それが手前に立ち、ほかはその下に敷かれると書きます。
non_diegetic_music — 劇伴
登場人物には聞こえない音楽。いちばん短い項目です。
曲名ではなく、スタイル・楽器・テンポ・感情の起伏を書いてください。1〜2 文で十分です。書きすぎると、自分の環境音と喧嘩することになります。
組み上がったプロンプト、リアルタイム
integrated_multimodal_description
[Shot 1] Wide shot of a woman in a red coat, wet alley at night, slow push-in, small amplitude.
overall_soundscape
金属を打つ雨、遠くの車、水たまりを踏む足音。
non_diegetic_music
低いシンセパッド、ゆっくりした脈動、セリフの下に敷く。
0 / 7000
3 つの項目はこの順に並び、入れ替えられません。
公式の出力ルール
- 01見えるものか、聞こえるものを
- 02記述は英語、セリフはその言語で
- 03上の順序を守る
- 04あらすじを書かない、余計なタグを入れない
- 05項目の順序は絶対に入れ替えない
自分では一切書きたくないですか。プロンプト生成 が 1 文から 3 項目すべてを埋めますし、詳しい解説 は API についても書いています。
MiniMax H3 のカメラワークとマルチショットの時間指定
camera moves と書いても何も起きません。H3 がカメラを動かすには 3 つ要ります——種類・振れ幅・速さ。
寄る / 引く / パン / ティルト / 回り込み / 手持ち / クレーン / 固定
小さく / 中くらい / 大きく
ゆっくり / 一定 / 速く
動きます
ゆっくり 寄る, 小さく amplitude
camera moves
無視されます
ゆっくり寄る、振れ幅は小さく画面が被写体に寄っていき、ほかは何も動きません。
速い空撮の寄り、振れ幅は大きく振れ幅が大きいと稼げるのは移動距離であって、カットの速さではありません。
中くらいの手持ち追従、振れ幅は中くらい手持ちは質感です。そう書かないと、レールに乗ったショットが返ってきます。
マルチショットの時間
尺の外 — 生成まるごと失敗
8 秒の尺が終わる
ショットに番号を振り、カットにタイムスタンプを付けてください。最後のタイムスタンプは、選んだ尺の内側に収めます。
書き直すより作り替えたい映像がすでに手元にありますか。それは 動画から動画 です。
同じプロンプトの中のセリフと音
登場人物は喋れます。音は画と同じパスから出てきて、追加料金もかかりません。
喋るセリフの組み立て
同じパス · 追加料金なし
(S1) / (S2) · 768P · 8 秒安定対応は 11 言語
11
- アラビア語
- 中国語
- 英語
- フランス語
- ドイツ語
- イタリア語
- 日本語
- 韓国語
- ポルトガル語
- ロシア語
- スペイン語
見落とされるルール
プロンプトの記述部分は英語のままにして、喋るセリフはそれぞれの言語で書いてください。
(S2) replies firmly, [Japanese] 分かった。正(S2) replies firmly, [Japanese] Understood.誤
日本語のセリフを英語で書いてしまうのが、言い方が思ったとおりに返ってこない最大の原因です。
複数の映像にわたって同じ顔や同じ声が要りますか。参照素材から動画 を使ってください。
テキストから動画の設定・上限と、つまずきやすい 3 点
下の値はすべて公式の API リファレンスから取っています。このうち 3 行が、みんながつまずくところです。


- 尺
- 4〜15 秒、整数秒5〜15 と書いているサイトが複数あります。API リファレンスは 4 を受け付けます。
- フレームレート
- 24 fps
- 解像度
- 768P か 2K
- 01縦横比
- 21:9 · 16:9 · 4:3 · 1:1 · 3:4 · 9:16 — 必須
- プロンプト上限
- 7,000 文字
- 02フレーム格子
- 24 fps で 17n+5
- 03シード / ネガティブ
- 公開されていません
- 出力
- MP4 1 本、H.264 + AAC、音声は多重化済み
Source: 公式 · MiniMax API reference
つまずきやすい 3 点
- 01
比率を空欄にすると呼び出しが失敗します。
- 21:9
- 16:9
- 4:3
- 1:1
- 3:4
- 9:16
- adaptive
画像から動画 が adaptive のままでいいのは、画面の形を推測する元になる写真があるからです。
- 02
7 秒と頼んで 6.9 秒が返ることがあります。
24 fps で 17n + 5 フレーム
- 指定
- 7.0 秒
- 返り値
- 6.9 秒
尺はいちばん近い有効なブロックに吸着します。不具合ではなく、モデルの仕様です。
- 03
シードなし。ネガティブプロンプトなし。
ここは 7,000 文字Veo 3.1 は 1,024 トークンバーの長さ=プロンプトの予算
制御は、望むものをより正確に書くことから来ます。Veo 3.1 は 1,024 トークンです。
テキストから動画 1 本にいくらかかるか
課金は試行回数ではなく出力の秒数なので、4 秒のテストは 15 秒の本番より安く済みます。生成に失敗した場合は一切課金されません。ここでは 8 秒 1 本の費用を、比較検討によく挙がる 2 つのモデルと並べています。
8 秒 1 本、各社の表示価格
- このページ · 8 秒 768P
- $0.64
- Veo 3.1 Standard · 1080p
- $3.20
- Seedance 2.5 · 720p
- $1.85
各社の表示価格、2026-08-13 時点。料金の全体。
毎月のクレジットはどちらでも同じ
- 無料カード不要
アカウントなしで 1 本、無料エンジンで。MiniMax H3 自体は有料です。
$0ずっとクレジットカードは一度も要りません
無料で開始ボット確認だけ — メール不要
1 本、アカウント不要
Agnes Video V2.0 · 16:9 · 5 秒 · 無音
無料でログイン — Agnes で 1 日 3 本、無音$9.9 からのどのパックでも MiniMax H3 が解放されます — 全モード、768P と 2K
- ネイティブ 2K の H3有料のみ
- 映像と一緒のネイティブ音声有料のみ
- 1 本、アカウント不要
- 同時 1 本
- 失敗した分は無料
- 非公開で生成
- どのパックでも全モードで H3 が解放
無料枠は別のエンジンです。プランを見る
速度と順番待ち
- 順番待ち
- 無料レーン
- 同時実行
- 1
- まとめ生成
- 1
- 履歴の保存
- 24 時間 · ログイン時は 7 日
- サポート
- コミュニティ
- Lite50% お得
ネイティブ 2K の MiniMax H3 を解放。いちばん小さい有料プランです — 多くの人が選ぶのは Pro です。
$24.9/mo$49.9年額 $298.8 · 年間 $300 お得
7 日返金 · いつでも解約
毎月 1,290 クレジット · 約 22 本
4 秒 · 768P · テキストから動画
4 秒 2K なら約 17 本
月払いでも年払いでもクレジットは同じ
- ネイティブ 2K の H3 — ネイティブ音声つき
- セリフ・効果音・音楽が同じファイルに
- 最長 15 秒15 秒
- 4 秒 768P のテキストから動画で毎月約 22 本
- 失敗した分は無料
- クレジット未使用なら 7 日返金
- 同時実行 1 本
- 1 つのプロンプトから 2 通り
個人利用・評価目的 — 理由
速度と順番待ち
- 順番待ち
- 標準
- 同時実行
- 1
- まとめ生成
- 2
- 履歴の保存
- 7 日間
- サポート
- メール · 48 時間
- 多くの人が選ぶPro50% お得
Lite より $50 高いだけ。毎月およそ 125 本、同じ MiniMax H3、順番待ちも速い。
$49.9/mo$99.9年額 $598.8 · 年間 $600 お得
7 日返金 · いつでも解約
毎月 4,990 クレジット · 約 125 本
4 秒 · 768P · テキストから動画
4 秒 2K なら約 84 本
月払いでも年払いでもクレジットは同じ
- Lite の全部に加えて
- 4 秒 768P のテキストから動画で毎月約 125 本
- 同時 3 本3×
- 動画→プロンプト
- 1 つのプロンプトから 4 通り
- 履歴は 7 日間保存
- クレジット未使用なら 7 日返金
個人利用・評価目的 — 理由
速度と順番待ち
- 順番待ち
- 高速
- 同時実行
- 3
- まとめ生成
- 4
- 履歴の保存
- 7 日間
- サポート
- メール · 12 時間
- Studio50% お得
ひと月ぶんの本数、順番待ちの先頭、そして 4 時間以内に人が返します。
$99.9/mo$199.9年額 $1,198.8 · 年間 $1,200 お得
7 日返金 · いつでも解約
毎月 12,990 クレジット · 約 325 本
4 秒 · 768P · テキストから動画
4 秒 2K なら約 217 本
月払いでも年払いでもクレジットは同じ
- Pro の全部に加えて
- 4 秒 768P のテキストから動画で毎月約 325 本
- 同時 8 本8×
- 1 つのプロンプトから 4 通り
- 履歴は 7 日間保存
- 4 時間以内の優先サポート
- 当サイトで最も安い消費レート
- クレジット未使用なら 7 日返金
個人利用・評価目的 — 理由
速度と順番待ち
- 順番待ち
- 優先 — 順番待ちの先頭
- 同時実行
- 8
- まとめ生成
- 4
- 履歴の保存
- 7 日間
- サポート
- 優先 · 4 時間
MiniMax H3 でテキストから動画を作るまで
4 手順、どれも編集ソフトを必要としません。音は画と同じファイルに入って届きます。
ショットと音を書く
1 つの項目が両方を受け取ります。カメラに何が見えるかを書き、次に何が聞こえるか——セリフ、効果音、劇伴——を書きます。
7,000 文字まで比率・尺・解像度を決める
縦横比 6 種類、4 秒から 15 秒までの任意の整数秒、768P か 2K。
24 fps、4〜15 秒生成する
画と 32 kHz ステレオのトラックは同じパスで作られます。あとから貼り合わせるのではありません。
1 パスMP4 をダウンロードする
1 本のファイル、音はすでに中に入っています。失敗したタスクは、無料枠を含むどのプランでもクレジットを消費しません。
どのプランでも透かしは入りません
無料枠は Agnes Video V2.0 で 16:9・無音です。MiniMax H3 そのものと、2K・ネイティブ音声は有料プランからです。
テキストから動画についてよくある質問
12 問 · すべて表示 · 折りたたみなし
