MiniMax H3 文字轉影片

把你想看到的東西打出來。MiniMax H3 文字轉影片給你一支做好的 4 到 15 秒片子——畫面、對白和配樂在同一個 MP4 裡,768P 或 2K。不用素材,不用剪輯軟體。

把鏡頭寫出來

0 / 7000

This run spends credits — the free clip is 4s · 768P · 16:9.

Sign up free and your first MiniMax H3 clip renders 4s · 768P · 16:9, with sound. A plan raises the ceiling to 15s, 2K and four at a time — the free clip is a size, not a different model.

  • 文字轉影片一定要指定比例——這裡沒有 adaptive 這個選項
  • 長度會對齊 24 影格每秒下的 17n+5 影格格線,所以 7 秒可能回來變成 6.9 秒

不用綁卡:右邊那些片子連完整提示詞都看得到,然後免費註冊,自己在 MiniMax H3 上跑一支——4 秒 · 768P · 16:9,帶聲音,可以下載。更長、2K 和 H3 的其他能力,從 $9.9 的點數包開始。

13 支真的片子 · 按「試這個」載入一支

MiniMax H3 文字轉影片:一位饒舌歌手在摩天大樓之間墜落,從下往上拍11 秒 · 16:9 · 768P

四個場景,同一個角色

一段提示詞能給你什麼

一段提示詞能給你什麼 用 MiniMax H3 文字轉影片

多數人的文字轉影片都死在同一個地方。你寫了一句話,模型把你沒說的部分全部自己補完,回來的東西跟你腦子裡那個完全不一樣。

你寫的是

一位女子走在街上。

剩下的都是模型自己補的

  • 什麼時間?
  • 穿什麼?
  • 鏡頭怎麼動?
  • 什麼天氣?
  • 有什麼聲音?
  • 什麼鏡頭?
文字轉影片的成品:黃昏時分一個人影走進霓虹街道,鏡頭緩緩推近MiniMax H3 · 16:9 · 768P · 8 秒
回來的東西:畫面、雨聲和那句台詞,都在一個 MP4 裡

MiniMax H3 文字轉影片給你把話說完的空間,最多 7,000 字元。回來的是 4 到 15 秒之間任何一個整秒、24 影格每秒、768P 或 2K 的影片,對白、音效與音樂已經和畫面在同一個檔案裡。不用原圖,不用分鏡,不用剪輯軟體。

你能寫多少字元
7,000

你能寫多少字元

任何一個整秒
4–15 秒

任何一個整秒

影格率
24 fps

影格率

解析度
768P / 2K

解析度

畫面、對白、音效與音樂
1 個 MP4

畫面、對白、音效與音樂

  • 不用原圖
  • 不用分鏡
  • 不用剪輯軟體

提示詞階梯

從一句話到一個鏡頭:MiniMax H3 提示詞的三種寫法

同一個想法寫三遍,每一遍都配上它跑出來的片子。三條都跑一次,你就知道 MiniMax H3 文字轉影片到底在讀什麼。

  • 第 1 級

    6 個詞

    文字轉影片的成品:六個詞的提示詞跑出來的畫面,細節很少

    A woman walks down a street.

    會飄

    主體在影格之間會飄,運鏡也由它自己決定。

  • 第 2 級

    30 個詞

    MiniMax H3 文字轉影片:霓虹街道裡的一個背影,鏡頭停在他身上30 個詞

    A woman in a red coat walks down a wet Tokyo alley at night, neon reflected in puddles, slow push-in with small amplitude, rain on metal and distant traffic.

    能用了

    鏡頭照你說的動,雨也真的下起來了。

  • 模型就是照這個結構訓練出來的

    第 3 級

    官方欄位

    用文字轉影片做的——一個背影走在霓虹街道上,鏡頭緩緩推近官方欄位
    integrated_multimodal_description
    [Shot 1] Red coat, wet Tokyo alley, slow push-in.
    overall_soundscape
    Rain on metal, distant traffic, footsteps.
    non_diegetic_music
    Low synth pad, slow pulse, under the dialogue.

    可以交出去

    對白壓在音樂前面,因為你寫了。

更多跑過的例子在 提示詞範例,每一條都附著完整的結構化提示詞。

提示詞建構器

MiniMax H3 文字轉影片的提示詞結構,一個欄位一個欄位拆給你看

填三個框,看著提示詞自己拼起來,直接送進生成器。

這個真的不用猜。H3 就是照一套三欄位結構訓練出來的,你照著寫,它就不會再替你亂補。

每句話該放哪

01

integrated_multimodal_description畫面

決定你拿到的是你的鏡頭,還是它隨手編的。

  1. 景別
  2. 主體
  3. 環境
  4. 動作
  5. 運鏡
  6. 畫面裡的聲音

照這個順序寫:景別、主體、環境、動作、運鏡,最後才是畫面裡發出的聲音。每個鏡頭用 [Shot 1][Shot 2] 編號。

02

overall_soundscape這個場景聽起來是什麼樣

不讓配樂把你的台詞蓋掉。

按時間順序描述環境音、擬音,還有一支立在現場的麥克風收得到的一切。如果某一句台詞重要,就寫明它在前面,其餘的都壓在下面。

03

non_diegetic_music配樂

角色聽不見的那一層音樂。最短的一個欄位。

給風格、樂器、速度和情緒走向就好,不要給曲名。一兩句就夠——寫太滿,正是很多人最後跟自己的聲音設計打架的原因。

即時拼出來的提示詞

integrated_multimodal_description

[Shot 1] Wide shot of a woman in a red coat, wet alley at night, slow push-in, small amplitude.

overall_soundscape

Rain on metal, distant traffic, footsteps in standing water.

non_diegetic_music

Low synth pad, slow pulse, sitting under the dialogue.

0 / 7000

這三個欄位就按這個順序走,不能對調。

官方的輸出規則

  1. 01看得見,或者聽得見
  2. 02描述用英文,台詞用它自己的語言
  3. 03維持上面那個順序
  4. 04不要寫劇情大綱,不要留多餘的標籤
  5. 05永遠不要調換欄位順序

一個字都不想寫?提示詞產生器 能從一句話填滿這三個欄位,完整教學 連 API 那條路也講了。

運鏡與分鏡

MiniMax H3 的運鏡怎麼寫,多鏡頭怎麼卡秒數

只寫 camera moves 是不會動的。H3 要看到三樣東西才肯動鏡頭:類型、幅度、速度

push-in / pull-out / pan / tilt / orbit / handheld / crane / static

small / medium / strong

slow / steady / fast

它動了

slow push-in, small amplitude

camera moves

被忽略
  • 文字轉影片的成品:沿著霓虹小巷緩慢推近
    slow push-in, small amplitude畫面朝主體收攏,其他什麼都不動。
  • MiniMax H3 文字轉影片:沿著海岸線的大幅空拍推進
    fast aerial push-in, large amplitude大幅度買到的是走過的距離,不是切鏡頭的快慢。
  • 用文字轉影片做的——手持跟拍穿過一個路邊小吃攤
    medium handheld follow, medium amplitude手持是一種質感。你不說,鏡頭回來就像裝在軌道上一樣穩。

多鏡頭卡秒數

超出片長,整次生成作廢

[Shot 1]
[Shot 2] 在 00:04.500
這一刀
00:0000:0200:0400:0600:08

8 秒的片長到此結束

給鏡頭編號,給這一刀標上時間戳記。最後一個時間戳記一定要落在你選的片長以內。

已經有素材,比起重寫更想換個風格?那條路是 影片轉影片

對白與聲音

對白和聲音,寫在同一條 MiniMax H3 提示詞裡

你的角色可以開口說話。聲音和畫面出自同一次生成,不另外收費。

一句台詞是怎麼組成的

同一次生成 · 不另外收費

(S1)speaks softly,[English]Follow the wind, live free.

(S2)replies firmly,[Japanese]分かった。

文字轉影片的成品:同一個鏡頭裡兩個人對話,每一句都標了說話人(S1) / (S2) · 768P · 8 秒
兩個標了說話人的角色,一鏡到底——按下去聽聲音

十一種穩定的語言

11

  • 阿拉伯文
  • 中文
  • 英文
  • 法文
  • 德文
  • 義大利文
  • 日文
  • 韓文
  • 葡萄牙文
  • 俄文
  • 西班牙文

最多人漏掉的一條

提示詞裡描述的部分用英文寫,但每一句台詞要用它自己的語言寫。

  • (S2) replies firmly, [Japanese] 分かった。
  • (S2) replies firmly, [Japanese] Understood.

把一句日文台詞寫成英文,是念出來不對味的頭號原因。

需要好幾支片子裡都是同一張臉、同一把嗓音?用 參考圖生影片

參數與限制

MiniMax H3 文字轉影片的參數、限制,以及三個最容易踩的坑

在花掉任何點數之前,先把這場戲排好。下面每一個數字都來自官方 API 文件。

用文字轉影片做的——同一個鏡頭重新生成到 2K 的樣子
MiniMax H3 文字轉影片:同一個鏡頭在 768P 下生成的樣子
768P2K
同一條提示詞,同樣沒有種子 · 2K 是重新生成的,不是放大的
片長
4–15 秒,整秒好幾個站寫 5–15。API 文件接受 4。
影格率
24 fps
解析度
768P 或 2K
01長寬比
21:9 · 16:9 · 4:3 · 1:1 · 3:4 · 9:16,必填
提示詞上限
7,000 字元
02影格格線
24 影格每秒下的 17n+5
03種子 / 負面提示詞
未開放
輸出
一個 MP4,H.264 + AAC,音訊已經混好

Source: 官方 · MiniMax API reference

三個最容易踩的坑

  • 01

    長寬比留空,這次呼叫直接失敗。

    • 21:9
    • 16:9
    • 4:3
    • 1:1
    • 3:4
    • 9:16
    • adaptive

    圖片轉影片 可以留在 adaptive,因為它有你那張圖可以推斷畫面比例。

  • 02

    你要 7 秒,回來的可能是 6.9 秒。

    24 影格每秒下的 17n + 5 影格

    你要的
    7.0 秒
    回來的
    6.9 秒

    長度會吸到最近的合法區塊上。這是模型的規則,不是 bug。

  • 03

    沒有種子,也沒有負面提示詞。

    這裡 7,000 字元
    Veo 3.1 是 1,024 token

    長條的長度 = 提示詞額度

    控制力來自把你想要的東西說得更準。Veo 3.1 給你 1,024 token。

價格 · 每個付費方案都出 2K · 原生音訊

一支 MiniMax H3 文字轉影片要多少錢

按輸出秒數計費,不是按次數,所以跑一支 4 秒的試片比 15 秒的成品便宜。生成失敗完全不收錢。下面是在這裡出一支 8 秒要多少錢,旁邊是大家最常拿來一起比的兩個模型。

一支 8 秒,各家標價

本頁 · 8 秒 768P
$0.64
Veo 3.1 Standard · 1080p
$3.20
Seedance 2.5 · 720p
$1.85

各家標價,核對於 2026-08-13。完整價格

兩種繳法,每月點數一樣

  • 免費免綁卡

    一支真的 MiniMax H3 影片,帶聲音。4 秒 · 768P 之外的一切都靠點數。

    $0永遠

    從頭到尾都不用信用卡

    免費開始

    只驗機器人——不要 email

    在 MiniMax H3 上跑 1 支

    MiniMax H3 · 4 秒 · 768P · 16:9 · 帶聲音
    7 天後回來看看——37 點數,再一支

    $9.9 起的任何一個點數包,都能解鎖 MiniMax H3 AI 影片生成器——每一種輸入方式、768P 和 2K

    • 原生 2K 的 MiniMax H3只有付費
    • 聲音和畫面一起生成只有付費
    • 一支,不用綁卡
    • 一次跑 1 支
    • 跑壞的不收錢
    • 生成內容不公開
    • 任何一個點數包都能解鎖 MiniMax H3 AI 影片生成器的每一種輸入方式

    免費層跑的是另一個引擎。看方案

    速度與排隊

    排隊
    免費通道
    同時任務數
    1
    批次
    1
    紀錄保留
    24 小時 · 登入後 7 天
    支援
    社群
  • Lite省 30%

    用原生 2K 解鎖 MiniMax H3 AI 影片生成器。最小的付費方案——大多數人選的是 Pro。

    $16.9/mo$24.9

    年繳 $202.8 · 一年省 $96

    7 天退款 · 隨時取消

    750 點數 / 月 · 約 20 支影片

    4 秒 · 768P · 文字轉影片

    或 4 秒 2K 約 13 支

    月繳年繳,每月點數一樣

    • 原生 2K 的 MiniMax H3——還有原生音訊
    • 對白、音效與音樂在同一個檔案裡
    • 最長 15 秒15 秒
    • 每月約 20 支 4 秒 768P 的文字轉影片
    • 跑壞的不收錢
    • 點數沒動過,7 天內可退
    • 一次跑 1 個任務
    • 同一段提示詞批次跑 2 個版本

    包含商業使用——涵蓋範圍

    速度與排隊

    排隊
    一般
    同時任務數
    1
    批次
    2
    紀錄保留
    7 天
    支援
    Email · 48 小時
  • 多數人推薦
    Pro省 30%

    比 Lite 多 $32。每月約 47 支影片,同一個 MiniMax H3 AI 影片生成器,排隊更快。

    $39.9/mo$56.9

    年繳 $478.8 · 一年省 $204

    7 天退款 · 隨時取消

    1,775 點數 / 月 · 約 47 支影片

    4 秒 · 768P · 文字轉影片

    或 4 秒 2K 約 31 支

    月繳年繳,每月點數一樣

    • Lite 的全部
    • 每月約 47 支 4 秒 768P 的文字轉影片
    • 同時 3 個任務
    • 影片轉提示詞
    • 同一段提示詞批次跑 4 個版本
    • 紀錄保留 7 天
    • 點數沒動過,7 天內可退

    包含商業使用——涵蓋範圍

    速度與排隊

    排隊
    快速
    同時任務數
    3
    批次
    4
    紀錄保留
    7 天
    支援
    Email · 12 小時
  • Studio省 30%

    整整一個月的量、排隊排在最前面,還有一個 4 小時內回覆的真人。

    $99.9/mo$142.9

    年繳 $1,198.8 · 一年省 $516

    7 天退款 · 隨時取消

    4,425 點數 / 月 · 約 119 支影片

    4 秒 · 768P · 文字轉影片

    或 4 秒 2K 約 77 支

    月繳年繳,每月點數一樣

    • Pro 的全部
    • 每月約 119 支 4 秒 768P 的文字轉影片
    • 同時 8 個任務
    • 同一段提示詞批次跑 4 個版本
    • 紀錄保留 7 天
    • 4 小時內的優先支援
    • 我們給得出的最低點數消耗
    • 點數沒動過,7 天內可退

    包含商業使用——涵蓋範圍

    速度與排隊

    排隊
    優先——排在最前面
    同時任務數
    8
    批次
    4
    紀錄保留
    7 天
    支援
    優先 · 4 小時

完整流程

怎麼用 MiniMax H3 把一段文字變成影片

四個步驟,沒有一步需要剪輯軟體。聲音就在畫面那個檔案裡。

  1. 把畫面和聲音都描述出來

    一個輸入框兩樣都收。先寫鏡頭看到什麼,再寫它聽到什麼——對白、音效、配樂。

    最多 7,000 字元
  2. 設定長寬比、長度和解析度

    六種長寬比,4 到 15 秒之間任何一個整秒,768P 或 2K。

    24 影格每秒,4–15 秒
  3. 生成

    畫面和 32 kHz 立體聲在同一次生成裡做出來,不是事後拼上去的。

    一次生成
  4. 下載 MP4

    一個檔案,聲音已經在裡面。任務失敗不扣點數,每個方案都一樣,免費的也是。

    任何一層都不加浮水印

免費的那一支跑的就是 MiniMax H3 本身:4 秒 · 768P · 16:9,帶原生聲音。2K、更長的片長和其他比例要用點數跑。

大家真的會問的問題

MiniMax H3 文字轉影片常見問題

第一支 MiniMax H3 影片之前,先知道這些

MiniMax H3 文字轉影片是什麼?

MiniMax H3 文字轉影片把一段寫好的提示詞變成 4 到 15 秒、24 影格每秒的影片,768P 或 2K,不需要任何原圖。聲音就在同一個 MP4 裡。

長寬比一定要選嗎?

一定要。和圖片轉影片不一樣,這裡沒有 adaptive 這個選項——沒有輸入圖,就沒有東西可以推斷你要的畫面比例。

一支片子最長可以多長?

4 到 15 秒之間任何一個整秒。好幾個站寫 5 到 15;API 文件接受 4。

我要 7 秒,怎麼回來是 6.9 秒?

24 影格每秒下,影格數落在 17n+5 這條格線上,所以長度會吸到最近的合法區塊。

提示詞可以寫多長?

最多 7,000 字元。在 H3 上,寫得長、寫得細,通常比寫得短有用。

可以用種子或負面提示詞嗎?

不行,兩個都沒開放。改成把你想要的東西說得更準。

可以出 2K 嗎?

可以。2K 是帶著你原本的上下文重新生成,不是把像素放大,所以畫面裡的小字留得住。

聲音真的是生成出來的嗎?

是在同一次生成裡做出來的:對白、音效與音樂。沒有開關,也不另外收費。

我的角色可以說哪些語言?

十一種是穩定的。每一句台詞都要用它自己的語言寫。

一定要註冊嗎?

一支,跑在模型本身上。免費帳號可以拿到一支真的 MiniMax H3 影片——4 秒 · 768P · 16:9,帶聲音——連續簽到七天再拿 37 點數,剛好又是同樣尺寸的一支。

免費做出來的片子有聲音嗎?

有。免費的那一支就是 MiniMax H3 本身,所以對白、音效與音樂都和畫面在同一次生成裡做出來,32 kHz 立體聲——這裡沒有無聲的那一層了。它是 4 秒、768P,而且我們不在任何一層加浮水印。

這些影片可以商業使用嗎?

可以,每個方案都可以,免費的也算。這裡的影片是透過 MiniMax 的 API 生成的,而 MiniMax 對你生成的產出不主張任何權利——本站把這一點原樣傳給你:任何一層都不加浮水印,不按支收授權費,也沒有另外要買的授權。你寫的提示詞同樣是你的,拿到哪裡跑都行。本站做不到的是替 MiniMax 發言——這裡是獨立的第三方介面,模型授權本身要由 MiniMax 自己說明。以上是概述,不構成法律意見。

一句話,就夠你試出答案。

不用綁卡。免費註冊,第一支 MiniMax H3 影片我們請你,還有聲音。

免費註冊 · 送 1 支 MiniMax H3

MiniMax H3 AI Video Generator 編輯團隊撰寫與維護發布於 最後更新 工具版本 2026.09.4