MiniMax H3 提示詞產生器

一句話說清想法,拿回 H3 受訓時就在讀的那三個欄位——先畫面,後聲音。

你打算在哪裡用?模式一換,欄位骨架就跟著換。

不用帳號。從來不花點數。

從哪起步 , , , , , , , 或者載入一個寫好的例子: , ,

免費。不用帳號。從來不花點數。

你的結構化提示詞

  • integrated_multimodal_description
  • overall_soundscape
  • non_diegetic_music

檢查項12 條規則,在你複製之前先跑一遍

  • 欄位順序與官方序列一致
  • [Shot 1] 上不帶時間戳記
  • 運鏡那一句點了動作,但沒寫幅度和速度the camera pushes in

灰色的骨架就是真正的格式——基礎模式三個欄位,參考模式六個。

0 / 7,000 characters

你在本站的第一支片子免費——不用綁卡。

你會拿到什麼

MiniMax H3 提示詞產生器會回給你什麼

一段 H3 可以直接執行的提示詞,不是一段它得先去猜的話。

MiniMax H3 提示詞產生器接過一句大白話的想法,照這個模型受訓時讀到的樣子重寫一遍:先是一顆一顆鏡頭的畫面描述,然後是場景的聲音,最後是配樂,順序固定。市面上多數 AI 影片提示詞產生器給你的還是一整塊默片式的散文,不然就是一張二十格的表單,逼你自己去做結構化。這一個只要一句話,結構它替你寫,再照官方規則查一遍,而且從頭到尾不跟你要帳號。

輸入
1

輸入

輸出欄位
3 / 6

輸出欄位

檢查規則
12

檢查規則

字元上限
7,000

字元上限

  • 沒有二十格表單
  • 不用帳號
  • 不花點數

格式

三欄位提示詞結構,照 H3 期待的順序

這是 MiniMax 官方自己的格式——2026 年 8 月發布在 H3 GitHub 倉庫裡的 h3-prompt-writing skill,欄位、順序和規則都由參考檔案釘死。在 MiniMax 自己的管線裡,有一個叫 Context-IR 的託管環節,會先把你打的字改寫成這個結構,模型才看得到。走 API 你就有那個環節;在別的地方你得自己搭。在這裡它已經跑起來了,就在你的瀏覽器裡。

  1. integrated_multimodal_description畫面,一顆鏡頭一顆鏡頭寫。
  2. overall_soundscape這個場景本身聽起來是什麼樣。
  3. non_diegetic_music配樂,或者「N/A」。

[Shot 1]、時間戳記與對白

鏡頭要編號,從第二顆鏡頭起每一個切點都要帶時間戳記,而第一顆永遠不帶。每顆鏡頭內部的官方順序是:構圖、主體、環境、動作、運鏡、聲音。對白也住在這裡:身份和語氣寫在標籤外面,原話寫在標籤裡面。寫成「她說了一句動人的話」,H3 就自己編一句——很少是你要的那一句。這個欄位大約會佔掉整段提示詞的六成,也佔掉大部分被打回的原因。

(S1) says: <d>[English] Follow the wind.</d>

overall_soundscape 與 non_diegetic_music

結尾這兩個欄位,是那些圍著無聲模型做的工具從來不寫的。環境音是場景自己發出來的聲音——雨打在布上、馬克杯放下、兩條街外的車流——帶著距離和落點時間。音樂欄位是只有觀眾聽得見的配樂:樂器、速度、從哪裡進來、在哪裡收住。一個判斷方法:戲裡的人聽得見嗎?聽得見就歸環境音,聽不見就歸音樂。

non_diegetic_music: N/A

運鏡寫法

運鏡寫法:動作、幅度、速度

H3 把運鏡當成鏡頭描述裡的一句普通英文來讀,由三個部分拼起來。

  • 動作推進
  • 幅度small
  • 速度slow
  • slow push-in, small amplitude
  • static hold throughout
  • cinematic camera work裡面沒有任何可以執行的東西。
  • [Push in][Truck left]這是 Hailuo 02 的寫法。H3 不讀它。

「The camera pushes in with small amplitude at slow speed」是可以執行的,「Cinematic camera work」不是。幅度和速度想用中等和正常,那就乾脆別寫。如果你學的是 Hailuo 02,那套方括號要忘掉:疊標籤沒有了,方括號現在只用來標鏡頭編號,運鏡由 MiniMax H3 提示詞產生器寫進句子裡。

想要機位鎖死就明寫 static——一顆你從不提起的鏡頭,模型有權自己動它。另外在純文字轉影片上,別導演過頭:社群測試的結論是,一段自然的文字勝過一堆技術指令。

五種輸入模式

一個 MiniMax H3 提示詞產生器,五種輸入模式

模式決定骨架,所以先選模式。

  • 文字

    T2VA
    用 MiniMax H3 提示詞產生器搭出來的:一顆完全由文字搭起來的鏡頭

    整條時間軸都由文字搭出來。

    必須給長寬比——adaptive 會被擋下

  • 起始影格

    I2VA
    提示詞產生器輸出:一張當作開場影格用的照片

    你的圖打開這顆鏡頭,片子從那裡往前長。

  • 起始 + 結束

    FL2VA
    出自提示詞產生器——兩張圖,中間那段路由模型生成

    兩張圖,中間那段路交給模型生成。

  • 結束影格

    L2VA
    用 MiniMax H3 提示詞產生器搭出來的:一支片子收束到你給的最後一個影格

    描述一段說得通的前情,讓片子收束到你那張圖上。

    真的有,而且幾乎沒有人寫過

  • 參考素材

    Ref2VA
    提示詞產生器輸出:用來定義主體的參考素材

    素材定義主體;場景照著它們搭。

三種圖片模式比基礎模式多一句話:一句對齊聲明,把每一張圖釘到它該出現的那一刻。圖片模式不看你選的長寬比——那由圖決定。

Ref2VA:六個段落與八個保留標記

參考模式把三個欄位換成六個。每一份素材都有一個標籤,只要有一個標籤用了卻沒定義,整段提示詞就作廢。summary 段以方括號裡的任務類型開頭,而 retention_analysis 給每一份參考分配八個標記之一,分成固定的兩組——四個視覺、四個聲音。兩組之間從不交叉。這是整個格式裡最難手寫的那五分之一,所以表單按素材逐個替你搭。完整的標記說明在 參考圖生影片

  1. subject_definitions
  2. summary
  3. retention_analysis
  4. detailed_description
  5. overall_soundscape
  6. non_diegetic_music

檢查器

MiniMax H3 提示詞產生器在你複製之前跑的那些檢查

官方那份 skill 的結尾是一組輸出規則。這裡每一份輸出都先照著查一遍,才交到你手上。

  • 欄位順序與官方序列一致
  • 第一顆鏡頭不帶時間戳記[Shot 1]
  • 每一個切點都落在請求的長度裡8 秒的片子裡出現 00:09.000
  • 總長度不超過 API 上限7,000 字元
  • 文字模式給了明確的長寬比adaptive 會被擋下
  • 每一個參考標籤都有定義subject_definitions
  • 保留標記不跨組視覺 ≠ 聲音
  • 描述部分用英文寫對白保留自己的語言
  • 對白寫出確切的原話
  • 運鏡句三個部分都齊
  • 圖片模式開頭有一句對齊句
  • 文字讀起來像一顆鏡頭,不像劇情大綱

檢查器寫出來的一條判定,原樣

"the camera pushes in" — names a move but not its amplitude or speed.

這三樣 H3 都會執行。試試:slow push-in, small amplitude。

把任何已經有的提示詞貼進「檢查」分頁,MiniMax H3 提示詞產生器會照同一套規矩過一遍,出錯那一行原樣引出來,並給出改法。

一段寫壞的提示詞,通常要花掉一次付費生成才發現。在這裡發現它不用錢。

反過來走

影片轉提示詞:片子已經有了的時候

上面講的都是從想法到提示詞。這一段是同一條路反著走。

  • 這一頁

    一行大白話三個欄位,照順序

  • 影片轉提示詞

    分鏡表、運鏡路徑、兩個聲音欄位你手上已經有的一支片子

手上有一支片子,想要那段能做出同一類片子的提示詞——分鏡表、運鏡路徑和兩個聲音欄位,全部從素材裡讀回來。倒檔是另一個工具:去 影片轉提示詞 貼一條連結,再把結果拿回這邊改。

如果目標是留住原本的取景或者配樂,那就別寫提示詞了,把片子直接餵給 參考模式

拿去別的地方用

把 H3 提示詞搬到 Veo、Seedance 或 Kling

提示詞歸你,結構大致也搬得動。先說那條硬限制。

  • MiniMax H37,000 字元

  • Veo 3.11,024 token —— 一份完整的 H3 分鏡表塞不下

留一顆鏡頭的描述,去掉欄位標籤,運鏡那一句重寫。Seedance 讀的是 @AssetName 這樣的引用,不是標籤定義。Kling 和其餘多數模型要的是一整段描述性文字,所以只把視覺那個欄位送過去。

兩個聲音欄位哪裡都去不了——沒有第二個主流模型把聲音當成帶標籤的欄位來收,而這恰恰是一個 MiniMax H3 提示詞產生器大半的用處所在。

是在幾個模型之間做選擇,不是搬提示詞?從 MiniMax H3 對上 Veo 3 看起。

完整流程

怎麼搭一段 MiniMax H3 提示詞

寫提示詞從來不花點數,所以在生成任何東西之前,這些檢查都值得先跑一遍。

  1. 挑輸入模式

    T2VA、I2VA、FL2VA、L2VA 或 Ref2VA。模式決定 H3 期待哪些欄位、照什麼順序。

    五種模式
  2. 用大白話把想法打進去

    一行就夠。它會被改寫成官方欄位順序,兩個聲音欄位都算上。

    免費,不用帳號
  3. 讀那十二條檢查

    每一條沒過的規則,都會把踩壞它的那一行引出來,讓你看見 H3 本來會忽略掉什麼。

    出錯那一行原樣引出
  4. 複製走,或者直接送進生成器

    你在改的時候,字元計數器一直盯著 7,000 字元的 API 上限。

    7,000 字元上限

已經在別的地方寫好提示詞了?「檢查」分頁會照同樣這十二條規則查它,一個字都不改寫。

大家真的會問的問題

MiniMax H3 提示詞產生器常見問題

寫第一段 H3 提示詞之前,先知道這些

MiniMax H3 提示詞產生器是什麼?

它把一句大白話的想法變成 MiniMax H3 期待的那種結構化、帶標籤的提示詞——基礎模式三個欄位,參考模式六個——並在你複製之前照官方輸出規則驗證一遍。

這是官方格式嗎?

是。MiniMax H3 提示詞產生器照的是官方那份 h3-prompt-writing skill 和它的參考檔案。工具本身是獨立的;我們不是 MiniMax。

Context-IR 是什麼,我還需要它嗎?

Context-IR 是 MiniMax 託管的一個環節,負責把輸入改寫成這個結構,按 token 計費。這一頁就是官方說明裡講的「自己搭」的那個替代方案。走大量 API 管線的人可能還是會偏好它。

一段 H3 提示詞該寫多長?

通常越長、越具體越佔便宜,上限是 API 的 7,000 字元。MiniMax 自己的 Context-IR 範例就是把很短的想法擴成好幾千個 token。

一定要用英文寫嗎?

描述部分是的。對白、歌詞和畫面上出現的文字保留原本的語言——這是官方規則。

對白怎麼寫?

說話者編號、語氣,然後把確切的那句話放進語言標記裡:(S1) says: <d>[English] your line here.</d> 身份寫在標記外面。有十一種語言的支援是穩的。

運鏡怎麼寫?

三個部分寫進一句話:動作類型、幅度、速度。「The camera pushes in with small amplitude at slow speed」執行得了;「dynamic camera work」不行。

環境音欄位和音樂欄位怎麼分?

看戲裡的人聽不聽得見。場景裡真實存在的聲音歸環境音;只有觀眾聽得見的配樂歸音樂。

我的時間戳記為什麼被打回?

與請求長度矛盾的時間安排,違反的是一條寫明的官方規則。檢查器會在你複製之前標出來——包括那個經典錯誤:第一顆鏡頭上帶了時間戳記。

它可以把影片變成提示詞嗎?

這一頁不行——那是影片轉提示詞,反向的那個工具。把片子貼到那邊,它會把分鏡表和兩個聲音欄位讀回來。

它免費嗎?提示詞可以帶走嗎?

免費,不用帳號,而且寫提示詞從來不花點數。提示詞歸你:貼進我們的文字轉影片生成器、MiniMax API、Hailuo、ComfyUI,哪裡都行。有合理使用的速率限制,讓它一直跑得快。

一行話進去,官方欄位順序出來。

免費,不用帳號,而且提示詞帶到哪裡都歸你。

免費註冊 · 送 1 支 MiniMax H3

MiniMax H3 AI Video Generator 編輯團隊撰寫與維護發布於 最後更新 工具版本 2026.09.4