MiniMax H3 影片轉提示詞
看一支片子,拿回一段能做出同一類片子的提示詞——三個欄位齊全,順序照 H3 的規矩排。
你的結構化提示詞
integrated_multimodal_description分鏡 · 運鏡 · 對白overall_soundscape這個場景自己發出來的聲音non_diegetic_music沒有就寫 None。
拆成欄位,不是一段散文——時間戳記已經重排好了。
拿一支範例片試試: , , ,
你在本站的第一支片子免費——不用綁卡。
MiniMax H3 影片轉提示詞
到底倒推出什麼
給的是一段提示詞,不是一句圖說。

你的片子
照欄位讀出來,不是一段散文
MiniMax H3 影片轉提示詞會把你的片子看一遍——影格和音訊都看——再寫回一段能做出同一類片子的結構化提示詞:一份帶編號、帶運鏡和時間戳記的分鏡表,場景本身的聲音,還有配樂,裝進 H3 會讀的那三個帶標籤的欄位裡。通用工具回給你的是一段關於畫面的散文。H3 不吃散文,而且你這支片子有一半的內容是聽出來的。貼一條連結或者拖一個檔案進來;每週第一次倒推不用帳號。
- 通讀遍數
- 7
- 輸出的欄位數
- 3
- 讀得了的來源長度
- ≤ 60 秒
- 時間戳記重排到
- 4–15 秒
通讀遍數
輸出的欄位數
讀得了的來源長度
時間戳記重排到
- 不抽關鍵影格
- 不給一段散文
- 不用帳號
大家從一支參考片裡拿走的五樣東西
先說清楚你要哪一樣,才知道哪一遍通讀最要緊、措辭要精確到什麼程度,以及一段寫出來的提示詞是不是根本就不該是答案。
風格
GRADE
調色、光、質感——東西還沒動之前的那個樣子。
構圖
FRAME
取景與走位:東西擺在哪裡,眼睛沿著什麼路線走。
運動
PATH
調度與運鏡路徑,寫成類型、幅度、速度三樣。
聲音
MIX
讓它聽起來很貴的那套混音,分三層寫。
人物
WHO
畫面裡的人是誰——也是唯一一個要先拿到同意的目標。
肖像界線見下
一支舞蹈片和一支香水廣告可能共用同一套調色,但你倒推它們的理由正好相反——前者要的是運動,後者要的是光。在倒推器裡挑好目標,重點就跟著挪。
從素材到欄位:七遍通讀
這次倒推讀一顆鏡頭的順序,和官方提示詞指南要你寫一顆鏡頭的順序是同一個:構圖、主體、環境、動作、運鏡、聲音——以及每一樣被提到的東西究竟在哪一秒出現。
切點
一共幾顆鏡頭,切在哪裡。
[Shot n] · At 00:0x.xxx
構圖
景別與機位高度,一顆鏡頭一顆鏡頭讀。
每一顆鏡頭的開頭
主體
具體到一個陌生人照著能重畫出來——「三十出頭的女子,黑色齊耳短髮,寬大的灰色風衣」,而不是「一個女人」。
主體描述
環境
地點、天氣,還有光從哪個方向來。H3 把光當成物理量處理,所以「窗光從畫面左側進來」比「光影很美」有用得多。
環境描述
動作
到底發生了什麼,照先後順序寫。
動作描述
運鏡
照 H3 執行它的方式寫:類型、幅度、速度。「緩慢推進,小幅度」活得過這一趟;「流暢的電影感運動」活不過——裡面沒有任何可以執行的東西。
運鏡描述
聲音
下面那三層,也是別的工具全都跳過的那一遍。
兩個聲音欄位 + 對白
你這支片子正在發出的三種聲音
關鍵影格工具抽的是靜止畫面,等於把你的片子靜音之後再分析。
這裡的倒推是真的在聽,而且把聽到的東西分成三份,因為 H3 對每一層的處理位置都不一樣。後兩層怎麼分,只要問一句:片子裡的人聽得見嗎?

對白
人真正說出口的話,逐句轉寫,帶說話者編號、語氣和語言標記,落在鏡頭描述裡面。
(S1) says warmly, [English] …
環境音
場景自己產生的一切:雨打在雨棚上、刀落在砧板上、兩條街外的車流——每一個聲源都帶一個距離和一個落點時間。
overall_soundscape
配樂
只有觀眾聽得見的那一層:樂器、速度、在哪裡推起來、在哪裡停。片子裡沒有配樂,這一格就寫 None——這本身也是一條 H3 會照辦的指令。
non_diegetic_music
這一刀切下去,就是為什麼 MiniMax H3 影片轉提示詞的結果末尾會掛著兩個聲音欄位,也是為什麼少了它們的結果等於把這個模型浪費掉一半。
30 秒的片子塞不進 15 秒的鐘
H3 只出 4 到 15 秒,而你的參考片多半不在這個區間裡。
你的參考片30 秒 —— 掐掉贅句,拍點重新分布
H3 出片4–15 秒,24 影格每秒
把它的時間戳記原樣搬過去,會直接違反一條寫明的官方規則——與請求長度矛盾的時間安排會被打回——所以倒推器改成重排。挑一個目標長度,要緊的拍點(切點、動作峰值、聲音事件)會留下並重新分布。或者乾脆從來源裡拖出一段,只取那一段;緊湊的四秒通常比鬆垮的三十秒更好倒推。
測試裡得出兩個可以直接用的數字:一顆有真實動作變化的鏡頭大約要三秒,一顆靜態的情緒鏡頭兩秒就夠——所以八秒裝得下大約兩顆鏡頭,十五秒大約三顆。選段器會把它留下的拍點和丟掉的拍點都標出來,機器的品味你可以一票否決。
影格會在 24 影格每秒下對齊 H3 的 17n+5 格線,而每一個重排過的時間戳記,都會在你複製之前跟你挑的長度核對一遍。
什麼時候 MiniMax H3 影片轉提示詞是錯的工具
要留住就交檔案,要重做才寫提示詞。
想學它
這支片子為什麼好看?這一頁
想做一支像它的
一支帶著它那股勁的新片子這一頁
想留住
留住原本的取景、光或者配樂參考圖生影片
想改它
幫真實素材換聲音,或者接著往下拍影片轉影片
傳不上去
別人的素材,或者不能外傳的內容只有這一頁走得通
提示詞是一段描述,而描述是故意有損的。目標要是搞懂一支片子為什麼好看,或者做一支帶著它那股勁的新片,這份損耗正是重點。目標要是留住原本的取景、打光或者配樂,就別再描述了,直接把片子交給 H3——參考模式保住的是重寫只能逼近的東西;幫真實素材換聲音或者接著往下拍,那是 影片轉影片 的活。
提示詞是唯一那條路的情況只有一種:來源根本傳不上去——別人的素材、不能外傳的內容——因為你自己寫出來的描述歸你,一份拷貝永遠做不到這一點。
重現別人的片子:界線畫在哪裡
風格不受保護,某一部具體的作品受保護。
- 風格看出一支片子吃的是黃昏光加一個緩慢推進,沒問題。
- 某一部具體作品把一部認得出來的作品一顆鏡頭一顆鏡頭複製出來,不行。
- 真實的人把一個真實、認得出來的人描述給模型,也不行。
- 音樂寫情緒和配器;不要去重建某一首具體的歌。
- 商標與商品不管影片是怎麼做出來的,它們都受保護。你的產出要是會被認成別人的東西,先去問對方。
怎麼把一支參考片變成 MiniMax H3 提示詞
它讀的是影格和音訊,不是抽出來的關鍵影格——所以聲音才能自己成一組欄位回來。
貼一條連結,或者上傳一支片子
60 秒、50 MB 以內。直接連結和檔案一樣好用。
≤60 秒,≤50 MB讓七遍通讀跑完
切點、構圖、主體、環境、動作、運鏡和聲音,分開讀。
七遍通讀看分鏡表和那兩個聲音欄位
對白會帶著說話者編號、語氣和語言標記轉寫回來;環境音與配樂各自獨立。
官方欄位順序把重排好的提示詞拿走
時間戳記會從你片子的長度重排到 4–15 秒的目標上,所以結果拿去就能跑。
重排到 4–15 秒
不用帳號每週倒推一次,登入後三次,之後每次 5 點數。
MiniMax H3 影片轉提示詞常見問題
把一支片子倒推回提示詞之前,先知道這些
MiniMax H3 影片轉提示詞是什麼?
我會拿回一模一樣的影片嗎?
為什麼不用通用的影片轉提示詞工具?
我是不是乾脆把這支片子當參考素材用?
我的來源有四十秒,會怎麼樣?
它會把對白轉寫出來嗎?
拿到提示詞之後要做什麼?
重現別人的影片合法嗎?
我可以貼什麼、上傳什麼,最長可以多久?
片子裡沒有人說話,還能用嗎?
它是免費的嗎?
可以反過來嗎——從想法出提示詞?
由 MiniMax H3 AI Video Generator 編輯團隊撰寫與維護發布於 最後更新 工具版本 2026.09.4