Alternatives

MiniMax M3 讀影片。它連一個影格都算不出來——會算的是這一個。

MiniMax M3 把影片讀進去、把文字寫出來,從來不會算出一個影格。真正會做影片的是哪一個模型,以及 M3 在片子裡真正看得到什麼。

8 分鐘讀完編輯部編輯部
MiniMax M3 讀影片。它連一個影格都算不出來——會算的是這一個。

MiniMax M3 不生成影片,從來沒有過。 它把影片讀進去—— 一次請求最多大約三十分鐘的素材——然後把文字寫出來。描述、評述、鏡頭表、程式碼。 MiniMax 那個會算影片的模型是 H3,比 M3 晚兩個月釋出, 在 API 字串裡只差一個字母。

你會來到這裡有兩種可能,而它們需要相反的答案。

如果你是來找「MiniMax M3 影片生成器」的,你要的那個模型叫 H3, 你現在就可以用它做一支片子——同一家公司,正確的那個字母。 如果你真的是要問 M3,想知道它拿素材能做什麼,那就繼續讀。 答案比「什麼都不能」具體得多,而且真正的限制不在規格表上那一條。

MiniMax M3 生成得了影片嗎?

不行。我先去看 pipeline tag,因為它一次查詢就把問題解決了, 而且你一分鐘之內就能自己重做一遍。

MiniMax M3MiniMax H3
Hugging Face pipeline tagimage-text-to-textimage-text-to-video
API 模型字串MiniMax-M3MiniMax-H3
端點/v1/chat/completions/v2/video_generation
怎麼呼叫對話,同步建立任務、輪詢 id、取檔
計費單位token輸出秒數
回來的是文字一個 MP4

pipeline tag 是最快的那一個。它是模型倉庫上一個宣告好的欄位, 標的是輸出的模態——M3 那一欄寫的是文字。 一個任務標籤以 -to-text 結尾的模型,沒有任何路徑通向一個影片檔, 不管請求怎麼寫。

計費那一行咬的是團隊,不是個人。在這裡用錯模型去估一個專案, 估出來的不是稍微偏掉,而是單位就錯了——token 對輸出秒數—— 而下游沒有任何一個環節對得回來。

餵一支片子給 M3,它實際上看得到什麼

就算你只做影片,這件事也值得知道,因為 M3 在進去那一端其實有用。

M3 是原生多模態的:文字、圖片和影片都從同一個對話端點進去, 從一開始就一起訓練,而不是在一個文字模型上外掛一個視覺轉接器。 NVIDIA 的部署卡把長片的上限寫成每次請求大約 30 分鐘的素材, 而 MiniMax 回報 512 影格下 Video-MME 84.6 分—— 那是它自己的評測,所以請當成原廠自報的數字讀。

有三件事比那個分數更要緊。

影片是以影格進去的,不是以檔案。 你要對片子取樣, 然後傳進一串有順序的圖片。MiniMax 自己公布的評測是用 1 FPS 取樣的。

這就讓那個上限變成一個穿著時長外衣的 token 預算。 你取樣的每一個影格,都花掉 1,048,576 個 token 的上下文視窗的一部分。 這就是為什麼同一個限制在部署頁上以分鐘出現、在評測設定裡以影格出現: 1 FPS 下的 512 影格大約是真實素材的八分半。半小時之所以是半小時, 只在你願意一秒看一格的前提下成立——拿 12 FPS 去取樣兩分鐘, 你就用同樣的預算換到了十二分之一的時長。 你的取樣率要對著鏡頭設,不是對著檔案長度設。

M3 聽不見你的片子。 影片這條路是一串靜態影像,而聲音軌不跟著它們走。 線索就在 MiniMax 自己的 Video-MME 設定裡:它每 30 秒插入一段文字形式的字幕, 而不是把聲音餵進去。所以 M3 講的任何關於對白、音樂或房間底噪的話, 都是它從畫面和你給它的文字推出來的。如果對白很要緊,就把逐字稿貼進去。

於是剩下一組漂亮的對照可以拿來記住這一對: H3 由它產生的聲音定義,M3 由它收不進去的聲音定義。 同一家公司,相隔兩個月。

如果你真正的工作是描述你已經有的素材,我們的 影片轉提示詞工具 做的是 H3 形狀的那個版本: 它讀一支片子,回給你一份可以直接拿去算的結構化提示詞, 而不是一段你還得自己手動轉換的散文。

現在有四個名字都答應「MiniMax 3」

你看到的名字它是什麼做影片嗎?
MiniMax H3那個影片模型。文字、圖片、影片和聲音進去;出來 4–15 秒,最高 2K
MiniMax H3 Maxfal 後訓練過的 H3——更快,上限 768p,兩個端點,但天花板低一些
MiniMax M3那個文字、程式碼和代理模型。讀影片,寫文字
Music-3.0MiniMax 的音樂模型

2026 年出了三個名字裡帶 3 的產品,其中兩個的 API 字串只差一個字元, 而 MiniMax 用「長影片理解」來賣 M3 的百萬 token 視窗—— 說法準確,而且乍看之下跟影片生成分不出來。

H3 Max 是最新一種走錯地方的方式。它是一個真的、經 MiniMax 認可的模型, 在 MiniMax 自己的文件裡就列在 H3 旁邊,但它不是一個你可以隨意替換進去的東西: 只有託管、沒有公布權重、是 768p 而不是 2K。 「Max」到底最大化了什麼、又放棄了什麼 把整筆交換走了一遍。

你的工作需要哪一個模型

要出來的是什麼用哪個模型在哪裡
從一個寫下來的想法,做一支帶聲音的影片MiniMax H3文字轉影片
從你手上一張照片開始的影片MiniMax H3圖片轉影片
跨鏡頭守住同一個角色、聲音或風格的影片MiniMax H3參考圖生影片
從你已經有的素材裡生出一份提示詞或描述都可以影片轉提示詞
文字、程式碼、代理、長上下文閱讀MiniMax M3MiniMax 自己的 M3 頁面

讓 M3 寫提示詞,讓 H3 去算

M3 在影片流程裡確實有一份工作。只是不是算圖那一份。

H3 要的不是一句話。它要的是一份很長的結構化描述——逐鏡頭, 把運鏡、時間安排和聲音寫進具名的欄位裡。MiniMax 用一段叫 Context-IR 的託管階段來生成那份描述,而它不在開放釋出的範圍內, 它自己的指引則邀請開發者自己搭一層前處理。

M3 幾乎太適合填這個缺口了。百萬 token 的視窗可以同時裝下一份品牌風格指南 和一份鏡頭表;原生的圖片與影片輸入表示它讀得懂你的參考素材; 而它輸出文字,那正好是 H3 吃的東西。所以這條流程是 M3 寫提示詞、H3 去算—— 把你帶到這裡的那次搜尋,離一條真的工作流只差一個字母,而不是一個錯誤。

完整的交接——那段讓 M3 吐出 H3 三欄格式的系統提示詞、 這次來回相對於算圖要花多少錢、以及兩份授權在哪裡分岔——寫在 MiniMax H3 對比 MiniMax M3。 不想自己搭的話,我們的提示詞產生器 在瀏覽器裡產出同樣的結構。

MiniMax M3 與影片:常見問題

MiniMax M3 是影片模型嗎? 它是一個讀影片的多模態模型。它不是一個影片生成模型—— 它的 pipeline tag 是 image-text-to-text

MiniMax M3 做得了文字轉影片嗎? 不行。H3 做得到,而它就是 MiniMax 為此打造的模型。

那我一直看到有人打廣告的「MiniMax M3 影片生成器」是什麼? 幾乎永遠是一個 MiniMax H3 的介面,用 M3 這個拼法來接這個搜尋。 那個生成器是真的;掛在上面的模型名字是錯的。

H3 Max 跟 M3 是同一個東西嗎? 不是,而這兩個是最容易不小心搞混的一對。H3 Max 做影片,是後訓練過的 H3; M3 做文字。共用的那個字母是巧合。

我上傳一支影片,M3 聽得懂裡面的聲音嗎? 不能。進去的是影格,聲音軌不跟著走。對白要緊的時候,把逐字稿當文字貼進去。

MiniMax M3 有多少參數? 總共大約 428B,每個 token 大約啟用 23B,128 個專家中每個 token 啟用四個。 Hugging Face 的 safetensors 中繼資料報的精確值是 427,040,140,160。

MiniMax M3 和 MiniMax H3 都是開放權重嗎? 兩邊都以受限授權公布權重,而那些授權都不是 OSI 意義上的開源, 而且限制的形狀不一樣——M3 沒有地域限制,H3 排除四個市場。 H3 的授權到底限制了什麼 把那一邊拆開來講。

我只是想做一支影片。 從 MiniMax H3 的文字轉影片開始——不需要 M3, 而且聲音在同一次運算裡就到。


最後查核 2026 年 8 月 31 日。 那個 30 分鐘的上限是 NVIDIA 公布的部署數字, 不是 MiniMax API 的保證,而 Video-MME 的分數是 MiniMax 自己的—— 兩者都附了出處,所以你可以自己去重查,而不是照單全收。 MiniMax 出東西的速度,讓第四個「3」是一種現實的可能。

編輯部

作者

編輯部

minimax-h3ai.video

發布於 MiniMax H3 AI Video Generator,一個基於 MiniMax H3 的獨立第三方介面。

所有文章