MiniMax M3 로 동영상 만들기? 만드는 쪽은 H3
M3 는 영상을 받아 글을 돌려줄 뿐 한 프레임도 만들지 않습니다. 만드는 쪽은 H3 이고, M3 가 소재에서 무엇을 읽어 내는지도 함께 정리했습니다.

MiniMax M3 는 영상을 만들지 않습니다. 한 번도 만든 적이 없습니다. 영상은 들어가는 쪽이고, 한 요청에 최대 30분 분량까지 들어갑니다. 나오는 것은 글입니다. 설명, 비평, 숏 리스트, 코드. MiniMax 에서 영상을 만드는 모델은 H3 이고, M3 보다 두 달 뒤에 나왔으며, API 문자열에서 글자 하나 차이입니다.
이 페이지에 닿는 길은 둘이고, 그 둘은 반대의 답을 필요로 합니다.
「MiniMax M3 동영상 만들기」를 찾아 오셨다면 원하시는 모델의 이름은 H3 이고, 지금 바로 한 편 만들어 보실 수 있습니다. 같은 회사, 맞는 글자입니다. 말씀하신 것이 정말 M3 이고 그것이 소재를 두고 무엇을 하는지 알고 싶으시다면 계속 읽어 주십시오. 답은 「아무것도 못 한다」보다 훨씬 구체적이고, 진짜 한계는 사양표에 적힌 그것이 아닙니다.
MiniMax M3 는 영상을 만들 수 있습니까
없습니다. 제가 먼저 본 것은 pipeline tag 입니다. 한 번 찾아보면 끝나고, 1 분이면 직접 재현하실 수 있습니다.
| MiniMax M3 | MiniMax H3 | |
|---|---|---|
| Hugging Face pipeline tag | image-text-to-text | image-text-to-video |
| API 모델 문자열 | MiniMax-M3 | MiniMax-H3 |
| 엔드포인트 | /v1/chat/completions | /v2/video_generation |
| 호출 방식 | 대화, 동기 | 작업을 만들고, id 를 조회하고, 파일을 받습니다 |
| 청구 단위 | 토큰 | 결과물 초 |
| 돌아오는 것 | 글 | MP4 한 개 |
가장 빠른 줄이 pipeline tag 입니다. 모델 저장소에 명시된 필드이고 출력 모달리티를 그대로 이름 붙인 것인데, M3 쪽에는 text 라고 적혀 있습니다. task tag 가 -to-text 로 끝나는 모델은 요청을 어떻게 쓰더라도 영상 파일에 이르지 못합니다.
청구 줄은 개인이 아니라 팀의 발목을 잡습니다. 잘못된 모델로 뽑은 견적은 「조금 어긋난」 것이 아닙니다. 단위 자체가 다르고 — 토큰 대 결과물 초 — 뒷단 어디에서도 맞아떨어지지 않습니다.
M3 에 클립을 넣으면 실제로 무엇이 보이나
영상만 만드시는 분에게도 알아 둘 값이 있습니다. M3 가 진짜로 쓸모 있는 자리는 들어가는 쪽이거든요.
M3 는 태생부터 멀티모달입니다. 텍스트 · 이미지 · 영상이 같은 대화 엔드포인트로 들어가고, 처음부터 함께 학습되었습니다. 텍스트 모델에 비전 어댑터를 나중에 붙인 것이 아닙니다. NVIDIA 의 배포 카드는 장편 상한을 한 요청에 약 30분 분량으로 적어 두고, MiniMax 는 Video-MME 512 프레임에서 84.6 을 보고합니다. 자체 평가이니 벤더 자체 보고로 읽어 주십시오.
그 점수보다 중요한 것이 셋 있습니다.
영상은 프레임으로 들어갑니다. 파일로 들어가지 않습니다. 클립을 샘플링해서 순서가 있는 이미지 묶음을 넘깁니다. MiniMax 가 공개한 평가는 1 FPS 로 샘플링했습니다.
그러니 그 상한은 길이의 옷을 입은 토큰 예산입니다. 샘플링한 프레임 한 장마다 1,048,576 토큰짜리 맥락 창을 씁니다. 같은 제한이 배포 페이지에서는 분으로, 평가 설정에서는 프레임으로 나타나는 이유가 그것입니다. 512 프레임을 1 FPS 로 잡으면 실제 소재로는 8분 반쯤입니다. 30분이 30분인 것은 1초에 한 프레임씩 보아도 괜찮을 때뿐이고, 2분짜리 클립을 12 FPS 로 잡으면 같은 예산을 길이의 12분의 1 에 쓰신 셈이 됩니다. 프레임레이트는 파일 길이가 아니라 그 숏을 보고 정하십시오.
M3 는 여러분의 클립을 듣지 못합니다. 영상 경로는 정지 프레임의 나열이고 사운드트랙은 함께 실려 가지 않습니다. 단서는 MiniMax 자신의 Video-MME 설정에 있습니다. 오디오를 넣는 대신 30초마다 자막을 텍스트로 끼워 넣었습니다. 그러니 클립의 대사나 음악이나 공간음에 대해 M3 가 말하는 것은, 그림과 여러분이 건넨 글에서 추론한 것입니다. 대사가 중요하면 대본을 붙여 넣으십시오.
여기서 이 한 쌍을 기억할 깔끔한 뒤집힘이 남습니다. H3 는 내보내는 소리로 정의되고, M3 는 받아들이지 못하는 소리로 정의됩니다. 같은 회사, 두 달 차이.
이미 갖고 계신 소재를 설명하는 것이 진짜 일이라면, 저희 영상에서 프롬프트 추출이 H3 에 맞춘 판본을 합니다. 클립을 읽고, 나중에 손으로 옮겨야 하는 산문이 아니라 그대로 생성에 넣을 수 있는 구조화된 프롬프트를 돌려줍니다.
이제 「MiniMax 3」에 네 개의 이름이 대답합니다
| 보신 이름 | 무엇인지 | 영상을 만드나 |
|---|---|---|
| MiniMax H3 | 영상 모델. 텍스트 · 이미지 · 영상 · 오디오가 들어가고 4~15초가 최대 2K 로 나옵니다 | 만듭니다 |
| MiniMax H3 Max | fal 이 사후 학습한 H3 — 더 빠르고, 768p 에서 멈추고, 엔드포인트는 둘 | 만듭니다. 다만 천장이 낮습니다 |
| MiniMax M3 | 텍스트 · 코딩 · 에이전트 모델. 영상을 읽고 글을 씁니다 | 안 만듭니다 |
| Music-3.0 | MiniMax 의 음악 모델 | 안 만듭니다 |
2026년에 이름에 3 이 들어간 제품이 셋 나왔고, 그중 둘은 API 문자열이 한 글자 차이이며, MiniMax 는 M3 의 100만 토큰 창을 「장편 영상 이해」로 팝니다. 정확한 말이고, 훑어 읽으면 영상 생성과 구분되지 않습니다.
H3 Max 는 엉뚱한 자리에 내려앉는 가장 새로운 길입니다. MiniMax 가 인정한 진짜 모델이고 MiniMax 자체 문서에 H3 와 나란히 올라 있지만, 마음대로 바꿔 끼울 수 있는 것은 아닙니다. 호스팅만, 가중치 미공개, 2K 가 아니라 768p. 「Max」가 실제로 무엇을 Max 하고 무엇을 내주는지에서 그 거래를 처음부터 끝까지 걸어 봅니다.
이 일에 필요한 모델은 어느 쪽인가
| 나와야 하는 것 | 모델 | 어디서 |
|---|---|---|
| 써 둔 아이디어에서, 소리 붙은 영상 | MiniMax H3 | 텍스트로 동영상 만들기 |
| 갖고 계신 사진에서 출발하는 영상 | MiniMax H3 | 사진으로 동영상 만들기 |
| 컷을 넘나들며 인물 · 목소리 · 스타일을 지키는 영상 | MiniMax H3 | 레퍼런스 이미지로 동영상 만들기 |
| 이미 있는 소재에서 프롬프트나 설명 | 어느 쪽이든 | 영상에서 프롬프트 추출 |
| 글, 코드, 에이전트, 긴 맥락 읽기 | MiniMax M3 | MiniMax 자체의 M3 페이지 |
프롬프트는 M3 가 쓰고, 생성은 H3 가 한다
M3 에게도 영상 공정에 맡은 자리가 있습니다. 그 자리가 생성이 아닐 뿐입니다.
H3 가 원하는 것은 한 문장이 아닙니다. 길고 구조화된 서술입니다. 숏 하나하나에 카메라 움직임과 타이밍과 소리가 이름 붙은 필드로 적힌 것. MiniMax 는 그 서술을 Context-IR 이라는 호스트 측 단계로 만들고, 그 단계는 공개된 배포물에 들어 있지 않으며, MiniMax 자신의 안내도 개발자가 직접 전처리를 만들 것을 권합니다.
M3 는 그 빈자리에 지나칠 만큼 잘 맞습니다. 100만 토큰 창에는 브랜드 스타일 가이드와 숏 리스트가 동시에 들어가고, 태생적인 이미지 · 영상 입력은 참고 자료를 읽게 해 주며, 출력은 글 — 바로 H3 가 먹는 것입니다. 그래서 공정은 M3 가 프롬프트를 쓰고 H3 가 생성한다 이고, 여러분을 여기까지 데려온 검색은 실수라기보다 실재하는 워크플로에서 글자 하나만큼 빗나간 것이었습니다.
이 인계의 완전한 판본 — M3 에게 H3 의 세 필드 형식을 뱉게 하는 시스템 프롬프트, 그 왕복이 생성 자체에 견주어 얼마인지, 두 라이선스가 어디서 갈리는지 — 은 MiniMax H3 vs MiniMax M3 에 있습니다. 직접 만들지 않으시려면 프롬프트 생성기가 같은 구조를 브라우저에서 뽑아 줍니다.
MiniMax M3 와 영상: 자주 묻는 질문
MiniMax M3 는 영상 모델입니까?
영상을 읽는 멀티모달 모델입니다. 영상 생성 모델은 아닙니다 — pipeline tag 가 image-text-to-text 입니다.
MiniMax M3 로 텍스트로 동영상 만들기가 됩니까? 안 됩니다. H3 는 됩니다. MiniMax 가 그 일을 위해 만든 모델이 H3 입니다.
광고에서 계속 보이는 「MiniMax M3 동영상 만들기」는 무엇입니까? 거의 언제나, 이 검색을 받으려고 M3 라는 철자를 쓴 MiniMax H3 인터페이스입니다. 만드는 기능은 진짜이고, 위에 붙은 모델 이름이 틀렸습니다.
H3 Max 와 M3 는 같은 것입니까? 아닙니다. 그리고 이 둘이 실수로 바꿔 잡기 가장 쉬운 짝입니다. H3 Max 는 영상을 만드는 사후 학습판 H3 이고, M3 는 글을 만듭니다. 글자가 겹치는 것은 우연입니다.
올린 영상 속 소리를 M3 가 이해합니까? 못 합니다. 들어가는 것은 프레임이고 사운드트랙은 들어가지 않습니다. 대사가 중요하면 대본을 글로 붙여 넣으십시오.
MiniMax M3 의 파라미터는 몇 개입니까? 전체 약 428B, 토큰당 약 23B 가 활성화되며, 128 개 전문가 가운데 넷이 토큰마다 켜집니다. Hugging Face 의 safetensors 메타데이터는 427,040,140,160 이라고 정확히 보고합니다.
MiniMax M3 와 MiniMax H3 는 둘 다 오픈 웨이트입니까? 둘 다 가중치를 공개하지만 라이선스에 제한이 있어 OSI 오픈소스가 아니며, 제한의 모양도 다릅니다. M3 에는 지역 제한이 없고 H3 는 네 시장을 제외합니다. H3 라이선스가 실제로 막는 것이 그쪽을 분해합니다.
그냥 영상 한 편 만들고 싶습니다. MiniMax H3 의 텍스트로 동영상 만들기부터 시작하십시오. M3 는 필요 없고, 소리도 같은 생성에서 함께 나옵니다.
최종 확인 2026년 8월 31일. 30분이라는 상한은 NVIDIA 가 공개한 배포 수치이지 MiniMax 의 API 보장이 아니고, Video-MME 점수는 MiniMax 자신의 것입니다. 둘 다 출처를 밝혀 두었으니 그대로 믿는 대신 직접 다시 확인하실 수 있습니다. MiniMax 의 출하 속도라면 네 번째 「3」도 충분히 가능합니다.


