O MiniMax M3 lê vídeo. Ele não renderiza um único quadro — este é o modelo que renderiza.
O MiniMax M3 recebe vídeo e devolve texto — nunca um quadro renderizado. Qual modelo da MiniMax faz vídeo de verdade, e o que o M3 enxerga num clipe.

O MiniMax M3 não gera vídeo, e nunca gerou. Ele recebe vídeo para dentro — até cerca de trinta minutos de imagem numa requisição — e escreve texto para fora. Descrições, críticas, listas de tomadas, código. O modelo da MiniMax que renderiza vídeo é o H3, lançado dois meses depois do M3, a uma letra de distância na string da API.
Existem dois jeitos de você ter chegado aqui e eles pedem respostas opostas.
Se você veio procurando um gerador de vídeo MiniMax M3, o modelo que você quer se chama H3 e você pode fazer um clipe com ele agora — mesma empresa, letra certa. Se você quis dizer M3 mesmo e quer saber o que ele faz com imagem em movimento, siga lendo. A resposta é bem mais específica que «nada», e o limite de verdade não é o da ficha técnica.
O MiniMax M3 consegue gerar vídeo?
Não. Fui primeiro à tag de pipeline, porque ela resolve a pergunta numa consulta só e você consegue repetir isso em menos de um minuto.
| MiniMax M3 | MiniMax H3 | |
|---|---|---|
| Tag de pipeline no Hugging Face | image-text-to-text | image-text-to-video |
| String do modelo na API | MiniMax-M3 | MiniMax-H3 |
| Endpoint | /v1/chat/completions | /v2/video_generation |
| Como você chama | Chat, síncrono | Crie uma tarefa, consulte o id, busque o arquivo |
| Cobrado em | Tokens | Segundos de saída |
| O que volta | Texto | Um MP4 |
A tag de pipeline é a via rápida. É um campo declarado no repositório do modelo
e ela nomeia a modalidade de saída — a do M3 diz texto. Um modelo cuja tag de
tarefa termina em -to-text não tem caminho nenhum até um arquivo de vídeo,
seja como for que a requisição esteja escrita.
A linha da cobrança é a que morde equipes em vez de pessoas. Orce um projeto no modelo errado aqui e a estimativa não fica um pouquinho fora, ela fica na unidade errada — tokens contra segundos de saída — e nada lá na frente concilia isso.
Entregue um clipe ao M3 e veja o que ele de fato enxerga
Vale saber mesmo que você só faça vídeo, porque o M3 acaba sendo útil no caminho de entrada.
O M3 é multimodal nativo: texto, imagem e vídeo chegam todos pelo mesmo endpoint de chat, treinados juntos desde o começo em vez de por um adaptador de visão parafusado num modelo de texto. O cartão de implantação da NVIDIA põe o teto de forma longa em cerca de 30 minutos de imagem por requisição, e a MiniMax relata 84,6 no Video-MME com 512 quadros — avaliação dela mesma, então leia como reportado pelo fornecedor.
Três coisas importam mais que essa nota.
O vídeo entra como quadros, não como arquivo. Você amostra o clipe e passa uma sequência ordenada de imagens. A avaliação publicada pela própria MiniMax amostrou a 1 FPS.
O que faz do teto um orçamento de tokens fantasiado de duração. Cada quadro que você amostra gasta uma parte da janela de contexto de 1.048.576 tokens. É por isso que o limite aparece como minutos numa página de implantação e como quadros numa configuração de avaliação: 512 quadros a 1 FPS são cerca de oito minutos e meio de imagem real. Meia hora é meia hora só se você aceitar olhar para ela um quadro por segundo — amostre dois minutos a 12 FPS e você gastou o mesmo orçamento num doze avos da duração. Ajuste a sua taxa de quadros à tomada, não ao tamanho do arquivo.
O M3 não consegue ouvir o seu clipe. O caminho de vídeo é uma sequência de quadros parados e a trilha sonora não viaja com eles. A pista está na própria configuração de Video-MME da MiniMax, que intercalou legendas como texto a cada 30 segundos em vez de alimentar áudio. Então qualquer coisa que o M3 diga sobre diálogo, música ou som do cômodo, ele inferiu de imagens e do texto que você entregou. Se o diálogo importa, cole uma transcrição.
O que deixa uma inversão bonita para lembrar a dupla: o H3 se define pelo som que ele produz, o M3 pelo som que ele não consegue receber. Mesma empresa, dois meses de diferença.
Se descrever imagens que você já tem é o trabalho de verdade, a nossa ferramenta de vídeo para prompt faz a versão em formato H3: ela lê um clipe e devolve um prompt estruturado do qual você renderiza direto, em vez de prosa que você depois tem de converter à mão.
Quatro nomes agora atendem por «MiniMax 3»
| Nome que você viu | O que é | Faz vídeo? |
|---|---|---|
| MiniMax H3 | O modelo de vídeo. Texto, imagem, vídeo e áudio entram; de 4 a 15 segundos saem, até 2K | Sim |
| MiniMax H3 Max | O H3 pós-treinado da fal — mais rápido, limitado a 768p, dois endpoints | Sim, com teto mais baixo |
| MiniMax M3 | O modelo de texto, código e agente. Lê vídeo, escreve texto | Não |
| Music-3.0 | O modelo de música da MiniMax | Não |
Três produtos com um 3 no nome saíram em 2026, as strings de API de dois deles diferem por um caractere, e a MiniMax vende a janela de um milhão de tokens do M3 como «entendimento de vídeo longo» — o que é exato, e indistinguível de geração de vídeo numa olhada rápida.
O H3 Max é o jeito mais novo de cair no lugar errado. É um modelo real chancelado pela MiniMax, listado ao lado do H3 na documentação dela mesma, mas não é um que você troque à vontade: só hospedado, sem pesos publicados, 768p em vez de 2K. O que o «Max» maximiza de verdade, e o que ele abre mão percorre a troca inteira.
De qual modelo o seu trabalho precisa
| O que tem de sair | O modelo | Onde |
|---|---|---|
| Um vídeo, com som, a partir de uma ideia escrita | MiniMax H3 | Texto para vídeo |
| Um vídeo que parte de uma foto que você tem | MiniMax H3 | Imagem para vídeo |
| Um vídeo segurando um personagem, uma voz ou um estilo entre cortes | MiniMax H3 | Referência para vídeo |
| Um prompt ou uma descrição a partir de imagens que você já tem | qualquer um dos dois | Vídeo para prompt |
| Texto, código, um agente, uma leitura de contexto longo | MiniMax M3 | As páginas do M3 da própria MiniMax |
Deixe o M3 escrever o prompt, e o H3 renderizar
O M3 tem sim um trabalho num pipeline de vídeo. Só não é o trabalho de renderizar.
O H3 não quer uma frase. Ele quer uma descrição longa e estruturada — tomada a tomada, com movimentos de câmera, tempos e som escritos em campos nomeados. A MiniMax monta essa descrição com um estágio hospedado chamado Context-IR que não está na versão aberta, e a orientação dela mesma convida quem desenvolve a construir o próprio pré-processamento.
O M3 encaixa nessa abertura quase bem demais. Uma janela de um milhão de tokens segura um guia de marca e uma lista de tomadas ao mesmo tempo; entrada nativa de imagem e vídeo quer dizer que ele consegue ler o seu material de referência; e ele produz texto, que é exatamente o que o H3 consome. Então o pipeline é o M3 escreve o prompt, o H3 renderiza — e a busca que te trouxe até aqui estava a uma letra de um fluxo de trabalho real, em vez de ser um erro.
A passagem de bastão completa — o system prompt que faz o M3 emitir o formato de três campos do H3, quanto essa troca custa contra o render, e onde as duas licenças divergem — está em MiniMax H3 contra MiniMax M3. Para pular a construção disso, o nosso gerador de prompt produz a mesma estrutura no navegador.
MiniMax M3 e vídeo: perguntas frequentes
O MiniMax M3 é um modelo de vídeo?
É um modelo multimodal que lê vídeo. Não é um modelo de geração de vídeo — a
tag de pipeline dele é image-text-to-text.
O MiniMax M3 faz texto para vídeo? Não. O H3 faz, e é o modelo que a MiniMax construiu para isso.
O que é esse «gerador de vídeo MiniMax M3» que eu vejo anunciado? Quase sempre uma interface de MiniMax H3 usando a grafia M3 para pegar esta busca. O gerador é real; o nome do modelo nele está errado.
O H3 Max é a mesma coisa que o M3? Não, e esses dois são o par mais fácil de trocar sem querer. O H3 Max faz vídeo e é um H3 pós-treinado; o M3 faz texto. A letra em comum é coincidência.
O M3 entende o áudio de um vídeo que eu subo? Não. Os quadros entram, a trilha não. Cole uma transcrição como texto quando o diálogo importar.
Quantos parâmetros o MiniMax M3 tem? Cerca de 428B no total, uns 23B ativos por token, em 128 experts com quatro ativados por token. Os metadados safetensors do Hugging Face reportam 427.040.140.160 exatamente.
MiniMax M3 e MiniMax H3 são os dois de pesos abertos? Os dois publicam pesos sob licenças restritas que não são código aberto pela OSI, e as restrições têm formatos diferentes — o M3 não traz limite de território, o H3 exclui quatro mercados. O que a licença do H3 restringe de verdade destrincha esse lado.
Eu só quero fazer um vídeo. Comece pelo texto para vídeo do MiniMax H3 — sem precisar de M3, e o som chega na mesma passagem.
Última verificação em 31 de agosto de 2026. O teto de 30 minutos é o número de implantação publicado pela NVIDIA e não uma garantia da API da MiniMax, e a nota do Video-MME é da própria MiniMax — os dois estão com fonte para você poder reconferir em vez de aceitar na confiança. A MiniMax lança rápido o bastante para um quarto «3» ser uma possibilidade viva.
Escrito por
Redação
minimax-h3ai.video
Publicado no gerador de vídeo com IA MiniMax H3, uma interface independente, de terceiros, construída sobre o MiniMax H3.


