Alternatives

MiniMax M3 lee video. No puede renderizar ni un fotograma — éste es el modelo que sí

MiniMax M3 mete video y saca texto — nunca un fotograma renderizado. Qué modelo de MiniMax hace video de verdad, y qué ve M3 dentro de un clip.

8 min de lecturaRedacciónRedacción
MiniMax M3 lee video. No puede renderizar ni un fotograma — éste es el modelo que sí

MiniMax M3 no genera video, y nunca lo ha hecho. Lo que hace es meter video hacia dentro — hasta unos treinta minutos de material en una sola petición — y sacar texto. Descripciones, críticas, listas de planos, código. El modelo de MiniMax que renderiza video es H3, publicado dos meses después que M3 y a una letra de distancia en la cadena de la API.

Hay dos maneras de haber llegado hasta aquí, y necesitan respuestas opuestas.

Si viniste buscando un generador de video de MiniMax M3, el modelo que quieres se llama H3 y puedes hacer un clip con él ahora mismo — misma empresa, letra correcta. Si de verdad querías decir M3 y quieres saber qué hace con el material, sigue leyendo. La respuesta es mucho más concreta que “nada”, y el límite real no es el de la ficha técnica.

¿MiniMax M3 puede generar video?

No. Fui primero a la etiqueta de pipeline, porque resuelve la pregunta en una sola consulta y puedes repetirla en menos de un minuto.

MiniMax M3MiniMax H3
Etiqueta de pipeline en Hugging Faceimage-text-to-textimage-text-to-video
Cadena del modelo en la APIMiniMax-M3MiniMax-H3
Endpoint/v1/chat/completions/v2/video_generation
Cómo se llamaChat, síncronoCrear una tarea, sondear el id, recoger el archivo
Se factura enTokensSegundos de salida
Qué vuelveTextoUn MP4

La etiqueta de pipeline es la vía rápida. Es un campo declarado en el repositorio del modelo y nombra la modalidad de salida — la de M3 dice texto. Un modelo cuya etiqueta de tarea termina en -to-text no tiene ningún camino hacia un archivo de video, se redacte como se redacte la petición.

La fila de la facturación es la que muerde a los equipos más que a las personas. Presupuesta un proyecto sobre el modelo equivocado aquí y la estimación no queda un poco desviada: queda en la unidad equivocada — tokens contra segundos de salida — y aguas abajo no hay nada que lo reconcilie.

Dale un clip a M3 y esto es lo que puede ver de verdad

Conviene saberlo aunque tú sólo hagas video, porque M3 resulta útil en el camino de entrada.

M3 es multimodal de nacimiento: el texto, las imágenes y el video llegan todos por el mismo endpoint de chat, entrenados juntos desde el principio y no a través de un adaptador de visión atornillado a un modelo de texto. La ficha de despliegue de NVIDIA pone el techo de formato largo en unos 30 minutos de material por petición, y MiniMax informa de un 84,6 en Video-MME con 512 fotogramas — es su propia evaluación, así que léelo como una cifra del proveedor.

Hay tres cosas que importan más que esa puntuación.

El video entra como fotogramas, no como archivo. Muestreas el clip y pasas una secuencia ordenada de imágenes. La evaluación publicada por la propia MiniMax muestreó a 1 FPS.

Lo que convierte el techo en un presupuesto de tokens disfrazado de duración. Cada fotograma que muestreas gasta parte de la ventana de contexto de 1 048 576 tokens. Por eso el límite aparece como minutos en una página de despliegue y como fotogramas en una configuración de evaluación: 512 fotogramas a 1 FPS son unos ocho minutos y medio de material real. Media hora es media hora sólo si estás dispuesto a mirarla a un fotograma por segundo — muestrea dos minutos a 12 FPS y habrás gastado el mismo presupuesto en una doceava parte de la duración. Fija tu frecuencia de muestreo contra el plano, no contra la longitud del archivo.

M3 no puede oír tu clip. La vía del video es una secuencia de imágenes fijas y la banda sonora no viaja con ellas. La pista está en el propio montaje de Video-MME de MiniMax, que intercalaba los subtítulos como texto cada 30 segundos en lugar de meter audio. Así que cualquier cosa que M3 diga sobre el diálogo, la música o el tono de sala la ha deducido de las imágenes y de cualquier texto que tú le hayas dado. Si el diálogo importa, pega una transcripción.

Lo que deja una inversión limpia para acordarse de la pareja: a H3 lo define el sonido que produce, y a M3 el sonido que no puede recibir. Misma empresa, dos meses de diferencia.

Si el trabajo de verdad es describir material que ya tienes, nuestra herramienta de video a prompt hace la versión con forma de H3: lee un clip y devuelve un prompt estructurado desde el que puedes renderizar directamente, en vez de una prosa que después tienes que convertir a mano.

Cuatro nombres responden ya a “MiniMax 3”

Nombre que visteQué es¿Hace video?
MiniMax H3El modelo de video. Entra texto, imágenes, video y audio; salen de 4 a 15 segundos, hasta 2K
MiniMax H3 MaxEl H3 posentrenado de fal — más rápido, con tope en 768p, dos endpoints, con un techo más bajo
MiniMax M3El modelo de texto, de código y de agentes. Lee video, escribe textoNo
Music-3.0El modelo de música de MiniMaxNo

En 2026 salieron tres productos con un 3 en el nombre, las cadenas de API de dos de ellos se diferencian en un carácter, y MiniMax vende la ventana de un millón de tokens de M3 como “comprensión de video largo” — que es exacto, e indistinguible de la generación de video a primera vista.

H3 Max es la manera más nueva de aterrizar en el sitio equivocado. Es un modelo real y avalado por MiniMax, listado junto a H3 en la propia documentación de MiniMax, pero no es uno que puedas intercambiar sin más: sólo alojado, sin pesos publicados, y 768p en vez de 2K. Qué maximiza de verdad el “Max”, y a qué renuncia recorre el intercambio entero.

Qué modelo necesita tu trabajo

Qué tiene que salirEl modeloDónde
Un video, con sonido, a partir de una idea escritaMiniMax H3Texto a video
Un video que arranca de una foto que ya tienesMiniMax H3Foto a video
Un video que sostiene un personaje, una voz o un estilo entre cortesMiniMax H3Referencia a video
Un prompt o una descripción sacados de material que ya tienescualquiera de los dosVideo a prompt
Texto, código, un agente, una lectura de contexto largoMiniMax M3Las páginas de M3 de la propia MiniMax

Que M3 escriba el prompt y H3 lo renderice

M3 sí tiene un trabajo en una canalización de video. Lo que no tiene es el trabajo de renderizar.

H3 no quiere una frase. Quiere una descripción estructurada y larga — plano a plano, con los movimientos de cámara, los tiempos y el sonido escritos en campos con nombre. MiniMax construye esa descripción con una etapa alojada llamada Context-IR que no está en la publicación abierta, y su propia guía invita a los desarrolladores a construirse su preprocesado.

M3 encaja en ese hueco casi demasiado bien. Una ventana de un millón de tokens sostiene a la vez una guía de estilo de marca y una lista de planos; la entrada nativa de imagen y video significa que puede leer tu material de referencia; y saca texto, que es exactamente lo que H3 consume. Así que la canalización es M3 escribe el prompt, H3 lo renderiza — y la búsqueda que te trajo hasta aquí estaba a una letra de un flujo de trabajo real, más que de un error.

El traspaso completo — el prompt de sistema que hace que M3 emita el formato de tres campos de H3, lo que cuesta el intercambio frente al render, y dónde divergen las dos licencias — está en MiniMax H3 frente a MiniMax M3. Para saltarte el montaje, nuestro generador de prompts produce la misma estructura en el navegador.

MiniMax M3 y el video: preguntas frecuentes

¿MiniMax M3 es un modelo de video? Es un modelo multimodal que lee video. No es un modelo de generación de video — su etiqueta de pipeline es image-text-to-text.

¿MiniMax M3 puede hacer texto a video? No. H3 sí, y es el modelo que MiniMax construyó para eso.

¿Qué es ese “generador de video de MiniMax M3” que veo anunciado por ahí? Casi siempre una interfaz de MiniMax H3 que usa la grafía M3 para pescar esta búsqueda. El generador es real; el nombre del modelo que lleva encima está mal.

¿H3 Max es lo mismo que M3? No, y estos dos son la pareja más fácil de confundir. H3 Max hace video y es un H3 posentrenado; M3 hace texto. La letra compartida es una casualidad.

¿M3 entiende el audio de un video que le suba? No. Los fotogramas entran, la banda sonora no. Pega una transcripción como texto cuando el diálogo importe.

¿Cuántos parámetros tiene MiniMax M3? Unos 428B en total, más o menos 23B activos por token, repartidos en 128 expertos con cuatro activados por token. Los metadatos de safetensors de Hugging Face informan de 427 040 140 160 exactos.

¿MiniMax M3 y MiniMax H3 son los dos de pesos abiertos? Los dos publican pesos bajo licencias restringidas que no son código abierto según la OSI, y las restricciones tienen forma distinta — M3 no lleva ningún límite de territorio y H3 excluye cuatro mercados. Qué restringe de verdad la licencia de H3 desmenuza ese lado.

Yo sólo quiero hacer un video. Empieza por el texto a video de MiniMax H3 — sin M3 de por medio, y el sonido llega en la misma pasada.


Última verificación: 31 de agosto de 2026. El techo de los 30 minutos es la cifra de despliegue publicada por NVIDIA y no una garantía de la API de MiniMax, y la puntuación de Video-MME es de la propia MiniMax — las dos van con fuente para que puedas volver a comprobarlas en vez de creértelas. MiniMax publica lo bastante rápido como para que un cuarto “3” sea una posibilidad viva.

Redacción

Escrito por

Redacción

minimax-h3ai.video

Publicado en el generador de video con IA MiniMax H3, una interfaz independiente de terceros construida sobre MiniMax H3.

Todos los artículos