MiniMax H3 : extraire le prompt d’une vidéo
Regardez un clip, récupérez le prompt qui pourrait en faire un semblable — les trois champs, dans l’ordre attendu par H3.
Votre prompt structuré
integrated_multimodal_descriptionplans · caméra · dialoguesoverall_soundscapece que la scène produitnon_diegetic_musicou None.
Découpé en champs, pas en prose — avec les horodatages déjà réajustés.
Essayez un clip d’exemple : , , ,
Avant de copier
- Le style, oui ; une œuvre reconnaissable, non.
- Les personnes réelles et identifiables doivent consentir.
- Décrivez une ambiance, pas un morceau précis.
Votre premier clip sur ce site est offert — sans carte.
Ce que MiniMax H3 extrait vraiment
d’une vidéo
Un prompt, pas une légende.

Votre clip
Restitué en champs, pas en prose
MiniMax H3 en extraction de prompt regarde votre clip — les images et l’audio — et réécrit le prompt structuré qui pourrait en produire un semblable : une liste de plans numérotés avec les mouvements de caméra et les horodatages, le son de la scène, et la musique, dans les trois champs étiquetés que H3 lit. Les outils génériques rendent un paragraphe sur l’image. H3 ne prend pas de paragraphes, et la moitié de ce que fait votre clip s’entend. Collez un lien ou déposez un fichier ; la première extraction de chaque semaine ne demande pas de compte.
- Passes sur le clip
- 7
- Champs étiquetés en sortie
- 3
- Source qu’il lira
- ≤ 60 s
- Horodatages réajustés à
- 4 à 15 s
Passes sur le clip
Champs étiquetés en sortie
Source qu’il lira
Horodatages réajustés à
- Pas d’échantillonnage d’images clés
- Pas de paragraphe en prose
- Sans compte
Cinq choses qu’on prend à un clip de référence
Nommer la cible change quelle passe compte le plus, à quel point la formulation doit être exacte, et si un prompt écrit est même le bon véhicule.
Style
ÉTALONNAGE
Étalonnage, lumière, texture — le rendu avant que quoi que ce soit bouge.
Composition
CADRE
Cadrage et placement : où les choses se posent et comment l’œil circule.
Mouvement
TRAJET
Chorégraphie et trajet de caméra, écrits en type, amplitude et vitesse.
Son
MIXAGE
Le mixage qui donne l’impression que c’est cher, en trois couches.
Personnage
QUI
Qui est à l’écran — et le seul objectif qui commence par un consentement.
Droit à l’image, plus bas
Un clip de danse et une publicité de parfum peuvent partager un étalonnage, mais on les remonterait pour des raisons opposées — le premier pour son mouvement, la seconde pour sa lumière. Choisissez l’objectif dans l’extracteur et l’accent se déplace avec lui.
Des rushes aux champs : les sept passes
L’extraction lit un plan dans l’ordre où le guide de prompt officiel en commande un : composition, sujet, environnement, action, caméra, son — et le moment exact où chaque chose citée apparaît.
Coupes
Combien il y a de plans et où ils se coupent.
[Shot n] · À 00:0x.xxx
Composition
Échelle de plan et hauteur de caméra, lues plan par plan.
Ouvre chaque plan
Sujet
Assez précis pour qu’un inconnu puisse le redessiner — « une femme d’une trentaine d’années, carré noir court, trench gris oversize », jamais « une femme ».
Description du sujet
Environnement
Le lieu, la météo et la direction de la lumière. H3 traite la lumière comme de la physique : « lumière de fenêtre venant de la gauche du cadre » vaut mieux que « belle lumière ».
Description de l’environnement
Action
Ce qui se passe vraiment, dans l’ordre.
Description de l’action
Caméra
Écrit comme H3 l’exécute : type, amplitude, vitesse. « Travelling avant lent, faible amplitude » survit au trajet. « Mouvement cinématographique fluide » non — il n’y a rien à exécuter dedans.
Description de la caméra
Son
Les trois couches ci-dessous, et la passe que tous les autres outils sautent.
Deux champs sonores + les dialogues
Les trois sons que produit votre clip
Les outils à images clés échantillonnent des images fixes : autrement dit, ils analysent votre clip en sourdine.
L’extraction, ici, écoute, et sépare ce qu’elle entend en trois, parce que H3 prend chaque couche à un endroit différent. Le test entre les deux dernières tient en une question : les gens dans le clip pourraient-ils l’entendre ?

Dialogue
Les mots que les gens disent réellement, transcrits avec un identifiant de locuteur, une intention de jeu et une étiquette de langue, placés à l’intérieur de la description du plan.
(S1) says warmly, [French] …
Ambiance
Tout ce que la scène produit elle-même : la pluie sur un auvent, un couteau sur une planche, la circulation deux rues plus loin — chaque source avec une distance et un moment où elle arrive.
overall_soundscape
Musique
Ce que seul le public entend : les instruments, le tempo, où ça monte et où ça s’arrête. Si le clip n’en a pas, le champ dit None — ce qui est déjà une instruction que H3 suit.
non_diegetic_music
C’est cette séparation qui fait qu’un résultat d’extraction de prompt MiniMax H3 a deux champs sonores à la fin, et qu’un résultat sans eux gâche la moitié du modèle.
Un clip de 30 secondes ne tient pas dans une horloge de 15 secondes
H3 génère de 4 à 15 secondes, et votre référence ne fait probablement pas ça.
Votre référence30 s — remplissage retiré, temps réespacés
Sortie H34 à 15 s à 24 fps
Recopier ses horodatages tels quels enfreint une règle officielle explicite — un minutage qui contredit la durée demandée est refusé — donc l’extracteur remappe à la place. Choisissez une durée cible et les temps qui comptent (coupes, pics d’action, événements sonores) sont gardés et réespacés. Ou bien isolez une seule section de la source et ne prenez que celle-là ; quatre secondes serrées se remontent en général mieux que trente secondes lâches.
Deux chiffres de travail issus des tests : un plan avec un vrai changement d’action demande environ trois secondes, et un plan d’ambiance statique tient sur deux — donc huit secondes portent à peu près deux plans, quinze environ trois. Le sélecteur montre les temps qu’il a gardés et ceux qu’il a laissés, pour que vous puissiez opposer votre veto au goût de la machine.
Les images se calent sur la grille 17n+5 de H3 à 24 fps, et chaque horodatage remappé est vérifié contre la durée que vous avez choisie avant que vous ne copiiez quoi que ce soit.
Quand l’extraction de prompt MiniMax H3 n’est pas le bon outil
On préserve avec le fichier, on recrée avec le prompt.
En apprendre
Pourquoi ce clip fonctionne-t-il ?Cette page
En faire un semblable
Un nouveau clip dans son espritCette page
Le garder
Garder le cadrage, la lumière ou la bande-sonImage de référence
Le changer
Redoubler ou prolonger les images d’origineVidéo à vidéo
Impossible à envoyer
Des images d’autrui ou privéesCette page — le seul chemin
Un prompt est une description, et une description perd de l’information exprès. Si le but est de comprendre pourquoi un clip fonctionne, ou d’en faire un nouveau dans son esprit, cette perte est justement le but. Si le but est de garder le cadrage, la lumière ou la bande-son d’origine, arrêtez de décrire et donnez le clip lui-même à H3 — le mode référence préserve ce qu’une réécriture ne peut qu’approcher, et redoubler ou prolonger les images réelles, c’est le travail de vidéo à vidéo.
Le seul cas où le prompt est le seul chemin, c’est quand la source ne peut pas être envoyée du tout — des images d’autrui, du matériel privé — parce qu’une description que vous avez écrite est à vous d’une façon qu’une copie ne sera jamais.
Recréer le clip de quelqu’un d’autre : où passe la limite
Le style n’est pas protégeable ; une œuvre précise l’est.
- StyleRetenir qu’un clip s’appuie sur une lumière d’heure dorée et un lent travelling avant, c’est permis.
- Une œuvre préciseReproduire plan par plan une œuvre reconnaissable, non.
- Une personne réelleDécrire une personne réelle et identifiable à un modèle, non plus.
- MusiqueDécrivez une ambiance et une instrumentation ; ne reconstruisez pas un morceau précis.
- Logos et produitsProtégés quelle que soit la façon dont la vidéo a été faite. Si votre résultat pouvait être reconnu comme l’œuvre de quelqu’un d’autre, demandez-lui d’abord.
Comment transformer un clip de référence en prompt MiniMax H3
Il lit les images et l’audio, pas des images clés échantillonnées : c’est pour ça que le son revient dans ses propres champs.
Collez une URL ou envoyez un clip
Jusqu’à 60 secondes et 50 Mo. Un lien direct marche aussi bien qu’un fichier.
≤ 60 s, ≤ 50 MoLaissez tourner les sept passes
Coupes, composition, sujet, environnement, action, caméra et son sont lus séparément.
Sept passesLisez la liste des plans et les deux champs sonores
Les dialogues reviennent transcrits avec identifiant de locuteur, intention de jeu et étiquette de langue ; l’ambiance sonore et la musique restent séparées.
Ordre officiel des champsPrenez le prompt réajusté
Les horodatages sont remappés de la durée de votre clip vers une cible de 4 à 15 secondes, si bien que le résultat est générable tel quel.
Remappé sur 4 à 15 s
Une extraction par semaine sans compte, trois une fois connecté, puis 5 crédits chacune.
FAQ : extraire le prompt d’une vidéo avec MiniMax H3
Ce qu’il faut savoir avant d’extraire le prompt d’un clip
Qu’est-ce que l’extraction de prompt MiniMax H3 ?
Vais-je récupérer exactement la même vidéo ?
Pourquoi ne pas utiliser un outil d’extraction générique ?
Ne devrais-je pas plutôt utiliser le clip comme référence ?
Ma source fait quarante secondes. Que se passe-t-il ?
Est-ce qu’il transcrit les dialogues ?
Qu’est-ce que je fais du prompt ?
Est-il légal de recréer la vidéo de quelqu’un d’autre ?
Que puis-je coller ou envoyer, et quelle durée ?
Est-ce que ça marche sur des clips sans dialogue ?
Est-ce gratuit ?
Peut-il fonctionner dans l’autre sens — de l’idée au prompt ?
Collez le clip, relisez-le sous forme de prompt.
Une extraction offerte par semaine sans compte, et ce que vous copiez est à vous.
Générer gratuitement · file d’attenteRédigé et tenu à jour par l’équipe éditoriale de MiniMax H3 AI Video GeneratorPublié le Mis à jour le