Écrire le son dans un prompt H3 : trois champs décident
L’image et la stéréo 32 kHz sortent de la même passe : le son s’écrit dans le prompt. Trois champs décident, et le dialogue a sa syntaxe.

La plupart des modèles vidéo traitent le son comme un second travail. Pas H3 : l’image et l’audio sortent de la même passe avant, en stéréo 32 kHz, emballés dans un seul MP4. Il n’y a pas de prompt audio séparé, ni d’interrupteur pour le couper.
La conséquence pratique, c’est que si vous n’avez pas écrit le son, vous ne l’avez pas choisi. Le modèle produira quelque chose de toute façon, et ce qu’il produit en l’absence d’instruction est une moyenne plausible de la scène.
Le prompt structuré a trois champs porteurs de son
Le format de prompt que H3 consomme est un document structuré, pas un paragraphe. Pour les travaux à partir de texte, d’image et d’image clé, ce sont trois champs, toujours dans cet ordre :
integrated_multimodal_description
overall_soundscape
non_diegetic_musicIls ne sont pas interchangeables, et c’est la répartition qui est utile :
integrated_multimodal_descriptionporte les plans — composition, sujet, environnement, action, caméra, et tout ce qui s’entend à un moment précis, avec un minutage :At 00:04.500, the door latch clicks.overall_soundscapeest l’ambiance du monde et le bruitage. Le silence de la pièce, la pluie, la circulation au loin, le réfrigérateur. Des choses vraies pour tout le clip.non_diegetic_musicest la musique de film — hors de la scène, que personne dedans n’entend. Style, instrumentation, tempo, et la façon dont l’humeur se déplace.
Le dernier est là où vit l’erreur la plus fréquente. Décrire une bande sonore à l’intérieur du champ d’ambiance demande au modèle une musique qui existe dans la pièce, et vous obtenez quelque chose qui sonne comme un haut-parleur juste hors champ. Si vous voulez de la musique de film, dites-le dans le champ de musique.
Écrire non_diegetic_music: none est une instruction légitime et sous-employée.
Le matériel de facture documentaire la réclame presque toujours.
Le dialogue a une syntaxe
C’est la partie difficile à découvrir et qui change immédiatement les résultats. Les répliques sont marquées d’un identifiant de locuteur, d’une langue et d’une indication de jeu :
(S1) speaks softly, [English] Follow the wind, live free.Trois choses y travaillent :
(S1)est un identifiant de locuteur stable. Réutilisez-le et la voix reste la même d’une réplique à l’autre ; introduisez(S2)et vous obtenez une seconde voix, distincte. C’est ainsi qu’un dialogue à deux tient debout.[English]fixe la langue parlée. Onze sont prises en charge de façon fiable : allemand, anglais, arabe, chinois, coréen, espagnol, français, italien, japonais, portugais et russe.- L’indication de jeu placée avant le crochet — speaks softly, level broadcast delivery, shouting over traffic — déplace davantage l’interprétation que n’importe quelle quantité d’adjectifs dans la description visuelle.
Une règle fait trébucher ceux qui écrivent dans une autre langue : la documentation officielle demande d’écrire le prompt réécrit en anglais, mais de laisser les dialogues, les paroles de chanson et tout texte visible à l’image dans leur langue d’origine. Une réplique en allemand reste en allemand à l’intérieur des crochets ; la description autour est en anglais.
La même règle vaut pour le texte que la caméra voit, et cela mérite d’être dit à part, car l’erreur est silencieuse : nommez une langue et H3 écrit le texte à l’écran dans cette langue ; n’en nommez aucune et il en choisit une d’après la scène. C’est ainsi qu’un brief en anglais revient avec un carton final en chinois — mesuré image par image dans ce que MiniMax H3 fait du texte que vous n’avez pas nommé.
Un exemple travaillé
Voici un plan de plateau télé écrit en version longue. Ce n’est pas compliqué, c’est juste complet.
integrated_multimodal_description:
[Shot 1] Locked-off medium shot, chest up. A presenter sits at a dark
news desk, studio key light from camera left, out-of-focus screens
behind her. She looks straight down the lens and delivers one line.
At 00:00.800 she begins speaking. At 00:03.200 she pauses, then
completes the sentence.
(S1) level broadcast delivery, [English] The vote came in just after
midnight.
overall_soundscape:
Room tone only. Faint air handling. No audience, no paper, no
keyboard.
non_diegetic_music:
None.Les deux contraintes qui comptent le plus sont la dernière ligne de chacun des deux derniers champs. « Room tone only » et « None » sont ce qui empêche le modèle de mettre le plan en musique et d’ajouter une agitation de rédaction que vous n’avez pas demandée.
Les règles que la documentation officielle applique vraiment
Cinq, et il vaut la peine d’y confronter votre prompt :
- Écrivez la réécriture en anglais ; gardez les dialogues, les paroles et le texte à l’image dans leur propre langue.
- Décrivez chaque plan dans l’ordre composition → sujet → environnement → action → caméra → son → le moment exact où apparaît chaque élément référencé.
- Pas de résumé d’intrigue, pas d’étiquette de référence non résolue, pas de minutage qui ne tombe pas sur la durée demandée.
- Chaque détail doit correspondre à quelque chose de visible ou d’audible. « Elle se sent incertaine » n’est pas un détail. « Elle jette un regard hors champ et ne finit pas sa phrase » en est un.
- Gardez l’ordre des champs fixe.
La règle 4 est celle qui améliore tout sans faire de bruit. Un prompt écrit entièrement en choses qu’un micro ou un objectif pourraient enregistrer est un prompt que le modèle sait exécuter.
Deux choses à savoir sur le budget
Le mouvement de caméra a trois parties, pas une. Le lexique officiel est type de mouvement + amplitude + vitesse — « travelling avant lent, faible amplitude » plutôt que « mouvement de caméra cinématographique ». Le vocabulaire de mouvement vague est à l’origine d’une bonne part de la bouillie qu’on voit dans la vidéo générée.
Vous avez bien plus de place que vous ne le croyez. Le point d’entrée de création accepte des prompts jusqu’à 7 000 caractères. À titre de comparaison, l’entrée texte de Veo plafonne à 1 024 tokens. Trois champs écrits correctement n’approcheront pas le plafond, donc il n’y a aucune raison de comprimer la description du son en une proposition.
Écrivez les trois, puis écoutez ce qui revient : le générateur de vidéo IA MiniMax H3 renvoie la stéréo 32 kHz dans le même MP4, il n’y a donc rien à mixer ensuite.
Rédigé par
Rédaction
minimax-h3ai.video
Publié sur le MiniMax H3 AI Video Generator, une interface tierce indépendante bâtie sur MiniMax H3.


