Prompt craft

H3 프롬프트에 소리 쓰는 법과 들리는 것을 정하는 세 항목

화면과 32 kHz 스테레오가 같은 과정에서 나오므로 오디오는 프롬프트에 씁니다. 무엇이 들릴지는 세 항목이 정하고, 대사에는 따로 문법이 있습니다.

6분 읽기편집팀편집팀
H3 프롬프트에 소리 쓰는 법과 들리는 것을 정하는 세 항목

대부분의 영상 모델은 소리를 두 번째 일로 다룹니다. H3 는 그러지 않습니다. 화면과 오디오가 같은 한 번의 순전파에서 32 kHz 스테레오로 나와 MP4 하나에 담깁니다. 오디오용 프롬프트가 따로 있지도 않고, 끄는 스위치도 없습니다.

실질적인 결과는 이렇습니다. 소리를 적지 않으셨다면, 소리를 고르지 않으신 것입니다. 모델은 어쨌든 무언가를 만들고, 지시가 없을 때 만드는 것은 그 장면의 그럴듯한 평균입니다.

구조화된 프롬프트에는 소리를 담는 항목이 셋 있습니다

H3 가 받는 프롬프트 형식은 문단이 아니라 구조화된 문서입니다. 텍스트 · 이미지 · 키프레임 작업에서는 항상 이 순서의 세 항목입니다.

integrated_multimodal_description
overall_soundscape
non_diegetic_music

서로 바꿔 쓸 수 없고, 나뉘어 있다는 것 자체가 쓸모 있는 부분입니다.

  • integrated_multimodal_description 은 샷을 담습니다. 구도, 인물, 환경, 동작, 카메라, 그리고 특정한 순간에 들리는 것을 타임스탬프와 함께 적습니다. At 00:04.500, the door latch clicks.
  • overall_soundscape 는 그 세계의 주변음과 폴리입니다. 룸톤, 비, 멀리서 오는 차 소리, 냉장고. 영상 내내 사실인 것들입니다.
  • non_diegetic_music 은 음악입니다. 장면 밖에 있고 장면 안의 누구에게도 들리지 않습니다. 스타일, 악기 구성, 템포, 그리고 분위기가 어떻게 움직이는지를 적습니다.

가장 흔한 실수가 마지막 항목에 있습니다. 사운드트랙을 soundscape 항목 안에 적으면 그 방 안에 실재하는 음악을 모델에 요청하는 것이 되고, 화면 바로 밖 스피커에서 흘러나오는 것 같은 소리가 나옵니다. 음악을 원하시면 음악 항목에 적으세요.

non_diegetic_music: none 이라고 쓰는 것도 정당하고, 많이들 쓰지 않는 지시입니다. 다큐멘터리 결의 소재는 거의 언제나 이쪽이 맞습니다.

대사에는 문법이 있습니다

찾아내기 어렵지만 알고 나면 결과가 바로 달라지는 부분입니다. 대사에는 화자 표시, 언어, 말투 메모가 붙습니다.

(S1) speaks softly, [English] Follow the wind, live free.

여기에서 세 가지가 일을 하고 있습니다.

  • (S1) 은 고정된 화자 표시입니다. 다시 쓰면 여러 대사에 걸쳐 목소리가 같게 유지되고, (S2) 를 넣으면 구별되는 두 번째 목소리가 생깁니다. 두 사람 대화가 무너지지 않는 이유가 이것입니다.
  • [English] 는 말하는 언어를 정합니다. 열한 가지가 안정적으로 지원됩니다. 아랍어, 중국어, 영어, 프랑스어, 독일어, 이탈리아어, 일본어, 한국어, 포르투갈어, 러시아어, 스페인어.
  • 대괄호 앞의 말투 메모 — speaks softly, level broadcast delivery, shouting over traffic — 는 화면 묘사에 형용사를 아무리 쌓는 것보다 연기를 크게 움직입니다.

다른 언어로 쓰시는 분들이 걸리는 규칙이 하나 있습니다. 공식 안내는 다시 쓴 프롬프트를 영어로 쓰되, 대사와 가사, 화면에 보이는 글자는 원래 언어 그대로 두라고 합니다. 한국어 대사는 대괄호 안에서 한국어로 남고, 그 주변의 묘사는 영어입니다.

예시 하나를 끝까지

뉴스룸 샷을 길게 풀어 쓴 것입니다. 복잡하지 않고, 그저 빠진 데가 없을 뿐입니다.

integrated_multimodal_description:
[Shot 1] Locked-off medium shot, chest up. A presenter sits at a dark
news desk, studio key light from camera left, out-of-focus screens
behind her. She looks straight down the lens and delivers one line.
At 00:00.800 she begins speaking. At 00:03.200 she pauses, then
completes the sentence.
(S1) level broadcast delivery, [English] The vote came in just after
midnight.

overall_soundscape:
Room tone only. Faint air handling. No audience, no paper, no
keyboard.

non_diegetic_music:
None.

가장 중요한 제약 두 개는 마지막 두 항목의 마지막 줄입니다. 「Room tone only」와 「None」이, 모델이 이 샷에 음악을 깔고 부탁하지도 않은 뉴스룸 소음을 더하는 것을 막습니다.

공식 안내가 실제로 강제하는 규칙

다섯 개이고, 프롬프트를 여기에 비춰 보실 만합니다.

  1. 다시 쓴 것은 영어로 쓰고, 대사와 가사, 화면에 보이는 글자는 원래 언어로 둘 것.
  2. 각 샷을 구도 → 인물 → 환경 → 동작 → 카메라 → 소리 → 언급한 소재가 정확히 언제 나오는지 순서로 적을 것.
  3. 줄거리 요약 금지, 정의하지 않은 레퍼런스 태그 금지, 요청한 길이와 맞지 않는 타이밍 금지.
  4. 모든 세부는 보이거나 들리는 것에 대응해야 함. 「그녀는 불안해 보인다」는 세부가 아닙니다. 「그녀가 화면 밖을 흘끗 보고 문장을 끝맺지 않는다」는 세부입니다.
  5. 항목 순서를 고정할 것.

4번이 조용히 모든 것을 나아지게 합니다. 마이크나 렌즈가 잡아낼 수 있는 것만으로 쓴 프롬프트는 모델이 실행할 수 있는 프롬프트입니다.

예산에 대해 알아 둘 만한 두 가지

카메라 움직임은 하나가 아니라 세 부분입니다. 공식 어휘는 움직임 종류 + 크기 + 속도입니다. 「cinematic camera move」가 아니라 「slow push-in, small magnitude」죠. 생성된 영상이 뭉개져 보이는 원인의 상당 부분이 모호한 움직임 표현에서 나옵니다.

생각보다 자리가 훨씬 넉넉합니다. 생성 엔드포인트는 7,000자까지 프롬프트를 받습니다. 비교하자면 Veo 의 텍스트 입력은 1,024 토큰이 상한입니다. 세 항목을 제대로 써도 그 천장에 가까이 가지 않으니, 소리 묘사를 한 구절로 줄이실 이유가 없습니다.

편집팀

쓴 사람

편집팀

minimax-h3ai.video

글 전체