AI 립싱크 영상 만들기

사진 한 장을 넣고 무슨 말을 할지 치시면 말하는 영상이 돌아옵니다. 목소리가 함께 나오니 음성 파일을 먼저 만들 필요가 없습니다. 4~15초, 최대 2K, 11개 언어.

사진으로

이미지 만들기

JPG · PNG · WEBP · HEIC · 30MB 이하 · 얼굴 하나

0 / 7000

말하는 사람은 끝까지 같은 얼굴, 같은 머리, 같은 옷과 색을 유지합니다. 바뀌는 것은 카메라와 묘사된 움직임뿐입니다.

무료 가입 · MiniMax H3 1편

This run spends credits — the free clip is 4s · 768P · 16:9.

Sign up free and your first MiniMax H3 clip renders 4s · 768P · 16:9, with sound. A plan raises the ceiling to 15s, 2K and four at a time — the free clip is a size, not a different model.

이 페이지의 영상은 모두 계정 없이 재생하고 내려받으실 수 있습니다. 직접 쓰신 대사를 돌리는 것은 출력 초 단위로 청구되며, 768P 4초라는 최소 단위가 60 크레딧입니다.

실제 MiniMax H3 출력 · 「이걸로 해보기」를 누르면 요약이 아니라 프롬프트 전문이 들어갑니다

헤드폰을 쓴 팟캐스트 진행자가 탁상 마이크 앞에서 웃으며 대사를 말하는 장면, MiniMax H3 립싱크8s · 16:9 · 768P

사진 한 장과 한 문장

사진에 일어나는 일

정지된 사진 한 장, 그리고 함께 나오는 목소리

사진 위에 무언가를 그려 넣는 것이 아닙니다. 그 사진이 그 사람이 말하고 있는 숏의 첫 프레임이 되고, 목소리는 같은 패스에서 생성됩니다 — 그래서 음성 파일을 먼저 만들 필요가 없습니다.

들어간 사진: 길가 카페 자리에서 에스프레소 잔을 내려다보고 있는, 말하고 있지 않은 여성

올리신 사진

생성된 것 — 화면과 소리가 함께

24 fps 로 4 에서 15 사이의 모든 정수 초, 768P 또는 2K, 끝까지 돌려본 11개 언어. JPG, PNG, WEBP, HEIC, HEIF 가 그대로 들어갑니다. 사람 사진은 대개 휴대폰 사진인데 대부분의 도구가 조용히 변환을 요구하기 때문에, 이건 말해 둘 값어치가 있습니다. 다듬은 프로필 사진보다 휴대폰 스냅이 더 잘 움직이는 경우가 많습니다 — 보정은 움직임에 필요한 질감을 지워 버립니다. 고르실 수 있다면 이가 보이는 사진으로: 다문 입은 입술 뒤에 무엇이 있는지에 대한 정보를 담고 있지 않아서 모델이 입안을 지어내고, 그 지어낸 입안이 결과를 어색하게 보이게 하는 정체입니다.

사진이 첫 프레임
001

사진이 첫 프레임

정수 초 단위
4~15초

정수 초 단위

끝까지 돌려본 언어
11

끝까지 돌려본 언어

같은 패스에서 나온 소리
스테레오

같은 패스에서 나온 소리

  • 음성 파일을 먼저 만들 필요 없음
  • 프레임 단위 타이밍 맞추기 없음
  • 립싱크 공정을 따로 돌릴 필요 없음

완성된 한 편

AI 립싱크가 제대로 나왔을 때의 모습

보시는 것이 나온 그대로입니다 — 업스케일도, 색보정도, 두 번째 패스도 없습니다. 옆에 찍혀 있는 것은 그것을 만든 프롬프트 전문이며 요약이 아닙니다. 「이걸로 해보기」를 누르면 위쪽 입력창에 그대로 들어갑니다. 길이와 화면 비율도 만들어졌을 때 그대로라서, 한 줄만 바꿔 무엇이 달라지는지 보실 수 있습니다. 소리를 켜 보세요. 들리는 소리는 말하는 입과 같은 패스에서 나온 것입니다.

더 많은 프롬프트 예시 ↗
위 사진 속 여성이 이제 카메라를 보고 말 중간에 입을 벌리고 있습니다. 뒤에는 같은 탁자와 같은 거리16:9 · 6s

요약이 아니라 프롬프트 전문

Reference the Hitchcock camera movement from Video 1, have the character in Image 2 sing, with the vocals matching Audio 3.

6s · 16:9

위의 사진, 그리고 그것이 된 6초

한 번의 생성, 하나의 프롬프트, 모델이 돌려준 그대로

입을 열 수 있는 것

사람 사진이어야 할 이유는 없습니다

  • 조명이 켜진 화장대 거울 앞에서 립오일을 든 여성이 카메라에 말하는 장면. 모든 컷에서 얼굴이 참조한 사진과 맞습니다16:9 · 15s
    한 사람사진참조한 사진 한 장이 입 클로즈업을 포함해 모든 숏에서 유지됩니다. 립싱크가 원래 크기에서 버티는지 아닌지는 바로 거기서 갈립니다.
  • 거실에서 다투는 남녀. 카메라는 핸드헬드이고 두 사람이 번갈아 한 줄씩 말합니다16:9 · 15s
    한 화면에 두 사람165자두 사람이 번갈아 말하는데 프롬프트 전체는 한 문장이었습니다. 화자 태그는 누가 먼저 말할지 지정해야 할 때 쓰는 것이고, 이 편에서는 쓰지 않았습니다.
  • 밀짚모자를 쓴 소녀가 온실 안에서 꽃관을 쓴 작은 비구름과 이야기하는 장면. 둘 다 회화풍 2D16:9 · 15s
    그려진 캐릭터일러스트회화풍 2D 이고, 입도 화면의 나머지와 같은 손으로 그려졌습니다. 숏 어디에도 실사적인 요소는 없습니다.
  • 중절모를 쓴 검은 고양이와 물방울무늬 원피스를 입은 생쥐가 노을 진 공원 벤치에서 이야기하는 장면16:9 · 15s
    동물 캐릭터동물고양이와 생쥐가 한 줄씩 말합니다. 사람 얼굴이 아닌데도 입은 음절에 정확히 얹힙니다.

이 네 편은 다른 분들이 돌린 것이지 저희 것이 아닙니다 — 그래서 구석에 Hailuo 마크가 있고, 이 페이지의 다른 영상에는 없습니다. 그 마크가 출처의 증거입니다. 네 편 모두 프롬프트와 함께 @SimplyAnnisa, @heydin_ai, @ManuAGI01 께서 공개하셨고, 네 편의 모든 글자를 그 링크에서 읽으실 수 있습니다.

여기에 없는 것은 저희가 아직 돌려보지 않은 것들입니다. 진짜 개나 고양이의 사진, 그리고 그려진 초상화. 둘 다 막혀 있지 않고 시도해 볼 값어치도 있습니다 — 확인한 11개 너머의 언어에 대해 이 페이지가 취하는 것과 같은 입장입니다. 돌아오는 것을 직접 보지 않은 것은 주장하지 않습니다.

전체 과정

사진을 립싱크하는 세 단계

결과를 가르는 것은 첫 단계이고, 제대로 하는 데 4초쯤 걸립니다. 앞의 두 카드는 이 페이지 위쪽 입력창이 일하고 있는 모습입니다 — 받아들인 파일과, 거기 쳐 넣은 한 줄. 세 번째가 돌아온 것입니다.

  1. 이 페이지 입력창의 업로드 줄, 사진이 받아들여진 상태: 카페 자리에 앉은 여성의 썸네일, 파일 이름 ref-espresso.webp, 그리고 1280×724 · 1.77:1 · 62 KB 라고 적힌 초록 체크

    얼굴 하나 넣기

    사진도 되고 2 에서 15초짜리 소재도 됩니다. 얼굴 하나, 카메라를 보고 있고, 입을 가리는 것이 없어야 합니다. iPhone 의 HEIC 는 그대로 들어가고, 입력창이 파일을 읽어서 되돌려 줍니다 — 크기, 비율, 용량 — 돈을 쓰시기 전에.

    얼굴 하나JPG · PNG · WEBP · HEIC
  2. 이 페이지의 프롬프트 입력창에 한 줄이 쳐진 상태 — (S1) speaks warmly, [English] I have used this every morning for a month — 그리고 73 / 7000 이라고 표시된 카운터

    무슨 말을 할지 쓰기

    문장과 언어 태그를 쳐 넣으면 목소리도 함께 도착합니다 — 음성 파일을 먼저 만들 필요가 없습니다. 입력창 안의 저 한 줄은 주어진 7,000자 중 73자이고, 나머지는 전부 숏을 묘사하는 데 씁니다.

    7,000자 중 73자성우를 고를 일 없음
  3. 완성된 영상, 오디오는 이미 파일 안에
    오디오 트랙 · 32 kHzLIP-SYNC.MP4

    재생하고, 한 단어만 바꾸기

    영상은 소리가 이미 파일 안에 들어간 채로 도착합니다. 대부분은 첫 번째가 아니라 두 번째나 세 번째를 남기십니다 — 모든 시도가 저장되니, 처음부터 다시가 아니라 고치는 작업이 됩니다.

    4~15s · 최대 2K소리는 이미 합쳐져 있음

앞의 두 카드는 이 페이지 위쪽 입력창을 찍은 화면이지 그림이 아닙니다. 올리신 사진은 절대 수정되지 않습니다 — 돌아오는 것은 새 파일입니다. 세 번째 카드의 영상은 MiniMax 가 직접 만든 것으로, 프롬프트와 함께 H3 공개 글에 실렸습니다. 스틸이 얼굴을, 보컬 트랙이 노래를, 영화 클립이 카메라 움직임을 정했습니다. 그 편은 오디오 경로로 갔고, 위쪽 입력창은 두 경로 다 받습니다.

활용 사례

사람들이 AI 립싱크를 쓰는 곳

시작하기 좋은 네 곳. 각각 완성된 영상 뒤의 프롬프트 전문을, 만들어졌을 때의 길이와 화면 비율 그대로 위쪽 입력창에 넣어 줍니다.

  • 탁상 마이크 앞에서 웃으며 한 줄을 말하는 팟캐스트 진행자, MiniMax H3 립싱크
    16:9 · 8s

    카메라를 보고 한 줄

    영상 전체가 한 사람과 한 문장입니다. 6초라면 열두 단어 안쪽으로 잡으세요 — 짧은 길이에 긴 문장을 넣는 것이 첫 시도가 실망스러운 흔한 이유입니다.

  • 어두운 성 내부에서 팽팽한 대화를 나누는 두 캐릭터. 장면 내내 두 인물이 그대로 유지됩니다
    9:16 · 9s

    장면에 대사 한 줄

    이미 머릿속에 있는 숏에서 캐릭터가 그 한 줄을 말합니다. 말뿐 아니라 사람도 묘사하세요 — 옷, 머리, 눈에 띄는 특징 하나 — 그러면 얼굴이 영상 내내 자리를 지킵니다.

  • 빵집 앞에서 손에 든 커다란 크루아상에 대해 카메라에 이야기하는 여성. 립싱크가 다섯 숏에 걸쳐 유지됩니다
    9:16 · 15s

    제품을 이야기하는 사람

    인물 스틸에 제품 스틸을 더하고, 대사는 숏마다 따로 씁니다. 15초를 꽉 채우는 편이라, 상한이 어디인지도 함께 보여 줍니다.

  • 파란 스튜디오에서 랩 트랙에 맞춰 입을 움직이는 여성. 얼굴은 참조한 스틸에 고정되어 있습니다
    16:9 · 15s

    말이 아니라 노래

    톤을 노래로 두시거나, 보컬을 올려 입을 움직이게 하세요. 올리신 트랙은 참조가 아니라 완성 사운드트랙 그 자체가 되고, 올리는 데는 청구되지 않습니다. 영상 길이는 최소한 트랙과 같게 잡으세요.

영상에서 출발하는데 원래 픽셀이 그대로 남아야 하나요? 그건 더빙이고, 잘라 붙이는 도구가 이 페이지보다 잘합니다 — 여기서는 원본을 고치는 것이 아니라 숏을 다시 세웁니다.

언어

11개 언어, 그리고 그것을 움직이는 대사 형식

끝까지 돌려본 것이 11개입니다. 어느 언어에서든 입은 영어의 근사음이 아니라 그 언어 자체의 소리로 빚어집니다. 말할 대사를 그 언어로 쓰면 말맛이 살고, 영어로 쓰고 언어 태그만 붙이면 살지 않습니다. 대사 쓰는 법에 형식이 있습니다.

립싱크로 확인한 11개

11

  • 아랍어
  • 중국어
  • 영어
  • 프랑스어
  • 독일어
  • 이탈리아어
  • 일본어
  • 한국어
  • 포르투갈어
  • 러시아어
  • 스페인어

견주어 보시라고 적자면, Google 자신의 Veo 3.1 문서에는 영어는 완전히 지원되고 다른 언어는 평가하지 않았다고 적혀 있습니다. 여러 편에서 같은 얼굴이나 같은 목소리가 필요하시면 레퍼런스로 영상을 쓰세요.

한 편 비용

확인하실 수 있는 것, 한 편의 비용, 플랜이 바꾸는 것

먼저 말씀드립니다. 이건 유료 도구입니다. 소리가 없는 립싱크는 립싱크가 아니라서, 이 페이지가 돌리는 것은 화면만 나오는 무음 엔진이 아니라 MiniMax H3 이고, 그래서 체험용 한 편을 드릴 수가 없습니다. 돈을 쓰지 않고 하실 수 있는 것은 결과를 확인하는 일입니다. 위의 영상은 모두 계정 없이 재생하고 내려받으실 수 있고, 그것을 만든 프롬프트도 함께 있습니다. 한 번 돌리는 것은 60 크레딧부터 — 768P 4초, 모델이 만들 수 있는 가장 짧은 길이입니다. 모든 시도가 저장되고, 의미가 있는 것은 두 번째입니다. 첫 편을 남기는 분은 거의 없기 때문입니다. 플랜을 올리시면 매달 크레딧이 늘고, 긴 영상도 아껴 쓰지 않고 2K 로 뽑을 수 있으며, 완성 1초당 비용이 내려갑니다.

청구 방식

청구 기준
출력 초
생성 실패
돌려드립니다
직접 올린 음성
청구 없음
이 페이지의 영상
재생 가능 · 계정 없이

전체 요금.

어느 쪽이든 월 크레딧은 같습니다

  • 무료카드 없이

    계정 없이 한 편, 무료 엔진으로. MiniMax H3 자체는 유료입니다.

    $0계속

    어느 단계에서도 카드를 받지 않습니다

    무료 시작

    봇 확인만 — 이메일 없이

    1편, 계정 없이

    Agnes Video V2.0 · 16:9 · 5초 · 소리 없음
    무료로 로그인 — Agnes 로 하루 3편, 소리 없음

    $9.9 부터의 어떤 팩이든 MiniMax H3 를 엽니다 — 모든 방식, 768P 와 2K

    • 네이티브 2K 의 MiniMax H3유료만
    • 화면과 함께 오는 네이티브 오디오유료만
    • 계정 없이 한 편
    • 동시 1편
    • 실패한 영상은 무료
    • 비공개 생성
    • 어떤 팩이든 모든 방식에서 H3 를 엽니다

    무료는 다른 엔진입니다. 플랜 보기

    속도와 대기열

    대기열
    무료 레인
    동시 작업
    1
    묶음
    1
    기록 보관
    24시간 · 로그인 시 7일
    응대
    커뮤니티
  • Lite33% 절약

    MiniMax H3 를 네이티브 2K 로 엽니다. 가장 작은 유료 플랜입니다 — 가장 많이 고르시는 것은 Pro 입니다.

    $9.9/mo$14.9

    연 $118.8 청구 · 연 $60 절약

    7일 환불 · 언제든 해지

    월 1,000 크레딧 · 약 22편

    4초 · 768P · 텍스트로 영상

    4초 2K 라면 약 17편

    월간이든 연간이든 크레딧은 같습니다

    • 네이티브 2K 의 MiniMax H3 — 네이티브 오디오와 함께
    • 대사 · 효과음 · 음악이 같은 파일에
    • 최대 15초15초
    • 4초 768P 텍스트로 영상 기준 월 약 22편
    • 실패한 영상은 무료
    • 크레딧 미사용 시 7일 환불
    • 동시 작업 1개
    • 한 프롬프트로 2개 변형 묶음

    개인용과 검토용 — 상업적 권리는 MiniMax 에서

    속도와 대기열

    대기열
    표준
    동시 작업
    1
    묶음
    2
    기록 보관
    7일
    응대
    이메일 · 48시간
  • 가장 많이 고르는 플랜
    Pro33% 절약

    Lite 보다 $30 더. 월 약 125편, 같은 MiniMax H3, 더 빠른 대기열.

    $29.9/mo$44.9

    연 $358.8 청구 · 연 $180 절약

    7일 환불 · 언제든 해지

    월 3,000 크레딧 · 약 125편

    4초 · 768P · 텍스트로 영상

    4초 2K 라면 약 84편

    월간이든 연간이든 크레딧은 같습니다

    • Lite 의 모든 것
    • 4초 768P 텍스트로 영상 기준 월 약 125편
    • 동시 3개
    • 프롬프트 추출
    • 한 프롬프트로 4개 변형 묶음
    • 기록 7일 보관
    • 크레딧 미사용 시 7일 환불

    개인용과 검토용 — 상업적 권리는 MiniMax 에서

    속도와 대기열

    대기열
    빠름
    동시 작업
    3
    묶음
    4
    기록 보관
    7일
    응대
    이메일 · 12시간
  • Studio33% 절약

    한 달치 분량 전부, 줄의 맨 앞, 그리고 4시간 안에 답하는 사람.

    $99.9/mo$149.9

    연 $1,198.8 청구 · 연 $600 절약

    7일 환불 · 언제든 해지

    월 10,000 크레딧 · 약 325편

    4초 · 768P · 텍스트로 영상

    4초 2K 라면 약 217편

    월간이든 연간이든 크레딧은 같습니다

    • Pro 의 모든 것
    • 4초 768P 텍스트로 영상 기준 월 약 325편
    • 동시 8개
    • 한 프롬프트로 4개 변형 묶음
    • 기록 7일 보관
    • 4시간 안에 우선 응대
    • 저희가 드리는 가장 낮은 소모율
    • 크레딧 미사용 시 7일 환불

    개인용과 검토용 — 상업적 권리는 MiniMax 에서

    속도와 대기열

    대기열
    우선 — 줄의 맨 앞
    동시 작업
    8
    묶음
    4
    기록 보관
    7일
    응대
    우선 · 4시간

만들어지는 방식

입이 원래 해상도에서도 버티는 이유

다른 립싱크 도구는 모두 사진 속에서 입을 찾아 바꿔치기합니다. 이건 애초에 찾지 않습니다 — 그 한 가지 차이가 입이 덧댄 조각처럼 보이지 않는 이유의 전부입니다.

  • 징후

    피부와 맞지 않는 입

    주변 얼굴과 해상도가 다른 조각, 그리고 고개를 돌릴 때마다 기어 다니는 턱선. 한 번 보이기 시작하면 다시는 안 보이게 할 수 없습니다 — 그리고 그건 한 번도 올리신 사진 탓이 아니었습니다.

  • 원인

    96 픽셀 사각형을 도로 붙이기

    흔한 방식은 입을 찾아 그 둘레를 작은 사각형으로 — 대개 96×96 — 잘라내고, 그 크기에서 새 입모양을 만들어 원래 프레임에 붙이는 것입니다. 사각형 바깥은 한 번도 모델을 거치지 않았습니다.

  • 먼저 알아채는 법

    도구가 스스로를 설명하는 동사를 읽으세요

    영상 속 얼굴에 입모양을 매핑합니다. 원본 이미지에 블렌딩합니다. 매핑, 블렌딩 — 어느 쪽이든 이미 있는 얼굴 위에 무언가를 얹는 것이고, 턱선이 그 끝나는 자리입니다.

  • 여기서 일어나는 일

    소리까지 포함한 새 프레임이 한 번의 패스로

    MiniMax H3 는 올리신 입을 찾지 않습니다. 프레임을 편집하는 것이 아니기 때문입니다. 잘라내기도, 붙이기도, 따라가야 할 경계도 없습니다. 입이 뺨과 같은 해상도를 갖는 이유는 그림 안에 해상도가 하나뿐이기 때문입니다. 목소리도 같은 패스에서 나오니, 밋밋한 얼굴 위에 들뜬 사운드트랙이 얹히는 일이 없습니다.

올리기 전에 감수할 것

원래 영상은 남지 않습니다. 돌아오는 것은 그것을 바탕으로 새로 만든 영상이지, 올리신 영상에 새 입이 붙은 것이 아닙니다. 내 픽셀을 되찾아야 하신다면 — 이를테면 40분짜리 강의에 스페인어 사운드트랙을 붙이는 경우 — 잘라 붙이는 쪽 도구가 이 페이지보다 도움이 됩니다.

대사

사진이 정하지 못하는 것을 대사가 정합니다

애초에 될지 안 될지는 사진이 정합니다. 무엇이 나올지, 몇 초가 될지, 얼마가 들지는 대사가 정합니다 — 그리고 이 셋은 같은 하나의 결정입니다.

  1. 01길이는 예산입니다

    출력은 4 에서 15 사이의 정수 초입니다. 보통 말하는 속도라면 대략 열에서 마흔 단어. 대사를 먼저 쓰고, 세어 보고, 그다음 길이를 고르세요 — 반대로 하면 따라잡을 수 없는 시계와 경주하는 말투가 나옵니다.

    4~15초, 정수 초

  2. 02힘을 받는 태그는 하나

    [Language] 는 입모양의 바탕이 되는 음소 집합을 고르므로, 화면을 바꾸는 태그는 이쪽입니다. (S1) 은 화면에 말할 만한 사람이 둘 이상일 때만 제 몫을 합니다 — 얼굴이 하나면 눈에 보이는 변화는 없습니다.

    (S1) … [Korean] …

  3. 03글자 수 상한은 대사를 위한 것이 아닙니다

    7,000자는 프롬프트 전체를 덮습니다. 말하는 대사는 수십 자이고, 나머지는 전부 숏입니다 — 누가, 어디서, 어떤 빛으로, 어떤 화각으로. 자리가 모자라는 것은 묘사의 문제이지 대사의 문제가 아닙니다.

    7,000자

  4. 04초가 곧 청구서입니다

    768P 는 출력 1초당 $0.08, 2K 는 $0.13 입니다. 대사가 길이를 정하고 길이가 청구액을 정하니, 15초짜리는 4초짜리의 거의 네 배가 듭니다. 들을 값어치가 있는 대사는 대개 짧습니다.

    $0.08 / 초 · 768P

여기 적힌 것은 모델에 대한 추측이 아닙니다 — 길이와 글자 수 상한은 공개된 제한이고, 초당 가격은 요금 페이지에 있는 그대로입니다. 숏 묘사를 맡기고 싶으시면 프롬프트 생성기가 나머지 6,900자를 씁니다.

책임 있는 사용

누구의 얼굴을 쓰실 수 있나

본인 얼굴, 허락을 받은 얼굴, 또는 직접 생성하셔서 누구의 것도 아닌 얼굴입니다.

  • 얼굴실존 인물이 하지 않은 말을 한 것처럼 보이게 하는 것은 H3 라이선스가 금지합니다 — 공인도, 모르는 사람의 사진도 안 됩니다.
  • 목소리특정 인물의 목소리를 복제하는 트랙을 올리시려면 본인 것이거나, 사용 허락을 받았거나, 합성된 것이어야 합니다.
  • 신고신고 링크는 모든 페이지와 모든 결과에 있습니다. 반복되는 계정은 정지됩니다.
  • 미성년자미성년자가 나오는 사진이나 영상은 절대 올리지 마세요.
  • 업로드어떤 학습에도 쓰지 않습니다. 언제든 지우실 수 있고, 계정도 지우실 수 있습니다.
  • 상업적 이용 권리개인 이용과 평가 목적 이용은 유료를 포함한 모든 플랜에서 가능합니다. 상업적 이용 권리는 MiniMax 에서 직접, Hailuo 또는 공식 API 를 통해 얻으셔야 합니다. 요약이며 법률 자문이 아닙니다.

전문: 책임 있는 사용

실제로 많이 묻는 것

AI 립싱크 자주 묻는 질문

첫 대사를 돌리기 전에 알아 두실 것

이 AI 립싱크 도구는 무료인가요?

아니요, 한 편 돌리는 것은 유료입니다. 소리가 없는 립싱크는 립싱크가 아니라서, 이 페이지가 돌리는 것은 화면만 나오는 무음 엔진이 아니라 MiniMax H3 이고, 한 번 돌리는 것은 60 크레딧부터 — 768P 4초입니다. 계정이 필요 없는 쪽은 증거입니다. 여기 있는 완성된 영상과 그 뒤의 프롬프트 전문은 그대로 재생하고 내려받으실 수 있습니다.

돈을 적게 쓰고 시험해 보려면?

먼저 4초를 돌려 보세요. 청구가 출력 초 단위라서, 얼굴이 유지되는지 입이 맞는지 보는 가장 싼 방법이 가장 짧은 테이크입니다 — 15초를 꽉 채운 225 크레딧에 견주어 60 크레딧입니다. 4초에서 사진과 대사를 맞춘 뒤에 정말 원하시는 길이를 고르세요.

음성 파일이 필요한가요?

아니요, 그 점이 이 분야 대부분의 도구와 가장 다른 부분입니다. 대사를 치고 언어를 고르시면 목소리가 입과 함께 생성됩니다. 이미 녹음이나 노래가 있으시면 올려 주세요. 그것이 완성 사운드트랙이 됩니다.

영상에 소리가 함께 오나요?

네 — 32 kHz 스테레오이고, 화면과 같은 패스에서 만들어져 하나의 MP4 안에 들어 있습니다. 별도의 오디오 단계도, 합칠 작업도 없습니다.

이미 있는 영상을 립싱크할 수 있나요?

됩니다. 다만 한 가지를 먼저 아셔야 합니다. H3 는 올리신 프레임에 입을 덧그리는 것이 아니라 숏을 다시 생성합니다. 올리신 소재는 결과를 이끌 뿐, 결과 안에 남지는 않습니다. 그래서 같은 아이디어의 새 테이크를 원하실 때는 이 페이지가 맞고, 원래 픽셀 자체가 목적일 때는 맞지 않습니다 — 40분짜리 강의에 스페인어 사운드트랙을 붙여야 하거나, 누구도 다시 그려서는 안 되는 고객사 소재 같은 경우입니다. 그럴 때는 잘라 붙이는 더빙 도구가 저희보다 도움이 됩니다.

영상은 얼마나 길게 만들 수 있나요?

24 fps 로 4 에서 15 사이의 모든 정수 초입니다. 15초는 모델 쪽 상한이지 플랜 제한이 아닙니다 — 어떤 등급도 이걸 올려 주지 않습니다.

어떤 언어가 되나요?

확인한 것은 11개입니다: 아랍어, 중국어, 영어, 프랑스어, 독일어, 이탈리아어, 일본어, 한국어, 포르투갈어, 러시아어, 스페인어. 다른 언어도 대개 되고 막아 두지 않았습니다. 다만 돌려보지 않았으니 된다고 말씀드리지 않습니다.

전에 쓰던 도구에서 입이 뭉개진 이유가 뭔가요?

거의 틀림없이 입 둘레의 좁은 영역을 잘라내 그 크기에서 만든 뒤 도로 붙이기 때문입니다. 1080p 프레임에서는 그 조각만 저해상도 병목을 지나므로, 뺨 옆에 두면 흐릿해 보입니다. 올리신 사진 탓이 아닙니다.

제 사진 속 사람처럼 보이나요?

프롬프트가 말할 내용뿐 아니라 사람도 묘사하면 유지되고, 말할 내용만 적으면 흐트러집니다. 정면을 보는 소재가 눈에 띄게 더 잘 버팁니다. 사진으로 영상과 같은 규칙, 같은 해법이고, 외형 고정이 그 문장을 대신 써 줍니다.

어떤 사진을 쓰면 되나요?

얼굴 하나, 정면, 고른 빛, 입을 가리는 것이 없고, 고르실 수 있다면 이가 보이는 사진. 휴대폰 스냅이 보정한 프로필 사진보다 대개 낫습니다 — 보정은 움직임에 필요한 질감을 지웁니다.

오디오가 영상보다 길면 어떻게 되나요?

영상 길이에서 잘립니다. 압축되거나 빨라지지 않습니다. 길이를 최소한 트랙과 같게 잡으세요 — 입력창이 둘을 견주어 보고 고쳐 드릴지 물어봅니다.

말하지 않고 노래하게 할 수 있나요?

됩니다. 톤을 노래로 두시거나, 보컬을 올려 입을 움직이게 하세요. 상한은 똑같이 15초입니다.

2K 로 뽑을 수 있나요?

됩니다. 2K 는 픽셀을 늘리는 것이 아니라 원래 맥락에서 다시 생성하므로, 입 주변 디테일이 보간되는 대신 그 단계를 살아남습니다.

계정이 필요한가요?

이 페이지에서 재생하거나 내려받는 데는 필요 없습니다. 직접 돌리시려면 필요하고 크레딧도 필요합니다. 이 페이지가 돌리는 것이 유료 MiniMax H3 이기 때문입니다. 시도가 저장되니 두 번째는 다시 올리는 것이 아니라 고치는 작업이 됩니다.

결과물에 워터마크가 들어가나요?

들어가지 않습니다. 내려받으시는 것은 모델이 내놓은 그대로입니다.

「생성」을 누르면 그다음엔 어떻게 되나요?

모델로 보내지고, 소리가 이미 파일에 들어간 완성 MP4 로 기록에 돌아옵니다. 페이지를 지키고 계실 필요는 없습니다 — 브라우저가 돌아오지 않은 건도 서버 쪽에서 끝나고, 제공사가 놓친 것은 실패 처리되어 크레딧이 자동으로 돌아옵니다.

만든 영상을 상업적으로 쓸 수 있나요?

개인 이용과 평가 목적 이용은 모든 플랜에서 가능합니다. 상업적 조건은 MiniMax 에서 직접, Hailuo 또는 공식 API 를 통해 받으셔야 합니다. 요약이며 법률 자문이 아닙니다.

어떤 사진 형식과 크기가 되나요?

JPG, JPEG, PNG, WEBP, HEIC, HEIF 이며 파일당 30 MB 까지, 한 변이 256 에서 5,760 픽셀 사이, 화면 비율은 2:5 와 5:2 사이입니다. HEIC 와 HEIF 는 그대로 들어가니 iPhone 으로 찍은 사진을 먼저 변환하실 필요가 없습니다. 이것이 공개된 제한이고, 업로드 입력창이 돈을 쓰시기 전에 파일을 대조합니다.

사진에 사람이 둘 이상 있어도 되나요?

됩니다. 한 줄로 처리됩니다. 화면에 얼굴이 둘이면 지정하지 않는 한 모델이 화자를 고르니, 태그를 붙이세요: (S1) asks, [English] Did you send it? (S2) replies firmly, [English] Two hours ago. 얼굴이 하나면 이 태그로 눈에 보이는 변화는 없습니다. 그래서 필요할 때만 알고 계시면 충분합니다.

대사는 얼마나 길게 쓸 수 있나요?

7,000자는 프롬프트 전체를 덮고, 말하는 대사는 수십 자입니다 — 나머지는 전부 숏입니다. 진짜 상한은 시계 쪽입니다. 4초에서 15초는 보통 말하는 속도로 대략 열에서 마흔 단어입니다. 대사를 쓰고, 세어 보고, 그다음 길이를 고르세요. 자리가 모자라는 것은 묘사의 문제이지 대사의 문제가 아닙니다.

사진 한 장과 한 문장.

입력은 그게 전부입니다 — 그리고 위에 있는 것은 로그인하시든 안 하시든 재생됩니다.

무료로 만들기 · 대기열

MiniMax H3 AI Video Generator 편집팀이 작성하고 관리합니다 게시 최종 수정