AI 립싱크 영상 만들기
사진 한 장을 넣고 무슨 말을 할지 치시면 말하는 영상이 돌아옵니다. 목소리가 함께 나오니 음성 파일을 먼저 만들 필요가 없습니다. 4~15초, 최대 2K, 11개 언어.
실제 MiniMax H3 출력 · 「이걸로 해보기」를 누르면 요약이 아니라 프롬프트 전문이 들어갑니다
8s · 16:9 · 768P사진 한 장과 한 문장
정지된 사진 한 장,
그리고 함께 나오는 목소리
사진 위에 무언가를 그려 넣는 것이 아닙니다. 그 사진이 그 사람이 말하고 있는 숏의 첫 프레임이 되고, 목소리는 같은 패스에서 생성됩니다 — 그래서 음성 파일을 먼저 만들 필요가 없습니다.

올리신 사진
생성된 것 — 화면과 소리가 함께
24 fps 로 4 에서 15 사이의 모든 정수 초, 768P 또는 2K, 끝까지 돌려본 11개 언어. JPG, PNG, WEBP, HEIC, HEIF 가 그대로 들어갑니다. 사람 사진은 대개 휴대폰 사진인데 대부분의 도구가 조용히 변환을 요구하기 때문에, 이건 말해 둘 값어치가 있습니다. 다듬은 프로필 사진보다 휴대폰 스냅이 더 잘 움직이는 경우가 많습니다 — 보정은 움직임에 필요한 질감을 지워 버립니다. 고르실 수 있다면 이가 보이는 사진으로: 다문 입은 입술 뒤에 무엇이 있는지에 대한 정보를 담고 있지 않아서 모델이 입안을 지어내고, 그 지어낸 입안이 결과를 어색하게 보이게 하는 정체입니다.
- 사진이 첫 프레임
- 001
- 정수 초 단위
- 4~15초
- 끝까지 돌려본 언어
- 11
- 같은 패스에서 나온 소리
- 스테레오
사진이 첫 프레임
정수 초 단위
끝까지 돌려본 언어
같은 패스에서 나온 소리
- 음성 파일을 먼저 만들 필요 없음
- 프레임 단위 타이밍 맞추기 없음
- 립싱크 공정을 따로 돌릴 필요 없음
AI 립싱크가 제대로 나왔을 때의 모습
보시는 것이 나온 그대로입니다 — 업스케일도, 색보정도, 두 번째 패스도 없습니다. 옆에 찍혀 있는 것은 그것을 만든 프롬프트 전문이며 요약이 아닙니다. 「이걸로 해보기」를 누르면 위쪽 입력창에 그대로 들어갑니다. 길이와 화면 비율도 만들어졌을 때 그대로라서, 한 줄만 바꿔 무엇이 달라지는지 보실 수 있습니다. 소리를 켜 보세요. 들리는 소리는 말하는 입과 같은 패스에서 나온 것입니다.
더 많은 프롬프트 예시 ↗
16:9 · 6s요약이 아니라 프롬프트 전문
Reference the Hitchcock camera movement from Video 1, have the character in Image 2 sing, with the vocals matching Audio 3.
위의 사진, 그리고 그것이 된 6초
한 번의 생성, 하나의 프롬프트, 모델이 돌려준 그대로
사람 사진이어야 할
이유는 없습니다
16:9 · 15s한 사람사진참조한 사진 한 장이 입 클로즈업을 포함해 모든 숏에서 유지됩니다. 립싱크가 원래 크기에서 버티는지 아닌지는 바로 거기서 갈립니다.
16:9 · 15s한 화면에 두 사람165자두 사람이 번갈아 말하는데 프롬프트 전체는 한 문장이었습니다. 화자 태그는 누가 먼저 말할지 지정해야 할 때 쓰는 것이고, 이 편에서는 쓰지 않았습니다.
16:9 · 15s그려진 캐릭터일러스트회화풍 2D 이고, 입도 화면의 나머지와 같은 손으로 그려졌습니다. 숏 어디에도 실사적인 요소는 없습니다.
16:9 · 15s동물 캐릭터동물고양이와 생쥐가 한 줄씩 말합니다. 사람 얼굴이 아닌데도 입은 음절에 정확히 얹힙니다.
이 네 편은 다른 분들이 돌린 것이지 저희 것이 아닙니다 — 그래서 구석에 Hailuo 마크가 있고, 이 페이지의 다른 영상에는 없습니다. 그 마크가 출처의 증거입니다. 네 편 모두 프롬프트와 함께 @SimplyAnnisa, @heydin_ai, @ManuAGI01 께서 공개하셨고, 네 편의 모든 글자를 그 링크에서 읽으실 수 있습니다.
여기에 없는 것은 저희가 아직 돌려보지 않은 것들입니다. 진짜 개나 고양이의 사진, 그리고 그려진 초상화. 둘 다 막혀 있지 않고 시도해 볼 값어치도 있습니다 — 확인한 11개 너머의 언어에 대해 이 페이지가 취하는 것과 같은 입장입니다. 돌아오는 것을 직접 보지 않은 것은 주장하지 않습니다.
사진을 립싱크하는 세 단계
결과를 가르는 것은 첫 단계이고, 제대로 하는 데 4초쯤 걸립니다. 앞의 두 카드는 이 페이지 위쪽 입력창이 일하고 있는 모습입니다 — 받아들인 파일과, 거기 쳐 넣은 한 줄. 세 번째가 돌아온 것입니다.

얼굴 하나 넣기
사진도 되고 2 에서 15초짜리 소재도 됩니다. 얼굴 하나, 카메라를 보고 있고, 입을 가리는 것이 없어야 합니다. iPhone 의 HEIC 는 그대로 들어가고, 입력창이 파일을 읽어서 되돌려 줍니다 — 크기, 비율, 용량 — 돈을 쓰시기 전에.
얼굴 하나JPG · PNG · WEBP · HEIC![이 페이지의 프롬프트 입력창에 한 줄이 쳐진 상태 — (S1) speaks warmly, [English] I have used this every morning for a month — 그리고 73 / 7000 이라고 표시된 카운터](/_next/image?url=%2Fmedia%2Ftools%2Fls-ui-prompt.webp&w=1280&q=70)
무슨 말을 할지 쓰기
문장과 언어 태그를 쳐 넣으면 목소리도 함께 도착합니다 — 음성 파일을 먼저 만들 필요가 없습니다. 입력창 안의 저 한 줄은 주어진 7,000자 중 73자이고, 나머지는 전부 숏을 묘사하는 데 씁니다.
7,000자 중 73자성우를 고를 일 없음
오디오 트랙 · 32 kHzLIP-SYNC.MP4재생하고, 한 단어만 바꾸기
영상은 소리가 이미 파일 안에 들어간 채로 도착합니다. 대부분은 첫 번째가 아니라 두 번째나 세 번째를 남기십니다 — 모든 시도가 저장되니, 처음부터 다시가 아니라 고치는 작업이 됩니다.
4~15s · 최대 2K소리는 이미 합쳐져 있음
앞의 두 카드는 이 페이지 위쪽 입력창을 찍은 화면이지 그림이 아닙니다. 올리신 사진은 절대 수정되지 않습니다 — 돌아오는 것은 새 파일입니다. 세 번째 카드의 영상은 MiniMax 가 직접 만든 것으로, 프롬프트와 함께 H3 공개 글에 실렸습니다. 스틸이 얼굴을, 보컬 트랙이 노래를, 영화 클립이 카메라 움직임을 정했습니다. 그 편은 오디오 경로로 갔고, 위쪽 입력창은 두 경로 다 받습니다.
사람들이 AI 립싱크를 쓰는 곳
시작하기 좋은 네 곳. 각각 완성된 영상 뒤의 프롬프트 전문을, 만들어졌을 때의 길이와 화면 비율 그대로 위쪽 입력창에 넣어 줍니다.
16:9 · 8s카메라를 보고 한 줄
영상 전체가 한 사람과 한 문장입니다. 6초라면 열두 단어 안쪽으로 잡으세요 — 짧은 길이에 긴 문장을 넣는 것이 첫 시도가 실망스러운 흔한 이유입니다.
9:16 · 9s장면에 대사 한 줄
이미 머릿속에 있는 숏에서 캐릭터가 그 한 줄을 말합니다. 말뿐 아니라 사람도 묘사하세요 — 옷, 머리, 눈에 띄는 특징 하나 — 그러면 얼굴이 영상 내내 자리를 지킵니다.
9:16 · 15s제품을 이야기하는 사람
인물 스틸에 제품 스틸을 더하고, 대사는 숏마다 따로 씁니다. 15초를 꽉 채우는 편이라, 상한이 어디인지도 함께 보여 줍니다.
16:9 · 15s말이 아니라 노래
톤을 노래로 두시거나, 보컬을 올려 입을 움직이게 하세요. 올리신 트랙은 참조가 아니라 완성 사운드트랙 그 자체가 되고, 올리는 데는 청구되지 않습니다. 영상 길이는 최소한 트랙과 같게 잡으세요.
영상에서 출발하는데 원래 픽셀이 그대로 남아야 하나요? 그건 더빙이고, 잘라 붙이는 도구가 이 페이지보다 잘합니다 — 여기서는 원본을 고치는 것이 아니라 숏을 다시 세웁니다.
11개 언어, 그리고 그것을 움직이는 대사 형식
끝까지 돌려본 것이 11개입니다. 어느 언어에서든 입은 영어의 근사음이 아니라 그 언어 자체의 소리로 빚어집니다. 말할 대사를 그 언어로 쓰면 말맛이 살고, 영어로 쓰고 언어 태그만 붙이면 살지 않습니다. 대사 쓰는 법에 형식이 있습니다.
립싱크로 확인한 11개
11
- 아랍어
- 중국어
- 영어
- 프랑스어
- 독일어
- 이탈리아어
- 일본어
- 한국어
- 포르투갈어
- 러시아어
- 스페인어
견주어 보시라고 적자면, Google 자신의 Veo 3.1 문서에는 영어는 완전히 지원되고 다른 언어는 평가하지 않았다고 적혀 있습니다. 여러 편에서 같은 얼굴이나 같은 목소리가 필요하시면 레퍼런스로 영상을 쓰세요.
확인하실 수 있는 것, 한 편의 비용, 플랜이 바꾸는 것
먼저 말씀드립니다. 이건 유료 도구입니다. 소리가 없는 립싱크는 립싱크가 아니라서, 이 페이지가 돌리는 것은 화면만 나오는 무음 엔진이 아니라 MiniMax H3 이고, 그래서 체험용 한 편을 드릴 수가 없습니다. 돈을 쓰지 않고 하실 수 있는 것은 결과를 확인하는 일입니다. 위의 영상은 모두 계정 없이 재생하고 내려받으실 수 있고, 그것을 만든 프롬프트도 함께 있습니다. 한 번 돌리는 것은 60 크레딧부터 — 768P 4초, 모델이 만들 수 있는 가장 짧은 길이입니다. 모든 시도가 저장되고, 의미가 있는 것은 두 번째입니다. 첫 편을 남기는 분은 거의 없기 때문입니다. 플랜을 올리시면 매달 크레딧이 늘고, 긴 영상도 아껴 쓰지 않고 2K 로 뽑을 수 있으며, 완성 1초당 비용이 내려갑니다.
어느 쪽이든 월 크레딧은 같습니다
- 무료카드 없이
계정 없이 한 편, 무료 엔진으로. MiniMax H3 자체는 유료입니다.
$0계속어느 단계에서도 카드를 받지 않습니다
무료 시작봇 확인만 — 이메일 없이
1편, 계정 없이
Agnes Video V2.0 · 16:9 · 5초 · 소리 없음
무료로 로그인 — Agnes 로 하루 3편, 소리 없음$9.9 부터의 어떤 팩이든 MiniMax H3 를 엽니다 — 모든 방식, 768P 와 2K
- 네이티브 2K 의 MiniMax H3유료만
- 화면과 함께 오는 네이티브 오디오유료만
- 계정 없이 한 편
- 동시 1편
- 실패한 영상은 무료
- 비공개 생성
- 어떤 팩이든 모든 방식에서 H3 를 엽니다
무료는 다른 엔진입니다. 플랜 보기
속도와 대기열
- 대기열
- 무료 레인
- 동시 작업
- 1
- 묶음
- 1
- 기록 보관
- 24시간 · 로그인 시 7일
- 응대
- 커뮤니티
- Lite33% 절약
MiniMax H3 를 네이티브 2K 로 엽니다. 가장 작은 유료 플랜입니다 — 가장 많이 고르시는 것은 Pro 입니다.
$9.9/mo$14.9연 $118.8 청구 · 연 $60 절약
7일 환불 · 언제든 해지
월 1,000 크레딧 · 약 22편
4초 · 768P · 텍스트로 영상
4초 2K 라면 약 17편
월간이든 연간이든 크레딧은 같습니다
- 네이티브 2K 의 MiniMax H3 — 네이티브 오디오와 함께
- 대사 · 효과음 · 음악이 같은 파일에
- 최대 15초15초
- 4초 768P 텍스트로 영상 기준 월 약 22편
- 실패한 영상은 무료
- 크레딧 미사용 시 7일 환불
- 동시 작업 1개
- 한 프롬프트로 2개 변형 묶음
개인용과 검토용 — 상업적 권리는 MiniMax 에서
속도와 대기열
- 대기열
- 표준
- 동시 작업
- 1
- 묶음
- 2
- 기록 보관
- 7일
- 응대
- 이메일 · 48시간
- 가장 많이 고르는 플랜Pro33% 절약
Lite 보다 $30 더. 월 약 125편, 같은 MiniMax H3, 더 빠른 대기열.
$29.9/mo$44.9연 $358.8 청구 · 연 $180 절약
7일 환불 · 언제든 해지
월 3,000 크레딧 · 약 125편
4초 · 768P · 텍스트로 영상
4초 2K 라면 약 84편
월간이든 연간이든 크레딧은 같습니다
- Lite 의 모든 것
- 4초 768P 텍스트로 영상 기준 월 약 125편
- 동시 3개3×
- 프롬프트 추출
- 한 프롬프트로 4개 변형 묶음
- 기록 7일 보관
- 크레딧 미사용 시 7일 환불
개인용과 검토용 — 상업적 권리는 MiniMax 에서
속도와 대기열
- 대기열
- 빠름
- 동시 작업
- 3
- 묶음
- 4
- 기록 보관
- 7일
- 응대
- 이메일 · 12시간
- Studio33% 절약
한 달치 분량 전부, 줄의 맨 앞, 그리고 4시간 안에 답하는 사람.
$99.9/mo$149.9연 $1,198.8 청구 · 연 $600 절약
7일 환불 · 언제든 해지
월 10,000 크레딧 · 약 325편
4초 · 768P · 텍스트로 영상
4초 2K 라면 약 217편
월간이든 연간이든 크레딧은 같습니다
- Pro 의 모든 것
- 4초 768P 텍스트로 영상 기준 월 약 325편
- 동시 8개8×
- 한 프롬프트로 4개 변형 묶음
- 기록 7일 보관
- 4시간 안에 우선 응대
- 저희가 드리는 가장 낮은 소모율
- 크레딧 미사용 시 7일 환불
개인용과 검토용 — 상업적 권리는 MiniMax 에서
속도와 대기열
- 대기열
- 우선 — 줄의 맨 앞
- 동시 작업
- 8
- 묶음
- 4
- 기록 보관
- 7일
- 응대
- 우선 · 4시간
입이 원래 해상도에서도
버티는 이유
다른 립싱크 도구는 모두 사진 속에서 입을 찾아 바꿔치기합니다. 이건 애초에 찾지 않습니다 — 그 한 가지 차이가 입이 덧댄 조각처럼 보이지 않는 이유의 전부입니다.
피부와 맞지 않는 입
주변 얼굴과 해상도가 다른 조각, 그리고 고개를 돌릴 때마다 기어 다니는 턱선. 한 번 보이기 시작하면 다시는 안 보이게 할 수 없습니다 — 그리고 그건 한 번도 올리신 사진 탓이 아니었습니다.
96 픽셀 사각형을 도로 붙이기
흔한 방식은 입을 찾아 그 둘레를 작은 사각형으로 — 대개 96×96 — 잘라내고, 그 크기에서 새 입모양을 만들어 원래 프레임에 붙이는 것입니다. 사각형 바깥은 한 번도 모델을 거치지 않았습니다.
도구가 스스로를 설명하는 동사를 읽으세요
영상 속 얼굴에 입모양을 매핑합니다. 원본 이미지에 블렌딩합니다. 매핑, 블렌딩 — 어느 쪽이든 이미 있는 얼굴 위에 무언가를 얹는 것이고, 턱선이 그 끝나는 자리입니다.
소리까지 포함한 새 프레임이 한 번의 패스로
MiniMax H3 는 올리신 입을 찾지 않습니다. 프레임을 편집하는 것이 아니기 때문입니다. 잘라내기도, 붙이기도, 따라가야 할 경계도 없습니다. 입이 뺨과 같은 해상도를 갖는 이유는 그림 안에 해상도가 하나뿐이기 때문입니다. 목소리도 같은 패스에서 나오니, 밋밋한 얼굴 위에 들뜬 사운드트랙이 얹히는 일이 없습니다.
원래 영상은 남지 않습니다. 돌아오는 것은 그것을 바탕으로 새로 만든 영상이지, 올리신 영상에 새 입이 붙은 것이 아닙니다. 내 픽셀을 되찾아야 하신다면 — 이를테면 40분짜리 강의에 스페인어 사운드트랙을 붙이는 경우 — 잘라 붙이는 쪽 도구가 이 페이지보다 도움이 됩니다.
사진이 정하지 못하는 것을
대사가 정합니다
애초에 될지 안 될지는 사진이 정합니다. 무엇이 나올지, 몇 초가 될지, 얼마가 들지는 대사가 정합니다 — 그리고 이 셋은 같은 하나의 결정입니다.
길이는 예산입니다
출력은 4 에서 15 사이의 정수 초입니다. 보통 말하는 속도라면 대략 열에서 마흔 단어. 대사를 먼저 쓰고, 세어 보고, 그다음 길이를 고르세요 — 반대로 하면 따라잡을 수 없는 시계와 경주하는 말투가 나옵니다.
4~15초, 정수 초
힘을 받는 태그는 하나
[Language] 는 입모양의 바탕이 되는 음소 집합을 고르므로, 화면을 바꾸는 태그는 이쪽입니다. (S1) 은 화면에 말할 만한 사람이 둘 이상일 때만 제 몫을 합니다 — 얼굴이 하나면 눈에 보이는 변화는 없습니다.
(S1) … [Korean] …
글자 수 상한은 대사를 위한 것이 아닙니다
7,000자는 프롬프트 전체를 덮습니다. 말하는 대사는 수십 자이고, 나머지는 전부 숏입니다 — 누가, 어디서, 어떤 빛으로, 어떤 화각으로. 자리가 모자라는 것은 묘사의 문제이지 대사의 문제가 아닙니다.
7,000자
초가 곧 청구서입니다
768P 는 출력 1초당 $0.08, 2K 는 $0.13 입니다. 대사가 길이를 정하고 길이가 청구액을 정하니, 15초짜리는 4초짜리의 거의 네 배가 듭니다. 들을 값어치가 있는 대사는 대개 짧습니다.
$0.08 / 초 · 768P
여기 적힌 것은 모델에 대한 추측이 아닙니다 — 길이와 글자 수 상한은 공개된 제한이고, 초당 가격은 요금 페이지에 있는 그대로입니다. 숏 묘사를 맡기고 싶으시면 프롬프트 생성기가 나머지 6,900자를 씁니다.
누구의 얼굴을 쓰실 수 있나
본인 얼굴, 허락을 받은 얼굴, 또는 직접 생성하셔서 누구의 것도 아닌 얼굴입니다.
- 얼굴실존 인물이 하지 않은 말을 한 것처럼 보이게 하는 것은 H3 라이선스가 금지합니다 — 공인도, 모르는 사람의 사진도 안 됩니다.
- 목소리특정 인물의 목소리를 복제하는 트랙을 올리시려면 본인 것이거나, 사용 허락을 받았거나, 합성된 것이어야 합니다.
- 신고신고 링크는 모든 페이지와 모든 결과에 있습니다. 반복되는 계정은 정지됩니다.
- 미성년자미성년자가 나오는 사진이나 영상은 절대 올리지 마세요.
- 업로드어떤 학습에도 쓰지 않습니다. 언제든 지우실 수 있고, 계정도 지우실 수 있습니다.
- 상업적 이용 권리개인 이용과 평가 목적 이용은 유료를 포함한 모든 플랜에서 가능합니다. 상업적 이용 권리는 MiniMax 에서 직접, Hailuo 또는 공식 API 를 통해 얻으셔야 합니다. 요약이며 법률 자문이 아닙니다.
AI 립싱크 자주 묻는 질문
첫 대사를 돌리기 전에 알아 두실 것
이 AI 립싱크 도구는 무료인가요?
돈을 적게 쓰고 시험해 보려면?
음성 파일이 필요한가요?
영상에 소리가 함께 오나요?
이미 있는 영상을 립싱크할 수 있나요?
영상은 얼마나 길게 만들 수 있나요?
어떤 언어가 되나요?
전에 쓰던 도구에서 입이 뭉개진 이유가 뭔가요?
제 사진 속 사람처럼 보이나요?
어떤 사진을 쓰면 되나요?
오디오가 영상보다 길면 어떻게 되나요?
말하지 않고 노래하게 할 수 있나요?
2K 로 뽑을 수 있나요?
계정이 필요한가요?
결과물에 워터마크가 들어가나요?
「생성」을 누르면 그다음엔 어떻게 되나요?
만든 영상을 상업적으로 쓸 수 있나요?
어떤 사진 형식과 크기가 되나요?
사진에 사람이 둘 이상 있어도 되나요?
대사는 얼마나 길게 쓸 수 있나요?
MiniMax H3 AI Video Generator 편집팀이 작성하고 관리합니다 게시 최종 수정
