
AI 뮤직비디오 생성 API: 음악·사진·가사로 전곡 영상 만들기
10초~5분 음악 파일과 1~7개 참고 이미지로 완성된 뮤직비디오를 한 번의 비동기 API 요청으로 생성하는 방법, 자막 옵션, 정확한 가격표를 정리했습니다.
Music Video 1.0은 10300초 MP3 한 곡과 참고 이미지 17개를 하나의 비동기 API 작업으로 완전한 길이의 뮤직비디오로 변환합니다. 다섯 가지 화면비와 540P/720P/1080P 출력을 지원하며, 음악에서 추출하거나 SRT 파일로 공급하는 가사 자막을 선택적으로 소성(burn-in)할 수 있습니다.[1]
이것은 35초 짧은 쇼트 30개를 생성해 트랙으로 편집하는 것과는 다른 상품입니다. 음악이 출력 길이와 청구액을 모두 결정합니다.
입력, 출력, 한계값
| 필드 | 기능 | 한계 |
|---|---|---|
audio_url | 완성된 음악 | MP3, 10~300초 |
reference_image_urls | 아티스트, 캐릭터, 배경, 스타일 참고 | 1~7개 공개 URL |
prompt | 시각적 방향 지시 | 최대 3,000자 |
aspect_ratio | 가로, 세로, 정사각형 | 16:9, 9:16, 1:1, 4:3, 3:4 |
resolution | 출력 계급 | 540P, 720P, 1080P |
add_subtitle | 가사를 영상에 소성 | 선택사항 |
srt_url | 승인된 가사 타이밍 제공 | 선택사항 공개 SRT URL |
출력은 음악 길이를 따르며 최대 5분입니다. API는 즉시 작업 id를 반환하고, 애플리케이션은 output.video_urls에 MP4가 나타날 때까지 폴링합니다.[1]
최소 요청
curl -X POST https://api.reapi.ai/api/v1/videos/generations \
-H "Authorization: Bearer $REAPI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "music-video-1-0",
"audio_url": "https://files.example.com/song.mp3",
"reference_image_urls": [
"https://files.example.com/artist-portrait.jpg",
"https://files.example.com/neon-stage.jpg"
],
"aspect_ratio": "16:9",
"resolution": "540P",
"prompt": "Intimate live performance, practical colored lights, slow camera movement"
}'모든 미디어는 공개 HTTP(S) URL이어야 합니다. 로컬 경로와 base64 데이터는 거부됩니다.
완성된 음악이 얼마인가
공개 요금은 540P에서 곡 초당 $0.05, 720P에서 $0.08, 1080P에서 $0.15입니다.[2]
뮤직비디오 비용 = 올림(음악 초) × 해상도 요금| 음악 길이 | 540P | 720P | 1080P |
|---|---|---|---|
| 30초 | $1.50 | $2.40 | $4.50 |
| 60초 | $3.00 | $4.80 | $9.00 |
| 2분 | $6.00 | $9.60 | $18.00 |
| 3분 | $9.00 | $14.40 | $27.00 |
| 5분 | $15.00 | $24.00 | $45.00 |
서버는 클라이언트가 공급한 길이를 믿지 않고 MP3를 직접 측정합니다. 업로드 전에 의도하지 않은 12초 무음 아웃트로를 다듬으면 출력 길이와 청구 길이가 모두 줄어듭니다.
참고 이미지를 시각적 계약처럼 사용하기
이미지는 7개까지 쓸 수 있지만 각각이 역할을 가져야 합니다. 아티스트 영상의 실용적인 세트는 이렇습니다:
- 깔끔한 얼굴/의상 참고 이미지 1개;
- 전신 이미지 1개;
- 배경이나 세트 참고 2개;
- 색감/조명 참고 1개;
- 물건이나 앨범아트 참고 1개.
같은 인물의 여러 버전(머리, 옷, 나이가 다른)을 섞지 마세요. 다양성이 의도된 게 아니라면 모델은 어느 모순이 실수인지 알 수 없습니다.
프롬프트는 이미지 내용을 반복하기보다는 그 역할을 설명해야 합니다:
Keep the singer's face and silver jacket from the first two images. Use the
warehouse and amber light from images three and four. Verses are restrained
handheld close-ups; choruses widen into fast dolly moves. No crowd, no logos,
no text except supplied subtitles.자동 가사 또는 직접 만든 SRT?
유효한 선택지는 세 가지입니다:
| 자막 모드 | 언제 쓸 것인가 | 위험 |
|---|---|---|
add_subtitle: false | 깔끔한 마스터를 나중에 자막 처리할 때 | 납본 파일에 가사 없음 |
| 자동 자막 | 빠른 초안이면 충분할 때 | 인명, 슬랭, 타이밍이 틀릴 수 있음 |
srt_url 제공 | 가사와 타이밍이 승인되었을 때 | SRT 준비 필요 |
출시 마스터라면 SRT를 준비하세요. 자동 전사는 검수용이지, 모든 가사가 맞다는 증명이 아닙니다.
{
"model": "music-video-1-0",
"audio_url": "https://files.example.com/song.mp3",
"reference_image_urls": ["https://files.example.com/look.jpg"],
"aspect_ratio": "9:16",
"resolution": "720P",
"add_subtitle": true,
"srt_url": "https://files.example.com/song-approved.srt",
"subtitle_color": "#F4EBDD"
}전곡 생성인가, 쇼트별인가?
속도와 광범위한 시각적 연속성이 각 비트마다 정밀한 편집보다 중요할 때는 전곡 작업을 사용하세요. 정확한 상품, 안무, 서사적 연속성, 비트 단위 고정 편집이 필요할 때는 쇼트 리스트를 사용하세요.
중간 경로가 보통 최선입니다: 540P 완성 시각 치료를 생성하고, 지킬 만한 섹션에 표시한 다음, 하이라이트 순간만 쇼트 레벨 모델로 재구성합니다. 전곡은 최종 마스터가 아니라 애니매틱이 됩니다.
한 번의 전곡 요청으로 할 수 있고 없는 것
하나의 작업은 전반적인 룩, 페이싱 방향, 트랙 전체의 반복되는 주제를 지키는 데 좋습니다. 편집자가 17번째 마디의 특정 액션, 매 후렴에서의 정확한 상품, 고정된 가사에서의 서사적 사건을 요청할 때는 약합니다.
프롬프트를 타임스탐프 명령 50개가 있는 쇼트 리스트보다는 뮤직비디오 브리프처럼 다루세요. 시각 문법을 설명하세요: 절이 후렴과 어떻게 다른가, 브릿지에서 뭐가 바뀌는가, 어떤 주체가 인지 가능해야 하는가, 뭐는 절대 없어야 하는가. 그 다음 결과를 애니매틱으로 검토합니다.
결정적 오버레이, 로고, 법적 문구, 가사 타이포그래피, 정확한 비트 컷은 타임라인 편집기나 쇼트 레벨 생성을 사용하세요. 생성 프레임은 프롬프트에서 자의적인 텍스트를 그리는 나쁜 장소입니다. 자막 시스템이 예외입니다. 승인된 transcript/SRT를 알려진 필드를 통해 소성하므로 프롬프트의 의도하지 않은 텍스트 그리기를 요청하지 않습니다.
1080P를 고르기 전에 재시도 노출을 추산하세요
가격표는 예상 시도 횟수를 곱했을 때 더 유용해집니다. 3분 트랙은 1080P에서 $27입니다. 세 가지 다른 시각 개념은 $81이고, 선택한 개념의 두 번 개정은 총액을 $135까지 올릴 수 있습니다.
540P에서 같은 탐색은 시도당 $9입니다. 3개 개념과 1개 1080P 최종본 비용은 $54입니다:
3 × 180초 540P 개념 $27
1 × 180초 1080P 최종본 $27
총계 $54받음 기준이 최종 해상도에서만 보일 때는 그 단계별 계획이 작동하지 않습니다. 영상이 얼굴 디테일, 세밀한 의상 질감, 자막 가독성에 의존한다면 일찍 한 번의 짧거나 고해상도 보정을 실행하세요.
제출 전에 오디오와 참고본 준비하기
서버는 실제 MP3를 측정하므로, 업로드한 마스터는 이미 최종본이어야 합니다. 보내기 전에:
- 의도하지 않은 무음과 count-in 오디오를 제거하세요;
- 샘플이 임시 워터마크나 가이드 음성을 포함하지 않는지 확인하세요;
- 비디오 작업 밖에서 승인된 마스터를 정규화하세요;
- 모든 참고 이미지가 라이선스 있고 의도적으로 룩의 일부인지 확인하세요;
- 모델이 필요한 주체 정보 주위로 참고본을 자르세요;
- 색감 그레이드가 충돌하는 거의 같은 이미지를 제거하세요;
- 가사가 중요하다면 SRT를 만들고 교정하세요.
생성 후 음악을 바꾸면 모든 나중 편집과 자막 큐가 이동합니다. 전곡 렌더는 오디오 마스터링의 하류이지, 브릿지가 8초 더 짧아진다는 걸 알아내는 장소가 아닙니다.
실패하거나 멈춘 오래 걸리는 작업 처리하기
폴링 타임아웃 시 자동으로 재제출하지 마세요. 원래 작업이 아직 처리 중일 수 있으며, 무조건 재시도하면 두 번째 전곡 청구가 생길 수 있습니다. 작업 id를 유지하고, 상태를 다시 질의하며, 애플리케이션 타임아웃과 터미널 failed 상태를 구분하세요.
서버가 오디오를 측정할 수 없으면, 요청은 청구 없이 가격 오류를 반환합니다. URL이 공개이고, MP3를 직접 반환하며, 원격 접근을 지원하는지 확인하세요. 오디오 플레이어를 포함하는 공유 페이지는 직접 오디오 URL과 같지 않습니다.
장시간 비동기 작업 주위에 구축하기
다중 분 렌더는 짧은 text-to-video 작업보다 훨씬 더 오래 걸릴 수 있습니다. 프로덕션 코드는:
- 사용자에게 반환하기 전에 작업 id를 저장하세요;
- HTTP 요청을 열어두지 말고 백그라운드에서 폴링하세요;
- 긴 타임아웃 윈도우를 허용하세요;
- 측정된 음악 길이와 추정 해상도 비용을 표시하세요;
- 감사와 재시도를 위해 입력 URL과 프롬프트를 유지하세요.
전체 요청과 오류 계약은 Music Video 1.0 API 문서에 있으며, 현재 요금은 Music Video 1.0 모델 페이지에 있습니다.
참고자료
- reAPI Music Video 1.0 API documentation, accessed August 23, 2026.
- reAPI Music Video 1.0 model and pricing page, accessed August 23, 2026.
더 많은 게시물

휴대폰 카메라 모션 참조로 AI 영상 카메라 움직임을 제어하는 방법
휴대폰으로 자연스러운 카메라 움직임을 기록하고 깔끔한 모션 참조로 변환한 뒤, 3D 애니메이션을 배우지 않고 AI 영상 모델에 카메라 움직임을 지시합니다.


2026년 최고의 Replicate 대안 5가지 비교
2026년 Replicate 대안을 찾고 있나요? fal.ai, Together AI, RunPod, Hugging Face, reAPI를 모델 범위, 가격, 속도와 API 설계로 비교합니다.


GPT-6 Astra 컨텍스트 윈도우: Codex가 258K를 표시하는 이유
GPT-6 Astra의 1.05M 토큰 컨텍스트 윈도우, Codex 세션이 258K를 표시하는 이유, 추측 없이 측정하는 정확한 방법을 설명합니다.
