Seedance 2.5 is live — 30-second cinematic video with native audio & real-person references
Vídeos musicales con IA: de canción y fotos a vídeo completo
2026/08/23

Vídeos musicales con IA: de canción y fotos a vídeo completo

Convierte MP3 de 10 segundos a 5 minutos e imágenes 1-7 en vídeos musicales mediante una solicitud API, con subtítulos y tablas de precios precisos.

Music Video 1.0 transforma un MP3 de 10 a 300 segundos y de 1 a 7 imágenes de referencia en un vídeo musical de longitud completa en una única tarea API asincrónica. Admite cinco relaciones de aspecto, salida en 540P/720P/1080P, y subtítulos opcionales de letras generados a partir de la canción o proporcionados como archivo SRT.[1]

Este es un producto diferente del de generar treinta clips de cinco segundos y editarlos en una pista. La canción determina tanto la duración de salida como la facturación.

Entradas, salida y límites

CampoQué haceLímite
audio_urlLa canción completaMP3, 10–300 segundos
reference_image_urlsArtista, personaje, ubicación o referencias de estilo1–7 URLs públicas
promptDirección visualHasta 3.000 caracteres
aspect_ratioHorizontal, vertical o cuadrado16:9, 9:16, 1:1, 4:3, 3:4
resolutionNivel de salida540P, 720P, 1080P
add_subtitleGrabar letras en el vídeoOpcional
srt_urlProporcionar temporización aprobada de letrasURL SRT pública opcional

La salida sigue la duración de la canción, hasta cinco minutos. La API devuelve un id de tarea inmediatamente; la aplicación sondea hasta que output.video_urls contiene el MP4.[1]

Solicitud mínima

curl -X POST https://api.reapi.ai/api/v1/videos/generations \
  -H "Authorization: Bearer $REAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "music-video-1-0",
    "audio_url": "https://files.example.com/song.mp3",
    "reference_image_urls": [
      "https://files.example.com/artist-portrait.jpg",
      "https://files.example.com/neon-stage.jpg"
    ],
    "aspect_ratio": "16:9",
    "resolution": "540P",
    "prompt": "Intimate live performance, practical colored lights, slow camera movement"
  }'

Todos los medios deben ser URLs HTTP(S) públicas. Se rechazar rutas locales y datos base64.

Cuánto cuesta una canción completa

Las tarifas públicas en vivo son 0,05 $ por segundo de canción a 540P, 0,08 $ a 720P y 0,15 $ a 1080P.[2]

coste de vídeo musical = segundos de canción redondeados × tarifa de resolución
Duración de canción540P720P1080P
30 segundos$1,50$2,40$4,50
60 segundos$3,00$4,80$9,00
2 minutos$6,00$9,60$18,00
3 minutos$9,00$14,40$27,00
5 minutos$15,00$24,00$45,00

El servidor mide el MP3 real en lugar de confiar en la duración suministrada por el cliente. Recortar un outro de silencio no intencional de 12 segundos antes de cargar reduce tanto la duración de salida como la duración facturable.

Usa las imágenes de referencia como un contrato visual

Hay siete imágenes disponibles, pero cada una debe tener un propósito. Un conjunto práctico para un vídeo de artista es:

  • una imagen de referencia limpia de rostro/vestuario;
  • una imagen de cuerpo completo;
  • dos referencias de ubicación o set;
  • una referencia de color/iluminación;
  • una referencia de objeto o portada de álbum.

No mezcles varias versiones del mismo personaje con diferente cabello, ropa o edad a menos que la variación sea intencional. El modelo no tiene forma de saber cuál es la contradicción es un error.

El prompt debe explicar los roles en lugar de reiterar el contenido de la imagen:

Keep the singer's face and silver jacket from the first two images. Use the
warehouse and amber light from images three and four. Verses are restrained
handheld close-ups; choruses widen into fast dolly moves. No crowd, no logos,
no text except supplied subtitles.

¿Letras automáticas o tu propio SRT?

Hay tres opciones válidas:

Modo de subtítuloÚsalo cuandoRiesgo
add_subtitle: falseSe va a añadir una leyenda limpia más tardeSin letras en el archivo entregado
Subtítulos automáticosUn borrador rápido es suficienteLos nombres, jerga y temporización pueden ser incorrectos
srt_url suministradoLas letras y la temporización están aprobadasRequiere preparar el SRT

Para un lanzamiento maestro, traes un SRT. La transcripción automática es útil para revisar, no como prueba de que cada letra sea correcta.

{
  "model": "music-video-1-0",
  "audio_url": "https://files.example.com/song.mp3",
  "reference_image_urls": ["https://files.example.com/look.jpg"],
  "aspect_ratio": "9:16",
  "resolution": "720P",
  "add_subtitle": true,
  "srt_url": "https://files.example.com/song-approved.srt",
  "subtitle_color": "#F4EBDD"
}

¿Generación de canción completa o plano de tomas?

Usa una tarea de canción completa cuando la velocidad y la continuidad visual amplia importan más que editar cada pulso. Usa una lista de tomas cuando el vídeo necesita productos exactos, coreografía, continuidad narrativa o una edición fija en pulso.

El camino intermedio suele ser lo mejor: genera un tratamiento visual completamente acabado a 540P, marca las secciones que vale la pena mantener, luego reconstruye solo los momentos destacados con modelos de nivel de toma. La canción completa se convierte en una maqueta animada en lugar del maestro final.

Qué un simple solicitud de canción completa puede y no puede controlar

Una única tarea es buena para preservar una apariencia general, dirección de ritmo y asunto recurrente en toda una pista. Es más débil cuando el editor necesita una acción específica en el compás 17, un producto exacto en cada estribillo o un evento narrativo en una letra fija.

Trata el prompt como un brief de vídeo musical en lugar de una lista de tomas con cincuenta comandos con marca de tiempo. Describe la gramática visual: cómo los versos difieren de los estribillos, qué cambia en el puente, qué asunto debe seguir siendo reconocible y qué nunca debe aparecer. Luego revisa el resultado como una maqueta animada.

Usa un editor de línea de tiempo o generaciones de nivel de toma para superposiciones deterministas, logotipos, copia legal, tipografía de letras y cortes de pulso exactos. Los fotogramas generativos son un lugar deficiente para componer un nombre de patrocinador aprobado. El sistema de subtítulos es la excepción porque grabar una transcripción/SRT conocida a través de un campo dedicado en lugar de pedirle al modelo de vídeo que dibuje texto arbitrario desde un prompt.

Estima la exposición al reintento antes de elegir 1080P

La tabla de costes se vuelve más útil cuando se multiplica por intentos esperados. Una pista de tres minutos cuesta 27 $ a 1080P. Tres conceptos visuales diferentes cuestan 81 $; dos revisiones del concepto elegido pueden llevar el total a 135 $.

La misma exploración a 540P es 9 $ por intento. Tres conceptos más un 1080P final cuestan 54 $:

3 × conceptos 540P de 180 segundos   $27
1 × final 1080P de 180 segundos      $27
total                                $54

Ese plan escalonado no funciona cuando el problema de aceptación es visible solo a resolución final. Ejecuta una calibración corta o de alta resolución completa temprano si el vídeo depende del detalle facial, textura de vestuario fino o legibilidad de subtítulos.

Prepara el audio y las referencias antes del envío

El servidor mide el MP3 real, así que el maestro cargado ya debe estar finalizado. Antes de enviarlo:

  • elimina silencio no intencional y audio de cuenta atrás;
  • confirma que la muestra no contiene marcas de agua temporales ni voces guía;
  • normaliza el maestro aprobado fuera de la tarea de vídeo;
  • verifica que cada imagen de referencia tenga licencia y sea intencionalmente parte del look;
  • recorta las referencias alrededor de la información de asunto que el modelo necesita;
  • elimina imágenes casi duplicadas con grados de color en conflicto;
  • crea y revisa el SRT si las letras importan.

Cambiar la canción después de la generación desplaza cada edición posterior y pista de subtítulo. Un render de canción completa es posterior al dominio de audio, no un lugar para descubrir que el puente será ocho segundos más corto.

Maneja una tarea larga fallida o estancada

No reenvíes automáticamente cuando el sondeo agota el tiempo. La tarea original aún puede estar en proceso, y un reintento ciego puede crear una segunda carga de canción completa. Persiste el id de tarea, consulta su estado nuevamente y distingue un tiempo de espera de aplicación de un estado failed terminal.

Si el servidor no puede medir el audio, la solicitud devuelve un error de precios sin carga. Verifica que la URL sea pública, devuelva el MP3 directamente y admita acceso remoto. Una página de compartición que contenga un reproductor de audio no es lo mismo que una URL de audio directo.

Construye alrededor de una tarea asincrónica de larga duración

Un render de varios minutos puede tomar mucho más tiempo que un trabajo de text-to-video corto. El código de producción debe:

  1. guardar el id de tarea antes de volver al usuario;
  2. sondear en segundo plano en lugar de mantener abierta una solicitud HTTP;
  3. permitir una ventana de tiempo de espera larga;
  4. mostrar la duración de canción sondeda y el coste de resolución estimado;
  5. retener las URLs de entrada y el prompt para auditoría y reintento.

El contrato completo de solicitud y error está en la documentación de API de Music Video 1.0, y las tarifas actuales están en la página de modelo y precios de Music Video 1.0.

Referencias

  1. reAPI Music Video 1.0 API documentation, accessed August 23, 2026.
  2. reAPI Music Video 1.0 model and pricing page, accessed August 23, 2026.