
Upscalers de código abierto para vídeo: video2x y Real-ESRGAN
Guía de upscalers de vídeo de código abierto: video2x frente a Real-ESRGAN, motores Vulkan, modelos de anime, bajo VRAM, y licencias comerciales.
Sí, puedes upscalear vídeo con software de código abierto, y el stack de upscalers de vídeo de código abierto se ha asentado en dos proyectos que cubren casi cualquier flujo de trabajo. video2x (20.913 estrellas en GitHub, AGPL-3.0) es la canalización completa: una GUI, un instalador de Windows y procesamiento por lotes que envuelve varios motores de upscaling en una sola interfaz[1]. Real-ESRGAN (36.472 estrellas, BSD-3-Clause) es el modelo de restauración sobre el que se construyen la mayoría de esos motores, y proporciona sus propios ejecutables portátiles si deseas el modelo sin el framework[2].
Esta guía cubre qué instala realmente cada uno, en qué GPUs se ejecutan (la respuesta es más amplia que NVIDIA), qué variantes de modelo se ajustan a qué metraje, y dónde están los límites honestos que devuelven a la gente a una API alojada. Todos los hechos del proyecto provienen de la propia documentación de los dos repositorios, recuperados en agosto de 2026.
El stack de upscalers de vídeo de código abierto, y cómo se relacionan los dos proyectos
La relación importa más que la comparación. video2x es un framework de superresolución de vídeo y interpolación de fotogramas de aprendizaje automático; Real-ESRGAN es uno de los motores en su interior. video2x 6.x admite Real-ESRGAN, Real-CUGAN, y RIFE a través de ncnn y Vulkan, más Anime4K v4 y cualquier shader GLSL compatible con MPV personalizado[1]. Por lo tanto, la pregunta práctica rara vez es "video2x o Real-ESRGAN" en términos de calidad; se trata de si deseas que la canalización de vídeo completa (extracción, upscaling, interpolación, reensamblaje) se administre para ti, o si prefieres control directo del modelo.
Hay dos hechos que vale la pena registrar antes de instalar cualquier cosa:
- El requisito de GPU es Vulkan, no CUDA. video2x requiere una GPU que admita Vulkan[1], y las compilaciones portátiles de Real-ESRGAN se ejecutan en GPU de Intel, AMD y NVIDIA a través de la misma implementación ncnn-Vulkan[2]. La creencia común de que el upscaling de código abierto necesita una tarjeta NVIDIA es incorrecta para este stack.
- Las licencias apuntan en direcciones diferentes. AGPL-3.0 en video2x conlleva obligaciones si lo integras en un servicio que ofreces a otros; BSD-3-Clause de Real-ESRGAN no. Para trabajo personal e interno, ninguna te impide avanzar.
video2x: la ruta de canalización completa
video2x es el punto de entrada correcto cuando la entrada es un archivo de vídeo y la salida deseada es un archivo de vídeo mejor, sin nada ensamblado a mano. El lanzamiento actual 6.4.0 es multiplataforma para Windows y Linux, con una GUI Qt6 e instalador de un clic para Windows[1].
Lo que el framework maneja por ti:
- Dos modos de procesamiento: filtrado (upscaling) e interpolación de fotogramas, por lo que un clip de 24 fps puede salir tanto más nítido como más suave[1].
- Elección de motor por trabajo: Anime4K v4 para velocidad en animación, Real-ESRGAN para restauración fotográfica, Real-CUGAN como alternativa ajustada para anime, RIFE para interpolación[1].
- La infraestructura de vídeo: extracción de fotogramas, inferencia por fotograma, y reensamblaje con audio, que es exactamente la parte que falla cuando escribes un modelo directamente contra un archivo de vídeo.
El costo es opacidad y ritmo. Un lanzamiento de framework se mueve más lentamente que los modelos en su interior, y cuando un trabajo falla a mitad del clip, la depuración ocurre en el nivel de registro del framework en lugar del tuyo.
Real-ESRGAN: ejecutables portátiles y la ruta de Python
Real-ESRGAN describe su objetivo como algoritmos prácticos para restauración general de imágenes y vídeos[2], y su distribución refleja lo "práctico": ejecutables portátiles precompilados para Windows, Linux y macOS que no requieren entorno de Python en absoluto, ejecutándose en GPU de Intel, AMD y NVIDIA a través de ncnn-Vulkan[2].
Los detalles que importan para trabajo con vídeo:
- AnimeVideo-v3 es el modelo específico para vídeo: un modelo pequeño ajustado para vídeo de anime, documentado con sus propias comparaciones en el repositorio[2]. Para metraje de animación es la opción predeterminada, no el modelo general x4plus.
- RealESRGAN_x4plus_anime_6B es el modelo compacto de imagen de anime cuando el tamaño de archivo y la velocidad importan[2].
- El script de inferencia de Python admite tiling[2], que es la salida de emergencia de bajo VRAM: un fotograma demasiado grande para la memoria de tu GPU se procesa en mosaicos en lugar de fallar. Más lento, pero se completa.
- Los canales alfa, escala de grises e imágenes de 16 bits se manejan con el mismo script[2], lo que importa cuando el trabajo "vídeo" es realmente un trabajo de secuencia de imágenes desde una tubería de VFX.
El costo en esta dirección: Real-ESRGAN solo procesa fotogramas, no vídeos. Te apropias de la extracción y reensamblaje de ffmpeg, la pista de audio, y la contabilidad de frecuencia de fotogramas, o vuelves a poner video2x encima y estás un nivel de abstracción hacia arriba de nuevo.
Lo que la ruta gratuita realmente cuesta
El software es gratis; la ejecución no lo es. La inferencia por fotograma ocupa la GPU durante toda la duración del trabajo, un clip largo a 4× son horas de ocupación en una tarjeta de consumidor, y el procesamiento en mosaicos para bajo VRAM lo extiende aún más. Ese costo es invisible hasta el tercer lote de la semana, que es cuando la aritmética contra una API alojada se vuelve digna de ejecutar: los precios de API por segundo comienzan en $0.002054/s para mejora ligera y $0.044/s para upscaling Topaz dedicado[3][4]. Y el cálculo del punto de equilibrio contra tu volumen toma cinco minutos.
La división limpia de trabajo en la que aterrizan la mayoría de los equipos: código abierto para iterar en una restauración hasta que se vea bien (reejecutamientos ilimitados, costo marginal cero), la API para el lote que sigue (la tubería por lotes en Python son unos 80 renglones). El modo de fallo a evitar es escribir una granja local frágil para procesar un volumen mensual que costaría $25 alojado.
Una prueba de diez segundos, paso a paso
Sea cual sea la herramienta que instales, la primera ejecución debe ser un segmento de prueba recortado, no un clip completo. La secuencia que ahorra más horas de GPU desperdiciadas:
- Corta diez segundos de la parte que se vea peor; una sección limpia pasará cualquier upscaler y no te dirá nada.
- Elige el motor por contenido, no por capturas de pantalla de referencia: metraje fotográfico a los modelos generales de Real-ESRGAN, animación a AnimeVideo-v3 o Anime4K, e interpolación solo si el formato de entrega realmente necesita la frecuencia de fotogramas más alta[1][2].
- Ejecuta a 2× antes de intentar 4×. Duplicar la resolución es generalmente seguro; quadruplicar desde una fuente de baja calidad inventa detalles que se desplazan en caras y texto.
- Compara en la pantalla de destino al 100% de zoom, pausado en movimiento. El parpadeo temporal y las costuras de mosaicos se ocultan a tamaño de miniatura.
- Cronometra la ejecución y extrapola. Diez segundos de tiempo de procesamiento multiplicados por tu registro real es el costo honesto de la ruta gratuita, y el número que decide si el lote se mantiene local.
Eligiendo entre ellos en la práctica
Instala video2x cuando el trabajo sea "haz estos archivos de vídeo mejores" y quieras una GUI, un instalador, y elección de motor sin tuberías. Cargas de trabajo con mucha animación especialmente: Anime4K y Real-CUGAN viven nativamente allí[1].
Ve directo a Real-ESRGAN cuando necesites el ejecutable portátil en una máquina sin Python, estés procesando secuencias de imágenes en lugar de archivos de contenedor, necesites tiling para que quepa en VRAM, o estés incrustando restauración en tu propio pipeline donde AGPL es un problema y BSD no[2].
Sáltate ambos cuando el metraje ya esté limpio y solo necesite resolución para una especificación de entrega; ese es el trabajo aburrido y barato para el cual existen los niveles de mejora alojada[4].
FAQ
¿Puedo upscalear vídeos usando software de código abierto?
Sí. video2x te proporciona una canalización GUI completa con un instalador de Windows y soporte para Linux, envolviendo motores Real-ESRGAN, Real-CUGAN, RIFE y Anime4K[1]; Real-ESRGAN solo proporciona ejecutables portátiles para Windows, Linux y macOS[2]. Gratis, local, y privado; los costos son tiempo de GPU y esfuerzo de configuración.
¿Necesito una GPU NVIDIA para video2x o Real-ESRGAN?
No. Este stack se ejecuta en Vulkan a través de ncnn: video2x requiere una GPU capaz de Vulkan[1], y las compilaciones portátiles de Real-ESRGAN admiten explícitamente GPU de Intel, AMD y NVIDIA[2]. CUDA-only es un mito aquí, aunque las tarjetas NVIDIA siguen siendo la ruta más probada.
¿Qué modelo debo usar para metraje de anime?
AnimeVideo-v3 de Real-ESRGAN para vídeo, o el compacto x4plus_anime_6B para imágenes[2]. Dentro de video2x, Anime4K v4 es la opción rápida y Real-CUGAN es la alternativa de anime enfocada en calidad[1]. El metraje fotográfico se mantiene en los modelos generales de Real-ESRGAN.
¿Qué hago si mi GPU se queda sin memoria?
Usa tiling. El script de inferencia de Real-ESRGAN tiene opciones de mosaico que dividen cada fotograma en piezas que tu GPU puede sostener[2]. La ejecución se vuelve más lenta y el tiling muy agresivo puede generar costuras en degradados, pero convierte "sin memoria" en "terminado tarde".
¿Puedo usar estas herramientas comercialmente?
La licencia BSD-3-Clause de Real-ESRGAN es permisiva, incluido el uso comercial[2]. video2x es AGPL-3.0[1]: está bien usarlo comercialmente en casa, pero incrustrarlo en un servicio que distribuyas u alojes para otros dispara obligaciones de copyleft que vale la pena leer detenidamente.
¿Cuándo una API alojada es más barata que ejecutar estos localmente?
Cuando el volumen es constante y la experimentación por ejecución termina. La mejora alojada comienza alrededor de $0.12 por minuto de metraje[4]; si tu GPU estaría ocupada durante horas para ahorrar unos dólares, o el lote necesita ejecutarse desatendido, la ruta de API gana. El trabajo de restauración con mucha experimentación se mantiene local.
Ejecuta tu primer upscale
Comienza con diez segundos de tu metraje más pobre, ejecútalo a través del ejecutable portátil de Real-ESRGAN con el modelo que coincida con el contenido, y juzga en la pantalla de destino antes de comprometer horas de tiempo de GPU. Si el resultado se sostiene y el volumen es ocasional, este stack de upscalers de vídeo de código abierto es realmente todo lo que necesitas; si el lote sigue creciendo, mantén la configuración local para desarrollo de look y deja que la aritmética decida dónde se ejecuta el volumen.
References
- k4yt3x. video2x — README: supported engines, modes, platforms, and requirements (v6.4.0). Retrieved August 2026 from github.com/k4yt3x/video2x
- Xintao Wang et al. Real-ESRGAN — README: portable executables, model variants, inference options. Retrieved August 2026 from github.com/xinntao/Real-ESRGAN
- reAPI. Topaz Video Upscaler — model page with live per-second pricing. Retrieved August 2026 from reapi.ai/models/topaz-video-upscaler
- reAPI. Enhance Video 1.0 — model page with live per-second pricing. Retrieved August 2026 from reapi.ai/models/enhance-video-1-0
Further reading
- reAPI. Upscale video with AI: open source, desktop, or API. reapi.ai/blog/upscale-video-with-ai
- reAPI. Upscale video with Python: batch API pipeline and costs. reapi.ai/blog/upscale-video-python
- reAPI. Open-source AI video models that run on a local GPU. reapi.ai/blog/best-open-source-ai-video-models-local-gpu-2026
Autor

Categorías
Más publicaciones

Cuál es el mejor modelo Claude para programación y escritura
Fable 5 lidera SWE-Bench Pro, pero Opus 5 gana en tareas de terminal y trabajo de conocimiento con precio mucho más bajo. Compara benchmarks y costos.


Hailuo AI vs Seedance, Kling, Veo: comparación de precios
¿Cómo compara Hailuo AI con Seedance 2.5, Kling 3.0 y Veo 3.1? Precio por segundo, duración, audio, referencias y capacidades del MiniMax H3 frente a otras IA.


Cómo usar Claude Fable 5: rechazos, reserva y costo
Cómo usar Claude Fable 5: tabla de benchmarks, contrato de rechazo y reserva que cambia tu código, retención obligatoria y cómo Opus 5 cambió.
