
MiniMax H3 local versus API: VRAM, velocidad, licencia y coste
¿Qué dicen los documentos oficiales de MiniMax y ComfyUI sobre el hardware local para H3? Compara con los costes de la API alojada en 768P y 2K.
Ejecuta MiniMax H3 localmente cuando el flujo oficial optimizado se ajuste a tu hardware y necesites iteraciones repetidas o entradas privadas; usa una API cuando necesites clips terminados ocasionales, salida 2K alojada, concurrencia o ningún trabajo de configuración. La guía oficial de ComfyUI indica que la descarga dinámica puede iniciar el flujo en una RTX 3060, pero iniciar no es una prueba de velocidad ni demuestra que distintos niveles de VRAM entreguen resultados equivalentes.[1]
La frase «funciona localmente» necesita tres cifras: resolución, duración y tiempo de ejecución. Sin ellas, un inicio con poca memoria y un despliegue de servidor parecen el mismo resultado.
Qué significa actualmente H3 local
| Configuración | Resultado documentado oficialmente | Aclaración importante |
|---|---|---|
| Paquete oficial optimizado de ComfyUI | Huella total del modelo de 42.5GB; la descarga dinámica puede iniciar en RTX 3060 | Iniciar no es una prueba de velocidad |
| Ejemplo oficial de SGLang | Despliegue completo en cuatro GPU | Ruta de servidor, no una receta para una sola GPU de consumo |
La guía oficial de H3 en ComfyUI fija el lienzo nativo 16:9 en 1344×768 e incluye pesos INT8 podados, un codificador de texto NVFP4, VAE separados de vídeo y audio y Turbo LoRA opcionales.[1] La optimización publicada redujo la huella de precisión completa de 123.6GB a 42.5GB. La descarga permite que una tarjeta más pequeña inicie el flujo moviendo componentes por la memoria del sistema; no hace que desaparezcan.
Por eso, la capacidad de VRAM por sí sola no indica si un flujo local es útil. La resolución, la duración, el tiempo de ejecución y el grado de descarga deben aparecer en el mismo resultado de prueba.
Qué establecen los documentos oficiales sobre el hardware local
Las fuentes oficiales citadas establecen dos rutas de despliegue concretas: un flujo optimizado de ComfyUI con descarga dinámica y un ejemplo SGLang multi-GPU. No publican una tabla de rendimiento comparable para sistemas de consumo de 8GB, 12GB y 24GB.
Antes de usar cualquier resultado local como recomendación de compra, formula tres preguntas directas:
- ¿Puede cargarse el flujo exacto sin un error de memoria insuficiente?
- ¿Qué resolución y duración produce, y cuánto tarda un intento?
- ¿La salida solicitada usa solo el flujo local nativo o también un servicio oficial alojado de contexto o regeneración?
La ficha de modelo de MiniMax también distingue el flujo local nativo de la ruta 2K completa. El flujo 2K publicado combina el despliegue local con las API oficiales Context-IR o de regeneración.[2] Por tanto, 768p local y 2K alojado son productos de salida distintos, no dos precios para un trabajo idéntico.
Coste de API de MiniMax H3
Precios verificados 23 de agosto de 2026:
| Ruta alojada | Por segundo | 5 segundos | 15 segundos |
|---|---|---|---|
| MiniMax directo, 768P | $0.080 | $0.400 | $1.200 |
| reAPI, 768P | $0.074 | $0.370 | $1.110 |
| MiniMax directo, 2K | $0.130 | $0.650 | $1.950 |
| reAPI, 2K | $0.119 | $0.595 | $1.785 |
La hoja de precios oficial de MiniMax cobra por duración de salida. La duración de entrada también se factura en la resolución seleccionada, las primeras cinco imágenes de referencia son gratis, imágenes posteriores añaden un cargo y referencias de audio son gratis.[3]
La página de modelo reAPI MiniMax H3 publica tasas separadas 768P y 2K.[4] Estos son números fechados, no promesas permanentes; usa la página en vivo para un presupuesto.
El punto de equilibrio del hardware se mide en intentos
Supón que H3 requiere una actualización de hardware de $500. Ignora electricidad y tiempo de configuración primero.
- En $1.11 por clip 768P de 15 segundos de API, $500 compra aproximadamente 450 intentos.
- En $1.785 por clip 2K de 15 segundos, compra aproximadamente 280 intentos.
- Un presupuesto de máquina de $1,000 mueve esas cifras a aproximadamente 900 intentos en 768P o 560 en 2K.
La unidad correcta es intentos, no vídeos entregados. Si una toma aceptada requiere cinco generaciones, 450 intentos pueden convertirse en 90 clips terminados. La generación local beneficia más cuando borradores rechazados dominan la carga de trabajo.
La aritmética también cambia cuando la GPU ya está en el escritorio. Su coste de compra se ha hundido, y el H3 local se vuelve atractivo rápidamente para iteración de resolución baja ilimitada, material de referencia fuera de línea, nodos personalizados y control de flujo de trabajo completo.
El acceso a API gana su coste cuando el volumen es irregular, se requiere entregable 2K, varios trabajos deben ejecutarse sin ocupar una estación de trabajo o el equipo prefiere gastar $0.37 probando un prompt que pasar un fin de semana ajustando configuración de memoria.
Verifica la licencia antes de comprar la GPU
MiniMax H3 es open-weight, no licenciado Apache o MIT. La licencia comunitaria actual excluye Estados Unidos, Unión Europea, Reino Unido y Corea del Sur de su territorio aplicable y dirige usuarios allí a obtener autorización escrita separada.[5]
La descarga pública y el permiso para un despliegue son preguntas separadas. La licencia también contiene condiciones de ingresos comerciales y atribución. Nuestra guía de licencia MiniMax H3 explica las cláusulas sin intentar proporcionar asesoramiento legal.
Esa distinción importa más para auto-hospedaje porque el equipo toma y opera los pesos directamente. Una API alojada es una ruta contractual diferente y debe evaluarse bajo sus términos de servicio.
Preguntas frecuentes
¿Corre MiniMax H3 en 8GB VRAM?
Las fuentes oficiales citadas no establecen un resultado para una configuración de 8GB. La guía oficial de ComfyUI documenta el inicio mediante descarga dinámica en una RTX 3060, pero no establece el rendimiento de una configuración de 8GB.
¿Es 12GB VRAM suficiente para H3?
Las pruebas oficiales citadas no bastan para afirmar que todas las configuraciones de 12GB sean adecuadas. Muestran una ruta optimizada y descargada concreta, no una garantía general de rendimiento con 12GB.
¿Es local H3 gratis?
No hay facturación por generación de API, pero hardware, potencia, almacenamiento, tiempo de configuración e intentos fallidos locales tienen costes. La licencia comunitaria también puede determinar si el despliegue previsto se permite.
¿Cuándo es el API más barato que H3 local?
Para un gasto nuevo de hardware de $500, el punto de equilibrio actual es aproximadamente 450 intentos 768P de quince segundos o 280 intentos 2K de quince segundos en reAPI, antes de electricidad y tiempo de configuración.
¿Produce local H3 la misma salida 2K que la API alojada?
No a través del flujo nativo ComfyUI básico. MiniMax describe el flujo 2K completo como una combinación de despliegue local y servicios oficiales de contexto o regeneración.
Referencias
- ComfyUI. MiniMax H3 official tutorial. Retrieved August 23, 2026. docs.comfy.org
- MiniMaxAI. MiniMax H3 model card and deployment examples. Retrieved August 23, 2026. huggingface.co
- MiniMax API. Pay-as-you-go pricing. Retrieved August 23, 2026. platform.minimax.io
- reAPI. MiniMax H3 model page and live pricing. Retrieved August 23, 2026. reapi.ai
- MiniMaxAI. MiniMax H3 Community License. Retrieved August 23, 2026. huggingface.co
Autor

Categorías
Más publicaciones

Precios de WaveSpeed AI: prueba gratis y pago por uso
WaveSpeed AI usa créditos de pago por uso, no membresía mensual. Cómo funcionan prueba gratis, niveles de cuenta, activación de API y límites.


MiniMax H3 vs Seedance 2.5: ¿Qué modelo de vídeo IA es mejor?
Compara MiniMax H3 con Seedance 2.5 en duración, salida 2K, audio nativo, referencias multimodales, edición, precios, acceso a API y casos de uso.


¿Nano Banana tiene marca de agua? SynthID explicado
Insignia visible vs SynthID: dos cosas distintas. Una es categoría de producto, la otra marcador de procedencia en contenido. Cómo distinguirlas.
