Seedance 2.5 is live — 30-second cinematic video with native audio & real-person references
Kimi K3: guía completa del modelo insignia 2.8T de Moonshot
2026/07/27 ·

Kimi K3: guía completa del modelo insignia 2.8T de Moonshot

Kimi K3 al detalle: arquitectura, precios y API con contexto 1M, razonamiento permanente, muestreo fijo y compatibilidad con OpenAI.

Moonshot AI lanzó Kimi K3 a mediados de julio de 2026, pero lo hizo al revés: la documentación de la API, la página de precios y un ID de modelo kimi-k3 operativo aparecieron antes que cualquier tabla de benchmarks, artículo técnico o publicación de pesos[1]. Una semana de hilos sobre filtraciones llenó el vacío, y casi todo lo que circuló contenía al menos un dato equivocado. Esta guía reúne la versión basada en la propia documentación de Moonshot: qué está confirmado, qué se ha fijado deliberadamente y qué sigue sin publicarse.

También parte de una perspectiva concreta: ofrecemos Kimi K3 en la pasarela reAPI. Por eso explicamos tanto el modelo como su uso real: los parámetros que harán rechazar una solicitud, el comportamiento de la caché que determina la factura y las trampas que esperan al migrar código K2.x.

Resumen rápido

  • Kimi K3 es un modelo insignia de 2.8 billones de parámetros, basado en Kimi Delta Attention, un mecanismo híbrido de atención lineal, y Attention Residuals. Su Stable LatentMoE activa 16 de 896 expertos por token[1][3].
  • La ventana de contexto es de 1 048 576 tokens con precio uniforme, sin nivel de contexto largo. La API nativa de Moonshot usa un límite de salida predeterminado de 131 072 y permite hasta 1 048 576, siempre que la entrada más ese límite quepan en la ventana[1][2][9].
  • El razonamiento siempre está activo. El único control es reasoning_effort con tres niveles (low / high / max, sin medium) y max por defecto[4].
  • El muestreo está bloqueado: temperature 1.0, top_p 0.95, n 1 y ambas penalizaciones en 0. Cualquier otro valor devuelve un error[1].
  • La tarifa publicada por Moonshot es de $3.00 de entrada / $15.00 de salida por 1M tokens ($0.30 para entrada con caché). En reAPI, el mismo modelo cuesta $2.50 / $12.00, menos en ambos conceptos[2][8].
  • La visión es nativa para imágenes y vídeo, pero se rechazan las URL públicas de imágenes. Solo se admite base64 o una referencia a un archivo cargado[5].

Kimi K3 de un vistazo

Todos los datos de esta tabla proceden de la documentación de Moonshot, consultada el 26 de julio de 2026:

EspecificaciónKimi K3 (oficial)
ID del modelokimi-k3
Parámetros totales2.8 billones
ArquitecturaKimi Delta Attention (atención lineal híbrida) + Attention Residuals; Stable LatentMoE, 16 de 896 expertos activos
Ventana de contexto1,048,576 tokens (1M)
Salida máximaValor nativo predeterminado de 131 072 tokens; límite del parámetro de 1 048 576, sujeto al espacio compartido con la entrada [9]
Modalidadestexto, imagen y vídeo de entrada; texto de salida
Razonamientosiempre activo; reasoning_effort con low / high / max, max por defecto
Precio de entrada (sin caché)$3.00 por 1M tokens
Precio de entrada (con caché)$0.30 por 1M tokens
Precio de salida$15.00 por 1M tokens
Niveles de contextoninguno: misma tarifa por token para cualquier longitud

Dos cifras merecen una segunda lectura. Los 2.8T parámetros sitúan a K3 en una clase que ningún modelo con pesos abiertos había ocupado. Moonshot se ha comprometido a publicar los pesos, lo que lo convertiría en el primer modelo open source de la clase de 3 billones[3]. También está el precio: con $3.00 / $15.00, K3 cuesta de tres a cuatro veces más que la línea K2. Moonshot lo tarifa como modelo insignia de frontera, no como la opción económica que antes sugería el nombre Kimi, aunque sigue por debajo de los modelos cerrados de frontera tanto en entrada como en salida.

El lanzamiento: primero la API, después las pruebas

El orden del despliegue explica la información contradictoria que sigue circulando. Antes del lanzamiento, observadores de la comunidad vieron una página promocional momentánea en la plataforma de Moonshot y selectores beta en la aplicación Kimi. Las filtraciones convergieron en «unos 2.5T parámetros y contexto 1M». Se acercaron, pero la cifra oficial es 2.8T. Después llegó un vídeo sin texto de la cuenta oficial de Moonshot, y el producto adelantó al ciclo de prensa: documentación, inicio rápido y precios se publicaron el mismo día que los primeros artículos financieros sobre el lanzamiento[1][2].

Esa secuencia —API y documentación antes que benchmarks y pesos— invierte la de los modelos insignia K2, que llegaron con un artículo técnico completo y pesos abiertos desde el primer día. En la práctica, durante la primera semana de K3 la documentación fue la única fuente fiable; todo lo demás era inferencia.

Arquitectura: Kimi Delta Attention, LatentMoE y Attention Residuals

La frase técnicamente más interesante indica que K3 está «construido sobre Kimi Delta Attention, un mecanismo híbrido de atención lineal, y Attention Residuals»[3]. No es lenguaje publicitario: es el despliegue en producción de la investigación Kimi Linear que Moonshot publicó a finales de 2025. Entenderla explica la ventana de 1M tokens y el precio uniforme que la hace útil[6].

Kimi Delta Attention (KDA) es un mecanismo de atención lineal, una mejora de Gated DeltaNet con puertas más granulares. La caché de claves y valores de la atención softmax estándar crece linealmente con la secuencia, lo que encarece muchísimo los contextos de un millón de tokens. La atención lineal mantiene en su lugar un estado recurrente de tamaño fijo. El coste histórico era la calidad: la atención lineal pura pierde precisión al recordar detalles en documentos largos.

La disposición híbrida resuelve ese compromiso en el artículo Kimi Linear: intercala capas KDA y de atención completa con proporción 3:1. Tres de cada cuatro capas usan el mecanismo lineal económico y la cuarta conserva atención global exacta. En los resultados publicados, esta configuración superó a la atención completa en calidad, redujo hasta un 75% la memoria de KV-cache y decodificó hasta 6x más rápido con contextos de 1M tokens[6].

Stable LatentMoE es la configuración sparse mixture-of-experts: 896 expertos, 16 activos por token[3]. Esa dispersión permite servir un modelo de 2.8T: el cálculo activo por token representa una pequeña parte del total de parámetros.

Attention Residuals es el único componente sin artículo publicado; el término aparece por primera vez en la documentación de K3. Hasta que llegue un informe técnico, solo conocemos el nombre, no el mecanismo.

Esto importa porque un contexto de 1M tokens solo sirve si es económicamente viable. Muchos proveedores suben el precio en contextos muy largos o degradan el servicio discretamente. K3 afirma que no hay niveles: se aplica la misma tarifa por token al enviar 5,000 o 900,000 tokens[2]. Solo es racional si el coste marginal del contexto largo se ha desplomado, precisamente el objetivo de KDA. La arquitectura explica el precio.

Lo que realmente ofrece la API

La API de K3 toma decisiones estrictas que sorprenderán a equipos procedentes de K2.x o de modelos al estilo OpenAI. Son restricciones documentadas, no observaciones[1]:

  • El razonamiento siempre está activo. No hay modo sin pensamiento. La FAQ de Moonshot responde a «cómo desactivo la cadena de pensamiento» con un claro «no se puede». reasoning_effort es un campo superior con low, high y max. No existe medium y el valor por defecto es el más caro, max[4].
  • El muestreo es fijo. temperature vale 1.0, top_p 0.95, n 1 y ambas penalizaciones 0. Otro valor genera un error, así que conviene omitirlos. Si el proceso ajusta la temperatura por tarea, ese control desaparece.
  • El presupuesto de salida debe caber junto con la entrada. La API nativa de Moonshot usa 131 072 como valor predeterminado de max_completion_tokens y permite hasta 1 048 576. Si la entrada más ese límite superan la ventana, devuelve invalid_request_error. El mayor valor del parámetro no garantiza una respuesta final de un millón de tokens. Fija un límite explícito y deja espacio para la entrada, el razonamiento y la respuesta[9].
  • El streaming separa razonamiento y respuesta. Las respuestas transmiten deltas reasoning_content distintos de los deltas content, de modo que la interfaz puede mostrar por separado la reflexión y el resultado final.
  • Preserved Thinking es obligatorio. En bucles de varios turnos y herramientas, el mensaje assistant completo, incluidos reasoning_content y tool_calls, debe volver sin cambios a messages. Conservar solo content, hábito frecuente del código basado en OpenAI, degrada el modelo sin avisar.
  • La visión tiene límites claros. Imágenes y vídeos son nativos, pero no se admiten URL públicas de imágenes. Envía URI de datos base64 o carga archivos y referencia su ID[5].
  • La salida estructurada es nativa. Un JSON Schema con strict: true restringe el campo de respuesta final, no el razonamiento en prosa.

La nueva capa de herramientas

Dos funciones debutan con K3. Ambas resuelven el mismo problema: agentes con muchos recursos gastan contexto en definiciones de herramientas[1].

tool_choice: "required" obliga a realizar al menos una llamada de herramienta en el turno. Evita que el agente responda de memoria cuando debía consultar algo. Los modelos K2 rechazan este valor; K3 lo acepta.

La carga dinámica de herramientas es más novedosa: coloca una definición completa en un mensaje system a mitad de conversación, con un campo tools y sin content. Desde ahí queda disponible. En vez de añadir 80 esquemas a cada solicitud, el orquestador los inyecta cuando la fase los necesita. Una advertencia: el servidor no conserva la herramienta. Mantén ese mensaje system en el historial o desaparecerá en el siguiente turno.

La documentación advierte que la herramienta web_search integrada de Moonshot está en actualización y no se recomienda en producción. Si el agente necesita buscar, utiliza una herramienta propia.

Caché de contexto automática

La caché de K3 no exige ID, gestión de TTL ni parámetros extra. Mantén un prefijo largo estable y la plataforma intenta reutilizarlo automáticamente, cobrando $0.30 por 1M tokens en lugar de $3.00[1]. Supone un 90% de descuento para contexto repetido y convierte la ventana 1M en un patrón real: carga un corpus como prefijo estable y consúltalo después por una décima parte del precio.

Dos condiciones deciden el acierto. Los prompt tokens de la solicitud anterior deben superar 256; por debajo no se guarda nada. Tampoco puede cambiar reasoning_effort, porque hacerlo en mitad de la conversación invalida la caché de prefijo[4]. Elige el nivel antes de empezar.

La telemetría inicial de terceros sugiere que funciona: las estadísticas de K3 en OpenRouter han mostrado una tasa de aciertos superior al 75%, reduciendo el precio medio ponderado de entrada muy por debajo de un tercio del catálogo[7].

Precios: ruptura deliberada con la estrategia económica

Hasta ahora, cada Kimi competía principalmente por coste. K3 no. Esta es su posición frente a su familia y la competencia de frontera, por 1M tokens y con entrada sin caché:

ModeloEntradaSalidaEntrada con cachéContexto
Kimi K2.6$0.95$4.00$0.16256K
DeepSeek V4 Pro$1.74$3.48$0.145128K
Kimi K3 (Moonshot directo)$3.00$15.00$0.301M
Kimi K3 en reAPI$2.50$12.001M
Claude Opus 4.8$5.00$25.001M
GPT-5.5$5.00$30.00400K

La posición se entiende de inmediato: K3 cuesta de tres a cuatro veces más que sus hermanos y un 40–50% menos que los modelos cerrados de frontera. Moonshot apuesta a que la ventana de 1M tokens, el vídeo nativo y una capacidad de frontera justifican un nivel premium dentro de los pesos abiertos.

La velocidad es el asterisco honesto. Las primeras mediciones sitúan a K3 en unos 28 tokens por segundo y cuatro segundos hasta el primero[7]. Es comprensible para un modelo de este tamaño con razonamiento permanente, pero lento. K3 busca profundidad por llamada, no llamadas por minuto; los bucles sensibles a la latencia necesitan otro modelo.

Otra nota: Moonshot está recortando su catálogo. La antigua serie moonshot-v1 y variantes K2.x previas se han cerrado a nuevos usuarios, con retirada completa anunciada para finales de agosto de 2026. Moonshot quiere trasladar a todos a K3.

Migrar desde K2.x: lista práctica

Si utilizas K2.6 o K2.7-Code, la migración es pequeña pero real:

  1. Cambia el ID del modelo a kimi-k3; la API sigue siendo compatible con OpenAI.
  2. Sustituye thinking por reasoning_effort en el nivel superior. El objeto thinking de K2 no es un parámetro K3 y provoca un error.
  3. Elimina el muestreo. Quita temperature, top_p y las penalizaciones de las solicitudes K3: están fijos en el servidor y cualquier otro valor se rechaza.
  4. Elige el esfuerzo conscientemente. max es el nivel predeterminado y más caro; los tokens de razonamiento se cobran como salida. Baja a high o low si la tarea no lo merece y no cambies durante la conversación, pues invalidaría la caché.
  5. Revisa el coste. La salida cuesta 3.75x la tarifa de K2.6 a precio de lista, y el razonamiento permanente aumenta su volumen. Aprovecha la caché: prefijo estable primero, sufijo variable al final.
  6. Modifica la entrada visual si usabas URL públicas. K3 solo acepta base64 o referencias de archivos cargados[5].
  7. Devuelve completos los mensajes assistant, incluidos reasoning_content y tool_calls, en todos los turnos.

Quién debería usar K3 hoy

Según lo confirmado, K3 tiene sentido para trabajos largos donde la calidad por tarea pesa más que el coste por token: agentes de programación durante horas en repositorios grandes, corpus de un millón de tokens consultados repetidamente con prefijo en caché y razonamiento multimodal con imágenes, vídeo y código en un contexto.

No conviene para productos interactivos sensibles a la latencia —28 tokens/sec es otra herramienta—, procesos que necesitan muestreo ajustable, porque todo está bloqueado, ni optimización pura de costes. Para eso están los niveles baratos.

Ejecutar Kimi K3 mediante reAPI

K3 está disponible en reAPI como endpoint compatible con OpenAI: cambia la URL base a https://api.reapi.ai/v1, envía la clave como bearer token y usa kimi-k3 como modelo. El SDK openai existente funciona sin cambios.

curl https://api.reapi.ai/v1/chat/completions \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "kimi-k3",
    "messages": [
      { "role": "user", "content": "Refactor this module and add tests." }
    ],
    "reasoning_effort": "high",
    "stream": true
  }'

Hay dos razones para usar K3 mediante reAPI en lugar de una conexión directa:

  • Precio. reAPI cobra por K3 $2.50 de entrada / $12.00 de salida por 1M tokens, por debajo de Moonshot en ambos casos y una quinta parte menos en salida[8]. En un modelo cuyo razonamiento aumenta la salida, esa tarifa importa más.
  • Una clave, muchos modelos. La misma clave alcanza Claude, GPT, Gemini, DeepSeek, GLM y Kimi. K3 se convierte en una decisión de enrutamiento, no en dependencia de proveedor, y entra en la misma lógica de respaldo y reparto.

La interfaz completa —parámetros fijos, condiciones de caché, formato visual y errores— está en la documentación de Kimi K3, y las tarifas actuales en la página del modelo.

Preguntas frecuentes

¿Kimi K3 es de código abierto?

Moonshot presenta K3 como lanzamiento open source y se ha comprometido a publicar los pesos, lo que lo convertiría en el primer modelo abierto de 3 billones de parámetros[3]. Su publicación es inminente, pero la API sigue siendo el acceso principal.

¿Puedo desactivar o reducir el razonamiento de K3?

No se puede desactivar. Puedes reducirlo: reasoning_effort acepta low, high y max, con max por defecto[4]. low existe para cuando el razonamiento cuesta más de lo que vale la respuesta.

¿El contexto 1M cuesta más?

No. El precio por token es uniforme: un prompt de 900K tokens tiene la misma tarifa que uno de 9K[2]. Con Moonshot directo, la entrada con caché baja a $0.30 por 1M tokens.

¿Por qué mi solicitud K3 devuelve un error de temperatura?

temperature, top_p, n y las dos penalizaciones están fijos en el servidor; otro valor genera error en vez de sobrescribirlos[1]. Elimínalos. Igual con thinking de K2: usa reasoning_effort en el nivel superior.

¿Puedo usar K3 en Claude Code, Codex o Cline?

Sí. La API es compatible con OpenAI y funciona con cualquier herramienta que admita URL y clave personalizadas, incluidas Claude Code, Codex, Cline, RooCode y OpenCode. Apunta a https://api.reapi.ai/v1 con la clave y el ID kimi-k3.

¿Cómo se compara K3 con Claude Opus 4.8 o GPT-5.5 en benchmarks?

Moonshot aún no ha publicado una evaluación oficial de K3: ni SWE-Bench, ni Terminal-Bench, ni resultados verificables. Trata las cifras de redes sociales como no confirmadas hasta que aparezcan la tabla y el informe técnico.

Referencias

  1. Moonshot AI. Inicio rápido de Kimi K3: ID, muestreo fijo, límites, herramientas y caché. Consultado en julio de 2026 en platform.kimi.ai/docs/guide/kimi-k3-quickstart
  2. Moonshot AI. Precios de Kimi K3: $3.00 / $15.00 por 1M tokens, caché $0.30 y sin niveles de contexto. Consultado en julio de 2026 en platform.kimi.ai/docs/pricing/chat-k3
  3. Moonshot AI. Modelos: 2.8T, Kimi Delta Attention + Attention Residuals, Stable LatentMoE (16 de 896) y compromiso open source. Consultado en julio de 2026 en platform.kimi.ai/docs/api/models-overview
  4. Moonshot AI. Uso de reasoning_effort: low / high / max, max por defecto e invalidación de caché. Consultado en julio de 2026 en platform.kimi.ai/docs/guide/use-reasoning-effort
  5. Moonshot AI. Visión Kimi: imágenes y vídeo, base64 y archivos, sin URL públicas. Consultado en julio de 2026 en platform.kimi.ai/docs/guide/use-kimi-vision-model
  6. Moonshot AI. Kimi Linear: An Expressive, Efficient Attention Architecture (arXiv:2510.26692): KDA, diseño 3:1, KV-cache y decodificación. Consultado en julio de 2026 en arxiv.org/abs/2510.26692
  7. OpenRouter. MoonshotAI: Kimi K3 — telemetría de caché, precio ponderado, rendimiento y TTFT. Consultado en julio de 2026 en openrouter.ai/moonshotai/kimi-k3
  8. reAPI. Kimi K3: página del modelo, documentación y tarifas. Consultado en julio de 2026 en reapi.ai/docs/kimi-k3
  9. Moonshot AI. Chat Completions API — output cap and input-plus-cap validation. Retrieved September 8, 2026 from platform.kimi.ai/docs/api/chat

Lecturas relacionadas