Introducción a Kimi: Modelos, Precios y Usos
Esta lección abre el curso sobre Kimi, un modelo de lenguaje grande de la empresa china Moonshot AI. Aprenderás quién está detrás de Kimi, cómo la línea de modelos se diferencia de K2 a K3 y qué modelo elegir para tu tarea al 03.10.2026. Después de la lección, podrás elegir conscientemente entre la aplicación, la API y los pesos abiertos, no confundir los modelos actuales con los deshabilitados y evaluar con sensatez las fortalezas y debilidades de Kimi frente a Claude, ChatGPT y DeepSeek.
Curso no oficial de AI University. Los textos, ejemplos y tareas fueron escritos por nuestro equipo basándose en la documentación abierta de Moonshot AI y la experiencia de los desarrolladores al 03.10.2026; el curso no está relacionado con Moonshot AI ni ha sido aprobado por ella. Los modelos y precios cambian, consulta la documentación.
Quién es Moonshot AI y por qué se habla de Kimi
Moonshot AI (en chino 月之暗面, "el lado oscuro de la luna") fue fundada en Beijing en 2023. La empresa desarrolla un producto para usuarios finales bajo el nombre de Kimi y, al mismo tiempo, publica los pesos de parte de sus modelos en acceso abierto. Para los usuarios existen dos versiones: la internacional kimi.ai, cuyo contrato se celebra con una empresa de Singapur y el pago se realiza en dólares, y la china kimi.com, donde el acceso se realiza por teléfono o a través de WeChat. Un detalle importante: las cuentas, los saldos de suscripción y las claves API de estas dos versiones no son transferibles entre sí, es decir, tendrás que registrarte por separado donde realmente vayas a trabajar.
Las conversaciones en torno a Kimi se basan en varios argumentos prácticos. Primero, parte de los modelos se lanzan con pesos abiertos, lo que permite descargarlos y desplegarlos en tus propios servidores, a diferencia de los modelos insignia cerrados de las empresas occidentales. Segundo, Kimi se muestra consistentemente fuerte en tareas de código y escenarios de agente, es decir, donde el modelo mismo invoca herramientas y completa una tarea de varios pasos. Tercero, el contexto del modelo insignia K3 alcanza 1 048 576 tokens, lo que permite cargar bases de código completas o documentos largos en el diálogo sin truncamiento. Y finalmente, los precios de la API al 03.10.2026 son notablemente más bajos que los de los modelos insignia cerrados: por ejemplo, la entrada sin caché para kimi-k3 cuesta 3 dólares por millón de tokens, y la salida 15 dólares; un análisis detallado de las tarifas se presentará en la lección 3.
De K2 a K3: cronología y qué es MoE en palabras sencillas
La línea de modelos Kimi actuales es la siguiente. Kimi K2 se lanzó en julio de 2025 como un modelo de mezcla de expertos (MoE) con un billón de parámetros y 32 mil millones de parámetros activos. En enero de 2026 apareció K2.5 con multimodalidad y el modo Agent Swarm, que puede distribuir una tarea entre múltiples subagentes. El 20 de abril de 2026 se lanzó K2.6, y en junio de 2026 apareció K2.7 Code, especializado en programación. El 16 de julio de 2026, Moonshot presentó Kimi K3, el nuevo modelo insignia, cuyos pesos completos se abrieron el 27 de julio de 2026. Y el 11 de septiembre de 2026, en la suscripción Kimi Code bajo el identificador kimi-for-coding, apareció K2.8 Preview, un modelo que no está en la plataforma API normal: su arquitectura y número de parámetros no se han publicado en ningún lugar, por lo que debe tratarse como un producto para suscriptores de Kimi Code, y no como otra entrada en la lista de modelos API.
Entendamos el término MoE (mixture of experts, mezcla de expertos), que aparece en la descripción de cada modelo Kimi. Imagina que en lugar de una enorme red neuronal que participa por completo en el procesamiento de cada palabra, tienes un gran equipo de especialistas, expertos, y un despachador que, para cada palabra, llama solo a algunos de ellos. En K3 hay un total de 2,8 billones de parámetros, pero en realidad solo 104 mil millones, los parámetros activos, se "activan" para procesar un token. Técnicamente, esto funciona así: el modelo tiene 896 expertos, y el despachador selecciona 16 de ellos por cada token, más dos expertos generales que siempre están activos. Este esquema permite que el modelo sea enorme en conocimientos y capacidades, pero al mismo tiempo calcule más rápido y más barato que si todos los parámetros participaran en cada cálculo. Por eso, el precio por token en la API de modelos que en papel son enormes resulta razonable: pagas, de hecho, por los parámetros activos, no por los 2,8 billones.
Además de MoE, K3 utiliza un esquema de atención híbrido: 69 capas con Kimi Delta Attention (KDA, desarrollo propio de Moonshot) y 24 capas Gated MLA. KDA ahorra memoria y acelera el trabajo con contextos muy largos, mientras que Gated MLA mantiene la precisión en razonamientos complejos. El modelo comprende imágenes y videos de forma nativa, sin complementos separados, y la profundidad de razonamiento en K3 siempre está activada y se regula solo con el parámetro reasoning_effort con valores low, high o max; en la API, el valor predeterminado es max. No se puede desactivar el razonamiento en K3, está integrado en la arquitectura, y el parámetro thinking, que existe en K2.6, no existe en K3.
Qué modelo elegir al 03.10.2026
En la práctica, la elección se reduce a tres líneas.
Kimi K3 (en la API kimi-k3) debe usarse para tareas complejas: razonamientos de varios pasos, trabajo con contextos muy largos, análisis de imágenes y videos. Es el modelo más capaz de la línea, pero también el más caro y, según los usuarios, no el más rápido.
Kimi K2.7 Code y su versión de alta velocidad kimi-k2.7-code-highspeed están diseñados específicamente para la programación. La versión normal mantiene las instrucciones largas en el código con mayor precisión, mientras que la versión de alta velocidad produce alrededor de 180 tokens por segundo, lo que acelera notablemente el trabajo en escenarios interactivos como el autocompletado o las iteraciones rápidas en un agente programador. Ambos modelos son más baratos que K3 y son adecuados si la carga principal es código, no razonamientos generales.
Kimi K2.6 sigue siendo una opción razonable para tareas masivas y económicas: chat normal, clasificación de texto, procesamiento de documentos sencillos. En este modelo, el razonamiento se puede activar y desactivar con el parámetro thinking, lo que permite ahorrar tokens donde no se necesitan razonamientos profundos.
Brevemente, en qué fijarse al elegir:
K3 tareas complejas, 1M contexto, imágenes y video, más caro
K2.7 Code código y agentes de desarrollo, la versión normal es más precisa
highspeed el mismo código, pero para velocidad, alrededor de 180 tok/s
K2.6 tareas masivas, barato, reflexiones opcionales
Cuidado con las instrucciones obsoletas
En internet y en notas antiguas todavía se encuentran ejemplos de código con nombres de modelos que ya no funcionan. Al 03.10.2026, toda la serie kimi-k2 (incluido kimi-k2-0905-preview), kimi-k2.5 y toda la serie moonshot-v1, así como kimi-latest, están deshabilitadas. Una solicitud a cualquiera de estos identificadores devolverá un error, no una respuesta del modelo. Si ves un tutorial o un artículo que utiliza uno de estos nombres, considera el material obsoleto y migra el código a los identificadores actuales: kimi-k3, kimi-k2.7-code, kimi-k2.7-code-highspeed o kimi-k2.6. Esto es especialmente importante para quienes copian ejemplos de artículos antiguos en ruso e inglés: la fecha de publicación del material a menudo no se indica explícitamente, y el nombre del modelo en el código parece plausible.
Otro error menor pero frecuente en ejemplos antiguos: para kimi-k3, en la solicitud se pasan temperature o top_p, ajustados para otro modelo. En K3, estos parámetros están fijados en los valores 1.0 y 0.95, y cualquier valor diferente provoca un error, por lo que es mejor no especificarlos en la solicitud.
Kimi frente a Claude, ChatGPT y DeepSeek
Comparar modelos de manera justa es difícil, porque la imagen suele diferir entre la empresa desarrolladora y los usuarios independientes. La propia Moonshot afirma en el blog de K3 que el modelo supera, por ejemplo, a Claude Opus 4.8 y GPT-5.5, pero al mismo tiempo reconoce una "brecha notable en la experiencia del usuario en comparación con Claude Fable 5 y GPT-5.6 Sol". Tales declaraciones de la empresa deben tomarse como marketing, no como una evaluación independiente, y tratarse con la misma cautela que cualquier benchmark del propio desarrollador.
Las fortalezas de Kimi, confirmadas por diversas fuentes, son: un precio por token notablemente más bajo en comparación con los modelos insignia cerrados, pesos abiertos de parte de los modelos, lo que permite desplegarlos localmente, y resultados sólidos en escenarios de agente como Agent Swarm y en tareas de desarrollo frontend.
Las debilidades, según la experiencia de los profesionales, son: en revisiones independientes, las alucinaciones de Kimi son más notables que las de los modelos insignia cerrados, especialmente en detalles técnicos como archivos de configuración. K3, según los usuarios, a veces es más lento de lo esperado y tiende a ser excesivamente proactivo en tareas sencillas, es decir, hace más de lo que se le pide cuando una respuesta corta y directa sería suficiente. Según un desarrollador que probó K3 a través de la API, el modelo resultó ser menos fiable en tareas realmente complejas que Claude Opus, y no reemplaza a Claude Fable 5, aunque para el trabajo rutinario es suficiente "hasta el punto de dejar de notar la diferencia". La brecha entre los modelos chinos de código abierto y los modelos insignia occidentales cerrados, según la evaluación de los participantes del mercado, se está reduciendo gradualmente, pero es demasiado pronto para decir que ya se ha cerrado.
Cabe mencionar aparte a DeepSeek, otra empresa china con modelos de pesos abiertos. No hay una comparación directa con cifras específicas en los materiales para esta lección, y no se deben citar tales cifras sin verificación. Si te interesa una comparación específica con DeepSeek, es razonable consultar clasificaciones independientes como Artificial Analysis o LM Arena en el momento de tomar una decisión, y no basarse en cifras de hace muchos meses.
Dos sitios web y formas de acceder a Kimi
La versión internacional kimi.ai acepta pagos con tarjeta Visa o Mastercard, así como a través de las tiendas de aplicaciones App Store y Google Play. La versión china kimi.com está diseñada para el acceso por teléfono o a través de WeChat, y el método de pago, según los usuarios, suele ser Alipay, aunque este punto no está claramente descrito en la documentación oficial. Para el lector de América Latina, ninguno de estos métodos está garantizado: la disponibilidad de tarjetas, tiendas de aplicaciones y métodos de acceso cambia con frecuencia, por lo que antes de planificar un trabajo regular con Kimi, verifica directamente en el sitio web qué método de acceso y pago te funciona en este momento.
Además de la aplicación y la versión web, hay otras dos formas de usar Kimi. La primera es la API: obtienes una clave en la consola de platform.kimi.ai (para la versión internacional) o platform.kimi.com (para la china), y accedes a los modelos programáticamente a través del protocolo OpenAI Chat Completions, Responses o mediante compatibilidad con Anthropic Messages. Este método es adecuado para desarrolladores que integran Kimi en sus productos y pagan por tokens; lo analizaremos en detalle en la lección 3. La segunda forma son los pesos abiertos: los modelos de las series K2.x y K3 se pueden descargar y desplegar en tus propios servidores, si la tarea requiere un control total sobre los datos o el cumplimiento de requisitos de seguridad internos. Para K3, se recomienda oficialmente un nodo de al menos 8 aceleradores GB300 o MI355X, que son capacidades industriales serias, no una computadora doméstica. Hablaremos más sobre los pesos abiertos, las licencias y las cuestiones de seguridad en la lección 5.
En resumen, para quién es cada cosa: la aplicación y el sitio web son para cuando necesitas una interfaz lista y no quieres escribir código, la API es para la integración en tus propios servicios y la automatización, y los pesos abiertos en tus propios servidores son para empresas con requisitos de privacidad de datos o acceso a hardware potente.
Mapa del curso
Este curso consta de cinco lecciones. En la lección 1, que estás leyendo ahora, hemos analizado qué es Kimi, de dónde viene la empresa y qué modelo elegir para tu tarea. En la lección 2 hablaremos sobre cómo trabajar con Kimi directamente en el navegador: modo agente, investigación profunda y generación de presentaciones. La lección 3 se centrará en la API de Kimi en Python: allí analizaremos el trabajo con K3, el parámetro reasoning_effort, la invocación de herramientas y el cálculo del costo de las solicitudes. En la lección 4 nos centraremos en Kimi para programadores, Kimi Code CLI y la comparación con Claude Code. La lección 5 cerrará el curso con el tema de los pesos abiertos, las condiciones de las licencias y las cuestiones de seguridad al desplegar modelos por cuenta propia.
Pruébalo tú mismo
Regístrate en kimi.ai, elige el plan gratuito Adagio y haz la misma pregunta práctica de tu trabajo al modelo K3 en el chat de Kimi y a cualquier modelo que conozcas, por ejemplo, ChatGPT o Claude. Criterio de resultado: has registrado qué respuesta es más precisa, cuál es más corta y cuál es más fácil de aplicar de inmediato sin modificaciones.
En el chat de Kimi, cambia entre K2.6 y K3 para la misma tarea sencilla, por ejemplo, redactar una carta corta o explicar un término. Criterio de resultado: has notado la diferencia en la velocidad de la respuesta y en cuánto el modelo expande la tarea más allá de lo que pediste.
Verifica en el sitio web kimi.ai qué método de inicio de sesión y pago está disponible desde tu país en este momento. Criterio de resultado: sabes si podrás pagar la suscripción con tarjeta o si necesitarás un método de pago a través de una tienda de aplicaciones.
Conclusiones
- Moonshot AI, una empresa de Beijing, desarrolla Kimi como un producto para usuarios y, paralelamente, abre parte de sus modelos como pesos abiertos; la versión internacional kimi.ai y la china kimi.com no comparten cuentas ni claves.
- Al 03.10.2026, los modelos actuales son kimi-k3 (tareas complejas, contexto de hasta 1 048 576 tokens, imágenes y video), kimi-k2.7-code con la versión highspeed (código) y kimi-k2.6 (tareas masivas y económicas con modo de razonamiento controlable).
- MoE y los parámetros activos significan que un modelo con un número enorme de parámetros en papel solo calcula una parte de ellos por cada token, lo que logra un equilibrio entre capacidades y precio.
- Las instrucciones antiguas con nombres como kimi-k2-0905-preview, moonshot-v1 o kimi-latest ya no funcionan; si encuentras ejemplos así, migra el código a los identificadores actuales y no pases tus propios valores de temperature o top_p a kimi-k3.
- Las fortalezas de Kimi son el precio, los pesos abiertos y los escenarios de agente; las debilidades, según revisiones independientes, son alucinaciones notables y un retraso con respecto a algunos modelos cerrados de primera línea en las tareas más complejas.
- Para acceder a Kimi hay tres vías: la aplicación y el sitio web para una interfaz lista, la API para integraciones y los pesos abiertos para el despliegue en tus propios servidores; la elección depende de la tarea y los recursos disponibles.