Kimi K3, DeepSeek V4 y Qwen 3.8 Max tensionan la carrera mundial de IA

La inteligencia artificial china ha concentrado en pocos días tres movimientos de gran alcance. Moonshot AI ha tenido que limitar las nuevas suscripciones de Kimi K3 por falta de capacidad, DeepSeek ha comenzado el despliegue general de su familia V4 y Alibaba ha presentado Qwen 3.8 Max. Los tres modelos compiten con propuestas estadounidenses como GPT-5.6 y Claude Opus 5, pero el verdadero campo de batalla ya no está solo en los benchmarks: también importa cuánto cuesta servir cada respuesta y cuántas GPU hay disponibles para atender la demanda.

Las claves de los nuevos modelos chinos en 20 segundos

  • Moonshot detuvo temporalmente las altas de Kimi K3 tras saturar parte de su capacidad de inferencia.
  • DeepSeek V4 combina contexto largo, precios reducidos y dos variantes para distintas cargas.
  • Alibaba ha presentado Qwen 3.8 Max como un modelo multimodal de 2,4 billones de parámetros.
  • GPT-5.6 y Claude Opus 5 mantienen ventaja en varias tareas profesionales, aunque con precios más elevados.

La sucesión de anuncios confirma un cambio importante. Durante los primeros años de la inteligencia artificial generativa, la atención se concentró en quién podía entrenar el modelo más grande o alcanzar la puntuación más alta. Ahora el problema es distinto: un laboratorio puede disponer de un modelo competitivo y, aun así, no tener suficiente infraestructura para atender a todos sus usuarios.

Kimi K3 ofrece uno de los ejemplos más claros. Apenas 48 horas después de comenzar su comercialización, Moonshot AI dejó de aceptar nuevos suscriptores. La compañía prefirió proteger el servicio de los clientes existentes antes que permitir que la latencia y la estabilidad empeorasen por el crecimiento de la demanda.

Kimi K3 muestra los límites de servir un modelo de 2,8 billones

Kimi K3 es un modelo de 2,8 billones de parámetros basado en una arquitectura de mezcla de expertos, conocida como MoE (Mixture of Experts). Este diseño no utiliza todos los parámetros en cada consulta. Un sistema de enrutamiento selecciona los expertos más adecuados para procesar cada token, lo que reduce el trabajo de cálculo frente a un modelo denso del mismo tamaño.

Eso no significa que sea barato ni sencillo de desplegar.

Moonshot recomienda utilizar supernodos con al menos 64 aceleradores para que la comunicación entre los distintos expertos permanezca dentro de una red de alto ancho de banda. El conjunto completo de pesos ocuparía alrededor de 1,5 TB en precisión completa, mientras que una versión cuantizada a 4 bits seguiría necesitando aproximadamente 600 GB de memoria.

La arquitectura Kimi Delta Attention reduce de forma considerable la memoria destinada a la caché KV, utilizada para conservar el contexto durante la generación. Sin embargo, esta mejora no elimina las necesidades físicas del modelo. La empresa sigue necesitando grandes cantidades de memoria de alto ancho de banda, capacidad de interconexión y GPU disponibles durante cada petición.

El lanzamiento disparó las ventas diarias y el consumo de la API, lo que llevó a Moonshot a dividir su suscripción en dos productos. Uno cubre la aplicación web, las funciones de trabajo y el servicio general de Kimi. El segundo, Kimi Code, se dirige específicamente a programación.

La separación tiene una explicación técnica. Una conversación convencional puede durar unos minutos, mientras que un agente de programación puede trabajar durante horas, analizar repositorios completos, utilizar herramientas y generar millones de tokens. Tratar ambos usos como una única carga dificulta la asignación de recursos.

La futura publicación de los pesos también ayudará a Moonshot a repartir el coste. Los proveedores cloud, las grandes empresas y los operadores de centros de datos podrán ejecutar Kimi K3 por su cuenta, aunque el tamaño del modelo lo mantendrá lejos de los servidores convencionales.

DeepSeek V4 compite con precio y eficiencia en contexto largo

Mientras Moonshot limitaba las altas de Kimi K3, DeepSeek comenzó el despliegue general de V4 Pro y V4 Flash, dos modelos que habían estado disponibles como vista previa desde abril.

V4 Pro cuenta con 1,6 billones de parámetros totales y activa 49.000 millones por token. V4 Flash reduce la escala hasta 284.000 millones de parámetros totales y 13.000 millones activos. Ambos ofrecen una ventana de contexto de un millón de tokens.

La arquitectura no ha cambiado de manera sustancial desde la versión preliminar. Las principales mejoras se concentran en el razonamiento, el uso de herramientas y el comportamiento de los agentes. Las primeras pruebas comunicadas apuntan a menos llamadas inventadas y a respuestas más claras durante las tareas de programación.

DeepSeek también ha introducido una política de precios según la hora del día. Las tarifas aumentan en las franjas de mayor demanda de Pekín y se reducen durante las horas valle. Se trata de un modelo habitual en electricidad, transporte o capacidad cloud, pero poco frecuente hasta ahora en las API de inteligencia artificial.

Fuera de las horas punta, la salida de V4 Pro se sitúa en torno a 0,87 dólares por millón de tokens, mientras que V4 Flash baja hasta unos 0,28 dólares. Son precios muy inferiores a los de los modelos estadounidenses de gama alta.

La comparación no debe limitarse a dividir el coste por token. Un modelo barato puede generar respuestas más largas, necesitar más intentos o cometer errores que obliguen a repetir una tarea. Aun así, la diferencia de precio resulta suficientemente grande como para que muchas empresas consideren utilizar DeepSeek en clasificación, extracción de datos, generación de código rutinario o procesos automatizados de gran volumen.

Otro cambio relevante es la retirada de los antiguos identificadores deepseek-chat y deepseek-reasoner. Los desarrolladores deberán migrar a los nuevos nombres de V4 Pro y V4 Flash para controlar con precisión qué variante utilizan.

Qwen 3.8 Max entra con 2,4 billones de parámetros y capacidades multimodales

Alibaba ha presentado Qwen 3.8 Max Preview, un modelo de 2,4 billones de parámetros que también utiliza una arquitectura MoE. La compañía todavía no ha comunicado cuántos parámetros activa por token, un dato necesario para calcular con precisión su velocidad y coste de inferencia.

El modelo admite texto, imágenes, vídeo y documentos. También ofrece una ventana de contexto cercana a los 984.000 tokens y puede generar respuestas de hasta 131.072 tokens.

Alibaba ha incorporado distintos niveles de esfuerzo para el razonamiento, desde bajo hasta extra alto. Esta configuración permite ajustar el consumo de recursos según la dificultad de la tarea, aunque el razonamiento permanece activado de forma predeterminada.

Qwen 3.8 Max está disponible a través de los planes de tokens de Alibaba y de sus plataformas Qoder y QoderWork. El servicio es compatible con los protocolos de OpenAI y Anthropic, por lo que muchas aplicaciones pueden cambiar de endpoint sin reconstruir su integración completa.

La empresa no ha publicado todavía una tarifa estándar por millón de tokens ni resultados completos en benchmarks. Además, se trata de una versión preliminar que puede cambiar durante las próximas semanas. Alibaba ha prometido publicar los pesos, pero aún no ha confirmado la fecha ni la licencia.

Kimi, DeepSeek y Qwen frente a GPT-5.6 y Claude Opus 5

Las propuestas chinas llegan con precios bajos, arquitecturas abiertas o promesas de apertura y ventanas de contexto cercanas al millón de tokens. OpenAI y Anthropic mantienen una ventaja distinta: modelos propietarios más maduros, herramientas integradas y una infraestructura con mayor capacidad de servicio.

ModeloArquitecturaContexto aproximadoPrecio de salidaDisponibilidad
Kimi K3MoE, 2,8 billones de parámetros1 millón15 dólares por millón de tokensAPI, aplicaciones y pesos anunciados
DeepSeek V4 ProMoE, 1,6 billones totales1 millónDesde 0,87 dólares fuera de hora puntaAPI y pesos abiertos
DeepSeek V4 FlashMoE, 284.000 millones totales1 millónDesde 0,28 dólares fuera de hora puntaAPI y pesos abiertos
Qwen 3.8 MaxMoE, 2,4 billones de parámetrosCerca de 1 millónSin tarifa estándar publicadaVista previa cerrada
GPT-5.6PropietarioSegún versión y modalidadHasta 30 dólares por millónAPI y servicios de OpenAI
Claude Opus 5PropietarioHasta 1 millón25 dólares por millónAPI y aplicaciones de Anthropic

GPT-5.6 mantiene una posición fuerte en programación, investigación, diseño y automatización mediante herramientas. OpenAI también ofrece variantes y niveles de razonamiento que permiten intercambiar velocidad, coste y calidad según cada proyecto.

Claude Opus 5 compite especialmente en programación autónoma, análisis de repositorios, agentes prolongados y uso del ordenador. Anthropic lo sitúa cerca de su modelo de mayor capacidad, pero con un coste inferior por tarea.

Las tarifas de ambos son más elevadas que las de DeepSeek, aunque OpenAI y Anthropic cuentan con una ventaja de escala. Controlan su infraestructura, sus modelos, sus herramientas y buena parte de las interfaces utilizadas por el cliente final.

La capacidad de inferencia se convierte en el nuevo cuello de botella

El episodio de Kimi K3 resume la siguiente fase de la carrera tecnológica. Crear un modelo avanzado no basta. También hay que servirlo a millones de usuarios sin que aumenten la latencia, los errores o el coste por respuesta.

China tiene además una dificultad añadida. Las restricciones estadounidenses limitan el acceso a los aceleradores más avanzados, lo que obliga a sus laboratorios a obtener más rendimiento de cada GPU y a diseñar arquitecturas más eficientes.

Estas limitaciones han favorecido avances en mezcla de expertos, atención eficiente, cuantización y reducción de la caché KV. Sin embargo, la eficiencia no sustituye por completo a la capacidad física. Un modelo de varios billones de parámetros sigue necesitando grandes clústeres, memoria HBM y redes capaces de mover datos entre aceleradores a gran velocidad.

Para los desarrolladores, el resultado es una oferta más amplia. Ya existen modelos competitivos para distintas combinaciones de coste, privacidad, apertura y rendimiento. Una empresa puede reservar GPT-5.6 o Claude Opus 5 para los trabajos más exigentes y utilizar DeepSeek, Kimi o Qwen en tareas repetitivas o de mayor volumen.

La elección dejará de depender únicamente de cuál aparece primero en una clasificación. Será necesario medir el coste por tarea completada, la velocidad, el consumo de tokens, la estabilidad de la API, la posibilidad de despliegue privado y la disponibilidad real de infraestructura.

Preguntas frecuentes

¿Por qué Kimi K3 dejó de aceptar nuevos suscriptores?

Moonshot AI limitó temporalmente las altas porque la demanda estaba llevando su infraestructura de GPU cerca del límite. Los clientes existentes mantuvieron el acceso.

¿Qué diferencia existe entre DeepSeek V4 Pro y V4 Flash?

V4 Pro activa más parámetros y está pensado para tareas complejas. V4 Flash utiliza menos recursos y ofrece menor coste y latencia para cargas frecuentes.

¿Qwen 3.8 Max es un modelo abierto?

Alibaba ha anunciado que publicará los pesos, pero todavía no ha confirmado una fecha, una licencia ni el repositorio desde el que podrán descargarse.

¿Son mejores los modelos chinos que GPT-5.6 y Claude Opus 5?

Depende de la tarea. Los modelos chinos destacan por precio, contexto y apertura, mientras que GPT-5.6 y Claude Opus 5 conservan ventaja en varias cargas profesionales y ofrecen servicios más maduros.

vía: Noticias Inteligencia Artificial

encuentra artículos

newsletter

Recibe toda la actualidad del sector tech y cloud en tu email de la mano de RevistaCloud.com.

Suscripción boletín

LO ÚLTIMO