NPU vs GPU: diferencias, rendimiento y cuál necesitas realmente para IA local

Las NPU (Neural Processing Unit) han dejado de ser una curiosidad reservada a móviles y empiezan a formar parte del hardware habitual de portátiles y equipos de escritorio. Qualcomm alcanza ya 80 TOPS con Snapdragon X2, AMD ronda los 50-55 TOPS en Ryzen AI, Intel llega a 50 TOPS con Core Ultra Series 3 y Apple lleva años integrando su Neural Engine. Pero tener una NPU no significa que una GPU haya dejado de ser necesaria: ambos aceleradores resuelven problemas distintos y, para un desarrollador, elegir correctamente depende mucho más del modelo y del software que de una cifra de TOPS.

Las claves de NPU vs GPU en 20 segundos

  • Una NPU está diseñada principalmente para ejecutar IA local con bajo consumo.
  • La GPU sigue siendo mucho más flexible y normalmente es preferible para entrenamiento e inferencia pesada.
  • Los Copilot+ PC requieren una NPU capaz de superar los 40 TOPS.
  • Qualcomm alcanza 80 TOPS, AMD alrededor de 50-55 e Intel hasta 50 TOPS en sus plataformas actuales.
  • Para programar IA local importa tanto el software compatible como la potencia del chip.

La llegada de las NPU responde a un problema bastante concreto. Ejecutar continuamente reconocimiento de voz, análisis de imagen, reducción de ruido o pequeños modelos de inteligencia artificial mediante CPU puede consumir demasiados recursos. Utilizar una GPU dedicada funciona, pero tampoco es la solución más eficiente para tareas que deben permanecer activas durante horas en un portátil.

La industria ha optado por incorporar un tercer bloque especializado.

CPU, GPU y NPU no compiten exactamente por el mismo trabajo

Una CPU está diseñada para resolver una variedad enorme de operaciones. Dispone de relativamente pocos núcleos muy sofisticados capaces de ejecutar lógica compleja, gestionar el sistema operativo y responder rápidamente a cargas muy diferentes.

La GPU parte de otra filosofía. Posee una gran capacidad para realizar muchas operaciones en paralelo, lo que originalmente resultó ideal para gráficos y posteriormente para matrices y tensores utilizados por machine learning.

La NPU lleva esa especialización un paso más allá.

Está construida específicamente alrededor de las operaciones habituales en redes neuronales y suele trabajar muy bien con formatos numéricos de baja precisión utilizados durante la inferencia.

Una comparación simplificada sería:

CaracterísticaCPUGPUNPU
FlexibilidadMuy altaAltaMás limitada
Cargas secuencialesExcelenteMenor eficienciaNo es su objetivo
Paralelismo masivoLimitadoExcelenteExcelente para IA compatible
Inferencia IAPosibleMuy buenaMuy eficiente
Entrenamiento IAPosible, pero lentoPrincipal opciónNo suele ser su objetivo
Consumo sostenidoMedioAlto en GPU dedicadaBajo
GráficosLimitados/integradosExcelenteNo
IA siempre activaPoco eficientePosibleEspecialmente adecuada

La consecuencia práctica es que la pregunta no debería ser simplemente «¿GPU o NPU?».

En muchos ordenadores modernos se dispone simultáneamente de CPU, GPU integrada y NPU. El sistema puede elegir cuál utilizar dependiendo de la carga.

Microsoft describe precisamente Windows ML de esta forma: un único entorno de inferencia capaz de dirigir modelos hacia CPU, GPU o NPU mediante diferentes proveedores de ejecución. La compañía considera la NPU especialmente apropiada para inferencia sostenida con eficiencia energética, mientras que señala a las GPU, sobre todo las dedicadas, para cargas de alto rendimiento como imagen, vídeo e IA generativa.

Los TOPS ayudan, pero no sirven para comparar cualquier NPU

La unidad que domina el marketing de los PC con IA es el TOPS, Trillion Operations Per Second, es decir, billones de operaciones por segundo utilizando la escala numérica anglosajona, equivalente a 10¹² operaciones.

Microsoft fijó una referencia especialmente visible al exigir más de 40 TOPS de NPU para los Copilot+ PC.

En agosto de 2026, algunas de las plataformas más conocidas ofrecen aproximadamente estas cifras:

PlataformaNPURendimiento anunciado
Qualcomm Snapdragon X2 Elite / ExtremeHexagon80 TOPS
Qualcomm Snapdragon X2 PlusHexagon80 TOPS
AMD Ryzen AI 9 HX 375XDNA 2hasta 55 TOPS
AMD Ryzen AI 300XDNA 2alrededor de 50 TOPS
AMD Ryzen AI MaxXDNA 2hasta 50 TOPS
Intel Core Ultra Series 3NPUhasta 50 TOPS
Apple M4Neural Engine38 billones de operaciones/s

Qualcomm prácticamente ha duplicado la cifra de su primera generación de PC ARM: Snapdragon X2 Elite y X2 Elite Extreme incorporan una NPU Hexagon de 80 TOPS, cifra que también ofrece Snapdragon X2 Plus.

Intel, por su parte, estrenó en 2026 los Core Ultra Series 3, conocidos inicialmente como Panther Lake y fabricados con Intel 18A. Los modelos superiores alcanzan 50 TOPS exclusivamente en la NPU, no los 60-65 TOPS que algunas informaciones preliminares atribuían a esta generación.

AMD ofrece hasta 50 TOPS en buena parte de Ryzen AI 300 y Ryzen AI Max, mientras determinadas versiones como Ryzen AI 9 HX 375 llegan hasta 55 TOPS.

Apple utiliza otra denominación, Neural Engine. El M4 incorpora 16 núcleos y Apple anunció una capacidad de hasta 38 billones de operaciones por segundo.

Pero comparar esos números directamente tiene limitaciones.

Una cifra TOPS depende de la precisión numérica utilizada, las operaciones contabilizadas y la arquitectura. Un acelerador con más TOPS nominales no tiene por qué ejecutar un modelo concreto más rápido que otro con una cifra inferior.

También importan:

  • ancho de banda de memoria;
  • cantidad de memoria disponible;
  • operadores compatibles;
  • precisión utilizada;
  • compilador;
  • runtime;
  • tamaño del modelo;
  • arquitectura neuronal;
  • capacidad para mantener datos dentro del acelerador.

Por eso 80 TOPS no significa automáticamente el doble de rendimiento real que 40 TOPS.

El software es ahora tan importante como la NPU

Aquí está probablemente la cuestión más relevante para quien programa.

Una GPU NVIDIA puede ejecutar una enorme variedad de software porque detrás existe un ecosistema construido durante años alrededor de CUDA, cuDNN, TensorRT, PyTorch y otras herramientas.

Las NPU todavía tienen un ecosistema más fragmentado.

Microsoft está intentando reducir esa fragmentación mediante Windows ML, que en 2026 se ha convertido en su plataforma recomendada para inferencia local.

Windows ML utiliza ONNX Runtime y puede descargar proveedores de ejecución específicos para diferentes fabricantes. De esta forma, una aplicación puede trabajar con un modelo ONNX mientras Windows selecciona el acelerador adecuado.

Es un cambio importante respecto a DirectML.

DirectML continúa soportado, pero Microsoft lo considera actualmente en modo de mantenimiento y ha trasladado el nuevo desarrollo para despliegues ONNX hacia Windows ML.

En macOS, Apple ofrece una integración bastante más vertical.

Core ML puede distribuir automáticamente el trabajo entre CPU, GPU y Neural Engine, seleccionando los recursos disponibles para reducir consumo de memoria y energía. Además puede ejecutar todo el modelo en el dispositivo sin necesidad de conexión a Internet.

Para el desarrollador, esta diferencia importa mucho más que conocer únicamente los TOPS.

¿Sirve una NPU para ejecutar un LLM?

Sí, pero con bastantes matices.

Las NPU pueden ejecutar modelos generativos y LLM compatibles, especialmente cuando están cuantizados y optimizados para el acelerador.

Pero esto no significa que una NPU de portátil vaya a sustituir automáticamente a una GPU RTX en herramientas de IA local.

Un LLM necesita dos recursos fundamentales: capacidad de cálculo y memoria suficiente para mantener sus pesos y el KV cache.

Por ejemplo, un modelo de 7.000 millones de parámetros cuantizado a 4 bits necesita varios gigabytes únicamente para los pesos. A medida que aumenta el contexto, también aumenta la memoria necesaria para el KV cache.

La GPU dedicada cuenta con VRAM de alto ancho de banda específicamente diseñada para este tipo de trabajo. En cambio, muchas NPU dependen de la memoria compartida del sistema y tienen restricciones sobre qué operadores y modelos pueden ejecutar.

Esto convierte a la NPU en una opción especialmente atractiva para:

  • modelos pequeños;
  • clasificación;
  • detección de objetos;
  • reconocimiento de voz;
  • cancelación de ruido;
  • segmentación;
  • traducción;
  • procesamiento de cámara;
  • embeddings;
  • asistentes locales ligeros;
  • funciones de IA permanentes en segundo plano.

Una GPU dedicada sigue siendo normalmente preferible cuando el objetivo es ejecutar modelos generativos grandes a máxima velocidad.

Una NPU tampoco está pensada principalmente para entrenar modelos

Otra diferencia importante es el entrenamiento.

Las NPU de PC actuales están diseñadas fundamentalmente para inferencia, es decir, ejecutar modelos que ya han sido entrenados.

Las GPU tienen una arquitectura y un software mucho más maduros para entrenamiento, fine-tuning y operaciones con grandes tensores.

Eso hace que un desarrollador que trabaje principalmente con:

PyTorch
CUDA
LoRA
QLoRA
fine-tuning
Stable Diffusion
LLM grandes
entrenamiento distribuido

continúe obteniendo mucho más valor de una GPU potente que de aumentar los TOPS de la NPU.

La NPU puede complementar ese hardware, pero no sustituirlo.

Cuándo elegir NPU y cuándo invertir en GPU

Para desarrollo convencional, probablemente no debería comprarse un ordenador únicamente en función de su NPU.

Si se programa backend, Java, .NET, Go, Rust, PHP o aplicaciones web tradicionales, CPU, memoria y almacenamiento seguirán siendo mucho más importantes.

La situación cambia para quien desarrolla IA en dispositivo.

Una NPU cobra sentido cuando el objetivo es crear aplicaciones que ejecuten continuamente modelos pequeños sin enviar información al cloud. Es especialmente interesante para software empresarial donde privacidad, latencia y funcionamiento offline importen.

Algunos ejemplos:

Transcripción local. El audio puede procesarse sin enviarlo fuera del equipo.

Análisis de imagen. Una aplicación puede detectar objetos o clasificar fotografías continuamente consumiendo menos batería que utilizando una GPU dedicada.

Videoconferencia. Desenfoque de fondo, seguimiento facial, corrección de mirada o supresión de ruido pueden mantenerse activos durante una llamada.

Seguridad. Determinados modelos de detección pueden analizar localmente actividad o contenido sin transmitir los datos.

Aplicaciones offline. El modelo continúa funcionando sin conexión y sin coste por llamada a una API.

Para IA generativa pesada, entrenamiento o desarrollo CUDA, la prioridad continúa siendo una GPU.

La mejor arquitectura probablemente sea utilizar las tres

La evolución del PC apunta en realidad hacia una arquitectura heterogénea.

                  APLICACIÓN
                      │
            ┌─────────┼─────────┐
            │         │         │
            ▼         ▼         ▼
           CPU       GPU       NPU
            │         │         │
          lógica    IA pesada   IA eficiente
          sistema   gráficos    permanente
          control   generación  local

Microsoft ya construye Windows ML alrededor de esta idea: una misma aplicación puede recurrir a CPU, GPU o NPU según el modelo y el hardware disponible.

Apple lleva años aplicando una filosofía parecida con Core ML, que decide entre CPU, GPU y Neural Engine.

Eso hace que la NPU no sea tanto «la nueva GPU» como un tercer procesador especializado que permite ejecutar una categoría de cargas donde utilizar la GPU sería innecesariamente caro en energía.

La distinción será cada vez más importante a medida que los sistemas operativos incorporen agentes, búsqueda semántica, traducción, visión y reconocimiento de voz que permanezcan activos durante buena parte del tiempo.

Una GPU puede hacerlo.

La cuestión es si tiene sentido mantenerla trabajando continuamente para una tarea que una NPU puede ejecutar consumiendo una fracción de la energía.

Preguntas frecuentes

¿Qué diferencia hay entre una GPU y una NPU?

La GPU es un procesador paralelo de propósito relativamente amplio utilizado para gráficos, IA y computación. La NPU está mucho más especializada en operaciones de redes neuronales y prioriza la eficiencia durante la inferencia.

¿Una NPU puede sustituir una GPU para inteligencia artificial?

No en general. Puede ser mejor para determinadas tareas de inferencia local y bajo consumo, pero las GPU siguen ofreciendo mayor flexibilidad y rendimiento para entrenamiento, modelos grandes e IA generativa pesada.

¿Cuántos TOPS necesita un Copilot+ PC?

Microsoft establece como requisito una NPU capaz de superar los 40 TOPS, además de otros requisitos de hardware y software.

¿Qué debería priorizar un desarrollador: GPU o NPU?

Para entrenamiento, CUDA, generación de imágenes o LLM grandes suele ser más importante una GPU dedicada. Para aplicaciones con inferencia local permanente, voz, visión o IA integrada en Windows, macOS o dispositivos móviles, la NPU adquiere mucho más valor.

encuentra artículos

newsletter

Recibe toda la actualidad del sector tech y cloud en tu email de la mano de RevistaCloud.com.

Suscripción boletín

LO ÚLTIMO