---
title: "Qué comprar para ejecutar LLM en local en septiembre de 2026"
description: "La elección de hardware para ejecutar modelos de lenguaje en local ha cambiado mucho desde primavera. La RTX 5090 sigue ofreciendo un ancho de banda enorme en una sola GPU, pero su precio en España ha..."
url: https://revistacloud.com/que-comprar-para-ejecutar-llm-en-local-en-septiembre-de-2026/
date: 2026-09-24
modified: 2026-09-24
author: "Silvia A. Feliz"
image: https://revistacloud.com/wp-content/uploads/2025/07/llm-api.jpeg
categories: ["Análisis y opinión", "Inteligencia artificial"]
tags: ["apple", "B200", "GPU", "LLM", "mac studio", "NVIDIA", "RTX 5090"]
type: post
lang: es
---

# Qué comprar para ejecutar LLM en local en septiembre de 2026

La elección de hardware para ejecutar modelos de lenguaje en local ha cambiado mucho desde primavera. La RTX 5090 sigue ofreciendo un ancho de banda enorme en una sola GPU, pero su precio en España ha escalado hasta superar los 5.000 euros. Al mismo tiempo, los equipos con 128 GB de memoria unificada se han multiplicado: DGX Spark cuesta 4.800 euros, el Mac Studio M5 Max alcanza 128 GB y el M5 Ultra llega a 512 GB, mientras AMD y Lenovo amplían la oferta de mini-PC preparados para modelos grandes.

**Las claves del hardware para LLM locales en 30 segundos**

- La RTX 5090 conserva 32 GB GDDR7 y 1.792 GB/s, pero las unidades que se encuentran en España parten de unos 5.299 euros.
- DGX Spark ofrece 128 GB de memoria unificada y CUDA por 4.800 euros.
- Mac Studio M5 Max llega a 128 GB y 614 GB/s; M5 Ultra alcanza 512 GB y 1,2 TB/s.
- AMD ya dispone de equipos Ryzen AI Max+ 395 de 128 GB y prepara plataformas de 192 GB.
- Lenovo lanzará en noviembre el ThinkCentre X Ultra con hasta 128 GB por un precio previsto desde 3.100 euros.
- Para entrenamiento grande, el B200 en la nube puede encontrarse desde unos 4,7 euros por hora en determinados proveedores europeos.

El cambio más importante respecto a la guía de abril no está solamente en los procesadores. **La memoria se ha convertido en el componente que más condiciona el precio de la IA local.** La escasez de memoria de alto rendimiento ha encarecido tanto las GPU de gran capacidad como algunos equipos con memoria unificada, alterando las cuentas que hace unos meses favorecían determinadas configuraciones.

Además, el software ha avanzado. Unsloth ya ofrece soporte para ejecutar y entrenar modelos en macOS, Windows y Linux, con NVIDIA, AMD y otros backends, mientras AMD ha mejorado el soporte de ROCm para Ryzen AI Max+ y Apple continúa ampliando MLX para entrenamiento y distribución entre varios equipos.

## La tabla de compra para septiembre de 2026

Los precios son referencias observadas en Europa y España durante septiembre de 2026. En tarjetas gráficas, especialmente NVIDIA, la diferencia entre precio recomendado y precio real puede ser enorme.

| Equipo | Memoria | Ancho de banda aprox. | Precio orientativo en euros | Enfoque |
| --- | --- | --- | --- | --- |
| RTX 5090 | 32 GB GDDR7 | 1.792 GB/s | desde ~5.299 € | Máxima velocidad en modelos que caben |
| Framework Desktop Max+ 395 | 128 GB | LPDDR5X-8000 | ~3.889 € | Capacidad x86 |
| GMKtec EVO-X3 Max+ 395 | 128 GB | LPDDR5X-8000 | 3.499,99 € | Mini-PC de alta capacidad |
| DGX Spark | 128 GB | 273 GB/s | 4.800 € | CUDA + memoria unificada |
| Mac Studio M5 Max | 128 GB | hasta 614 GB/s | 5.859 € | Inferencia + MLX |
| Mac Studio M5 Ultra | 256 GB | 1,2 TB/s | 10.999 € | Modelos muy grandes |
| Lenovo ThinkCentre X Ultra | hasta 128 GB | LPDDR5X-8533 | desde 3.100 € previsto | Nueva plataforma AMD |
| RTX PRO 6000 Blackwell | 96 GB GDDR7 ECC | 1.792 GB/s | ~13.000 € o más | CUDA profesional |
| B200 en nube | 180-192 GB HBM | hasta 8 TB/s | desde ~4,7 €/h | Entrenamiento y grandes modelos |

La RTX 5090 es el caso más extremo. NVIDIA mantiene 32 GB de GDDR7 y 1.792 GB/s, pero los precios españoles recogidos por Idealo muestran modelos desde 5.299 euros, con numerosas variantes por encima de 5.400 y algunas que superan ampliamente los 7.000 euros.

La diferencia entre el precio oficial y el precio real es tan grande que ya no tiene sentido utilizar la cifra recomendada de la tarjeta como referencia para calcular el coste de una estación de trabajo. A ese precio hay que añadir procesador, placa base, memoria del sistema, almacenamiento, fuente de alimentación y refrigeración.

En cambio, DGX Spark se vende como un sistema completo. NVIDIA fija actualmente su precio europeo en **4.800 euros**, con 128 GB de memoria unificada, 4 TB NVMe y el superchip GB10 Grace Blackwell.

## Hasta 30.000 millones de parámetros: la RTX 5090 sigue teniendo sentido

La primera regla de la guía de abril sigue vigente: **si el modelo cabe cómodamente en la memoria de la GPU, el ancho de banda importa muchísimo**.

La RTX 5090 tiene 32 GB y 1.792 GB/s. Eso permite ejecutar modelos cuantizados de tamaño medio con una velocidad que los sistemas de memoria unificada más lenta no pueden igualar. NVIDIA confirma además 21.760 núcleos CUDA y una potencia gráfica total de 575 W.

Para modelos densos de unos 20.000-30.000 millones de parámetros, especialmente en cuantización de 4 bits, una 5090 sigue siendo una solución muy rápida. El problema aparece cuando el modelo, la caché KV y el contexto empiezan a acercarse a los 32 GB disponibles.

Los modelos Mixture of Experts (MoE) complican todavía más la comparación. Un modelo puede tener decenas o cientos de miles de millones de parámetros totales, pero activar solo una parte durante cada token. Por eso un modelo MoE grande puede ser más viable en una máquina de 32 GB que un modelo denso mucho menor.

La cuestión no es únicamente si los pesos caben. También hay que reservar memoria para el contexto, la caché KV, el runtime y las operaciones temporales.

Con los precios actuales, sin embargo, la RTX 5090 presenta un problema económico. Comprar una tarjeta por más de 5.000 euros y construir después un ordenador alrededor de ella puede llevar el coste total muy por encima del de una máquina completa con 128 GB de memoria.

## 128 GB: el segmento que más ha cambiado

Los equipos de AMD Ryzen AI Max+ 395 han convertido los 128 GB de memoria unificada en una configuración mucho más accesible.

Framework ofrece el Desktop con Ryzen AI Max+ 395 y 128 GB de LPDDR5X-8000. La plataforma puede reservar hasta 96 GB para la GPU, según la configuración de memoria gráfica, y funciona con Windows o Linux.

El precio europeo de referencia de la configuración de 128 GB se sitúa alrededor de 3.889 euros en la documentación comercial recogida durante agosto, aunque el coste final depende de almacenamiento y configuración.

También han aparecido equipos como el **GMKtec EVO-X3**, con Ryzen AI Max+ 395, 128 GB de LPDDR5X y 4 TB de almacenamiento por 3.499,99 euros en su tienda española.

AMD ha ampliado además la plataforma. El nuevo Ryzen AI Max+ PRO 495, basado en Gorgon Halo, admite hasta 192 GB de LPDDR5X-8533 y utiliza una Radeon 8065S con 40 unidades de cómputo. AMD sitúa su NPU en hasta 55 TOPS y permite configuraciones de memoria superiores a las de los Ryzen AI Max+ 395 actuales.

Esto abre una categoría intermedia que hace un año era mucho menos habitual: **mini-PC capaces de cargar modelos de más de 100.000 millones de parámetros sin utilizar varias tarjetas gráficas**.

AMD incluso ha publicado una guía para ejecutar modelos de hasta un billón de parámetros distribuidos entre sistemas Ryzen AI Max+, utilizando llama.cpp y conexiones entre máquinas. Es una demostración de capacidad, no una indicación de que un usuario vaya a obtener una experiencia interactiva con un modelo de ese tamaño.

## DGX Spark: 128 GB y CUDA en el escritorio

DGX Spark ocupa una posición diferente.

Su ventaja es que ofrece 128 GB de memoria unificada junto con el ecosistema CUDA. NVIDIA especifica 273 GB/s de ancho de banda, 128 GB de memoria coherente, 1 PFLOP de rendimiento FP4 y 4 TB de almacenamiento NVMe en el sistema comercializado actualmente.

No puede competir con los 1.792 GB/s de la RTX 5090. Por eso no debe interpretarse como una «RTX 5090 de 128 GB».

Su atractivo está en otra parte: **modelos que no caben en una GPU convencional y que necesitan mantenerse dentro del ecosistema NVIDIA**.

También ha mejorado la parte de entrenamiento. NVIDIA mantiene documentación específica para utilizar Unsloth sobre DGX Spark, incluyendo CUDA, PyTorch y herramientas de ajuste fino.

El precio actual de 4.800 euros hace que la comparación con un Mac Studio M5 Max sea especialmente interesante.

## Apple M5 Max: la memoria unificada ya no significa poca velocidad

Apple ha cambiado bastante la ecuación con el nuevo Mac Studio.

El M5 Max puede configurarse con hasta 128 GB de memoria unificada. En la versión con GPU de 40 núcleos alcanza 614 GB/s de ancho de banda, mientras que el modelo M5 Max de entrada se queda en 460 GB/s.

La configuración de 128 GB con 512 GB de SSD cuesta **5.859 euros** según la tabla europea publicada tras el lanzamiento.

Esto coloca al M5 Max en una posición peculiar. Es bastante más caro que un mini-PC Ryzen AI Max+ de 128 GB, pero ofrece más del doble de ancho de banda que DGX Spark y Strix Halo.

Para usuarios que trabajan principalmente con MLX, llama.cpp y herramientas adaptadas a Apple Silicon, la diferencia puede ser importante. Apple también está desarrollando capacidades para distribuir entrenamiento mediante MLX entre varios equipos. En las demostraciones de WWDC26, Apple mostró un entrenamiento de Qwen 3.5 de 9.000 millones de parámetros que pasó de unos 180 tokens por segundo en un equipo a alrededor de 600 tokens por segundo en un clúster.

Eso no convierte a un clúster de Mac en un sustituto directo de un sistema NVIDIA para todos los trabajos, pero demuestra que el modelo de memoria unificada puede escalar más allá de un único ordenador.

## M5 Ultra: 256 GB por 10.999 euros y 512 GB en octubre

El M5 Ultra es la configuración que cambia realmente el límite de memoria.

Apple ofrece hasta **512 GB de memoria unificada** y 1,2 TB/s de ancho de banda. La configuración de 256 GB cuesta actualmente 10.999 euros en Europa. La versión de 512 GB llegará a finales de octubre.

La configuración de 256 GB ya permite abordar modelos que quedan completamente fuera del alcance de una RTX 5090 de 32 GB o de un sistema de 128 GB.

La cifra de 1,2 TB/s también es importante. El M5 Ultra no consigue la velocidad de memoria de la 5090, pero se acerca mucho más a ella que Strix Halo o DGX Spark, al mismo tiempo que ofrece ocho veces la capacidad de memoria de la GPU de NVIDIA.

Para modelos grandes cuantizados, esa combinación cambia la pregunta de «¿cabe?» a «¿qué velocidad obtengo una vez que cabe?».

## Lenovo entra en la carrera de los 128 GB

Una de las novedades que no aparecía en la guía de abril es Lenovo.

La compañía ha presentado el **ThinkCentre X Ultra**, un mini-PC de 1,6 litros basado en Ryzen AI Max+ PRO 495. Puede incorporar hasta 128 GB de LPDDR5X-8533 y asignar hasta 96 GB a la GPU integrada Radeon 8065S. Lenovo también prepara configuraciones capaces de conectar hasta cuatro equipos para ampliar memoria y capacidad de cálculo.

Su llegada está prevista para noviembre de 2026, con un precio inicial estimado de **3.100 euros**. Hay que tener en cuenta que ese precio es el de partida anunciado por Lenovo y no significa necesariamente que la configuración de 128 GB vaya a costar esa cantidad.

La plataforma también incluye soporte para Windows y Linux y dos ranuras M.2 para almacenamiento. Es otro indicador de que los 128 GB de memoria compartida han dejado de ser una característica exclusiva de Apple o de máquinas muy especializadas.

## RTX PRO 6000: 96 GB de VRAM, pero el precio se dispara

Para quienes necesitan CUDA y mucha memoria sin pasar a un servidor, la RTX PRO 6000 Blackwell Workstation Edition sigue siendo una alternativa.

Tiene **96 GB de GDDR7 ECC y 1.792 GB/s**, exactamente el mismo ancho de banda anunciado para la RTX 5090, pero con tres veces más memoria. NVIDIA la orienta a estaciones de trabajo profesionales y cargas de IA.

El problema es el precio. NVIDIA elevó en agosto el precio estadounidense de esta tarjeta hasta 16.000 dólares, mientras que en Europa se han observado precios cercanos a 13.000 euros y, en determinados distribuidores, incluso superiores.

A estos niveles ya no se puede hablar de una GPU de consumo. Es una inversión de workstation que tiene sentido cuando la capacidad de 96 GB y CUDA son requisitos permanentes.

Para una empresa que necesita servir modelos a varios usuarios de forma continua, la memoria adicional puede justificar la diferencia. Para un desarrollador individual que ejecuta modelos ocasionalmente, el coste cambia completamente la ecuación.

## Entrenamiento: aquí la respuesta es diferente

La gran corrección respecto a la guía de abril está en que el software local se ha ampliado.

Unsloth ya ofrece soporte para macOS, Windows y Linux y afirma compatibilidad con NVIDIA, AMD, Intel, CPU y Vulkan, además de soporte para LoRA, QLoRA, SFT, RL, GRPO y DPO.

Eso no significa que todas las plataformas ofrezcan el mismo rendimiento ni que todos los métodos funcionen igual de bien en cada backend. CUDA continúa teniendo una posición especialmente fuerte en entrenamiento y en herramientas de investigación.

Pero Apple Silicon ya no debe describirse simplemente como una plataforma para inferencia. MLX permite LoRA y QLoRA y Apple está demostrando entrenamiento distribuido entre equipos.

AMD también ha mejorado su posición. ROCm ofrece documentación específica para llama.cpp y AMD publica herramientas para ejecutar modelos en Ryzen AI Max+ con ROCm.

Para SFT de modelos pequeños y medianos, una RTX 5090 sigue ofreciendo una combinación muy fuerte de rendimiento y compatibilidad. Para modelos que superan ampliamente su memoria, el problema deja de ser la potencia de cálculo y pasa a ser la capacidad disponible.

Y para entrenamiento grande, la nube sigue teniendo una ventaja económica importante.

## B200: cuándo dejar de comprar hardware

El B200 dispone de 180-192 GB de memoria HBM3e según la plataforma y un ancho de banda cercano a 8 TB/s. Es una categoría completamente diferente respecto a las máquinas de escritorio.

En septiembre de 2026 se encuentran instancias B200 desde aproximadamente **4,7 euros por GPU y hora** en algunos proveedores europeos, mientras que otras ofertas se sitúan alrededor de 5,4-6 euros. Los precios varían por proveedor, región, modalidad y disponibilidad.

También existen configuraciones B200 en Europa mucho más caras. CoreWeave, por ejemplo, publica una instancia HGX de ocho B200 con presencia en España por unos 59,93 euros por hora, mientras que la modalidad spot baja aproximadamente a 30 euros por hora para el nodo de ocho GPU.

La diferencia frente a comprar una workstation de decenas de miles de euros es sencilla: **la nube permite pagar únicamente durante el entrenamiento o la inferencia**.

Un trabajo de cuatro horas con una B200 a 5 euros por hora cuesta unos 20 euros. El mismo hardware funcionando 24 horas durante un mes supera los 3.600 euros. Por eso la estrategia más razonable para muchos proyectos consiste en preparar los datos, el código y los parámetros localmente y utilizar la GPU de nube solo cuando el tamaño del trabajo lo exige.

## La tabla práctica para elegir en 2026

| Necesidad | Hardware que encaja | Precio aprox. |
| --- | --- | --- |
| Modelos de hasta ~30B y máxima velocidad | RTX 5090 | desde 5.299 € |
| 70B con presupuesto contenido | Ryzen AI Max+ 395, 128 GB | 3.500-3.900 € |
| 70B+ con CUDA | DGX Spark, 128 GB | 4.800 € |
| 70B con más ancho de banda | Mac Studio M5 Max, 128 GB | 5.859 € |
| Modelos de más de 100B | M5 Max 128 GB / M5 Ultra 256 GB | desde 5.859 € |
| Modelos de 200B y más | M5 Ultra 256/512 GB | desde 10.999 € |
| 70B+ profesional con CUDA | RTX PRO 6000, 96 GB | ~13.000 € o más |
| Entrenamiento grande o modelos gigantes | B200 en la nube | desde ~4,7 €/h |

La principal conclusión de esta actualización es que **ya no existe una única máquina que tenga sentido para todos los LLM locales**.

La RTX 5090 sigue siendo la opción de alto ancho de banda cuando el modelo cabe en 32 GB, pero su precio en España ha convertido la compra en una decisión mucho más difícil. Los sistemas Ryzen AI Max+ 395 ofrecen mucha memoria por menos dinero, aunque con bastante menos ancho de banda. DGX Spark añade CUDA a esa fórmula. El M5 Max combina 128 GB con 614 GB/s y el M5 Ultra lleva esa idea hasta 512 GB y 1,2 TB/s.

Mientras tanto, AMD y Lenovo están empujando los 128-192 GB hacia equipos más pequeños y económicos, y el software está reduciendo parte de las diferencias que existían entre plataformas hace unos meses.

La decisión debería partir del modelo que se quiere ejecutar, su cuantización, el tamaño del contexto y si se necesita entrenamiento o solo inferencia. **Primero hay que calcular cuánta memoria hace falta; después, cuánto ancho de banda se necesita; y solo entonces comparar precios.**

Para un modelo que cabe en 32 GB, pagar por 128 GB puede significar gastar dinero en capacidad que no se utiliza. Para un modelo de 120.000 millones de parámetros, una RTX 5090 simplemente queda fuera por memoria aunque sea mucho más rápida.

Y cuando el trabajo requiere 180 GB, varias GPU o entrenamiento distribuido, la pregunta deja de ser qué ordenador comprar y pasa a ser durante cuántas horas se necesita una máquina de centro de datos.

## Preguntas frecuentes

### ¿Cuál es la GPU más rápida para ejecutar LLM en local?

La RTX 5090 ofrece 1.792 GB/s de ancho de banda con 32 GB de GDDR7, por lo que resulta especialmente adecuada para modelos que caben completamente en su memoria.

### ¿Qué ordenador ofrece más memoria para IA local?

El Mac Studio M5 Ultra puede configurarse con hasta 512 GB de memoria unificada y 1,2 TB/s de ancho de banda. La configuración de 256 GB cuesta actualmente 10.999 euros y la de 512 GB llegará a finales de octubre.

### ¿Cuánto cuesta un DGX Spark en Europa?

NVIDIA muestra actualmente DGX Spark a 4.800 euros, con 128 GB de memoria unificada y 4 TB de almacenamiento NVMe.

### ¿Sigue siendo necesario utilizar NVIDIA para entrenar modelos?

No necesariamente. En septiembre de 2026 existen herramientas para entrenar en Apple Silicon mediante MLX y soporte de entrenamiento en plataformas AMD, además de Unsloth multiplataforma. Sin embargo, CUDA mantiene un ecosistema muy amplio para entrenamiento y determinadas técnicas y cargas de trabajo.
