Ollama casi duplica la velocidad de los LLM en Mac con MLX, pero hay una condición

Ollama ha cambiado una parte importante de su arquitectura para ejecutar modelos de inteligencia artificial en los Mac con Apple Silicon. Desde la versión 0.19 incorpora en fase preliminar un motor basado en MLX, el framework de aprendizaje automático de Apple, capaz de elevar la generación de Qwen3.5-35B-A3B de 58 a 112 tokens por segundo en las pruebas publicadas por la compañía. La mejora roza el 93 %, aunque tiene una condición importante: los modelos GGUF que muchos usuarios ya tenían descargados siguen utilizando llama.cpp y no reciben automáticamente esa aceleración.

Las claves de Ollama y MLX en 20 segundos

  • Ollama 0.19 estrenó en marzo un motor MLX para Apple Silicon.
  • En Qwen3.5-35B-A3B, la generación pasó de 58 a 112 tokens/s en las pruebas de Ollama.
  • Los modelos GGUF continúan utilizando llama.cpp; MLX trabaja con modelos compatibles en safetensors.
  • En junio, nuevas optimizaciones elevaron otro 20 % el rendimiento del motor MLX.
  • Ollama 0.31.1 añadió Multi-Token Prediction para acelerar Gemma 4.

El cambio tiene especial interés para desarrolladores que utilizan un Mac como estación local para ejecutar LLM, agentes de programación o asistentes sin depender continuamente de una API externa. Pero también demuestra hasta qué punto el rendimiento depende ya no solo del modelo y del hardware, sino del motor de inferencia, el formato de los pesos, la cuantización y las optimizaciones específicas de cada plataforma.

Ollama presentó oficialmente la integración el 30 de marzo de 2026. La versión inicial aceleraba Qwen3.5-35B-A3B y requería más de 32 GB de memoria unificada para el modelo utilizado como demostración. Desde entonces, el soporte y el propio motor MLX han seguido evolucionando.

De 58 a 112 tokens por segundo cambiando el motor

Los primeros números publicados por Ollama muestran una diferencia considerable.

La compañía comparó Qwen3.5-35B-A3B utilizando Ollama 0.18 y su anterior implementación Q4_K_M con la versión basada en MLX y el modelo cuantizado en NVFP4. En procesamiento del prompt o prefill, el resultado pasó de 1.154 a 1.810 tokens/s, una mejora de aproximadamente 1,57 veces.

En generación o decode, que es la velocidad que el usuario percibe mientras aparece la respuesta, pasó de 58 a 112 tokens/s, alrededor de 1,93 veces más.

Ollama indicó además que una variante int4 podía alcanzar 1.851 tokens/s de prefill y 134 tokens/s de generación. Son mediciones de la propia compañía y corresponden a modelos con cuantizaciones diferentes, por lo que no deben interpretarse como una comparación exclusivamente entre MLX y llama.cpp.

Ese matiz es importante.

El salto no procede de una única optimización. Al cambiar de ruta también cambia el formato utilizado por el modelo y puede cambiar su cuantización. Por tanto, afirmar simplemente que «MLX es un 93 % más rápido que llama.cpp» generalizaría demasiado un resultado obtenido bajo unas condiciones concretas.

Una comparación independiente realizada por Ante Kapetanovic pocos días antes del lanzamiento ayuda a poner las diferencias en perspectiva. Probando Qwen3.5-35B-A3B en un M4 Max con 128 GB de memoria unificada, obtuvo 48,1 tokens/s con Ollama sobre llama.cpp, 72,4 tokens/s ejecutando directamente llama.cpp y 131,8 tokens/s mediante mlx-lm.

Las cuantizaciones tampoco eran idénticas, por lo que esas cifras no permiten aislar perfectamente la influencia del motor. Sí muestran que la capa de ejecución elegida puede alterar mucho el rendimiento incluso utilizando el mismo Mac y la misma familia de modelos.

Actualizar Ollama no acelera automáticamente los modelos antiguos

Este es probablemente el detalle más relevante para quienes ya utilizan Ollama.

Instalar una versión nueva no significa que todos los modelos almacenados en el equipo comiencen a funcionar mediante MLX.

La arquitectura mantiene dos caminos de inferencia. Los modelos GGUF continúan utilizando llama.cpp, mientras que los modelos compatibles distribuidos como safetensors pueden utilizar el motor MLX en macOS sobre ARM64.

Por eso un usuario puede actualizar Ollama y observar prácticamente el mismo rendimiento si continúa ejecutando exactamente el mismo modelo GGUF.

El cambio debe llegar también al modelo utilizado.

Esta separación permite conservar la enorme biblioteca existente alrededor de GGUF y llama.cpp mientras Ollama amplía progresivamente su catálogo compatible con MLX. La contrapartida es que las mejoras no son universales.

La primera versión preliminar estaba centrada en qwen3.5:35b-a3b-coding-nvfp4. Posteriormente llegaron otros modelos y optimizaciones. En junio, por ejemplo, Ollama documentó la ejecución de gemma4:12b-mlx mediante el nuevo motor.

La propia evolución de las versiones demuestra que todavía se trata de una arquitectura joven. Las actualizaciones han ido incorporando correcciones para carga de modelos, capas de embedding, operaciones matriciales y nuevas arquitecturas.

Por qué MLX encaja especialmente bien con Apple Silicon

MLX no es simplemente otra interfaz sobre Metal.

Apple lo diseñó específicamente para sus procesadores y su arquitectura de memoria unificada, donde CPU y GPU pueden trabajar sobre la misma memoria física. Según Apple, las operaciones de MLX pueden ejecutarse en CPU o GPU sin tener que mover explícitamente los datos entre espacios de memoria separados.

Esto no significa que llama.cpp ignore las ventajas de Apple Silicon. Su backend Metal también está ampliamente optimizado para los Mac.

MLX añade, sin embargo, características como evaluación diferida del grafo y optimizaciones estrechamente ligadas al hardware de Apple.

Ollama explicó en junio que había conseguido que su motor MLX fuese hasta un 20 % más rápido que su propia versión anterior fusionando varias operaciones en kernels Metal mediante el compilador JIT de MLX y revisando el muestreo ejecutado en GPU.

La diferencia adquiere otra dimensión con la generación M5.

Apple introdujo Neural Accelerators dentro de los núcleos GPU para acelerar operaciones matriciales. En sus propias pruebas con MLX, la compañía encontró mejoras de entre 3,33 y 4,06 veces en el tiempo hasta el primer token frente a un MacBook Pro M4 dependiendo del modelo probado.

La generación posterior de tokens mejoró bastante menos, entre 1,19 y 1,27 veces.

No es una contradicción.

Apple explica que procesar inicialmente el prompt es una carga muy dependiente de capacidad de cálculo, por lo que los Neural Accelerators pueden intervenir directamente. La generación token a token está mucho más condicionada por el ancho de banda de memoria.

En los equipos comparados por Apple, este pasó de 120 GB/s en M4 a 153 GB/s en M5, un incremento del 28 %.

Para utilizar las capacidades mejoradas de los Neural Accelerators del M5 mediante MLX, Apple establece además macOS 26.2 o posterior como requisito.

NVFP4 también forma parte de la ecuación

El cambio de motor ha llegado acompañado de otra pieza técnica: NVFP4.

Ollama está utilizando este formato de baja precisión desarrollado por NVIDIA en algunos de sus modelos preparados para MLX. Frente a almacenar los pesos con mayor precisión, una cuantización de 4 bits reduce la memoria necesaria y, especialmente importante durante el decode, la cantidad de información que debe desplazarse continuamente desde memoria.

Ollama sostiene que NVFP4 conserva mejor la calidad que Q4_K_M en sus pruebas con Gemma 4 12B. La compañía afirma que aproximadamente reduce a la mitad la pérdida de calidad provocada por la cuantización respecto a BF16 y que, con su motor MLX actualizado, genera alrededor de un 20 % más rápido que Q4_K_M. Son resultados del fabricante y no equivalen a una ventaja universal para cualquier modelo.

También existe una razón práctica para utilizar el formato.

NVFP4 está orientado a cargas de inferencia en infraestructura NVIDIA. Ollama plantea así la posibilidad de ejecutar localmente modelos preparados con una cuantización similar a la utilizada posteriormente en centros de datos.

Pero nuevamente hay que separar las variables: cuando se compara un GGUF Q4_K_M ejecutado mediante llama.cpp con un safetensors NVFP4 mediante MLX, no está cambiando únicamente el motor de inferencia.

Gemma 4 añade otra aceleración: generar varios tokens a la vez

La evolución no terminó con MLX.

Ollama 0.31.1, publicada el 30 de junio, incorporó mejoras para Multi-Token Prediction (MTP) en Gemma 4 sobre Apple Silicon.

La idea consiste en intentar anticipar varios tokens durante el proceso de generación en lugar de producir estrictamente uno por cada paso. Ollama ajusta dinámicamente cuántos tokens conviene proponer.

Según las pruebas publicadas en las notas de la versión, Gemma 4 12B NVFP4 sobre un M5 Max pasó de 50,2 a 95 tokens/s en un benchmark de Aider Polyglot, cerca de un 90 % más. La compañía asegura que la función está activada por defecto, no requiere configuración y no modifica la salida del modelo.

Es una mejora distinta del salto inicial de llama.cpp a MLX, por lo que tampoco deberían sumarse ambos porcentajes para obtener una supuesta aceleración total.

Lo que sí muestran las sucesivas versiones es hacia dónde se dirige la inferencia local en Mac: utilizar cada vez más características específicas de Apple Silicon en lugar de depender exclusivamente de una capa común y portable entre diferentes plataformas.

Para un desarrollador, esto introduce una decisión que antes podía pasar inadvertida. Ya no basta con mirar qué modelo está ejecutando Ollama. También importa qué variante se ha descargado, con qué cuantización está almacenada y qué motor termina procesándola.

Un GGUF perfectamente funcional puede seguir siendo la opción adecuada por compatibilidad, disponibilidad o calidad. Pero actualizar Ollama y continuar utilizando exactamente los mismos archivos no permite asumir que el equipo está aprovechando las nuevas aceleraciones MLX.

Preguntas frecuentes

¿Ollama utiliza MLX automáticamente en todos los Mac?

Ollama dispone de un motor MLX para Apple Silicon, pero no todos los modelos utilizan esa ruta. Los modelos GGUF existentes continúan ejecutándose mediante llama.cpp, mientras las variantes compatibles con MLX utilizan otra ruta de inferencia.

¿MLX hace que Ollama sea el doble de rápido?

En la prueba inicial de Ollama con Qwen3.5-35B-A3B, el decode pasó de 58 a 112 tokens/s, una mejora de aproximadamente 1,93 veces. No puede generalizarse ese resultado a todos los modelos, Mac y cuantizaciones.

¿Qué aporta el M5 frente a generaciones anteriores?

Los Neural Accelerators de la GPU M5 aceleran especialmente las operaciones matriciales utilizadas durante el procesamiento inicial del prompt. Apple midió mejoras de hasta 4,06 veces en tiempo hasta el primer token frente al M4, mientras la generación posterior mejoró entre un 19 % y un 27 % en los modelos probados.

¿Es necesario volver a descargar los modelos de Ollama?

Para aprovechar una variante preparada específicamente para MLX es necesario utilizar el modelo correspondiente. Actualizar Ollama por sí solo no convierte los modelos GGUF ya descargados en modelos MLX.

Fuentes:

encuentra artículos

newsletter

Recibe toda la actualidad del sector tech y cloud en tu email de la mano de RevistaCloud.com.

Suscripción boletín

LO ÚLTIMO