
Ollama casi duplica la velocidad de los LLM en Mac con MLX, pero hay una condición
Ollama ha cambiado una parte importante de su arquitectura para ejecutar modelos de inteligencia artificial en los Mac con Apple Silicon. Desde la versión 0.19 incorpora en fase preliminar un motor basado en MLX, el framework de aprendizaje automático de Apple, capaz de elevar la generación de Qwen3.5-35B-A3B de 58 a 112 tokens por segundo en las pruebas publicadas por la compañía. La mejora roza el 93 %, aunque tiene una condición importante: los modelos GGUF que muchos usuarios ya tenían descargados siguen utilizando llama.cpp y no reciben automáticamente esa aceleración. Las claves de Ollama y MLX en 20 segundos El cambio tiene especial interés para desarrolladores que utilizan un Mac como estación local para ejecutar LLM, agentes de programación




