
Cloudflare revela cómo ejecuta Kimi y GLM con menos memoria sin perder precisión
Cloudflare ha explicado algunos de los cambios que ha introducido en Workers AI para ejecutar modelos abiertos de gran tamaño como Kimi K2.6 de Moonshot AI y GLM 5.2 de Z.ai de forma más eficiente. La compañía asegura haber reducido el consumo de memoria de GPU y el coste por inferencia mediante nuevas técnicas de optimización, manteniendo prácticamente intacta la precisión de los modelos. Las claves de las optimizaciones de Cloudflare en 20 segundos La publicación ofrece una visión poco habitual del trabajo que existe detrás de la ejecución de modelos de lenguaje a gran escala, donde el reto ya no consiste únicamente en disponer de GPUs más potentes, sino en aprovechar mejor cada gigabyte de memoria disponible. El verdadero




