
SpaceX construyó Colossus a toda velocidad, ahora necesita hacerlo resistente
SpaceXAI ha demostrado que puede levantar infraestructura de inteligencia artificial a una velocidad difícil de igualar: el primer clúster Colossus, con unas 100.000 GPU NVIDIA H100 y alrededor de 130 MW de potencia de computación, entró en funcionamiento en 122 días. Colossus II fue todavía más rápido. Pero una información publicada por The Information apunta a un problema diferente: los primeros centros habrían sufrido interrupciones frecuentes y SpaceX estaría revisando parte de su diseño para aumentar la fiabilidad. La cuestión ya no es únicamente cuántas GPU puede instalar, sino qué nivel de redundancia necesita para convertir esa capacidad en un servicio cloud que pueda vender de forma sostenida a terceros. Las claves de Colossus y el reto de la redundancia




