AMD ha comprado Taalas, una pequeña compañía canadiense que está experimentando con una idea radicalmente distinta a la utilizada por las GPU actuales: incorporar los pesos de un modelo de inteligencia artificial directamente al silicio. Su demostrador HC1 alcanzó aproximadamente 16.960 tokens por segundo ejecutando Llama 3.1 8B, una cifra difícil de conseguir con aceleradores convencionales y que ayuda a explicar el interés de AMD por la compañía.
Las claves de la compra de Taalas por AMD en 20 segundos
- AMD anunció la adquisición de Taalas el 6 de agosto, sin revelar el importe de la operación.
- Su demostrador HC1 ejecuta Llama 3.1 8B a aproximadamente 16.960 tokens por segundo, según Taalas.
- La compañía incorpora los pesos del modelo al propio silicio para reducir el movimiento de datos.
- La contrapartida es perder flexibilidad: cambiar sustancialmente el modelo implica fabricar nuevo hardware.
- AMD planea combinar esta tecnología especializada con sus aceleradores Instinct.
AMD no ha comprado simplemente otra empresa que diseña aceleradores. Taalas plantea una respuesta diferente a uno de los grandes problemas económicos de la inferencia de modelos de lenguaje: mover continuamente enormes cantidades de información entre memoria y unidades de cálculo.
La operación también anticipa una posible evolución de los centros de datos dedicados a IA. En lugar de utilizar el mismo tipo de GPU para todas las fases de una carga, determinados modelos suficientemente estables podrían terminar ejecutándose sobre hardware específicamente construido para ellos.
16.960 tokens por segundo con un chip de 6 nanómetros
Taalas presentó HC1 en febrero de 2026 como demostración de su arquitectura. El chip está fabricado mediante un proceso de 6 nanómetros de TSMC, lejos de los nodos más avanzados utilizados actualmente por algunos de los aceleradores de IA más recientes.
Su característica más llamativa es otra.
HC1 fue construido específicamente para ejecutar Llama 3.1 8B, el modelo de aproximadamente 8.000 millones de parámetros presentado por Meta en 2024.
Taalas comunicó un rendimiento máximo próximo a 17.000 tokens por segundo por usuario. Pruebas realizadas posteriormente sobre la demostración pública han registrado velocidades alrededor de 15.000 tokens por segundo, por lo que existe evidencia adicional de que el sistema funciona dentro de ese orden de magnitud.
La diferencia frente a otros aceleradores resulta enorme.
Cuando Cerebras lanzó su servicio de inferencia para Llama 3.1 8B comunicó velocidades superiores a 1.800 tokens por segundo. Su documentación posterior situó el rendimiento típico aproximadamente en 2.200 tokens/s.
Taalas presentó HC1 como aproximadamente 8,5 veces más rápido que Cerebras y 48 veces más rápido que determinadas configuraciones NVIDIA utilizadas en su comparación.
Es importante mantener esas cifras como comparaciones del fabricante. Tokens por segundo no constituye por sí solo un benchmark universal: influyen precisión, longitud de contexto, batching, latencia, modelo, configuración y número de usuarios simultáneos.
Lo realmente interesante está detrás de los números.
El modelo deja de viajar desde la memoria
En un acelerador convencional existe una separación física entre computación y memoria.
Las GPU modernas intentan reducir esa limitación utilizando enormes cantidades de HBM (High Bandwidth Memory). NVIDIA, AMD y otros fabricantes han incrementado generación tras generación tanto la capacidad como el ancho de banda disponible.
Pero durante determinadas fases de inferencia, especialmente durante la generación secuencial de tokens, mover los pesos puede convertirse en una de las principales restricciones.
Taalas elimina buena parte del problema de una forma bastante drástica: los pesos están incorporados físicamente al chip.
Su arquitectura utiliza una región que la compañía denomina mask-ROM recall fabric. La información que debe permanecer modificable utiliza SRAM, incluyendo elementos como la caché KV y adaptaciones mediante LoRA.
En términos simplificados, el procesador deja de preguntar continuamente a una memoria externa cuáles son los pesos que necesita porque buena parte de esa información ya forma parte de su estructura física.
El beneficio es enorme en rendimiento y consumo.
El precio se paga en flexibilidad.
Una GPU puede ejecutar hoy Llama, mañana Qwen y pasado mañana otro modelo completamente diferente simplemente cargando otros pesos.
El chip de Taalas no.
Cambios importantes en el modelo requieren otra fabricación del silicio. Aunque Taalas ha explicado que su metodología permite realizar determinadas modificaciones actuando sobre capas metálicas del diseño, continúa existiendo un proceso físico de fabricación.
Eso introduce una variable que normalmente pertenece al software dentro del ciclo económico del semiconductor: la vida útil del modelo.
AMD quiere combinar Taalas con Instinct, no sustituir sus GPU
Este punto ayuda a entender la compra.
AMD no ha anunciado que Taalas vaya a reemplazar a Instinct. Ha explicado justamente lo contrario: pretende incorporar su tecnología a su estrategia de aceleradores y desarrollar soluciones a nivel de sistema conjuntamente con AMD Instinct.
Eso abre una posibilidad especialmente interesante: desagregar diferentes etapas de inferencia.
El procesamiento inicial de un prompt y la generación posterior de tokens tienen características computacionales distintas. No necesariamente resulta económicamente óptimo ejecutar ambas sobre exactamente el mismo hardware.
Una infraestructura futura podría utilizar aceleradores programables como Instinct para las fases que necesitan mayor flexibilidad y chips especializados para ejecutar repetidamente la parte más estable del proceso.
La decisión de infraestructura dejaría entonces de ser simplemente:
¿Cuántas GPU necesita este modelo?
Pasaría a incluir otra pregunta:
¿Qué parte del trabajo merece ejecutarse sobre cada tipo de acelerador?
Es una evolución que también aparece en otros diseños especializados de inferencia. Cerebras y Groq han demostrado que existe espacio fuera de las GPU convencionales cuando la prioridad es conseguir latencias muy bajas y grandes velocidades de generación.
El riesgo económico: ¿cuánto tiempo seguirá vivo el modelo?
Existe, sin embargo, una cuestión menos tecnológica y posiblemente más importante.
Un servidor equipado con GPU conserva cierta flexibilidad económica. Si un modelo deja de utilizarse, el acelerador puede destinarse a otro.
Un ASIC construido alrededor de un modelo específico tiene una situación diferente.
Si el modelo desaparece del entorno de producción antes de amortizar el hardware, su capacidad para ser reutilizado disminuye radicalmente.
Ese problema puede afectar incluso a la financiación de infraestructura. Una GPU generalista dispone de un mercado secundario y puede utilizarse para diferentes cargas. Valorar dentro de varios años un chip cuya utilidad depende de que continúe utilizándose una determinada arquitectura de modelo resulta bastante más complicado.
Por eso Taalas probablemente tenga más sentido inicialmente donde los modelos cambien poco y el volumen de inferencia sea enorme.
Detección de fraude, clasificación, visión industrial, determinados sistemas de recomendación o modelos empresariales muy estabilizados pueden ajustarse mejor a ese perfil que un servicio generativo que cambia de modelo cada pocas semanas.
La compra de Taalas plantea así una cuestión que va bastante más allá de los 16.960 tokens por segundo.
Durante los últimos años la industria ha intentado conseguir aceleradores cada vez más programables capaces de ejecutar prácticamente cualquier modelo. Taalas está explorando el extremo contrario: sacrificar parte de esa flexibilidad para eliminar costes que aparecen precisamente por mantenerla.
AMD parece considerar que ambas aproximaciones pueden convivir.
Y si esa estrategia funciona, dimensionar una plataforma de inferencia de IA podría dejar de consistir en escoger una única familia de GPU. El trabajo estaría repartido entre diferentes aceleradores dependiendo de cuánto cálculo, memoria, flexibilidad y velocidad necesita cada fase.
Preguntas frecuentes
¿Qué velocidad alcanza el chip Taalas HC1?
Taalas ha comunicado aproximadamente 16.960 tokens por segundo ejecutando Llama 3.1 8B. Es una cifra del fabricante, aunque pruebas sobre su demostración pública han obtenido resultados del mismo orden.
¿Por qué Taalas puede generar tokens tan rápidamente?
Su arquitectura incorpora los pesos del modelo directamente al silicio, reduciendo el movimiento de información entre memoria externa y unidades de cálculo que condiciona determinados procesos de inferencia.
¿Puede HC1 ejecutar cualquier modelo de IA?
No. HC1 está construido específicamente alrededor de Llama 3.1 8B. La arquitectura admite determinados cambios y adaptadores como LoRA, pero modificaciones importantes del modelo requieren nuevo hardware.
¿AMD sustituirá sus GPU Instinct por chips Taalas?
No es lo anunciado. AMD afirma que pretende integrar la tecnología de Taalas en soluciones de sistema junto con sus GPU Instinct, lo que apunta hacia arquitecturas de inferencia más especializadas.