Los datos de evaluación de los agentes de DeepSeek (DSH) esconden una señal sobre una ruta de hardware.

Algunos números clave:
- el consumo de tokens es enorme; la tasa de aciertos de la caché KV es el tema de debate
- con la misma tarea, el tiempo de DSH es 2 veces el de GPT/Claude

Ese “2 veces”, para muchos, es solo una diferencia de rendimiento, pero en realidad es una pista importante de la ruta de hardware.

¿Cuál es el cuello de botella en la era de los agentes?
No es la potencia de cómputo, es el ancho de banda de la memoria.
Hacer trabajo con agentes = contexto ultralargo = lectura y escritura repetidas de enormes cachés KV.
Cuanto más largo es el contexto, más grande es el KV cache y más lenta es la lectura—
por mucho más rápido que sea tu chip de cómputo, los datos no pueden moverse desde la memoria a tiempo; todo se convierte en espera en vano.

Que el tiempo de DSH se duplique en esencia es un “golpe de realidad” a la “muralla de la memoria”: está cambiando “acceso a memoria más lento” por “menor coste”.

Esto explica por qué Chen Liwu (Intel) insiste en apilar encapsulados de CPU + DRAM:

La solución de NVIDIA es apilar encapsulados de GPU + HBM (tecnología CoWoS),
para que la unidad de cómputo esté pegada a la memoria; la distancia de traslado de datos pasa de “a nivel de centímetros” a “a nivel de micrómetros”, con un salto brutal del ancho de banda.

Chen Liwu mira lo mismo, pero desde la CPU:
tras la popularización de los agentes, la CPU asume una gran cantidad de inferencia y de gestión; igualmente necesita funcionar pegada a la memoria.

La popularización de los agentes acelerará la llegada de la era “CPU/GPU 1:1”:
- Ahora: las GPUs de los centros de datos son protagonistas; la CPU es un actor secundario
- En la era de los agentes: junto a cada GPU debe haber una CPU potente para gestionar la planificación, el ciclo del agente y la administración del KV
- En ese momento, la CPU también debe ser como la GPU: encapsulado apilado CPU + HBM

¿Qué significa esto (perspectiva de inversión)?

1. La tecnología de encapsulado = el siguiente eslabón que puede ahogar el cuello de botella
CoWoS, apilado 2.5D/3D, unión híbrida—estos procesos de encapsulado son el nuevo punto de la carrera armamentista en hardware de IA.
2. Reordenamiento de precios para los fabricantes de memoria
La HBM ya se ha vendido a montones; si la CPU también necesita HBM, el espacio de imaginación de los fabricantes de DRAM se ampliará aún más.
3. La “apuesta desfasada” de Intel podría salir bien
El mercado mira a NVIDIA, pero el apilado de CPU+DRAM de Chen Liwu apuesta por la “segunda curva” en la era de los agentes.

La última frase:
La factura de tokens de los agentes está redefiniendo el hardware—
cuando “la velocidad de lectura” vale más que “la velocidad de cómputo”, la apuesta ganadora son los chips pegados a la memoria.

La primera mitad de la carrera armamentista del cómputo está en la GPU;
la segunda mitad, en el encapsulado.

#DeepSeek #DSH #封装 #HBM