Dữ liệu đánh giá về Agent của DeepSeek (DSH) đang giấu một tín hiệu về lộ trình phần cứng.
Vài con số then chốt:
- Lượng token tiêu thụ rất lớn, tỉ lệ hit của bộ nhớ đệm KV là chủ đề được bàn luận nhiều
- Với cùng một tác vụ, thời gian của DSH gấp 2 lần GPT/Claude
Cái “2 lần” này, nhiều người chỉ coi là chênh lệch hiệu năng, nhưng nó lại là manh mối quan trọng của lộ trình phần cứng.
Nút thắt của thời đại Agent là gì?
Không phải sức mạnh tính toán, mà là băng thông bộ nhớ.
Agent làm việc = ngữ cảnh cực dài = đọc/ghi lặp lại khổng lồ trên bộ nhớ đệm KV.
Ngữ cảnh càng dài, KV cache càng lớn, việc đọc càng chậm——
chip tính toán của bạn có nhanh đến đâu, dữ liệu từ bộ nhớ vẫn không “chuyển” kịp, rồi bạn cứ phải chờ vô ích.
Thời gian của DSH gấp đôi, bản chất là “bị bạt tai bởi bức tường bộ nhớ”: nó dùng “truy cập bộ nhớ chậm hơn” để đổi lấy “chi phí thấp hơn”.
Điều này cũng giải thích vì sao Trần Lập Vũ (Intel) kiên trì đóng gói chồng CPU + DRAM:
Cách của NVIDIA là đóng gói chồng GPU + HBM (công nghệ CoWoS),
đưa các đơn vị tính toán áp sát bộ nhớ, quãng đường vận chuyển dữ liệu từ “cỡ centimet” rút xuống “cỡ micromet”——băng thông bùng nổ.
Trần Lập Vũ cũng nhìn cùng một việc đó, nhưng đặt lên nền tảng CPU:
Sau khi Agent phổ biến, CPU sẽ gánh khối lượng lớn suy luận và điều phối, và cũng cần chạy áp sát bộ nhớ.
Việc Agent phổ biến sẽ đẩy nhanh sự ra đời của thời đại “CPU/GPU 1:1”:
- Hiện tại: GPU trung tâm dữ liệu là nhân vật chính, CPU chỉ là phụ
- Thời đại Agent: bên cạnh mỗi GPU đều cần có CPU mạnh để xử lý điều phối, vòng lặp Agent và quản lý KV
- Khi đó, CPU cũng phải giống GPU: đóng gói chồng CPU + HBM
Điều này có nghĩa gì (góc nhìn đầu tư):
1. Công nghệ đóng gói = mắt xích cổ chai tiếp theo
CoWoS, xếp chồng 2.5D/3D, liên kết lai—những quy trình đóng gói này chính là điểm tranh tài quân bị mới của phần cứng AI
2. Các nhà sản xuất bộ nhớ sẽ định giá lại
HBM đã bán chạy rồi; nếu CPU cũng cần HBM, không gian tưởng tượng của các nhà sản xuất DRAM sẽ lại tăng thêm một tầng
3. “Đặt cược lệch” của Intel có thể lật kèo
Thị trường đang nhìn vào NVIDIA, nhưng Trần Lập Vũ đặt cược vào việc đóng gói chồng CPU+DRAM, cược vào “đường cong thứ hai” của thời đại Agent
Câu cuối cùng:
Hóa đơn token của Agent đang định nghĩa lại phần cứng—
Khi “tốc độ đọc” quan trọng hơn “tốc độ tính toán”, thì chip áp sát bộ nhớ mới là kẻ chiến thắng.
Giai đoạn đầu của cuộc đua “quân bị sức mạnh tính toán” là GPU,
và giai đoạn sau là đóng gói.
#DeepSeek #DSH #封装 #HBM
Vài con số then chốt:
- Lượng token tiêu thụ rất lớn, tỉ lệ hit của bộ nhớ đệm KV là chủ đề được bàn luận nhiều
- Với cùng một tác vụ, thời gian của DSH gấp 2 lần GPT/Claude
Cái “2 lần” này, nhiều người chỉ coi là chênh lệch hiệu năng, nhưng nó lại là manh mối quan trọng của lộ trình phần cứng.
Nút thắt của thời đại Agent là gì?
Không phải sức mạnh tính toán, mà là băng thông bộ nhớ.
Agent làm việc = ngữ cảnh cực dài = đọc/ghi lặp lại khổng lồ trên bộ nhớ đệm KV.
Ngữ cảnh càng dài, KV cache càng lớn, việc đọc càng chậm——
chip tính toán của bạn có nhanh đến đâu, dữ liệu từ bộ nhớ vẫn không “chuyển” kịp, rồi bạn cứ phải chờ vô ích.
Thời gian của DSH gấp đôi, bản chất là “bị bạt tai bởi bức tường bộ nhớ”: nó dùng “truy cập bộ nhớ chậm hơn” để đổi lấy “chi phí thấp hơn”.
Điều này cũng giải thích vì sao Trần Lập Vũ (Intel) kiên trì đóng gói chồng CPU + DRAM:
Cách của NVIDIA là đóng gói chồng GPU + HBM (công nghệ CoWoS),
đưa các đơn vị tính toán áp sát bộ nhớ, quãng đường vận chuyển dữ liệu từ “cỡ centimet” rút xuống “cỡ micromet”——băng thông bùng nổ.
Trần Lập Vũ cũng nhìn cùng một việc đó, nhưng đặt lên nền tảng CPU:
Sau khi Agent phổ biến, CPU sẽ gánh khối lượng lớn suy luận và điều phối, và cũng cần chạy áp sát bộ nhớ.
Việc Agent phổ biến sẽ đẩy nhanh sự ra đời của thời đại “CPU/GPU 1:1”:
- Hiện tại: GPU trung tâm dữ liệu là nhân vật chính, CPU chỉ là phụ
- Thời đại Agent: bên cạnh mỗi GPU đều cần có CPU mạnh để xử lý điều phối, vòng lặp Agent và quản lý KV
- Khi đó, CPU cũng phải giống GPU: đóng gói chồng CPU + HBM
Điều này có nghĩa gì (góc nhìn đầu tư):
1. Công nghệ đóng gói = mắt xích cổ chai tiếp theo
CoWoS, xếp chồng 2.5D/3D, liên kết lai—những quy trình đóng gói này chính là điểm tranh tài quân bị mới của phần cứng AI
2. Các nhà sản xuất bộ nhớ sẽ định giá lại
HBM đã bán chạy rồi; nếu CPU cũng cần HBM, không gian tưởng tượng của các nhà sản xuất DRAM sẽ lại tăng thêm một tầng
3. “Đặt cược lệch” của Intel có thể lật kèo
Thị trường đang nhìn vào NVIDIA, nhưng Trần Lập Vũ đặt cược vào việc đóng gói chồng CPU+DRAM, cược vào “đường cong thứ hai” của thời đại Agent
Câu cuối cùng:
Hóa đơn token của Agent đang định nghĩa lại phần cứng—
Khi “tốc độ đọc” quan trọng hơn “tốc độ tính toán”, thì chip áp sát bộ nhớ mới là kẻ chiến thắng.
Giai đoạn đầu của cuộc đua “quân bị sức mạnh tính toán” là GPU,
và giai đoạn sau là đóng gói.
#DeepSeek #DSH #封装 #HBM