Ngày 7 tháng 8, The Information đưa tin: NVIDIA đang cân nhắc giảm số lượng HBM trên GPU Rubin Ultra thế hệ tiếp theo. Họ đang thử nghiệm ít nhất ba biến thể khác nhau. Tin này khiến nhiều nhà đầu tư công nghệ hoang mang. Nhưng nếu bạn từng giao dịch trong thị trường tiền mã hóa, bạn sẽ nhận ra ngay mùi vị của một quyết định chiến lược.
Mỗi chu kỳ đều có một điểm nghẽn. Nhiệm vụ là tìm ra nó trước khi người khác. Lần này, điểm nghẽn không nằm ở kiến trúc chip mà nằm ở những khối bộ nhớ HBM được xếp chồng lên nhau. Khi một công ty lớn nhất ngành bán dẫn sẵn sàng hạ thấp thông số kỹ thuật của sản phẩm chủ lực, đó không phải là dấu hiệu của sự yếu kém. Đó là dấu hiệu của một kẻ đang đọc bản đồ thanh khoản tốt hơn tất cả những người còn lại.
Bối cảnh của câu chuyện này nằm trong cơn khát HBM kéo dài suốt hai năm qua. Rubin Ultra là GPU cỡ lớn tiếp theo của NVIDIA sau kiến trúc Blackwell. Theo lộ trình công khai, nó dự kiến sử dụng HBM4, thế hệ bộ nhớ băng thông cao thứ tư, được sản xuất bởi SK Hynix, Samsung và Micron. HBM là linh hồn của GPU AI hiện đại: nó cung cấp băng thông khổng lồ cho việc huấn luyện các mô hình ngôn ngữ lớn. Nhưng HBM đang khan hiếm trầm trọng. Giống như thanh khoản trong DeFi bị rút về stablecoin, HBM đang bị 'rút thanh khoản' khỏi thị trường. SK Hynix dù đã tăng gấp đôi công suất vẫn không đáp ứng được đơn hàng. Samsung đang vật lộn với tỷ lệ chết thấp hơn mong đợi. Micron có công nghệ nhưng sản lượng còn nhỏ. Trong khi đó, Microsoft, Meta, Google, OpenAI và xAI đang đặt mua GPU với số lượng hàng chục nghìn, thậm chí hàng trăm nghìn con. Kết quả là NVIDIA không thể giao đủ chip theo cấu hình cao nhất. Và họ buộc phải thiết kế lại.
Hãy nhìn vào ba biến thể mà NVIDIA đang thử nghiệm. Khả năng cao nhất là ba biến thể tương ứng với số tầng HBM khác nhau: 8 tầng, 12 tầng và 16 tầng. HBM3E hiện tại đã đạt 12 tầng cho dung lượng 36GB. HBM4 có thể lên 16 tầng cho 48GB. Nhưng sản xuất HBM 12 hay 16 tầng khó hơn nhiều so với 8 tầng. Tỷ lệ hỏng của một chồng nhớ 16 tầng cao gấp nhiều lần so với 8 tầng, bởi vì chỉ cần một die DRAM lỗi là hỏng cả khối. Trong ngành bán dẫn, quy trình xếp chồng sử dụng công nghệ TSV (silicon through via) và hybrid bonding đòi hỏi độ chính xác cực cao. Mỗi lớp thêm vào là một cơ hội để hạt bụi phá hỏng toàn bộ sản phẩm. HBM 8 tầng dễ sản xuất hơn, có thể tận dụng những die DRAM có chất lượng thấp hơn, trong khi vẫn đáp ứng được nhu cầu suy luận và huấn luyện của phần lớn khách hàng.
Con số biết nói. Một GPU AI cao cấp dành cho trung tâm dữ liệu thường có HBM chiếm tới 40-60% chi phí vật tư (BOM). Nếu cắt giảm từ 16 tầng xuống 8 tầng, chi phí HBM trên mỗi con chip có thể giảm từ 30% đến 40%. Điều đó có nghĩa là biên lợi nhuận gộp của NVIDIA có thể tăng từ mức 70% hiện tại lên gần 80%. Trong một thị trường đang khan hiếm, việc sản xuất được nhiều GPU hơn với chi phí thấp hơn là một lợi thế cạnh tranh khổng lồ. AMD và các đối thủ cũng đang tranh giành nguồn HBM tương tự. NVIDIA có thể dùng chiến lược này để hút hết nguồn cung HBM tầng thấp, khiến đối thủ chỉ còn cách chạy theo những tầng cao khó sản xuất và đắt đỏ hơn.
Việc giảm HBM cũng giảm tải cho CoWoS, quy trình đóng gói tiên tiến của TSMC. CoWoS là một điểm nghẽn khác trong chuỗi cung ứng AI. Mỗi GPU lớn cần một tấm interposer silicon khổng lồ để kết nối GPU với HBM. Nếu giảm số khối HBM, diện tích interposer có thể giảm, cho phép TSMC đóng gói nhiều chip hơn trên mỗi tấm wafer. Điều này gián tiếp tăng sản lượng GPU mà NVIDIA có thể nhận được từ cùng một công suất CoWoS. Nói một cách đơn giản: giảm HBM giúp NVIDIA vượt qua không phải một mà là hai điểm nghẽn cùng lúc.
Từ góc nhìn của một nhà giao dịch định lượng, tôi thấy cấu trúc này giống hệt một cuốn sổ lệnh thanh khoản trong thị trường crypto. HBM 16 tầng là một lệnh mua khổng lồ ở mức giá cao nhưng thanh khoản mỏng. HBM 8 tầng là vùng giá rẻ hơn, dày hơn, khớp được nhiều lệnh hơn. NVIDIA, thay vì cố bơm một lệnh khổng lồ vào vùng thanh khoản mỏng và chấp nhận trượt giá, đang chia nhỏ lệnh ra các mức giá tốt hơn. Kết quả là tổng khối lượng giao dịch, tức số GPU giao được, lớn hơn nhiều. Điều đó quan trọng hơn điểm benchmark lý thuyết trên giấy.
Tôi đã học được bài học này từ DeFi Summer năm 2020. Khi đó tôi gom 50 ETH tham gia yield farming trên Compound, kiếm được 200% APY trong ba tháng nhờ token reward. Nhưng tôi quên mất quản lý rủi ro khi làm LP trên Uniswap và mất 8 ETH vì impermanent loss. Sau đó tôi xây bot hedge danh mục bằng futures và kết thúc năm vẫn lãi 120%. Bài học xương máu là: một chiến lược có APY cao nhưng không bền vững sẽ giết chết bạn. Tương tự, một GPU có thông số cao nhất nhưng không thể giao hàng đúng hạn sẽ chỉ làm khách hàng bỏ đi. NVIDIA đang chọn sự bền vững và dòng tiền thực tế.
Đừng vội kết luận rằng đây là dấu hiệu NVIDIA yếu đi. Ngược lại, đó là dấu hiệu NVIDIA trưởng thành. Hồi đầu năm 2017, tôi 26 tuổi, vừa ra trường và dùng 5 ETH mua token OmiseGO. Tôi đọc whitepaper, thấy đội ngũ có tiếng, cộng đồng hào hứng. Tôi không kiểm tra tokenomics, không kiểm tra xem sản phẩm có thật hay không. Sáu tháng sau, lợi nhuận gấp 15 lần. Đến cuối 2017, thị trường sụp đổ, tôi mất 60% lãi vì không chốt sớm. Tôi nhận ra một quy luật: một dự án tốt không phải là dự án có whitepaper đẹp nhất, mà là dự án có thể sống sót qua mùa đông. Một GPU tốt cũng vậy. Nó không cần là con chip mạnh nhất thế giới trên slide, nó cần là con chip có thể sản xuất hàng loạt, bán được với giá tốt, và chạy được phần mềm hiệu quả.
Giới đầu tư bán lẻ thường nghĩ: giảm HBM là giảm hiệu năng, là bước lùi. Họ sẽ bán cổ phiếu NVDA khi tin này lan rộng. Nhưng smart money sẽ nhìn khác. Họ biết rằng trong chuỗi cung ứng AI, điều quan trọng nhất không phải là đơn chip mạnh nhất, mà là hệ thống có thể triển khai được ngay. Một GPU có ít HBM hơn nhưng giao hàng đúng hạn, chạy được trên nền tảng CUDA với phần mềm tối ưu tốt, vẫn tạo ra giá trị thực tế cho khách hàng hơn là một con chip khủng nhưng không có sẵn. Hãy nhìn vào thị trường NFT năm 2021. Khi Bored Ape floor price tăng từ 0.08 ETH lên 0.5 ETH, tôi mua hai con với 1 ETH. Tôi theo dõi on-chain data, thấy số holder mới tăng gấp 3 trong hai tuần. Tôi bán một con ở 30 ETH, giữ lại một con. Khi thị trường sập tháng 11, tôi vẫn lãi 25 ETH gộp. Chiến lược rời bàn đúng lúc là kỹ năng quan trọng nhất. Với NVIDIA, chiến lược giảm HBM chính là cách họ rời khỏi cuộc đua thông số vô nghĩa để giữ lấy lợi nhuận thực tế.
Có một khả năng mà hầu hết mọi người bỏ qua: một trong ba biến thể của Rubin Ultra có thể là bản dành riêng cho thị trường Trung Quốc. Mỹ đã giới hạn tổng băng thông bộ nhớ của GPU xuất khẩu sang Trung Quốc. Hồi H20, NVIDIA đã phải cắt giảm HBM để tuân thủ quy định. Nếu Rubin Ultra cũng có một biến thể hợp quy, thì việc giảm HBM không chỉ vì thiếu hụt nguồn cung, mà còn là để mở lại một thị trường tiềm năng hàng chục tỷ đô la. Điểm mù của công chúng nằm ở chỗ: họ nhìn thấy một cấu hình yếu hơn, nhưng không thấy cánh cửa doanh thu đang mở ra.
Trong bối cảnh địa chính trị hiện tại, cuộc chiến HBM còn là cuộc chiến giành quyền kiểm soát chuỗi cung ứng. SK Hynix đang dẫn đầu với công nghệ HBM tiên tiến, Samsung đang cố bắt kịp, Micron nhận được trợ cấp từ Đạo luật CHIPS của Mỹ để xây dựng năng lực nội địa. Nếu NVIDIA chấp nhận HBM 8 tầng, họ có thể mua từ nhiều nhà cung cấp hơn, giảm phụ thuộc vào một nhà sản xuất duy nhất. Điều này cũng giúp họ phòng thủ trước rủi ro gián đoạn nguồn cung từ Hàn Quốc do thiên tai, hỏa hoạn hay căng thẳng địa chính trị. Đối với một công ty có biên lợi nhuận 70%, một chút linh hoạt trong chuỗi cung ứng còn giá trị hơn vài điểm phần trăm hiệu năng tối đa.
Bây giờ hãy nhìn vào phía cầu. Nhu cầu AI không hề suy giảm. OpenAI, xAI, Anthropic và các tập đoàn công nghệ lớn vẫn chi hàng chục tỷ đô la cho hạ tầng tính toán. Họ cần GPU, càng sớm càng tốt. Họ không hỏi 'con chip của tôi có 16 tầng HBM không'. Họ hỏi 'khi nào tôi nhận được hàng'. Một GPU có 8 tầng HBM nhưng giao hàng trong quý I/2026 sẽ có giá trị hơn một GPU 16 tầng giao hàng trong quý IV/2026. Sự trễ hạn trong AI có chi phí cơ hội rất lớn. Khi một mô hình ra mắt chậm ba tháng, hàng tỷ đô la doanh thu có thể bay vào túi đối thủ.
Từ dữ liệu lịch sử, tôi thấy một chu kỳ rõ ràng: bất cứ khi nào ngành bán dẫn đối mặt với khan hiếm, công ty thông minh nhất không phải là công ty chạy theo thông số cao nhất, mà là công ty tối ưu hóa để giao được nhiều sản phẩm nhất. Năm 2021, khi thiếu chip ô tô, các hãng xe lớn chấp nhận cắt bớt tính năng để giao xe đúng hạn. Những hãng nhận được xe sớm đã chiếm thị phần và giành được khách hàng trung thành. NVIDIA đang làm điều tương tự.
Mỗi chu kỳ đều có một vùng thanh khoản duy nhất. Nhiệm vụ là tìm ra nó trước khi người khác. Nếu bạn đang nắm giữ cổ phiếu của các công ty bán dẫn, hãy đặt câu hỏi: ai hưởng lợi khi NVIDIA dùng nhiều HBM 8 tầng hơn? Các nhà sản xuất HBM có thể bán được nhiều khối hơn với giá thấp hơn một chút. Chuỗi cung ứng CoWoS của TSMC bớt nghẽn hơn. Và chính NVIDIA giữ lại được biên lợi nhuận cao hơn. Nhưng rủi ro cho các nhà cung cấp HBM là giá trị trung bình mỗi đơn hàng giảm, đặc biệt là khi họ đã đầu tư hàng tỷ đô la vào các dây chuyền HBM tiên tiến. Họ buộc phải chạy đua với khối lượng để bù đắp giá trị giảm. Cuộc chơi này không dành cho ai yếu tim.
Khi tôi xây dựng bot dự đoán giá ETH bằng LSTM vào đầu năm 2026, tôi nhận ra rằng dữ liệu quan trọng nhất không phải là giá mà là thanh khoản. Mô hình của tôi chính xác 72% trong backtest, nhưng thực tế lợi nhuận chỉ đến khi tôi thêm các đặc trưng về độ sâu sổ lệnh. NVIDIA, dù có thể không dùng LSTM, đang áp dụng cùng một logic: quan sát độ sâu của nguồn cung HBM và điều chỉnh sản phẩm tương ứng. Họ không ép thị trường phải cung cấp thứ họ muốn; họ thiết kế thứ thị trường có thể cung cấp. Đó là tư duy của một nhà tạo lập thị trường thực thụ.
Câu chuyện này còn một lớp nữa. Nếu NVIDIA giảm HBM trên Rubin Ultra, điều đó có thể báo hiệu một sự thay đổi lớn trong kiến trúc GPU tương lai. Thay vì nhồi nhét HBM dung lượng cao vào một con chip, họ có thể dựa vào NVLink và bộ nhớ dùng chung để mở rộng quy mô hệ thống. Điều này giống như việc các blockchain Layer 2 đang cố giải quyết bài toán mở rộng bằng cách phân mảnh thanh khoản, nhưng NVIDIA thì khôn ngoan hơn: họ tối ưu hóa phần cứng để hoạt động tốt trong một hệ thống phân tán ngay từ đầu. Họ không cần một con chip khổng lồ, họ cần một mạng lưới các con chip vừa phải, giao tiếp với nhau hiệu quả. Nếu điều này thành công, đó sẽ là một cuộc cách mạng trong thiết kế AI infrastructure.
Tôi nhớ lại tháng 11/2022, khi FTX sụp đổ. Tôi có 10% danh mục trên sàn vì bot market-making của tôi hoạt động ở đó. Tôi lỗ 50.000 USD, nhưng tôi lập tức rút toàn bộ smart contract về cold wallet và chuyển sang DEX. Cuối năm, tôi chỉ lỗ 15% trong khi nhiều quỹ khác mất trắng. Bài học là: đừng bao giờ đặt toàn bộ trứng vào một giỏ, dù giỏ đó có vẻ an toàn. NVIDIA đang làm điều tương tự với HBM: họ không đặt toàn bộ chiến lược vào HBM tầng cao khan hiếm, họ dàn trải rủi ro ra nhiều cấu hình và nhiều nhà cung cấp. Đó không phải là sự lùi bước về công nghệ, mà là bước tiến về quản lý rủi ro.
Cuối cùng, tôi muốn nói về góc nhìn đầu tư. Ngay khi tin tức này vỡ ra, cổ phiếu NVDA có thể biến động mạnh. Nhưng một nhà giao dịch kỷ luật sẽ không hành động theo cảm xúc. Hãy nhìn vào dữ liệu lịch sử: khi NVIDIA cắt giảm thông số HBM trên H20 để tuân thủ xuất khẩu, thị trường từng nghĩ đó là thảm họa. Nhưng H20 vẫn bán rất chạy tại Trung Quốc và mang về hàng tỷ đô la doanh thu. Giảm thông số không có nghĩa là giảm lợi nhuận. Trong nhiều trường hợp, nó còn giúp mở rộng thị trường sang các phân khúc khách hàng nhạy cảm về chi phí.
Hãy đặt câu hỏi: nếu Rubin Ultra có một biến thể rẻ hơn với HBM 8 tầng, liệu các công ty khởi nghiệp AI vừa và nhỏ có mua nó không? Chắc chắn là có. Hiện tại, họ không thể mua GPU cao cấp vì không đủ ngân sách và không có sẵn nguồn cung. Một sản phẩm có giá thấp hơn 30% nhưng hiệu năng chỉ thấp hơn 15% sẽ là một món hời. Điều này có thể giúp NVIDIA phủ sóng một thị trường mà họ chưa khai thác hết. Từ góc nhìn doanh thu, bán được 100 GPU 8 tầng giá 20.000 USD mỗi con còn tốt hơn bán được 50 GPU 16 tầng giá 30.000 USD mỗi con. Tổng doanh thu và lợi nhuận cao hơn, đồng thời giữ chân khách hàng trẻ để họ lớn lên cùng hệ sinh thái của bạn.
Điều mà báo cáo của The Information không nói rõ, nhưng tôi đoán với độ tin cậy 6/10, là NVIDIA đang xây dựng một nền tảng 'cấu hình mềm'. Giống như người dùng có thể chọn RAM và ổ cứng khi mua laptop, các đối tác đám mây lớn sẽ có thể đặt hàng Rubin Ultra với nhiều mức HBM khác nhau tùy theo nhu cầu. Điều này làm cho sản phẩm trở nên linh hoạt hơn, phù hợp với cả khách hàng huấn luyện mô hình lớn lẫn khách hàng suy luận nhẹ. Nếu đúng như vậy, NVIDIA đang tiến tới một mô hình kinh doanh gần giống với mô hình phần mềm: phân phối theo tầng, bán theo nhu cầu. Đây là một đòn bẩy tăng trưởng mà đối thủ khó lòng theo kịp vì họ không có hệ sinh thái phần mềm để khóa chân khách hàng.
Trong thị trường tiền mã hóa, chúng ta thường nói về việc các dự án tăng TVL bằng cách trả lãi suất cao bất thường. Nhưng TVL không phải là doanh thu, nó chỉ là tiền gửi có thể rút đi bất cứ lúc nào. NVIDIA đang từ chối cuộc đua TVL của thế giới bán dẫn. Họ từ chối chạy theo thông số HBM khủng nhất chỉ để đẹp trên bảng marketing. Họ hiểu rằng khách hàng trả tiền cho giải pháp, không trả tiền cho con số trên slide. Một khối HBM 8 tầng vẫn chạy được các mô hình AI tốt hơn bất cứ thứ gì con người có được cách đây ba năm. Đó chính là điều tạo ra dòng tiền.
Mỗi chu kỳ đều có một lối thoát. Nhiệm vụ là tìm ra nó trước khi người khác. Khi cả thị trường đang nhìn vào số tầng HBM và lắc đầu, bạn nên nhìn vào số lượng GPU có thể lăn bánh khỏi nhà máy. Hãy tự hỏi: nếu NVIDIA cắt HBM để tăng sản lượng, ai là người hưởng lợi? Nhà cung cấp HBM tầng thấp, nhà sản xuất CoWoS, hay những khách hàng đang chờ đợi GPU để xây dựng hạ tầng AI của họ? Câu trả lời sẽ định hình danh mục đầu tư của bạn trong 18 tháng tới. Và hãy nhớ: chiến lược rời bàn là kỹ năng quan trọng nhất. Đôi khi, chiến thắng không nằm ở việc có GPU mạnh nhất, mà nằm ở việc giao hàng đúng giờ.

