[비즈한국] Sự hoài nghi về AI lại một lần nữa trỗi dậy. Không phải vì "AI vô dụng", mà từ góc độ công nghiệp, người ta thường xuyên đặt câu hỏi rằng "liệu AI có thực sự xứng đáng với những khoản đầu tư khổng lồ như kỳ vọng hay không". Dù kết luận theo hướng nào, chúng ta cũng sẽ không từ bỏ niềm tin vào tiềm năng của công nghệ AI hay cắt giảm lượng sử dụng. Ngược lại, trong thời gian tới, con số này chắc chắn sẽ còn tăng lên.
Khoản đầu tư mà các doanh nghiệp liên quan đến AI đang đổ vào máy tính hiện nay là mức không tưởng. Nhìn vào báo cáo kết quả kinh doanh gần đây của Google, chi phí đầu tư cơ sở hạ tầng trong năm 2026 dự kiến lên tới 200 tỷ USD. Trong quý vừa qua, Google đạt doanh thu khoảng 120 tỷ USD, tăng 24% so với cùng kỳ năm ngoái. Đối với một doanh nghiệp tầm cỡ như Google, mức tăng trưởng này là cực kỳ ấn tượng. Trong đó, mảng đám mây (Cloud) đã kiếm được số tiền nhiều hơn 82% so với cùng kỳ năm trước. Lý do chỉ có một: đó chính là AI.

Tuy nhiên, trớ trêu thay, sau thông báo này, thị trường chứng khoán lại bất ngờ dấy lên sự hoài nghi về AI. Dù Google đạt kết quả vượt kỳ vọng và có động lực tăng trưởng mạnh mẽ, nhưng nhiều người lo ngại rằng tỷ trọng đầu tư vào cơ sở hạ tầng đang chiếm quá lớn. Tùy vào góc nhìn, nhưng đánh giá về các doanh nghiệp dẫn đầu AI, bao gồm cả ngành bán dẫn, đang nguội lạnh nhanh chóng. Mức độ hoảng sợ thậm chí có thể nói là đáng lo ngại.
AI vẫn là từ khóa cốt lõi dẫn dắt ngành công nghiệp hiện nay. Các doanh nghiệp được gọi là "hyperscaler" (nhà cung cấp dịch vụ quy mô lớn) như Google đang thu về lợi nhuận khổng lồ. Và để tạo ra những mô hình tốt hơn, họ đang tiếp tục mở rộng hạ tầng liên quan đến AI. Trên thực tế, họ đang thâu tóm gần như tất cả các tài nguyên điện toán trên thế giới. Sự tăng trưởng hạ tầng chưa bao giờ mạnh mẽ hơn thế, với mức độ tập trung và mở rộng diễn ra ở tốc độ đáng kinh ngạc.
Cơn khát kỹ thuật nhằm nâng cao "số token tạo ra trên mỗi chi phí"
Gần đây, tôi đã tham dự sự kiện AI thường niên của AMD mang tên "Advancing AI" tại San Francisco, Mỹ. Đây là nơi AMD giới thiệu các sản phẩm AI mới, đồng thời công bố những chiến lược và lộ trình quy mô lớn. Cho đến nay, sự kiện này thường xoay quanh các GPU xử lý AI và khung phát triển ROCm. Lý do là vì AI trên thế giới bắt đầu dựa trên khung CUDA của Nvidia và vận hành bằng GPU của Nvidia.
AMD đã luôn nhấn mạnh rằng: "GPU của AMD cũng mang lại hiệu năng tuyệt vời, và ROCm cũng có thể tạo ra môi trường AI dễ sử dụng và mạnh mẽ không kém gì CUDA của Nvidia". Đặc biệt, vì nguồn cung GPU của Nvidia không đáp ứng đủ nhu cầu bùng nổ, việc đưa ra các GPU của AMD như dòng "Instinct" trở thành một phương án thay thế thực tế và mạnh mẽ nhất là điều đương nhiên.

Tuy nhiên, quan điểm của AMD năm nay đã có sự thay đổi tinh tế. Họ không chỉ đơn thuần là giải pháp thay thế cho Nvidia, mà đã đưa ra câu trả lời thực tế cho những từ khóa "nóng" nhất hiện nay: "hiệu năng trên mỗi chi phí" và "số lượng token tạo ra trên mỗi chi phí". Việc đào tạo cơ bản cho các mô hình AI lớn đã đi vào ổn định, và hiệu năng hạ tầng cho việc này cũng đã bớt căng thẳng. Thế nhưng, vấn đề thực tế nhất hiện nay nằm ở khâu "suy luận" (inference) – nơi đưa ra câu trả lời theo yêu cầu của người dùng.
Lisa Su, CEO của AMD, đã phát biểu trong bài thuyết trình chính: "Cho đến hai năm trước, tỷ lệ giữa đào tạo và suy luận là khoảng 6:4, nhưng từ năm nay, cán cân sẽ bị đảo ngược". Điều này cho thấy nhu cầu AI tại thực địa đang tăng trưởng bùng nổ. Giờ đây, các mô hình ngôn ngữ lớn không chỉ dừng lại ở việc viết văn, mà còn viết code cho các dự án phát triển quy mô lớn, phân tích các thí nghiệm khoa học, tạo ảnh và video. Tất nhiên, việc tìm kiếm, sắp xếp thông tin và viết lách tự nhiên hơn là điều hiển nhiên. Thế nhưng, việc xử lý những tác vụ này rốt cuộc vẫn phụ thuộc vào năng lực suy luận của các máy tính vận hành dịch vụ đó.

Hơn nữa, xu hướng AI hiện nay đang chuyển dịch sang "AI đại lý" (Agent AI), nơi các AI không chỉ làm việc đơn lẻ mà là sự kết hợp của nhiều AI được tối ưu hóa cho các lĩnh vực cụ thể để cùng xử lý một công việc lớn. Để giải quyết một tác vụ, cần nhiều mô hình AI hoạt động cùng lúc.
Năm nay, AMD không chỉ ra mắt GPU mà còn giới thiệu "Helios", một siêu máy tính AI tích hợp CPU, GPU và mạng lưới kết nối 18 máy chủ này lại với nhau. Tôi đề cập đến hệ thống này không phải chỉ vì nó mạnh, mà vì định hướng mà nó theo đuổi phản ánh chính xác thực trạng của AI hiện nay.
Cốt lõi của máy tính này là việc kết hợp các máy chủ dạng phiến (blade server) mỏng dẹt dùng trong trung tâm dữ liệu. Mỗi khay máy chủ được trang bị bộ vi xử lý EPYC với 256 lõi trên mỗi chip và 4 GPU hiệu năng cao có tên Instinct MI455X. Các GPU này được kết hợp với bộ nhớ HBM4 khổng lồ lên tới 432GB. Việc kết hợp 18 đơn vị phiến này tạo thành một hệ thống rack có kích thước bằng một chiếc tủ lạnh lớn, kết nối tổng cộng 4.608 lõi, 72 GPU và 31TB (terabyte) HBM thành một hệ thống duy nhất.
"Rack-scale system", phương pháp luận để có thêm sức mạnh điện toán trong cùng một không gian
Helios cũng có hình dáng như những máy tính thường thấy trong trung tâm dữ liệu, vậy điều gì đặc biệt ở đây? Thực tế, đối với máy tính hiện đại bao gồm cả AI, thông lượng tổng thể quan trọng hơn tốc độ xử lý đơn lẻ. Đó là câu hỏi: "Ta có thể thực hiện bao nhiêu phép tính?". Do đó, mấu chốt nằm ở việc nhồi nhét càng nhiều máy tính vào một hệ thống hoặc một không gian giới hạn càng tốt. Nhưng đây không chỉ là vấn đề số lượng. Dù máy chủ trông có vẻ đồ sộ, nhưng cấu trúc của nó không khác nhiều so với PC chúng ta đang dùng. Vẫn là CPU và bộ nhớ làm trung tâm, kết hợp với GPU được gắn kèm.

Đặc biệt, GPU trao đổi dữ liệu qua cổng gọi là PCI Express, và tốc độ cũng như dung lượng dữ liệu đi qua con đường này đều có giới hạn. Vì vậy, việc gắn hai GPU vào một máy tính để xử lý AI không mang lại hiệu năng gấp đôi chính xác mà sẽ có một chút hao hụt. Đã từng có lúc người ta gắn rất nhiều GPU vào một máy tính, nhưng càng nhiều GPU thì hao hụt càng lớn. Hơn nữa, số lượng GPU có thể gắn vào một máy tính bị giới hạn bởi cả PCI Express lẫn không gian vật lý. Do đó, người ta kết nối nhiều máy chủ đơn vị lại thành một hệ thống. Đây là cách các "rack" (giá đỡ) – thứ trông như những kệ sách – thường được cấu tạo.
Tuy nhiên, việc kết nối máy chủ với máy chủ lại gây ra sự hao hụt lớn hơn. Trong một máy chủ, dữ liệu được xử lý qua bảng mạch, nhưng khi kết nối máy chủ với máy chủ, kết quả xử lý bên trong một máy tính phải được truyền tải qua mạng một lần nữa. Do lưu lượng truyền tải và thời gian di chuyển vật lý của dữ liệu, hiệu năng bị sụt giảm nghiêm trọng. Có câu nói rằng nếu kết nối 100 GPU thì khó đạt được hiệu năng gấp 100 lần, thậm chí gấp 50 lần cũng rất khó.
Nhưng đó chưa phải là tất cả. Khi khối lượng xử lý AI tăng lên, nhu cầu về GPU trở nên khổng lồ, và các trung tâm dữ liệu kết nối hàng chục, hàng trăm rack như vậy bắt đầu hình thành. Mục đích của trung tâm dữ liệu là nhồi nhét nhiều máy tính hơn vào không gian hữu hạn. Ngoài việc lắp nhiều CPU hay GPU, việc nâng cao hiệu quả kết nối cũng quan trọng không kém.

Lý do AMD không bán CPU và GPU dưới dạng "linh kiện rời" mà đóng gói thành "sản phẩm hoàn chỉnh" dạng hệ thống thông qua Helios chính là để đề xuất một tiêu chuẩn phổ quát cho sự kết nối này. Khi kết hợp 1 CPU 256 lõi với 4 GPU, hệ thống sẽ đạt hiệu năng tối ưu và không gặp hiện tượng nghẽn cổ chai. Việc kết nối nhiều hệ thống tiêu chuẩn hóa như vậy cũng có lợi cho việc vận hành trung tâm dữ liệu một cách ổn định.
Đây cũng là khái niệm mà Nvidia đang đề xuất thông qua "Vera Rubin". Có thể diễn giải đây là cách họ độc quyền nền tảng và bán sản phẩm hoàn chỉnh để tăng giá GPU, nhưng vì đây là cách hiệu quả nhất để tập trung sức mạnh tính toán ổn định vào không gian hạn hẹp của trung tâm dữ liệu, nên nó trở nên ưu việt hơn trong điều kiện cần phải đảm bảo hạ tầng ngay lập tức.
Trên thực tế, thông qua Helios, AMD đã đưa vào mỗi rack lượng bộ nhớ HBM4 lớn hơn nhiều so với trước đây. CEO Lisa Su cho rằng vì môi trường AI tương lai chắc chắn sẽ đòi hỏi nhiều bộ nhớ hơn, nên việc đảm bảo càng nhiều bộ nhớ HBM trong cùng một không gian càng tốt là nhiệm vụ cấp bách nhất của thị trường.

AI đại lý vẫn còn đang "khát" bộ nhớ
Cho đến nay, các mô hình ngôn ngữ lớn chủ yếu tồn tại dưới dạng "chatbot", nhưng từ giờ trở đi, kỷ nguyên của AI đại lý (Agent AI) sẽ mở ra. Mỗi đại lý cần nhiều suy luận hơn, và việc điều phối (orchestration) để tập hợp các kết quả đó nhằm tạo ra giá trị trở nên quan trọng. Điều này đồng nghĩa với việc không chỉ hiệu năng suy luận mà cả dung lượng bộ nhớ cần ghi nhớ cũng sẽ tăng lên.
AI sẽ đòi hỏi sức mạnh tính toán lớn hơn và bộ nhớ nhiều hơn. Ngay cả bây giờ, chúng ta vẫn đang phải "nhường" các tài nguyên hạn hẹp như bộ vi xử lý và bộ nhớ cần thiết trên PC, smartphone cho AI. Cái giá phải trả chính là mức giá bán dẫn đắt đỏ. Nhưng thị trường AI hiện nay còn đang hút nhiều tài nguyên hơn thế. Helios của AMD hay Vera Rubin của Nvidia là những lời đề nghị "ngọt ngào" về mặt kỹ thuật cho vấn đề này.

Ngay trước khi bắt đầu bài thuyết trình chính tại Advancing AI, AMD cũng đã công bố kế hoạch đầu tư và quan hệ đối tác với Microsoft và Anthropic. Đặc biệt, AMD cam kết đầu tư chiến lược quy mô khổng lồ lên tới 5 tỷ USD (hơn 7 nghìn tỷ won) vào Anthropic – đơn vị vận hành Claude. Dựa trên cơ sở này, Anthropic dự kiến sẽ đưa vào sử dụng hạ tầng AI dựa trên Helios với quy mô 1 gigawatt ngay trong năm tới. Dù chưa thể biết chính xác chi phí triển khai hạ tầng này, nhưng đây là một con số cực kỳ lớn, và có thể hiểu là Anthropic đang đảm bảo nguồn lực bằng cách chuyển nhượng một phần cổ phần cho AMD. AMD cũng không chỉ nhìn vào doanh thu trước mắt mà đang dùng phần cứng để đổi lấy cổ phần của Anthropic như một loại "hiện vật". Việc Nvidia gần đây đầu tư và cung cấp hệ thống Vera Rubin cho Naver cũng có thể được hiểu theo quy trình tương tự.
Điều này chứng minh rằng AI đang đòi hỏi nhiều chất bán dẫn hơn bao giờ hết, và dù có chút áp lực, các doanh nghiệp buộc phải gấp rút thâu tóm các thế hệ GPU và bộ nhớ tiếp theo. Ngành công nghiệp AI đang sẵn sàng để tiếp tục hút thêm nhiều tài nguyên hơn nữa. AI dựa trên học máy hiện tại suy cho cùng là cuộc chiến của "xác suất", và các phương pháp tạo lập cũng như vận hành mô hình cơ bản đã đi vào ổn định. Cách giải thích cho rằng AI đã đạt đến giới hạn kỹ thuật cũng không hẳn là sai. Điều này có nghĩa là với mô hình đơn lẻ như hiện nay, AI khó có thể trở nên thông minh hơn nữa.
Tuy nhiên, AI đại lý là một phương pháp luận mới giúp vượt qua rào cản này, cho phép chúng ta tin tưởng giao phó nhiều việc hơn cho AI. AI đại lý tạo ra một môi trường khác biệt so với các mô hình ngôn ngữ lớn trước đây. Chặng đường cuối của hành trình dài này sẽ là sự hoàn thiện của trí tuệ nhân tạo dựa trên các kỹ thuật học máy đã được đề xuất từ 40 năm trước. Và trong quá trình đó, chúng ta chắc chắn sẽ phải trả cái giá bằng nhiều chất bán dẫn hơn nữa.