Bitget App
Giao dịch thông minh hơn
Mua CryptoThị trườngGiao dịchFutures‌EarnAIQuảng trườngThêm
Cơn khan hiếm GPU chưa kết thúc, giờ đến lượt CPU có thể bị săn lùng

Cơn khan hiếm GPU chưa kết thúc, giờ đến lượt CPU có thể bị săn lùng

deeptech深科技deeptech深科技2026/08/18 06:29
Hiển thị bản gốc
Theo:deeptech深科技
Cơn khan hiếm GPU chưa kết thúc, giờ đến lượt CPU có thể bị săn lùng image 0


Ngày 31/5/2026, Nvidia thông báo CPU sở hữu 88 nhân tùy chỉnh đã bắt đầu sản xuất hàng loạt. Con chip có tên là Vera, sử dụng kiến trúc lệnh Arm và nhân Olympus do Nvidia tự phát triển, sẽ được tích hợp vào nền tảng siêu máy tính Vera Rubin và cũng được lắp riêng trong các máy chủ CPU. Dell, HP, Lenovo, Supermicro cùng nhiều hãng sản xuất máy chủ đã bắt đầu chế tạo hệ thống tích hợp Vera.


Nvidia gọi Vera là “CPU đầu tiên được tạo ra cho AI Agent”.Vera sẽ kết hợp cùng GPU Rubin thành một nền tảng và cũng được lắp vào máy chủ CPU độc lập.Sau nhiều năm chỉ bán GPU, Nvidia lại bắt đầu bán riêng năng lực tính toán CPU, điều này nghe có vẻ không bình thường.


Cơn khan hiếm GPU chưa kết thúc, giờ đến lượt CPU có thể bị săn lùng image 1

Hình | Nvidia Vera (nguồn: Nvidia)


Ba năm trở lại đây, lo lắng về phần cứng của ngành AI gần như xoay quanh GPU. Việc huấn luyện cần nhiều GPU hơn, suy luận cần nhiều GPU hơn, khi số lượng tham số mô hình và người dùng tăng lên thì câu trả lời vẫn là thêm GPU. CPU trong hệ thống này chủ yếu đảm nhận việc khởi động nhiệm vụ, di chuyển dữ liệu và quản lý máy chủ, hiếm khi trở thành đối tượng quan tâm của nhà đầu tư.


Cho đến khi AI Agent thay đổi hình thái nhiệm vụ.


Bot trò chuyện thông thường nhận đoạn văn bản, chạy một lần mô hình, sau đó sinh ra một đoạn văn bản. Agent còn phải chuyển quyết định của mô hình thành hành động: đọc file, tìm kiếm web, truy xuất cơ sở dữ liệu, gọi API, thực thi code rồi trả về kết quả cho mô hình. Một tác vụ có thể trải qua hàng chục vòng “suy luận – thao tác – quan sát”, mỗi vòng phải chuyển đổi qua lại giữa GPU và CPU.


GPU vẫn đảm nhận việc tính toán mô hình nặng nhất, còn các tác vụ như phân tích đầu ra mô hình, xác định loại công cụ, gửi yêu cầu, chạy chương trình, quản lý tệp, thu thập kết quả và sắp xếp vòng nhiệm vụ tiếp theo thường được CPU xử lý. Madhu Rangarajan, Phó Chủ tịch về Tính toán & Enterprise AI của AMD, cho biết trong một pipeline agent thực tế mà công ty thử nghiệm, 7 trong 8 giai đoạn hoàn toàn chạy trên CPU. Tỷ lệ này do AMD tự đo, không nhất thiết đại diện cho mọi hệ thống, nhưng cũng đủ nói lên rằng:Suy luận mô hình chỉ là một phần để agent hoàn thành nhiệm vụ, còn mọi phối hợp ngoài phần đó đều đè nặng lên CPU.


Chi phí gây ra bởi một Agent có thể không lớn, nhưng khi mở rộng quy mô con số này sẽ trở nên rất lớn.


Một agent có thể đồng thời gọi nhiều công cụ và tạo ra các agent con. Khi doanh nghiệp triển khai cùng một hệ thống cho hàng chục nghìn nhân viên, số lượng tác vụ đồng thời sẽ tăng chóng mặt. Mỗi agent đều phân tích đầu ra, thực thi code và đọc ghi dữ liệu, chi phí CPU ban đầu phân tán sẽ tích tụ thành yêu cầu về dung lượng. Nếu CPU xử lý chậm, GPU sẽ phải chờ đầu vào cho vòng suy luận tiếp theo.


Kiểm tra bảo mật cũng đang làm tăng gánh nặng này. Agent càng nhiều quyền hạn, hệ thống càng cần kiểm tra agent đã mở file nào, gọi API nào, có đụng đến dữ liệu nhạy cảm không. Việc đối chiếu quy tắc, phân tích log và kiểm duyệt bằng các mô hình nhỏ thường để cho CPU vì tác vụ phân tán, nhạy cảm về độ trễ, gọi GPU riêng lẻ chưa chắc đã hợp lý. Vậy nên, agent càng tự chủ, khâu kiểm tra càng nhiều, CPU càng tải nặng.


Vào tháng 7 năm nay, AI Agent của OpenAI trong một đánh giá an ninh nội bộ đã vô tình vượt sandbox, truy cập vào hệ thống sản xuất của Hugging Face, minh chứng cho tầm quan trọng của các cơ chế an toàn này và lượng tải tính toán tăng thêm khi triển khai thực tế.


Một gánh nặng dễ bị bỏ qua nữa là việc tách từ (tokenization).


Trước khi xử lý văn bản, mô hình lớn phải chuyển văn bản thành các token. Quá trình này gồm rất nhiều thao tác chuỗi và rẽ nhánh điều kiện, không phù hợp với GPU như biến đổi ma trận. Đầu vào hội thoại thường ngắn, độ trễ tách từ gần như không cảm nhận được; nhưng agent liên tục tích lũy kết quả trả về của công cụ, mã code, log và lịch sử thao tác, đầu vào có thể lên đến hàng chục nghìn, thậm chí hàng trăm nghìn token.


Nghiên cứu sinh Euijun Chung của Viện Công nghệ Georgia, trong một cuộc phỏng vấn với IEEE Spectrum, cho biết trong một số hiện thực, ngữ cảnh đã có 100.000 token khi thêm kết quả công cụ 1.000 token, bộ tách từ vẫn có thể xử lý lại toàn bộ đầu vào.Bộ nhớ đệm tiền tố và tách từ tăng dần giúp giảm lặp lại công việc, do đó không phải hệ thống nào cũng làm vậy; nhưng áp lực CPU từ văn bản dài vẫn tồn tại.


Nhóm Chung trong nghiên cứu mới nhất đã kiểm thử các mô hình như Llama 3.1 và Qwen3. Khi chuỗi dài và batch lớn, việc tách từ chiếm đến 80% độ trễ token đầu tiên. Nếu số lõi CPU không đủ, các luồng tách từ sẽ tranh tài nguyên với tác vụ lập lịch và khởi động nhân GPU, dẫn đến CPU full load nhưng GPU lại chưa đầy tải. Sau khi bổ sung số lõi CPU, độ trễ token đầu tiên ở các cấu hình khác nhau cải thiện được 1,47–5,15 lần mà không phải thêm GPU.


Dữ liệu ngành đã bắt đầu phản ánh sự thay đổi này. Tháng 1/2026, KeyBanc dựa trên khảo sát chuỗi cung ứng cho rằng, phần lớn năng lực CPU máy chủ của Intel cả năm đã bán hết, nguồn cung CPU máy chủ của AMD cũng gần như sử dụng hết, nhờ vậy cả hai công ty có cơ hội tăng giá. Đây là ước tính từ kênh phân tích, không phải dữ liệu đơn đặt hàng do doanh nghiệp công bố.


Tài liệu tài chính của Intel sau đó phần nào đã xác nhận điều này. Công ty cho biết, nhu cầu CPU máy chủ quý I/2026 vượt quá khả năng cung ứng, dự báo hạn chế về sản lượng nội bộ sẽ kéo dài đến cuối năm. Giá trung bình sản phẩm máy chủ tăng 27% so với cùng kỳ, lượng xuất xưởng lại giảm 5%; Intel cho rằng nguyên nhân tăng giá do tỷ lệ sản phẩm cao cấp tăng, chiến lược định giá theo nhu cầu và chi phí gia tăng.


Doanh thu mảng trung tâm dữ liệu của AMD cùng kỳ đạt 5,8 tỷ USD, tăng 57% so với năm trước, tăng trưởng đồng thời đến từ CPU EPYC máy chủ và GPU Instinct. AMD không công bố tốc độ tăng trưởng riêng của CPU máy chủ nên chưa thể kết luận mức tăng 57% này hoàn toàn do nhu cầu của agent.


Dự báo của công ty về tương lai còn mạnh mẽ hơn. Trước đó AMD dự đoán thị trường CPU máy chủ tăng trưởng bình quân 18%/năm; đến tháng 5/2026 lại nâng dự báo lên trên 35%, dự kiến quy mô thị trường vượt mức 120 tỷ USD vào năm 2030.Lý do phía AMD đưa ra là agent cần một tầng tính toán CPU độc lập để đảm trách điều phối, xử lý dữ liệu, thực hiện công cụ và kiểm tra an ninh.


Trước đây, trong data center thường dùng một CPU để quản lý 4–8 GPU. AMD nhận thấy hệ thống agent đang thúc đẩy tỷ lệ này về gần 1:1, thậm chí nhiều CPU hơn đối với một số tải. Nhận định này dựa trên nhu cầu khách hàng, cấu hình thực tế sẽ thay đổi tùy theo công việc. Tuy nhiên, xu hướng rất rõ: Tăng thêm vài CPU không còn đủ, các hãng cloud bắt đầu xây dựng riêng các rack CPU cho agent.


Arm cũng lần đầu tiên chuyển từ bán thiết kế vi xử lý sang bán CPU data center trực tiếp vào tháng 3/2026. Dòng sản phẩm AGI của họ sở hữu tối đa 136 nhân, được phát triển cùng với Meta. Arm dự đoán, với cùng mức tiêu thụ điện, dung lượng CPU cần cho data center agent có thể gấp 4 lần so với data center truyền thống.


Qualcomm sau đó đã ra mắt Dragonfly C1000 với hơn 250 nhân, đồng thời ký hợp tác cung cấp nhiều thế hệ CPU máy chủ với Meta. Intel, AMD, Arm, Qualcomm và Nvidia trong vài tháng đã đều bổ sung “CPU cho agent” vào lộ trình sản phẩm, cho thấy cuộc cạnh tranh này đã vượt khỏi thị trường x86 truyền thống, mở rộng sang server Arm, nhân tự phát triển và thiết kế trọn rack.


Nvidia giữ một vị trí đặc biệt trong trường hợp này. Họ vừa bán GPU gây áp lực cho CPU, lại vừa bán Vera để giảm tải cho CPU; từ vi xử lý, mạng đến lưu trữ, toàn bộ thiết bị có thể do Nvidia cung cấp.Vera do đó không chỉ là mở rộng dòng sản phẩm, mà còn nhằm bảo vệ tỷ lệ sử dụng GPU. Mỗi giây GPU giảm chờ đợi có thể chuyển thành nhiều token hơn và tăng thu nhập rack máy chủ.


Tuy nhiên, khi các hãng chip chạy theo tiền thì cuối cùng vẫn là người tiêu dùng phải chịu. Giống GPU, chip lưu trữ, biến động nguồn cung lần này khả năng cao lại là do chúng ta gánh.


Intel đã thừa nhận trong cuộc họp báo cáo tài chính Q4/2025 rằng công ty đang chuyển hướng nguồn wafer nội bộ tối đa cho data center, đồng thời thuê thêm gia công cho sản phẩm khách hàng; ban lãnh đạo bổ sung là Intel sẽ không thể rời bỏ hoàn toàn thị trường khách hàng. Đến Q1/2026, giá trung bình CPU khách hàng Intel tăng 16% so với cùng kỳ, nhưng doanh số lại giảm 13%, công ty dự đoán hạn chế cung ứng ít nhất kéo dài đến hết nửa đầu năm.


Biến động của sản phẩm khách hàng không thể đổ hết cho agent. Bản thân Intel cũng chuyển đổi quy trình, thay đổi năng lực nội-ngoại bộ và nguồn cung RAM đều ảnh hưởng đến giá xuất xưởng. Tuy nhiên, với năng lực hạn chế, chip máy chủ lõi nhiều, giá bán cao, nhà cung cấp cloud lại sẵn sàng ký hợp đồng dài hạn, tài nguyên sản xuất sẽ được ưu tiên cho data center.


Ba năm trở lại đây, người dùng bình thường đã quen với chuyện GPU tăng giá và khan hàng. Sắp tới, điều tương tự có thể xảy ra với CPU.


Vận hành/trình bày: Hà Thần Long


Lưu ý: Ảnh bìa/ảnh đầu được AI hỗ trợ tạo ra

0
0

Tuyên bố miễn trừ trách nhiệm: Mọi thông tin trong bài viết đều thể hiện quan điểm của tác giả và không liên quan đến nền tảng. Bài viết này không nhằm mục đích tham khảo để đưa ra quyết định đầu tư.

PoolX: Khóa để nhận token mới.
APR lên đến 12%. Luôn hoạt động, luôn nhận airdrop.
Khóa ngay!

Bạn cũng có thể thích

Quỹ phòng hộ vừa tái tạo vị thế mua ròng công nghệ, nhưng hỗ trợ quan trọng của Nasdaq đã bắt đầu suy yếu

Chỉ số Nasdaq 100 đang tiến sát vùng đáy của khu vực dao động trong nhiều tháng, hợp đồng tương lai đã phá vỡ đường xu hướng tăng và đường trung bình động 100 ngày, tín hiệu kỹ thuật yếu đi. Các quỹ phòng hộ trước đây đã mua vào mạnh nhóm cổ phiếu công nghệ, vị thế tập trung làm gia tăng rủi ro giảm giá. Tranh cãi về an toàn AI và rủi ro nguồn cung năng lượng trở thành hai nhân tố xúc tác đồng thời. Nếu ngưỡng hỗ trợ quan trọng bị phá vỡ mà tâm lý hoảng loạn trên thị trường vẫn thấp, biến động giá có khả năng bị đánh giá lại.

华尔街见闻2026/09/14 16:12

Lợi suất trái phiếu chính phủ Mỹ kỳ hạn 10 năm vượt 5%! "Nhà tiên tri" cảnh báo: Đợt bán tháo vẫn chưa kết thúc

Steven Barrow, trưởng phòng chiến lược G10 của Standard Bank, người đầu tiên dự đoán mức 5% vào tháng 2 năm nay, đã nâng dự báo lợi suất trái phiếu kho bạc Mỹ kỳ hạn 10 năm cuối năm lên 5,2% và dự kiến sẽ tăng lên 5,3% vào quý I năm 2027. Ông cho biết áp lực chuỗi cung ứng, biến đổi khí hậu cùng với chính sách nhập cư của Mỹ đang giới hạn nguồn cung lao động mạnh mẽ hơn trước đây. Chỉ số đô la Mỹ có mức tăng trong ngày cao nhất lên tới 0,6%, hứa hẹn ghi nhận mức tăng tốt nhất trong một ngày kể từ ngày 17 tháng 6.

华尔街见闻2026/09/14 15:46

Tiến lên ngược dòng trong cơn bão "AI chậm lại"? Có thông tin Kioxia dự kiến niêm yết tại Mỹ, huy động ít nhất 10 tỷ USD

Theo báo cáo, Kioxia đang cân nhắc huy động 10 tỷ USD thông qua việc niêm yết tại Mỹ.

智通财经2026/09/14 13:56
Tiến lên ngược dòng trong cơn bão "AI chậm lại"? Có thông tin Kioxia dự kiến niêm yết tại Mỹ, huy động ít nhất 10 tỷ USD

Xây dựng năng lực AI chuyển từ “thiếu điện” sang “thiếu nhân lực”: Sự trỗi dậy của mô-đun hóa, Schneider, Vertiv, Eaton đón cơ hội mới

Gần đây, Bernstein đã công bố báo cáo nghiên cứu, trong bối cảnh việc xây dựng năng lực AI đang mở rộng nhanh chóng, những mâu thuẫn chính hạn chế sự phát triển của các trung tâm dữ liệu đang dần chuyển đổi.

智通财经2026/09/14 13:46
Xây dựng năng lực AI chuyển từ “thiếu điện” sang “thiếu nhân lực”: Sự trỗi dậy của mô-đun hóa, Schneider, Vertiv, Eaton đón cơ hội mới