Morgan Stanley: Ang kakulangan sa AI memory ay magtatagal ng ilang taon, tatlong pangunahing direksyon para solusyunan ito, at may estruktural na oportunidad sa storage at heterogenous computing power
Ang ulat ng industriya ng semiconductor na inilabas ng Morgan Stanley ay nagsasaad na ang kakulangan sa DRAM memory ay magpapatuloy sa kasalukuyang AI industry cycle, at ang pagpapalawak ng AI computing power ay hindi maghihintay sa pagpapatayo at operasyon ng bagong wafer factories.
Nalalaman mula sa APP ng Pananalaping Matalino na naglabas ang Morgan Stanley ng ulat ukol sa industriya ng semiconductor na nagsasaad na ang kakulangan ng DRAM memory ay magpapatuloy sa kasalukuyang cycle ng AI industry, at ang pagpapalawak ng AI computing power ay hindi maghihintay para maitayo at magsimulang mag-operate ang mga bagong wafer fab. Ang industriya ay kasalukuyang gumagamit ng tatlong pangunahing teknolohikal na ruta—hardware na may pinababang specs, disaggregation ng inference architecture, at CXL memory pooling—upang lampasan ang memory bottleneck at patuloy na itulak ang pagbuo ng computing power sa kabila ng limitasyon ng suplay. Patuloy na positibo ang pananaw ng Morgan Stanley sa mga nangungunang storage gaya ng Micron (MU.US) at SanDisk (SNDK.US), at nakikita rin ang karagdagang oportunidad sa track ng CXL interconnect at heterogeneous inference, kaya inirerekomenda ang Astera Labs (ALAB.US), Marvell (MRVL.US), Cerebras (CBRS.US), at Nvidia (NVDA.US).
Binigyang-diin ng Morgan Stanley na ang kasalukuyang kakulangan ng AI memory ay hindi pansamantalang abala, kundi isang structural na kontradiksyon kung saan ang pagtaas ng performance ng computing power ay malayo ang inangat kaysa sa bilis ng pagtaas ng memory supply. Ang laki ng mga advanced na modelo ay dumodoble bawat anim na buwan, at ang growth rate ng context window ng nangungunang mga modelo ay umaabot ng 5-6 beses kada taon. Kasabay ng tuloy-tuloy na pagtaas ng demand sa inference concurrency, patuloy na sumasabog ang pangangailangan sa kapasidad at bandwidth ng memory. Gayunpaman, ang cycle ng pagtatayo ng DRAM wafer fab ay umaabot ng maraming taon at napakababa ng supply elasticity, kaya’t ang kakulangan ay magpapatuloy sa maraming taon. Hayagang sinabi ni Nvidia CEO Jensen Huang na kinakailangan ng industriya ng pagbabago ng mindset, na dapat labanan ang memory constraint sa pamamagitan ng architectural innovation at hindi basta maghintay lamang sa pagpapalawak ng kapasidad.
Sa harap ng mahigpit na supply ng HBM at pangunahing memory, ang pinaka-direktang paraan ng industriya ay ang pagpili ng selective na pagbaba ng memory specs ng kada device (De-speccing). Halimbawa, sa Nvidia Rubin architecture, ang kapasidad ng on-board LPDDR5 ng isang device ay mula sa dating plano na 54TB naibaba sa 28TB, ang kapasidad ng HBM ng bawat GPU mula 288GB ay binaba sa 192GB, upang mapanatili ang kabuuang bilang ng shipment sa pamamagitan ng pagpapababa ng memory stack height. Pinunto ni Morgan Stanley na ang pagbaba ng specs ay hindi nag-aalis ng memory bottleneck kundi inililipat ang pressure sa pagitan ng memory layers: pagkatapos bawasan ang high-speed local memory, ang mga hindi high-frequency data gaya ng KV cache ay inililipat sa NAND storage, habang lumalakas ang inter-GPU data interaction na nagpapataas ng demand sa network interconnect bandwidth. Sa esensiya, ito ay pagpapalawak ng high-bandwidth memory gamit ang mas mabilis na network interconnect at mas murang storage resources.
Ang ikalawang paraan ng paglabas sa bottleneck ay ang inference architecture decoupling (Disaggregation). Binubuo ang AI inference ng dalawang magkaibang yugto: Prefill (malakas ang computing power consumption) at Decode (malubha ang pagdepende sa memory bandwidth). Noon, ginagamit ng tradisyunal na arkitektura ang iisang accelerator para sa parehong tasks, kaya mababa ang resource utilization. Sa kasalukuyan, mabilis na tinatahak ng industriya ang heterogeneous inference, pinaghihiwalay ang dalawang yugto sa magkaibang hardware: ang computation-intensive na Prefill ay handled ng general-purpose GPU, samantalang ang memory bandwidth-intensive na Decode ay sinasagawa ng specialized na acceleration chips na may malalaking on-chip SRAM.
Kasama sa mga tipikal na halimbawa ang wafer-scale engine ng Cerebras at ang Groq LPU architecture na binili ng Nvidia, na parehong kayang magbigay ng memory bandwidth efficiency na labis pa sa tradisyunal na GPU tuwing decode phase. Naniniwala ang Morgan Stanley na ang heterogeneous inference ay magiging mahalagang direksyon ng ebolusyon ng AI infrastructure, at ang mga computation power manufacturers na nakatutok sa decode phase ay makakakuha ng malinaw na karagdagang bahagi sa merkado.
Ang ikatlong ruta ay ang CXL technology na muling nag-oorganisa ng memory system. Ang CXL (Compute Express Link) ay nagbibigay-daan sa memory expansion, sharing, at pooling sa pamamagitan ng high-speed interconnection, kaya hindi na nakatali ang memory sa isang processor lamang, na nagiging pangunahing teknolohikal na paraan upang lampasan ang memory capacity constraints. Tinaya ng Morgan Stanley na sa taong 2030, dahil sa AI demand, aabot ang CXL at kaugnay na merkado ng memory attachment chips sa humigit-kumulang $6 bilyon, mas malaki kaysa sa tradisyunal na CPU memory expansion market. Ang pangunahing halaga rito ay ang pagtatayo ng tiered memory architecture: ang pinakamataas na frequency na data ay nilalagay sa HBM, kasunod ang data sa CXL memory pool, at ang mababang frequency/cold data naman sa NAND—ginagawan ng cost gradient na katapat ng data access frequency.
Para sa pangunahing linya ng pamumuhunan, muling pinagtibay ng Morgan Stanley ang tatlong direksyon: Una, patuloy na over-weight ang Micron at SanDisk, dahil ang pagbawas ng specs ay dulot ng kakulangan ng suplay hindi ng paghina ng demand; pangmatagalan ang pag-angat ng AI memory demand at ang kakulangan sa suplay ay patuloy na sisipsipin ang kapasidad. Ikalawa, mag-invest sa CXL at mga scale-up interconnect leaders gaya ng Astera Labs at Marvell. Ikatlo, bigyang pansin ang mga makikinabang sa heterogeneous inference gaya ng Cerebras, pati na ang Nvidia na pinahusay ang heterogeneous layout sa pamamagitan ng pag-acquire sa Groq.
Babala sa panganib: Ang pagtaas ng demand para sa AI computing power ay maaaring bumagal kaysa sa inaasahan; ang implementation ng CXL technology ay mas mabagal kaysa sa inaasahan; ang pagpapalawak ng kapasidad ng memory ay lumagpas sa inaasahan.
Disclaimer: Ang nilalaman ng artikulong ito ay sumasalamin lamang sa opinyon ng author at hindi kumakatawan sa platform sa anumang kapasidad. Ang artikulong ito ay hindi nilayon na magsilbi bilang isang sanggunian para sa paggawa ng mga desisyon sa investment.
Baka magustuhan mo rin
Halos kalahati ng mga endpoint security system ng mga negosyo ay kailangang i-upgrade pa! Tinututukan ng CrowdStrike (CRWD.US) ang pagpapalawak ng bahagi ng merkado; sabi ng BNP Paribas, maaaring maging konserbatibo ang pangmatagalang target ng paglago.
Naniniwala ang kumpanya ng cybersecurity na CrowdStrike na habang unti-unting inaalis ng mga negosyo ang tradisyonal na mga sistema ng seguridad, nananatili pa ring may malaking puwang para sa paglago ng bahagi ng kumpanya sa endpoint detection at response na merkado.
Ang aktibidad ng serbisyo sa Estados Unidos ay lumago sa pinakamabilis na antas sa higit limang taon! Umakyat ang PMI sa 58.8 noong Setyembre, muling tumaas ang presyon ng inflation sa gitna ng malakas na demand
Ang aktibidad ng sektor ng serbisyo sa Estados Unidos ay mabilis na lumago noong Setyembre, kung saan ang PMI Business Activity Index ng sektor ng serbisyo ay tumaas mula 56.5 noong Agosto hanggang 58.8, patuloy nang umakyat sa ika-apat na magkakasunod na buwan, at nasa expansion zone sa loob ng anim na magkakasunod na buwan. Ito ang pinakamabilis na bilis ng pagpapalawak mula noong Hulyo 2021.
Morgan Stanley: Ang kakulangan sa kuryente ng data center sa US ay umabot sa 34%, nangungunang chip manufacturer ay pansamantalang immune, ngunit ang mga downstream na bahagi ay nasa ilalim ng pressure
Gayunpaman, binigyang-diin ng ulat na ang Nvidia at Broadcom, dahil sa kanilang pandaigdigang layout, mas mataas na produksyon ng computing power kada yunit ng kuryente, at malinaw na pananaw sa upstream at downstream supply chain, hindi pa naapektuhan ng power constraints ang kanilang forecast ng performance sa 2027. Ang mga downstream kagaya ng ASIC, storage, optical modules, at analog devices ay haharap sa mas malaking panganib ng pagbabago sa demand.
