Bitget App
Trade smarter
Acquista CryptoMercatiTradingPerpsStocksEarnAziendaIA e altro
Morgan Stanley: La carenza di memoria per l’AI durerà per anni; tre percorsi principali di soluzione; opportunità strutturali per lo storage e la potenza di calcolo eterogenea

Morgan Stanley: La carenza di memoria per l’AI durerà per anni; tre percorsi principali di soluzione; opportunità strutturali per lo storage e la potenza di calcolo eterogenea

智通财经智通财经2026/10/05 14:12
Mostra l'originale
Per:智通财经

Morgan Stanley ha pubblicato un rapporto sul settore dei semiconduttori, sottolineando che la carenza di memoria DRAM persisterà durante tutto il ciclo attuale dell’industria AI, mentre l’espansione della capacità di calcolo AI non aspetterà la costruzione e l’entrata in funzione di nuove fabbriche di wafer.

Secondo quanto riportato da Zhitong Caijing APP, Morgan Stanley ha pubblicato un report sul settore dei semiconduttori in cui evidenzia che la carenza di memoria DRAM persisterà durante tutto questo ciclo industriale dell'AI, mentre l’espansione della potenza di calcolo dell’AI non aspetterà la costruzione e la produzione di nuove fabbriche di wafer. Il settore sta aggirando il collo di bottiglia della memoria attraverso tre principali percorsi tecnologici: riduzione delle specifiche hardware, disaccoppiamento dell’architettura di inferenza e la poolizzazione della memoria tramite CXL. In un contesto di offerta limitata, la costruzione delle capacità di calcolo continua ad avanzare. L’istituto rimane ottimista su leader nello storage come Micron (MU.US) e SanDisk (SNDK.US), ed è positivo sulle opportunità incrementali offerte dai settori dell’interconnessione CXL e dell’inferenza eterogenea, raccomandando Astera Labs (ALAB.US), Marvell (MRVL.US), Cerebras (CBRS.US) e Nvidia (NVDA.US).

Morgan Stanley sottolinea che la carenza attuale di memoria AI non è una perturbazione temporanea, ma uno squilibrio strutturale in cui la crescita delle prestazioni di calcolo supera di gran lunga la velocità di crescita dell’offerta di memoria. La scala dei modelli avanzati raddoppia ogni sei mesi, le finestre di contesto dei modelli principali crescono annualmente del 5-6 volte e, con la crescente domanda di inferenza concorrente, la richiesta di capacità e banda di memoria continua a esplodere. Tuttavia, il ciclo di costruzione di una fabbrica di wafer DRAM può durare anni, la flessibilità dell’offerta è estremamente bassa, e la situazione di carenza durerà diversi anni. Anche il CEO di Nvidia, Jensen Huang, ha dichiarato pubblicamente che l’industria deve cambiare approccio e affrontare il vincolo della memoria tramite innovazioni architetturali, invece di attendere semplicemente un’espansione della capacità produttiva.

Per affrontare le tensioni nell’offerta di HBM e memoria principale, il modo più diretto per il settore è la riduzione selettiva delle specifiche di memoria per singolo dispositivo ("De-speccing"). Prendendo come esempio l’architettura Rubin di Nvidia, la capacità LPDDR5 per singolo rack è stata ridotta da 54 TB pianificati a 28 TB, mentre la capacità HBM per singolo GPU è stata abbassata da 288 GB a 192 GB, assicurando così la quantità di unità consegnate riducendo l’altezza degli stack di memoria. Morgan Stanley sottolinea che la riduzione delle specifiche non elimina il collo di bottiglia della memoria, bensì trasferisce la pressione tra i diversi livelli di memoria: il taglio della memoria locale ad alta velocità porta i dati non ad alta frequenza come i KV cache a spostarsi verso lo storage NAND e aumenta lo scambio di dati cross-GPU, stimolando la domanda di banda di rete di interconnessione; in sostanza, si compensa la scarsità di memoria ad alta banda con risorse di rete più rapide e di archiviazione a costi inferiori.

Il secondo percorso per risolvere il problema è il disaccoppiamento dell’architettura di inferenza (Disaggregation). L’inferenza AI include due fasi molto diverse: il Prefill, che consuma principalmente potenza di calcolo, e il Decode, che dipende fortemente dalla banda di memoria. L’architettura tradizionale usa lo stesso acceleratore per entrambe le attività, portando a una bassa efficienza nell’uso delle risorse. Attualmente il settore sta accelerando verso un’inferenza eterogenea, separando le due fasi su hardware differenti: il Prefill intensivo di calcolo affidato a GPU generiche, mentre il Decode, che richiede grande larghezza di banda di memoria, viene gestito da chip acceleratori specializzati dotati di ampie SRAM on-chip.

Esempi tipici includono il motore a livello di wafer di Cerebras e l’architettura Groq LPU acquisita da Nvidia, entrambe in grado di offrire durante la fase di Decode un’efficienza di banda di memoria ben superiore a quella delle GPU tradizionali. Morgan Stanley ritiene che l’inferenza eterogenea diventerà una delle principali direzioni evolutive delle infrastrutture AI e che i fornitori di potenza di calcolo specializzati nella fase di Decode acquisiranno un chiaro mercato incrementale.

Il terzo percorso consiste nella ricostruzione del sistema di memoria tramite la tecnologia CXL. CXL (Compute Express Link) permette di espandere, condividere e poolare la memoria tramite interconnessioni ad alta velocità, consentendo alla memoria di non essere più vincolata a un singolo processore e diventando così un percorso tecnologico chiave per superare il limite della capacità di memoria. Secondo le stime di Morgan Stanley, la domanda di AI porterà il mercato di CXL e dei relativi chip di memoria aggiuntiva a raggiungere circa 6 miliardi di dollari entro il 2030, ben oltre la dimensione del tradizionale mercato di espansione di memoria per CPU. Il suo valore principale risiede nella costruzione di un’architettura di memoria gerarchica: i dati a più alta frequenza restano in HBM, quelli di frequenza intermedia nel pool di memoria CXL e i dati a bassa frequenza in NAND, abbinando così il costo all’intensità di accesso ai dati.

Per quanto riguarda le linee guida di investimento, Morgan Stanley ribadisce tre direzioni principali: la prima è continuare a sovrappesare Micron e SanDisk, la riduzione delle specifiche è causata dalla carenza d’offerta e non dal calo della domanda, la domanda di memoria AI è in aumento nel lungo termine e il gap di offerta continuerà a essere assorbito dalla capacità produttiva; la seconda è investire nei leader dell’interconnessione CXL e scale-up, ovvero Astera Labs e Marvell; la terza è monitorare i beneficiari dell’inferenza eterogenea come Cerebras e Nvidia, che sta perfezionando il proprio posizionamento nel settore attraverso l’acquisizione di Groq.

Avvertenze sui rischi: la crescita della domanda di potenza AI inferiore alle attese; il progresso della tecnologia CXL più lento del previsto; l’espansione della capacità di memoria superiore alle stime.

0
0

Esclusione di responsabilità: il contenuto di questo articolo riflette esclusivamente l’opinione dell’autore e non rappresenta in alcun modo la piattaforma. Questo articolo non deve essere utilizzato come riferimento per prendere decisioni di investimento.

PoolX: Blocca per guadagnare
Almeno il 12% di APR. Sempre disponibile, ottieni sempre un airdrop.
Blocca ora!

Ti potrebbe interessare anche

Quasi la metà dei sistemi di sicurezza degli endpoint aziendali deve ancora essere aggiornata! CrowdStrike (CRWD.US) punta all'espansione della quota di mercato; BNP Paribas afferma che gli obiettivi di crescita a lungo termine potrebbero essere troppo conservativi.

La società di sicurezza informatica CrowdStrike ritiene che, con l’eliminazione graduale dei sistemi di sicurezza tradizionali da parte delle aziende, la società abbia ancora ampi margini di crescita nel mercato della rilevazione e risposta agli endpoint.

智通财经•2026/10/05 14:58

L'attività del settore dei servizi negli Stati Uniti cresce al ritmo più veloce degli ultimi cinque anni! Il PMI di settembre sale a 58,8, con una domanda robusta che riaccende le pressioni inflazionistiche.

Le attività del settore dei servizi negli Stati Uniti hanno registrato una notevole accelerazione a settembre: l'indice PMI dell'attività commerciale nei servizi è salito da 56,5 ad agosto a 58,8, segnando il quarto mese consecutivo di crescita e il sesto mese consecutivo in area di espansione, raggiungendo il ritmo di crescita più rapido dal luglio 2021.

智通财经•2026/10/05 14:40

Morgan Stanley: il deficit di energia dei data center negli Stati Uniti raggiunge il 34%, i principali produttori di chip sono temporaneamente immuni, mentre le fasi a valle subiscono pressioni

Tuttavia, il rapporto sottolinea che Nvidia e Broadcom, grazie alla loro presenza globale, a una maggiore produttività energetica per unità e a una chiara visibilità sulla catena di approvvigionamento, non sono attualmente influenzate dai vincoli sull'energia per la guidance delle prestazioni fino al 2027. I segmenti downstream come ASIC, storage, moduli ottici e dispositivi analogici affronteranno un rischio maggiore di volatilità nella domanda.

智通财经•2026/10/05 13:36