In occasione di Semicon Taiwan 2026, Google ha sottolineato il crescente “memory wall” che il calcolo AI deve affrontare.
Il Commercial Times riporta che Nikhil Cherian – Senior Director of Supply Chain Infrastrutture presso Google Cloud – ha affermato che l’ascesa delle architetture multimodali e “mixture-of-experts” (MoE) sta spostando l’elaborazione AI da un modello compute-bound a uno memory-bound, così la memoria ad alte prestazioni ora rappresenta oltre il 75% del costo della distinta base hardware di un server AI.
Cherian ha spiegato che il rapido sviluppo dei modelli linguistici di grandi dimensioni e dei flussi di lavoro degli agenti di AI sta spingendo la gerarchia della memoria al limite delle sue capacità fisiche in termini di capacità, larghezza di banda, latenza e consumo energetico.
L’approccio di Google contro il “memory wall”
Per affrontare questi colli di bottiglia, Google sta adottando un approccio hardware differenziato, con la TPU 8i orientata all’inferenza a bassa latenza e la TPU 8t progettata per l’addestramento su scala ultra-ampia.
- Dal punto di vista hardware, il rapporto evidenzia che la TPU 8i, incentrata sull’inferenza, dispone di 288 GB di memoria ad alta larghezza di banda (Hbm) e triplica la capacità della Sram integrata nel chip portandola a 384 MiB, consentendo agli stati conversazionali dinamici e alla cache chiave-valore (KV) di rimanere sul chip per una latenza fuori chip pari a zero.
- La TPU 8t, invece, orientata all’addestramento, collega 9.600 chip in un enorme cluster di calcolo con un pool Hbm condiviso fino a 2 PB, riducendo i colli di bottiglia nel trasferimento dei dati fuori chip. Incorpora inoltre la tecnologia Tpu Direct Storage per contribuire a mantenere un elevato utilizzo dell’acceleratore.
TurboQuant, il nuovo algoritmo Google
Sul fronte del software e della sostenibilità, Google ha sviluppato TurboQuant, un algoritmo di quantizzazione senza perdita di dati e senza necessità di addestramento che comprime la cache KV dei modelli di grandi dimensioni da 32 bit a 3 bit. L’approccio riduce l’utilizzo della memoria di 6 volte senza compromettere la precisione, accelerando al contempo il calcolo dell’attenzione di 8 volte.
Per quanto riguarda il suo potenziale impatto sul mercato della memoria, un rapporto di marzo dell’Economic Daily News sottolinea che TurboQuant comprime principalmente la cache KV durante l’inferenza dell’AI e non influisce sull’Hbm utilizzata per l’addestramento dei modelli e l’archiviazione dei pesi, né sulla domanda di archiviazione a lungo termine. Il suo impatto sulla memoria in senso lato dovrebbe quindi essere limitato.
Tuttavia, riducendo i costi di elaborazione, TurboQuant potrebbe contribuire ad accelerare l’adozione dell’AI e stimolare una maggiore domanda di dispositivi finali e di edge computing.
Le prospettive future
La memoria sta assumendo una quota crescente della spesa per le infrastrutture di AI. TrendForce prevede che la Dram e la Nand Flash insieme rappresenteranno il 47% del CapEx totale dei Cps nel 2026, con la quota che salirà al 68% nel 2027, trainata dall’aumento dei prezzi contrattuali della memoria e da una maggiore domanda di bit.
Inoltre, si prospetta che i prezzi contrattuali delle Dram per server registreranno un’impennata di circa il 270% nel 2026, mentre i prezzi degli Ssd aziendali dovrebbero aumentare di circa il 235%.


















