La strategia di Google contro il memory wall

La memoria ad alte prestazioni rappresenta oltre il 75% del costo della distinta base hardware di un server AI: la soluzione di Google contro il memory wall

12
memorie

In occasione di Semicon Taiwan 2026, Google ha sottolineato il crescente “memory wall” che il calcolo AI deve affrontare.

Il Commercial Times riporta che Nikhil Cherian – Senior Director of Supply Chain Infrastrutture presso Google Cloud – ha affermato che l’ascesa delle architetture multimodali e “mixture-of-experts” (MoE) sta spostando l’elaborazione AI da un modello compute-bound a uno memory-bound, così la memoria ad alte prestazioni ora rappresenta oltre il 75% del costo della distinta base hardware di un server AI.

Cherian ha spiegato che il rapido sviluppo dei modelli linguistici di grandi dimensioni e dei flussi di lavoro degli agenti di AI sta spingendo la gerarchia della memoria al limite delle sue capacità fisiche in termini di capacità, larghezza di banda, latenza e consumo energetico.

L’approccio di Google contro il “memory wall”

Per affrontare questi colli di bottiglia, Google sta adottando un approccio hardware differenziato, con la TPU 8i orientata all’inferenza a bassa latenza e la TPU 8t progettata per l’addestramento su scala ultra-ampia.

  • Dal punto di vista hardware, il rapporto evidenzia che la TPU 8i, incentrata sull’inferenza, dispone di 288 GB di memoria ad alta larghezza di banda (Hbm) e triplica la capacità della Sram integrata nel chip portandola a 384 MiB, consentendo agli stati conversazionali dinamici e alla cache chiave-valore (KV) di rimanere sul chip per una latenza fuori chip pari a zero.
  • La TPU 8t, invece, orientata all’addestramento, collega 9.600 chip in un enorme cluster di calcolo con un pool Hbm condiviso fino a 2 PB, riducendo i colli di bottiglia nel trasferimento dei dati fuori chip. Incorpora inoltre la tecnologia Tpu Direct Storage per contribuire a mantenere un elevato utilizzo dell’acceleratore.

TurboQuant, il nuovo algoritmo Google

Sul fronte del software e della sostenibilità, Google ha sviluppato TurboQuant, un algoritmo di quantizzazione senza perdita di dati e senza necessità di addestramento che comprime la cache KV dei modelli di grandi dimensioni da 32 bit a 3 bit. L’approccio riduce l’utilizzo della memoria di 6 volte senza compromettere la precisione, accelerando al contempo il calcolo dell’attenzione di 8 volte.

Per quanto riguarda il suo potenziale impatto sul mercato della memoria, un rapporto di marzo dell’Economic Daily News sottolinea che TurboQuant comprime principalmente la cache KV durante l’inferenza dell’AI e non influisce sull’Hbm utilizzata per l’addestramento dei modelli e l’archiviazione dei pesi, né sulla domanda di archiviazione a lungo termine. Il suo impatto sulla memoria in senso lato dovrebbe quindi essere limitato.

Tuttavia, riducendo i costi di elaborazione, TurboQuant potrebbe contribuire ad accelerare l’adozione dell’AI e stimolare una maggiore domanda di dispositivi finali e di edge computing.

Le prospettive future

La memoria sta assumendo una quota crescente della spesa per le infrastrutture di AI. TrendForce prevede che la Dram e la Nand Flash insieme rappresenteranno il 47% del CapEx totale dei Cps nel 2026, con la quota che salirà al 68% nel 2027, trainata dall’aumento dei prezzi contrattuali della memoria e da una maggiore domanda di bit.

Inoltre, si prospetta che i prezzi contrattuali delle Dram per server registreranno un’impennata di circa il 270% nel 2026, mentre i prezzi degli Ssd aziendali dovrebbero aumentare di circa il 235%.

Articolo precedenteLe apparecchiature per semiconduttori crescono del 23%
Articolo successivoA IES 2026 una tavola rotonda sulla New Space Economy
La Redazione
La Redazione di Elettronica AV è diretta da Laura Reggiani. Ne fanno parte Virna Bottarelli, Cecilia Chiappani, Giorgia Andrei, Cleopatra Gatti e Greta Gironi, supportate da diversi collaboratori tra cui Alan Friedman, Ron Bishop, Marco Mezger e Jordi Tarrida.

LASCIA UN COMMENTO

Per favore inserisci il tuo commento!
Per favore inserisci il tuo nome qui