Per un decennio, l’hardware è stato qualcosa che la maggior parte dei leader tecnologici poteva esternalizzare mentalmente. Hai scelto un cloud, hai ordinato più macchine, hai pagato il conto. Il livello fisico era l’astrazione, e l’astrazione è esattamente ciò che vuole un manager: non pensare al problema.
Quella pausa è finita. Il costo di gestione dell’intelligenza artificiale ha trasformato il tipo di chip in una decisione aziendale, con un impatto diretto su margine, latenza e dipendenza dai fornitori. La conversazione su GPU, NPU, ASIC e RISC-V ha lasciato l'ingegneria e ha raggiunto il comitato di prodotto, anche se parla ancora una lingua che pochi nel comitato capiscono.
Questo articolo traduce quella lingua. Non per poter progettare il silicio, ma per poter riconoscere quando una scelta hardware sta effettivamente fissando il limite per una strategia.
Perché l'hardware è tornato al centro
La breve spiegazione: il software è diventato affamato in un modo che i processori generici non riescono a tenere il passo.
I modelli di intelligenza artificiale eseguono un tipo di calcolo ripetitivo e massiccio, la moltiplicazione di matrici, in un volume che non si adatta comodamente a una comune CPU. Quando la natura del carico di lavoro cambia, l’hardware che era generico diventa un collo di bottiglia. E i colli di bottiglia hardware non possono essere risolti con un codice più intelligente, possono essere risolti con un chip diverso.
A ciò si aggiunge l’economia. I modelli di formazione e servizio consumano energia su una scala che appare nella fattura e nel bilancio di sostenibilità. Ogni watt risparmiato per query diventa margine quando lo moltiplichi per milioni di richieste. L’hardware non è più un costo fisso invisibile ed è diventato una leva di costo variabile, e tutto ciò che incide sui costi variabili diventa l’agenda di chi decide.
La conseguenza pratica: le aziende che trattano i chip come un bene intercambiabile pagano di più o consegnano più lentamente rispetto ai concorrenti che hanno scelto consapevolmente.
GPU: il cavallo di battaglia flessibile
La GPU (unità di elaborazione grafica) è nata per i giochi e il rendering e, per un felice caso, ha risolto il problema dell'intelligenza artificiale prima che l'intelligenza artificiale diventasse di moda. Fa molti calcoli in parallelo, che è esattamente ciò che richiede l'addestramento di una rete neurale.
La virtù della GPU è la flessibilità. Gestisce quasi tutti i carichi utili dell'intelligenza artificiale, dall'addestramento all'inferenza, dalla visione artificiale ai modelli linguistici. Se non sapete ancora quale sarà il vostro carico dominante, la GPU è la scommessa sicura perché commette pochi errori in ogni scenario.
Il costo di questa flessibilità si manifesta in due ambiti: prezzo ed energia. La GPU di fascia alta è costosa, combattuta e consuma molto. Paghi per la capacità generica anche quando il carico è specifico e prevedibile. Per il leader, la regola mentale è semplice: la GPU è quella che usi quando stai ancora imparando ciò che ti serve, o quando la varietà dei carichi giustifica la non specializzazione.
NPU: l'acceleratore che risiede sul dispositivo
La NPU (unità di elaborazione neurale) è un chip progettato per un compito ristretto: eseguire l'inferenza dell'intelligenza artificiale a basso consumo. Non addestra modelli giganti, esegue in modo efficiente modelli già pronti, ed è per questo che sta comparendo nei notebook e nei telefoni cellulari.
Il cambiamento consentito da NPU è l'inferenza locale. Invece di inviare tutti i dati dell’utente a un server, elaborarli e restituirli, parte del lavoro avviene sul dispositivo stesso. Ciò cambia tre cose che un manager comprende senza bisogno di un diagramma: latenza (risposta istantanea), privacy (i dati non viaggiano) e costi (non si paga il cloud per quella query).
La NPU è il motore dietro l'ondata di PC e app AI che si descrivono come NPU-first, progettati fin dall'inizio per funzionare sul dispositivo. Per quanto riguarda il prodotto, apre una categoria di funzionalità che in precedenza era troppo costosa o troppo lenta per esistere. Vale la pena approfondire l'intelligenza artificiale locale sul dispositivo, perché la decisione su dove avviene l'inferenza è strategica prima che tecnica.
ASIC: specializzarsi per guadagnare in costi ed energia
L'ASIC (circuito integrato specifico per l'applicazione) è l'opposto della GPU nella filosofia. Invece di essere utilizzato per qualsiasi cosa, è progettato per fare una cosa, e farlo con un'efficienza che nessun chip generico può raggiungere.
Lo scambio è diretto. Si rinuncia alla flessibilità e si ottengono costi per operazione e consumi energetici molto inferiori per il carico specifico servito dal chip. Per l’inferenza su larga scala, dove si esegue lo stesso tipo di modello miliardi di volte, questa specializzazione diventa un vantaggio economico che si accumula.
Il prezzo d’ingresso è alto. Progettare un ASIC è costoso e richiede molto tempo, e il chip nasce bloccato: se il suo carico cambia, il silicio non reggerà il passo. Ecco perché l'ASIC ha senso solo quando il volume è grande e il carico è stabile. La decisione spetta a chi sa già esattamente cosa verrà girato e in che misura.
RISC-V: architettura aperta proveniente dall'edge
RISC-V non è un chip, è una specifica di come il chip comunica con il software, un ISA (architettura del set di istruzioni). La differenza che conta: è aperto. Chiunque può utilizzarlo, modificarlo e produrlo senza pagare una licenza al proprietario.
Sembra un tecnicismo ed è, in effetti, una questione di potere. Le architetture chiuse concentrano la dipendenza da una manciata di fornitori che addebitano royalties e dettano la tabella di marcia. Un ISA aperto ridistribuisce questo controllo: riduce i costi di licenza, consente una profonda personalizzazione e dà sovranità a coloro che non vogliono essere tenuti in ostaggio da una catena che non controllano.
RISC-V avanza innanzitutto nell’edge e nell’IoT, dove i chip sono più semplici e la sensibilità ai costi è elevata. Lì basta la maturità. Nei carichi pesanti e generici l'ecosistema è ancora in formazione. Strumenti, supporto, software e maturità dell’ecosistema non possono essere acquistati volontariamente, ma vengono costruiti nel tempo.
Come il leader legge questa bacheca
La tentazione è quella di tifare per un vincitore. Il vero consiglio è quello della convivenza, e la responsabilità di chi decide è quella di abbinare il carico al chip giusto.
GPU per ciò che è ancora incerto o vario. NPU per l'inferenza sul dispositivo, vicino all'utente. ASIC per inferenza su larga scala con carico stabile. RISC-V per l'edge e per ridurre la dipendenza laddove la maturità lo consente già. Silicone personalizzato, quando si opera su una scala tale da giustificare la progettazione propria, argomento che merita un capitolo a parte.
La domanda giusta non è quale chip sia migliore. Dipende da quale sia il carico dominante, quanto sia stabile e quanto la latenza, la potenza e il vincolo del fornitore pesano sul tuo modello di business. La risposta a questa domanda sceglie il silicio e non il contrario. E il guadagno in efficienza energetica in IA di solito deriva più dalla scelta dell'hardware che da qualsiasi successiva ottimizzazione del codice.
Se sei alla guida della tecnologia e tratti ancora i chip come una linea infrastrutturale, vale la pena prendere questa decisione a un livello superiore. L’hardware è tornato ad essere strategia, e una strategia delegata dall’inerzia è una strategia perduta.
Leggi anche
- Chip specializzati e la fine dell'era delle CPU generiche
- PC AI e NPU: cosa cambia quando il dispositivo ottiene l'acceleratore AI
- Geopolitica del silicio: perché la guerra dei chip è importante per chi decide in merito alla tecnologia
- Chip di inferenza e ASIC: quando specializzato batte generico
- RISC-V all'edge e IoT: perché l'architettura aperta è importante
- Computazione neuromorfica e bio-ispirata: quando il chip inizia ad apprendere dal cervello
