AMD e Cerebras stringono una partnership per l'inferenza AI

Jeremy Waterhouse / Pexels
In un importante e decisivo passo di integrazione hardware per il supercalcolo che promette di ridefinire profondamente i costi operativi dell'elaborazione di modelli linguistici massivi, il produttore di semiconduttori e processori grafici AMD e la rinomata sviluppatrice di silicio su wafer intero Cerebras Systems hanno annunciato ufficialmente oggi una partnership tecnica strategica di mercato. L'annuncio ufficiale di cooperazione è avvenuto durante l'evento Advancing AI 2026 tenutosi a San Francisco.
Architettura disaggregata per l'elaborazione dell'inferenza
Il pilastro centrale della cooperazione tecnologica tra i marchi del silicio consiste nello sviluppo congiunto di una nuova piattaforma di inferenza AI disaggregata (disaggregated AI inference). Il sistema di elaborazione unifica le prestazioni dei rack server AMD Helios con la capacità di memoria ad alta larghezza di banda dei processori Cerebras Wafer-Scale Engine (WSE), organizzando le fasi logiche di esecuzione dei prompt e la generazione delle risposte in tempo di inferenza.
In pratica, l'architettura innovativa suddivide i carichi di lavoro complessi di inferenza in due fasi fisiche separate di esecuzione rapida nei datacenter aziendali. Nella prima fase, l'elaborazione e la compressione iniziale dei prompt (fase di prefill) e la gestione di finestre di contesto dati enormi vengono indirizzate ai rack AMD Helios. Ciascuno di questi rack è equipaggiato internamente con settantadue GPU ad alte prestazioni MI455X per supportare il throughput.
Generazione di risposte veloci grazie al silicio su wafer intero
Nella seconda fase dell'operazione computazionale, la generazione massiva e ripetitiva di risposte parola per parola (fase di decoding), che richiede larghezza di banda di memoria estrema e bus veloci, viene elaborata immediatamente dal Cerebras Wafer-Scale Engine. Test operativi di modellazione condotti dai team tecnici a luglio 2026 utilizzando il modello Kimi 2.6 da un trilione di parametri hanno dimostrato un'efficienza energetica fino a cinque volte maggiore in termini di token per secondo per watt rispetto a una configurazione hardware isolata di Cerebras.
Competizione nel mercato delle infrastrutture e dei chip
La soluzione congiunta di silicio sarà resa disponibile commercialmente agli sviluppatori di intelligenza artificiale inizialmente sui server di Cerebras Cloud durante la seconda metà del 2026. L'infrastruttura risponde alla crescente domanda delle grandi aziende IT negli Stati Uniti e in Asia che cercano di ottimizzare la velocità degli assistenti logici locali senza aumentare i costi operativi di energia e elaborazione.
L'alleanza strategica hardware intensifica la competizione per la fornitura di server neurali su scala iper nel mercato IT internazionale. La cooperazione tecnica mira a offrire un'infrastruttura alternativa altamente efficiente ai marchi tecnologici, competendo con le soluzioni cloud e di silicio integrate di concorrenti e partner tradizionali del calcolo, come Microsoft, il motore di ricerca Google e i cluster neurali dello sviluppatore OpenAI. La capacità di suddividere i compiti ottimizza la scalabilità delle reti aziendali.
Switch di rete fisici veloci e connessioni stabili nei datacenter
Il movimento massivo di dati e l'attivazione di bus rapidi tra i rack GPU e i chip su wafer intero richiedono connessioni ottiche fisiche stabili e switch ad alta velocità. Il traffico dati e le connessioni locali dipendono da chip e router progettati da progettisti specializzati di rete fisica, come il produttore di semiconduttori di rete Broadcom. L'abbassamento dei prezzi degli switch di rete locali ottimizza l'elaborazione e riduce il consumo elettrico dei computer delle aziende partner nel mercato dell'energia pulita.
Questo contenuto è stato creato e revisionato dal nostro team (iatoskill.com), se riscontri problemi, contattaci


