OpenAI presenta Jalapeño: il chip che rivoluziona l’inferenza AI
In Breve
- Cosa è Jalapeño?
- Jalapeño è un chip presentato da OpenAI per migliorare le prestazioni nell'inferenza delle intelligenze artificiali.
- Quando sarà disponibile Jalapeño?
- Il primo dispiegamento di Jalapeño è previsto entro la fine del 2026, con una distribuzione più ampia nel 2027.
- Quali sono i vantaggi di Jalapeño?
- Jalapeño offre un maggiore numero di token per utente e una migliore throughput per kilowatt rispetto ai chip attuali.
Durante la conferenza Hot Chips, OpenAI ha presentato Jalapeño, un chip innovativo progettato per ottimizzare le prestazioni nell’inferenza delle intelligenze artificiali. I primi risultati dei benchmark condotti su InferenceX di Semianalysis mostrano che Jalapeño offre un numero maggiore di token per utente e una maggiore throughput per kilowatt rispetto ai processori di inferenza attualmente considerati all’avanguardia.
Il confronto è stato effettuato con un sistema Nvidia Blackwell, ma OpenAI ha avvertito che la concorrenza potrebbe evolvere prima della piena distribuzione del prodotto. Jalapeño è stato sviluppato in collaborazione con Broadcom, integrando i modelli di OpenAI nel processo di progettazione. L’azienda prevede che questa piattaforma diventi multigenerazionale, coordinando chip, memoria e modelli per migliorare ulteriormente le prestazioni.
L’architettura di Jalapeño è stata progettata per ridurre i ritardi nelle fasi di prefill e comunicazione, che solitamente rappresentano colli di bottiglia durante l’inferenza. Come dichiarato nel comunicato aziendale, “We designed Jalapeño to minimize data movement and communication delays.” Questo approccio permette di allocare e mantenere localmente lo stato del modello, inclusa la KV cache utilizzata nella generazione delle risposte, mentre il sistema attiva la combinazione ottimale di calcolo, memoria e rete per ogni fase di inferenza.
Richard Ho, responsabile hardware di OpenAI, ha commentato: “The bottom line is that the results show a very, very significant performance advance over state of the art. Jalapeño can serve more AI work per unit of power, while also returning responses more quickly. It’s very efficient to serve a lot of customers, but it can also be very low latency.”
OpenAI prevede un primo dispiegamento di Jalapeño in volumi molto ridotti entro la fine del 2026, con una distribuzione più significativa programmata per il 2027. Questo sviluppo rappresenta un passo importante verso l’ottimizzazione delle tecnologie AI, promettendo prestazioni superiori e una maggiore efficienza energetica.
