OpenAI objavio prve rezultate čipa Jalapeño za AI inferenciju

OpenAI je objavio prve rezultate testiranja Jalapeña, svog prilagođenog čipa za AI inferenciju, na modelima GPT-OSS 120B, DeepSeek R1 670B i Kimi K2.5 1T. Kompanija navodi 1,5 do 1,9 puta više AI rada po vatu pri vršnom protoku, uz 1,7 do 3,6 puta nižu latenciju od uporednih sistema. Za izrazito interaktivna opterećenja prijavljena prednost performansi iznosi od 2,1 do 4,1 puta.
Rezultati su zasnovani na InferenceX-u, javnom benchmarku kompanije SemiAnalysis koji prati kompletan proces posluživanja AI zahteva. OpenAI je sistem poređivao u rasponu radnih režima, od velikog propusnog kapaciteta do niskolatentne, interaktivne upotrebe, uz usklađeno korisničko iskustvo.
Performanse po potrošnji, a ne samo po čipu
OpenAI kao merodavniji pokazatelj ističe količinu korisnog AI rada po jedinici snage, jer agenti često izvršavaju više uzastopnih koraka, pa se pojedinačna kašnjenja sabiraju tokom celog zadatka. Jalapeño je ocenjen na 700 W, dok je izmerena trajna potrošnja tokom testiranih opterećenja ostala na ili ispod 550 W.
Na modelu Kimi K2.5 1T, najvećem javnom modelu iz testova, Jalapeño je ostvario približno 1,5 puta veće vršne performanse po vatu i 3,4 puta nižu krajnju latenciju od uporednog sistema. U dodatku se za GPT-OSS 120B navodi 1,9 puta veći mešoviti broj tokena u sekundi po kilovatu, dok je za DeepSeek R1 670B prijavljena 3,6 puta niža krajnja latencija.
Arhitektura usmerena na tok podataka
Kompanija pripisuje rezultate zajedničkom projektovanju čipa, memorije, mreže, softvera i sistema na nivou rekova. Inferencija je podeljena na faze sa različitim uskim grlima: obrada početnog upita je računski intenzivna, dok je generisanje tokena više ograničeno propusnošću memorije.
Jalapeño je projektovan da smanji pomeranje podataka i kašnjenja u komunikaciji. Stanje modela, uključujući KV keš tokom generisanja odgovora, može eksplicitno da se postavi i zadrži lokalno, dok se za pojedinu fazu aktivira odgovarajuća kombinacija računarskih, memorijskih i mrežnih resursa. Kontekst koji je doveo do Jalapeño za energetski efikasnu LLM inferenciju pokazuje da je akcenat od početka bio na energetskoj efikasnosti i skaliranju LLM inferencije.
AI u razvoju hardvera i softvera
OpenAI navodi da je AI pomogla timu da od početnog dizajna do tapeouta stigne za devet meseci, kroz istraživanje implementacija i kraće cikluse projektovanja, merenja i verifikacije. Za programiranje sistema inženjeri opisuju rad lokalnim tenzorima, eksplicitnom komunikacijom i predvidivom sinhronizacijom.
Uz Codex i GPT-Astra, tri open-weight modela koja nisu bila u prvobitnom produkcionom planu dovedena su do visokih performansi za dva meseca. Za odabrane GPT-OSS blokove pažnje i mixture-of-experts arhitekture, implementacije koje je generisala AI radile su 1,5 do 1,8 puta brže od postojećih implementacija koje su napisali stručnjaci; OpenAI naglašava da se taj podatak odnosi na odabrane blokove, a ne na ceo model.
Plan primene
OpenAI planira početak uvođenja Jalapeña u sopstvenu računarsku infrastrukturu do kraja godine, uz nastavak proizvodne kvalifikacije, sazrevanje softvera i validaciju na dodatnim modelima. Kompanija istovremeno navodi da će nastaviti široku primenu akceleratora kompanije NVIDIA i drugih partnera za obuku i inferenciju. Za poslovanje, ovi rezultati naglašavaju potrebu da se AI infrastruktura procenjuje kroz odnos odziva, propusnosti i potrošnje pri stvarnim radnim opterećenjima.

