OpenAI objavio prve rezultate za Jalapeño sistem za inferenciju

OpenAI je na konferenciji Hot Chips objavio prve rezultate testiranja sistema Jalapeño, razvijenog u bliskoj saradnji sa Broadcomom. Na Semianalysis InferenceX benchmarku Jalapeño je zabeležio više tokena po korisniku i veći protok po kilovatu od trenutno dostupnih procesora za AI inferenciju, uključujući Nvidia Blackwell sistem sa kojim je poređen.
Fokus na propusnosti i niskoj latenciji
Richard Ho, šef hardvera u kompaniji OpenAI, ocenio je da rezultati pokazuju značajan napredak u odnosu na postojeće stanje tehnologije. Njegova ključna tvrdnja jeste da Jalapeño može da obradi više AI posla po jedinici energije, uz brže vraćanje odgovora.
To su dve metrike koje su važne za rad AI usluga u velikom obimu. Visoka propusnost određuje koliko zahteva sistem može da obradi, dok niska latencija utiče na brzinu odgovora koju korisnik vidi tokom interakcije sa modelom.
Poređenje je ipak vezano za Nvidia Blackwell sistem koji je trenutno dostupan. OpenAI očekuje prvo, veoma ograničeno postavljanje Jalapeña krajem 2026. godine, dok bi značajnije uvođenje trebalo da usledi tokom 2027. Do tada će se menjati i konkurentska ponuda procesora za inferenciju.
Optimizacija memorije, mreže i faza inferencije
Jalapeño je zamišljen kao višegeneracijska platforma u kojoj se AI proizvodi, modeli, čipovi i memorija razvijaju usklađeno. OpenAI navodi da je takav pristup omogućio ciljanu optimizaciju delova inferencijskog procesa koji često stvaraju uska grla.
Poseban naglasak je na prefill fazi i komunikaciji. Kompanija je sistem projektovala da smanji pomeranje podataka i komunikaciona kašnjenja, tako što se stanje modela može eksplicitno smestiti i zadržati lokalno. To obuhvata i KV keš koji se koristi tokom generisanja odgovora, dok sistem za svaku fazu aktivira odgovarajuću kombinaciju računarskih resursa, memorije i umrežavanja.
Širi tehnološki kontekst opisuje akcelerator za LLM inferenciju usmeren na energetsku efikasnost i skaliranje usluga kao akcelerator za LLM inferenciju usmeren na energetsku efikasnost i skaliranje usluga.
Šta rezultati znače za poslovnu infrastrukturu
Objavljeni benchmarki još ne predstavljaju dokaz performansi u svim produkcionim okruženjima, ali jasno pokazuju smer dizajna: smanjenje kašnjenja i potrošnje tokom inferencije. Za kompanije koje planiraju AI kapacitete, relevantni kriterijumi ostaju propusnost po korisniku, energetska efikasnost, ponašanje memorije i mreže, kao i rok stvarne dostupnosti sistema. Jalapeño će zato biti potrebno procenjivati uz aktuelne alternative onda kada njegovo šire postavljanje počne 2027. godine.

