VMTech
Razgovarajmo

Arhitektura GPT‑Live održava glasovni razgovor bez prekida

Arhitektura GPT‑Live održava glasovni razgovor bez prekida

OpenAI je za šest meseci izgradio novu arhitekturu za GPT‑Live, treću generaciju svog glasovnog sistema: model istovremeno sluša i govori, GPT‑5.5 preuzima dublje rezonovanje i rad sa alatima, dok WARP smanjuje pokretanje medijskog i podatkovnog toka sa šest mrežnih razmena na jednu.

Za razliku od ranijih sistema zasnovanih na smenama, GPT‑Live uklanja poseban detektor završetka korisnikovog iskaza iz audio-putanje. Zvuk ne čeka njegovu odluku, već neprekidno ulazi u model i vraća se korisniku, dok se zahtevniji poslovi izvršavaju asinhrono.

Brza putanja za zvuk

OpenAI je odvojio tok medija od aplikacione i poslovne logike. Pozivi alata, delegiranje i pozadinski servisi nalaze se iza asinhrone RPC granice, pa njihovo kašnjenje ne zaustavlja audio-frejmove. Medijski frontend i inferenciona logika napisani su u jeziku Go umesto u ranijoj implementaciji Python asyncio. Time je p95 glatkoće isporuke frejmova novog sistema dostigao p50 prethodnog.

WebRTC ostaje transportna osnova jer podnosi gubitak paketa, odstupanje časovnika i promene veze. WARP dodatno ubrzava uspostavljanje sesije: kombinuje DTLS rukovanje sa ICE procesom, koristi DTLS 1.3 i unapred ugovara SCTP i kanale podataka. Instant Connect istovremeno uklanja razmenu SDP parametara sa kritične putanje, pa klijent može da započne sesiju jednim UDP paketom.

Stanje razgovora bez zastoja

Duge sesije stalno uvećavaju kontekst, dok se instance modela uključuju i isključuju u skladu sa potražnjom. Pri prelasku sistem zagreva zamensku instancu, unapred je popunjava postojećim kontekstom, paralelno pokreće inferenciju i prebacuje razgovor tek kada je nova instanca spremna.

Isti postupak rešava sažimanje konteksta. Dok postojeća instanca nastavlja razgovor, sistem sažima istoriju i na drugoj instanci obnavlja stanje koje je promenom konteksta izgubilo važeći KV keš. Prebacivanje se zato obavlja bez prekida medijskog toka.

Delegiranje i pouzdana evidencija

GPT‑Live održava prirodan tok govora, a GPT‑5.5 u pozadini obavlja pretragu, rezonovanje ili pozive alata. Sesija za napredni model priprema se na početku razgovora, dobija početni kontekst i zadržava stabilnu vezu sa izvršnim resursom. Keširanje upita, granice izlaza i broj razmena između modela i alata podešeni su radi kraćeg čekanja na koristan rezultat.

Okolni sistemi i dalje zahtevaju zasebne poruke korisnika i asistenta. Server zato koristi delimične transkripte i vremenske signale, čuva promenljiv prikaz tekuće razmene i konačan zapis za analitiku. Kratke potvrde tokom korisnikovog govora ne moraju postati zasebna poruka, dok se sadržajna upadica može evidentirati.

Provera u stvarnom saobraćaju

Pre puštanja korisnicima, OpenAI je mali i postepeno rastući deo produkcionih ChatGPT Voice sesija paralelno usmeravao ka GPT‑Live sistemu u režimu samo za čitanje. Test je pokazao da kapacitet nije samo pitanje GPU propusnosti: procesorski rukovaoci tokovima, redovi i mrežne putanje moraju da izdrže broj istovremenih sesija i isporuče svaki frejm na vreme.

Duge sesije otkrile su pritisak na memoriju i trajno čuvanje stanja, ponovno povezivanje proverilo je sažimanje i obnovu, a prekidi klijenata razotkrili su trke pri gašenju. Zato su uvedeni preciznija telemetrija, etapno povećavanje saobraćaja, provera konfiguracija i brzo isključivanje pojedinačnih putanja.

Za procenu poslovne primene važno je povezati mogućnosti glasovnog sistema GPT‑Live u ChatGPT-u sa operativnim merilima kao što su broj održivih istovremenih sesija, regionalni kapacitet, vreme pokretanja i oporavak od greške. Glavni zaključak je da odziv glasovnog sistema zavisi od cele putanje, od klijenta i protokola do modela, alata i infrastrukture.

#voiceai#realtimeai#webrtc#openai
Otvorena analitika
Na sajtu 1 pregleda
min čitanja 4 05.08.2026
Instagram

Arhitektura GPT‑Live održava glasovni razgovor bez prekida

Otvorite objavu na Instagramu ↗