Tehnologie și știință19:10

GPT-Live-1 ajunge în API: OpenAI promite conversații vocale simultane și întreruperi mai naturale

OpenAI a lansat GPT-Live-1 pentru dezvoltatorii care construiesc aplicații vocale, cu dialog simultan, reacții mai bune la întreruperi și un tarif anunțat de 0,05 dolari pe minut.

Ilustrație editorială despre o conversație vocală simultană între un om și un sistem de inteligență artificială
Ilustrație editorială originală generată cu inteligență artificială pentru FONTES
Redacția FONTES 1 sursă directă consultată formulare originală

OpenAI a anunțat GPT-Live-1, un model disponibil în API pentru aplicații vocale care trebuie să poarte conversații în timp real. Elementul central al lansării este funcționarea full-duplex: sistemul poate asculta și vorbi simultan, în loc să trateze dialogul ca pe o succesiune rigidă de replici. Compania spune că această abordare permite răspunsuri mai naturale atunci când utilizatorul îl întrerupe, confirmă ceva din mers sau schimbă direcția conversației.

Modelul este prezentat ca un strat vocal care poate fi conectat la alte modele și instrumente. Într-o aplicație complexă, GPT-Live-1 poate gestiona conversația, iar sarcinile care cer raționament mai amplu ori acces la date pot fi delegate către alte componente. Potrivit OpenAI, dezvoltatorii pot controla tonul, ritmul și stilul răspunsurilor, iar sistemul a fost proiectat să se descurce mai bine cu zgomotul de fond, pauzele și sesiunile lungi.

OpenAI afirmă că GPT-Live-1 a obținut un avans de 30 de puncte față de GPT-Realtime-2.1 în evaluarea internă Full Duplex Bench. Rezultatul trebuie citit ca o măsurătoare publicată de compania care oferă produsul, nu ca o verificare independentă. În practică, diferența relevantă pentru utilizatori va depinde de integrare, de calitatea conexiunii, de microfon și de felul în care fiecare aplicație gestionează datele și accesul la instrumente.

Compania indică și scenarii de utilizare precum asistenți telefonici, programări, servicii pentru clienți sau interfețe vocale care trebuie să rămână active o perioadă mai lungă. Prețul anunțat pentru stratul vocal este de 0,05 dolari pe minut. Costul total al unei aplicații poate fi însă mai mare dacă aceasta folosește separat modele de raționament, instrumente externe, stocare ori infrastructură de telefonie.

Lansarea nu înseamnă că toate conversațiile automate vor deveni imediat indistincte de cele umane. Este o infrastructură oferită dezvoltatorilor, iar rezultatul final depinde de modul în care este construit serviciul. Pentru organizațiile care o folosesc rămân importante informarea clară a interlocutorului, protejarea datelor și stabilirea situațiilor în care un operator uman trebuie să preia conversația.

Notă editorială: Material realizat de Redacția FONTES pe baza surselor publice indicate. FONTES nu revendică informațiile, investigațiile sau relatările originale; ne asumăm selecția, verificarea, sinteza și formularea articolului.