News

OpenAI aggiorna la API: GPT-Realtime-2 e voce in tempo reale

OpenAI aggiorna la sua API con nuovi strumenti vocali per traduzione, trascrizione e conversazioni in tempo reale, puntando su app più evolute e versatili.

di Klav 3 minuti di lettura
OpenAI Privacy Filter foto editoriale

OpenAI ha aggiornato la sua API con una nuova generazione di funzioni vocali pensate per portare le conversazioni in tempo reale oltre il semplice scambio domanda-risposta. L’idea è offrire agli sviluppatori strumenti capaci di ascoltare, trascrivere, tradurre e reagire mentre il dialogo è ancora in corso.

Le novità puntano soprattutto ai sistemi di assistenza clienti, ma il campo d’uso è più ampio e tocca anche educazione, media, eventi e piattaforme per creator. In mezzo ci sono un nuovo modello vocale, una traduzione live con oltre 70 lingue in input e una trascrizione in tempo reale basata su speech-to-text.

OpenAI porta nella API una nuova voce per le conversazioni in tempo reale

Il pacchetto di novità entra nella Realtime API e segna un passaggio importante per le applicazioni vocali. OpenAI descrive questi modelli come un’evoluzione rispetto al classico schema ascolta-rispondi, perché possono gestire più azioni nello stesso flusso: ascoltare, ragionare, tradurre, trascrivere e intervenire mentre la conversazione prosegue.

Il modello principale è GPT-Realtime-2, pensato per simulare una voce più realistica e per gestire richieste più complesse grazie a un livello di ragionamento definito da OpenAI come di classe GPT-5. Per chi sviluppa prodotti vocali, il punto non è solo la qualità dell’audio, ma la capacità di mantenere il contesto e rispondere in modo più utile durante l’interazione.

GPT-Realtime-Translate e GPT-Realtime-Whisper allargano il ruolo della voce

Accanto al nuovo modello vocale arrivano due funzioni distinte. GPT-Realtime-Translate è pensato per la traduzione istantanea e segue il ritmo dell’utente in modo conversazionale, senza spezzare il flusso del parlato. Il sistema comprende più di 70 lingue in input e può restituire il risultato in 13 lingue di output.

GPT-Realtime-Whisper aggiunge invece la trascrizione live, trasformando la voce in testo mentre l’interazione è in corso. È una funzione che può pesare molto in scenari come call center, riunioni, eventi o servizi digitali in cui la parola detta deve diventare subito dato utilizzabile.

Le nuove funzioni vocali aprono casi d’uso più ampi ma anche nuovi rischi

OpenAI vede applicazioni oltre il supporto clienti, con possibili usi in educazione, media e piattaforme per creator. Il motivo è semplice: quando un sistema vocale sa capire, tradurre e trascrivere in tempo reale, può diventare parte attiva del lavoro e non solo un canale di contatto.

Resta però il tema dell’abuso. L’azienda dice di aver inserito protezioni per bloccare spam, frodi e altri usi dannosi, con trigger in grado di interrompere le conversazioni se vengono rilevate violazioni delle linee guida sui contenuti nocivi. In pratica, la stessa flessibilità che rende questi strumenti interessanti li rende anche più delicati da controllare.

Le nuove funzioni sono incluse nella Realtime API con modelli a consumo

I nuovi modelli vocali sono disponibili all’interno della Realtime API. GPT-Realtime-Translate e GPT-Realtime-Whisper vengono fatturati al minuto, mentre GPT-Realtime-2 segue una logica di consumo basata sui token.

Per gli sviluppatori, questo significa poter scegliere tra funzioni diverse in base al tipo di prodotto da costruire, dal supporto in tempo reale agli strumenti di trascrizione e traduzione. Il punto di svolta, più che nella singola funzione, sta nella possibilità di combinare più livelli di intelligenza vocale nella stessa esperienza.

Leave A Reply