專注于工業(yè)領(lǐng)域,不斷創(chuàng)新,為客戶提供更加專業(yè)、優(yōu)質(zhì)、先進(jìn)的產(chǎn)品和服務(wù)
【okooo澳客官網(wǎng)科技消息】7月29日,OpenAI Developers官方宣布在API中推出兩款語音轉(zhuǎn)錄模型。其中,GPT-Live-Transcribe面向低延遲實(shí)時(shí)轉(zhuǎn)錄場景,GPT-Transcribe則針對已完成音頻文件的異步轉(zhuǎn)錄及批量處理任務(wù)進(jìn)行優(yōu)化。
OpenAI
OpenAI表示,兩款模型進(jìn)一步提升了上下文理解能力,在不同語言、口音及復(fù)雜真實(shí)環(huán)境中能夠提供更準(zhǔn)確的轉(zhuǎn)錄結(jié)果,尤其改善了短語、數(shù)字、專業(yè)術(shù)語以及強(qiáng)背景噪聲下的識別表現(xiàn)。開發(fā)者還可以向模型提供錄音內(nèi)容簡介、姓名及領(lǐng)域術(shù)語關(guān)鍵詞、預(yù)期語言和前序轉(zhuǎn)錄內(nèi)容,以提高識別準(zhǔn)確率。

測試數(shù)據(jù)顯示,在OpenAI新建立的上下文感知自動(dòng)語音識別評測中,GPT-Live-Transcribe的語義準(zhǔn)確率在未提供自由形式上下文時(shí)為38.5%,加入上下文后提高至44.6%。在覆蓋22種語言的Common Voice測試中,其轉(zhuǎn)錄錯(cuò)誤率為19.70%,略低于GPT-Realtime-Whisper-1的20.33%;在九種語言的真實(shí)錄音測試中,兩者分別為9.60%和11.65%。
GPT-Transcribe同樣可以利用上下文提高表現(xiàn),其語義準(zhǔn)確率由41.6%升至45.2%。在Common Voice測試中,該模型的轉(zhuǎn)錄錯(cuò)誤率為19.27%,相比Whisper-1的40.37%明顯降低;真實(shí)錄音測試中的錯(cuò)誤率為8.98%,Whisper-1則為15.21%。
版權(quán)所有,未經(jīng)許可不得轉(zhuǎn)載
-okooo澳客官網(wǎng)