IT之家 3 月 5 日消息,今天晚間,據(jù) The Information 報道,OpenAI 正在開發(fā)一種新的語音模型,希望讓用戶與 ChatGPT 的對話更加自然。當用戶在 AI 說話過程中打斷系統(tǒng)時,AI 可以實時調(diào)整回應,而不是像現(xiàn)在一樣突然停止。
目前 ChatGPT 的高級語音模式采用回合式對話機制。用戶必須先說完話,AI 才會處理語音并生成回答。如果用戶在 AI 發(fā)言時插入“okay”或“mm-hm”等回應,系統(tǒng)通常會直接停止,而不會繼續(xù)像正常對話那樣進行。
OpenAI 正在開發(fā)的新模型名為 BiDi(IT之家注:雙向語音模型)。該模型能夠持續(xù)處理說話者的語音輸入,因此在被打斷時可以立即調(diào)整回應。相比之下,現(xiàn)有語音模型一旦開始生成回答,輸出內(nèi)容就基本固定,無法再根據(jù)新的輸入進行變化。
這項技術仍處于開發(fā)階段。一名了解項目情況的人士表示,原型模型在持續(xù)對話幾分鐘后容易出現(xiàn)故障,有時甚至會發(fā)出不自然的聲音。OpenAI 研究人員原本希望今年第一季度發(fā)布 BiDi,而目前最新的發(fā)布時間可能推遲到第二季度或更晚。
OpenAI 認為,如果語音模型能夠在性能上接近文本模型,AI 的使用范圍將進一步擴大,因為大多數(shù)人更習慣與 AI 進行語音交流,而不是輸入文字。
BiDi 模型在客服場景中可能尤其有價值。例如,當顧客與零售商的 AI 客服通話時,如果顧客在對話過程中臨時決定選擇換貨而非退貨,BiDi 模型理論上可以讓 AI 客服順暢調(diào)整對話,而不會突然停止或出現(xiàn)混亂。
這名知情人士還表示,BiDi 模型在調(diào)用外部工具和應用方面也更靈活。據(jù)IT之家了解,OpenAI 此前表示,公司計劃為未來一款主要通過語音交互的 AI 設備改進語音模型,并考慮開發(fā)一款智能音箱,通過語音指令即可查看郵件或預訂服務。
廣告聲明:文內(nèi)含有的對外跳轉(zhuǎn)鏈接(包括不限于超鏈接、二維碼、口令等形式),用于傳遞更多信息,節(jié)省甄選時間,結果僅供參考,IT之家所有文章均包含本聲明。