方言也能聽懂?百度AI展現(xiàn)神級語音技術(shù)

7月4日、5日,百度AI開發(fā)者大會火熱召開,會上百度向開發(fā)者們展示了百度AI能力的核心——百度大腦3.0。

百度大腦3.0的核心是“多模態(tài)深度語義理解”,它不僅能讓機器聽清、看清,更能深入理解它背后的含義,深度地理解真實世界,進而更好地支撐各種應(yīng)用。

在下午的百度大腦分論壇上,百度展示了它在語音語義一體化、視覺語義化等技術(shù)上的新突破。

“小度小度,我要看電影~”

“小度小度,徐崢的老婆是誰~”

“小度小度,聲音調(diào)大點~”

……

如果是識別出了幾段普通話,可能并不讓人驚奇,但這段指令卻是一段四川方言,而搭載了DuerOS的電視不僅識別出了口令,并且和人類進行了流暢互動,這就讓在場的開發(fā)者們驚奇不已了。而在這流暢交互的背后,就是百度大腦3.0在語音技術(shù)上的體現(xiàn)。

方言也能聽懂?百度AI展現(xiàn)神級語音技術(shù)

據(jù)百度高級副總裁、AI技術(shù)平臺體系總負責人王海峰介紹,百度大腦3.0的核心是“多模態(tài)深度語義理解”,“多模態(tài)深度語義理解”是指對文字、聲音、圖片、視頻等多模態(tài)的數(shù)據(jù)和信息進行深層次多維度的語義理解,包括數(shù)據(jù)語義、知識語義、視覺語義、語音語義一體化和自然語言語義等多方面的語義理解技術(shù)。

在語音技術(shù)上,百度取得了三項重大突破:百度高噪聲環(huán)境Hand-free語音識別準確率已提升了10個百分點;語音語義一體化技術(shù)使得遠場語音識別準確率提升了10個百分點;在語音合成方面,WaveNet+拼接的情感語音合成技術(shù),使得流暢度和自然度也大幅提升。

語音識別的準確率是語音技術(shù)的基礎(chǔ),針對遠場交互中高頻Query的識別率問題,百度對語義識別的技術(shù)和框架進行了重新設(shè)計,專門為高頻Query建構(gòu)解碼空間,且對高頻Query和普通Query兩套架構(gòu)并行解碼。在動態(tài)解碼階段,百度采用了Ranking綜合排序,以保證高頻Query的高權(quán)重。百度基于高頻Query的識別架構(gòu),目前能夠?qū)⒏哳lQuery的準確性提升10個點,并能保證普通Query的識別率不降。

多語種混合Query的識別是語音技術(shù)中攻克的難點,百度發(fā)布的基于Deep Peak2采用的多語種音素組合建模,突破了以音素為基本建模單元的傳統(tǒng),對中英文統(tǒng)一建模,不僅能將建模單元減少至一千多、將解碼速度加快、解碼效率增高,且因為模型對訓(xùn)練數(shù)據(jù)極高的多樣性和包容性,模型能積累更多的訓(xùn)練數(shù)據(jù),進而大大提高對中英文混合Query的識別準確率。目前,基于中文Deep Peak2的多語種音素組合模型已在百度多個產(chǎn)品上線,相對錯誤率比業(yè)界最好競品降低了20%。

技術(shù)質(zhì)量與成本最優(yōu)化是技術(shù)追求的目標,百度創(chuàng)新的WaveNet+拼接技術(shù)不僅保證了合成聲音的情感,保證了輸出聲音的穩(wěn)定性,同時降低了需要使用的數(shù)據(jù)和成本,全新的語音合成技術(shù)的經(jīng)濟適用性,覆蓋了更多的聊天場景,也讓該技術(shù)能得到大規(guī)模的工業(yè)應(yīng)用。

極客網(wǎng)企業(yè)會員

免責聲明:本網(wǎng)站內(nèi)容主要來自原創(chuàng)、合作伙伴供稿和第三方自媒體作者投稿,凡在本網(wǎng)站出現(xiàn)的信息,均僅供參考。本網(wǎng)站將盡力確保所提供信息的準確性及可靠性,但不保證有關(guān)資料的準確性及可靠性,讀者在使用前請進一步核實,并對任何自主決定的行為負責。本網(wǎng)站對有關(guān)資料所引致的錯誤、不確或遺漏,概不負任何法律責任。任何單位或個人認為本網(wǎng)站中的網(wǎng)頁或鏈接內(nèi)容可能涉嫌侵犯其知識產(chǎn)權(quán)或存在不實內(nèi)容時,應(yīng)及時向本網(wǎng)站提出書面權(quán)利通知或不實情況說明,并提供身份證明、權(quán)屬證明及詳細侵權(quán)或不實情況證明。本網(wǎng)站在收到上述法律文件后,將會依法盡快聯(lián)系相關(guān)文章源頭核實,溝通刪除相關(guān)內(nèi)容或斷開相關(guān)鏈接。

2018-07-05
方言也能聽懂?百度AI展現(xiàn)神級語音技術(shù)
7月4日、5日,百度AI開發(fā)者大會火熱召開,會上百度向開發(fā)者們展示了百度AI能力的核心——百度大腦3.0。

長按掃碼 閱讀全文