方言也能聽懂?百度AI展現神級語音技術

7月4日、5日,百度AI開發(fā)者大會火熱召開,會上百度向開發(fā)者們展示了百度AI能力的核心——百度大腦3.0。

百度大腦3.0的核心是“多模態(tài)深度語義理解”,它不僅能讓機器聽清、看清,更能深入理解它背后的含義,深度地理解真實世界,進而更好地支撐各種應用。

在下午的百度大腦分論壇上,百度展示了它在語音語義一體化、視覺語義化等技術上的新突破。

“小度小度,我要看電影~”

“小度小度,徐崢的老婆是誰~”

“小度小度,聲音調大點~”

……

如果是識別出了幾段普通話,可能并不讓人驚奇,但這段指令卻是一段四川方言,而搭載了DuerOS的電視不僅識別出了口令,并且和人類進行了流暢互動,這就讓在場的開發(fā)者們驚奇不已了。而在這流暢交互的背后,就是百度大腦3.0在語音技術上的體現。

方言也能聽懂?百度AI展現神級語音技術

據百度高級副總裁、AI技術平臺體系總負責人王海峰介紹,百度大腦3.0的核心是“多模態(tài)深度語義理解”,“多模態(tài)深度語義理解”是指對文字、聲音、圖片、視頻等多模態(tài)的數據和信息進行深層次多維度的語義理解,包括數據語義、知識語義、視覺語義、語音語義一體化和自然語言語義等多方面的語義理解技術。

在語音技術上,百度取得了三項重大突破:百度高噪聲環(huán)境Hand-free語音識別準確率已提升了10個百分點;語音語義一體化技術使得遠場語音識別準確率提升了10個百分點;在語音合成方面,WaveNet+拼接的情感語音合成技術,使得流暢度和自然度也大幅提升。

語音識別的準確率是語音技術的基礎,針對遠場交互中高頻Query的識別率問題,百度對語義識別的技術和框架進行了重新設計,專門為高頻Query建構解碼空間,且對高頻Query和普通Query兩套架構并行解碼。在動態(tài)解碼階段,百度采用了Ranking綜合排序,以保證高頻Query的高權重。百度基于高頻Query的識別架構,目前能夠將高頻Query的準確性提升10個點,并能保證普通Query的識別率不降。

多語種混合Query的識別是語音技術中攻克的難點,百度發(fā)布的基于Deep Peak2采用的多語種音素組合建模,突破了以音素為基本建模單元的傳統(tǒng),對中英文統(tǒng)一建模,不僅能將建模單元減少至一千多、將解碼速度加快、解碼效率增高,且因為模型對訓練數據極高的多樣性和包容性,模型能積累更多的訓練數據,進而大大提高對中英文混合Query的識別準確率。目前,基于中文Deep Peak2的多語種音素組合模型已在百度多個產品上線,相對錯誤率比業(yè)界最好競品降低了20%。

技術質量與成本最優(yōu)化是技術追求的目標,百度創(chuàng)新的WaveNet+拼接技術不僅保證了合成聲音的情感,保證了輸出聲音的穩(wěn)定性,同時降低了需要使用的數據和成本,全新的語音合成技術的經濟適用性,覆蓋了更多的聊天場景,也讓該技術能得到大規(guī)模的工業(yè)應用。

極客網企業(yè)會員

免責聲明:本網站內容主要來自原創(chuàng)、合作伙伴供稿和第三方自媒體作者投稿,凡在本網站出現的信息,均僅供參考。本網站將盡力確保所提供信息的準確性及可靠性,但不保證有關資料的準確性及可靠性,讀者在使用前請進一步核實,并對任何自主決定的行為負責。本網站對有關資料所引致的錯誤、不確或遺漏,概不負任何法律責任。任何單位或個人認為本網站中的網頁或鏈接內容可能涉嫌侵犯其知識產權或存在不實內容時,應及時向本網站提出書面權利通知或不實情況說明,并提供身份證明、權屬證明及詳細侵權或不實情況證明。本網站在收到上述法律文件后,將會依法盡快聯系相關文章源頭核實,溝通刪除相關內容或斷開相關鏈接。

2018-07-05
方言也能聽懂?百度AI展現神級語音技術
7月4日、5日,百度AI開發(fā)者大會火熱召開,會上百度向開發(fā)者們展示了百度AI能力的核心——百度大腦3.0。

長按掃碼 閱讀全文