亚洲成在人线线播放无码,中文字幕在线光看不卡,中国成熟IPHONE

7月4日、5日，百度AI開發(fā)者大會火熱召開，會上百度向開發(fā)者們展示了百度AI能力的核心——百度大腦3.0。

百度大腦3.0的核心是“多模態(tài)深度語義理解”，它不僅能讓機器聽清、看清，更能深入理解它背后的含義，深度地理解真實世界，進而更好地支撐各種應(yīng)用。

在下午的百度大腦分論壇上，百度展示了它在語音語義一體化、視覺語義化等技術(shù)上的新突破。

“小度小度，我要看電影~”

“小度小度，徐崢的老婆是誰~”

“小度小度，聲音調(diào)大點~”

……

如果是識別出了幾段普通話，可能并不讓人驚奇，但這段指令卻是一段四川方言，而搭載了DuerOS的電視不僅識別出了口令，并且和人類進行了流暢互動，這就讓在場的開發(fā)者們驚奇不已了。而在這流暢交互的背后，就是百度大腦3.0在語音技術(shù)上的體現(xiàn)。

方言也能聽懂？百度AI展現(xiàn)神級語音技術(shù)

據(jù)百度高級副總裁、AI技術(shù)平臺體系總負責(zé)人王海峰介紹，百度大腦3.0的核心是“多模態(tài)深度語義理解”，“多模態(tài)深度語義理解”是指對文字、聲音、圖片、視頻等多模態(tài)的數(shù)據(jù)和信息進行深層次多維度的語義理解，包括數(shù)據(jù)語義、知識語義、視覺語義、語音語義一體化和自然語言語義等多方面的語義理解技術(shù)。

在語音技術(shù)上，百度取得了三項重大突破：百度高噪聲環(huán)境Hand-free語音識別準確率已提升了10個百分點;語音語義一體化技術(shù)使得遠場語音識別準確率提升了10個百分點;在語音合成方面，WaveNet+拼接的情感語音合成技術(shù)，使得流暢度和自然度也大幅提升。

語音識別的準確率是語音技術(shù)的基礎(chǔ)，針對遠場交互中高頻Query的識別率問題，百度對語義識別的技術(shù)和框架進行了重新設(shè)計，專門為高頻Query建構(gòu)解碼空間，且對高頻Query和普通Query兩套架構(gòu)并行解碼。在動態(tài)解碼階段，百度采用了Ranking綜合排序，以保證高頻Query的高權(quán)重。百度基于高頻Query的識別架構(gòu)，目前能夠?qū)⒏哳lQuery的準確性提升10個點，并能保證普通Query的識別率不降。

多語種混合Query的識別是語音技術(shù)中攻克的難點，百度發(fā)布的基于Deep Peak2采用的多語種音素組合建模，突破了以音素為基本建模單元的傳統(tǒng)，對中英文統(tǒng)一建模，不僅能將建模單元減少至一千多、將解碼速度加快、解碼效率增高，且因為模型對訓(xùn)練數(shù)據(jù)極高的多樣性和包容性，模型能積累更多的訓(xùn)練數(shù)據(jù)，進而大大提高對中英文混合Query的識別準確率。目前，基于中文Deep Peak2的多語種音素組合模型已在百度多個產(chǎn)品上線，相對錯誤率比業(yè)界最好競品降低了20%。

技術(shù)質(zhì)量與成本最優(yōu)化是技術(shù)追求的目標(biāo)，百度創(chuàng)新的WaveNet+拼接技術(shù)不僅保證了合成聲音的情感，保證了輸出聲音的穩(wěn)定性，同時降低了需要使用的數(shù)據(jù)和成本，全新的語音合成技術(shù)的經(jīng)濟適用性，覆蓋了更多的聊天場景，也讓該技術(shù)能得到大規(guī)模的工業(yè)應(yīng)用。

免責(zé)聲明：本網(wǎng)站內(nèi)容主要來自原創(chuàng)、合作伙伴供稿和第三方自媒體作者投稿，凡在本網(wǎng)站出現(xiàn)的信息，均僅供參考。本網(wǎng)站將盡力確保所提供信息的準確性及可靠性，但不保證有關(guān)資料的準確性及可靠性，讀者在使用前請進一步核實，并對任何自主決定的行為負責(zé)。本網(wǎng)站對有關(guān)資料所引致的錯誤、不確或遺漏，概不負任何法律責(zé)任。任何單位或個人認為本網(wǎng)站中的網(wǎng)頁或鏈接內(nèi)容可能涉嫌侵犯其知識產(chǎn)權(quán)或存在不實內(nèi)容時，應(yīng)及時向本網(wǎng)站提出書面權(quán)利通知或不實情況說明，并提供身份證明、權(quán)屬證明及詳細侵權(quán)或不實情況證明。本網(wǎng)站在收到上述法律文件后，將會依法盡快聯(lián)系相關(guān)文章源頭核實，溝通刪除相關(guān)內(nèi)容或斷開相關(guān)鏈接。

方言也能聽懂？百度AI展現(xiàn)神級語音技術(shù)

下一篇

方言也能聽懂？百度AI展現(xiàn)神級語音技術(shù)