91欧美超碰AV自拍|国产成年人性爱视频免费看|亚洲 日韩 欧美一厂二区入|人人看人人爽人人操aV|丝袜美腿视频一区二区在线看|人人操人人爽人人爱|婷婷五月天超碰|97色色欧美亚州A√|另类A√无码精品一级av|欧美特级日韩特级

0
  • 聊天消息
  • 系統(tǒng)消息
  • 評(píng)論與回復(fù)
登錄后你可以
  • 下載海量資料
  • 學(xué)習(xí)在線課程
  • 觀看技術(shù)視頻
  • 寫文章/發(fā)帖/加入社區(qū)
會(huì)員中心
創(chuàng)作中心

完善資料讓更多小伙伴認(rèn)識(shí)你,還能領(lǐng)取20積分哦,立即完善>

3天內(nèi)不再提示

語(yǔ)音識(shí)別技術(shù)的發(fā)展史

454398 ? 來(lái)源:工程師吳畏 ? 2019-04-30 11:49 ? 次閱讀
加入交流群
微信小助手二維碼

掃碼添加小助手

加入工程師交流群

從前年開始,海外谷歌、亞馬遜、蘋果、微軟、三星,國(guó)內(nèi)阿里、小米、京東等都已先后涉足智能音箱這一領(lǐng)域。隨著其快速發(fā)展,作為核心技術(shù)之一的語(yǔ)音識(shí)別技術(shù)也逐步進(jìn)入人們的視線,本篇我們就來(lái)談?wù)務(wù)Z音識(shí)別技術(shù)。

語(yǔ)音識(shí)別技術(shù)簡(jiǎn)介

語(yǔ)音識(shí)別,也被稱為自動(dòng)語(yǔ)音識(shí)別(Automatic Speech Recognition,ASR)技術(shù),就是讓機(jī)器通過(guò)識(shí)別和理解過(guò)程把語(yǔ)音信號(hào)轉(zhuǎn)變?yōu)橄鄳?yīng)的文本或命令的高技術(shù),也就是讓機(jī)器聽懂人類的語(yǔ)音。

所謂聽懂,有兩層意思,一是指把用戶所說(shuō)的話逐詞逐句轉(zhuǎn)換成文本;二是指正確理解語(yǔ)音中所包含的要求,作出正確的應(yīng)答。

語(yǔ)音識(shí)別技術(shù)目前在桌面系統(tǒng)、智能手機(jī)、導(dǎo)航設(shè)備等嵌入式領(lǐng)域均有一定程度的應(yīng)用。

語(yǔ)音識(shí)別系統(tǒng)及過(guò)程

不同的語(yǔ)音識(shí)別系統(tǒng),雖然具體實(shí)現(xiàn)細(xì)節(jié)有所不同,但所采用的基本技術(shù)相似,一個(gè)典型語(yǔ)音識(shí)別系統(tǒng)的實(shí)現(xiàn)過(guò)程如下圖所示。

語(yǔ)音識(shí)別的基本過(guò)程有兩個(gè)部分組成。一是學(xué)習(xí)和訓(xùn)練,二是識(shí)別過(guò)程。

訓(xùn)練(Training):預(yù)先分析出語(yǔ)音特征參數(shù),制作語(yǔ)音模板(Template)并存放在語(yǔ)音參數(shù)庫(kù)中。

識(shí)別(Recognition):待識(shí)語(yǔ)音經(jīng)過(guò)與訓(xùn)練時(shí)相同的分析,得到語(yǔ)音參數(shù),將它與庫(kù)中的參考模板一一比較,并采用判決的方法找出最接近語(yǔ)音特征的模板,得出識(shí)別效果。

語(yǔ)音識(shí)別系統(tǒng)的分類

(1)根據(jù)對(duì)說(shuō)話人說(shuō)話方式的要求,可以分為孤立字(詞)語(yǔ)音識(shí)別系統(tǒng),連接字語(yǔ)音識(shí)別系統(tǒng)以及連續(xù)語(yǔ)音識(shí)別系統(tǒng)。

孤立單詞識(shí)別(Isolated Word Recognition):識(shí)別的單元為字、詞或短語(yǔ),它們組成識(shí)別的詞匯表(Vocabulary),對(duì)它們中的每一個(gè)通過(guò)訓(xùn)練建立模板或模型。

連續(xù)單詞識(shí)別(Connected Word Recognition):以比較少的詞匯為對(duì)象,能夠完全識(shí)別每個(gè)詞。識(shí)別的詞匯表和標(biāo)準(zhǔn)樣板或模型也是字、詞或短語(yǔ),但識(shí)別時(shí)可以是它們中間幾個(gè)的連續(xù)。

連續(xù)語(yǔ)音識(shí)別(Continuous Speech Recognition):以多數(shù)詞匯為對(duì)象,待識(shí)語(yǔ)音是一些完整的句子。雖不能完全準(zhǔn)確識(shí)別每個(gè)單詞,但能夠理解其意義,連續(xù)語(yǔ)音識(shí)別也叫會(huì)話語(yǔ)音識(shí)別。可理解為在語(yǔ)音識(shí)別之后,根據(jù)語(yǔ)言學(xué)知識(shí)來(lái)推斷語(yǔ)音的含義內(nèi)容。

(2)根據(jù)對(duì)說(shuō)話人的依賴程度可以分為特定人和非特定人語(yǔ)音識(shí)別系統(tǒng)。

特定人語(yǔ)音識(shí)別(Speaker-Dependent):語(yǔ)音識(shí)別的標(biāo)準(zhǔn)模板或模型只適應(yīng)于某個(gè)人。實(shí)際上,該模板或模型就是該人通過(guò)輸入詞匯表中的每個(gè)字、詞或短語(yǔ)的語(yǔ)音建立起來(lái)的。其他人使用時(shí),需同樣建立自己的標(biāo)準(zhǔn)模板或模型。

非特定人語(yǔ)音識(shí)別(Speaker-Independent):語(yǔ)音識(shí)別的標(biāo)準(zhǔn)模板或模型適應(yīng)于指定的某一范疇的說(shuō)話人(比如標(biāo)準(zhǔn)普通話),標(biāo)準(zhǔn)模板或模型由該范疇的多個(gè)人通過(guò)訓(xùn)練而產(chǎn)生。識(shí)別時(shí)可供參加訓(xùn)練的發(fā)音人使用,也可供未參加訓(xùn)練的同一范疇的發(fā)音人使用。

(3)根據(jù)詞匯量大小,可以分為有限詞匯以及無(wú)限詞匯量語(yǔ)音識(shí)別系統(tǒng)。

有限詞匯識(shí)別:按詞匯表中字、詞或短句個(gè)數(shù)的多少,大致分為:100以下小詞匯量;100-1000中等詞匯量;1000以上為大詞匯量。

無(wú)限詞匯識(shí)別(全音節(jié)識(shí)別):當(dāng)識(shí)別基元為漢語(yǔ)普通話中對(duì)應(yīng)所有漢字的可讀音節(jié)時(shí),稱其為全音節(jié)語(yǔ)音識(shí)別,是實(shí)現(xiàn)無(wú)線詞匯或中文文本輸入的基礎(chǔ)。

語(yǔ)音識(shí)別技術(shù)的“前世今生”

下面我們來(lái)看看語(yǔ)音識(shí)別技術(shù)的“前世今生”:

(1)起始階段

1952年AT& T Bell實(shí)驗(yàn)室實(shí)現(xiàn)了一個(gè)單一發(fā)音人孤立發(fā)音的十個(gè)英文數(shù)字的語(yǔ)音識(shí)別系統(tǒng),方法主要是度量每個(gè)數(shù)字的元音音段的共振峰。

1960年英國(guó)的Denes等人研究成功了第一個(gè)計(jì)算機(jī)語(yǔ)音識(shí)別系統(tǒng)。在此期間,提出的一些思想沿用至今。

理論:模式識(shí)別思想、動(dòng)態(tài)規(guī)劃算法、時(shí)間規(guī)劃算法、動(dòng)態(tài)因素跟蹤法。

(2)快速發(fā)展階段

70年代孤立詞發(fā)音和孤立語(yǔ)句發(fā)音的識(shí)別成為了可行的有用技術(shù),大規(guī)模的語(yǔ)音識(shí)別研究在這個(gè)時(shí)期得到很大的發(fā)展。

80年代研究的重點(diǎn)轉(zhuǎn)向了詞匯量的積累,以及連續(xù)的語(yǔ)音識(shí)別,也就是從傳統(tǒng)的基于標(biāo)準(zhǔn)模板匹配的技術(shù)思路轉(zhuǎn)變基于統(tǒng)計(jì)模型的技術(shù)思路。此外,再次提出了將神經(jīng)網(wǎng)絡(luò)技術(shù)引入語(yǔ)音識(shí)別的技術(shù)思路。

理論:聲學(xué)模型—隱馬爾科夫模型(Hidden Markov Model,HMM)

語(yǔ)言模型—N-gram模型

(3)應(yīng)用開發(fā)

90年代,語(yǔ)音識(shí)別研究的重點(diǎn)轉(zhuǎn)向自然語(yǔ)言的識(shí)別處理,任務(wù)轉(zhuǎn)移到航空旅行信息的索取。同時(shí),語(yǔ)音識(shí)別技術(shù)不斷應(yīng)用于電話網(wǎng)絡(luò),增強(qiáng)話務(wù)員服務(wù)和自動(dòng)化。

2000年以來(lái),人機(jī)語(yǔ)音交互成為研究的焦點(diǎn)。研究重點(diǎn)包括即興口語(yǔ)的識(shí)別和理解,自然口語(yǔ)對(duì)話,以及多語(yǔ)種的語(yǔ)音同聲翻譯。

理論:聲學(xué)模型—隱馬爾科夫模型—深度神經(jīng)網(wǎng)絡(luò)(Deep Neural Network,DNN)

語(yǔ)言模型—N-gram模型—反饋神經(jīng)網(wǎng)絡(luò)(Feedback Neural Network,F(xiàn)NN)

語(yǔ)音識(shí)別領(lǐng)域公司

科大訊飛,騰訊,百度,蘇州思必馳,捷通華聲,云知聲等等。

結(jié)語(yǔ)

隨著語(yǔ)音識(shí)別技術(shù)的不斷發(fā)展,無(wú)論是Siri、Echo,還是其他的智能語(yǔ)音助手都可以接觸和管理消息、郵件和日程帳號(hào),還能控制聯(lián)網(wǎng)家居,播放音樂,甚至完成網(wǎng)絡(luò)搜索或者更多的事情。而我們,只需滿懷期待。

聲明:本文內(nèi)容及配圖由入駐作者撰寫或者入駐合作網(wǎng)站授權(quán)轉(zhuǎn)載。文章觀點(diǎn)僅代表作者本人,不代表電子發(fā)燒友網(wǎng)立場(chǎng)。文章及其配圖僅供工程師學(xué)習(xí)之用,如有內(nèi)容侵權(quán)或者其他違規(guī)問(wèn)題,請(qǐng)聯(lián)系本站處理。 舉報(bào)投訴
收藏 人收藏
加入交流群
微信小助手二維碼

掃碼添加小助手

加入工程師交流群

    評(píng)論

    相關(guān)推薦
    熱點(diǎn)推薦

    語(yǔ)音識(shí)別IC分類,語(yǔ)音識(shí)別芯片的工作原理

    語(yǔ)音識(shí)別芯片,也叫語(yǔ)音識(shí)別集成電路,是一種集聲音存儲(chǔ)、播放、錄音及語(yǔ)音識(shí)別功能于一體的專用芯片。
    的頭像 發(fā)表于 01-14 15:22 ?239次閱讀
    <b class='flag-5'>語(yǔ)音</b><b class='flag-5'>識(shí)別</b>IC分類,<b class='flag-5'>語(yǔ)音</b><b class='flag-5'>識(shí)別</b>芯片的工作原理

    國(guó)產(chǎn)32位MCU語(yǔ)音識(shí)別方案

    在智能家居、工業(yè)控制及便攜設(shè)備領(lǐng)域,語(yǔ)音交互正成為人機(jī)界面的重要發(fā)展方向。針對(duì)離線語(yǔ)音識(shí)別需求,基于國(guó)產(chǎn)32位MCU的解決方案日益成熟,其中以CH32V307等為代表的32位MCU芯片
    的頭像 發(fā)表于 12-04 15:11 ?541次閱讀

    語(yǔ)音識(shí)別芯片有哪些(語(yǔ)音識(shí)別芯片AT680系列)

    在人工智能技術(shù)飛速發(fā)展的今天,語(yǔ)音識(shí)別芯片作為人機(jī)交互的重要橋梁,正逐漸成為各類智能設(shè)備不可或缺的核心部件。與傳統(tǒng)的語(yǔ)音芯片不同,
    的頭像 發(fā)表于 11-14 17:11 ?1368次閱讀

    廣州唯創(chuàng)電子WTK6900H-24SS語(yǔ)音識(shí)別芯片:智能語(yǔ)音控制賦能臺(tái)燈創(chuàng)新應(yīng)用 | 語(yǔ)音IC廠家

    在智能家居快速發(fā)展的今天,語(yǔ)音交互技術(shù)正在深刻改變?nèi)藗兣c家居設(shè)備的互動(dòng)方式。臺(tái)燈作為日常生活中不可或缺的照明工具,其智能化升級(jí)已成為行業(yè)發(fā)展的重要趨勢(shì)。廣州唯創(chuàng)電子作為國(guó)內(nèi)領(lǐng)先的
    的頭像 發(fā)表于 11-05 09:20 ?778次閱讀
    廣州唯創(chuàng)電子WTK6900H-24SS<b class='flag-5'>語(yǔ)音</b><b class='flag-5'>識(shí)別</b>芯片:智能<b class='flag-5'>語(yǔ)音</b>控制賦能臺(tái)燈創(chuàng)新應(yīng)用 | <b class='flag-5'>語(yǔ)音</b>IC廠家

    什么是離線語(yǔ)音識(shí)別芯片(離線語(yǔ)音識(shí)別芯片有哪些優(yōu)點(diǎn))

    離線語(yǔ)音識(shí)別芯片,是一種集成了語(yǔ)音信號(hào)采集、前端處理和本地識(shí)別功能的專用集成電路,無(wú)須聯(lián)網(wǎng)也可以進(jìn)行語(yǔ)音控制。它內(nèi)設(shè)先進(jìn)的數(shù)字信號(hào)處理模塊及
    的頭像 發(fā)表于 10-31 15:27 ?506次閱讀

    如何選擇合適的語(yǔ)音識(shí)別芯片型號(hào)

    語(yǔ)音識(shí)別芯片(又稱語(yǔ)音識(shí)別IC)是現(xiàn)代智能設(shè)備的核心組件,與傳統(tǒng)語(yǔ)音芯片相比,其最大特點(diǎn)是能夠主動(dòng)識(shí)別
    的頭像 發(fā)表于 10-30 16:32 ?611次閱讀

    廣州唯創(chuàng)電子WTK6900H-32N語(yǔ)音識(shí)別芯片:AI降噪算法助力抽油煙機(jī)精準(zhǔn)語(yǔ)音控制 | 語(yǔ)音IC廠家

    在現(xiàn)代智能家居快速發(fā)展的大背景下,廚房作為家庭生活的重要場(chǎng)景,其智能化程度卻一直受到環(huán)境噪音的制約。抽油煙機(jī)作為廚房核心電器,其運(yùn)行產(chǎn)生的噪音往往使得傳統(tǒng)語(yǔ)音識(shí)別技術(shù)難以發(fā)揮效用。廣州
    的頭像 發(fā)表于 10-30 09:17 ?378次閱讀
    廣州唯創(chuàng)電子WTK6900H-32N<b class='flag-5'>語(yǔ)音</b><b class='flag-5'>識(shí)別</b>芯片:AI降噪算法助力抽油煙機(jī)精準(zhǔn)<b class='flag-5'>語(yǔ)音</b>控制 | <b class='flag-5'>語(yǔ)音</b>IC廠家

    語(yǔ)音識(shí)別系統(tǒng)的技術(shù)核心:從聲音到文字的智能轉(zhuǎn)換

    ? ? ? 語(yǔ)音識(shí)別技術(shù),也稱為自動(dòng)語(yǔ)音識(shí)別(ASR),其核心目標(biāo)是將人類語(yǔ)音信號(hào)轉(zhuǎn)換為對(duì)應(yīng)的文
    的頭像 發(fā)表于 09-05 14:04 ?837次閱讀

    瑞芯微RK3576語(yǔ)音識(shí)別算法

    1.語(yǔ)音識(shí)別簡(jiǎn)介語(yǔ)音識(shí)別技術(shù),也被稱為自動(dòng)語(yǔ)音識(shí)別
    的頭像 發(fā)表于 08-15 15:13 ?2184次閱讀
    瑞芯微RK3576<b class='flag-5'>語(yǔ)音</b><b class='flag-5'>識(shí)別</b>算法

    語(yǔ)音識(shí)別---大家怎么看呢?

    語(yǔ)音識(shí)別是一門交叉學(xué)科。近二十年來(lái),語(yǔ)音識(shí)別技術(shù)取得顯著進(jìn)步,開始從實(shí)驗(yàn)室走向市場(chǎng)。人們預(yù)計(jì),未來(lái)10年內(nèi),
    發(fā)表于 08-09 10:54

    語(yǔ)音識(shí)別芯片選型有哪些技術(shù)參數(shù)要注意

    語(yǔ)音識(shí)別芯片的使用場(chǎng)景越來(lái)越多涉及的范圍也越來(lái)越廣!那么語(yǔ)音芯片的選型就很重要了,選型不對(duì)直接影響產(chǎn)品的使用體驗(yàn),下面小編從不同的維度來(lái)給大家介紹語(yǔ)音
    的頭像 發(fā)表于 06-23 17:31 ?868次閱讀
    <b class='flag-5'>語(yǔ)音</b><b class='flag-5'>識(shí)別</b>芯片選型有哪些<b class='flag-5'>技術(shù)</b>參數(shù)要注意

    明遠(yuǎn)智睿SSD2351開發(fā)板:語(yǔ)音機(jī)器人領(lǐng)域的變革力量

    源的開發(fā)資料為開發(fā)者提供了深入研究和定制語(yǔ)音機(jī)器人功能的基礎(chǔ),開發(fā)者可以根據(jù)不同的應(yīng)用需求,對(duì)語(yǔ)音識(shí)別算法、語(yǔ)音合成引擎等進(jìn)行優(yōu)化和改進(jìn)。一對(duì)一的
    發(fā)表于 05-28 11:36

    普強(qiáng)信息入選2024語(yǔ)音識(shí)別技術(shù)公司TOP30榜單

    普強(qiáng)憑借在語(yǔ)音識(shí)別領(lǐng)域多年的技術(shù)積淀與持續(xù)的創(chuàng)新突破,成功入選“2024語(yǔ)音識(shí)別技術(shù)公司TOP3
    的頭像 發(fā)表于 04-18 17:25 ?1209次閱讀

    半導(dǎo)體材料發(fā)展史:從硅基到超寬禁帶半導(dǎo)體的跨越

    半導(dǎo)體材料是現(xiàn)代信息技術(shù)的基石,其發(fā)展史不僅是科技進(jìn)步的縮影,更是人類對(duì)材料性能極限不斷突破的見證。從第一代硅基材料到第四代超寬禁帶半導(dǎo)體,每一代材料的迭代都推動(dòng)了電子器件性能的飛躍。 1 第一代
    的頭像 發(fā)表于 04-10 15:58 ?3180次閱讀

    廠家芯資訊|廣州唯創(chuàng)電子語(yǔ)音識(shí)別芯片技術(shù)解析

    ?一、公司及產(chǎn)品概述作為國(guó)內(nèi)領(lǐng)先的語(yǔ)音芯片研發(fā)企業(yè),深耕語(yǔ)音技術(shù)領(lǐng)域25年,其產(chǎn)品以高穩(wěn)定性、低功耗和多場(chǎng)景適應(yīng)性著稱。公司推出的語(yǔ)音識(shí)別
    的頭像 發(fā)表于 03-19 08:46 ?800次閱讀
    廠家芯資訊|廣州唯創(chuàng)電子<b class='flag-5'>語(yǔ)音</b><b class='flag-5'>識(shí)別</b>芯片<b class='flag-5'>技術(shù)</b>解析