當(dāng)前位置：首頁 > 物聯(lián)網(wǎng) > 智能應(yīng)用

原創(chuàng)

什么是語音識別技術(shù)

時(shí)間：2024-04-12 11:00:01

關(guān)鍵字：語音識別語音識別技術(shù)

手機(jī)看文章

掃描二維碼
隨時(shí)隨地手機(jī)看文章

[導(dǎo)讀]在下述的內(nèi)容中，小編將會對語音識別技術(shù)的相關(guān)消息予以報(bào)道，如果語音識別技術(shù)是您想要了解的焦點(diǎn)之一，不妨和小編共同閱讀這篇文章哦。

在下述的內(nèi)容中，小編將會對語音識別技術(shù)的相關(guān)消息予以報(bào)道，如果語音識別技術(shù)是您想要了解的焦點(diǎn)之一，不妨和小編共同閱讀這篇文章哦。

一、什么是語音識別技術(shù)

語音識別技術(shù)，也被稱為自動(dòng)語音識別(Automatic Speech Recognition，ASR)，其目標(biāo)是將人類的語音中的詞匯內(nèi)容轉(zhuǎn)換為計(jì)算機(jī)可讀的輸入，例如按鍵、二進(jìn)制編碼或者字符序列。與說話人識別及說話人確認(rèn)不同，后者嘗試識別或確認(rèn)發(fā)出語音的說話人而非其中所包含的詞匯內(nèi)容。

語音識別技術(shù)屬于人工智能方向的一個(gè)重要分支，涉及許多學(xué)科，如信號處理、計(jì)算機(jī)科學(xué)、語言學(xué)、聲學(xué)、生理學(xué)、心理學(xué)等，是人機(jī)自然交互技術(shù)中的關(guān)鍵環(huán)節(jié)。語音識別較語音合成而言，技術(shù)上要復(fù)雜，但應(yīng)用卻更加廣泛。語音識別ASR的最大優(yōu)勢在于使得人機(jī)用戶界面更加自然和容易使用。

語音識別是涉及心理學(xué)、生理學(xué)、聲學(xué)、語言學(xué)、信息理論、信號處理、計(jì)算機(jī)科學(xué)、模式識別等多個(gè)學(xué)科的交叉學(xué)科，具有廣闊的應(yīng)用前景，如語音檢索、命令控制、自動(dòng)客戶服務(wù)、機(jī)器自動(dòng)翻譯等。當(dāng)今信息社會的高速發(fā)展迫切需要性能優(yōu)越的，能滿足各種不同需求的自動(dòng)語音識別技術(shù)。但是，這樣的目標(biāo)面臨著諸多困難，如：①語音信號會受到上下文的影響而發(fā)生變化;②發(fā)音人以及口音的不同會導(dǎo)致語音特征在參數(shù)空間分布的不同;③同一發(fā)音人心理和生理變化帶來的語音變化;④不同的發(fā)音方式和習(xí)慣引起的省略、連讀等多變的語音現(xiàn)象;⑤環(huán)境和信道等因素造成的語音信號失真問題。

對于自動(dòng)語音識別的探索，實(shí)際是早于計(jì)算機(jī)的出現(xiàn)的，早期的聲碼器可以看作是語音合成和識別技術(shù)的雛形，20世紀(jì)20年代出現(xiàn)的“Radio Rex”玩具狗也許是人類歷史上最早的語音識別機(jī)?，F(xiàn)代自動(dòng)語音識別技術(shù)可以追溯到上世紀(jì)50年代貝爾實(shí)驗(yàn)室的研究員使用模擬元器件，提取分析元音的共振峰信息，實(shí)現(xiàn)了十個(gè)英文孤立數(shù)字的識別功能。到了50年代末，統(tǒng)計(jì)語法的概念被倫敦大學(xué)學(xué)院的研究者首次加入到語音識別中(Fry，1959)，具有識別輔音和元音音素功能的識別器問世。在同一時(shí)期，用于特定環(huán)境中面向非特定人10個(gè)元音的音紊識別器也在麻省理工大學(xué)的林肯實(shí)驗(yàn)室被研制出來。概率在不確定性數(shù)據(jù)管理中扮演重要角色，但多重概率的出現(xiàn)也極大的加大了數(shù)據(jù)處理的繁雜度。

二、語音識別系統(tǒng)包含哪些部分

(1)語音輸入的預(yù)處理模塊

對輸入的原始語音信號進(jìn)行處理，濾除掉其中的不重要信息以及背景噪聲，并進(jìn)行語音信號的端點(diǎn)檢測(也就是找出語音信號的始末)、語音分幀(可以近似理解為，一段語音就像是一段視頻，由許多幀的有序畫面構(gòu)成，可以將語音信號切割為單個(gè)的“畫面”進(jìn)行分析)等處理。

(2)特征提取

在去除語音信號中對于語音識別無用的冗余信息后，保留能夠反映語音本質(zhì)特征的信息進(jìn)行處理，并用一定的形式表示出來。也就是提取出反映語音信號特征的關(guān)鍵特征參數(shù)形成特征矢量序列，以便用于后續(xù)處理。

(3)聲學(xué)模型訓(xùn)練

聲學(xué)模型可以理解為是對聲音的建模，能夠把語音輸入轉(zhuǎn)換成聲學(xué)表示的輸出，準(zhǔn)確的說，是給出語音屬于某個(gè)聲學(xué)符號的概率。根據(jù)訓(xùn)練語音庫的特征參數(shù)訓(xùn)練出聲學(xué)模型參數(shù)。在識別時(shí)可以將待識別的語音的特征參數(shù)與聲學(xué)模型進(jìn)行匹配，得到識別結(jié)果。目前的主流語音識別系統(tǒng)多采用隱馬爾可夫模型HMM進(jìn)行聲學(xué)模型建模。

(4)語言模型訓(xùn)練

語言模型是用來計(jì)算一個(gè)句子出現(xiàn)概率的模型，簡單地說，就是計(jì)算一個(gè)句子在語法上是否正確的概率。因?yàn)榫渥拥臉?gòu)造往往是規(guī)律的，前面出現(xiàn)的詞經(jīng)常預(yù)示了后方可能出現(xiàn)的詞語。它主要用于決定哪個(gè)詞序列的可能性更大，或者在出現(xiàn)了幾個(gè)詞的時(shí)候預(yù)測下一個(gè)即將出現(xiàn)的詞語。它定義了哪些詞能跟在上一個(gè)已經(jīng)識別的詞的后面(匹配是一個(gè)順序的處理過程)，這樣就可以為匹配過程排除一些不可能的單詞。

語言建模能夠有效的結(jié)合漢語語法和語義的知識，描述詞之間的內(nèi)在關(guān)系，從而提高識別率，減少搜索范圍。對訓(xùn)練文本數(shù)據(jù)庫進(jìn)行語法、語義分析，經(jīng)過基于統(tǒng)計(jì)模型訓(xùn)練得到語言模型。

(5)語音解碼和搜索算法

解碼器是指語音技術(shù)中的識別過程。針對輸入的語音信號，根據(jù)己經(jīng)訓(xùn)練好的HMM聲學(xué)模型、語言模型及字典建立一個(gè)識別網(wǎng)絡(luò)，根據(jù)搜索算法在該網(wǎng)絡(luò)中尋找最佳的一條路徑，這個(gè)路徑就是能夠以最大概率輸出該語音信號的詞串，這樣就確定這個(gè)語音樣本所包含的文字了。所以，解碼操作即指搜索算法，即在解碼端通過搜索技術(shù)尋找最優(yōu)詞串的方法。

以上便是小編此次帶來的有關(guān)語音識別技術(shù)的全部內(nèi)容，十分感謝大家的耐心閱讀，想要了解更多相關(guān)內(nèi)容，或者更多精彩內(nèi)容，請一定關(guān)注我們網(wǎng)站哦。

聲明：該篇文章為本站原創(chuàng)，未經(jīng)授權(quán)不予轉(zhuǎn)載，侵權(quán)必究。

換一批

與傳統(tǒng)的驅(qū)動(dòng)方式相比，共陰恒流驅(qū)動(dòng)在能效有哪些優(yōu)勢

LED驅(qū)動(dòng)電源的輸入包括高壓工頻交流(即市電)、低壓直流、高壓直流、低壓高頻交流(如電子變壓器的輸出)等。

關(guān)鍵字：驅(qū)動(dòng)電源

[電源]

工業(yè)電機(jī)驅(qū)動(dòng)電源設(shè)計(jì)：反電動(dòng)勢抑制與過流保護(hù)的集成方案

在工業(yè)自動(dòng)化蓬勃發(fā)展的當(dāng)下，工業(yè)電機(jī)作為核心動(dòng)力設(shè)備，其驅(qū)動(dòng)電源的性能直接關(guān)系到整個(gè)系統(tǒng)的穩(wěn)定性和可靠性。其中，反電動(dòng)勢抑制與過流保護(hù)是驅(qū)動(dòng)電源設(shè)計(jì)中至關(guān)重要的兩個(gè)環(huán)節(jié)，集成化方案的設(shè)計(jì)成為提升電機(jī)驅(qū)動(dòng)性能的關(guān)鍵。

關(guān)鍵字：工業(yè)電機(jī) 驅(qū)動(dòng)電源

[電源]

如何解決 LED 驅(qū)動(dòng)電源的易損壞問題

LED 驅(qū)動(dòng)電源作為 LED 照明系統(tǒng)的 “心臟”，其穩(wěn)定性直接決定了整個(gè)照明設(shè)備的使用壽命。然而，在實(shí)際應(yīng)用中，LED 驅(qū)動(dòng)電源易損壞的問題卻十分常見，不僅增加了維護(hù)成本，還影響了用戶體驗(yàn)。要解決這一問題，需從設(shè)計(jì)、生...

關(guān)鍵字：驅(qū)動(dòng)電源照明系統(tǒng) 散熱

[電力電工電路]

LED設(shè)計(jì)中LED驅(qū)動(dòng)電源的公式

根據(jù)LED驅(qū)動(dòng)電源的公式，電感內(nèi)電流波動(dòng)大小和電感值成反比，輸出紋波和輸出電容值成反比。所以加大電感值和輸出電容值可以減小紋波。

關(guān)鍵字： LED 設(shè)計(jì) 驅(qū)動(dòng)電源

[汽車電子]

EV主驅(qū)IGBT隔離驅(qū)動(dòng)電源方案選擇問題探討

電動(dòng)汽車(EV)作為新能源汽車的重要代表，正逐漸成為全球汽車產(chǎn)業(yè)的重要發(fā)展方向。電動(dòng)汽車的核心技術(shù)之一是電機(jī)驅(qū)動(dòng)控制系統(tǒng)，而絕緣柵雙極型晶體管(IGBT)作為電機(jī)驅(qū)動(dòng)系統(tǒng)中的關(guān)鍵元件，其性能直接影響到電動(dòng)汽車的動(dòng)力性能和...

關(guān)鍵字：電動(dòng)汽車新能源驅(qū)動(dòng)電源

[電源]

合理的驅(qū)動(dòng)電源方案成為大功率區(qū)域照明的主流選擇

在現(xiàn)代城市建設(shè)中，街道及停車場照明作為基礎(chǔ)設(shè)施的重要組成部分，其質(zhì)量和效率直接關(guān)系到城市的公共安全、居民生活質(zhì)量和能源利用效率。隨著科技的進(jìn)步，高亮度白光發(fā)光二極管(LED)因其獨(dú)特的優(yōu)勢逐漸取代傳統(tǒng)光源，成為大功率區(qū)域...

關(guān)鍵字：發(fā)光二極管驅(qū)動(dòng)電源 LED

[消費(fèi)電子]

AC-DC電源轉(zhuǎn)換拓?fù)浣Y(jié)構(gòu)設(shè)計(jì)

LED通用照明設(shè)計(jì)工程師會遇到許多挑戰(zhàn)，如功率密度、功率因數(shù)校正(PFC)、空間受限和可靠性等。

關(guān)鍵字： LED 驅(qū)動(dòng)電源功率因數(shù)校正

[電源]

針對于LED照明驅(qū)動(dòng)電源技術(shù)中的電磁干擾其中的三大硬件問題措施

在LED照明技術(shù)日益普及的今天，LED驅(qū)動(dòng)電源的電磁干擾(EMI)問題成為了一個(gè)不可忽視的挑戰(zhàn)。電磁干擾不僅會影響LED燈具的正常工作，還可能對周圍電子設(shè)備造成不利影響，甚至引發(fā)系統(tǒng)故障。因此，采取有效的硬件措施來解決L...

關(guān)鍵字： LED照明技術(shù) 電磁干擾驅(qū)動(dòng)電源

[電源]

LED驅(qū)動(dòng)電源的核心部分“開關(guān)管”和“變換器”設(shè)計(jì)技巧

開關(guān)電源具有效率高的特性,而且開關(guān)電源的變壓器體積比串聯(lián)穩(wěn)壓型電源的要小得多,電源電路比較整潔,整機(jī)重量也有所下降,所以,現(xiàn)在的LED驅(qū)動(dòng)電源

關(guān)鍵字： LED 驅(qū)動(dòng)電源開關(guān)電源

[電源]

最全LED驅(qū)動(dòng)電源及散熱設(shè)計(jì)方案介紹

LED驅(qū)動(dòng)電源是把電源供應(yīng)轉(zhuǎn)換為特定的電壓電流以驅(qū)動(dòng)LED發(fā)光的電壓轉(zhuǎn)換器，通常情況下：LED驅(qū)動(dòng)電源的輸入包括高壓工頻交流(即市電)、低壓直流、高壓直流、低壓高頻交流(如電子變壓器的輸出)等。

關(guān)鍵字： LED 隧道燈驅(qū)動(dòng)電源