基于DSP+FPGA的機(jī)器人語音識別系統(tǒng)的設(shè)計(jì)

作者：時(shí)間：2010-12-12 來源：網(wǎng)絡(luò)

加入技術(shù)交流群
- 掃碼加入
  和技術(shù)大咖面對面交流
  海量資料庫查詢

1 引言

機(jī)器人聽覺系統(tǒng)主要是對人的聲音進(jìn)行語音識別并做出判斷，然后輸出相應(yīng)的動作指令控制頭部和手臂的動作，傳統(tǒng)的機(jī)器人聽覺系統(tǒng)一般是以PC機(jī)為平臺對機(jī)器人進(jìn)行控制，其特點(diǎn)是用一臺計(jì)算機(jī)作為機(jī)器人的信息處理核心通過接口電路對機(jī)器人進(jìn)行控制，雖然處理能力比較強(qiáng)大，語音庫比較完備，系統(tǒng)更新以及功能拓展比較容易，但是比較笨重，不利于機(jī)器人的小型化和復(fù)雜條件下進(jìn)行工作，此外功耗大、成本高。

本文引用地址：http://butianyuan.cn/article/151217.htm

本次設(shè)計(jì)采用了性價(jià)比較高的數(shù)字信號處理芯片TMS320VC5509作為語音識別處理器，具有較快的處理速度，使機(jī)器人在脫機(jī)狀態(tài)下，獨(dú)立完成復(fù)雜的語音信號處理和動作指令控制，FPGA系統(tǒng)的開發(fā)降低了時(shí)序控制電路和邏輯電路在PCB板所占的面積，使機(jī)器人的大腦的語音處理部分微型化、低功耗。一個(gè)體積小、低功耗、高速度能完成特定范圍語音識別和動作指令的機(jī)器人系統(tǒng)的研制具有很大的實(shí)際意義。

2 系統(tǒng)硬件總體設(shè)計(jì)

系統(tǒng)的硬件功能是實(shí)現(xiàn)語音指令的采集和步進(jìn)電機(jī)的驅(qū)動控制，為系統(tǒng)軟件提供開發(fā)和調(diào)試平臺。如圖1所示。

系統(tǒng)硬件分為語音信號的采集和播放，基于 DSP的語音識別，FPGA動作指令控制、步進(jìn)電機(jī)及其驅(qū)動、DSP外接閃存芯片，JTAG口仿真調(diào)試和鍵盤控制幾個(gè)部分。工作流程是麥克風(fēng)將人的語音信號轉(zhuǎn)化為模擬信號，在經(jīng)過音頻芯片TLV320AIC23量化轉(zhuǎn)化成數(shù)字信號輸入DSP．DSP完成識別后，輸出動作指令。

FPGA根據(jù)DSP輸入的動作指令產(chǎn)生正確的正反轉(zhuǎn)信號和準(zhǔn)確的脈沖給步進(jìn)電機(jī)驅(qū)動芯片，驅(qū)動芯片提供步進(jìn)電機(jī)的驅(qū)動信號，控制步進(jìn)電機(jī)的轉(zhuǎn)動。片外 FLASH用于存儲系統(tǒng)程序和語音庫并完成系統(tǒng)的上電加載。JTAG口用于與PC機(jī)進(jìn)行聯(lián)機(jī)在線仿真，鍵盤則用于參數(shù)調(diào)整和功能的切換。

3 語音識別系統(tǒng)設(shè)計(jì)

3．1 語音信號的特點(diǎn)

語音信號的頻率成分主要分布在300～3400Hz之間，根據(jù)采樣定理選擇信號的采樣率為8 kHz。語音信號的一個(gè)特點(diǎn)在于他的短時(shí)性，有時(shí)在一個(gè)短時(shí)段呈現(xiàn)隨機(jī)噪聲的特性，而另一段表現(xiàn)周期信號的特性，或二者兼而有之。語音信號的特征是隨時(shí)間變化的，只有一段時(shí)間內(nèi)，信號才表現(xiàn)穩(wěn)定一致的特征，一般來說短時(shí)段可取5～50 ms，因此語音信號的處理要建立在其短時(shí)性上[2]，系統(tǒng)將語音信號幀長設(shè)為20 ms，幀移設(shè)為10 ms，則每幀數(shù)據(jù)為160×16 b。

3．2 語音信號的采集和播放

語音采集和播放芯片采用的是TI公司生產(chǎn)的TLV320AIC23B，TLV320AIC23B的模數(shù)轉(zhuǎn)換(ADC)和數(shù)模轉(zhuǎn)換(DAC)部件高度集成在芯片內(nèi)部，芯片采用8 k采樣率，單聲道模擬信號輸入，雙聲道輸出。TLV320AIC23具有可編程特性，DSP可通過控制接口來編輯該器件的控制寄存器，而且能夠編譯 SPI，I2C兩種規(guī)格的接口，TLV320AIC23B與DSP5509的電路連接如圖2所示。

DSP采用I2C口對TLV320AIC23的寄存器進(jìn)行設(shè)置。當(dāng)MODE=O時(shí)，為I2C規(guī)格的接口，DSP采用主發(fā)送模式，通過I2C口對地址為 0000000～0001111的11個(gè)寄存器進(jìn)行初始化。I2C模式下，數(shù)據(jù)是分為3個(gè)8 b寫入的。而TLV320AIC23有7位地址和9位數(shù)據(jù)，也就是說，需要把數(shù)據(jù)項(xiàng)上面的最高位補(bǔ)充到第二個(gè)8 B中的最后一位。

MCBSP串口通過6個(gè)引腳CLKX，CLKR，F(xiàn)SX，F(xiàn)SR，DR和CX與TLV320AIC23相連。數(shù)據(jù)經(jīng)MCBSP串口與外設(shè)的通信通過DR和 DX引腳傳輸，控制同步信號則由CLKX，CLKR，F(xiàn)SX，F(xiàn)SR四個(gè)引腳實(shí)現(xiàn)。將MCBSP串口設(shè)置為DSP Mode模式，然后使串口的接收器和發(fā)送器同步，并且由TLV320AIC23的幀同步信號LRCIN，LRCOUT啟動串口傳輸，同時(shí)將發(fā)送接收的數(shù)據(jù)字長設(shè)定為32 b(左聲道16 b，右聲道16 b)單幀模式。

3．3 語音識別程序模塊的設(shè)計(jì)

為了實(shí)現(xiàn)機(jī)器人對非特定人語音指令的識別，系統(tǒng)采用非特定人的孤立詞識別系統(tǒng)。非特定人的語音識別是指語音模型由不同年齡、不同性別、不同口音的人進(jìn)行訓(xùn)練，在識別時(shí)不需要訓(xùn)練就可以識別說話人的語音[2]。系統(tǒng)分為預(yù)加重和加窗，短點(diǎn)檢測，特征提取，與語音庫的模式匹配和訓(xùn)練幾個(gè)部分。

新聞中心

基于DSP+FPGA的機(jī)器人語音識別系統(tǒng)的設(shè)計(jì)

評論

相關(guān)推薦

技術(shù)專區(qū)