人工智能开源硬件与python编程实践 课件 项目15、16 语音识别与Python编程实践、 语音交互控制智能相机设计综合实践.ppt

人工智能开源硬件与python编程实践 课件 项目15、16 语音识别与Python编程实践、 语音交互控制智能相机设计综合实践.ppt

  1. 1、本文档共36页,可阅读全部内容。
  2. 2、原创力文档(book118)网站文档一经付费(服务费),不意味着购买了该文档的版权,仅供个人/单位学习、研究之用,不得用于商业用途,未经授权,严禁复制、发行、汇编、翻译或者网络传播等,侵权必究。
  3. 3、本站所有内容均由合作方或网友上传,本站不对文档的完整性、权威性及其观点立场正确性做任何保证或承诺!文档内容仅供研究参考,付费前请自行鉴别。如您付费,意味着您自己接受本站规则且自行承担风险,本站不退款、不进行额外附加服务;查看《如何避免下载的几个坑》。如果您已付费下载过本站文档,您可以点击 这里二次下载
  4. 4、如文档侵犯商业秘密、侵犯著作权、侵犯人身权等,请点击“版权申诉”(推荐),也可以打举报电话:400-050-0827(电话支持时间:9:00-18:30)。
查看更多
语音识别与Python编程实践 人工智能开源硬件与python编程实践 情境导入 语音识别发展到现在,从语音打字机、数据库检索到特定的环境所需的语音命令, 给人们的生活带来了很多方便。语音识别人机交互技术是典型的人工智能方法,在智能家居、智能驾驶、智能手机中都有成熟的应用。 智能玩具开始大量应用人工智能技术,市场上出现了大批可以讲故事、唱歌曲、说英语的益智玩具,通过语音识别人机交互技术,大幅提升了玩具的互动性、教育性、智能性和娱乐性,满足了知识学习、娱乐、科学探究、智力开发等多重需求。 任务与目标 了解语音识别的基本原理、相关算法和应用框架; 了解运用人工智能开源硬件设计语音识别应用系统的方法; 运用人工智能开源硬件和Python编程库,编写和调试初步的语音识别应用Python程序; 掌握利用OpenAIE IDE编程工具编写、上传、运行、完善Python语音识别程序的方法。 知识拓展:语音识别的概念 语音识别技术可以比做为“机器的听觉系统”,就是让机器通过识别和理解过程把语音信号转变为相应的文本或命令的方法。 语音识别技术主要包括语音特征提取、模式识别及声学模型训练技术三个方面。 知识拓展:语音识别技术的发展历史 50年代,AT&T Bell实验室实现了第一个可识别十个英文数字的语音识别系统-Audry系统。 60年代,动态规划 (DP) 和线性预测分析技术 (LP) 等技术的提出和运用,对语音识别的发展产生了深远影响。 70年代,动态时间归整正技术 (DTW) 开始成熟,特别是矢量量化 (VQ) 和隐马尔可夫模型 (HMM) 得到运用,实现了基于线性预测倒谱和DTW技术的特定人孤立语音识别系统。 20世纪80年代,随着HMM模型和人工神经元网络 (ANN) 等技术在语音识别中的成功应用,人们突破了大词汇量、连续语音和非特定人这三大语音识别障碍。 知识拓展:隐马尔科夫模型的应用 CMU的李开复实现了第一个基于隐马尔科夫模型的大词汇量语音识别系统Sphinx,它是第一个高性能的非特定人、大词汇量连续语音识别系统 ; 在声学识别层面,以多个说话人发音的大规模语音数据为基础,通过对连续语音中上下文发音变体的HMM建模, 语音音素识别率有了长足的进步 。 知识拓展:语音信号的短时特性 语音信号的特征是随时间变化的,具有短时性,在5-50ms的一段时间间隔中,保持相对稳定一致的特性。 语音信号的分析和处理都是建立在“短时”的基础上,按5-50ms分成语音帧进行处理,重要的计算参数有短时能量、短时过零率、短时自相关函数、短时频谱等。 设计与实践 人工智能开源硬件语音识别处理模块 OpenAIE IDE的使用 编写第一个嵌入式Python程序 调试、验证及完善 人工智能开源硬件语音识别处理模块 AIE控制板上固化除了有计算机视觉CV库、板上器件及接口pyb库外,还有连续非特定人语音识别ASR库。该ASR库基于板上集成的语音识别处理器的特性进行设计,提供一个与语音识别相关的asr对象给外部Python程序调用。 拾音器 ASR处理器 按键 语音识别处理器 语音识别处理器基于ASR技术,具有降噪、端点检测、语音识别等功能。语音识别处理器内置有高精度的A/D和D/A通道,设计时直接把拾音器连接在处理器芯片的AD 引脚上,不需要外接 AD 芯片,不需要外接辅助的Flash 和 RAM,就能完成说话语音的实时采集。 语音识别处理器内含有事先训练好的声学模型参数库,由大批量非特定人普通话连续语音语料训练而成,支持ASR连续语音识别,应用时不需要再进行任何录音训练。 定义语音识别工作场景 语音识别处理器允许用户定义一张识别关键词语列表,应用中还可以动态编辑和维护这张识别关键词语列表。只需要把关键词语以字符串的形式传送给芯片,即可以在下次识别过程中生效。每个关键词语可以是单字、词组、短句或者任何的中文发音的组合。 板上语音识别处理器目前支持用户自由编辑50条关键词词条,即在同一时刻,最多在50 条关键词语中进行识别。编程设计时可以根据工作场景的需要,动态编辑和更新这50条关键词语的内容。 语音识别Python类的设计 语音识别ASR Python库基于板上集成的语音识别处理器的特性进行设计,采用Python语言进行编写,主要设计和封装了一个asr类给外部Python程序引用。 该asr类主要提供设置工作场景命令词add_cmd()、启动识别过程run()、获取识别结果get_res()等方法供应用程序使用。 ASR语音识别类的Python调用方法 导入asr类模块 创建语音识别对象实例 初始化语音识别对象 设置工作场景,添加关键词识别列表 启动语音识别 等待语音识别结果 提取语音识别结果 ASR语音识别类初始化编

您可能关注的文档

文档评论(0)

balala11 + 关注
实名认证
内容提供者

该用户很懒,什么也没介绍

1亿VIP精品文档

相关文档