我是h1

 

地址: 深圳湾科技生态园5栋D座1302室
客服电话:
4008400488
邮箱: bd@rainxn.com

墨客星球

友情链接

© 2019 深圳雨本信息技术有限公司 | 粤ICP备17123203号 网站建设:中企动力 深圳

联系我们

最新文章

亚马逊宣布再裁员9000人,CEO称2023年首要原则是精简;南京大学团队重复实验再次推翻美国室温超导轰动性研究
亚马逊宣布再裁员9000人,CEO称2023年首要原则是精简;南京大学团队重复实验再次推翻美国室温超导轰动性研究
支付宝安全中心提醒“山寨 ChatGPT”骗局;我国已完全掌握量子计算用极低温稀释制冷机关键核心技术,实现接近绝对零度
支付宝安全中心提醒“山寨
腾讯46岁T13技术大佬黄希彤被曝遭裁员;台积电美国厂整体建设和设备安装进度已被推迟
腾讯46岁T13技术大佬黄希彤被曝遭裁员;台积电美国厂整体建设和设备安装进度已被推迟
共享办公巨头WeWork与投资者谈判重组超30亿美元债务;奇瑞领导回应周六要上班争议邮件:本意是不是压榨,鼓励愿意努力的奋斗
共享办公巨头WeWork与投资者谈判重组超30亿美元债务;奇瑞领导回应周六要上班争议邮件:本意是不是压榨,鼓励愿意努力的奋斗
王兴宣布美团网约车业务调整:后续将减少资源和人力投入,轻装前行;京东百亿补贴商品不支持价保,称已经十分优惠
王兴宣布美团网约车业务调整:后续将减少资源和人力投入,轻装前行;京东百亿补贴商品不支持价保,称已经十分优惠
科大讯飞否认利用绩效回溯变相降薪;全国政协委员谈“996”:严重违背劳动法规 加班问题让年轻人没时间结婚生娃
科大讯飞否认利用绩效回溯变相降薪;全国政协委员谈“996”:严重违背劳动法规

依图科技发布语音开放平台,字错率仅3.71%

区块链
阳光
2018年12月11日
浏览量
【摘要】:
12月11日,人工智能公司依图科技公布了在中文语音识别技术上的最新突破。在全球最大的中文开源数据库AISHELL-2中,依图短语音听写的字错率(CER)仅为3.71%,号称比原业内领先者提升约20%。语音识别技术远未成熟,技术透明度差 近年来,深度学习的爆发驱动了语音识别技术的高速发展,但相较于人脸识别在准确率方面的高增速来说,语音识别的发展仍较为缓慢。尽管一些机构已宣传达到了人类水平,但大多数情

12月11日,人工智能公司依图科技公布了在中文语音识别技术上的最新突破。在全球最大的中文开源数据库AISHELL-2中,依图短语音听写的字错率(CER)仅为3.71%,号称比原业内领先者提升约20%。

语音识别技术远未成熟,技术透明度差

 

近年来,深度学习的爆发驱动了语音识别技术的高速发展,但相较于人脸识别在准确率方面的高增速来说,语音识别的发展仍较为缓慢。尽管一些机构已宣传达到了人类水平,但大多数情况下都来自安静、近场等受限场景。对于电话、语音节目、远场等更复杂场景,则需要针对性地开发不同模型,但实际应用中的不确定性,使理想和现实仍有较大差距,导致应用场景难以得到更大突破。

依图科技发布语音开放平台,字错率仅3.71%

 

对语音识别来说,语速、语态、语气、口音等都会显著影响识别的准确率。一般认为,字错率在低于3%时不会影响可读性,而超过15%则毫无可读性。这两个数据可认为是语音识别的两条红线,而在不同场景下,不同算法的表现可能会有很大差异。在中文语音识别技术领域,汉语的博大精深带来的同音不同意等问题,更对语音识别的处理难度带来极大挑战,显著影响最终的使用体验。

依图首席创新官吕昊博士表示,“语音识别技术经历了漫长的发展进化,但至今都只能在受限的场景下才能达到较好的使用效果。我们认为,核心技术的突破,依然是当前破局中文语音识别发展的关键。”

讯飞依图位列第一阵营?

 

据介绍,依图此次推出的中文语音识别算法,与业内原有领先者相比,大幅提升了识别准确率,且在单个算法模型上,有极为出色的多场景适用性表现。

依图科技发布语音开放平台,字错率仅3.71%

在业内近期公开的AISHELL-2的三个测试子集,以及来自第三方的近场口音测试集、近场安静聊天测试集、语音节目测试集、电话测试集、远场测试集中,依图均处于业界领先水平,且字错率几乎全部在15%以下。其中,在AISHELL2-2018A-EVAL数据集中,依图的识别准确率高达96.29%,字错率(CER)仅为3.71%,领先行业第二名约20%。

值得一提的是,通过“听写大会”微信小程序,用户可以直观感受到语音识别技术的真实表现。

(注:AISHELL-2是AISHELL Foundation和希尔贝壳宣布的开源数据库,数据规模达1000小时,是目前全球最大的中文开源数据库。它由1991名来自中国不同口音区域的发言人参与录制,经过专业语音校对人员转写标注,通过了严格质量检验,数据库文本正确率在96%以上,录音文本涉及唤醒词、语音控制词、智能家居、无人驾驶、工业生产等12个领域。)

依图预计,在未来6个月到12个月,语音识别技术的算法性能将呈指数级增长,更多的场景将被解锁,为行业应用带来更大的价值。

依图科技发布语音开放平台,字错率仅3.71%

为回馈墨客星球的粉丝,我们特意保留了10张区块链存储峰会的内部门票,关注墨客星球微信,回复“门票”即可免费获取。