语音交互|「做个人吧」!车载语音交互的终极奥义是听相声?( 二 )
既然真人化的声音能让人产生舒适感,为什么不从一开始就把语音拟人化呢?
如果只是追求语音像真人,技术上并不是无法实现。在我们常用的手机导航 App 里,明星们的导航语音就是通过关键词采集后,利用 TTS 语音合成技术来实现,甚至可以达到以假乱真的地步。不过导航 App 的语音只是单方面的输出,并不是双向的交互,不需要识别语音指令,也不需要接收指令后执行任务、给出反馈的步骤。
文章插图
座舱内的语音交互就复杂的多了。
首先,语音系统需要从用户复杂的话语中,迅速、准确地提炼出指令关键词,正确接受指令;同时,需要语音系统还需要车内的软硬件功能打通,把接受的指令准确无误的传达到其他功能区,实现跨软件、甚至跨域的功能调用;最后,才需要语音用真人化的声音来反馈用户。三者相互配合,才能保证行车过程安全,交互体验顺畅。
对于同样的语音调整座椅指令,在汽车停止时,我们对小 P 说「放倒主驾座椅」,可以自动放倒主驾座椅;而当车辆开始行驶时,系统会拒绝执行,禁止开车时自动调整座椅。这样,可以避免开车时座椅突然放倒带来的危险。
文章插图
就算排除了安全隐患,如果前两项任务做的不好,只有声音的拟人化,也会在体验上出现「反噬」效果。
宾夕法尼亚大学媒体效果研究实验室曾经做过一个实验,他们把智能语音客服分类,一类标注上机器人客服,一类假装成真人客服。让志愿者在不知情的情况下与客服沟通、咨询,然后主观打分。同样的沟通过程,志愿者给机器人客服打出 80 分,而假装成真人的客服只得到 60 分。
原因很简单,当语音系统伪装成了真人,志愿者潜意识里就会用真人的标准来评价它,如果语音助手不能提供真人化的功能服务,反而会收获「差评」。
所以,为了做好用户对语音系统的「期待值管理」,拟人化语音要搭配「拟人化」的性能一起使用。
不论是宝马 iDrive 8.0,还是小鹏最新的小 P,推出拟人化语音,基于深度神经网络来提升语音逼真感,同时也提搭配了连续对话、多轮对话、自然语音识别、可见即可说,甚至语音与摄像头、触屏等其他交互模式配合的多模态语音模式,让语音在听起来像人的同时,也能名副其实。
比如,面对生活中常出现的方言、每个用户不同的用词习惯,语音系统既要通过深度学习来掌握语言指令的共性和特征,也需要一个聪明的「大脑」,能根据用户自己的习惯来进一步学习个体行为,满足个性化需求。
在小鹏小 P 系统的体验中,就遇到了在播放视频时,说「取消全屏」,系统直接帮我关闭了中控屏幕的情况。看来语音助手要更懂事儿,还需要更多的磨合。
比如,为了让语音交互更主动、更精确,语音需要联手座舱内的传感器和其他交互方式,用多模态交互的方式来察言观色,提供更周到的交互体验。
在宝马 iDrive 8.0 中,就预告了语音系统与车内摄像头配合,通过捕捉用户的表情来进一步精确指令,让语音系统听得懂用户的弦外之音。
文章插图
当然,当语音助手「真人化」到一定程度,就像逼真的 AI 换脸技术有可能被用到灰色地带的潜在风险一样,关于人工智能伦理和安全性的探讨也会成为一个不得不考虑的问题。
语音助手的拟人化,在给用户提供声音抚慰的同时,更重要的是带来全场景的服务。
- 36氪首发|烹饪机器人公司「智谷天厨」获数千万元天使轮融资,羲融善道独家投资
- 社交|腾讯视频为IP编写「价值算法」
- 电影|录人「过节」, 平台「走新」
- 软件|简单但必学的几款交互软件
- 华为鸿蒙系统|18个月显卡花费150亿美元,以太坊「矿工」即将停止开采
- 「科学」郑作新:与鸟儿同行
- Room|VR社交应用「Rec Room」注册用户已达7500万
- AirPods|iOS 16 内部流出,苹果「王炸」新品年底见
- 尼康|尼康Nikon新机「Z6 III」或将在今年秋季发布
- 福布斯|36氪首发 | 专攻特医食品市场,「科露宝」获数千万元A+轮融资
