ICASSP已从信号处理延伸至语义理解,形成涵盖声学处理与自然语言理解的融合谱系。端到端神经网络取代传统分解式系统,通过共享表示和联合训练提升准确性与效率,并整合高层语言特征。未来挑战在于结合半监督学习与逻辑推理。

Alexa科学家Ariya Rastrow探讨声学处理与语言理解之间日益模糊的界限。
长期稳定更新的攒劲资源: >>>点此立即查看<<<
作者:Larry Hardesty | 2020年5月4日 | 阅读时间6分钟
会议:ICASSP 2020
国际声学、语音与信号处理会议(ICASSP)至今已有45年历史,在谷歌学术排名中,其信号处理领域的影响力始终位居前列。随着语音技术的快速发展,信号处理概念的边界已被显著扩展。Alexa首席研究科学家Ariya Rastrow指出:“如今的ICASSP已经成为一个大熔炉,涵盖从底层信号处理到语义理解与自然语言理解的完整谱系。”
Alexa高级首席科学家Ariya Rastrow(图片来源:Jordan Stead)
为何会出现这种变化?Rastrow给出的答案颇为直接:人类音频处理系统本身具备高度复杂性。大脑并非仅依据声学信号来识别文字,计算机系统同样不应如此操作。
“从人类角度看,语言与声学之间的交互极为动态,”Rastrow解释道,“如果在非常安静的环境中交流,我们能够在声学层面进行高精度跟踪。但若身处嘈杂的酒吧,人类会更多地依赖先验知识——在语义层面猜测对方可能说出的内容、可能涉及的话题——并利用这些信息弥补声音信号的不足。”
传统上,口语理解任务被机械地划分为两个部分:自动语音识别(ASR),负责将声学信号转换为文字;自然语言理解(NLU),负责理解文字的含义。然而,语音识别本身往往需要借助更高层的语言特征来推测词语。传统ASR系统由三部分构成:声学模型(将声学信号转换为音素)、词典(将音素序列映射到词语)、语言模型(利用词语共现的高层统计信息裁决不同解释)。
Rastrow回忆道:“二十到二十五年前,采用这种分解式系统是务实的做法。各组件之间界限清晰。传统语音识别系统基于隐马尔可夫模型(HMM)架构,推理时会整合多个知识源,但声学模型和语言模型是分开训练的。”
然而,这一套路近年来已被基于神经网络的大规模端到端训练架构所取代——单个神经网络直接接收声学输入和完整转录输出样本,从头到尾学习之前分散在ASR各组件中的全部关联。
Rastrow表示:“其优势显著。首先,联合训练使系统在准确性上得到优化。分解式系统中每个组件按各自特定目标函数训练,推理时难以应对不流畅和错误。借助架构进步、联合训练与多任务训练,系统对这些混乱状况的鲁棒性大幅提升。”
“另一个优势是效率,”他继续说道,“通过知识迁移、联合训练或共享表示,系统的不同部分可以共用相同的表示或网络层。这能够压缩整体规模、加速执行,为部署在资源有限的设备和硬件上创造条件。”
举例而言:若需同时进行声学事件检测、唤醒词检测与耳语检测——这些虽属不同类型的音频分类任务——可以分别构建系统,也可采用知识迁移和共享表示学习。凭借共享的网络组件和层,除了准确性提升外,效率亦显著提高。
“此外,整个系统运行在神经网络执行框架内,我们清楚如何从软件和硬件两方面加速。但基于显式知识表示的词典和语言模型系统则不具备这一特性——它们传统上不属于深度学习范畴,无法利用这些效率机制。过去两三年,我们一直在朝这一方向推进。”
让单个大模型将ASR底层的声学信号处理与高层语言建模整合起来,意味着可以利用更高层的语言特征。例如:在2020年ICASSP发表的一篇论文中,Alexa研究人员报告了使用语义特征区分针对Alexa的语音与非针对Alexa的语音——以往的“设备定向”检测器仅依赖声学特征。
这种整合的终极形态,自然是能够执行完整口语理解任务(包括ASR与NLU)的单一神经网络。
“新兴研究表明,”Rastrow指出,“至少对于部分交互场景,可以构建占用空间较小的单一网络,直接将音频转换为语义层面。延迟更小,无需分阶段执行。此外,有研究显示人类并非逐词识别——对话话题与语义的重要信息会直接打包进语音之中。”
“但挑战仍然存在,”他补充道,“这些全神经网络系统对数据依赖极大。一旦接近理解层面,便会面临数据稀疏性与独特交互细微差别的问题。在声学层面,如音素/p/,即使跨语言也能找到大量样本。但越靠近语义与句子级理解,模式就越具独特性。”
“一个挑战是如何将这些直接音频到NLU的新架构与我们在半监督/无监督学习方面的进展结合。另一个挑战则是如何将极度依赖数据的学习系统与某种推理或逻辑相融合。”
“举个例子:你说‘打开卧室灯’,Alexa误开了厨房灯,你又说‘不,Alexa,别打开厨房灯’——这就涉及否定问题。你说‘别打开它’时,实际意思是‘关掉它’。此类例子在数据中很难找到。传统上,我们知道如何用规则、逻辑和推理解决,但仅凭数据可能无法提供良好的表示。因此,未来两三年要研究的方向是:如何将这些系统与半监督/无监督学习结合,如何与知识和逻辑结合。”
对话式人工智能
标签:人工智能(AI)、自动语音识别(ASR)、信号处理、端到端学习、自然语言理解(NLU)、自然语言处理(NLP)
会议:ICASSP 2020
关于作者:Larry Hardesty,某机构科学博客编辑。曾任《麻省理工科技评论》高级编辑和麻省理工学院新闻办公室计算机科学撰稿人。
侠游戏发布此文仅为了传递信息,不代表侠游戏网站认同其观点或证实其描述