跳至主要内容

什么是语音识别?

什么是语音识别?

语音识别技术会自动将录制的音频转换为数字文本。以前,人们需要收听音频文件并将其键入文本文件,才能将语音内容重新用于不同的媒体。但是现在,语音识别技术使用人工智能将语音转换为文本,提高了准确性和速度。它与声音识别是分开的,后者会按说话人对音频录音进行分类。语音识别提高了数字可访问性、应用程序效率和企业生产力。

语音识别有哪些使用案例?

语音识别软件有多种使用案例。

虚拟助手

语音识别技术的日常使用案例是在 Alexa 等虚拟助手中。用户可以说出语音命令,语音识别软件将其转换为虚拟助手使用的操作。您可以利用它要求助手播放音乐、设置提醒、给某人打电话或在网上搜索信息。

语音识别工具对身体有障碍的人也很有帮助。它们允许人们用声音控制计算机界面。当语音识别软件将语音转换为文本时,可以触发计算机设备上的操作。

转录

企业和个人可以使用语音识别程序自动转录录音、讲座、演示和访谈。通过将语音转换为文本,个人可以听写电子邮件,甚至生成对话转录,从而节省时间和金钱。

语音识别技术还可以记录人们在会议中所说的话。这种方法使您的企业不必指派人做笔记,从而节省了时间并提高了员工的工作效率。

音频内容审核

企业可以使用语音识别应用程序来监控口语和单词序列中是否存在不当语言。自动语音识别可以理解音频和语音信号,从而审核和审查直播中的有毒内容,或使用内容警告标记内容。该方法对于自动审核和增强在线用户安全非常有用。

实时翻译

翻译平台使用语音识别技术自动记录和转录对话。这些工具捕获、翻译,然后使用文本转语音来朗读用另一种语言所说的内容。用户可以与使用另一种语言的说话者进行实时对话。

业务分析

企业可以使用语音识别系统将客户的电话通话转换为转录文本。然后,他们可以从这些对话中提取切实可行的见解,利用这些见解进一步了解客户情绪或通话背景。公司可以利用这些见解提高客户参与度并增强其支持团队的能力。

增强文档

健康、金融、科学、法律和其他专业领域经常使用特定行业的行话,记下这些术语既费时又繁琐。专家可以使用语音转文本软件将语音输入转换为书面文档。使用特定术语进行训练后,语音识别可以理解和处理特定领域的语言。

自然语言处理在语音识别中的作用是什么?

自然语言处理(NLP)是一种机器学习技术,使计算机能够解释、处理和理解人类语言。它是语音识别软件用来将语音转换为文本的核心过程。NLP 帮助这些系统将声音转换为对这些声音可能代表哪些词的准确预测。

消除歧义

由于同音异义词(发音相同但含义不同的词)或发音不清,语音到文本的转换过程会引入歧义。NLP 通过提供上下文信息来帮助应对这些挑战。它使用统计模型来预测一系列单词一起出现的可能性。该预测基于单词出现在训练数据中的频率和模式。这样,它就可以准确识别出在给定上下文中最有可能正确的单词。

复杂的语言特征

人类语言有一些特征,例如讽刺、隐喻、句子结构变化,以及人类需要数年才能学习的语法和特殊用法。程序员使用机器学习方法训练 NLP 应用程序从一开始就识别和准确理解这些特征。这有助于理解语法上可能较为复杂或包含习语表达的语音。

意图识别

NLP 算法可以识别命令、问题或其他意图,然后生成适当的响应或操作,从而使交互更加自然且有效。这方面在语音激活助手和其他交互式系统中尤为重要,在这些系统中,用户期望的不仅是语音的确认,还需要相关的响应或操作。

持续学习

NLP 系统可以从新数据中学习并随着时间的推移而改进。随着这些系统暴露于更多的语音模式、口音、方言和语言,它们会调整其模型以更好地理解和处理语音。它们可以适应个人用户的语音模式并个性化语音识别体验。

语音识别的工作原理是什么?

语音识别系统使用麦克风收集音频声音和对话信号。它们分阶段进行处理,如下所示。

清理

该软件会清理原始音频,对其进行调制以调节音高、音量和速度。在此阶段,计算机语音识别会去除与录音无关的所有背景噪音。

音素识别

有了这个干净的音频文件后,语音识别技术会将录音中的声音分解成单个音素。音素是语言中声音的最小单位。每个音素都与一种数学表示相关,从而使语音识别软件能够确定人们在音频中说了什么。

基于转换器的语音识别技术使用多层卷积网络(CNN)作为特征提取器,该特征提取器接收输入音频信号并输出音频表示,也被视为特征。这些特征被馈送到转换器网络中生成情境化表示。

自然语言处理

转换器架构在各种 NLP 任务中也能取得很好的模型性能和结果。使用大型数据样本训练 NLP 算法可提高算法的准确性。特定领域的数据样本用于确保 NLP 对特定行业的行话和短语做出更准确的预测。该软件使用 NLP,以极有可能的序列将音素组合成单词。

基于转换器的架构的语音识别过程。

语音识别中使用的算法是什么?

语音识别过程使用各种算法来保证正常运行。随着时间的推移,这些不同算法的突出地位正在发生变化。隐马尔可夫模型和动态时间规整正逐渐被 RNN 和说话人分离所取代。

隐马尔可夫模型

隐马尔可夫模型(HMM)是语音识别软件中用于管理语音模式方差的传统算法。不同的口音和方言会导致人们发音不同,HMM 会处理这些潜在的差异。随着带有口音变化的训练数据越来越多,HMM 在声音识别方面变得越来越有效,而在语音识别中的重要性却降低了。

动态时间规整

动态时间规整(DTW)进一步帮助 HMM 使语音识别软件能够理解声音。对话中的两个声音可能以不同的速度和不同的口音说话。DTW 会同步其他声音,加快或减慢它们的速度,确保它们处于相同的速度。

当录音的长度和速度相同时,语音识别软件会发现更容易准确地将音频分解为声音并将这些声音转换为语言假设。

循环神经网络

循环神经网络是一种深度学习形式,它对更传统的语音识别算法进行了改进。RNN 在预测人类语音接下来可能发生的事情时会考虑先前的声音,从而提高其准确性。随着时间的推移,该算法在理解某人的口音和方言时也会得到有效改进,使其对虚拟助手很有用。

说话人分离

说话人分离是现代语音识别系统用来理解声音变化并判断对话中谁在说话的技术。除了识别语音外,这种策略还允许软件识别系统区分录音中的说话人。

生成式人工智能在语音识别中的作用是什么?

生成式人工智能虽然不是语音识别过程的直接组成部分,但在语音识别中起着互补且越来越重要的作用。生成式人工智能将文本从语音识别输出转换为语音。它可以重新生成紧密模仿人类语音模式(包括语调、情感和口音)的语音音频。它可以为虚拟助手、有声读物和语言学习工具等应用程序创建更具交互性和吸引力的用户体验。

生成式人工智能模型能够学习和合成多种语言和方言的语音。它们还可以生成与用户口音相匹配的语音,从而使用户更容易理解设备并与之交互。这种个性化延伸到为无法说话的人创造独特的声音。

AWS 如何为您的语音识别工作提供帮助?

Amazon Transcribe 是一项完全托管的音频转文本服务,使用机器学习快速准确地进行转录。您可以使用 Transcribe 具有的一些功能输入音频,生成易于阅读的转录文本,通过自定义提高特定域的准确性,并编辑敏感的个人信息以确保客户隐私。使用 Amazon Transcribe,您可以:

立即创建免费的 AWS 账户,开始在 AWS 上使用语音识别系统。

Browse all cloud computing concepts

Browse all cloud computing concepts content here:

正在加载
正在加载
正在加载
正在加载
正在加载

Did you find what you were looking for today?

Let us know so we can improve the quality of the content on our pages