跳至主要内容

什么是声音识别?

什么是声音识别?

声音识别是使用人工智能识别特定用户声音的过程。基于语音的现代技术可以由用户声音控制,但声音识别不止于此。该技术识别和验证一个人的声音,并根据其独特的声纹区分多个用户身份。声音识别技术在医疗保健、金融和其他需要由人类语音控制的高度安全系统的领域有多种应用。

声音识别有哪些使用案例?

多种不同类型的企业都可以在其运营中使用声音识别。

基于声音的医疗协助

医学领域有许多声音识别使用案例,对患者和医生都有帮助。医疗机构可以使用声音识别程序来接听患者的电话,要求他们确认症状,然后提供示例性医疗建议。如果症状与更严重的病情相符,系统可以将其转介至远程医疗预约。声音识别还允许患者用声音确认身份并访问其病历。

自动化金融交易

金融机构开始使用声音识别软件来验证客户的身份。软件可以要求客户验证部分账户详细信息对说话人进行身份验证,然后再将他们重定向到客户服务。

或者,一些声音识别平台允许客户通过语音聊天支付账单。软件通过提出一系列有具体答案的问题来验证用户的身份。经过身份验证后,用户可以访问其账户并使用声音命令说出他们想要支付的款项。然后,声音识别平台与用户的银行账户进行通信,以安排付款。

自动客户服务平台可以减轻客户服务座席的工作负担,同时降低运营成本。

航空中的飞行控制

飞行员在使用飞行系统时通过声音控制访问信息或进行细微调整。声音识别软件可以理解飞行员的特定命令,并在必要时进行飞行调整。通过依靠声音识别软件,飞行员可以减少工作量,同时提高安全性。

将声音识别应用程序配置为仅识别飞行员和副驾驶的声音生物特征,可确保飞行期间不受干扰。只有直接匹配时,软件才会启动声音命令。

声音识别是如何运作的?

声音识别的工作原理如下。

音频捕获

声音识别从音频捕获开始。软件会听取口语内容并将其捕获为录音。然后,对音频进行处理和标准化,消除背景噪音,并确保整个录制过程中的音量保持规律。

声纹分析

声纹是指语音生物识别,例如音调、口音、音高或频率变化。这些是构成个人声音的独特特征。捕获音频后,声音识别技术会分析声纹以了解说话人的说话方式。将声纹信息存储在已知录音的数据库中。

声音身份验证

当用户对系统说话时,该技术会记录音频,将其分解为单个声音,然后将其与存储的数据进行比较。人工智能模型使用深度学习和自然语言处理来比较各个语音发音、音高和音调。

如果用户的声音生物识别信息与记录相符,声音识别平台会验证身份。如果平台拥有某人声音的多个样本,声音识别的准确性会提高。一些说话人识别平台允许用户说出预先录制的特定句子,这有助于进一步提高识别准确性。

声音识别系统有哪些类型?

有两种不同类型的声音识别系统,都旨在验证说话人的身份。

文本相关

文本相关型声音识别系统要求用户说出预先确定的短语作为身份验证或识别的密码。用户在系统注册时配置该短语。例如,“这是 [姓名]。”

声音识别软件将用户独特的声纹与预先录制的数据进行比较。如果音高、音调、口音和频率都匹配,软件就会验证此人的身份。

文本相关型系统的集成成本较低,因此适合银行和医疗机构。

文本无关

文本无关型声音识别系统更为复杂,不需要特殊的密码短语。用户只需说话,平台会记录并分析独特的声音特征,例如背景中的音高、音调和说话风格,与所说的具体词语无关。

作为一种更灵活、连续的语音识别系统,文本无关型侦听成本更高,实施起来也更复杂。

声音识别和语音识别软件之间有什么区别?

语音识别是一个更广泛的领域,涉及各种形式的声音识别,包括语音转文本、虚拟助手和其他不需要身份验证的使用案例。声音识别是一种特殊类型的语音识别,侧重于识别和验证人的声音。语音识别仅在需要在允许用户访问其功能之前对用户进行身份验证时才使用声音识别技术。

声音识别以外的语音识别使用案例

所有声音识别都是语音识别,但并不是所有语音识别都是声音识别。语音识别技术还提供了一系列不使用声音识别的其他使用案例。

转录

语音识别技术听取录音,然后使用先前口语词汇示例的语料库来准确地转录录音。转录语音处理有时会与其他技术(例如语言建模)相结合,以提供有关语音录制的详细信息。例如,组织可以监控客户沟通中的情绪和意图。

为视频添加字幕

自动语音识别工具可以生成字幕,有助于提高这些视频源的可访问性。这样您就可以覆盖更广泛的受众,并更快地将内容重新用于多语言受众。

毒性检测

通过监控用户的音高、语气和词汇,语音识别平台可以识别某人何时使用暴力语言或仇恨言论。这些平台可以检测毒性类别,例如亵渎、露骨语言或骚扰,并可以帮助进行自动审核。

AWS 如何帮助满足您的语音和声音识别需求?

Amazon Transcribe 是一项完全托管的语音识别服务,使用人工智能快速准确地进行转录。该服务依托于下一代数十亿参数语音基础模型,可为流式传输和录制的语音提供高度准确的转录服务。例如,Amazon Transcribe 可以:

  • 处理实时和录制的音频或视频输入,为搜索和分析提供高质量的转录。
  • 处理各种语音和声学特征,包括音量、音高和语速变化。
  • 在转录结果中掩盖或删除敏感或不适合您的受众的词语。
  • 为每个句子提供多达 10 个备选转录文本,帮助您快速为内容和领域选择最佳选项。

立即创建免费的 AWS 账户,开始在 AWS 上使用语音和声音识别。

Browse all cloud computing concepts

Browse all cloud computing concepts content here:

正在加载
正在加载
正在加载
正在加载
正在加载

Did you find what you were looking for today?

Let us know so we can improve the quality of the content on our pages