什么是推理?
什么是 AI 推理?
推理是人工智能模型基于新数据生成有理据的预测或输出结果的过程。完成完整的模型训练流程后,AI 模型将具备一组习得参数与表征。模型收到新输入数据后,即可借助上述参数与表征生成输出结果。推理发生在人工智能(AI)应用程序的运行时与部署阶段,可支撑各类实际使用案例。
为什么推理很重要?
AI 推理是 AI 模型基于未见过的输入数据生成输出的过程。模型训练阶段,模型从训练数据集习得通用模式;训练完成后,AI 模型通过推理将该类通用模式作用于新数据。
例如,AI 模型可基于医护人员标注的医学影像扫描样本开展训练。AI 训练期间,模型会提取数据中的视觉线索与关联特征。训练完成后,模型可通过推理,在新扫描影像中识别潜在肿瘤或异常病灶。可由医护人员针对同一批扫描影像给出判读结论,以此核验推理结果的准确度。
传统分析技术需要人工定义规则、选定统计方法;而模型训练能够挖掘人工几乎无法通过代码编写实现的复杂模式。这类模式来源于数十亿个模型参数。推理将上述已习得的模式作用于新数据。
机器学习推理有哪些类型?
机器学习(ML)推理分为多种不同类型。
批量推理
批量推理指 AI 以成批输入数据的方式执行预测。批量推理适用于非时间敏感应用程序,可容忍推理结果延迟返回。例如,企业分析生成式人工智能应用程序可按每小时执行更新处理,无需实时响应。
边缘推理
边缘 AI 推理是指 AI 模型在用户设备上或靠近数据源处运行。无需将数据传输至中央处理枢纽,边缘推理可将网络延迟降至极低,甚至实现零延迟。边缘推理尤其适用于网络条件较差的偏远区域,或是推理功能至关重要的设备;但其处理速度受设备性能与模型延迟制约。
实时推理
实时推理指根据输入请求即时生成 AI 推理结果的过程。AI 模型接收来自用户输入或所连接数据来源的数据,从而需要即时输出推理结果。实时推理需要极低延迟的 AI 系统支撑,普遍用于时间敏感业务系统。例如自动驾驶汽车就采用实时推理,依靠极低推理延迟实现实时决策。
流式推理
流式推理指数据管线持续向 AI 模型推送数据,模型实时输出流式推理结果。流式推理与实时推理虽有相似之处,但流式推理会基于输入数据流持续生成输出。实时推理针对用户输入或即时请求做出响应;流式推理则持续输出源源不断的 AI 预测结果。
推理是如何运作的?
多项技术与数据系统协同配合,共同搭建 AI 推理所需基础设施。
机器学习模型基础设施
必须完成完整的机器学习模型训练流程,方可执行 AI 推理。AI 模型部署前,必须依次完成训练、微调、验证以及推理优化多个环节。
生产环境下的已训练 AI 模型需要消耗大量算力,可使用图形处理单元(GPU)、中央处理单元(CPU)以及 Amazon Inferentia 等专用 AI 加速器。算力还需要存储、网络与数据管线提供支撑。
用户输入与数据预处理
为保障模型正常执行 AI 推理,输入模型的数据必须经过预处理。可借助各类技术完成数据转换:视觉模型使用归一化,大语言模型(LLM)使用分词;同时可对数据做清洗,尽可能提升数据质量。
推理过程
推理过程读取清洗后的干净数据,执行前向传播:将预处理数据流经模型各层完成运算,生成输出结果。该过程包含一系列复杂运算。
输出生成与后处理
完成前向传播运算后,模型生成输出结果。模型输出基于 AI 训练数据习得的模式生成,得到全新预测结果。
后处理会对模型全部输出进行扫描、过滤与格式整理,排查不符合预设护栏与策略的输出内容。例如,护栏可拦截不雅用语与有害内容,格式处理则可以让输出内容匹配企业的表达风格。
AI 模型的推理存在哪些挑战?
构建 AI 模型推理能力时,需要攻克多项挑战。
模型漂移
模型漂移指随着时间推移,新的真实业务数据与训练数据出现偏差,导致模型最终版本效果逐步下降。当输入数据内的特定模式随时间发生偏移,即产生数据漂移。若模型权重沿用历史 AI 训练数据保持固定,新数据出现此类偏移后,模型输出就会出现错误。
此外,概念漂移指模型输入与输出的对应关系随时间发生改变。对应关系发生改变或复杂度提升,便会引发概念漂移。例如,AI 模型需要判断收到的邮件是否属于网络钓鱼攻击时,会依据习得模式生成输出结果。但如果网络钓鱼团伙开始使用新型技术,该差异就会造成模型输出准确率降低。需要执行重新训练,适配模型复杂度的变动。
上述两种场景下,发生模型漂移后,原本效果优异的模型输出结果准确率下降,甚至直接出错。
速度和性能
大规模部署 AI 模型,需要配套的基础设施用于生成输出结果。企业需要图形处理器、低延迟、高速网络,以及面向复杂模型的高性能处理单元。
其他速度和性能优化方式还包括:优化基础设施架构设计、选用专用硬件,以及采用推理优化技术(例如通过量化压缩输入数据体量)。
选用其他 AI 推理模式(如批量推理),可以改善特定使用案例下的性能表现。
成本
可基于新数据完成精准推理的 AI 模型,运行推理工作负载时可能产生意外成本。企业若要大规模运行 AI 模型或将其应用于各类业务场景,所需算力与推理请求量会带来持续增长的开销。企业可通过多种方式实现成本优化:缩减模型体积、并行处理,以及采用支持自动扩缩的云基础设施执行在线推理。
提升 AI 准确度与实用效果的最佳实践
提升 AI 推理效果,使其能够输出精准结论,核心在于优化训练与调优流程。以下若干最佳实践,可优化 AI 推理并提升推理准确度。
重视数据质量
训练 AI 模型所用数据集的质量,会直接影响模型对未知数据进行判别、生成有效输出的能力。标注完备、一致性好且不含噪声的高质量数据,能够增强模型挖掘模式的能力。建立严谨的数据准备流程,对训练数据执行清洗、验证、标准化处理,消除数据不一致问题。
配备专业人员
条件允许时,可聘用熟悉目标技术栈、精通模型训练与模型架构的专业人员。由领域专家参与数据标注,能够保障模型接收的数据兼具高质量与完备性。基于高质量数据训练的 AI 模型,输出结果准确度更高。
实现面向合规的可解释性
AI 经由推理得到的输出结果,应当具备可解释性。对模型应用 AI 可解释性技术,即可获知哪些输入特征对某一特定输出造成影响。不同机器学习模型适用不同的可解释性技术,例如 Shapley Additive exPlanations(SHAP);该技术兼容各类模型,但最适配树模型、线性模型与神经网络。AI 可解释性还能够帮助企业符合各类 AI 合规框架要求,例如 GDPR 中关于 AI 决策的解释权。
亚马逊云科技如何支持 AI 推理?
亚马逊云科技依托全套服务与专用基础设施,持续优化机器学习与 AI 模型生命周期的各个环节。
Amazon SageMaker AI 提供完整的机器学习环境,您可在此构建、训练、优化、测试并治理自定义机器学习模型。
Amazon SageMaker AI 是一项完全托管型服务,集成丰富工具,可面向各类使用案例提供高性能、低成本的机器学习(ML)能力。借助 SageMaker AI,您可使用笔记本、调试器、分析器、管线、MLOps 等工具大规模构建、训练和部署机器学习模型,全部操作都在同一个集成式开发环境(IDE)内完成。
SageMaker AI 通过简化访问控制、提升机器学习项目透明度,满足训练与推理全生命周期的治理要求。此外,您还可以自建基础模型(FM),这类大型模型基于海量数据集训练;您可使用专用工具对基础模型执行微调、实验、重新训练与部署操作。
亚马逊云科技提供多种用于 AI 推理的云基础设施,包括 Amazon EC2 上的专用 GPU,以及 Amazon Inferentia 这类机器学习芯片。
立即创建免费账户,在亚马逊云科技上体验机器学习模型推理。
Browse all cloud computing concepts
Browse all cloud computing concepts content here:
Did you find what you were looking for today?
Let us know so we can improve the quality of the content on our pages