什么是 LLMOps?
什么是 LLMOps?
大语言模型运维(LLMOps)是指用于在生产环境中管理大语言模型运维工作的工具和实践方法。大多数组织会从开源或商业大语言模型(LLM)中进行选择,针对特定使用场景进行定制,并将其部署到生产环境中。这一过程在安全性、规模化、客户支持和版本控制方面面临独特的挑战。LLMOps 负责管理并自动化 LLM 的全生命周期,涵盖从微调到维护的各个阶段。它包含源自 DevOps 的方法论,以支持对大语言模型进行持续监控、测试和改进。
LLMOps 有哪些优势?
商业领域的生成式人工智能(GenAI)应用能够显著提高生产力,帮助企业获得竞争优势,并实现超越现有能力的业务规模化扩展。但是,实施生成式人工智能也伴随着相应的运营挑战。
LLMOps 为 LLM 开发带来的益处,正如 DevOps 为传统软件开发带来的益处一样。传统上,DevOps 旨在弥合开发团队与运维团队之间的鸿沟。DevOps 借助持续集成和持续交付(CI/CD)流程,确保代码变更能够自动部署到生产环境。自动化测试可实现高效、可靠的代码更新和新功能开发。
同样,LLMOps 倡导协作文化,从而在 LLM 开发中实现更快的发布周期、更高的 AI 应用质量以及更高效的资源利用。通过支持 LLM 全生命周期的模型和管道开发,组织能够大规模构建高质量的 LLM 应用。
版本控制
应用程序代码更新可能会引发错误,进而需要进行回滚和故障排查。同样,LLM 微调活动也需要对模型配置、提示数据集和训练数据集进行版本控制和管理。LLMOps 使 LLM 定制和再训练过程版本化且可跟踪。开发人员可以复用模型和数据集,从而加快 AI 技术的应用速度。
可观测性
LLMOps 提高了生产管道中 LLM 运营的可视性,使您能够衡量并控制 AI 应用程序的性能。LLMOps 团队可以跟踪各种指标,例如提示词元数、补全、LLM 延迟、上下文遵循度、完整性、数据块利用率等。尽管与其他机器学习模型相比,对 LLM 进行可观测性埋点的难度更大,但该领域正迅速涌现出各种新工具。开发人员可以利用这些技术排查问题的根本原因并进行修复。
控制
LLMOps 增强了安全性,使组织能够更好地管控 LLM 使用的数据及其生成的响应内容。管理者可以将 LLM 项目的可观测性和性能指标与业务目标相关联,并汇报 AI 应用的成效。组织能够更好地控制运行大规模模型相关的运营成本,并跟踪 AI 投资的回报情况。
MLOps、FMOps 和 LLMOps 有什么区别?
MLOps、FMOps 和 LLMOps 是 AI 应用程序开发中使用的不同术语。它们均源自 DevOps,且目标一致:即在整个开发周期内利用自动化手段提升效率与质量。不过,由于项目需求不同,具体的实施细节也会有所不同。
传统的 MLOps 旨在帮助您将机器学习用例生产化。然而,生成式人工智能用例需要扩展 MLOps 的能力,以满足更为复杂的运营需求。正因如此,FMOps 和 LLMOps 变得至关重要。
MLOps
机器学习是一门开发算法和统计模型的科学,计算机系统使用这些算法和模型,在没有明确指令的情况下,依靠既有模式和推理来执行任务。机器学习模型与系统逐渐演变成了如今我们所见的现代生成式人工智能应用程序。
机器学习与运营(MLOps)结合了人员、流程与技术,旨在高效地将机器学习解决方案投入生产应用。它涵盖了模型训练与构建、测试、部署及服务(推理)的自动化流程。所有生成的模型和代码自动化都通过模型注册中心的功能,存储在一个集中式工具账户中。团队能够针对不同应用场景,对机器学习(ML)模型进行抽象化、模板化、维护和重复使用。
FMOps
基础模型(FM)是一种极其先进且规模宏大的机器学习模型,可用于构建多种其他类型的 AI 模型。FM 基于 TB 级数据进行训练,拥有数千亿个参数,能够针对生成式人工智能的三大主要类别预测最佳的后续结果:
- 文本到文本——根据文本输入,预测下一个最佳单词或单词序列。
- 文本到图像——根据文本输入,预测下一张最佳图像。
- 文本到音频或视频——根据文本输入,预测下一段最佳音频或视频片段。
鉴于基础模型的通用特性,FMOps 的涵盖范围更为广泛。其目标是构建和商业化新的 FM 模型,并从零开始对其进行训练。FMOps 包含用于管理大规模多媒体训练数据及审查复杂输出结果的技术与流程。除了模型版本控制外,它还需要具备大规模参数调优和结果评估的能力。
LLMOps
大语言模型(LLM)是文本到文本的 FM 模型。大多数组织并不具备从零开始构建新 FM 的能力,而是针对特定用例对现有的 LLM 进行定制。LLM 的模型选择与定制带来了一系列新的问题。无论业务用例如何,LLMOps 都是指在可重复、稳定且受管理的环境中部署大语言模型所需的一套工具和实践方法。

LLMOps 如何支持 LLM 生命周期的不同阶段?
LLMOps 包括旨在提升 LLM 生命周期各阶段效率的技术、流程和人员。LLM 生命周期的主要阶段如下所述。
模型发现
LLM 模型的生产化始于模型的发现和选择。首先,团队会进行探索性数据分析(EDA)。他们确定 LLM 将使用的数据集,并执行数据收集、清洗和预处理等任务,以便模型使用。随后,他们针对具体应用场景选择并评估最合适的模型。
LLMOps 平台提供多种大语言模型供选择。工程师和决策者可以在确定最适合其数据的模型之前,根据不同参数进行模型审核。考虑到敏感数据,在评估模型时,除了性能指标外,还会考量成本和安全性等因素。评估框架可用于辅助模型发现阶段。
模型自定义
选定模型后,会根据组织的特定数据集对其进行定制。定制内容包括:
微调
更改 LLM 模型参数。这种方式需要较多的前期算力投入,但能让 LLM 学习执行此前无法完成的任务。
RAG
检索增强生成(RAG)是模型微调的替代方案,该方案无需更改模型参数。其做法是将领域数据转换为向量嵌入,并存储在向量数据库中建立索引。应用程序会对提示的嵌入向量与索引进行相似度搜索,并利用搜索结果为 LLM 的提示提供上下文信息。
LLMOps 提供的工具支持提示工程、链式调用及智能体的开发。此外,还可以集成用于遥测、安全和测试的 DevOps 风格工具。支持新版 LLM 发布的工具至关重要,因为这些更新能显著提升模型性能。
部署和监控
LLM 完成定制后,即可用于生产环境。持续的模型监控对于确保用户的请求合规,并保证 LLM 仅基于授权且准确的数据进行响应必不可少。必须持续部署新数据,以确保 LLM 始终掌握最新信息。
LLMOps 提供自动化功能和流程,支持将 LLM 应用持续部署到生产环境。它确保对生产环境中的所有 LLM 应用进行可观测性管理与监控,以便跟踪性能和问题。
LLMOps 包含哪些阶段?
与 DevOps 类似,LLMOps 包括三个主要阶段:持续集成(CI)、持续部署(CD)和持续调优(CT)。参与此流程的人员包括数据科学家、提示工程师、机器学习工程师、模型负责人以及生成式人工智能用户。
持续集成
CI 包括将应用程序代码的所有工作副本合并为单一版本,并针对该版本运行系统测试与单元测试。在使用 LLM 时,单元测试往往需要对模型的输出进行人工检查。例如,对于由 LLM 驱动的游戏角色,测试可以询问该角色的背景、游戏中的其他角色以及游戏设定等相关问题。
持续部署
CD 是指在通过基于指标的评估或人机闭环方式对模型性能和质量进行评估后,将应用程序基础设施及模型部署到指定环境的过程。一种典型的模式是先将应用部署到开发和质量保证(QA)环境,然后再部署到生产(PROD)环境。通过在 QA 环境和 PROD 环境的部署之间设置人工审批环节,可以确保新模型在部署到生产环境之前已在 QA 环境中经过测试。
持续调优
CT 是指利用额外数据对大语言模型进行微调以更新其参数的过程,旨在优化模型并生成新版本。该过程通常包括数据预处理、模型调优、模型评估和模型注册。模型一旦存入模型注册中心,即可接受审查并获批进行部署。
LLMOps 中使用了哪些技术?
在大语言模型运维中,多种技术协同发挥作用。
提示工程
提示工程是指设计最合适的格式、短语和词汇,以引导 LLM 生成最佳输出的过程。但是,创建新的提示只是第一步。提示工程技术允许您跟踪提示变更以及生成的响应。您可以区分高质量与低质量的提示,并衡量模型推理效果。
嵌入和向量数据库
嵌入是语言的数值表示。它们使 LLM 能够像人类一样理解和处理语言。组织必须基于内部知识库创建新的嵌入,以便 LLM 能够利用内部数据响应用户的查询。向量数据库对于存储、处理和更新嵌入至关重要。管理嵌入和向量数据库对定制化大语言模型的交付至关重要。
链和智能体
链是指将一个 LLM 的响应作为输入,传递给另一个(或同一个)LLM 的过程。智能体是与语言模型交互以执行特定功能的自主或半自主系统。智能体处理应用程序中的 LLM 活动。管理这两种不同的技术可能比较困难,因为可能需要进行大量的调试工作。但是,对于在组织内部大规模应用 AI 技术,这两者都不可或缺。
评估工具
必须对大语言模型的输出进行检查,以评估其是否存在偏见、连贯性问题、准确性偏差、模型漂移或可靠性问题。LLMOps 包含多种工具,用于设定基准并衡量 LLM 的输出质量。例如,评估工具可以评估摘要质量、执行跨 LLM 的对比检查,或评测检索增强生成(RAG)管道。此外,它们还支持对 LLM 输出进行人工评估和反馈。
可观测性工具
LLMOps 包含支持对 LLM 服务进行埋点(以收集日志、追踪数据和指标)的相关技术。您可以利用这些工具识别并解决生产环境中的问题,同时生成关于性能和可靠性的度量数据。这些工具能够评测模型输出,并在特定指标未达到阈值时向团队成员发出警报。
AWS 如何支持您的 LLMOps 工作?
Amazon SageMaker Pipelines 是一项专用的工作流编排服务,能够自动化 LLM 生命周期的各个阶段(从数据预处理到模型监控)。借助直观的用户界面和 Python SDK,您可以大规模管理可重复的端到端 LLM 管道。您可以轻松且大规模地对 LLM 模型进行训练、测试、故障排查、部署和治理,从而在保持生产环境模型性能的同时提高生产力。
Amazon Bedrock 是一项完全托管式服务,提供多种高性能 LLM 以及构建生成式人工智能应用所需的一系列功能,同时兼顾安全性、隐私性和负责任的人工智能原则。使用 Amazon Bedrock,您可以:
- 针对您的应用场景试验和评估热门 LLM
- 通过微调或 RAG,使用自有数据对 LLM 进行私有化定制
- 构建使用企业系统和数据来源执行任务的代理。
由于 Amazon Bedrock 采用无服务器架构,因此您无需管理任何基础设施。您可以使用自己熟悉的 AWS 服务,将生成式人工智能功能安全地集成并部署到应用程序中。
立即创建免费账户,开始在 AWS 上使用 LLMOps。
Browse all cloud computing concepts
Browse all cloud computing concepts content here:
Did you find what you were looking for today?
Let us know so we can improve the quality of the content on our pages