亚马逊AWS官方博客

Jean Lilly 使用 AWS Security Agent 加速应用安全验证

摘要:Jean Lilly 为 B2B 珠宝店铺提供在线 3D 工艺设计平台,店铺可以在珠宝模型上添加刻字、图案等定制内容,并直接在网站中查看模拟渲染效果。公司研发团队二十多人,没有专职安全工程师,需要跟上持续加快的发布节奏。客户使用 AWS Security Agent(现已纳入 AWS Continuum)执行按需渗透测试,将以往需要 2~4 周协调和完成的外部安全测试缩短到数小时,并把目标授权、测试范围、登录凭据和成本上限纳入同一套可重复流程。


一、引言

对于没有专职安全团队的中小企业,安全验证往往同时受到发布周期、外部专家排期和测试成本的约束。业务功能持续更新时,低频渗透测试留下的间隔会越来越长;攻击者借助 AI Agent 提高漏洞研究和多步骤操作效率后,这个时间差更值得关注。

Jean Lilly 的实践围绕一个具体问题展开:现有开发团队如何在明确授权、测试范围和成本边界的前提下,更频繁地验证已部署应用。下面先说明客户原有流程和外部风险变化,再按实际操作顺序介绍 AWS Security Agent 的配置、运行和 Findings 处理方法。

二、Jean Lilly 的发布节奏超过了传统渗透测试周期

Jean Lilly 面向 B2B 珠宝店铺提供在线 3D 工艺设计平台。店铺可以在珠宝模型上添加刻字、图案等定制内容,并直接在网站中查看模拟渲染效果,以便在实际制作前确认设计。公司约 50 人,其中研发团队二十多人,海外云基础业务运行在 AWS。随着市场推广力度加大,平台功能和代码的更新频率随之上升。团队没有专职安全工程师,需要在现有人员规模下同时完成业务开发、上线和安全验证。

此前,Jean Lilly 主要委托外部安全公司执行人工渗透测试。根据客户提供的项目记录,单次测试费用约为人民币 5~15 万元,从安排测试到取得结果通常需要 2~4 周。外部专家仍适合承担独立审计、专项评估和需要人工判断的复杂工作,但这种交付周期难以覆盖每次代码发布。如果等待固定测试窗口,漏洞可能在两个窗口之间进入生产环境;如果每次发布都安排外部测试,成本和协调工作又会快速增加。

因此,Jean Lilly 的 CEO 和 CTO 将安全验证列为平台扩展过程中的优先事项。团队需要一种能够由开发人员按需发起、覆盖登录后功能、给出可复现证据,并能控制测试目标和费用的验证方式,而不是增加一次与发布流程脱节的孤立扫描。

三、攻击型 AI Agent 正在缩短攻击者的行动周期

Jean Lilly 调整安全验证方式还有一个外部原因:前沿模型逐渐具备长时间执行任务、调用工具并串联多个攻击步骤的能力。下面三项公开材料分别反映了能力门槛变化、恶意使用和测试隔离失败。三者性质不同,不能都归为安全事故,但共同说明仅依赖低频检查会留下越来越难以接受的风险窗口。

3.1 Claude Mythos 反映漏洞发现和利用能力的变化

2026 年 4 月,英国 AI Security Institute(AISI)公布了对 Claude Mythos Preview 的受控评估。评估明确向模型下达网络攻击任务并提供网络访问。在专家级 Capture the Flag 任务中,Mythos Preview 的成功率为 73%;在一个包含 32 个步骤的模拟企业网络攻击环境中,它在 10 次尝试中有 3 次完成了全流程。AISI 同时强调,该测试环境缺少真实企业常见的主动防御和检测工具,因此结果不能直接推断为能够攻破防护完善的生产系统。

Anthropic 没有将 Mythos Preview 面向公众开放,而是通过 Project Glasswing 向部分软件厂商和关键基础设施维护者提供受控访问,用于寻找和修复漏洞。Mozilla 随后披露,在其漏洞发现流水线中,Claude Mythos Preview 帮助识别了 Firefox 150 中修复的 271 个安全缺陷;Mozilla 也特别说明,单个高严重性缺陷不一定构成可直接利用的完整攻击链。

这些材料反映了漏洞研究能力的变化:过去需要稀缺专家投入数天完成的部分工作,正在被模型和 Agent 加速。相同能力可以帮助防守方,也可能缩短攻击者发现并利用漏洞的时间。

3.2 AI 已被用于编排大规模网络间谍活动

Anthropic 在 2025 年 11 月发布的威胁情报报告中称,其在当年 9 月发现了一起使用 Claude Code 的网络间谍活动。根据 Anthropic 的调查,攻击者尝试入侵约 30 个目标,并在少数目标上成功;AI 被用于侦察、漏洞研究、凭据获取、数据分类和记录攻击过程。报告估计 AI 承担了该活动 80%~90% 的工作,人类主要在少数关键决策点介入。

这些数字来自服务提供商对自身遥测和调查结果的判断,不应当被理解为所有网络攻击都已经实现同等程度的自动化。它仍说明,Agent 可以让攻击者并行处理更多目标,并降低长时间维持攻击活动所需的人工投入。

3.3 OpenAI 模型评估越过测试边界并影响 Hugging Face

2026 年 7 月,Hugging Face 披露其部分生产基础设施遭到自主 AI Agent 系统入侵。攻击从数据处理管道中的代码执行路径开始,随后获取部分云和集群凭据并横向移动。Hugging Face 记录了超过 17,000 个攻击事件,确认有限的内部数据集和若干服务凭据受到未授权访问,同时表示没有发现公开模型、数据集或 Spaces 被篡改。

Hugging Face 首次披露时尚未确认模型提供方。OpenAI 随后发布说明,确认该活动与其网络安全能力评估中的 Agent 有关。公开材料显示,这不是 Agent 凭空突破完全隔离的物理环境,而是评估环境仍保留了受过滤的软件包访问路径,Agent 利用该路径相关的漏洞获得了超出预期的访问能力。这个区别很重要:问题既涉及模型持续追求任务目标,也涉及测试环境的隔离、最小权限和实时监控不足。

对于 Jean Lilly 这样没有专职安全团队的研发组织,上述变化不意味着必须自行建设大型安全部门,也不意味着任何一种产品能够消除所有风险。更实际的应对方式,是缩短从代码变化到安全验证之间的时间,并把授权、范围、证据和修复纳入可重复的工程过程。

四、AWS Security Agent 如何适配没有专职安全团队的研发组织

AWS Security Agent(现已纳入 AWS Continuum)贯穿设计、开发和部署阶段提供安全分析。本文使用其中的 Continuum for penetration testing:团队提供目标 URL、身份验证信息以及可选的源代码和应用文档,Agent 基于应用上下文构造多步测试,发现并验证漏洞,并为 Finding 提供影响分析和可复现的攻击路径。配置了代码源和修复能力时,它还可以给出代码修复建议。

这套方式与传统的固定规则扫描并不相同,但也不是人工安全工作的替代品。Jean Lilly 采用它的主要原因是可以由现有开发团队按需执行测试,并优先查看有验证证据的 Finding。外部专家仍可用于独立审计、复杂业务逻辑评估和法规要求的测试。

AWS Security Agent 将管理动作分在两个界面中:管理员在 AWS Management Console 中启用能力、创建服务角色并验证目标域名;使用者通过 Web 应用创建和运行渗透测试、查看结果。下面的截图均来自 2026 年 9 月在 us-west-2 建立的 AWS 测试环境,仅用于说明操作流程,不代表 Jean Lilly 的生产配置或测试结果。

五、五步创建一次范围受控的渗透测试

5.1 启用 Penetration testing 并创建服务角色

进入 AWS Security Agent 控制台并选择 Agent Space。在能力列表中选择 Penetration testing。

图 1:AWS 测试环境中的 Agent Space 与 Penetration testing 入口(us-west-2)

[图 1:AWS 测试环境中的 Agent Space 与 Penetration testing 入口(us-west-2)]

在 Penetration test 页签中选择 Set up penetration test。对于公网目标,Amazon Virtual Private Cloud(Amazon VPC)、日志和客户管理密钥等项目可以按实际需要配置。展开 Service access,可以创建默认服务角色,也可以选择符合组织权限管理要求的现有角色。

图 2:AWS 测试环境中创建默认服务角色(us-west-2)

[图 2:AWS 测试环境中创建默认服务角色(us-west-2)]

服务角色配置不会同时完成目标授权。保存设置后,还需要在 Target domains 中单独添加并验证域名。

5.2 注册并验证拥有或获准测试的目标域名

AWS Security Agent 只允许对完成所有权验证的域名发起渗透测试。团队必须确保目标由自己拥有,或者已经取得明确测试授权。在 Target domains 中选择 Add domain,然后根据域名管理方式使用下列方法之一:

  • 对同一账号中由 Amazon Route 53 托管的域名,可以使用一键验证。
  • 对其他 DNS 服务商管理的域名,可以添加指定的 DNS TXT 记录。
  • 对能够修改站点内容的域名,可以在指定的 /.well-known/ 路径放置验证文件,使用 HTTP route 完成验证。

Amazon CloudFront 默认域名属于 AWS,用户不能为 *.cloudfront.net 添加 DNS TXT 记录,因此本文测试环境中的 CloudFront 场景使用 HTTP route。真实业务如果使用自有域名,应根据其 DNS 和站点管理方式选择验证方法。

图 3:AWS 测试环境中添加 CloudFront 目标域名并选择 HTTP route(us-west-2)

[图 3:AWS 测试环境中添加 CloudFront 目标域名并选择 HTTP route(us-west-2)]

验证成功后,域名状态显示为 Verified,Penetration testing 状态变为可用。子域名是否包含在授权范围内,应以控制台显示和组织的书面授权为准,不要因为技术上可访问就扩大测试范围。

图 4:AWS 测试环境中的目标域名 Verified 状态(us-west-2)

[图 4:AWS 测试环境中的目标域名 Verified 状态(us-west-2)]

5.3 创建测试并限制网络范围

从 Agent Space 选择 Launch web application,进入 Web 应用后创建 penetration test。首先填写测试名称和 Target URL;Target URL 必须属于已经验证的域名。

图 5:AWS 测试环境中的测试名称、Target URL 与网络范围配置(us-west-2)

[图 5:AWS 测试环境中的测试名称、Target URL 与网络范围配置(us-west-2)]

网络范围直接影响安全边界和测试成本。创建任务时应检查以下设置:

  • Accessible URLs:登录流程需要访问、但不应成为攻击目标的第三方地址,例如身份提供商。加入该列表不等于授权 Agent 攻击这些系统。
  • Out-of-scope URLs:明确排除可能造成破坏或不在授权范围内的路径,例如删除账号、真实支付和生产数据批量修改接口。
  • Custom HTTP headers:目标位于 AWS WAF 或其他访问控制之后时,可以按组织规定加入专用测试标识或放行头。

范围应覆盖本次发布涉及的业务流程,但不超出验证所需。新增域名、第三方跳转或高风险操作时,应重新审查授权和排除项。

5.4 使用低权限账号覆盖登录后功能,并在运行前测试凭据

不提供登录凭据时,Agent 只能访问公开页面。要检查越权、角色边界和登录后 API,需要配置专门的测试账号、Access URL 和登录步骤。凭据可以由 AWS Security Agent 安全地存储在客户自己的 AWS Secrets Manager 中;不要使用真实管理员账号,并应为测试账号设置最小权限和可恢复的数据范围。

图 6:AWS 测试环境中的身份验证资源配置页面(us-west-2)

[图 6:AWS 测试环境中的身份验证资源配置页面(us-west-2)]

AWS Security Agent 用户指南的文档历史记录显示,从 2026 年 9 月 18 日更新的流程开始,用户可以在运行前逐个测试凭据,确认 Agent 能否成功登录。测试凭据时,系统还会发现登录流程访问的域名,用户需要在新的 Network configuration 步骤中对这些域名进行分类。[8]

这项更新改变了排障顺序:团队可以在启动收费任务前发现密码错误、登录步骤不完整、重定向域名缺失等问题,不必等到运行进入 Preflight 才看到登录失败。本文现有截图拍摄于该控件完整展示之前,因此只用文字说明这项能力。

如果应用使用多因素身份验证(MFA),应根据当前支持方式配置专用测试流程。无论采用哪种认证方式,都应避免在截图、日志或文章中暴露密码、一次性验证码、Secret ARN 和内部账号信息。

5.5 设置成本上限,确认后再启动运行

Continuum for penetration testing 按 task-hour 计费。多个任务可以并行执行,因此 task-hour 是所有任务累计消耗的时间,不等于用户的实际等待时间。AWS 定价页当前列出的价格为每 task-hour 50 美元;例如,一次测试可以在约 1 小时内完成,但并行任务累计消耗 3.4625 task-hours,费用为 173.13 美元。

在 Jean Lilly 启用服务时,新客户可在前两个月获得每月 400 task-hours 的额度。价格、活动额度和适用条件可能调整,正式运行前仍应在 AWS 定价页、AWS Billing and Cost Management 以及客户账号中确认。

创建任务时使用 Max task hours 设置单次运行上限。本文测试环境中的示例选择 20 task-hours;这是单次运行的上限,不表示运行一定会消耗完全部额度。

图 7:AWS 测试环境中设置 Max task hours(us-west-2)

[图 7:AWS 测试环境中设置 Max task hours(us-west-2)]

最后还要区分两个动作:Create pentest 只保存配置,不开始运行;Create and execute 会立即启动并开始累计 task-hours。首次配置时,可以先保存任务,复核目标、排除路径、凭据测试结果和额度,再选择 Start run。

六、运行检查与 Findings 处理

启动后,运行依次经过 Preflight、Static analysis、Pentest、Finalizing。Preflight 会检查日志基础设施、目标端点、Secrets Manager、测试环境和登录状态。即使已经在配置阶段测试过凭据,Preflight 仍用于确认整套运行环境在本次执行时可用。

图 8:AWS 测试环境中的 Preflight 检查项目(us-west-2)

[图 8:AWS 测试环境中的 Preflight 检查项目(us-west-2)]

Preflight 通过后,Agent 开始静态分析和网络测试任务。测试可能持续数小时,具体时间取决于应用规模、可访问路径、身份角色、任务并行度和 Max task hours。

图 9:AWS 测试环境中 Static analysis 和扫描任务运行状态(us-west-2)

[图 9:AWS 测试环境中 Static analysis 和扫描任务运行状态(us-west-2)]

运行完成后,团队在 Findings 页面查看结果。每条 Finding 可包含严重程度、Agent confidence、影响分析、复现步骤和证据。启用相应代码集成和修复能力后,还可以取得修复建议。处理顺序不应只看数量:开发人员应优先复核高严重程度且证据充分的 Finding,确认业务影响后修复,再重新验证问题是否仍可利用。

本文测试环境使用的测试靶站故意包含反射型跨站脚本、越权访问和未鉴权接口等教学漏洞,用于验证流程。它已经在 2026 年 9 月 15 日拆除。上述漏洞及截图不是 Jean Lilly 生产环境的发现,本文也不据此推断客户系统存在同类问题。

七、Jean Lilly 获得的价值及适用边界

采用 AWS Security Agent 后,Jean Lilly 可以由现有开发团队按需创建渗透测试。根据客户项目记录,安全验证从过去外部测试所需的 2~4 周缩短到数小时。团队因而可以在重要版本发布前增加验证频率,而不必为每次测试单独等待外部供应商排期。

成本变化应按同一测试范围和交付物比较。传统外部测试每次约人民币 5~15 万元,通常包含安全专家的分析、沟通和交付;Continuum for penetration testing 按实际 task-hours 计费,不能只用单价做一对一替换。对 Jean Lilly 而言,更直接的价值是可以把自动化验证用于更多发布节点,把外部专家集中在独立审计、复杂业务逻辑和需要人工经验的工作上。

该实践有以下边界:

  • 测试目标必须由客户拥有或取得授权,Verified 状态不能替代组织的书面授权和变更流程。
  • Agent 发现并验证漏洞,但开发团队仍需判断业务影响、安排修复并确认修复没有引入回归。
  • 登录账号、排除路径和最大 task-hours 需要在每次重要范围变化后复核。
  • 本文数据反映 Jean Lilly 当前团队和项目范围,不构成其他企业的成本或周期承诺。
  • 自动化渗透测试不能替代法规要求的独立审计、人工红队或覆盖组织流程和人员的安全评估。

对于没有专职安全工程师、但版本迭代频繁的团队,较可行的起点是选择一个边界清楚、已经获得授权的应用,配置低权限测试账号和成本上限,先完成一次可控运行。团队建立 Finding 复核与修复流程后,再逐步扩大覆盖范围。

八、参考资料

  1. UK AI Security Institute:Our evaluation of Claude Mythos Preview’s cyber capabilities
  2. Anthropic:Project Glasswing—Securing critical software for the AI era
  3. Mozilla Hacks:Behind the Scenes Hardening Firefox with Claude Mythos Preview
  4. Anthropic:Disrupting an AI-orchestrated cyber espionage campaign
  5. Hugging Face:Security incident disclosure—July 2026
  6. OpenAI:OpenAI and Hugging Face partner to address security incident during model evaluation
  7. AWS Security Agent User Guide:What is AWS Security Agent (now part of AWS Continuum)?
  8. AWS Security Agent User Guide:Document history
  9. AWS Continuum for penetration testing pricing

➡️ 下一步行动:

相关产品:

相关文章:

*前述特定亚马逊云科技生成式人工智能相关的服务目前在亚马逊云科技海外区域可用。亚马逊云科技中国区域相关云服务由西云数据和光环新网运营,具体信息以中国区域官网为准。

本篇作者

林翰彧

Jean Lilly 精品电商平台技术负责人,深耕 IT 领域近 30 年,具备半导体、金融与电商等跨产业经验,专精于企业架构、云端迁移及资安治理。现任精品电商平台技术负责人,主导 AWS 跨区迁移与架构现代化。

李永乐

亚马逊云科技解决方案架构师,专注于各行业的生成式 AI 解决方案的架构咨询和设计。在加入亚马逊云科技之前,曾就职于微软、惠普软件等企业,具有丰富的云计算实践经验。


AWS 架构师中心:云端创新的引领者

探索 AWS 架构师中心,获取经实战验证的最佳实践与架构指南,助您高效构建安全、可靠的云上应用