新产品覆盖面向客户的对话式智能体和执行系统操作的自主智能体,可直接基于代码生成测试场景,依据实际证据评估每项操作,并量化呈现所有未能验证的“验证缺口”
旧金山和印度诺伊达2026年8月19日 /美通社/ — 全球首个 Agentic AI 原生质量工程平台 TestMu AI(前身为 LambdaTest)今日宣布推出 Agent Assurance,旨在回答当前每个准备上线 AI 智能体的工程团队都面临的关键问题:该智能体能否安全上线?Agent Assurance 通过单一产品同时覆盖两类智能体:对话式智能体用于评估通过聊天、语音、电话、视频和图像与用户互动的智能体;全新推出的自主智能体则用于验证能够操作系统的智能体,包括:调用工具、写入文件、调用 API 以及创建拉取请求。
目前,大多数团队在测试自主智能体时,主要依据智能体对自身行为的陈述:例如操作记录,或评审模型根据其最终回复给出的评分。Agent Assurance 则侧重评估智能体实际执行操作后产生的结果。接入代码库后,Agent Assurance 会识别智能体的功能,自动生成一套端到端测试套件,涵盖功能测试、非功能测试和对抗性场景。随后,系统会实际调用智能体,并依据观测到的证据逐项评估。相关证据包括:磁盘上发生变更的文件、生成的输出产物,以及根据智能体所声明的可用工具范围核验的工具调用记录。
除“通过”和“未通过”外,Agent Assurance 还会给出第三种判定——无法验证。此类结果不计入通过率,而是以验证缺口这一数值单独呈现。报告中的每项结论均有实际观测证据作为依据。由于验证缺口反映了智能体记录自身操作的完整程度,团队可以通过提升智能体的可观测性来缩小这一缺口。
“工程团队正在风险最高的环节不断积累验证债务。智能体对自身行为的陈述,是用于判断其实际行为的最薄弱证据,因为它本身正是最有可能出错的一方。”TestMu AI 集团工程高级副总裁 Vipul Verma 表示。“当前该领域的所有工具都会报告通过率。Agent Assurance 不仅给出通过率,还会说明自身的盲区有多大。只有同时呈现二者,这一数字才足以赢得团队的信任,并支持其据此推进上线。”
借助 Agent Assurance,团队能够:
无需编写测试用例即可开展测试——测试套件直接从代码库自动生成,从而实现智能体自动化测试。团队只需提供智能体的调用方式,例如命令、HTTP 端点、MCP 服务器,或基于 n8n 等平台构建的工作流。默认覆盖对抗性场景——提示词注入、工具滥用和指令覆盖等场景将作为核心测试类别自动生成,而非作为附加功能提供。在 CI 流程中设置发布门禁——在每条流水线中持续测试智能体,覆盖从每次代码提交时的智能体冒烟测试,到正式发布前的完整测试;支持无界面运行的命令及退出码,可明确区分“智能体执行错误”与“测试框架无法完成测试”。可靠追踪变更——智能体回归测试会对比不同运行批次之间的差异,分别呈现新增失败项、新修复项和不稳定结果,因为测试不稳定与功能回归需要采取截然不同的处理方式。
对话式智能体类别也正在扩展至软件与用户交互的最新场景:出现在镜头中的智能体。借助平台全新的 Video Agent Testing(Link)功能,一名具有逼真面容和声音的虚拟用户将加入视频智能体的实时会话,与其展开自然对话,并按照团队设定的成功标准对智能体进行评估。每项判定均可追溯至录像中支持该结论的具体时刻。任何无法通过录像核实的项目都会被判定为未达标。对于以录像作为证据的测试类别而言,这是一项严格标准:凡评估者未能观察到的表现,视频智能体均不会得分。
对话式智能体类别现已在 TestMu AI 平台正式开放使用。自主智能体类别目前处于早期访问阶段,可通过终端使用 rook 运行。相关模型由 TestMu AI 控制器执行,因此本地无需配置任何模型供应商的 API 密钥。如需开始使用,请访问 Link。
###
关于 TestMu AI
TestMu AI 是全球首个 Agentic AI 原生质量工程平台,旨在以智能技术为核心,帮助企业实现测试自动化和规模化。通过将自主运行能力与现代开发工作流无缝集成,TestMu AI 帮助团队在 AI 优先时代更快交付更加可靠、安全的软件。
如需了解更多信息,请访问 TestMu AI
SOURCE TestMu AI (Formerly LambdaTest)


