大模型/AI 应用系统怎么进行第三方软件验收测试

软件验收 0 阅读 A+ 默认 A-

作者:尚拓小云 | 审核:第三方软件测评

AIGC 智能客服、AI 代码助手、文档问答系统、企业知识库检索增强(RAG)……越来越多软件的核心能力来自大模型或 AI 模块。这些系统的验收测试,与传统软件相比不只是”功能验证加一加”,而是要补上一整套 AI 专属维度——回答分布而非单一输出、安全风险比传统软件更立体、可重复性比功能正确更难守住。

AI 应用系统与传统软件:验收测试要补的维度

不确定性带来的新维度

传统软件对给定输入返回确定结果,AI 应用系统则带有概率性:同一道问题在不同时间可能给出不同答案,模型版本、推理温度、上下文窗口长度都会影响输出。这把验收测试从”输入-输出是否一致”推进到”输出分布是否在可接受范围”,需要引入新的衡量指标:幻觉率、知识忠实度、提示词敏感性、答案一致性等。

法规与备案要求叠加

面向公众提供生成式 AI 服务的,还要按《生成式人工智能服务管理暂行办法》履行算法备案与安全评估义务。第三方验收测试报告是备案材料里技术评估的一类证据——这是 AI 系统验收的特殊背景,传统软件验收里没有这一层。

软件验收测试报告AIGC

验收测试的五大技术维度

维度一:功能正确性与任务达成率

明确系统”做什么”是验收的前提。AI 系统的功能定义往往以任务为单位——意图识别准确率、问答命中率、抽取字段完整率、工具调用成功率——而不是以菜单页面为单位。验收阶段要按任务清单逐项测量,给出每类任务的达成率与失败分布。失败样例比平均达成率更值得分析:它往往指向训练数据、提示词或后处理规则的系统性问题。

维度二:幻觉率与回答忠实度

幻觉是 AI 系统破坏用户信任的主要风险。在 RAG(检索增强生成)架构下,核心问题不是”答案是否正确”,而是”答案是否被检索到的资料支持”。评估方法分两层:一层判断答案的事实准确性;另一层判断每条关键声明是否能在原始资料里找到出处。前者靠专家 Fact-Checking 与自动化核对,后者靠证据溯源。两者数据结合,能区分”模型答错了”与”检索召回错了”,后续修复的着力点也不同。

维度三:安全性与红队测试

AI 系统的安全风险比传统软件更立体,至少包括四类:提示词注入与越狱攻击(让模型绕过安全限制输出违规内容)、敏感信息泄露(训练数据里的个人信息被答出)、有害内容生成(歧视、暴力、违法教唆)、未成年人保护不当(不当内容、未成年消费管控失效)。测试方式采用”攻防红队人工诱导 + 自动化安全打分”双轨,攻击样本覆盖中英文、不同句式、间接诱导、隐喻表达等。

维度四:性能与稳定性

AI 系统的性能指标比传统软件更复杂。除了常规的接口响应时间,还要测首字延迟(time-to-first-token,对交互体验影响大)、P95/P99 延迟分布、并发用户下的吞吐上限、长上下文(16K/32K/128K token)下的退化表现、流式输出的中断恢复。重试和回退路径要单独测——主模型切到备用模型时,质量与延迟的变化要可控。

维度五:可重复性与版本回归

AI 系统升级频繁(基座模型微调、提示词调整、检索库更新都可能改变行为),验收测试不能只做一次。测试集要版本化保存,评测脚本要可复现,断言阈值要根据业务容忍度设定。每次模型或提示词变更后,重跑测试集,对比新旧结果,发现回归立即定位。这一节也是第三方验收交付物的核心组成部分——评测集与脚本随报告一并交付,客户的运维团队后续能在内部继续复测。

软件验收测试报告AIGC产品的质量保证

通用质量模型与 AI 专属标准

GB/T 25000.51-2016 的适用边界

软件产品评价的八项质量特性(功能性、性能效率、兼容性、易用性、可靠性、安全性、维护性、可移植性)对 AI 系统仍然适用,是验收测试的底层框架。但 AI 系统的”功能性”需要按任务而非菜单拆分,”安全性”要扩展到内容安全和模型安全两层,”维护性”要纳入模型与提示词的版本可管理。

GB/T 42888-2023 机器学习算法安全评估

这是当前 AI 算法侧评估中较有约束力的国标之一。它把评估维度划为数据安全、算法健壮性、伦理合规三块:要求建立对抗训练机制,黑盒、白盒、灰盒攻击场景都覆盖,噪声注入率不低于15%的压力测试,关键决策日志留存不少于6个月。针对生成合成类算法,附录A明确要求建立生成内容标识系统,对 AI 生成的文本、图像、视频添加不可篡改水印,且需在传输前完成标注——这是 2023 年首例算法违规罚单的核心条款。

TC260 生成式人工智能服务安全基本要求

全国信息安全标准化技术委员会发布的《生成式人工智能服务安全基本要求》是暂行办法在技术层面的细化。文件把要求拆为三类:训练数据安全(数据源、内容管理、标注,含”非法和不良信息比例不超过5%“等量化指标)、模型安全(训练、输出、监控评估、更新、环境隔离,生成内容安全合格率不低于90%)、安全措施(用户群体论证、透明度、用户 opt-out 关闭训练使用途径、收集投诉举报渠道)。对第三方测评来说,这是除 GB/T 25000.51 之外的另一条强制参照线。

报告交付与备案协同

评测集与评审计分的方式

成熟的验收交付应同时包含三套评估手段:基于规则的自动化评估(有标准答案的任务,如抽取字段、代码生成测试通过率)、LLM-as-judge 自动化打分(开放性任务,需用人类评分集合校准,不能单独作最终结论)、人类专家评审(高风险任务,作为最终质量的把关)。三者按场景组合使用,比例根据风险等级调整。

报告中的合规要点

除常规的功能、性能、安全结论外,AI 系统验收报告还应包含:生成内容标识与水印方案的检查记录、未成年人保护机制(每日对话时长限制、消费确认、防沉迷密码)的实测结果、用户 opt-out 关闭训练数据使用途径的可触达性测试、透明度披露页面的内容核对。这些项目是备案前安全评估会逐项核对的要素,验收报告里写清楚可以缩短备案周期。

与算法备案和安全评估的衔接

工信部、网信办对生成式 AI 服务设有算法备案与安全评估两道门槛。第三方验收测试报告是这两道门槛里技术评估部分的关键证据之一——验收报告里”安全合规率100%、越狱成功率0%“这类硬指标,能够直接被备案材料的”安全评估”项引用。报告里给出的训练数据来源说明、生成内容标识方案,也能与备案表里的对应栏目一一对齐。尚拓云测在承接这类系统验收时,会按备案表结构预置报告栏目,减少客户后续补材料的成本。

客户需要准备的材料

测试数据与权限

含脱敏后的真实业务问答样本、典型边界用例、违规诱导样本;接口访问权限(API 账号或本地部署的访问密钥),以及模型版本号、推理参数(temperature、top-p 等)、上下文窗口配置等关键元数据。

测试环境与调用限制

独立的测试环境账号、与生产环境数据隔离;如果系统涉及 RAG,需要测试用的检索库快照;明确调用频率上限与并发限制,避免评测过程触发生产环境的限流保护。

期望与基线

任务清单(哪些任务必答、哪些允许拒答、哪些需要人工复核)、幻觉率与错误率的容忍阈值、延迟与成本的预算红线、已知失败场景的应对策略(重试、人工接管、降级)。这些参数决定验收通过线画在哪里。

持续监控与回归节奏

一次性验收只能确认当下质量。AI 系统的基座模型更新、提示词调整、检索库扩容都可能改变行为。建议在验收后建立回归评测集,定期复测,把评测脚本纳入 CI/CD,让 AI 系统的质量监控和发布门禁挂钩。

CNAS资质软件测试报告封面

相关文章

分享到: