测试用例 Agent 的门禁落地:一条需求缺口,应该挡住哪些用例?
用一个提交申请的合成示例,说明如何关联需求缺口与测试用例、限制依赖范围,并在规则确认后重新校验,避免局部缺口阻塞全部生成或被悄悄写成确定预期。
RESEARCH TOPIC
按主题浏览大模型评测、业务 Eval、LLM-as-a-Judge、Agent Eval、Trace Grading、Failure Corpus 与 Quality Gate 相关文章;系统学习请进入 AI Eval 系列。
用一个提交申请的合成示例,说明如何关联需求缺口与测试用例、限制依赖范围,并在规则确认后重新校验,避免局部缺口阻塞全部生成或被悄悄写成确定预期。
测试用例生成被 Gate 卡住,未必都是模型能力问题。区分输入缺口、执行错误与用例质量,分开管理草稿生成和正式交付,并把未知项纳入覆盖报告。
Eval 只有进入 CI / Quality Gate 才真正参与交付。本文给出 Baseline、Hard Gate、Regression、Flaky Case、Artifact、Override 与发布准入的工程化设计。
Failure Corpus 不是错误日志堆积,而是把真实失败结构化成可复现、可归因、可回归的质量资产。本文给出 Failure → Root Cause → Regression Case 的完整闭环。
Offline Eval 负责发布前的可重复比较,Online Eval 负责发现真实生产分布与新失败。本文给出两者的边界、数据闭环与落地方式。
AI Eval 不能只看 Pass Rate。本文拆解 Task Success、pass@k、pass^k、Critical Failure、False Pass、Latency、Cost、Retry、Evidence 与 Regression Delta。
LLM-as-a-Judge 适合开放任务的大规模评测,但不能直接把模型分数当真值。本文给出 Rubric、Pairwise、Reference、偏差控制、人工校准与 Judge Regression 的实用方法。
业务 Eval Dataset 不应该只是随机抽样。本文给出从真实任务、失败案例、边界条件到数据分层、Gold Label、Holdout 与持续回归的一套工程化构造方法。
Model Eval 主要评模型输出,Agent Eval 还必须评 Tool、State、Trace、Side Effect、Evidence 和最终任务完成度。本文拆开两者的评价对象和工程边界。
模型排行榜能帮助理解通用能力,但不能替代业务评测。本文从任务分布、Harness、Prompt、Tool、Latency、Cost 和 Failure Set 解释为什么生产选型必须自己做 Eval。
大模型评测不只是跑 Benchmark。本文拆开公开基准、模型能力评测、业务 Eval、自动 Grader 与持续回归,给出一套工程化评测框架。
Harness 负责产生可信执行事实,Eval 负责跨任务和版本判断质量。本文拆开 Runtime、Trace、Evaluator、Regression 和 Gate 的职责。
Agent 最终通过并不代表过程可靠:从执行轨迹、独立证据、失败回归到 Quality Gate,讨论 Agent Reliability 的工程判断。
执行 → 证据 → 评测 → 回归 → 交付