测试用例 Agent 的门禁落地:一条需求缺口,应该挡住哪些用例?
用一个提交申请的合成示例,说明如何关联需求缺口与测试用例、限制依赖范围,并在规则确认后重新校验,避免局部缺口阻塞全部生成或被悄悄写成确定预期。
RESEARCH TOPIC
从 Failure Corpus 到 Agent Regression Testing,让真实失败成为测试资产。
用一个提交申请的合成示例,说明如何关联需求缺口与测试用例、限制依赖范围,并在规则确认后重新校验,避免局部缺口阻塞全部生成或被悄悄写成确定预期。
测试用例生成被 Gate 卡住,未必都是模型能力问题。区分输入缺口、执行错误与用例质量,分开管理草稿生成和正式交付,并把未知项纳入覆盖报告。
无人值守 Agent 如何避免卡住、反复重试和消耗 Token?从任务边界、进展证据、预算、停止原因与恢复检查,设计可接手的有界自主运行。
从一次测试用例生成 Agent 的重构出发,讨论为什么 Prompt 无法保证执行流程,以及如何用 Execution Contract、Validator、Trace 和 Drift 检测把 Agent 的过程可靠性变成可验证问题。
把 Trace、Evidence、Failure Regression、Eval 收束到 Merge / Release Gate,让 Agent 的结果从“能运行”走向“可交付”。
Harness 负责产生可信执行事实,Eval 负责跨任务和版本判断质量。本文拆开 Runtime、Trace、Evaluator、Regression 和 Gate 的职责。
把一次真实 Agent 事故沉淀成可复现、可判断、可长期执行的 Regression Case,形成 Failure Corpus。
Agent 最终通过并不代表过程可靠:从执行轨迹、独立证据、失败回归到 Quality Gate,讨论 Agent Reliability 的工程判断。
执行 → 证据 → 评测 → 回归 → 交付