SERIES / 01
Agent Harness:从入门到 Reliability
从基础概念、运行机制到 Trace、Eval、Failure Regression 与 Quality Gate,逐步建立可验证的 Agent 执行系统。
NOTES ON AI ENGINEERING RELIABILITY
Agent Reliability · Harness · AI Testing · Runtime Quality
研究 AI 系统从生成、执行、验证到交付过程中的可靠性问题。
SERIES / 01
从基础概念、运行机制到 Trace、Eval、Failure Regression 与 Quality Gate,逐步建立可验证的 Agent 执行系统。
SERIES / 02
从 Benchmark、业务 Eval、Dataset 和 LLM-as-a-Judge,逐步进入 Agent Eval、Trace Grading、Failure Corpus、Regression 与 Quality Gate。
用一个提交申请的合成示例,说明如何关联需求缺口与测试用例、限制依赖范围,并在规则确认后重新校验,避免局部缺口阻塞全部生成或被悄悄写成确定预期。
测试用例生成被 Gate 卡住,未必都是模型能力问题。区分输入缺口、执行错误与用例质量,分开管理草稿生成和正式交付,并把未知项纳入覆盖报告。
无人值守 Agent 如何避免卡住、反复重试和消耗 Token?从任务边界、进展证据、预算、停止原因与恢复检查,设计可接手的有界自主运行。
从一次测试用例生成 Agent 的重构出发,讨论为什么 Prompt 无法保证执行流程,以及如何用 Execution Contract、Validator、Trace 和 Drift 检测把 Agent 的过程可靠性变成可验证问题。
Eval 只有进入 CI / Quality Gate 才真正参与交付。本文给出 Baseline、Hard Gate、Regression、Flaky Case、Artifact、Override 与发布准入的工程化设计。
Agent Eval 不能只看最终答案。本文讲清如何用 Trace Grading 检查 Tool、State、Constraint、Side Effect、Evidence 与 Recovery,同时避免把评测写成僵硬的路径匹配。
Failure Corpus 不是错误日志堆积,而是把真实失败结构化成可复现、可归因、可回归的质量资产。本文给出 Failure → Root Cause → Regression Case 的完整闭环。
Offline Eval 负责发布前的可重复比较,Online Eval 负责发现真实生产分布与新失败。本文给出两者的边界、数据闭环与落地方式。