让 Agent 下班后继续跑:有界自主运行怎么设计?
无人值守 Agent 如何避免卡住、反复重试和消耗 Token?从任务边界、进展证据、预算、停止原因与恢复检查,设计可接手的有界自主运行。
RESEARCH TOPIC
连接 Agent Observability、Agent Trace 与独立执行证据。
无人值守 Agent 如何避免卡住、反复重试和消耗 Token?从任务边界、进展证据、预算、停止原因与恢复检查,设计可接手的有界自主运行。
从一次测试用例生成 Agent 的重构出发,讨论为什么 Prompt 无法保证执行流程,以及如何用 Execution Contract、Validator、Trace 和 Drift 检测把 Agent 的过程可靠性变成可验证问题。
Agent Eval 不能只看最终答案。本文讲清如何用 Trace Grading 检查 Tool、State、Constraint、Side Effect、Evidence 与 Recovery,同时避免把评测写成僵硬的路径匹配。
Model Eval 主要评模型输出,Agent Eval 还必须评 Tool、State、Trace、Side Effect、Evidence 和最终任务完成度。本文拆开两者的评价对象和工程边界。
Harness 负责产生可信执行事实,Eval 负责跨任务和版本判断质量。本文拆开 Runtime、Trace、Evaluator、Regression 和 Gate 的职责。
Agent Trace 不只是日志。本文从 Run、Turn、Tool、State、Artifact、Verification 六类事件设计一条可定位、可验证、可回归的执行证据链。
从 Context Build、Model Decision、Action Validation、Tool Execution、Observation、State Update 到 Termination,拆开一个完整 Agent Loop。
从模型调用、Agent Loop、Tool、Context、State 到 Trace,解释 Agent Harness 在 Agent 系统里到底负责什么。
Agent 最终通过并不代表过程可靠:从执行轨迹、独立证据、失败回归到 Quality Gate,讨论 Agent Reliability 的工程判断。
执行 → 证据 → 评测 → 回归 → 交付