全部文章 · 31 篇
测试用例 Agent 的门禁落地:一条需求缺口,应该挡住哪些用例?
用一个提交申请的合成示例,说明如何关联需求缺口与测试用例、限制依赖范围,并在规则确认后重新校验,避免局部缺口阻塞全部生成或被悄悄写成确定预期。
需求不完整时,测试用例生成的 Gate 应该怎么判?
测试用例生成被 Gate 卡住,未必都是模型能力问题。区分输入缺口、执行错误与用例质量,分开管理草稿生成和正式交付,并把未知项纳入覆盖报告。
让 Agent 下班后继续跑:有界自主运行怎么设计?
无人值守 Agent 如何避免卡住、反复重试和消耗 Token?从任务边界、进展证据、预算、停止原因与恢复检查,设计可接手的有界自主运行。
Agent 会跳步骤:从测试用例生成失败到 Execution Contract Drift
从一次测试用例生成 Agent 的重构出发,讨论为什么 Prompt 无法保证执行流程,以及如何用 Execution Contract、Validator、Trace 和 Drift 检测把 Agent 的过程可靠性变成可验证问题。
怎么把 AI Eval 接进 CI / Quality Gate?让评测真正阻断坏版本
Eval 只有进入 CI / Quality Gate 才真正参与交付。本文给出 Baseline、Hard Gate、Regression、Flaky Case、Artifact、Override 与发布准入的工程化设计。
Agent Trace Grading 怎么设计?结果正确,过程也可能已经失控
Agent Eval 不能只看最终答案。本文讲清如何用 Trace Grading 检查 Tool、State、Constraint、Side Effect、Evidence 与 Recovery,同时避免把评测写成僵硬的路径匹配。
线上失败怎么变成 Failure Corpus?从一次事故到持续回归
Failure Corpus 不是错误日志堆积,而是把真实失败结构化成可复现、可归因、可回归的质量资产。本文给出 Failure → Root Cause → Regression Case 的完整闭环。
Offline Eval 和 Online Eval 有什么区别?一套 AI 系统为什么两个都需要
Offline Eval 负责发布前的可重复比较,Online Eval 负责发现真实生产分布与新失败。本文给出两者的边界、数据闭环与落地方式。
Eval 指标怎么设计?为什么 Pass Rate 远远不够
AI Eval 不能只看 Pass Rate。本文拆解 Task Success、pass@k、pass^k、Critical Failure、False Pass、Latency、Cost、Retry、Evidence 与 Regression Delta。
LLM-as-a-Judge 怎么做才靠谱?从 Rubric、偏差到人工校准
LLM-as-a-Judge 适合开放任务的大规模评测,但不能直接把模型分数当真值。本文给出 Rubric、Pairwise、Reference、偏差控制、人工校准与 Judge Regression 的实用方法。
怎样构造一套真正有用的业务 Eval Dataset?
业务 Eval Dataset 不应该只是随机抽样。本文给出从真实任务、失败案例、边界条件到数据分层、Gold Label、Holdout 与持续回归的一套工程化构造方法。
Model Eval 和 Agent Eval 有什么区别?从单次输出到完整执行轨迹
Model Eval 主要评模型输出,Agent Eval 还必须评 Tool、State、Trace、Side Effect、Evidence 和最终任务完成度。本文拆开两者的评价对象和工程边界。
排行榜第一,为什么到了你的业务里可能不好用?
模型排行榜能帮助理解通用能力,但不能替代业务评测。本文从任务分布、Harness、Prompt、Tool、Latency、Cost 和 Failure Set 解释为什么生产选型必须自己做 Eval。
大模型评测到底在评什么?Benchmark、Eval、业务评测一次讲清
大模型评测不只是跑 Benchmark。本文拆开公开基准、模型能力评测、业务 Eval、自动 Grader 与持续回归,给出一套工程化评测框架。
Agent Harness 的终点:从执行引擎走向 Quality Gate
把 Trace、Evidence、Failure Regression、Eval 收束到 Merge / Release Gate,让 Agent 的结果从“能运行”走向“可交付”。
Harness 和 Eval 平台到底是什么关系?
Harness 负责产生可信执行事实,Eval 负责跨任务和版本判断质量。本文拆开 Runtime、Trace、Evaluator、Regression 和 Gate 的职责。
一次 Agent 失败,怎么变成一条 Regression Case?
把一次真实 Agent 事故沉淀成可复现、可判断、可长期执行的 Regression Case,形成 Failure Corpus。
结果正确就够了吗?给 Agent 设计 Evidence Contract
把 Agent 的“我完成了”升级为可验证结果:定义 Evidence Contract、独立验证、Artifact 引用和 VERIFIED / UNVERIFIED 状态。
Agent 调错工具怎么办:Timeout、Retry、Budget 与 Side Effect
把 Agent Tool 执行拆成错误分类、Timeout、Retry、Budget、Idempotency 和 Side Effect 六个控制点,避免最终成功掩盖过程失控。
Trace 不是日志:Harness 应该记录哪些执行证据?
Agent Trace 不只是日志。本文从 Run、Turn、Tool、State、Artifact、Verification 六类事件设计一条可定位、可验证、可回归的执行证据链。
Harness 到底应该管什么?从 Agent Loop 到 Reliability Boundary
从 Context、Tool、State、Policy、Trace、Recovery 到 Verification,定义 Agent Harness 应该负责什么,以及哪些能力不应该继续塞进 Prompt。
一个 Agent Loop 到底是怎么跑起来的?
从 Context Build、Model Decision、Action Validation、Tool Execution、Observation、State Update 到 Termination,拆开一个完整 Agent Loop。
smolagents 教程:用 CodeAgent 跑通一个 Agent Loop
Hugging Face smolagents 入门教程:用 CodeAgent / ToolCallingAgent 跑通 Agent Loop,理解 max_steps、planning_interval、step_callbacks 与代码执行安全边界。
Agent、Framework、Workflow、Runtime、Harness 到底有什么区别?
用五个工程问题讲清 Agent、Agent Framework、Workflow、Runtime 和 Harness 的边界,以及为什么这些概念经常重叠。
Agent 为什么需要 Harness:模型负责决策,系统负责约束
为什么 Prompt 不能替代执行约束?从 Permission、Budget、Timeout、Side Effect、Evidence 到 Recovery,解释 Harness 如何成为 Agent Reliability 的边界。
手写 Agent Harness:用 Python 实现 Loop、Tool、Policy 与 Trace
不用 Agent Framework,用 Python 从零实现一个最小 Agent Harness:包含 Model Adapter、Tool Registry、Policy、Trace、max_steps 与执行循环。
OpenAI Agents SDK 教程:安装、Tool、Session 与 Trace
OpenAI Agents SDK 入门教程:从安装开始,跑通 Agent、Runner、Tool、SQLiteSession 与 Tracing,并理解它们和 Agent Harness 的关系。
2026 Agent Harness / Runtime 工具盘点:主流方案怎么选
2026 Agent Harness / Runtime 工具盘点:对比 OpenAI、Microsoft、Cloudflare、LangGraph、Google ADK 与 smolagents 的 Loop、State、Trace、Permission 和 Recovery 能力,帮助选择...
Agent Harness 是什么?为什么它正在成为 Agent 工程的关键一层
从模型调用、Agent Loop、Tool、Context、State 到 Trace,解释 Agent Harness 在 Agent 系统里到底负责什么。
如何申请技术专利:从一个技术点,到一份能提交的交底书
面向工程师的技术专利材料准备方法:梳理现有技术、核心差异、技术效果与实施过程,形成可沟通的技术交底书。
Agent 最危险的不是失败,而是“最终通过,但过程已经失控”
Agent 最终通过并不代表过程可靠:从执行轨迹、独立证据、失败回归到 Quality Gate,讨论 Agent Reliability 的工程判断。