agent-eval 3 篇
agent-framework 2 篇
Agent Harness 17 篇
- 让 Agent 下班后继续跑:有界自主运行怎么设计?
- Agent 会跳步骤:从测试用例生成失败到 Execution Contract Drift
- Agent Harness 的终点:从执行引擎走向 Quality Gate
- Harness 和 Eval 平台到底是什么关系?
- 一次 Agent 失败,怎么变成一条 Regression Case?
- 结果正确就够了吗?给 Agent 设计 Evidence Contract
- Agent 调错工具怎么办:Timeout、Retry、Budget 与 Side Effect
- Trace 不是日志:Harness 应该记录哪些执行证据?
- Harness 到底应该管什么?从 Agent Loop 到 Reliability Boundary
- 一个 Agent Loop 到底是怎么跑起来的?
- smolagents 教程:用 CodeAgent 跑通一个 Agent Loop
- Agent、Framework、Workflow、Runtime、Harness 到底有什么区别?
- Agent 为什么需要 Harness:模型负责决策,系统负责约束
- 手写 Agent Harness:用 Python 实现 Loop、Tool、Policy 与 Trace
- OpenAI Agents SDK 教程:安装、Tool、Session 与 Trace
- 2026 Agent Harness / Runtime 工具盘点:主流方案怎么选
- Agent Harness 是什么?为什么它正在成为 Agent 工程的关键一层
agent-loop 3 篇
Agent Reliability 17 篇
- 测试用例 Agent 的门禁落地:一条需求缺口,应该挡住哪些用例?
- 需求不完整时,测试用例生成的 Gate 应该怎么判?
- 让 Agent 下班后继续跑:有界自主运行怎么设计?
- Agent 会跳步骤:从测试用例生成失败到 Execution Contract Drift
- 怎么把 AI Eval 接进 CI / Quality Gate?让评测真正阻断坏版本
- Agent Trace Grading 怎么设计?结果正确,过程也可能已经失控
- 线上失败怎么变成 Failure Corpus?从一次事故到持续回归
- Model Eval 和 Agent Eval 有什么区别?从单次输出到完整执行轨迹
- Agent Harness 的终点:从执行引擎走向 Quality Gate
- 一次 Agent 失败,怎么变成一条 Regression Case?
- 结果正确就够了吗?给 Agent 设计 Evidence Contract
- Agent 调错工具怎么办:Timeout、Retry、Budget 与 Side Effect
- Trace 不是日志:Harness 应该记录哪些执行证据?
- Harness 到底应该管什么?从 Agent Loop 到 Reliability Boundary
- Agent 为什么需要 Harness:模型负责决策,系统负责约束
- Agent Harness 是什么?为什么它正在成为 Agent 工程的关键一层
- Agent 最危险的不是失败,而是“最终通过,但过程已经失控”
agent-runtime 4 篇
AI Eval 13 篇
- 测试用例 Agent 的门禁落地:一条需求缺口,应该挡住哪些用例?
- 需求不完整时,测试用例生成的 Gate 应该怎么判?
- 怎么把 AI Eval 接进 CI / Quality Gate?让评测真正阻断坏版本
- 线上失败怎么变成 Failure Corpus?从一次事故到持续回归
- Offline Eval 和 Online Eval 有什么区别?一套 AI 系统为什么两个都需要
- Eval 指标怎么设计?为什么 Pass Rate 远远不够
- LLM-as-a-Judge 怎么做才靠谱?从 Rubric、偏差到人工校准
- 怎样构造一套真正有用的业务 Eval Dataset?
- Model Eval 和 Agent Eval 有什么区别?从单次输出到完整执行轨迹
- 排行榜第一,为什么到了你的业务里可能不好用?
- 大模型评测到底在评什么?Benchmark、Eval、业务评测一次讲清
- Harness 和 Eval 平台到底是什么关系?
- Agent 最危险的不是失败,而是“最终通过,但过程已经失控”
architecture 1 篇
benchmark 1 篇
business-eval 2 篇
ci 1 篇
eval 1 篇
eval-dataset 1 篇
eval-metrics 1 篇
evidence 1 篇
failure-corpus 2 篇
Failure Regression 8 篇
grader 1 篇
human-evaluation 1 篇
llm-as-a-judge 3 篇
llm-benchmark 1 篇
llm-eval 1 篇
model-eval 1 篇
model-evaluation 1 篇
model-selection 1 篇
observability 1 篇
offline-eval 1 篇
online-eval 1 篇
openai-agents-sdk 1 篇
pass-at-k 1 篇
production-monitoring 1 篇
python 1 篇
Quality Gate 7 篇
regression 4 篇
reliability 1 篇
retry 1 篇
root-cause 1 篇
rubric 1 篇
runtime 2 篇
side-effect 1 篇
smolagents 1 篇
timeout 1 篇
tool-calling 1 篇
tools 1 篇
Trace & Evidence 9 篇
- 让 Agent 下班后继续跑:有界自主运行怎么设计?
- Agent 会跳步骤:从测试用例生成失败到 Execution Contract Drift
- Agent Trace Grading 怎么设计?结果正确,过程也可能已经失控
- Model Eval 和 Agent Eval 有什么区别?从单次输出到完整执行轨迹
- Harness 和 Eval 平台到底是什么关系?
- Trace 不是日志:Harness 应该记录哪些执行证据?
- 一个 Agent Loop 到底是怎么跑起来的?
- Agent Harness 是什么?为什么它正在成为 Agent 工程的关键一层
- Agent 最危险的不是失败,而是“最终通过,但过程已经失控”