Selected projects · engineering judgment

先有判断,
后有证据。

这里整理的是归纳,不是罗列。每个案例都从一个判断开始——问题如何被界定、边界如何收束、结论如何验证——再落到可以核验的证据链。

01 · Engineering judgment

独立研究

先看判断,再看案例。

下面三条是我反复使用的工作判断;两个主案例和后面的方法研究,都是这些判断的落点。

AUT-01 · Agent 的判别标准

不是调了 LLM,就算 Agent。

可调用的 tools、observe-act 循环、由模型自主判断的终止条件,三者缺一不可。单次生成是 LLM 应用,固定流程 DAG 是 workflow——框架或调用方式本身不决定边界。

为什么重要:先分清对象,才能决定该把哪一层做成 Agent、哪一层做成确定性的流程。

AUT-02 · Agent 与 Harness 的分工

Agent 决定做什么,
Harness 决定在什么约束下做。

工具协议、循环边界、终止判断、状态恢复与审计追溯,从业务逻辑里剥出来,成为独立基础设施,让 Agent 行为可观测、可约束、可回归。

为什么重要:两个案例里,Agent 负责判断与执行,边界与审计由工程约束承接,而不是埋进提示词。

AUT-03 · 证据优先的公约数

结论必须能回到证据,
不能证明的就保留状态。

证据优先、显式拒答或诊断状态、人在回路、可重复生成——这些是贯穿案例的公约数:不把不确定性伪装成事实,只把可验证的结论发布出去。

为什么重要:RAG 的拒答状态、SQL 血缘的诊断状态与人工审核,都是同一判断的落点。

03 · Agent engineering study

独立研究

判断如何变成工具:
Plugins、Skills 与可验证编排

上面的判断要落地,需要工具层承接。模型提供通用推理能力,但工程系统需要回答更具体的问题:什么时候触发哪套流程、主 Agent 把什么交给 Subagents、哪些工具可以使用、什么动作需要批准,以及一次修改有没有破坏原有能力。

为什么从 Skills 开始

先把工作方法写成合同,
再把能力打包成产品。

Skill 定义任务边界、输入输出、步骤、资源、失败语义和验证方式;Plugin 再把一个或多个 Skills、连接器与工具依赖组织成可安装、可分发的能力包。这样,业务方法不会被埋进某个模型、提示词或客户端代码里。

Skill工作流合同

说明何时触发、怎样执行、何时拒绝,以及输出必须满足什么。

Plugin能力分发

将 Skills、连接器、MCP 工具和呈现资产组合为可安装单元。

Harness执行系统

管理上下文、工具调用、沙箱、审批、进度、失败和跨轮状态。

Golden Evals发布证据

用固定案例、评分器和人工校准证明新版本没有关键回归。

Orchestration

Skill 如何编排主 Agent 与 Subagents

主 Agent 保留需求、合同和最终决策;Subagents 只接收边界清晰、可以独立验证的工作包。Skill 规定什么时候允许并行、子任务应返回什么,以及发生共享写入或合同冲突时如何降级为串行。

Main Agent 理解目标并冻结合同

确认输入、输出、公开边界、依赖和成功标准。

Subagent A代码与调用链探索
Subagent B测试与失败样本检查
Subagent C文档、来源与边界核对
Main Agent 解决冲突并集成验证

只接收证据摘要;共享合同、写入和最终判断回到主线程。

适合并行:只读探索、测试发现、日志分析、资料归纳。必须串行:共享合同、同一文件、线上状态、审批动作和最终发布。

Evaluation

用黄金测试集验证 Skill,而不是凭感觉验收

黄金集不只保存“正确答案”,还要冻结触发条件、不得触发的反例、预期工具轨迹、审批点、状态语义和输出合同。

01

建立案例集

覆盖标准路径、边界、歧义、对抗输入、工具失败和应拒绝场景。

02

在 Harness 中回放

固定 Skill 版本、模型、工具、沙箱和输入,记录完整执行轨迹。

03

分层评分

确定性断言检查合同;规则或模型评分检查质量;关键样本由人工校准。

04

设置发布门禁

比较基线版本;关键案例不得回归,新发现的失败追加到黄金集。

触发准确率合同满足率工具与审批轨迹任务正确性拒绝正确率成本与时延
Examples

几个可以说明设计边界的 Skills

下面列的是工作流样本,不代表公开其私有指令、凭据、会话内容或运行数据。

openai-docs

受来源约束的技术研究

先检索并打开官方资料,再回答产品、API 与 Codex 问题;来源范围和引用要求本身就是 Skill 合同。

研究路由 · 来源门禁 · 引用验证
skill-creator

把稳定工作流变成 Skill

从目标、触发条件、输入输出和失败语义出发,生成最小的 SKILL.md 与必要资源。

需求冻结 · 渐进披露 · 结构校验
plugin-creator

把能力打包为 Plugin

组织清单、Skills 与可选依赖,验证安装和分发边界;Plugin 是包装层,不替代工作流合同。

Manifest · 能力清单 · 分发验证
shared-chrome-session

已登录浏览器的协作控制

以标签页租约、刷新检查和人工确认约束共享会话,避免多个 Agent 争用状态或越过外部副作用边界。

会话租约 · 审计事件 · 人工批准