不是调了 LLM,就算 Agent。
可调用的 tools、observe-act 循环、由模型自主判断的终止条件,三者缺一不可。单次生成是 LLM 应用,固定流程 DAG 是 workflow——框架或调用方式本身不决定边界。
为什么重要:先分清对象,才能决定该把哪一层做成 Agent、哪一层做成确定性的流程。
Selected projects · engineering judgment
这里整理的是归纳,不是罗列。每个案例都从一个判断开始——问题如何被界定、边界如何收束、结论如何验证——再落到可以核验的证据链。
01 · Engineering judgment
独立研究下面三条是我反复使用的工作判断;两个主案例和后面的方法研究,都是这些判断的落点。
可调用的 tools、observe-act 循环、由模型自主判断的终止条件,三者缺一不可。单次生成是 LLM 应用,固定流程 DAG 是 workflow——框架或调用方式本身不决定边界。
为什么重要:先分清对象,才能决定该把哪一层做成 Agent、哪一层做成确定性的流程。
工具协议、循环边界、终止判断、状态恢复与审计追溯,从业务逻辑里剥出来,成为独立基础设施,让 Agent 行为可观测、可约束、可回归。
为什么重要:两个案例里,Agent 负责判断与执行,边界与审计由工程约束承接,而不是埋进提示词。
证据优先、显式拒答或诊断状态、人在回路、可重复生成——这些是贯穿案例的公约数:不把不确定性伪装成事实,只把可验证的结论发布出去。
为什么重要:RAG 的拒答状态、SQL 血缘的诊断状态与人工审核,都是同一判断的落点。
02 · Representative work
下面两条实证,分别把非结构化知识与结构化 SQL 收束为可核验、可审计的结论。
Knowledge assets before retrieval
在 embedding 之前,以受控分类、主题归整、来源回链和入库门禁,把 PPT/PDF 页面转化为高密度知识单元;弱证据显式拒答,回答回到来源页。
Evidence before lineage claims
从目标节点出发,在项目 SQL 快照中自动搜索相关节点与路径,再在已证实的 scope 内追溯字段来源;无法唯一证明的关系保留为诊断状态,交给人工审核。
03 · Agent engineering study
独立研究上面的判断要落地,需要工具层承接。模型提供通用推理能力,但工程系统需要回答更具体的问题:什么时候触发哪套流程、主 Agent 把什么交给 Subagents、哪些工具可以使用、什么动作需要批准,以及一次修改有没有破坏原有能力。
Skill 定义任务边界、输入输出、步骤、资源、失败语义和验证方式;Plugin 再把一个或多个 Skills、连接器与工具依赖组织成可安装、可分发的能力包。这样,业务方法不会被埋进某个模型、提示词或客户端代码里。
说明何时触发、怎样执行、何时拒绝,以及输出必须满足什么。
将 Skills、连接器、MCP 工具和呈现资产组合为可安装单元。
管理上下文、工具调用、沙箱、审批、进度、失败和跨轮状态。
用固定案例、评分器和人工校准证明新版本没有关键回归。
主 Agent 保留需求、合同和最终决策;Subagents 只接收边界清晰、可以独立验证的工作包。Skill 规定什么时候允许并行、子任务应返回什么,以及发生共享写入或合同冲突时如何降级为串行。
确认输入、输出、公开边界、依赖和成功标准。
只接收证据摘要;共享合同、写入和最终判断回到主线程。
适合并行:只读探索、测试发现、日志分析、资料归纳。必须串行:共享合同、同一文件、线上状态、审批动作和最终发布。
黄金集不只保存“正确答案”,还要冻结触发条件、不得触发的反例、预期工具轨迹、审批点、状态语义和输出合同。
覆盖标准路径、边界、歧义、对抗输入、工具失败和应拒绝场景。
固定 Skill 版本、模型、工具、沙箱和输入,记录完整执行轨迹。
确定性断言检查合同;规则或模型评分检查质量;关键样本由人工校准。
比较基线版本;关键案例不得回归,新发现的失败追加到黄金集。
下面列的是工作流样本,不代表公开其私有指令、凭据、会话内容或运行数据。
openai-docs先检索并打开官方资料,再回答产品、API 与 Codex 问题;来源范围和引用要求本身就是 Skill 合同。
研究路由 · 来源门禁 · 引用验证skill-creator从目标、触发条件、输入输出和失败语义出发,生成最小的 SKILL.md 与必要资源。
需求冻结 · 渐进披露 · 结构校验plugin-creator组织清单、Skills 与可选依赖,验证安装和分发边界;Plugin 是包装层,不替代工作流合同。
Manifest · 能力清单 · 分发验证shared-chrome-session以标签页租约、刷新检查和人工确认约束共享会话,避免多个 Agent 争用状态或越过外部副作用边界。
会话租约 · 审计事件 · 人工批准