Harness Engineering
Harness Engineering
模型外面运行的系统:Harness
Not model, prompt and RAG
The key point : how to devide the task into different parts
How Harness evolve
Prompt -> context -> Harness
Prompt : understand
You should say your problems explicitly
提示词本质:局部概率空间
要求:语言的设计
无法:凭空弥补信息
用于聊天机器人年代
Context
进入Agent时代
关键:整条任务链条能不能跑通
核心:把正确信息送进去
Context不只是几段背景资料,是不同时期的内容总和
例:RAG

Agent skills的本质也一样
Skills:渐进式披露
按需给、分层给、正确时机给
问题:模型不一定能稳定执行对
之前努力都在解决输入侧的问题
谁来监督、约束?
Harness
本义:缰绳
怎么让模型别跑偏
持续观测、纠偏的基础

Harness 构成
Harness = Agent - Model
也就是除了模型以外的东西
一、上下文处理
本质就是Context
模型在正确信息边界内思考
- 角色目标定义
- 信息选择和裁剪
- 结构化组织
二、工具系统
连上工具
不是简单挂工具
- 给什么工具
- 什么时候该调用工具
- 结果怎么给回模型
三、执行编排
模型下一步要做什么
轨道:
- 理解目标
- 判断信息
- 继续分析
- 检查输出
四、状态和记忆
管理状态,分清三类:
- 当前任务状态
- 中间结果
- 长期记忆偏好
五、评估和观测
长期停留在“自我感觉良好”的状态
- 输出验收
- 环境验收
- …
六、约束校验与失败恢复
- 约束:哪些可做
- 校验
- 恢复:回滚状态
公司的产品体系
LangChain、Openai、Anthropic
Anthropic
-
上下文焦虑问题
正常:Context compaction
方法:Context Reset
直接给一个新的模型
-
自评失真
模型自己打分会偏乐观
planner、Generator、Evaluator
带具体环境的验证
生产和验收必须分离
Openai
人类主要负责设计环境
工程师:
- 拆解任务
- 补充能力
- 建立反馈
Agent出问题,不是更努力,而是缺了什么能力
渐进式披露
Agents.md 改成一个目录页,拆到子文档里面
和Skill一样,按需暴露
人类验不过来,让Agent自己验
- 接浏览器
- 接日志指标
- 独立
不止人类Code Review
把工程师经验写出系统工程
自动治理系统
本博客所有文章除特别声明外,均采用 CC BY-NC-SA 4.0 许可协议。转载请注明来源 zhangxixi的博客!



