Harness Engineering

模型外面运行的系统:Harness

Not model, prompt and RAG

The key point : how to devide the task into different parts

How Harness evolve

Prompt -> context -> Harness

Prompt : understand

You should say your problems explicitly

提示词本质:局部概率空间

要求:语言的设计

无法:凭空弥补信息

用于聊天机器人年代

Context

进入Agent时代

关键:整条任务链条能不能跑通

核心:把正确信息送进去

Context不只是几段背景资料,是不同时期的内容总和

例:RAG

image-20260731155604210

Agent skills的本质也一样

Skills:渐进式披露

按需给、分层给、正确时机给

问题:模型不一定能稳定执行对

之前努力都在解决输入侧的问题

谁来监督、约束?

Harness

本义:缰绳

怎么让模型别跑偏

持续观测、纠偏的基础

image-20260731155854928

Harness 构成

Harness = Agent - Model

也就是除了模型以外的东西

一、上下文处理

本质就是Context

模型在正确信息边界内思考

  1. 角色目标定义
  2. 信息选择和裁剪
  3. 结构化组织

二、工具系统

连上工具

不是简单挂工具

  1. 给什么工具
  2. 什么时候该调用工具
  3. 结果怎么给回模型

三、执行编排

模型下一步要做什么

轨道:

  1. 理解目标
  2. 判断信息
  3. 继续分析
  4. 检查输出

四、状态和记忆

管理状态,分清三类:

  1. 当前任务状态
  2. 中间结果
  3. 长期记忆偏好

五、评估和观测

长期停留在“自我感觉良好”的状态

  1. 输出验收
  2. 环境验收

六、约束校验与失败恢复

  1. 约束:哪些可做
  2. 校验
  3. 恢复:回滚状态

公司的产品体系

LangChain、Openai、Anthropic

Anthropic

  1. 上下文焦虑问题

    正常:Context compaction

    方法:Context Reset

    直接给一个新的模型

  2. 自评失真

    模型自己打分会偏乐观

    planner、Generator、Evaluator

    带具体环境的验证

    生产和验收必须分离

Openai

人类主要负责设计环境

工程师:

  1. 拆解任务
  2. 补充能力
  3. 建立反馈

Agent出问题,不是更努力,而是缺了什么能力

渐进式披露

Agents.md 改成一个目录页,拆到子文档里面

和Skill一样,按需暴露

人类验不过来,让Agent自己验

  1. 接浏览器
  2. 接日志指标
  3. 独立

不止人类Code Review

把工程师经验写出系统工程

自动治理系统