18 篇深度分析 · 持续更新

LLM + Harness = Agent
让 AI 模型在真实场景中可靠工作

不是学术论文,是一线实践者的工程笔记。
核心结论:模型能力只决定下限,Harness 设计决定上限——同一条 API 可以差 10 倍。

从你的角色开始

每篇文章都可以独立阅读,建议从适合你身份的入口开始

产品经理 / 决策者

想理解 Agent 产品的技术差异,做技术选型

从 PRD TechPlan 开始 →

开发者

想在自己的项目里用上这些思路

从核心创新点 01 开始 →

研究者

关注 Agent 架构的学术脉络

从论文数据库开始 →

只想直接用产品

跳过理论,直接上手工具

去看产品体系 →

18 篇创新分析

每篇独立的深度文章,共享同一个核心逻辑:把不可丢失的和可以压缩的分开

01

Agent 免疫系统

Prompt 指令在长任务中会失效,让 Harness 自查自修而非让模型硬记

02

大脑主动驱动小脑

从"Harness→LLM"单向流变为"LLM⇄Harness"双向主动流

03

注意力预算管理

Agent 表现退化不一定是模型问题,也可能是上下文与注意力管理的问题

04

KV Cache 硬约束前缀注入

把稳定约束与可压缩历史分离,降低约束在压缩中丢失的风险

05

文档 KV Cache 优化结构

把 Agent 内部的优化原理应用到文档规范上

06

OKR PlanStep + 级联修正

Plan 从扁平清单升级为有向依赖图,改一步自动级联修正

07

KV Cache 驱动的审查深度切换

审查标准是 f(KV Cache, Plan 复杂度) 而非固定阈值

08

两层面范围蔓延的分治策略

需求蔓延和技术蔓延是两种病,不能用同一种药

09

Skills 自进化闭环

Agent 完成复杂任务→提议沉淀为 Skill→下次减少重复推理

10

7+1 意图→策略自动切换

识别任务意图→自动匹配采访深度/审查标准/执行模式

11

Checkpoint 快照驱动的多轮审查

用独立快照控制审查上下文,而非反复携带完整历史

12

Memory 粒度控制

收敛任务要强记忆,发散任务要弱记忆

13

Byte-Stable Prefix 作为架构约束

不只是缓存 System Prompt——让整个 Agent 以 Cache 优先

14

Reasoning Content 回传陷阱

每个 Token 都要证明自己的存在价值

15

DSML 工具调用格式优化

DeepSeek V4 独有的 XML 标记格式优化

16

Quick Instruction 路由

V4 内置的 6 种特殊 token 路由

17

推理强度控制

reasoning_effort 三级控制策略

18

最新提醒注入

注入时效信息到注意力权重最高的位置

核心架构

LLM(概率推理引擎)
  • 理解用户意图
  • 生成代码 / 文本
  • 逻辑推理
  • 模式识别
Harness Runtime(控制与证据系统)
  • 持久记忆(Memory)
  • 工具与权限(Tools + Policy)
  • 状态与编排(State + Orchestrator)
  • Checkpoint 与验证(Evidence)
  • 模型路由与成本遥测
  • 沙箱、恢复与审查