不是学术论文,是一线实践者的工程笔记。
核心结论:模型能力只决定下限,Harness 设计决定上限——同一条 API 可以差 10 倍。
每篇文章都可以独立阅读,建议从适合你身份的入口开始
想理解 Agent 产品的技术差异,做技术选型
从 PRD TechPlan 开始 →想在自己的项目里用上这些思路
从核心创新点 01 开始 →关注 Agent 架构的学术脉络
从论文数据库开始 →跳过理论,直接上手工具
去看产品体系 →每篇独立的深度文章,共享同一个核心逻辑:把不可丢失的和可以压缩的分开
Prompt 指令在长任务中会失效,让 Harness 自查自修而非让模型硬记
从"Harness→LLM"单向流变为"LLM⇄Harness"双向主动流
Agent 表现退化不一定是模型问题,也可能是上下文与注意力管理的问题
把稳定约束与可压缩历史分离,降低约束在压缩中丢失的风险
把 Agent 内部的优化原理应用到文档规范上
Plan 从扁平清单升级为有向依赖图,改一步自动级联修正
审查标准是 f(KV Cache, Plan 复杂度) 而非固定阈值
需求蔓延和技术蔓延是两种病,不能用同一种药
Agent 完成复杂任务→提议沉淀为 Skill→下次减少重复推理
识别任务意图→自动匹配采访深度/审查标准/执行模式
用独立快照控制审查上下文,而非反复携带完整历史
收敛任务要强记忆,发散任务要弱记忆
不只是缓存 System Prompt——让整个 Agent 以 Cache 优先
每个 Token 都要证明自己的存在价值
DeepSeek V4 独有的 XML 标记格式优化
V4 内置的 6 种特殊 token 路由
reasoning_effort 三级控制策略
注入时效信息到注意力权重最高的位置