不是学术论文,是一线实践者的工程笔记。
核心结论:模型能力只决定下限,Harness 设计决定上限——同一条 API 可以差 10 倍。
每篇文章都可以独立阅读,建议从适合你身份的入口开始
想理解 Agent 产品的技术差异,做技术选型
从 PRD TechPlan 开始 →想在自己的项目里用上这些思路
从核心创新点 01 开始 →关注 Agent 架构的学术脉络
从论文数据库开始 →跳过理论,直接上手工具
去看产品体系 →每篇独立的深度文章,共享同一个核心逻辑:把不可丢失的和可以压缩的分开
Prompt 指令在长任务中会失效,让 Harness 自查自修而非让模型硬记
02从"Harness→LLM"单向流变为"LLM⇄Harness"双向主动流
03Agent 表现退化不一定是模型问题,也可能是上下文与注意力管理的问题
04把稳定约束与可压缩历史分离,降低约束在压缩中丢失的风险
05把 Agent 内部的优化原理应用到文档规范上
06Plan 从扁平清单升级为有向依赖图,改一步自动级联修正
07审查标准是 f(KV Cache, Plan 复杂度) 而非固定阈值
08需求蔓延和技术蔓延是两种病,不能用同一种药
09Agent 完成复杂任务→提议沉淀为 Skill→下次减少重复推理
10识别任务意图→自动匹配采访深度/审查标准/执行模式
11用独立快照控制审查上下文,而非反复携带完整历史
12收敛任务要强记忆,发散任务要弱记忆
13不只是缓存 System Prompt——让整个 Agent 以 Cache 优先
14每个 Token 都要证明自己的存在价值
15DeepSeek V4 独有的 XML 标记格式优化
16V4 内置的 6 种特殊 token 路由
17reasoning_effort 三级控制策略
18注入时效信息到注意力权重最高的位置