# LLM + Harness = Agent — Agent 架构深度研究 > LLM 索引文件。本文件是 18 篇深度研究文章的导航入口。完整全文见 [llms-full.txt](https://harness-papers.starseas.org/llms-full.txt)。 ## 一句话 18 篇深度分析从理论与源码验证 Agent 架构设计。不是学术论文,是一线实践者的工程笔记。核心结论:**模型能力决定下限,Harness 设计决定上限——同一条 API 可以差 10 倍**。 ## 完整论文(18 篇,每篇独立页面) - [01 Agent 免疫系统:从 Prompt 违规到可审计的系统加固](https://harness-papers.starseas.org/papers/01-agent-immune-system) — Agent 可能因为指令冲突、上下文遗漏、错误检索、工具结果噪音、模型行为波动或 Runtime 缺少强制检查而违反约束 - [02 模型元请求:让 LLM 声明需求,但不交出 Runtime 控制权](https://harness-papers.starseas.org/papers/02-bidirectional-agent) — LLM API 通常采用请求—响应协议:客户端调用模型,模型在响应中返回文本或 Tool Calls。模型不能在请求之外 - [03 注意力预算管理:从“稀释定律”改为可验证的上下文分配](https://harness-papers.starseas.org/papers/03-attention-budget) — 长任务中的 Agent 可能出现约束遗漏、目标漂移、工具选择错误、重复读取和审查质量下降,但这些现象不能简单归因于“注意 - [04 稳定约束与可压缩历史分区:Context Compiler,而不是“KV Cache 免死区”](https://harness-papers.starseas.org/papers/04-kv-cache-prefix) — 长任务会产生用户约束、项目规则、工具轨迹、测试结果、历史讨论和临时信息。它们的生命周期不同,不应该由同一套压缩策略处理。 - [05 Agent 可读文档结构:稳定摘要、内容寻址与按需读取](https://harness-papers.starseas.org/papers/05-document-kv-cache) — 大型项目文档常同时承担四种职责: - [06 PlanGraph:验收标准、依赖边与级联失效](https://harness-papers.starseas.org/papers/06-okr-planstep-cascade) — 复杂任务中的步骤通常存在: - [07 风险与证据驱动的审查切换](https://harness-papers.starseas.org/papers/07-review-switching) — 固定审查流程会在两端失效: - [08 范围治理:区分产品范围扩张与实现依赖发现](https://harness-papers.starseas.org/papers/08-scope-creep) — 用户说“加一个基础 JWT 登录”,执行中可能出现两类变化: - [09 Skills 自进化闭环:从经验提取到受治理的软件供应链](https://harness-papers.starseas.org/papers/09-skills-self-evolution) — 复杂任务中确实可能出现可复用模式,例如: - [10 意图→策略自动切换:从已观察路由到 7+1 设计提案](https://harness-papers.starseas.org/papers/10-intent-routing) — 不同任务需要不同执行策略: - [11 Checkpoint 驱动的多轮审查:状态快照必须连接原始证据](https://harness-papers.starseas.org/papers/11-checkpoint-review) — 复杂任务需要在执行过程中多次确认: - [12 Memory 粒度控制:按任务、来源和风险编译记忆](https://harness-papers.starseas.org/papers/12-memory-granularity) — Memory 可以减少重复沟通,也可能引入: - [13 Byte-Stable Prefix:受正确性约束的缓存优化不变量](https://harness-papers.starseas.org/papers/13-byte-stable-prefix-architecture) — Prefix Cache 的基本工程机会是:如果多次请求共享相同前缀,Provider 可能复用部分计算,降低输入成本或 - [14 Reasoning Content 回传策略:协议正确性优先于 Token 优化](https://harness-papers.starseas.org/papers/14-reasoning-content-stripping) — 推理模型的响应可能包含: - [15 DSML 编码层研究:内部表示不等于客户端协议](https://harness-papers.starseas.org/papers/15-dsml-tool-call-optimization) — DeepSeek V4 的编码源码中存在 DSML(DeepSeek Markup Language)特殊 Token - [16 Quick Instruction 路由:编码层能力与公共 API 可用性必须分开](https://harness-papers.starseas.org/papers/16-quick-instruction-routing) — DeepSeek V4 编码源码定义了六类任务特殊 Token: - [17 推理强度控制:参数接受、真实语义与任务收益必须分别验证](https://harness-papers.starseas.org/papers/17-reasoning-effort-control) — “让模型多想一点”不是一个单一能力。可能涉及: - [18 最新提醒注入:动态上下文的位置、来源与时效实验](https://harness-papers.starseas.org/papers/18-latest-reminder-injection) — 日期、时区、用户位置、当前页面、运行状态和临时约束会频繁变化,不适合与长期稳定规则混在同一不可变 System 前缀中。 ## 核心架构 - **LLM(概率推理引擎)**:理解意图、生成代码、逻辑推理、模式识别 - **Harness Runtime(控制与证据系统)**:持久记忆、工具与权限、状态与编排、Checkpoint 与验证、模型路由与成本遥测、沙箱恢复与审查 ## 读者路径 - 产品经理/决策者 → 第 10 篇起(意图路由/审查切换) - 开发者 → 从第 01 篇 Agent 免疫系统开始 - 研究者 → 关注 KV Cache 与模型路由系列(04/07/13/15/16) - 只想直接用产品 → 去看产品体系(deepseek.starseas.org)