king-of-water · 个人博客

你好,我是
king-of-water。

这里记录后端、Agent 实践、项目,以及真正用过的工具。

Pi Agent:一个 Agent Harness 最小可以小到什么程度

沿 Pi 的公开源码拆解一个可用 Agent Harness 的必要组成部分:统一模型接口、Agent Loop、消息模型、工具契约、steering 队列、会话树与扩展边界,并回答哪些责任必须留在运行时之外。

Pi AgentAgent HarnessAgent LoopTool CallingContext Engineering

DSH:Everything is a Plugin,Agent Harness 如何被拆成可组合能力

沿 DeepSeek Harness 与 Cordis 论文拆解插件化 Agent 运行时:Service Definition、Provider、Consumer、Scope、可逆 effect 与响应式 coeffect,以及可替换 Agent Loop 和运行时自修改的治理边界。

DeepSeek HarnessDSHCordisPlugin ArchitectureAgent Runtime

Jev:为什么 Agent 需要一个比 LLM 更快的控制层

Jev 不生成长文本,而是对有限答案返回类型化决策与概率。本文沿 TypeSafe 官方资料、REFLEX、Jev-Mem 和评测 Judge 三项研究,拆解这种 System One 模型怎样进入 Agent 控制平面,以及它在哪些决策上可靠、在哪些边界上会失效。

JevSystem One ModelAgent Control PlaneModel RoutingAgentic Memory

Agent 自进化:它究竟在修改什么

从 Context、Memory、Skill、Workflow、代码到模型权重,梳理 Agent 自进化的对象、反馈信号、更新周期与安全边界,并结合 ACE、EvoSkill、DGM、AlphaEvolve 与自进化综述,分析哪些修改值得保留、哪些会越改越差。

Agent 自进化Self-Evolving AgentsACEEvoSkillDarwin Gödel MachineAlphaEvolve

Agent 评测闭环:决定进化是否真的有效

从任务契约、结果与轨迹评测、LLM Judge、数据分层到 reward hacking、统计显著性、准入门禁和灰度回滚,搭建一套能判断 Agent 改动是否真的更好的评测闭环。

Agent EvaluationEvalsLLM JudgeReward HackingAgent 自进化Observability

LLM Wiki:把仓库编译成能读、能查、能更新的知识

从知识模型、页面规划、证据组装、分层生成到更新、评测与治理,讲清怎样把代码仓库编译成一套可追溯、可维护的知识页,以及它和 RAG、Repo Map 的分工。

LLM Wiki代码知识库知识工程Context Engineering代码理解