king-of-water · 个人博客

你好,我是
king-of-water。

这里记录后端、Agent 实践、项目,以及真正用过的工具。

Pi Agent:一个 Agent Harness 最小可以小到什么程度

沿 Pi 的公开源码拆解一个可用 Agent Harness 的必要组成部分:统一模型接口、Agent Loop、消息模型、工具契约、steering 队列、会话树与扩展边界,并回答哪些责任必须留在运行时之外。

Pi AgentAgent HarnessAgent LoopTool CallingContext Engineering

DSH:Everything is a Plugin,Agent Harness 如何被拆成可组合能力

沿 DeepSeek Harness 与 Cordis 论文拆解插件化 Agent 运行时:Service Definition、Provider、Consumer、Scope、可逆 effect 与响应式 coeffect,以及可替换 Agent Loop 和运行时自修改的治理边界。

DeepSeek HarnessDSHCordisPlugin ArchitectureAgent Runtime

Jev:为什么 Agent 需要一个比 LLM 更快的控制层

Jev 不生成长文本,而是对有限答案返回类型化决策与概率。本文沿 TypeSafe 官方资料、REFLEX、Jev-Mem 和评测 Judge 三项研究,拆解这种 System One 模型怎样进入 Agent 控制平面,以及它在哪些决策上可靠、在哪些边界上会失效。

JevSystem One ModelAgent Control PlaneModel RoutingAgentic Memory

Agent 自进化:它究竟在修改什么

从 Context、Memory、Skill、Workflow、代码到模型权重,梳理 Agent 自进化的对象、反馈信号、更新周期与安全边界,并结合 ACE、EvoSkill、DGM、AlphaEvolve 与自进化综述,分析哪些修改值得保留、哪些会越改越差。

Agent 自进化Self-Evolving AgentsACEEvoSkillDarwin Gödel MachineAlphaEvolve

Agent 评测闭环:决定进化是否真的有效

从任务契约、结果与轨迹评测、LLM Judge、冻结与隐藏集到 reward hacking、统计显著性、准入门禁和灰度回滚,搭建一套能判断 Agent 改动是否真的更好的评测闭环。

Agent EvaluationEvalsLLM JudgeReward HackingAgent 自进化Observability

Claude Code 架构拆解:Query Loop、Compact 与 Memory

以 Anthropic 官方文档为事实边界,结合特定版本的客户端还原资料,拆解 Claude Code 的主循环、上下文装配、五层压缩、自动记忆、工具权限与子 Agent。

Claude CodeAgent HarnessQuery LoopCompactMemoryContext EngineeringSubAgent