Agent 前沿
新模型、新框架与新型 Agent 产品观察。
文章
5 篇Agent · Agent 前沿
Pi Agent:一个 Agent Harness 最小可以小到什么程度
沿 Pi 的公开源码拆解一个可用 Agent Harness 的必要组成部分:统一模型接口、Agent Loop、消息模型、工具契约、steering 队列、会话树与扩展边界,并回答哪些责任必须留在运行时之外。
Pi AgentAgent HarnessAgent LoopTool CallingContext Engineering
Agent · Agent 前沿
DSH:Everything is a Plugin,Agent Harness 如何被拆成可组合能力
沿 DeepSeek Harness 与 Cordis 论文拆解插件化 Agent 运行时:Service Definition、Provider、Consumer、Scope、可逆 effect 与响应式 coeffect,以及可替换 Agent Loop 和运行时自修改的治理边界。
DeepSeek HarnessDSHCordisPlugin ArchitectureAgent Runtime
Agent · Agent 前沿
Jev:为什么 Agent 需要一个比 LLM 更快的控制层
Jev 不生成长文本,而是对有限答案返回类型化决策与概率。本文沿 TypeSafe 官方资料、REFLEX、Jev-Mem 和评测 Judge 三项研究,拆解这种 System One 模型怎样进入 Agent 控制平面,以及它在哪些决策上可靠、在哪些边界上会失效。
JevSystem One ModelAgent Control PlaneModel RoutingAgentic Memory
Agent · Agent 前沿
Agent 自进化:它究竟在修改什么
从 Context、Memory、Skill、Workflow、代码到模型权重,梳理 Agent 自进化的对象、反馈信号、更新周期与安全边界,并结合 ACE、EvoSkill、DGM、AlphaEvolve 与自进化综述,分析哪些修改值得保留、哪些会越改越差。
Agent 自进化Self-Evolving AgentsACEEvoSkillDarwin Gödel MachineAlphaEvolve
Agent · Agent 前沿
Agent 评测闭环:决定进化是否真的有效
从任务契约、结果与轨迹评测、LLM Judge、冻结与隐藏集到 reward hacking、统计显著性、准入门禁和灰度回滚,搭建一套能判断 Agent 改动是否真的更好的评测闭环。
Agent EvaluationEvalsLLM JudgeReward HackingAgent 自进化Observability