Agent 方法与评测
规划、反思、自进化、多 Agent 协作,以及效果如何被可靠评估。
文章
2 篇Agent · Agent 方法与评测
Agent 自进化:它究竟在修改什么
从 Context、Memory、Skill、Workflow、代码到模型权重,梳理 Agent 自进化的对象、反馈信号、更新周期与安全边界,并结合 ACE、EvoSkill、DGM、AlphaEvolve 与自进化综述,分析哪些修改值得保留、哪些会越改越差。
Agent 自进化Self-Evolving AgentsACEEvoSkillDarwin Gödel MachineAlphaEvolve
Agent · Agent 方法与评测
Agent 评测闭环:决定进化是否真的有效
从任务契约、结果与轨迹评测、LLM Judge、数据分层到 reward hacking、统计显著性、准入门禁和灰度回滚,搭建一套能判断 Agent 改动是否真的更好的评测闭环。
Agent EvaluationEvalsLLM JudgeReward HackingAgent 自进化Observability