Agent Skill 自进化|完整流程与效果审计

Agent Skill 自进化|完整流程与效果审计 由 Archify 生成的架构图。 线上用户 Case · 01 线上回流与产题 线上用户 Case 负反馈系统 · 关键词匹配 · 连续 Query 意图重复 · 01 线上回流与产题 负反馈系统 关键词匹配 · 连续 Query 意图重复 负反馈 Trace · 保留任务上下文与执行证据 · 01 线上回流与产题 负反馈 Trace 保留任务上下文与执行证据 自动产题 · 保留原始任务 · 去除用户纠错 Query · 01 线上回流与产题 自动产题 保留原始任务 · 去除用户纠错 Query 产题质检与 Skill 校准 · 题意 / Checkpoint 准确与完整 · 01 线上回流与产题 · 阶段人审 >70% 后自动化 产题质检与 Skill 校准 题意 / Checkpoint 准确与完整 阶段人审 >70% 后自动化 动态 Bad Case 训练集 · 持续更新,用于问题发现与归因 · 01 线上回流与产题 动态 Bad Case 训练集 持续更新,用于问题发现与归因 基准集与评估器建设 · 覆盖采样 · 区分度 · 重复评测 · 01 线上回流与产题 · 高翻转校准;翻转率 16.3% → 3.9% 基准集与评估器建设 覆盖采样 · 区分度 · 重复评测 高翻转校准;翻转率 16.3% → 3.9% 执行训练题,采集对照 Trace · 待优化模型与强模型各 N 次 · 02 进化归因 · 评分、理由、model span、tool span 执行训练题,采集对照 Trace 待优化模型与强模型各 N 次 评分、理由、model span、tool span All Cases / 全量执行轨迹 · 每轮随机重分 chunk · 02 进化归因 · 复用同一批 Trace All Cases / 全量执行轨迹 每轮随机重分 chunk 复用同一批 Trace Chunk 1 · 02 进化归因 Chunk 1 Chunk 2 · 02 进化归因 Chunk 2 … Chunk N · 02 进化归因 Chunk N 跨模型轨迹对比 · weak × strong:N×N 对比 · 02 进化归因 · 可迁移过程;不按分差筛题 跨模型轨迹对比 weak × strong:N×N 对比 可迁移过程;不按分差筛题 自身高低分轨迹对比 · 决策 / 工具 / 验证 / 输出 · 02 进化归因 · 可单用或组合使用 自身高低分轨迹对比 决策 / 工具 / 验证 / 输出 可单用或组合使用 候选改动点 + 来源证据 · 改动点 + 来源证据 · 02 进化归因 · 先判 Skill 可解性;本层不改 Skill 候选改动点 + 来源证据 改动点 + 来源证据 先判 Skill 可解性;本层不改 Skill 跨 chunk 归纳收敛 · 去重 · 合并 · 解冲突 · 抽象共性 · 02 进化归因 跨 chunk 归纳收敛 去重 · 合并 · 解冲突 · 抽象共性 G1–G9 规则门禁 · 覆盖与泛化 · 禁 Case 泄漏 · 02 进化归因 · 可迁移 / 无冲突 / 通用表达 G1–G9 规则门禁 覆盖与泛化 · 禁 Case 泄漏 可迁移 / 无冲突 / 通用表达 Top-K 共性 Pattern · 通用 rule 入 Skill;具体证据留审计 · 02 进化归因 Top-K 共性 Pattern 通用 rule 入 Skill;具体证据留审计 new_rule · 新增通用规则 · 02 进化归因 new_rule 新增通用规则 reinforce_existing · 改写、强化已有规则 · 02 进化归因 reinforce_existing 改写、强化已有规则 候选 Skill 草稿 · 02 进化归因 · 多轮分块归纳;精简去重与准出 候选 Skill 草稿 多轮分块归纳;精简去重与准出 候选 Skill 写入与部署 · 新增 / 强化后精简去重 · 03 验证与效果审计 候选 Skill 写入与部署 新增 / 强化后精简去重 独立基准评测 · 独立基准,同 Case、同口径对比 · 03 验证与效果审计 · 不以本轮训练分数代替泛化评估 独立基准评测 独立基准,同 Case、同口径对比 不以本轮训练分数代替泛化评估 版本准出判断 · 03 验证与效果审计 版本准出判断 通过:保留候选版本 · success = true · 03 验证与效果审计 通过:保留候选版本 success = true 不通过:回滚版本 · success = false · 03 验证与效果审计 不通过:回滚版本 success = false 进化前 · Trace + 基准分 · 03 验证与效果审计 进化前 Trace + 基准分 进化后 · Trace + 基准分 · 03 验证与效果审计 进化后 Trace + 基准分 a 是否使用 Skill? · 保留完整调用证据,LLM 判定 · 03 验证与效果审计 · 未使用:调用问题单独记录 a 是否使用 Skill? 保留完整调用证据,LLM 判定 未使用:调用问题单独记录 b 逐条判断规则遵循 · follow / violate / n/a · 03 验证与效果审计 · 独立于、先于分数变化判断 b 逐条判断规则遵循 follow / violate / n/a 独立于、先于分数变化判断 c 判断同 Case 表现变化 · 分差 + 绝对表现 + 噪声地板 · 03 验证与效果审计 · positive / negative / none / unknown c 判断同 Case 表现变化 分差 + 绝对表现 + 噪声地板 positive / negative / none / unknown 审计报告 + suspect_rules + 置信度 · 供下一次运行参考,本轮不删改规则 · 03 验证与效果审计 · 仅最近 success=true;核对规则 / 置信度 审计报告 + suspect_rules + 置信度 供下一次运行参考,本轮不删改规则 仅最近 success=true;核对规则 / 置信度 Q1 有效证据 · 遵循 + 改善 · 03 验证与效果审计 · 保留正向佐证 Q1 有效证据 遵循 + 改善 保留正向佐证 Q2 疑似有害 · 遵循 + 退化 · 03 验证与效果审计 · 建议审查 / 回退 Q2 疑似有害 遵循 + 退化 建议审查 / 回退 Q4 疑似冗余 · 违反 + 改善 · 03 验证与效果审计 · 建议审查 / 精简 Q4 疑似冗余 违反 + 改善 建议审查 / 精简 Q3 执行偏差 · 违反 + 退化 · 03 验证与效果审计 · 必要时强化措辞 Q3 执行偏差 违反 + 退化 必要时强化措辞 分块对照 · 02 进化归因 分块对照 训练题 独立基准 + 稳定评估器 PASS 通过 未通过 已使用 下一次 S3:核对规则,按置信度采信 01 线上回流与产题 02 进化归因 03 验证与效果审计 图例 前端 后端 数据库 云服务 安全