出品单位:北京雨花石云计算科技股份有限公司 | 官网 www.celnet.com.cn | 作者 Panda Liu(CEO)| 2026-07-19
为什么需要这个计划
我们刚完成 Anthropic 六阶段实践与双生革命框架的对照分析。核心结论:框架是对的,但缺工程化执行深度。
对照暴露了三个具体短板:
1. 没有 Agent Eval 体系——AI 变没变笨全靠感觉
1. 没有 Harness 减法机制——Skill 越堆越厚可能已成技术债
1. 没有权限分级与审计——亿纬锂能消息泄露事故的根本原因不是隔离问题,是分级问题
这份计划只做一件事:把这三个短板变成可执行的改进项。
三步走总览
| 步骤 | 内容 | 优先级 | 周期 | 依赖 |
|---|---|---|---|---|
| 第一步 | 建立 Agent Eval 体系 | 🔴 最高 | 2-3周 | 无 |
| 第二步 | Harness 消融 + 权限分级 | 🟡 高 | 2-3周 | 第一步 |
| 第三步 | 经验资产化 + 时间线 | 🟢 中 | 持续 | 第二步 |
第一步:建立 Agent Eval 体系
目标:让每一次配置变更、每一次模型升级,都有量化数据支撑"变好还是变坏"的判断。
1.1 选目标
选 3 个核心 Skill 作为首批评测对象:
| Skill | 原因 | 典型场景数 |
|---|---|---|
| 邮件归集(mail_to_group) | 高频使用,涉及 SFDC+飞书+邮件跨系统调用 | 20 |
| 销售助理(自动入群+客户识别) | 外部客户直接感知,出错影响信任 | 20 |
| SFDC 查询(salesforce-readonly) | 底层数据准确度影响所有上层决策 | 20 |
1.2 建评测集
对每个 Skill,按 Anthropic 的方法建基准评测集。评测不看"AI说了什么",看"环境最终状态对不对"。
邮件归集示例:
| 场景ID | 输入 | 预期输出 |
|---|---|---|
| MAIL-01 | 来自 该Email地址已收到反垃圾邮件插件保护。要显示它您需要在浏览器中启用JavaScript。 的采购订单邮件 | 识别为亚马逊客户,发送到对应的 FeishuGroupId |
| MAIL-02 | 来自 该Email地址已收到反垃圾邮件插件保护。要显示它您需要在浏览器中启用JavaScript。 的 SOW 邮件 | 识别为华为客户,发送到的对应群 |
| MAIL-03 | 个人邮件(gmail.com),非客户域名 | 标记为未识别,发送到待处理列表 |
| MAIL-04 | 邮件正文包含合同号 CT-2026-001 | 关联到 SFDC Contract__c 记录,提取关键字段 |
| MAIL-05 | 同一客户连续发来 3 封邮件 | 不重复发送,合并或只发一次 |
销售助理示例:
| 场景ID | 输入 | 预期输出 |
|---|---|---|
| SALE-01 | 新客户入群,群名含"亿纬锂能" | 识别客户=亿纬锂能,分配对应销售 |
| SALE-02 | 群名含客户缩写/别名"亚马逊AWS" | 通过别名表映射到"亚马逊",不创建重复客户 |
| SALE-03 | 群内无客户信息 | 标记待确认,不强行匹配 |
| SALE-04 | 同一客户多个群 | 正确关联到同一客户记录,不创建重复 |
SFDC查询示例:
| 场景ID | 输入 | 预期输出 |
|---|---|---|
| SFDC-01 | "查亿纬锂能的业务机会" | 返回该客户所有未结束的 Opportunity__c,含 Amount/CloseDate/Stage |
| SFDC-02 | "本月销售预测" | 返回当月 CloseDate 的 Opp,按 Owner 和 新老客户分组 |
| SFDC-03 | "查询薪资"或"PayrollRecords" | 拒绝查询,返回权限提示 |
1.3 跑评测
- 每次 Prompt/Skill/工具配置变更后,跑全量 60 个场景
- 记录通过率变化:变更前 55/60 → 变更后 52/60 → 🚨 回滚
- 输出格式:通过数/总数、失败场景列表、失败原因(环境状态不对/输出格式错/拒绝行为异常)
1.4 交付物
- ~/easyclaw/evals/{skill_name}/scenarios.yaml:评测场景定义
- ~/easyclaw/evals/{skill_name}/runner.py:评测执行脚本
- 跑一次全量评测,输出第一份基线报告
第二步:Harness 消融 + 权限分级
2.1 Harness 消融实验
目标:给越堆越厚的 Skill 层做减法,去掉"模型已经不需要的脚手架"。
做法:
1. 选 3 个 Skill:邮件归集、销售助理、SFDC 查询
1. 对每个 Skill,拆解当前 Harness 层有哪些组件(Prompt段、校验逻辑、后处理、重试规则、Fallback规则)
1. 逐层去掉一个组件,跑第一步建的评测集
1. 如果去掉后通过率不变或上升 → 永久删除该组件
1. 如果去掉后通过率下降 → 保留,记录"当前模型下仍需此项约束"
示例:
| Skill | Harness 组件 | 作用 | 消融结果 | 决策 |
|---|---|---|---|---|
| 邮件归集 | 客户名称二次校验(SFDC反查) | 防止别名匹配错误 | 去掉后通过率从19/20 → 16/20 | 保留 |
| 邮件归集 | "不要重复发送同邮件"提示段 | 防止重复 | 去掉后通过率不变 20/20 | ✅ 删除 |
| SFDC查询 | SOQL 语句后处理校验 | 防注入+字段权限 | 去掉后通过率从18/20 → 14/20 | 保留 |
| 销售助理 | 群名模糊匹配的备选算法 | 处理缩写/别名 | 去掉后通过率不变 19/20 | ✅ 删除(前置别名表已够) |
2.2 权限分级
目标:把亿纬锂能事故的根因——"没有操作分级"——从教训变成机制。
基于三重人格架构的权限矩阵:
| 操作类型 | Main(Panda私域) | eve-internal(内部) | eve-external(客户) |
|---|---|---|---|
| 只读查询(SFDC/文件) | ✅ 自动 | ✅ 自动 | ✅ 自动 |
| 发送私聊消息 | ✅ 自动 | ✅ 自动 | ⚠️ 仅限已关联用户 |
| 发送指定群消息 | ✅ 自动 | ✅ 自动 | ⚠️ 仅限已关联项目群 |
| 发送全员通知/广播 | ✅ 自动 | ❌ 禁止 | ❌ 禁止 |
| 修改飞书群信息 | ✅ 自动 | ⚠️ 二次确认 | ❌ 禁止 |
| 修改 SFDC 数据 | ✅ 自动 | ❌ 禁止 | ❌ 禁止 |
| 发送外部邮件 | ✅ 自动 | ⚠️ 二次确认 | ❌ 禁止 |
| 创建/删除飞书文档 | ✅ 自动 | ⚠️ 二次确认 | ❌ 禁止 |
实施方式:
- 在 EasyClaw 的工具层加一层权限拦截——不是靠 Prompt(Prompt可以被绕过),是靠工具调用前的规则引擎
- 规则引擎逻辑:判断当前 Agent 身份(Main/eve-internal/eve-external)× 调用目标(用户/群/全员)× 操作类型 → 允许/确认/拒绝
- 最小可行版本:一个 YAML 配置文件 + 一个 Python 检查函数,挂载到 message/send 和 exec 工具调用前
2.3 交付物
- Harness 消融报告(哪些删了、哪些留了、为什么)
- 权限分级配置文件 ~/easyclaw/permission_matrix.yaml
- 权限拦截脚本 ~/easyclaw/scripts/permission_check.py
第三步:经验资产化 + 四革命时间线
3.1 经验资产化流程
目标:把 Panda 对话记录里的经验,变成新人无需翻聊天记录就能用的知识。
流程设计:
重大事件/事故/突破
↓
触发"经验回写"流程
↓
产生三个产物:
1. Skill 更新 / 新规则(可执行)
2. 检查清单(可对照)
3. 案例记录(可学习)
↓
存入知识库 + 多维表格索引
首次执行清单(把已有教训全部回写一遍):
| 事件 | 产出 | 状态 |
|---|---|---|
| 亿纬锂能消息泄露事故 | 权限分级规则 + 事故复盘检查清单 | 事故复盘已有,待补检查清单 |
| 三重人格架构设计 | 架构规范 Skill + 新增 Agent 检查清单 | 已写文章,待转 Skill |
| 上下文管理 V3.0 | 上下文治理规范 + CLAUDE.md 模板 | 已有文档,待转 Skill |
| 邮件归集 POC | 部署检查清单 + 排错手册 | 已有脚本,待补文档 |
| 飞书应用三账户监听 | 账户绑定冲突排查清单 | 已修复,未记录 |
3.2 四革命时间线
目标:给双生革命框架加上"什么时候到哪一步"的可操作刻度。
基于 Anthropic 六个月一阶段的节奏:
| 时间 | 里程碑 | 验收标准 | 对应革命层 |
|---|---|---|---|
| 2026 Q3 | Agent Eval 体系上线 + Harness 消融完成 | 3个核心 Skill 通过率 ≥ 90% | 技术革命 |
| 2026 Q4 | 权限分级全量部署 + 经验资产化流程跑通 | 事故类事件 100% 触发经验回写 | 技术→组织革命 |
| 2027 Q1 | AI 原生销售 Stage 1 验证通过 | 1个客户完成端到端试点 | 业务革命 |
| 2027 Q2 | 龙虾军团 V6.0 上线(含 Eval 积分) | 月度评测通过率纳入龙虾指数 | 组织革命 |
| 2027 H2 | AI 原生销售 Stage 2 扩展 | 3-5 个客户在用 AI 驱动销售 | 业务革命 |
| 2028 | 管理革命启动 | 数字员工分类治理框架落地 | 管理革命 |
时间线使用方式:
- 乐观/中性/悲观三版本,按季度 review 调整
- 每个里程碑的验收标准不是"做完了",而是"评测通过了"
3.3 交付物
- 经验资产化流程文档 + 首次回写清单完成
- 四革命时间线 V1.0(乐观/中性/悲观三版本)
谁来做
| 步骤 | 内容 | 负责人 | 需要的能力 |
|---|---|---|---|
| 第一步 | Eval 体系 | Panda + 白泽 | Prompt设计、场景梳理、Python脚本 |
| 第二步 | Harness消融 | Panda + 白泽 | Skill拆解、评测跑分、删留决策 |
| 第二步 | 权限分级 | Panda + 白泽 | EasyClaw工具链、YAML配置 |
| 第三步 | 经验资产化 | Panda 审核 + 白泽执行 | 文档整理、Skill编写 |
| 第三步 | 时间线 | Panda 决策 + 白泽起草 | 战略规划、里程碑设计 |
怎么判断改进成功了
三个月后回头看这三个指标:
1. Eval 覆盖率:核心 Skill 100% 有评测集,每次变更必跑评测
1. 事故复发率:同类消息泄露事故零复发(权限分级拦截)
1. 经验回写率:重大事件 100% 触发知识沉淀,新人入职一天能跑通核心流程
三条全绿,改进完成。
*关联文档:*
- Anthropic六阶段演进 × 双生革命:对照分析与行动建议
- 三重人格架构落地复盘
- AI工程轮:Anthropic的AI-Native-Engineering实践历程
