方法 · Method

先问目标,再定测法

软件、开源项目和 AI Skill 解决的问题不同。我们不再让它们共用一套看似精确、实际失焦的分数。

共同底线

  • 先写清使用者、任务、环境和成功标准,再开始测
  • 结论必须能回到证据;未核实、推断和实测结果分开标注
  • 先过隐私、安全、许可、数据可退出等红线,再谈综合表现
  • 不把不同目标的对象硬凑成一个排行榜,也不以单一总分代替判断

三条测评轨道

01

软件

目标:让特定用户在可接受的总成本和风险下,把一件事稳定做成。

先建立个人 / 小团队 / 企业等使用画像,再执行代表性任务。七格档案继续保留,但从“资料清单”升级为任务成功、功能边界、上手与协作、真实总成本、稳定与服务、数据退出与合规、厂商与 AI 可持续性。

输出:适合谁、不适合谁、在哪些约束下值得买,以及可核实的替代方案。

02

开源项目

目标:判断一个项目能否被采用、部署并长期维护,而不是判断它是否流行。

在干净环境复现安装并跑通核心任务;核验发布节奏、问题响应、贡献集中度、升级与回滚、依赖和供应链、安全与许可证。Star、Fork 等只作为发现线索,不直接换算成质量分。

输出:可直接采用 / 小范围试用 / 仅供参考,并列出维护成本和阻断项。

03

AI Skill

目标:验证 Skill 是否让 AI Agent 在目标任务上产生可重复的净增益。

同一模型、工具、上下文和任务,做“无 Skill 基线”与“启用 Skill”对照;覆盖常规、边界和失败任务并重复运行。比较任务成功率、结果质量、人工干预、耗时、Token / 工具成本、稳定性、安全边界和跨 Agent 兼容性。

输出:提升了什么、代价是什么、在哪些任务或 Agent 上有效,以及失败样例。

重点 · Skill Benchmark

Skill 怎么证明有效

Skill 的价值不是文档写得多漂亮,而是相对于同一 Agent 的无 Skill 基线,能否提高任务结果并控制额外成本。

01

定义目标

把“让 Agent 更好”改写成可验收任务和评分规则。

02

建立基线

固定模型版本、参数、工具权限、上下文和输入,先跑无 Skill 结果。

03

配对测试

只改变 Skill 这一项;常规 / 边界 / 对抗任务分别多次运行。

04

计算净增益

同时看成功率与质量提升,以及时间、Token、工具调用、人工接管的变化。

05

检查副作用

记录越权、错误自信、上下文冲突、过度流程化和跨 Agent 失效。

06

给条件结论

不只说好坏,而是明确适用任务、环境、成本和禁用条件。

结论怎么写

先报告红线和任务结果,再报告效率与成本,最后给“推荐 / 有条件推荐 / 暂不推荐”。置信度由证据质量、样本覆盖、重复一致性和核实新鲜度决定;置信度不足时不下强结论。