软件
目标:让特定用户在可接受的总成本和风险下,把一件事稳定做成。
先建立个人 / 小团队 / 企业等使用画像,再执行代表性任务。七格档案继续保留,但从“资料清单”升级为任务成功、功能边界、上手与协作、真实总成本、稳定与服务、数据退出与合规、厂商与 AI 可持续性。
输出:适合谁、不适合谁、在哪些约束下值得买,以及可核实的替代方案。
方法 · Method
软件、开源项目和 AI Skill 解决的问题不同。我们不再让它们共用一套看似精确、实际失焦的分数。
目标:让特定用户在可接受的总成本和风险下,把一件事稳定做成。
先建立个人 / 小团队 / 企业等使用画像,再执行代表性任务。七格档案继续保留,但从“资料清单”升级为任务成功、功能边界、上手与协作、真实总成本、稳定与服务、数据退出与合规、厂商与 AI 可持续性。
输出:适合谁、不适合谁、在哪些约束下值得买,以及可核实的替代方案。
目标:判断一个项目能否被采用、部署并长期维护,而不是判断它是否流行。
在干净环境复现安装并跑通核心任务;核验发布节奏、问题响应、贡献集中度、升级与回滚、依赖和供应链、安全与许可证。Star、Fork 等只作为发现线索,不直接换算成质量分。
输出:可直接采用 / 小范围试用 / 仅供参考,并列出维护成本和阻断项。
目标:验证 Skill 是否让 AI Agent 在目标任务上产生可重复的净增益。
同一模型、工具、上下文和任务,做“无 Skill 基线”与“启用 Skill”对照;覆盖常规、边界和失败任务并重复运行。比较任务成功率、结果质量、人工干预、耗时、Token / 工具成本、稳定性、安全边界和跨 Agent 兼容性。
输出:提升了什么、代价是什么、在哪些任务或 Agent 上有效,以及失败样例。
重点 · Skill Benchmark
Skill 的价值不是文档写得多漂亮,而是相对于同一 Agent 的无 Skill 基线,能否提高任务结果并控制额外成本。
把“让 Agent 更好”改写成可验收任务和评分规则。
固定模型版本、参数、工具权限、上下文和输入,先跑无 Skill 结果。
只改变 Skill 这一项;常规 / 边界 / 对抗任务分别多次运行。
同时看成功率与质量提升,以及时间、Token、工具调用、人工接管的变化。
记录越权、错误自信、上下文冲突、过度流程化和跨 Agent 失效。
不只说好坏,而是明确适用任务、环境、成本和禁用条件。
先报告红线和任务结果,再报告效率与成本,最后给“推荐 / 有条件推荐 / 暂不推荐”。置信度由证据质量、样本覆盖、重复一致性和核实新鲜度决定;置信度不足时不下强结论。