AI资讯

AI小老六发布Skill评测体系:五层证据链确保真实任务验证

AI小老六发布Skill评测体系,通过五层证据链从格式检查到真实任务验证,确保Skill质量。

AI云图智寻编辑部2026-08-04 11:22
阅读时间:约 3 分钟
AI小老六发布Skill评测体系:五层证据链确保真实任务验证
AI小老六发布了一套Skill评测体系,通过五层证据链从格式检查到真实任务验证,确保Skill的质量。该体系不仅关注格式合规,还涵盖了语义、工程关系、动态效果和修复交付闭环,以确保Skill在实际应用中的有效性。

规范质量:基础的格式与风险检查

规范质量是评测体系的第一层,主要处理确定性问题,如Skill能否被稳定读取,依赖是否能找到等。常见的检查项包括元信息、引用数据、执行依赖、可迁移性和安全风险等。这些检查适合放入持续集成(CI)中,作为准入门禁。然而,规范检查只能证明资产没有明显坏掉,不能替代整体质量评估。例如,一个描述完整的Skill仍可能在错误场景下触发,或者缺少关键边界条件。因此,规范检查是地基,但不是质量结论。

语义质量:确定性规则难以表达的问题

语义质量关注的是确定性规则难以表达的问题,如内容完整性、触发边界清晰度、错误恢复可执行性等。为了使评测进入工程治理,需要将开放式判断收束到Rubric中。Rubric Judge的核心思想是模型不负责发明评价标准,只负责在给定标准下输出结构化评分、理由、证据和事实缺口。评分键可以定义为0到4分,分别表示不及格、较差、合格、良好和优秀。这样可以避免模糊的评分,而是提供具体的改进建议。例如,当前Skill已说明依赖安装,但缺少版本冲突处理和失败恢复;现有reference也无法证明遇到冲突时应采用哪种策略。

动态效果:真实任务的表现与稳定性

动态效果评测关注的是Skill在真实任务中的表现。即使静态文档写得再合理,也可能在实际执行时失败。动态评测至少包含四类指标:选择质量、任务价值、执行成本和稳定性。选择质量观察Skill是否在正确时机介入,任务价值观察其是否提高结果质量,执行成本观察改善结果所需的资源,稳定性观察多次执行的波动和失败分布。测试题目应来自真实需求、代码变更、历史问题、用户反馈或可追溯任务记录,并区分用户可见事实、隐藏判定事实和来源证据。动态成功也不能反向证明一切,一次任务通过不能说明description长期准确,也不能覆盖全项目的能力冲突。