DSHEVAL
菜单

DSH-Eval 万物皆可测

DSH-Eval 是面向 DeepSeek Harness(DSH)Agent 与插件的通用测评平台。通过明确任务、记录执行过程与检查证据,帮助开发者和技术团队判断 Agent 的任务表现。

让能力判断有依据

  • Agent 能完成
    哪些任务?

  • 安装插件后
    有没有提升?

  • 升级版本
    是否出现退步?

这些是评测希望回答的问题。判断插件增益或版本退步,需要专门组织同条件对照;结论始终对应具体任务、模型与运行环境,不代表默认具备自动版本比较能力。

从任务到有依据的评分

新框架围绕以下五个环节组织评测;现有公开报告继续以各自的方法与评分规则为准。

  1. 明确任务

    确定评测对象、运行配置、任务要求与完成条件。

  2. 执行与观测

    让 Agent 执行任务,按本次方法记录执行过程及相关产物或状态。

  3. 组织证据

    汇集运行轨迹、环境变化与交付物,记录来源及采集缺口。

  4. 逐标签评分

    结合标签标准、题目参考与同一份证据评分,保留理由、引用与异常。

  5. 阅读报告

    结合有效分数、无法判断和评分错误的数量,以及证据与运行状态理解结果。

当前范围与进展

新框架开发中 · 更新于 2026-09-14

新框架的真实端到端能力验收尚待完成,受控测试样例不代表真实 Agent 能力成绩。现有公开报告继续按各自公布的方法与测试条件解释。

评测对象
新框架以指定配置下的完整 DSH Agent 为对象,包含本次模型、插件、工具、权限与环境条件。其他运行时、独立模型或协议的评测需要相应适配与验证。
运行与查看
新框架处于 MVP 阶段,面向 macOS 任务环境,提供命令行评测及本地/VM 只读报告查看路径。具体安装、版本与开放方式以发布说明为准。
证据与报告
新框架将运行轨迹、环境变化与交付物组织为统一证据。逐标签 LLM Judge 结合标签标准和题目评分参考给出分数、理由与引用;报告汇总有效维度分数,另列无法判断、评分错误与运行状态。
了解新框架的评测方法

常见问题

01

为什么同时看运行轨迹和环境证据?

运行轨迹用于解释 Agent 发起了什么操作,环境观测记录相关变化,最终回答和文件内容作为交付证据。观测来源相对于 Agent 自述独立,但不代表第三方认证,也不能单凭环境变化证明其由 Agent 引起。可形成的结论取决于实际观测范围和检查要求。

02

新框架如何区分已评分、无法判断与评分错误?

SCORED 表示已形成有效数值评分,包括可能的零分;UNASSESSABLE 表示无法判断,ERROR 表示评分请求或响应失败,后两者分数为空。当前按同标签、同标准对有效分数取均值,并保留各状态的 Case 数量;空分不按零分处理。当前不自动汇总为通过或失败,运行状态另行阅读。

03

如何理解 LLM Judge 的评分?

各标签的 LLM Judge 读取同一份已采集证据,结合标签评分标准与题目专用评分参考,给出分数、理由和证据引用。程序检查响应字段、分数范围与引用 ID;采集缺口随证据一起交给 Judge,由其判断能否评分。格式正确不保证评分或引用正确,仍需针对用途校准与复核。

04

评测报告能否复查或复现?

复查时先核对任务与评分标准、维度分数、评分理由、相关证据和运行状态。重新执行任务还需要对应版本、输入材料、环境与权限;能读取报告不等于已经完成复现。现有公开报告的资料开放范围与验证情况,以各自说明为准。

05

DSH-Eval 与 DSH、DSH Studio 有什么关系?

DSH 提供 Agent 运行能力,DSH-Eval 组织任务评测并提供证据与评分。DSH Studio 的方向是企业 Agent 应用的生产化;Eval 的机制介绍不代表 Studio 的企业系统集成、交付或业务验收已经完成。

06

现在如何开始了解或使用?

先选一个明确的 Agent 任务,列出预期结果与检查条件,再阅读适用的方法说明。查看已有结果时,以对应报告的版本和条件为准;接入新框架前,核对官方实际发布的环境要求与使用步骤。

官方信息

官方 GitHub 公开仓库
https://github.com/dsheval/dsh-eval

Top100 是 DSH-Eval 旗下的插件与 Skills 发现栏目,收录或热度排名不代表已经通过能力评测。

DSH-Eval 为主展示名,DSHEval、DSHeval 为文档与历史写法。公开资料以仓库实际发布内容为准,不将开发版本视为已同步的公开版本。

引用评测结论时,请以公开报告注明的代码、版本和测试环境为准。