报告目录 · 7 个章节
本轮测了什么,报告提供什么
EvalDock 首轮报告汇总 10 种 DSH 插件配置、228 题次的维度评分,并选取六个已核对执行证据的案例,展示程序、工作簿、查询结果与代码补丁的交付表现。
- 评分配置
- 10种
- 纳入任务
- 228题次
- 精选案例
- 6项
使用者可按任务类型了解交付表现;开发者可参考评分维度与验证步骤,设计产品验收和优化任务。
各配置的维度评分
以下为纳入任务的原始模型评分汇总,原始均分满分 5 分。各配置按测试顺序展示,点击名称可直达对应评分。
均分按同一配置、同一维度的题目等权计算,保留两位小数;样本量 n 为该维度纳入的评分数。每项分数对应各自任务范围。
dsh-mattpocock-skills-zh
@vinvcn/dsh-mattpocock-skills-zh · v1.2.3
纳入 24 题次
| 维度 | 均分 / 5 | 样本 n |
|---|---|---|
| 产物交付 | 4.75 | 24 |
| 推理与规划 | 4.74 | 24 |
| 执行闭环 | 4.83 | 3 |
| 代码与终端 | 4.78 | 2 |
| 数据处理 | 4.75 | 19 |
| 文档处理 | 4.92 | 6 |
| 多模态 | 4.13 | 4 |
modlens
@liustack/modlens · v3.26.1
纳入 23 题次
| 维度 | 均分 / 5 | 样本 n |
|---|---|---|
| 产物交付 | 4.70 | 21 |
| 推理与规划 | 4.42 | 23 |
| 执行闭环 | 4.93 | 7 |
| 代码与终端 | 4.67 | 6 |
| 数据处理 | 5.00 | 9 |
| 文档处理 | 5.00 | 7 |
| 多模态 | 2.25 | 4 |
| 协作 | 4.50 | 2 |
| 外部工具 | 4.50 | 2 |
browser-skill-dsh-plugin
@wxg-prc-cpg/browser-skill-dsh-plugin · v0.2.1
纳入 20 题次
| 维度 | 均分 / 5 | 样本 n |
|---|---|---|
| 产物交付 | 4.95 | 18 |
| 推理与规划 | 4.75 | 20 |
| 执行闭环 | 4.85 | 5 |
| 代码与终端 | 4.50 | 5 |
| 数据处理 | 4.98 | 11 |
| 文档处理 | 4.81 | 4 |
| 多模态 | 4.75 | 2 |
| 协作 | 4.00 | 2 |
| 外部工具 | 4.25 | 2 |
dsh-agent-teams
@nanmicoder/dsh-agent-teams · v0.1.18
纳入 21 题次
| 维度 | 均分 / 5 | 样本 n |
|---|---|---|
| 产物交付 | 4.88 | 18 |
| 推理与规划 | 4.90 | 21 |
| 执行闭环 | 4.95 | 5 |
| 代码与终端 | 4.63 | 4 |
| 数据处理 | 4.95 | 14 |
| 文档处理 | 5.00 | 1 |
| 多模态 | 5.00 | 1 |
| 协作 | 4.42 | 3 |
| 外部工具 | 4.25 | 3 |
treg-dsh
treg-dsh · v0.19.1
纳入 19 题次
| 维度 | 均分 / 5 | 样本 n |
|---|---|---|
| 产物交付 | 4.69 | 16 |
| 推理与规划 | 4.49 | 19 |
| 数据处理 | 5.00 | 12 |
| 文档处理 | 4.98 | 6 |
| 多模态 | 2.25 | 2 |
| 协作 | 4.42 | 3 |
| 外部工具 | 4.25 | 3 |
aegis
aegis · v2.10.5
纳入 30 题次
| 维度 | 均分 / 5 | 样本 n |
|---|---|---|
| 产物交付 | 4.66 | 27 |
| 推理与规划 | 4.42 | 30 |
| 执行闭环 | 5.00 | 6 |
| 代码与终端 | 4.71 | 6 |
| 数据处理 | 4.97 | 15 |
| 文档处理 | 5.00 | 6 |
| 多模态 | 1.92 | 3 |
| 协作 | 4.75 | 3 |
| 外部工具 | 4.58 | 3 |
dsh-vision-router
dsh-vision-router · v2.1.7
纳入 26 题次
| 维度 | 均分 / 5 | 样本 n |
|---|---|---|
| 产物交付 | 4.63 | 26 |
| 推理与规划 | 4.26 | 26 |
| 执行闭环 | 4.88 | 6 |
| 代码与终端 | 4.94 | 4 |
| 数据处理 | 4.92 | 16 |
| 文档处理 | 4.94 | 8 |
| 多模态 | 2.88 | 4 |
| 检索与依据 | 4.75 | 1 |
| Web 工具 | 5.00 | 1 |
dsh-vision-toolkit
@anionex/dsh-vision-toolkit · v0.1.45
纳入 36 题次
| 维度 | 均分 / 5 | 样本 n |
|---|---|---|
| 产物交付 | 4.74 | 36 |
| 推理与规划 | 4.48 | 36 |
| 执行闭环 | 4.95 | 10 |
| 代码与终端 | 4.63 | 8 |
| 数据处理 | 4.92 | 21 |
| 文档处理 | 4.88 | 8 |
| 多模态 | 2.80 | 5 |
| 检索与依据 | 4.75 | 1 |
| Web 工具 | 5.00 | 1 |
modsearch
@liustack/modsearch · v5.10.3
纳入 8 题次
| 维度 | 均分 / 5 | 样本 n |
|---|---|---|
| 产物交付 | 4.66 | 8 |
| 推理与规划 | 4.59 | 8 |
| 执行闭环 | 4.75 | 7 |
| 代码与终端 | 4.94 | 4 |
| 数据处理 | 4.33 | 3 |
| 文档处理 | 4.25 | 2 |
| 多模态 | 4.00 | 1 |
| 效率与可靠性 | 4.25 | 1 |
| 检索与依据 | 4.00 | 2 |
| Web 工具 | 4.50 | 2 |
dsh-redteam-model
@dsh-external/dsh-redteam-model · v1.1.1
纳入 21 题次
| 维度 | 均分 / 5 | 样本 n |
|---|---|---|
| 产物交付 | 4.61 | 19 |
| 推理与规划 | 4.32 | 21 |
| 执行闭环 | 4.79 | 6 |
| 代码与终端 | 4.58 | 6 |
| 数据处理 | 5.00 | 7 |
| 多模态 | 2.00 | 3 |
| 协作 | 4.50 | 2 |
| 效率与可靠性 | 5.00 | 1 |
| 外部工具 | 4.50 | 2 |
评分来源:deepseek-flash,按 EvalDock 维度评分标准 v2.0 生成。查看统计口径。
从六项任务中看到的成果
六个代表任务
每项案例列出执行时的配置版本、交付成果与验证方式。执行步骤经过脱敏整理,便于快速理解任务过程。
S01 / 数据处理
实现序列处理,并验证边界输入
配置:dsh-vision-router 2.1.7 · 查看该配置评分
将数据转换要求实现为可调用程序,处理空输入、重复值与异常类型,并检查序列化前后的结果。
交付与验证摘要
- 交付物
- 数据转换程序
- 验证方式
- 边界用例 · 随机属性检查 · 序列化往返
- 分析输入约束
- 实现转换逻辑
- 构造边界与随机用例
- 运行验证脚本
程序交付完成,自建验证脚本通过;执行记录确认输入文件保持不变。
查看证据核对说明
核对了程序内容、验证脚本及工具实际返回。检查覆盖显式边界用例、随机属性断言与序列化往返,记录包含输入完整性检查。
S02 / 图像计算
完成图像变换,逐像素核对结果
配置:dsh-vision-router 2.1.7 · 查看该配置评分
交付图像处理程序,用独立参考计算核对像素输出,并检查通道边界与输入完整性。
交付与验证摘要
- 交付物
- 图像变换程序
- 验证方式
- 参考计算 · 随机图像 · 逐像素比较
- 解析图像输入
- 实现变换计算
- 建立参考结果
- 逐像素比对输出
图像变换程序完成交付,归档验证脚本返回全部检查通过。
查看证据核对说明
核对了程序内容、参考计算与实际工具返回。验证覆盖样例、随机图像和通道边界,比较完整像素结果。
S03 / 表格计算
补全统计公式,保留原表结构
配置:@vinvcn/dsh-mattpocock-skills-zh 1.2.3 · 查看该配置评分
读取已有工作簿,将跨区域匹配与统计要求写成公式,在目标单元格完成计算并保留原有表格。
交付与验证摘要
- 交付物
- 含统计公式的 Excel 工作簿
- 验证方式
- 公式检查 · LibreOffice 重算 · 修改范围比对
- 读取工作簿
- 写入目标公式
- 独立重算结果
- 复核修改与样式
交付带公式及计算缓存的 Excel 文件;归档比较显示只修改了两个目标单元格,已有单元格样式保持一致。
查看证据核对说明
只读检查交付文件中的公式与缓存值,并核对 LibreOffice 重算记录。执行记录同时比较了修改单元格、原有样式与工作表名称。
S04 / 数据库查询
将查询需求转成 SQL,并交付执行结果
配置:@nanmicoder/dsh-agent-teams 0.1.18 · 查看该配置评分
先检查数据库结构,再根据自然语言要求编写查询,执行后将结构化结果与答案一并交付。
交付与验证摘要
- 交付物
- SQL 查询 + JSON 结果 + 答案文件
- 验证方式
- 结构读取 · 实际查询 · 文件与返回值核对
- 检查表结构
- 生成筛选查询
- 执行数据库查询
- 整理结果与答案
交付 SQL 查询、JSON 结果和答案文件;答案与实际查询返回一致。
查看证据核对说明
核对数据库结构读取与查询工具返回,再对照三份交付文件,确认查询字段、执行结果与答案之间的对应关系。
S05 / 票据整理
从票据图片提取信息,整理成可用表格
配置:@anionex/dsh-vision-toolkit 0.1.45 · 查看该配置评分
批量读取票据图片,提取日期与总金额,结合原图复核后,按统一字段整理为 Excel 工作簿。
交付与验证摘要
- 交付物
- 22 条记录的票据汇总表
- 验证方式
- 图片识别 · 原图复核 · 工作簿读回检查
- 批量识别图片
- 提取日期与总额
- 对照原图复核
- 导出并读回表格
将 22 张票据整理为 22 条记录,交付包含来源、日期和金额三列的 Excel 文件。
查看证据核对说明
核对输入图片清单、提取过程与最终读回记录;只读检查交付工作簿,确认一张工作表、三列字段和 22 条数据记录。
S06 / 代码修复
修复事件通知逻辑,交付可应用补丁
配置:@liustack/modsearch 5.10.3 · 查看该配置评分
定位事件通知接口的调用问题,修改对应实现,通过针对性测试检查行为,并导出补丁。
交付与验证摘要
- 交付物
- 代码补丁 + 修复说明
- 验证方式
- 针对性单元测试 · 补丁应用检查
- 定位通知逻辑
- 修改接口调用
- 运行针对性测试
- 导出并检查补丁
交付单文件补丁与修复说明;归档记录显示目标测试文件的 10 项测试通过,补丁应用检查通过。
查看证据核对说明
核对实际补丁、目标测试文件的运行返回与补丁应用记录。这里呈现的是该次执行中的针对性验证结果。
结合你的任务阅读
- 需要从已有数据中获得答案
- 关注答案的来处:是否读取实际数据结构、执行查询,并保留与答案对应的结果文件。参见 S04。
对于开发者,可将案例中的交付要求、验证步骤和评分维度转成自己的验收清单,并固定任务与配置进行版本复测。
EvalDock 是面向各类 Agent 的跨生态评测与选型平台,为使用者提供选型与解决方案,为开发者提供优化依据。了解平台与服务。
从任务到成果的评测方法
- 明确任务要求。根据任务确定输入、交付物和检查条件。
- 记录真实执行。保留工具调用、运行过程及最终产物。
- 核对成果与证据。结合程序内容、验证脚本及实际工具返回,确认案例描述的依据。
- 整理公开报告。呈现任务类别、配置版本、成果摘要与验证方式。
各案例标注了执行时使用的插件配置与版本。我们结合归档交付物与实际工具返回核对成果;验证结果来自任务执行时的归档记录。
评分与统计口径
本节汇总 DSH 0.1.5-rc.1 下十种插件配置的 228 题次。统计纳入正常结束、任务所需测试条件齐备、全部适用维度评分完整且符合独立作答要求的记录;同一任务在不同配置下分别计为题次。
评分模型为 deepseek-flash,使用 EvalDock 维度评分标准 v2.0,结合任务要求、归档轨迹与产物给出 0–5 分。均分展示原始评分,分母为该配置、该维度的实际纳入数。
4 分对应能力完整、结果正确且过程符合要求;5 分进一步要求全部适用要求达到高质量完成,相关边界与结果有充分可复核证据。小数表示相邻评分锚点之间的完成程度。
本表用于查看各配置在所测任务中的维度表现;跨配置选型时,结合任务范围、样本量与案例阅读。
完整流程见评测方法说明。
报告信息与公开范围
本报告由 EvalDock 团队整理,公开原始模型评分的汇总、经过核对的任务成果、配置与方法。案例使用 S01–S06 编号,以脱敏摘要呈现。
测试执行代码、完整题库、参考答案及原始会话保留内部。公开内容聚焦具体任务观察,便于使用者了解执行方式与交付表现。
引用建议:EvalDock,《首轮 Agent 与插件评测报告:配置评分与任务成果》,v1.4,2026-09-19。报告固定地址。
