EvalDock
菜单

ROUND 01 / 首轮评测

首轮 Agent 与插件评测报告:配置评分与任务成果

查看各配置的维度评分,结合实际交付成果,了解 Agent 如何完成任务。

EvalDock报告 v1.4
报告目录 · 7 个章节

本轮测了什么,报告提供什么

EvalDock 首轮报告汇总 10 种 DSH 插件配置、228 题次的维度评分,并选取六个已核对执行证据的案例,展示程序、工作簿、查询结果与代码补丁的交付表现。

评分配置
10
纳入任务
228题次
精选案例
6

使用者可按任务类型了解交付表现;开发者可参考评分维度与验证步骤,设计产品验收和优化任务。

各配置的维度评分

以下为纳入任务的原始模型评分汇总,原始均分满分 5 分。各配置按测试顺序展示,点击名称可直达对应评分。

均分按同一配置、同一维度的题目等权计算,保留两位小数;样本量 n 为该维度纳入的评分数。每项分数对应各自任务范围。

维度均分 · 0–5 分

dsh-mattpocock-skills-zh

@vinvcn/dsh-mattpocock-skills-zh · v1.2.3

纳入 24 题次

@vinvcn/dsh-mattpocock-skills-zh 维度评分雷达图从中心 0 分到外圈 5 分,各轴表示一个评分维度。圆点可查看均分与样本量。
维度均分 · 0–5 分点选圆点,查看均分与样本量

modlens

@liustack/modlens · v3.26.1

纳入 23 题次

@liustack/modlens 维度评分雷达图从中心 0 分到外圈 5 分,各轴表示一个评分维度。圆点可查看均分与样本量。
维度均分 · 0–5 分点选圆点,查看均分与样本量

browser-skill-dsh-plugin

@wxg-prc-cpg/browser-skill-dsh-plugin · v0.2.1

纳入 20 题次

@wxg-prc-cpg/browser-skill-dsh-plugin 维度评分雷达图从中心 0 分到外圈 5 分,各轴表示一个评分维度。圆点可查看均分与样本量。
维度均分 · 0–5 分点选圆点,查看均分与样本量

dsh-agent-teams

@nanmicoder/dsh-agent-teams · v0.1.18

纳入 21 题次

@nanmicoder/dsh-agent-teams 维度评分雷达图从中心 0 分到外圈 5 分,各轴表示一个评分维度。圆点可查看均分与样本量。
维度均分 · 0–5 分点选圆点,查看均分与样本量

treg-dsh

treg-dsh · v0.19.1

纳入 19 题次

treg-dsh 维度评分雷达图从中心 0 分到外圈 5 分,各轴表示一个评分维度。圆点可查看均分与样本量。
维度均分 · 0–5 分点选圆点,查看均分与样本量

aegis

aegis · v2.10.5

纳入 30 题次

aegis 维度评分雷达图从中心 0 分到外圈 5 分,各轴表示一个评分维度。圆点可查看均分与样本量。
维度均分 · 0–5 分点选圆点,查看均分与样本量

dsh-vision-router

dsh-vision-router · v2.1.7

纳入 26 题次

dsh-vision-router 维度评分雷达图从中心 0 分到外圈 5 分,各轴表示一个评分维度。圆点可查看均分与样本量。
维度均分 · 0–5 分点选圆点,查看均分与样本量

dsh-vision-toolkit

@anionex/dsh-vision-toolkit · v0.1.45

纳入 36 题次

@anionex/dsh-vision-toolkit 维度评分雷达图从中心 0 分到外圈 5 分,各轴表示一个评分维度。圆点可查看均分与样本量。
维度均分 · 0–5 分点选圆点,查看均分与样本量

modsearch

@liustack/modsearch · v5.10.3

纳入 8 题次

@liustack/modsearch 维度评分雷达图从中心 0 分到外圈 5 分,各轴表示一个评分维度。圆点可查看均分与样本量。
维度均分 · 0–5 分点选圆点,查看均分与样本量

dsh-redteam-model

@dsh-external/dsh-redteam-model · v1.1.1

纳入 21 题次

@dsh-external/dsh-redteam-model 维度评分雷达图从中心 0 分到外圈 5 分,各轴表示一个评分维度。圆点可查看均分与样本量。
维度均分 · 0–5 分点选圆点,查看均分与样本量

评分来源:deepseek-flash,按 EvalDock 维度评分标准 v2.0 生成。查看统计口径

从六项任务中看到的成果

  1. 从文字要求走到实际文件交付

    案例交付了可调用程序、含公式的工作簿、查询文件和代码补丁。读者可以沿着“需求—执行—产物”了解任务如何落地。查看表格案例 →

  2. 验证方式与交付物相匹配

    图像程序使用逐像素比对,表格公式经过独立重算,代码补丁经过针对性测试与应用检查。这些步骤让成果有具体的验证依据。查看图像案例 →

  3. 将原始信息整理为后续可用的结果

    票据图片被整理为统一字段的表格;数据库查询同时保留 SQL、结构化结果和答案,便于继续处理或回查来源。查看票据案例 →

六个代表任务

每项案例列出执行时的配置版本、交付成果与验证方式。执行步骤经过脱敏整理,便于快速理解任务过程。

S01 / 数据处理

实现序列处理,并验证边界输入

配置:dsh-vision-router 2.1.7 · 查看该配置评分

将数据转换要求实现为可调用程序,处理空输入、重复值与异常类型,并检查序列化前后的结果。

交付与验证摘要

交付物
数据转换程序
验证方式
边界用例 · 随机属性检查 · 序列化往返
  1. 分析输入约束
  2. 实现转换逻辑
  3. 构造边界与随机用例
  4. 运行验证脚本
程序交付完成,自建验证脚本通过;执行记录确认输入文件保持不变。
查看证据核对说明

核对了程序内容、验证脚本及工具实际返回。检查覆盖显式边界用例、随机属性断言与序列化往返,记录包含输入完整性检查。

S02 / 图像计算

完成图像变换,逐像素核对结果

配置:dsh-vision-router 2.1.7 · 查看该配置评分

交付图像处理程序,用独立参考计算核对像素输出,并检查通道边界与输入完整性。

交付与验证摘要

交付物
图像变换程序
验证方式
参考计算 · 随机图像 · 逐像素比较
  1. 解析图像输入
  2. 实现变换计算
  3. 建立参考结果
  4. 逐像素比对输出
图像变换程序完成交付,归档验证脚本返回全部检查通过。
查看证据核对说明

核对了程序内容、参考计算与实际工具返回。验证覆盖样例、随机图像和通道边界,比较完整像素结果。

S03 / 表格计算

补全统计公式,保留原表结构

配置:@vinvcn/dsh-mattpocock-skills-zh 1.2.3 · 查看该配置评分

读取已有工作簿,将跨区域匹配与统计要求写成公式,在目标单元格完成计算并保留原有表格。

交付与验证摘要

交付物
含统计公式的 Excel 工作簿
验证方式
公式检查 · LibreOffice 重算 · 修改范围比对
  1. 读取工作簿
  2. 写入目标公式
  3. 独立重算结果
  4. 复核修改与样式
交付带公式及计算缓存的 Excel 文件;归档比较显示只修改了两个目标单元格,已有单元格样式保持一致。
查看证据核对说明

只读检查交付文件中的公式与缓存值,并核对 LibreOffice 重算记录。执行记录同时比较了修改单元格、原有样式与工作表名称。

S04 / 数据库查询

将查询需求转成 SQL,并交付执行结果

配置:@nanmicoder/dsh-agent-teams 0.1.18 · 查看该配置评分

先检查数据库结构,再根据自然语言要求编写查询,执行后将结构化结果与答案一并交付。

交付与验证摘要

交付物
SQL 查询 + JSON 结果 + 答案文件
验证方式
结构读取 · 实际查询 · 文件与返回值核对
  1. 检查表结构
  2. 生成筛选查询
  3. 执行数据库查询
  4. 整理结果与答案
交付 SQL 查询、JSON 结果和答案文件;答案与实际查询返回一致。
查看证据核对说明

核对数据库结构读取与查询工具返回,再对照三份交付文件,确认查询字段、执行结果与答案之间的对应关系。

S05 / 票据整理

从票据图片提取信息,整理成可用表格

配置:@anionex/dsh-vision-toolkit 0.1.45 · 查看该配置评分

批量读取票据图片,提取日期与总金额,结合原图复核后,按统一字段整理为 Excel 工作簿。

交付与验证摘要

交付物
22 条记录的票据汇总表
验证方式
图片识别 · 原图复核 · 工作簿读回检查
  1. 批量识别图片
  2. 提取日期与总额
  3. 对照原图复核
  4. 导出并读回表格
将 22 张票据整理为 22 条记录,交付包含来源、日期和金额三列的 Excel 文件。
查看证据核对说明

核对输入图片清单、提取过程与最终读回记录;只读检查交付工作簿,确认一张工作表、三列字段和 22 条数据记录。

S06 / 代码修复

修复事件通知逻辑,交付可应用补丁

配置:@liustack/modsearch 5.10.3 · 查看该配置评分

定位事件通知接口的调用问题,修改对应实现,通过针对性测试检查行为,并导出补丁。

交付与验证摘要

交付物
代码补丁 + 修复说明
验证方式
针对性单元测试 · 补丁应用检查
  1. 定位通知逻辑
  2. 修改接口调用
  3. 运行针对性测试
  4. 导出并检查补丁
交付单文件补丁与修复说明;归档记录显示目标测试文件的 10 项测试通过,补丁应用检查通过。
查看证据核对说明

核对实际补丁、目标测试文件的运行返回与补丁应用记录。这里呈现的是该次执行中的针对性验证结果。

结合你的任务阅读

需要处理代码或计算逻辑
关注实现与验证如何对应:输入边界是否被覆盖、是否有参考结果、交付内容如何检查。参见 S01S02S06
需要完成办公数据整理
关注产物能否进入后续工作:公式是否保留、表格结构是否完整、字段与格式是否统一。参见 S03S05
需要从已有数据中获得答案
关注答案的来处:是否读取实际数据结构、执行查询,并保留与答案对应的结果文件。参见 S04

对于开发者,可将案例中的交付要求、验证步骤和评分维度转成自己的验收清单,并固定任务与配置进行版本复测。

EvalDock 是面向各类 Agent 的跨生态评测与选型平台,为使用者提供选型与解决方案,为开发者提供优化依据。了解平台与服务

从任务到成果的评测方法

  1. 明确任务要求。根据任务确定输入、交付物和检查条件。
  2. 记录真实执行。保留工具调用、运行过程及最终产物。
  3. 核对成果与证据。结合程序内容、验证脚本及实际工具返回,确认案例描述的依据。
  4. 整理公开报告。呈现任务类别、配置版本、成果摘要与验证方式。

各案例标注了执行时使用的插件配置与版本。我们结合归档交付物与实际工具返回核对成果;验证结果来自任务执行时的归档记录。

评分与统计口径

本节汇总 DSH 0.1.5-rc.1 下十种插件配置的 228 题次。统计纳入正常结束、任务所需测试条件齐备、全部适用维度评分完整且符合独立作答要求的记录;同一任务在不同配置下分别计为题次。

评分模型为 deepseek-flash,使用 EvalDock 维度评分标准 v2.0,结合任务要求、归档轨迹与产物给出 0–5 分。均分展示原始评分,分母为该配置、该维度的实际纳入数。

4 分对应能力完整、结果正确且过程符合要求;5 分进一步要求全部适用要求达到高质量完成,相关边界与结果有充分可复核证据。小数表示相邻评分锚点之间的完成程度。

本表用于查看各配置在所测任务中的维度表现;跨配置选型时,结合任务范围、样本量与案例阅读。

完整流程见评测方法说明

报告信息与公开范围

本报告由 EvalDock 团队整理,公开原始模型评分的汇总、经过核对的任务成果、配置与方法。案例使用 S01–S06 编号,以脱敏摘要呈现。

测试执行代码、完整题库、参考答案及原始会话保留内部。公开内容聚焦具体任务观察,便于使用者了解执行方式与交付表现。

引用建议:EvalDock,《首轮 Agent 与插件评测报告:配置评分与任务成果》,v1.4,2026-09-19。报告固定地址