EvalDock
菜单

REPORT

四款办公 Agent,75 道任务实测

比较四款办公 Agent 的最终交付表现,结合分项成绩与实际案例,了解不同任务中的差异。

EvalDock 发布于

报告目录 · 7 个章节

1. 评测范围与报告内容

办公 Agent 能否完成一份可用的表格、演示文稿或文档报告?EvalDock 从五套评测集中选取 75 道任务,由四款产品分别执行,围绕 300 项结果比较最终交付表现。

以下按任务展示成绩,并结合具体文件说明交付表现。总分按五套题集等权汇总,分项用于比较不同任务类型下的表现。

参测产品
4
不同任务
75
交付结果
300
评测题集
5

本报告评估允许人工辅助、续接和重试后的最终交付质量。取样方式、执行条件与评分规则见第 06 节。

2. 四款产品的评测成绩

五套评测分别覆盖办公文件交付、电子表格处理、PPT 修改、演示文稿生成和文档图像问答。每款产品在每套评测中均有 15 道题,成绩统一换算为 0—100 分,具体公式见测试方法。

总分 · 五套题集等权

每款 75 题 · 总分 / 100
千问办公
90.5,换算分 / 100
WPS 灵犀
90.5,换算分 / 100
WorkBuddy
88.3,换算分 / 100
豆包工作
88.3,换算分 / 100

办公文件、电子表格、PPT 修改、PPT 生成、文档问答各占 20%;PPT 生成取内容、设计、连贯性三项换算分的平均。总分仅概括本批 75 道任务的表现。

深色为当前指标的本批最高值(含并列);分数不代表任务成功率。

计分方法 ↗各项按理论范围换算为 0—100 分,总分按五套题集等权计算。

查看总分与全部 7 项成绩
换算分 · 满分 100
本批每款每套 15 题 · 总分按五套题集等权计算
评测对象总分办公文件电子表格PPT 修改PPT 内容PPT 设计PPT 连贯性文档问答
千问办公90.593.3100.098.359.669.273.393.3
WPS 灵犀90.5100.093.391.758.573.175.098.5
WorkBuddy88.393.393.393.358.570.475.093.3
豆包工作88.3100.0100.083.857.579.676.786.7

计分方法 ↗各项按理论范围换算为 0—100 分,总分按五套题集等权计算。

OfficeBench 与 SpreadsheetBench 的通过数反映是否满足对应任务的检查要求。PPT 分数描述指定修改或生成质量。ANLS 衡量答案文本相似度,不等同于答对率。这些指标回答不同问题,适合在各自任务范围内比较。

3. 本批主要发现

本批结果显示,不同产品的领先项随任务类型变化。 办公文件交付中,WPS 灵犀和豆包通过全部 15 题;电子表格任务中,千问和豆包通过全部 15 题。千问在 PPT 修改任务中得分最高,豆包在演示文稿的设计与连贯性评分中最高,灵犀在文档问答的文本相似度指标上最高。

以上按分项指标展示本批领先表现,具体交付差异见下方案例。

4. 具体交付案例与任务表现

结合表格、发票、PPT 和文档问答,查看分数背后的交付细节。以下案例仅描述本批对应任务。

电子表格:计算、完整性与表达共同影响交付

本批 SpreadsheetBench 样本中,千问和豆包均通过 15 题,灵犀和 WorkBuddy 均通过 14 题。结合办公文件任务,可以看到影响交付的细节不仅是公式逻辑,还包括字段和数值表达。

千问在一项收入提取任务中正确填写了年份和金额,但把要求的 year 表头写成了 d,因此未通过完整检查。金额提取正确与字段满足要求,需要分别判断。

灵犀在一道滚动求和题中,正确补出了后八行的求和公式,但前三个应计算的位置仍为 n/a,预期值分别为 4、6、12。这一例体现的是目标区域填写不完整。

WorkBuddy 在按月份天数计算夜班比例的任务中,正确处理了闰年和月份天数,但将小数比例放大了 100 倍。例如,10/31 应约为 0.322580645,交付值为 32.258064516;十二个月份中,十一个非零结果存在尺度问题。

表格验收检查点
验收维度本批观察实际使用时的检查点
字段准确性数据正确,指定表头不符列名、位置与任务要求是否一致
区域完整性已有公式正确,部分目标单元格未填是否仍有空白、占位符或错误值
数值表达比例与百分数的尺度混用底层数值、显示格式及单位是否匹配

发票报告:金额与主体信息分别验收

在一项两张发票汇总任务中,WorkBuddy 完成了金额汇总与报告交付,金额正确;但将“Earthenware for everyone”这句宣传语识别为供应商名称,漏掉了票面收款方“Pottery & Co.”。

这说明一份报告的计算结果和主体信息可能表现不同。验收票据类交付时,应分别核对金额、公司名称及交易角色。仅检查总额,无法覆盖报告中的全部关键信息。

PPT:修改准确度与生成质量各有侧重

Microsoft PPT-Eval 关注按要求修改已有演示文稿。本批千问得分 98.3,WorkBuddy 为 93.3,灵犀为 91.7,豆包为 83.8,满分均为 100。

具体交付中,千问曾将“Instant messaging”放入表格的另一列;灵犀曾生成两条并有缩进的项目符号,但保留了指定句子之外的原文。对修改类任务,内容是否处于指定位置、修改是否符合要求,都是验收的一部分。

PPTAgent / PPTEval 则分别评价生成演示文稿的内容、设计和连贯性。换算为百分制后,千问的内容得分为 59.6,在本批略高;豆包设计得分 79.6、连贯性得分 76.7,在本批最高。

PPT 修改与生成分别考察指令执行和内容创作,阅读成绩时应结合具体用途。制作演示文稿时,除版式与叙事外,还应核对关键数字、引述和结论的来源。

文档问答:区分信息理解与格式差异

本批 DocVQA 按平均 ANLS 换算为百分制后,灵犀最高,为 98.5;千问与 WorkBuddy 均为 93.3,豆包为 86.7。先对每款 15 题的 ANLS 求均值,再换算展示。

在对照源图检查的 60 份回答中,55 份原满分回答与源图信息一致。另有 3 份回答存在文本格式差异:千问将页码 12 写为“Page 12”,灵犀使用不同的日期分隔符,豆包将 800 写为带原图单位的“800 ng/g”。这些回答发生了文本匹配扣分,不能直接理解为对应信息均识别错误。

另外 2 份回答将题目要求的列标题理解成总标题或左侧项目名称,属于目标位置理解偏差。源图对照采用 AI 辅助复核,用于解释扣分原因;报告保留原 ANLS 成绩,分别呈现格式差异与信息理解问题。

5. 结合你的任务阅读

如果主要处理表格,可重点查看目标区域计算和完整性;如果主要制作 PPT,应先区分修改已有文件与生成新演示文稿;如果主要处理票据或文档问答,除了数字,还应关注实体名称、角色和信息所在位置。

这批成绩与案例可帮助确定优先试用的产品与任务。正式使用前,建议结合自己的材料,按计算准确性、内容完整性和文件格式等要求验收交付结果。

6. 测试方法与适用范围

测试时间:北京时间 2026 年 9 月 23—24 日。

范围与配置。 测试覆盖五套评测集各 15 题,四款产品合计 300 项结果,均通过网页端执行。WPS 灵犀的模型标签为 DeepSeek V4.1 Flash,WorkBuddy 为 hy4-preview。模型标签依据评测记录与评测方确认;本次评测对象为产品,精确后端模型未作独立核实。

执行与取样。 本文评估最终交付质量,执行中允许必要的人工辅助、任务续接和重试,不统计首次无人干预成功率。每套 15 题按类别、难度等信息选取,属于非简单随机样本。本轮未设置重复运行实验,分差用于描述本批任务表现,尚不足以判断长期稳定优势。

评分规则。 OfficeBench 采用文件交付适配检查;SpreadsheetBench 采用 Verified 子集的目标区域比较。两套 PPT 使用本次统一的自动检查与 AI 裁判配置,PPTAgent 内容与设计按页面评分汇总,连贯性按演示文稿汇总;DocVQA 采用平均 ANLS。

核验范围。 文件检查、自动评分与针对性内容复核共同构成核验依据,覆盖范围随案例说明,并非全部产物的独立人工验收结论。PPT 内容评分不包含源 PDF 事实的逐项核验;DocVQA 源图对照采用 AI 辅助检查,用于解释扣分原因,保留原 ANLS 成绩,不另计人工盲评结果或正确率。

百分制换算

所有成绩按指标的理论范围线性换算为 0—100 分,不按本批产品的最高、最低值拉伸。

  • 办公文件与电子表格: 通过题数 ÷ 15 × 100。
  • PPT 修改: 原评分范围为 0—100,数值保持。
  • PPT 内容、设计与连贯性: 原评分范围为 1—5,按(原分 − 1)÷ 4 × 100 换算;1 分对应 0,5 分对应 100。
  • 文档问答: 平均 ANLS × 100。

使用未四舍五入的原始均分计算,最终显示一位小数。换算仅统一展示尺度,不改变各项排序;不同任务的分数含义仍不同,换算分不等于任务成功率。总分 =(办公文件换算分 + 电子表格换算分 + PPT 修改换算分 + PPT 生成换算分 + 文档问答换算分)÷ 5,五套题集各占 20%。其中 PPT 生成换算分 =(内容换算分 + 设计换算分 + 连贯性换算分)÷ 3,三个维度合计只占总分的 20%。总分同样使用未四舍五入的数值计算后显示一位小数。

结果解读。 总分概括本批 75 道任务在所列产品配置下的最终交付表现,权重变化会影响总分与排序。跨报告比较需核对题集、执行条件和评分配置:本次采用选取样本与适配评分,PPT 裁判配置也与原评测不同,成绩用于本报告内的产品比较。

数据日期:2026-09-24。结果适用于本文所列样本、配置与评分口径。

查看五套评测的计分方法

7. 报告信息与参测配置

本报告由 EvalDock 整理,公开汇总成绩、具体交付案例和必要的计分方法、执行条件。

配置按测试时的评测记录与评测方确认列示,模型核实范围见第 06 节。

千问办公

网页端 · 每套 15 题,共 75 题
模型:未核实

WPS 灵犀

网页端 · 每套 15 题,共 75 题
模型:DeepSeek V4.1 Flash

WorkBuddy

网页端 · 每套 15 题,共 75 题
模型:hy4-preview

豆包工作

网页端 · 每套 15 题,共 75 题
模型:未核实

引用建议:EvalDock,《四款办公 Agent,75 道任务实测》,2026-09-24报告固定地址