DSHEVAL
菜单

ABOUT DSH-EVAL

万物皆可测

DSH-Eval 是面向 DeepSeek Harness(DSH)Agent 与插件的通用测评平台。通过任务、证据与基线比较,帮助开发者和选型团队判断能力与插件增益。

了解方法设计

让能力判断有依据

  • Agent 能完成哪些任务?
  • 安装插件后有没有提升?
  • 升级版本是否出现退步?

DSH-Eval 帮助开发者和选型团队回答这三个问题。每项结论都结合具体任务、模型与运行环境,便于判断是否适用于自己的场景。

从任务到可比较的结论

为回答这些问题,测评方法围绕以下五个环节设计。

  1. 匹配测试任务

    根据插件的能力描述,选择适合的测试集。

  2. 执行真实任务

    在约定的模型与环境下,让 Agent 实际完成任务。

  3. 保留逐题证据

    记录输入输出、执行过程和必要的环境变化,作为判断依据。

  4. 按能力维度评分

    使用统一标签和评分规则,呈现各项能力的表现。

  5. 比较插件增益

    与同条件下未安装第三方功能插件的原生 Agent 比较,判断提升或退步。

常见问题

01

DSH-Eval 评测什么?

实际被测对象是指定模型、Harness、插件、权限、工具和环境配置下的整个 Agent。插件是实验中的变化因素,成绩不能解释为脱离模型与宿主的插件固有分数。

02

一次评测如何保证公平?

同一测试中的对象使用相同题目、运行环境、模型配置、超时设置和评分规则。必须改变的变量会在方法与结果中单独说明。

03

评测结果能否复查或复现?

公开报告提供结果数据、评测代码、版本与环境信息,并说明可复查的范围。部分题面、标准答案和完整日志未公开,无法仅凭公开数据重跑全部测试;是否完成独立环境复测,会通过验证等级明确标注。

04

Level 01–05 表示什么?

等级表示证据和验证进展,不表示能力高低:从已收录、可运行、已完成测试、已提交自测,到关键结果已在独立环境复测。

05

评测故障会被记为零分吗?

不会。框架、处理器或环境故障会单独记录;缺少关键证据时会标记无法评测,避免把评测系统的问题误写成对象能力不足。

06

如何提交项目或对结果提出异议?

请在对应公开报告所链接的代码仓库中提交 Issue,并注明项目版本、争议数据、复现环境和相关证据。我们会把更正与复测状态保留在公开记录中。