ABOUT DSH-EVAL
万物皆可测
DSH-Eval 是面向 DeepSeek Harness(DSH)Agent 与插件的通用测评平台。通过任务、证据与基线比较,帮助开发者和选型团队判断能力与插件增益。
了解方法设计PRODUCT & SCOPE
让能力判断有依据
- Agent 能完成哪些任务?
- 安装插件后有没有提升?
- 升级版本是否出现退步?
DSH-Eval 帮助开发者和选型团队回答这三个问题。每项结论都结合具体任务、模型与运行环境,便于判断是否适用于自己的场景。
METHOD DESIGN
从任务到可比较的结论
为回答这些问题,测评方法围绕以下五个环节设计。
匹配测试任务
根据插件的能力描述,选择适合的测试集。
执行真实任务
在约定的模型与环境下,让 Agent 实际完成任务。
保留逐题证据
记录输入输出、执行过程和必要的环境变化,作为判断依据。
按能力维度评分
使用统一标签和评分规则,呈现各项能力的表现。
比较插件增益
与同条件下未安装第三方功能插件的原生 Agent 比较,判断提升或退步。
FAQ
常见问题
01DSH-Eval 评测什么?
+
实际被测对象是指定模型、Harness、插件、权限、工具和环境配置下的整个 Agent。插件是实验中的变化因素,成绩不能解释为脱离模型与宿主的插件固有分数。
02一次评测如何保证公平?
+
同一测试中的对象使用相同题目、运行环境、模型配置、超时设置和评分规则。必须改变的变量会在方法与结果中单独说明。
03评测结果能否复查或复现?
+
公开报告提供结果数据、评测代码、版本与环境信息,并说明可复查的范围。部分题面、标准答案和完整日志未公开,无法仅凭公开数据重跑全部测试;是否完成独立环境复测,会通过验证等级明确标注。
04Level 01–05 表示什么?
+
等级表示证据和验证进展,不表示能力高低:从已收录、可运行、已完成测试、已提交自测,到关键结果已在独立环境复测。
05评测故障会被记为零分吗?
+
不会。框架、处理器或环境故障会单独记录;缺少关键证据时会标记无法评测,避免把评测系统的问题误写成对象能力不足。
06如何提交项目或对结果提出异议?
+
请在对应公开报告所链接的代码仓库中提交 Issue,并注明项目版本、争议数据、复现环境和相关证据。我们会把更正与复测状态保留在公开记录中。