Skip to content

Latest commit

 

History

2 Commits

Folders and files

NameName
Last commit message
Last commit date
 
 
 
 
 
 
 
 
 
 
 
 
 
 

Repository files navigation

DPB-WS · 生成子集(让 agent 做题 → 生成试卷)

Definition Precision Benchmark for Weak/Strong-text languages · 弱/强文本语言定义质量基准

这是 DPB-WS 的生成子集 它只保留「让被测 agent 读题目 → 自己产出定义 → 生成答案集(试卷)」这一截。 不评分、不排名、不分析、不含裁判脚本。


这个仓库有什么

dpb-ws-gen/
├── README.md
├── AGENT_TASK.md            # ★ 给任意 agent 的自包含任务简报(首选入口,零手动)
├── LICENSE                  # MIT
├── .gitignore               # 运行产物不入库
├── requirements.txt         # generate.py 是纯标准库,无需安装;agents 自带依赖
├── dataset/
│   └── concepts.json        # 80 概念 × 5 域(数学/物理/法律/医学/计算机)的「题目 + 中性参考」
├── agents/
│   ├── example_agent.py     # 接口模板(离线桩,改成你的 agent 即可)
│   └── dpbws_agent.py       # 一个可跑的真实示例(调 DeepSeek,需 requests)
├── src/
│   └── generate.py          # 代码型 agent 接入:跑 agents/<x>.py 的 define() → results/raw/<x>.json
└── results/
    └── raw/                 # ← 答卷写这里(gitignored,不入库)

数据集 dataset/concepts.json

80 个专业概念,每个形如:

{
  "id": "math-01",
  "domain": "数学",
  "concept": "极限",
  "en": "limit (of a function/sequence)",
  "reference_def": "…中性参考定义(独立权威源转录)…",
  "traps": ["常见误区 1", "常见误区 2"],
  "reference_source": "Rudin, …",
  "trap_source": "独立误区出处…"
}

⚠️ 被测 agent 只应读取 id / concept / en / domain 四个字段。 reference_def / traps / reference_source / trap_source 是留给评分阶段的金标准与陷阱, 相当于「开卷后才发的答案」,定义时不得使用,否则答卷无效。


怎么用:测你自己的 agent

DPB-WS 不要求你改任何代码、不要求你复制粘贴。 首选:让被测 agent 自己读题、自己写答卷。

路径 A · 任意带文件读取的 agent(WorkBuddy / Claude / GPT / 豆包)——零手动

  1. AGENT_TASK.md 里那段指令整段贴进你的 agent,告诉它:
    • 你的 agent 叫什么(决定输出文件名,如 my_agent);
    • 用哪种技术答题:naive(裸定义)/ df(定义前置)/ en(英文原生)/ struct(结构化不钉定义)。
  2. 等它回「已写入 results/raw/my_agent.json,共 N 条」。 —— 它自己读 dataset/concepts.json、自己产出、自己写文件,你全程不用动手。

路径 B · 代码型 agent(你有可调用的 Python 函数)

pip install -r requirements.txt          # 实际纯标准库即可,requests 仅 dpbws_agent 示例需要
# 复制 agents/example_agent.py -> agents/myagent.py,实现 def define(concept: dict) -> str
python src/generate.py --agent myagent          # 零 Key(桩版),写入 results/raw/myagent.json
python src/generate.py --agent myagent --limit 8  # 调试小跑前 8 题

define() 入参:{"id", "concept"(中文术语), "en"(英文术语), "domain"(领域)}; 返回该概念的定义文本即可。DPB-WS 不关心你内部怎么调模型(本地函数 / 你的 HTTP 服务 / 任意 API 都行)。


答卷格式(results/raw/<agent>.json

agent 写出的文件结构:

{
  "benchmark": "DPB-WS",
  "generator": "<agent名>",
  "label": "<agent名>",
  "generated_at": "2026-07-16T08:47:22",
  "results": [
    {
      "concept_id": "math-01",
      "concept": "极限",
      "domain": "数学",
      "condition": "naive | df | en | struct",
      "text": "<该概念的定义原文>",
      "prompt_tokens": null,
      "completion_tokens": null
    }
    // ……其余概念依次追加,须覆盖 concepts.json 中的每一个 id
  ]
}

condition 填你采用的技术标签;text 是定义原文,不得为空、不得写「无法确定」。


之后怎么评分(本仓库不管)

本仓库只负责「出题 + 收卷」。评分可由跑者用任意大模型(豆包 / deep / GPT)对照 reference_deftraps 自行完成——尺子不握在基准作者手里,工具保持中立。 配套的可复现评分流程(打包 → 任意模型评 → 改进参考)在完整版 dpb-ws 仓库中。


中立性声明(基准的生命线)

  • 尺子独立reference_def 来自 reference_source 指向的外部权威(教材/法条/标准),不是作者表述。
  • 尺子中立reference_def 须为对 reference_source 的逐字转录,严禁按任何被测提示技术改写或「DF 化」——一条公开基准的尺子,不能长着被测技术的样子。
  • 陷阱独立traps 来自 trap_source 指向的独立误区出处,与 reference_source 不同源。
  • 我们不评分:DPB-WS 只提供数据 + 中性规则,评分权完全交给跑者。

当前状态(诚实声明)

组件 状态
数据集 concepts.json(80 概念 × 中性参考源 + 陷阱) ⚠️ DRAFTreference_def 待按 reference_source 逐字核对;法律域尺子已钉《民法典》条文,其余域为权威源家族 + TODO
生成 / 接口脚本 ✅ 可运行(零 API Key 即可跑通桩版)

上传本仓库前请知悉:在数据集经来源核实、且至少一组真实评测跑通前,请勿把它当「已成立的基准」引用。本仓库定位是可复现的「出题 + 收卷」工具


作者:孙巍珑(GitHub: llxpy)· 计算机大专学历 / 独立学习者 · 视角论文配套工程

About

DPB-WS是一个专注Agent处理问题的规范

Resources

Stars

0 stars

Watchers

0 watching

Forks

Releases

Packages

Contributors

Languages