Definition Precision Benchmark for Weak/Strong-text languages · 弱/强文本语言定义质量基准
这是 DPB-WS 的生成子集 它只保留「让被测 agent 读题目 → 自己产出定义 → 生成答案集(试卷)」这一截。 不评分、不排名、不分析、不含裁判脚本。
dpb-ws-gen/
├── README.md
├── AGENT_TASK.md # ★ 给任意 agent 的自包含任务简报(首选入口,零手动)
├── LICENSE # MIT
├── .gitignore # 运行产物不入库
├── requirements.txt # generate.py 是纯标准库,无需安装;agents 自带依赖
├── dataset/
│ └── concepts.json # 80 概念 × 5 域(数学/物理/法律/医学/计算机)的「题目 + 中性参考」
├── agents/
│ ├── example_agent.py # 接口模板(离线桩,改成你的 agent 即可)
│ └── dpbws_agent.py # 一个可跑的真实示例(调 DeepSeek,需 requests)
├── src/
│ └── generate.py # 代码型 agent 接入:跑 agents/<x>.py 的 define() → results/raw/<x>.json
└── results/
└── raw/ # ← 答卷写这里(gitignored,不入库)
80 个专业概念,每个形如:
{
"id": "math-01",
"domain": "数学",
"concept": "极限",
"en": "limit (of a function/sequence)",
"reference_def": "…中性参考定义(独立权威源转录)…",
"traps": ["常见误区 1", "常见误区 2"],
"reference_source": "Rudin, …",
"trap_source": "独立误区出处…"
}id / concept / en / domain 四个字段。
reference_def / traps / reference_source / trap_source 是留给评分阶段的金标准与陷阱,
相当于「开卷后才发的答案」,定义时不得使用,否则答卷无效。
DPB-WS 不要求你改任何代码、不要求你复制粘贴。 首选:让被测 agent 自己读题、自己写答卷。
- 把
AGENT_TASK.md里那段指令整段贴进你的 agent,告诉它:- 你的 agent 叫什么(决定输出文件名,如
my_agent); - 用哪种技术答题:
naive(裸定义)/df(定义前置)/en(英文原生)/struct(结构化不钉定义)。
- 你的 agent 叫什么(决定输出文件名,如
- 等它回「已写入
results/raw/my_agent.json,共 N 条」。 —— 它自己读dataset/concepts.json、自己产出、自己写文件,你全程不用动手。
pip install -r requirements.txt # 实际纯标准库即可,requests 仅 dpbws_agent 示例需要
# 复制 agents/example_agent.py -> agents/myagent.py,实现 def define(concept: dict) -> str
python src/generate.py --agent myagent # 零 Key(桩版),写入 results/raw/myagent.json
python src/generate.py --agent myagent --limit 8 # 调试小跑前 8 题define() 入参:{"id", "concept"(中文术语), "en"(英文术语), "domain"(领域)};
返回该概念的定义文本即可。DPB-WS 不关心你内部怎么调模型(本地函数 / 你的 HTTP 服务 / 任意 API 都行)。
agent 写出的文件结构:
{
"benchmark": "DPB-WS",
"generator": "<agent名>",
"label": "<agent名>",
"generated_at": "2026-07-16T08:47:22",
"results": [
{
"concept_id": "math-01",
"concept": "极限",
"domain": "数学",
"condition": "naive | df | en | struct",
"text": "<该概念的定义原文>",
"prompt_tokens": null,
"completion_tokens": null
}
// ……其余概念依次追加,须覆盖 concepts.json 中的每一个 id
]
}condition 填你采用的技术标签;text 是定义原文,不得为空、不得写「无法确定」。
本仓库只负责「出题 + 收卷」。评分可由跑者用任意大模型(豆包 / deep / GPT)对照
reference_def 与 traps 自行完成——尺子不握在基准作者手里,工具保持中立。
配套的可复现评分流程(打包 → 任意模型评 → 改进参考)在完整版 dpb-ws 仓库中。
- 尺子独立:
reference_def来自reference_source指向的外部权威(教材/法条/标准),不是作者表述。 - 尺子中立:
reference_def须为对reference_source的逐字转录,严禁按任何被测提示技术改写或「DF 化」——一条公开基准的尺子,不能长着被测技术的样子。 - 陷阱独立:
traps来自trap_source指向的独立误区出处,与reference_source不同源。 - 我们不评分:DPB-WS 只提供数据 + 中性规则,评分权完全交给跑者。
| 组件 | 状态 |
|---|---|
| 数据集 concepts.json(80 概念 × 中性参考源 + 陷阱) | reference_def 待按 reference_source 逐字核对;法律域尺子已钉《民法典》条文,其余域为权威源家族 + TODO |
| 生成 / 接口脚本 | ✅ 可运行(零 API Key 即可跑通桩版) |
上传本仓库前请知悉:在数据集经来源核实、且至少一组真实评测跑通前,请勿把它当「已成立的基准」引用。本仓库定位是可复现的「出题 + 收卷」工具。
作者:孙巍珑(GitHub: llxpy)· 计算机大专学历 / 独立学习者 · 视角论文配套工程