English · 简体中文
⚠️ 更正(2026-10-02,另一项):防御轴的一案 A-d511f9e8 在所有车道上改记 NA(考场判的不是考生交付的文件,判分还要求了题面没写的事)。分母不变,过案数不变,每条道的总分都带'。本仓各期成绩表里这一格请按 NA 读,其余内容保留原样,以更正声明为准。
⚠️ 更正(2026-10-02):以下考卷在作答时越出考卷、接触了判分材料,不计胜负。deepseek-v4.1-flash @ CommandCode(high 档) 有 2 张卷(A-61f7ad01、A-24bcf707)改记 NA,成绩 17/23∅ → 15'/23∅;同道 none 档 有 1 张卷(A-a5608487)改记 NA,成绩 17/23 → 16'/23;同道 medium 档 有 1 张卷(A-a5608487)改记 NA,成绩 15/23 → 14'/23;mimo-v2.6-pro @ CommandCode 有 1 张卷(A-a5608487)改记 NA,成绩 17'/24 → 16'/24;space-bunny-alpha @ CommandCode 有 2 张卷(A-a5608487、A-be92627f)改记 NA,成绩 15/24 → 13'/24;grok-4.7 @ CommandCode(未完赛,不定级)的 A-be92627f、A-a5608487 两格由 ✓ 改记 NA;另有一格存疑、未能裁定:mimo-v2.6-flash 的 A-a5608487(发布为「过」),见声明。原因是考场隔离缺陷,责任在我们。本页其余内容保留原样,以更正声明为准。
2026-10-07 更新:A-cdc3d11a(审查):某个审查案上,判分器把一条格式正确的发现里的每个小点都当成一条未经证实的独立断言,又把答案清单之外的真实缺陷当成误报,所以一份正确、格式规范的审查报告也到不了及格线;该案在所有车道上挂起,分母不变,待判分器和考场修好、重新补考后再定。本仓三条榜上车道的这一格都改记 NA(挂起),不记负:deepseek-v4.1-flash @ CommandCode(high 档)、mimo-v2.6-pro、space-bunny-alpha;该案由负改记 NA 的车道共 27 条,没有重新考试,也不对任何模型的能力下结论。三条车道的过案数都不变(榜上 15'/23、16'/24、13'/24);负案 5→4、6→5、8→7,NA 3→4、2→3、3→4;审查轴都是 1/2 不变、另有 1 个 NA。2026-W37 期文和 2026-W39 期文的矩阵里这些格已照此改记,其余各列和图表(含上方榜单构成图)为更新前原记,未动。见规范仓 2026-10-07 的更正(A-cdc3d11a)。
用私有题库 AMBER 实测 CommandCode(可从它这里购买各家模型的 API 额度,api.commandcode.ai)在售模型:只公开成绩,不公开题目。
| 大类 | 轴 | 考什么 | laguna-s-2.1 (CommandCode) · W41 | mimo-v2.6-pro · W39 | space-bunny-alpha · W39 | deepseek-v4.1-flash · W37 |
|---|---|---|---|---|---|---|
| 施工面 | 编码 | 照着需求把功能写对 | 4/6 · 2 NA | 5/6 | 4/6 | 4/6 · 1 NA |
| 交付 | 做完还得交得出东西 | 2/3 | 3/3 | 2/3 | 3/3 | |
| 运维 | 照规程干脏活 | 6/6 | 5/6 · 1 NA | 5/6 · 1 NA | 5/6 · 1 NA | |
| 需求 | 客户要 A 不要 B | 0/1 | 1/1 | 0/1 | 1/1 | |
| 收敛 | 真干完,不绕圈装忙 | 1/1 | 1/1 | 0/1 | — | |
| 判断面 | UI | 照设计稿做页面 | 0/1 | 0/1 | 1/1 | 1/1 |
| 视觉 | 给真截图挑毛病 | 0/1 | 0/1 | 0/1 | 0/1 | |
| 防御 | 堵死校验器的漏网口 | 0/2 · 1 NA | 0/2 · 1 NA | 0/2 · 2 NA | 0/2 · 1 NA | |
| 归因 | 毛病对到正确根因 | 0/1 · 1 NA | 0/1 | 0/1 | 0/1 | |
| 审查 | 给别人的交付物挑错 | 1/2 · 1 NA | 1/2 · 1 NA | 1/2 · 1 NA | 1/2 · 1 NA | |
| 合计 | 14'/24 | 16'/24 | 13'/24 | 15'/23 |
每格 = 过了几案/该轴共几案(案 = 一道计分题)。NA = 这一案作废或暂停计分,不算过也不算没过;总分带 ' 表示其中有 NA。多数轴只有 1–2 案,差一案读数就变,所以别把小差距当结论。各期考试日期不同,数字是当期快照。
我们定期让同一批模型考试,只发成绩单;考题和评分细节不公开。
- 「道」= 一个模型名在某家平台的售卖入口(也可读作渠道);「案」= 一道题;「卷」= 一场考试记录;「档」= effort 档,思考力度档位。
- 每期一篇
results/YYYY-Www.md:同题、同考试程序(harness,跑考试并记分的程序),对目标模型跑全库;同名模型跨平台并排。 - 一期固定报告:题集规模与哈希、每案找茬分(d2 分:我们对模型犯错种类与严重度的打分,算法不公开;过/不过关另看每案通过线)与通过/失败、终端终态(程序跑完时的退出状态)、token 用量(若渠道上报)与时延、环境指纹、按证据纪律写的定性裁决。
- 题目、oracle(判分器)、transcript(答题全过程记录)、中间产物永不公开(见下「发布纪律」)。
- 姐妹仓:amber-deepseek(DeepSeek 官方道)、amber-opencode(OpenCode Go 道)、amber-gpt、amber-crof、amber-ollama、amber-devin、amber-workbuddy(WorkBuddy ACP 道)、amber-doubao、amber-goldenpotato、amber-kimi、amber-stepfun。本仓的对照轴是同名模型跨厂商对决——同一个模型名在 CommandCode / OpenCode Go / DeepSeek 官方道上可能是不同端点,跨仓引用一律带日期与档位声明。
- AMBER 是 agentic 实战题库(施工/运维/审查/视觉/需求漂移——题中要求中途变化),规范与制题工具见 getaskclaw/amber;考题本体私有。
- 只发:分数与聚合、token 用量(若渠道上报)、速度、定性裁决。
- 永不发:题目内容、oracle/判分器、transcript、考生工作区、任何能复原题面的中间产物。
- 每期必钉:模型 ID、effort 档(思考力度档位)、日期(UTC)、harness 版本、每案内容哈希(bundle_sha,每题内容的哈希指纹)。哈希用于对照 amber 的公开哈希清单,自证题集未变。
- 案号与题目结构属私有面:公开结果里案例只用稳定别名(A-xxxxxxxx,哈希派生)+ bundle 哈希作句柄;内部案号、变体名、题目描述永不出现。
- 基调:这是社区实测,不是对厂商的攻击。数据说话,措辞克制。
同名模型、同 provider,两次跑也可能不同分——推理参数、负载、服务端版本都在漂;转发/聚合道还隔着一层上游路由,同名不一定是同一个端点。所以这里的一切结论都带日期与档位,且定期重测。单日数字是快照,不是定律。
成绩速读:「格」= 榜单里的一个计分格;「invalid」= 这场考试作废(多为考场侧问题),不计能力分;「挂起」= 暂不定论、待复核或重考;「案级计数」= 以案为单位汇总的成绩数(一道题可能有多卷);「三连考」= 一期连着考三条模型线;「腿」= 其中一条模型线;「车道冻结期」= 该渠道暂停补考的一段时间;「防御钉」= 防御类钉子题(刻意埋陷阱、专考模型犯错方式的难题);「五档天梯」= 同一模型在 5 个 effort 档上的成绩阶梯;「GA 当日」= 模型正式发布当天。
| 期 | 内容 | 结论 |
|---|---|---|
| 2026-W39(EN) | CommandCode 三连考:grok-4.7 / mimo-v2.6-pro / mimo-v2.6-flash;09-24 加餐 stealth/space-bunny-alpha | mimo-v2.6-pro 17/24(1 invalid);mimo-v2.6-flash 13/24(6 负;5 案 invalid 不定模型罪);grok-4.7 未完赛,7 案挂起待 09-29 原道重考;加餐 space-bunny-alpha 15/24(stealth 免费窗,页内同端点并排) |
| 2026-W38 更正特刊(EN) | W38 全库复核:本仓 0 个计分格改判 · 14 个计分格挂起;另附三连考 mimo 两个模型成绩入档 | W37 五档天梯 14 卷挂起(high 档 2 格 + 案级计数),车道冻结期内不补考;加餐:mimo-v2.6-pro 判过 17 / 判负 6 / 挂起 1,mimo-v2.6-flash 判过 13 / 判负 6 / 挂起 5(A-be92627f 同一案在两个模型因不同原因失败,分别记账) |
| 2026-W37 | deepseek/deepseek-v4.1-flash 全库首考(23 案,GA 当日) | 17/23;UI 搭建卷满分(第五个公开通过该案的成绩);防御钉 8/9 刷新全员纪录;同名跨厂商三家核对,确认都是真 v4.1;审查/视觉面是弱项 |
与 CommandCode、DeepSeek(深度求索)无任何隶属/赞助关系。分数是特定周、特定档位的快照,不构成采购建议。
