research: Learning in Referencing — 22 组实证;🔴 换词控制推翻了参数化记忆线的「概念」解读(25 处自我推翻) - #335
research: Learning in Referencing — 22 组实证;🔴 换词控制推翻了参数化记忆线的「概念」解读(25 处自我推翻)#335oratis wants to merge 42 commits into
Conversation
Co-Authored-By: Claude Opus 4.8 <noreply@anthropic.com>
第四轮 deep-research(12 目标 × [发现员+怀疑复核] + 总裁决 = 25 agent, 0 error) 对抗式证伪狭义主张。结果 holds-with-caveat, 0 反例 0 refute: - 族6 回放选择准则全覆盖: reservoir=随机 / GDumb=类别平衡 / GSS=梯度多样性 / iCaRL=代表性 / DER++=reservoir(标签仅进loss) 皆真准入门; MIR 是检索门非准入门; 生成式回放/CLS 无逐项门 — 无一用概念级正确性 - 族5 局部学习: FF/PC/EqProp 无 episodic 门(量词空真); Hopfield 容量=被动饱和; recall-gated/self-sizing 是 GT-free 但信号为熟悉度/新颖 - 两悬案关闭: CN-DPM ✅ 确立为架构原生两段式(WAKE/SLEEP, DP×似然门); 2606.03787 ✅ 确立为真实 surprise-gated robot episodic memory - caveat: 2026 agentic 记忆写入门(Write-Time Gating/TRUSTMEM/LOCI)引入新代理 (来源信誉/对源忠实/可靠度/外部oracle), 均非概念真伪 → 代理表扩到十类, delta 收紧为 "GT-free / 无外部 oracle"; LOCI 为最锋利近邻(外部结果确认) - 引用修正: GDumb arXiv:2007.05003 是误号 → ECCV 2020 proceedings 改动: §7.6.2 代理表+12行 / 新增 §7.6.7 总裁决 / §7.6.4 证据强度重排 / §7.6.5 关闭两悬案 / §7.6.6 引用陷阱 / 附录 I 族4/5/6 落地 / §9.1 勾掉第四轮 / §9.2 Q9/Q11 已答+Q12 / §9.3 立论包(proposal+related-work+三层架构最小实现) Co-Authored-By: Claude Opus 4.8 <noreply@anthropic.com>
四轮调研收官后进入设计。两份新文档把立论包 §9.3 的 C2/C4 展开为可实现规格:
- DESIGN_COMPRESSION_GATE.md — 机制
* 两部分 MDL 形式化:G(c) 必须在【留出轮次】上算、必须含 L(c)、必须过【安慰剂对照】
* 修正 C4:区分 E1(模型误解 → 压缩门拒绝 ✅)与 E2(老师教假话 → 压缩门接受,
属设计边界,归 provenance 门射程)——原措辞"拒绝一切错误概念"会被 E2 反例击穿
* 现有七种门在 E1 上的失分表 + 七条失败模式 + 八项消融矩阵
- DESIGN_CONCEPT_BENCH.md — 数据
* 构造语言(伪词四道过滤 / 组合式微世界 / 语法距离旋钮)
* gavagai 对 G1–G5:教学集在构造上不足以消歧,只有留出用法能揭示所指
→ 把 E1 从"碰运气"变成可控可判分的实验条件
* 切断 Aycock 平行样例捷径的教学协议;冲突词跨用户隔离测试
* 实施顺序按"最早能证伪"排:P0 零算力先验证核心信号
研究文档同步回填 C4 修正、related-work 末句收紧提示、P0 指引。
Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
首个实证结果(Qwen2.5-1.5B 冻结,零训练,8 个 gavagai 对)。
结论:机制成立,但【压缩什么】比【用什么判据】更关键。
1. 朴素版(在老师自由陈述上算 NLL)——失败
· G 表面 8/8,但拆开看 92% 的 margin 来自长度罚 L(c)
· 纯预测力 ΔNLL 仅 +0.68 nats(5/8, 符号检验 p=0.36 不显著)
· 词级 margin +0.02 ≈ 零:给不给正确定义,模型输出该伪词的概率几乎不变
· 2/8 项被错误安慰剂击败
→ 若只报 G 的 8/8 就是假阳性结论;诊断项是设计时特意埋的,起了作用
2. 决定性诊断——能力在,观测方式错
· 强制选择探针:M/M′ 落差平均 0.295,6/8 有区分(最强 0.954→0.026)
· 失败的 2 项均需世界知识(盒子不圆 / 石头非金属)
3. 修正版(改压缩老师的用词决策序列)——成立
· ΔNLL +4.92 nats(8/8, p=0.0039),较自由陈述版提升 7.2×
· 安慰剂对照 8/8;4/8 项上误解的增益为负(比无概念更糟,门直接拒绝)
· 长度罚占比 92% → 60%
未解决(已写进文档,不可声称已解决):
· 单候选阈值跨 item 不可分,最佳归一化 AUC 0.875
→ 门目前是排序器,不是阈值判据;per-item 校准是最大缺口
· 范畴歧义远易于合取歧义(+10.73 vs +2.99),勿用 G2 数字代表整体
回改:机制文档新增 §1.2b(观测量)、§1.3 阈值警告、消融必报项 A0′/A0″。
Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
按路线图推进第 1、3 项(第 2 项缩放测试受下载带宽阻塞,未完成)。
1. per-item 校准(P0d)——部分成功
· 用安慰剂池作零分布算 z 分数:AUC 0.797 → 0.906
· 设计预测精确成立:M′ 平均 −0.22 vs 零分布中心 −0.27(仅差 0.05 nats),
M 为 +3.86 显著离群 → 零分布含 overspec 的设计是对的
· 与 SEMA(族 4 最接近先例)同一套 z 校准机制,差别只在信号类型 → 可正面引用
· 试过 6 种归一化(硬零分布/仅overspec/稳健z/百分位/÷base),全局可分性均未达成
2. ★ 根因定位:门的判别力继承自基座能力(新增第二前置条件)
· ρ(能力探针落差, 判别 margin) = +0.857
· 探针失败组 margin +2.11 vs 通过组 +5.86(2.8×)
→ 校准无法弥补能力不足;这是原设计未识别的前置条件
3. 扩展集 v2(P0e)——22 items × 5 类歧义 + bootstrap CI
· margin +4.08 nats 95%CI [+2.52,+5.70](不含 0);19/22,p=0.000428
· AUC 裸 0.843 [0.738,0.942] / z 校准 0.857 [0.746,0.950]
· 分类型差异是主导因素:
G2 范畴 +9.12 (AUC 1.000) · G3 材料 +8.25 (1.000) · G1 合取 +2.93 (0.861)
G5 绝对/相对 +0.53 (0.812) · G4 论元顺序 +0.15 (0.562 ≈ 随机)
· ★ 分层可分性:仅 G2/G3 时单候选阈值 AUC 1.000、τ=+0.75 ✅
→ 把「阈值不可分」从方法缺陷重定位为【作用域条件】
4. 🔴 撤回一个我方设计预测
· 设计时预期「双向判别(G3-G5)强于单向(G1,G2)」→ 实测相反(+2.98 vs +5.41)
· G4 失败机制查清:|ΔNLL| 仅 0.90 vs 其他 4.74,定义完全不改变模型预测
(靠表层语序启发式作答)——能力缺失,非材料或门的缺陷
5. bf16 与 fp32 结果一致(margin +4.90 vs +4.92,AUC 相同)→ 精度非混淆项
回改:机制文档新增 §1.3b(零分布 z 校准)、失败模式 8/9、前置条件 2;
bench 文档标注 G1/G2/G3 为主实验核心、G4/G5 为作用域边界。
Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
P0e 发现 G4(论元顺序)AUC 0.562 ≈ 随机、|ΔNLL| 仅 0.90(其他类 4.74)。 本实验保持任务不变、只改定义呈现方式,分开三种互斥解释: a 抽象变量 "X zelka Y" means X gives to Y → margin +0.15 (2/4), |ΔNLL| 0.90 b + 显式角色说明(第一个名字是给予者…) → margin −0.56 (1/4), |ΔNLL| 3.37 c 用真实人名实例化(去掉变量绑定) → margin +0.35 (3/4), |ΔNLL| 0.87 对照:其他 4 类歧义 → margin ≈ +4.9, |ΔNLL| ≈ 4.74 裁决:(A) 能力缺失。三种呈现都无信号 → 排除 (B) 变量绑定 与 (C) 提示格式。 关键细节:b 的 |ΔNLL| 升到 3.37 说明显式角色说明确实大幅改变了模型预测, 但 margin 转负 —— 不是"定义被忽略",而是模型用了定义却仍分不清论元角色。 这把 G4 从"可能是提示假象"坐实为【基座能力边界】。 含义:论文作用域应以 G1/G2/G3(属性/范畴/材料)为核心, G4/G5 单列为当前基座不可及的边界,勿混入主指标。 Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
项目目标扩展为「探索所有 AI 模型将知识内化的方案」,据此新建全景文档, 把前四轮调研的材料重组为按机制的分类学(而非按论文名)。 概念脊柱(本文档的原创综合,标 💭): · 内化的五个判据 I1–I5:免检索/组合性/隐式触发/跨会话持久/抗干扰 → "学会了" ≈ 五者合取;RAG 只满足 I4,是"存储"不是"内化" · 内化度阶梯 L0–L5:上下文→外部存储→激活/状态→适配器→稀疏槽→稠密权重 · ★ 核心张力:内化度 ↑ ⟹ 可逆性 ↓、可隔离性 ↓ 所有工程方案本质上都是在这条对角线上选点;有意思的研究都在中间层 L3/L4 · 内化流水线六环节:获取→准入门控→写入→巩固→保持/隔离→调用 实证发现:环节②(准入门控)是全领域最薄弱的一环 三个正交轴:载体 × 写入算子 × 时机,外加横切的准入门控维度。 家族 A–I 已落地(ICL/外部记忆/SSM状态/TTT快权重/稀疏槽/per-user适配器/ 权重编辑/可生长模块/局部规则),每族回答四问:内化到哪里、用什么写入、 持久性、有无准入门控;全部带 ✅/⚠️ /❌/🔍/💭 验证状态。 §4 横向矩阵读出三条结构性事实: 1. 「推理期写入」与「跨会话持久」在任何一行都不同时为 ✓ 2. 有门控的家族信号都不是正确性(十类代理占满,正确性列空) 3. 唯一原生快慢分离(HOPE/CMS)把巩固接到时钟而非门 §5 五个根本张力:稳定性-可塑性、叠加不可寻址、内化度反比、容量上界、 隔离 vs 泛化(后者在架构文献中命中为零)。 §7 定位本项目并声明边界:压缩增益验证「对该对话者用法的语义保真度」, 非「世界真值」;解决 E1(模型误解)不解决 E2(老师说假话), 后者属 provenance 门射程,两者正交可组合。 待办:第五轮调研(进行中)回填 J–P,尤其 J 上下文蒸馏—— 它可能是「推理期写入 × 跨会话持久」那格的已有解,若是则空白声明需收紧。 Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
问题:门的判别力继承自基座能力(ρ=0.857),关系类概念上几乎无信号,
校准救不了(试过 6 种归一化)。原设计的门是二态的(毕业/不毕业),
在能力不足处任何阈值都是在读噪声。
方案:加一个前置的【可判定性闸门】,让门能"知道自己判不了"并转为追问。
可判定性计 σ_null = 零分布的离散度,必须满足三条且都满足:
· GT-free(不需要答案)
· 不需要知道哪个候选是对的(对比:能力探针 ρ=0.857 但需要两个候选)
· 门本来就要算零分布 → 零额外开销
语义:把候选定义塞进上下文后,模型预测到底会不会被影响。
σ_null≈0 ⟹ 定义没进入决策 ⟹ 增益判据无效。
实测(22 items):
σ_null: G1 4.75 / G3 4.12 / G2 2.93 ≫ G5 1.07 / G4 0.64
ρ(σ_null, margin) = +0.520
三态门(τ_dec=1.5, τ_z=+0.68):
AUC 0.857 → 0.964(τ_dec=2.0 时 0.970)
正确接受 M 15/15(零漏拒)· 正确拒绝 M′ 12/15 · 弃权 7/22
覆盖项准确率 90.0%
⚠️ 仍误收 3 个 M′ —— 误解被固化是最该压低的错误,未解决
★ 弃权的正当性检验(关键):被弃权项的 AUC = 0.551 ≈ 随机
→ 门弃掉的正是它本来就判不了的,不是在丢信号
这让弃权从"逃避"变成"有依据的判断"
回改:
· 机制文档 §1.4 毕业判据从二态升级为三态(ACCEPT/REJECT/ASK),
失败模式 8(基座无能力)标为"已解决为机制"
· 全景文档 §1.3 流水线补充:环节②应含元判断"判不判得了",
指出现有所有方案的门都是二态的、没有"弃权"这一态
Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
· 机制文档:状态行更新为「判据已升级为三态门」;失败模式 8(基座无能力) 标为「已解决为机制」——σ_null 可判定性闸门可检出并弃权 · 全景文档 §1.3:流水线环节② 补充元判断「这条经验我判不判得了」, 并指出现有所有方案的门都是二态的、没有「弃权」这一态 · 全景文档 §7:补三态门实测结果与三层架构中的位置 Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
第五轮调研(上下文蒸馏/模型合并/知识蒸馏/检索增强/自我改进/睡眠期/
参数化知识库)回填完成,A–P 全覆盖,文档 631 行。
🔴 证据等级警告(已在文档顶部与 §3 前置声明):
第五轮的 Verify 与 Synthesize 阶段未执行完(工作流在 Fetch 后中断,
输出文件为空),130 条主张未经 3 票对抗验证。
J–P 全部标 🔍,与 A–I 的 ✅ 不可混用。
★ 最重要的一条:撤回原 §4 结构性事实 1
原文:「推理期写入」与「跨会话持久」在任何一行都不同时为 ✓,是最干净的结构性空白。
实况:家族 J(上下文蒸馏)恰恰填上了这一格;其中 Generative Adapter
(ICLR 2025)更做到 单次前向写入 × 跨会话 × 天然按用户隔离。
修正后仅保留弱版本:该格在纯架构层 A–I 内为空;J 靠额外离线蒸馏步/摊销 hypernet。
(这条风险在上一版 §8 待办里已预警,现应验并如实撤回。)
★ 但定位反而更强:J/J′/O 三族「有完整内化管线、唯独没有准入门控」
→ 贡献声明从「提出新架构」收紧为
「给一个已跑通的内化管线补上它唯一缺的器官:无需标准答案的正确性门」
→ 不必自证管线可行(J 族已证),只需证明「加门比不加好」
→ 2605.26099 的调研记录直接点出「这个无门控正是压缩增益门可插入的位置」
新增两条必须处理的风险(已写进 §7 与 §8):
1. 内化不幂等(When Context Returns, 2606.11627):把原始 context 重新塞回
已蒸馏模型,性能反而变差,甚至在它本已答对的样本上退化。
本项目正是「引用→内化」系统,必须测;已知轻量修复 = stop-gradient
anchoring + forward KL 一致性正则。
2. 迭代内化的 progressive capability collapse(2606.04703);
缓解线索 principle-level > instance-level、step-wise > global。
一条理论正面支持:Sharpening 机制(ICLR 2025)证明自我改进不可能创造
模型中原本不存在的信息 → 新知识必须来自外部证据 → 从理论侧确认本项目
「新概念必须在引用中从对话者处获得」的问题设定是对的。
其他要点:M 族给出「何时写进权重」的判据双轴(规模轴标度律 + 长尾流行度轴);
K 族 task vector 取负提供了罕见的可逆性,但崩塌是任务对固有属性且有解析上界;
N 族模型坍缩需连边界条件引用(替换式才坍缩,累积式不坍缩);
P 族 LMLM 的损失掩码即准入门,且支持 instant forgetting。
新增附录 J(J–P 文献表,全部 🔍)。
Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
3B 下载完成,路线图第 2 项解除阻塞并跑通。结论与我方预测相反。 预测(由 ρ(能力探针,margin)=+0.857 导出):放大基座应同时提升 margin、 判别质量、全局可分性。 实测(22 items,同材料同代码,均 bf16): margin +4.08 → +16.82 (涨 4×) ✅ M 胜出 19/22 p=0.00043 → 15/22 p=0.067 ❌ 不再显著 AUC(z) 0.857 → 0.738 ❌ → margin 大 ≠ 判得准,二者不是一回事 分类型显示两种失败模式对缩放反应相反: G4 论元顺序 0.562 → 0.812 ✅ 改善(原最差项,"没有信号"型失败确实随规模缓解) G1 合取 0.861 → 1.000 ✅ G5 绝对/相对 0.812 → 0.000 ❌❌ 彻底翻转(4/4 全判反,margin −21.70) ★ 新错误类型 E5「条件化失败」: G5 的实例措辞 "next to Y" 提示比较读法;3B 模型即使被明确告知 "该词指绝对大"仍按比较读法作答 —— 模型没有忠实条件化于给定定义, 先验压过了定义。而先验强度随规模增长 ⟹ 该失败模式越大越糟。 与 E1–E4 的区别:E1 是模型的假设错;E5 是假设对但模型不按它行动。 测量效度含义:ΔNLL 实测的是「(模型先验 ⊗ c) 解释数据的程度」,不是 c。 ★ 三态门接不住 E5(弃权机制的盲区): G5 的 σ_null 均值 6.94(不低)、z(M′) 均值 +3.52(强离群) → 模型是「自信地判反」而非「判不了」,可判定性计读出的是「可判定」 → 「不可判定」≠「自信地错」,σ_null 只能检出前者。当前最大未解决问题。 方法学注记:能力探针在 3B 上饱和失效(落差 +0.297→+0.058,6/8→1/8; ρ 0.857→0.310)。它是两个趋近 1 的概率相减 —— 这不是能力瓶颈结论被推翻, 而是该仪器在 ≥3B 不再可用;σ_null(离散度)更稳健。 必须声明的混淆:G5 把对照物写进实例本身,本就提示比较读法。但真实对话 总是带框架的,故这是真实的测量效度问题,不能仅当作材料瑕疵;两种解释都报告。 机制文档:新增 E5 行与前置条件 3(模型必须能忠实条件化于候选概念)、 失败模式 10。候选解法方向:忠实性探针(在定义能给出平凡确定答案的实例上 检查模型是否遵循 c)。 Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
按计划做了两件事:验证仪器、试 E5 的候选解法。两个结果都是负面的,
其中一个纠正了我上一条提交里的结论。
1. P0h 仪器有效性检查(下 E5 结论前的前置验证)
· 平凡常识题:raw 6/6、chat 6/6 → 仪器正常,E5 不是格式假象 ✅
· 但伪词+定义的平凡应用 3B 仅 4/6:
"kirel means red" + "Is a red box kirel?" → p(yes)=0.000(以概率 1.0 答 No)
→ E5 比 §6c 原先归因的「framing 提示比较读法」更广:
3B 连无任何框架的单属性平凡应用都会失败。
2. P0i 忠实性探针 F(c) —— 我提的方案,失败
构造「答案由候选定义单独蕴含」的平凡实例(GT-free 成立),
F(c) = p_yes(蕴含Yes) − p_yes(蕴含No)。
预测判错的 AUC:F_min 1.5B 0.895 / 3B 0.533(≈随机)
σ_null 1.5B 0.965 / 3B 0.905
→ 两个规模都不如 σ_null,3B 上退化到随机。假设推翻,不采用。
(细节:3B 的 G5 上 F(M)=0.403 < F(M′)=0.768,模型对错误读法反而更忠实,
与先验压过定义一致;但 F_min 聚合后挑不出这类项。)
3. ★ 纠正上一条提交里的过强结论
上次写「σ_null 是盲的、接不住 E5」。数据不支持:
判错的 7 项 σ_null 均值 6.72 vs 判对的 15 项 13.06
σ_null 预测本项会不会判错的 AUC = 0.905
→ σ_null 对 E5 并不盲,它在失败项上系统性更低。
→ 真正坏掉的是阈值跨规模不可迁移(3B 的 σ_null 约为 1.5B 的 4 倍,
1.5B 调好的 τ_dec=1.5 在 3B 上无意义)。
→ 这是校准问题,不是盲区;修法应是把 σ_null 无量纲化,而非另找信号。
限制清单相应更新(第 10/12 条),并把失败的 F(c) 存档以免重复劳动。
Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
失败模式 10 与前置条件 3 更新: · σ_null 对 E5 并不盲(判错组 6.72 vs 判对组 13.06,AUC 0.905) · 真问题是阈值跨规模不可迁移(3B ≈ 1.5B 的 4×)→ 需无量纲化 · 忠实性探针 F(c) 已试且失败(3B AUC 0.533≈随机),标注不采用以免重复 Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
§6d 定位出真问题是阈值跨规模不可迁移(3B 的 σ_null ≈ 1.5B 的 4×)。本次解决。 测了 6 种归一化,双标准:A 组内 AUC 不降;B 1.5B 选的阈值直接用到 3B 仍有效。 结果: raw AUC 0.965/0.905 迁移❌(3B 全保留,无弃权效果) /base AUC 0.965/0.724 迁移◐ ← 我事先按量纲推理看好的,实测失败 /|mu| AUC 0.667/0.743 迁移✅ ← 但组内 AUC 太低,判为噪声,不推荐 rank AUC 0.965/0.905 迁移✅ ← 采用 ★ rank 是对的,且有构造性论证而非拟合: · rank 是 raw 的单调变换 ⟹ 组内 AUC 与 raw 完全相同,判别力分毫不损 · 分位数天然无量纲 ⟹ 跨规模可比 两点都是构造性质,不是在 22 样本上碰巧拟合出来。 覆盖/准确率权衡在两个规模上都单调(信号良态的标志): τ=0.19 → 1.5B 18/22 100% | 3B 18/22 77.8% τ=0.40 → 1.5B 13/22 100% | 3B 13/22 92.3% τ=0.60 → 1.5B 9/22 100% | 3B 9/22 100% (3B 不弃权基线 68.2%) 🔴 但这没有解决 E5:3B 上 τ=0.19 弃掉的 4 项里只有 3 个是真错误; 7 个错误中 G4-01/G4-04/G5-01/G5-02 未被抓住——G5 的 E5 错误多为中等 σ_null。 ⟹ 校准问题与 E5 问题是两个独立问题,§6d 把它们混在一起了,本节分开。 部署代价:rank 需要一批候选才能算分位(同轮候选池或滚动窗口), 必须写进论文。 Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
第六轮的正式 Verify(3票) 阶段未跑完,但抓取代理完成了 pdftotext 全文穷举 +
关键词逐条核查。据此引入中间证据等级 ✅ᶠ(全文穷举级,强于 🔍 弱于 ✅)。
★ 确认(✅ᶠ 全文穷举)——立论支点在「已实现方法」层面成立:
· Generative Adapter (ICLR 2025):21 页 camera-ready、136KB 全文,
admission/admit/filter/criteri*/threshold/verif*/trust/confiden*/reliab*/
surpris*/salien*/discard/relevance/importance 命中全为 0;
近似命中逐条证伪——gate 唯一命中是 'aggregated' 子串,gating 是 'investigating' 子串
· Cartridges:Algorithm 1 是裸 chunk→seed→sample 循环,每条生成对话直接进训练集;
损失为纯 KL 上下文蒸馏,无正确性/事实性/置信度项;38.6×/26.4× 数字准确
· Cartridges at Scale:12,094 词穷举 gate/admission/novelty 均 0
★★ Appendix J 提供「凡进上下文即写」的直接铁证:9 个 FinQA cartridge 的
688 个唯一数字中仅 41% 有原文依据,纯粹捏造占 9%(n=62),全部被无差别写入
🔴 改正 4 处错误:
1. LMLM 不是 NeurIPS 2025 主会 → 是 CCFM workshop Oral;
且 v3 已更名 Large → Limited Memory Language Models(沿用旧名会检索错配)
2. LMLM「损失掩码即准入门」是范畴错置 → 掩码是训练目标;真正的写入过滤器是
标注管线的 Corrector(按损失丢弃 top-10%,判据=格式合规+上下文可推得性,非正确性)
3. Sharpening「自我改进不可能创造新信息」不是该文定理 → 是动机性前提,
正文归因于 data-processing inequality (Cover 1999)。引用须改归因。
但适用范围核查对我方有利:论文显式限定「无外部反馈」自采样设定,
故不能外推到「有外部证据进入上下文」,我方推论仍成立。
4. Generative Adapter「全程无梯度」不准确 → 仅测试期;生成器 G 需离线自监督预训练。
「省 4×」必须连代价一起报:F1 66.0 → 40.2(相对下跌 39%),只报 4× 是误导。
🔴🔴 优先权风险(对本项目最重要):
arXiv:2607.08032 "What to Keep, What to Forget: A Rate–Distortion View of
Memory Compaction"(Colaco & Lahjouji, 2026-07-09)
· 有利:独立佐证我方否定性支点(该文 49 次 gate 命中全是架构门控单元,
admission/verify/correctness 全 0;断言各层保留信号一律是注意力幅度或时近性)
· 不利:其开放问题已提出基于边际任务条件信息量 I*(Q) 的写入准入判据,
与压缩增益/MDL 门在动机与形式上高度同构
→ 裁决:已实现方法层面支点仍成立(该文未实现、未实验),但已被提出层面被占位
→ 贡献声明收紧为「尚无方法【实现并实证】基于压缩增益的写入准入门控」,
并把 2607.08032 作为 concurrent position work 正面引用
→ 这是继 SAGE 之后第二次有工作逼近本项目位置,且这次在信息论形式上更近
Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
汇总 2026-07-24→07-31 的全部工作,作为 PR 的主文档。 结构:研究问题(四性质 P1–P4) → 方法(6 轮对抗调研 + P0–P0j) → 主要发现 → ★被推翻或收紧的我方主张(10 处) → 当前状态 → 下一步 → 产物索引。 核心结论: · 定位:空白在「门控信号的类型」而非「有没有门控」;十类代理占满, 「无 GT、无外部 oracle 的概念级正确性」一列为空 · 实证:压缩增益门成立(22 items,19/22,p=0.00043),但【压缩什么】 比【用什么判据】更关键——观测量必须是用词决策序列而非自由陈述(7.2×) · 三个前置条件(原设计全漏):观测量要对 / 基座要有能力 / 基座要肯照做; 条件 2 与 3 对缩放的反应相反 ⟹「放大模型」不是通用解药 · 三态门 + 弃权正当性(被弃权项 AUC 0.551≈随机)+ rank 跨规模校准 同时把贡献声明按第六轮的优先权风险做最终收紧: 「尚无方法【实现并实证】基于压缩增益的、GT-free 且无外部 oracle 的写入准入门控」 并把 arXiv:2607.08032 作为 concurrent position work 正面引用。 Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
第七轮收窄到 8 篇后 Verify 阶段成功执行(103 agent,105 主张 → 25 验证 →
18 确认 7 否决;5 个 agent 因 API 断连出错)。
🔴🔴 立论支点的绝对表述被证伪(第二次被推翻):
arXiv:2606.03979 的 Dreaming 阶段有两道真实的写入前筛选——
(a) 梯度重要性 Top-k 拒采(ARC 上「每任务采 60 条 dream、拒 45 条」;
消融去掉后 SQuAD 48.9/46.2 → 47.1/45.2)
(b) 继承自 SEAL 的二值奖励 r={1 if improves, 0 otherwise}
但两者判据均为【可学习性/效用】而非正确性/事实核验;
且 τ 只在 ReST-EM 训练期塑形生成器,部署写入环节不施加过滤。
⟹ 声明第三次收紧为「尚无方法【实现并实证】以压缩增益/MDL 为判据、
GT-free 且无外部 oracle 的写入准入门控」。
🔴 改正我方两处实质错误(均在 2605.26099):
1. 作用域:N 次 pass 作用于当前窗口 chunk(L=24 tokens),
不是「整个累积上下文」
2. 定性(更严重):其 fast weights 是 SSM 定长递归状态 S、每序列零初始化,
不是跨会话持久的模型参数(permanent=0/cross-session=0/continual=0)
⟹ 我方原先称其「把睡眠期落到权重上」是错的,已撤回;
不可与真正写权重的 P 族并列为持久化证据
✅ 新确认(3 票):
· Sleep-time Compute 不写权重(LaTeX 级 weight/gradient/LoRA/SGD 全 0;
模型全为闭源 API 结构上无法写权重;repo 无 torch/peft),数字 5×/+13%/+18% 属实;
唯一写入规则是新近性+似然,参考实现为无条件覆写
· LMs Need Sleep 两阶段与摘要关键句逐字属实;第一阶段确无准入判据
(forget*=13 全是 catastrophic forgetting、零个 forget gate;
surpris*=1 仅 "Surprisingly" → 不存在 Titans 式 surprise 度量)
⚠️ 两条措辞纪律:
· 不得由「论文不假设 oracle verifier」推出「因此不可能有正确性门控」
(该强推论被三次独立否决 0-3×3)
· Sleep-time Compute 的仓库层提示词含 "remove calculations that are not useful"
与 "checked that there are no errors" —— 可被审稿人当反例,避免绝对句
🔴 最高优先未决线索:GATES (stein2026) 的 consensus-gating 按多条 tutor trace
一致性门控学习 —— 一致性是无需 GT 的正确性代理,直接落在我方主张位置上,
若属实需再次收紧。SEAL 同样待查。
❗ 覆盖缺口:J 族 3 篇 + P 族 2 篇本轮无一条主张通过验证,仍仅摘要级,
相关事实明确标注为「不得写入论文」。
核查 SOP 已沉淀:子串误报清单(LoRA⊂exploration、gating⊂backpropagating 等)、
词边界+substring 双跑、arXiv HTML 曾返回错篇故须用正文水印校验身份。
Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
· 自我推翻清单 10 → 12(新增:支点绝对表述被证伪、Do LMs Need Sleep 的 fast weights 非持久参数) · 贡献声明的三次收紧过程做成表格,给出当前唯一可辩护的措辞 · 新增 GATES/SEAL 最高优先未决线索 · 未解决表补充 J/P 族剩余 5 篇仍仅摘要级(明确标注哪些事实不得写入论文) · 方法学自评补充第七轮沉淀的核查 SOP(子串误报清单、双跑校验、 arXiv HTML 返回错篇、不得过度外推 oracle 免责句) Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
第七轮 3 票验证结果(PR 已更新)前两轮的 Verify 阶段都卡住没跑完,这轮把范围收窄到 8 篇后成功执行(103 agent,105 主张 → 25 验证 → 18 确认 7 否决)。 🔴 立论支点的绝对表述被证伪arXiv:2606.03979(Language Models Need Sleep)的 Dreaming 阶段有两道真实的写入前筛选:
但两者判据都是【可学习性/效用】,不是正确性/事实核验。 贡献声明因此第三次收紧:
🔴 同时改正了我方两处实质错误(都在 2605.26099)
✅ 新确认(3 票 + 全文穷举)Sleep-time Compute 不写权重:LaTeX 源码级 🔴 下一轮最高优先:GATES2606.03979 点名 GATES 用 consensus-gating「按多条 tutor trace 的一致性门控学习」——一致性是无需 GT 的正确性代理,直接落在我方主张的位置上。若属实需再次收紧。 ❗ 覆盖缺口(已在报告中明确标注)J 族 3 篇 + P 族 2 篇无一条主张通过验证,仍仅摘要级。相关事实(Snell 的"不需 GT"、SPIDER +9%、OPCD 机制、Memory Grafting 数字等)明确标注为不得写入论文。 自我推翻清单从 10 条增至 12 条;另沉淀了一套核查 SOP(子串误报清单如 |
Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
窄范围 5 篇,Verify 成功执行(100 agent,90 主张 → 25 验证 → 21 确认 4 否决)。
我方预判「GATES 有相当概率构成反例」应验。
★ GATES = arXiv:2602.20574v1 (Stein/Huang/Goldstein, UMD, 2026-02-24)
三源互证(PDF 水印 + LaTeX e-print + HTML),确认为 GT-free 二值写入准入门:
· 判据 = k=8 条 tutor rollout 答案一致度 ≥4/8;未过门者
"contributes zero loss across all objectives"(整体丢弃)
· 数学确证是硬性准入而非降权:g_i·e_{i,j} 同时在 Eq.1 分子与归一化分母中
→ 被门掉的项从分母消失
· 作者自陈 "agreement… as a proxy for correctness"、
"no external teacher or reward model is involved"
· 亲自划界 "it decides when to distill, not what to answer"
· 消融:去掉共识门 → student 54.0% / benchmark 31.1%
🔴 且非首创:LMSI (2210.11610, 2022) 早已用多数投票筛选自训练数据,
明言 "we do not use any ground truth labels to filter";
GATES 自认 consensus filtering 是 "well-established"。
⟹ 「GT-free 正确性代理 + 准入门控」这一轴彻底失守,不得再主张新颖性。
✅ 但我方在另外两轴存活,新颖性重量全部转移过去:
(i) 判据类型:全族 MDL/description length/compression 词边界命中 = 0
(compression 唯一命中在参考文献;bits 是 exhibits 子串)
(ii) 门控环节:GATES 门作用于训练期数据/梯度准入、固定预生成题集;
我方作用于推理期按对话者隔离的持久写入
❌ SEAL 不构成反例:奖励需每 context 配带 gold label 的 τ,论文 Limitations
自述 "prevents RL training of SEAL from scaling to unlabeled corpora";
且筛选在生成器 RL 训练期,部署写入期无条件聚合应用、完全无门。
✅ Snell 2209.15189 确认为「无门」最近邻:LaTeX 源码级确认目标函数是纯嵌套
期望,无指示函数/阈值/门控项;穷举扫描全零。
⚠️ 但其机制细节描述被 0-3 否决、"SPIDER +9%" 未获核实 → 均不得引用。
★ 一条对我方有利的反向证据:arXiv:2607.08065 大规模审计
(53 runners × K=50 × 265,000 samples)显示一致性只是弱预测子
(Spearman ρ 0.20–0.59),高一致的 gpt-4.1 在 GPQA 上仍 48% 出错,
"Self-consistency is not accuracy… unreliable as a standalone confidence score"
→ 可论证一致性类信号 ≠ 压缩类判据,且共识门控的代理效力本身存疑。
三条硬性禁令已写入文档:
1. 不得再写「尚无 GT-free 的写入准入门控」
2. 不得保留「无外部 oracle」作为独立卖点(攻防上得不偿失)
3. 用「写入」必须带 scope 注解(推理期/持久/按条)
最终措辞(摘要版 + Related Work 收口版)已定稿写入 REPORT §4。
自我推翻清单 12 → 13 条。
剩余最大风险面:Prompt Distillation (2412.14964) 与 OPCD (2602.12275)
两轮均未通过验证,若任一含 GT-free 写入侧筛选,声明仍可能被推翻。
Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
1. §3.1「无 GT 的概念级正确性一列为空」已被第八轮 GATES 推翻 → 就地标注 并给出修正后的空白(判据类型=压缩/MDL + 门控环节=推理期持久写入) 2. 自我推翻表第 12/13 条顺序修正 3. 周期更新至 2026-08-01 Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
第八轮:GATES 确认为反例 —— 贡献声明第四次收紧(定稿)上一条评论里我预判「GATES 有相当概率构成反例」。应验了。 🔴 GATES 是一个 GT-free 的二值写入准入门arXiv:2602.20574v1(Stein / Huang / Goldstein, UMD)—— PDF 水印 + LaTeX e-print + HTML 三源互证:
且非首创:LMSI(arXiv:2210.11610, 2022)早已用多数投票筛选自训练数据,明言 "we do not use any ground truth labels to filter"。GATES 自己承认 consensus filtering 是 "well-established"。 ✅ 但我方在另外两轴存活 —— 这反而让 delta 更精确
❌ SEAL 不构成反例奖励需每个 context 配带 gold label 的 τ;论文 Limitations 自述这 "prevents RL training of SEAL from scaling to unlabeled corpora"。且筛选在生成器 RL 训练期,部署写入期无条件聚合、完全无门。 ★ 一条对我方有利的反向证据arXiv:2607.08065 的大规模审计(53 runners × K=50 × 265,000 samples):一致性只是弱预测子(Spearman ρ 0.20–0.59),高一致的 gpt-4.1 在 GPQA 上仍 48% 出错 —— "Self-consistency is not accuracy… unreliable as a standalone confidence score." ⟹ 可论证:一致性类信号 ≠ 压缩类判据,且共识门控的代理效力本身存疑。 🚫 三条硬性禁令(已写入文档)
最终措辞(摘要版 + Related Work 收口版)已定稿写入 REPORT §4。 自我推翻清单 12 → 13 条。剩余最大风险面:Prompt Distillation (2412.14964) 与 OPCD (2602.12275) 连续两轮未通过验证——若任一含 GT-free 的写入侧筛选,声明仍可能被推翻。 |
2412.14964 (Prompt Distillation) 与 2602.12275 (OPCD) 连续两轮(七、八)无一条 主张通过验证,是唯一未闭合的风险面。本轮取得两篇全文(水印校验 v2/v2), 11 条主张 × 3 独立对抗验证者 = 33 票,全部 3-0 确认: ★ 决定性结论:两篇均无 GT-free 的写入侧准入筛选 - 2412.14964:完全无筛(30+ 关键词词边界+substring 双跑穷举零命中; gate/gating 9 个 raw 命中全为 mitigate/investigate 子串误报)。噪声答案 不过滤,靠高温软标签蒸馏吸收。附录 K 的五分位分组是诊断性消融,非管线筛选 - OPCD:唯一筛选「filtered EKD」在 1000 道带 GT 的 math validation / 环境 得分上打分取最高 → 判据=任务表现,需要标签/oracle,非 GT-free;其明确 GT-free 的 test-time 设定随机选取,自述 "quality … not pre-evaluated" ⟹ 第八轮定稿贡献声明维持原文;OPCD 反而构成空白存在性的直接文献锚点 同轮确认(解禁,可按收紧措辞写入论文): - 2412.14964:teacher=同一模型带文档 prompt、LoRA 翻转切换角色、训练无 GT、 无更强 teacher(更大 expert 反因风格失配变差) - OPCD:reverse KL + on-policy 机制、两应用(experiential/system prompt) 新增 2 处我方转述收紧(REPORT §4 #14/#15,总数 13→15): - 「PD 多规模超过 RAG」→ 纯闭卷仅 Squadshifts/Llama-8B 追平;「超过」依赖 PD+RAG 组合或 PD XL;HotpotQA 上 RAG 对纯闭卷 PD 全面占优 - 「OPCD 更好保留 OOD」→ 边际(+0.1~+0.5,std 内;对 base 持平或微降), 且 checkpoint 按 test accuracy 挑选,数字受通胀 文档同步: - REPORT.md:8→9 轮、§2 加第 9 行、§4 加第九轮小节+2 收紧、§5 风险表 两行合并为一行(仍禁写:Snell/DyPRAG/Memory Grafting)、§6 推进到 改写 Intro/Related Work → P1/P2、SOP 误报清单补 gate⊂Bagatella - RESEARCH_KNOWLEDGE_INTERNALIZATION.md:J 族两行 🔍→✅(带收紧措辞)、 准入门控行改为核实后表述、§8 勾掉 GATES 与两篇核查项、附录 J 更新 - r9/verification.json:33 票原始裁决+逐条证据引文+PDF md5,供审计 Co-Authored-By: Claude Fable 5 <noreply@anthropic.com>
第九轮定向验证 — 最后风险口闭合 ✅(commit 3d417c8)只查两篇(连续两轮未通过对抗验证的最大风险面):2412.14964(Prompt Distillation)与 2602.12275(OPCD)。全文级(PDF,水印校验 ★ 决定性问题:有无 GT-free 的写入侧准入筛选?——都没有
⟹ 第八轮定稿贡献声明维持原文,免于第五次收紧。 OPCD 反而构成反向支持——它把 GT-free 部署场景明确留在「质量不预评」状态,可在 Related Work 中直接引作空白存在性的文献锚点。 同轮确认(两篇解禁,可按收紧措辞写入论文)
新增 2 处我方转述收紧(§4 #14/#15,自我推翻总数 13 → 15)
状态与下一步
🤖 Generated with Claude Code |
一、第十轮验证(5 篇全文 / 17 主张 / 51 票):仅摘要级清零 - Generative Adapter 2411.05877v1:单次前向机制+无门+数字全确认; 但「天然按用户隔离」被收紧(1C/2CORR)——论文无 isolation 一词、无跨用户 测试,跨会话复用也是架构性而非纵向演示 → REPORT §4 #16。 反而保住我方 P4 空间:「按对话者隔离并实测无泄漏」仍无人做 - When Context Returns 2606.11627v1:内化不幂等升级为 ✅(7/12 设定退化; 修复 NCA 11/12;scope=仅系统提示/游戏脚手架,未测文档) - Snell 2209.15189v1:七轮 0-3 悬案解决——机制精化(token 级 KL 到冻结 自身副本,非硬标签微调)+「SPIDER +9%」精确化(8-shot 比 GD 基线 +9.0 点, 非对 teacher) - DyPRAG 2503.23895v4:我方「多文档 LoRA 平均互相干扰」系误读,如实改正 (REPORT §4 #17)——论文称平均有效整合,衰退归因无关冗余+有损压缩 - Memory Grafting 2605.20948v1:定性修正为预训练容量扩展方法;写入侧仅 频率覆盖筛选(质量盲),非正确性门 - 自我推翻总数 15→17;无一篇含正确性写入门 → 空白声明再获确认 二、Introduction / Related Work 投稿草案 v1(paper/DRAFT_INTRO_RELATED_WORK.md) - 按第八轮定稿措辞:GATES/LMSI 正面让位、OPCD "not pre-evaluated" 作 空白锚点、E1/E2 划界、三条禁令全稿自查表 + 措辞红线速查 - RESEARCH doc §9.3.1 旧 C1 与 §9.3.2 旧段就地标注已被推翻/替代 三、两个内化风险写进实验设计 - DESIGN_COMPRESSION_GATE §3 新增失败模式 #11(内化不幂等,✅)与 #12(迭代坍缩,🔍 2606.04703 引用前须 3 票) - DESIGN_CONCEPT_BENCH §7 新增指标 8(重现幂等性)与 9(迭代巩固坍缩曲线, gate-on vs gate-off——若推迟坍缩即门价值第二论据) 四、P1 构造语言生成器脚手架(research/learning-in-referencing/p1/) - lexicon(CV(C) 音系+阻断表+编辑距离;分词器/探针钩子留待模型环境) - microworld(13 kind × 4 色 × 3 尺寸 × 4 材料,4 范畴群) - gavagai G1-G5 程序化构造:教学集外延一致由构造保证,不变量测试全过 (T1 外延一致/T2 分离样例/T3 过滤/T4 确定性/T5 留出未见/T6 overspec) - 已生成 items_p1.json(40 items)+ isolation_p1.json(8 冲突词隔离对) Co-Authored-By: Claude Fable 5 <noreply@anthropic.com>
Co-Authored-By: Claude Fable 5 <noreply@anthropic.com>
P4「按对话者隔离」性质的实证。8 对冲突词(同一伪词、两位老师教互斥含义)
× 每对 8 条程序化留出决策,冻结 Qwen2.5-1.5B,零训练。
结果:
Q1 判别力(阈值无关 AUC)
分区(只含 A 的概念) 1.000 —— 8/8 对全部完美
共享(A+B 同时在场) 0.754 —— 6/8 对下降;最差 ISO-08 掉到 0.281(反向)
★ Q2 压缩门选对 A 的真实含义
分区 8/8 = 100%
共享 4/8 = 50% ≈ 随机
⟹ 没有分区,门就无法把概念归属到人——不是模型不行,而是信息上不可能:
两个互斥定义同时在场时,观测数据本身不含「哪个属于谁」。
⚠️ 三处必须说清的限定(已写入 p3/README.md §3):
1. 共享条件的门控比较是同样两句话的不同顺序,测的是「位置是否承载归属」
(答案:不承载),不得表述为「门在两个候选间选错」
2. 共享条件是强形式污染(互斥定义直接同处一境),不是 PersistBench 那种
隐蔽的自然泄漏——度量不同,勿与其 53% 直接比数值
3. 本轮是上下文级分区,尚未实现 product-key 记忆层的 uid 硬分区,
研究文档 §7.4 的「架构性零干扰」主张仍未实证
★ 方法学:又一次「先验仪器再下结论」救了结论
初版用 0.5 阈值算准确率得到 0.00 的假象;查证发现模型对陌生伪词谓词
有系统性 No 偏置(蓝色项 p_yes 0.245–0.349 vs 红色项 0.020–0.023,
判别信号强 14× 但绝对值全在 0.5 以下)。
这反过来佐证了机制设计:压缩门用连续 NLL 而非阈值化决策,不受该偏置影响。
(继 P0h 之后第二次。)
另修两个实现 bug:mw.entities() 是生成器被一次性耗尽(第二对起留出集为空);
0.5 固定阈值改为阈值无关 AUC。
Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
P3 冲突词隔离测试完成 —— P4 性质实证8 对冲突词(同一伪词、两位老师教互斥含义)× 每对 8 条程序化留出决策。冻结 Qwen2.5-1.5B,零训练。 结果
|
| 上下文 | 实例 | p(yes) |
|---|---|---|
komalor means blue. |
蓝色项 | 0.245–0.349 |
| 同上 | 红色项 | 0.020–0.023 |
判别信号强约 14×,但绝对值全在 0.5 以下。
这反过来佐证了机制设计:压缩门用连续 NLL 而非阈值化决策,不受该偏置影响——同一条 ISO-01 上"准确率 0.00"而门控 ✅。
(继 P0h 之后第二次。另修两个实现 bug:mw.entities() 生成器被一次性耗尽;固定阈值改为阈值无关 AUC。)
详见 p3/README.md。
下一步:product-key 记忆层 + uid 硬分区——把上下文级分区升级为架构性零干扰,这是 P3 唯一未闭合项。
流程:① 教学 → ② 门控裁决 → ③ 写入 uid 分区 → ④ 清空上下文 → ⑤ 新会话
仅从该 uid 分区加载 → 作答。16 位老师(8 对冲突词),冻结 Qwen2.5-1.5B,零训练。
结果:
② 门控 16/16;真含义领先对方含义 +9.92 nats(候选 4 选 1,含对方含义 + 2 干扰)
⑤ 新会话(上下文已清空)
none 不加载记忆 0.514 ← ≈随机,说明记忆确实必要
★ partitioned uid 分区 0.980
wrong_user 错用户 0.129 ← 远低于随机(两义互斥)
shared 无分区共享库 0.562 ← 均值有误导性,见下
结构性零干扰:跨分区命中 0/16
🔴 共享库的真实失效模式是「后写覆盖」,不是「两义并存」:
uA 先写 分区 0.984 → 共享 0.148(8/8 概念被彻底摧毁)
uB 后写 分区 0.977 → 共享 0.977(完好)
均值 0.562 是「A 被毁 + B 完好」的平均,不可读作整体退化,必须拆开报。
且这与 P3 的共享条件是不同失效模式(P3 两义同处上下文互相干扰;
P4 是存储层 last-write-wins)。
四条性质状态:P1 全新 ✅ · P2 无 GT 自验证 ✅ · P3 持久 ✅ · P4 隔离 ✅
⚠️ 三条必须说清的限定(已写入 p4/README.md §4):
1. 层级:这是 L1 外部记忆 + 检索纪律,不是 §7.4 提议的 L4 product-key
参数化记忆层(需训练)。按我方五判据,满足 I4 与隔离,但不满足
I1 免检索 / I2 组合性——仍是「知道有这回事」不是「学会了」。
论文中不得说成参数级内化。
2. 门控任务比 P2 容易得多(4 个互斥颜色、领先 +9.92 nats),
16/16 不可与 P2 核心域 AUC 0.915 相提并论。
3. 零干扰是构造性真理(键带 uid 前缀 + 按 uid 掩码),不是实证发现;
实证的是它复现了隔离行为、且两个对照确实劣化。
Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
P4 端到端闭环 —— 四条性质第一次在同一流程里同时成立16 位老师(8 对冲突词),候选 = {真含义, 对方老师的含义, 2 个干扰颜色}。冻结 Qwen2.5-1.5B,零训练。 结果
四条性质:P1 全新 ✅ · P2 无 GT 自验证 ✅ · P3 持久 ✅(0.514→0.980)· P4 隔离 ✅ 🔴 共享库的失效模式是「后写覆盖」,不是「两义并存」
|
接 DRAFT_INTRO_RELATED_WORK 的 §1–§2,补齐 §3–§7。英文正文 + 中文编辑注记体例。
结构:
§3 Method 3.1 观测量(决策序列而非自由陈述)+ 两部分 MDL + 安慰剂对照
3.2 零分布 z 校准 + 三态门(含弃权正当性与 rank 跨规模校准)
3.3 巩固与按对话者分区(明写 store 是 external)
§4 Setup 构造语言 + 污染控制双保险;★ gavagai 对(Quine 做成可控条件);
为何用阈值无关 AUC(No 偏置的实测教训)
§5 Results 5.1 三臂对照(核心域 0.915 vs 0.269)
5.2 ★ 失效机制:语义熵反向(0.137)或随机(0.507),从不正向
5.3 作用域:条件 2 与 3 对缩放反应相反,「放大」不是通用解药
5.4 隔离是正确性前提;5.5 端到端四性质同时成立
§6 Limitations 五条,与 REPORT §5 未解决表一一对应,无隐去
§7 禁令自查表 8 条逐条勾
新增两条禁令(本稿特有,已写入自查表):
4. 不得把 L1 外部记忆说成参数级内化
→ §3.3 明写 "this store is external",§6(i) 独立成条:
按我方五判据满足 I4 与隔离,但不满足 I1 免检索 / I2 组合性,
是「知道有这回事」不是「学会了」
5. 不得把 P4 门控 16/16 与 P2 核心域 AUC 0.915 相提并论
→ P4 是 4 个互斥颜色、领先 +9.92 nats,比 gavagai 对容易一个量级
其他已在稿内落实的口径纪律:
· 语义熵不得写成「≈随机」→ 用「反向或随机,从不正向」
· 三臂实际只有 2 个独立臂(数学等价,margin 差 5.55e-17),正文不宣称三臂
· PersistBench 53% 不直接比数值(度量不同)
· G5 是语义熵唯一有效类型(0.750),诚实报告未隐去
· 共享库 last-write-wins 的均值 0.562 有误导性,必须拆开报
Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
动机:20 处自我推翻散落在 12 份文档里,正文改了而附录表格没跟着改是最易漏的一类错误。 🔴 抓到 1 处真实残留(docs/RESEARCH_KNOWLEDGE_INTERNALIZATION.md 附录 J): LMLM 条目仍写「NeurIPS 2025」+「损失掩码即准入门」—— 这两条早在第六轮就已改正,但只改了正文、附录文献表未同步。 现已修正为:v3 更名 Limited Memory LM;NeurIPS 2025 CCFM workshop Oral(非主会); 掩码是训练目标而非写入准入判据,真正的写入过滤器是标注管线的 Corrector (按损失丢弃 top-10%,判据=格式合规+上下文可推得性,非正确性)。 其余 24 处命中经逐条复核均为正当引用(自我推翻表的「我方原主张」列、 四次收紧表的「被推翻的表述」列、两份草稿的禁令自查表——都是「为了禁止而引用」)。 已在四次收紧表上方加注:该列仅作沿革记录,不得用作行文措辞。 工具固化为 research/learning-in-referencing/tools/audit_retracted.py: · 11 条规则覆盖全部已撤回/已改正的主张 · 命中行若处在「撤回/改正/禁令/⚠️ /~~删除线~~/不写」等否定语境即放行 · 输出明确标注「放行 ≠ 正确,仍需人工复核」——它是提醒器不是判官 投稿前及每次新增主张后应重跑。 Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
论文正文初稿 + 投稿前一致性审计1. Method / Experiments 草案 v1接 Intro/RW 补齐 §3–§7(DRAFT_METHOD_EXPERIMENTS.md,英文正文 + 中文编辑注记):
新增两条本稿特有的禁令:
2. 🔴 一致性审计抓到一处真实残留20 处自我推翻散落在 12 份文档里,正文改了而附录表格没跟着改是最易漏的一类错误。写了个审计器扫全库:
已修正(v3 更名 Limited Memory LM;实为 CCFM workshop Oral 非主会;掩码是训练目标,真正的写入过滤器是标注管线的 Corrector)。 其余 24 处命中经逐条复核均为正当引用(自我推翻表的"我方原主张"列、四次收紧表的"被推翻的表述"列、两份草稿的禁令自查表——都是"为了禁止而引用")。已在四次收紧表上方加注:该列仅作沿革记录,不得用作行文措辞。 审计器已固化为 当前状态:11 轮调研(🔍 全清零)· 13 组实证(四性质端到端跑通)· 20 处自我推翻 · 论文 Intro/RW + Method/Experiments 初稿齐备。 剩余:3 张图表 + 正式 bibkey;L4 参数化记忆层(唯一需要突破零算力约束的一步)。 |
把 P4 的 L1 外部记忆升级为参数:冻结 Qwen2.5-1.5B,只训练 uid 分区的
product-key 稀疏槽;记忆挂最后一层之后,梯度不反传任何 transformer block,
单机 MPS 数分钟可训。
★ E1 免检索(判据 I1,P4 的 L1 方案不满足的那一条):
上下文完全不含概念陈述,仅靠参数——
无记忆 0.485 ≈ 随机 → 参数化记忆 0.992(+0.507)
用他人分区 0.260(远低于随机,两义互斥)
★ E4 顺序写入:分区 vs 共享(同等总容量 512 槽)
分区 1.000 → 0.992(最低 0.960)
共享 1.000 → 0.562(最低 0.000),第 2 次写入即崩至 0.520
🔴 但分区版的零退化是构造性的,不是实证发现:
梯度掩码 → 先前用户的槽根本没被碰到;实测「写入时 AUC」与「最终 AUC」
16/16 逐位相同。曲线 −0.008 漂移来自新用户自身分数差异,非退化。
⟹ 不得报作「稀疏记忆抗崩塌」。有意义的结论只有一条:
同等容量下分区防住了、共享没防住 —— 关键是分区,不是容量或稀疏性。
★ 过程中两次失败,均靠先诊断而非猜测定位(已存档以免重复):
1. 全词表 CE(151k 词表)稀释二元信号 → 记忆完全无效(三个条件 AUC 全同、
提升 +0.000)。修法:改为 BCE(logit_yes − logit_no)。
2. 原始点积路由塌缩 → 记忆退化为常量偏置。诊断:
· 线性探针训练 acc 1.000 → 信息在 h 里,不是设计点死
· 隐状态两两余弦 0.9937、‖h‖≈171.8、‖W_yes−W_no‖=1.11
· 被路由到的不同槽数 1/12 ← 决定性证据
修法:余弦归一化 + 温度 → loss 0.6377→0.0021、训练 acc 0.50→1.00、槽数 2/12
★ 一般性教训:提示只在细微语义处不同时,product-key 路由必须做余弦归一化。
⚠️ 限制:final-layer memory ≠ 中间层 product-key 层(缺深度组合性);
与 ROME/MEMIT 仍非同基准(判分口径与编辑粒度不同,且冲突词是最坏情况);
任务为 4 个互斥颜色而非 gavagai 难例;I2 组合性未验证(探针同源微世界)。
按五判据:达成 I1 + I4 + 隔离;I2 未验证,I3/I5 未测。
Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
一、REPORT 新增 §0 综合结论(可独立阅读的执行摘要):
0.1 一句话贡献 + 四次收紧的完整沿革
0.2 四条性质的实证状态 + 五判据(达成 I1/I4/隔离;I2 未验证)
0.3 三个可迁移的发现(不依赖本项目具体主张):
· 「压缩什么」比「用什么判据」更关键(+0.68 → +4.92 nats,7.2×)
· 自洽类信号被概念宽度系统性误导(M′更窄 0.137 / 不更窄 0.507,反向或随机从不正向)
· product-key 路由必须做余弦归一化(余弦 0.994 → 12 输入全落同一槽)
0.4 三条「差点犯的错」及各自被什么诊断项抓住
0.5 未解决清单
二、Method/Experiments 草稿并入 P5:
· §3.3 巩固改为分列 (a) External / (b) Parametric 两级实例化,
并把「余弦路由是必要条件而非实现细节」写进正文
· 新增 §5.5:免检索(0.485→0.992)+ 分区 vs 共享消融
· §6(i) 限制改写——原文「the store is external」已被 P5 部分推翻,
现改为「深度与组合性」:final-layer memory 缺深度组合,I2 未验证
· §4 评测口径修正:原写「no training of any kind」对 P5 已不成立,
改为「基座全程冻结、只训练记忆的 keys/values、梯度不过任何 transformer block」
· 禁令自查表 8 → 10 条(新增:分区零退化不得报作抗崩塌实证、不得声称已验证 I2)
· 禁令 4 改写:从「不得把 L1 说成参数级」改为「必须区分两个实例化」
Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
「被推翻的表述」列引用的是已作废的措辞,加 ~~删除线~~ 使其语义自明; §0.1 补上与 §4 一致的「仅作沿革记录、不得用作行文措辞」提示。 一致性审计现 0 处待处理。 Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
L4 参数化记忆完成 —— I1「免检索」达成,并证明是分区而非容量在防干扰这是唯一需要训练的一步(基座全程冻结,只训练记忆的 keys/values;记忆挂最后一层之后,梯度不反传任何 transformer block,单机数分钟)。 ★ I1 免检索达成 —— P4 的 L1 方案不满足的那一条上下文里完全没有该概念的任何陈述:
★ 顺序写入:分区 vs 共享(同等总容量 512 槽)
过程中两次失败,都靠先诊断而非猜测才定位
综合收尾REPORT 新增 §0 综合结论(可独立阅读):四次收紧沿革 · 四性质状态 · 三个可迁移发现 · 三条"差点犯的错" · 未解决清单。 Method/Experiments 并入 P5,并修了两处因 P5 而过时的表述:
禁令自查表 8 → 10 条。一致性审计 0 处待处理。 当前状态
下一步:验证 I2 组合性(跨域/跨属性探针);把 final-layer memory 上移到中间层(§7.4 原提案)。 |
跨域探针(概念 ⊗ 世界知识,答案从未被明说):
base 0.500 → L1 上下文 0.840 → L4 参数化记忆 0.949(+0.449,反超 L1 +0.109)
前置检查:base 对这些物体颜色的世界知识命中 1.00(否则实验无意义)。
🔴 推翻我方在 P5 §4 声明、并已写进 Method 草稿 §6(i) 的限制
「final-layer memory 缺深度组合性」——该断言从架构位置推测、从未实测。
保留的只有结构事实:不参与中间层表征计算。结构差异 ≠ 能力差异。
三条限定同时写清:
· base 跨域 0.500 是构造性的(冲突对对称,逐用户 [0.062, 0.938] 相互抵消)
· 只测了「概念 ⊗ 世界知识」;概念⊗概念 / 否定量化 / 多跳组合未测
⟹ 只能声称「与世界知识的组合成立」,不得泛化为「具备组合性」
· L4 为何反超 L1 是假说、未做消融,引用须标 hypothesis
同步:REPORT §3.9 + 自我推翻表 21 处 + 0.2/0.4/0.5/5/6/7 状态;
Method 草稿 §5.6/§6(i)/禁令 10;全景文档 L0–L5 表的 I2 列首次回填实证;
p5 README §1 与 memory_layer.py 的残留(审计器抓到);
审计器新增 #21 两条规则并重跑 → 0 处残留。
新增纪律:自己声明的「限制」也必须做实验——未测的限制和未测的优点一样不可信。
Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
P6 — I2 组合性:我方自设的限制被自己的实验推翻(自我推翻 #21)五判据里最后一条未验证的(I2 组合性)已测。前面所有探针都来自同源微世界——那测的是泛化,不是组合。 跨域探针要求两步组合:①
🔴 这推翻的是我方自己声明的限制P5 §4 写过「final-layer memory 缺深度组合性」,并据此在 Method 草稿 §6(i) 写入 "we do not verify criterion I2"。 ⟹ 新增纪律:自己声明的「限制」也必须做实验。未测的限制和未测的优点一样不可信。
|
| 判据 | 状态 |
|---|---|
| I1 免检索 | ✅ P5(0.485 → 0.992) |
| I2 组合性 | ◐ 部分成立 — 与世界知识 ✅;概念间未测 |
| I3 隐式触发 | 🔴 未测 |
| I4 跨会话持久 | ✅ P4/P5 |
| I5 抗干扰 | 🔴 未测 |
| (隔离) | ✅ P3/P4/P5 |
同步范围
REPORT §3.9 + 自我推翻表(20 → 21 处)+ §0.2/0.4/0.5/§5/§6/§7;Method 草稿 §5.6/§6(i)/禁令 10;全景文档 L0–L5 表的 I2 列首次回填实证;p5/README.md §1 与 memory_layer.py 的残留(由一致性审计器抓到);审计器新增 #21 两条规则并重跑 → 0 处残留。
换 torch/transformers 环境后重跑 P6 时发现的。逐用户跨域 AUC 16/16 完全复现
(0.949、0.840、0.992、1.000 逐位相同,torch 2.13 + transformers 5.14),
但前置检查那一行:
脚本实际打印 → red 3/4 · blue 3/4 · yellow 3/4 · green 2/4
平均 0.69 —— ⚠️ 世界知识不足,跨域结论受限
我写进文档的 → 平均命中 1.00 ✅
数字错,判据也错。判据错在**重犯了 P3 的 No 偏置坑**:模型对 Yes/No 题有系统性
No 偏置,16 个【正确】颜色配对里有 5 个 p_yes < 0.5,尽管与负例分得很开(负例低至
0.001)。改用本项目已确立的阈值无关 AUC → 0.891(red .958/yellow .917/green .854/
blue .833)。⟹ **P6 结论不变**,世界知识确实可用。
修正范围:p6 脚本改用 AUC 判据并保留 raw 命中率作为偏置证据;p6/README、REPORT §3.9、
Method 草稿 §5.6 的数字与判据;REPORT §0.4 加一行"差点犯的错"。
★ 结构性防复发:新增 tools/probe_metrics.py。P3 那次的教训写进了报告**但没有变成代码**,
于是第二次照犯。auc() 是判据,hit_rate() 只作偏置证据且注释里写明不得当判据。
Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
I2 的最后一格补上了。同一用户学两个概念(颜色+材质,各自独立教学), 探针问从未教过的合取句式 `Is X both w1 and w2?`: base 0.479 → L4 合并训练 0.889 → L1 上下文 0.986 (单概念策略上界 0.500) 前置检查:基座对真词的同句式合取 AUC 0.973;L1 min 0.986 ⟹ 任务本身可解 🔴 自我推翻 #22:初稿把单概念策略上界算成 0.500,实为 0.750 (负例"只中 w1"那半与正例在 w1 上同分布贡献 0.5,"只中 w2"那半被 w1 拒掉贡献 1.0)。 修法:判据拆成 conj|¬w2 与 conj|¬w1 两半取 min——单概念策略在此必 ≈ 0.5。 裁决线设错会把单概念策略误判成组合。⚠️ 自我推翻 #23:P5 的「分区解决了干扰」只对【跨用户】成立。 同一分区内顺序写第二个概念会冲掉第一个:0.951 → 0.590(Δ −0.361)。 ★ 修法来自诊断而非猜测(子区版失败后先查): · w1 的槽 values 最大改动量 0.00e+00 → 梯度掩码有效,槽分毫未动 · w1 探针 25% 的 top-4 落进 w2 子区 → **检索跨了区** ⟹ 分区必须同时作用于写入与检索。P5 之所以成功,正因为那里检索本来就按 uid 掩了。 双掩码后 Δ +0.000,且每概念只有 16 槽(< seq 的 32)⟹ 容量解释被排除。 🔴 但 Δ 0.000 是构造性的,不得报作"抗遗忘"。非构造性的只有两条: 只掩写入不够(−0.351 ≈ 不分区的 −0.361);修好它的那版容量更少。⚠️ 代价 —— 全景文档新增第二条张力:**可隔离性 ↑ ⟹ 组合性 ↓** 严格按概念分区保住了单概念(0.927, Δ 0.000)却把合取压到 0.653(合并训练 0.889)。 ⟹「顺序到达 + 强组合」目前无解,已写进 §6(i) limitations。 顺带修两个工具缺陷: · memory_layer 加可选子区掩码(P5 结果 JSON 逐字节相同,向后兼容已验证) · 审计器在子目录下会扫到 0 份文档却打印 ✅(假放行)→ 路径锚到仓库根 + <10 份即拒绝结论 Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
更正 + P7🔴 先更正上一条评论里的一个数字上一条我写「世界知识前置检查命中 1.00 ✅」。错的。 换 torch/transformers 环境重跑时发现,脚本实际打印的是: 我把脚本的警告当成了通过。 而且判据也错——重犯了 P3 的 No 偏置坑(16 个正确颜色配对里 5 个 p_yes < 0.5,尽管负例低至 0.001)。改用阈值无关 AUC:0.891。P6 结论不变,世界知识确实可用。 P6 本身在新环境下逐用户 16/16 完全复现(0.949 / 0.840 / 0.992 逐位相同)。
P7 — 「概念 ⊗ 概念」(I2 的最后一格)同一用户学两个概念(颜色 + 材质,各自独立教学),探针问从未教过的合取句式
自我推翻 #22:初稿把单概念策略上界算成 0.500,实为 0.750。判据必须拆成 🔴 自我推翻 #23:P5 的「分区解决了干扰」只对跨用户成立同一分区内顺序写第二个概念会冲掉第一个:0.951 → 0.590(Δ −0.361)。 修法来自诊断而非猜测——子区版失败后(Δ −0.351,几乎等于不分区)先查:
🔴 但 Δ 0.000 是构造性的,不得报作"抗遗忘"。非构造性的只有两条:只掩写入不够(−0.351 ≈ 不分区的 −0.361);修好它的那版容量更少。
|
| 判据 | 状态 |
|---|---|
| I1 免检索 | ✅ P5 |
| I2 组合性 | ✅ 两种形态(P6 ⊗世界知识、P7 ⊗概念);否定/量化/多跳/同属性内两概念未测 |
| I3 隐式触发 | 🔴 未测 |
| I4 跨会话持久 | ✅ P4/P5 |
| I5 抗干扰 | 🔴 未测 |
| 隔离 | ✅ 跨用户;◐ 用户内部需子区+双掩码,代价是组合性 |
顺带修了审计器一个缺陷:在子目录下跑会扫到 0 份文档却打印 ✅(假放行)→ 路径锚到仓库根,<10 份即拒绝给结论。
五判据最后两格。I5 ✅,I3 ❌,而后者的机制把前面所有结论统一了起来。
【I5 抗干扰 ✅】上下文塞进另一位老师的含义("in some dialects, w means …"):
base 0.545 → 0.033 ← 关键对照:base 没有概念,照单全收,答案系统性反向
L1 0.988 → 0.912 (−0.075)
L4 0.960 → 0.910 (−0.050) ⟹ 参数化比上下文注入更抗干扰
base 那一行证明了干扰确实有效——L4 扛住不是因为模型没读它。
【I3 隐式触发 ❌】不问定义、要求去用(二选一行动题,训练中没有的句式):
base 0.500 · L1 1.000 · 真词先验 1.000 · ★ L4 0.507 ⟹ 零迁移
🔴 判据在这里又错了一次:初版只报 accuracy(0.492),而伪词条件下模型 91% 选 A,
阈值法被偏置钉死在 0.5。这是 P3(No 偏置) → P6(前置检查) → P8(A 偏置) 同一类
仪器错误的第三次,且专为此抽出的 probe_metrics.auc 当时已 import、只用在了 I5 上。
⟹ 抽出工具还不够,判据必须在每个新度量上被显式选择一次。改 AUC 后结论不变,
但那是运气不是方法。
★ 机制(先诊断,不猜)—— 否掉了"检索没取到":
行动题 top-4 落在训练用过的槽的比例 : 0.750 ← 取到了
cos(m(h), W_yes−W_no) : +0.7926
cos(m(h), W_A−W_B) : +0.0027 ← 近乎零
两读出方向本身余弦 : −0.0265
‖m(h_act)‖ = 14.279 ← 不是太小,是方向不对
⟹ 记忆学的是"这个决策格式下往哪边推",不是概念。
★ P8b 回应显然的反驳「多训几种格式不就行了」——可证伪,测了:
训 F1 : F1 0.960 · F2 0.555 · F3 0.755(held-out)
训 F1+F2 : F1 0.902 · F2 0.795 · F3 0.645(held-out)
加训 F2 使 F2 +0.240,却让 F3 −0.110、F1 −0.058 ⟹ 换方向,不是累加。
更有力的是同序关系:只训 F1 时迁移量随读出方向余弦单调
余弦 1.000 → 0.960 · +0.1065 → 0.755 · −0.0265 → 0.555 ≈ base
⚠️ 只有三个点,同序而已,不得写成拟合出来的定律。
🔑 这条回溯限定了 P5–P7:它们的训练与探针全在同一个读出方向内。
P6 变的是表层内容、P7 变的是表层句式,读出方向都没变;P8 变的正是读出方向。
⟹ 精确主张只有一条:**概念能跨表层句式迁移,不能跨读出方向迁移**。
「泛化 ✅ / 组合 ✅ / 隐式触发 ❌」是同一条机制的三个侧面。
论文中每条结论都须带作用域「在教学所用的决策格式内」。
✅ 副产品:第一次给「中间层记忆」提供了实证动机(而非审美偏好)——
P5 曾错误声明的"缺深度组合性"已被 P6 撤回,现在有了正确版本且是测出来的。
⚠️ 但中间层版本未做,不得声称它能解决。
诊断脚本入库(p8/diag_i3_mechanism.py、p7/diag_subpart_failure.py);
审计器加 #24 两条规则;Method 草稿 §5.8 + §6(i) 重写 + 禁令 13–15;
全景文档 L0–L5 表的 L4 行 I3=✓ 加硬前提。
Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
P8 — 五判据最后两格:I5 ✅ / I3 ❌,且 I3 的机制把前面所有结论统一了I5 抗干扰 ✅上下文里塞进另一位老师的含义(
关键对照在 base 那一行:base 没有概念,那条注释是它唯一的定义来源,于是照单全收、答案系统性反向(0.033)。⟹ 干扰被证明有效,L4 扛住不是因为模型没读它。参数化比上下文注入更抗干扰。 🔴 I3 隐式触发 ❌ —— 干净的负结果不问定义,要求去用(二选一行动题,训练中从未出现的句式):
零迁移。 任务完全可解,参数化记忆没有任何效果。
★ 机制:不是检索失败,是读出方向
记忆学的是「这个决策格式下该往哪边推」,不是概念。 P8b — 回应「那多训几种格式不就行了」
加训 F2:F2 +0.240,但 F3 −0.110、F1 −0.058 ⟹ 换方向,不是累加。 比裁决更有力的是同序关系——只训 F1 时,迁移量随读出方向余弦单调:
🔑 这条回溯限定了 P5–P7
✅ 副产品:中间层记忆第一次有了实证动机P5 曾错误声明 final-layer memory「缺深度组合性」(已被 P6 推翻撤回)。现在有了正确版本,而且是测出来的:它只在输出层动手,学到的东西天然绑死在训练任务的读出方向上。 五判据最终状态
📌 |
fig1 判据类型 × M′ 宽度分层 —— 压缩增益 0.915/0.883/0.766 vs 语义熵 0.269/0.137/0.507 fig2 五判据 × 参数化 vs 上下文注入 —— I3 那一格灰底标 fails fig3 (a) 迁移量 vs 读出方向余弦 (b) 记忆插入位置(P9 跑完后自动补全) 🔴 出图时抓到一处会与正文打架的错:我先用了**配对胜率**,得核心域 0.958 / 0.208, 而正文引用的是**汇总 AUC** 0.915 / 0.269 —— 两个不同的统计量。 已改为与 p2_three_arm.py 的 report() 同一估计量,并加了闸门: 图上的核心域数值若与 p2 自己产出的 summary 差 >1e-6 即 sys.exit 拒绝出图。 分层口径与 p2/README §3.2 严格一致(M′ 更窄 = G1 合取 + G2 范畴层级)。 灰度可读,不靠颜色区分;单栏 3.3in / 8pt。 Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
⚠️ 本 commit 只落原始结果与脚本;**解释待 P9b 词绑定控制**(正在跑,见下)。 只训 F1 Yes/No,F2 A/B 与 F3 True/False 始终 held-out: 插入位置 F1(训练) F2 F3 跨方向均值 base 0.540 0.550 0.510 0.530 L1 定义进上下文 0.960 1.000 1.000 1.000 ★ L7 全位置 0.945 0.935 0.945 0.940 ◇ L7@last 0.820 0.565 0.600 0.583 post-norm(=P5–P8) 0.970 0.555 0.770 0.663 ✅ P8 的推论成立:中间层比 post-norm 高 +0.277,几乎追平上下文注入。 🔴 但控制条件否掉了「深度」这个解释:L7@last(同样在 L7、其上同样有 20 层去变换它, 只是**仅改最后一个位置**)只有 0.583,**比 post-norm 还低 0.080**。 ⟹ 增益来自**位置覆盖**——记忆必须改写**描述物体的那些 token** 的表征, 而不是在决策点上加偏置。没有这个控制,这条结论会被一句话打掉。 🔴 而这恰好打开一个新漏洞:既然它改写物体表征,它可能只学会了「给蓝色物体打标」、 根本没绑定到那个词。三种格式全过也解释得通。⟹ P9b 换词控制已启动, 在它出结果之前**不写任何「学到了一个概念」的结论**。 工程: · 正确性闸门 —— 批处理左填充必须显式传 position_ids,否则 rotary 整体移位; 实测与逐条前向最大 logit 偏差 8.77e-05、argmax 5/5,不过闸门即 sys.exit。 · 每条件即时落盘 + --preload 合并(上一轮中断白跑 99 分钟的教训), 合并时核验重算的 base/L1 与 preload 逐位相同(差 ≥1e-6 即拒绝)。 · 未测:L14/L21 深度曲线(单条件 ~99 分钟,本轮裁掉)。 fig3(b) 补全插入位置对比。 Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
P9 说"概念能跨读出方向迁移"。那个结论有个明显漏洞我自己去堵,结果堵塌了。
控制:训练完全不变,**只把提示里的伪词换成另一位用户的伪词**,其余一字不改。
插入位置 提示里的词 F1 F2 F3
L7 本词 0.945 0.935 0.935
★ 换成别人的词 0.930 0.895 0.935 落差均值 0.018
post-norm 本词 0.970 0.555 0.770
★ 换成别人的词 0.975 0.505 0.765 落差均值 0.017
⟹ **两个方案都不是"学会了一个词的含义",而是"给一类物体打了标"。**
L7 的跨格式迁移之所以成立,正因为被打标的是**物体表征**——任何读出格式都能读到它。
这与 P9 查到的"增益来自位置覆盖"完全自洽,但把结论的性质整个改变了。
🔴 波及范围:所有**每个用户只教一个概念**的实验(P5 I1、P6 I2⊗世界知识、P8 I5、P9)。
在那些设置里,「w 指蓝色」与「给蓝色物体打标」**在训练集上外延完全相同**——
梯度没有任何理由去关心那个词。**是实验设置欠定,不一定是方法的性质。**
★ 唯一可能的例外是 P7(每人两个词,同一物体在两词下标签不同,光打标不可能同时高分)。
P9c 正在直接验这一点(三档换词:本词 / 换成同用户的另一个词 / 换成别人的词)。
**在 P9c 出结果之前,不得写任何"学到了一个概念"的结论。**
工程:本轮把训练好的记忆存盘(P9 没存,导致这个控制不得不整个重训);权重不入库。
Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
P9b 之后剩一个可能的辩解:单概念设置**欠定**(一个词时"w 指蓝色"与"给蓝色物体
打标"在训练集上外延完全相同,那个词是常量、零信息)。P7 的两词设置是唯一例外——
直接测,全部针对 w1 的探针与 w1 的标签:
提示里用的词 F1 F2 F3
w1(本词) 0.785 0.505 0.695
★ 换成同用户的 w2 0.790 0.570 0.645
换成别人的词 0.790 0.515 0.675
own − within -0.005 -0.065 +0.050
(前置:w2 自己的探针 0.890 —— 两个词都"学会"了,不是没学会导致的)
⟹ 两概念也逼不出词绑定。
★ 机制诊断(diag_word_independence.py)—— 两个方案因**不同原因**失败:
L7 post-norm
m(h) 换词后余弦 0.99998 0.787
路由命中槽重合率 1.000 0.957
决策方向上的投影 — +1.690 → +1.047
★★【正例−负例】投影差 — +4.443 → +4.327(保留 97%)
L7 路由层面就看不见那个词。
post-norm 看得见词,但 AUC 只看排序,而判别分量保留 97% ⟹ 词只平移偏置。
🔴 我在这里差点得出相反结论:只看 m(h) 余弦 0.787 会判成"路由读到了词 ✅"。
是补了"决策方向上的正负例投影差"才发现变化分量与判别正交。
⟹「输出变了」不等于「行为变了」;度量必须对准被解释的那个量。
措辞处置:
· REPORT 顶部加最高优先级警告 + §3.12 + 自我推翻 #25
· p5/p6/p7/p8 四页 README 加降级横幅
· Method 草稿加 SCOPE CORRECTION + §6(0) + 禁令 16/17
· 审计器加 #25 两条规则(中英各一),并把 🔴 补进 ALLOW
· 能站住的只有:「为每位对话者写入一个持久的、按分区隔离的、与词无关的物体级偏置」
· 不受影响:压缩增益门(P0–P4,概念以文本存在、词是显式的)、按对话者隔离(P3/P4)
修法方向(全部未做,不得声称已解决):键取在**词的 token 位置**而非整段末位;
让**两个词在同一物体上给出相反标签**(P9c 方向对但强度不够——两词问不同属性,
一个"红或木"的分级标就能同时糊弄过去);显式的词条件路由。
Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
🔴 P9 / P9b / P9c — 我把自己整条参数化记忆线推翻了先是好消息:P8 的推论成立把记忆从输出层移到中间层,跨读出方向迁移成立。而且控制条件查清了真正的原因:
然后这条结论自己打开了漏洞,我去堵,堵塌了既然它改写的是物体表征,就可能只学会了「给蓝色物体打标」、根本没绑定到那个词。控制:训练不变,只换提示里那个伪词。
还剩一个辩解:单概念设置欠定(一个词时「w 指蓝色」与「给蓝色物体打标」在训练集上外延完全相同,那个词是常量、零信息)。P7 的两词设置是唯一例外——直接测,也不行:
前置:w2 自己的探针 0.890,两个词都"学会"了 ⟹ 不是没学会导致的。 机制:两个方案因不同原因失败
处置必须撤回:参数化记忆线不得写"学会了一个词 / 建立了一个概念"。
已落地:REPORT 顶部最高优先级警告 + §3.12 + 自我推翻 #25;p5–p8 四页 README 加降级横幅;Method 草稿加 SCOPE CORRECTION + §6(0) + 禁令 16/17;审计器加 #25 中英两条规则。 修法方向(全部未做,不得声称已解决):键取在词的 token 位置而非整段末位;让两个词在同一物体上给出相反标签(P9c 方向对但强度不够——两词问不同属性,一个"红或木"的分级标就能同时糊弄过去);显式的词条件路由。 |
这是什么
一个新论文方向(目标 COLM/ICLR 2027)的阶段研究成果:让 LLM 在预训练之后、于交互(引用)中建立经过验证的、永久的、按对话者隔离的新概念。
本 PR 只新增
docs/与research/下的文档与实验代码,不触碰产品代码。核心结论
定位:空白不在「有没有准入门控」,而在门控用什么信号。跨持续学习/记忆架构/agentic 记忆,所有永久固化门的信号穷尽落在十类代理上(损失·参数漂移·容量·新颖性·梯度干扰·代表性·类别平衡·随机·不确定性·来源可信),「无 GT、无外部 oracle 的概念级正确性」一列为空。
实证:压缩增益门成立——22 个 gavagai 对,margin +4.08 nats 95%CI[+2.52,+5.70],19/22,p=0.00043。
但最重要的发现是**「压缩什么」比「用什么判据」更关键**:
三个前置条件(原设计全都漏了):观测量要对 / 基座要有能力 / 基座要肯照做。
后两者对缩放的反应相反(G4 无信号型 0.562→0.812 改善;G5 条件化失败 0.812→0.000 恶化)⟹ 「放大模型」不是通用解药。
★ 10 处自我推翻
报告第 4 节逐条记录了我方先提出、后被自己的调研或实验推翻的主张,包括:
/base归一化 → 试了,失败(存档以免重复劳动)其中 6 处来自设计时特意埋的诊断项——例如朴素压缩门表面 8/8,被自埋的
ΔNLL拆解否掉(92% 的 margin 来自长度罚,词级 margin 仅 +0.02)。只报G就会是假阳性结论。🔴 一条优先权风险
arXiv:2607.08032(2026-07-09)已在开放问题中提出与压缩增益门同构的写入准入判据(基于边际任务条件信息量
I*(Q)),但只提议程、未实现未实验。贡献声明已据此最终收紧为:「尚无方法【实现并实证】基于压缩增益的、GT-free 且无外部 oracle 的写入准入门控」,并将其作为 concurrent position work 正面引用。
证据等级
复现
全部实验零训练算力(冻结基座 + 纯 prompt,单机 MPS):
🤖 Generated with Claude Code