Skip to content

research: Learning in Referencing — 22 组实证;🔴 换词控制推翻了参数化记忆线的「概念」解读(25 处自我推翻) - #335

Open
oratis wants to merge 42 commits into
mainfrom
claude/learning-in-referencing-03a60e
Open

research: Learning in Referencing — 22 组实证;🔴 换词控制推翻了参数化记忆线的「概念」解读(25 处自我推翻)#335
oratis wants to merge 42 commits into
mainfrom
claude/learning-in-referencing-03a60e

Conversation

@oratis

@oratis oratis commented Jul 31, 2026

Copy link
Copy Markdown
Owner

主文档research/learning-in-referencing/REPORT.md

这是什么

一个新论文方向(目标 COLM/ICLR 2027)的阶段研究成果:让 LLM 在预训练之后、于交互(引用)中建立经过验证的、永久的、按对话者隔离的新概念。

本 PR 只新增 docs/research/ 下的文档与实验代码,不触碰产品代码

核心结论

定位:空白不在「有没有准入门控」,而在门控用什么信号。跨持续学习/记忆架构/agentic 记忆,所有永久固化门的信号穷尽落在十类代理上(损失·参数漂移·容量·新颖性·梯度干扰·代表性·类别平衡·随机·不确定性·来源可信),「无 GT、无外部 oracle 的概念级正确性」一列为空

实证:压缩增益门成立——22 个 gavagai 对,margin +4.08 nats 95%CI[+2.52,+5.70],19/22p=0.00043
但最重要的发现是**「压缩什么」比「用什么判据」更关键**:

观测量 margin 显著性
老师的自由陈述 +0.68 nats p=0.36 ❌
老师的用词决策序列 +4.92 nats p=0.0039

三个前置条件(原设计全都漏了):观测量要对 / 基座要有能力 / 基座要肯照做
后两者对缩放的反应相反(G4 无信号型 0.562→0.812 改善;G5 条件化失败 0.812→0.000 恶化)⟹ 「放大模型」不是通用解药

★ 10 处自我推翻

报告第 4 节逐条记录了我方先提出、后被自己的调研或实验推翻的主张,包括:

  • 「所有门控只调写入强度」→ 第三轮推翻(DEN/SEMA/SAGE 都是真门控)
  • 「推理期写入 × 跨会话持久从未同时成立」→ 上下文蒸馏族已填上该格
  • 「放大模型可解」→ 3B 上 margin 涨 4× 但 AUC 反降
  • 「σ_null 是盲的」→ 被自己的数据纠正(是校准问题不是盲区)
  • 忠实性探针 F(c)、/base 归一化 → 试了,失败(存档以免重复劳动)
  • LMLM 的 venue 与机制归因、Sharpening 的定理归因 → 第六轮改正

其中 6 处来自设计时特意埋的诊断项——例如朴素压缩门表面 8/8,被自埋的 ΔNLL 拆解否掉(92% 的 margin 来自长度罚,词级 margin 仅 +0.02)。只报 G 就会是假阳性结论。

🔴 一条优先权风险

arXiv:2607.08032(2026-07-09)已在开放问题中提出与压缩增益门同构的写入准入判据(基于边际任务条件信息量 I*(Q)),但只提议程、未实现未实验
贡献声明已据此最终收紧为:「尚无方法【实现并实证】基于压缩增益的、GT-free 且无外部 oracle 的写入准入门控」,并将其作为 concurrent position work 正面引用。

证据等级

  • 家族 A–I:经 3 票对抗验证(✅)
  • 家族 J–P:第五、六轮的正式 Verify 阶段未跑完;第六轮抓取代理完成了 pdftotext 全文穷举 + 近似命中逐条核查,故标 ✅ᶠ(强于 🔍、弱于 ✅)
  • 未解决项与方法学限制在报告第 5 节全部列出(E5 条件化失败、误收 3 个 M′、内化不幂等、迭代内化坍缩、单模型族、22 items)

复现

全部实验零训练算力(冻结基座 + 纯 prompt,单机 MPS):

cd research/learning-in-referencing/p0
uv venv --python 3.12 .venv && uv pip install torch transformers
.venv/bin/python p0c_decision_mdl.py                              # 核心信号
.venv/bin/python p0e_v2_eval.py Qwen/Qwen2.5-1.5B-Instruct bf16   # 22 items + CI
.venv/bin/python p0j_calibration.py                               # 跨规模校准(纯分析)

🤖 Generated with Claude Code

oratis and others added 18 commits July 24, 2026 13:50
Co-Authored-By: Claude Opus 4.8 <noreply@anthropic.com>
第四轮 deep-research(12 目标 × [发现员+怀疑复核] + 总裁决 = 25 agent, 0 error)
对抗式证伪狭义主张。结果 holds-with-caveat, 0 反例 0 refute:

- 族6 回放选择准则全覆盖: reservoir=随机 / GDumb=类别平衡 / GSS=梯度多样性 /
  iCaRL=代表性 / DER++=reservoir(标签仅进loss) 皆真准入门; MIR 是检索门非准入门;
  生成式回放/CLS 无逐项门 — 无一用概念级正确性
- 族5 局部学习: FF/PC/EqProp 无 episodic 门(量词空真); Hopfield 容量=被动饱和;
  recall-gated/self-sizing 是 GT-free 但信号为熟悉度/新颖
- 两悬案关闭: CN-DPM ✅ 确立为架构原生两段式(WAKE/SLEEP, DP×似然门);
  2606.03787 ✅ 确立为真实 surprise-gated robot episodic memory
- caveat: 2026 agentic 记忆写入门(Write-Time Gating/TRUSTMEM/LOCI)引入新代理
  (来源信誉/对源忠实/可靠度/外部oracle), 均非概念真伪 → 代理表扩到十类,
  delta 收紧为 "GT-free / 无外部 oracle"; LOCI 为最锋利近邻(外部结果确认)
- 引用修正: GDumb arXiv:2007.05003 是误号 → ECCV 2020 proceedings

改动: §7.6.2 代理表+12行 / 新增 §7.6.7 总裁决 / §7.6.4 证据强度重排 /
§7.6.5 关闭两悬案 / §7.6.6 引用陷阱 / 附录 I 族4/5/6 落地 / §9.1 勾掉第四轮 /
§9.2 Q9/Q11 已答+Q12 / §9.3 立论包(proposal+related-work+三层架构最小实现)

Co-Authored-By: Claude Opus 4.8 <noreply@anthropic.com>
四轮调研收官后进入设计。两份新文档把立论包 §9.3 的 C2/C4 展开为可实现规格:

- DESIGN_COMPRESSION_GATE.md — 机制
  * 两部分 MDL 形式化:G(c) 必须在【留出轮次】上算、必须含 L(c)、必须过【安慰剂对照】
  * 修正 C4:区分 E1(模型误解 → 压缩门拒绝 ✅)与 E2(老师教假话 → 压缩门接受,
    属设计边界,归 provenance 门射程)——原措辞"拒绝一切错误概念"会被 E2 反例击穿
  * 现有七种门在 E1 上的失分表 + 七条失败模式 + 八项消融矩阵

- DESIGN_CONCEPT_BENCH.md — 数据
  * 构造语言(伪词四道过滤 / 组合式微世界 / 语法距离旋钮)
  * gavagai 对 G1–G5:教学集在构造上不足以消歧,只有留出用法能揭示所指
    → 把 E1 从"碰运气"变成可控可判分的实验条件
  * 切断 Aycock 平行样例捷径的教学协议;冲突词跨用户隔离测试
  * 实施顺序按"最早能证伪"排:P0 零算力先验证核心信号

研究文档同步回填 C4 修正、related-work 末句收紧提示、P0 指引。

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
首个实证结果(Qwen2.5-1.5B 冻结,零训练,8 个 gavagai 对)。

结论:机制成立,但【压缩什么】比【用什么判据】更关键。

1. 朴素版(在老师自由陈述上算 NLL)——失败
   · G 表面 8/8,但拆开看 92% 的 margin 来自长度罚 L(c)
   · 纯预测力 ΔNLL 仅 +0.68 nats(5/8, 符号检验 p=0.36 不显著)
   · 词级 margin +0.02 ≈ 零:给不给正确定义,模型输出该伪词的概率几乎不变
   · 2/8 项被错误安慰剂击败
   → 若只报 G 的 8/8 就是假阳性结论;诊断项是设计时特意埋的,起了作用

2. 决定性诊断——能力在,观测方式错
   · 强制选择探针:M/M′ 落差平均 0.295,6/8 有区分(最强 0.954→0.026)
   · 失败的 2 项均需世界知识(盒子不圆 / 石头非金属)

3. 修正版(改压缩老师的用词决策序列)——成立
   · ΔNLL +4.92 nats(8/8, p=0.0039),较自由陈述版提升 7.2×
   · 安慰剂对照 8/8;4/8 项上误解的增益为负(比无概念更糟,门直接拒绝)
   · 长度罚占比 92% → 60%

未解决(已写进文档,不可声称已解决):
   · 单候选阈值跨 item 不可分,最佳归一化 AUC 0.875
     → 门目前是排序器,不是阈值判据;per-item 校准是最大缺口
   · 范畴歧义远易于合取歧义(+10.73 vs +2.99),勿用 G2 数字代表整体

回改:机制文档新增 §1.2b(观测量)、§1.3 阈值警告、消融必报项 A0′/A0″。

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
按路线图推进第 1、3 项(第 2 项缩放测试受下载带宽阻塞,未完成)。

1. per-item 校准(P0d)——部分成功
   · 用安慰剂池作零分布算 z 分数:AUC 0.797 → 0.906
   · 设计预测精确成立:M′ 平均 −0.22 vs 零分布中心 −0.27(仅差 0.05 nats),
     M 为 +3.86 显著离群 → 零分布含 overspec 的设计是对的
   · 与 SEMA(族 4 最接近先例)同一套 z 校准机制,差别只在信号类型 → 可正面引用
   · 试过 6 种归一化(硬零分布/仅overspec/稳健z/百分位/÷base),全局可分性均未达成

2. ★ 根因定位:门的判别力继承自基座能力(新增第二前置条件)
   · ρ(能力探针落差, 判别 margin) = +0.857
   · 探针失败组 margin +2.11 vs 通过组 +5.86(2.8×)
   → 校准无法弥补能力不足;这是原设计未识别的前置条件

3. 扩展集 v2(P0e)——22 items × 5 类歧义 + bootstrap CI
   · margin +4.08 nats 95%CI [+2.52,+5.70](不含 0);19/22,p=0.000428
   · AUC 裸 0.843 [0.738,0.942] / z 校准 0.857 [0.746,0.950]
   · 分类型差异是主导因素:
       G2 范畴 +9.12 (AUC 1.000) · G3 材料 +8.25 (1.000) · G1 合取 +2.93 (0.861)
       G5 绝对/相对 +0.53 (0.812) · G4 论元顺序 +0.15 (0.562 ≈ 随机)
   · ★ 分层可分性:仅 G2/G3 时单候选阈值 AUC 1.000、τ=+0.75 ✅
     → 把「阈值不可分」从方法缺陷重定位为【作用域条件】

4. 🔴 撤回一个我方设计预测
   · 设计时预期「双向判别(G3-G5)强于单向(G1,G2)」→ 实测相反(+2.98 vs +5.41)
   · G4 失败机制查清:|ΔNLL| 仅 0.90 vs 其他 4.74,定义完全不改变模型预测
     (靠表层语序启发式作答)——能力缺失,非材料或门的缺陷

5. bf16 与 fp32 结果一致(margin +4.90 vs +4.92,AUC 相同)→ 精度非混淆项

回改:机制文档新增 §1.3b(零分布 z 校准)、失败模式 8/9、前置条件 2;
bench 文档标注 G1/G2/G3 为主实验核心、G4/G5 为作用域边界。

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
P0e 发现 G4(论元顺序)AUC 0.562 ≈ 随机、|ΔNLL| 仅 0.90(其他类 4.74)。
本实验保持任务不变、只改定义呈现方式,分开三种互斥解释:

  a 抽象变量 "X zelka Y" means X gives to Y   → margin +0.15 (2/4), |ΔNLL| 0.90
  b + 显式角色说明(第一个名字是给予者…)        → margin −0.56 (1/4), |ΔNLL| 3.37
  c 用真实人名实例化(去掉变量绑定)             → margin +0.35 (3/4), |ΔNLL| 0.87
  对照:其他 4 类歧义                          → margin ≈ +4.9,   |ΔNLL| ≈ 4.74

裁决:(A) 能力缺失。三种呈现都无信号 → 排除 (B) 变量绑定 与 (C) 提示格式。

关键细节:b 的 |ΔNLL| 升到 3.37 说明显式角色说明确实大幅改变了模型预测,
但 margin 转负 —— 不是"定义被忽略",而是模型用了定义却仍分不清论元角色。
这把 G4 从"可能是提示假象"坐实为【基座能力边界】。

含义:论文作用域应以 G1/G2/G3(属性/范畴/材料)为核心,
G4/G5 单列为当前基座不可及的边界,勿混入主指标。

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
项目目标扩展为「探索所有 AI 模型将知识内化的方案」,据此新建全景文档,
把前四轮调研的材料重组为按机制的分类学(而非按论文名)。

概念脊柱(本文档的原创综合,标 💭):
· 内化的五个判据 I1–I5:免检索/组合性/隐式触发/跨会话持久/抗干扰
  → "学会了" ≈ 五者合取;RAG 只满足 I4,是"存储"不是"内化"
· 内化度阶梯 L0–L5:上下文→外部存储→激活/状态→适配器→稀疏槽→稠密权重
· ★ 核心张力:内化度 ↑ ⟹ 可逆性 ↓、可隔离性 ↓
  所有工程方案本质上都是在这条对角线上选点;有意思的研究都在中间层 L3/L4
· 内化流水线六环节:获取→准入门控→写入→巩固→保持/隔离→调用
  实证发现:环节②(准入门控)是全领域最薄弱的一环

三个正交轴:载体 × 写入算子 × 时机,外加横切的准入门控维度。

家族 A–I 已落地(ICL/外部记忆/SSM状态/TTT快权重/稀疏槽/per-user适配器/
权重编辑/可生长模块/局部规则),每族回答四问:内化到哪里、用什么写入、
持久性、有无准入门控;全部带 ✅/⚠️/❌/🔍/💭 验证状态。

§4 横向矩阵读出三条结构性事实:
 1. 「推理期写入」与「跨会话持久」在任何一行都不同时为 ✓
 2. 有门控的家族信号都不是正确性(十类代理占满,正确性列空)
 3. 唯一原生快慢分离(HOPE/CMS)把巩固接到时钟而非门

§5 五个根本张力:稳定性-可塑性、叠加不可寻址、内化度反比、容量上界、
隔离 vs 泛化(后者在架构文献中命中为零)。

§7 定位本项目并声明边界:压缩增益验证「对该对话者用法的语义保真度」,
非「世界真值」;解决 E1(模型误解)不解决 E2(老师说假话),
后者属 provenance 门射程,两者正交可组合。

待办:第五轮调研(进行中)回填 J–P,尤其 J 上下文蒸馏——
它可能是「推理期写入 × 跨会话持久」那格的已有解,若是则空白声明需收紧。

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
问题:门的判别力继承自基座能力(ρ=0.857),关系类概念上几乎无信号,
校准救不了(试过 6 种归一化)。原设计的门是二态的(毕业/不毕业),
在能力不足处任何阈值都是在读噪声。

方案:加一个前置的【可判定性闸门】,让门能"知道自己判不了"并转为追问。

可判定性计 σ_null = 零分布的离散度,必须满足三条且都满足:
  · GT-free(不需要答案)
  · 不需要知道哪个候选是对的(对比:能力探针 ρ=0.857 但需要两个候选)
  · 门本来就要算零分布 → 零额外开销
语义:把候选定义塞进上下文后,模型预测到底会不会被影响。
      σ_null≈0 ⟹ 定义没进入决策 ⟹ 增益判据无效。

实测(22 items):
  σ_null: G1 4.75 / G3 4.12 / G2 2.93 ≫ G5 1.07 / G4 0.64
  ρ(σ_null, margin) = +0.520

三态门(τ_dec=1.5, τ_z=+0.68):
  AUC 0.857 → 0.964(τ_dec=2.0 时 0.970)
  正确接受 M 15/15(零漏拒)· 正确拒绝 M′ 12/15 · 弃权 7/22
  覆盖项准确率 90.0%
  ⚠️ 仍误收 3 个 M′ —— 误解被固化是最该压低的错误,未解决

★ 弃权的正当性检验(关键):被弃权项的 AUC = 0.551 ≈ 随机
  → 门弃掉的正是它本来就判不了的,不是在丢信号
  这让弃权从"逃避"变成"有依据的判断"

回改:
· 机制文档 §1.4 毕业判据从二态升级为三态(ACCEPT/REJECT/ASK),
  失败模式 8(基座无能力)标为"已解决为机制"
· 全景文档 §1.3 流水线补充:环节②应含元判断"判不判得了",
  指出现有所有方案的门都是二态的、没有"弃权"这一态

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
· 机制文档:状态行更新为「判据已升级为三态门」;失败模式 8(基座无能力)
  标为「已解决为机制」——σ_null 可判定性闸门可检出并弃权
· 全景文档 §1.3:流水线环节② 补充元判断「这条经验我判不判得了」,
  并指出现有所有方案的门都是二态的、没有「弃权」这一态
· 全景文档 §7:补三态门实测结果与三层架构中的位置

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
第五轮调研(上下文蒸馏/模型合并/知识蒸馏/检索增强/自我改进/睡眠期/
参数化知识库)回填完成,A–P 全覆盖,文档 631 行。

🔴 证据等级警告(已在文档顶部与 §3 前置声明):
   第五轮的 Verify 与 Synthesize 阶段未执行完(工作流在 Fetch 后中断,
   输出文件为空),130 条主张未经 3 票对抗验证。
   J–P 全部标 🔍,与 A–I 的 ✅ 不可混用。

★ 最重要的一条:撤回原 §4 结构性事实 1
   原文:「推理期写入」与「跨会话持久」在任何一行都不同时为 ✓,是最干净的结构性空白。
   实况:家族 J(上下文蒸馏)恰恰填上了这一格;其中 Generative Adapter
        (ICLR 2025)更做到 单次前向写入 × 跨会话 × 天然按用户隔离。
   修正后仅保留弱版本:该格在纯架构层 A–I 内为空;J 靠额外离线蒸馏步/摊销 hypernet。
   (这条风险在上一版 §8 待办里已预警,现应验并如实撤回。)

★ 但定位反而更强:J/J′/O 三族「有完整内化管线、唯独没有准入门控」
   → 贡献声明从「提出新架构」收紧为
     「给一个已跑通的内化管线补上它唯一缺的器官:无需标准答案的正确性门」
   → 不必自证管线可行(J 族已证),只需证明「加门比不加好」
   → 2605.26099 的调研记录直接点出「这个无门控正是压缩增益门可插入的位置」

新增两条必须处理的风险(已写进 §7 与 §8):
 1. 内化不幂等(When Context Returns, 2606.11627):把原始 context 重新塞回
    已蒸馏模型,性能反而变差,甚至在它本已答对的样本上退化。
    本项目正是「引用→内化」系统,必须测;已知轻量修复 = stop-gradient
    anchoring + forward KL 一致性正则。
 2. 迭代内化的 progressive capability collapse(2606.04703);
    缓解线索 principle-level > instance-level、step-wise > global。

一条理论正面支持:Sharpening 机制(ICLR 2025)证明自我改进不可能创造
模型中原本不存在的信息 → 新知识必须来自外部证据 → 从理论侧确认本项目
「新概念必须在引用中从对话者处获得」的问题设定是对的。

其他要点:M 族给出「何时写进权重」的判据双轴(规模轴标度律 + 长尾流行度轴);
K 族 task vector 取负提供了罕见的可逆性,但崩塌是任务对固有属性且有解析上界;
N 族模型坍缩需连边界条件引用(替换式才坍缩,累积式不坍缩);
P 族 LMLM 的损失掩码即准入门,且支持 instant forgetting。

新增附录 J(J–P 文献表,全部 🔍)。

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
3B 下载完成,路线图第 2 项解除阻塞并跑通。结论与我方预测相反。

预测(由 ρ(能力探针,margin)=+0.857 导出):放大基座应同时提升 margin、
判别质量、全局可分性。

实测(22 items,同材料同代码,均 bf16):
  margin  +4.08 → +16.82   (涨 4×)   ✅
  M 胜出  19/22 p=0.00043 → 15/22 p=0.067  ❌ 不再显著
  AUC(z)  0.857 → 0.738    ❌
  → margin 大 ≠ 判得准,二者不是一回事

分类型显示两种失败模式对缩放反应相反:
  G4 论元顺序  0.562 → 0.812  ✅ 改善(原最差项,"没有信号"型失败确实随规模缓解)
  G1 合取      0.861 → 1.000  ✅
  G5 绝对/相对 0.812 → 0.000  ❌❌ 彻底翻转(4/4 全判反,margin −21.70)

★ 新错误类型 E5「条件化失败」:
  G5 的实例措辞 "next to Y" 提示比较读法;3B 模型即使被明确告知
  "该词指绝对大"仍按比较读法作答 —— 模型没有忠实条件化于给定定义,
  先验压过了定义。而先验强度随规模增长 ⟹ 该失败模式越大越糟。

  与 E1–E4 的区别:E1 是模型的假设错;E5 是假设对但模型不按它行动。
  测量效度含义:ΔNLL 实测的是「(模型先验 ⊗ c) 解释数据的程度」,不是 c。

★ 三态门接不住 E5(弃权机制的盲区):
  G5 的 σ_null 均值 6.94(不低)、z(M′) 均值 +3.52(强离群)
  → 模型是「自信地判反」而非「判不了」,可判定性计读出的是「可判定」
  → 「不可判定」≠「自信地错」,σ_null 只能检出前者。当前最大未解决问题。

方法学注记:能力探针在 3B 上饱和失效(落差 +0.297→+0.058,6/8→1/8;
ρ 0.857→0.310)。它是两个趋近 1 的概率相减 —— 这不是能力瓶颈结论被推翻,
而是该仪器在 ≥3B 不再可用;σ_null(离散度)更稳健。

必须声明的混淆:G5 把对照物写进实例本身,本就提示比较读法。但真实对话
总是带框架的,故这是真实的测量效度问题,不能仅当作材料瑕疵;两种解释都报告。

机制文档:新增 E5 行与前置条件 3(模型必须能忠实条件化于候选概念)、
失败模式 10。候选解法方向:忠实性探针(在定义能给出平凡确定答案的实例上
检查模型是否遵循 c)。

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
按计划做了两件事:验证仪器、试 E5 的候选解法。两个结果都是负面的,
其中一个纠正了我上一条提交里的结论。

1. P0h 仪器有效性检查(下 E5 结论前的前置验证)
   · 平凡常识题:raw 6/6、chat 6/6 → 仪器正常,E5 不是格式假象 ✅
   · 但伪词+定义的平凡应用 3B 仅 4/6:
     "kirel means red" + "Is a red box kirel?" → p(yes)=0.000(以概率 1.0 答 No)
   → E5 比 §6c 原先归因的「framing 提示比较读法」更广:
     3B 连无任何框架的单属性平凡应用都会失败。

2. P0i 忠实性探针 F(c) —— 我提的方案,失败
   构造「答案由候选定义单独蕴含」的平凡实例(GT-free 成立),
   F(c) = p_yes(蕴含Yes) − p_yes(蕴含No)。
   预测判错的 AUC:F_min 1.5B 0.895 / 3B 0.533(≈随机)
                   σ_null 1.5B 0.965 / 3B 0.905
   → 两个规模都不如 σ_null,3B 上退化到随机。假设推翻,不采用。
   (细节:3B 的 G5 上 F(M)=0.403 < F(M′)=0.768,模型对错误读法反而更忠实,
     与先验压过定义一致;但 F_min 聚合后挑不出这类项。)

3. ★ 纠正上一条提交里的过强结论
   上次写「σ_null 是盲的、接不住 E5」。数据不支持:
     判错的 7 项 σ_null 均值 6.72  vs  判对的 15 项 13.06
     σ_null 预测本项会不会判错的 AUC = 0.905
   → σ_null 对 E5 并不盲,它在失败项上系统性更低。
   → 真正坏掉的是阈值跨规模不可迁移(3B 的 σ_null 约为 1.5B 的 4 倍,
     1.5B 调好的 τ_dec=1.5 在 3B 上无意义)。
   → 这是校准问题,不是盲区;修法应是把 σ_null 无量纲化,而非另找信号。

限制清单相应更新(第 10/12 条),并把失败的 F(c) 存档以免重复劳动。

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
失败模式 10 与前置条件 3 更新:
· σ_null 对 E5 并不盲(判错组 6.72 vs 判对组 13.06,AUC 0.905)
· 真问题是阈值跨规模不可迁移(3B ≈ 1.5B 的 4×)→ 需无量纲化
· 忠实性探针 F(c) 已试且失败(3B AUC 0.533≈随机),标注不采用以免重复

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
§6d 定位出真问题是阈值跨规模不可迁移(3B 的 σ_null ≈ 1.5B 的 4×)。本次解决。

测了 6 种归一化,双标准:A 组内 AUC 不降;B 1.5B 选的阈值直接用到 3B 仍有效。

结果:
  raw     AUC 0.965/0.905  迁移❌(3B 全保留,无弃权效果)
  /base   AUC 0.965/0.724  迁移◐   ← 我事先按量纲推理看好的,实测失败
  /|mu|   AUC 0.667/0.743  迁移✅   ← 但组内 AUC 太低,判为噪声,不推荐
  rank    AUC 0.965/0.905  迁移✅   ← 采用

★ rank 是对的,且有构造性论证而非拟合:
  · rank 是 raw 的单调变换 ⟹ 组内 AUC 与 raw 完全相同,判别力分毫不损
  · 分位数天然无量纲 ⟹ 跨规模可比
  两点都是构造性质,不是在 22 样本上碰巧拟合出来。

覆盖/准确率权衡在两个规模上都单调(信号良态的标志):
  τ=0.19 → 1.5B 18/22 100%  | 3B 18/22 77.8%
  τ=0.40 → 1.5B 13/22 100%  | 3B 13/22 92.3%
  τ=0.60 → 1.5B  9/22 100%  | 3B  9/22 100%
  (3B 不弃权基线 68.2%)

🔴 但这没有解决 E5:3B 上 τ=0.19 弃掉的 4 项里只有 3 个是真错误;
   7 个错误中 G4-01/G4-04/G5-01/G5-02 未被抓住——G5 的 E5 错误多为中等 σ_null。
   ⟹ 校准问题与 E5 问题是两个独立问题,§6d 把它们混在一起了,本节分开。

部署代价:rank 需要一批候选才能算分位(同轮候选池或滚动窗口),
必须写进论文。

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
第六轮的正式 Verify(3票) 阶段未跑完,但抓取代理完成了 pdftotext 全文穷举 +
关键词逐条核查。据此引入中间证据等级 ✅ᶠ(全文穷举级,强于 🔍 弱于 ✅)。

★ 确认(✅ᶠ 全文穷举)——立论支点在「已实现方法」层面成立:
· Generative Adapter (ICLR 2025):21 页 camera-ready、136KB 全文,
  admission/admit/filter/criteri*/threshold/verif*/trust/confiden*/reliab*/
  surpris*/salien*/discard/relevance/importance 命中全为 0;
  近似命中逐条证伪——gate 唯一命中是 'aggregated' 子串,gating 是 'investigating' 子串
· Cartridges:Algorithm 1 是裸 chunk→seed→sample 循环,每条生成对话直接进训练集;
  损失为纯 KL 上下文蒸馏,无正确性/事实性/置信度项;38.6×/26.4× 数字准确
· Cartridges at Scale:12,094 词穷举 gate/admission/novelty 均 0
  ★★ Appendix J 提供「凡进上下文即写」的直接铁证:9 个 FinQA cartridge 的
     688 个唯一数字中仅 41% 有原文依据,纯粹捏造占 9%(n=62),全部被无差别写入

🔴 改正 4 处错误:
1. LMLM 不是 NeurIPS 2025 主会 → 是 CCFM workshop Oral;
   且 v3 已更名 Large → Limited Memory Language Models(沿用旧名会检索错配)
2. LMLM「损失掩码即准入门」是范畴错置 → 掩码是训练目标;真正的写入过滤器是
   标注管线的 Corrector(按损失丢弃 top-10%,判据=格式合规+上下文可推得性,非正确性)
3. Sharpening「自我改进不可能创造新信息」不是该文定理 → 是动机性前提,
   正文归因于 data-processing inequality (Cover 1999)。引用须改归因。
   但适用范围核查对我方有利:论文显式限定「无外部反馈」自采样设定,
   故不能外推到「有外部证据进入上下文」,我方推论仍成立。
4. Generative Adapter「全程无梯度」不准确 → 仅测试期;生成器 G 需离线自监督预训练。
   「省 4×」必须连代价一起报:F1 66.0 → 40.2(相对下跌 39%),只报 4× 是误导。

🔴🔴 优先权风险(对本项目最重要):
   arXiv:2607.08032 "What to Keep, What to Forget: A Rate–Distortion View of
   Memory Compaction"(Colaco & Lahjouji, 2026-07-09)
   · 有利:独立佐证我方否定性支点(该文 49 次 gate 命中全是架构门控单元,
     admission/verify/correctness 全 0;断言各层保留信号一律是注意力幅度或时近性)
   · 不利:其开放问题已提出基于边际任务条件信息量 I*(Q) 的写入准入判据,
     与压缩增益/MDL 门在动机与形式上高度同构
   → 裁决:已实现方法层面支点仍成立(该文未实现、未实验),但已被提出层面被占位
   → 贡献声明收紧为「尚无方法【实现并实证】基于压缩增益的写入准入门控」,
     并把 2607.08032 作为 concurrent position work 正面引用
   → 这是继 SAGE 之后第二次有工作逼近本项目位置,且这次在信息论形式上更近

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
汇总 2026-07-24→07-31 的全部工作,作为 PR 的主文档。

结构:研究问题(四性质 P1–P4) → 方法(6 轮对抗调研 + P0–P0j) →
主要发现 → ★被推翻或收紧的我方主张(10 处) → 当前状态 → 下一步 → 产物索引。

核心结论:
· 定位:空白在「门控信号的类型」而非「有没有门控」;十类代理占满,
  「无 GT、无外部 oracle 的概念级正确性」一列为空
· 实证:压缩增益门成立(22 items,19/22,p=0.00043),但【压缩什么】
  比【用什么判据】更关键——观测量必须是用词决策序列而非自由陈述(7.2×)
· 三个前置条件(原设计全漏):观测量要对 / 基座要有能力 / 基座要肯照做;
  条件 2 与 3 对缩放的反应相反 ⟹「放大模型」不是通用解药
· 三态门 + 弃权正当性(被弃权项 AUC 0.551≈随机)+ rank 跨规模校准

同时把贡献声明按第六轮的优先权风险做最终收紧:
  「尚无方法【实现并实证】基于压缩增益的、GT-free 且无外部 oracle 的写入准入门控」
  并把 arXiv:2607.08032 作为 concurrent position work 正面引用。

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
第七轮收窄到 8 篇后 Verify 阶段成功执行(103 agent,105 主张 → 25 验证 →
18 确认 7 否决;5 个 agent 因 API 断连出错)。

🔴🔴 立论支点的绝对表述被证伪(第二次被推翻):
  arXiv:2606.03979 的 Dreaming 阶段有两道真实的写入前筛选——
  (a) 梯度重要性 Top-k 拒采(ARC 上「每任务采 60 条 dream、拒 45 条」;
      消融去掉后 SQuAD 48.9/46.2 → 47.1/45.2)
  (b) 继承自 SEAL 的二值奖励 r={1 if improves, 0 otherwise}
  但两者判据均为【可学习性/效用】而非正确性/事实核验;
  且 τ 只在 ReST-EM 训练期塑形生成器,部署写入环节不施加过滤。
  ⟹ 声明第三次收紧为「尚无方法【实现并实证】以压缩增益/MDL 为判据、
     GT-free 且无外部 oracle 的写入准入门控」。

🔴 改正我方两处实质错误(均在 2605.26099):
  1. 作用域:N 次 pass 作用于当前窗口 chunk(L=24 tokens),
     不是「整个累积上下文」
  2. 定性(更严重):其 fast weights 是 SSM 定长递归状态 S、每序列零初始化,
     不是跨会话持久的模型参数(permanent=0/cross-session=0/continual=0)
     ⟹ 我方原先称其「把睡眠期落到权重上」是错的,已撤回;
        不可与真正写权重的 P 族并列为持久化证据

✅ 新确认(3 票):
· Sleep-time Compute 不写权重(LaTeX 级 weight/gradient/LoRA/SGD 全 0;
  模型全为闭源 API 结构上无法写权重;repo 无 torch/peft),数字 5×/+13%/+18% 属实;
  唯一写入规则是新近性+似然,参考实现为无条件覆写
· LMs Need Sleep 两阶段与摘要关键句逐字属实;第一阶段确无准入判据
  (forget*=13 全是 catastrophic forgetting、零个 forget gate;
   surpris*=1 仅 "Surprisingly" → 不存在 Titans 式 surprise 度量)

⚠️ 两条措辞纪律:
· 不得由「论文不假设 oracle verifier」推出「因此不可能有正确性门控」
  (该强推论被三次独立否决 0-3×3)
· Sleep-time Compute 的仓库层提示词含 "remove calculations that are not useful"
  与 "checked that there are no errors" —— 可被审稿人当反例,避免绝对句

🔴 最高优先未决线索:GATES (stein2026) 的 consensus-gating 按多条 tutor trace
   一致性门控学习 —— 一致性是无需 GT 的正确性代理,直接落在我方主张位置上,
   若属实需再次收紧。SEAL 同样待查。

❗ 覆盖缺口:J 族 3 篇 + P 族 2 篇本轮无一条主张通过验证,仍仅摘要级,
   相关事实明确标注为「不得写入论文」。

核查 SOP 已沉淀:子串误报清单(LoRA⊂exploration、gating⊂backpropagating 等)、
词边界+substring 双跑、arXiv HTML 曾返回错篇故须用正文水印校验身份。

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
· 自我推翻清单 10 → 12(新增:支点绝对表述被证伪、Do LMs Need Sleep 的
  fast weights 非持久参数)
· 贡献声明的三次收紧过程做成表格,给出当前唯一可辩护的措辞
· 新增 GATES/SEAL 最高优先未决线索
· 未解决表补充 J/P 族剩余 5 篇仍仅摘要级(明确标注哪些事实不得写入论文)
· 方法学自评补充第七轮沉淀的核查 SOP(子串误报清单、双跑校验、
  arXiv HTML 返回错篇、不得过度外推 oracle 免责句)

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
@oratis

oratis commented Jul 31, 2026

Copy link
Copy Markdown
Owner Author

第七轮 3 票验证结果(PR 已更新)

前两轮的 Verify 阶段都卡住没跑完,这轮把范围收窄到 8 篇后成功执行(103 agent,105 主张 → 25 验证 → 18 确认 7 否决)。

🔴 立论支点的绝对表述被证伪

arXiv:2606.03979(Language Models Need Sleep)的 Dreaming 阶段有两道真实的写入前筛选

  • 梯度重要性 Top-k 拒采 —— ARC 上**「每任务采 60 条 dream、拒 45 条」**
  • 继承自 SEAL 的二值奖励 r = {1 if improves, 0 otherwise}

但两者判据都是【可学习性/效用】,不是正确性/事实核验。 贡献声明因此第三次收紧:

「尚无方法【实现并实证】以压缩增益 / MDL 为判据、GT-free 且无外部 oracle 的写入准入门控。」

🔴 同时改正了我方两处实质错误(都在 2605.26099)

  1. 作用域:N 次 pass 只作用于 L=24 token 的当前窗口,不是"整个累积上下文"
  2. 定性(更严重):其 fast weights 是 SSM 定长递归状态、每序列零初始化permanent/cross-session/continual 全 0)——不是持久参数。我方原先称其"把睡眠期落到权重上"是错的,已撤回。

✅ 新确认(3 票 + 全文穷举)

Sleep-time Compute 不写权重:LaTeX 源码级 weight/gradient/LoRA/SGD 全 0;所用模型全为闭源 API 结构上无法写权重;官方 repo 无 torch/peft。数字 5×/+13%/+18% 属实。唯一写入规则是新近性 + 似然,参考实现是无条件覆写

🔴 下一轮最高优先:GATES

2606.03979 点名 GATES 用 consensus-gating「按多条 tutor trace 的一致性门控学习」——一致性是无需 GT 的正确性代理,直接落在我方主张的位置上。若属实需再次收紧。

❗ 覆盖缺口(已在报告中明确标注)

J 族 3 篇 + P 族 2 篇无一条主张通过验证,仍仅摘要级。相关事实(Snell 的"不需 GT"、SPIDER +9%、OPCD 机制、Memory Grafting 数字等)明确标注为不得写入论文


自我推翻清单从 10 条增至 12 条;另沉淀了一套核查 SOP(子串误报清单如 gating ⊂ backpropagating、词边界+substring 双跑、arXiv HTML 曾返回错篇故须用正文水印校验)。

@oratis oratis changed the title research: Learning in Referencing — 6 轮调研 + 10 组实证,含 10 处自我推翻 research: Learning in Referencing — 7 轮调研 + 10 组实证,含 12 处自我推翻 Jul 31, 2026
窄范围 5 篇,Verify 成功执行(100 agent,90 主张 → 25 验证 → 21 确认 4 否决)。
我方预判「GATES 有相当概率构成反例」应验。

★ GATES = arXiv:2602.20574v1 (Stein/Huang/Goldstein, UMD, 2026-02-24)
  三源互证(PDF 水印 + LaTeX e-print + HTML),确认为 GT-free 二值写入准入门:
  · 判据 = k=8 条 tutor rollout 答案一致度 ≥4/8;未过门者
    "contributes zero loss across all objectives"(整体丢弃)
  · 数学确证是硬性准入而非降权:g_i·e_{i,j} 同时在 Eq.1 分子与归一化分母中
    → 被门掉的项从分母消失
  · 作者自陈 "agreement… as a proxy for correctness"、
    "no external teacher or reward model is involved"
  · 亲自划界 "it decides when to distill, not what to answer"
  · 消融:去掉共识门 → student 54.0% / benchmark 31.1%

🔴 且非首创:LMSI (2210.11610, 2022) 早已用多数投票筛选自训练数据,
   明言 "we do not use any ground truth labels to filter";
   GATES 自认 consensus filtering 是 "well-established"。

⟹ 「GT-free 正确性代理 + 准入门控」这一轴彻底失守,不得再主张新颖性。

✅ 但我方在另外两轴存活,新颖性重量全部转移过去:
  (i) 判据类型:全族 MDL/description length/compression 词边界命中 = 0
      (compression 唯一命中在参考文献;bits 是 exhibits 子串)
  (ii) 门控环节:GATES 门作用于训练期数据/梯度准入、固定预生成题集;
       我方作用于推理期按对话者隔离的持久写入

❌ SEAL 不构成反例:奖励需每 context 配带 gold label 的 τ,论文 Limitations
   自述 "prevents RL training of SEAL from scaling to unlabeled corpora";
   且筛选在生成器 RL 训练期,部署写入期无条件聚合应用、完全无门。

✅ Snell 2209.15189 确认为「无门」最近邻:LaTeX 源码级确认目标函数是纯嵌套
   期望,无指示函数/阈值/门控项;穷举扫描全零。
   ⚠️ 但其机制细节描述被 0-3 否决、"SPIDER +9%" 未获核实 → 均不得引用。

★ 一条对我方有利的反向证据:arXiv:2607.08065 大规模审计
  (53 runners × K=50 × 265,000 samples)显示一致性只是弱预测子
  (Spearman ρ 0.20–0.59),高一致的 gpt-4.1 在 GPQA 上仍 48% 出错,
  "Self-consistency is not accuracy… unreliable as a standalone confidence score"
  → 可论证一致性类信号 ≠ 压缩类判据,且共识门控的代理效力本身存疑。

三条硬性禁令已写入文档:
 1. 不得再写「尚无 GT-free 的写入准入门控」
 2. 不得保留「无外部 oracle」作为独立卖点(攻防上得不偿失)
 3. 用「写入」必须带 scope 注解(推理期/持久/按条)

最终措辞(摘要版 + Related Work 收口版)已定稿写入 REPORT §4。
自我推翻清单 12 → 13 条。

剩余最大风险面:Prompt Distillation (2412.14964) 与 OPCD (2602.12275)
两轮均未通过验证,若任一含 GT-free 写入侧筛选,声明仍可能被推翻。

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
@oratis oratis changed the title research: Learning in Referencing — 7 轮调研 + 10 组实证,含 12 处自我推翻 research: Learning in Referencing — 8 轮调研 + 10 组实证,含 13 处自我推翻 Jul 31, 2026
oratis and others added 2 commits August 1, 2026 02:17
1. §3.1「无 GT 的概念级正确性一列为空」已被第八轮 GATES 推翻 → 就地标注
   并给出修正后的空白(判据类型=压缩/MDL + 门控环节=推理期持久写入)
2. 自我推翻表第 12/13 条顺序修正
3. 周期更新至 2026-08-01

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
@oratis

oratis commented Jul 31, 2026

Copy link
Copy Markdown
Owner Author

第八轮:GATES 确认为反例 —— 贡献声明第四次收紧(定稿)

上一条评论里我预判「GATES 有相当概率构成反例」。应验了。

🔴 GATES 是一个 GT-free 的二值写入准入门

arXiv:2602.20574v1(Stein / Huang / Goldstein, UMD)—— PDF 水印 + LaTeX e-print + HTML 三源互证:

  • 判据 = k=8 条 tutor rollout 答案的一致度 ≥4/8;未过门者 "contributes zero loss across all objectives"
  • 数学确证是硬性准入而非降权g_i·e_{i,j} 同时出现在 Eq.1 的分子与归一化分母中 → 被门掉的项从分母消失
  • 作者自陈:"agreement… as a proxy for correctness""no external teacher or reward model is involved"
  • 亲自与推理期方法划界:"it decides when to distill, not what to answer"

且非首创LMSI(arXiv:2210.11610, 2022)早已用多数投票筛选自训练数据,明言 "we do not use any ground truth labels to filter"。GATES 自己承认 consensus filtering 是 "well-established"

✅ 但我方在另外两轴存活 —— 这反而让 delta 更精确

GATES / LMSI 我方
判据类型 答案一致性;全族 MDL/description length/compression 词边界命中 = 0 压缩增益 / MDL
门控环节 训练期数据/梯度准入,作用于固定预生成题集 推理期按对话者隔离的持久写入

❌ SEAL 不构成反例

奖励需每个 context 配带 gold label 的 τ;论文 Limitations 自述这 "prevents RL training of SEAL from scaling to unlabeled corpora"。且筛选在生成器 RL 训练期部署写入期无条件聚合、完全无门

★ 一条对我方有利的反向证据

arXiv:2607.08065 的大规模审计(53 runners × K=50 × 265,000 samples):一致性只是弱预测子(Spearman ρ 0.20–0.59),高一致的 gpt-4.1 在 GPQA 上仍 48% 出错 —— "Self-consistency is not accuracy… unreliable as a standalone confidence score."

⟹ 可论证:一致性类信号 ≠ 压缩类判据,且共识门控的代理效力本身存疑。

🚫 三条硬性禁令(已写入文档)

  1. 不得再写「尚无 GT-free 的写入准入门控」—— 已被彻底证伪
  2. 不得保留「无外部 oracle」作为独立卖点 —— 攻防上得不偿失
  3. 用「写入」必须带 scope 注解(推理期/持久/按条),否则与 GATES 的训练准入不可区分

最终措辞(摘要版 + Related Work 收口版)已定稿写入 REPORT §4


自我推翻清单 12 → 13 条。剩余最大风险面:Prompt Distillation (2412.14964) 与 OPCD (2602.12275) 连续两轮未通过验证——若任一含 GT-free 的写入侧筛选,声明仍可能被推翻。

2412.14964 (Prompt Distillation) 与 2602.12275 (OPCD) 连续两轮(七、八)无一条
主张通过验证,是唯一未闭合的风险面。本轮取得两篇全文(水印校验 v2/v2),
11 条主张 × 3 独立对抗验证者 = 33 票,全部 3-0 确认:

★ 决定性结论:两篇均无 GT-free 的写入侧准入筛选
- 2412.14964:完全无筛(30+ 关键词词边界+substring 双跑穷举零命中;
  gate/gating 9 个 raw 命中全为 mitigate/investigate 子串误报)。噪声答案
  不过滤,靠高温软标签蒸馏吸收。附录 K 的五分位分组是诊断性消融,非管线筛选
- OPCD:唯一筛选「filtered EKD」在 1000 道带 GT 的 math validation / 环境
  得分上打分取最高 → 判据=任务表现,需要标签/oracle,非 GT-free;其明确
  GT-free 的 test-time 设定随机选取,自述 "quality … not pre-evaluated"
⟹ 第八轮定稿贡献声明维持原文;OPCD 反而构成空白存在性的直接文献锚点

同轮确认(解禁,可按收紧措辞写入论文):
- 2412.14964:teacher=同一模型带文档 prompt、LoRA 翻转切换角色、训练无 GT、
  无更强 teacher(更大 expert 反因风格失配变差)
- OPCD:reverse KL + on-policy 机制、两应用(experiential/system prompt)

新增 2 处我方转述收紧(REPORT §4 #14/#15,总数 13→15):
- 「PD 多规模超过 RAG」→ 纯闭卷仅 Squadshifts/Llama-8B 追平;「超过」依赖
  PD+RAG 组合或 PD XL;HotpotQA 上 RAG 对纯闭卷 PD 全面占优
- 「OPCD 更好保留 OOD」→ 边际(+0.1~+0.5,std 内;对 base 持平或微降),
  且 checkpoint 按 test accuracy 挑选,数字受通胀

文档同步:
- REPORT.md:8→9 轮、§2 加第 9 行、§4 加第九轮小节+2 收紧、§5 风险表
  两行合并为一行(仍禁写:Snell/DyPRAG/Memory Grafting)、§6 推进到
  改写 Intro/Related Work → P1/P2、SOP 误报清单补 gate⊂Bagatella
- RESEARCH_KNOWLEDGE_INTERNALIZATION.md:J 族两行 🔍→✅(带收紧措辞)、
  准入门控行改为核实后表述、§8 勾掉 GATES 与两篇核查项、附录 J 更新
- r9/verification.json:33 票原始裁决+逐条证据引文+PDF md5,供审计

Co-Authored-By: Claude Fable 5 <noreply@anthropic.com>
@oratis

oratis commented Aug 1, 2026

Copy link
Copy Markdown
Owner Author

第九轮定向验证 — 最后风险口闭合 ✅(commit 3d417c8

只查两篇(连续两轮未通过对抗验证的最大风险面):2412.14964(Prompt Distillation)与 2602.12275(OPCD)。全文级(PDF,水印校验 arXiv:2412.14964v2 / arXiv:2602.12275v2,md5 记录在案),11 条主张 × 3 独立对抗验证者 = 33 票全数 3–0 确认

★ 决定性问题:有无 GT-free 的写入侧准入筛选?——都没有

论文 裁决
2412.14964 完全无筛:30+ 关键词词边界+substring 双跑穷举零命中(gate/gating 9 个 raw 命中全为 mitigate/investigate 子串误报,另新收录 gate ⊂ Bagatella 人名误报)。噪声生成答案不过滤,靠高温软标签蒸馏吸收("answers serve as inputs (not direct targets)")。附录 K 五分位分组是诊断性消融,非管线筛选
2602.12275 唯一筛选「filtered EKD」= 在 1000 道带 GT 的 math validation / 128 局文字游戏环境得分上打分取最高 → 判据是任务表现,需要标签/环境 oracle,非 GT-free;触发在蒸馏训练前的数据选择期。其明确 GT-free 的「test-time EKD」设定随机选取,论文自述 "no ground-truth labels are available and the quality of experiential knowledge is not pre-evaluated"

⟹ 第八轮定稿贡献声明维持原文,免于第五次收紧。 OPCD 反而构成反向支持——它把 GT-free 部署场景明确留在「质量不预评」状态,可在 Related Work 中直接引作空白存在性的文献锚点。

同轮确认(两篇解禁,可按收紧措辞写入论文)

  • 2412.14964:teacher = 同一模型带文档 prompt ✅、同一模型 + LoRA 翻转切换角色(rank 512–1024)✅、训练全程无 GT ✅、无更强 teacher(更大 expert 反因风格失配变差)✅
  • OPCD:reverse KL + on-policy 机制(学生无 context 采样自身轨迹、top-256 学生词表)✅、两应用(experiential / system prompt distillation)✅

新增 2 处我方转述收紧(§4 #14/#15,自我推翻总数 13 → 15)

  1. 「PD 多规模超过 RAG」→ 纯闭卷仅 Squadshifts/Llama-8B 追平;「超过」依赖 PD+RAG 组合(三规模)或 PD XL(Squadshifts 均值);HotpotQA 上 RAG 对纯闭卷 PD 全面占优
  2. 「OPCD 更好保留 OOD」→ 边际(对 off-policy CD 仅 +0.1~+0.5、落在 std 内;对 base 持平或微降),且 checkpoint 按 test accuracy 挑选(A.3/B.2),数字受通胀

状态与下一步

  • 仍禁写(仅摘要级):Snell 2209.15189 机制细节与「SPIDER +9%」、DyPRAG 2503.23895、Memory Grafting 2605.20948
  • §6 已推进:① 按第八轮定稿措辞改写 Introduction / Related Work → ② 进 P1/P2(构造语言生成器 → 三臂对照 → 记忆层 + 隔离测试)
  • 原始裁决(33 票 + 逐条证据引文 + PDF md5)存于 research/learning-in-referencing/r9/verification.json

🤖 Generated with Claude Code

oratis and others added 2 commits August 1, 2026 12:24
一、第十轮验证(5 篇全文 / 17 主张 / 51 票):仅摘要级清零
- Generative Adapter 2411.05877v1:单次前向机制+无门+数字全确认;
  但「天然按用户隔离」被收紧(1C/2CORR)——论文无 isolation 一词、无跨用户
  测试,跨会话复用也是架构性而非纵向演示 → REPORT §4 #16。
  反而保住我方 P4 空间:「按对话者隔离并实测无泄漏」仍无人做
- When Context Returns 2606.11627v1:内化不幂等升级为 ✅(7/12 设定退化;
  修复 NCA 11/12;scope=仅系统提示/游戏脚手架,未测文档)
- Snell 2209.15189v1:七轮 0-3 悬案解决——机制精化(token 级 KL 到冻结
  自身副本,非硬标签微调)+「SPIDER +9%」精确化(8-shot 比 GD 基线 +9.0 点,
  非对 teacher)
- DyPRAG 2503.23895v4:我方「多文档 LoRA 平均互相干扰」系误读,如实改正
  (REPORT §4 #17)——论文称平均有效整合,衰退归因无关冗余+有损压缩
- Memory Grafting 2605.20948v1:定性修正为预训练容量扩展方法;写入侧仅
  频率覆盖筛选(质量盲),非正确性门
- 自我推翻总数 15→17;无一篇含正确性写入门 → 空白声明再获确认

二、Introduction / Related Work 投稿草案 v1(paper/DRAFT_INTRO_RELATED_WORK.md)
- 按第八轮定稿措辞:GATES/LMSI 正面让位、OPCD "not pre-evaluated" 作
  空白锚点、E1/E2 划界、三条禁令全稿自查表 + 措辞红线速查
- RESEARCH doc §9.3.1 旧 C1 与 §9.3.2 旧段就地标注已被推翻/替代

三、两个内化风险写进实验设计
- DESIGN_COMPRESSION_GATE §3 新增失败模式 #11(内化不幂等,✅)与
  #12(迭代坍缩,🔍 2606.04703 引用前须 3 票)
- DESIGN_CONCEPT_BENCH §7 新增指标 8(重现幂等性)与 9(迭代巩固坍缩曲线,
  gate-on vs gate-off——若推迟坍缩即门价值第二论据)

四、P1 构造语言生成器脚手架(research/learning-in-referencing/p1/)
- lexicon(CV(C) 音系+阻断表+编辑距离;分词器/探针钩子留待模型环境)
- microworld(13 kind × 4 色 × 3 尺寸 × 4 材料,4 范畴群)
- gavagai G1-G5 程序化构造:教学集外延一致由构造保证,不变量测试全过
  (T1 外延一致/T2 分离样例/T3 过滤/T4 确定性/T5 留出未见/T6 overspec)
- 已生成 items_p1.json(40 items)+ isolation_p1.json(8 冲突词隔离对)

Co-Authored-By: Claude Fable 5 <noreply@anthropic.com>
Co-Authored-By: Claude Fable 5 <noreply@anthropic.com>
P4「按对话者隔离」性质的实证。8 对冲突词(同一伪词、两位老师教互斥含义)
× 每对 8 条程序化留出决策,冻结 Qwen2.5-1.5B,零训练。

结果:
  Q1 判别力(阈值无关 AUC)
     分区(只含 A 的概念)  1.000  —— 8/8 对全部完美
     共享(A+B 同时在场)   0.754  —— 6/8 对下降;最差 ISO-08 掉到 0.281(反向)
  ★ Q2 压缩门选对 A 的真实含义
     分区  8/8 = 100%
     共享  4/8 = 50% ≈ 随机

⟹ 没有分区,门就无法把概念归属到人——不是模型不行,而是信息上不可能:
   两个互斥定义同时在场时,观测数据本身不含「哪个属于谁」。

⚠️ 三处必须说清的限定(已写入 p3/README.md §3):
 1. 共享条件的门控比较是同样两句话的不同顺序,测的是「位置是否承载归属」
    (答案:不承载),不得表述为「门在两个候选间选错」
 2. 共享条件是强形式污染(互斥定义直接同处一境),不是 PersistBench 那种
    隐蔽的自然泄漏——度量不同,勿与其 53% 直接比数值
 3. 本轮是上下文级分区,尚未实现 product-key 记忆层的 uid 硬分区,
    研究文档 §7.4 的「架构性零干扰」主张仍未实证

★ 方法学:又一次「先验仪器再下结论」救了结论
  初版用 0.5 阈值算准确率得到 0.00 的假象;查证发现模型对陌生伪词谓词
  有系统性 No 偏置(蓝色项 p_yes 0.245–0.349 vs 红色项 0.020–0.023,
  判别信号强 14× 但绝对值全在 0.5 以下)。
  这反过来佐证了机制设计:压缩门用连续 NLL 而非阈值化决策,不受该偏置影响。
  (继 P0h 之后第二次。)

另修两个实现 bug:mw.entities() 是生成器被一次性耗尽(第二对起留出集为空);
0.5 固定阈值改为阈值无关 AUC。

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
@oratis oratis changed the title research: Learning in Referencing — 11 轮调研 + 11 组实证,含 20 处自我推翻 research: Learning in Referencing — 11 轮调研 + 12 组实证,含 20 处自我推翻 Aug 3, 2026
@oratis

oratis commented Aug 3, 2026

Copy link
Copy Markdown
Owner Author

P3 冲突词隔离测试完成 —— P4 性质实证

8 对冲突词(同一伪词、两位老师教互斥含义)× 每对 8 条程序化留出决策。冻结 Qwen2.5-1.5B,零训练。

结果

分区(只含 A 的概念) 共享(A+B 同时在场)
对 A 留出集的判别 AUC 1.000(8/8 对完美) 0.754(6/8 下降;最差 ISO-08 掉到 0.281 = 反向
★ 压缩门选对 A 的真实含义 8/8 = 100% 4/8 = 50% ≈ 随机

没有分区,门就无法把概念归属到人——不是模型不行,而是信息上就不可能:两个互斥定义同时在场时,观测数据本身不含"哪个属于谁"。

隔离是机制正确性的前提,不是工程洁癖。

⚠️ 三处必须说清的限定

  1. 共享条件的门控比较是同样两句话的不同顺序,测的是"位置是否承载归属"(答案:不承载)。不得表述为"门在两个候选间选错"。
  2. 共享条件是强形式污染(互斥定义直接同处一境),不是 PersistBench 那种隐蔽的自然泄漏——度量不同,勿与其 53% 直接比数值
  3. 🔴 本轮是上下文级分区尚未实现 product-key 记忆层的 uid 硬分区——研究文档 §7.4 的"架构性零干扰"主张仍未实证。

★ 又一次"先验仪器再下结论"救了结论

初版用 0.5 阈值算准确率,得到 0.00 的假象。查证发现模型对陌生伪词谓词有系统性 No 偏置

上下文 实例 p(yes)
komalor means blue. 蓝色项 0.245–0.349
同上 红色项 0.020–0.023

判别信号强约 14×,但绝对值全在 0.5 以下。

这反过来佐证了机制设计:压缩门用连续 NLL 而非阈值化决策,不受该偏置影响——同一条 ISO-01 上"准确率 0.00"而门控 ✅。

(继 P0h 之后第二次。另修两个实现 bug:mw.entities() 生成器被一次性耗尽;固定阈值改为阈值无关 AUC。)

详见 p3/README.md

下一步:product-key 记忆层 + uid 硬分区——把上下文级分区升级为架构性零干扰,这是 P3 唯一未闭合项。

流程:① 教学 → ② 门控裁决 → ③ 写入 uid 分区 → ④ 清空上下文 → ⑤ 新会话
仅从该 uid 分区加载 → 作答。16 位老师(8 对冲突词),冻结 Qwen2.5-1.5B,零训练。

结果:
  ② 门控 16/16;真含义领先对方含义 +9.92 nats(候选 4 选 1,含对方含义 + 2 干扰)
  ⑤ 新会话(上下文已清空)
       none 不加载记忆      0.514  ← ≈随机,说明记忆确实必要
     ★ partitioned uid 分区  0.980
       wrong_user 错用户     0.129  ← 远低于随机(两义互斥)
       shared 无分区共享库    0.562  ← 均值有误导性,见下
  结构性零干扰:跨分区命中 0/16

🔴 共享库的真实失效模式是「后写覆盖」,不是「两义并存」:
     uA 先写  分区 0.984 → 共享 0.148(8/8 概念被彻底摧毁)
     uB 后写  分区 0.977 → 共享 0.977(完好)
   均值 0.562 是「A 被毁 + B 完好」的平均,不可读作整体退化,必须拆开报。
   且这与 P3 的共享条件是不同失效模式(P3 两义同处上下文互相干扰;
   P4 是存储层 last-write-wins)。

四条性质状态:P1 全新 ✅ · P2 无 GT 自验证 ✅ · P3 持久 ✅ · P4 隔离 ✅

⚠️ 三条必须说清的限定(已写入 p4/README.md §4):
 1. 层级:这是 L1 外部记忆 + 检索纪律,不是 §7.4 提议的 L4 product-key
    参数化记忆层(需训练)。按我方五判据,满足 I4 与隔离,但不满足
    I1 免检索 / I2 组合性——仍是「知道有这回事」不是「学会了」。
    论文中不得说成参数级内化。
 2. 门控任务比 P2 容易得多(4 个互斥颜色、领先 +9.92 nats),
    16/16 不可与 P2 核心域 AUC 0.915 相提并论。
 3. 零干扰是构造性真理(键带 uid 前缀 + 按 uid 掩码),不是实证发现;
    实证的是它复现了隔离行为、且两个对照确实劣化。

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
@oratis oratis changed the title research: Learning in Referencing — 11 轮调研 + 12 组实证,含 20 处自我推翻 research: Learning in Referencing — 11 轮调研 + 13 组实证,四性质端到端跑通 Aug 3, 2026
@oratis

oratis commented Aug 3, 2026

Copy link
Copy Markdown
Owner Author

P4 端到端闭环 —— 四条性质第一次在同一流程里同时成立

① 教学 → ② 门控裁决 → ③ 写入 uid 分区 → ★④ 清空上下文 → ⑤ 新会话仅从该 uid 分区加载 → 作答

16 位老师(8 对冲突词),候选 = {真含义, 对方老师的含义, 2 个干扰颜色}。冻结 Qwen2.5-1.5B,零训练。

结果

环节 结果
② 门控裁决 16/16;真含义领先对方含义 +9.92 nats
⑤ 新会话(上下文已清空 none 0.514 → ★partitioned 0.980
对照:取回错用户的概念 0.129(远低于随机,因两义互斥)
结构性零干扰 跨分区命中 0/16

四条性质:P1 全新 ✅ · P2 无 GT 自验证 ✅ · P3 持久 ✅(0.514→0.980)· P4 隔离 ✅

🔴 共享库的失效模式是「后写覆盖」,不是「两义并存」

分区 AUC 共享 AUC
uA 先写 0.984 0.148 — 8/8 概念被彻底摧毁
uB 后写 0.977 0.977 — 完好

均值 0.562 是"A 被毁 + B 完好"的平均,不可读作整体退化
且这与 P3 的共享条件是不同失效模式(P3 是两义同处上下文互相干扰;P4 是存储层 last-write-wins)。

⚠️ 三条必须说清的限定

  1. 🔴 层级:这是 L1 外部记忆 + 检索纪律不是研究文档 §7.4 提议的 L4 product-key 参数化记忆层(需训练)。按我方自己的五判据,本方案满足 I4 与隔离,但不满足 I1 免检索 / I2 组合性——仍是"知道有这回事",不是"学会了"论文中不得说成参数级内化。
  2. 门控任务比 P2 容易得多:4 个互斥颜色、领先 +9.92 nats。16/16 不可与 P2 核心域 AUC 0.915 相提并论。
  3. 零干扰是构造性真理(键带 uid 前缀 + 按 uid 掩码),不是实证发现;实证的是它复现了隔离行为、且两个对照确实劣化。

详见 p4/README.md


下一步:把 L1 外部记忆升级为 L4 参数化记忆层(product-key + uid 硬分区)——这是当前唯一需要突破零算力约束的一步。

oratis and others added 2 commits August 3, 2026 22:17
接 DRAFT_INTRO_RELATED_WORK 的 §1–§2,补齐 §3–§7。英文正文 + 中文编辑注记体例。

结构:
 §3 Method     3.1 观测量(决策序列而非自由陈述)+ 两部分 MDL + 安慰剂对照
               3.2 零分布 z 校准 + 三态门(含弃权正当性与 rank 跨规模校准)
               3.3 巩固与按对话者分区(明写 store 是 external)
 §4 Setup      构造语言 + 污染控制双保险;★ gavagai 对(Quine 做成可控条件);
               为何用阈值无关 AUC(No 偏置的实测教训)
 §5 Results    5.1 三臂对照(核心域 0.915 vs 0.269)
               5.2 ★ 失效机制:语义熵反向(0.137)或随机(0.507),从不正向
               5.3 作用域:条件 2 与 3 对缩放反应相反,「放大」不是通用解药
               5.4 隔离是正确性前提;5.5 端到端四性质同时成立
 §6 Limitations 五条,与 REPORT §5 未解决表一一对应,无隐去
 §7 禁令自查表  8 条逐条勾

新增两条禁令(本稿特有,已写入自查表):
 4. 不得把 L1 外部记忆说成参数级内化
    → §3.3 明写 "this store is external",§6(i) 独立成条:
      按我方五判据满足 I4 与隔离,但不满足 I1 免检索 / I2 组合性,
      是「知道有这回事」不是「学会了」
 5. 不得把 P4 门控 16/16 与 P2 核心域 AUC 0.915 相提并论
    → P4 是 4 个互斥颜色、领先 +9.92 nats,比 gavagai 对容易一个量级

其他已在稿内落实的口径纪律:
 · 语义熵不得写成「≈随机」→ 用「反向或随机,从不正向」
 · 三臂实际只有 2 个独立臂(数学等价,margin 差 5.55e-17),正文不宣称三臂
 · PersistBench 53% 不直接比数值(度量不同)
 · G5 是语义熵唯一有效类型(0.750),诚实报告未隐去
 · 共享库 last-write-wins 的均值 0.562 有误导性,必须拆开报

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
动机:20 处自我推翻散落在 12 份文档里,正文改了而附录表格没跟着改是最易漏的一类错误。

🔴 抓到 1 处真实残留(docs/RESEARCH_KNOWLEDGE_INTERNALIZATION.md 附录 J):
  LMLM 条目仍写「NeurIPS 2025」+「损失掩码即准入门」——
  这两条早在第六轮就已改正,但只改了正文、附录文献表未同步。
  现已修正为:v3 更名 Limited Memory LM;NeurIPS 2025 CCFM workshop Oral(非主会);
  掩码是训练目标而非写入准入判据,真正的写入过滤器是标注管线的 Corrector
  (按损失丢弃 top-10%,判据=格式合规+上下文可推得性,非正确性)。

其余 24 处命中经逐条复核均为正当引用(自我推翻表的「我方原主张」列、
四次收紧表的「被推翻的表述」列、两份草稿的禁令自查表——都是「为了禁止而引用」)。
已在四次收紧表上方加注:该列仅作沿革记录,不得用作行文措辞。

工具固化为 research/learning-in-referencing/tools/audit_retracted.py:
  · 11 条规则覆盖全部已撤回/已改正的主张
  · 命中行若处在「撤回/改正/禁令/⚠️/~~删除线~~/不写」等否定语境即放行
  · 输出明确标注「放行 ≠ 正确,仍需人工复核」——它是提醒器不是判官
  投稿前及每次新增主张后应重跑。

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
@oratis

oratis commented Aug 3, 2026

Copy link
Copy Markdown
Owner Author

论文正文初稿 + 投稿前一致性审计

1. Method / Experiments 草案 v1

接 Intro/RW 补齐 §3–§7(DRAFT_METHOD_EXPERIMENTS.md,英文正文 + 中文编辑注记):

  • §3 Method — 观测量(决策序列而非自由陈述)→ 两部分 MDL + 安慰剂对照 → 零分布 z 校准 → 三态门
  • §4 Setup — 构造语言 + 污染控制双保险;★ gavagai 对把 Quine 做成可控条件;为何用阈值无关 AUC
  • §5 Results — 三臂对照 / 失效机制 / 作用域 / 隔离 / 端到端
  • §6 Limitations — 五条,与 REPORT 未解决表一一对应
  • §7 禁令自查表 — 8 条逐条勾

新增两条本稿特有的禁令

  1. 不得把 L1 外部记忆说成参数级内化 —— §3.3 明写 this store is external,§6(i) 独立成条:按我方自己的五判据,本方案满足 I4 与隔离,但不满足 I1 免检索 / I2 组合性,是"知道有这回事"不是"学会了"
  2. 不得把 P4 门控 16/16 与 P2 核心域 AUC 0.915 相提并论 —— 前者是 4 个互斥颜色、领先 +9.92 nats,难度差一个量级

2. 🔴 一致性审计抓到一处真实残留

20 处自我推翻散落在 12 份文档里,正文改了而附录表格没跟着改是最易漏的一类错误。写了个审计器扫全库:

docs/RESEARCH_KNOWLEDGE_INTERNALIZATION.md 附录 J 的 LMLM 条目仍写着「NeurIPS 2025」+「损失掩码即准入门」 —— 这两条早在第六轮就已改正,但当时只改了正文。

已修正(v3 更名 Limited Memory LM;实为 CCFM workshop Oral 非主会;掩码是训练目标,真正的写入过滤器是标注管线的 Corrector)。

其余 24 处命中经逐条复核均为正当引用(自我推翻表的"我方原主张"列、四次收紧表的"被推翻的表述"列、两份草稿的禁令自查表——都是"为了禁止而引用")。已在四次收紧表上方加注:该列仅作沿革记录,不得用作行文措辞

审计器已固化为 tools/audit_retracted.py(11 条规则),输出明确标注**"放行 ≠ 正确,仍需人工复核"**——它是提醒器不是判官。投稿前及每次新增主张后应重跑。


当前状态:11 轮调研(🔍 全清零)· 13 组实证(四性质端到端跑通)· 20 处自我推翻 · 论文 Intro/RW + Method/Experiments 初稿齐备。

剩余:3 张图表 + 正式 bibkey;L4 参数化记忆层(唯一需要突破零算力约束的一步)。

oratis and others added 2 commits August 3, 2026 22:41
把 P4 的 L1 外部记忆升级为参数:冻结 Qwen2.5-1.5B,只训练 uid 分区的
product-key 稀疏槽;记忆挂最后一层之后,梯度不反传任何 transformer block,
单机 MPS 数分钟可训。

★ E1 免检索(判据 I1,P4 的 L1 方案不满足的那一条):
  上下文完全不含概念陈述,仅靠参数——
    无记忆 0.485 ≈ 随机 → 参数化记忆 0.992(+0.507)
    用他人分区 0.260(远低于随机,两义互斥)

★ E4 顺序写入:分区 vs 共享(同等总容量 512 槽)
    分区  1.000 → 0.992(最低 0.960)
    共享  1.000 → 0.562(最低 0.000),第 2 次写入即崩至 0.520

🔴 但分区版的零退化是构造性的,不是实证发现:
   梯度掩码 → 先前用户的槽根本没被碰到;实测「写入时 AUC」与「最终 AUC」
   16/16 逐位相同。曲线 −0.008 漂移来自新用户自身分数差异,非退化。
   ⟹ 不得报作「稀疏记忆抗崩塌」。有意义的结论只有一条:
      同等容量下分区防住了、共享没防住 —— 关键是分区,不是容量或稀疏性。

★ 过程中两次失败,均靠先诊断而非猜测定位(已存档以免重复):
 1. 全词表 CE(151k 词表)稀释二元信号 → 记忆完全无效(三个条件 AUC 全同、
    提升 +0.000)。修法:改为 BCE(logit_yes − logit_no)。
 2. 原始点积路由塌缩 → 记忆退化为常量偏置。诊断:
    · 线性探针训练 acc 1.000 → 信息在 h 里,不是设计点死
    · 隐状态两两余弦 0.9937、‖h‖≈171.8、‖W_yes−W_no‖=1.11
    · 被路由到的不同槽数 1/12 ← 决定性证据
    修法:余弦归一化 + 温度 → loss 0.6377→0.0021、训练 acc 0.50→1.00、槽数 2/12
    ★ 一般性教训:提示只在细微语义处不同时,product-key 路由必须做余弦归一化。

⚠️ 限制:final-layer memory ≠ 中间层 product-key 层(缺深度组合性);
   与 ROME/MEMIT 仍非同基准(判分口径与编辑粒度不同,且冲突词是最坏情况);
   任务为 4 个互斥颜色而非 gavagai 难例;I2 组合性未验证(探针同源微世界)。
   按五判据:达成 I1 + I4 + 隔离;I2 未验证,I3/I5 未测。

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
一、REPORT 新增 §0 综合结论(可独立阅读的执行摘要):
  0.1 一句话贡献 + 四次收紧的完整沿革
  0.2 四条性质的实证状态 + 五判据(达成 I1/I4/隔离;I2 未验证)
  0.3 三个可迁移的发现(不依赖本项目具体主张):
      · 「压缩什么」比「用什么判据」更关键(+0.68 → +4.92 nats,7.2×)
      · 自洽类信号被概念宽度系统性误导(M′更窄 0.137 / 不更窄 0.507,反向或随机从不正向)
      · product-key 路由必须做余弦归一化(余弦 0.994 → 12 输入全落同一槽)
  0.4 三条「差点犯的错」及各自被什么诊断项抓住
  0.5 未解决清单

二、Method/Experiments 草稿并入 P5:
  · §3.3 巩固改为分列 (a) External / (b) Parametric 两级实例化,
    并把「余弦路由是必要条件而非实现细节」写进正文
  · 新增 §5.5:免检索(0.485→0.992)+ 分区 vs 共享消融
  · §6(i) 限制改写——原文「the store is external」已被 P5 部分推翻,
    现改为「深度与组合性」:final-layer memory 缺深度组合,I2 未验证
  · §4 评测口径修正:原写「no training of any kind」对 P5 已不成立,
    改为「基座全程冻结、只训练记忆的 keys/values、梯度不过任何 transformer block」
  · 禁令自查表 8 → 10 条(新增:分区零退化不得报作抗崩塌实证、不得声称已验证 I2)
  · 禁令 4 改写:从「不得把 L1 说成参数级」改为「必须区分两个实例化」

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
@oratis oratis changed the title research: Learning in Referencing — 11 轮调研 + 13 组实证,四性质端到端跑通 research: Learning in Referencing — 11 轮调研 + 14 组实证,四性质端到端 + L4 参数化内化 Aug 3, 2026
「被推翻的表述」列引用的是已作废的措辞,加 ~~删除线~~ 使其语义自明;
§0.1 补上与 §4 一致的「仅作沿革记录、不得用作行文措辞」提示。
一致性审计现 0 处待处理。

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
@oratis

oratis commented Aug 3, 2026

Copy link
Copy Markdown
Owner Author

L4 参数化记忆完成 —— I1「免检索」达成,并证明是分区而非容量在防干扰

这是唯一需要训练的一步(基座全程冻结,只训练记忆的 keys/values;记忆挂最后一层之后,梯度不反传任何 transformer block,单机数分钟)。

★ I1 免检索达成 —— P4 的 L1 方案不满足的那一条

上下文里完全没有该概念的任何陈述:

探针 AUC
无记忆(冻结基座) 0.485 ≈ 随机
参数化记忆 0.992(+0.507)
用他人分区 0.260(远低于随机)

★ 顺序写入:分区 vs 共享(同等总容量 512 槽

已写入 uid 分区 共享槽
2 1.000 0.520 ← 第 2 次就崩
16 0.992(最低 0.960) 0.562(最低 0.000

🔴 但分区版的零退化是构造性的——梯度掩码 → 先前用户的槽根本没被碰到。实测「写入时 AUC」与「最终 AUC」16/16 逐位相同
不得报作"稀疏记忆抗崩塌"的实证。

有意义的结论只有一条:同等容量下,分区防住了、共享没防住 ⟹ 关键是分区,不是容量或稀疏性本身。

过程中两次失败,都靠先诊断而非猜测才定位

  1. 全词表 CE(151k)稀释二元信号 → 记忆完全无效(三个条件 AUC 全同、提升 +0.000)
  2. 原始点积路由塌缩 → 记忆退化为常量偏置。诊断链:线性探针 acc 1.000(信息在 h 里,设计点没死)→ 隐状态两两余弦 0.9937、‖h‖≈172 → 被路由到的不同槽数 1/12(决定性证据)。
    余弦归一化 + 温度后:loss 0.6377→0.0021、acc 0.50→1.00

    ★ 一般性教训:提示只在细微语义处不同时,product-key 路由必须做余弦归一化。


综合收尾

REPORT 新增 §0 综合结论(可独立阅读):四次收紧沿革 · 四性质状态 · 三个可迁移发现 · 三条"差点犯的错" · 未解决清单。

Method/Experiments 并入 P5,并修了两处因 P5 而过时的表述:

  • §6(i) 原写"the store is external"——已被 P5 部分推翻,改为"深度与组合性"(final-layer memory 缺深度组合,I2 未验证
  • §4 原写"no training of any kind"——对 P5 不成立,改为"基座全程冻结、只训练 keys/values"

禁令自查表 8 → 10 条一致性审计 0 处待处理。


当前状态

调研 11 轮,🔍 全清零
实证 14 组,四性质端到端 + L4
自我推翻 20 处
五判据 达成 I1 免检索 + I4 持久 + 隔离;I2 组合性未验证,I3/I5 未测

下一步:验证 I2 组合性(跨域/跨属性探针);把 final-layer memory 上移到中间层(§7.4 原提案)。

跨域探针(概念 ⊗ 世界知识,答案从未被明说):
  base 0.500 → L1 上下文 0.840 → L4 参数化记忆 0.949(+0.449,反超 L1 +0.109)
前置检查:base 对这些物体颜色的世界知识命中 1.00(否则实验无意义)。

🔴 推翻我方在 P5 §4 声明、并已写进 Method 草稿 §6(i) 的限制
   「final-layer memory 缺深度组合性」——该断言从架构位置推测、从未实测。
   保留的只有结构事实:不参与中间层表征计算。结构差异 ≠ 能力差异。

三条限定同时写清:
  · base 跨域 0.500 是构造性的(冲突对对称,逐用户 [0.062, 0.938] 相互抵消)
  · 只测了「概念 ⊗ 世界知识」;概念⊗概念 / 否定量化 / 多跳组合未测
    ⟹ 只能声称「与世界知识的组合成立」,不得泛化为「具备组合性」
  · L4 为何反超 L1 是假说、未做消融,引用须标 hypothesis

同步:REPORT §3.9 + 自我推翻表 21 处 + 0.2/0.4/0.5/5/6/7 状态;
     Method 草稿 §5.6/§6(i)/禁令 10;全景文档 L0–L5 表的 I2 列首次回填实证;
     p5 README §1 与 memory_layer.py 的残留(审计器抓到);
     审计器新增 #21 两条规则并重跑 → 0 处残留。

新增纪律:自己声明的「限制」也必须做实验——未测的限制和未测的优点一样不可信。

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
@oratis oratis changed the title research: Learning in Referencing — 11 轮调研 + 14 组实证,四性质端到端 + L4 参数化内化 research: Learning in Referencing — 11 轮调研 + 15 组实证,四性质端到端 + L4 参数化内化(含 21 处自我推翻) Aug 3, 2026
@oratis

oratis commented Aug 3, 2026

Copy link
Copy Markdown
Owner Author

P6 — I2 组合性:我方自设的限制被自己的实验推翻(自我推翻 #21

五判据里最后一条未验证的(I2 组合性)已测。前面所有探针都来自同源微世界——那测的是泛化,不是组合

跨域探针要求两步组合:① a ripe banana 是 yellow(预训练世界知识)× ② romi = yellow(推理期习得)⟹ Is a ripe banana romi? 从未被明说

域内探针 ★ 跨域探针
base(无概念、无记忆) 0.485 0.500
L1 上下文注入 1.000 0.840
L4 参数化记忆 0.992 0.949
L4 − base +0.507 +0.449
L4 − L1 −0.008 +0.109

前置检查:base 对这些真实物体颜色的世界知识命中 1.00(否则实验无意义)。

🔴 这推翻的是我方自己声明的限制

P5 §4 写过「final-layer memory 缺深度组合性」,并据此在 Method 草稿 §6(i) 写入 "we do not verify criterion I2"
该断言从架构位置推测、从未实测——一测就反了。现已撤回,只保留结构事实:不参与中间层表征计算

⟹ 新增纪律:自己声明的「限制」也必须做实验。未测的限制和未测的优点一样不可信。

⚠️ 三条必须同时写清的限定

  1. base 跨域 0.500 是构造性的:冲突对对称(A 的 Yes 项正是 B 的 No 项),逐用户范围 [0.062, 0.938] 相互抵消 → 说明探针集跨用户平衡不代表 base 校准良好
  2. 只测了「概念 ⊗ 世界知识」:概念⊗概念、否定/量化、多跳组合全部未测不得泛化为「具备组合性」
  3. L4 为何反超 L1 是假说、未做消融(猜测上下文注入干扰了世界知识检索)——引用须标 hypothesis。

五判据最新状态

判据 状态
I1 免检索 ✅ P5(0.485 → 0.992)
I2 组合性 部分成立 — 与世界知识 ✅;概念间未测
I3 隐式触发 🔴 未测
I4 跨会话持久 ✅ P4/P5
I5 抗干扰 🔴 未测
(隔离) ✅ P3/P4/P5

同步范围

REPORT §3.9 + 自我推翻表(20 → 21 处)+ §0.2/0.4/0.5/§5/§6/§7;Method 草稿 §5.6/§6(i)/禁令 10;全景文档 L0–L5 表的 I2 列首次回填实证p5/README.md §1 与 memory_layer.py 的残留(由一致性审计器抓到);审计器新增 #21 两条规则并重跑 → 0 处残留

📌 research/learning-in-referencing/p6/README.md

oratis and others added 2 commits August 3, 2026 23:27
换 torch/transformers 环境后重跑 P6 时发现的。逐用户跨域 AUC 16/16 完全复现
(0.949、0.840、0.992、1.000 逐位相同,torch 2.13 + transformers 5.14),
但前置检查那一行:

  脚本实际打印 → red 3/4 · blue 3/4 · yellow 3/4 · green 2/4
                 平均 0.69 —— ⚠️ 世界知识不足,跨域结论受限
  我写进文档的 → 平均命中 1.00 ✅

数字错,判据也错。判据错在**重犯了 P3 的 No 偏置坑**:模型对 Yes/No 题有系统性
No 偏置,16 个【正确】颜色配对里有 5 个 p_yes < 0.5,尽管与负例分得很开(负例低至
0.001)。改用本项目已确立的阈值无关 AUC → 0.891(red .958/yellow .917/green .854/
blue .833)。⟹ **P6 结论不变**,世界知识确实可用。

修正范围:p6 脚本改用 AUC 判据并保留 raw 命中率作为偏置证据;p6/README、REPORT §3.9、
Method 草稿 §5.6 的数字与判据;REPORT §0.4 加一行"差点犯的错"。

★ 结构性防复发:新增 tools/probe_metrics.py。P3 那次的教训写进了报告**但没有变成代码**,
于是第二次照犯。auc() 是判据,hit_rate() 只作偏置证据且注释里写明不得当判据。

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
I2 的最后一格补上了。同一用户学两个概念(颜色+材质,各自独立教学),
探针问从未教过的合取句式 `Is X both w1 and w2?`:

  base 0.479 → L4 合并训练 0.889 → L1 上下文 0.986   (单概念策略上界 0.500)
  前置检查:基座对真词的同句式合取 AUC 0.973;L1 min 0.986 ⟹ 任务本身可解

🔴 自我推翻 #22:初稿把单概念策略上界算成 0.500,实为 0.750
   (负例"只中 w1"那半与正例在 w1 上同分布贡献 0.5,"只中 w2"那半被 w1 拒掉贡献 1.0)。
   修法:判据拆成 conj|¬w2 与 conj|¬w1 两半取 min——单概念策略在此必 ≈ 0.5。
   裁决线设错会把单概念策略误判成组合。

⚠️ 自我推翻 #23:P5 的「分区解决了干扰」只对【跨用户】成立。
   同一分区内顺序写第二个概念会冲掉第一个:0.951 → 0.590(Δ −0.361)。

★ 修法来自诊断而非猜测(子区版失败后先查):
   · w1 的槽 values 最大改动量 0.00e+00 → 梯度掩码有效,槽分毫未动
   · w1 探针 25% 的 top-4 落进 w2 子区 → **检索跨了区**
   ⟹ 分区必须同时作用于写入与检索。P5 之所以成功,正因为那里检索本来就按 uid 掩了。
   双掩码后 Δ +0.000,且每概念只有 16 槽(< seq 的 32)⟹ 容量解释被排除。

🔴 但 Δ 0.000 是构造性的,不得报作"抗遗忘"。非构造性的只有两条:
   只掩写入不够(−0.351 ≈ 不分区的 −0.361);修好它的那版容量更少。

⚠️ 代价 —— 全景文档新增第二条张力:**可隔离性 ↑ ⟹ 组合性 ↓**
   严格按概念分区保住了单概念(0.927, Δ 0.000)却把合取压到 0.653(合并训练 0.889)。
   ⟹「顺序到达 + 强组合」目前无解,已写进 §6(i) limitations。

顺带修两个工具缺陷:
  · memory_layer 加可选子区掩码(P5 结果 JSON 逐字节相同,向后兼容已验证)
  · 审计器在子目录下会扫到 0 份文档却打印 ✅(假放行)→ 路径锚到仓库根 + <10 份即拒绝结论

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
@oratis oratis changed the title research: Learning in Referencing — 11 轮调研 + 15 组实证,四性质端到端 + L4 参数化内化(含 21 处自我推翻) research: Learning in Referencing — 11 轮调研 + 16 组实证,四性质端到端 + L4 参数化内化(含 23 处自我推翻) Aug 3, 2026
@oratis

oratis commented Aug 3, 2026

Copy link
Copy Markdown
Owner Author

更正 + P7

🔴 先更正上一条评论里的一个数字

上一条我写「世界知识前置检查命中 1.00 ✅」。错的。 换 torch/transformers 环境重跑时发现,脚本实际打印的是:

red 3/4 · blue 3/4 · yellow 3/4 · green 2/4
平均 0.69 —— ⚠️ 世界知识不足,跨域结论受限

我把脚本的警告当成了通过。 而且判据也错——重犯了 P3 的 No 偏置坑(16 个正确颜色配对里 5 个 p_yes < 0.5,尽管负例低至 0.001)。改用阈值无关 AUC:0.891P6 结论不变,世界知识确实可用。

P6 本身在新环境下逐用户 16/16 完全复现(0.949 / 0.840 / 0.992 逐位相同)。

结构性防复发:新增 tools/probe_metrics.py。P3 的教训写进了报告但没变成代码,所以第二次照犯。


P7 — 「概念 ⊗ 概念」(I2 的最后一格)

同一用户学两个概念(颜色 + 材质,各自独立教学),探针问从未教过的合取句式 Is X both w1 and w2?

概念1 概念2 ★ min(两半)
base 0.510 0.444 0.479
L1 定义进上下文 0.997 0.997 0.986
L4 合并训练 0.812 0.889 0.889
L4 顺序·共享 32 槽 0.590 0.931 0.750
L4 顺序·子区(只掩梯度) 0.483 0.826 0.576
★ L4 顺序·子区(写入+检索都掩) 0.927 0.847 0.653
单概念策略 0.500

自我推翻 #22:初稿把单概念策略上界算成 0.500,实为 0.750。判据必须拆成 conj|¬w2conj|¬w1 两半取 min——单概念策略在此才必然 ≈ 0.5。裁决线设错会把单概念策略误判成组合。

🔴 自我推翻 #23:P5 的「分区解决了干扰」只对跨用户成立

同一分区内顺序写第二个概念会冲掉第一个:0.951 → 0.590(Δ −0.361)。

修法来自诊断而非猜测——子区版失败后(Δ −0.351,几乎等于不分区)先查:

检查 结果
w1 的槽 values 最大改动量 0.00e+00 → 梯度掩码有效,槽分毫未动
w1 探针 top-4 落在 w2 子区的比例 25% ← 决定性证据

分区必须同时作用于写入与检索。 P5 之所以成功,正因为那里检索本来就按 uid 掩了——子区破坏了这个对称性。双掩码后 Δ +0.000,且每概念只有 16 槽 < seq 的 32容量解释被排除

🔴 但 Δ 0.000 是构造性的,不得报作"抗遗忘"。非构造性的只有两条:只掩写入不够(−0.351 ≈ 不分区的 −0.361);修好它的那版容量更少。

⚠️ 代价:新的一条张力

可隔离性 ↑ ⟹ 组合性 ↓。严格按概念分区保住了单概念(0.927,Δ 0.000),却把合取压到 0.653(合并训练 0.889)。组合要两个概念在同一次检索里都被取到,隔离要它们永不相见——要求正好相反

「顺序到达 + 强组合」目前无解,已写进 §6(i)。另:L4 全线低于 L1(0.889 vs 0.986),参数化路线在组合上确有代价,未加掩饰。

五判据

判据 状态
I1 免检索 ✅ P5
I2 组合性 两种形态(P6 ⊗世界知识、P7 ⊗概念);否定/量化/多跳/同属性内两概念未测
I3 隐式触发 🔴 未测
I4 跨会话持久 ✅ P4/P5
I5 抗干扰 🔴 未测
隔离 ✅ 跨用户;◐ 用户内部需子区+双掩码,代价是组合性

顺带修了审计器一个缺陷:在子目录下跑会扫到 0 份文档却打印 ✅(假放行)→ 路径锚到仓库根,<10 份即拒绝给结论。

📌 p7/README.md

五判据最后两格。I5 ✅,I3 ❌,而后者的机制把前面所有结论统一了起来。

【I5 抗干扰 ✅】上下文塞进另一位老师的含义("in some dialects, w means …"):
     base 0.545 → 0.033   ← 关键对照:base 没有概念,照单全收,答案系统性反向
     L1   0.988 → 0.912   (−0.075)
     L4   0.960 → 0.910   (−0.050)  ⟹ 参数化比上下文注入更抗干扰
   base 那一行证明了干扰确实有效——L4 扛住不是因为模型没读它。

【I3 隐式触发 ❌】不问定义、要求去用(二选一行动题,训练中没有的句式):
     base 0.500 · L1 1.000 · 真词先验 1.000 · ★ L4 0.507   ⟹ 零迁移

🔴 判据在这里又错了一次:初版只报 accuracy(0.492),而伪词条件下模型 91% 选 A,
   阈值法被偏置钉死在 0.5。这是 P3(No 偏置) → P6(前置检查) → P8(A 偏置) 同一类
   仪器错误的第三次,且专为此抽出的 probe_metrics.auc 当时已 import、只用在了 I5 上。
   ⟹ 抽出工具还不够,判据必须在每个新度量上被显式选择一次。改 AUC 后结论不变,
      但那是运气不是方法。

★ 机制(先诊断,不猜)—— 否掉了"检索没取到":
     行动题 top-4 落在训练用过的槽的比例 : 0.750   ← 取到了
     cos(m(h), W_yes−W_no)              : +0.7926
     cos(m(h), W_A−W_B)                 : +0.0027   ← 近乎零
     两读出方向本身余弦                    : −0.0265
     ‖m(h_act)‖ = 14.279                             ← 不是太小,是方向不对
   ⟹ 记忆学的是"这个决策格式下往哪边推",不是概念。

★ P8b 回应显然的反驳「多训几种格式不就行了」——可证伪,测了:
     训 F1     : F1 0.960 · F2 0.555 · F3 0.755(held-out)
     训 F1+F2  : F1 0.902 · F2 0.795 · F3 0.645(held-out)
   加训 F2 使 F2 +0.240,却让 F3 −0.110、F1 −0.058 ⟹ 换方向,不是累加。
   更有力的是同序关系:只训 F1 时迁移量随读出方向余弦单调
     余弦 1.000 → 0.960 · +0.1065 → 0.755 · −0.0265 → 0.555 ≈ base
   ⚠️ 只有三个点,同序而已,不得写成拟合出来的定律。

🔑 这条回溯限定了 P5–P7:它们的训练与探针全在同一个读出方向内。
   P6 变的是表层内容、P7 变的是表层句式,读出方向都没变;P8 变的正是读出方向。
   ⟹ 精确主张只有一条:**概念能跨表层句式迁移,不能跨读出方向迁移**。
      「泛化 ✅ / 组合 ✅ / 隐式触发 ❌」是同一条机制的三个侧面。
      论文中每条结论都须带作用域「在教学所用的决策格式内」。

✅ 副产品:第一次给「中间层记忆」提供了实证动机(而非审美偏好)——
   P5 曾错误声明的"缺深度组合性"已被 P6 撤回,现在有了正确版本且是测出来的。
   ⚠️ 但中间层版本未做,不得声称它能解决。

诊断脚本入库(p8/diag_i3_mechanism.py、p7/diag_subpart_failure.py);
审计器加 #24 两条规则;Method 草稿 §5.8 + §6(i) 重写 + 禁令 13–15;
全景文档 L0–L5 表的 L4 行 I3=✓ 加硬前提。

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
@oratis oratis changed the title research: Learning in Referencing — 11 轮调研 + 16 组实证,四性质端到端 + L4 参数化内化(含 23 处自我推翻) research: Learning in Referencing — 11 轮调研 + 18 组实证;I3 不成立,机制=读出方向(含 24 处自我推翻) Aug 3, 2026
@oratis

oratis commented Aug 3, 2026

Copy link
Copy Markdown
Owner Author

P8 — 五判据最后两格:I5 ✅ / I3 ❌,且 I3 的机制把前面所有结论统一了

I5 抗干扰 ✅

上下文里塞进另一位老师的含义Note: in some dialects, w means <对方>.):

无干扰 无关长文 ★ 冲突定义 降幅
base 0.545 0.525 0.033 −0.513
L1 上下文注入 0.988 0.917 0.912 −0.075
L4 参数化记忆 0.960 0.953 0.910 −0.050

关键对照在 base 那一行:base 没有概念,那条注释是它唯一的定义来源,于是照单全收、答案系统性反向(0.033)。⟹ 干扰被证明有效,L4 扛住不是因为模型没读它。参数化比上下文注入抗干扰。

🔴 I3 隐式触发 ❌ —— 干净的负结果

不问定义,要求去用(二选一行动题,训练中从未出现的句式):

★ AUC accuracy 选 A 比例
base 0.500 0.488 0.910
L1 定义进上下文 1.000 0.988 0.496
真英语词先验 1.000 0.979 0.479
L4 参数化记忆 0.507 0.492 0.914

零迁移。 任务完全可解,参数化记忆没有任何效果。

🔴 判据在这里又错了一次:初版只报 accuracy,而伪词条件下模型 91% 选 A,阈值法被偏置钉死在 0.5。这是 P3(No 偏置) → P6(前置检查) → P8(A 偏置) 同一类仪器错误的第三次,而且专为此抽出的 probe_metrics.auc 当时已经 import、却只用在了 I5 上。改 AUC 后结论不变——但那是运气不是方法。⟹ 抽出工具还不够,判据必须在每个新度量上被显式选择一次

★ 机制:不是检索失败,是读出方向

观测 判读
行动题 top-4 落在训练用过的槽的比例 0.750 ✅ 检索取到了 ⟹ H_route 被否
cos(m(h), W_yes − W_no) +0.7926
cos(m(h), W_A − W_B) +0.0027 ← 近乎零
两读出方向本身的余弦 −0.0265 近乎正交
‖m(h)‖ 14.279 不是太小,是方向不对

记忆学的是「这个决策格式下该往哪边推」,不是概念。

P8b — 回应「那多训几种格式不就行了」

H_readout 对此有可证伪的预言,直接测:

F1 Yes/No F2 A/B F3 True/False(始终 held-out
base 0.540 0.550 0.510
L1 定义进上下文 0.960 1.000 1.000
L4 训 F1 0.960 0.555 0.755
L4 训 F1+F2 0.902 0.795 0.645

加训 F2:F2 +0.240,但 F3 −0.110、F1 −0.058 ⟹ 换方向,不是累加。

比裁决更有力的是同序关系——只训 F1 时,迁移量随读出方向余弦单调:

测试格式 与 F1 的余弦 AUC 相对 base
F1 Yes/No 1.000 0.960 +0.420
F3 True/False +0.1065 0.755 +0.245
F2 A/B −0.0265 0.555 +0.005 ≈ 0

⚠️ 只有三个点,顺序一致而已,不得写成拟合出来的定律。

🔑 这条回溯限定了 P5–P7

实验 变的是 结果
P6 跨域探针 表层内容 · 同读出方向 ✅ 0.949
P7 合取探针 表层句式 · 同读出方向 ✅ 0.889
P8 I3 读出方向 ❌ 0.507

精确主张只有一条:概念能跨表层句式迁移,不能跨读出方向迁移。
「泛化 ✅ / 组合 ✅ / 隐式触发 ❌」不是三个互不相干的结论,是同一条机制的三个侧面
论文中 P5–P7 每条结论都已加作用域「在教学所用的决策格式内」(禁令 13)。

✅ 副产品:中间层记忆第一次有了实证动机

P5 曾错误声明 final-layer memory「缺深度组合性」(已被 P6 推翻撤回)。现在有了正确版本,而且是测出来的:它只在输出层动手,学到的东西天然绑死在训练任务的读出方向上。⚠️ 但中间层版本未做,不得声称它能解决(禁令 15)。

五判据最终状态

判据 状态
I1 免检索 ✅ P5
I2 组合性 ✅ 两种形态(P6/P7)—— 限于同一读出方向内
I3 隐式触发 不成立(0.507),且不是调参能补的
I4 跨会话持久 ✅ P4/P5
I5 抗干扰 优于上下文注入
隔离 ✅ 跨用户 · ◐ 用户内部(需双掩码,代价是组合性)

📌 p8/README.md · 诊断脚本 p8/diag_i3_mechanism.py

oratis and others added 4 commits August 4, 2026 02:49
fig1 判据类型 × M′ 宽度分层 —— 压缩增益 0.915/0.883/0.766 vs 语义熵 0.269/0.137/0.507
fig2 五判据 × 参数化 vs 上下文注入 —— I3 那一格灰底标 fails
fig3 (a) 迁移量 vs 读出方向余弦  (b) 记忆插入位置(P9 跑完后自动补全)

🔴 出图时抓到一处会与正文打架的错:我先用了**配对胜率**,得核心域 0.958 / 0.208,
   而正文引用的是**汇总 AUC** 0.915 / 0.269 —— 两个不同的统计量。
   已改为与 p2_three_arm.py 的 report() 同一估计量,并加了闸门:
   图上的核心域数值若与 p2 自己产出的 summary 差 >1e-6 即 sys.exit 拒绝出图。

分层口径与 p2/README §3.2 严格一致(M′ 更窄 = G1 合取 + G2 范畴层级)。
灰度可读,不靠颜色区分;单栏 3.3in / 8pt。

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
⚠️ 本 commit 只落原始结果与脚本;**解释待 P9b 词绑定控制**(正在跑,见下)。

只训 F1 Yes/No,F2 A/B 与 F3 True/False 始终 held-out:

  插入位置            F1(训练)  F2      F3      跨方向均值
  base               0.540   0.550   0.510   0.530
  L1 定义进上下文       0.960   1.000   1.000   1.000
  ★ L7 全位置         0.945   0.935   0.945   0.940
  ◇ L7@last          0.820   0.565   0.600   0.583
  post-norm(=P5–P8)  0.970   0.555   0.770   0.663

✅ P8 的推论成立:中间层比 post-norm 高 +0.277,几乎追平上下文注入。

🔴 但控制条件否掉了「深度」这个解释:L7@last(同样在 L7、其上同样有 20 层去变换它,
   只是**仅改最后一个位置**)只有 0.583,**比 post-norm 还低 0.080**。
   ⟹ 增益来自**位置覆盖**——记忆必须改写**描述物体的那些 token** 的表征,
      而不是在决策点上加偏置。没有这个控制,这条结论会被一句话打掉。

🔴 而这恰好打开一个新漏洞:既然它改写物体表征,它可能只学会了「给蓝色物体打标」、
   根本没绑定到那个词。三种格式全过也解释得通。⟹ P9b 换词控制已启动,
   在它出结果之前**不写任何「学到了一个概念」的结论**。

工程:
· 正确性闸门 —— 批处理左填充必须显式传 position_ids,否则 rotary 整体移位;
  实测与逐条前向最大 logit 偏差 8.77e-05、argmax 5/5,不过闸门即 sys.exit。
· 每条件即时落盘 + --preload 合并(上一轮中断白跑 99 分钟的教训),
  合并时核验重算的 base/L1 与 preload 逐位相同(差 ≥1e-6 即拒绝)。
· 未测:L14/L21 深度曲线(单条件 ~99 分钟,本轮裁掉)。

fig3(b) 补全插入位置对比。

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
P9 说"概念能跨读出方向迁移"。那个结论有个明显漏洞我自己去堵,结果堵塌了。

控制:训练完全不变,**只把提示里的伪词换成另一位用户的伪词**,其余一字不改。

  插入位置      提示里的词        F1      F2      F3
  L7          本词            0.945   0.935   0.935
              ★ 换成别人的词     0.930   0.895   0.935     落差均值 0.018
  post-norm   本词            0.970   0.555   0.770
              ★ 换成别人的词     0.975   0.505   0.765     落差均值 0.017

⟹ **两个方案都不是"学会了一个词的含义",而是"给一类物体打了标"。**
   L7 的跨格式迁移之所以成立,正因为被打标的是**物体表征**——任何读出格式都能读到它。
   这与 P9 查到的"增益来自位置覆盖"完全自洽,但把结论的性质整个改变了。

🔴 波及范围:所有**每个用户只教一个概念**的实验(P5 I1、P6 I2⊗世界知识、P8 I5、P9)。
   在那些设置里,「w 指蓝色」与「给蓝色物体打标」**在训练集上外延完全相同**——
   梯度没有任何理由去关心那个词。**是实验设置欠定,不一定是方法的性质。**

★ 唯一可能的例外是 P7(每人两个词,同一物体在两词下标签不同,光打标不可能同时高分)。
  P9c 正在直接验这一点(三档换词:本词 / 换成同用户的另一个词 / 换成别人的词)。
  **在 P9c 出结果之前,不得写任何"学到了一个概念"的结论。**

工程:本轮把训练好的记忆存盘(P9 没存,导致这个控制不得不整个重训);权重不入库。

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
P9b 之后剩一个可能的辩解:单概念设置**欠定**(一个词时"w 指蓝色"与"给蓝色物体
打标"在训练集上外延完全相同,那个词是常量、零信息)。P7 的两词设置是唯一例外——
直接测,全部针对 w1 的探针与 w1 的标签:

  提示里用的词          F1      F2      F3
  w1(本词)          0.785   0.505   0.695
  ★ 换成同用户的 w2    0.790   0.570   0.645
  换成别人的词         0.790   0.515   0.675
  own − within      -0.005  -0.065  +0.050
  (前置:w2 自己的探针 0.890 —— 两个词都"学会"了,不是没学会导致的)

⟹ 两概念也逼不出词绑定。

★ 机制诊断(diag_word_independence.py)—— 两个方案因**不同原因**失败:
                          L7        post-norm
  m(h) 换词后余弦        0.99998      0.787
  路由命中槽重合率        1.000        0.957
  决策方向上的投影          —      +1.690 → +1.047
  ★★【正例−负例】投影差    —      +4.443 → +4.327(保留 97%)

  L7        路由层面就看不见那个词。
  post-norm 看得见词,但 AUC 只看排序,而判别分量保留 97% ⟹ 词只平移偏置。

🔴 我在这里差点得出相反结论:只看 m(h) 余弦 0.787 会判成"路由读到了词 ✅"。
   是补了"决策方向上的正负例投影差"才发现变化分量与判别正交。
   ⟹「输出变了」不等于「行为变了」;度量必须对准被解释的那个量。

措辞处置:
· REPORT 顶部加最高优先级警告 + §3.12 + 自我推翻 #25
· p5/p6/p7/p8 四页 README 加降级横幅
· Method 草稿加 SCOPE CORRECTION + §6(0) + 禁令 16/17
· 审计器加 #25 两条规则(中英各一),并把 🔴 补进 ALLOW
· 能站住的只有:「为每位对话者写入一个持久的、按分区隔离的、与词无关的物体级偏置」
· 不受影响:压缩增益门(P0–P4,概念以文本存在、词是显式的)、按对话者隔离(P3/P4)

修法方向(全部未做,不得声称已解决):键取在**词的 token 位置**而非整段末位;
让**两个词在同一物体上给出相反标签**(P9c 方向对但强度不够——两词问不同属性,
一个"红或木"的分级标就能同时糊弄过去);显式的词条件路由。

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
@oratis oratis changed the title research: Learning in Referencing — 11 轮调研 + 18 组实证;I3 不成立,机制=读出方向(含 24 处自我推翻) research: Learning in Referencing — 22 组实证;🔴 换词控制推翻了参数化记忆线的「概念」解读(25 处自我推翻) Aug 4, 2026
@oratis

oratis commented Aug 4, 2026

Copy link
Copy Markdown
Owner Author

🔴 P9 / P9b / P9c — 我把自己整条参数化记忆线推翻了

先是好消息:P8 的推论成立

把记忆从输出层移到中间层,跨读出方向迁移成立。而且控制条件查清了真正的原因:

插入位置 F1(训练) F2 F3 跨方向均值
base 0.540 0.550 0.510 0.530
L1 定义进上下文 0.960 1.000 1.000 1.000
L7 全位置 0.945 0.935 0.945 0.940
L7@last(只改最后位置) 0.820 0.565 0.600 0.583
post-norm(=P5–P8) 0.970 0.555 0.770 0.663

L7@last 同样在 L7、其上同样有 20 层,只是仅改最后一个位置0.583,比 post-norm 还低。⟹ 增益来自位置覆盖(改写描述物体的 token),不是深度

然后这条结论自己打开了漏洞,我去堵,堵塌了

既然它改写的是物体表征,就可能只学会了「给蓝色物体打标」、根本没绑定到那个词。控制:训练不变,只换提示里那个伪词

插入位置 本词 → 换成别人的词 落差均值
L7 0.945/0.935/0.935 → 0.930/0.895/0.935 0.018
post-norm 0.970/0.555/0.770 → 0.975/0.505/0.765 0.017

还剩一个辩解:单概念设置欠定(一个词时「w 指蓝色」与「给蓝色物体打标」在训练集上外延完全相同,那个词是常量、零信息)。P7 的两词设置是唯一例外——直接测,也不行

提示里用的词 F1 F2 F3
w1(本词) 0.785 0.505 0.695
换成同用户的 w2 0.790 0.570 0.645
own − within −0.005 −0.065 +0.050

前置:w2 自己的探针 0.890,两个词都"学会"了 ⟹ 不是没学会导致的。

机制:两个方案因不同原因失败

观测 L7 post-norm
m(h) 换词后余弦 0.99998 0.787
路由命中槽 换词后重合率 1.000 0.957
决策方向上的投影 +1.690 → +1.047
★★ 【正例−负例】投影差 +4.443 → +4.327(保留 97%)
  • L7:路由层面就看不见那个词
  • post-norm看得见词,但 AUC 只看排序,而判别分量保留 97% ⟹ 词只平移偏置。

🔴 我在这里差点判反:只看 m(h) 余弦 0.787 会得出"路由确实读到了词 ✅"。是补了决策方向上的正负例投影差才发现变化分量与判别正交。⟹「输出变了」不等于「行为变了」。

处置

必须撤回:参数化记忆线不得写"学会了一个词 / 建立了一个概念"。
能站住的只有:「为每位对话者写入一个持久的、按分区隔离的、与词无关的物体级偏置」。

受影响 不受影响
P5 I1 · P6 I2⊗世界知识 · P7 I2⊗概念 · P8 I5 · P9 跨读出方向 的概念性解读 压缩增益门(P0–P4)——那条线里概念以文本存在、词是显式的
按对话者隔离(P3/P4)——隔离的是分区,与绑定到什么无关

已落地:REPORT 顶部最高优先级警告 + §3.12 + 自我推翻 #25;p5–p8 四页 README 加降级横幅;Method 草稿加 SCOPE CORRECTION + §6(0) + 禁令 16/17;审计器加 #25 中英两条规则。

修法方向(全部未做,不得声称已解决):键取在词的 token 位置而非整段末位;让两个词在同一物体上给出相反标签(P9c 方向对但强度不够——两词问不同属性,一个"红或木"的分级标就能同时糊弄过去);显式的词条件路由。

📌 p9/README.md · 诊断 p9/diag_word_independence.py

Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Labels

None yet

Projects

None yet

Development

Successfully merging this pull request may close these issues.

1 participant