工作看板

现在在做什么,什么已经停了

这页只回答三件事:要解决什么问题,已经做到哪一步,为什么停。 状态以真实仓库的最新提交和未提交产物为准,不直接照抄工作区旧总表。

正在进行
3
已经停止
9
状态时间

本次核对没有修改任何源仓库。三个外部上游仓库的远端最新版与本地固定版本一致。

看板一

正在进行

下面三项都在真实仓库里有当天的新合同、代码或产物。

  1. 四项子门槛已过 主线

    Same-family ConflictBound

    要解决的问题

    几段过去经验互相冲突时,智能体要先判断哪段适合眼前情况, 再决定先检查哪里。评测还要防止模型只看一条记录就猜出答案。

    现在到哪了

    四项新构造都已有可重放结果:18,432 条模型输入; 12 组成对的噪声和检查失败题;一套三动作、三结果的新机制; 以及 32、64、96 条长记忆。最新报告记录 91 项测试通过。

    1. 已完成 模型输入、噪声和失败、第二种机制、长记忆这四个子门槛都通过。
    2. 正在做 把四项结果放进一份总验收,确认它们合在一起仍满足原合同。
    3. 还不能做 各报告都明确说“只通过本子项”。总验收没有落盘前, 不跑付费模型,也不能说完整门槛已经通过。
    最新证据
    memory-research-workspace @ 9c1b81a,另有 22:06 前的未提交结果
    当前硬阻塞
    长记忆仍能被规则匹配,第二种机制也只有一个形式例子
  2. 正在把关系写成自然话 窄问题继续

    Echoes Aren’t Experience

    要解决的问题

    记忆系统会不会把“同一次经历被讲了五遍”当成“五次独立经历”, 然后把一次选择误当成稳定偏好。

    现在到哪了

    关系构造和验证门槛已经提交。它能从公开关系分清一件事、五件事和无法判断, 还保持各类事实数量一样。新的文献复核也把贡献缩到一个很窄的 “同一次经历还是多次经历”压力测试。

    1. 已完成 找出旧数据泄漏,冻结关系构造,并把宽版偏好轨迹主张否掉。
    2. 正在做 先用“因果交接加互斥结局”做一个饮料场景。本地锁死事实和答案, 模型只能改写句子。
    3. 还不能做 新文字没有通过结构、语义和公开审查前,不再付费生成, 也不跑 RecMem、LangMem。
    最新证据
    eventidentitymem @ b4200cb,另有候选模板和改写协议未提交
    当前硬阻塞
    精确关系很容易写成规则表,还没证明能写成自然对话
  3. 运行前检查 新研究 EU1

    WitnessGuard:EnactToM EU1

    要解决的问题

    当接收者已经在真实提示中看到关键事实,它会不会还是做错那个依赖事实的动作。 对照组从一开始就看到全部事实。

    现在到哪了

    已固定 13 个任务。静态检查确认,两组在第一次能做物理动作前拥有同一组事实。 运行前实现已经完成。分析器测试 46/46、EU1 联合测试 108/108, 整个仓库 622 项测试通过,另有 3 项原有测试跳过。

    1. 已完成 13 个任务、运行器、分析器、反例检查和本地测试全部完成。付费调用为 0。
    2. 正在做 提交这份准确状态,把同一提交复制到 WSL,再做四路零调用试跑。
    3. 还不能做 最新放行审计仍是“需要修改”。干净提交、干净的 WSL 副本、 四路零调用试跑没有完成前,不能开始付费小试。
    最新证据
    witnessguard @ d6adf1b,另有 22:07 前的未提交 EU1 工作
    下一道门
    先做 4 个只看技术问题的付费小试,再决定是否跑完 26 个任务组

看板二

已经停止

“整条方向停止”和“旧路线停止”不是一回事。 有窄问题继续时,这里会直接写明。

整条宽方向停止

Broad EventIdentityMem

为什么停

“几段文字是不是同一件真实事件”已有事件共指研究; “重复来源不能算独立证据”也已有真值发现、复制检测和来源追踪研究。 原来的宽说法没有留下新的记忆问题。

仍在继续:更窄的“同一次经历被重复计算”问题。

旧数据路线停止

EventIdentityMem v1–v5 和一站式出题

为什么停

v1–v4 可以靠模板猜答案,对“不确定”样本也判断不好。 v5 的一件事或五件事只写在私有编号里,公开文字没有证据, 反而可以靠“一个话题还是多个话题”来猜。后来让模型一次写文字、 关系、私有编号和答案,又产生 185 个硬错误。

处理:不跑系统,改做公开关系可验证的 v6。

宽版论文主张停止

Experience-root trajectory 宽版

为什么停

“跨会话累积行为,形成偏好,再用于推荐、工具或主动动作”已经被近期工作覆盖。 这里还能研究的只剩一个窄问题:这些记录来自同一次经历,还是多次独立经历。

仍在继续:把这个窄差别加进现有偏好记忆评测。

旧构造停止

ConflictBound stock / static / v0.1

为什么停

stock 评分器没有说明眼前情况为什么有最终决定权; v0.1 用固定检查就能 24 次全对,场景也不自然; 二元 static 版最后只是查表。

仍在继续:升级后的多候选、两步、长记忆版本。

论文路线停止

WitnessGuard protocol benchmark

为什么停

多代 protocol 都能被短规则 100% 解出,而且这些规则不用读取目标记忆。 这个评测不能证明记忆机制有用。

扩大实验停止

EnactToM R1 / R2 原扩展

为什么停

六个任务里只有一个干净例子。 它从 1/3 提高到 3/3,但没有达到三个案例、两种决定方式的预设要求。 不能说成稳定的跨任务效果。

后来的 EU1 是新问题、新合同,不是继续放大旧结果。

旧研究停止

EnactToM ED1 送达失败研究

为什么停

静态复核发现,关键事实会在 24 个任务中的 23 个里提前送达。 旧门槛却要求至少 5 个“没有送达”的案例,所以数学上最多只有 1 个, 门槛不可能通过。付费调用为 0。

项目停止

CAC 2.0

为什么停

它要求两套公开任务都能真的执行后续动作并检查结果。 MemoryArena 只给后续计划文本打分,不执行动作; PM-Bench 只有一套合格的动作表面。240 次小试因此取消。

独立项目停止

Pure Visual Prospective Memory

为什么停

现有工作已经覆盖视频流里的新增、修改、取消、主动触发和多任务管理。 当前视频本身还常常带着提示和答案,模型可能完全绕过过去的意图记录。

ActPM / EmbodiedPM 只是搁置,不算已经否定。

状态来源

这页按什么判断

先看真实仓库

ConflictBound 看当前 benchmark 目录;EventIdentityMem 和 WitnessGuard 看各自源仓库的提交、工作树改动、最新审计和最新产物。

再看工作区总表

topics/README.mdDECISION_LOG.md 用来找题目和历史结论。两者比源仓库旧时,以源仓库为准。

上游版本也要核对

Mem2ActBench、EnactToM 代码和 EnactToM 300 数据的远端最新版, 本次都与本地固定版本一致。

本次核对的版本
Mem2ActBench
b007269
EnactToM
093c4a1
EnactToM 300 数据
d3c61ab