工作看板
现在在做什么,什么已经停了
这页只回答三件事:要解决什么问题,已经做到哪一步,为什么停。
状态以真实仓库的最新提交和未提交产物为准,不直接照抄工作区旧总表。
- 正在进行
- 3 项
- 已经停止
- 9 项
- 状态时间
本次核对没有修改任何源仓库。三个外部上游仓库的远端最新版与本地固定版本一致。
下面三项都在真实仓库里有当天的新合同、代码或产物。
-
要解决的问题
几段过去经验互相冲突时,智能体要先判断哪段适合眼前情况,
再决定先检查哪里。评测还要防止模型只看一条记录就猜出答案。
现在到哪了
四项新构造都已有可重放结果:18,432 条模型输入;
12 组成对的噪声和检查失败题;一套三动作、三结果的新机制;
以及 32、64、96 条长记忆。最新报告记录 91 项测试通过。
-
已完成
模型输入、噪声和失败、第二种机制、长记忆这四个子门槛都通过。
-
正在做
把四项结果放进一份总验收,确认它们合在一起仍满足原合同。
-
还不能做
各报告都明确说“只通过本子项”。总验收没有落盘前,
不跑付费模型,也不能说完整门槛已经通过。
- 最新证据
memory-research-workspace @ 9c1b81a,另有 22:06 前的未提交结果
- 当前硬阻塞
- 长记忆仍能被规则匹配,第二种机制也只有一个形式例子
-
要解决的问题
记忆系统会不会把“同一次经历被讲了五遍”当成“五次独立经历”,
然后把一次选择误当成稳定偏好。
现在到哪了
关系构造和验证门槛已经提交。它能从公开关系分清一件事、五件事和无法判断,
还保持各类事实数量一样。新的文献复核也把贡献缩到一个很窄的
“同一次经历还是多次经历”压力测试。
-
已完成
找出旧数据泄漏,冻结关系构造,并把宽版偏好轨迹主张否掉。
-
正在做
先用“因果交接加互斥结局”做一个饮料场景。本地锁死事实和答案,
模型只能改写句子。
-
还不能做
新文字没有通过结构、语义和公开审查前,不再付费生成,
也不跑 RecMem、LangMem。
- 最新证据
eventidentitymem @ b4200cb,另有候选模板和改写协议未提交
- 当前硬阻塞
- 精确关系很容易写成规则表,还没证明能写成自然对话
-
要解决的问题
当接收者已经在真实提示中看到关键事实,它会不会还是做错那个依赖事实的动作。
对照组从一开始就看到全部事实。
现在到哪了
已固定 13 个任务。静态检查确认,两组在第一次能做物理动作前拥有同一组事实。
运行前实现已经完成。分析器测试 46/46、EU1 联合测试 108/108,
整个仓库 622 项测试通过,另有 3 项原有测试跳过。
-
已完成
13 个任务、运行器、分析器、反例检查和本地测试全部完成。付费调用为 0。
-
正在做
提交这份准确状态,把同一提交复制到 WSL,再做四路零调用试跑。
-
还不能做
最新放行审计仍是“需要修改”。干净提交、干净的 WSL 副本、
四路零调用试跑没有完成前,不能开始付费小试。
- 最新证据
witnessguard @ d6adf1b,另有 22:07 前的未提交 EU1 工作
- 下一道门
- 先做 4 个只看技术问题的付费小试,再决定是否跑完 26 个任务组
“整条方向停止”和“旧路线停止”不是一回事。
有窄问题继续时,这里会直接写明。
整条宽方向停止
Broad EventIdentityMem
为什么停
“几段文字是不是同一件真实事件”已有事件共指研究;
“重复来源不能算独立证据”也已有真值发现、复制检测和来源追踪研究。
原来的宽说法没有留下新的记忆问题。
仍在继续:更窄的“同一次经历被重复计算”问题。
旧数据路线停止
EventIdentityMem v1–v5 和一站式出题
为什么停
v1–v4 可以靠模板猜答案,对“不确定”样本也判断不好。
v5 的一件事或五件事只写在私有编号里,公开文字没有证据,
反而可以靠“一个话题还是多个话题”来猜。后来让模型一次写文字、
关系、私有编号和答案,又产生 185 个硬错误。
处理:不跑系统,改做公开关系可验证的 v6。
宽版论文主张停止
Experience-root trajectory 宽版
为什么停
“跨会话累积行为,形成偏好,再用于推荐、工具或主动动作”已经被近期工作覆盖。
这里还能研究的只剩一个窄问题:这些记录来自同一次经历,还是多次独立经历。
仍在继续:把这个窄差别加进现有偏好记忆评测。
旧构造停止
ConflictBound stock / static / v0.1
为什么停
stock 评分器没有说明眼前情况为什么有最终决定权;
v0.1 用固定检查就能 24 次全对,场景也不自然;
二元 static 版最后只是查表。
仍在继续:升级后的多候选、两步、长记忆版本。
论文路线停止
WitnessGuard protocol benchmark
为什么停
多代 protocol 都能被短规则 100% 解出,而且这些规则不用读取目标记忆。
这个评测不能证明记忆机制有用。
扩大实验停止
EnactToM R1 / R2 原扩展
为什么停
六个任务里只有一个干净例子。
它从 1/3 提高到 3/3,但没有达到三个案例、两种决定方式的预设要求。
不能说成稳定的跨任务效果。
后来的 EU1 是新问题、新合同,不是继续放大旧结果。
旧研究停止
EnactToM ED1 送达失败研究
为什么停
静态复核发现,关键事实会在 24 个任务中的 23 个里提前送达。
旧门槛却要求至少 5 个“没有送达”的案例,所以数学上最多只有 1 个,
门槛不可能通过。付费调用为 0。
项目停止
CAC 2.0
为什么停
它要求两套公开任务都能真的执行后续动作并检查结果。
MemoryArena 只给后续计划文本打分,不执行动作;
PM-Bench 只有一套合格的动作表面。240 次小试因此取消。
独立项目停止
Pure Visual Prospective Memory
为什么停
现有工作已经覆盖视频流里的新增、修改、取消、主动触发和多任务管理。
当前视频本身还常常带着提示和答案,模型可能完全绕过过去的意图记录。
ActPM / EmbodiedPM 只是搁置,不算已经否定。
先看真实仓库
ConflictBound 看当前 benchmark 目录;EventIdentityMem 和 WitnessGuard
看各自源仓库的提交、工作树改动、最新审计和最新产物。
再看工作区总表
topics/README.md 和 DECISION_LOG.md
用来找题目和历史结论。两者比源仓库旧时,以源仓库为准。
上游版本也要核对
Mem2ActBench、EnactToM 代码和 EnactToM 300 数据的远端最新版,
本次都与本地固定版本一致。
本次核对的版本
- Mem2ActBench
b007269
- EnactToM
093c4a1
- EnactToM 300 数据
d3c61ab