已验证效果

以下是真实调用 LLM(DeepSeek)跑出来的结果,不是模拟或精选的数字。目前也还比不过这个赛道头部玩家公开的数字——我们把这一点直接说清楚,而不是靠一个好看的标题数字带过去。

LoCoMo

LoCoMo-10(conv-26 前 150 轮,84 条问答对)。

Recall@10(正确的证据轮次有没有进入上下文) 52.4%
Accuracy — 严格子串匹配 19.0%
Accuracy — LLM 语义评判(措辞不同但语义正确也算对) 44.0%

没有回避的那个 trade-off

修复前的版本准确率更低,但 Recall@10 更高(62.0%)。一个把日期折叠进抽取谓语的修复(让「我什么时候说过 X」这类问题能被回答)用一部分检索召回率换来了真实的 +14.3 个百分点准确率提升——而且没有止步于「准确率变好了」就收工,而是去查清楚了 Recall 为什么会掉:日期折叠指令有时会误触发在没有信息量的寒暄上(「谢谢!」被折成「在 2023 年 7 月 3 日道谢」),这些额外的低价值三元组会挤占固定 top_k=10 检索窗口里真正相关三元组的名额。

LongMemEval

xiaowu0162/longmemeval-cleaned,oracle 变体,500 题中的前 10 题。

Recall@10 100%(10/10)
Accuracy — 严格子串匹配 30%
Accuracy — LLM 语义评判 80%

这些数字为什么需要局限性说明,而不是只看标题数字