研究团队发布 InMind 基准,包含 125 个专家验证任务,测试智能体记忆系统处理隐式关联的能力。当关键记忆直接放入上下文时,骨干模型能回答 84.0% 的间接查询;但通过六种记忆系统检索时,命中率最高仅 14.4%,尽管这些系统直接召回准确率可达 100%。失败根源在于查询驱动的检索接口本身,将"路由--决定哪些事实必须保持可见"确立为核心开放问题。
查看原文:https://arxiv.org/abs/2607.24368
来源:HuggingFace Daily Papers(社区热门论文)
未经允许不得转载:AI之家 » InMind 基准揭示智能体记忆系统的隐式关联盲点



