跳到正文
原文
Berkeley AI Research·· 2026-07-26精选AI 评分62

ABBEL:用自然语言信念状态监督提升长程交互的摘要学习效率

Teaching LLMs to Update Beliefs for Efficient Long-Horizon Interaction

AI 导读

Berkeley AI Research 提出 ABBEL 框架,将递归摘要建模为自然语言信念状态并对其内容进行监督,以提升长程交互中的学习效率。在 CollabBench 协作编码中,基于重建的信念评分将全上下文模型的性能差距缩小约一半,训练步数从 100 减至 50;在 Combination Lock 中,结合领域知识的评分器使学习效率超过全上下文模型。

推荐理由

原文给出了 ABBEL 框架在三个环境上的量化结果,读者可据此判断信念状态监督相比传统递归摘要的实际收益。

来源:Berkeley AI Research · bair.berkeley.edu