在这里插入图片描述

📖标题:Don’t lie to your friends: Learning what you know from collaborative self-play
🌐来源:arXiv, 2503.14481

🌟摘要

🔸为了成为有用的助手,人工智能代理必须意识到自己的能力和局限性。这包括知道何时从参数知识中回答问题,何时使用工具,何时信任工具输出,以及何时放弃或对冲。这种能力很难通过监督微调来教授,因为它们需要构建反映代理特定能力的示例。
🔸因此,我们提出了一种全新的方法来教授代理人他们所知道的东西:协作式自我游戏。我们构建了多智能体协作,在这种协作中,团队因集体得出正确答案而获得奖励。所需的元知识来自互动结构中内置的激励。我们关注的是能够访问异构工具(语料库特定检索)的小型代理团体,因此必须合作以最大限度地提高他们的成功率,同时尽量减少他们的努力。
🔸实验表明,在单独部署单个代理的环境中,多代理社区的组级奖励可以诱导策略转移,以改善工具使用和选择性预测。

🛎️文章简介

🔸研究问题:如何通过多智能体协作自我训练来提升大语言模型(LLM)在回答问题时的准确性与工具使用的效率,尤其是在不确定情况下的决策能力。
🔸主要贡献:论文提出了一种新的训练方法“协作自我训练”(CSP),通过多智能体系统的协作,促使智能体学习在合适的时机使用工具并在回答时进行信心校准,从而提高模型的整体表现。

📝重点思路

🔸提出多智能体协作自我训练(CSP),模型共享参数但在提示和工具访问上有所不同,旨在通过交互学习有效的工具使用和答案信心校准。
🔸智能体通过#ASK、#ANSWER和#HEDGE等动作进行互相沟通,实现信息的有效传递和信心的自我调节。
🔸使用强化自我训练(ReST)方法,模型在多轮次的回合中通过选择高奖励的回合进行微调。
🔸通过设计奖励函数,激励智能体在完成任务时以最小的成本(即工具调用次数)获得高准确率的答案。

🔎分析总结

🔸实验表明,使用CSP训练的智能体在回答准确性和工具使用效率上明显优于其他模型,尤其是在处理长尾问题时,优势更加明显。
🔸CSP智能体能够更好地判断何时使用搜索工具,从而减少无效搜索的次数,显著降低了搜索率。
🔸在答案校准方面,CSP方法使得智能体在面对不确定性时能够更好地进行#HEDGE动作,避免提供不准确的答案。
🔸在不同的数据集(BioASQ和PopQA)上测试,结果显示CSP智能体在任务表现上达到了更高的F1分数,证明了其有效性。

💡个人观点

论文为每个智能体设计了能力边界,通过动作进行一定范围内的调用,并对调用结果进行评估选出最佳策略,进而构建训练数据。

🧩附录

在这里插入图片描述
在这里插入图片描述

Logo