登录社区云,与社区用户共同成长
邀请您加入社区
UCM领读计划 欢迎加入 UCM 社区“领读计划”第 01 期。本期我们共同解析 《Sparse Attention Across Multiple-Context KV Cache》。这篇论文针对 KV Cache 在多上下文下的复杂调度,提出了一套行之有效的稀疏注意力方案。我们将拨开算法的迷雾,解析其如何精准切入并优化大模型推理中的性能瓶颈。 论文信息 论文名称:Sparse Attentio
如何有效地生成和使用常识知识图谱,以更好地理解和服务电子商务平台用户的意图。人类反馈与知识优化:人类标注(Human-in-the-Loop)LLMs+human-in-the-loop结合的常识知识生成。知识生成与质量控制问题(与真实偏好一致、避免噪声和错误传播)现有电子商务知识图谱的局限性(忽略了对用户意图的深度挖掘)用户中心的常识知识图谱构建(如何围绕用户行为和意图来构建)常识知识的生成与服
开发基于因果图的最优干预策略智能体(Intervention Agent),实现不确定性最小化的主动学习;提出拓扑自适应的图通信与角色涌现机制(Graph-Comm MARL),设计基于图匹配与拍卖理论的资源分配智能体(Graph-Matching Agents),优化复杂环境下的多智能体协作效率。建立图逻辑约束与策略屏蔽的安全执行框架(Shielded Graph Agent),设计可证明的图规
关键在于依据具体任务选择合适的技术组合:若需要多智能体协作,则选择多智能体强化学习(MARL);最新的技术不一定是最适合的,找到契合项目需求的技术路线才是关键所在!该方向极具研究价值,尤其是大语言模型指导下的多智能体系统,极大地提升了协作的智能化程度。当前采用Transformer架构处理智能体间的通信,借助注意力机制使智能体能够更精准地理解彼此意图。结合行为经济学的多智能体强化学习,在样本效率方
强化学习(RL)在赋予机器人自主获取复杂操作技能方面具有巨大潜力,但在真实世界环境中实现这一潜力仍然充满挑战。我们提出了一种基于视觉的、引入人类反馈的强化学习系统,该系统在一系列灵巧操作任务上展现出了卓越的性能,包括动态操作、精密装配和双臂协调。我们的方法结合了示范学习和人类修正、高效的强化学习算法以及其他系统级设计选择,从而能够在仅1至2.5小时的训练时间内学习出近乎完美的成功率和快速的循环时间
该架构在智能制造、集群无人机、分布式医疗诊断及动态风控等场景中展现出强大潜力,重新定义了复杂环境下的多智能体协作范式。在智能空战决策等复杂场景中,该框架在保持决策质量的同时将计算复杂度降低数个数量级,为实时群体决策提供新范式。在复杂游戏与动态策略优化中,该方案使收敛速度达到传统DQN方法的2-3倍,特别适合非稳态环境下的快速适应。FedGAT 模型通过自监督学习从无标注图数据中提取高层次语义表示。
针对传统习题导向知识点标注难以反映学生编程个体差异、单智能体无法高效处理大规模代码的问题,本文提出基于多智能体协作的C语言学生代码知识点自动标注方法。构建“语句层-代码块层-函数层”三层次知识点体系,设计由知识点标注、任务分析、整合反馈智能体组成的协作系统(含自检迭代机制)。基于363份大一新生C语言代码实验,对比直接使用LLM的基线方法,多智能体方法(Proposed-MAS-R)在完整性(4.
本文解决了一个多智能体协作导航问题,即多个智能体在未知环境中协同工作,在不发生碰撞的情况下到达不同的目标,并最大限度地减少它们花费的最大导航时间。 典型的基于强化学习的解决方案直接将协作导航策略建模为steering policy。 然而,当每个智能体不知道要前往哪个目标时,这种方法可能会延长收敛时间并降低整体性能。 为此,我们将导航策略建模为**动态目标选择策略和碰撞避免策略**的组合。 奖励函
我们关注的问题是在一个模拟仓库环境中,多台机器人并行尝试解决穿越杂物的到达(reaching through clutter)问题。在这样的环境下,我们研究了通过引入人机交互(human-in-the-loop)为机器人规划器提供指导所能带来的性能提升。这些操作问题对自主规划器而言极具挑战性,因为它们必须在高维空间中搜索解决方案。此外,物理模拟器存在不确定性问题:在仿真中有效的轨迹在现实世界执行时
《LLM-based Agentic Reasoning Frameworks: A Survey from Methods to Scenarios》(2025)。是目前关于 LLM驱动的智能体(Agent)推理框架最系统、最前沿的综述之一。它系统梳理了近年来基于大语言模型(LLM)的智能体推理框架(Agentic Reasoning Frameworks)的研究进展,提出了一个统一的分类体系(
本文提出FACT-AUDIT框架,通过多智能体协作动态评估大语言模型(LLMs)的事实核查能力。该框架采用原型模拟、事实验证与自适应更新三阶段流程,覆盖复杂声明、假新闻等场景,并引入IMR、JFR等指标。实验评估13个主流LLMs,结果显示GPT-4o和Qwen2-72B表现最优,但LLMs在复杂声明场景仍有明显不足。该框架突破了传统静态评估的局限,实现了对LLMs事实核查能力的全面审计。