AI 智能体在企业业务场景落地过程中的好坏与架构设计的工程化能力密切相关,特别是:总体架构分层设计、AI 智能体协作模式设计、MCP 工具调用标准化设计、AI 智能体编排框架设计等4个维度,本文结合我们实际落地的工程实践视角,来展开剖析。

img

下文我们详细剖析之。

*1.AI 智能体总体架构分层设计*

下图展示了 AI 大模型时代和微服务时代技术架构分层设计的简单对比,主要是为了明确领域层和基础设施层的架构设计范围。

img

在 AI 大模型时代,架构设计主要包括:AI 智能体的抽象定义、Tool 的抽象定义、业务 Prompt 的设计、业务数据的供给、经过微调的大模型以及完整的评测集。

明确这些架构设计分层技术目的是为了让业务产品的开发和接入更多地围绕这些关键部分展开。AI 智能体平台需要提供与之配套的服务能力,比如:AI 智能体注册与编排能力、Tool 接入能力、Prompt 调试能力、大模型微调能力和测评能力。

*2.AI 智能体协作模式设计*

1、互联网架构的演变

如下图所示,过去的互联网架构经历了从单体服务到微服务/云原生的架构演变。这种架构演变本质上是对业务系统高内聚低耦合的实践。比如:一次优惠活动的创建,可能涉及营销、库存、限购、商品等多个领域,每个领域都有不同程度的参与。随着单个领域的业务知识不断膨胀,以及行业需求的不断迭代,推动了我们对系统和服务进行拆分。

img

在微服务实践中,我们在统一的系统编排框架(比如:Spring Cloud Alibaba)下进行交互,领域之间的互联通过服务接口进行。因此,在 AI 时代,未来的系统交付物可能不再是某个服务,而是某个 AI 智能体。AI 智能体与传统接口的最大区别在于,它可能涉及多轮交互,而不仅仅是简单的输入输出。因此,协议设计需要考虑多轮交互来完成任务。同时,像服务注册与发现这类能力,仍然具有很高的参考价值。

img

2、AI 智能体架构的演进路径

在 AI 智能体系统的发展中,也会有类似的架构演进路径。最初,一个 AI 智能体可能会逐渐变得功能强大,但随着领域知识的积累和复杂度的增加,会催生出更多的 AI 智能体来共同完成某个任务。这种从单体 AI 智能体到多 AI 智能体协作的演进是必然的。

img

3、多 AI 智能体协作模式

既然从单体 AI 智能体到多 AI 智能体协作是必然的演进规律,那么就有必要关注多 AI 智能体协作模式。以下是多 AI 智能体协作的核心内容

  • 任务分配机制

    • 集中式任务分配
    • 分布式任务协商
    • 基于角色的任务划分
    • 动态任务重分配
  • 协作方式

    • 平行协作:多 AI 智能体并行解决问题
    • 层级协作:管理 AI 智能体统筹下级 AI 智能体
    • 专家协作:不同领域 AI 智能体联合解决问题
  • 冲突解决

    • 基于优先级的决策
    • 投票机制
    • 仲裁 AI 智能体介入
    • 基于规则的冲突处理

当前市面上关于多 AI 智能体协作的讨论,主要围绕任务的解决展开,包括任务分发、任务处理和任务结果回收。这也是 A2A 协议引入“任务”这个概念的原因。

A2A Main Graphic

4、多 AI 智能体协作架构设计

下图是对多 AI 智能体协作架构设计的一个简化理解。从业务主 AI 智能体出发,需要基于任务中心恢复当前任务上下文,继续本次任务的处理。接着通过 AI 智能体仓库找到需要协同的 AI 智能体。我们通过多 AI 智能体交互协议与其他协作 AI 智能体交互,并在主 AI 智能体的业务流程中完成结果决策或子 AI 智能体的状态透传。

img

这套多 AI 智能体架构设计也呼应了前面提到的,AI 智能体可以是任意一个能够完成一定范围内人类任务的系统,只要它能在我们的业务流程中参与协同并解决一类问题。它可以是“一行 Hello World 代码”,也可以是一个复杂的交互系统。同样,基于“万物皆 AI 智能体”的思路,MCP 工具服务也可以抽象成一个 AI 智能体,并且可以在这一层做一些额外的事情,比如:鉴权、参数校验等。

*3.MCP 工具调用标准化设计*

AI 智能体在企业落地中,Tool 的抽象也比较关键,尤其通过 Tool 来扩展和增强大模型的能力边界。现在,虽然 MCP 已经成为行业标准,但是当前 MCP 协议整体还比较薄,需要进一步工程化的架构设计能力来增强,特别是:公网/内网级的权限控制、用户态的权限控制、工具快速接入能力、长工具列表优化等工程化,如下图所示:

img

1. 公网/内网级的权限控制

单体服务向微服务转变后,会抽象出许多只在公司内部供给能力的领域。因此,工具和 AI 智能体需要在公网和内网的维度进行隔离。当前的 MCP 服务是基于公网的协议,这意味着内网的 MCP 服务需要有统一的网关层来收口,并根据请求类型提供相应的工具集

2. 用户态的权限控制

当前的 MCP 协议没有用户态信息,这会导致一些只对特定用户开放的工具无法进行用户级的鉴权。因此,需要在用户态信息层面补充 MCP。对于公司来说,用户态信息可以是多类型的,比如:电商用户、外卖用户、公司员工等。有了这层信息后,业务工具可以在自己的服务内部进行鉴权行为。与传统应用不同,面向大模型的服务最好在工具供给这一层就做好权限控制,用户没有权限的工具直接对大模型不可见,以避免请求后无法获取数据的错误。

3. 工具快速接入能力

从零开发一个 MCP Server 对业务团队来说是有一定工作量的。开发框架(比如:Spring AI Alibaba)支持零代码一键转 MCP Server,这就是一种工具快速接入的能力。除了开发框架外,还有很多业务团队常用的接入诉求,比如:SLS 日志查询的接入、表读取的接入、服务的接入等。这些能力可以快速支撑起一个简单的应用场景。对于公司的 MCP 中心,如果能够支持这种工具接入的收敛,可以提高业务应用建设的效率。

4. 长工具列表优化

随着业务系统的复杂性提升,一个 AI 智能体系统依赖的工具可能会显著增加。对于业务侧来说,需要让工具更加内聚和简单。对于 MCP 中心来说,可以通过一些更通用的工程化手段来处理,比如:在服务发现的末端,基于用户的请求前置过滤一些与本次无关的工具,可以通过向量相似性或 LLM 来处理。这种二阶段工具匹配的做法不仅可以减少长任务下的上下文长度,还能提高工具匹配的准确性。

*4.AI 智能体编排框架设计*

下图很好地总结了 AI 智能体编排框架的分层设计。除了前面提到 AI 智能体协作构建模式和既定的工具调用标准(MCP),AI 智能体在企业落地过程中还需要引入问题理解、关键记忆召回、知识库增强、评测等能力。

img

基于这些能力,AI 智能体平台衍生出了以下关键模块:知识库的管理与干预、模型市场中心、记忆管理、链路追踪、评测管理与微调能力。这些关键模块每一个都可以深入剖析,改天再来详细剖析。

img

如何学习大模型 AI ?

由于新岗位的生产效率,要优于被取代岗位的生产效率,所以实际上整个社会的生产效率是提升的。

但是具体到个人,只能说是:

“最先掌握AI的人,将会比较晚掌握AI的人有竞争优势”。

这句话,放在计算机、互联网、移动互联网的开局时期,都是一样的道理。

我在一线互联网企业工作十余年里,指导过不少同行后辈。帮助很多人得到了学习和成长。

我意识到有很多经验和知识值得分享给大家,也可以通过我们的能力和经验解答大家在人工智能学习中的很多困惑,所以在工作繁忙的情况下还是坚持各种整理和分享。但苦于知识传播途径有限,很多互联网行业朋友无法获得正确的资料得到学习提升,故此将重要的AI大模型资料包括AI大模型入门学习思维导图、精品AI大模型学习书籍手册、视频教程、实战学习等录播视频免费分享出来。

在这里插入图片描述

第一阶段(10天):初阶应用

该阶段让大家对大模型 AI有一个最前沿的认识,对大模型 AI 的理解超过 95% 的人,可以在相关讨论时发表高级、不跟风、又接地气的见解,别人只会和 AI 聊天,而你能调教 AI,并能用代码将大模型和业务衔接。

  • 大模型 AI 能干什么?
  • 大模型是怎样获得「智能」的?
  • 用好 AI 的核心心法
  • 大模型应用业务架构
  • 大模型应用技术架构
  • 代码示例:向 GPT-3.5 灌入新知识
  • 提示工程的意义和核心思想
  • Prompt 典型构成
  • 指令调优方法论
  • 思维链和思维树
  • Prompt 攻击和防范

第二阶段(30天):高阶应用

该阶段我们正式进入大模型 AI 进阶实战学习,学会构造私有知识库,扩展 AI 的能力。快速开发一个完整的基于 agent 对话机器人。掌握功能最强的大模型开发框架,抓住最新的技术进展,适合 Python 和 JavaScript 程序员。

  • 为什么要做 RAG
  • 搭建一个简单的 ChatPDF
  • 检索的基础概念
  • 什么是向量表示(Embeddings)
  • 向量数据库与向量检索
  • 基于向量检索的 RAG
  • 搭建 RAG 系统的扩展知识
  • 混合检索与 RAG-Fusion 简介
  • 向量模型本地部署

第三阶段(30天):模型训练

恭喜你,如果学到这里,你基本可以找到一份大模型 AI相关的工作,自己也能训练 GPT 了!通过微调,训练自己的垂直大模型,能独立训练开源多模态大模型,掌握更多技术方案。

到此为止,大概2个月的时间。你已经成为了一名“AI小子”。那么你还想往下探索吗?

  • 为什么要做 RAG
  • 什么是模型
  • 什么是模型训练
  • 求解器 & 损失函数简介
  • 小实验2:手写一个简单的神经网络并训练它
  • 什么是训练/预训练/微调/轻量化微调
  • Transformer结构简介
  • 轻量化微调
  • 实验数据集的构建

第四阶段(20天):商业闭环

对全球大模型从性能、吞吐量、成本等方面有一定的认知,可以在云端和本地等多种环境下部署大模型,找到适合自己的项目/创业方向,做一名被 AI 武装的产品经理。

  • 硬件选型
  • 带你了解全球大模型
  • 使用国产大模型服务
  • 搭建 OpenAI 代理
  • 热身:基于阿里云 PAI 部署 Stable Diffusion
  • 在本地计算机运行大模型
  • 大模型的私有化部署
  • 基于 vLLM 部署大模型
  • 案例:如何优雅地在阿里云私有部署开源大模型
  • 部署一套开源 LLM 项目
  • 内容安全
  • 互联网信息服务算法备案

学习是一个过程,只要学习就会有挑战。天道酬勤,你越努力,就会成为越优秀的自己。

如果你能在15天内完成所有的任务,那你堪称天才。然而,如果你能完成 60-70% 的内容,你就已经开始具备成为一名大模型 AI 的正确特征了。

这份完整版的大模型 AI 学习资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费

在这里插入图片描述

Logo

更多推荐