你真的了解AI Agent吗?深入浅出一文读懂!
引言
AI Agent,直接翻译过来叫人工智能代理,虽然笔者从实际业务场景中能体会到代理所代表的含义,但是从准确性和传播性上来说,我更愿意把他叫做AI应用程序,本文剩余部分会直接用“AI应用程序”指代“AI Agent”。
AI发展的历史脉络
假如把人类的所有知识看成一个圈,那么每时每刻,前沿的科学家们都在知识圈内推动边界向外扩展,这一探索过程缓慢而艰难。不过当某个探索的方向一旦确定有效,也就是路线正确了,那么很快所有的科研力量会热情的从这一突破点撕开一条口子,迅速地扩大,再通过学科间的协同,最终实现整个知识圈的向外扩大,这一过程很有星星之火可以燎原的意味。因此,当2022年底,LLM(大语言模型)展现出巨大的潜力后,所有力量都集中在了一起,开启了2023的AI元年。AI一天,人间一年,AI不仅在科学,技术领域飞速发展,也极大刺激了工程领域的落地热情。
对新事物的探索是曲折的,期待的幻灭很容易演变成无尽的诋毁,毕竟速胜论和投降论只隔着一行篱笆。AI分成两个主流方向,是文本生成和图像生成,图像生成发展迅速,落地效果好,但业务领域相较文本生成较小,众多企业主要期待还是放在了文本生成上。很快,文本生成方向在2023-2024年受到了巨大的质疑,究其原因,大模型的幻觉和昂贵的数据维护成本,使文本生成的应用难以达到业务的要求。笔者认为,对于艺术来说,大模型的幻觉某种角度来说是创造力的来源,养着马儿用来代步,效果自然很好。因为艺术没有一个放之皆准的标准,离经叛道也许更能推陈出新。而文本生成的企业知识库路线经常有着"demo一整天,落地一整年,人工调整一辈子"的调侃。也是底层逻辑的不契合,一个天马行空的艺术家,坚持要他做财务,养着马儿用来拉磨,效果自然差。
但是,在文本生成的AI辅助编程业务场景中,AI发展迅速,效果让人叹为观止,这点国内的感受还会相对滞后一些,Vibe Coding在国外已经大规模使用。而国内还在起步阶段。Claude Code和Cursor是AI辅助编程应用的佼佼者。AI工程探索也是一个圈,别的地方碰壁了,自然大家都会研究成功的方向,以求获取指导和经验。于是随着文本生成领域的工程师不断的研究,交流,总结,终于看到了曙光。
AI应用程序的核心思想
正如2017年发表的《Attention is All You Need》——这篇后来被公认为大语言模型开山之作的论文,最初并未引起太多反响。其研究思路源于现实生活的启发:人眼在观察广阔世界时,实际上无法同时处理所有视觉信息,但我们却总能感觉自己“看到”了完整的画面。这是因为大脑会自动从视野中捕捉“重点”,优先处理关键部分,其余内容则交由大脑“补全”。生活中我们常有这样的体验:一条走过无数遍的路,某天突然发现“多”了一根电线杆或一栋房子——其实它们一直都在,只是我们从未真正“注意”到。这种注意力机制,简单来说,就是把握事物的主要矛盾,将有限精力集中于核心部分,从而拓展认知的边界。
许多深刻的道理,往往源自对现实世界的细致观察。2025年年中,笔者读到《12-factor-agents》与《What is Context Engineering》两篇文章,它们系统总结了当前AI应用程序的核心思想与实践路径,正推动整个行业在这一新范式下持续演进。这两篇文章中所蕴含的理念,同样清晰而易于理解。
笔者希望延续同样的思路,从现实世界出发,介绍当前AI应用程序的基本思想与实践方法。假设一家公司要培养一名刚毕业的新员工,通常不会要求他立即独立工作,而是安排一位资深员工带领。这位导师会先讲解工作流程,演示具体操作,包括使用哪些工具、执行哪些步骤、最终达成何种结果。接着,他会让新人亲手尝试,根据流程操作工具、产出结果,并对其表现进行评估与指导,从而帮助新人逐步改进、熟练掌握。
AI应用程序正是对这一过程的抽象与模拟。在特定业务场景中,我们首先为AI提供一套操作指南,引导其逐步思考下一步该做什么。每完成一步,系统会记录结果,并再次启动决策流程,直至AI判断任务完成为止。就像一位数学老师指导学生解题:先说明本题需运用“数形结合”的思路,随后在学生每写一步后追问:“根据已有的推导,下一步应该怎么写?”如此循环,直至问题解决。
核心代码实现
《12-factor-agents》中的核心思想代码

文字伪代码
没有接触过编程也不要紧,我把新员工培训的过程用核心思想代码阐述一番 一个新员工入职培训的场景,整个过程其实是这样一个循环:•一开始,我们有一张明确的“培训清单”,上面罗列了需要完成的步骤:比如先做理论讲解,然后操作演示,接着让员工自己动手,最后进行评估反馈。•整个培训就围绕着这张清单展开:•导师来决定下一步做什么:在每一个环节,导师都会根据目前的培训进度,来判断接下来该进行哪一步。是该继续讲解,还是该做演示了?•执行具体的教学动作:一旦确定了要做什么,导师或新员工就会去执行:•如果是理论讲解,导师就会把相关的知识和流程讲清楚。•如果是操作演示,导师就会亲自展示工具该怎么用,步骤是什么样的。•如果是员工实操,就轮到新员工自己动手,按照学到的方法尝试操作。•如果是结果评估,导师则会来检查操作结果,并给出反馈意见。•记录与检查:每一个步骤做了什么、结果如何,都会被记录下来。这样,整个培训过程就变得有迹可循。•这个过程会一直重复,直到清单上的所有项目都圆满完成。当导师最终判断“培训完成”时,就意味着新员工已经掌握了技能,可以独立工作了。
实践中的深入探索
有些读者到这里可能会突然很开心,说我已经完全理解了AI应用程序,我也很欣慰,不过你可以说你理解了"现阶段的"AI应用程序的"核心思想",但是实践中远远不是这一个公式能概括的。从战略上藐视对手,从战术上重视对手。
如果你想问那么具体能有哪些方面的扩展呢?我简单举几个例子,非IT行业的不用在意,可以直接看下一章节。
1.缓存2.上下文压缩3.意图识别的优化4.动态更新计划5.容错,评估,性能6.人工打断7.权限,数据安全
AI应用软件和传统软件的结合
上一章节其实没有解释AI应用程序怎么控制幻觉,怎么治理数据,不过我们千万不能把这认为是AI的缺陷,而是认识到这是AI的特性。not bug,is feature。对于绘画来说这就是好事呀。那在业务领域,怎么去用好AI,并且适配好AI的特性呢。答案就在传统软件,传统软件精准而高效,同时传统软件直接访问数据库,数据治理问题也被巧妙的规避了。有些读者会质疑,那AI应用软件不就是传统软件套壳吗,我想引用这样一段话:任何事物的内部都有其新旧两个方面的矛盾,形成为一系列的曲折的斗争。斗争的结果,新的方面由小变大,上升为支配的东西;旧的方面则由大变小,变成逐步归于灭亡的东西。同样的,当AI在完全替代传统软件并且直接在业务中产生巨大作用的这条路上前进的时候,一定要认识到这一过程是渐进的。新的方面由小变大,意味着AI的落地是长期的,逐步完善的过程,而旧的方面则由大变小,则意味着传统软件还会长期占据主导地位,在现有业务中起着决定性作用。那么,这个结合点在哪呢。回到上一章节的代码:

这里,execute_step就是AI委托给传统软件去处理,然后获取执行结果的,当然现阶段的AI应用程序人员更愿意说,这是AI去执行工具。
以笔者所在的保险行业举例,对于理赔的场景,公司就有很多现成的软件。比如医疗信息数据对接平台,影像系统,核心系统理赔模块,理赔试算系统,精算系统,核保系统。假如某人说他可以写个AI,去替换掉这些系统,提供完善的可控的对外服务,那实在是是太理想化了。不过假如我把这句话换种方式说,我们可以写一个AI应用程序,根据某一标准的操作流程,让AI去不断循环调用上述系统获取信息,最后生成某一案件的总结,去辅助资深理赔操作员,提高他们的处理效率,是不是一下就变得可执行并且可期待起来了。对于幻觉,仅让AI根据上下文信息判断和哪个系统对接,做好评估和容错,就能对幻觉做到很好的控制。而数据,都存在传统软件系统中,自然精确性也得到了保证。虽然从整体的比例上来说,AI只占据了10%,传统软件占据了90%,意义在哪里呢,抛开形而上的新旧事物理论,笔者在实践中的感受可以用这样一句话总结,AI可以很好的把握模糊的灵活性,很贴近现实生活,这是传统软件永远无法做到的。
分形
数学上有个美妙的概念,分形。IT里也有类似的概念,递归。
分形的核心特征有两个:
•自相似性:整体与部分相似,部分中又包含更小部分的相似结构。•标度不变性:无论你放大或缩小多少倍,这种相似的结构会重复出现。
社会中也有这样的规律,比如:五人为伍,五伍为两,四两为卒,五卒为旅,五旅为师,五师为军。 自相似性:一个"军"的统帅,他指挥的是几个"师";一个"师"的统帅,指挥的是几个"旅";一直到一个"伍"长,指挥的是几个"士兵"。每一个层级的管理模式和指挥结构都是相似的。高层级的管理者不需要关心最底层士兵的个人细节,他只需要管理好下一级的几个单位即可。所以同样的,公司架构:员工 -> 团队 -> 部门 -> 事业部 -> 公司,行政划分:个人 -> 家庭 -> 社区/村 -> 乡镇 -> 县市 -> 省份 -> 国家
这样的规律怎么去指导AI应用程序呢,还是回到理赔的场景,医疗信息数据对接平台上对接很多家供应商,每个供应商都对应一个独立的程序,所以我们同样可以对医疗信息数据对接平台做AI化的改造,给定一个指导规则,比如获取某个案件的医疗信息,让AI自主去选择对接某个供应商程序,直到获取到数据。这样的操作还可以继续,比如某个对接供应商的独立的程序,有5个接口,也可以委托给AI去管理接口,达成获取这个供应商数据的目的。刚才举例的两个场景是往小处分形,假如往大处分形呢,一个用户咨询保险公司的AI应用系统,AI应用系统会根据指导规则,自主选择对接销售系统,财务系统,理赔系统,客服系统去满足客户的需求。如果说上一章节阐述的是某个特定业务系统的AI转换过程,那么通过分形,可以让AI扩散到非常大,或者非常小的开发维度。越往大扩散是越接近大脑的,越往往小扩散是越接近工具,笔者建议先结合实际,先从小的地方入手,会收获很好的效果。
Multi Agent
求职者在面试的时候,经常会遇到这样一种情况,面试要好几轮,最常见的一面技术面,二面老板面,三面HR面。而在每一面中,可能也会有多个面试官。HR会根据多轮,多面试官的评价,综合的给求职者进行多维度的打分,最后给予是否录用的判断。多AI应用程序也是一样的思路,还是以保险场景为例子,在对客户的理赔决定,可以设计3+1个AI应用程序,其中3个AI应用程序有对接精算系统的,从费率设计方面给出意见。有对接客户服务系统的,从消保的方面给出意见。有对接舆情系统,从声誉的角度给出意见。最后这些意见会由一个管理的AI应用程序做总结和判断,给出最后的处理意见报告。笔者愿意这样总结Multi Agent,三个臭皮匠,顶个诸葛亮。
AI大模型从0到精通全套学习大礼包
我在一线互联网企业工作十余年里,指导过不少同行后辈。帮助很多人得到了学习和成长。
只要你是真心想学AI大模型,我这份资料就可以无偿共享给你学习。大模型行业确实也需要更多的有志之士加入进来,我也真心希望帮助大家学好这门技术,如果日后有什么学习上的问题,欢迎找我交流,有技术上面的问题,我是很愿意去帮助大家的!
如果你也想通过学大模型技术去帮助就业和转行,可以扫描下方链接👇👇
大模型重磅福利:入门进阶全套104G学习资源包免费分享!

01.从入门到精通的全套视频教程
包含提示词工程、RAG、Agent等技术点
02.AI大模型学习路线图(还有视频解说)
全过程AI大模型学习路线


03.学习电子书籍和技术文档
市面上的大模型书籍确实太多了,这些是我精选出来的


04.大模型面试题目详解


05.这些资料真的有用吗?
这份资料由我和鲁为民博士共同整理,鲁为民博士先后获得了北京清华大学学士和美国加州理工学院博士学位,在包括IEEE Transactions等学术期刊和诸多国际会议上发表了超过50篇学术论文、取得了多项美国和中国发明专利,同时还斩获了吴文俊人工智能科学技术奖。目前我正在和鲁博士共同进行人工智能的研究。
所有的视频由智泊AI老师录制,且资料与智泊AI共享,相互补充。这份学习大礼包应该算是现在最全面的大模型学习资料了。
资料内容涵盖了从入门到进阶的各类视频教程和实战项目,无论你是小白还是有些技术基础的,这份资料都绝对能帮助你提升薪资待遇,转行大模型岗位。


智泊AI始终秉持着“让每个人平等享受到优质教育资源”的育人理念,通过动态追踪大模型开发、数据标注伦理等前沿技术趋势,构建起"前沿课程+智能实训+精准就业"的高效培养体系。
课堂上不光教理论,还带着学员做了十多个真实项目。学员要亲自上手搞数据清洗、模型调优这些硬核操作,把课本知识变成真本事!

如果说你是以下人群中的其中一类,都可以来智泊AI学习人工智能,找到高薪工作,一次小小的“投资”换来的是终身受益!
应届毕业生:无工作经验但想要系统学习AI大模型技术,期待通过实战项目掌握核心技术。
零基础转型:非技术背景但关注AI应用场景,计划通过低代码工具实现“AI+行业”跨界。
业务赋能 突破瓶颈:传统开发者(Java/前端等)学习Transformer架构与LangChain框架,向AI全栈工程师转型。
👉获取方式:
😝有需要的小伙伴,可以保存图片到wx扫描二v码免费领取【保证100%免费】🆓
更多推荐


所有评论(0)