Skip to content

Agent 进阶(一)开篇:从「能跑的 demo」到「真能用」

🕒 Published at:

入门系列里,我们把一个 RAG + Agent 从零做了出来,它能查资料、能调工具、有记忆。跑通那一刻很爽——但如果你真把它丢到公司里、给真实用户用,大概率会发现:demo 好用,一上真实数据和真实用户就"翻车"

这个进阶系列就是来补这道坎的。碰到 rerank、评测集、MCP 这类词,别被名字唬住,我尽量说明白。代码主要用 Python——进阶这些工具的 Python 生态成熟不少;Node 的对应写法,需要的地方会标一下。

为什么 demo 和「能用」差了十万八千里

举个特别真实的例子。你做了个"公司制度问答机器人",自己测试时问「年假有几天」,答得又快又准,感觉稳了。上线第一天,同事们的问题是这样的:

「我去年入职的,今年请假额度咋算?」「产假和陪产假能一起休不?」「那个……就是生孩子那个假期,工资照发吗?」

你会发现:用户的话又乱又口语,和你文档里的书面语对不上(检索找不准);有时它一本正经地编一个不存在的政策(没法评估、没人发现);碰到「帮我把这条假期申请提交了」这种要动真格的操作,它直接就做了(没有安全闸门);老板问「这东西到底靠不靠谱、一个月要烧多少钱」,你答不上来(没有可观测和成本意识)。

这些都不是"代码写错了",而是入门 demo 天然缺失的工程能力。把这几块补齐,才叫"真能用"。

进阶要补的四块短板

① 让它更准进阶 RAG:检索找得准、多智能体各司其职② 让它更通MCP:像插 USB 一样接入海量现成工具③ 让它可衡量评估:用评测集科学判断好坏,不靠拍脑袋④ 让它能上线可观测 / 成本 / 安全 / 部署

① 让它更准。 入门的 RAG 检索比较"素",用户换个说法就找不到资料。进阶 RAG 会讲查询改写、混合检索、重排序这些让检索"更懂人话"的技巧。而当一个 Agent 什么都想干、反而什么都干不好时,就要拆成"多智能体"——像一个团队分工,各管一摊。

② 让它更通。 每接一个新工具(查天气、发邮件、连数据库)都要手写一遍,太累。MCP 是一个新兴的"通用插头"标准,让 Agent 能像插 USB 一样,即插即用地接入别人已经做好的成百上千个工具。

③ 让它可衡量。 入门时我们靠"手动问几句,感觉还行"来判断好坏。真实项目里这远远不够——你需要一套评测集(一堆标准问答题),量化地回答"这次改动到底是变好了还是变差了",而不是拍脑袋。

④ 让它能上线。 线上要能看清它每一步在干嘛、慢在哪、花了多少钱(可观测与成本),要防住恶意输入和危险操作(安全),还要能稳定地部署和监控。这是从"我电脑上能跑"到"7×24 服务用户"的最后一公里。

这个系列怎么读

顺序是精心排的,由"让它变好"到"让它上线"层层递进:

先是进阶 RAG(两篇)——检索为什么不准、怎么变准;接着多智能体(两篇)——什么时候该拆、怎么用 LangGraph 编排协作;然后 MCP(一篇)——打通工具生态;再到评估(一篇)——学会科学地量化好坏;最后可观测与成本、上生产(两篇)——真正把它送上线;结尾一篇进阶地图收口。

不需要每篇都动手敲代码。很多篇是"先把道理和名词讲透,再看关键代码",因为进阶阶段想清楚"为什么这么做",比记住某个 API 更重要

一句话定调

如果说入门系列教你"造一辆能开的车",进阶系列就是教你"让这辆车跑得准、跑得稳、还能合规上路"。前者靠热情就能完成,后者需要一点工程的耐心——而这,恰恰是职场里最值钱的能力。

下一篇,我们从最立竿见影的地方开始:为什么你的 RAG 检索总是"差一点",以及怎么用查询改写和混合检索让它"更懂人话"。