演示台上的智能体几乎无所不能:查资料、写报告、操作软件。真正推进到产线时,团队会遇到同一批问题——同样是十个任务,演示时成功九个,上线后可能只剩四个稳定。过去几个月,我们把智能体接进客服、运营和内容三条真实业务线,这篇把五道关按踩坑顺序讲清楚。
第一关:任务边界
不是所有任务都适合交给智能体。我们的筛选标准是三条:结果可验证(做没做对能自动判断)、步骤可分工(能拆成明确的子任务)、工具可授权(涉及的每个系统都有安全接口)。三条沾不上边的任务,比如「帮我判断这个业务要不要调整」,仍然应该留给人。把边界划清楚,智能体的成功率立刻好看一倍——因为模糊任务本身就是失败的主要来源。
第二关:状态管理
长任务需要记忆。一个要跑二十分钟、调用十几个工具的流程,中途丢失上下文就会前功尽弃。我们的做法是把状态外置:每完成一步就把「已做什么、拿到什么、还剩什么」写进结构化存储,而不是塞进对话历史。这样任务可以断点续跑、可以人工接管,也方便事后复盘每一步的决策依据。
第三关:工具调用可靠性
智能体的一半失败来自工具调用:接口超时、返回格式变了、参数理解错了。工程上的解法与分布式系统同源——重试带退避、结果做校验、关键操作要幂等,再加一道人工审批闸门。验收口径也要务实:单个工具成功率 99%,串联十个工具的整体成功率就是 90%;所以关键路径上的工具数量要宁少勿多。
第四关:评测
智能体的评测比单轮问答难得多,因为它多步执行、路径不唯一。我们用三层评测兜住:单元层测每个工具调用的准确性;路径层测「该不该走这一步」的决策质量;结果层测最终交付物是否达标。上线前用真实历史案例回放测,上线后按周抽样人工复核——没有评测体系的智能体项目,调优全靠感觉。
第五关:成本
智能体的成本要用「单任务成本 × 完成率」来衡量。一个任务平均调用十几次模型、穿插若干工具,单次调用的价格乘上步数,往往比预期高一个数量级。降本的顺序是:先砍无效步骤(多数是提示词没约束好),再换小模型处理简单步骤,最后才是压价。我们服务的一个运营场景经过这三轮优化后,单任务成本降了约六成,完成率还涨了。
智能体的知识底座通常由 RAG 承担,细节见《RAG 落地避坑指南》;记忆系统设计可参考《知音 Emotional Memory 架构》;流程编排平台见《云枢 CloudPivot 2.0》;需要智能体方案评估,欢迎通过联系合作沟通场景。
