[{"data":1,"prerenderedAt":100},["ShallowReactive",2],{"PortalFooter_QX9Sj6L0jYa0f3sHh8puk8D6pkI69QhELaa1ZMuWxNo":3,"article-zh-ai-安全与对齐工程实践-幻觉控制-越狱防护与内容审核":10,"article-body-v-0-0-0":32,"AppImage_z2Dp4SY1VSZzchL7OMgEJwstBVsDeOIzK6mIDt9ZM":33,"PortalBreadcrumb_DpFJeYxiFp2OIeAPO14oKszoyuHxoDNDyiDn7RK8ju0":40,"related-zh-article-ai-安全与对齐工程实践-幻觉控制-越狱防护与内容审核":47,"PostCard_x6dtFQiBEmCye6IPguyIMK6zK20KlF5sHjVP3s6t4":79,"PostCard_aCqkegqFEBYvJlCUNmlGS4lq0Krsk0b9XgWMY1Q3To":86,"PostCard_Q2tdhHfZKr47yNkcHCzNCkuhzQCKaVfdZiyAP87A":93},["Island",4],{"key":5,"result":6},"PortalFooter_QX9Sj6L0jYa0f3sHh8puk8D6pkI69QhELaa1ZMuWxNo",{"head":7},{"link":8,"style":9},[],[],{"id":11,"locale":12,"slug":13,"type":14,"title":15,"summary":16,"content_html":17,"video_url":18,"cover_url":19,"author":20,"category":21,"status":22,"published_at":23,"created_at":24,"updated_at":25,"alternates":26},169,"zh","ai-安全与对齐工程实践-幻觉控制-越狱防护与内容审核","article","AI 安全与对齐工程实践：幻觉控制、越狱防护与内容审核","本文从工程落地角度梳理大模型安全与对齐的核心问题，围绕幻觉控制、越狱防护与内容审核给出分层防御、红队测试和上线检查清单，帮助开发者构建更可靠的生成式 AI 应用。","\u003Ch2>背景与问题\u003C\u002Fh2>\n\u003Cp>过去两年，大模型从演示工具走向客服、研发助手、知识问答、营销内容生成等生产系统。一旦接入真实业务，问题会迅速变得具体：模型可能编造不存在的接口参数，可能在多轮诱导下输出违规内容，也可能把网页里的隐藏文本当成指令执行。对工程团队来说，AI 安全与对齐不是抽象伦理口号，而是一组需要纳入需求、测试、发布和运维的工程约束。\u003C\u002Fp>\n\u003Cfigure class=\"portal-article-figure\">\u003Cimg src=\"https:\u002F\u002Fguanshanshuyuan.cn\u002Fimages\u002Farticles\u002Flandscape_mountain.jpg\" alt=\"观山静思\" loading=\"lazy\" decoding=\"async\" \u002F>\u003Cfigcaption>观山静思\u003C\u002Ffigcaption>\u003C\u002Ffigure>\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\u003Cp>常见风险可以概括为三类：第一是幻觉，即模型生成看似合理但缺乏事实依据的内容；第二是越狱与提示注入，即攻击者通过话术、编码、角色设定或外部数据绕过安全策略；第三是内容合规风险，包括违法、暴力、歧视、隐私泄露和高风险专业建议。真正成熟的系统不会假设模型永远正确，而是通过多层机制让错误可发现、可拦截、可追溯。\u003C\u002Fp>\n\u003Ch2>核心概念\u003C\u002Fh2>\n\u003Ch3>安全、对齐与可控性\u003C\u002Fh3>\n\u003Cul>\n\u003Cli>\u003Cstrong>安全\u003C\u002Fstrong>：系统在不同输入下尽量避免产生有害、违法或误导性输出。\u003C\u002Fli>\n\u003Cli>\u003Cstrong>对齐\u003C\u002Fstrong>：模型行为与用户意图、产品目标、组织策略和社会规范保持一致。\u003C\u002Fli>\n\u003Cli>\u003Cstrong>可控性\u003C\u002Fstrong>：开发者能够限定模型能力边界、审计关键行为，并在异常时停止或降级服务。\u003C\u002Fli>\n\u003C\u002Ful>\n\u003Cp>三者关系可以这样理解：对齐解决模型应该做什么，安全解决模型不能做什么，可控性解决人类如何监督和纠偏。若只有提示词而没有权限边界，模型很容易被诱导；若只有过滤器而没有事实依据，系统又容易误伤正常需求。\u003C\u002Fp>\n\u003Ch3>幻觉控制\u003C\u002Fh3>\n\u003Cp>幻觉并不等于模型说谎，它更像是模型在信息不足时仍然保持高置信度表达。工程上通常从三个方向控制：第一，减少无依据生成，例如引入检索增强、知识库引用和工具查询；第二，降低错误置信度，例如要求模型区分事实、推测和未知；第三，建立验证机制，例如引用校验、答案一致性检查和人工抽检。\u003C\u002Fp>\n\u003Cp>对于事实型任务，建议将回答分为可验证与不可验证两类。可验证问题尽量走检索或数据库，不可验证问题则明确标注不确定性。这比单纯要求模型不要幻觉更有效。\u003C\u002Fp>\n\u003Ch3>越狱防护\u003C\u002Fh3>\n\u003Cp>越狱通常利用模型对自然语言的泛化能力，例如假装成小说创作、代码调试、学术讨论、系统管理员，或使用 Base64、Unicode、多语言混合等方式绕过检测。提示注入则更进一步，把恶意指令混入用户输入、网页内容、文档附件或工具返回结果中。\u003C\u002Fp>\n\u003Cp>防护重点不是寻找一个万能关键词表，而是建立分层防御：输入层识别高风险意图，系统层隔离用户指令与系统策略，工具层限制文件、网络、数据库和代码执行权限，输出层进行安全审核，日志层保留可审计证据。\u003C\u002Fp>\n\u003Ch3>内容审核\u003C\u002Fh3>\n\u003Cp>内容审核是模型输出进入用户前的最后一道防线。它不应只是一个黑盒分类器，而应包含清晰策略：哪些内容必须拦截，哪些内容需要改写或降级，哪些内容可以放行但附带提示，哪些场景必须转人工。审核策略需要与业务风险等级匹配，例如医疗、法律、金融、未成年人相关场景应显著从严。\u003C\u002Fp>\n\u003Ch2>实践步骤与检查清单\u003C\u002Fh2>\n\u003Ch3>1. 先定义风险等级，再选择模型能力\u003C\u002Fh3>\n\u003Cul>\n\u003Cli>明确应用是否涉及资金、医疗、法律、未成年人、隐私或自动化执行。\u003C\u002Fli>\n\u003Cli>根据风险等级确定是否允许联网、是否允许调用工具、是否允许生成可执行代码。\u003C\u002Fli>\n\u003Cli>对高风险场景设置人工复核、限流、白名单和强审计。\u003C\u002Fli>\n\u003C\u002Ful>\n\u003Ch3>2. 建立分层防御流水线\u003C\u002Fh3>\n\u003Cp>一个常见的生产流水线包括：输入清洗、意图识别、权限判断、检索增强、模型生成、事实校验、输出审核和日志记录。下面是一个简化的伪代码示例，用于说明各检查点的位置。\u003C\u002Fp>\n\u003Cpre>\u003Ccode>def guardrail(prompt, context):\n    if contains_secret(prompt):\n        return deny('请勿提交密钥或个人敏感信息')\n\n    intent = classify_intent(prompt)\n    if intent in ('medical', 'legal', 'finance'):\n        return answer_with_disclaimer(prompt, require_review=True)\n\n    if intent == 'fact':\n        context = retrieve_sources(prompt)\n\n    answer = llm_generate(prompt, context, temperature=0.2)\n\n    if intent == 'fact' and not has_citation(answer):\n        answer = add_uncertainty_note(answer)\n\n    return output_filter(answer)\n\u003C\u002Fcode>\u003C\u002Fpre>\n\u003Cp>这段代码不是完整安全方案，而是展示工程思路：先处理敏感信息与高风险意图，再根据任务类型决定是否检索，最后对输出进行审核和不确定性标注。\u003C\u002Fp>\n\u003Ch3>3. 幻觉控制的关键动作\u003C\u002Fh3>\n\u003Cul>\n\u003Cli>为事实型问题接入检索、知识库或结构化查询，并尽量要求引用来源。\u003C\u002Fli>\n\u003Cli>限制模型在缺少证据时自由发挥，可设置拒答模板或转人工。\u003C\u002Fli>\n\u003Cli>对长文档问答进行分段检索，避免模型跨段落拼接出错误结论。\u003C\u002Fli>\n\u003Cli>建立离线评估集，重点检查事实准确率、引用命中率和拒答合理性。\u003C\u002Fli>\n\u003C\u002Ful>\n\u003Ch3>4. 越狱与提示注入测试\u003C\u002Fh3>\n\u003Cul>\n\u003Cli>构造角色扮演、反向指令、多轮诱导、编码绕过、多语言混合等测试用例。\u003C\u002Fli>\n\u003Cli>检查系统提示是否可能被泄露，工具调用是否可能被用户间接控制。\u003C\u002Fli>\n\u003Cli>对网页抓取、文件解析、数据库返回等外部内容做隔离，避免间接注入。\u003C\u002Fli>\n\u003Cli>每次模型升级、提示词调整或工具变更后，执行回归红队测试。\u003C\u002Fli>\n\u003C\u002Ful>\n\u003Ch3>5. 内容审核与运营闭环\u003C\u002Fh3>\n\u003Cul>\n\u003Cli>输出审核应覆盖违法、暴力、歧视、隐私、自伤、未成年人和高风险专业建议。\u003C\u002Fli>\n\u003Cli>对拦截案例记录原因，对误判案例进行复盘，持续更新策略。\u003C\u002Fli>\n\u003Cli>为客服、教育、医疗等场景配置专门话术和人工升级路径。\u003C\u002Fli>\n\u003Cli>日志要脱敏保存，并明确保留期限与访问权限，请以适用法规和官方合规要求为准。\u003C\u002Fli>\n\u003C\u002Ful>\n\u003Ch2>常见坑与建议\u003C\u002Fh2>\n\u003Cul>\n\u003Cli>\u003Cstrong>只依赖系统提示\u003C\u002Fstrong>：系统提示很重要，但不能作为唯一防线。攻击者可以通过多轮对话或外部内容改变模型行为，必须配合权限控制和输出审核。\u003C\u002Fli>\n\u003Cli>\u003Cstrong>关键词过滤过于简单\u003C\u002Fstrong>：关键词表容易被同义词、拼音、编码和隐喻绕过。应结合语义分类、上下文判断和风险分级。\u003C\u002Fli>\n\u003Cli>\u003Cstrong>把幻觉问题只归因于提示词\u003C\u002Fstrong>：如果没有可靠知识来源和评估机制，仅靠请模型谨慎回答往往效果有限。\u003C\u002Fli>\n\u003Cli>\u003Cstrong>过度拒绝影响可用性\u003C\u002Fstrong>：安全策略不是一味拦截。对边缘场景应提供解释、替代方案或人工入口，避免用户被反复拒绝。\u003C\u002Fli>\n\u003Cli>\u003Cstrong>忽略间接注入\u003C\u002Fstrong>：模型读取网页、PDF、邮件或工具返回时，外部文本可能携带指令。应将数据内容与执行指令明确分离。\u003C\u002Fli>\n\u003Cli>\u003Cstrong>没有持续评估\u003C\u002Fstrong>：模型版本、提示词、知识库和工具都会变化。没有回归测试，安全能力会随迭代悄悄退化。\u003C\u002Fli>\n\u003C\u002Ful>\n\u003Ch2>延伸阅读方向\u003C\u002Fh2>\n\u003Cul>\n\u003Cli>OWASP 针对大模型应用的安全风险清单与生成式 AI 安全实践。\u003C\u002Fli>\n\u003Cli>NIST AI Risk Management Framework 等公共治理框架。\u003C\u002Fli>\n\u003Cli>据公开资料，Google SAIF、Anthropic 等机构提出的安全对齐与红队测试方法。\u003C\u002Fli>\n\u003Cli>RLHF、DPO、Constitutional AI 等对齐技术路线及其适用边界。\u003C\u002Fli>\n\u003Cli>RAG 评估指标，如忠实度、答案相关性、引用准确率和拒答率。\u003C\u002Fli>\n\u003Cli>自动化红队、对抗提示生成与模型行为监测工具链。\u003C\u002Fli>\n\u003C\u002Ful>\n\u003Cp>总体而言，AI 安全与对齐不是一次性项目，而是持续运营。工程团队需要把幻觉控制、越狱防护和内容审核纳入同一套质量体系，用可测试、可观测、可回滚的方式管理模型风险。\u003C\u002Fp>\n\u003Csection class=\"portal-sources\" style=\"margin-top:2em;font-size:14px;line-height:1.7;color:#5c5850;\">\u003Cp style=\"margin:0 0 0.5em;font-weight:600;\">参考来源\u003C\u002Fp>\u003Cul style=\"margin:0;padding-left:1.25em;\">\u003Cli style=\"margin:0.25em 0;\">\u003Ca href=\"https:\u002F\u002Fwww.chagushici.com\u002Fzidian\u002Fzuci\u002F%E5%A4%A7\" rel=\"noopener noreferrer\" target=\"_blank\">大组词_大字组词_大的词语 - 汉语词典\u003C\u002Fa>\u003C\u002Fli>\u003Cli style=\"margin:0.25em 0;\">\u003Ca href=\"https:\u002F\u002Fzhuanlan.zhihu.com\u002Fp\u002F636078956\" rel=\"noopener noreferrer\" target=\"_blank\">AI安全与对齐: When, Why, What, and How - 知乎\u003C\u002Fa>\u003C\u002Fli>\u003Cli style=\"margin:0.25em 0;\">\u003Ca href=\"https:\u002F\u002Fnotes.hehugo.com\u002Fresearch\u002Fai\u002Fengineering\u002Fai-safety-alignment-guide\" rel=\"noopener noreferrer\" target=\"_blank\">AI 安全与对齐完全指南 | 何雨果的知识库\u003C\u002Fa>\u003C\u002Fli>\u003Cli style=\"margin:0.25em 0;\">\u003Ca href=\"https:\u002F\u002Fzhuanlan.zhihu.com\u002Fp\u002F666115472\" rel=\"noopener noreferrer\" target=\"_blank\">AI安全前沿 #1 | AI安全四大抓手：对齐、鲁棒性、监测 ...\u003C\u002Fa>\u003C\u002Fli>\u003Cli style=\"margin:0.25em 0;\">\u003Ca href=\"https:\u002F\u002Fblog.csdn.net\u002Fmieshizhishou\u002Farticle\u002Fdetails\u002F140318746\" rel=\"noopener noreferrer\" target=\"_blank\">【有啥问啥】LLM大模型应用中的安全对齐的简单理解 ...\u003C\u002Fa>\u003C\u002Fli>\u003C\u002Ful>\u003C\u002Fsection>\n\u003Csection class=\"portal-disclaimer\" data-portal-disclaimer=\"1\" style=\"margin-top:2.5em;padding-top:1.25em;border-top:1px solid #e8e4dc;font-size:14px;line-height:1.7;color:#7a756c;\">\u003Cp style=\"margin:0;\">免责声明：本文内容整理自公开网络资料，仅供学习交流参考，不代表观山书院立场。如涉及版权侵权，请联系我们删除。\u003C\u002Fp>\u003Cp style=\"margin:0.75em 0 0;\">联系邮箱：\u003Ca href=\"mailto:chenxj.g@gmail.com\">chenxj.g@gmail.com\u003C\u002Fa>\u003C\u002Fp>\u003C\u002Fsection>","","https:\u002F\u002Fguanshanshuyuan.cn\u002Fimages\u002Farticles\u002Flandscape_mountain.jpg","观山书院","ai","published","2026-09-29T14:25:47.577226+08:00","2026-09-29T14:30:35.360431+08:00","2026-09-29T21:35:01.971841+08:00",[27,29],{"locale":12,"path":28},"\u002Farticles\u002Fai-安全与对齐工程实践-幻觉控制-越狱防护与内容审核",{"locale":30,"path":31},"en","\u002Fen\u002Farticles\u002Fai-安全与对齐工程实践-幻觉控制-越狱防护与内容审核","\u003Ch2>背景与问题\u003C\u002Fh2>\n\u003Cp>过去两年，大模型从演示工具走向客服、研发助手、知识问答、营销内容生成等生产系统。一旦接入真实业务，问题会迅速变得具体：模型可能编造不存在的接口参数，可能在多轮诱导下输出违规内容，也可能把网页里的隐藏文本当成指令执行。对工程团队来说，AI 安全与对齐不是抽象伦理口号，而是一组需要纳入需求、测试、发布和运维的工程约束。\u003C\u002Fp>\n\u003Cfigure class=\"portal-article-figure\">\u003Cimg src=\"https:\u002F\u002Fguanshanshuyuan.cn\u002Fimages\u002Farticles\u002Flandscape_mountain.jpg\" alt=\"观山静思\" loading=\"lazy\" decoding=\"async\">\u003Cfigcaption>观山静思\u003C\u002Ffigcaption>\u003C\u002Ffigure>\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\u003Cp>常见风险可以概括为三类：第一是幻觉，即模型生成看似合理但缺乏事实依据的内容；第二是越狱与提示注入，即攻击者通过话术、编码、角色设定或外部数据绕过安全策略；第三是内容合规风险，包括违法、暴力、歧视、隐私泄露和高风险专业建议。真正成熟的系统不会假设模型永远正确，而是通过多层机制让错误可发现、可拦截、可追溯。\u003C\u002Fp>\n\u003Ch2>核心概念\u003C\u002Fh2>\n\u003Ch3>安全、对齐与可控性\u003C\u002Fh3>\n\u003Cul>\n\u003Cli>\u003Cstrong>安全\u003C\u002Fstrong>：系统在不同输入下尽量避免产生有害、违法或误导性输出。\u003C\u002Fli>\n\u003Cli>\u003Cstrong>对齐\u003C\u002Fstrong>：模型行为与用户意图、产品目标、组织策略和社会规范保持一致。\u003C\u002Fli>\n\u003Cli>\u003Cstrong>可控性\u003C\u002Fstrong>：开发者能够限定模型能力边界、审计关键行为，并在异常时停止或降级服务。\u003C\u002Fli>\n\u003C\u002Ful>\n\u003Cp>三者关系可以这样理解：对齐解决模型应该做什么，安全解决模型不能做什么，可控性解决人类如何监督和纠偏。若只有提示词而没有权限边界，模型很容易被诱导；若只有过滤器而没有事实依据，系统又容易误伤正常需求。\u003C\u002Fp>\n\u003Ch3>幻觉控制\u003C\u002Fh3>\n\u003Cp>幻觉并不等于模型说谎，它更像是模型在信息不足时仍然保持高置信度表达。工程上通常从三个方向控制：第一，减少无依据生成，例如引入检索增强、知识库引用和工具查询；第二，降低错误置信度，例如要求模型区分事实、推测和未知；第三，建立验证机制，例如引用校验、答案一致性检查和人工抽检。\u003C\u002Fp>\n\u003Cp>对于事实型任务，建议将回答分为可验证与不可验证两类。可验证问题尽量走检索或数据库，不可验证问题则明确标注不确定性。这比单纯要求模型不要幻觉更有效。\u003C\u002Fp>\n\u003Ch3>越狱防护\u003C\u002Fh3>\n\u003Cp>越狱通常利用模型对自然语言的泛化能力，例如假装成小说创作、代码调试、学术讨论、系统管理员，或使用 Base64、Unicode、多语言混合等方式绕过检测。提示注入则更进一步，把恶意指令混入用户输入、网页内容、文档附件或工具返回结果中。\u003C\u002Fp>\n\u003Cp>防护重点不是寻找一个万能关键词表，而是建立分层防御：输入层识别高风险意图，系统层隔离用户指令与系统策略，工具层限制文件、网络、数据库和代码执行权限，输出层进行安全审核，日志层保留可审计证据。\u003C\u002Fp>\n\u003Ch3>内容审核\u003C\u002Fh3>\n\u003Cp>内容审核是模型输出进入用户前的最后一道防线。它不应只是一个黑盒分类器，而应包含清晰策略：哪些内容必须拦截，哪些内容需要改写或降级，哪些内容可以放行但附带提示，哪些场景必须转人工。审核策略需要与业务风险等级匹配，例如医疗、法律、金融、未成年人相关场景应显著从严。\u003C\u002Fp>\n\u003Ch2>实践步骤与检查清单\u003C\u002Fh2>\n\u003Ch3>1. 先定义风险等级，再选择模型能力\u003C\u002Fh3>\n\u003Cul>\n\u003Cli>明确应用是否涉及资金、医疗、法律、未成年人、隐私或自动化执行。\u003C\u002Fli>\n\u003Cli>根据风险等级确定是否允许联网、是否允许调用工具、是否允许生成可执行代码。\u003C\u002Fli>\n\u003Cli>对高风险场景设置人工复核、限流、白名单和强审计。\u003C\u002Fli>\n\u003C\u002Ful>\n\u003Ch3>2. 建立分层防御流水线\u003C\u002Fh3>\n\u003Cp>一个常见的生产流水线包括：输入清洗、意图识别、权限判断、检索增强、模型生成、事实校验、输出审核和日志记录。下面是一个简化的伪代码示例，用于说明各检查点的位置。\u003C\u002Fp>\n\u003Cpre>\u003Ccode>def guardrail(prompt, context):\n    if contains_secret(prompt):\n        return deny('请勿提交密钥或个人敏感信息')\n\n    intent = classify_intent(prompt)\n    if intent in ('medical', 'legal', 'finance'):\n        return answer_with_disclaimer(prompt, require_review=True)\n\n    if intent == 'fact':\n        context = retrieve_sources(prompt)\n\n    answer = llm_generate(prompt, context, temperature=0.2)\n\n    if intent == 'fact' and not has_citation(answer):\n        answer = add_uncertainty_note(answer)\n\n    return output_filter(answer)\n\u003C\u002Fcode>\u003C\u002Fpre>\n\u003Cp>这段代码不是完整安全方案，而是展示工程思路：先处理敏感信息与高风险意图，再根据任务类型决定是否检索，最后对输出进行审核和不确定性标注。\u003C\u002Fp>\n\u003Ch3>3. 幻觉控制的关键动作\u003C\u002Fh3>\n\u003Cul>\n\u003Cli>为事实型问题接入检索、知识库或结构化查询，并尽量要求引用来源。\u003C\u002Fli>\n\u003Cli>限制模型在缺少证据时自由发挥，可设置拒答模板或转人工。\u003C\u002Fli>\n\u003Cli>对长文档问答进行分段检索，避免模型跨段落拼接出错误结论。\u003C\u002Fli>\n\u003Cli>建立离线评估集，重点检查事实准确率、引用命中率和拒答合理性。\u003C\u002Fli>\n\u003C\u002Ful>\n\u003Ch3>4. 越狱与提示注入测试\u003C\u002Fh3>\n\u003Cul>\n\u003Cli>构造角色扮演、反向指令、多轮诱导、编码绕过、多语言混合等测试用例。\u003C\u002Fli>\n\u003Cli>检查系统提示是否可能被泄露，工具调用是否可能被用户间接控制。\u003C\u002Fli>\n\u003Cli>对网页抓取、文件解析、数据库返回等外部内容做隔离，避免间接注入。\u003C\u002Fli>\n\u003Cli>每次模型升级、提示词调整或工具变更后，执行回归红队测试。\u003C\u002Fli>\n\u003C\u002Ful>\n\u003Ch3>5. 内容审核与运营闭环\u003C\u002Fh3>\n\u003Cul>\n\u003Cli>输出审核应覆盖违法、暴力、歧视、隐私、自伤、未成年人和高风险专业建议。\u003C\u002Fli>\n\u003Cli>对拦截案例记录原因，对误判案例进行复盘，持续更新策略。\u003C\u002Fli>\n\u003Cli>为客服、教育、医疗等场景配置专门话术和人工升级路径。\u003C\u002Fli>\n\u003Cli>日志要脱敏保存，并明确保留期限与访问权限，请以适用法规和官方合规要求为准。\u003C\u002Fli>\n\u003C\u002Ful>\n\u003Ch2>常见坑与建议\u003C\u002Fh2>\n\u003Cul>\n\u003Cli>\u003Cstrong>只依赖系统提示\u003C\u002Fstrong>：系统提示很重要，但不能作为唯一防线。攻击者可以通过多轮对话或外部内容改变模型行为，必须配合权限控制和输出审核。\u003C\u002Fli>\n\u003Cli>\u003Cstrong>关键词过滤过于简单\u003C\u002Fstrong>：关键词表容易被同义词、拼音、编码和隐喻绕过。应结合语义分类、上下文判断和风险分级。\u003C\u002Fli>\n\u003Cli>\u003Cstrong>把幻觉问题只归因于提示词\u003C\u002Fstrong>：如果没有可靠知识来源和评估机制，仅靠请模型谨慎回答往往效果有限。\u003C\u002Fli>\n\u003Cli>\u003Cstrong>过度拒绝影响可用性\u003C\u002Fstrong>：安全策略不是一味拦截。对边缘场景应提供解释、替代方案或人工入口，避免用户被反复拒绝。\u003C\u002Fli>\n\u003Cli>\u003Cstrong>忽略间接注入\u003C\u002Fstrong>：模型读取网页、PDF、邮件或工具返回时，外部文本可能携带指令。应将数据内容与执行指令明确分离。\u003C\u002Fli>\n\u003Cli>\u003Cstrong>没有持续评估\u003C\u002Fstrong>：模型版本、提示词、知识库和工具都会变化。没有回归测试，安全能力会随迭代悄悄退化。\u003C\u002Fli>\n\u003C\u002Ful>\n\u003Ch2>延伸阅读方向\u003C\u002Fh2>\n\u003Cul>\n\u003Cli>OWASP 针对大模型应用的安全风险清单与生成式 AI 安全实践。\u003C\u002Fli>\n\u003Cli>NIST AI Risk Management Framework 等公共治理框架。\u003C\u002Fli>\n\u003Cli>据公开资料，Google SAIF、Anthropic 等机构提出的安全对齐与红队测试方法。\u003C\u002Fli>\n\u003Cli>RLHF、DPO、Constitutional AI 等对齐技术路线及其适用边界。\u003C\u002Fli>\n\u003Cli>RAG 评估指标，如忠实度、答案相关性、引用准确率和拒答率。\u003C\u002Fli>\n\u003Cli>自动化红队、对抗提示生成与模型行为监测工具链。\u003C\u002Fli>\n\u003C\u002Ful>\n\u003Cp>总体而言，AI 安全与对齐不是一次性项目，而是持续运营。工程团队需要把幻觉控制、越狱防护和内容审核纳入同一套质量体系，用可测试、可观测、可回滚的方式管理模型风险。\u003C\u002Fp>\n\u003Csection class=\"portal-sources\" style=\"margin-top:2em;font-size:14px;line-height:1.7;color:#5c5850;\">\u003Cp style=\"margin:0 0 0.5em;font-weight:600;\">参考来源\u003C\u002Fp>\u003Cul style=\"margin:0;padding-left:1.25em;\">\u003Cli style=\"margin:0.25em 0;\">\u003Ca href=\"https:\u002F\u002Fwww.chagushici.com\u002Fzidian\u002Fzuci\u002F%E5%A4%A7\" rel=\"noopener noreferrer\">大组词_大字组词_大的词语 - 汉语词典\u003C\u002Fa>\u003C\u002Fli>\u003Cli style=\"margin:0.25em 0;\">\u003Ca href=\"https:\u002F\u002Fzhuanlan.zhihu.com\u002Fp\u002F636078956\" rel=\"noopener noreferrer\">AI安全与对齐: When, Why, What, and How - 知乎\u003C\u002Fa>\u003C\u002Fli>\u003Cli style=\"margin:0.25em 0;\">\u003Ca href=\"https:\u002F\u002Fnotes.hehugo.com\u002Fresearch\u002Fai\u002Fengineering\u002Fai-safety-alignment-guide\" rel=\"noopener noreferrer\">AI 安全与对齐完全指南 | 何雨果的知识库\u003C\u002Fa>\u003C\u002Fli>\u003Cli style=\"margin:0.25em 0;\">\u003Ca href=\"https:\u002F\u002Fzhuanlan.zhihu.com\u002Fp\u002F666115472\" rel=\"noopener noreferrer\">AI安全前沿 #1 | AI安全四大抓手：对齐、鲁棒性、监测 ...\u003C\u002Fa>\u003C\u002Fli>\u003Cli style=\"margin:0.25em 0;\">\u003Ca href=\"https:\u002F\u002Fblog.csdn.net\u002Fmieshizhishou\u002Farticle\u002Fdetails\u002F140318746\" rel=\"noopener noreferrer\">【有啥问啥】LLM大模型应用中的安全对齐的简单理解 ...\u003C\u002Fa>\u003C\u002Fli>\u003C\u002Ful>\u003C\u002Fsection>\n\u003Csection class=\"portal-disclaimer\" data-portal-disclaimer=\"1\" style=\"margin-top:2.5em;padding-top:1.25em;border-top:1px solid #e8e4dc;font-size:14px;line-height:1.7;color:#7a756c;\">\u003Cp style=\"margin:0;\">免责声明：本文内容整理自公开网络资料，仅供学习交流参考，不代表观山书院立场。如涉及版权侵权，请联系我们删除。\u003C\u002Fp>\u003Cp style=\"margin:0.75em 0 0;\">联系邮箱：\u003Ca href=\"mailto:chenxj.g@gmail.com\">chenxj.g@gmail.com\u003C\u002Fa>\u003C\u002Fp>\u003C\u002Fsection>",["Island",34],{"key":35,"result":36},"AppImage_z2Dp4SY1VSZzchL7OMgEJwstBVsDeOIzK6mIDt9ZM",{"head":37},{"link":38,"style":39},[],[],["Island",41],{"key":42,"result":43},"PortalBreadcrumb_DpFJeYxiFp2OIeAPO14oKszoyuHxoDNDyiDn7RK8ju0",{"head":44},{"link":45,"style":46},[],[],[48,59,69],{"id":49,"locale":12,"slug":50,"type":14,"title":51,"summary":52,"content_html":53,"video_url":18,"cover_url":19,"author":54,"category":21,"status":22,"source_job_id":55,"published_at":56,"created_at":57,"updated_at":58},4591,"agent试点验收-七类失败复盘表","Agent试点验收：七类失败复盘表","读完可拿到七类失败归因表、三张验收清单和放权阈值，按步骤先跑只读试点，再决定哪些自动执行。","\u003Csection data-gzh-readable=\"1\" style=\"margin:0;padding:0;\">\u003Cdiv data-gzh-header=\"1\">\u003Cp style=\"font-size:15px;color:#888;text-align:center;margin-top:8px;\">读完可拿到七类失败归因表、三张验收清单和放权阈值，按步骤先跑只读试点，再决定哪些自动执行。\u003C\u002Fp>\n\u003Cfigure class=\"portal-article-figure\">\u003Cimg src=\"https:\u002F\u002Fguanshanshuyuan.cn\u002Fimages\u002Farticles\u002Flandscape_mountain.jpg\" alt=\"观山静思\" loading=\"lazy\" decoding=\"async\" \u002F>\u003Cfigcaption>观山静思\u003C\u002Ffigcaption>\u003C\u002Ffigure>\n\n\n\n\n\n\u003Cp style=\"font-size:14px;color:#999;text-align:center;margin-top:4px;\">作者：进学斋 · 观山书院\u003C\u002Fp>\u003Cp style=\"font-size:13px;color:#999;text-align:center;margin:0 0 6px 0;\">全文约3633字 · 阅读约需13分钟\u003C\u002Fp>\u003Chr style=\"border:none;border-top:1px solid #eee;margin:24px 0;\" \u002F>\u003C\u002Fdiv>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">最近不少团队把 AI Agent 放进真实流程：客服工单、运营巡检、数据整理、内部审批。Demo 很顺，一到多人、多系统、长时间运行就出问题。表面看是效果不稳定，真正卡住的是失败信号没有被拆开。\u003C\u002Fp>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">这篇给一套验收方法：七类失败复盘表、三张清单、三天只读试点、分级放权。你可以按步骤先跑只读试点，再决定哪些动作自动执行。\u003C\u002Fp>\u003Ch2 style=\"font-size:20px;font-weight:bold;color:#1a1a1a;border-bottom:2px solid #4a90d9;padding-bottom:8px;margin:2em 0 1em;\">一、先把失败讲清楚：七类信号决定要不要继续\u003C\u002Fh2>\u003Ch3 style=\"font-size:18px;font-weight:bold;color:#333;margin:1.6em 0 0.8em;\">1. 任务理解偏移：它做成了另一个任务\u003C\u002Fh3>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">用户要整理客诉并生成回复草稿，Agent 只做了分类。用户要补全字段，Agent 改写了整段文案。偏移的根源常在目标拆解，不在模型本身。\u003C\u002Fp>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">你可以看一次通过率、人工介入率和低质量输出占比。若同一个意图经常走偏，先改任务模板和验收字段，再考虑提示词。\u003C\u002Fp>\u003Ch3 style=\"font-size:18px;font-weight:bold;color:#333;margin:1.6em 0 0.8em;\">2. 上下文丢失：关键依据没跟到下一步\u003C\u002Fh3>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">多轮任务里，前面的约束、客户等级、预算口径、历史处理结论，到工具调用阶段被丢掉。结果看着合理，经不起复核。\u003C\u002Fp>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">观察上下文引用次数、关键字段正确率、任务耗时。如果重复查询和重复确认变多，说明链路没有把依据传下去。\u003C\u002Fp>\u003Ch3 style=\"font-size:18px;font-weight:bold;color:#333;margin:1.6em 0 0.8em;\">3. 工具越权：不该做的动作被做了\u003C\u002Fh3>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">读接口变写接口，草稿变发送，查询变删除。这类问题比回答错误更危险，因为它直接改变外部状态。\u003C\u002Fp>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">记录敏感动作命中数、工具调用入参、调用者身份、目标系统。发现越权先收窄工具白名单，而不是补一句不要删除。\u003C\u002Fp>\u003Ch3 style=\"font-size:18px;font-weight:bold;color:#333;margin:1.6em 0 0.8em;\">4. 结果不可验：输出漂亮，但无法追溯\u003C\u002Fh3>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">Agent 给出结论，却没有留下依据来源、计算口径、工具返回值、置信提示。业务同学不敢签，工程同学难复现。\u003C\u002Fp>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">验收要看关键字段正确率、依据链路完整率、用户是否接受结果。没有可验字段，就不能把动作交给自动流程。\u003C\u002Fp>\u003Ch3 style=\"font-size:18px;font-weight:bold;color:#333;margin:1.6em 0 0.8em;\">5. 成本失控：一个任务跑成了循环\u003C\u002Fh3>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">重复检索、反复总结、模型多次调用、工具多次请求，单任务成本持续上涨。团队只盯 token，容易漏掉耗时、重试、人工复核。\u003C\u002Fp>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">跟踪重复调用次数、任务耗时、错误恢复时间、单位任务成本趋势。成本异常往往是流程有环，先断环再扩容。\u003C\u002Fp>\u003Ch3 style=\"font-size:18px;font-weight:bold;color:#333;margin:1.6em 0 0.8em;\">6. 审批缺失：自动动作绕过人\u003C\u002Fh3>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">高风险动作没有审批位，或者审批只是走形式。真正出问题时，责任链断裂，复盘也找不回当时为什么放行。\u003C\u002Fp>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">检查审批缺失率、外部写入动作命中数、审批记录保留期限。审批不是加一个按钮，而是给每个高风险动作绑定人和理由。\u003C\u002Fp>\u003Ch3 style=\"font-size:18px;font-weight:bold;color:#333;margin:1.6em 0 0.8em;\">7. 回滚缺位：改出去收不回来\u003C\u002Fh3>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">改文档、发消息、更新工单、调整配置，失败后没有回滚 ID、没有补偿动作、没有兜底模板。一次成功，可能掩盖下一次事故。\u003C\u002Fp>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">记录回滚责任人、错误恢复时间、幂等性、审计 ID。写操作若不能回滚，只允许在低影响范围试点。\u003C\u002Fp>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">\u003Cem>—— 先采集运行日志，再判断问题在模型、提示词、工具还是流程。\u003C\u002Fem>\u003C\u002Fp>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">不要一上来就换框架、扩权限或加提示词。先让失败可观测，团队才有讨论基础。\u003C\u002Fp>\u003Cp style=\"text-align:center;margin:16px 0 6px 0;\">\u003Cimg src=\"http:\u002F\u002Fmmbiz.qpic.cn\u002Fsz_mmbiz_jpg\u002F4WyfSFibfkROMdibe5hjUkfGygfhy7nUib2bicXAV0oicfMrpdCPHs1NaYib56OA6H166X6IVxU9xib3DlnNuy5icy5bxiaONJ9iaQ9yGpAoR7bgTjfJ0\u002F0?from=appmsg\" alt=\"配图·湖光暮色\" style=\"max-width:100%;border-radius:6px;display:block;margin:0 auto;\" \u002F>\u003C\u002Fp>\u003Cp style=\"text-align:center;font-size:12px;color:#bbb;margin:0 0 18px 0;\">配图·湖光暮色\u003C\u002Fp>\u003Ch2 style=\"font-size:20px;font-weight:bold;color:#1a1a1a;border-bottom:2px solid #4a90d9;padding-bottom:8px;margin:2em 0 1em;\">二、定义验收口径：用三张清单替代看起来可用\u003C\u002Fh2>\u003Ch3 style=\"font-size:18px;font-weight:bold;color:#333;margin:1.6em 0 0.8em;\">1. 业务验收清单\u003C\u002Fh3>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">业务侧只问结果能不能用。你可以固定五项：任务目标完成率、关键字段正确率、用户是否接受结果、低质量输出占比、人工复核比例。每项都要说明口径。\u003C\u002Fp>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">比如关键客诉字段包含客户身份、诉求类型、责任团队、处理时限。缺一项，就不算完成。\u003C\u002Fp>\u003Ch3 style=\"font-size:18px;font-weight:bold;color:#333;margin:1.6em 0 0.8em;\">2. 工程验收清单\u003C\u002Fh3>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">工程侧要能复现、能追踪、能止损。你可以固定：超时率、重试次数、幂等性、日志字段完整性、依赖服务错误码、调用链路耗时分布。\u003C\u002Fp>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">日志至少包含 \u003Ccode style=\"font-family:'SF Mono',Menlo,Consolas,monospace;color:#333;background:#f5f5f5;padding:2px 6px;font-size:14px;border-radius:3px;\">task_id\u003C\u002Fcode>、\u003Ccode style=\"font-family:'SF Mono',Menlo,Consolas,monospace;color:#333;background:#f5f5f5;padding:2px 6px;font-size:14px;border-radius:3px;\">run_id\u003C\u002Fcode>、\u003Ccode style=\"font-family:'SF Mono',Menlo,Consolas,monospace;color:#333;background:#f5f5f5;padding:2px 6px;font-size:14px;border-radius:3px;\">agent_version\u003C\u002Fcode>、\u003Ccode style=\"font-family:'SF Mono',Menlo,Consolas,monospace;color:#333;background:#f5f5f5;padding:2px 6px;font-size:14px;border-radius:3px;\">tool_name\u003C\u002Fcode>、\u003Ccode style=\"font-family:'SF Mono',Menlo,Consolas,monospace;color:#333;background:#f5f5f5;padding:2px 6px;font-size:14px;border-radius:3px;\">input_hash\u003C\u002Fcode>、\u003Ccode style=\"font-family:'SF Mono',Menlo,Consolas,monospace;color:#333;background:#f5f5f5;padding:2px 6px;font-size:14px;border-radius:3px;\">output_hash\u003C\u002Fcode>、\u003Ccode style=\"font-family:'SF Mono',Menlo,Consolas,monospace;color:#333;background:#f5f5f5;padding:2px 6px;font-size:14px;border-radius:3px;\">duration\u003C\u002Fcode>、\u003Ccode style=\"font-family:'SF Mono',Menlo,Consolas,monospace;color:#333;background:#f5f5f5;padding:2px 6px;font-size:14px;border-radius:3px;\">error_code\u003C\u002Fcode>。\u003C\u002Fp>\u003Cpre style=\"background:#f5f7fa;padding:15px;border-radius:6px;font-size:14px;line-height:1.6;overflow-x:auto;margin:1em 0;\">\u003Ccode style=\"font-family:'SF Mono',Menlo,Consolas,monospace;color:#333;background:#f5f5f5;padding:2px 6px;font-size:14px;border-radius:3px;\">event: agent.plan\u003Cbr>task_id: T-1024\u003Cbr>run_id: R-77\u003Cbr>user_intent: 整理客户投诉并生成回复草稿\u003Cbr>planned_steps: retrieve, summarize, draft\u003Cbr>tool_call: search_tickets status=open\u003Cbr>risk_level: read_only\u003Cbr>approval_required: false\u003Cbr>idempotency_key: T-1024-R-77-search-001\u003C\u002Fcode>\u003C\u002Fpre>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">这段日志不是为了好看，是为了三天试点后能归因。若只有结果没有过程，复盘会变成猜。\u003C\u002Fp>\u003Ch3 style=\"font-size:18px;font-weight:bold;color:#333;margin:1.6em 0 0.8em;\">3. 安全合规清单\u003C\u002Fh3>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">安全侧重点不是模型能力，而是动作边界。你需要检查：敏感数据暴露、外部写入动作、删除\u002F支付\u002F发布类操作审批、审计记录保留期限、回滚责任人。\u003C\u002Fp>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">对客外发、资金变更、生产配置修改、删除记录，默认不进自动执行。即使业务催得紧，也只先在沙箱或影子系统跑。\u003C\u002Fp>\u003Ch3 style=\"font-size:18px;font-weight:bold;color:#333;margin:1.6em 0 0.8em;\">可执行检查清单\u003C\u002Fh3>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">☐ 建立 \u003Ccode style=\"font-family:'SF Mono',Menlo,Consolas,monospace;color:#333;background:#f5f5f5;padding:2px 6px;font-size:14px;border-radius:3px;\">task_id\u003C\u002Fcode>、\u003Ccode style=\"font-family:'SF Mono',Menlo,Consolas,monospace;color:#333;background:#f5f5f5;padding:2px 6px;font-size:14px;border-radius:3px;\">run_id\u003C\u002Fcode>、\u003Ccode style=\"font-family:'SF Mono',Menlo,Consolas,monospace;color:#333;background:#f5f5f5;padding:2px 6px;font-size:14px;border-radius:3px;\">agent_version\u003C\u002Fcode> 三键日志，确保每次执行可追踪。\u003C\u002Fp>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">☐ 为每个工具调用记录输入摘要、输出摘要、耗时、错误码和幂等键。\u003C\u002Fp>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">☐ 把外部写入、删除、支付、发布、对客外发动作放入默认拦截名单。\u003C\u002Fp>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">☐ 给业务验收字段写明定义、口径、复核人，不接受模糊评价。\u003C\u002Fp>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">☐ 为失败样本设置每日复盘池，问题未关闭前不扩大调用范围。\u003C\u002Fp>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">☐ 每个高风险动作绑定审批人、理由字段、回滚责任人和审计 ID。\u003C\u002Fp>\u003Cp style=\"text-align:center;margin:16px 0 6px 0;\">\u003Cimg src=\"http:\u002F\u002Fmmbiz.qpic.cn\u002Fmmbiz_jpg\u002F4WyfSFibfkROLjnzBJj8d98qdiarGGqdU4mMiaDpmBha8u2wBO4iarb53DmcMrPZDYNXwnWqlEtV3bGrj9IepTv4vQQGzfyxvyiaZaRhjG35uQQY\u002F0?from=appmsg\" alt=\"配图·晨雾山色\" style=\"max-width:100%;border-radius:6px;display:block;margin:0 auto;\" \u002F>\u003C\u002Fp>\u003Cp style=\"text-align:center;font-size:12px;color:#bbb;margin:0 0 18px 0;\">配图·晨雾山色\u003C\u002Fp>\u003Ch2 style=\"font-size:20px;font-weight:bold;color:#1a1a1a;border-bottom:2px solid #4a90d9;padding-bottom:8px;margin:2em 0 1em;\">三、跑只读试点：三天量出能力边界\u003C\u002Fh2>\u003Ch3 style=\"font-size:18px;font-weight:bold;color:#333;margin:1.6em 0 0.8em;\">第一天：只记录，不执行\u003C\u002Fh3>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">第一天让 Agent 只做影子运行。它接收输入，生成计划，记录工具调用意图、输出草案和失败提示。实际系统不被修改。\u003C\u002Fp>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">你要确认三件事：它是否理解目标，是否知道边界，是否能把计划说得清楚。若计划里出现删除、外发、支付，直接打回。\u003C\u002Fp>\u003Ch3 style=\"font-size:18px;font-weight:bold;color:#333;margin:1.6em 0 0.8em;\">第二天：只放低危动作\u003C\u002Fh3>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">第二天允许查询、摘要、草稿生成、格式转换。禁止跨系统写入、外发、删除、资金类操作。\u003C\u002Fp>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">重点看动作是否可重复、是否可撤销、是否产生真实状态变化。只要会影响别人，就退回人工确认。\u003C\u002Fp>\u003Ch3 style=\"font-size:18px;font-weight:bold;color:#333;margin:1.6em 0 0.8em;\">第三天：失败归因与三档分类\u003C\u002Fh3>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">第三天把任务按七类信号打标签。每个动作分成三档：自动执行、人工审批、必须禁用。\u003C\u002Fp>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">自动执行适合低危、可重复、只读、影响小的动作。人工审批适合中高风险写入和边界模糊动作。必须禁用适合不可验、不可回滚、越权倾向明显的动作。\u003C\u002Fp>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">据公开资料\u002F行业观察，团队常见问题是把 Agent 一次性接到完整业务流程。更稳的做法是先跑影子日志，再逐步开放低危动作。\u003C\u002Fp>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">\u003Cem>—— 试点不是证明它聪明，而是找出它什么时候不该被信任。\u003C\u002Fem>\u003C\u002Fp>\u003Ch2 style=\"font-size:20px;font-weight:bold;color:#1a1a1a;border-bottom:2px solid #4a90d9;padding-bottom:8px;margin:2em 0 1em;\">四、按风险放权：用分级执行把兜底写进流程\u003C\u002Fh2>\u003Ch3 style=\"font-size:18px;font-weight:bold;color:#333;margin:1.6em 0 0.8em;\">1. 动作风险乘以影响范围\u003C\u002Fh3>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">不要按任务名称放权，要按动作风险。低风险只读可自动，中风险写入需确认，高风险外发或变更需人工审批。\u003C\u002Fp>\u003Ctable style=\"width:100%;border-collapse:collapse;font-size:13px;margin:16px 0;\">\u003Ctr>\u003Cth style=\"border:1px solid #ddd;padding:8px 10px;background:#f5f8fc;color:#1a1a1a;font-weight:bold;text-align:left;\">失败信号\u003C\u002Fth>\u003Cth style=\"border:1px solid #ddd;padding:8px 10px;background:#f5f8fc;color:#1a1a1a;font-weight:bold;text-align:left;\">典型症状\u003C\u002Fth>\u003Cth style=\"border:1px solid #ddd;padding:8px 10px;background:#f5f8fc;color:#1a1a1a;font-weight:bold;text-align:left;\">先查什么\u003C\u002Fth>\u003Cth style=\"border:1px solid #ddd;padding:8px 10px;background:#f5f8fc;color:#1a1a1a;font-weight:bold;text-align:left;\">治理动作\u003C\u002Fth>\u003C\u002Ftr>\u003Ctr>\u003Ctd style=\"border:1px solid #ddd;padding:8px 10px;vertical-align:top;\">任务理解偏移\u003C\u002Ftd>\u003Ctd style=\"border:1px solid #ddd;padding:8px 10px;vertical-align:top;\">输出和原目标不一致\u003C\u002Ftd>\u003Ctd style=\"border:1px solid #ddd;padding:8px 10px;vertical-align:top;\">任务模板、验收字段\u003C\u002Ftd>\u003Ctd style=\"border:1px solid #ddd;padding:8px 10px;vertical-align:top;\">重写任务拆解，加目标校验\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd style=\"border:1px solid #ddd;padding:8px 10px;vertical-align:top;\">上下文丢失\u003C\u002Ftd>\u003Ctd style=\"border:1px solid #ddd;padding:8px 10px;vertical-align:top;\">约束被遗忘，重复确认\u003C\u002Ftd>\u003Ctd style=\"border:1px solid #ddd;padding:8px 10px;vertical-align:top;\">字段传递、检索引用\u003C\u002Ftd>\u003Ctd style=\"border:1px solid #ddd;padding:8px 10px;vertical-align:top;\">固定上下文字段，增加计划前检查\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd style=\"border:1px solid #ddd;padding:8px 10px;vertical-align:top;\">工具越权\u003C\u002Ftd>\u003Ctd style=\"border:1px solid #ddd;padding:8px 10px;vertical-align:top;\">读变写，草稿变发送\u003C\u002Ftd>\u003Ctd style=\"border:1px solid #ddd;padding:8px 10px;vertical-align:top;\">工具白名单、调用身份\u003C\u002Ftd>\u003Ctd style=\"border:1px solid #ddd;padding:8px 10px;vertical-align:top;\">收窄权限，敏感动作拦截\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd style=\"border:1px solid #ddd;padding:8px 10px;vertical-align:top;\">结果不可验\u003C\u002Ftd>\u003Ctd style=\"border:1px solid #ddd;padding:8px 10px;vertical-align:top;\">无依据、无口径、难复现\u003C\u002Ftd>\u003Ctd style=\"border:1px solid #ddd;padding:8px 10px;vertical-align:top;\">关键字段、依据链\u003C\u002Ftd>\u003Ctd style=\"border:1px solid #ddd;padding:8px 10px;vertical-align:top;\">补齐来源和审计字段\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd style=\"border:1px solid #ddd;padding:8px 10px;vertical-align:top;\">成本失控\u003C\u002Ftd>\u003Ctd style=\"border:1px solid #ddd;padding:8px 10px;vertical-align:top;\">重复调用、长链路堆积\u003C\u002Ftd>\u003Ctd style=\"border:1px solid #ddd;padding:8px 10px;vertical-align:top;\">重试、耗时、成本趋势\u003C\u002Ftd>\u003Ctd style=\"border:1px solid #ddd;padding:8px 10px;vertical-align:top;\">设超时和熔断，拆小任务\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd style=\"border:1px solid #ddd;padding:8px 10px;vertical-align:top;\">审批缺失\u003C\u002Ftd>\u003Ctd style=\"border:1px solid #ddd;padding:8px 10px;vertical-align:top;\">绕过人或审批形同虚设\u003C\u002Ftd>\u003Ctd style=\"border:1px solid #ddd;padding:8px 10px;vertical-align:top;\">审批记录、责任链\u003C\u002Ftd>\u003Ctd style=\"border:1px solid #ddd;padding:8px 10px;vertical-align:top;\">高风险动作绑定审批人和理由\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd style=\"border:1px solid #ddd;padding:8px 10px;vertical-align:top;\">回滚缺位\u003C\u002Ftd>\u003Ctd style=\"border:1px solid #ddd;padding:8px 10px;vertical-align:top;\">改出去收不回\u003C\u002Ftd>\u003Ctd style=\"border:1px solid #ddd;padding:8px 10px;vertical-align:top;\">幂等键、回滚责任人\u003C\u002Ftd>\u003Ctd style=\"border:1px solid #ddd;padding:8px 10px;vertical-align:top;\">无回滚不放量，先禁用\u003C\u002Ftd>\u003C\u002Ftr>\u003C\u002Ftable>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">表格可以放在验收会议首页。讨论时别问效果怎么样，先问命中了哪类失败。\u003C\u002Fp>\u003Ch3 style=\"font-size:18px;font-weight:bold;color:#333;margin:1.6em 0 0.8em;\">2. 写操作三件套\u003C\u002Fh3>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">所有写操作必须具备幂等、可回滚和审计 ID。同一用户同一任务重复失败时，优先熔断，而不是继续重试。\u003C\u002Fp>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">幂等键可以设计成 \u003Ccode style=\"font-family:'SF Mono',Menlo,Consolas,monospace;color:#333;background:#f5f5f5;padding:2px 6px;font-size:14px;border-radius:3px;\">user_id + task_id + action_id\u003C\u002Fcode>。回滚字段可以记录 \u003Ccode style=\"font-family:'SF Mono',Menlo,Consolas,monospace;color:#333;background:#f5f5f5;padding:2px 6px;font-size:14px;border-radius:3px;\">previous_state\u003C\u002Fcode>、\u003Ccode style=\"font-family:'SF Mono',Menlo,Consolas,monospace;color:#333;background:#f5f5f5;padding:2px 6px;font-size:14px;border-radius:3px;\">restore_point\u003C\u002Fcode>、\u003Ccode style=\"font-family:'SF Mono',Menlo,Consolas,monospace;color:#333;background:#f5f5f5;padding:2px 6px;font-size:14px;border-radius:3px;\">owner\u003C\u002Fcode>。审计 ID 让人工干预可追溯。\u003C\u002Fp>\u003Ch3 style=\"font-size:18px;font-weight:bold;color:#333;margin:1.6em 0 0.8em;\">3. 兜底通道要提前准备\u003C\u002Fh3>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">给 Agent 准备四条路：超时回退模板，失败转人工，敏感动作拦截，异常样本进入每日复盘池。\u003C\u002Fp>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">兜底不是失败后的补丁，而是流程的一部分。没有兜底的自动化，本质是把风险交给运气。\u003C\u002Fp>\u003Ch2 style=\"font-size:20px;font-weight:bold;color:#1a1a1a;border-bottom:2px solid #4a90d9;padding-bottom:8px;margin:2em 0 1em;\">五、上线后迭代：用复盘表持续收紧边界\u003C\u002Fh2>\u003Ch3 style=\"font-size:18px;font-weight:bold;color:#333;margin:1.6em 0 0.8em;\">1. 每周汇总失败样本\u003C\u002Fh3>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">每周把七类失败样本归并一次。更新提示词、工具描述、路由规则和验收阈值。问题不能靠临时补提示词掩盖。\u003C\u002Fp>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">如果同一任务反复命中工具越权，改工具权限。如果结果不可验，补字段。如果成本失控，设调用上限和熔断。\u003C\u002Fp>\u003Ch3 style=\"font-size:18px;font-weight:bold;color:#333;margin:1.6em 0 0.8em;\">2. 灰度对比四组指标\u003C\u002Fh3>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">小范围灰度批次时，你可以对比四组指标：一次通过率、人工介入率、单位任务成本、错误恢复时间。\u003C\u002Fp>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">指标变稳再扩大调用范围。指标波动时，先缩权限。放权顺序应是：只读查询、草稿生成、低危写入、外部写入、高风险审批动作。\u003C\u002Fp>\u003Ch3 style=\"font-size:18px;font-weight:bold;color:#333;margin:1.6em 0 0.8em;\">3. 形成版本化验收记录\u003C\u002Fh3>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">每次上线都要留下记录：本次改了什么，为什么改，哪些动作从审批降为自动，哪些仍保持人工兜底。\u003C\u002Fp>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">版本化记录能避免两个团队重复踩坑。也让 Agent 试点从口头可用变成可交接的工程资产。\u003C\u002Fp>\u003Ch2 style=\"font-size:20px;font-weight:bold;color:#1a1a1a;border-bottom:2px solid #4a90d9;padding-bottom:8px;margin:2em 0 1em;\">三句话讲透\u003C\u002Fh2>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">先记录再放权。没有日志和归因，所有乐观都容易变成事故。\u003C\u002Fp>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">先验收再上线。没有三张清单，Agent 的聪明只是局部表演。\u003C\u002Fp>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">先兜底再自动化。没有熔断、回滚和审批，团队不敢把真实流程交给它。\u003C\u002Fp>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">你可以今晚就做三件事：给当前试点补 \u003Ccode style=\"font-family:'SF Mono',Menlo,Consolas,monospace;color:#333;background:#f5f5f5;padding:2px 6px;font-size:14px;border-radius:3px;\">task_id\u003C\u002Fcode> 日志；把删除、外发、支付动作放进默认拦截；用三天试点把动作分成自动、审批、禁用三档。\u003C\u002Fp>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">这篇适合转发给负责 Agent 试点的工程、产品和安全同学。建议收藏，下次验收直接对着清单过。\u003C\u002Fp>\u003C\u002Fsection>\n\u003Csection class=\"portal-disclaimer\" data-portal-disclaimer=\"1\" style=\"margin-top:2.5em;padding-top:1.25em;border-top:1px solid #e8e4dc;font-size:14px;line-height:1.7;color:#7a756c;\">\u003Cp style=\"margin:0;\">免责声明：本文内容整理自公开网络资料，仅供学习交流参考，不代表观山书院立场。如涉及版权侵权，请联系我们删除。\u003C\u002Fp>\u003Cp style=\"margin:0.75em 0 0;\">联系邮箱：\u003Ca href=\"mailto:chenxj.g@gmail.com\">chenxj.g@gmail.com\u003C\u002Fa>\u003C\u002Fp>\u003C\u002Fsection>","进学斋",3491491,"2026-09-29T20:53:49+08:00","2026-09-29T21:12:09.721151+08:00","2026-09-29T21:35:02.874441+08:00",{"id":60,"locale":12,"slug":61,"type":14,"title":62,"summary":63,"content_html":64,"video_url":18,"cover_url":19,"author":54,"category":21,"status":22,"source_job_id":65,"published_at":66,"created_at":67,"updated_at":68},4589,"agent观测回滚-落地实战清单","Agent观测回滚：落地实战清单","读完可拿到Agent运行期观测字段清单和错误分级回滚表，先小流量记录、再逐步放权。","\u003Csection data-gzh-readable=\"1\" style=\"margin:0;padding:0;\">\u003Cdiv data-gzh-header=\"1\">\u003Cp style=\"font-size:15px;color:#888;text-align:center;margin-top:8px;\">读完可拿到Agent运行期观测字段清单和错误分级回滚表，先小流量记录、再逐步放权。\u003C\u002Fp>\n\u003Cfigure class=\"portal-article-figure\">\u003Cimg src=\"https:\u002F\u002Fguanshanshuyuan.cn\u002Fimages\u002Farticles\u002Flandscape_mountain.jpg\" alt=\"观山静思\" loading=\"lazy\" decoding=\"async\" \u002F>\u003Cfigcaption>观山静思\u003C\u002Ffigcaption>\u003C\u002Ffigure>\n\n\n\n\n\n\n\n\n\u003Cp style=\"font-size:14px;color:#999;text-align:center;margin-top:4px;\">作者：进学斋 · 观山书院\u003C\u002Fp>\u003Cp style=\"font-size:13px;color:#999;text-align:center;margin:0 0 6px 0;\">全文约3580字 · 阅读约需12分钟\u003C\u002Fp>\u003Chr style=\"border:none;border-top:1px solid #eee;margin:24px 0;\" \u002F>\u003C\u002Fdiv>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">最近几个 Agent 项目进入运行期，问题开始变复杂：模型回答看起来不错，流程却跑不稳。不是少一个提示词，就是权限太大、成本太高、错误没人发现。\u003C\u002Fp>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">这篇只讲上线后的运行期数据治理。你可以拿到四张观测看板、三档回滚动作、一份七天落地步骤。先小流量记录，再逐步放权。\u003C\u002Fp>\u003Ch2 style=\"font-size:20px;font-weight:bold;color:#1a1a1a;border-bottom:2px solid #4a90d9;padding-bottom:8px;margin:2em 0 1em;\">一、落地卡点：从模型会答到系统可管\u003C\u002Fh2>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">很多团队把 Agent 接上工具后，默认「能调用」就等于「能上线」。实际故障很少停在答案文本上，更多出现在工具调用链断裂、权限越界、成本失控和人工接管失控。\u003C\u002Fp>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">比如查询工具返回空值，Agent 继续生成结论；写回接口超时，任务被重复执行；敏感操作没有审批，直接进入生产账号。这类问题靠临时改提示词很难根治。\u003C\u002Fp>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">运行期要做的是把每次执行变成可追踪对象。先定义稳定执行：任务可追踪、错误可停止、成本可回滚。\u003C\u002Fp>\u003Ch3 style=\"font-size:18px;font-weight:bold;color:#333;margin:1.6em 0 0.8em;\">可追踪：一次任务必须有身份\u003C\u002Fh3>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">没有 \u003Ccode style=\"font-family:'SF Mono',Menlo,Consolas,monospace;color:#333;background:#f5f5f5;padding:2px 6px;font-size:14px;border-radius:3px;\">task_id\u003C\u002Fcode> 和 \u003Ccode style=\"font-family:'SF Mono',Menlo,Consolas,monospace;color:#333;background:#f5f5f5;padding:2px 6px;font-size:14px;border-radius:3px;\">trace_id\u003C\u002Fcode>，Agent 调用就像匿名请求。你不知道它属于哪个岗位、哪个流程、哪一批用户。\u003C\u002Fp>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">每次调用至少记录：任务身份、场景、输入摘要、提示词版本、模型版本、开始时间和状态。\u003C\u002Fp>\u003Ch3 style=\"font-size:18px;font-weight:bold;color:#333;margin:1.6em 0 0.8em;\">可停止：错误必须分级\u003C\u002Fh3>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">不是所有错误都继续重试。参数校验失败可以提示用户修正；工具连续失败要熔断；权限未审批要直接停止。\u003C\u002Fp>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">停止条件要写在系统里，不是靠运营盯屏。\u003C\u002Fp>\u003Ch3 style=\"font-size:18px;font-weight:bold;color:#333;margin:1.6em 0 0.8em;\">可回滚：动作要有退出路径\u003C\u002Fh3>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">Agent 如果只生成文本，回滚简单。一旦写库、发消息、改工单，就必须知道回滚点在哪里。\u003C\u002Fp>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">可回滚不是每次撤销，而是保证错误不扩散。\u003C\u002Fp>\u003Cp align=\"center\" style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">\u003Cem>—— 看得见，才谈得上管得住\u003C\u002Fem>\u003C\u002Fp>\u003Cp style=\"text-align:center;margin:16px 0 6px 0;\">\u003Cimg src=\"http:\u002F\u002Fmmbiz.qpic.cn\u002Fmmbiz_jpg\u002F4WyfSFibfkRNicSJdZqVvCiasq28Q9qpTaIzccpTIdMFMV6CG1VdagjPZLT84B1Yicz5ppSlAZAShzH8OIJJ570JSEorQEyRGSLus3EPRJJYnLM\u002F0?from=appmsg\" alt=\"配图·山谷柔绿\" style=\"max-width:100%;border-radius:6px;display:block;margin:0 auto;\" \u002F>\u003C\u002Fp>\u003Cp style=\"text-align:center;font-size:12px;color:#bbb;margin:0 0 18px 0;\">配图·山谷柔绿\u003C\u002Fp>\u003Ch2 style=\"font-size:20px;font-weight:bold;color:#1a1a1a;border-bottom:2px solid #4a90d9;padding-bottom:8px;margin:2em 0 1em;\">二、观测模型：四张数据看板\u003C\u002Fh2>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">不要把所有日志堆成一张表。Agent 运行期至少要拆成四张看板：请求、工具、成本质量、审计。每张看板回答不同问题。\u003C\u002Fp>\u003Ch3 style=\"font-size:18px;font-weight:bold;color:#333;margin:1.6em 0 0.8em;\">请求看板：任务是否被正确触发\u003C\u002Fh3>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">它记录请求来自谁、属于什么任务、为什么触发。适合排查这个 Agent 为什么开始跑。\u003C\u002Fp>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">你可以先收集一组字段：\u003Ccode style=\"font-family:'SF Mono',Menlo,Consolas,monospace;color:#333;background:#f5f5f5;padding:2px 6px;font-size:14px;border-radius:3px;\">task_id\u003C\u002Fcode>、\u003Ccode style=\"font-family:'SF Mono',Menlo,Consolas,monospace;color:#333;background:#f5f5f5;padding:2px 6px;font-size:14px;border-radius:3px;\">scene\u003C\u002Fcode>、\u003Ccode style=\"font-family:'SF Mono',Menlo,Consolas,monospace;color:#333;background:#f5f5f5;padding:2px 6px;font-size:14px;border-radius:3px;\">input_digest\u003C\u002Fcode>、\u003Ccode style=\"font-family:'SF Mono',Menlo,Consolas,monospace;color:#333;background:#f5f5f5;padding:2px 6px;font-size:14px;border-radius:3px;\">prompt_version\u003C\u002Fcode>、\u003Ccode style=\"font-family:'SF Mono',Menlo,Consolas,monospace;color:#333;background:#f5f5f5;padding:2px 6px;font-size:14px;border-radius:3px;\">status\u003C\u002Fcode>。字段不在多，关键能串起来。\u003C\u002Fp>\u003Cpre style=\"background:#f5f7fa;padding:15px;border-radius:6px;font-size:14px;line-height:1.6;overflow-x:auto;margin:1em 0;\">\u003Ccode style=\"font-family:'SF Mono',Menlo,Consolas,monospace;color:#333;background:#f5f5f5;padding:2px 6px;font-size:14px;border-radius:3px;\">trace_id=agent-ticket-001\ntask_id=ticket-8827\nscene=ticket_first_reply\ninput_digest=order_delay_customer_question\nprompt_version=ticket_reply_v3\nstart_time=2026-09-29T10:20:00\nstatus=success\u003C\u002Fcode>\u003C\u002Fpre>\u003Ch3 style=\"font-size:18px;font-weight:bold;color:#333;margin:1.6em 0 0.8em;\">工具看板：链路在哪里断掉\u003C\u002Fh3>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">工具看板比答案看板更重要。它记录调用顺序、返回码、耗时和失败节点。\u003C\u002Fp>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">建议按 step 展开：第 1 步查询订单，第 2 步读取知识库，第 3 步生成草稿，第 4 步写回工单。如果第 3 步没有写回，问题在工具层，不在模型层。\u003C\u002Fp>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">字段：\u003Ccode style=\"font-family:'SF Mono',Menlo,Consolas,monospace;color:#333;background:#f5f5f5;padding:2px 6px;font-size:14px;border-radius:3px;\">step_no\u003C\u002Fcode>、\u003Ccode style=\"font-family:'SF Mono',Menlo,Consolas,monospace;color:#333;background:#f5f5f5;padding:2px 6px;font-size:14px;border-radius:3px;\">tool_name\u003C\u002Fcode>、\u003Ccode style=\"font-family:'SF Mono',Menlo,Consolas,monospace;color:#333;background:#f5f5f5;padding:2px 6px;font-size:14px;border-radius:3px;\">args_digest\u003C\u002Fcode>、\u003Ccode style=\"font-family:'SF Mono',Menlo,Consolas,monospace;color:#333;background:#f5f5f5;padding:2px 6px;font-size:14px;border-radius:3px;\">return_code\u003C\u002Fcode>、\u003Ccode style=\"font-family:'SF Mono',Menlo,Consolas,monospace;color:#333;background:#f5f5f5;padding:2px 6px;font-size:14px;border-radius:3px;\">latency_ms\u003C\u002Fcode>、\u003Ccode style=\"font-family:'SF Mono',Menlo,Consolas,monospace;color:#333;background:#f5f5f5;padding:2px 6px;font-size:14px;border-radius:3px;\">retry_count\u003C\u002Fcode>。\u003C\u002Fp>\u003Ch3 style=\"font-size:18px;font-weight:bold;color:#333;margin:1.6em 0 0.8em;\">成本与质量看板：值不值得继续放权\u003C\u002Fh3>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">Agent 不是越自动越好，要算账。Token 用量、工具接口费用、人工接管率、重复提问率，都会决定能不能扩大流量。\u003C\u002Fp>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">质量指标不要只看准确率。可以看一次完成率、人工修正次数、重复触发次数、最终是否进入业务系统。\u003C\u002Fp>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">字段：\u003Ccode style=\"font-family:'SF Mono',Menlo,Consolas,monospace;color:#333;background:#f5f5f5;padding:2px 6px;font-size:14px;border-radius:3px;\">tokens_in\u003C\u002Fcode>、\u003Ccode style=\"font-family:'SF Mono',Menlo,Consolas,monospace;color:#333;background:#f5f5f5;padding:2px 6px;font-size:14px;border-radius:3px;\">tokens_out\u003C\u002Fcode>、\u003Ccode style=\"font-family:'SF Mono',Menlo,Consolas,monospace;color:#333;background:#f5f5f5;padding:2px 6px;font-size:14px;border-radius:3px;\">tool_cost_estimate\u003C\u002Fcode>、\u003Ccode style=\"font-family:'SF Mono',Menlo,Consolas,monospace;color:#333;background:#f5f5f5;padding:2px 6px;font-size:14px;border-radius:3px;\">manual_takeover_reason\u003C\u002Fcode>、\u003Ccode style=\"font-family:'SF Mono',Menlo,Consolas,monospace;color:#333;background:#f5f5f5;padding:2px 6px;font-size:14px;border-radius:3px;\">repeat_question_count\u003C\u002Fcode>。\u003C\u002Fp>\u003Ch3 style=\"font-size:18px;font-weight:bold;color:#333;margin:1.6em 0 0.8em;\">审计看板：谁批准了什么动作\u003C\u002Fh3>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">涉及工单关闭、客户通知、退款申请、库存调整时，审计必须独立成看板。\u003C\u002Fp>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">它记录敏感操作、审批人、执行结果、是否回滚。审计不是给模型看，是给流程看。\u003C\u002Fp>\u003Cp align=\"center\" style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">\u003Cem>—— 回滚不是倒退，是保留继续跑下去的资格\u003C\u002Fem>\u003C\u002Fp>\u003Cp style=\"text-align:center;margin:16px 0 6px 0;\">\u003Cimg src=\"http:\u002F\u002Fmmbiz.qpic.cn\u002Fsz_mmbiz_jpg\u002F4WyfSFibfkRMBOBM1DicBljibhC3e83iaaT74NwgoO06223ibzZsRbHtgsXfCgp4pEpRIZX9A2WOh9PY4pW622DbAYVMfFWvjXzznsnYqkMvPwGA\u002F0?from=appmsg\" alt=\"配图·静湖云烟\" style=\"max-width:100%;border-radius:6px;display:block;margin:0 auto;\" \u002F>\u003C\u002Fp>\u003Cp style=\"text-align:center;font-size:12px;color:#bbb;margin:0 0 18px 0;\">配图·静湖云烟\u003C\u002Fp>\u003Ch2 style=\"font-size:20px;font-weight:bold;color:#1a1a1a;border-bottom:2px solid #4a90d9;padding-bottom:8px;margin:2em 0 1em;\">三、回滚机制：三档动作分级\u003C\u002Fh2>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">很多团队回滚靠感觉危险。真正上线需要三档动作：只读观察、影子执行、最小闭环。每一档都有权限边界和触发条件。\u003C\u002Fp>\u003Ch3 style=\"font-size:18px;font-weight:bold;color:#333;margin:1.6em 0 0.8em;\">只读观察：先记录，不动业务\u003C\u002Fh3>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">只读观察适合新场景第一周。Agent 可以规划、查询、生成草稿，但不能写生产库、不能对外发消息。\u003C\u002Fp>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">目标不是替代人工，是拿到执行链路证据。你可以问自己：没有写入权限时，它能不能稳定产出可审计记录？\u003C\u002Fp>\u003Ch3 style=\"font-size:18px;font-weight:bold;color:#333;margin:1.6em 0 0.8em;\">影子执行：并行跑旧流程\u003C\u002Fh3>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">影子执行适合已有稳定人工流程。Agent 和原系统同时处理同一批任务，结果只比对，不生效。\u003C\u002Fp>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">重点看差异：Agent 是否多调工具、是否引用错资料、是否生成不可执行结论、是否触发敏感动作。\u003C\u002Fp>\u003Ch3 style=\"font-size:18px;font-weight:bold;color:#333;margin:1.6em 0 0.8em;\">最小闭环：低风险自动，高风险确认\u003C\u002Fh3>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">最小闭环可以放行低风险动作：查询、内部草稿、状态预览、非关键通知。高风险动作必须保留确认：支付、删除、改权限、对外承诺、合同条款变更。\u003C\u002Fp>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">低风险和高风险不是业务主观词，要按影响面分级：是否改变资产、是否触达客户、是否跨越权限、是否难以撤销。\u003C\u002Fp>\u003Ctable style=\"width:100%;border-collapse:collapse;font-size:13px;margin:16px 0;\">\u003Cthead>\u003Ctr>\u003Cth style=\"border:1px solid #ddd;padding:8px 10px;background:#f5f8fc;color:#1a1a1a;font-weight:bold;text-align:left;\">档位\u003C\u002Fth>\u003Cth style=\"border:1px solid #ddd;padding:8px 10px;background:#f5f8fc;color:#1a1a1a;font-weight:bold;text-align:left;\">适用阶段\u003C\u002Fth>\u003Cth style=\"border:1px solid #ddd;padding:8px 10px;background:#f5f8fc;color:#1a1a1a;font-weight:bold;text-align:left;\">动作范围\u003C\u002Fth>\u003Cth style=\"border:1px solid #ddd;padding:8px 10px;background:#f5f8fc;color:#1a1a1a;font-weight:bold;text-align:left;\">触发条件\u003C\u002Fth>\u003Cth style=\"border:1px solid #ddd;padding:8px 10px;background:#f5f8fc;color:#1a1a1a;font-weight:bold;text-align:left;\">自动回滚动作\u003C\u002Fth>\u003C\u002Ftr>\u003C\u002Fthead>\u003Ctbody>\u003Ctr>\u003Ctd style=\"border:1px solid #ddd;padding:8px 10px;vertical-align:top;\">只读观察\u003C\u002Ftd>\u003Ctd style=\"border:1px solid #ddd;padding:8px 10px;vertical-align:top;\">新场景试运行\u003C\u002Ftd>\u003Ctd style=\"border:1px solid #ddd;padding:8px 10px;vertical-align:top;\">查询、记录、生成草稿\u003C\u002Ftd>\u003Ctd style=\"border:1px solid #ddd;padding:8px 10px;vertical-align:top;\">字段可追踪，无业务写入\u003C\u002Ftd>\u003Ctd style=\"border:1px solid #ddd;padding:8px 10px;vertical-align:top;\">保留日志，不影响旧流程\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd style=\"border:1px solid #ddd;padding:8px 10px;vertical-align:top;\">影子执行\u003C\u002Ftd>\u003Ctd style=\"border:1px solid #ddd;padding:8px 10px;vertical-align:top;\">已有流程替代评估\u003C\u002Ftd>\u003Ctd style=\"border:1px solid #ddd;padding:8px 10px;vertical-align:top;\">并行处理，结果比对\u003C\u002Ftd>\u003Ctd style=\"border:1px solid #ddd;padding:8px 10px;vertical-align:top;\">差异可解释，不直接生效\u003C\u002Ftd>\u003Ctd style=\"border:1px solid #ddd;padding:8px 10px;vertical-align:top;\">差异过大时暂停比对任务\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd style=\"border:1px solid #ddd;padding:8px 10px;vertical-align:top;\">最小闭环\u003C\u002Ftd>\u003Ctd style=\"border:1px solid #ddd;padding:8px 10px;vertical-align:top;\">小流量放行\u003C\u002Ftd>\u003Ctd style=\"border:1px solid #ddd;padding:8px 10px;vertical-align:top;\">低风险自动，高风险确认\u003C\u002Ftd>\u003Ctd style=\"border:1px solid #ddd;padding:8px 10px;vertical-align:top;\">有审批点、有熔断阈值\u003C\u002Ftd>\u003Ctd style=\"border:1px solid #ddd;padding:8px 10px;vertical-align:top;\">自动暂停工具调用并转人工\u003C\u002Ftd>\u003C\u002Ftr>\u003C\u002Ftbody>\u003C\u002Ftable>\u003Cp align=\"center\" style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">\u003Cem>—— 先把边界钉住，再谈放权\u003C\u002Fem>\u003C\u002Fp>\u003Ch2 style=\"font-size:20px;font-weight:bold;color:#1a1a1a;border-bottom:2px solid #4a90d9;padding-bottom:8px;margin:2em 0 1em;\">四、七天落地步骤\u003C\u002Fh2>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">别一次性把 Agent 接满所有流程。七天可以完成一次可控试点。\u003C\u002Fp>\u003Ch3 style=\"font-size:18px;font-weight:bold;color:#333;margin:1.6em 0 0.8em;\">第一天：选一个低风险岗位任务\u003C\u002Fh3>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">选工单预处理、知识库引用草稿、会议材料汇总这类任务。明确成功指标：一次完成率提升、人工修正减少、成本可控。明确停止条件：连续工具失败、未审批敏感动作、重复提问升高。\u003C\u002Fp>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">不要从支付、投诉、法务文书开始。高风险任务需要多轮审批和更完整审计。\u003C\u002Fp>\u003Ch3 style=\"font-size:18px;font-weight:bold;color:#333;margin:1.6em 0 0.8em;\">第二天：打通日志字段\u003C\u002Fh3>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">让每次调用可追踪。最少补齐 \u003Ccode style=\"font-family:'SF Mono',Menlo,Consolas,monospace;color:#333;background:#f5f5f5;padding:2px 6px;font-size:14px;border-radius:3px;\">trace_id\u003C\u002Fcode>、\u003Ccode style=\"font-family:'SF Mono',Menlo,Consolas,monospace;color:#333;background:#f5f5f5;padding:2px 6px;font-size:14px;border-radius:3px;\">tool_name\u003C\u002Fcode>、\u003Ccode style=\"font-family:'SF Mono',Menlo,Consolas,monospace;color:#333;background:#f5f5f5;padding:2px 6px;font-size:14px;border-radius:3px;\">return_code\u003C\u002Fcode>、\u003Ccode style=\"font-family:'SF Mono',Menlo,Consolas,monospace;color:#333;background:#f5f5f5;padding:2px 6px;font-size:14px;border-radius:3px;\">manual_takeover_reason\u003C\u002Fcode>。\u003C\u002Fp>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">如果日志只有自然语言摘要，后续定位很难。结构化日志是运行期治理的地基。\u003C\u002Fp>\u003Ch3 style=\"font-size:18px;font-weight:bold;color:#333;margin:1.6em 0 0.8em;\">第三到四天：做影子执行\u003C\u002Fh3>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">让 Agent 和旧流程同时处理一批任务。记录差异：Agent 是否漏查字段、是否误调用工具、是否产生不可确认结论。\u003C\u002Fp>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">人工接管原因要归三类：提示不清、工具失败、业务规则变化。不要只记效果不好。\u003C\u002Fp>\u003Ch3 style=\"font-size:18px;font-weight:bold;color:#333;margin:1.6em 0 0.8em;\">第五到七天：按回滚清单灰度放行\u003C\u002Fh3>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">先放行一小部分任务，不是一下全量。按档位检查：低风险动作可自动，高风险动作必须审批。\u003C\u002Fp>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">设置自动暂停阈值：同一工具连续返回失败码、未审批敏感动作被触发、成本预算超限、重复提问明显升高。触发后自动降级到只读观察或影子执行。\u003C\u002Fp>\u003Ch3 style=\"font-size:18px;font-weight:bold;color:#333;margin:1.6em 0 0.8em;\">上线前检查清单\u003C\u002Fh3>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">☐ 每个任务都有 \u003Ccode style=\"font-family:'SF Mono',Menlo,Consolas,monospace;color:#333;background:#f5f5f5;padding:2px 6px;font-size:14px;border-radius:3px;\">task_id\u003C\u002Fcode> 和 \u003Ccode style=\"font-family:'SF Mono',Menlo,Consolas,monospace;color:#333;background:#f5f5f5;padding:2px 6px;font-size:14px;border-radius:3px;\">trace_id\u003C\u002Fcode>。\u003C\u002Fp>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">☐ 工具调用顺序可重放，失败节点可定位。\u003C\u002Fp>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">☐ 成本字段能估算 Token 与工具费用。\u003C\u002Fp>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">☐ 人工接管率与重复提问率有看板。\u003C\u002Fp>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">☐ 敏感操作有审批人和执行结果记录。\u003C\u002Fp>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">☐ 有只读观察、影子执行、最小闭环三档开关。\u003C\u002Fp>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">☐ 有自动暂停条件和回滚路径，而不是只靠人工发现。\u003C\u002Fp>\u003Cp align=\"center\" style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">\u003Cem>—— 稳定不是少犯错，是错误发生时不扩散\u003C\u002Fem>\u003C\u002Fp>\u003Ch2 style=\"font-size:20px;font-weight:bold;color:#1a1a1a;border-bottom:2px solid #4a90d9;padding-bottom:8px;margin:2em 0 1em;\">五、常见坑与选型\u003C\u002Fh2>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">第一个坑：只看单次准确率。模型答得像模像样，不代表工具链可用。一个参数错，可能让后续查询、写回、通知全部跟着错。\u003C\u002Fp>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">更稳的指标是链路完成率：Agent 是否从输入走到可审计输出。单次准确率适合离线评估，不适合运行期治理。\u003C\u002Fp>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">第二个坑：把 Agent 接进权限过大的生产账号。工具权限最小化比提示词安全更可靠。能只读就不要写，能草稿就不要发送，能预览就不要提交。\u003C\u002Fp>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">行业实践中常见做法是给 Agent 单独创建受限身份，并走审批队列。敏感动作可以由 Agent 准备材料，由人或审批系统确认执行。\u003C\u002Fp>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">第三个坑：观测字段太少。只有答案，没有 \u003Ccode style=\"font-family:'SF Mono',Menlo,Consolas,monospace;color:#333;background:#f5f5f5;padding:2px 6px;font-size:14px;border-radius:3px;\">tool_name\u003C\u002Fcode>、\u003Ccode style=\"font-family:'SF Mono',Menlo,Consolas,monospace;color:#333;background:#f5f5f5;padding:2px 6px;font-size:14px;border-radius:3px;\">return_code\u003C\u002Fcode>、\u003Ccode style=\"font-family:'SF Mono',Menlo,Consolas,monospace;color:#333;background:#f5f5f5;padding:2px 6px;font-size:14px;border-radius:3px;\">args_digest\u003C\u002Fcode>，就无法判断失败来自提示、工具还是数据。\u003C\u002Fp>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">建议至少保留三类标识：请求身份、工具身份、错误身份。没有错误身份，系统就不知道什么时候暂停。\u003C\u002Fp>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">第四个坑：回滚只靠人工发现。运行期故障通常很快，人工盯屏会漏。必须设置自动暂停：工具连续失败、成本超预算、敏感动作未审批、重复提问升高。\u003C\u002Fp>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">第五个坑：把回滚等同于删除数据。回滚不一定物理撤销，重点是阻断扩散、保留证据、转人工。\u003C\u002Fp>\u003Ch3 style=\"font-size:18px;font-weight:bold;color:#333;margin:1.6em 0 0.8em;\">选型建议：观测平台怎么选\u003C\u002Fh3>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">如果你已有日志平台，不一定要新建复杂中台。先满足三件事：结构化日志、调用链追踪、阈值告警。\u003C\u002Fp>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">可以按优先级选择能力：第一步补日志字段；第二步做 trace 重放；第三步做成本与质量指标；第四步接入审批和回滚。\u003C\u002Fp>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">不要一开始追求全自动化。据公开资料和行业观察，稳定 Agent 试点往往先解决记录和归因，再逐步扩大自动动作范围。\u003C\u002Fp>\u003Ch2 style=\"font-size:20px;font-weight:bold;color:#1a1a1a;border-bottom:2px solid #4a90d9;padding-bottom:8px;margin:2em 0 1em;\">三句话讲透\u003C\u002Fh2>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">先可观测，再可回滚，最后可放权。\u003C\u002Fp>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">没有观测，放权就是赌运气。\u003C\u002Fp>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">落地不是追求全自动，而是让 Agent 在可控边界里稳定产生价值。\u003C\u002Fp>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">如果团队正在准备 Agent 上线，建议先把四张看板字段、三档回滚表、七天落地清单拿去评审。也欢迎收藏或转发给研发、运营和风控同事，少一点临时救火，多一点可追踪执行。\u003C\u002Fp>\u003C\u002Fsection>\n\u003Csection class=\"portal-disclaimer\" data-portal-disclaimer=\"1\" style=\"margin-top:2.5em;padding-top:1.25em;border-top:1px solid #e8e4dc;font-size:14px;line-height:1.7;color:#7a756c;\">\u003Cp style=\"margin:0;\">免责声明：本文内容整理自公开网络资料，仅供学习交流参考，不代表观山书院立场。如涉及版权侵权，请联系我们删除。\u003C\u002Fp>\u003Cp style=\"margin:0.75em 0 0;\">联系邮箱：\u003Ca href=\"mailto:chenxj.g@gmail.com\">chenxj.g@gmail.com\u003C\u002Fa>\u003C\u002Fp>\u003C\u002Fsection>",3491490,"2026-09-29T20:49:00+08:00","2026-09-29T21:00:41.902383+08:00","2026-09-29T21:35:01.7603+08:00",{"id":70,"locale":12,"slug":71,"type":14,"title":72,"summary":73,"content_html":74,"video_url":18,"cover_url":19,"author":54,"category":21,"status":22,"source_job_id":75,"published_at":76,"created_at":77,"updated_at":78},185,"agent落地-运行闭环七步法","Agent落地：运行闭环七步法","读完能搭建智能体上线后的监控、告警、人工接管、回滚与评测闭环，并用两周试点判断继续、降级或停止。","\u003Csection data-gzh-readable=\"1\" style=\"margin:0;padding:0;\">\u003Cdiv data-gzh-header=\"1\">\u003Cp style=\"font-size:15px;color:#888;text-align:center;margin-top:8px;\">读完能搭建智能体上线后的监控、告警、人工接管、回滚与评测闭环，并用两周试点判断继续、降级或停止。\u003C\u002Fp>\n\u003Cfigure class=\"portal-article-figure\">\u003Cimg src=\"https:\u002F\u002Fguanshanshuyuan.cn\u002Fimages\u002Farticles\u002Flandscape_mountain.jpg\" alt=\"观山静思\" loading=\"lazy\" decoding=\"async\" \u002F>\u003Cfigcaption>观山静思\u003C\u002Ffigcaption>\u003C\u002Ffigure>\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\u003Cp style=\"font-size:14px;color:#999;text-align:center;margin-top:4px;\">作者：进学斋 · 观山书院\u003C\u002Fp>\u003Cp style=\"font-size:13px;color:#999;text-align:center;margin:0 0 6px 0;\">全文约3943字 · 阅读约需14分钟\u003C\u002Fp>\u003Chr style=\"border:none;border-top:1px solid #eee;margin:24px 0;\" \u002F>\u003C\u002Fdiv>\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">最近跟几个做智能体交付的团队复盘，现场 demo 大多漂亮：能总结、能查库、能填字段。可一旦接到真实请求，工具超时、权限误拒、输出漂移、人工接管找不到责任人，问题就露出来了。这不是提示词不够华丽，而是运行闭环没有建立。\u003C\u002Fp>\n\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">这篇只讲上线后的运行闭环：正常、降级、熔断怎么划；失败怎么回放；监控怎么最小可用；人工接管、评测回归、回滚包怎么准备；最后用两周试点判断继续、降级或停止。\u003C\u002Fp>\n\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">据行业观察，多数智能体事故不是单一模型错，而是运行边界没有提前划清。闭环建好，才能少靠临时救火。\u003C\u002Fp>\n\u003Ch2 style=\"font-size:20px;font-weight:bold;color:#1a1a1a;border-bottom:2px solid #4a90d9;padding-bottom:8px;margin:2em 0 1em;\">一、先划运行状态表：正常、降级、熔断\u003C\u002Fh2>\n\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">很多团队把智能体状态简化成成功或失败。生产里，失败往往是逐步扩大的。一个解析错误可能先导致字段缺失，再触发工具重试，最后把成本拉高。状态表的意义，是让系统知道什么时候继续、什么时候降权、什么时候停止。\u003C\u002Fp>\n\u003Ch3 style=\"font-size:18px;font-weight:bold;color:#333;margin:1.6em 0 0.8em;\">状态表要回答四件事\u003C\u002Fh3>\n\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">它要定义进入条件、系统动作、恢复条件和责任人。没有这四项，值班人员只能凭感觉。下面这张表可以直接改成你们团队的版本。\u003C\u002Fp>\n\u003Ctable style=\"width:100%;border-collapse:collapse;font-size:13px;margin:16px 0;\">\n\u003Ctr>\u003Cth style=\"border:1px solid #ddd;padding:8px 10px;background:#f5f8fc;color:#1a1a1a;font-weight:bold;text-align:left;\">状态\u003C\u002Fth>\u003Cth style=\"border:1px solid #ddd;padding:8px 10px;background:#f5f8fc;color:#1a1a1a;font-weight:bold;text-align:left;\">进入条件\u003C\u002Fth>\u003Cth style=\"border:1px solid #ddd;padding:8px 10px;background:#f5f8fc;color:#1a1a1a;font-weight:bold;text-align:left;\">系统动作\u003C\u002Fth>\u003Cth style=\"border:1px solid #ddd;padding:8px 10px;background:#f5f8fc;color:#1a1a1a;font-weight:bold;text-align:left;\">恢复条件\u003C\u002Fth>\u003C\u002Ftr>\n\u003Ctr>\u003Ctd style=\"border:1px solid #ddd;padding:8px 10px;vertical-align:top;\">正常\u003C\u002Ftd>\u003Ctd style=\"border:1px solid #ddd;padding:8px 10px;vertical-align:top;\">核心工具可用，输出校验通过，成本在基线内，敏感操作已授权\u003C\u002Ftd>\u003Ctd style=\"border:1px solid #ddd;padding:8px 10px;vertical-align:top;\">低风险任务自动执行，中风险任务生成建议，高风险任务转审批\u003C\u002Ftd>\u003Ctd style=\"border:1px solid #ddd;padding:8px 10px;vertical-align:top;\">持续通过评测与监控，进入下一周期评审\u003C\u002Ftd>\u003C\u002Ftr>\n\u003Ctr>\u003Ctd style=\"border:1px solid #ddd;padding:8px 10px;vertical-align:top;\">降级\u003C\u002Ftd>\u003Ctd style=\"border:1px solid #ddd;padding:8px 10px;vertical-align:top;\">解析失败、工具报错或用户纠错连续上升，某类任务质量不稳定，成本异常增长\u003C\u002Ftd>\u003Ctd style=\"border:1px solid #ddd;padding:8px 10px;vertical-align:top;\">关闭高风险自动执行，保留只读查询、草稿建议和人工确认\u003C\u002Ftd>\u003Ctd style=\"border:1px solid #ddd;padding:8px 10px;vertical-align:top;\">连续观察窗内失败率回落，回归测试通过，负责人审批恢复\u003C\u002Ftd>\u003C\u002Ftr>\n\u003Ctr>\u003Ctd style=\"border:1px solid #ddd;padding:8px 10px;vertical-align:top;\">熔断\u003C\u002Ftd>\u003Ctd style=\"border:1px solid #ddd;padding:8px 10px;vertical-align:top;\">权限越界、关键依赖不可用、输出造成业务影响、成本或数据风险不可控\u003C\u002Ftd>\u003Ctd style=\"border:1px solid #ddd;padding:8px 10px;vertical-align:top;\">停用入口，保留证据，切回旧流程，通知负责人和受影响用户\u003C\u002Ftd>\u003Ctd style=\"border:1px solid #ddd;padding:8px 10px;vertical-align:top;\">根因已修复，事故复盘完成，小范围试点通过\u003C\u002Ftd>\u003C\u002Ftr>\n\u003C\u002Ftable>\n\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">这里有一个实操原则：降级不是把智能体变成摆设，而是把能力缩到可解释、可审计、可恢复的范围。\u003C\u002Fp>\n\u003Ch3 style=\"font-size:18px;font-weight:bold;color:#333;margin:1.6em 0 0.8em;\">三类任务权限先分清楚\u003C\u002Fh3>\n\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">上线前如果没写清楚权限边界，运行中就会出现模型建议退款、客服直接改单、用户没有确认就提交外部动作。至少分成三类：\u003C\u002Fp>\n\u003Cul>\n\u003Cli>\u003Cstrong style=\"font-weight:bold;color:#1a1a1a;\">可自动执行\u003C\u002Fstrong>：知识库检索、材料摘要、工单初分类、字段抽取草稿、只读状态查询。要求输出可校验，且不直接改变外部状态。\u003C\u002Fli>\n\u003Cli>\u003Cstrong style=\"font-weight:bold;color:#1a1a1a;\">只能建议\u003C\u002Fstrong>：合同条款修改、费用解释、风险话术、跨部门流程推荐。需要人工确认后才能推进。\u003C\u002Fli>\n\u003Cli>\u003Cstrong style=\"font-weight:bold;color:#1a1a1a;\">必须审批\u003C\u002Fstrong>：退款、账号权限变更、数据删除、对外发送、资金操作、影响用户权益的写动作。必须保留审批人、理由和证据。\u003C\u002Fli>\n\u003C\u002Ful>\n\u003Ch3 style=\"font-size:18px;font-weight:bold;color:#333;margin:1.6em 0 0.8em;\">关键输出要带证据字段\u003C\u002Fh3>\n\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">没有证据字段，群里只会留下一句“又出问题了”。证据要让人快速回答：输入从哪里来，工具返回什么，校验是否通过，失败在哪一层。\u003C\u002Fp>\n\u003Cpre style=\"background:#f5f7fa;padding:15px;border-radius:6px;font-size:14px;line-height:1.6;overflow-x:auto;margin:1em 0;\">\u003Ccode style=\"font-family:'SF Mono',Menlo,Consolas,monospace;color:#333;background:#f5f5f5;padding:2px 6px;font-size:14px;border-radius:3px;\">input_source: ticket_id, doc_id, user_context_version\ntool_calls: retrieval_status, extraction_status, validation_status\noutput_check: schema_passed, safety_passed, business_rule_passed\nfailure_reason: plan_timeout, tool_error, permission_denied, user_correction\n\u003C\u002Fcode>\u003C\u002Fpre>\n\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">这些字段不一定都要展示给用户，但必须存在日志里。\u003C\u002Fp>\n\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">\u003Cem>——状态表是控制面，证据日志是显微镜。\u003C\u002Fem>\u003C\u002Fp>\n\u003Cp style=\"text-align:center;margin:16px 0 6px 0;\">\u003Cimg src=\"http:\u002F\u002Fmmbiz.qpic.cn\u002Fmmbiz_jpg\u002F4WyfSFibfkROdDNdbMQuptW8ogdgFPnJdzGnbEwAEXKeb6NmUrRcxgqkCV0g9eTkHU57XJbrodBxjX5DDzOvFeOvS5qxic8vAXcL9hTibLu7qk\u002F0?from=appmsg\" alt=\"配图·秋色温黄\" style=\"max-width:100%;border-radius:6px;display:block;margin:0 auto;\" \u002F>\u003C\u002Fp>\u003Cp style=\"text-align:center;font-size:12px;color:#bbb;margin:0 0 18px 0;\">配图·秋色温黄\u003C\u002Fp>\u003Ch2 style=\"font-size:20px;font-weight:bold;color:#1a1a1a;border-bottom:2px solid #4a90d9;padding-bottom:8px;margin:2em 0 1em;\">二、最小监控与证据清单\u003C\u002Fh2>\n\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">监控不要一上来就做大盘。先抓五类失败，比总体准确率更能指导行动。\u003C\u002Fp>\n\u003Ch3 style=\"font-size:18px;font-weight:bold;color:#333;margin:1.6em 0 0.8em;\">先看五类失败\u003C\u002Fh3>\n\u003Cul>\n\u003Cli>\u003Cstrong style=\"font-weight:bold;color:#1a1a1a;\">解析失败\u003C\u002Fstrong>：字段没抽取出来，JSON 不符合模式，表格行列错位。问题常在输入格式和 schema 约束。\u003C\u002Fli>\n\u003Cli>\u003Cstrong style=\"font-weight:bold;color:#1a1a1a;\">规划超时\u003C\u002Fstrong>：任务拆解太长，多轮检索反复跳转，工具选择犹豫。问题常在任务边界和循环控制。\u003C\u002Fli>\n\u003Cli>\u003Cstrong style=\"font-weight:bold;color:#1a1a1a;\">工具报错\u003C\u002Fstrong>：依赖接口返回异常，权限过期，参数映射错。问题常在工具链和错误透传。\u003C\u002Fli>\n\u003Cli>\u003Cstrong style=\"font-weight:bold;color:#1a1a1a;\">权限拒绝\u003C\u002Fstrong>：智能体调用了不该调的动作，或访问了未授权数据。问题常在策略配置和审批链路。\u003C\u002Fli>\n\u003Cli>\u003Cstrong style=\"font-weight:bold;color:#1a1a1a;\">用户纠错\u003C\u002Fstrong>：用户明确说答非所问、依据不足、建议不可执行。问题常在任务价值和真实场景匹配。\u003C\u002Fli>\n\u003C\u002Ful>\n\u003Ch3 style=\"font-size:18px;font-weight:bold;color:#333;margin:1.6em 0 0.8em;\">建立任务级日志\u003C\u002Fh3>\n\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">日志的目标是可回放。只要给一个 request_id，就能还原它调了哪些工具、用了哪个版本、卡在哪一层、有没有人工接管。字段不求全，但要求稳。\u003C\u002Fp>\n\u003Cpre style=\"background:#f5f7fa;padding:15px;border-radius:6px;font-size:14px;line-height:1.6;overflow-x:auto;margin:1em 0;\">\u003Ccode style=\"font-family:'SF Mono',Menlo,Consolas,monospace;color:#333;background:#f5f5f5;padding:2px 6px;font-size:14px;border-radius:3px;\">request_id\ntask_type\nagent_version\nprompt_version\ntool_call_chain\nlatency\ncost\nvalidation_status\nfail_layer\nhuman_takeover_count\nuser_feedback_id\n\u003C\u002Fcode>\u003C\u002Fpre>\n\u003Ch3 style=\"font-size:18px;font-weight:bold;color:#333;margin:1.6em 0 0.8em;\">设置可操作阈值\u003C\u002Fh3>\n\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">阈值不需要复杂模型，先覆盖会引发事故的变化。可以用固定窗口或滑动窗口，但每个阈值都要对应一个动作。\u003C\u002Fp>\n\u003Col>\n\u003Cli>同一任务连续失败达到预设次数，自动转建议模式，暂停写操作。\u003C\u002Fli>\n\u003Cli>敏感工具拒绝突增，冻结相关动作，检查权限映射和输入来源。\u003C\u002Fli>\n\u003Cli>成本相比历史基线异常上升，启用缓存、限频和短答案模式。\u003C\u002Fli>\n\u003Cli>人工接管和用户纠错连续上升，触发评测回归与回滚评估。\u003C\u002Fli>\n\u003C\u002Fol>\n\u003Ch3 style=\"font-size:18px;font-weight:bold;color:#333;margin:1.6em 0 0.8em;\">最小监控与证据清单\u003C\u002Fh3>\n\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">☐ 每个请求有唯一 request_id；\u003Cbr>☐ 每次工具调用有状态、耗时和错误码；\u003Cbr>☐ 每个失败能归到输入、规划、工具、输出、权限五层；\u003Cbr>☐ 每个降级开关有负责人；\u003Cbr>☐ 每个人工接管有审批记录和证据包；\u003Cbr>☐ 每个版本变更有旧入口和回滚路径；\u003Cbr>☐ 每条告警有明确动作，而不是只发通知。\u003C\u002Fp>\n\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">\u003Cem>——闭环的意义，是让下一次异常不再靠临时救火。\u003C\u002Fem>\u003C\u002Fp>\n\u003Cp style=\"text-align:center;margin:16px 0 6px 0;\">\u003Cimg src=\"http:\u002F\u002Fmmbiz.qpic.cn\u002Fsz_mmbiz_jpg\u002F4WyfSFibfkRP5WeeqJZQxz7mAH0BoQwyJMKcKP4sOtfgAIljZh9YTMqB0bVF1SKgREkNLmfricnn6MdyYpIeW1g6YRWhZOoflWgeuOuq5lXko\u002F0?from=appmsg\" alt=\"配图·江水竹影\" style=\"max-width:100%;border-radius:6px;display:block;margin:0 auto;\" \u002F>\u003C\u002Fp>\u003Cp style=\"text-align:center;font-size:12px;color:#bbb;margin:0 0 18px 0;\">配图·江水竹影\u003C\u002Fp>\u003Ch2 style=\"font-size:20px;font-weight:bold;color:#1a1a1a;border-bottom:2px solid #4a90d9;padding-bottom:8px;margin:2em 0 1em;\">三、七步闭环：从告警到回滚\u003C\u002Fh2>\n\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">七步闭环的目标是让告警变成可处置事件，不是让值班人自己猜。\u003C\u002Fp>\n\u003Ch3 style=\"font-size:18px;font-weight:bold;color:#333;margin:1.6em 0 0.8em;\">第1到2步：小范围放量，先把复现能力建起来\u003C\u002Fh3>\n\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">先选择低风险流量、白名单用户或单一任务入口。旧入口必须保留，用户或客服能一键回到原流程。与此同时接入监控和日志。如果一个问题无法通过 request_id 复现，后面所有复盘都会变成争论。\u003C\u002Fp>\n\u003Ch3 style=\"font-size:18px;font-weight:bold;color:#333;margin:1.6em 0 0.8em;\">第3到4步：失败回放，配置人工接管与敏感审批\u003C\u002Fh3>\n\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">告警触发后，不要急着改提示词。先做分层回放：\u003C\u002Fp>\n\u003Cpre style=\"background:#f5f7fa;padding:15px;border-radius:6px;font-size:14px;line-height:1.6;overflow-x:auto;margin:1em 0;\">\u003Ccode style=\"font-family:'SF Mono',Menlo,Consolas,monospace;color:#333;background:#f5f5f5;padding:2px 6px;font-size:14px;border-radius:3px;\">replay task_id --layers input,plan,tool,output,permission\n\u003C\u002Fcode>\u003C\u002Fpre>\n\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">如果输入本身缺失，优化上下文采集。如果规划反复绕圈，限制最大步数和工具选择策略。如果工具报错，补错误码透传和重试上限。如果输出违反规则，加 schema 校验和业务规则卡点。如果权限拒绝，重新划审批边界。\u003C\u002Fp>\n\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">人工接管不是简单转给人工，而是要给人工一个可决策的证据包：原始请求、关键工具结果、失败原因、建议动作、可点击审批入口。\u003C\u002Fp>\n\u003Ch3 style=\"font-size:18px;font-weight:bold;color:#333;margin:1.6em 0 0.8em;\">第5到6步：每周评测回归，准备回滚包\u003C\u002Fh3>\n\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">评测回归至少包含三类样本：固定回归样本、对抗样本、业务验收样本。重点不是证明模型变强，而是确认改动没有把已有能力改坏。尤其看字段稳定性、拒答合理性、成本变化和人工接管率。\u003C\u002Fp>\n\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">回滚包要像部署包一样准备，不能只写“把模型切回去”。至少包含：\u003C\u002Fp>\n\u003Col>\n\u003Cli>开关路径：如何一键关闭自动执行。\u003C\u002Fli>\n\u003Cli>旧流程：原客服工单、原审批表单、原报告模板。\u003C\u002Fli>\n\u003Cli>负责人：产品、工程、业务、合规各自对接人。\u003C\u002Fli>\n\u003Cli>通知路径：内部值班群、用户公告、依赖方同步。\u003C\u002Fli>\n\u003Cli>数据修复：错误提交、重复草稿、过期上下文如何清理。\u003C\u002Fli>\n\u003C\u002Fol>\n\u003Ch3 style=\"font-size:18px;font-weight:bold;color:#333;margin:1.6em 0 0.8em;\">第7步：按证据做三选一决策\u003C\u002Fh3>\n\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">运行闭环最终要落到决策：\u003C\u002Fp>\n\u003Cul>\n\u003Cli>\u003Cstrong style=\"font-weight:bold;color:#1a1a1a;\">扩容保留\u003C\u002Fstrong>：任务失败率低，人工接管少，成本稳定，业务价值能被验收样本证明。\u003C\u002Fli>\n\u003Cli>\u003Cstrong style=\"font-weight:bold;color:#1a1a1a;\">降级运行\u003C\u002Fstrong>：有价值但依赖不稳，适合继续只读查询、建议生成或限定场景试点。\u003C\u002Fli>\n\u003Cli>\u003Cstrong style=\"font-weight:bold;color:#1a1a1a;\">直接下线\u003C\u002Fstrong>：风险高、收益弱、成本不可承受，或者问题长期无法归因。\u003C\u002Fli>\n\u003C\u002Ful>\n\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">无论哪种，复盘都要写进版本说明。下一任值班人员需要知道：这个版本曾在哪里失败，边界在哪里。\u003C\u002Fp>\n\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">\u003Cem>——把事故写成版本说明，是把经验沉淀成系统边界。\u003C\u002Fem>\u003C\u002Fp>\n\u003Ch2 style=\"font-size:20px;font-weight:bold;color:#1a1a1a;border-bottom:2px solid #4a90d9;padding-bottom:8px;margin:2em 0 1em;\">四、两周试点计划与常见坑\u003C\u002Fh2>\n\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">如果没有完整平台，两周试点也能判断方向。关键不是上线多少功能，而是暴露多少真实运行问题。\u003C\u002Fp>\n\u003Ch3 style=\"font-size:18px;font-weight:bold;color:#333;margin:1.6em 0 0.8em;\">第1到3天：选任务，写边界\u003C\u002Fh3>\n\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">选择高频、低风险、可验收任务。比如会议纪要摘要、工单初分类、政策问答、字段抽取草稿。同时写清楚成功标准和不做什么。成功标准要能检查：答案是否引用正确、字段是否合规、人工确认是否缩短、错误是否可追踪。不做什么同样重要：不做退款，不改权限，不自动发送。\u003C\u002Fp>\n\u003Ch3 style=\"font-size:18px;font-weight:bold;color:#333;margin:1.6em 0 0.8em;\">第4到7天：接入只读日志、反馈入口和小范围告警\u003C\u002Fh3>\n\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">这一步只读运行。用户可以提交反馈，工程可以看到日志，运营可以处理告警，但关键写操作仍然留在旧流程。你可以把反馈入口设计成三个按钮：答案有用、依据不足、需要人工。不要一上来做复杂评分。\u003C\u002Fp>\n\u003Ch3 style=\"font-size:18px;font-weight:bold;color:#333;margin:1.6em 0 0.8em;\">第8到10天：演练故障\u003C\u002Fh3>\n\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">至少演练三次：工具超时、权限拒绝、人工接管。看回滚链路是否可用，旧入口能否恢复，负责人能否在约定流程内决策。演练不是形式主义，它会让告警、日志和审批链真正咬合。\u003C\u002Fp>\n\u003Ch3 style=\"font-size:18px;font-weight:bold;color:#333;margin:1.6em 0 0.8em;\">第11到14天：输出试点报告\u003C\u002Fh3>\n\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">报告只问三个问题：\u003C\u002Fp>\n\u003Cul>\n\u003Cli>\u003Cstrong style=\"font-weight:bold;color:#1a1a1a;\">价值是否成立\u003C\u002Fstrong>：它是否减少了重复劳动，是否提高了响应质量，是否让流程可追溯。\u003C\u002Fli>\n\u003Cli>\u003Cstrong style=\"font-weight:bold;color:#1a1a1a;\">风险是否可控\u003C\u002Fstrong>：失败是否能被及时发现，是否能降级，是否能回滚。\u003C\u002Fli>\n\u003Cli>\u003Cstrong style=\"font-weight:bold;color:#1a1a1a;\">成本是否可承受\u003C\u002Fstrong>：模型调用、工具维护、人工审核和回滚演练是否划算。\u003C\u002Fli>\n\u003C\u002Ful>\n\u003Ch3 style=\"font-size:18px;font-weight:bold;color:#333;margin:1.6em 0 0.8em;\">常见坑\u003C\u002Fh3>\n\u003Col>\n\u003Cli>只演示顺利路径，不演练失败路径。真实事故几乎都藏在边界输入里。\u003C\u002Fli>\n\u003Cli>把降级做成不可用。降级应保留可解释能力，比如只读查询和建议草稿。\u003C\u002Fli>\n\u003Cli>日志没有 request_id，问题无法回放，最后只能靠口述定位。\u003C\u002Fli>\n\u003Cli>人工接管没有证据包，审批人比模型更忙，反而拉低效率。\u003C\u002Fli>\n\u003Cli>评测集固定不变，导致团队只优化指标，不优化真实任务。\u003C\u002Fli>\n\u003Cli>回滚只有模型开关，没有旧流程、通知路径和数据清理动作。\u003C\u002Fli>\n\u003C\u002Fol>\n\u003Ch2 style=\"font-size:20px;font-weight:bold;color:#1a1a1a;border-bottom:2px solid #4a90d9;padding-bottom:8px;margin:2em 0 1em;\">三句话讲透\u003C\u002Fh2>\n\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">1. 智能体落地不是让模型多会说，而是让系统少失控。\u003C\u002Fp>\n\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">2. 状态表、证据日志和告警动作，比一句更聪明的提示词更接近生产可靠性。\u003C\u002Fp>\n\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">3. 继续、降级、停止不是情绪判断，而是运行闭环给出的证据决策。\u003C\u002Fp>\n\u003Cp style=\"font-size:16px;line-height:1.85;color:#333;margin:0 0 1em;text-align:justify;\">如果这篇清单能帮你少一次临时救火，建议收藏，并转给正在负责 Agent 试点的同事。\u003C\u002Fp>\u003C\u002Fsection>\n\u003Csection class=\"portal-disclaimer\" data-portal-disclaimer=\"1\" style=\"margin-top:2.5em;padding-top:1.25em;border-top:1px solid #e8e4dc;font-size:14px;line-height:1.7;color:#7a756c;\">\u003Cp style=\"margin:0;\">免责声明：本文内容整理自公开网络资料，仅供学习交流参考，不代表观山书院立场。如涉及版权侵权，请联系我们删除。\u003C\u002Fp>\u003Cp style=\"margin:0.75em 0 0;\">联系邮箱：\u003Ca href=\"mailto:chenxj.g@gmail.com\">chenxj.g@gmail.com\u003C\u002Fa>\u003C\u002Fp>\u003C\u002Fsection>",3491459,"2026-09-29T17:56:37+08:00","2026-09-29T18:08:27.844225+08:00","2026-09-29T21:35:02.036222+08:00",["Island",80],{"key":81,"result":82},"PostCard_x6dtFQiBEmCye6IPguyIMK6zK20KlF5sHjVP3s6t4",{"head":83},{"link":84,"style":85},[],[],["Island",87],{"key":88,"result":89},"PostCard_aCqkegqFEBYvJlCUNmlGS4lq0Krsk0b9XgWMY1Q3To",{"head":90},{"link":91,"style":92},[],[],["Island",94],{"key":95,"result":96},"PostCard_Q2tdhHfZKr47yNkcHCzNCkuhzQCKaVfdZiyAP87A",{"head":97},{"link":98,"style":99},[],[],1790693749784]