第 8 章 · 全书的"落地章"(最贴近你的工作)

网页对话,还是搭工程(harness engineering)?

这一章回答你问题清单里最实操的一个:什么情况直接跟大模型网页版对话,什么情况需要搭工程?先给你一套判断框架,再拆开"工程"到底是什么(提示词、工具调用、RAG、Agent、评估、护栏),最后用三个电力场景案例走一遍完整决策。

8.1 先定义:harness 到底是什么

Anthropic(Claude 的开发公司)在官方工程指南里明确过一个观点:模型能力再强,也只是"引擎";真正决定应用好不好用的是引擎外面那套"马具"(harness)——提示词、工具、记忆、护栏、评估等一切围绕模型的编排[1]。所以"harness engineering"不是玄学,就是:不训练模型、不改模型,而是精心设计模型"外面"的一切,让引擎发挥最大价值

比喻:引擎 vs 整车

模型 = 发动机。网页版对话 = 你直接坐进裸引擎座舱,手动挂挡。harness 工程 = 把发动机装进整车:接上仪表盘(记忆)、方向盘(提示词)、货斗(工具/数据库)、刹车与安全带(护栏)、年检(评估)。你不会因为发动机好就直接开着裸引擎上高速——工作里的 AI 应用同理

为什么"改外面"而不是"改模型"?因为改模型(微调/训练)贵、慢、易退化,而外面这层可以快速迭代、随时调整、完全由你控制。行业共识:先榨干 harness 的价值,再考虑要不要碰模型本身

8.2 判断框架:问 5 个问题

接到一个"想用 AI 干的事",先别急着打开网页版,按顺序问自己:

五问判断框架(答完就知道该走哪条路)
问题答"是" → 倾向答"否" → 倾向
① 是一次性的,还是要反复做? 要反复做 → 值得搭工程(一次投入,长期复用) 一次性的 → 网页版直接问
② 需要实时/私有/结构化数据吗? 需要 → 工程(RAG / 工具调用把数据接进来) 纯靠模型常识 → 网页版
③ 输出要稳定格式(表格/JSON/固定模板)吗? 要 → 工程(提示词约束 + 输出解析校验) 自由文本 → 网页版
④ 要接系统/多人使用/无人值守吗? 要 → 工程(API + 流程自动化 + 权限) 自己用、有人盯着 → 网页版
⑤ 结果要可审计、零容错吗? 要 → 工程(评估 + 护栏 + 人工复核流程) 参考性内容 → 网页版

五问的任何一问答"是",都值得至少考虑搭工程;五问全否,就用网页版。第 8.6 节会把它变成一张决策矩阵。

8.3 网页版对话:什么时候直接用、怎么用得更好

适合直接网页版对话的典型场景:学习与解释、头脑风暴、起草初稿、翻译润色、把模糊想法理清、快速评估一个主意值不值得做(比如"帮我想想月度经营分析报告怎么搭框架")。

把网页版用得更好的四个技巧(这是零成本的第一步工程):

  1. 给背景、给角色、给约束:不要说"分析一下违章数据",要说"你是电力安全分析专家,以下是某单位 Q3 违章数据的统计口径说明……请从 3 个角度分析,每个结论注明依据"。
  2. 让它反问再回答:在提示词末尾加"如果信息不足,先问我 3 个澄清问题再开始"。
  3. 让它写代码/表格公式,而不是直接算:要统计就让它"给出 Python/SQL 代码",你跑完把结果贴回去——避免它凭空算数(第 5 章弱推理)。
  4. 要求"逐条给证据 + 不确定就明说":告诉它"不确定的部分必须标注'不确定',不许编造"——降低幻觉污染。
数据合规红线(务必记住)

公共网页版大模型会把你的输入用于训练/存储。含员工姓名、身份证号、内部合同金额、未公开事故信息的数据,绝不能直接粘贴进公共网页版。敏感数据的处理只有两条路:脱敏后再用,或走企业内部合规的大模型(私有化/企业版 API)。这条在你做业财数据、违章明细分析时是硬约束。

8.4 harness 的六大构件

harness 六大构件:名字 + 人话解释 + 解决什么问题
构件人话解释解决
提示词工程
(system prompt)
给模型写"岗位说明书":你是谁、目标、格式、禁忌。升级版:few-shot(给 2–3 个示范例子)、思维链(让它分步想) 角色、风格、格式、稳定性的 70% 靠它
工具调用
(function calling)
模型可以"申请"调用你提供的函数/API:查数据库、跑 Python、算 Excel。模型负责决定调哪个、传什么参,结果拿回来继续生成 算数、查实时数据、接系统——补上模型"弱计算、知识截止"两大硬伤
检索增强 RAG 回答前先从"外部资料库"里检索相关段落,拼进提示词再让模型回答(8.5 详解) 知识截止、幻觉、企业私有文档问答
记忆 / 上下文管理 把对话历史、用户偏好、中间结果组织好,决定"什么该留在窗口里、什么该存到外部" 长对话丢开头、窗口爆掉、个性化
评估(eval) 准备一批"标准答案集",每次改完提示词/流程,跑一遍看正确率有没有掉——AI 版的回归测试 改动一个 prompt 导致全线变差,不评估根本发现不了
护栏(guardrails) 输入/输出两侧的检查规则:输入过滤(禁涉密内容)、输出校验(格式对不对、有没有幻觉高危表述)、降级策略(超时/失败怎么办) 合规、稳定性、可控性——监控岗最看重的那部分

8.5 两种核心模式:RAG 与 Agent

8.5.1 RAG:开卷考试

比喻:闭卷 vs 开卷

普通大模型 = 闭卷考生:全凭脑内记忆答题,记错就编(幻觉)。RAG = 开卷考生:带一本官方教材进场,答题时先翻到对应页,照着念、再组织语言。答案来自教材,模型只负责"组织"——准确率和可追溯性立刻上一个大台阶。

图 8-1 RAG 三步:资料切片入库 → 提问时检索相关片段 → 模型"照着片段"作答。答案可溯源(引用了哪份资料哪一段)

为什么它有效?因为大模型最擅长的就是"给定上下文,把话说好"——RAG 恰好给它提供了可信的上下文。你的规程库、历史报告、指标定义,都可以这样变成"开卷教材"。

8.5.2 Agent:自动跑腿的助理

比喻:会自己干活的助理

普通大模型 = 只会"回答"的顾问;Agent = 接了任务会自己分步干活的助理:查资料(RAG/搜索)、算数据(工具)、写文档、发现问题再回来问你要不要调整——直到任务完成。它干活的方式遵循一个经典循环,叫 ReAct
想(Thought):下一步该做什么?→ 做(Action):调一个工具 → 看(Observation):看结果 → 再想……直到任务完成。

图 8-2 ReAct 循环:想 → 做(调工具)→ 看(看结果)→ 再想,直到完成。Agent = 大模型 + 工具 + 循环控制

Agent 的现实忠告

Agent 很强大,但它会"自作主张"——可能调错工具、可能绕远路、可能中途卡死。生产环境里的 Agent 必须套上护栏:限定工具白名单、限制循环次数、关键步骤人工确认(human-in-the-loop)。第 8.7 的案例 B 会演示"怎么给 Agent 装刹车"。

8.6 决策矩阵:场景 × 方案

从"五问"到方案的决策矩阵
场景画像(五问的答案组合)推荐方案工程成本
一次性 + 纯知识 + 自由输出 + 自用 网页版对话 0(会问问题就行)
一次性 + 需要算数/查数据 网页版 + 让它写代码,自己跑 低(会用 Python/SQL 跑一下)
反复做 + 资料固定(规程问答、制度咨询) RAG(资料切片入库,开卷问答) 中(一次搭建,长期复用)
反复做 + 数据在系统里 + 要固定格式 API + 提示词模板 + 工具调用(自动拉数→生成→校验)
多步任务 + 多工具 + 无人值守 Agent + 护栏 中高(需要设计循环和兜底)
要进正式报告、零容错、可审计 以上任一 + 评估集 + 人工复核环节 必须加,不能省

8.7 案例走查:三个电力场景从判断到落地

案例 A:违章行为数据分析(月度)

需求:每月从违章记录里找出高风险作业类型、时段规律、趋势变化,出一页分析。

五问过一遍:① 反复做(是);② 要真实数据(是);③ 输出要固定格式(是);④ 自己用(否);⑤ 要可审计(是)。→ 应搭工程,但不必上 Agent

落地方案(阶梯式)

  1. 第一步(当天能上):数据脱敏 → 用 Python 脚本(本书 code/03 就是示例)跑出统计表和图表 → 把统计结果贴给网页版大模型,让它写"分析文字",注明"只准基于我给的数据写,不许补充不存在的事实";
  2. 第二步(一周内):把"统计脚本 + 提示词模板"固化成一个半自动流程(或简单的 API 调用),每月只改数据文件路径;
  3. 第三步(有预算后):接入企业大模型 API,脚本自动完成"拉数→统计→生成→人工复核"。
案例 A 的关键教训

数据计算和文字生成分离:让代码算数(可靠),让大模型写字(擅长)。这是所有数据类 AI 应用的第一原则——第 5 章的"弱计算"硬伤在这里被工程化解于无形。

案例 B:光伏发电运行日报(无人值守)

需求:每天早上 8 点自动生成前一日的运行日报:出力曲线摘要、异常电站告警、与预测值对比、原因初判。

五问:反复做(是);实时数据(是);固定格式(是);无人值守(是);要进报告(是)。→ Agent + 护栏

落地方案

  1. 定时触发(cron)→ Agent 醒来,按流程:调"SCADA 数据接口"工具拿出力数据 → 调"预测库"工具拿预测值 → 调"统计分析"工具算偏差 → 调"异常检测"工具标记异常电站;
  2. 护栏:工具白名单(只允许这 4 个)、最多 10 步循环、关键数据校验(出力非负、总和合理);
  3. 输出两版:初稿自动发群,终版必须人工确认后才可归档(监控岗红线:告警类结论必须人来签字)。

案例 C:业财数据对账与解释

需求:两套系统(业务系统 vs 财务系统)的月度数据对不上时,快速定位差异原因。

五问:反复做(是);私有敏感数据(是);要可审计(是);零容错(是)。→ 高风险区,工程 + 强护栏 + 强人工

落地方案

  1. 绝对不上公共网页版(数据合规);用企业内网 API 或本地小模型;
  2. 核心逻辑用确定性代码做(对账规则是人写的 if-else / SQL,不用模型判断),大模型只负责"把差异解释成人话"和"生成排查建议清单";
  3. 输出必须带"依据行号/凭证号"引用,且每次解释都要有人复核签字。
案例 C 的核心原则:越敏感,越要把大模型"降级为文书员"

涉及钱、安全、合规的任务,判断交给规则和代码,大模型只做文字表达。这不是保守,这是行业标准做法——你的岗位职责决定了你必须守住这条线。

8.8 什么时候不值得搭工程

工程有成本:搭建时间、维护、数据准备、评估、护栏。以下情况别搭

比喻:先租后买,先打车后买车

网页版 = 打车(按次付费,灵活);搭工程 = 买车(一次性投入,日常通勤才划算)。先打车跑通路线,确认天天要通勤了,再买车。这是最理性的 AI 落地节奏。

8.9 本章小结

读完本章,问大模型(复制可用)
我刚学完"网页对话 vs harness 工程",请:
1. 用五问框架,帮我评估 3 个我工作中的真实需求(我给你描述,你逐个过五问并给方案);
2. 解释 RAG 为什么能减少幻觉,它的局限是什么;
3. 设计一个"作业风险周报"的最小 Agent(工具白名单、循环上限、人工确认点);
4. 出 2 道场景判断题考我(一道该用网页版、一道该搭 RAG),先别给答案。

自测题:配套《自测题与思考题》第 8 章 Q8.1–Q8.6(场景决策题是重点)。

8.10 本节配套视频(B 站,已验证)

以下是第 0 章视频清单中与本章直接对应的部分(2026-09 已验证可访问)。建议读完 8.4–8.5 后观看,边看边对照"六大构件"。

E1

AI 大模型教程:提示词工程 + RAG + LangChain + Agent(保姆级)

覆盖本章全部核心概念:提示词、RAG 工作流、向量检索、Agent 设计模式。看到"LangChain"这类框架名不用慌——它只是把本章讲的构件打包成了工具库。

2025 新版合集 | 约 1.5 小时 | 进阶

看完后配合 code/05_调用大模型API.py(含最小 RAG 实现)动手跑一遍,本章就真正落地了。