您好!
欢迎来到京东云开发者社区
登录
首页
博文
课程
大赛
工具
用户中心
开源
首页
博文
课程
大赛
工具
开源
更多
用户中心
开发者社区
>
博文
>
大模型是怎样炼成的:从会背书到能办案
分享
打开微信扫码分享
点击前往QQ分享
点击前往微博分享
点击复制链接
大模型是怎样炼成的:从会背书到能办案
jd_KODiKkdTCZkx
2026-07-29
IP归属:北京
51浏览
<h1><span style="font-size: 26px"></span></h1><p><span style="color: rgb(153, 153, 153); font-family: JDLangZheng; font-size: 16px; background-color: rgb(255, 255, 255);">以合规调查员场景类比,面向所有人的大模型科普分享。</span></p><p style="text-align: center;"><img src="//img1.jcloudcs.com/cms/3b409522-d916-4260-a4bc-5cf7697a39f520260729145737.png" style="width: 266px; height: 184px;" width="266" height="184"/> <img src="//img1.jcloudcs.com/cms/bd8d8770-6e42-48ca-bed3-9db4f3e3f5d720260729145812.png" alt="image (1).png" width="290" height="183" style="width: 290px; height: 183px;"/></p><h1><span style="font-size: 26px">开场:一个贯穿全文的故事</span></h1><p>我们用一个大家都熟悉的场景来讲这个故事:<br/></p><p><strong>把训练一个大模型,想象成培养一个合规调查员,并最终建设一套合规调查体系。</strong></p><ul class=" list-paddingleft-2"><li><p>先让他读完所有法规、平台规则、历史案例(<strong>预训练</strong>),</p></li><li><p>再教他怎么按标准格式输出调查结论(<strong>SFT</strong>),</p></li><li><p>然后根据申诉率和误判反馈来校准他的判定尺度(<strong>RLHF</strong>),</p></li><li><p>接着训练他遇到复杂 case 时先拆解证据链再下结论(<strong>推理强化</strong>),</p></li><li><p>最终让他独立接手全链路调查——自己调证据、查系统、联动多方、输出完整报告(<strong>Agent</strong>)。</p></li><li><p>但光培养出一个优秀的调查员还不够。要把他的能力真正用起来,还需要给他配标准作业流程、案件管理系统、质控机制、团队协作规范——从个人能力变成组织化的生产力(<strong>工程化落地</strong>)。</p></li></ul><p>每一步都在解决上一步遗留的问题。下面我们一步步展开。</p><h1><span style="font-size: 26px">一、预训练(Pre-training):读完所有法规和案例</span></h1><p><span style="font-size: 26px"></span></p><p><span style="font-size: 22px; font-weight: 700;"></span></p><h2><span style="font-size: 22px; font-weight: 700;"></span></h2><h2><span style="font-size: 22px; font-weight: 700;">故事的起点</span><br/></h2><p>2017年,Google 发表论文<a href="https://arxiv.org/pdf/1706.03762"><span style="color: rgb(75, 150, 230)"><em>“Attention Is All You Need”(Vaswani et al., 2017)</em></span></a>,提出了Transformer 架构。这是大模型时代的地基。</p><p>在预训练阶段,我们让模型阅读互联网上的海量文本——法律条文、行业规范、新闻、技术文档、代码、论坛帖子……几乎人类写过的所有东西。它的学习任务只有一个:<strong>给定前文,预测下一个词</strong>。</p><p style="text-align:center"><img src="//img1.jcloudcs.com/cms/dfe257a7-343a-4c52-ac72-daaaaccbd89f20260729150221.png" alt="image (2).png" width="388" height="432" style="width: 388px; height: 432px;"/></p><p style="text-align: center;"><em>图1-1 预测下一个词</em></p><p>就这么一个简单的任务,重复几万亿次之后,模型掌握了语言规律、世界常识、代码能力,甚至一定的推理能力。这就是所谓的<strong>涌现(Emergence)</strong>——量变引发质变,简单目标叠加足够的规模后,“意外地”产生了复杂能力。</p><p>回到我们的类比:这个阶段相当于新来的调查员<strong>读完了能找到的所有资料</strong>——电商法、广告法、平台规则、过往处罚案例、商家申诉记录、行业研报。他现在知识储备极其丰富,但你给他一个具体 case,他并不会直接给你结论,而是像互联网文本一样“接龙”下去:</p><p>你:“这个商品涉嫌虚假宣传吗?”</p><p>他:“虚假宣传是指经营者利用广告或其他方法对商品做出与实际不符的虚假信息,根据2018年的一项研究……”</p><p>(他在背书和接龙,不是在给你调查结论。)</p><p>那为什么这种“续写训练”能让模型学到真正的知识?下面从架构层面看看背后发生了什么。</p><h2><span style="font-size: 22px">Transformer:所有证据摊在同一张桌上</span></h2><p>Transformer 之前,主流模型是 RNN/LSTM——它们处理文本像<strong>逐级传话</strong>,一个词一个词往后传,传到第100个词时第1个词的信息已经衰减得面目全非。这就像调查员只能按顺序逐条阅读证据,读到第50条时已经忘了第1条写的什么。</p><p style="text-align:center"><img src="//img1.jcloudcs.com/cms/8f44079f-05a0-4adb-9e71-ab6206322e6420260729150258.png" alt="image (3).png" width="918" height="245" style="width: 918px; height: 245px;"/></p><p style="text-align: center;"><em>图1-2 RNN 网络结构,信息逐级传递</em></p><p>Transformer 的核心创新是<strong>自注意力机制(Self-Attention)</strong>:处理每个词时,都能直接"看见"全文所有其他词,根据相关程度分配关注权重。不再是逐级传话,而是<strong>把所有证据摊在同一张桌子上同时审视</strong>——每条证据都能直接跟其他任意一条建立联系。</p><h3><span style="font-size: 20px">注意力的直觉:一次"模糊查找"</span></h3><p>对于工程师来说,最好的理解方式是把注意力类比为一个"软性 HashMap":</p><ul class=" list-paddingleft-2"><li><p><strong>传统 HashMap</strong>:精确匹配 key,返回唯一 value</p></li><li><p><strong>注意力机制</strong>:每个词带着一个查询(Query),去和所有词的标签(Key)算相似度,然后按相似度加权混合所有词的内容(Value)——不是精确匹配一个结果,而是按相关程度<strong>融合所有信息</strong></p></li></ul><p style="text-align:center"><img src="http://img1.jcloudcs.com/cms/165d7c3c-b2d7-48fb-9804-f436d5a57d5520260729150341.png" width="376" height="212" style="height: 212px; font-family: sans-serif; text-align: center; white-space: normal; width: 376px;"/></p><p style="text-align: center;"><em style="white-space: normal;">图1-3 传统 HashMap</em><span style="font-family: sans-serif; font-size: 14px;"> </span></p><p style="text-align: center;"><em style="font-family: unset; font-size: unset;"><img src="http://img1.jcloudcs.com/cms/9d0366bb-965b-4e12-9d07-73cb978da1cd20260729150341.png" width="344" height="298" style="height: 298px; font-family: sans-serif; text-align: center; white-space: normal; width: 344px;"/></em></p><p style="text-align: center;"><em style="font-family: unset; font-size: unset;">图1-4 自注意力机制</em></p><p><br/></p><p>类比到调查场景:调查员审查一个 case 时,不是只看某一条证据就下结论。他把所有证据(标题、详情页、评价、投诉记录、物流信息)都摆出来,然后根据和当前疑点的相关程度来综合判断——每条证据都被"看到"了,但权重不同。</p><h3><span style="font-size: 20px">多头注意力:同时从多个角度审视</span></h3><p>一组注意力只能捕捉一种关系模式。<strong>多头注意力(Multi-Head Attention)</strong>是同时进行多组这样的"模糊查找"——有的 head 关注词与词之间的语法搭配,有的关注语义关联,有的关注指代关系,有的关注因果逻辑。</p><p>类比:一个资深调查员审 case 时,会同时从多个角度审视——法规条款匹配度、事实逻辑链是否自洽、时间线有无矛盾、涉及主体之间的关联关系。每个角度就是一个"头"。</p><p style="text-align: center;"><img src="//img1.jcloudcs.com/cms/5425086e-53e2-4f59-969f-54b0e05bf42620260729150523.png" alt="image (6).png" width="405" height="270" style="width: 405px; height: 270px;"/></p><p style="text-align: center;"><em>图1-5 多头注意力可视化</em></p><p>然而,这种"所有词都看所有词"的方式带来一个问题——它丢失了顺序信息。</p><h3><span style="font-size: 20px">位置编码:给证据加上时间线</span></h3><p>注意力机制把证据摊在桌上同时看,但看不出先后顺序。模型分不清"商家先发货后修改描述"和"商家先修改描述后发货"——而这在合规判定中可能是天壤之别。</p><p>解决办法是给每个词附加一个位置信号。早期用绝对编号(位置0、1、2……),但遇到训练时没见过的长度就失效。现在主流是<a href="https://arxiv.org/pdf/2104.09864"><span style="color: rgb(75, 150, 230)"><strong>RoPE(旋转位置编码;Su et al., 2021)</strong></span></a>——编码的是词与词之间的"相对距离"。 就像调查员关心的是"修改描述发生在发货之前还是之后"(相对时序),而不是"修改描述这个动作出现在文档第几行"(绝对位置)。这也是为什么现代模型能够处理超长文本的关键之一。</p><p style="text-align: center;"><img src="//img1.jcloudcs.com/cms/8b953264-053d-429f-9d1b-d2da5d7fe4a720260729150552.png" alt="image (7).png"/></p><p style="text-align: center;"><em>图1-6 Transformer 网络结构</em></p><h2><span style="font-size: 22px">从词到向量:模型如何"理解"语义</span></h2><p>理解了注意力之后,还有一个前置问题:模型看到的并不是文字,而是数字。文字要先变成数字,才能做数学运算。这个过程分两步:</p><p><strong>第一步:分词(Tokenizer)</strong>——把句子拆成词片段,查表映射为数字编号。比如"虚假宣传"可能被拆成"虚假"和"宣传"两个 token,分别对应编号 3847 和 2956。</p><p><strong>第二步:词嵌入(Embedding)</strong>——把数字编号升维为一个高维向量(通常几千维)。关键在于:<strong>语义相近的词,向量距离也相近</strong>。</p><p>这个想法最早来自 2013 年的<a href="https://arxiv.org/pdf/1301.3781"><span style="color: rgb(75, 150, 230)"><strong>Word2Vec(Mikolov et al., 2013)</strong></span></a>。它有一个经典的发现:</p><p><strong>King - Man + Woman ≈ Queen</strong></p><p>也就是说,词向量之间的方向和距离<strong>编码了语义关系</strong>。"King"到"Queen"的方向,和"Man"到"Woman"的方向几乎一致——模型捕捉到了"性别"这个语义维度。类似地,"北京"到"中国"的向量关系,与"东京"到"日本"的关系也高度相似。</p><p style="text-align: center;"><img src="//img1.jcloudcs.com/cms/a8ab55d1-f1cf-4c2f-ba59-9caf585e7d7b20260729150615.png" alt="image (8).png" width="547" height="191" style="width: 547px; height: 191px;"/></p><p style="text-align: center;"><em>图1-7 Word2Vec可视化</em></p><p>现代大模型的嵌入层比 Word2Vec 复杂得多(上下文相关的动态嵌入,而非静态的),但核心思想一脉相承:<strong>用向量空间中的位置和方向来表征语义</strong>。 这就是为什么模型能"理解"词义——虽然它处理的是数字,但这些数字在向量空间中的几何关系恰好对应了人类理解的语义关系。</p><h2><span style="font-size: 22px">训练方式:自监督学习</span></h2><p>有了架构,接下来的问题是:训练数据从哪来?标注成本太高怎么办?</p><p>答案是:<strong>不需要人工标注</strong>。互联网文本本身就是训练数据。</p><p>做法极其简单——把句子截断,让模型预测被截掉的下一个词。预测对了就强化当前参数,预测错了就调整。损失函数是交叉熵——本质上就是一个从几万个候选词中选正确答案的分类问题。</p><p>这叫<strong>自监督学习</strong>,也是预训练能做到如此大规模的根本原因:</p><ul class=" list-paddingleft-2"><li><p>训练数据近乎无限(整个互联网)</p></li><li><p>不需要人工标注</p></li><li><p>模型规模可以疯狂 scale up 但"规模可以 scale up"背后有一个更深刻的规律在支撑——</p></li></ul><p><a href="https://arxiv.org/pdf/2001.08361"><span style="color: rgb(75, 150, 230)">Scaling Law (Kaplan, J. et al., 2020):规模即能力</span></a></p><p>OpenAI 在 2020 年发现了一条经验定律:模型的性能与参数量、数据量、计算量之间呈<strong>可预测的幂律关系</strong>。</p><p>性能 ∝ f(参数量,数据量,计算量)</p><p>翻译成人话:给够算力、给够数据、造够大,模型就会持续变强——而且变强的幅度是可预测的,不会突然停滞(至少在已探索的范围内)。</p><p>这就是为什么整个行业疯狂烧钱堆参数的理论依据——不是盲目堆料,而是有数学上的保证:堆了就一定会变强。这条定律也催生了后来 GPT-3(175B)、PaLM(540B)等超大规模模型的诞生。</p><p style="text-align: center;"><img src="//img1.jcloudcs.com/cms/756545f9-0c85-4530-adb5-60524710129020260729150636.png" alt="image (9).png" width="376" height="233" style="width: 376px; height: 233px;"/></p><p style="text-align: center;"><em>图1-8 大模型 Scaling Law</em></p><p>但模型越来越大,推理成本也水涨船高。这就引出了效率优化的需求。</p><h2><span style="font-size: 22px">效率瓶颈与优化</span></h2><p>注意力机制"所有词看所有词"的代价是计算量<strong>O(N²)</strong>——序列长度翻倍,计算量翻四倍。当文本达到几万甚至几十万 token 时,这个平方增长会成为严重瓶颈。</p><p>更具体地说,自回归生成时还有一个额外开销:每预测一个新词,理论上要重新计算前面所有词的中间结果。好在前面的词不会变,因此可以用<strong>KV Cache</strong> 缓存已算过的结果——每次只需要算新词和所有旧词的关系即可。</p><p>相当于调查员写报告时,写到第10页不需要重新理解前9页的素材——之前的分析已经"缓存"在脑子里了。代价是显存占用随序列长度线性增长。</p><p>围绕这个瓶颈,业界发展出一系列优化手段:</p><p><br/></p><table cellspan="0"><colgroup><col style="width: 252px"/><col style="width: 252px"/><col style="width: 254px"/></colgroup><tbody><tr class="firstRow"><td style="background: rgb(85, 85, 85);" width="252"><p><span style="color: rgb(255, 255, 255);">优化方向</span></p></td><td style="background: rgb(85, 85, 85);" width="252"><p><span style="color: rgb(255, 255, 255);">代表方法</span></p></td><td style="background: rgb(85, 85, 85);" width="254"><p><span style="color: rgb(255, 255, 255);">思路</span></p></td></tr><tr><td style="" width="252"><p>压缩缓存</p></td><td style="" width="252"><p><a href="https://arxiv.org/pdf/1911.02150"><span style="color: rgb(75, 150, 230)">MQA (Shazeer, 2019)</span></a>/<a href="https://arxiv.org/pdf/2305.13245"><span style="color: rgb(75, 150, 230)">GQA (Ainslie et al., 2023)</span></a>/<a href="https://arxiv.org/pdf/2405.04434"><span style="color: rgb(75, 150, 230)">MLA (DeepSeek-AI, 2024)</span></a></p></td><td style="" width="254"><p>多个查询共享同一份 KV 缓存,省显存</p></td></tr><tr><td style="" width="252"><p>加速计算</p></td><td style="" width="252"><p><a href="https://arxiv.org/pdf/2205.14135"><span style="color: rgb(75, 150, 230)">Flash Attention (Dao et al., 2022)</span></a></p></td><td style="" width="254"><p>减少 GPU 内存搬运次数,不改结果只改实现</p></td></tr><tr><td style="" width="252"><p>缩小范围</p></td><td style="" width="252"><p>滑动窗口注意力 (<a href="https://arxiv.org/pdf/2004.05150"><span style="color: rgb(75, 150, 230)">Beltagy et al., 2020</span></a>,<a href="https://arxiv.org/pdf/2309.17453"><span style="color: rgb(75, 150, 230)">Xiao et al., 2023</span></a>)</p></td><td style="" width="254"><p>只关注附近的上下文,远处的信息交给稀疏注意力处理</p></td></tr><tr><td style="" width="252"><p>内存管理</p></td><td style="" width="252"><p><a href="https://arxiv.org/pdf/2309.06180"><span style="color: rgb(75, 150, 230)">PagedAttention (vLLM; Kwon et al., 2023)</span></a></p></td><td style="" width="254"><p>像操作系统管内存一样管 KV Cache,按需分页分配回收</p></td></tr><tr><td style="" width="252"><p>加速生成</p></td><td style="" width="252"><p><a href="https://arxiv.org/pdf/2211.17192"><span style="color: rgb(75, 150, 230)">投机解码(Leviathan et al., 2023)</span></a></p></td><td style="" width="254"><p>小模型先批量起草,大模型一次性审核,通过的直接用</p></td></tr></tbody></table><p><br/></p><p>除了在运行层面优化,另一个思路是在模型结构层面降低成本——这就引出了<a href="https://arxiv.org/pdf/1701.06538"><span style="color: rgb(75, 150, 230)"><strong>MoE(Mixture of Experts,混合专家;Shazeer et al., 2017)</strong></span></a>。</p><h2><span style="font-size: 22px">MoE :不是所有人都需要同时上场</span></h2><p>传统模型(Dense Model)每次推理时,所有参数都参与计算。MoE 的思路是:模型内部划分为很多"专家子网络",每次推理时由一个路由器只激活其中 2~4 个最相关的专家。</p><p>DeepSeek-V3:总参数 671B,每次只激活 37B。相当于合规部有几百号人,但每个 case 只需要路由给相关领域的几个专家处理——涉及广告法的 case 找广告合规专家,涉及食品安全的找食品领域专家。不需要所有人都看。</p><p style="text-align: center;"><img src="//img1.jcloudcs.com/cms/ade8d48f-2e05-435b-bbd9-ef9b4bb7c70320260729150657.png" alt="image (10).png" width="495" height="201" style="width: 495px; height: 201px;"/></p><p style="text-align: center;"><em>图1-9 MoE 推理过程</em></p><p>这样一来,模型可以拥有"大模型的知识容量"和"小模型的计算成本"——两全其美,代价是模型文件很大(所有专家的参数都要存着),但每次推理开销小。</p><h2><span style="font-size: 22px">采样策略:控制输出的"性格"</span></h2><p>最后一个环节:模型每步输出的是一个概率分布(每个候选词被选中的可能性),怎么从中选词决定了输出的"性格":</p><ul class=" list-paddingleft-2"><li><p><strong>Temperature(温度)</strong>:越低越保守确定(适合出具正式结论),越高越有发散性(适合头脑风暴)。本质是在 softmax 之前对 logits 做缩放</p></li><li><p><strong>Top-K / Top-P</strong>:只从概率最高的若干候选中选取,避免选到离谱的词</p></li><li><p><strong>Beam Search</strong>:同时保留多条生成路径,选整体最优序列 这些策略不改变模型本身,只影响"怎么用模型"。</p></li></ul><h2><span style="font-size: 22px">小结</span></h2><p>到这里,我们有了一个知识渊博的"百科全书型"调查员。但他有一个致命问题:只会续写,不会按要求回答。接下来要解决的就是:怎么让他学会"接到 case,给结论"。</p><h1><span style="font-size: 26px">二、SFT(监督微调):学会按格式出结论</span></h1><h2><span style="font-size: 22px">从续写到问答:解决什么问题</span></h2><p>预训练完成后,模型什么都"知道",但什么都不"做"。你给它一个问题,它不是回答你,而是像互联网文本一样继续写下去。它不知道你在跟它对话——因为训练数据里就不是对话格式。</p><p>我们需要让它学会一个新模式:<strong>收到指令 → 执行任务 → 输出结果</strong>。</p><p>相当于那个读完所有资料的调查员,现在要进入<strong>岗前培训</strong>——学会"接到一个 case,按标准格式输出调查结论"这个基本工作流程。</p><h2><span style="font-size: 22px">做法:用示范数据教会它</span></h2><p><strong>SFT(Supervised Fine-Tuning,监督微调)</strong>,也叫指令微调,做法很直接:准备大量"指令→标准回答"格式的数据,在预训练好的模型基础上继续训练。</p><p>训练数据的格式:</p><p>输入:某商品标题宣称"100%纯棉",但质检报告显示含棉量仅65%</p><p>期望输出:判定违规。依据:违反《广告法》第二十八条,标题描述与实际商品不符,构成虚假宣传。建议处置:商品下架,商家警告。</p><p>模型看了成千上万条这样的示范之后,就学会了"收到问题 → 组织语言 → 给出结论"的行为模式。</p><p style="text-align: center;"><img src="//img1.jcloudcs.com/cms/1b49bd71-d888-44ea-8dda-6e366940618820260729150722.png" alt="image (11).png"/></p><p style="text-align: center;"><em>图2-1 指令微调前后对比</em></p><h3><span style="font-size: 20px">效果对比</span></h3><p><br/></p><table cellspan="0"><colgroup><col style="width: 189px"/><col style="width: 189px"/><col style="width: 189px"/><col style="width: 191px"/></colgroup><tbody><tr class="firstRow"><td style="background: rgb(85, 85, 85);" width="189"><br/></td><td style="background: rgb(85, 85, 85);" width="189"><p><span style="color: rgb(255, 255, 255);">输入</span></p></td><td style="background: rgb(85, 85, 85);" width="189"><p><span style="color: rgb(255, 255, 255);">预训练模型</span></p></td><td style="background: rgb(85, 85, 85);" width="191"><p><span style="color: rgb(255, 255, 255);">SFT 模型</span></p></td></tr><tr><td style="" width="189"><p>行为</p></td><td style="word-break: break-all;" width="189"><p>"这个商品涉嫌虚假宣传吗?"</p></td><td style="" width="189"><p>"虚假宣传是指经营者利用广告或其他方法……"(背书)</p></td><td style="" width="191"><p>"判定违规。理由:标题宣称与质检不符。依据:广告法第28条。"(给结论)</p></td></tr><tr><td style="" width="189"><p>本质</p></td><td style="" width="189"><p>—</p></td><td style="" width="189"><p>在续写</p></td><td style="" width="191"><p>在办案</p></td></tr></tbody></table><p><br/></p><h2><span style="font-size: 22px">知识蒸馏:让小模型学大模型</span></h2><p>SFT 的训练数据从哪来?早期靠人工标注,成本极高。后来业界发展出一种更高效的方式—— <a href="https://arxiv.org/pdf/1503.02531"><span style="color: rgb(75, 150, 230)"><strong>知识蒸馏(Knowledge Distillation; Hinton et al., 2015)</strong></span></a>。</p><p>核心思想:让一个大而强的模型(Teacher)去生成高质量的标注数据,然后用这些数据去训练一个小而快的模型(Student)。</p><p>回到类比:让一个经验丰富的资深调查员(大模型)出具大量标杆案例的分析报告,然后拿这些报告来批量培训新人(小模型)。新人的个人能力比不上老师,但在标准场景下能做到八成以上的水准,而成本只有老师的十分之一。</p><p>这就是为什么我们能在手机、边缘设备上跑 AI——不是直接跑那个几百B的大模型,而是用大模型的"知识"训练出一个几B的小模型来部署。 <a href="https://crfm.stanford.edu/2023/03/13/alpaca.html"><span style="color: rgb(75, 150, 230)">Alpaca (Taori et al., 2023)</span></a>、<a href="https://lmsys.org/blog/2023-03-30-vicuna/"><span style="color: rgb(75, 150, 230)">Vicuna (Chiang et al., 2023)</span></a>等早期开源模型就是通过蒸馏 GPT-4的输出来训练的。</p><h2><span style="font-size: 22px">SFT 的关键里程碑</span></h2><p><br/></p><table cellspan="0"><colgroup><col style="width: 189px"/><col style="width: 189px"/><col style="width: 189px"/><col style="width: 191px"/></colgroup><tbody><tr class="firstRow"><td style="background: rgb(85, 85, 85);" width="189"><p><span style="color: rgb(255, 255, 255);">模型</span></p></td><td style="background: rgb(85, 85, 85);" width="189"><p><span style="color: rgb(255, 255, 255);">时间</span></p></td><td style="background: rgb(85, 85, 85);" width="189"><p><span style="color: rgb(255, 255, 255);">参数量</span></p></td><td style="background: rgb(85, 85, 85);" width="191"><p><span style="color: rgb(255, 255, 255);">意义</span></p></td></tr><tr><td style="" width="189"><p><a href="https://cdn.openai.com/better-language-models/language_models_are_unsupervised_multitask_learners.pdf"><span style="color: rgb(75, 150, 230)">GPT-2 (Radford et al., 2019)</span></a></p></td><td style="" width="189"><p>2019</p></td><td style="" width="189"><p>1.5B</p></td><td style="" width="191"><p>第一次展示续写能力之强(OpenAI 一度不敢开源)</p></td></tr><tr><td style="" width="189"><p><a href="https://arxiv.org/pdf/2005.14165"><span style="color: rgb(75, 150, 230)">GPT-3 (Brown et al., 2020)</span></a></p></td><td style="" width="189"><p>2020</p></td><td style="" width="189"><p>175B</p></td><td style="" width="191"><p>规模涌现,少样本学习能力出现</p></td></tr><tr><td style="" width="189"><p><a href="https://arxiv.org/pdf/2203.02155"><span style="color: rgb(75, 150, 230)">InstructGPT (Ouyang et al., 2022)</span></a></p></td><td style="" width="189"><p>2022</p></td><td style="" width="189"><p>~1.3B</p></td><td style="" width="191"><p>SFT + RLHF,1.3B 的小模型用户体验超越 175B</p></td></tr></tbody></table><p><br/></p><p>InstructGPT 的结果特别有启发性:<strong>一个经过精心培训的 1.3B 小模型,用户满意度竟然超过了未经培训的 175B 大模型</strong>。 这说明"怎么训"比"有多大"更重要——至少在面向用户的体验层面是这样。</p><h2><span style="font-size: 22px">小结:SFT 还不够</span></h2><p>经过 SFT,调查员学会了按格式出结论。但一个新问题浮现了:<strong>他的判定质量参差不齐</strong>。</p><p>有时候判得太严——商家正常的营销修辞被判为虚假宣传,申诉后被推翻;有时候太松——明显的违规轻描淡写放过了;有时候结论格式到位但论证不够有说服力,经不起质问。</p><p>问题的根源在于:SFT 只教了"怎么回答",没教"什么是好的回答"。模型只是在模仿训练数据中的格式和风格,并不真正理解什么样的判定是"好"的。</p><p>怎么让他的判定经得起挑战?我们需要引入偏好反馈机制。</p><h1><span style="font-size: 26px">三、RLHF(人类反馈强化学习):根据反馈校准判定尺度</span></h1><h2><span style="font-size: 22px">对齐问题</span></h2><p>SFT 解决了"会不会回答"的问题,但没解决"回答得好不好"的问题。更本质地说:模型的行为需要与<strong>人类的价值判断</strong>对齐——不仅要"像一个助手",还要"是一个好的助手"。</p><p>这在合规场景里尤其明显:同一个 case,不同的措辞和侧重点,带来的判定说服力天差地别。标准答案不止一个,但有好坏之分。</p><h2><span style="font-size: 22px">核心思路:从"模仿标答"到"优化偏好"</span></h2><p><strong>RLHF = Reinforcement Learning from Human Feedback(人类反馈强化学习)</strong></p><p>做法分三步:</p><p><strong>第一步:收集人类偏好数据</strong></p><p>同一个 case,让模型生成两个不同的判定结论 A 和 B。由资深审核员(或多个标注员投票)选出更好的那个。不需要写出"正确答案",只需要做比较——这比从零标注要容易得多。</p><p><strong>第二步:训练奖励模型(Reward Model)</strong></p><p>用偏好数据训练一个"评委"模型——它学会了"给任意一个回答打分"。这个评委模型内化了人类标注员的偏好模式:什么样的措辞更专业、什么样的论证更有说服力、什么样的判定更站得住脚。</p><p><strong>第三步:用强化学习(</strong><a href="https://arxiv.org/pdf/1707.06347"><span style="color: rgb(75, 150, 230)"><strong>PPO; Schulman et al., 2017</strong></span></a><strong>)优化主模型</strong></p><p>让主模型朝着"评委给高分"的方向不断调整。生成的回答评委打高分就强化,打低分就抑制。</p><p style="text-align: center;"><img src="//img1.jcloudcs.com/cms/57522122-fd20-4594-8a84-894a9bea4c4620260729150742.png" alt="image (12).png" width="555" height="276" style="width: 555px; height: 276px;"/></p><p style="text-align: center;"><em>图3-1 RLHF 算法流程</em></p><p>回到类比:这相当于团队系统性地收集<strong>申诉反馈和 QA 抽检结果</strong>,先用这些数据训练出一个内部的"质量评估标准"(奖励模型),然后让调查员根据这个标准不断优化自己的判定方式——不是教他新规则(那是SFT),而是让他在实践中学会"哪种判法更站得住脚、更少被推翻"。</p><h2><span style="font-size: 22px">DPO:跳过奖励模型,一步到位</span></h2><p>传统 RLHF 的三步流程比较复杂,尤其是训练奖励模型和 PPO 训练都不太稳定。2023年提出的<a href="https://arxiv.org/pdf/2305.18290"><span style="color: rgb(75, 150, 230)"><strong>DPO(Direct Preference Optimization,直接偏好优化; Rafailov et al., 2023)</strong></span></a> 提供了一个更优雅的方案:</p><p>DPO 跳过了单独的奖励模型,直接从偏好对比数据中优化主模型——数学上可以证明,这等价于隐式地训练了一个奖励模型并做了强化学习,但实现上只需要一个简单的损失函数。</p><p>核心逻辑:好的回答(chosen)→ 提高生成概率;差的回答(rejected)→ 降低生成概率。干净、简单、稳定。</p><p style="text-align: center;"><img src="//img1.jcloudcs.com/cms/96c39533-35d5-4cb2-8eb5-303176ebdb4a20260729150808.png" alt="image (13).png" width="824" height="182" style="width: 824px; height: 182px;"/></p><p style="text-align: center;"><em>图3-2 DPO 与传统 RLHF(PPO)的对比</em></p><h2><span style="font-size: 22px">RLAIF:当人类标注不够用</span></h2><p>人类标注偏好数据是昂贵的——要请资深专家来做两两对比,效率低、成本高、标注员之间还会有分歧。</p><p><a href="https://arxiv.org/pdf/2212.08073"><span style="color: rgb(75, 150, 230)"><strong>RLAIF(RL from AI Feedback; Bai et al., 2022)</strong></span></a>的思路是:用一个更强的 AI模型来代替人类做偏好标注。</p><p>具体做法:让 GPT-4 或 Claude 这样的强模型来对比两个回答的好坏,生成偏好数据。然后用这些数据做标准的 RLHF/DPO 流程。</p><p>这和前面提到的知识蒸馏思想一脉相承——都是"让强者教弱者"。区别在于:</p><ul class=" list-paddingleft-2"><li><p>知识蒸馏:强模型直接生成"标答",弱模型模仿</p></li><li><p>RLAIF:强模型做"裁判",弱模型根据裁判反馈自我优化 回到类比:当资深调查员不够用时,可以让最顶尖的那几位只做"质检抽查和评分"(RLAIF),而不是让他们亲自写每一份调查报告(蒸馏)。这样他们的时间杠杆更大。</p></li></ul><h2><span style="font-size: 22px">对齐税:安全与能力的权衡</span></h2><p>RLHF 有一个已知的副作用:过度对齐(Over-alignment)。模型为了迎合"安全"的偏好,可能变得过于保守——什么都不敢说,什么都加 disclaimer,该给判定的时候含糊其辞。</p><p>这在合规场景里有对应的现象:如果 QA 只惩罚"误判"(查错了),调查员就会变得保守不敢判——宁可漏过也不错杀。好的偏好数据设计需要平衡"安全"和"有用"两个维度。</p><h2><span style="font-size: 22px">阶段小结</span></h2><p><br/></p><table cellspan="0"><colgroup><col style="width: 252px"/><col style="width: 252px"/><col style="width: 254px"/></colgroup><tbody><tr class="firstRow"><td style="background: rgb(85, 85, 85);" width="252"><p><span style="color: rgb(255, 255, 255);">阶段</span></p></td><td style="background: rgb(85, 85, 85);" width="252"><p><span style="color: rgb(255, 255, 255);">解决什么问题</span></p></td><td style="background: rgb(85, 85, 85);" width="254"><p><span style="color: rgb(255, 255, 255);">类比</span></p></td></tr><tr><td style="" width="252"><p>预训练</p></td><td style="" width="252"><p>有没有知识</p></td><td style="" width="254"><p>读完所有资料</p></td></tr><tr><td style="" width="252"><p>SFT</p></td><td style="" width="252"><p>会不会按格式做事</p></td><td style="" width="254"><p>岗前培训</p></td></tr><tr><td style="" width="252"><p>RLHF/DPO</p></td><td style="" width="252"><p>做事的质量好不好</p></td><td style="" width="254"><p>根据反馈校准尺度</p></td></tr></tbody></table><p><br/></p><p>到这里,我们得到了 ChatGPT、Claude 这样的产品——知识丰富、听指令、回答质量高且安全。但遇到真正复杂的推理任务时,模型依然容易"凭直觉秒答"然后出错。</p><h1><span style="font-size: 26px">四、推理强化(Reasoning Post-Training):先理证据链,再下结论</span></h1><h2><span style="font-size: 22px">问题的本质</span></h2><p>前三步培养出的调查员有一个根深蒂固的习惯:<strong>不管 case 多复杂,他都一步给出最终答案</strong>——因为训练目标就是"预测下一个 token",模型天然倾向于尽快给出结论。</p><p>简单 case 没问题。但遇到证据链长、涉及多方、规则有交叉的复杂案件时,直接给答案的正确率骤降。这就像一个调查员,接到一个涉及多个关联商家、跨多个时间节点的复杂刷单网络 case,他凭直觉说"违规"——有时蒙对了,有时经不起任何质问。</p><p>问题不在于他没有推理能力(预训练其实已经赋予了一定的推理能力),而在于<strong>他没有使用推理能力的习惯</strong>。</p><h2><a href="https://arxiv.org/pdf/2201.11903"><span style="font-size: 22px;color: rgb(75, 150, 230)">思维链(Chain-of-Thought; Wei et al., 2022)</span></a><span style="font-size: 22px">:给他一张草稿纸</span></h2><p><strong>核心洞察</strong>:让模型在给出最终结论之前,先输出中间推理步骤。相当于强制要求调查员<strong>先写分析过程,再出判定结论</strong>——不许跳步。</p><blockquote>❌<strong>不用 CoT:</strong><br/>Case:某商家近期订单量异常激增,部分收货地址集中在同一区域<br/><strong>结论:正常经营 ← 凭直觉秒答,漏判了</strong><br/>✅<strong>用 CoT:</strong><br/>Case:同上<br/>分析:<br/>· 订单量环比增长 800%,远超品类均值(异常信号)<br/>· 30% 收货地址集中在同一小区(物流异常)<br/>· 相关订单用户注册时间高度集中(批量注册嫌疑)<br/>· 复查发现付款账号存在交叉关联(资金闭环)<br/><strong>综合判定:高度疑似刷单,建议升级为正式调查 ✓</strong></blockquote><p style="text-align: center;"><img src="//img1.jcloudcs.com/cms/01548960-0aae-4d64-a054-aefed383e49120260729150832.png" alt="image (14).png" width="553" height="289" style="width: 553px; height: 289px;"/></p><p style="text-align: center;"><em>图4-1 思维链与传统提示词的对比</em></p><p><strong>为什么写下中间步骤就能提高正确率?</strong>因为中间步骤的输出会<strong>改变后续 token 的概率分布</strong>。当模型写下"订单量环比增长 800%"之后,再预测下一步时, 这个已输出的事实会影响后续的判断方向——把模型引向更正确的推理路径。</p><p>本质上,模型的"思考能力"受限于它的"工作记忆"——它只能看到输入和已输出的内容。不写下中间步骤,那些分析就不存在于它能看到的上下文中,自然无法利用。</p><h2><span style="font-size: 22px">Lost in the Middle:长推理的隐患</span></h2><p>然而,当推理链条变得很长时(比如需要分析20条证据),一个有趣的现象出现了:<strong>模型对中间位置的信息关注度明显低于开头和结尾</strong>。这被称为<a href="https://arxiv.org/pdf/2307.03172"><span style="color: rgb(75, 150, 230)"><strong>Lost in the Middle(Liu et al., 2023)。</strong></span></a></p><p style="text-align: center;"><img src="//img1.jcloudcs.com/cms/3acc4c68-e7b4-41c8-926d-637561ba183b20260729150851.png" alt="image (15).png" width="361" height="339" style="width: 361px; height: 339px;"/></p><p style="text-align: center;"><em>图4-2 Lost-in-the-Middle 现象</em></p><p>就像调查员翻阅一份很长的证据清单,开头和结尾记得清楚,但第8到第15条很容易被忽略。</p><p><strong>实践启示</strong>:</p><ul class=" list-paddingleft-2"><li><p>写 prompt 时把关键信息放在开头或结尾</p></li><li><p>如果推理链很长,可以让模型分段总结,避免信息丢失</p></li><li><p>这也是为什么 RAG(检索增强生成)需要对检索结果做排序优化 与此相关的还有一个有趣现象——<strong>Attention Sink(注意力水槽)</strong>:即使第一个 token 完全无关紧要(比如一个格式标记),模型也会给它分配大量注意力。 原因是注意力分数必须归一化为概率分布(加起来等于1),当模型"不确定该重点看哪里"时,会把剩余注意力倒给第一个 token——就像一个排水口,接住了无处安放的水。</p></li></ul><h2><span style="font-size: 22px">DeepSeek-R1:从模仿推理到自主推理</span></h2><p>早期的 CoT 依赖 SFT——人类专家写好标准分析步骤,让模型去模仿。这就像给调查员一本《标准分析模板》让他照着填。能用,但有上限:模型只会使用人类教过的那些推理模式。</p><p><a href="https://arxiv.org/pdf/2501.12948"><span style="color: rgb(75, 150, 230)"><strong>DeepSeek-R1(DeepSeek-AI (Guo et al.), 2025)</strong></span></a><strong>的关键创新</strong>:用强化学习直接激励推理能力——</p><ul class=" list-paddingleft-2"><li><p>给模型一个有明确正误判定的任务(数学题、代码题等可验证任务)</p></li><li><p>不教它怎么推理,让它自由发挥输出过程</p></li><li><p>只根据最终答案是否正确给予奖励(答对奖励,答错惩罚)</p></li><li><p>通过大量试错和强化,模型<strong>自己发展出了推理策略</strong></p></li></ul><p style="text-align: center;"><img src="//img1.jcloudcs.com/cms/16d9bd2d-568a-4752-9126-931d5240697920260729150911.png" alt="image (16).png" width="359" height="237" style="width: 359px; height: 237px;"/></p><p style="text-align: center;"><em>图4-3 DeepSeek-R1 的推理过程</em></p><p>结果令人惊叹:模型不仅学会了逐步推理,还"发明"了一些人类没有显式教过的策略——比如自我质疑("等等,我再检查一下前面的假设")、分支探索("换一种方法试试")、结果验证("让我用另一个角度验算")。</p><p>回到类比:这不是给调查员一本标准手册让他填表(SFT),而是<strong>只告诉他案件最终定性对不对,让他自己在实战中摸索出高效的调查方法论</strong>——他可能发展出比手册更精妙的分析路径,因为他是通过"做对了就强化"这种方式在海量实践中自然进化出来的。</p><h2><span style="font-size: 22px">推理模型的计算经济学</span></h2><p>推理强化带来了一个有趣的 trade-off:<strong>用更多的推理时计算量(inference compute)换取更高的正确率</strong>。</p><p>模型"想"得越久(输出越多中间步骤),正确率越高——但推理成本也线性增长。这就像让调查员花更多时间分析一个 case 自然会更准确,但人力成本也更高。</p><p>业界因此出现了"Test-Time Compute Scaling"的研究方向:如何在推理时智能地分配计算资源——简单问题快速回答,复杂问题深度思考。</p><h2><span style="font-size: 22px">小结</span></h2><p>到此为止,我们有了一个能深度分析复杂 case 的调查员。但他仍然是一个<strong>被动角色</strong>——所有材料都是你准备好喂给他的。他坐在桌前等你把证据摆好,然后分析出结论。</p><p>现实中的调查工作不是这样的。真正的调查员需要自己去<strong>找证据、调系统、联动多方</strong>。这就是下一步要解决的问题。</p><h1><span style="font-size: 26px">五、Agent:独立接手全链路调查</span></h1><h2><span style="font-size: 22px">从被动分析到主动行动</span></h2><p>到目前为止,我们的调查员已经很优秀了:知识丰富、会出结论、尺度校准过、遇到复杂 case 会先拆解分析再下判。但有一个本质局限:<strong>他只能处理你给他的信息</strong>。</p><p>现实中一个完整的调查流程是:接到线索 → 确定调查方向 → 主动调取证据 → 分析 → 根据发现调整方向 → 补充调取新证据 → 形成结论 → 输出报告。这里面大部分工作不是"分析",而是"规划和行动"。</p><p><strong>Agent(智能体)</strong>就是要让模型从"被动分析者"变成"主动行动者"——你给一个目标,它自己规划路径、调用工具、获取信息、根据反馈调整、最终完成任务。</p><h2><span style="font-size: 22px">Agent 的理论根基</span></h2><p>Agent 的概念来自强化学习的核心框架,即马尔可夫决策过程(MDP):</p><ul class=" list-paddingleft-2"><li><p><strong>状态(State)</strong>:当前掌握的信息</p></li><li><p><strong>行动(Action)</strong>:智能体采取的操作</p></li><li><p><strong>奖励(Reward)</strong>:操作后获得的反馈</p></li></ul><p style="text-align: center;"><img src="//img1.jcloudcs.com/cms/91af887a-26f0-4430-b950-36db5908f84820260729150930.png" alt="image (17).png" width="563" height="272" style="width: 563px; height: 272px;"/></p><p style="text-align: center;"><em>图5-1 强化学习中的马尔可夫决策过程</em></p><p>在大模型场景下,现代 LLM Agent =<strong>LLM 作为"大脑" + 记忆系统 + 工具调用能力 + 规划反思能力</strong></p><p style="text-align: center;"><img src="//img1.jcloudcs.com/cms/785c032e-384e-4d27-b2dc-815880a27c6820260729150953.png" alt="image (18).png" width="599" height="420" style="width: 599px; height: 420px;"/></p><p style="text-align: center;"><em>图5-2 LLM Agent 的运行流程,类比强化学习中的马尔可夫决策过程</em></p><h2><span style="font-size: 22px">三大核心能力</span></h2><p><br/></p><table cellspan="0"><colgroup><col style="width: 252px"/><col style="width: 252px"/><col style="width: 254px"/></colgroup><tbody><tr class="firstRow"><td style="background: rgb(85, 85, 85);" width="252"><p><span style="color: rgb(255, 255, 255);">能力</span></p></td><td style="background: rgb(85, 85, 85);" width="252"><p><span style="color: rgb(255, 255, 255);">作用</span></p></td><td style="background: rgb(85, 85, 85);" width="254"><p><span style="color: rgb(255, 255, 255);">对应调查员的能力</span></p></td></tr><tr><td style="" width="252"><p><strong>记忆</strong></p></td><td style="" width="252"><p>记住历史信息和长期经验</p></td><td style="" width="254"><p>记得之前查过什么、发现了什么、哪些路径走不通</p></td></tr><tr><td style="" width="252"><p><strong>工具调用</strong></p></td><td style="" width="252"><p>与外部系统交互</p></td><td style="" width="254"><p>会用各种内部系统查数据、拉记录、发工单</p></td></tr><tr><td style="" width="252"><p><strong>规划与反思</strong></p></td><td style="" width="252"><p>拆解目标、动态调整</p></td><td style="" width="254"><p>制定调查计划,发现新线索时调整方向</p></td></tr></tbody></table><p><br/></p><p>这三者缺一不可:没有记忆就会原地转圈,没有工具就只能纸上谈兵,没有规划就是无头苍蝇。</p><h2><span style="font-size: 22px">工作循环:</span><a href="https://arxiv.org/pdf/2210.03629"><span style="font-size: 22px;color: rgb(75, 150, 230)">观察-思考-行动(ReAct,</span><span style="font-size: 22px;color: rgb(75, 150, 230)"><strong>Yao et al., 2022)</strong></span></a></h2><p>Agent 的工作方式是一个循环:</p><ol class=" list-paddingleft-2"><li><p><strong>观察</strong>:感知当前状态(用户输入、工具返回的数据、当前任务进度)</p></li><li><p><strong>思考</strong>:LLM 推理分析,决定下一步做什么</p></li><li><p><strong>行动</strong>:调用工具执行具体操作</p></li><li><p><strong>获取反馈</strong>:观察操作结果</p></li><li><p><strong>循环或终止</strong>:根据结果决定继续调查还是输出结论</p></li></ol><p style="text-align: center;"><img src="//img1.jcloudcs.com/cms/6e7dd509-b176-4b58-8166-52fb75f5d8c120260729151014.png" alt="image (19).png" width="409" height="199" style="width: 409px; height: 199px;"/></p><p style="text-align: center;"><em>图5-3 ReAct 工作模式</em></p><h2><span style="font-size: 22px">一个完整的场景</span></h2><p><strong>你</strong>:商家 ID 为 JD-283746 疑似刷单,去查一下。</p><p>Agent 的自主工作过程:</p><ol class=" list-paddingleft-2"><li><p><strong>思考</strong>:先看订单数据有没有异常<strong>行动</strong>:调用订单系统 API,查询该商家近30天订单数据</p></li><li><p><strong>观察</strong>:订单量环比增长 500%,远超品类均值<strong>思考</strong>:增长异常,看看收货地址和买家画像</p></li><li><p><strong>行动</strong>:查询收货地址分布 + 关联买家注册信息<strong>观察</strong>:42% 地址集中在3个小区,相关买家80%在近7天注册</p></li><li><p><strong>思考</strong>:强烈刷单信号。再查资金流向确认闭环<strong>行动</strong>:查询相关订单的支付账号和退款记录</p></li><li><p><strong>观察</strong>:存在明显的资金回流路径<strong>结论</strong>:确认刷单,输出完整调查报告(含证据链、时间线、关联图谱、处置建议) 整个过程你只提供了一个商家 ID,其余全部是 Agent 自主完成的——从确定调查方向,到分步调取证据,到根据中间发现调整策略,到最终形成完整结论。</p></li></ol><h2><span style="font-size: 22px">多模态 Agent:不只看文字</span></h2><p>更进一步,现代 Agent 正在变得"多模态"——不仅能处理文字,还能理解图像、视频等。</p><p>在合规场景中,这意味着 Agent 可以:</p><ul class=" list-paddingleft-2"><li><p>审查商品主图和详情页图片是否存在违规内容</p></li><li><p>分析直播录屏中的主播话术</p></li><li><p>对比商品实拍图与描述是否一致</p></li><li><p>识别 OCR 无法覆盖的水印文字和图片中的违规信息 相当于调查员从"只看文字工单"进化到能同时审查图片证据、视频证据、音频证据——综合所有形态的信息做判断。</p></li></ul><h2><span style="font-size: 22px">Agent 的现状与挑战</span></h2><p>Agent 是当前大模型应用的前沿方向,但也面临诸多挑战:</p><ul class=" list-paddingleft-2"><li><p><strong>可靠性</strong>:模型可能"幻觉"出不存在的工具或错误地调用工具</p></li><li><p><strong>规划能力上限</strong>:超过10步以上的长程规划,当前模型容易走偏</p></li><li><p><strong>成本</strong>:一次完整的 Agent 调用可能涉及几十次 LLM 推理</p></li><li><p><strong>安全边界</strong>:Agent 有执行能力,需要严格的权限控制 但进展很快。从 2023 年到现在,Agent 的任务完成率在各类 benchmark 上持续提升,已经在代码生成、数据分析、客服等场景落地产出价值。</p></li></ul><h1><span style="font-size: 26px">六、下半场:如何把 AI 能力工程化落地</span></h1><h2><span style="font-size: 22px">从"模型能力"到"工程系统"</span></h2><p>前面五个阶段讲的都是模型本身的进化——怎么让模型更聪明、更听话、更会思考、更能行动。这是算法层面的故事。</p><p>但对于我们软件工程师、数据工程师来说,真正的挑战是:<strong>你有一个聪明的模型了,怎么把它变成一个可靠的、可维护的、能规模化运行的生产系统?</strong></p><p>这就好比:你培养出了一个优秀的调查员。但要建设一个高效运转的合规调查体系,光有优秀的人远远不够——你还需要标准操作流程(SOP)、案件管理系统、知识库、质检机制、团队协作规范……</p><p>下半场的主线,是围绕 Agent 系统的工程化展开的。它有一条清晰的演进路径:<strong>Prompt Engineering → Context Engineering → Skill → Harness → Agentic Loop → Multi-Agent</strong>。每一步都在解决上一步暴露的工程问题。</p><p style="text-align: center;"><img src="//img1.jcloudcs.com/cms/fa8f0ea7-0844-42f5-81ec-f046d36ccea120260729151037.png" alt="image (20).png" width="313" height="313" style="width: 313px; height: 313px;"/></p><p style="text-align: center;"><em>图6-1 AI 工程化范式的演进</em></p><h2><span style="font-size: 22px">第一阶段:Prompt Engineering(提示词工程)</span></h2><p>最早期的 LLM 应用方式极其简单——写一段 prompt(提示词),调一次 API,拿到结果。所有的"工程"工作就是把 prompt 写好。</p><p>回到类比:这相当于给调查员一张<strong>纸条</strong>,上面写着"你是一个合规专家,请判断以下商品是否违规"。调查员的全部工作依赖就是这张纸条上的指令。</p><p>这个阶段的核心问题:<strong>模型的表现完全取决于你怎么写 prompt</strong>。同样的任务,prompt 写法不同,结果可能天差地别。于是诞生了各种 prompt 技巧——Few-shot(给几个示例)、CoT(让模型逐步思考)、角色设定、格式约束等等。</p><p>但 Prompt Engineering 很快遇到了瓶颈:</p><ul class=" list-paddingleft-2"><li><p>纯文字指令能承载的信息量有限</p></li><li><p>无法动态适应不同的输入场景</p></li><li><p>规则一多就写成了又臭又长的"提示词面条"</p></li><li><p>没有工程化的可维护性可言</p></li></ul><h2><span style="font-size: 22px">第二阶段:Context Engineering(上下文工程)</span></h2><p>当 prompt 本身不够用时,思路自然转向:<strong>不只优化指令本身,而是优化模型每次推理时看到的全部上下文</strong>。</p><p>Andrej Karpathy(前 OpenAI/Tesla AI 负责人)在 2025 年提出:真正的核心能力不是写 prompt,而是<strong>Context Engineering</strong>——在正确的时间,把正确的信息,以正确的格式,放进模型的上下文窗口。</p><p>这包括:</p><ul class=" list-paddingleft-2"><li><p><strong>动态检索(RAG)</strong>:根据当前问题,实时从知识库中检索最相关的信息拼入上下文。类比:调查员办案时不是把所有法规都摆在桌上,而是根据当前 case 的类型,精准调出相关条款和类似案例</p></li><li><p><strong>记忆管理</strong>:维护对话历史、长期记忆、用户偏好等信息,决定每次放入哪些、裁剪哪些。类比:调查员脑子里记着这个商家的历史记录和之前的处理结论</p></li><li><p><strong>系统提示词模板化</strong>:把静态指令(角色、规则、格式要求)和动态内容(当前 case 信息、检索结果)分离管理</p></li><li><p><strong>上下文窗口预算分配</strong>:模型的上下文窗口是有限的(即使 128K 也会被用完),需要像管理内存一样精打细算地分配给不同信息 类比升级:这不再是给调查员一张纸条了,而是给他配了一个<strong>智能化的案件管理系统</strong>——每次打开一个 case 时,系统自动把相关法规、历史案例、该商家的档案、前序处理记录都准备好摆在桌面上。 调查员只需要专注于分析判断,信息调度由系统完成。</p></li></ul><h2><span style="font-size: 22px">第三阶段:Skill(技能模块化)</span></h2><p>Context Engineering 解决了"信息输入"的问题,但还有一个工程问题:<strong>模型需要完成的任务越来越多样,不可能用一个万能 prompt 覆盖所有场景</strong>。</p><p><strong>Skill(技能)</strong>的思想是:把 Agent 能做的事情封装成一个个独立的、可复用的技能模块。每个 Skill 包含:</p><ul class=" list-paddingleft-2"><li><p>触发条件:什么情况下该调用这个技能</p></li><li><p>专属 prompt/指令:针对这个任务优化的提示词</p></li><li><p>所需工具:完成这个技能需要调用哪些外部工具</p></li><li><p>输出格式:这个技能应该返回什么结构的结果 回到类比:这就像合规团队把不同类型的调查工作封装成了<strong>标准作业程序(SOP)</strong>:</p></li><li><p>"虚假宣传判定" Skill:需要商品信息 + 质检报告 + 广告法条款 → 输出判定结论</p></li><li><p>"刷单识别" Skill:需要订单数据 + 用户画像 + 资金流向 → 输出风险评分</p></li><li><p>"知识产权侵权" Skill:需要品牌数据库 + 商品图片 + 授权链 → 输出侵权判定 每个 SOP 独立可维护、可测试、可迭代。新来的调查员(新模型版本)也可以直接使用这些 SOP,不用从头学起。</p></li></ul><p>Skill 的关键好处是<strong>关注点分离</strong>:技能的编写者不需要关心调度逻辑,调度系统不需要关心每个技能的内部细节。</p><h2><span style="font-size: 22px">第四阶段:Harness(控制骨架)</span></h2><p>有了 Skill,下一个问题是:<strong>谁来决定什么时候调用哪个 Skill?调用失败了怎么办?结果怎么校验?</strong></p><p><strong>Harness(控制骨架/编排框架)</strong>是包裹在 LLM 外面的那层工程代码。它不是 AI,而是传统的确定性程序逻辑——负责流程控制、错误处理、重试机制、结果校验、权限管控等。</p><p>Harness 做的事情包括:</p><ul class=" list-paddingleft-2"><li><p><strong>流程编排</strong>:定义任务的步骤顺序、分支条件、并行/串行关系</p></li><li><p><strong>工具注册与权限控制</strong>:Agent 能调什么工具、每个工具的调用限制</p></li><li><p><strong>结果校验(Guard Rails)</strong>:模型输出后经过规则检查——格式对不对、有没有幻觉、是否触发安全红线</p></li><li><p><strong>异常处理</strong>:模型拒绝回答怎么办、工具调用超时怎么办、输出不合格怎么重试</p></li><li><p><strong>可观测性</strong>:日志、链路追踪、token 消耗统计、延迟监控 回到类比:Harness 就是合规团队的<strong>案件管理和质控系统</strong>。调查员(模型)负责动脑分析判断,但整个流程的调度——case 分配、超时提醒、结论复核、质检抽查、权限管控——全部由系统完成。 调查员再优秀,也不能自己决定"我要跳过复核环节直接处罚商家"——那是系统层面的控制。</p></li></ul><p>这个分层很重要:<strong>让 AI 做 AI 擅长的事(理解、推理、判断),让代码做代码擅长的事(流程控制、校验、可靠性保障)</strong>。</p><h2><span style="font-size: 22px">第五阶段:Agentic Loop(自主循环)</span></h2><p>前面的 Harness 是预定义的流程——步骤写死在代码里。但很多真实任务的路径不是提前可知的:调查员不知道第一步会发现什么,只能根据发现动态决定下一步。</p><p><strong>Agentic Loop(自主循环)</strong>的模式是:把"决定下一步做什么"这件事也交给 LLM——但外层的 Harness 仍然负责执行控制、安全边界、终止条件。</p><p>核心循环:</p><pre data-lang="markup">while (未达到终止条件) { observation = 收集当前状态信息 thought = LLM 分析并决策下一步行动 action = 执行 LLM 选择的工具调用 result = 获取工具返回结果 → 回到循环开头 }</pre><p>这就是第五章讲的 Agent 在工程层面的实现方式。关键在于<strong>循环是开放的</strong>——不是"第一步查订单、第二步查地址、第三步出结论"这种写死的流程,而是模型根据实际发现自主决定走向。</p><p>但 Agentic Loop 也有明确的工程约束(由 Harness 保证):</p><ul class=" list-paddingleft-2"><li><p><strong>最大循环次数</strong>:防止无限转圈</p></li><li><p><strong>Token 预算</strong>:控制成本不失控</p></li><li><p><strong>工具白名单</strong>:不能调用越权操作</p></li><li><p><strong>终止条件</strong>:什么时候必须停下来输出结果 回到类比:这就像给调查员一个<strong>自主调查权限</strong>,但同时有明确的边界——你可以自己决定调查路径,但总时长不能超过X天,只能访问Y级以下的系统,不能直接做出处罚决定,到期必须提交报告。自由度和控制力并存。</p></li></ul><h2><span style="font-size: 22px">第六阶段:Multi-Agent(多智能体协作)</span></h2><p>单个 Agentic Loop 处理一个 case 没问题。但当任务复杂到一个 Agent 搞不定时——上下文装不下、需要不同专业视角、需要并行处理——就需要多个 Agent 协作。</p><p><strong>Multi-Agent 系统</strong>把一个复杂任务分发给多个专业化的 Agent,每个 Agent 有自己的 Skill 集合、自己的 Loop、自己的上下文。它们通过一个 Orchestrator (编排者)来协调。</p><p style="text-align: center;"><img src="//img1.jcloudcs.com/cms/9d9b115f-76f6-4a98-947f-cc244c99e95b20260729151100.png" alt="image (21).png" width="425" height="315" style="width: 425px; height: 315px;"/></p><p style="text-align: center;"><em>图6-2 多智能体模式</em></p><p>回到类比:一个大型合规专项——比如"双十一期间全平台虚假原价排查":</p><ul class=" list-paddingleft-2"><li><p><strong>Orchestrator(组长)</strong>:接收任务,拆解为子任务,分配给各专业组,汇总结果</p></li><li><p><strong>数据 Agent</strong>:扫描全平台价格异动,输出疑似名单</p></li><li><p><strong>调查 Agent × N</strong>:并行处理多个商家的深度调查(每个跑自己的 Agentic Loop)</p></li><li><p><strong>法规 Agent</strong>:提供法规解释支持(被其他 Agent 按需调用)</p></li><li><p><strong>质检 Agent</strong>:对调查结论做交叉检验</p></li><li><p><strong>报告 Agent</strong>:汇总所有结果,生成专项报告 每个 Agent 只需要擅长自己的环节,复杂度被分治到可管理的程度。</p></li></ul><h2><span style="font-size: 22px">整条演进线的逻辑</span></h2><p>回头看这六个阶段,有一条清晰的递进逻辑:</p><p><br/></p><table cellspan="0"><colgroup><col style="width: 189px"/><col style="width: 189px"/><col style="width: 189px"/><col style="width: 191px"/></colgroup><tbody><tr class="firstRow"><td style="background: rgb(85, 85, 85);" width="189"><p><span style="color: rgb(255, 255, 255);">阶段</span></p></td><td style="background: rgb(85, 85, 85);" width="189"><p><span style="color: rgb(255, 255, 255);">核心思想</span></p></td><td style="background: rgb(85, 85, 85);" width="189"><p><span style="color: rgb(255, 255, 255);">解决的工程问题</span></p></td><td style="background: rgb(85, 85, 85);" width="191"><p><span style="color: rgb(255, 255, 255);">类比</span></p></td></tr><tr><td style="" width="189"><p><strong>Prompt Engineering</strong></p></td><td style="" width="189"><p>写好提示词</p></td><td style="" width="189"><p>怎么让模型理解任务</p></td><td style="" width="191"><p>给调查员一张指令纸条</p></td></tr><tr><td style="" width="189"><p><strong>Context Engineering</strong></p></td><td style="" width="189"><p>管理好输入的全部信息</p></td><td style="" width="189"><p>怎么让模型看到正确的上下文</p></td><td style="" width="191"><p>给他配一个智能案件管理系统</p></td></tr><tr><td style="" width="189"><p><strong>Skill</strong></p></td><td style="" width="189"><p>能力模块化</p></td><td style="" width="189"><p>怎么让系统覆盖多种任务类型</p></td><td style="" width="191"><p>编写各类调查的标准 SOP</p></td></tr><tr><td style="" width="189"><p><strong>Harness</strong></p></td><td style="" width="189"><p>工程骨架包裹 AI</p></td><td style="" width="189"><p>怎么保证流程可靠、结果可控</p></td><td style="" width="191"><p>案件管理 + 质控系统</p></td></tr><tr><td style="" width="189"><p><strong>Agentic Loop</strong></p></td><td style="" width="189"><p>让 AI 自主决策行动路径</p></td><td style="" width="189"><p>怎么处理非预定义的开放任务</p></td><td style="" width="191"><p>给调查员自主调查权限</p></td></tr><tr><td style="" width="189"><p><strong>Multi-Agent</strong></p></td><td style="" width="189"><p>多 Agent 分工协作</p></td><td style="" width="189"><p>怎么处理超出单人能力的大型任务</p></td><td style="" width="191"><p>组建专项行动小组</p></td></tr></tbody></table><p><br/></p><p>每一步都是在上一步的基础上增加一层抽象、解决一个新的复杂度问题。这不是六种可选方案,而是一条递进的演化路径——复杂度越高的任务,需要走到越后面的阶段。</p><h2><span style="font-size: 22px">数据飞轮:让系统越用越强</span></h2><p>无论走到哪个阶段,都有一个共性问题:<strong>系统上线后怎么持续变好?</strong></p><p>答案是构建<strong>数据飞轮</strong>:</p><p>系统处理真实 case</p><p>→ 收集结果和反馈(申诉、QA 抽检、人工复核)</p><p>→ 反馈转化为训练/评估数据</p><p>→ 优化 Prompt / Skill / 模型本身</p><p>→ 更好地处理下一批 case</p><p>→ ……</p><p>每一次真实的业务使用都在积累让系统更好的数据。Prompt 的迭代、Skill 的新增和优化、Guard Rails 规则的细化、甚至模型本身的微调——都可以由这个飞轮驱动。</p><p style="text-align: center;"><img src="//img1.jcloudcs.com/cms/2b86e69a-19bf-4908-a896-5684007d870120260729151124.png" alt="image (22).png" width="444" height="301" style="width: 444px; height: 301px;"/></p><p style="text-align: center;"><em>图6-3 数据飞轮运行流程</em></p><p>回到类比:这就是合规团队的<strong>经验沉淀和方法论迭代</strong>——每个 case 的处理结果都会反哺系统:被申诉推翻的判定变成负样本,QA 抽检认可的判定变成正样本,新出现的违规手法变成新的检测规则。 系统越用越聪明,不是靠某一次大版本升级,而是靠日积月累的飞轮转动。</p><h1><span style="font-size: 26px">七、前沿方向:接下来会发生什么</span></h1><p style="text-align: center;"><img src="//img1.jcloudcs.com/cms/3d0bf290-8108-4bfe-a45e-7333f2eddd9820260729151149.png" alt="image (23).png" width="505" height="284" style="width: 505px; height: 284px;"/></p><p style="text-align: center;"><em>图7-1 前几天刚刚召开的 WAIC 2026(世界人工智能大会)</em></p><p>前面讲了模型怎么进化、系统怎么落地。最后这一节看看当下正在发生和即将发生的事情——这些方向不是独立的概念,而是顺着前面的主线自然延伸出来的。</p><h2><span style="font-size: 22px">从文本到万物:多模态的深化</span></h2><p>前面的整个故事都是以文本为核心的。但现实世界的信息不只是文字——商品主图、直播录屏、客诉录音、物流单据照片……</p><p><strong>多模态大模型</strong>让 AI 能够同时理解和生成文本、图像、音频、视频。当前的进展:</p><ul class=" list-paddingleft-2"><li><p><strong>理解侧</strong>:GPT-4o、Gemini 等已能处理图文混合输入,识别图片内容、理解图表、分析视频帧</p></li><li><p><strong>生成侧</strong>:从文本生成图像(DALL-E、Midjourney)、视频(Sora)、语音(实时对话)</p></li><li><p><strong>端到端</strong>:原生多模态模型(不是"视觉模型+语言模型拼接",而是统一的模型处理所有模态) 对合规场景的意义:Agent 不仅能审文字,还能直接看商品图判断是否涉及侵权、分析直播画面识别违规话术、用 OCR + 语义理解处理扫描件——从"文字调查员"进化为"全能调查员"。</p></li></ul><h2><span style="font-size: 22px">从云端到终端:端侧部署与隐私计算</span></h2><p>大模型动辄几十GB,只能跑在 GPU 服务器上?未必了。</p><p>通过模型压缩(量化、剪枝、蒸馏),3B~8B 参数的模型已经可以在手机、笔记本、甚至 IoT 设备上流畅运行。苹果的 Apple Intelligence、高通的 AI 芯片方案都在推动这个方向。</p><p>对于合规这类涉及敏感数据的场景,端侧部署还有一个独特价值:<strong>数据不出域</strong>。商家信息、用户隐私数据不需要传到外部 API,在本地就能完成分析——天然满足数据安全和合规要求。</p><h2><span style="font-size: 22px">从对话框到物理世界:Computer Use 与具身智能</span></h2><p>Agent 目前主要通过 API 调用工具。但很多系统没有 API——只有网页界面、桌面软件、甚至物理操作。</p><p><strong>Computer Use(计算机使用)</strong>:让 AI 像人一样操作 GUI——看屏幕截图,移动鼠标,点击按钮,输入文字。Anthropic 和 OpenAI 在 2024-2025 年相继发布了这个能力。</p><p>对合规场景的潜在价值:有些内部系统没有开放 API(老旧 ERP、审批系统、特定平台后台),Agent 可以直接在界面上操作,降低系统对接成本。</p><p>更远的方向是<strong>具身智能</strong>——让 AI 控制物理机器人在真实世界中行动。2024-2025 年人形机器人 + LLM 的结合进展迅速,但距离实用还有距离。</p><h2><span style="font-size: 22px">从单次推理到持续进化:在线学习与自我改进</span></h2><p>当前模型的知识是"冻结"的——训练完成后就不再更新(除非重新训练或微调)。但世界在变、规则在变、违规手法在变。</p><p>几个正在探索的方向:</p><ul class=" list-paddingleft-2"><li><p><strong>在线学习(Continual Learning)</strong>:让模型在部署后持续从新数据中学习,而不会忘记旧知识</p></li><li><p><strong>自我反思与改进(Self-Improvement)</strong>:模型自己评估自己的输出质量,发现问题后自我修正</p></li><li><p><strong>合成数据驱动的自我进化</strong>:模型生成训练数据 → 训练更强的自己(但需要警惕"模型崩塌"——同质化导致多样性丧失) 回到类比:这就是调查员从"定期参加培训班更新知识"走向"在日常工作中自动学习新规则、新手法、新判例"——不用等别人教,自己就能持续进化。</p></li></ul><h2><span style="font-size: 22px">从确定性到可信赖:安全与对齐的深水区</span></h2><p>模型越强大、越自主,安全问题就越尖锐:</p><ul class=" list-paddingleft-2"><li><p><strong>幻觉(Hallucination)</strong>:模型自信地胡说八道。在合规场景中,引用一条不存在的法规可能导致严重后果</p></li><li><p><strong>越狱(Jailbreak)</strong>:恶意构造的输入让模型绕过安全限制</p></li><li><p><strong>对齐税</strong>:过度强调安全导致模型变得无用(什么都不敢判)</p></li><li><p><strong>可解释性</strong>:模型给出了结论,但你不知道它为什么这么判——这在法律和合规场景中是不可接受的 业界正在投入大量精力的方向:</p></li><li><p><strong>形式化验证</strong>:用数学方法证明模型在某些场景下不会产生特定有害输出</p></li><li><p><strong>宪法 AI(Constitutional AI)</strong>:让模型按照一组明确的"宪法"原则来自我约束</p></li><li><p><strong>机械可解释性(Mechanistic Interpretability)</strong>:打开模型黑箱,理解每个神经元在做什么</p></li></ul><h2><span style="font-size: 22px">方向汇总</span></h2><p><br/></p><table cellspan="0"><colgroup><col style="width: 252px"/><col style="width: 252px"/><col style="width: 254px"/></colgroup><tbody><tr class="firstRow"><td style="background: rgb(85, 85, 85);" width="252"><p><span style="color: rgb(255, 255, 255);">方向</span></p></td><td style="background: rgb(85, 85, 85);" width="252"><p><span style="color: rgb(255, 255, 255);">核心问题</span></p></td><td style="background: rgb(85, 85, 85);" width="254"><p><span style="color: rgb(255, 255, 255);">对合规场景的意义</span></p></td></tr><tr><td style="" width="252"><p><strong>多模态</strong></p></td><td style="" width="252"><p>让 AI 处理图/音/视频</p></td><td style="" width="254"><p>商品图审查、直播合规、证据识别</p></td></tr><tr><td style="" width="252"><p><strong>端侧部署</strong></p></td><td style="" width="252"><p>在本地设备运行模型</p></td><td style="" width="254"><p>数据不出域,满足隐私合规</p></td></tr><tr><td style="" width="252"><p><strong>Computer Use</strong></p></td><td style="" width="252"><p>让 AI 操作 GUI</p></td><td style="" width="254"><p>对接无 API 的老旧系统</p></td></tr><tr><td style="" width="252"><p><strong>持续进化</strong></p></td><td style="" width="252"><p>模型部署后继续学习</p></td><td style="" width="254"><p>自动适应新规则和新手法</p></td></tr><tr><td style="" width="252"><p><strong>可信 AI</strong></p></td><td style="" width="252"><p>消除幻觉、保证可解释</p></td><td style="" width="254"><p>判定结论可审计、可追溯</p></td></tr></tbody></table><p><br/></p><p>这些方向有一个共同趋势:让 AI 从"在对话框里回答问题"走向"在真实业务环境中可靠地、持续地工作"。每一个方向解决的都是从"Demo 好使"到"生产可用"之间的某个关键 gap。</p><h1><span style="font-size: 26px">全景回顾</span></h1><p>回到开头的故事。完整的旅程分为两个半场:</p><p><strong>上半场——模型能力的进化:</strong></p><p><br/></p><table cellspan="0"><colgroup><col style="width: 189px"/><col style="width: 189px"/><col style="width: 189px"/><col style="width: 191px"/></colgroup><tbody><tr class="firstRow"><td style="background: rgb(85, 85, 85);" width="189"><p><span style="color: rgb(255, 255, 255);">阶段</span></p></td><td style="background: rgb(85, 85, 85);" width="189"><p><span style="color: rgb(255, 255, 255);">做了什么</span></p></td><td style="background: rgb(85, 85, 85);" width="189"><p><span style="color: rgb(255, 255, 255);">解决了什么问题</span></p></td><td style="background: rgb(85, 85, 85);" width="191"><p><span style="color: rgb(255, 255, 255);">类比</span></p></td></tr><tr><td style="" width="189"><p><strong>预训练</strong></p></td><td style="" width="189"><p>海量文本上训练续写</p></td><td style="" width="189"><p>知识从无到有</p></td><td style="" width="191"><p>读完所有法规和案例</p></td></tr><tr><td style="" width="189"><p><strong>SFT</strong></p></td><td style="" width="189"><p>用指令数据微调</p></td><td style="" width="189"><p>从续写变为执行任务</p></td><td style="" width="191"><p>学会按格式出结论</p></td></tr><tr><td style="" width="189"><p><strong>RLHF/DPO</strong></p></td><td style="" width="189"><p>用偏好反馈对齐</p></td><td style="" width="189"><p>质量从参差到可靠</p></td><td style="" width="191"><p>根据反馈校准判定尺度</p></td></tr><tr><td style="" width="189"><p><strong>推理强化</strong></p></td><td style="" width="189"><p>用 CoT/RL 激励深度推理</p></td><td style="" width="189"><p>从凭直觉到有理有据</p></td><td style="" width="191"><p>先理证据链再下结论</p></td></tr><tr><td style="" width="189"><p><strong>Agent</strong></p></td><td style="" width="189"><p>加工具+记忆+规划</p></td><td style="" width="189"><p>从被动分析到主动行动</p></td><td style="" width="191"><p>独立接手全链路调查</p></td></tr></tbody></table><p><br/></p><p><strong>下半场——工程化落地:</strong></p><p><br/></p><table cellspan="0"><colgroup><col style="width: 189px"/><col style="width: 189px"/><col style="width: 189px"/><col style="width: 191px"/></colgroup><tbody><tr class="firstRow"><td style="background: rgb(85, 85, 85);" width="189"><p><span style="color: rgb(255, 255, 255);">阶段</span></p></td><td style="background: rgb(85, 85, 85);" width="189"><p><span style="color: rgb(255, 255, 255);">做了什么</span></p></td><td style="background: rgb(85, 85, 85);" width="189"><p><span style="color: rgb(255, 255, 255);">解决了什么问题</span></p></td><td style="background: rgb(85, 85, 85);" width="191"><p><span style="color: rgb(255, 255, 255);">类比</span></p></td></tr><tr><td style="" width="189"><p><strong>PE → CE</strong></p></td><td style="" width="189"><p>从写 prompt 到管理全部上下文</p></td><td style="" width="189"><p>信息输入的精准和高效</p></td><td style="" width="191"><p>从纸条指令到案件管理系统</p></td></tr><tr><td style="" width="189"><p><strong>Skill</strong></p></td><td style="" width="189"><p>能力模块化封装</p></td><td style="" width="189"><p>多场景覆盖和可维护性</p></td><td style="" width="191"><p>各类调查 SOP</p></td></tr><tr><td style="" width="189"><p><strong>Harness</strong></p></td><td style="" width="189"><p>工程骨架包裹 AI</p></td><td style="" width="189"><p>可靠性、安全性、可观测性</p></td><td style="" width="191"><p>质控系统和权限管控</p></td></tr><tr><td style="" width="189"><p><strong>Loop → Multi-Agent</strong></p></td><td style="" width="189"><p>自主循环到团队协作</p></td><td style="" width="189"><p>开放任务和复杂任务的处理</p></td><td style="" width="191"><p>从自主调查到专项行动小组</p></td></tr></tbody></table><p><br/></p><p>上半场解决"AI 能不能做",下半场解决"AI 怎么可靠地、规模化地做",前沿方向则在推动"AI 能做到什么程度"的边界不断外扩。</p><p><strong>结语</strong>:大模型的发展就是从"能背法条"走向"能独立办案",再走向"能组织化批量办案"的过程。对于我们团队来说,理解上半场是为了知道 AI 的能力边界在哪里, 理解下半场是为了知道怎么把这些能力变成真正可用的生产系统,关注前沿方向则是为了判断——哪些事情今天还做不到,但明天就可以开始尝试了。</p><h1><span style="font-size: 26px">参考文献</span></h1><ol class=" list-paddingleft-2"><li><p>Vaswani, A., et al. (2017).<em>Attention Is All You Need.</em> <a href="https://arxiv.org/abs/1706.03762"><span style="color: rgb(75, 150, 230)">https://arxiv.org/abs/1706.03762</span></a></p></li><li><p>Mikolov, T., et al. (2013).<em>Efficient Estimation of Word Representations in Vector Space ( Word2Vec).</em><a href="https://arxiv.org/abs/1301.3781"><span style="color: rgb(75, 150, 230)">https://arxiv.org/abs/1301.3781</span></a></p></li><li><p>Su, J., et al. (2021).<em>RoFormer: Enhanced Transformer with Rotary Position Embedding (RoPE).</em> <a href="https://arxiv.org/abs/2104.09864"><span style="color: rgb(75, 150, 230)">https://arxiv.org/abs/2104.09864</span></a></p></li><li><p>Shazeer, N. (2019).<em>Fast Transformer Decoding: One Write-Head is All You Need (MQA).</em> <a href="https://arxiv.org/abs/1911.02150"><span style="color: rgb(75, 150, 230)">https://arxiv.org/abs/1911.02150</span></a></p></li><li><p>Ainslie, J., et al. (2023).<em>GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints.</em><a href="https://arxiv.org/abs/2305.13245"><span style="color: rgb(75, 150, 230)">https://arxiv.org/abs/2305.13245</span></a></p></li><li><p>DeepSeek-AI. (2024).<em>DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model (MLA).</em><a href="https://arxiv.org/abs/2405.04434"><span style="color: rgb(75, 150, 230)">https://arxiv.org/abs/2405.04434</span></a></p></li><li><p>Dao, T., et al. (2022).<em>FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness.</em><a href="https://arxiv.org/abs/2205.14135"><span style="color: rgb(75, 150, 230)">https://arxiv.org/abs/2205.14135</span></a></p></li><li><p>Beltagy, I., et al. (2020).<em>Longformer: The Long-Document Transformer.</em><a href="https://arxiv.org/abs/2004.05150"><span style="color: rgb(75, 150, 230)">https://arxiv.org/abs/2004.05150</span></a></p></li><li><p>Xiao, G., et al. (2023).*Efficient Streaming Language Models with Attention Sinks (StreamingLLM). *<a href="https://arxiv.org/abs/2309.17453"><span style="color: rgb(75, 150, 230)">https://arxiv.org/abs/2309.17453</span></a></p></li><li><p>Kaplan, J., et al. (2020).<em>Scaling Laws for Neural Language Models.</em><a href="https://arxiv.org/abs/2001.08361"><span style="color: rgb(75, 150, 230)">https://arxiv.org/abs/2001.08361</span></a></p></li><li><p>Shazeer, N., et al. (2017).<em>Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer.</em><a href="https://arxiv.org/abs/1701.06538"><span style="color: rgb(75, 150, 230)">https://arxiv.org/abs/1701.06538</span></a></p></li><li><p>Radford, A., et al. (2019).<em>Language Models are Unsupervised Multitask Learners (GPT-2).</em><a href="https://cdn.openai.com/better-language-models/language_models_are_unsupervised_multitask_learners.pdf"><span style="color: rgb(75, 150, 230)">https://cdn.openai.com/better-language-models/language_models_are_unsupervised_multitask_learners.pdf</span></a></p></li><li><p>Brown, T., et al. (2020).<em>Language Models are Few-Shot Learners (GPT-3).</em><a href="https://arxiv.org/abs/2005.14165"><span style="color: rgb(75, 150, 230)">https://arxiv.org/abs/2005.14165</span></a></p></li><li><p>Ouyang, L., et al. (2022).<em>Training Language Models to Follow Instructions with Human Feedback ( InstructGPT).</em><a href="https://arxiv.org/abs/2203.02155"><span style="color: rgb(75, 150, 230)">https://arxiv.org/abs/2203.02155</span></a></p></li><li><p>Schulman, J., et al. (2017).<em>Proximal Policy Optimization Algorithms (PPO).</em><a href="https://arxiv.org/abs/1707.06347"><span style="color: rgb(75, 150, 230)">https://arxiv.org/abs/1707.06347</span></a></p></li><li><p>Rafailov, R., et al. (2023).<em>Direct Preference Optimization: Your Language Model is Secretly a Reward Model (DPO).</em><a href="https://arxiv.org/abs/2305.18290"><span style="color: rgb(75, 150, 230)">https://arxiv.org/abs/2305.18290</span></a></p></li><li><p>Bai, Y., et al. (2022).<em>Constitutional AI: Harmlessness from AI Feedback (RLAIF).</em><a href="https://arxiv.org/abs/2212.08073"><span style="color: rgb(75, 150, 230)">https://arxiv.org/abs/2212.08073</span></a></p></li><li><p>Wei, J., et al. (2022).<em>Chain-of-Thought Prompting Elicits Reasoning in Large Language Models.</em><a href="https://arxiv.org/abs/2201.11903"><span style="color: rgb(75, 150, 230)">https://arxiv.org/abs/2201.11903</span></a></p></li><li><p>Liu, N. F., et al. (2023).<em>Lost in the Middle: How Language Models Use Long Contexts.</em><a href="https://arxiv.org/abs/2307.03172"><span style="color: rgb(75, 150, 230)">https://arxiv.org/abs/2307.03172</span></a></p></li><li><p>DeepSeek-AI (Guo, D., et al.). (2025).<em>DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.</em><a href="https://arxiv.org/abs/2501.12948"><span style="color: rgb(75, 150, 230)">https://arxiv.org/abs/2501.12948</span></a></p></li><li><p>Hinton, G., et al. (2015).<em>Distilling the Knowledge in a Neural Network.</em><a href="https://arxiv.org/abs/1503.02531"><span style="color: rgb(75, 150, 230)">https://arxiv.org/abs/1503.02531</span></a></p></li><li><p>Taori, R., et al. (2023).<em>Alpaca: A Strong, Replicable Instruction-Following Model.</em><a href="https://crfm.stanford.edu/2023/03/13/alpaca.html"><span style="color: rgb(75, 150, 230)">https://crfm.stanford.edu/2023/03/13/alpaca.html</span></a></p></li><li><p>Chiang, W.-L., et al. (2023).<em>Vicuna: An Open-Source Chatbot Impressing GPT-4 with 90% ChatGPT Quality.</em><a href="https://lmsys.org/blog/2023-03-30-vicuna/"><span style="color: rgb(75, 150, 230)">https://lmsys.org/blog/2023-03-30-vicuna/</span></a></p></li><li><p>Yao, S., et al. (2022).<em>ReAct: Synergizing Reasoning and Acting in Language Models.</em><a href="https://arxiv.org/abs/2210.03629"><span style="color: rgb(75, 150, 230)">https://arxiv.org/abs/2210.03629</span></a></p></li><li><p>Leviathan, Y., et al. (2023).<em>Fast Inference from Transformers via Speculative Decoding.</em><a href="https://arxiv.org/abs/2211.17192"><span style="color: rgb(75, 150, 230)">https://arxiv.org/abs/2211.17192</span></a></p></li><li><p>Kwon, W., et al. (2023).<em>Efficient Memory Management for Large Language Model Serving with PagedAttention (vLLM).</em><a href="https://arxiv.org/abs/2309.06180"><span style="color: rgb(75, 150, 230)">https://arxiv.org/abs/2309.06180</span></a></p></li></ol><h1><span style="font-size: 26px">补充资料</span></h1><p style="text-align: center;"><img src="//img1.jcloudcs.com/cms/92197643-58d3-4f29-af2a-724fab412bc620260729152757.jpg" style="width: 250px; height: 167px;" width="250" height="167"/> <img src="//img1.jcloudcs.com/cms/8c658805-e810-4a64-b757-a3eddaa80ab320260729152757.png" width="258" height="172" style="font-size: unset; width: 258px; height: 172px;"/></p>
上一篇:【全栈实践】第一个 AI Agent 项目:从零搭建 AI 音频创作助手【最终版】
下一篇:京东零售广告创意:自动化商品海报生成与优化(AAAI 2026)
jd_KODiKkdTCZkx
文章数
1
阅读量
51
作者其他文章
01
大模型是怎样炼成的:从会背书到能办案
以合规调查员场景类比,面向所有人的大模型科普分享。 开场:一个贯穿全文的故事我们用一个大家都熟悉的场景来讲这个故事:把训练一个大模型,想象成培养一个合规调查员,并最终建设一套合规调查体系。先让他读完所有法规、平台规则、历史案例(预训练),再教他怎么按标准格式输出调查结论(SFT),然后根据申诉率和误判反馈来校准他的判定尺度(RLHF),接着训练他遇到复杂 case 时先拆解证据链再下结论(推理
jd_KODiKkdTCZkx
文章数
1
阅读量
51
作者其他文章
添加企业微信
获取1V1专业服务
扫码关注
京东云开发者公众号