资讯动态

货拉拉营销大模型落地实践:从文案生成到策略智能体

发布时间:2026/9/29 18:26:23 来源:尧图企业网站定制
2023年下半年我们团队拿到一个任务把大模型真正用进货拉拉的营销链路里而不是停在Demo阶段。当时大模型在行业里已经火了大半年但大多数公司的应用还停留在“能聊天、能写周报”的层面真正敢把它放进广告投放、营销增长这种直接对ROI负责的业务里的团队并不多。货拉拉的业务特点是高频、低价、强地域性营销物料的需求量巨大传统人工生产方式已经到了瓶颈。这篇总结不讲虚的把我们过去一年在营销广告场景落地大模型的经验、踩过的坑、以及最终沉淀下来的方法一次性说清楚适合正在做Agent应用、营销技术中台、或者想用大模型改造业务链路的朋友参考。1. 项目背景营销广告的痛点与大模型的切入点1.1 货拉拉营销业务的核心场景与效率瓶颈先拆解货拉拉的营销业务盘子。作为同城货运平台营销侧主要分为三个大方向C端用户增长拉新、促活、召回、B端司机端运营招募、留存、GMV激励以及品牌传播。这三个方向对应的物料需求差异巨大C端用户要看的是“便宜、快、安全”司机端在意的是“单量、收入、接单效率”品牌物料则强调调性统一。传统模式下这些物料从策划、文案、设计到投放跑完一整套流程至少需要3到5个工作日。遇到大促节点需求量翻倍团队只能靠堆人力加班来顶。更大的问题在于文案的同质化。同一个活动在不同城市的落地页仅仅是把城市名替换掉其他内容完全一样。但货拉拉的业务有明显的城市分层一线城市用户在意时效下沉市场用户在意价格同一句广告语在不同城市的效果差异非常大。运营同学也不是没有意识到这一点只是人工生产物料的成本摆在那里根本做不到大规模的个性化定制。此外投放人群圈选依赖运营手动组合标签数据分析也要靠BI同学写SQL再人工解读整个链路是被打断的决策周期被拖得很长。这些痛点的本质是营销生产链路中大量工作依赖“人肉的重复劳动”而非真正的创造性劳动。大模型的生成能力恰好可以接管那些重复性高、规则明确、但量级巨大的内容生产环节这正是我们决定切入的方向。1.2 为什么是“大模型”而不是规则引擎和传统机器学习有人可能会问文案批量生成用模板引擎不行吗人群圈选用规则匹配不行吗为什么非要上大模型这个问题我们内部也讨论了很久。答案是模板引擎能解决“统一”的问题但解决不了“个性化”的问题而传统机器学习模型虽然能做人货匹配却无法理解语义层面的意图。拿文案生成举例。模板引擎做出来的文案是“首单立减10元新用户专享”大模型可以根据用户的历史行为生成“你上次叫车是两周前那天下雨等了很久这次试试预约用车提前锁定司机”。前者是信息告知后者是基于用户场景的沟通。货拉拉有海量的用户行为数据订单数据、搜索记录、取消原因、客服反馈这些数据里蕴含着大量可被生成的语义信息传统技术栈根本没法利用。人群圈选就更明显了。运营同学跟我说“我要找出最近30天用过货拉拉、但是最近7天没下单、而且住在城中村的同城货运用户。”这种自然语言表达的意图在过去需要翻译成一串复杂的SQL和标签组合中间还可能因为理解偏差导致圈选结果跟预期不符。大模型可以直接把自然语言转成结构化的圈选规则并且支持反问和修正这才是真正意义上的提效。大模型的核心价值不是替代某个模板而是把“人的意图”和“机器执行”之间的翻译成本降到最低。这个定位一旦明确后面所有技术选型都围绕它展开。2. 技术选型与系统架构先搭基座再谈业务2.1 基座模型选择与私有化部署的考量模型选型是第一个大决策。当时市面上的主流选择有开源系的Qwen、ChatGLM、Llama以及闭源的商业API。我们最终选择了以Qwen系列开源模型为主力搭配少量商业API做兜底的混合方案。决定私有化部署的核心原因有两个。第一是数据合规。营销侧会接触到大量用户手机号、订单金额、行为轨迹等敏感数据这些数据如果通过外部API传输合规风险太高法务部门第一个不答应。第二是成本控制。营销物料生成的量级高峰期一天要调用几十万次如果全部走商业API单日成本就非常可观。私有化部署虽然前期有硬件投入但边际成本极低跑得越久越划算。部署层面我们用的是vLLM做推理加速配合P50节点做私有化集群。vLLM对Qwen系列的适配度很好显存管理做得漂亮吞吐量比原生推理框架高出不少。模型尺寸选择了7B和14B两个规格7B用于文案生成这类对速度要求高的场景14B用于人群圈选和数据分析这种需要更强推理能力的场景。量化方案用的INT8实测下来效果损失在可接受范围内但推理速度提升接近一倍。2.2 RAG知识库与向量检索把业务规则“喂”给模型刚上线时我们犯过一个典型错误直接把业务问题丢给基础模型让模型根据“常识”回答。结果就是模型一本正经地胡说八道。比如我们问“新用户首单立减规则是什么”模型会编造出一个根本不存在的优惠方案。这个问题的根源不是模型不够聪明而是它压根不知道货拉拉的营销规则它的知识截止日期和我们的业务系统是两个世界。解决方案是引入RAG检索增强生成。我们把所有营销活动的规则、券模板、文案规范、投放策略文档全部清洗后切成chunk块向量化后存入Milvus向量数据库。每次模型生成前先检索出最相关的业务规则片段作为上下文注入Prompt。这样一来模型的回答就有了“依据”不再是无中生有的自由发挥。这里有一个实操要点知识库不是丢进去就能用的清洗这一步决定了检索质量的上限。我们踩过的坑包括同一个活动在不同文档里有新旧两版规则检索时会同时命中导致模型混淆PDF格式的投放规范文档转文本后夹杂大量乱码切chunk时把语义完整的段落强行切断导致检索结果残破不全。后来我们专门建了一套清洗管线统一转成Markdown格式按活动、按版本打标签切chunk时尽量按语义边界切检索命中率从最初的62%提升到87%以上。2.3 Agent框架与工作流编排从“单点调用”到“多步决策”单次生成、单次检索只能解决“内容生产”的问题但营销业务中真正复杂的是“多步决策”。比如“根据未来三天的天气和交通数据动态调整暴雨城市的货运券面额”这需要工具调用、数据查询、规则校验然后再生成文案单次Prompt根本搞不定。我们基于LangChain搭建了自己的Agent框架。核心是把每个营销动作封装成工具让大模型作为决策大脑自主决定调用哪些工具、按什么顺序调用。比如“数据分析助手”这个Agent接收到运营的自然语言问题后先调用意图识别模块判断问题类型再调用SQL生成器生成查询语句执行查询后把结果传给图表生成工具最后用大模型对数据做解读。这个过程中最重要的一环是“工具描述”的设计。大模型并不知道你的工具怎么用它只能通过你的描述来理解工具的功能和参数。我们一开始工具描述写得含糊比如“get_coupon_info”后面只跟了一句“获取券信息”模型经常传错参数。后来参照function calling的规范把每个参数的类型、枚举值、默认值、示例全部写清楚调用成功率提升非常明显。这个细节在Demo阶段看不出差别但生产环境的准确率就靠这些细节堆出来的。3. 核心场景落地营销广告中的五个AI实战3.1 用户增长文案的批量生成与个性化改版第一个落地的场景是用户增长文案。我们建立了一个“活动聚合页自动生成系统”系统在大促期间每天为不同城市、不同用户群体生成个性化的活动落地页文案。输入参数包括用户城市、用户分层新用户/沉默用户/活跃用户、历史偏好品类搬家/运货/跑腿、当前活动利益点。Prompt设计上我们使用了一套“角色设定业务规则用户画像输出格式”的四段式结构。角色设定让模型以资深营销文案专家身份输出业务规则从RAG知识库中拉取确保利益点不虚构用户画像是动态传入的JSON结构描述用户的行为特征输出格式则约束了标题、副标题、CTA按钮文字的长度和语气。这套结构上线后文案的人工采纳率从初期的30%左右提升到接近60%。这里特别想说的是个性化并不意味着每句文案都不同而是要让目标用户觉得“这条文案是写给我的”。我们在A/B测试中发现针对沉默召回人群只要在文案里体现“记得你的历史记录”比如“你的常用运输车型已为你预留”点击率就能比通用文案提升15%以上。这不是什么神奇的技术魔法只是把数据用对了地方。3.2 多模态素材生产商品图生成与背景替换营销物料光有文案远远不够视觉素材的需求量同样巨大。货拉拉的营销投放涉及数千种素材尺寸横版、竖版、方形不同渠道还有各自的规格要求。传统设计团队一天最多产出几十张图但广告系统的需求是每天上千张。我们接入了多模态生成模型重点应用在两个环节。第一个是背景替换把原有素材图中的背景换成符合不同城市调性的场景比如一线城市的高楼、下沉市场的小区、节假日氛围图。第二个是模版快速产出根据行业化模板自动生成适合搬家、拉货、同城配送等不同品类的视觉素材。做法是先用文生图模型生成底图再用风格迁移模型做统一调性处理最后由设计师做人工审核。这个场景最核心的技巧是“Prompt模板库”的沉淀。我们把设计师脑子里那套“如何描述一张好看的图”的隐性知识转化成了结构化的提示词模板包括构图方式、色调风格、光影效果、材质质感等维度。设计师提供一个优质模板系统就能批量产出数百张风格统一的素材图人工只需要挑毛病、打回重做。实测一个项目的素材制作周期从4天压缩到1天设计师的精力从“画图”转移到“审核与调优”上这才是更合理的分工。3.3 自然语言圈选人群让运营用大白话做定向定向投放是营销的核心动作过去由运营在DMP后台手动组合标签或者用SQL直接查询数仓。这两种方式都有很高的使用门槛导致很多精细化的圈选想法因为“实现成本太高”而被放弃。我们做了一个“自然语言人群圈选助手”运营人员直接在对话框输入类似“我想找出北京地区最近一个月用过货拉拉搬家服务、近一周没有活跃的女性用户”系统会自动拆分意图映射到数仓的表字段和标签体系生成对应的圈选规则。整个过程支持多轮对话如果圈选结果范围过大或过小运营可以直接说“再加一个条件预算敏感的”系统会继续修正。这个场景对模型的语义理解能力要求很高因为运营的表达方式五花八门同样的意思有十几种说法。我们的做法是建立了一套“业务词典”体系把同义词、常见的口语表达与标准标签字段做映射。在系统后台运营说的“住在城中村”会被映射到“居住属性城中村”“预算敏感”会映射到“客单价30元且使用过优惠券”。这套映射规则初期靠人工编写后期通过采集真实对话数据不断扩充目前已经积累了500多组映射关系圈选意图识别的准确率达到了92%。3.4 投放数据问答助手让数据结果“说人话”投放决策依赖数据但传统的数据消费方式对运营同学并不友好。BI报表的字段多、维度杂一个“今天整体投放效果如何”的问题运营要自己去报表里翻好几个页面然后在大脑里拼接完整的信息全貌。这是巨大的时间浪费。我们的“数据问答助手”就是为此而建。运营输入问题大模型生成SQL去查询数仓拿回结果后由模型做自然语言的解读分析。比如投手问“为什么上海地区今天的点击率下降了”系统会查出来上海近三天的曝光、点击、转化数据对比昨天的变化指出哪个流量渠道的转化出现异常还附带一句推测性归因“直通车渠道的点击率环比下降12%可能与素材疲劳有关建议更换创意。”这个场景的技术难点在于“SQL生成的可靠性”。生成错误的SQL比不生成更糟它会误导决策。我们给SQL生成加了两道保险第一道是限定查询的字段范围模型只能从配置好的度量值和维度列表里选择不能自由发挥第二道是执行前的“自检Agent”把生成的SQL拿回去和原始问题做一次语义对比发现语义偏移就自动重写。目前这个场景下的SQL执行成功率达到85%折行失败的主要是极端复杂的多表join查询。3.5 营销策略智能体端到端的投放建议上面四个场景都是“单点赋能”最终我们希望把这些能力串联起来做一个真正意义上的“营销策略智能体”。这个智能体的工作方式是输入营销目标比如“提升上海地区新用户首单转化率”它会自动拉取历史投放数据、当前活动资源位、用户画像分布、竞品投放情报综合分析后给出一套完整的投放建议包括预算分配方案、目标人群圈选条件、文案方向、素材风格、投放渠道优先级。这个Agent的工作流涉及五步以上的工具调用每一步都可能出错。我们采用了“分步执行人工确认”的机制每一步生成的内容先展示给运营确认确认通过才继续下一步。刚开始运营觉得这个流程反而更繁琐但经过一个月的磨合后大家发现虽然每一步都要确认但总时间从原来的一周缩短到了半天因为系统给出的内容质量已经很高运营的处理重心变成了“调整”而不是“从零开始写”。这个场景也让我对Agent应用有了更深的认知Agent的价值不是“全自动”而是“高水平的半自动”。在AI还不能做到百分之百可靠的今天把人工从“做”变成“审”这件事本身就创造了巨大的效率增益。4. 实操细节从Demo到生产环境的四个关键环节4.1 Prompt工程从“写得好”到“稳定得好”很多团队花大量时间研究“怎么让大模型一次性给出最理想的答案”但真正到了生产环境核心诉求变成了“怎么让大模型的答案稳定可控”。理想答案只是一次性的惊喜稳定输出才是交付的前提。我总结了生产环境Prompt调优的四个原则。第一个原则是“输出格式锁定”。只要不是纯开放式问答场景一律要求模型输出JSON格式并且给出完整的JSON Schema。这样做的好处是后续流程可以自动解析不会因为模型突然加两句话导致整个管道崩溃。第二个原则是“示例大于描述”。告诉模型“不要写营销口吻过重的文案”不如直接给它三篇优秀示例和两篇反面示例模型对示例的模仿能力远强于对抽象规则的理解。第三个原则是“温度参数的场景化”。文案生成场景温度设为0.7到0.9用于保持创意性但人群圈选和SQL生成场景温度必须降到0.1到0.2宁愿保守也不能出错。第四个原则是“兜底输出”。Prompt里明确要求“如果信息不足请输出【信息不足】四个字而不是编造答案”这个兜底机制帮我们在上线初期避免了很多次事故。4.2 效果评估没有评测体系就谈不上调优大模型应用项目最容易犯的错是“凭感觉调优”。调整了几个Prompt就觉得变好了上线后发现效果波动很大。我们在项目启动的第二个月就建立了一套专门针对LLM输出质量的评测集目前积累了1200多条测试用例覆盖文案生成、圈选SQL、数据解读、素材Prompt这四类输出。评测维度分为三层。基础层是“合规性检查”输出的文案是否包含违规词语、是否有虚假承诺、SQL是否能成功执行质量层是“业务贴合度”由一个三人评审小组按照1到5分对生成结果打分主要看是否体现了核心利益点和用户场景效果层才是“业务指标”点击率、转化率、ROI的提升情况。前两层每周跑一次回归第三层跟着A/B实验走。评测数据是这个项目最宝贵的资产每一次Prompt调整都能用数据说话而不是靠感觉。4.3 A/B实验设计如何证明大模型带来了增量“大模型提升了效率”和“大模型提升了业务效果”是两个不同的问题。前者很好证明后者需要严谨的实验设计。我们在验证大模型文案的效果时采用了严格的同质分流方式同一批用户随机分到实验组和对照组实验组看到大模型生成的个性化文案对照组看到人工撰写的笼统文案其他投放条件保持完全一致。以召回文案为例实验结果显示大模型组的点击率比对照组提升了12.4%但这个差异在不同用户群体间并不均匀。新用户和高活跃用户几乎没有差异沉默召回用户和价格敏感型用户的效果提升最明显。这说明大模型的个性化能力不是对所有人群都能产生效果未来的提升方向应该是“动态判断哪些人群适合个性化文案哪些人群用通用文案就够了”。学会识别哪些场景不需要大模型同样是一个深度应用大模型的标志。4.4 成本控制让Token花在刀刃上大模型的成本控制是一个被严重低估的问题。营销场景的特点是调用量大、单次价值低如果不控制成本整个项目算下来可能ROI是负的。我们的成本优化手段主要靠四个方向。第一是模型分级。简单任务走7B小模型复杂任务走14B大模型粗粒度场景用规则引擎优先过滤从源头减少大模型调用次数。第二是Prompt压缩。把冗长的系统提示词精简掉废话把历史对话中的非关键轮次裁剪掉平均每请求Token消耗降低了差不多30%。第三是缓存机制。营销活动期间相同用户群和相同活动下的文案生成请求有很多重合我们做了语义级别的缓存相似请求直接命中缓存结果高峰期缓存命中率接近25%。第四是批量推理。把低优先级的任务攒到夜间用vLLM批量跑用时间换成本整体推理成本下降了大约四成。5. 踩坑实录我们在生产环境遇到的那些问题5.1 幻觉问题营销文案里的“虚假承诺”怎么防大模型在生产环境最危险的问题就是幻觉在营销场景更是致命。我们第一次出事故是在活动预热期模型生成了一批文案把“新用户首单立减10元”写成了“新用户首单免费”还加了一句“暴雨天气损失全赔”。这种虚假承诺一旦投放出去不仅会产生财务损失还会引发用户投诉和舆情风险。我们后续建立了三层防御机制。第一层是技术防御RAG知识库中把活动的利益点用专门的结构化格式注入Prompt比如“立减_金额10元_适用范围新用户_使用条件首单”模型只能复述这个结构化事实不能自由发挥。第二层是在输出端加了“合规校验Agent”对生成文案做一轮额外的规则检查校验关键词是否属实、优惠金额是否与配置一致。第三层是人工抽检每批次文案抽样审核头部流量素材百分百过审。三层机制闭环后虚假承诺问题基本被杜绝。5.2 输出不稳定同一个Prompt今天明天两种风格大模型生成的随机性给生产环境带来了一个隐性成本不稳定性。同一个Prompt连续调用十次可能得到十种不同的结果其中有一两次质量特别高七八次质量一般还有一两次跑偏。在上线初期编辑团队对需要人工重写的比例极其不满。我们做了几方面的处理。首先是“采样次数优化”生成时适度提高采样次数再从候选中挑选一个得分最高输出而不是只跑一次就返回结果。其次在Prompt中通过示例固定语气和节奏让输出的“风格方差”缩小。最后在模型层面做了LoRA微调用历史审核通过的高质量文案做微调数据把模型输出的基准水平抬高。几步叠加后文案的“及格率”显著提升人工重写比例从45%降到了18%。坦白说这个问题没法彻底根治目前只是把它压到了可接受的程度。5.3 数据安全与合规手机号、订单信息怎么隔离数据安全是踩过坑之后才真正重视起来的。最初联调时我们把数仓中的测试数据直接喂给模型结果发现测试数据表里有真实的用户手机号和完整订单链路信息这要是随模型输出被带到外部问题就大了。我们立即采购了数据脱敏方案所有进入模型的数据一律经过脱敏处理手机号、身份证号替换为掩码订单金额做了分箱处理。在工程架构上我们将模型服务与业务数据存储做了彻底的网络隔离模型服务只能访问一个专用的脱敏数据层这一层只保留模型推理所需的最少字段不做全量存储。同时记录了所有模型推理的日志包括入参出参供安全审计调用。这件事也给整个管理团队上了一课AI项目的技术风险只要落地到生产就会被无限放大安全红线必须前置到第一行代码。5.4 灰度发布的节奏为什么先拿“司机招募”练兵大模型应用不能一上来就挑战最核心、最敏感的C端增长场景。我们的发布节奏是“从低风险场景到高风险场景”第一个落地的是司机招募文案生成这个场景的用户量级相对小即使出问题影响面也可控。跑通链路后再逐步扩展到沉默用户召回、活动页文案、人群圈选最后才碰新客首单这种高敏感的转化场景。每个场景的灰度时间也不一样。低频场景灰度两周就放量核心的C端转化场景灰度了近两个月期间不断通过回流数据调整Prompt和规则。灰度期间我们还遇到了投放系统和大模型平台衔接的问题比如素材审核流程要求“机器生成”和“人工编写”的物料走不通的审核通道我们就和风控团队一起改了审核策略。系统的灰度考验的不仅是模型能力更是组织内部的流程适配能力这恰恰是很多技术团队容易忽略的。6. 落地一年后的复盘与个人体会6.1 什么场景真正带来了增量回顾这一年我认为有三个场景贡献了最明显的增量。第一是素材生产效率的提升设计团队产能翻了近三倍这个是可以用工时量化出来的硬收益。第二是自然语言圈选它让运营的精细化投放想法快速落地圈选维度从过去的几十个标签组合扩展到上千种自由组合覆盖用户规模提升了近四成。第三是数据问答帮助投放团队把“数据解读”的周期从小时级缩短到分钟级决策链路明显变快了。增量并不平均分布在所有场景个性化文案虽然效果好但它的增量是有条件的依赖数据基础和算法匹配能力。对于数据积累不那么丰富的冷启动城市个性化文案的提升幅度就很有限还是通用文案加头部素材更稳妥。看场景要冷静不能被尝鲜期的一些跑赢数字误导。6.2 什么场景应该“及时止损”同时也要坦白说有两个方向我们做了但没有继续投入。一个是完全端到端的自动投放让大模型直接决策预算分配并自动执行我们测试后认为风险远大于收益。投放涉及真金白银的经营目标在AI的可解释性和鲁棒性没有根本性突破之前保留人工审批环节是必要的。另一个是全量文案自动生成也就是完全没有人工审核的文案生产我们试过在小流量上放开但审核关闭后出现了一次低风险合规问题从此决定任何C端可见内容必须保留人工抽检环节这不是保守而是负责任。6.3 对后来者的几点建议如果你们团队刚准备启动类似的项目我给三点建议。第一先建评测体系再上模型没有量化评测就没有迭代方向不要指望“感觉”驱动一个生产系统。第二从单点场景切入而不是一上来就搞大而全的Agent平台。我们一开始也想把五个场景一次性铺开后来发现组织能力和模型能力都跟不上拆成单点逐个打透之后整体反而是最快的。第三一定要让业务运营深度参与不是把大模型定位成“替代运营的工具”而是“增强运营能力的工作伴侣”。我们最有效的Prompt迭代都是运营同学反复用出来的。这一年下来我个人最大的体会是大模型落地营销广告本质不是技术问题而是工程问题。模型的通用能力已经足够强真正决定项目成败的是把模型接入业务系统时那些听起来很琐碎的细节——数据脱敏怎么做、评测集怎么建、Prompt怎么让业务认可、灰度节奏怎么排。把这些细节一条条做到位大模型的价值自然就会从PPT上落到真实的业务增长里。最后再分享一个小技巧每次业务活动结束后一定要把活动的Prompt、生成文案、投放数据、人工修改记录打包存档这些都构建成后续微调的高质量数据集。我们下一阶段的LoRA微调方案素材正是来自这一年的存档内容。

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价 →
↑