资讯动态

大模型在营销广告中的落地实践:从文案生成到多模态合规审核

发布时间:2026/10/2 10:39:29 来源:尧图企业网站定制
这两年铺天盖地的“大模型”真正落到业务里尤其是营销广告这种既要内容创意、又要规模化生产、还得卡合规红线的场景坑比想象中多得多。我们在货拉拉营销广告方向做了一轮大模型应用实践从最开始“用大模型写几句文案”的小试牛刀到后来搭出一套覆盖素材生成、文案改写、多模态自检、审核辅助的营销广告内容生产链路中间踩了不少雷也沉淀了一些可能对同行有参考价值的方法。这篇文章不聊概念全部是实践过程中的真实取舍和细节希望能给正在做“大模型营销”的团队一点启发。1. 营销广告业务中我们到底想用大模型解决什么问题1.1 货拉拉营销广告的典型场景与原有痛点货拉拉的营销对象跟传统电商不太一样它至少有三类完全不同的群体C端用户需要拉新、促活、召回B端商户要推套餐、提频次司机端要招募、留存、做增值服务运营。这三类人对广告内容的诉求差异非常大。C端用户关心价格和便利性B端商户关心成本和稳定性司机端关心收入和接单保障把三拨人的需求混在一起写同一套素材效果可想而知。过去运营团队做一套营销素材的流程基本是活动运营定主题文案专员写稿设计师出图风控法务审核最后投放到App Push、短信、公众号、小程序弹窗、线下物料等渠道。一个活动周期下来少说也要七到十天产出几十套素材就算快的。遇到大促或者临时活动整个流程直接进入“兵荒马乱”状态文案专员一天要赶十几版稿子设计师加班改图审核同学还得在深夜守着群等素材。比“慢”更头疼的是素材的复用性很差。同一场活动App Push文案和短信文案的长度要求不一样公众号软文和弹窗banner的语感也不一样但运营往往只能拿同一套核心文案四处硬改改完还不一定适配渠道。结果就是同一个活动在不同渠道上投放用户看到的表达方式差异很大有的渠道转化表现好有的渠道点击率惨淡而且很难归因到底是哪个环节出了问题。1.2 立项时的三个核心判断我们最开始也走过弯路一上来就让大模型“自由发挥”写文案结果模型写得还挺流畅但真正能用进投放流程的比例很低。后来总结了三个核心判断才把项目的方向彻底拉正。第一不是“用大模型替代人”而是用大模型把素材生产从手工模式变成工业化流水线。人的精力应该放在策略判断、内容把关和创意方向上而不是耗在“今天写五十条推送文案”这种低水平重复劳动上。第二光有生成能力不够还要有理解能力。这里的理解包括对用户意图的理解、对历史投放效果的理解、对素材合规风险的理解。只有把理解和生成结合起来大模型才不是一个只会堆漂亮话的文字机器。第三所有能力必须能嵌入现有投放系统而不是做成一个孤立的“AI写文案工具”。如果算法团队交付了一个好用的demo但运营每次使用还要单独登录一个网页、复制粘贴文案、再手动搬回投放后台那这个项目基本就失败了。我们最终的目标是让大模型能力像水电一样接入业务系统让运营在工作台里直接完成“生成—筛选—修改—提交审核”的完整闭环。基于这三个判断我们确定了项目边界大模型不是来做一个炫技demo的而是要长在广告业务的数据和流程里。2. 整体技术方案设计如何把大模型嵌进广告流水线2.1 方案选型背后的核心原则立项之后我们做的第一件事不是选模型而是先把业务工作流完整梳理了一遍把营销广告链路里所有需要产出、修改、审核、分析的内容类型全部列出来。列完之后再对照大模型的能力维度也就是生成、改写、分类、抽取、总结、多模态理解逐一匹配场景。最后发现真正高频的场景集中在四类素材文案生成、既有文案的改写与润色、多模态素材自检、投放结果的结构化解读。其余场景比如“目标人群画像自动生成”我们认真评估后决定暂时用规则加统计方式处理不上大模型。这里有一个很重要的原则优先做“非用大模型不可”的场景能用传统方法替代的就不增加复杂度。道理很简单大模型引入的不只是能力还有延迟、成本、幻觉风险和运维复杂度。大模型在营销广告里最大的价值是把过去依赖人力、需要创造性的部分自动化结构化统计和简单规则能做到的事用规则做更稳、成本更低。我们见过一些团队恨不得把所有业务都往大模型上套最后反而把原本稳定可靠的系统搞复杂了。2.2 分层架构与核心组件整个系统搭建时我们分了四层。数据层是整个体系的底座接了广告历史素材库、用户分群画像做了严格脱敏、各渠道投放效果回流数据。这里需要特别强调数据的重要性没有历史表现数据的生成模型就是“盲写”生成出来的文案再华丽也不知道在真实用户面前好不好用。模型层有分工基座模型负责通用语义理解与生成针对广告文案这个垂直场景我们在基座模型上用历史优质素材做了轻量微调另外还有一个多模态模型负责图片素材的基础理解和合规初筛。三个模型统一走同一个推理网关业务方不需要关心底层调的是哪个模型。服务层是核心提供统一接口封装了prompt模板管理、检索增强、输出校验、敏感词过滤、限流降级这些功能。应用层则是运营工作台和API供不同业务方直接调用。为什么会选择检索增强而不是把所有知识都塞进模型因为活动规则和品牌语料变化太快了。今天上线的优惠价格信息可能明天就失效如果靠微调去跟进模型还没训练完活动都结束了。所以我们的做法是“动态知识走检索稳定风格走微调”。具体来说卖点类信息放在向量库里需要的时候检索出来拼进prompt品牌语气、常见句式这些相对稳定的表达沉淀在模型参数里两者互相配合既保证知识新鲜又保证风格稳定。2.3 模型选型、部署与性能权衡模型选型上我们横向比较过几款开源中英双语模型初期也跑过商用API但考虑到两个现实问题最终确定了以可私有化部署的开源模型为底座。第一个问题是素材数据不能出域营销素材里多少会涉及业务策略和用户信息放在外部API上总有合规隐患。第二个问题是成本商用API的调用费用会随着业务量线性增长等素材生成量上来之后这笔账非常惊人。对比维度开源私有化模型商用API数据安全数据不出域依赖外部合规承诺成本形态前期硬件投入边际成本递减按token计费随量增长定制能力可微调、可干预一般仅可配置prompt更新迭代依赖团队自身服务商持续更新部署运维需要自建推理服务免运维选型时关注的指标不只是跑分还包括中文指令跟随能力、长文本稳定性、量化和推理速度、社区活跃度。跑分高的模型在实际业务里未必好用尤其广告文案这种短文本生成场景模型的“听话程度”远比常识丰富程度重要。推理框架上我们选了vLLM整体用下来比较顺手它支持Continuous Batching吞吐能力比原生接口高出不少。模型量化走了INT8个别对延迟比较敏感的场景用INT4加AWQ。这里有个经验量化对广告文案这类短文本生成的影响比较小但如果生成的是长句偶尔会出现重复词可以在解码参数上适当调大重复惩罚值来缓解。3. 核心环节落地实录文案生成、个性化触达与多模态合规3.1 素材文案生成从“模板填空”到“结构化生成”第一版我们想做的是一个通用文案生成器输入“活动主题优惠力度投放人群”模型自动输出全套文案。当时觉得这也太简单了结果上线之后很快发现问题文案生成得确实“对”但也很“平”没有钩子读起来像说明书用户根本不想点。后来把生成流程彻底拆开按三个步骤来做。第一步是信息抽取。从活动需求文档里把卖点、规则、时间、地域这些结构化信息抽出来。这一步是基础如果信息抽错了后面生成得再漂亮也没用。我们先用大模型做粗抽再用规则做二次校验双保险。第二步是风格匹配。根据投放渠道和用户分群选择对应的写作风格模板。App Push适合短促有力的表达短信要突出利益点公众号软文则可以更从容地讲故事不同渠道的风格差异在这一步被显式地建模出来。第三步是约束生成。在prompt里明确写出必含信息、字数区间、禁用词同时结合检索到的相似优质素材完成生成。整个prompt的结构大致是“角色定义渠道场景用户人群描述必含信息风格要求负面约束参考素材”其中负面约束非常关键。通过把“自由创作”改成“约束创作”生成素材的可用率从最初的20%左右提升到了50%左右。这里还有一个很重要的经验是不要把产品的所有卖点都堆进一条文案里。一条文案只强化一个核心卖点转化效果往往更好。运营同学一开始总想一次把优势说完但用户注意力很短能记住一个点就已经很难得了什么都想要的结果往往是用户什么都记不住。3.2 文案改写与个性化触达Push和短信这两个场景的需求量最大但大部分时候运营并不是要一个全新的创意而是在历史高转化文案的基础上做小幅修改适配不同的人群和渠道。所以我们用大模型做的是“改写”而不是“创作”给定一个基准文案模型按不同渠道、不同用户分层生成变体再由运营同学筛选确认。这里有个细节特别值得说。用户分群标签不能直接贴进prompt比如“价格敏感型用户”这种内部标签模型并不能准确理解它背后的含义。如果直接把这个标签扔给模型它生成的文案会非常泛化。我们的解决方案是维护了一份“标签-表达词典”把内部标签翻译成模型能理解的自然语言描述。比如“价格敏感型”对应的是“强调对比优惠幅度、突出省钱金额、带紧迫感”“新用户”对应的是“降低理解门槛、突出首次福利、减少品牌包袱”。这样处理后模型输出的文案明显更贴合人群特征。生成之后也不是直接进入投放流程而是给运营提供候选列表运营可以勾选一条满意的也可以直接在线修改修改结果会被记录下来作为后续优化的重要反馈信号。这个交互设计我们后来反思是整个项目能持续跑起来的关键。如果只是模型生成什么就用什么运营会觉得被工具牵着走抵触情绪会很大。给了兜底修改入口之后运营反而越来越习惯用模型做初稿。3.3 多模态素材自检与合规审核营销素材不只是文字大头在图片和视频封面。我们接入多模态大模型后先做了一个“素材自检”流程把设计稿丢进去模型输出对排版、文字清晰度、主体位置、是否含有敏感要素这几个维度的判断。这个能力在活动物料批量产出的时候非常有用设计师出一批图模型先粗筛一轮明显有问题的直接退回返工人工检查的工作量降了不少。合规审核是整个营销广告链路里风险最高也最容易被技术团队低估的环节。广告素材一旦违规轻则被渠道下线重则带来品牌风险这里含糊不得。我们最终采用的是“规则引擎模型判断”双通道方案。规则引擎处理确定性的禁词和格式问题比如价格文案是否完整、有没有漏掉前提条件、字数是否超限。模型负责语义级的判断比如“绝对化用语”“夸大效果”“诱导点击”这类模糊问题。模型判断结果不会直接拦截素材而是标记风险等级和风险理由送给人工审核员做二道把关。这样做的好处是既不会因为规则太死而误伤大量正常素材也不会因为完全依赖模型而让高风险内容溜走。4. 评估体系与上线效果用数据反哺模型4.1 离线评估不能只盯文本相似度很多团队评估生成模型离线指标选ROUGE和BLEU算完之后发现和实际业务感受完全对不上。ROUGE/BLEU衡量的是生成文本和参考文本的重叠程度但广告文案的正确性、吸引力、合规性根本不是n-gram重叠度能衡量的。我们建立的离线评估体系核心是一套“生成素材可用性评估集”。评估集由运营和审核同学人工标注了几百条历史素材分为“优质、普通、劣质”三档还配了人工修改意见作为参考。模型跑完生成结果后按信息完整度、风格匹配度、合规风险三个维度自动评估同时保留固定比例的人工抽检。文本相似度指标并没有被完全抛弃它变成了回归测试工具。每次改prompt或者更新模型之后跑一遍固定回归集看生成结果有没有出现严重劣化这是它最合适的用途。真正衡量生成质量还是靠人工评估和线上效果。4.2 线上评估与业务指标观测线上我们主要跟踪几个指标素材制作人效、生成素材采纳率、投放点击率CTR、转化率CVR、审核驳回率。项目跑了一段时间后人效提升大概三到五倍素材产量也有明显增长运营把更多精力放在了策略和审核上而不是从零开始憋文案。这里要特别提醒同行生成文案的CTR不一定比资深运营手写的文案高很多。大模型的核心价值在于把人从低水平重复劳动里解放出来让人把时间投入到策略和判断上。所以评估这个项目时不能只盯CTR还要看人效、素材量、运营满意度和投放稳定度。如果只拿单条文案的CTR去要求模型超过最优秀的运营那标准本身就出了问题。4.3 数据回流与迭代闭环系统上线不是终点而是迭代的起点。我们的素材生成接口在投放后会把“哪些素材被采用、哪些被驳回、哪些点击率高”回流到样本池每个月做一次bad case分析把典型的失败案例集中起来处理。一部分用于更新prompt模板一部分经过清洗后作为微调数据。这个闭环跑起来之后模型的可用率是肉眼可见地在往上走的。举一个实际例子。最初生成的横幅文案很喜欢用“限时抢购”这种泛化词但投放数据表明用户对具体金额描述的反应明显更好。比如“下单立减15元”就比“限时优惠大促”更有吸引力。我们把这一观察写进prompt约束同时在微调数据里补充了大量“价格数字前置”的样本。迭代两轮之后生成素材的点击率确实出现了可观测的提升。5. 踩坑记录与我的实操体会5.1 幻觉问题让模型学会“不编”广告物料里出现幻觉是致命的比如把满减门槛从“满100减20”写成“满100减50”把业务范围从“同城货运”写错成其他领域这种错误一旦发布出去就是事故。我们做了三层防御。第一所有事实型信息金额、时间、规则这些在prompt里逐个给出并要求模型只能引用不能编造。这一步把幻觉的生存空间压到最小。第二生成结果之后再做一轮规则校验金额、时间、业务范围与输入不一致就直接拦截。第三对拿不准的场景走知识库检索查不到就直接拒绝生成不允许模型自由发挥。模型说“我不会”比说错的成本低得多。实际运行中这套防御确实拦截过几次金额错误的生成结果省下了不小的风险成本。5.2 微调实战数据质量比数量重要微调是我们项目里踩坑最多的环节。第一次微调时我们拿了大量“看起来像样”的素材直接灌进模型结果模型不仅学会了高频句式也学会了素材里隐藏的表述错误和过度夸张的话术。这个教训让我们重新整理了整套流程。后续所有微调数据都过了三遍筛选。第一遍筛信息错误凡是事实有出入的直接删除第二遍筛营销禁用词把所有踩红线的素材清理掉第三遍筛语气看是否符合品牌调性。三轮筛完真正留下的数据可能只有原本的十分之一但效果比粗糙的三万条好得多。训练方式上我们用的是LoRA/QLoRA这类参数高效微调方法好处是训练快、部署方便而且每次调完基座模型本身没有变可以随时回滚对比效果。经验参数上rank一般取8到16学习率在1e-4到2e-4之间epoch跑一到两轮就够了跑多了反而容易过拟合生成结果的多样性会明显下降。5.3 推理成本和延迟的工程优化广告场景对延迟的要求其实比聊天助手松用户可以接受几百毫秒甚至一两秒的等待但量级上去了之后成本非常敏感。我们主要做了三件事。一是用vLLM的Continuous Batching把不同渠道的请求攒批处理显著提高了GPU利用率。二是对prompt里的固定前缀做预计算缓存避免每次请求都重复计算相同部分这在模板化程度极高的广告场景收益非常大。三是对不同渠道设置不同规格的模型路由短信这种短文本场景用轻量模型跑品牌物料这类高质量要求场景才动用大参数模型。成本压力下不求所有请求都走最强模型把资源花在最需要质量的地方。5.4 组织协作与流程改造最后说一个容易被技术团队忽略的关键点。大模型项目上线改变的不仅是代码更是运营同学的工作习惯。系统上线前两周我们花了很多时间和运营团队磨合新的协作流程。运营不用再从空白文档开始写文案了而是从模型给的几个候选版本里做选择、修改和确认。磨合过程不是一帆风顺的有运营同学一开始不太信任模型输出宁可自己重写。后来团队做了一次“盲测”让资深运营和模型分别写同一批文案再把署名抹掉请运营团队自己打分模型版本的表现并不差。这件事之后大家对模型的接受度明显提升。更重要的是我们始终给运营留足兜底修改的入口让他们感觉是在使用工具而不是被工具替代。这个认知比任何技术优化都更影响项目成败。我个人在实际操作中的体会是大模型在营销广告里的价值不是“生成一篇文案”这一件事而是把整个素材生产链路变成一个可以度量、可以迭代的系统。如果你们团队也要做类似的项目我建议不要一上来就追多模态、追大参数而是先把单一场景的“生成—审核—投放—反馈”闭环跑通再去扩展能力。哪怕先只覆盖App Push文案这一个场景只要闭环数据沉淀下来了后面加素材类型、加投放渠道都是顺水推舟的事。先把最核心的链路走通让业务同学真实感受到效率的提升再逐步扩大范围也不迟。

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价 →
↑