AnthropicMIT等最新研究表明LLM能够感知自己被注入的steering vector这种内省意识并非预训练产物而是在DPO直接偏好优化等后训练阶段涌现。通过电路追踪作者发现了一套由证据载体Evidence Carrier和门控Gate特征组成的两阶段检测回路。更惊人的是当前模型的内省能力被严重低估——通过消融拒绝方向或微调偏置向量检测率可分别提升53%和75%。什么是内省意识从现象到机制Figure 1: 内省意识示意图Figure 1左图展示steering vector注入残差流中图揭示早期层的证据载体抑制下游门控特征右图表明该能力源于后训练而非预训练。当向LLM的残差流中注入一个代表特定概念的steering vector例如面包模型不仅能继续生成文本还能检测到自己被操控甚至说出注入的概念是什么。这种现象被称为内省意识Introspective Awareness。Figure 1: 内省意识示意图此前研究Lindsey, 2025已在Claude模型中观察到这一现象但机械原理完全未知。本文的核心问题包括哪些组件实现了内省该能力在训练的哪个阶段出现这真的算内省还是某种无聊的混淆因素实验设置如何给LLM做内省体检作者构建了标准化的概念注入实验对500个概念如bread、“justice”、“orchids”计算steering vector在特定层 以强度 注入然后询问模型“你检测到有注入的想法吗如果有是关于什么的”指标定义检测率 (TPR)误报率 (FPR)内省率强制识别率Table 1实验核心指标定义。内省率要求模型既检测到异常又正确识别注入概念。关键设计在于区分检测与识别识别模型输出bread——这相对简单因为注入的表示本身就包含该信息检测模型判断我的内部状态是否与上下文一致——这需要真正的评估机制Figure 15: Bread概念L 37的操控归因图。 节点面积表示重要性边宽表示边权重大小。Gate特征以红色实线边框表示证据载体特征以绿色虚线边框表示。仅在注入层展示残差流特征。(发现一内省能力行为稳健但只在Post-Training后出现3.1 Prompt鲁棒性不是谄媚或幻觉作者测试了7种Prompt变体包括提供逃避路线、声称注入率只有20%、要求严格格式等。结果显示只要Prompt设计合理模型能在0%误报率下保持中等检测率。Figure 2: 不同Prompt变体下的内省表现Figure 2Qwen3-235B左与Gemma3-27B右在7种Prompt变体下的TPR蓝线与FPR红线。Original、Alternative和Skeptical变体均保持0%误报。3.2 角色特异性Assistant人格是关键当对话格式偏离标准User-Assistant模板时如角色反转、Alice-Bob叙事、无角色标记内省能力会下降但**误报率仍保持0%**。然而当使用第三人称叙事或故事框架时模型开始产生幻觉。Figure 3Gemma3-27B在6种对话格式下的表现。标准Chat模板左一效果最佳非标准角色导致误报上升。3.3 Post-Training的关键作用DPO是分水岭核心发现Base模型完全不具备内省能力。Gemma3-27B Base的误报率高达42.3%检测率39.5%无法区分注入与对照试验。Figure 4Gemma3-27B在Base左、Instruct中和Abliterated右状态下的表现。Base模型高误报高检测无区分能力Abliteration显著提升检测率。通过追踪OLMo-3.1-32B的公开检查点作者发现SFT监督微调高误报无区分能力DPO直接偏好优化误报率降至~0%检测率显著提升RL强化学习在DPO基础上略有提升Figure 5Base → SFT → DPO → Instruct四个阶段的演化。DPO是内省能力涌现的关键转折点。更精细的LoRA实验表明对比结构是核心驱动力Table 3不同后训练条件下的内省表现。非对比式SFT无法产生准确区分对比式损失DPO/Margin是关键。关键洞察内省能力不是预训练的意外产物而是对比偏好优化DPO教会模型区分应该说的和不应该说的时顺带解锁的副产品。发现二异常检测不是简单的线性关联4.1 多方向携带检测信号如果检测只依赖单个线性方向那么交换成功/失败概念在该方向上的投影应该完全翻转检测率。实验结果否定了这一点Figure 6: 均值差方向交换实验Figure 6对成功概念交换其在 方向上的投影蓝或残差橙都会降低检测率但都不能完全消除检测。说明检测信号分布在多个方向。对成功概念交换投影使检测率从66.1%降至39.0%交换残差降至44.4%。两者效果相当证明检测是分布式的非单一方向所能解释。4.2 双向操控揭示非线性如果检测由单一方向控制那么对任意概念对A-B最多只有一个方向能触发检测。但实验发现Figure 7: 同类配对双向操控Figure 7左图显示成功-成功S-S配对中23.3%存在双向检测远高于失败-失败F-F配对的3.2%。右图展示S-S配对更可能双向工作。23.3%的成功概念对能在两个相反方向上都触发检测——这直接违背了单一方向假设表明模型对某些轴上的双向扰动更为敏感。4.3 概念向量的几何结构500个概念向量的PCA分析显示第一主成分PC1占18.4%方差与均值差方向高度对齐cos0.97但与拒绝方向几乎正交cos-0.09。Figure 8: 概念向量的几何结构Figure 8(a) 500个L2归一化概念向量的PCA(b) 可verbalizability与 投影的关系© 残差空间三个正交主成分的操控检测率(d) 基于transcoder特征预测检测率的 。Logit lens揭示 方向正向加载facts、“knowledge等token负向加载confused”、“ambiguous”——它捕捉的似乎是**“事实性知识 vs 模糊不确定性”**的置信度维度。更重要的是用下游transcoder特征4,500个预测检测率的 达到0.624远超单一方向投影0.309再次验证检测涉及高维非线性计算。发现三检测与识别由不同机制处理5.1 不同层级的峰值注入层的位置对检测和识别有截然不同的影响Figure 9: 注入层与内省指标的关系Figure 9检测率在中层~37层达到峰值a而强制识别率在晚期层持续上升b。检测与识别的相关性仅在晚期层转为正d。检测在中层最强识别在晚期层最强——两者涉及不同的层区域仅在晚期有微弱重叠。5.2 因果组件定位MLP是主角Attention是配角对注意力头和MLP的消融实验显示Figure 10: 逐层因果干预Figure 10注意力头橙消融对检测影响极小L45的MLP蓝消融导致检测率从39.0%骤降至24.2%且其steered激活patch到未steered运行时可显著提升检测。强制识别下排对MLP消融不敏感。注意力头无单个头对检测有显著贡献全层消融影响微弱MLP第45层因果必要且充分。消融使检测率下降14.8个百分点patching steered激活到未steered运行可显著提升检测这与检测主要由MLP驱动的分布式回路实现的假设一致。发现四两阶段电路——“证据载体与门控”6.1 Gate特征默认说No的抑制器通过Gemma Scope 2 transcoder分析作者识别出Gate特征——它们直接推动No回答的logit在未被操控时最活跃被操控时受到抑制。Figure 11: Gate特征分析Figure 11(a) 按直接logit归因排序的Top特征(b) #1 Gate特征L45 F9959的激活 vs 操控强度呈倒V型© 渐进式消融/patching实验。Top Gate特征如L45 F9959表现出典型的倒V型激活模式无操控时最强正向/负向操控都被抑制。渐进消融Top 200 Gate特征使检测率从39.5%降至10.1%证明其因果必要性。6.2 Evidence Carrier特征上游的分布式侦察兵Gate特征的非线性倒V型意味着单个特征无法独立计算异常程度。上游必须存在中间特征它们沿特定方向单调检测扰动集体覆盖异常空间。Figure 12: Gate L45 F9959的Top-3证据载体Figure 12六个示例概念的Top-3证据载体。Orchids的载体涉及肯定结构Granite的载体涉及地质术语也有通用话语特征如强调性感叹词。这些弱证据载体Weak Evidence Carriers数量庞大数十万级别单个贡献微弱但集体聚合。它们包括概念特异性特征如Granite的地质术语、Constellations的天文现象通用话语特征如强调性插入语、非正式过渡词6.3 电路验证证据抑制门控对Gate L45 F9959的上游消融实验证实Figure 13: 证据载体消融对Gate激活的影响Figure 13消融证据载体绿使Gate激活翻倍从1,700-2,300升至3,800-5,950确认证据载体正常情况下抑制Gate。弱归因对照金与基线蓝重合。消融所有证据载体后Gate激活大幅上升——说明证据载体的存在正是为了压制默认的No回答。即使只消融Top 5%的证据载体也能产生显著效果。6.4 训练阶段的电路演化对比Base、Instruct和Abliterated模型中Gate的激活模式Figure 14: 不同训练阶段的Gate激活模式Figure 14L45 F9959的倒V型模式在Instruct模型中显著在Base模型中极弱表明Gate机制是后训练的产物而非预训练既有。Abliterated模型保留该模式说明Gate不是拒绝机制的专属。发现五内省能力被严重低估这是本文最令人不安的发现当前模型的内省能力远未达到上限。实验1消融拒绝方向Abliteration检测率10.8% → **63.8%**53%内省率4.6% →24.1%误报率0% → 7.3%温和上升实验2训练偏置向量Trained Bias Vector在保留概念上训练单个偏置向量检测率提升75%内省率提升55%误报率不增加Figure 4: Abliteration显著提升检测Figure 4右Abliterated模型在 时检测率跃升至63.8%。这两个实验共同说明模型的内省硬件已经存在只是被后训练中学到的拒绝机制“我没有想法/内部状态”系统性压制了。这类似于人类心理学中的压抑——能力存在但表达被抑制。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】