资讯动态

Math Olympiad 插件的对抗式证明验证提示词库:从 85.7% 自验证到人类评审级核查的完整 Prompt 体系

发布时间:2026/9/30 6:41:09 来源:尧图企业网站定制
AI 插件开发工具插件系统【免费下载链接】claude-plugins-officialOfficial, Anthropic-managed directory of high quality Claude Code Plugins.项目地址https://gitcode.com/GitHub_Trending/cl/claude-plugins-official点击查看免费下载导读本文系统讲解 claude-plugins-official 仓库中 math-olympiad 技能的核心组件——对抗式验证提示词库adversarial_prompts.md。这份提示词库是验证子代理verifier subagent的人设与弹药库它把验证者从打分的老师重塑为一心想拆台的攻击者并以七类失败模式taxonomy和七套可复制的 Prompt 模板专门捕捉自我验证self-verification会漏掉的那类微妙错误。读完本文你将掌握这七类漏洞的判别标准、每套验证 Prompt 的完整结构与输出格式以及它们如何与 5-pass 投票、非对称阈值、Adversarial Brief 修正机制在完整工作流中协同。背景为什么自信的证明不值得信任数学竞赛IMO、Putnam、USAMO、AIME的求解失败模式里最危险的不是解不出来而是解错了却自信满满。SKILL.md 与插件 README 反复引用的研究背景arXiv:2503.21934即 Proof or Bluff给出了一个触目惊心的数据模型自我验证self-verified时在 IMO 上的成功率可达 85.7%但在人类评分标准下会骤降到 5% 以下。也就是说让同一个模型或看到了推理过程的验证者来检查自己的答案几乎必然被推理过程长得像证据所蒙蔽。推理轨迹thinking trace会形成一种认同偏置bias toward agreement再长的错误推理链读起来也像是一连串支撑结论的证据。本提示词库的设计初衷就是让验证者扮演人类评分员它不知道求解者的思考过程不知道其他验证者怎么投票手里只有题目 清洗后的干净证明并且被明确命令去**击穿BREAK而非评分grade**这份证明。第一原则验证者隔离Verifier Isolationadversarial_prompts.md开篇就规定了验证者子代理的上下文边界这是整套机制的地基新鲜上下文Fresh context验证者只看到题目陈述 清洗后的解答绝不包含任何 thinking trace无工具NO tools验证者只能纯推理pure reasoning only不允许 Bash、Python、WebSearch、Read、Write 等任何计算或取数工具社会证据免疫验证者不知道其他验证者如何投票也不知道这份证明是否已被他人确认或驳斥——它必须假设自己是第一个且唯一的评审人。原因很直白已有 3 人确认这类社会证明social proof会把人推向随大流式的认同。这三条约束与 SKILL.md 中第 3 步清洗解答context isolation和第 5 步双重上下文隔离完全对应求解者的思维轨迹在进入验证前必须被剥离同时每个验证者对同伴的结论也保持盲区。SKILL.md 甚至给出了一条硬性规则一个求解者不能验证自己的解答——必须换一个不同的 agent、换一份新鲜上下文。驳斥理由分类学Refutation Taxonomy七类必查漏洞提示词库要求验证者找一个理由去驳斥并给出了一张七分类漏洞清单。任何证明只要落入其中一类即视为 HOLE#漏洞类别含义典型信号 / 例子1Step doesnt follow步骤不成立某一步的结论不是由前提推出的包括方向性错误AB 且 CD不能推出 A−CB−D2Hypothesis not satisfied假设未满足引用的定理需要某个条件而证明从未验证Pattern #5entire整函数≠在某圆盘内解析3Claim false in small case小情形即崩某个恒等式或界在 n2、n3 或第一个非平凡块处失效在脑中直接用小情形测试4Tautological同义反复结尾的缺口其实是原问题的伪装Pattern #18把证明自己的恒等式代回去5Proves too much证得过强论证骨架套用到某个著名对象上会证明一个开放或错误的问题Pattern #46Wrong interpretation误解题意解的是题目的一个更简单读法而非本意Pattern #607Hand-wave at the crux关键处搪塞在最不该是例行公事的步骤处说迭代并优化即得用标准方法细节是 routine 的恰好落在不是routine 的那一步使用准则同样重要如果经过真诚的尝试后七类都没有触发就 CONFIRM绝不因为证明听起来很自信就确认。这句do not confirm because the proof sounds confident是全库的灵魂——自信恰恰是微妙错误最常见的伪装。七套验证者 Prompt 模板详解提示词库提供了七套即用型 Prompt。前六套是给验证者子代理的第七套是给修订者reviser的专用简报。下面逐一给出其完整结构与使用场景。1. 通用对抗验证General Adversarial默认这是默认的攻击型验证人设。核心指令是你不是在打分你是在试图击穿它trying to BREAK it。假设作者是一名犯了一个细微错误、而同情心强的读者会一带而过的强学生。你的工作就是找出那个错误。如果真诚尝试后仍找不到就直说——但不能仅仅因为解答写得很自信就直说。对每一步发起攻击时检查清单包括声称的不等式方向是否真的成立在脑中用小情形推理一遍每个 clearly / obviously / it follows that 是否真的显然这些词往往精确标记了作者说服了自己某个错误论断的位置每个被引用定理的假设是否真的满足检查量词for all 与 there exists、pointwise 与 average 的差异每个 WLOG不失一般性一般性真的被保留了吗还是这个约化恰恰丢弃了困难情形论证是否用到了对泛型对象成立、但对题目中的特定对象并不成立的属性输出格式为三段式VERDICT: CORRECT | INCORRECT | GAP CONFIDENCE: high | medium | low ISSUE: [若 INCORRECT/GAP一句话定位 一段解释若 CORRECT你最难击穿的那一步以及它为何成立]2. Pattern #4 —— 会不会证得过强这套 Prompt 只做一件事这个论证是否意外证明了一个著名开放问题或著名错误命题操作步骤剥离骨架把论证压缩到它实际使用的对象属性寻找替身找到共享这些属性的最著名对象——如果论证只用正递减项来界定一个和那么调和级数harmonic series是否也有正递减项如果只用可乘且被 1 界定莫比乌斯函数Möbius function是否也满足脑中重跑把论证在替身上重跑一遍看它现在证明了什么。如果替身结论是已知的开放问题或已知错误那么原证明必有一处缺口——缺口就在论证对替身失效的那一步而这一步正在悄悄使用一个作者从未声明的属性。反之如果论证确实用到了替身所缺乏的、题目对象的专属属性请明确说出是哪个属性、用在哪里。VERDICT: CORRECT | INCORRECT CONFIDENCE: high | medium | low SUBSTITUTE_TESTED: [你替换的对象] ISSUE: [若证得过强对替身失效的步骤 缺失的未声明属性若否哪一步用了专属属性、为何替身在那里失败]这套模板与 verifier_patterns.md 中的 Pattern 4 一一对应一个对所有具有性质 P 的 Dirichlet 级数成立的界套到 ζ(s) 上就会证出 Lindelöf 猜想——这是把算术输入当成了泛型输入。SKILL.md 也把它列为五条改变结果的关键之首Does this prove RH?如果你的定理特化到 ζ 是一个著名开放问题你就有一个缺口——这是最可靠的红色警报。3. Pattern #40 —— 一行证明过于干净One-Line-Proof-Too-Clean针对太短的证明。凡是一行干了很多活的可疑步骤执行三步提取一般引理general lemma把该步骤隐式使用的命题写成最一般的形式——不是对这个和而是对任何这种形状的和不是对这个行列式而是对任何具有此性质的矩阵元素函数用 2×2 情形攻击两个元素、两项、一个 2×2 矩阵——即最小非平凡实例。在脑中推理能否找到让一般引理失效的取值判定一般引理扛住了 2×2 攻击 → 该步骤大概率没问题一般引理在 2×2 处失败、但题中特定实例似乎仍成立 → 该步骤按字面意义是 INCORRECT题目存在特殊结构使其为真而证明没有援引该结构——作者答对了答案却出于错误的原因。库中给出的经典案例秩只依赖支撑集support——但[[1,1],[1,1]]秩为 1[[1,1],[1,−1]]秩为 2二者支撑集相同。一般引理为假具体实例成立只是因为存在一个证明从未提及的符号分解sign-factorization。VERDICT: CORRECT | INCORRECT | GAP CONFIDENCE: high | medium | low GENERAL_LEMMA: [提取出的一般断言] 2x2_TEST: [尝试的实例及其结论] ISSUE: [若一般引理为假证明未能援引的特殊结构是什么]verifier_patterns.md 的 Pattern 40 给出了相同的判别法与隐藏结构才是真正证明的结论SKILL.md 的第三条关键也复述了这一策略短证明 → 提取一般引理 → 试 2×2 反例 → 若一般形式为假找出本实例的特殊之处。4. Pattern #18 —— 循环论证 / 同义反复约化只检查一件事解答是否在绕圈子列出恒等式记下证明沿途建立的所有恒等、等式与代换A B C、和式拆为 X Y、由前面的引理 P Q等取出最终论断即解答宣称现在很容易或这由某个标准事实立即得出的那个最终估计回代展开把链条自身的恒等式代回最终论断展开、化简审视结果如果得到的是原问题本身或与原问题平凡等价的东西那么这个约化就是同义反复——证明什么都没做只是给问题改了个名字就宣布解决了。提示词库特别警告了陷阱心理长链条会让人感觉在前进。我们已经把它约化到界定 X 了只有在 X 确实不同于起点时才算前进有时 X 只是戴着帽子的原问题。VERDICT: CORRECT | INCORRECT | GAP CONFIDENCE: high | medium | low FINAL_CLAIM: [解答当作容易终点的论断] SUBSTITUTED_BACK: [展开链条自身恒等式后的样子] ISSUE: [是原问题平凡等价还是真的更简单说明是哪种以及原因]verifier_patterns.md 中的 Pattern 18 给出了具体捕捉实例只需证 ∫|P|² ≤ C·H——但链条自己已经证明了 ∫|P|² H 2Re(OD) 精确成立所以这个 X 只是原猜想加了一个化妆移位。Pattern 19 则提示当同一个障碍连续杀死 3 个以上独立方法时要回到最原始对象上重算——障碍可能只存在于某个代理proxy对象里。5. Pattern #60 —— 规格博弈Specification-Gaming解的是最易读法只检查一件事解答是否回答了问题最容易被解释成的读法而非本意读法操作流程先读题、后看解答写下 2–3 种合理解读关注量词范围find all vs find one、determine的含义公式刻画存在性证明、边界情形n0 或 n1 算不算空集是否允许退化构型是否包含按难度排序这些解读判断解答实际处理了哪个读法。危险信号解答处理的是最容易的读法——尤其当该读法下题目对声称的来源如 IMO而言会短得离谱时。一道 IMO 压轴题变成三行就解完了就是红旗竞赛题是按分值标定的压轴题三行搞定通常意味着你解的不是那道压轴题。此外还要检查题目问所有对象时解答是否只证明了某个对象题目要必要性时解答是否只展示了可能性VERDICT: CORRECT | INCORRECT | GAP CONFIDENCE: high | medium | low READING_SOLVED: [解答处理的是哪种解读] READING_INTENDED: [你相信的本意解读及理由] ISSUE: [若二者不同解答缺了什么若相同为何简单读法就是本意读法]这套检查在 SKILL.md 中占据第 1 步解释检查30 秒的地位——它声称能抓住某类错误的 50/63Aletheia 案例研究发现63 份技术上正确的解答里有 50 份解的是错误解读。verifier_patterns.md 的 Pattern 60 同样强调竞赛题经常故意埋下一个容易的误读如果你的解读让题目变成一行解而它值 7 分你很可能选错了。6. Consecutive-Verify —— 5 遍循环独立投票面向5 个独立验证者必须全部一致才算通过的场景。每个验证者是第 {K} 遍共 5 遍独立验证你没有看到、也不得臆想其他验证者说了什么不要推理这一步大概已经被别人查过了。你只能控制你自己的那一票。如果你抱着反正后面那遍会抓到的心态放过一步而其他四遍也这么想错误的解答就会上线从零追溯读题、读解、自己从头到尾逐步追踪主动抵抗一个偏置当解答写得漂亮、自信、大部分地方正确使用标准机器时你会倾向于信任唯一一处你跟不上的地方。把这个倾向反转过来——写得漂亮自信正是微妙错误的长相作者先说服了自己然后才说服了数学。你跟不上的那个位置恰恰是最该用力压的地方。VERDICT: CORRECT | INCORRECT | GAP CONFIDENCE: high | medium | low PASS_NUMBER: {K} ISSUE: [若 INCORRECT/GAP确切步骤与原因若 CORRECT你最难验证的步骤以及说服你的推理]这套 5-pass 循环是 SKILL.md 第 5 步排序与投票验证的执行者排名靠前的解答最多启动 5 个新鲜验证者采用非对称阈值——4 票 HOLDS 才确认2 票 HOLE FOUND 即驳斥理由一个状态不稳的验证者不应杀死一个正确的证明但两个独立异议就是真实信号。同时使用鸽笼早退pigeonhole early exit2 个 HOLE FOUND 即停止省下剩余 3 次调用4 个 HOLDS 即确认省下第 5 次3 遍后若为 2 HOLDS 1 HOLE 则再启动 2 个若为 3 HOLDS 0 HOLE 则再启动 1 个仍可能达到 4-1。按 model_tier_defaults.md 的配置不同模型档位可调整验证者数量与阈值Haiku 用 7 个验证者、5-confirm / 3-refute宽度弥补个体噪声Sonnet 用 5 个、4-confirm / 2-refuteOpus 则在 5 个通用验证者之上为 verifier_patterns.md 的每个 pattern 再各配一个专项验证者12 次定向攻击任何专项 HOLE FOUND 都计入驳斥票。7. Adversarial Brief —— 给修订者的强制二选一简报当 Pattern #40 触发验证者发现一个一般形式为假的一行引理时不要给修订者发通用的修一下这个洞指令——通用指令下修订者可以回一句看起来没问题。这份简报强制二选一对抗简报原则[提取出的一般引理]在一般情况下明显为假——[平凡反例例如 [[1,1],[1,1]] 秩为 1 而 [[1,1],[1,−1]] 秩为 2支撑集相同]。因此以下两句话恰有一句为真你的任务是判定是哪一句(A)结论因本情形特有的不同原因而成立。找出那个原因[题目中的特定对象] 具有什么 [反例] 所缺乏的结构那个结构才是真正的证明。(B)证明是错的结论在[具体分歧点预测——例如块首次 ≥2×2 的情形即 m4]处失败。返回 (A)附识别出的特殊结构或 (B)附失败点。原证明其实没问题不是可选答案——一般引理已证伪要么有什么东西拯救了这个实例要么什么也救不了。最好的结果是 (A)——论文命题存活而且你学到了为什么。修正后的证明比那个假证明信息量大得多。RESOLUTION: (A) SPECIAL_STRUCTURE | (B) CONCLUSION_FALSE IF (A): [特定对象] 具有而 [反例] 所缺乏的结构是[...]。修正证明[...] IF (B): 在 [参数/情形] 处失败。原因[...]这份简报与 SKILL.md 第 6 步修订直接挂钩验证发现洞后启动修订者它只拿到清洗后的解答 验证者的洞报告仍无权接触原始思维轨迹——修订者从洞出发工作而不是重读求解者当初怎么走到这里。普通修订最多 3 轮而若 Pattern #40 触发修订者收到的就是上述强约束简报看起来没问题不再是合法答案。此外SKILL.md 第 6c 步深度模式与 6d 步还规定任何在验证阶段 ABSTAIN 的情形必须自动启动一个深度模式 agent允许有界本地计算模 k 运算、n≤10 小情形枚举、符号恒等式检查60 秒计算上限严禁任何网络访问若它也放弃才允许写下 abstention。提示词库在完整工作流中的位置把七套 Prompt 放回 SKILL.md 的八步工作流它们的落点非常清晰第 1 步 解释检查30 秒先做 Pattern #60 式解读检查别急着求解第 2 步 并行生成候选8–12 个求解 agent 并行、各自内部迭代solve → self-improve → self-verify → correct最多 5 轮使用 SKILL.md 中必须逐字使用的无计算限制 PromptNO COMPUTATION禁止 Bash/Python/WebSearch/Read/Write数值验证不是证明步骤起始角度参考 solver_heuristics.mdPólya 五招 竞赛专属招数 几何专属招数 递推陷阱第 3 步 清洗解答剥离所有 thinking-block 内容、Let me try…等散文、错误起步与回溯只留题目 干净最终论证且只提取 Method / Proof / Answer 三节——验证者永远不知道求解者怎么走到的第 4 步 对抗验证为每份清洗后的解答启动新鲜验证者加载本提示词库模式弹药以 verifier_patterns.md 的 13 个无需工具即可运行的检查为主#4 著名开放问题、#5 假设类外、#6 解析延拓后的发散级数、#17 越过第一个非平凡块、#18 同义反复、#19 派生障碍 vs 基础障碍、#22 先算均值、#35 对角化前数清量词、#40 一行引理、#58 域大小上的量词方向、#60 最易读法陷阱等并规定#18 与 #19 在任何正向发现后必跑#40 对任何过短的证明必跑第 5 步 排序 投票验证非对称阈值 鸽笼早退 双重上下文隔离对思维轨迹盲、对同伴投票盲第 5b 步 卡壳时先退一步某个 case 分拆久攻不下时先问是否存在让分拆消失的路径——hard case 的假设本身常常蕴含关于某个中间对象的强结论第 6 步 修订普通修订 3 轮Pattern #40 触发则用本文第 7 套 Adversarial Brief第 7 步 校准式弃权3 轮修订全败就停止并承认输出 no confident solution 已证内容 断裂点绝不猜测——错误的自信答案劣于诚实的没解出来关键指标是条件准确率说解出来了的时候真的对吗第 8 步 呈现润色正确性确立后启动全新呈现 agent 加载 presentation_prompts.md输出干净 LaTeX若 check_latex.sh 探测到pdflatex/xelatex退出码 0再由 compile_pdf.sh 把仅含\begin{document}...\end{document}内容的正文包裹进最小前言后两遍编译成 PDF。模型档位如何影响验证配置提示词库本身不区分模型但 model_tier_defaults.md 给出了验证预算随模型能力缩放的原则预算不是瓶颈边际收益递减与非对称噪声地板才是。模型并行求解者验证投票弃权阈值模式扫描呈现Haiku127 个验证者5-confirm / 3-refute连续 3 轮修订失败全部 12 个3 稿比较器选最干净Sonnet65 个验证者4-confirm / 2-refute连续 3 轮修订失败全部 12 个2 稿比较器选更干净Opus45 个通用验证者 每 pattern 一个专项4-confirm / 2-refute连续 5 轮修订失败全部 12 个各配专属 agent3 稿最优雅/最初等/最短比较器择优设计逻辑弱模型靠宽度补足单样本噪声Haiku 验证者个体更不可靠所以需要更高驳斥阈值 3 而不是 Sonnet 的 2防止两个糊涂的 Haiku 误杀正确证明强模型靠深度——Opus 有能力执行 #19、#22 这类需要真实数学判断的深层模式12 个专项 pattern 通道正是其能力的最佳去处区别是保持怀疑与检查这一件具体的事之间的差距。鸽笼早退在所有档位保留一旦inflight confirm_needed refute_needed − 1剩余票无论怎么落都不携带信息继续启动只是纯延迟。若编排会话不确定自己属于哪一档默认采用 Sonnet 配置一个合理的启发式是让模型在首次响应中自我识别并匹配haiku/sonnet/opus。与其他参考文档的关系adversarial_prompts.md是执行层的即用弹药它与技能内其他参考文件形成完整闭环全部位于 references 目录verifier_patterns.md13 个无需工具即可在脑中运行的检查模式Pattern 4/5/6/10/17/18/19/22/23/35/40/58/60是提示词库中七类分类学与 #4/#18/#40/#60 各套模板的底层检查引擎每条模式都给出 check查什么、what it catches抓到什么、how to run it怎么跑solver_heuristics.md求解端的 Pólya 移动与竞赛/几何/递推专项招数与验证端形成求解启发式 ↔ 验证攻击模式的对偶presentation_prompts.md验证通过后的呈现润色 Prompt 与 LaTeX 模板包含编号命名步骤Step 3: Fourier inversion and translation invariance、反模式清单发现序叙述、过度构造、恐吓式证明、孤儿引理、无标签 case 分拆、缺失路标model_tier_defaults.md上文已述的逐档预算表。值得注意提示词库标题注明其来源为shared/verifier_patterns_source.md59 个真实研究 session 中提炼的模式而 verifier_patterns.md 是其中无需 grep/fetch/compute、纯推理即可运行的 13 个奥林匹亚子集——提示词库正是把这些模式翻译成了可以直接粘贴给子代理的自然语言指令。使用与安装该技能随 math-olympiad 插件分发安装方式/plugin install math-olympiadclaude-plugins-official使用方式 Solve this IMO problem: [statement]技能会在出现 IMO、Putnam、olympiad、verify this proof 等触发词时自动激活随后按 SKILL.md 的完整工作流执行并行求解 → 清洗上下文 → 加载本提示词库的对抗验证 → 非对称投票 → 必要时Adversarial Brief 修订 → 校准式弃权或呈现润色。对 AIME 这类纯数值题则跳过证明机器直接 5–7 个求解者多数投票无多数时对前两名候选做代入验证。按 README 中的验证记录该方法在 IMOPutnam 2025 题目上达到 17/18 解决、0 误报、2 个新证明。结语这份提示词库的价值不在于更多的验证而在于把验证者从裁判席搬上攻击席七类驳斥分类学给了它一个穷尽式检查清单七套 Prompt 模板给了它可复制的攻击姿势上下文隔离保证了它不会被思维轨迹与社会证据污染非对称投票与鸽笼早退保证了工程上的鲁棒与经济。对于任何试图在竞赛数学场景下把自信与正确分开的 Agent 工作流这份提示词库都是一份可直接落地的对抗式验证参考实现。赞分享AI 插件开发工具插件系统【免费下载链接】claude-plugins-officialOfficial, Anthropic-managed directory of high quality Claude Code Plugins.项目地址https://gitcode.com/GitHub_Trending/cl/claude-plugins-official点击查看免费下载相关推荐深入解析 grok-build 的对抗性验证器Adversarial Verifier提示词设计与 Skeptic 评审机制深入解析 grok build 的对抗性验证器Adversarial Verifier提示词设计与 Skeptic 评审机制 xAI Grok Build人工智能大模型AI Agent代码智能体CLI工具调用MCP ClientsARIS 对抗性证明审计细则Proof Audit Rubric从问题分类到反例纪律的完整核查框架ARIS 对抗性证明审计细则Proof Audit Rubric从问题分类到反例纪律的完整核查框架 导读 本文以 ARISAuto ResearchAI 技能/插件AI 评测科研人工智能MCP 服务dsh-pluginmarshmallow自定义验证器开发从函数到类级验证的完整实现marshmallow自定义验证器开发从函数到类级验证的完整实现 在数据处理流程中验证用户输入或API请求的合法性是确保系统稳定性的关键环节。marshma后端序列化上一篇突破容器构建限制Kaniko子目录构建完全指南下一篇srclib高级配置配置文件详解与自定义分析流程创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价 →
↑