0. 简介越来越强的模型正在改写 Claude Code 里 skill 的价值排序这篇文章想解决的具体问题很窄配置目录里那批装了却几乎没调用过的 skill到底哪些还该留着。判断依据被压缩成两条可核验的轴——模型本身的能力强度以及使用者对当前任务的清晰度再叠加一个常被忽略的成本项也就是模型有限的 token 注意力预算。全文的结论落在一个净值评分与四象限框架上帮你把兜底型和补能型两类 skill 分开处置。下面结合 Superpowers 与 grill-me 这两个真实插件的设计假设拆出四条能直接照着做的筛选与盘点动作。1. 先说个尴尬事装的 skill一大半没用过前段时间社区里有篇源码对比文很火把 Superpowers 和 grill-me 两个 Claude Code 插件扒了个底朝天。一个是 25 万行量级的方法论巨兽一个正文只有一行。文章落点在哪个设计更优雅但真正让我停下来的不是这句结论而是我自己的配置目录——那一刻我意识到比谁更优雅更值钱的问题是这些东西我到底用没用过。让我停下来的是另一件事这两个东西我都装了也几乎都没用过。翻一下配置目录躺着吃灰的 skill 远不止这两个。看到别人晒就装看到 star 多就装看到理念漂亮就装装完一次都想不起来调。这不是我一个人的毛病任何一个重度用 Claude Code 的人配置里大概率都堆着一批精神安慰型插件。进一步看囤 skill 的心态和囤没读完的电子书、没上完的网课是一回事——收藏即掌握的错觉装上那一刻仿佛能力就自动 1 了。这里的关键是安装动作只消耗一次点击却在你心里兑换成了我已经具备这个能力的错误结算。真相是能力没变只是配置目录又长了一行而那一行大概率再也不会被主动调用。问题从来不是 skill 好不好而是我们几乎没认真问过那句最该问的话这个 skill 解决的问题我到底有没有。这一问下去一半的插件其实都该卸载。换句话说装之前的评估动作被理念漂亮这个感性判断整个跳过了等于用收藏行为替代了需求判断最后配置目录变成一座只进不出的仓库。这篇文章就想把这一问讲透并且给出可以照着做的操作。核心问题在于判断一个 skill 该不该留不能靠它好不好这种绝对评价得引入两个相对变量模型现在有多强你自己有多清楚。这两个变量一旦摆上台面装还是删就从玄学变成了可推导的结论后面几节会把这条推导链一步步补全。2. 这两个东西各自在替你补什么想回答我需不需要得先看清它们各自赌的是什么。两个插件的设计哲学本质是对使用者的两种假设。这里要厘清的是插件的价值不写在功能列表里而写在它假设你缺什么——一旦看穿这个假设你就知道自己站在哪边也知道这个假设对今天的你还成不成立。2.1 Superpowers 赌的是你说不清自己要什么Superpowers 赌的是你说不清自己要什么。所以它用流程替你兜底从一个模糊念头到最终落地每一环都接管一步都不放你自己走。它的 skill 描述里几乎写死了一句近乎偏执的规矩翻成配置就是下面这段触发约束# superpowers/skills/brainstorming/SKILL.mdname:brainstormingdescription:Use this BEFORE any implementation. Even if a task has only a 1% chance of needing a skill, you MUST invoke and check it first.enforcement:mandatory# 不允许跳过gate:blocking# 未完成不得进入下一步这段配置的意思是宁可全管绝不漏管把所有岔路提前铺好。直观理解是它把你当成一个需要全程陪跑的新手代价是你也失去了抄近路的自由。这里的关键是那个enforcement: mandatory加gate: blocking的组合——它从机制上剥夺了我这次不需要的选项哪怕你心里早有答案也得陪流程走完一遍。2.2 grill-me 赌的是你说不完整grill-me 赌的是另一件事你大概知道要什么但说不完整。它的精华不是那行开始一次拷问而是底下这四条规矩我把它整理成等价的行为约束# grill-me 的四条核心规矩行为约束 1. one_question_at_a_time : 一次只问一个问题不批量轰炸 2. recommend_default : 每个问题都带一个推荐答案 3. never_ask_discoverable : 能自己查的绝不来烦你 4. no_code_before_aligned : 没对齐之前一行代码都不写这是宁可多问绝不误解用决策树一个节点一个节点帮你补齐脑子里的空白。这意味着两种赌法看着相反压的却是同一个底你需要被帮着才能想清楚。那如果你真正的问题恰恰不是想不清楚呢这层窗户纸一旦捅破后面几节的判断全都通了。难点提示不要被两个插件表面的复杂度差异带偏。Superpowers 几万行、grill-me 一行体量天差地别但它们押注的前提完全一样——使用者的思路是残缺的、需要外部流程来补全。真正决定你该不该装的从来不是代码量而是这个前提对现在的你还成不成立。3. 两个维度直接决定你该不该装我把判断压缩成两条轴一条是模型本身够不够强一条是你自己想得够不够清楚。这里的关键是这两条轴不是并列的偏好而是共同决定了一个 skill 的净价值是正还是负——两条轴一交叉你该不该装某个 skill基本就有答案了。下面先把两条轴各自说清楚再在第 4 节把它们合成一个能直接比大小的量。3.1 第一条轴模型够不够强先说第一条模型够不够强。某代更强的模型出来后社区里有个特别直白的反馈——Superpowers 开始拖后腿了。道理不绕模型已经能听懂意图、能自己做出靠谱的架构取舍、能写出不用大改的代码。你还在它头上罩一层先头脑风暴、再写规格、再排计划、再执行的紧箍咒就像给开了二十年长途的老师傅塞了个语音导航全程念叨请系好安全带不是没道理是碍手碍脚。进一步看还有更实的一层模型的注意力预算是有限的。它读你那套规程、走那套流程分支消耗的 token 全从真正动脑和写代码那份预算里硬扣出来等于用高价值算力去跑低价值流程。可以把一次任务里模型的有效产出写成一个很粗的预算式看清这笔账到底扣在哪V output B total − C skill − C overhead V_{\text{output}} B_{\text{total}} - C_{\text{skill}} - C_{\text{overhead}}VoutputBtotal−Cskill−Coverhead其中B total B_{\text{total}}Btotal是这次任务模型能投入的总注意力预算C skill C_{\text{skill}}Cskill是走 skill 流程读规程、走分支、逐问确认吃掉的部分C overhead C_{\text{overhead}}Coverhead是其它固定开销V output V_{\text{output}}Voutput才是真正落到动脑和写代码上的产出。模型越强C skill C_{\text{skill}}Cskill这笔账越不划算——因为被它挤掉的那部分预算本可以花在更值钱的地方。3.2 第二条轴你自己想得够不够清楚再说第二条你自己想得够不够清楚这条更根本。干了几年的开发者很多活儿在敲第一行字之前脑子里其实已经有答案了。需求边界、模块怎么切、接口长什么样、哪几处最容易埋雷都不是空白。这种时候兜底型 skill 甩给你一篇上千行、还得逐句批改的方案或者拿几十个你早知道答案的问题来考你都不是帮你是收你的过路费。换句话说你缺的是执行它给的是规划供需完全错位。反过来如果你手上只有一个模糊方向细节全是问号或者对某块技术心里真没底这些工具的价值立刻回来。它们做的事本质上只有一件把你从不清楚硬推到清楚。这里的关键是你缺这一推它就值钱不缺它就是纯噪音中间没有灰色地带。4. 把两条轴合成一个净值skill 到底值不值两条轴分开说还不够直接这里的关键是把它们合成一个能比大小的量。直观理解是一个 skill 值不值得装等于它替你补上的价值减去它每次运行都要收的成本。核心问题在于这个差值随着模型变强和你变熟练是会持续缩水的缩到某个点之后甚至会翻负。4.1 一个粗糙但够用的净值式我把它写成一个粗糙但够用的净值评分S SS好处是把感性的要不要装变成一个能代入数字、能比大小的表达式。哪怕G gap G_{\text{gap}}Ggap、m mm、u uu、C run C_{\text{run}}Crun这几个系数都只是拍脑袋估的方向也不会错至少能逼你把凭感觉装换成照着一个式子想一遍这一步的价值就已经回本了S skill G gap ⋅ ( 1 − m ) ⋅ ( 1 − u ) − C run S_{\text{skill}} G_{\text{gap}} \cdot (1 - m) \cdot (1 - u) - C_{\text{run}}SskillGgap⋅(1−m)⋅(1−u)−Crun其中G gap G_{\text{gap}}Ggap是这个 skill 理论上能补的能力缺口m ∈ [ 0 , 1 ] m \in [0,1]m∈[0,1]是模型强度越强越接近 1u ∈ [ 0 , 1 ] u \in [0,1]u∈[0,1]是你对当前任务的清晰度越清楚越接近 1C run C_{\text{run}}Crun是它每次触发都要付的运行成本。当m mm和u uu同时逼近 1前一项趋近于 0净值S SS直接被C run C_{\text{run}}Crun拖成负数。这意味着模型越强、你越清楚兜底型 skill 的净值不是变小是变成负担。4.2 为什么补能型不吃这条衰减这里要厘清一个关键区别上面那个( 1 − m ) ( 1 − u ) (1-m)(1-u)(1−m)(1−u)的衰减只打在替你思考的兜底型 skill 上。补能型 skill 的缺口G gap G_{\text{gap}}Ggap不来自你的思路残缺而来自模型本身的硬边界——它联不了网、看不见渲染结果、默认输出就是那个味儿。这类缺口不随m mm、u uu变化所以它们的净值大致是一条水平线S augment G hard − C run , G hard ≈ const S_{\text{augment}} G_{\text{hard}} - C_{\text{run}}, \quad G_{\text{hard}} \approx \text{const}SaugmentGhard−Crun,Ghard≈const其中G hard G_{\text{hard}}Ghard是模型结构性够不到的那块硬缺口几乎不随模型变强而消失。这就是兜底型和补能型最本质的分野前者的价值站在流沙上后者的价值扎在基岩里模型越强这条分界线只会越清楚。第 6 节会把这一刀切下去落到具体的 skill 分类上。5. 一张表把你自己对号入座两条轴交叉四个格子。这里要提醒的是别急着找我是哪种开发者先想清楚我手上这个任务落在哪一格这才是这张表真正的用法。人是会变的任务更是一个接一个换的钉死身份只会让你误判把本该临时判断的事当成了固定标签结果整年都用错工具。5.1 四象限与最扎心的那一格模型够强模型还不够强你自己想得清楚不需要直接干让模型执行你偶尔搭把手你自己想不清楚grill-me 够用帮你对齐细节Superpowers 有价值全流程兜底最有意思的是左上角——专业开发者遇上越来越强的模型这一格恰恰最不需要重型工具。可最扎心的也是这一格这批人往往最有能力欣赏这设计真漂亮因而最容易一冲动就把它装上。这里的关键是看得懂它的精妙和用得上它是两码事前者是审美后者才是需求。5.2 任务会滑格身份不会这张表也不是钉死的。同一个你做熟悉领域的活儿落在左上角一头扎进完全陌生的技术栈时可能瞬间滑到右下角。这意味着该问的从来不是我是哪一类人而是我这次这个任务落在哪一格。任务变了答案就跟着变昨天该删的 skill 今天可能又该临时装回来反过来也一样。6. 那 skill 到底该怎么用——这才是重点说到这你可能以为我在劝退正相反。我想讲的是另一件事skill 不是越多越好是越准越值钱。下面是我自己筛过一轮之后真正留在手边的四条实操每条都能直接照着做对应的正是前面那个净值式的四种用法——从装之前的减法到装之后的盘点覆盖一个 skill 的完整生命周期。6.1 装之前先做减法第一装之前先做减法逼自己回答缺什么。看到新 skill 别条件反射去点安装先过两个问题这个模型还需要我这么扶着吗我自己还需要被这么扶着吗两个都是不需要就别装。这里的关键是省下的不只是那点安装时间是往后每一次交互里那些本可以不发生的来回确认和流程空转。这意味着装一个用不上的 skill成本不是一次性的是每次它跳出来碍事都要再付一遍也就是净值式里那个持续为负的C run C_{\text{run}}Crun。换句话说安装是一锤子买卖负担却是分期付款而且没有免息期越用越亏。想清楚这一点你按下安装前的手会明显变慢。6.2 兜底型与补能型区别对待第二把 skill 分成两类区别对待这是最该想明白的一刀。一种是兜底型帮你想清楚——头脑风暴、结构化拷问、逼你写计划都是。它们的价值和你、和模型的成长反着走越熟练越多余对这类就一个字狠。另一种是补能型帮你做到模型自己做不到的事。联网抓最新文档因为模型知识有截止日期驱动真实浏览器截图验证因为模型看不见渲染结果把口水话改写成有观点的文字因为模型默认输出就是那个味儿。这类补的是模型的短板价值不衰减正对应净值式里那条水平线S augment S_{\text{augment}}Saugment模型越强反而越能把它们用好。难点提示判断一个 skill 属于哪类就问一句——它是在替我思考还是在帮我够到我够不着的东西前者随着你和模型一起变强而迟早退场后者补的是模型结构性的硬边界、该长期留在手边。这一问就是把( 1 − m ) ( 1 − u ) (1-m)(1-u)(1−m)(1−u)会不会打到它头上翻译成一句人话。这一刀切下去你的 skill 列表会瘦一大半剩下的全是真在干活的。这里值得强调别舍不得兜底型 skill 的以防万一九成情况都用不上那个万一而你为这一成的万一付的是全年每次交互的流程税这笔账怎么算都不划算何况那一成里模型多半也能自己扛过去。6.3 让好 skill 自己跳出来第三让好 skill 能自己跳出来而不是等你想起来。一个 skill 用不用得起来一半看它解决的问题真不真实另一半——很多人忽略的——看它触发门槛低不低。人是会偷懒的你总有想不起来的那次。触发描述写得含糊、场景没写清、每次都得手动敲一遍那再好的 skill 也是吃灰的命。这里的关键是把触发条件写得足够具体、能被真实场景自动命中而不是写一句放之四海而皆准的废话。对比一下下面两种写法就明白差在哪一个模型永远猜不到该在何时调它另一个几乎是自己往对的场景上撞触发描述这一行字的质量直接决定了这个 skill 活不活得起来# 反面触发描述含糊模型不知道何时该调description:帮你处理文档相关的任务# 正面场景 触发词 边界都写死能自动冒头description:Use when writing or optimizing a Chinese technical blog from a paper repo. Trigger on 把论文写成博客 / 深度解析 / 公众号科普. Enforces ≥100-char paragraphs, real code, verify.py gate.真正进了工作流的是能在对的场景自己冒头的那种。所以每次装完顺手把触发条件调准比多装三个新的都管用——这一步直接决定了那个能力缺口G gap G_{\text{gap}}Ggap到底能不能被真正兑现还是永远躺在配置里空转等于装了个只在理论上存在的能力。6.4 定期做一次吃灰盘点第四定期做一次吃灰盘点最简单也最容易被跳过。每隔一段时间翻一遍 skill 列表几个月没主动调用过的直接问自己是它没用还是我没在对的场景想起它前者删掉后者去修触发条件。这件事可以半自动化比如先把最近没被日志命中的 skill 捞出来# 粗略盘点列出 skills 目录里、近 90 天日志中从未出现过的 skill 名fordin~/.claude/skills/*/;doname$(basename$d)if!grep-rqi$name~/.claude/logs/2/dev/null;thenecho从未命中(候选删除或修触发):$namefidone别让配置目录变成一座只进不出的仓库。囤着不用的 skill 不会让你更强只会让你更心安而心安恰恰是这件事上最不该有的错觉——它会掩盖住我其实没在提升这个真相。这里的关键是盘点的动作本身就是在强制你面对净值为负的那批插件把该付的沉没成本一次性结清。7. 两类 skill 的价值曲线长得完全不同把前面净值式画成一张随时间推移的曲线两类 skill 的分野会更直观。核心问题在于横轴不是日历时间而是模型强度 你的熟练度合起来往右走的那个进度——两类 skill 在这根轴上走出的是两条完全相反的曲线一条注定坠落一条稳稳托住看清这一点就不会再对两类工具一视同仁。7.1 一条向下、一条持平兜底型 skill 的价值曲线是向下的模型越强、你越熟( 1 − m ) ( 1 − u ) (1-m)(1-u)(1−m)(1−u)越小净值一路滑向负区。补能型 skill 的价值曲线基本持平甚至因为模型能更好地驱动工具而略微上翘。直观理解是兜底型在跟你比赛谁进步更快而它注定会输补能型则站在模型永远够不到的地方等你。…详情请参照古月居