资讯动态

能力强却省token:API工具提取GPT-6 Astra隐藏思维链

发布时间:2026/10/3 7:10:52 来源:尧图企业网站定制
Capable yet Parsimonious: Extracting and Characterizing Hidden Chain-of-Thought in Frontier Models作者Xiaoyu Luo, Tao Ren, Wenrui Yu, Xiao Li, Qiongxiu Li, Johannes Bjerva核心发表机构Aalborg University、Seafill论文链接arXiv:2609.26637v1发布于arXiv 预印本cs.CL|—|—|—|—|—||MATH| None | 72.5 | 42.5 | 25.0 | N/A || | Native | 86.3 | 77.5 | 97.5 | 97.5 || | Forced | 85.0 | 81.3 | 91.3 | 93.8 ||HLE| None | 24.0 | 17.0 | 13.0 | N/A || | Native | 33.0 | 21.0 | 25.0 | 35.0 || | Forced | 27.0 | 22.0 | 23.0 | 32.0 ||LCB| None | 58.0 | 52.0 | 47.0 | N/A || | Native | 83.0 | 77.0 | 90.0 | 92.0 || | Forced | 82.0 | 77.0 | 90.0 | 89.0 |可直接读出的事实是Forced 全面且显著高于 None例如 Sol 在 MATH 上从 25.0 升至 91.3Sonnet 5 在 MATH 上从 42.5 升至 81.3Forced 与 Native 的差距普遍较小个别处 Forced 甚至略高——Sonnet 5 的 MATH81.3 vs 77.5与 HLE22.0 vs 21.0Sol 在 LCB 上 Forced 与 Native 完全相同90.0 vs 90.0。HLE 上所有模型整体分数偏低Native 最高为 Astra 的 35.0Forced 相对 Native 的落差在该基准上相对更明显如 Opus 4.8 从 33.0 降至 27.0Astra 从 35.0 降至 32.0。需要再次强调的是由于各模型对 tool prompt 的敏感度不同Forced-Reasoning 并不对应某个固定的 native reasoning effort 水平。4.3 消融实验 / Ablation Study消融一工具通道是否必要以及 wording 的作用GPT-5.6 Sol。作者先做了一个直接的对照在禁用 native reasoning 的前提下不附加任何工具直接在可见回复中请求 step-by-step reasoning。在 HMMT 上这种直接请求把准确率从 39.4% 提升到 60.6%把 maximal-deliberation 指令从 tool description 挪到 response prompt 并调整 scratchpad 引用后准确率仍是 60.6%而 forced tool calling 达到 84.8%default description与 93.9%maximal deliberation。结论是直接在普通文本中请求相同的 deliberation 无法复现 forced-tool 的结果更强的措辞单独也不够。检查 HMMT P11 的 Plain response 可以看到它呈现为一个简洁的条件概率解使用编号列表与加粗的 case headings是结构良好的 Markdown 回答而非 CoT 式文本最终以FINAL_ANSWER: $\frac{2}{5}$收尾。进一步的 wording 消融见下表表注Accuracy 为 pass1 (%)tokens 为均值none-reasoning 与 Tool 组均禁用 native reasoningMethodMATH Acc (%)MATH TokensHLE Acc (%)HLE Tokensno-tool: Default25.044210.0126no-tool: Plain36.390612.0263no-tool: Maximal36.367012.0169Native: Low78.81,59927.0819Native: Medium92.53,40327.01,791Native: High97.55,52625.03,293Tool: Forced Default81.31,94015.0460Tool: Forced Maximal91.33,48123.02,106在 MATH 上Forced Default 的 81.3% 接近 Native Low 的 78.8%Forced Maximal 的 91.3% 接近 Native Medium 的 92.5%Native High 最高97.5%但 token 成本达 5,526。在 HLE 上Forced Default 15.0%、Forced Maximal 23.0%仍未达到 Native Low/Medium 的 27.0%且 Native High 反而降至 25.0%。这说明 tool description 可以调节 Sol 通过 forced channel 外化多少 deliberation也说明无工具对照中更强的 wording 并未带来进一步的准确率增益。消融二Astra 的 effort、wording 与推理通道分配。Astra 与 Sol 对更强措辞的反应恰好相反maximal deliberation 会延长 Sol 的可见工具推理却让 Astra 产生更少的可见推理并保留大量 native-channel usage。作者解读为这是一种不愿外化推理而非不会回答问题的现象并据此选择了 think-here 描述。下表给出 MATH 上的数值Native reasoning tokens 为每次完整交互中所有调用的 API 报告 reasoning usage 之和的均值Zero-native rate 为完成交互记录到零 aggregate native reasoning usage 的 scheduled questions 比例TaskMetricDefaultMaximalThink-hereMATHAccuracy (%)90.0097.5095.00Output tokens848.96594.261,754.66Native reasoning tokens887.181,386.4013.65Zero-native rate (%)27.5011.2593.75三者的取舍非常清晰Maximal 准确率最高97.50%但 output tokens 最低594.26而 native reasoning tokens 最高1,386.40zero-native rate 最低11.25%think-here 准确率略低95.00%output tokens 最高1,754.66但 native reasoning tokens 被压到极低的 13.65zero-native rate 高达 93.75%。这支持了一个假设对更强模型而言鼓励它继续在工具空间中工作可能比要求它给出 exhaustive account 更有效。消融三同时开启高 native reasoning effort 时的行为APEX Shortlist。主实验的 Forced 条件通常在 little or no native reasoning 下运行Sol 用noneAstra 用可用的最低low。为了补足如果 native reasoning 也调高会发生什么作者在全部 47 个 APEX Shortlist 问题上以high与xhigh两档 native reasoning effort 保留相同 forced-tool 协议Sol 用 maximal-deliberationAstra 用 think-here每个条件每个问题一个 recorded rolloutModelEffortCorrectTool-zeroAll-zeroMean tool output tokensSolhigh44/4746/4738/4715,044Solxhigh47/4742/4739/4719,733Astrahigh47/4738/4718/475,775Astraxhigh47/4734/477/4712,014任务准确率很高Sol high 为 44/47 即 93.6%Sol xhigh 与 Astra 的 high/xhigh 均为 47/47但准确率本身不能说明推理究竟在哪里执行。随着 effort 上升tool-stage output usage 显著增加Sol 从约 15.0k 升至 19.7k tokensAstra 从 5.8k 升至 12.0k tokens这些计数包括 tool framing 并排除单独 final-answer calls而 whole-interaction zero 的稳定性下降Astra-high 只有 18/47 保持全程零Astra-xhigh 只有 7/47Sol 则在约五分之四的问题上保持 whole-interaction zero。差距主要来自 final-answer call 中出现的 native reasoning。对 available reasoning summaries 的检查显示final-stage activity 有时是在准备或组织已经开发好的工具解有时则是在做额外的数学检查或推导。换言之提高 native reasoning effort 可以暴露更多可见推理但会让 fully clean extraction 变得更不可靠尤其对 Astra。4.4 推理表征与全局结构分析输出长度Forced 普遍短于 NativeAstra 压缩最明显。下表给出四个前沿模型的 NativeR N R_NRN​与 ForcedO F O_FOF​TaskModelNativeR N R_NRN​ForcedO F O_FOF​MATHGPT-6 Astra2,9031,752GPT-5.6 Sol5,5263,925Opus 4.824,08716,283Sonnet 527,84627,851HLEGPT-6 Astra2,313652GPT-5.6 Sol3,2932,214Opus 4.85,3853,627Sonnet 510,60410,705LCBGPT-6 Astra1,962939GPT-5.6 Sol4,0582,665Opus 4.814,84912,696Sonnet 525,12826,416总体上 ForcedO F O_FOF​低于 NativeR N R_NRN​Astra 与 Sol 尤其明显Sonnet 5 的 Forced 与 Native 几乎持平LCB 上甚至略高Astra 的 token 数在各任务上多低于 Sol、Opus 4.8 与 Sonnet 5。局部粒度Astra 的短不是每句话说更短。作者用同一批 episode annotations 计算两类量(i) 某类型单元内的平均字符数(ii) 该 epilogue 类型对整条 trace 贡献的总字符数数据集为 pooled MATH annotation set。上图显示的是第一个量在大多数 episode 类型上Astra 的 characters per unit 与 Sol 和 Opus 相当因此其 compact CoT 不能简单由异常短句或异常压缩的局部推理操作解释相反Sonnet 经常在单个 Analyze、Plan、Explore 单元内表达多得多的文本。上图显示的是第二个量也是模型间更大的差异所在Opus尤其是 Sonnet会产生更多显式中间推理步骤Analyze、Plan、Implement 等类别对总文本的贡献增长 several-fold而 Astra 在暴露更少中间 trace 的情况下到达答案。作者由此把 Astra 的短 CoT 刻画为sparse externalization稀疏外化而非 local textual compression局部文本压缩。推理活动组成repertoire 并未消失。作者进一步比较各模型的推理活动分布。上图给出四个前沿模型在 pooled MATH annotation set 上各 reasoning episode 的平均标注单元比例。所有模型中 Analyze 与 Implement 占最大份额Planning、Exploration、Verification、Reading、Monitoring 的总体比例 comparable没有任何模型表现出 qualitatively different activity composition。Astra 尽管轨迹显著更短仍呈现类似的高层 profile——这印证了前两张图的结论Astra 的紧凑性主要在于表面化了多少中间步骤而不是推理行为种类在定性上贫乏。时间组织粗略模式相似。除了静态比例作者还考察 episode 在 trace 上的位置分布。上图的每个 panel 展示一个模型在归一化推理进度上各 episode type 的出现概率。可以看到 Read 强烈集中在 trace 开头Verify 在末尾更突出Implement 通常在中后段更 prevalent具体进展细节因模型而异。结论是Astra 更短的 trace 不仅保留了相同的 broad episode inventory还保留了若干相同的 coarse temporal patterns。全局结构Astra 的树最窄、节点最少但深度可比。在 MATH 上作者对每个模型每道题取一条 completed forced-reasoning traceAstra 用 think-here low native effortSol 用 maximal deliberation包括正确与错误响应若有多条则选 generation order 第一条final answer 与 reference answer 被排除在 judge 输入之外构建推理树。中位数含 [25th, 75th] 分位数如下模型Widthp ppDepthq qqNodesN NNGPT-6 Astra5.0[3.0, 9.0]11.0 [8.8, 15.0]27.0[17.8, 44.0]GPT-5.6 Sol12.0 [5.0, 19.3]11.0 [10.0, 13.0]60.0 [29.8, 90.3]Claude Opus 4.822.0 [5.0, 44.0]12.0 [9.0, 14.0]96.0 [28.5, 220.3]Claude Sonnet 528.5 [9.0, 49.3]13.0 [10.0, 15.0]136.0 [44.8, 234.8]同一批 traces 的均值报告在另一张表中Astra 为p 7.3 p7.3p7.3、q 14.9 q14.9q14.9、N 41.0 N41.0N41.0Sol 为16.7 16.716.7、11.2 11.211.2、65.9 65.965.9Opus 4.8 为30.6 30.630.6、11.9 11.911.9、144.2 144.2144.2Sonnet 5 为44.3 44.344.3、12.4 12.412.4、171.4 171.4171.4。Astra 具有最小的 mean width 与 size但在均值口径下 depth 最大正文中depth 相似的比较指的是中位数口径。上图给出对应的推理树可视化每个 panel 展示一条接近该模型中位数图大小的单条 trace所有 panel 使用相同的垂直与水平间距以便直接比较范围每个标签报告 widthp pp、depthq qq与 node countN NN。结论是Astra 产生显著更窄的树节点数远少同时达到 comparable depth——它遵循类似深度的解决轨迹但 branching、revisiting 与 trial-and-error 更少更直接地收敛到 productive path。结合活动组成来看各模型外化的推理活动 repertoire 大体相似差异在于它们如何被组织进完整解题轨迹。4.5 跨模型推理复用 / Cross-Model Reuse压缩轨迹会省略 routine steps其有用性因此可能取决于读者能否补全。作者通过模型间移植 trace 来直接测试这一点。上图呈现了完整结果每个 panel 是一个 recipient每一行是一个 donor空心圆显示 donor accuracy实心点显示 recipient 在收到 donor trace 后的 accuracy虚线显示 recipient 自身的 standalone Native-high accuracy左向连接表示相对 donor 的性能损失同心点表示准确率相等。从图中可以读出的模式有三。其一来自 Sol 与 Opus 的 traces 被每个 recipient 重用时几乎无损失。其二Astra 的 traces 行为不同强 recipient 能复现几乎全部 donor accuracy弱 recipient 恢复较少最大 shortfall 出现在 Claude Haiku 4.5 与 GPT-5.4 Nano。其三这种模式只出现在测试的 donors 中最压缩的那些 trace 上且不是严格按 recipient capability 排序——GPT-5.4 Nano 与 DeepSeek-V4-Flash 具有可比的 Native-high accuracy恢复程度却不同说明模型规模与训练配方等与 capability 相关的因素也可能参与其中。需要强调的是shortfall 是相对的而非绝对的弱 recipient 恢复的 donor accuracy 较少但仍显著优于其 unaided performance。理解 trace 存在能力天花板。有时 donor trace 已经陈述了正确答案recipient 仍答错并报告一个不同的最终答案。统计上Astra 在 73/80 问题91.25%中在其 CoT 里明确陈述了正确答案而在 recipient 的错误答案中正确答案已暴露的比例为Haiku 4.5 为 15/18 83.33%GPT-5.4 Nano 为 11/16 68.75%DS-V4-Flash 为 11/15 73.33%答案被视为 exposed 的条件是Astra 的 final answer 正确且 transplanted text 明确认可该正确请求答案允许 notation normalization 与 direct algebraic equivalence排除 incidental numbers、rejected candidates 以及需要进一步推导的答案。四个典型失败案例说明这一现象的形态。在 HMMT P20计算通过20 × 3 20\times320×3圆柱网格、从 top row 出发到 bottom row 结束且水平移动只允许向东的 Hamiltonian paths上Astra 给出20 ( 512 511 ) 20460 20(512511)2046020(512511)20460而 Haiku 4.5 答5242880 52428805242880、GPT-5.4 Nano 答10220 1022010220、DS-V4-Flash 答10240 1024010240——其中 Nano 明确只保留 511-path case计算20 ⋅ 511 10220 20\cdot5111022020⋅51110220丢掉了输入中已存在的另一项贡献。在 APEX P10函数方程问题求1 ≤ n ≤ 20 1\le n\le201≤n≤20上所有 attainable valuesf ( n ) n f(n)nf(n)n的和上Astra 显式列出2 6 3 6 14 18 10 59 263614181059263614181059而 Haiku 4.5 与 GPT-5.4 Nano 都答0 00DS-V4-Flash 答129 129129。在 HMMT P11四道测试题独立从 algebra、combinatorics、geometry、number theory 中均匀抽 topic条件于前三个 topics 都出现求 number theory 也出现的概率上Astra 的 CoT 已显式给出24 / 60 2 / 5 24/602/524/602/5而 GPT-5.4 Nano 答2 / 3 2/32/3、DS-V4-Flash 答4 / 7 4/74/7只有 Haiku 4.5 答对。在 APEX P47求最小正整数k kk使得每个k kk个连续正整数块中都有数字和能被 2025 整除的数上Astra 给出k 10 225 − 1 k10^{225}-1k10225−1Haiku 4.5 答10 225 10^{225}10225——错误恰好是丢掉了减法而 GPT-5.4 Nano 与 DS-V4-Flash 都给出了正确答案。这些案例共同暗示压缩推理 trace 不只是让 trace 更难读而是把它推到了一定能力阈值以下读者的理解范围之外。对监督的启示与非因果性说明。作者指出推理 trace 作为监督信号的价值可能不是内在的而是相对于将从中学习的模型而言的trace 显式性是独立于 teacher strength 的一个变量。这为蒸馏中的 capacity gap 提供了一个候选机制更强的 teacher 不一定产生更好的 student因为最强 teacher 写的是最压缩的 trace而压缩 trace 恰好省略了弱 student 无法自己重建的步骤。随着前沿模型持续优化 token efficiency会出现一种张力——使前沿推理高效的同一压缩也可能使它对最可能学习它的更小模型更不可用。作者同时明确说明实验测量的是 in-context reuse 而非 fine-tuningdonor traces 在 correctness、content、style 上存在差异因此比较不能隔离 compression 作为因果因素但这一解释给出了可测试预测将压缩 trace 展开为其隐式中间步骤应恢复对弱 recipient 的大部分有用性同时基本不影响强 recipient。五、相关工作 / Related Work隐藏 CoT 抽取。Panfilov et al. (2026) 的 “stealing” 利用供应商返回的加密推理块做跨会话、跨模型重放用较弱的同族模型把较强模型此前生成的 trace 以明文揭示出来Zhang et al. (2026) 的 Trace Inversion 不直接暴露已有隐藏 trace而是从可观测输出事后重建有用 traceLu et al. (2026) 的 REP / Reasoning Exposure Prompting 用影子模型示例包裹在类代码的辅助格式中诱导开启推理的模型在可见响应中把推理外化Qu et al. (2026) 的 EchoCoT 把 REP 的暴露设定扩展到 API tool-calling 场景加入攻击者定义的 scratchpad 工具使已生成的 native reasoning 通过连续工具交互被反复归档与重放。本文与这些工作的区别在于方法只依赖标准 API 接口客户端注册自定义工具 tool-choice 强制其目的也不止于恢复 trace而是把 trace 当作观测仪器去比较前沿模型的推理方式。在指定思考通道之外推理。Ma et al. (2025) 通过 response prefilling 绕过专用 thinking block模型仍生成分步解答Wang et al. (2025) 的 HybridThinking 显示no-think 模式下的推理模型尽管 thinking block 为空仍能在可见响应中输出推理与反思。本文正是沿着这一线索提出当 native reasoning 被禁用或最小化时客户端提供的工具能否充当中间推理的替代工作区与上述工作不同的地方是本文采用 API-as-a-service 的 tool setting目标是禁用 native reasoning channel 并提供工具作为解决当前任务的替代工作区无需 demonstrations 或模型内部访问。推理轨迹分析。Li et al. (2025) 用 Schoenfeld 的 Episode Theory 把数学推理分解为功能性 episode 并分析其转移ThinkARMLi et al., 2026把 episode 级分析扩展到多模型LCoT2TreeJiang et al., 2025把长 CoT 转成层级推理树并将结构模式与推理成功关联TRACEZhang et al., 2026构建 sub-thought progression graphs刻画过度思考的结构性来源此外还有关于冗余推理与更短、可控压缩 CoT 诱导的工作Chen et al., 2024Munkhbat et al., 2025Xia et al., 2025 TokenSkip。本文定位是在这些视角基础上对抽取出的前沿模型 trace在推理效率、局部表达、全局结构三个层面做比较并把 trace 的实用性延伸为一个接收模型相关的迁移实验。六、局限性与展望 / Limitations Future Work论文对自身局限的陈述相当克制且具体可归为以下几类。抽取轨迹的效度问题。抽取出的 trace 可能只是 post-hoc rationalization 而非真实推理这正是必须先做开源模型对齐验证的原因。而在闭源模型上native CoT 不可得因此不可能确定 extracted text 反映的是模型实际内部推理还是仅提供了一个有用的行为代理与 native traces 的相似性和下游效用不应被解释为与模型内部计算同一。协议的环境依赖。Forced-Reasoning 要求 API-as-a-service 接口支持 custom tools 与 named tool 的强制选择不具备这些控制的 endpoint 不在本文范围内。同时Forced-Reasoning 并不对应某个固定的 native reasoning effort 水平因为不同模型对 tool prompt 的敏感度不同prompt 设计本身是 heuristic 的其目标不是寻找 optimal attack 或优化 prompt engineering观察到的 wording effects 只支持 model-specific choices未建立关于 model capability 的通用 prompt 结论。对照条件的缺失与计量口径。GPT-6 Astra 不支持禁用 native reasoning因此其 None 条件为 N/A只能用最低可用的loweffort 替代这意味着 Astra 没有严格意义上的无推理对照。此外缺失的计数器被当作 unknown 而非 zero这会影响 zero-native 统计的解释APEX 补充实验每个条件每个问题只有一个 recorded rollout。提取稳定性与失效边界。提高 native reasoning effort 虽然能暴露更多可见推理却会让 fully clean extraction 变得不可靠尤其对 Astrahigh 只有 18/47、xhigh 只有 7/47 保持 whole-interaction zero主要混杂源是 final-answer call 中的 native reasoning。更根本的是协议存在 refusal boundaryClaude Opus 5、Fable 5、Fable 5.1 在所有测试配置上的 extraction success rate 为0 % 0\%0%——Opus 5 拒绝 forced reasoning-tool use 与 prompt-requested reasoning-tool use覆盖所有 tested descriptions 与 parameter names却允许在同一道 benign mathematics question 上被直接请求可见推理Fable 5 与 Fable 5.1 则在 disabling thinking 时返回 explicit errors并在即使 low reasoning effort 下也拒绝 required 或 named tool choice。作者强调这些观察只建立了测试协议的失效边界并未识别限制来源是模型本身还是 provider-side handling。分析方法的依赖与解释边界。推理树的 width、depth、size 依赖 segmentation 与 step assignment小树表示更少被表示的节点但本身不能证明内部计算更少或必要证明步骤更少节点的水平间距没有时间或计算上的解释depth 度量的是 sketch progression 而非路径长度。此外推理树分析对每个模型每道 MATH 题只分析一条 completed forced-reasoning trace多条可用时选 generation order 第一条final answer 与 reference answer 被排除在 judge 输入之外。迁移实验的非因果性。6.4 节已述实验测量 in-context reuse 而非 fine-tuningdonor traces 在 correctness、content、style 上不同因此不能隔离 compression 作为因果因素只能给出可测试预测。可能的缓解方向。论文提出了若干可能防御在 provider 层面当 native reasoning 被禁用时限制 free-form reasoning tools这一方向与观察到的 Opus 5 行为一致在接口层面限制 unconstrained string arguments 或限制 forced tool selection在输出层面用分类器检查 tool arguments 中是否包含 deliberative traces但合法 planning tools 也可能产生类似内容使区分变得困难在政策层面reasoning-disclosure policies 应覆盖 native reasoning、tool arguments 与 visible responses而不是只保护一个 designated channel。作者强调这些只是 possible defenses其有效性与对合法工具使用的影响仍需评估。伦理与披露。作者使用良性公开基准与研究者账号评估 confidentiality 与 capability-control boundary不提取个人数据、专有提示、凭据或不安全内容所有提取实验在 2026 年 9 月 9 日前完成全文将提取内容理解为 extracted reasoning trace content。风险评估后作者通过邮件向 OpenAI 与 Anthropic 安全团队报告了所有观察并提供复现代码。七、总结 / Conclusion论文从一个简单但尖锐的观察出发闭源前沿模型的原始 CoT 被隐藏benchmark 分数只说明模型能解什么不说明它如何求解也不说明更强、更高效的模型之间推理差异在哪。作者用一条极简的、仅依赖标准 API 的协议——注册一个自由文本参数的 scratchpad 工具并强制初始工具选择——在关闭或最小化 native reasoning 的条件下从 GPT-6 Astra、GPT-5.6 Sol、Claude Opus 4.8 与 Claude Sonnet 5 中外化出连贯的中间推理。通过开源模型上性能、词法、结构三层对齐 闭源模型上行为证据的两级验证作者论证这些抽取轨迹可作为 native CoT 的可比较代理。在此基础上论文给出了一个具有统一性的刻画模型之间的主要差异不是执行了哪些推理操作而是外化了多少。四个前沿模型共享大体相同的 episode repertoire 与粗略的时间组织但在外化多少中间步骤上系统性地分道扬镳。最高效的 GPT-6 Astra 产生最短、冗余最少、最难被无损压缩的 trace其推理树宽度与节点数显著最小而深度可比在局部它常把 routine computations 与简单推导在内部解决而不逐句 verbalize在全局它遵循更直接的解决路径分支与试错更少——这正是论文标题中 “Capable yet Parsimonious” 所指的 token-efficient directed reasoning。但这份简洁是有代价的。跨模型复用实验显示来自 Sol 与 Opus 的 traces 被各接收模型几乎无损地重用而 Astra 的压缩 trace 只有强接收模型能近乎完全利用弱接收模型只能部分利用即使 Astra 的 trace 在 91.25% 的问题中已明确写出正确答案弱接收模型的错误答案中仍有 68.75%–83.33% 属于答案已暴露却答错。这提示压缩推理 trace 不只是让 trace 更难读而是将其置于一定能力阈值以下读者的理解范围之外。由此引出的推论是推理 trace 的显式性值得与产生它的模型强度分开考虑最强 teacher 可能不是给定 student 最有用的监督来源——当 frontier 模型持续为 token 效率而压缩推理时使它们高效的同一压缩也可能使它们对最需要学习的更小模型更加不可用。论文的最终定位是一个行为学视角它不宣称揭示了模型的真实内部计算而是提供了一个在聚合 benchmark 分数之外比较前沿模型推理方式的仪器并同时标出了这一仪器的适用边界与失效边界。原文摘要:The rapid capability gains of frontier language models are widely attributed to improved reasoning abilities, yet this cannot be verified as raw CoT traces in closed-source systems are hidden. By registering a simple custom tool through a standard API feature, we induce frontier models to externalize intermediate reasoning. Because these traces may reflect post-hoc rationalization rather than genuine reasoning, we first evaluate against native CoT on open-source models and extend to closed-source frontier models including GPT-6 Astra. We find that the extracted reasoning matches native reasoning performance and substantially outperforms no-reasoning baselines, across competition mathematics, science, and code generation. We then characterize how frontier models structure their intermediate reasoning. Across token efficiency, reasoning-step types, and induced reasoning trees, we identify systematic differences in how models externalize, compress, and organize reasoning. We find that Astra exhibits token-efficient directed reasoning, selecting a correct trajectory earlier, while resolving elementary steps internally and externalizing only crucial reasoning. These findings provide a behavioral lens on frontier-model reasoning beyond benchmark scores.PDF链接:https://arxiv.org/pdf/2609.26637v1部分平台可能图片显示异常请以我的博客内容为准

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价 →
↑