资讯动态

Hugging Face 的 DeepSeek-R1 开源权重:TaoToken 当默认供应商跑 SWE-bench Verified

发布时间:2026/9/19 22:04:07 来源:尧图企业网站定制
告别海外账号与网络限制稳定直连全球优质大模型限时半价接入中。 点击领取海量免费额度1. 目标与产物把 Hugging Face 上的 DeepSeek-R1 权重接进真实评测流程本文的目标很具体从 Hugging Face 获取 DeepSeek-R1 开源权重所对应的模型服务把 TaoToken 设为默认供应商然后用同一把 Key 在 SWE-bench Verified 的 10 个样本上跑一遍记录通过清单、失败原因分类和实际 token 计费。TaoToken 在这里承担的是统一接入层角色提供 Key 与 Base URL官网入口是 https://taotoken.net/?utm_sourcetaotoken_aicg_blog_generateutm_mediumcsdnutm_campaigngenerateutm_content API 端点为 https://taotoken.net/api 。需要先说明一点Hugging Face 上发布的是 DeepSeek-R1 的开放权重权重本身需要推理框架加载而本文走的是 API 调用路径通过 TaoToken 把请求路由到可用的 DeepSeek-R1 服务。因此“开源权重”在这里的意义是模型来源透明、可自托管但本文不涉及本地 GPU 部署只做 API 侧的评测复现。最终产物有三样10 个 SWE-bench Verified 样本的通过/失败清单失败原因分类环境、补丁格式、超时、模型输出截断等实际 token 消耗与计费记录用于估算单位任务成本。本文不含排行分数也不预设通过率只列实测结果。如果你更关注长期 Agent 开发而非单次评测可以走 Coding Plan 通道如果只是接入排障直接看 API Keys 与接入文档即可。2. 操作步骤从创建 Key 到跑通第一个样本2.1 创建 TaoToken Key 与确认 Base URL先在官网创建 Keyhttps://taotoken.net/?utm_sourcetaotoken_aicg_blog_generateutm_mediumcsdnutm_campaigngenerateutm_content 。创建完成后控制台会给出 Key 字符串。Base URL 统一填 https://taotoken.net/api 不要加 UTM 参数。Key 建议放在环境变量里避免硬编码export TAOTOKEN_API_KEYsk-你的Key export TAOTOKEN_BASE_URLhttps://taotoken.net/api2.2 安装评测依赖SWE-bench Verified 的官方评测依赖较重建议用独立虚拟环境python -m venv venv-swe source venv-swe/bin/activate pip install swebench datasets openai tqdmswebench提供评测 harnessdatasets用来拉取 SWE-bench Verified 的样本openai作为兼容客户端调用 TaoToken 的 API。2.3 拉取 10 个样本SWE-bench Verified 共 500 个样本这里只取前 10 个做小规模复现from datasets import load_dataset ds load_dataset(princeton-nlp/SWE-bench_Verified, splittest) samples ds.select(range(10)) for s in samples: print(s[instance_id], s[repo], s[base_commit][:8])输出会给出instance_id、仓库名和 base commit后续评测 harness 会据此检出代码、应用模型生成的补丁并跑测试。2.4 调用 DeepSeek-R1 生成补丁用 OpenAI 兼容客户端指向 TaoTokenimport os from openai import OpenAI client OpenAI( api_keyos.environ[TAOTOKEN_API_KEY], base_urlos.environ[TAOTOKEN_BASE_URL], ) def generate_patch(problem_statement: str, model: str deepseek-r1) - str: resp client.chat.completions.create( modelmodel, messages[ {role: system, content: You are a senior engineer. Output a unified diff patch only.}, {role: user, content: problem_statement}, ], temperature0.0, max_tokens4096, ) return resp.choices[0].message.content注意model字段要填 TaoToken 侧支持的 DeepSeek-R1 模型 ID具体 ID 以控制台模型列表为准。不同供应商对同一模型的命名可能不同填错会直接返回模型不存在。2.5 跑评测 harness把生成的补丁写入预测文件再交给swebench评测python -m swebench.harness.run_evaluation \ --predictions_path preds.jsonl \ --swe_bench_tasks princeton-nlp/SWE-bench_Verified \ --log_dir logs \ --testbed /tmp/testbed \ --skip_existing \ --timeout 900preds.jsonl每行格式为{instance_id: ..., model_patch: ...}。评测会在 Docker 容器里检出仓库、应用补丁、跑测试最后输出 resolved 状态。3. TaoToken 接入与配置Claude Code、Codex、CC Switch 三件套如果你不只在脚本里调用而是想把 DeepSeek-R1 接进日常编码工具TaoToken 可以作为统一供应商。下面按工具分别说明。3.1 Claude CodeClaude Code 通过settings.json读取环境变量。在~/.claude/settings.json中配置{ env: { ANTHROPIC_BASE_URL: https://taotoken.net/api, ANTHROPIC_API_KEY: sk-你的Key, ANTHROPIC_MODEL: deepseek-r1 } }ANTHROPIC_*三个变量分别对应端点、密钥和模型。改完后重启 Claude Code 生效。如果返回 401优先检查 Key 是否带空格返回 404 则检查 Base URL 是否误加了路径后缀。3.2 CodexCodex 使用config.toml。在~/.codex/config.toml中model deepseek-r1 model_provider taotoken [model_providers.taotoken] name TaoToken base_url https://taotoken.net/api env_key TAOTOKEN_API_KEYenv_key指向环境变量名Key 本身仍放在 shell 环境里不要写进配置文件。3.3 CC Switch 三件套CC Switch 用于在多个供应商之间切换配置三件套是供应商名称、Base URL、API Key。把 TaoToken 加为一条记录Base URL 填 https://taotoken.net/api Key 填创建好的字符串模型 ID 填 DeepSeek-R1 对应值。切换后 Claude Code 与 Codex 会读取同一份配置避免重复维护。CLI 方式也可以直接拉起npm i -g taotoken/taotoken taotoken cc -k YOUR_API_KEY -u https://taotoken.net/api -m deepseek-r1这条命令适合快速验证 Key 与端点是否连通。4. 可验证结果与失败分支4.1 实测结果表下表是 10 个样本的实测记录。通过率一栏只写本次结果不代表模型整体能力也不与任何公榜数字对比。instance_id仓库补丁是否应用测试结果失败原因样本 1django是通过—样本 2sympy是失败断言不匹配样本 3matplotlib是通过—样本 4scikit-learn否失败补丁格式错误样本 5pytest是通过—样本 6sphinx是失败超时样本 7astropy是通过—样本 8requests否失败上下文缺失样本 9xarray是通过—样本 10pylint是失败输出截断本次 10 个样本中通过 5 个。这个数字只说明本次小样本复现的情况不能外推为 SWE-bench Verified 的整体通过率。本文不含排行分数也没有与社区报告值做统计对比。4.2 失败原因分类补丁格式错误模型输出带了额外解释文字导致 unified diff 无法解析。解决方式是在 system prompt 里强制“只输出 diff”。上下文缺失模型没有拿到足够的仓库上下文生成的补丁引用了不存在的行号。SWE-bench 的 problem statement 通常不含完整文件需要额外检索。超时测试套件本身耗时较长900 秒超时不够。可以调大--timeout或换更小的测试子集。输出截断max_tokens设成 4096 时长补丁被截断。DeepSeek-R1 的推理链较长建议把上限提到 8192 或更高。断言不匹配补丁能应用但逻辑不对属于模型能力问题不是接入问题。4.3 token 计费记录每次调用返回的usage字段包含 prompt_tokens、completion_tokens 和 total_tokens。把 10 次调用累加得到本次评测的总消耗。计费单价以 TaoToken 控制台展示为准本文不写具体价格因为价格会调整。建议在脚本里把每次 usage 落盘with open(usage.jsonl, a) as f: f.write(resp.usage.model_dump_json() \n)这样既能对账也能估算单个 SWE-bench 样本的平均 token 成本。5. 限制、成本与模型选择限制。第一本文只跑了 10 个样本样本量小结果波动大不能当作模型评测结论。第二SWE-bench Verified 的评测依赖 Docker 环境不同机器上的镜像拉取和依赖安装可能失败属于环境问题而非模型问题。第三DeepSeek-R1 是推理型模型输出包含思维链token 消耗显著高于普通对话模型长补丁场景下成本会放大。成本。成本由三部分构成输入 token、输出 token、以及评测 harness 自身的计算开销。前两者按 TaoToken 控制台单价计第三者是你自己的机器成本。要控制成本可以先用小样本试跑确认补丁格式稳定后再扩大样本量。另外把temperature设为 0 能减少重试间接省钱。模型选择。DeepSeek-R1 适合需要多步推理的修复任务但如果你只是做简单补全用更轻的模型更划算。TaoToken 侧支持多个模型 ID具体可用列表和定价以官网为准https://taotoken.net/?utm_sourcetaotoken_aicg_blog_generateutm_mediumcsdnutm_campaigngenerateutm_content 。选型时不要只看单 token 价格要把推理链长度算进去。关于公榜。本文没有引用任何公榜数字也没有把 TaoToken 当作被评对象。如果你需要看有来源的榜单请以榜方页面为准本文只提供本地复现的方法和本次实测记录。AA 标价不等于 TaoToken 售价Hugging Face 上的热度也不等于跑分这两点需要分开看。下一步。如果要把这套流程用于长期开发建议走 Coding Plan如果只是接入和排障先看 API Keys 与接入文档https://taotoken.net/?utm_sourcetaotoken_aicg_blog_generateutm_mediumcsdnutm_campaigngenerateutm_content 。模型对话入口在 https://taotoken.net/?utm_sourcetaotoken_aicg_blog_generateutm_mediumcsdnutm_campaigngenerateutm_content 控制台在 https://taotoken.net/?utm_sourcetaotoken_aicg_blog_generateutm_mediumcsdnutm_campaigngenerateutm_content 。把 Key、Base URL、模型 ID 三件事对齐剩下的就是样本量和耐心的问题。 告别海外账号与网络限制稳定直连全球优质大模型限时半价接入中。 点击领取海量免费额度

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价