资讯动态

Prime Inference 接入指南:通过 prime CLI 与 OpenAI 兼容 API 调用 Prime Intellect 推理服务

发布时间:2026/9/13 15:51:50 来源:尧图企业网站定制
Prime Inference 接入指南通过 prime CLI 与 OpenAI 兼容 API 调用 Prime Intellect 推理服务【免费下载链接】prime-agentA self-improving RLM agent for coding workflows and long-running autonomous tasks.项目地址: https://gitcode.com/GitHub_Trending/pr/prime-agentPrime Inference 是 Prime Intellect 提供的一套 OpenAI 兼容推理 API聚合了前沿模型与开源模型跨多个上游供应商路由专为大规模评测evaluations场景设计。本文围绕 inference.md 展开完整覆盖 API Key 申请与权限、CLI 命令行用法、直接调用 OpenAI 兼容端点以及 Teams 团队计费与 LoRA Adapter 部署四个部分并结合 Prime Agent 仓库源码说明认证校验、模型目录刷新、团队 ID 注入等底层实现帮助读者在实际项目中快速、正确地接入 Prime Inference。前置准备申请 API Key 并开启 Inference 权限Prime Inference 的鉴权基于 Prime 平台账号体系。接入前需要完成两步登录 https://app.primeintellect.ai控制台负责 API Keys、账单、Teams 等进入Account settings → API Keys创建一个 API Key。创建时必须勾选启用Inference权限。文档明确提示如果没有该权限后续所有请求都会以认证错误authentication errors失败。这里的权限并不是一句空话Prime Agent 仓库中的认证实现会真实校验它。在 prime-inference-auth.ts 中checkPrimeInferenceAccess调用/api/v1/user/whoami接口解析返回的用户scope字段只有当scope.inference.write true时才判定为{ ok: true }否则返回ok: false并携带具体原因如 Prime token does not have inference write permission。对应测试 prime-inference-auth.test.ts 用{ scope: { inference: { read: true, write: true } } }验证了通过用例。也就是说缺少 Inference 权限的 Key 在认证阶段就会被拦截而不是等到真正发请求时才报错。拿到 Key 后将其导出为环境变量方便 CLI 与 SDK 读取export PRIME_API_KEYyour-api-key-herePRIME_API_KEY是 Prime Inference 的标准环境变量名。在 usage.md 中记录为 Prime Inference API key; also used for trace sharing when it hasagent_tracesscope在 providers.md 中也明确 Prime Inference 使用 OpenAI 兼容端点https://api.pinference.ai/api/v1可通过设置PRIME_API_KEY或使用/login命令登录来配置。方式一通过 prime CLI 使用评测场景推荐primeCLI 是 Prime Intellect 全系产品环境、评测、训练、推理、算力的统一命令行入口。针对推理两条核心命令如下# 列出当前可用的模型 prime inference models # 运行一次评测模型路由到 Prime Inference prime eval run gsm8k -m meta-llama/llama-3.1-70b-instruct -n 25说明prime inference models输出当前账号可访问的模型清单模型 ID 形如meta-llama/llama-3.1-70b-instruct。prime eval run用于跑评测任务gsm8k是评测环境名-m指定模型-n 25指定样本数量。评测请求会通过 Prime Inference 路由执行。对 Prime Inference 模型执行的评测会自动上报预估的 USD 成本estimated USD cost便于控制大规模评测的预算。如果本机还没有安装primeCLI在 SKILL.md 中给出了初始化方式uv tool install prime # 或: pip install prime prime login # 浏览器登录; 或: prime config set-api-key prime config view # 验证配置客户端侧的成本与模型元数据管理仓库实现佐证当评测结果与费用估算需要精确对应时模型的价格、上下文窗口等元数据来自 Prime Inference 的/models目录接口。Prime Agent 的 prime-inference-model-catalog.ts 实现了fetchPrimeInferenceModelCatalog以GET https://api.pinference.ai/api/v1/models拉取目录并将响应原子写入磁盘缓存刷新失败或离线PI_OFFLINE1时回退到内置模型列表。缓存条目包含input/output单价、contextWindow、maxTokens、reasoning等字段见 buildPrimeInferenceModels其中 Anthropic 系模型的缓存读写成本还会按input * 0.1与input * 1.25估算。这正是 CLI 能够自动报告预估 USD 成本的客户端实现基础。方式二直接调用 OpenAI 兼容 APIPrime Inference 对外暴露的端点是Base URL: https://api.pinference.ai/api/v1该端点兼容 OpenAI Chat Completions 协议。使用官方openaiPython SDK 的最小调用示例import openai, os client openai.OpenAI( api_keyos.environ[PRIME_API_KEY], base_urlhttps://api.pinference.ai/api/v1, ) response client.chat.completions.create( modelmeta-llama/llama-3.1-70b-instruct, messages[{role: user, content: Hello!}], )关键点api_key直接从环境变量PRIME_API_KEY读取避免硬编码。base_url指向https://api.pinference.ai/api/v1注意保留/api/v1路径。模型 ID 使用带供应商前缀的完整 ID如meta-llama/llama-3.1-70b-instruct。只要是能讲 OpenAI API 语言的客户端都可用Python/JS/Go 等语言的 OpenAI SDK、curl、以及各类支持自定义 Base URL 的工具只需把地址指向上述端点即可。流式输出streaming与高级参数如 reasoning 控制等属于进阶用法见官方 Live docs 的inference/usage.md页面。从仓库源码看Prime Agent 自身也把这个端点当做一个标准 Provider 来集成provider 标识为prime-inference默认模型 ID 为z-ai/glm-5.3见 model-resolver.ts模型元数据加载时会把在线目录与内置模板合并mergePrimeInferenceModels见 prime-inference-model-catalog.ts。因此任何为 OpenAI 兼容 API 编写的请求在 Prime Inference 上都能按相同协议工作。Teams 团队计费与 LoRA Adapter 部署使用团队额度Team billing如果希望评测或推理消耗的是团队Team额度而非个人余额需要在请求中带上团队标识通过prime teams list命令或控制台的 Team Profile 页面查找到 Team ID。在请求头中加入X-Prime-Team-ID头X-Prime-Team-ID: your-team-id该头会被服务端用于账单归属。团队选择也可以固化到 CLI 配置或环境变量中Prime Agent 的配置读取逻辑支持~/.prime/config.json中的team_id、team_name、team_role字段并且环境变量PRIME_TEAM_ID的优先级高于配置文件见 prime-inference-auth.ts 的loadPrimeCliConfig以及 prime-inference-auth.test.ts 对环境变量覆盖文件配置的测试。在 Prime Agent 中X-Prime-Team-ID头还会被注入到请求中用于拉取该团队私有可见的模型见 prime-inference-models.ts 的fetchAuthorizedPrivatePrimeInferenceModels该方法要求必须携带X-Prime-Team-ID头才会发起带鉴权的私有模型请求。部署 LoRA Adapter使用 Prime Intellect Hosted Training 训练出的 LoRA Adapter可以部署后通过同一个 OpenAI 兼容 API 查询训练完成后在平台完成 Adapter 部署。部署完成后用部署返回的模型标识替换请求中的model字段其余请求方式与普通模型完全一致。详细的部署与查询流程参见官方 Live docs 的inference/adapter-deployments.md。也就是说从基础模型、团队计费到私有 Adapter 推理都收敛在同一条 OpenAI 兼容 API 上对上层应用是透明的。认证权限的仓库级验证最后把认证链路串起来看。当使用PRIME_API_KEY或浏览器登录prime login拿到 Key 后Prime Agent 的loginPrimeInference会做两层校验prime-inference-auth.ts若~/.prime/config.json中已有api_key先调用/api/v1/user/whoami检查该 Key 是否具备 Inference 写权限scope.inference.write具备则直接复用source 标记为prime-cli。若没有 Key 或现有 Key 权限不足则启动浏览器登录本地生成 RSA 密钥对调用/api/v1/auth_challenge/generate获取 challenge打开https://app.primeintellect.ai/dashboard/tokens/challenge?code...让用户授权随后轮询/api/v1/auth_challenge/status默认 5 秒间隔、30 秒超时拿到用公钥加密的结果并解密再对新 Key 做同样的 Inference 权限校验。这解释了为什么创建 Key 时未开启 Inference 权限会在接入阶段直接暴露——仓库用真实接口响应来验证权限而不是仅凭文档约束。相关测试用例覆盖了 Key 复用、浏览器登录降级、challenge 过期404 抛 Prime login challenge expired与取消登录抛 Login cancelled等分支见 prime-inference-auth.test.ts。小结接入 Prime Inference 只需三步在 https://app.primeintellect.ai 创建带Inference权限的 API Key → 导出PRIME_API_KEY→ 要么用primeCLI评测场景自动报告预估成本要么用任何 OpenAI 兼容客户端指向https://api.pinference.ai/api/v1。涉及团队计费时补一个X-Prime-Team-ID请求头涉及私有模型时确认该 Team 对模型可见即可。更进一步的信息流式、高级参数、Adapter 部署、故障排查可以持续跟进官方 Live docs 的inference/overview.md、inference/usage.md、inference/adapter-deployments.md、inference/troubleshooting.md页面仓库侧的prime-intellect技能文档与源码SKILL.md、providers.md则是日常排障和二次集成时的最佳参考。【免费下载链接】prime-agentA self-improving RLM agent for coding workflows and long-running autonomous tasks.项目地址: https://gitcode.com/GitHub_Trending/pr/prime-agent创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价