资讯动态

openpi 在桌面上 0 新样本拿起叉子:预训练模型已经读过 1 万小时机器人数据

发布时间:2026/9/12 16:54:14 来源:尧图企业网站定制
openpi 在桌面上 0 新样本拿起叉子预训练模型已经读过 1 万小时机器人数据【免费下载链接】openpi项目地址: https://gitcode.com/GitHub_Trending/op/openpi把相机对准桌面输入 pick up the fork机械臂就过去把叉子拿了起来——场景没标定新样本一条没采。这是 openpi 里的 π₀-FAST-DROID checkpoint它的本质是一个在 1 万多小时真机操作数据上预训练出来的视觉-语言-动作模型VLA。如果你的双臂要进温室工位去采摘或移栽问题不是从头训一个模型。预训练模型已经把场景长什么样机械臂怎么动这类常识读完了剩下的只是把你的机器人关节空间和目标作物对上去这就是微调。openpi 就是干这件事的工具链预训练 checkpoint、数据转换脚本、训练入口全在一个仓库里。先跑通它三步跑起 openpi 预训练模型的完整流程第一步clone 仓库。--recurse-submodules不能省third_party 里装着机器人驱动代码git clone --recurse-submodules https://gitcode.com/GitHub_Trending/op/openpi第二步用 uv 装依赖。README 里写明GIT_LFS_SKIP_SMUDGE1是必须的拉 LeRobot 依赖时需要它GIT_LFS_SKIP_SMUDGE1 uv sync GIT_LFS_SKIP_SMUDGE1 uv pip install -e .第三步跑一个不需要真机的 demo。开两个终端第一个起模型服务器第二个跑客户端它会生成随机 observation 并打印推理速率uv run scripts/serve_policy.py --env DROID uv run examples/simple_client/main.py --env DROID实际跑了一下客户端会连续刷出推理速率看到这个就说明这个预训练模型在你机器上通了。checkpoint 会自动从 gs://openpi-assets 下载并缓存到~/.cache/openpi不用手动拉。硬件门槛推理 8GB 显存README 给的示例卡是 RTX 4090系统只测过 Ubuntu 22.04不满足可以走 docs/docker.md 的容器路径。另外仓库现在有 JAX 和 PyTorch 两套实现API 相同PyTorch 版已在 LIBERO 上验证但暂不支持 LoRA 训练和 π₀-FAST。拆开模型内部预训练模型的视觉特征提取与动作token生成说白了一次推理就干一件事把图像 语言指令变成一串 token语言模型在这串 token 后面生成一段关节动作。核心环节就两个。视觉特征把 224×224 的图变成前缀输入→模型→输出外部相机图和腕部相机图客户端统一 resize 到 224×224进 siglip.py 里的 SigLIP 图像编码器输出的图像 token 和语言指令 token 拼成一个前缀。这一段是模型对场景的世界知识是 1 万小时预训练时读进去的。注意它的前缀只算一次并写入 KV cache后面的动作迭代直接复用这也是推理能跑起来的省算力的关键。动作生成把噪声去噪成一段轨迹输入→模型→输出前缀加上一段随机噪声动作进 Gemma 语言模型动作部分由独立的action expert小头处理flow matching 头迭代 10 步去噪最后输出 shape 为 (action_horizon, action_dim) 的 action_chunk。实际配置里机器人不是每步都问一次服务器而是把这整段动作开环执行跑完 N 步再来取下一段。README 里的例子从配置到拿到动作只有 4 行config _config.get_config(pi0_fast_droid) checkpoint_dir download.maybe_download(gs://openpi-assets/checkpoints/pi0_fast_droid) policy policy_config.create_trained_policy(config, checkpoint_dir) action_chunk policy.infer(example)[actions]为什么迁移到新场景只需要少量数据因为场景长什么样的理解和机械臂的操作先验已经躺在基座权重里微调只负责对齐你的关节空间和你的目标物体。README 里明确支持 LoRA 微调22.5GB 显存就够单张 4090 可以跑。换成你的作物要改什么预训练模型微调农业数据的六项适配别急你大概率要动这六个地方数据格式转换把采的示教数据转成 LeRobot 格式参考 convert_aloha_data_to_lerobot.py 这个例子checkpoint 选择base 还是 expert checkpoint看 README.md 的 checkpoint 表如果你的机器人在预训练分布里可以按 docs/norm_stats.md 重载预训练的归一化统计输入映射哪路相机算外部图、哪路算腕部图、动作维度是几参照 aloha_policy.py 的数据映射定义归一化统计训练前先跑uv run scripts/compute_norm_stats.py --config-name 配置名否则会报 missing norm stats 的错见 data_loader.py客户端图像管线图像要用 resize_with_pad 统一到 224×224 并转 uint8示例在 docs/remote_inference.md远程部署田里一般不给机械臂配 GPU模型放服务器上边缘端只负责采图和发指令客户端实现在 websocket_client_policy.py训练入口是uv run scripts/train.py 配置名README 里 LIBERO 的三步流程数据转换→训练→起服务器就是可以直接照抄的模板。它目前能做什么还差什么农业场景机器人操作边界对照表仓库里没有农业场景的实测数据下表数字全部来自仓库文档文档没写的直接标注未公开。场景已验证表现已知边界桌面抓取-放置DROID 单臂pi0_fast_droid checkpoint 可在新场景 0-shot 完成一系列简单桌面操作任务具体成功率未公开只输入 1 路外部相机 1 路腕部相机文档明说复杂操作任务上会失败ALOHA 双臂精细操作提供毛巾折叠、餐盒开盖两个 0-shot 现成 checkpoint平台是研究用 ALOHA 双臂文档只承诺may or may not work未做任何真实农业机械臂映射封闭仿真基准LIBEROπ₀.₅ 微调 checkpoint 在 4 个 LIBERO 子集平均 96.85为该基准 SOTA纯仿真基准非真实场景多遮挡、户外光照等条件完全未覆盖远程推理的延迟也要留意DROID 文档写明0.5–1 秒/段的延迟属于正常想在田里做高频控制得把 GPU 挪到离机械臂近一些。反过来文档也说推理时不用刻意调整相机角度和物体摆放部署宽容度比想象的高。README 的排错表还提醒如果数据的 q01/q99 在个别维度极小归一化后 loss 会发散需要手动调 norm_stats.json。clone 仓库git clone --recurse-submodules https://gitcode.com/GitHub_Trending/op/openpi跑 examples/aloha_sim/main.py 看看效果。【免费下载链接】openpi项目地址: https://gitcode.com/GitHub_Trending/op/openpi创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价