资讯动态

如何用 LeRobot 在 MetaWorld MT50 基准上评估策略?

发布时间:2026/9/13 8:48:06 来源:尧图企业网站定制
如何用 LeRobot 在 MetaWorld MT50 基准上评估策略【免费下载链接】lerobot LeRobot: Making AI for Robotics more accessible with end-to-end learning项目地址: https://gitcode.com/GitHub_Trending/le/lerobot你手上已经有一个训练好的策略VLA 或通用操作策略想在 LeRobot 内置的 Meta-World 仿真环境中用完整的 MT5050 个任务基准衡量它的多任务表现。完成这篇文章后你会得到一次覆盖 50 个任务、每任务 10 个回合共 500 个回合的评估以及按任务组和整体汇总的成功率指标。前提是已按 LeRobot 官方安装说明装好 LeRobot并且策略与 Meta-World 环境的观测/动作接口一致。MT50 基准包含什么Meta-World 是面向多任务与元强化学习的连续控制操作仿真基准在固定的 Sawyer 机械臂桌面上捆绑了 50 个任务。LeRobot 支持按单个任务、难度分组或完整 MT50 来评估分组如下引自 Meta-World 文档分组CLI 名称任务数说明Easyeasy28简单动力学、单步目标Mediummedium11需要多步推理Hardhard6复杂接触与精细操作Very Hardvery_hard5套件中最难的任务MT50全部逗号分隔列表50完整多任务设置四个难度组合计 28 11 6 5 50正好覆盖全部任务所以--env.taskeasy,medium,hard,very_hard等价于跑完整 MT50文档中 MT50 一行给出的 CLI 形式是「Comma-separated list」即把 50 个任务名用逗号列出。文档同时说明 MT50 评估使用固定物体/目标位置与 one-hot 任务向量来保持一致性并在 HF Hub 提供了对应的 LeRobot 格式数据集lerobot/metaworld_mt50若你还没有策略它是训练侧的配套数据。策略侧需要匹配的接口来自同一文档的 Policy inputs and outputs 一节observation.image—— 单个corner2相机视角480x480 HWC uint8observation.state—— 4 维本体感知末端位置 夹爪动作 ——Box(-1, 1, shape(4,))即 3 维末端增量 1 维夹爪。准备环境在按 LeRobot 官方安装说明完成安装之后追加 Meta-World 扩展依赖pip install -e .[metaworld]该 extra 会同时安装lerobot[dataset]、metaworld3.0.0与lerobot[scipy-dep]见 pyproject.toml 的依赖定义。文档给出了一个明确的排错项如果在运行 Meta-World 环境时遇到AssertionError: [human, rgb_array, depth_array]这是 Meta-World 与你的 Gymnasium 版本不匹配用下面命令修复pip install gymnasium1.1.0策略路径是评估命令的前置条件。--policy.path可以填 Hub 上策略的 repo ID或指向一个用Policy.save_pretrained保存的本地目录见 eval 配置。注意如果完全不提供该参数LeRobot 会用随机权重从零构建策略并只发出一条警告此时评估结果没有意义务必检查输出日志确认加载的是你的策略。运行 MT50 评估最短主路径——完整 MT50、每任务 10 个回合文档推荐的可复现基准设置50 个任务共 500 个回合lerobot-eval \ --policy.pathyour-policy-id \ --env.typemetaworld \ --env.taskeasy,medium,hard,very_hard \ --eval.batch_size1 \ --eval.n_episodes10其中your-policy-id替换为你的策略 repo ID 或本地权重目录路径其余参数与文档示例一致--env.task接受逗号分隔的显式任务名列表如assembly-v3,dial-turn-v3或难度组名--eval.batch_size控制并行运行的环境数量--eval.n_episodes设定每个任务运行的回合数。在跑完整 MT50 之前可以先用文档标注为 Default evaluation (recommended) 的 medium 分组11 个任务做一次快速验证确认策略能正常加载、环境能出图lerobot-eval \ --policy.pathyour-policy-id \ --env.typemetaworld \ --env.taskmedium \ --eval.batch_size1 \ --eval.n_episodes10medium 是覆盖度与算力之间的平衡点确认流程跑通后再切换回上面的 MT50 命令。验证评估结果运行过程中lerobot-eval会在进度条上实时显示running_success_rate百分比成功判定取自每个环境info[is_success]键见 eval 脚本 中的final_info处理逻辑以及 Meta-World 环境实现 中每步写入的is_success字段。跑完后脚本按任务组和整体两个层面累计sum_rewards、max_rewards、successes等指标见 eval 脚本 中的_accumulate_to聚合逻辑这就是你与 MT50 基准对齐的最终成功率。文档也提醒写后处理或日志时以info[is_success]作为成功指标才能与基准口径一致。评估产物默认写入outputs/eval/日期/时间_job_name目录未指定--output_dir时见 eval 配置。限制与注意事项单个回合最多 500 步环境按 MT1 配置构建max_path_length500Meta-World 环境实现 中的_max_episode_steps达到上限即截断成功与否以is_success为准。完整 MT50 共 500 个回合算力开销明显高于 medium11 个任务--eval.batch_size越大并行环境越多文档示例统一使用 1可按机器情况调整。若你计划训练多任务策略再回来评估文档建议采用 MT10/MT50 惯例的 one-hot 任务条件化让策略拥有显式任务上下文。遇到前面提到的 Gymnasium 断言错误时直接按pip install gymnasium1.1.0处理不要升级其他依赖猜测修复。【免费下载链接】lerobot LeRobot: Making AI for Robotics more accessible with end-to-end learning项目地址: https://gitcode.com/GitHub_Trending/le/lerobot创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价