资讯动态

Nemotron Steps命令详解:一条CLI打通数据准备到模型评估全流程

发布时间:2026/10/8 23:23:50 来源:尧图企业网站定制
Nemotron Steps命令详解一条CLI打通数据准备到模型评估全流程【免费下载链接】NemotronDeveloper Asset Hub for NVIDIA Nemotron — A one-stop resource for training recipes, usage cookbooks, datasets, and full end-to-end reference examples to build with Nemotron models项目地址: https://gitcode.com/gh_mirrors/ne/NemotronNemotron是 NVIDIA 官方开源的开发者资源中心Developer Asset Hub汇集训练配方、使用手册与端到端示例。它内置的nemotron stepsCLI是贯穿机器学习工作流的核心工具一条命令即可串联数据准备、模型训练、微调对齐直至模型评估让新手无需手写胶水代码就能跑通全流程。本文用 4 个命令讲透这套 CLI 的使用方法。 什么是 Nemotron Steps3个核心概念在动手之前先花 1 分钟理解三个术语后面所有命令都围绕它们展开完整定义见 docs/steps/basics.md概念含义例子Step步骤有稳定 ID 的最小工作单元自带输入输出契约sft/automodel、eval/model_evalConfig配置一组具名参数值用-c选择tiny冒烟测试、default生产规模Artifact工件步骤间传递的带类型数据是串接流水线的“接头”training_jsonl、binidx、checkpoint_hf、eval_results所有步骤都位于源码目录 src/nemotron/steps/每个步骤目录下有一份step.toml契约文件和step.py执行脚本CLI 在启动时自动发现它们。 快速上手Nemotron CLI 安装步骤环境要求Python 3.10和 uv如仓库文档中的安装指引。三步即可运行# 1. 克隆仓库并进入目录 git clone https://gitcode.com/gh_mirrors/ne/Nemotron cd Nemotron # 2. 同步依赖 uv sync # 3. 验证 CLI 可用 uv run nemotron steps --help看到list、show、run三个子命令的说明就说明安装成功了。 命令一steps list —— 查看全部可用步骤uv run nemotron steps list输出是一张表格每行一个步骤包含步骤 ID、分类、消费的工件、生产的工件和简短描述。常用技巧# 按分类过滤分类名对应 src/nemotron/steps/ 下的一级目录 uv run nemotron steps list --category sft # 输出 JSON方便配合 jq 或 Agent 工具 uv run nemotron steps list --json # 反向查询谁生产/消费某类工件 uv run nemotron steps list --produces training_jsonl uv run nemotron steps list --consumes training_jsonl后两条命令是“找上下游”利器——先查谁生产training_jsonl再查谁消费它一条数据管线就浮现出来了。 命令二steps show —— 检查单个步骤的完整契约uv run nemotron steps show sft/automodel它会打印该步骤的完整 manifest描述、输入/输出工件及说明、全部参数含默认值和可选值、运行规格启动器、容器镜像、资源形状和默认配置。加--json可以拿到机器可读版本。新手建议运行任何步骤前先show一遍确认它的[consumes]你手里有、[produces]是你要的能避免 90% 的返工。⚡ 命令三steps run —— 一条命令执行任意步骤run是真正的执行入口实现见 src/nemotron/cli/commands/steps/run_cmd.py它完成四件事解析步骤 ID → 编译 YAML 配置与命令行覆盖 → 按环境档案选择后端 → 提交任务。# 本地运行 tiny 配置10分钟冒烟测试 uv run nemotron steps run sft/automodel -c tiny # 预览编译结果不真正执行推荐先跑这条 uv run nemotron steps run data_prep/sft_packing -c tiny --dry-run # 提交到集群-r 前台执行日志回传终端-b 后台执行立即返回 uv run nemotron steps run sft/automodel -c tiny -r lepton_sft_automodel uv run nemotron steps run sft/automodel -c default -b slurm_sft # 命令行覆盖任意参数keyvalue放在命令末尾 uv run nemotron steps run peft/automodel -c default train.train_iters5000全局参数速查表参数短写说明配置名-c/--config在步骤的config/目录中选取默认default前台执行-r/--run通过环境档案提交日志实时回传后台执行-b/--batch提交后立即返回干跑预览-d/--dry-run只编译配置不执行参数覆盖keyvalue点号分隔路径任意位置生效集群环境档案env.toml 的用法不带-r/-b就在本机跑要跑集群CLI 会从仓库根目录读取env.toml。远程档案常用env/env_toml步骤从模板一键生成# 从内置模板生成 Lepton 环境档案 uv run nemotron steps run env/env_toml -c lepton # 指向生成的档案 export NEMOTRON_ENV_FILEenv.lepton.toml模板支持 Lepton AI、Slurm、DGX Cloud 三种目标生成的 TOML 中用${oc.env:VAR_NAME}占位符引用密钥避免明文入库。️ 全流程总览从数据准备到模型评估把steps list的输出按分类整理就是一张覆盖端到端流程的路线图完整目录见 src/nemotron/steps/STEPS.md数据侧 训练侧 评估侧 ───────────────────────────────────────────────────────────── curate/nemo_curator pretrain/megatron_bridge eval/model_eval ↓ filtered_jsonl sft/megatron_bridge ↓ eval_results data_prep/pretrain_prep ──→ sft/automodel (LoRA: peft/*) data_prep/sft_packing ──→ rl/nemo_rl/* (DPO/RLVR/RLHF) data_prep/rl_prep ──→ optimize/modelopt/* (量化/剪枝/蒸馏) sdg/data_designer (合成数据) convert/* (checkpoint 格式互转)几个典型组合数据准备三件套curate/nemo_curator做清洗过滤然后按训练目标分叉——预训练走data_prep/pretrain_prep产出 bin/idx 分片SFT 走data_prep/sft_packing产出 packed ParquetRL 走data_prep/rl_prep产出提示/偏好分片。没有数据先合成sdg/data_designer内置三个配方可生成 SFT 对话数据、工具调用数据、DPO 偏好对产物synthetic_jsonl直接喂给 SFT 步骤。翻译语料translate/nemo_curator可翻译 JSONL 语料并附带 FAITH 质量评分。 工件Artifact接力流水线为什么能自动串起来步骤之间不写死路径而是靠工件类型匹配衔接sdg/data_designer生产training_jsonlsft/automodel消费training_jsonl所以合成数据可以直接进入微调无需中间转换。当两个步骤“说的是同一种东西但格式不同”时convert/*家族负责桥接——例如convert/megatron_to_hf把 Megatron 分布式检查点转成 HuggingFace safetensors 以便部署。常用工件类型清单raw_jsonl、filtered_jsonl、training_jsonl、synthetic_jsonl、packed_parquet、binidx、checkpoint_hf、checkpoint_megatron、checkpoint_lora、eval_results、mcq_benchmark_parquet。 最后一步eval 完成模型评估训练完成后用eval/model_eval打分收尾。它支持两种模式部署 Megatron 检查点后在 OpenAI 兼容端点上跑基准或直接评估已有托管端点。# 冒烟测试tiny 配置 干跑 uv run nemotron steps run eval/model_eval -c tiny_chat --dry-run # 正式评估指向具体 iter_* 检查点 uv run nemotron steps run eval/model_eval -c default -b my_cluster最佳实践是在每个改变模型质量的阶段前后都评估一次SFT 前、SFT 后、量化后这样任何一步掉点都能立刻定位。 实用技巧与参考资料先 tiny 后 defaulttiny配置只验证“管线能启动、数据路径接对、集群能收任务”不能当质量证据确认无误后再换default上生产。--dry-run是好习惯编译完配置即退出能提前暴露参数拼写、工件缺失等问题。JSON 输出喂 Agentlist/show的--json输出无格式噪音非常适合脚本化处理。静态检查nemotron steps lint可对步骤 manifest 做静态校验。详细教程docs/steps/getting-started.md、概念定义见 docs/steps/basics.md、目录索引见 docs/steps/index.md。各领域进阶文档docs/sdg/合成数据、docs/translation/翻译、docs/train-models/训练、docs/model-eval/评估。总结Nemotron Steps 的核心设计哲学是契约化每个步骤声明自己消费和生产的工件类型CLI 通过list/show暴露全部契约用run统一执行入口。掌握list发现、show检查、run执行三个命令和-c、-r、-b、--dry-run四个参数你就能用一条 CLI 打通数据准备到模型评估的完整流程——这正是 NVIDIA 把训练配方、数据工具与评估器装进同一个资源中心的设计意图。【免费下载链接】NemotronDeveloper Asset Hub for NVIDIA Nemotron — A one-stop resource for training recipes, usage cookbooks, datasets, and full end-to-end reference examples to build with Nemotron models项目地址: https://gitcode.com/gh_mirrors/ne/Nemotron创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价 →
↑