资讯动态

NVIDIA Cosmos 上手实战:五个阶段跑通物理世界视频生成

发布时间:2026/8/19 20:24:58 来源:尧图企业网站定制
NVIDIA Cosmos 上手实战五个阶段跑通物理世界视频生成【免费下载链接】cosmosNVIDIA Cosmos is an open platform of world models, datasets, and tools that enables developers to build Physical AI for robots, autonomous vehicles, smart infrastructure, and more.项目地址: https://gitcode.com/GitHub_Trending/cosmos7/cosmos如果你在做机器人、自动驾驶或智慧基础设施相关项目一定遇到过同一个瓶颈真实世界的训练数据太贵、太难采集。NVIDIA Cosmos 正是冲着这个问题来的——它是一套开源的世界模型平台能根据一段文字描述或一段现成视频自动生成符合物理规律的模拟画面帮你批量制造训练素材。这篇文章会沿着看懂原理 → 搭好环境 → 跑通推理 → 调优效果 → 选型落地这条路线带你从零把 Cosmos 用起来。阶段一先看懂它——Cosmos 到底在解决什么问题传统生成模型擅长画画、写文但 Cosmos 关注的是物理世界本身。它要回答的问题是给一个场景的起点接下来几秒内这个世界会怎么演化比如一辆车驶向路口下一秒会不会停下、会不会有行人出现。这类能预测世界下一步的模型就是世界模型World Model。Cosmos 平台里其实塞了三样东西扩散式世界模型Diffusion支持 Text2World纯文本生成世界和 Video2World视频/图片续写世界两条路线自回归式世界模型Autoregressive主打基于视频输入预测未来画面视频分词器Tokenizer把视频压缩成连续或离散的 token是整个流水线的翻译官。一句话概括技术栈分词器负责把画面变成模型能读的语言世界模型负责预测接下来的剧情最后再解码回视频。下图就是这套架构的完整示意。看懂这一步的价值在于你后续下载的每个模型包在流水线里各司其职缺了哪个都会报错先有全局观排错时就不慌。阶段二搭好环境——把 Docker 容器跑起来Cosmos 官方只验证过 Ubuntu 系统20.04 / 22.04 / 24.04并且强烈建议用 Docker 隔离环境。你不需要手动装一堆 CUDA 依赖容器里全配好了。操作分三步安装 NVIDIA Container Toolkit让容器能用上宿主的 GPU拉取仓库代码git clone https://gitcode.com/GitHub_Trending/cosmos7/cosmos cd cosmos构建并进入容器docker build -t cosmos . docker run -d --name cosmos_container --gpus all --ipchost -it -v $(pwd):/workspace cosmos docker attach cosmos_container这三条命令分别做了什么第一条把镜像构建出来第二条把当前目录挂载进容器并开启全部 GPU这样你在容器里生成的视频能直接落在宿主机磁盘上第三条进入交互终端之后的命令都在里面执行。踩坑提醒如果你之前装过旧版 Docker--gpus all可能报错多半是 Container Toolkit 没装全先跑nvidia-smi确认宿主机能识别 GPU再回头检查 toolkit。阶段三拿到权重——生成你的第一条物理世界视频模型权重托管在 Hugging Face 上动手下载前要办三件事在 HF 官网生成一个访问令牌权限选Read默认的 Fine-grained 反而容易出问题用huggingface-cli login在容器里登录去 Mistral 的 Pixtral-12B 模型页面点一下 Agree and access repository——这个模型负责给视频生成提示词不授权就下不全。然后一条命令下载全套权重7B、14B 的 Text2World 和 Video2World 一起拿PYTHONPATH$(pwd) python cosmos1/scripts/download_diffusion.py \ --model_sizes 7B 14B \ --model_types Text2World Video2World下载完的checkpoints/目录里除了四个主模型还会自动带上分词器、提示词上采样器和安全护栏后续推理全靠它们。第一条视频纯文本驱动Text2World先用最轻的 7B 模型试水只需准备一段场景描述PROMPT一个优雅的人形机器人站在巨大的仓库中周围是整齐堆放在工业货架上的纸箱金属身体在明亮均匀的灯光下闪闪发光。 PYTHONPATH$(pwd) python cosmos1/models/diffusion/inference/text2world.py \ --checkpoint_dir checkpoints \ --diffusion_transformer_dir Cosmos-1.0-Diffusion-7B-Text2World \ --prompt $PROMPT \ --offload_prompt_upsampler \ --video_save_name 我的第一条物理世界视频--offload_prompt_upsampler表示提示词上采样器用完就卸载H100 上跑 14B 模型也建议带上它。生成一条 121 帧的视频在单卡 H100 上大约要 380 秒够你泡杯咖啡了。第二条视频用一张图续写世界Video2World如果你手头有真实场景的照片或视频可以让 Cosmos 顺着它继续演下去——这正是机器人仿真最常用的玩法。项目自带了一张高速公路的示例图PYTHONPATH$(pwd) python cosmos1/models/diffusion/inference/video2world.py \ --checkpoint_dir checkpoints \ --diffusion_transformer_dir Cosmos-1.0-Diffusion-7B-Video2World \ --input_image_or_video_path cosmos1/models/diffusion/assets/v1p0/video2world_input0.jpg \ --num_input_frames 1 \ --video_save_name 视频生成示例 \ --offload_prompt_upsampler--num_input_frames只支持 1 或 91 表示输入一张图9 表示输入一段短视频的开头几帧。注意 Video2World 默认开启提示词上采样器也就是让模型自己看图写描述想自己指定文案要额外加--disable_prompt_upsampler和--prompt。阶段四调优三件套——显存、批量、提示词显存不够怎么办按需卸载Cosmos 的推理脚本提供了五档卸载开关--offload_tokenizer、--offload_diffusion_transformer、--offload_text_encoder_model、--offload_prompt_upsampler、--offload_guardrail_models。本质都是用完即扔把模型权重从显存挪回内存代价是速度略慢。以 7B Text2World 为例官方给出的显存占用阶梯大致如下卸载策略峰值显存只卸载提示词上采样器约 74 GB加上安全护栏约 57 GB再加 T5 文本编码器约 38.5 GB再加分词器约 38.3 GB最后连扩散模型也卸载约 24.4 GB结论很直白RTX 3090 / 4090 这种 24GB 显存的卡把五个开关全打开就能跑H10080GB只需要卸上采样器和护栏A10040GB可以参考中间档位。低显存全开的长命令可以直接照着拼。批量生成一次喂一批 prompt单条跑通后批量生成才是提效关键。准备一个 JSONL 文件每行一条记录{prompt: prompt1} {prompt: prompt2}然后指定--batch_input_path和输出目录PYTHONPATH$(pwd) python cosmos1/models/diffusion/inference/text2world.py \ --checkpoint_dir checkpoints \ --diffusion_transformer_dir Cosmos-1.0-Diffusion-7B-Text2World \ --batch_input_path cosmos1/models/diffusion/assets/v1p0/batch_inputs/text2world.jsonl \ --video_save_folder outputs/批量结果 \ --offload_prompt_upsamplerVideo2World 的 JSONL 对应字段是visual_input写输入文件路径如果同时关了上采样器则每行要同时写prompt和visual_input。提示词质量上限的钥匙模型效果好不好七成看提示词。三条经验值得记住只写一个场景别贪多否则模型会自作主张切镜头长度控制在 120 词左右太短没细节太长反而干扰少提相机运动当前版本对镜头控制理解有限。另外默认开启的提示词上采样器会把你的短句扩写成大段描述偶尔会跑偏加戏。发现输出偏离初衷时用--disable_prompt_upsampler关掉它用自己的原文生成。阶段五选对型号、守住边界、再往前走一步模型家族怎么选模型用途适合谁Diffusion-7B / 14B Text2World文本生成世界快速出 demo、效果验证Diffusion-7B / 14B Video2World视频/图片续写世界机器人仿真数据生产Autoregressive-4B / 12B未来世界生成时序预测类任务Autoregressive-5B / 13B Video2World视频续写追求长程一致性的场景经验法则先上 7B 把流程跑通再换 14B 提质量对推理速度有要求就留 7B。单卡 H100 上 14B 单视频约 590 秒比 7B 慢了半程自己权衡。三条硬性边界提前知道省得白跑安全护栏不可关闭Cosmos 内置人脸模糊和内容安全过滤生成人脸会被自动打码这是设计如此别想绕过规格锁死当前版本只支持 121 帧输出帧率可在 12-40fps 间调宽高比支持 1:1、4:3、3:4、16:9、9:16 几档效果有上限毕竟是生成模型物理细节偶有瑕疵关键场景要多抽几次种子对比。再进一步后训练定制通用模型不够贴需求Cosmos 基于 NeMo 框架提供了后训练脚本可以针对自己的数据微调扩散模型和自回归模型具体流程见仓库里的cosmos1/models/POST_TRAINING.md。这属于进阶玩法建议先把推理链路吃透再碰。关于性能官方的分词器在吞吐和重建质量上都做了优化下图是不同 tokenizer 的耗时对比选型时可以参考常见疑问速答Q只有 24GB 显存能玩吗能。五个卸载开关全开即可速度会慢一些但能跑。Q为什么生成的人脸是糊的安全护栏强制模糊人脸属于正常现象不是模型坏了。Q提示词写得很详细结果还是多镜头乱切试试删掉镜头运动相关描述并把场景限定在单一画面内。Q下载总在中途失败多半是 Pixtral-12B 没授权先确认 Hugging Face 令牌权限是 Read并同意过该模型的访问协议。快速上手要点环境先行Ubuntu NVIDIA Container Toolkit Docker按官方三步把容器拉起来别在宿主机裸奔先 7B 后 14B7B 模型配全量卸载跑通全流程再逐步升级模型和关闭卸载开关提示词是杠杆单一场景、120 词左右、避免镜头指令配合批量 JSONL 一次产出多条数据。现在就去克隆仓库、跑通第一条视频吧。从一张仓库里的示例图开始到批量生成你自己的仿真场景这个过程比想象中快——动手才是最好的老师。【免费下载链接】cosmosNVIDIA Cosmos is an open platform of world models, datasets, and tools that enables developers to build Physical AI for robots, autonomous vehicles, smart infrastructure, and more.项目地址: https://gitcode.com/GitHub_Trending/cosmos7/cosmos创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价