资讯动态

SV3D单图生成3D环绕视频:从安装到跑出第一个结果

发布时间:2026/9/4 13:21:59 来源:尧图企业网站定制
SV3D单图生成3D环绕视频从安装到跑出第一个结果【免费下载链接】generative-modelsGenerative Models by Stability AI项目地址: https://gitcode.com/GitHub_Trending/ge/generative-models商品页面常常只有一张正面图买家看不到侧面和背面。generative-models 仓库里的 SV3D 模型用一张 576×576 图片作为输入就能生成一段 21 帧的 3D 环绕视频让物体在视频里转上一圈。‍ 它适合谁、解决什么问题SV3DStable Video 3D把单张图片变成多视角环绕视频不需要建模也不需要环绕拍摄设备。它适合想跑通图生视频、多视角生成链路的开发者需要让静态商品图转起来的电商与内容团队需要 360 度环绕素材但没有实拍条件的创作者能做的事给定一张图输出 21 帧、576×576 分辨率的环绕视频6fps 下约 3.5 秒提供sv3d_u自动环绕和sv3d_p自定义相机路径两个模型版本。 安装、下权重、跑出第一个结果环境要求 Python 3.10 NVIDIA CUDA GPU。克隆仓库并安装依赖git clone https://gitcode.com/GitHub_Trending/ge/generative-models cd generative-models python3.10 -m venv .pt2 source .pt2/bin/activate pip3 install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu118 pip3 install -r requirements/pt2.txt .下载 SV3D_u 权重到checkpoints/huggingface-cli download stabilityai/sv3d sv3d_u.safetensors --local-dir checkpoints用仓库自带的示例图运行推理脚本python scripts/sampling/simple_video_sample.py --input_path assets/test_image.png --version sv3d_u跑出来长这样输入是一张静态图样例输入可参考 assets/test_image.png输出是相机绕主体转一圈的短视频。视频和输入图一起保存在outputs/simple_video_sample/sv3d_u/。 按需求选择生成模式版本需要提供什么什么时候用sv3d_u一张图要标准 360 度环绕不想调相机sv3d_p一张图 仰角/方位角序列要精确控制相机高度与环绕角度SV3D_u免参数一键环绕命令即上文跑出第一个结果中的那条无需任何相机参数。可调项--num_steps默认 50调低到 20 可先快速预览--seed固定随机种子保证结果可复现--decoding_t一次解码的帧数显存吃紧时调小SV3D_p自定义相机路径elevations_deg仰角传单个数值表示恒定高度环绕传 21 个数值则逐帧改变相机高度。azimuths_deg是 21 个按 0 到 360 递增排列的方位角不指定时默认为均匀 360 度环绕。python scripts/sampling/simple_video_sample.py --input_path your_image.png \ --version sv3d_p --elevations_deg 10.0SV4D输入视频生成时间 × 视角的 4D 结果SV4D 接收 21 帧的输入视频gif/mp4输出新增视角的视频它先用 SV3D 生成首帧的多视角参考再由 4D 模型补全其余视角。需要把sv4d.safetensors和sv3d_u.safetensors两个权重都下到checkpoints/分别来自stabilityai/sv4d与stabilityai/sv3d仓库python scripts/sampling/simple_video_sample_4d.py --input_path assets/sv4d_videos/test_video1.mp4 --output_folder outputs/sv4d--remove_bgTrue对纯色背景视频自动去背景--encoding_t/--decoding_t一次编码/解码的帧数低显存时调小--img_size输入分辨率默认 576️ 先看效果再谈能用在哪儿上面分别是单物体图片的环绕结果机器人是刚体结构风车带旋转部件可以对比不同结构主体在环绕时的稳定性。输入图以主体占画面大部分、背景简单最好白底为佳脚本会自动去背景、裁切并居中背景不必完美干净。落地场景电商商品展示把商品正面图交给sv3d_u生成 360 度环绕视频挂进详情页买家能直接看到侧面与背面教学与科普文物、解剖结构图从单张变多角度演示比静态图直观社媒内容环绕短视频比静图更容易让人停留适合新品发布和种草素材原理一句话SV3D 在 U-Net 上加入了时间维度以首帧为条件预测 21 帧的潜变量再由 VAE 逐帧解码成视频。网络与时间注意力sgm/modules/diffusionmodules/video_model.pysv3d_p 的仰角/方位角作为条件输入configs/inference/sv3d_p.yaml采样与模型参数scripts/sampling/configs/sv3d_u.yaml 常见问题现象运行到一半显存不足CUDA OOM原因sv3d_u默认一次解码 14 帧解码是最吃显存的环节。 解法运行时加--decoding_t 4SV4D 再加--encoding_t 1。现象环绕发糊、主体变形原因输入图不符合训练分布——背景杂乱、主体过小或偏心。 解法换白底或简单背景、单一主体的图片用--image_frame_ratio调节主体在画面中的占比值越接近 1主体占满程度越高。现象一次生成耗时太长原因默认 50 步去噪 × 21 帧每步都要对全序列做计算。 解法设--num_steps 20耗时约为原来一半细节略有下降适合先批量预览再精修。适合想把静态图变成 3D 环绕视频的开发者与内容团队。下一步选一张自己的商品图跑一遍上文 SV3D_p 那条命令观察elevations_deg取 10 和 30 时的差异。【免费下载链接】generative-modelsGenerative Models by Stability AI项目地址: https://gitcode.com/GitHub_Trending/ge/generative-models创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价