资讯动态

Lens 模型推理指南:在 stable-diffusion.cpp 中运行 Lens 与 Lens Turbo 文生图

发布时间:2026/9/28 13:03:08 来源:尧图企业网站定制
人工智能大模型本地部署推理引擎媒体生成【免费下载链接】stable-diffusion.cppDiffusion model(SD,Flux,Wan,Qwen Image,Z-Image,...) inference in pure C/C项目地址https://gitcode.com/GitHub_Trending/st/stable-diffusion.cpp点击查看免费下载Lens 是 stable-diffusion.cpp 中一类以Lens 扩散 Transformer FLUX.2 VAE GPT-OSS-20B 文本编码器组合而成的新型文生图模型。本文以仓库 docs/lens.md 为主线完整介绍权重下载、GPT-OSS 外部 tokenizer 配置、CLI 实战命令与关键参数并结合 src/model/diffusion/lens.hpp 的源码剖析其网络结构与推理实现帮助你在一套纯 C/C 推理框架中稳定跑通 Lens 和蒸馏版 Lens Turbo。模型架构总览Lens 的组成非常明确文档给出了三块核心组件组件用途说明Lens 扩散 Transformer去噪主干网络采用类似 Flux 的双流图像/文本联合注意力DiT 结构FLUX.2 VAE图像自编码器负责 latent 与像素空间的相互转换与 FLUX.2 共用flux2_ae权重GPT-OSS-20BLLM 文本编码器以大型语言模型取代传统 CLIP/T5语义理解能力更强从源码看Lens 的扩散主干被完整实现在 src/model/diffusion/lens.hpp 的Lens::LensModel与Lens::LensRunner中并在 src/pipeline/model_builders.cpp 中通过sd_version_is_lens(version)判定后以LLMEmbedder文本编码侧Lens::LensRunner扩散侧的组合构建管线与文档所述的三段式架构完全吻合。权重下载清单Lens 推理共需要 4 类权重文件请按下列清单逐一准备Lens 扩散模型safetensors从 Comfy-Org/Lens 仓库的diffusion_models目录下载lens_bf16.safetensors普通版与lens_turbo_bf16.safetensorsTurbo 蒸馏版。FLUX.2 VAEsafetensors从 black-forest-labs/FLUX.2-dev 目录下载flux2_ae.safetensors即 docs/flux2.md 中使用的同一 VAE。GPT-OSS-20B 文本编码器gguf从 unsloth/gpt-oss-20b-GGUF 下载 GGUF 量化版例如gpt-oss-20b-UD-Q8_K_XL.gguf。GPT-OSS-20B 的tokenizer.json从 openai/gpt-oss-20b 目录下载保存为tokenizer_gpt_oss.json必须与所选 GPT-OSS 检查点匹配。推荐将文件按以下目录结构组织便于命令行引用models/ ├── diffusion_models/ │ ├── lens_bf16.safetensors │ └── lens_turbo_bf16.safetensors ├── text_encoders/ │ └── gpt-oss-20b-UD-Q8_K_XL.gguf ├── vae/ │ └── flux2_ae.safetensors └── tokenizers/ └── tokenizer_gpt_oss.json为什么 Lens 必须使用外部 tokenizer.json与大多数自带 tokenizer 的模型不同Lens 和 Lens Turbo 的 GPT-OSS tokenizer 并未内嵌在 sd.cpp 中。文档明确指出保存为tokenizer_gpt_oss.json后必须通过--tokenizer显式传入初始化时若缺少主 tokenizer 会直接失败。这背后的实现约束可以从源码得到印证src/model/te/llm.hpp 中明确抛出异常——GPT-OSS, Gemma 2 and LLaDA2 require an external tokenizer.json in the main tokenizer slot且GPT_OSS_20B被列入LLMArch架构枚举见 src/model/te/llm.hpp。详细的 CLI 与 C API 用法请参阅 docs/tokenizers.md要点如下--tokenizer FILE作用于主 LLM/BPE 编码器槽位Gemma 2/3、Qwen 2/3、Mistral、GPT-OSS 等普通路径等价于mainFILE可以多槽位组合如--tokenizer mainmain.json,clip-lclip_l.jsonJSON 文件的 vocabulary/merges/added tokens 必须与文本编码器检查点匹配仅凭ID 不超出 embedding 表无法证明词汇表语义一致文件加载发生在文本编码器创建时此时不会加载内嵌词表。CLI 实战运行 Lens文档给出的 Lens 完整命令Windows 路径如下.\bin\Release\sd-cli.exe --diffusion-model ..\models\diffusion_models\lens_bf16.safetensors --llm ..\models\text_encoders\gpt-oss-20b-UD-Q8_K_XL.gguf --tokenizer ..\models\tokenizers\tokenizer_gpt_oss.json --vae ..\models\vae\flux2_ae.safetensors --cfg-scale 5.0 -p A crystal dragon soaring through an aurora borealis sky, its entire body made of transparent faceted crystal refracting the green and purple aurora light into rainbow spectra, ice particles trailing from its wings, high fantasy digital art --diffusion-fa -v在 Linux/macOS 上等价写法为按上文目录结构且bin/sd-cli为编译产物所在目录./bin/sd-cli --diffusion-model models/diffusion_models/lens_bf16.safetensors \ --llm models/text_encoders/gpt-oss-20b-UD-Q8_K_XL.gguf \ --tokenizer models/tokenizers/tokenizer_gpt_oss.json \ --vae models/vae/flux2_ae.safetensors \ --cfg-scale 5.0 \ -p A crystal dragon soaring through an aurora borealis sky, its entire body made of transparent faceted crystal refracting the green and purple aurora light into rainbow spectra, ice particles trailing from its wings, high fantasy digital art \ --diffusion-fa -vCLI 实战运行 Lens TurboLens Turbo 是蒸馏加速版本核心差异是--cfg-scale必须降到 1.0并配合--steps 4使用极少的去噪步数.\bin\Release\sd-cli.exe --diffusion-model ..\models\diffusion_models\lens_turbo_bf16.safetensors --llm ..\models\text_encoders\gpt-oss-20b-UD-Q8_K_XL.gguf --tokenizer ..\models\tokenizers\tokenizer_gpt_oss.json --vae ..\models\vae\flux2_ae.safetensors --cfg-scale 1.0 -p A crystal dragon soaring through an aurora borealis sky, its entire body made of transparent faceted crystal refracting the green and purple aurora light into rainbow spectra, ice particles trailing from its wings, high fantasy digital art --diffusion-fa -v --steps 4关键参数详解参数取值示例作用与建议--diffusion-modellens_bf16.safetensors/lens_turbo_bf16.safetensors指定 Lens/Lens Turbo 扩散模型权重--llmgpt-oss-20b-UD-Q8_K_XL.gguf指定 GPT-OSS-20B 文本编码器 GGUF--tokenizertokenizer_gpt_oss.json指定外部 GPT-OSS tokenizer必填--vaeflux2_ae.safetensors指定 FLUX.2 VAE 权重--cfg-scaleLens 用5.0Lens Turbo 用1.0无分类器引导强度Turbo 蒸馏模型必须为 1.0--stepsTurbo 用4采样步数蒸馏版建议极少步数--diffusion-fa-为扩散模型启用 Flash Attention降低显存/内存压力-v-输出详细日志便于观察加载与推理过程补充说明GPT-OSS-20B 是约 200 亿参数级别的 MoE 语言模型建议使用 Q8_K 等高保真量化 GGUF若显存不足可参考其他文档中常见的--offload-to-cpu选项将部分权重驻留 CPU--cfg-scale与--steps的取值直接影响生成质量Lens 普通版用 5.0 保持提示词遵循度Lens Turbo 则必须用 1.0 才能与蒸馏权重匹配切勿混用。源码级实现剖析配置自动探测Lens::LensConfig::detect_from_weightssrc/model/diffusion/lens.hpp会在加载权重时自动推导超参数由img_in.weight得到in_channels默认 128由proj_out.weight与 patch size 推导out_channels默认 32由transformer_blocks.0.attn.norm_q.weight得到attention_head_dim默认 64并按txt_in.weight与joint_attention_dim2880之比得到selected_layer_count默认 4。其默认配置为 48 层 Transformer、24 个注意力头、axes_dim {8, 28, 28}、RoPEtheta 10000。双流联合注意力 TransformerLensTransformerBlocksrc/model/diffusion/lens.hpp与LensJointAttentionsrc/model/diffusion/lens.hpp展示了核心结构图像序列与文本序列各自投影出 Q/K/V经 RMSNorm 归一化后拼接在一起做联合注意力再按图像/文本视图拆开分别输出块内以 AdaLN 调制img_mod.1/txt_mod.1输出 6 组调制系数与 Gated MLPLensGateMLP即 SwiGLU 变体完成特征变换。这解释了为什么 Lens 需要 LLM 级别的文本编码——txt_in的输入维度是joint_attention_dim * selected_layer_count2880×4即拼接了 GPT-OSS 多个层的隐状态来驱动条件注入。图构建与位置编码LensRunner::build_graphsrc/model/diffusion/lens.hpp以LENS_GRAPH_SIZE 40960开辟计算图调用Rope::gen_lens_pe依据图像分辨率与文本长度生成轴向位置编码并将x、timesteps、context三路输入送入LensModel::forward经过 patch 化patch size 2、img_in/txt_in投影、48 层联合注意力与 AdaLN 归一化后由proj_out还原为 latent。get_desc()返回lens供日志与调试区分。管线注册在 src/pipeline/model_builders.cpp 中Lens 分支使用LLMEmbedder作为 conditioner负责调用 GPT-OSS 编码提示词配合Lens::LensRunner完成去噪模型版本VERSION_LENS与判定函数sd_version_is_lens定义于 src/model.h 与 src/model.h。C API 使用提示如果你通过 C API 集成 Lens需要把外部 tokenizer 路径写入sd_ctx_params_t::tokenizer。该字段接受与 CLI--tokenizer相同的字符串如maintokenizer_gpt_oss.jsonTokenizerConfig会在文本编码器初始化时解析并校验对 Lens/PiD 这类模型主 tokenizer 路径必须非空否则初始化失败详见 docs/tokenizers.md。sd_ctx_params_t params; sd_ctx_params_init(params); params.tokenizer maintokenizer_gpt_oss.json;常见问题与注意事项缺少 tokenizer 导致初始化失败必须下载 openai/gpt-oss-20b 的tokenizer.json并重命名为tokenizer_gpt_oss.json用--tokenizer传入主槽位这是 Lens 与 PiD 等模型的内嵌约束无法省略。Turbo 版输出异常确认--cfg-scale 1.0与--steps 4均已设置蒸馏模型对这两项参数有严格要求。文本编码器与 tokenizer 不匹配请从同一来源下载配套的 GPT-OSS 检查点与词表避免 ID 映射错位导致生成内容漂移。VRAM 限制GPT-OSS-20B 体量较大可在命令中加入--offload-to-cpu并配合--diffusion-fa降低显存占用具体以你机器实际可用显存为准。至此你已经掌握了 Lens / Lens Turbo 在 stable-diffusion.cpp 中的完整推理方案从四类权重准备、外部 tokenizer 配置到两条可直接运行的 CLI 命令与背后 DiT 架构的源码印证足以基于仓库源码进一步定制与调试。赞分享人工智能大模型本地部署推理引擎媒体生成【免费下载链接】stable-diffusion.cppDiffusion model(SD,Flux,Wan,Qwen Image,Z-Image,...) inference in pure C/C项目地址https://gitcode.com/GitHub_Trending/st/stable-diffusion.cpp点击查看免费下载相关推荐Druid 中的 Lens 与 Lens trait数据聚焦、组合与零成本抽象实战指南Druid 中的 Lens 与 Lens trait数据聚焦、组合与零成本抽象实战指南 导读 Lens透镜是 Druid 中与 Data 并列的核心抽象之跨平台桌面应用UI组件Chroma1-Radiance 文本生成图像实战在 stable-diffusion.cpp 中配置与运行 Radiance 蒸馏模型Chroma1 Radiance 文本生成图像实战在 stable diffusion.cpp 中配置与运行 Radiance 蒸馏模型 本篇技术指南围绕 s人工智能大模型本地部署推理引擎媒体生成上一篇MAA 明日方舟一键长草完整指南5 分钟装好并跑通自动日常下一篇nltk_data最佳实践10个技巧提升你的NLP项目效率创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价 →
↑