资讯动态

AMD显卡跑通kohya_ss:LoRA与TI训练全流程

发布时间:2026/9/13 20:07:09 来源:尧图企业网站定制
AMD显卡跑通kohya_ssLoRA与TI训练全流程【免费下载链接】kohya_ss项目地址: https://gitcode.com/GitHub_Trending/ko/kohya_ss在 AMD 显卡上跑通 kohya_ss你能用 10~20 张图片训练出 LoRA 模型、文本嵌入或完整风格模型ROCm 环境一次配好GUI 里点选参数即可开始训练产出可直接加载使用的模型文件。能力全景按目标选训练方式想固定一个角色或物品DreamBooth 训练用少量图片学出特定人物或物品配合 trigger word 稳定召唤LoRA / LoHa / LoKr 网络训练10~100MB 的轻量网络文件即训即用Textual Inversion只训练一个嵌入向量把某个概念绑定到指定词想复刻一种画风全量微调finetune更新基础模型全部权重得到独立 .safetensors 模型LECO 概念擦除反向训练去掉模型里已有的某个概念或风格支持 SD1.5/2.x、SDXL、SD3、Flux.1、Lumina、HunyuanImage-2.1 等底座想先把数据整理好tools/caption.py按图片批量生成同名 .txt 描述文件group_images 工具按尺寸把图片分桶归组喂给 bucket 训练presets/lora/SDXL 社区参数预设直接导入 GUI 起步仓库自带测试数据集的样本图AMD显卡5分钟装完ROCm环境一次配齐前提LinuxUbuntu 20.04/22.04 ROCm 6.3 及以上 Python 3.10/3.11。装好 ROCm 驱动后一个连续流程走完git clone --recursive https://gitcode.com/GitHub_Trending/ko/kohya_ss cd kohya_sspip install -r requirements_linux_rocm.txt该文件锁定了 AMD 专用依赖栈torch2.7.1rocm6.3、tensorflow-rocm、onnxruntime-rocm其余依赖继承 requirements.txt。./setup.sh ./gui.sh浏览器打开 Gradio 页面即完成部署。最小验证python -c import torch; print(torch.__version__, torch.cuda.is_available())输出2.7.1rocm6.3 True即表示 PyTorch 已识别到 AMD GPU。两条典型工作流TI嵌入与全量微调工作流1Textual Inversion 嵌入训练输入一组带统一 caption 的图片用 caption.py 生成同名 .txt 即可操作GUI 选 TI 标签页指向数据集设置嵌入名与向量数启动训练输出一个嵌入文件加载到文生图端后用绑定词即可稳定召唤该概念工作流2全量微调出风格模型输入10~20 张同一风格图目录结构参照 test/img/ 的编号_描述/图片.txt格式操作GUI 选 Finetune 标签页挑底座模型从 presets/finetune/ 导入参数模板输出完整 .safetensors 模型独立使用无需叠加底座维度TI 嵌入训练全量微调产出嵌入文件完整模型文件数据量少量同概念图10~20 张同风格图训练量仅嵌入向量全部网络权重典型用途快速绑定一个新概念完整复刻一种画风masked loss 掩膜训练样本排障速查4个高频报错torch.cuda.is_available()返回False→ 装成了 CUDA 版 torchROCm 不识别 → 改用 requirements_linux_rocm.txt 重装 torch 2.7.1rocm6.3hipErrorNoBinaryForGpu→ ROCm 驱动与 GPU 架构不匹配 →rocminfo确认驱动识别正常升级到 6.3 后重启HSA out of memory→ batch 超出显存 → train_batch_size 降到 1并开启 gradient_checkpointingNo module named tkinter→ 系统缺少 Python 图形依赖 → 重跑./setup.sh补装性能调优显存、batch与精度怎么配社区预设里已有一组可参考的默认值SDXL - LoRA AI_characters standard v1.1.jsonlearning_rate3e-05、train_batch_size3、fp16 混合精度、gradient_checkpointing 开启。显存紧张时优先降 batch再开梯度检查点最后才降分辨率精度上 fp16 更省显存bf16 数值更稳——prodigy 预设即用 bf16 配8batch。数据加载线程通过 max_data_loader_n_workers 按 CPU 核数设置数据集放 SSD 可明显减少 IO 等待。进阶多卡场景下GUI 的 Accelerate 标签页可按 GPU ID 选卡Linux 支持同时起多个训练实例训练期间用rocm-smi盯显存与利用率。下一步3步把训练跑起来从 test/img/ 拷出一组测试图并配好 .txt用 test/config/ 里的 toml 模板做第一版配置GUI 选 LoRA 标签页导入 presets/lora/ 中一个 SDXL 预设先完整跑通一次训练并检查产出文件记录这次 learning_rate、batch、epochs 的组合存为个人基线预设后续每次只改一个变量做对比【免费下载链接】kohya_ss项目地址: https://gitcode.com/GitHub_Trending/ko/kohya_ss创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价