AI Toolkit 上手指南:24GB 显存训 FLUX 与 SDXL LoRA 的最短路径
2026/9/14 8:28:24 网站建设 项目流程

AI Toolkit 上手指南:24GB 显存训 FLUX 与 SDXL LoRA 的最短路径

【免费下载链接】ai-toolkitThe ultimate training toolkit for finetuning diffusion models项目地址: https://gitcode.com/GitHub_Trending/ai/ai-toolkit

24GB 显存的显卡想训 FLUX LoRA,光 base 模型就快把显存占满;换成 SDXL 又是一堆要调的参数。AI Toolkit 是一个面向消费级显卡的扩散模型训练工具包,把 FLUX、SDXL 这类模型的 LoRA 微调压成一份带注释的 YAML 配置,本地或云端都能跑。

它替你省掉的事

先说自定义 LoRA:数据集就是一个文件夹,jpg/jpeg/png 图片配同名 txt 描述,描述里写[trigger],配置里定了 trigger_word 后会自动替换。图片不需要手动裁剪或缩放——加载器只做下采样,并按不同宽高比分桶,配置里可以一次给多个分辨率(FLUX 示例是 512/768/1024)。

显卡方面不用你自己算账:24GB 配置默认开了 8bit 量化(quantize: true),base 模型按 8bit 混合精度加载,LoRA 本身仍按 bf16 训练;显存更紧时还能再开low_vram。想试视频模型也直接有模板,Wan 2.1 的 1.3B/14B 到 Wan 2.2 的 14B 都有对应配置。

第一次跑通的最短路径

克隆后不需要手动搭环境。仓库内置 manager,会自动装对应 GPU 的 PyTorch、建虚拟环境、拉 Node.js 和 FFmpeg,全部留在仓库目录内,不污染系统:

git clone https://gitcode.com/GitHub_Trending/ai/ai-toolkit cd ai-toolkit chmod +x run_linux.sh && ./run_linux.sh

Mac 用 run_mac.zsh(Apple Silicon 为实验性支持),Windows 双击 run_windows.bat。启动后 UI 开在http://localhost:8675,任务的启停、采样图预览都在里面;部署到公网前建议设置AI_TOOLKIT_AUTH环境变量加访问口令。偏好手动安装的话:venv + pip 装 torch 2.13.0(cu130)再装 requirements.txt 即可。

训练走配置文件:把示例拷到 config/ 目录,改三处——任务名、数据集 folder_path、触发词,然后:

cp config/examples/train_lora_flux_24gb.yaml config/my_first_lora.yml python run.py config/my_first_lora.yml

checkpoint 和采样图都写在 output 目录;中途 ctrl+c 停掉,下次会从最近的 checkpoint 续训(保存的瞬间别按,会损坏该 checkpoint)。

进阶:两个值得多花时间的配置点

低显存量化训练怎么开

FLUX 这类 flow 模型在 24GB 卡上能跑通,关键就在 model 段的quantize: true:权重以 8bit 存储、前向回到 bf16 计算,精度损失可控,换来的是显存从"放不下"到"还有余量"。配套项:train 段保持gradient_checkpointing: true(显存换时间),optimizer 用 adamw8bit;如果显卡接显示器导致显存被桌面占用,解开low_vram: true,量化时的峰值再降一些,代价是稍慢。

AI 自动配文:Florence-2 接入方式

数据集最大的隐性成本是写描述。UI 里可以直接调 Florence-2 给每张图生成 caption,结果可逐张编辑,[trigger]占位符会替换成你设置的触发词,相当于把描述质量的下限拉平了。剩下的训练细节(save_every: 250、EMA decay 0.99、caption dropout 5%)示例配置里都有默认值,第一遍不需要动。

训练块里还有实验项linear_timesteps: true,给每个时间步重新分配损失权重,对 FLUX 可能出更好结果;toolkit/timestep_weighing/ 目录里有配套脚本和权重曲线。

按硬件和场景怎么选

  • 24GB 卡训 FLUX LoRA:用 train_lora_flux_24gb.yaml 作底稿,量化和 gradient checkpointing 保持开启。
  • 想要出图更快:FLUX.1-schnell 有独立配置,采样 guidance_scale 为 1,省掉 CFG 开销。
  • 32GB 以上显存:可以关掉 quantize 跑全精度,或试 config/examples/ 里的 Qwen-Image-Edit 32GB 模板。
  • 视频模型实验:从 Wan 2.1 1.3B 起步,14B/720P 版本显存要求高不少,先用小模型验证流程。
  • 不想本地跑:config/examples/modal/ 下有 Modal 云模板,配合 run_modal.py 提交到云端 GPU。

下一步:从哪个配置文件起步

第一遍别改太多:拿 train_lora_flux_24gb.yaml 当底稿,只填数据集路径和触发词,跑通 250 步看第一次采样,再决定加 LoKr、用 only_if_contains 选层训练,还是换时间步权重。配置文件里几乎每行都有注释,照着改就行。

【免费下载链接】ai-toolkitThe ultimate training toolkit for finetuning diffusion models项目地址: https://gitcode.com/GitHub_Trending/ai/ai-toolkit

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询