静静学AI

模型微调术语速查:英文叫什么,在这次实验里做什么

配套资料:模型微调跟练资料

不需要先背一遍。读到不熟悉的词,再回来查。缩写写全称;普通英文词和产品名称会明确注明,不硬凑缩写解释。

先认识这些词

术语或缩写 英文全称或原词 中文含义与本次用途
AI Artificial Intelligence 人工智能。大类名称,不代表特定模型。
Fine-tuning 普通英文词,不是缩写 微调。在已有模型上继续训练,使其适应具体需求。
Base Model 普通英文词组 底模。本次继续训练的起点;不等于从未被其他人微调。
LoRA Low-Rank Adaptation 低秩适应。一种参数高效微调方法,本次用它学习虚拟人物的外貌倾向。它是方法,不能与“所有微调”画等号。官方说明
SDXL Stable Diffusion XL 本次使用的图像生成模型系列。Juggernaut XL v9 是基于这个系列的模型,不是聊天模型。官方文档
LLM Large Language Model 大语言模型,主要处理语言。本次不是 LLM 微调,数据和训练脚本不能直接照搬过去。
IP-Adapter Image Prompt Adapter 图像提示适配器。让参考图片参与生成。本次只用它辅助制作数据,验收时关闭。原论文
Dataset 普通英文词 数据集。这里是审核通过的图片和配套文字描述。
Caption 普通英文词 图片描述。训练时用的文字,应描述图里实际出现的内容。
Prompt 普通英文词 提示词。生成时告诉模型想要什么;与训练图片的 Caption 用途不同。
Trigger Word 普通英文词组 触发词。训练描述与生成提示中使用的人物标识。本次是 vprsn01,不是身份证明,也不保证每次都像。
Parameters / Weights 普通英文词 参数 / 权重。模型计算所用的数值;权重是其中常用的称呼。本次保存的是 LoRA 的增量权重,不是完整底模。
Checkpoint 普通英文词 检查点。训练过程中保存的阶段成果。保存了权重,不一定就保存了精确续训所需的全部状态。
Inference 普通英文词 推理。用训练好的模型处理输入、生成结果;这里就是出图,不需要每次重新训练。

日志和参数里会看到什么

术语或缩写 英文全称或原词 怎么理解,哪里容易误会
Training Steps 普通英文词组 训练步数,通常按优化器更新参数的次数统计。本次正式训练 1200 步。
Sampling Steps 普通英文词组 采样步数,生成一张图片时的去噪迭代次数。本次对照生图用 30 步,不是重新训练 30 次。
Seed 普通英文词 随机种子,控制随机数生成起点。相同种子便于对照,但不能跨模型版本、硬件和全部设置保证图片完全一致。
CFG Classifier-Free Guidance 无分类器引导。通过结合有条件和无条件预测来影响生成方向;数值会影响对提示的遵从和画面,不能简单理解成“越大越好”。本次对照用 5。原论文
Sampler 普通英文词 采样器。决定出图时如何逐步去噪。本次对照用 Euler;不能只固定种子却随意换采样器。
Batch Size 普通英文词组 批大小,一次送进模型计算的样本数。本次为 1;与“只训练一张图”不是一回事。
LR Learning Rate 学习率,控制训练时参数更新的尺度。本次为 0.0001,不是越大训练越好。
Rank 普通英文词 秩。LoRA 低秩矩阵的内部维度,影响可训练参数量。本次为 32,不是训练 32 步。官方说明
Alpha 参数名称,不是英文缩写 本次 LoRA 训练的缩放参数,设为 16;不是生图时设置的 LoRA 强度 0.8。
LoRA Scale 普通英文词组 生成时 LoRA 的作用强度。本次为 0.8,不表示“人物相似度 80%”。
Loss 普通英文词 损失值,训练目标上的误差。不是人物相似度、审美分或照片合格率。
Overfitting 普通英文词 过拟合。过度适应训练样本,以至于在新条件下表现不好。不能仅凭步数多或几张照片就断言发生了过拟合。
Smoke Test 普通英文词组 冒烟测试。先做很小的一轮运行,排除环境、读取与保存问题。本次测试 20 步,不用于验收最终效果。

电脑、服务器与文件

术语或缩写 英文全称或原词 在本次流程里的作用
GPU Graphics Processing Unit 图形处理器。本次训练和生图的主要计算设备。RTX 4090 是显卡产品型号,不需要把型号当成技术缩写背。
CPU Central Processing Unit 中央处理器,负责通用计算和任务调度等;不等同于 GPU。
VRAM Video Random Access Memory 显存,用于存放模型和中间计算数据。24 GB 显存不等于 24 GB 系统内存。
SSH Secure Shell 安全外壳协议。用于加密连接远程服务器并执行命令。连接凭据不能出现在公开教程截图中。协议说明
tmux terminal multiplexer 终端复用器。操作指南用它保留服务器上的工作会话,便于SSH重新连接后接着查看;它不是防止关机或训练报错的工具。官方入门
SFTP SSH File Transfer Protocol 通过 SSH 传输文件的协议。本次用它下载训练成果;与“截一张文件列表图”不是一回事。OpenSSH 说明
SHA-256 Secure Hash Algorithm,256 位版本 为文件计算校验值,用来核对传输前后内容是否一致。相同文件应有相同校验值;它不评价模型效果。
.safetensors 文件格式名称,不是英文缩写 用于保存模型张量的格式。本次人物 LoRA 以这个格式保存;扩展名本身不能证明文件已训练成功。
.json JavaScript Object Notation 一种结构化文本数据格式。本次用来保存图片审核、生成参数等记录,不是权重文件。
.toml Tom's Obvious Minimal Language 一种配置文件格式。本次训练设置保存在 train.toml;它是设置清单,不是模型。官方说明
Image(镜像) 普通英文词 在租服务器的语境中,是预装操作系统和部分软件的环境模板;不是训练图片,也不是模型。
Terminal 普通英文词 终端,输入并运行命令的窗口。本指南的Linux命令在云端终端运行,Windows的PowerShell命令在自己电脑运行。
Virtual Environment 普通英文词组 虚拟环境,用来隔离Python依赖。本次文件夹叫 .venv;每次打开新终端,都要重新激活后再运行训练或生图。
Preflight 普通英文词 预检,训练前检查显卡与软件是否满足要求;不是正式训练。
Log 普通英文词 日志,程序运行时留下的记录。查看日志不等于重新执行程序。
CUDA Compute Unified Device Architecture NVIDIA 的并行计算平台和编程模型。本次软件栈依赖它;并非所有品牌的显卡都能直接运行这套配置。NVIDIA 官方介绍

原始技术记录中的补充词

这些词解释环境和省显存设置,不必放进教程开头。

术语或名称 英文原名 通俗解释
BF16 Brain Floating Point,16 位格式,类型名为 bfloat16 一种 16 位浮点数格式,用较低存储开销参与计算。本次混合精度设置用它;不要把它理解成图片只有 16 种颜色。原始研究
VAE Variational Autoencoder 变分自编码器,用于图片与较紧凑的潜在表示之间的转换。母图演示更换过 VAE,是不能仅凭种子承诺完全复现的原因之一。
Latent 普通英文词 潜在表示,可以粗略理解为模型内部处理的压缩表示,不是另一张供人直接观看的照片。
U-Net / UNet 网络名称,U 指结构形状,不是待逐字展开的缩写 本次底模里的去噪网络。本次只训练加在它上面的 LoRA 参数,没有训练所有组件。
SDPA Scaled Dot-Product Attention 缩放点积注意力,一种注意力计算。本次通过 PyTorch 的实现参与运算,不是人物相似度算法。PyTorch 文档
Gradient Checkpointing 普通英文词组 梯度检查点,通过反向计算时重算部分中间结果来省显存。与保存权重版本的 Checkpoint 不是一回事。
AdamW8bit 算法与实现名称组合,不是一个首字母缩写 使用 8 位优化器状态的 AdamW 优化器实现。本次用于控制训练显存开销,不代表最终 LoRA 是 8 位权重。

平台和工具名称也不要混淆: Hugging Face 托管模型和数据;AutoDL 提供本次租用的云计算资源;Python 是编程语言;PyTorch 是深度学习框架;Ubuntu 是操作系统;sd-scripts 是本次训练脚本项目;Diffusers 是生成模型工具库;JupyterLab 是浏览器里的开发界面;TensorBoard 用于查看训练记录。它们不是一组要分别训练的模型。

最需要记住的区别: 参考图生成不等于个人模型训练,训练步数不等于生图步数,损失值不等于人物相似度,保存 LoRA 不等于保存完整底模。