
一、训练方案设计训练范式选择预训练Pre-training从头训练基础模型需要海量数据算力微调Fine-tuning在预训练模型上适配下游任务数据量小迁移学习跨领域/跨任务迁移已有知识持续学习模型在线更新不遗忘旧知识提示学习Prompt Tuning冻结模型参数只训练提示词RLHF / DPO基于人类反馈的强化学习/直接偏好优化训练策略决策全量微调 vs 参数高效微调LoRA、Adapter、Prefix Tuning单任务 vs 多任务联合训练增量训练 vs 从头训练冷启动策略与Warmup设计数据配比设计训练/验证/测试集划分比例常见8:1:1或按场景调整多源数据混合比例通用数据 vs 领域数据 vs 指令数据数据采样策略均匀采样、加权采样、课程学习由易到难⚙️ 二、训练环境与基础设施硬件资源配置GPU选型A100/H100大模型vs V100/4090中小模型显存估算模型参数量 × 精度字节数 × 冗余系数多卡互联NVLink、InfiniBand带宽与拓扑存储IO数据加载瓶颈与SSD/内存缓存策略软件框架栈深度学习框架PyTorch、TensorFlow、JAX、PaddlePaddle训练加速库DeepSpeed、Megatron-LM、FSDP、Colossal-AI分布式通信NCCL、Gloo、MPI容器化部署Docker、Kubernetes、Slurm集群调度环境一致性依赖版本锁定CUDA、cuDNN、Python库随机种子固定保证实验可复现配置管理YAML/JSON配置文件化避免硬编码 三、核心训练机制前向传播与反向传播前向输入 → 网络层计算 → 输出预测 → 计算Loss反向Loss梯度 → 链式法则逐层回传 → 更新参数自动微分AutogradPyTorch的动态计算图机制损失函数Loss Function分类CrossEntropy、Focal Loss处理类别不平衡回归MSE、MAE、Huber Loss生成NLL负对数似然、Perceptual Loss对比学习InfoNCE、Triplet Loss大语言模型Next Token Prediction、DPO Loss优化器OptimizerSGD Momentum经典但需调参Adam / AdamW自适应学习率最常用AdamW带权重衰减Lion、Adafactor大模型训练的新选择学习率调度Warmup Cosine Decay、Step Decay、Plateau正则化与防过拟合Dropout训练时随机失活神经元Weight DecayL2正则惩罚大权重Early Stopping验证集不提升则提前停止数据增强从数据侧增加多样性Label Smoothing软化硬标签提升泛化 四、分布式训练策略数据并行Data Parallelism, DP每张GPU放完整模型副本各自处理不同数据批次梯度All-Reduce同步参数保持一致适用模型能放进单卡显存数据量大模型并行Model Parallelism, MP模型层拆分到不同GPU每张卡只存部分层流水线并行Pipeline Parallelism层间流水线张量并行Tensor Parallelism层内矩阵拆分适用超大模型单卡放不下混合并行与3D并行数据并行 模型并行 流水线并行组合ZeRODeepSpeed优化器状态/梯度/参数分片ZeRO-1/2/3/Offload逐层 offload 到CPU/磁盘训练效率优化梯度累积小batch模拟大batch混合精度训练FP16/BF16 FP32省显存加速梯度检查点Gradient Checkpointing时间换空间FlashAttention显存高效的注意力计算 五、训练监控与调试关键监控指标Loss曲线训练Loss应持续下降验证Loss不上升学习率变化是否符合调度策略梯度范数检测梯度爆炸/消失正常范围1e-3~1e1GPU利用率应保持在90%低说明IO瓶颈显存占用监控OOM风险吞吐量samples/sec评估训练效率常见问题诊断Loss不下降学习率太小、数据问题、标签错误Loss震荡剧烈学习率太大、batch太小验证Loss上升 → 过拟合加正则化、增数据、早停Loss为NaN/Inf梯度爆炸、学习率过大、数据异常训练Loss低但验证差分布偏移、数据泄露调试工具TensorBoard / WandB / MLflow可视化训练过程PyTorch Profiler定位性能瓶颈Overfit小数据集验证模型/代码正确性✅ 六、评估验证与迭代优化评估方法论Hold-out验证固定划分训练/验证/测试集K折交叉验证数据少时更可靠留一验证Leave-One-Out极端小样本时序验证时间序列必须按时间切分评估指标体系分类Accuracy、Precision、Recall、F1、AUC-ROC、混淆矩阵回归MSE、RMSE、MAE、R²NLPBLEU、ROUGE、Perplexity、BERTScore大模型MMLU、GSM8K、HumanEval等Benchmark业务指标转化率、点击率、用户满意度最终目标迭代优化策略超参搜索网格搜索、随机搜索、贝叶斯优化错误分析看Bad Case定位模型弱点数据迭代针对错误样本补充标注数据模型迭代换架构、加层、改注意力机制A/B测试线上真实效果对比 七、主流训练范式详解范式说明适用场景训练师关键工作监督学习有标签数据训练分类、回归、检测、NER准备高质量标注数据、设计数据配比、监控训练-验证Gap无监督/自监督无需人工标签从数据本身构造监督信号如BERT的MLM预训练、表征学习、聚类数据质量和多样性比标注更重要强化学习RL通过奖励信号训练策略游戏AI、机器人控制、LLM对齐奖励函数设计、探索-利用平衡、训练稳定性指令微调SFT将预训练模型转化为能遵循指令的助手ChatGPT类对话模型构造(Instruction, Input, Output)三元组保证指令多样性RLHF / DPO基于人类偏好对齐模型价值观大模型安全对齐、风格调优准备偏好对数据chosen vs rejected控制KL散度对比学习学习相似靠近、不相似远离的表征表征学习、跨模态对齐、检索正负样本构造、温度系数调参、Batch Size要大 八、AI训练师在算法训练中的核心职责职责侧具体内容数据侧训练数据准备、数据配比设计、Bad Case分析反哺配置侧超参配置管理、训练方案制定、实验记录追踪监控侧训练过程监控、指标异常诊断、Loss曲线分析评估侧测试集评估、Benchmark跑分、业务效果验证核心定位AI训练师是算法工程师的「搭档」——训练师负责数据质量、训练配置、效果评估算法工程师负责模型架构、算法创新、工程优化。两者协同完成模型从0到1的训练。 训练师必备公式速查公式说明显存估算≈ 模型参数 × 精度字节 × (1~4)FP162字节, FP324字节, INT81字节训练时间估算≈ (数据量 × 轮数) / (Batch × GPU数 × 吞吐)学习率经验大模型微调1e-5 ~ 5e-5预训练1e-4 ~ 1e-3Batch Size选择小模型32~256大模型受显存限制配合梯度累积过拟合判断Train Loss ↓ 但 Val Loss ↑Gap 10% 即需干预LoRA配置Rank: 8~64, Alpha2×Rank目标模块: q_proj, v_proj