首页 机器学习 深度学习 LLM 推荐算法 Agent 项目 关于

深度学习

CNN、Transformer、训练优化

最新文章

LeNet-5 与 AlexNet:CNN 的奠基之作

拆解 LeNet-5 的「卷积-池化-全连接」范式与 AlexNet 的 ReLU+Dropout+GPU 三大创新,梳理从 MNIST 到 ImageNet 的范式跃迁。

VGG 与 GoogLeNet:更深更宽的探索

VGG 用 3×3 卷积堆叠把网络做到 16-19 层,GoogLeNet 用 1×1 降维 + Inception 多分支做到 22 层仅 500 万参数。

ResNet 与 DenseNet:残差连接的胜利

ResNet 用加法捷径让网络深到 152 层,DenseNet 用拼接捷径让每层复用所有历史特征,共同确立了「跨层连接 = 现代 CNN 标配」。

卷积运算详解:从 2D 卷积到深度可分离卷积

系统讲解 2D 卷积、1×1 卷积、空洞卷积、转置卷积与深度可分离卷积的原理、PyTorch 实现与计算量对比。

归一化层:BatchNorm / LayerNorm / GroupNorm

对比 BatchNorm、LayerNorm、GroupNorm、InstanceNorm、RMSNorm 五种归一化方法,给出按任务类型选择的工程指南。

优化器演进:SGD → Adam → AdamW → LAMB

系统梳理 SGD、Momentum、Adam、AdamW、LAMB、Lion 的算法、PyTorch 实现与适用场景,Transformer 默认 AdamW。

学习率调度:Warmup + Cosine Annealing + OneCycle

讲解 Warmup、Step Decay、Exponential、Cosine Annealing、OneCycle 五种调度策略,附 LR Range Test 找最优学习率。

混合精度训练与分布式训练(DDP)

详解 FP16/BF16 混合精度与 DistributedDataParallel 的原理、PyTorch 实战与踩坑指南,LLM 训练六件套。