深度学习
CNN、Transformer、训练优化
最新文章
LeNet-5 与 AlexNet:CNN 的奠基之作
2026-07-08
拆解 LeNet-5 的「卷积-池化-全连接」范式与 AlexNet 的 ReLU+Dropout+GPU 三大创新,梳理从 MNIST 到 ImageNet 的范式跃迁。
VGG 与 GoogLeNet:更深更宽的探索
2026-07-08
VGG 用 3×3 卷积堆叠把网络做到 16-19 层,GoogLeNet 用 1×1 降维 + Inception 多分支做到 22 层仅 500 万参数。
ResNet 与 DenseNet:残差连接的胜利
2026-07-08
ResNet 用加法捷径让网络深到 152 层,DenseNet 用拼接捷径让每层复用所有历史特征,共同确立了「跨层连接 = 现代 CNN 标配」。
卷积运算详解:从 2D 卷积到深度可分离卷积
2026-07-08
系统讲解 2D 卷积、1×1 卷积、空洞卷积、转置卷积与深度可分离卷积的原理、PyTorch 实现与计算量对比。
归一化层:BatchNorm / LayerNorm / GroupNorm
2026-07-08
对比 BatchNorm、LayerNorm、GroupNorm、InstanceNorm、RMSNorm 五种归一化方法,给出按任务类型选择的工程指南。
优化器演进:SGD → Adam → AdamW → LAMB
2026-07-08
系统梳理 SGD、Momentum、Adam、AdamW、LAMB、Lion 的算法、PyTorch 实现与适用场景,Transformer 默认 AdamW。
学习率调度:Warmup + Cosine Annealing + OneCycle
2026-07-08
讲解 Warmup、Step Decay、Exponential、Cosine Annealing、OneCycle 五种调度策略,附 LR Range Test 找最优学习率。
混合精度训练与分布式训练(DDP)
2026-07-08
详解 FP16/BF16 混合精度与 DistributedDataParallel 的原理、PyTorch 实战与踩坑指南,LLM 训练六件套。