Vanishing and Exploding Gradients in Deep Neural Networks | рдбреАрдк рдиреНрдпреВрд░рд▓ рдиреЗрдЯрд╡рд░реНрдХреНрд╕ рдореЗрдВ рд╡реИрдирд┐рд╢рд┐рдВрдЧ рдФрд░ рдПрдХреНрд╕рдкреНрд▓реЛрдбрд┐рдВрдЧ рдЧреНрд░реЗрдбрд┐рдПрдВрдЯреНрд╕ рдХреА рд╕рдорд╕реНрдпрд╛
Vanishing and Exploding Gradients in Deep Neural Networks | рдбреАрдк рдиреНрдпреВрд░рд▓ рдиреЗрдЯрд╡рд░реНрдХреНрд╕ рдореЗрдВ рд╡реИрдирд┐рд╢рд┐рдВрдЧ рдФрд░ рдПрдХреНрд╕рдкреНрд▓реЛрдбрд┐рдВрдЧ рдЧреНрд░реЗрдбрд┐рдПрдВрдЯреНрд╕ рдХреА рд╕рдорд╕реНрдпрд╛
рдбреАрдк рдиреНрдпреВрд░рд▓ рдиреЗрдЯрд╡рд░реНрдХреНрд╕ рдореЗрдВ рд╡реИрдирд┐рд╢рд┐рдВрдЧ рдФрд░ рдПрдХреНрд╕рдкреНрд▓реЛрдбрд┐рдВрдЧ рдЧреНрд░реЗрдбрд┐рдПрдВрдЯреНрд╕ рдХреА рд╕рдорд╕реНрдпрд╛
рдбреАрдк рд▓рд░реНрдирд┐рдВрдЧ рдореЗрдВ Vanishing Gradient рдФрд░ Exploding Gradient рджреЛ рдкреНрд░рдореБрдЦ рд╕рдорд╕реНрдпрд╛рдПрдБ рд╣реИрдВ рдЬреЛ рдиреЗрдЯрд╡рд░реНрдХ рдХреЛ рд╕рд╣реА рдврдВрдЧ рд╕реЗ рдЯреНрд░реЗрди рд╣реЛрдиреЗ рд╕реЗ рд░реЛрдХрддреА рд╣реИрдВред рдпрд╣ рд╕рдорд╕реНрдпрд╛ рд╡рд┐рд╢реЗрд╖ рд░реВрдк рд╕реЗ Recurrent Neural Networks (RNNs) рдФрд░ рдЧрд╣рд░реЗ (Deep) рдиреЗрдЯрд╡рд░реНрдХреНрд╕ рдореЗрдВ рджреЗрдЦреА рдЬрд╛рддреА рд╣реИ, рдЬрд╣рд╛рдБ gradients рдХрдИ рд▓реЗрдпрд░реНрд╕ рдпрд╛ рдЯрд╛рдЗрдо рд╕реНрдЯреЗрдкреНрд╕ рд╕реЗ рд╣реЛрдХрд░ рдкреАрдЫреЗ рдХреА рдУрд░ рдкреНрд░рд╡рд╛рд╣рд┐рдд рд╣реЛрддреЗ рд╣реИрдВред
ЁЯУШ Gradient рдХреНрдпрд╛ рд╣реЛрддрд╛ рд╣реИ?
Gradient рд╡рд╣ рдорд╛рди рд╣реИ рдЬреЛ рдмрддрд╛рддрд╛ рд╣реИ рдХрд┐ рдХрд┐рд╕реА рд╡реЗрдЯ (Weight) рдХреЛ Loss рдХреЛ рдХрдо рдХрд░рдиреЗ рдХреЗ рд▓рд┐рдП рдХрд┐рддрдирд╛ рдФрд░ рдХрд┐рд╕ рджрд┐рд╢рд╛ рдореЗрдВ рдмрджрд▓рдирд╛ рдЪрд╛рд╣рд┐рдПред Gradient Descent рдЗрд╕ рд╡рд┐рдЪрд╛рд░ рдкрд░ рдЖрдзрд╛рд░рд┐рдд рд╣реИ рдХрд┐ loss рдХреЛ рдШрдЯрд╛рдиреЗ рдХреЗ рд▓рд┐рдП рдЫреЛрдЯреЗ-рдЫреЛрдЯреЗ рдЕрдкрдбреЗрдЯ рдХрд┐рдП рдЬрд╛рдПрдБред
ЁЯза Gradient рдХрд╛ рдкреНрд░рд╡рд╛рд╣ (Flow):
рдЬрдм рд╣рдо Backpropagation рдпрд╛ BPTT (Backpropagation Through Time) рдХрд░рддреЗ рд╣реИрдВ, рддреЛ gradients рд╣рд░ рд▓реЗрдпрд░ рдореЗрдВ chain rule рдХреЗ рдорд╛рдзреНрдпрдо рд╕реЗ рдЧреБрдгрд╛ рд╣реЛрддреЗ рдЬрд╛рддреЗ рд╣реИрдВ:
тИВL/тИВW = тИВL/тИВaтВЩ * тИВaтВЩ/тИВaтВЩтВЛтВБ * ... * тИВaтВВ/тИВaтВБ * тИВaтВБ/тИВW
рдпрджрд┐ рдЗрди derivatives рдХреЗ рдорд╛рди рдмрд╣реБрдд рдЫреЛрдЯреЗ (<1) рд╣реИрдВ рддреЛ gradients тАЬvanishтАЭ рд╣реЛ рдЬрд╛рддреЗ рд╣реИрдВ, рдФрд░ рдпрджрд┐ рдмрд╣реБрдд рдмрдбрд╝реЗ (>1) рд╣реИрдВ рддреЛ тАЬexplodeтАЭ рд╣реЛ рдЬрд╛рддреЗ рд╣реИрдВред
тЪая╕П 1я╕ПтГг Vanishing Gradient Problem
рдпрд╣ рддрдм рд╣реЛрддрд╛ рд╣реИ рдЬрдм gradients рдмрд╣реБрдд рдЫреЛрдЯреЗ рд╣реЛрддреЗ рдЬрд╛рддреЗ рд╣реИрдВ, рдЬрд┐рд╕рд╕реЗ рд╡реЗрдЯреНрд╕ рдореЗрдВ рдмрд╣реБрдд рдЫреЛрдЯреЗ рдмрджрд▓рд╛рд╡ рд╣реЛрддреЗ рд╣реИрдВ, рдФрд░ рдиреЗрдЯрд╡рд░реНрдХ long-term dependencies рдирд╣реАрдВ рд╕реАрдЦ рдкрд╛рддрд╛ред
ЁЯзо рдЙрджрд╛рд╣рд░рдг:
рдпрджрд┐ рдкреНрд░рддреНрдпреЗрдХ derivative рдХрд╛ рдФрд╕рдд 0.9 рд╣реИ рдФрд░ 50 рдЯрд╛рдЗрдо рд╕реНрдЯреЗрдкреНрд╕ рд╣реИрдВ, рддреЛ рдХреБрд▓ gradient = (0.9)тБ╡тБ░ тЙИ 0.005 тАФ рдмрд╣реБрдд рдЫреЛрдЯрд╛ред
ЁЯУЙ рдкрд░рд┐рдгрд╛рдо:
- Training рдмрд╣реБрдд рдзреАрдореА рд╣реЛ рдЬрд╛рддреА рд╣реИред
- RNN рдкрд┐рдЫрд▓реЗ рдЗрдирдкреБрдЯреНрд╕ рдХреЛ тАЬрднреВрд▓тАЭ рдЬрд╛рддрд╛ рд╣реИред
- Deep layers рдХреЗрд╡рд▓ рдкреНрд░рд╛рд░рдВрднрд┐рдХ рд▓реЗрдпрд░реНрд╕ рддрдХ рд╕реАрдорд┐рдд рд░рд╣ рдЬрд╛рддреА рд╣реИрдВред
ЁЯТе 2я╕ПтГг Exploding Gradient Problem
рдпрд╣ рддрдм рд╣реЛрддреА рд╣реИ рдЬрдм derivatives рдмрд╣реБрдд рдмрдбрд╝реЗ (>1) рд╣реЛрддреЗ рд╣реИрдВ, рдЬрд┐рд╕рд╕реЗ gradient exponentially рдмрдврд╝рддрд╛ рд╣реИ рдФрд░ рдиреЗрдЯрд╡рд░реНрдХ рдЕрд╕реНрдерд┐рд░ рд╣реЛ рдЬрд╛рддрд╛ рд╣реИред
ЁЯзо рдЙрджрд╛рд╣рд░рдг:
рдпрджрд┐ рдФрд╕рдд derivative 1.2 рд╣реИ рдФрд░ 50 рдЯрд╛рдЗрдо рд╕реНрдЯреЗрдкреНрд╕ рд╣реИрдВ, рддреЛ gradient = (1.2)тБ╡тБ░ тЙИ 9100 тАФ рдЬреЛ рдиреЗрдЯрд╡рд░реНрдХ рдХреЛ тАЬexplodeтАЭ рдХрд░ рджреЗрддрд╛ рд╣реИред
тЪая╕П рдкрд░рд┐рдгрд╛рдо:
- Loss рдЕрдЪрд╛рдирдХ рдмрд╣реБрдд рдмрдбрд╝рд╛ рд╣реЛ рдЬрд╛рддрд╛ рд╣реИред
- Weights NaN рдпрд╛ Inf рдмрди рдЬрд╛рддреЗ рд╣реИрдВред
- рдореЙрдбрд▓ рдЯреНрд░реЗрдирд┐рдВрдЧ рд░реЛрдХ рджреЗрддрд╛ рд╣реИред
ЁЯзй рдХрд╛рд░рдг:
- Sigmoid рдпрд╛ Tanh рдЬреИрд╕реА activation functions рдХреЗ saturation рдХреНрд╖реЗрддреНрд░ред
- рд▓рдВрдмреЗ рдЯрд╛рдЗрдо рд╕реНрдЯреЗрдкреНрд╕ (RNNs рдореЗрдВ)ред
- рдЕрдиреБрдЪрд┐рдд weight initializationред
- рдмрд╣реБрдд рдЧрд╣рд░реА рдиреЗрдЯрд╡рд░реНрдХ рд╕рдВрд░рдЪрдирд╛ред
тЪЩя╕П рд╕рдорд╛рдзрд╛рди:
1я╕ПтГг Gradient Clipping:
рдЬрдм gradient рдмрд╣реБрдд рдмрдбрд╝рд╛ рд╣реЛ рдЬрд╛рдП, рддреЛ рдЙрд╕реЗ рдХрд┐рд╕реА рдирд┐рд╢реНрдЪрд┐рдд рд╕реАрдорд╛ (threshold) рдкрд░ тАЬclipтАЭ рдХрд░ рджрд┐рдпрд╛ рдЬрд╛рддрд╛ рд╣реИред
torch.nn.utils.clip_grad_norm_(model.parameters(), max_norm=1.0)
2я╕ПтГг Proper Weight Initialization:
- He Initialization (ReLU рдХреЗ рд▓рд┐рдП)
- Xavier Initialization (Tanh/Sigmoid рдХреЗ рд▓рд┐рдП)
3я╕ПтГг Use of LSTM/GRU:
LSTM рдФрд░ GRU architectures рд╡рд┐рд╢реЗрд╖ рд░реВрдк рд╕реЗ vanishing gradient рд╕рдорд╕реНрдпрд╛ рдХреЛ рджреВрд░ рдХрд░рдиреЗ рдХреЗ рд▓рд┐рдП рдмрдирд╛рдП рдЧрдП рд╣реИрдВред рд╡реЗ тАЬgatesтАЭ рдХрд╛ рдЙрдкрдпреЛрдЧ рдХрд░рдХреЗ gradients рдХреЛ рд▓рдВрдмреЗ рд╕рдордп рддрдХ рдкреНрд░рд╡рд╛рд╣рд┐рдд рд╣реЛрдиреЗ рджреЗрддреЗ рд╣реИрдВред
4я╕ПтГг Batch Normalization рдФрд░ Residual Connections:
рдпреЗ рддрдХрдиреАрдХреЗрдВ gradients рдХреЛ рд╕реНрдерд┐рд░ рдмрдирд╛рдП рд░рдЦрддреА рд╣реИрдВ рдФрд░ signal flow рдХреЛ smooth рдмрдирд╛рддреА рд╣реИрдВред
ЁЯЪА 2025 рдореЗрдВ рдЖрдзреБрдирд┐рдХ рд╕рдорд╛рдзрд╛рди:
- Adaptive Gradient Clipping (AGC): dynamic gradient controlред
- Gradient Noise Injection: training stability рдХреЗ рд▓рд┐рдПред
- Scaled Residuals: ResNet рд╕реЗ рдкреНрд░реЗрд░рд┐рдд normalization layersред
ЁЯУЩ рдирд┐рд╖реНрдХрд░реНрд╖:
Vanishing рдФрд░ Exploding Gradients рдбреАрдк рдиреЗрдЯрд╡рд░реНрдХреНрд╕ рдХреА рд╕реАрдЦрдиреЗ рдХреА рдХреНрд╖рдорддрд╛ рдХреЛ рд╕реАрдорд┐рдд рдХрд░рддреЗ рд╣реИрдВред рдЗрди рд╕рдорд╕реНрдпрд╛рдУрдВ рдХреЗ рд╕рдорд╛рдзрд╛рди рдХреЗ рдмрд┐рдирд╛ RNNs рдХрд╛ рдкреНрд░рднрд╛рд╡реА рдкреНрд░рд╢рд┐рдХреНрд╖рдг рд╕рдВрднрд╡ рдирд╣реАрдВред рд▓реЗрдХрд┐рди LSTM, GRU рдФрд░ ResNet рдЬреИрд╕реА рддрдХрдиреАрдХреЛрдВ рдиреЗ рдЗрди рдмрд╛рдзрд╛рдУрдВ рдХреЛ рджреВрд░ рдХрд░рдХреЗ рдбреАрдк рд▓рд░реНрдирд┐рдВрдЧ рдХреЛ рдФрд░ рд╕реНрдерд┐рд░ рдмрдирд╛рдпрд╛ рд╣реИред 2025 рдореЗрдВ, gradient stabilization рддрдХрдиреАрдХреЗрдВ рдбреАрдк рд▓рд░реНрдирд┐рдВрдЧ рдЯреНрд░реЗрдирд┐рдВрдЧ рдХреА рдЖрдзрд╛рд░рд╢рд┐рд▓рд╛ рдмрди рдЪреБрдХреА рд╣реИрдВред
Related Articles
Applications of Deep Learning in Object Detection, Speech/Image Recognition, Video Analysis, NLP, and Medical Science | рдбреАрдк рд▓рд░реНрдирд┐рдВрдЧ рдХреЗ рдЕрдиреБрдкреНрд░рдпреЛрдЧ: рдСрдмреНрдЬреЗрдХреНрдЯ рдбрд┐рдЯреЗрдХреНрд╢рди, рд╕реНрдкреАрдЪ/рдЗрдореЗрдЬ рд░рд┐рдХрдЧреНрдирд┐рд╢рди, рд╡реАрдбрд┐рдпреЛ рдПрдирд╛рд▓рд┐рд╕рд┐рд╕, рдПрдирдПрд▓рдкреА рдФрд░ рдореЗрдбрд┐рдХрд▓ рд╕рд╛рдЗрдВрд╕
рдбреАрдк рд▓рд░реНрдирд┐рдВрдЧ рдХреЗ рдЕрдиреБрдкреНрд░рдпреЛрдЧ: рдСрдмреНрдЬреЗр...
Read More тЖТGenerative Adversarial Networks (GANs): Concept, Architecture, and Applications | рдЬреЗрдирд░реЗрдЯрд┐рд╡ рдПрдбрд╡рд░реНрд╕реЗрд░рд┐рдпрд▓ рдиреЗрдЯрд╡рд░реНрдХ (GAN): рдЕрд╡рдзрд╛рд░рдгрд╛, рд╕рдВрд░рдЪрдирд╛ рдФрд░ рдЕрдиреБрдкреНрд░рдпреЛрдЧ
рдЬреЗрдирд░реЗрдЯрд┐рд╡ рдПрдбрд╡рд░реНрд╕реЗрд░рд┐рдпрд▓ рдиреЗрдЯрд╡рд░реНрдХ (GA...
Read More тЖТAuto-Regressive Models (NADE, MADE, PixelRNN): Concept, Architecture, and Deep Learning Applications | рдСрдЯреЛ-рд░реЗрдЧреНрд░реЗрд╕рд┐рд╡ рдореЙрдбрд▓реНрд╕ (NADE, MADE, PixelRNN): рдЕрд╡рдзрд╛рд░рдгрд╛, рд╕рдВрд░рдЪрдирд╛ рдФрд░ рдбреАрдк рд▓рд░реНрдирд┐рдВрдЧ рдореЗрдВ рдЕрдиреБрдкреНрд░рдпреЛрдЧ
рдСрдЯреЛ-рд░реЗрдЧреНрд░реЗрд╕рд┐рд╡ рдореЙрдбрд▓реНрд╕ (NADE, MADE, PixelRNN): рдЕ...
Read More тЖТMarkov Chains: Concept, Transition Matrices, and Applications in Deep Learning | рдорд╛рд░реНрдХреЛрд╡ рдЪреЗрди: рдЕрд╡рдзрд╛рд░рдгрд╛, рдЯреНрд░рд╛рдВрдЬрд┐рд╢рди рдореИрдЯреНрд░рд┐рдХреНрд╕ рдФрд░ рдбреАрдк рд▓рд░реНрдирд┐рдВрдЧ рдореЗрдВ рдЕрдиреБрдкреНрд░рдпреЛрдЧ
рдорд╛рд░реНрдХреЛрд╡ рдЪреЗрди: рдЕрд╡рдзрд╛рд░рдгрд╛, рдЯреНрд░рд╛рдВрдЬрд┐рд╢рди ...
Read More тЖТMarkov Networks (Markov Random Fields): Concept, Structure, and Applications | рдорд╛рд░реНрдХреЛрд╡ рдиреЗрдЯрд╡рд░реНрдХ (Markov Networks): рдЕрд╡рдзрд╛рд░рдгрд╛, рд╕рдВрд░рдЪрдирд╛ рдФрд░ рдЕрдиреБрдкреНрд░рдпреЛрдЧ
рдорд╛рд░реНрдХреЛрд╡ рдиреЗрдЯрд╡рд░реНрдХ (Markov Random Fields): рдЕрд╡рдзрд╛рд░р...
Read More тЖТ