Solving the Vanishing Gradient Problem with LSTMs | LSTM рд╕реЗ рд╡реИрдирд┐рд╢рд┐рдВрдЧ рдЧреНрд░реЗрдбрд┐рдПрдВрдЯ рд╕рдорд╕реНрдпрд╛ рдХрд╛ рд╕рдорд╛рдзрд╛рди

Solving the Vanishing Gradient Problem with LSTMs | LSTM рд╕реЗ рд╡реИрдирд┐рд╢рд┐рдВрдЧ рдЧреНрд░реЗрдбрд┐рдПрдВрдЯ рд╕рдорд╕реНрдпрд╛ рдХрд╛ рд╕рдорд╛рдзрд╛рди


LSTM рд╕реЗ рд╡реИрдирд┐рд╢рд┐рдВрдЧ рдЧреНрд░реЗрдбрд┐рдПрдВрдЯ рд╕рдорд╕реНрдпрд╛ рдХрд╛ рд╕рдорд╛рдзрд╛рди

Recurrent Neural Networks (RNNs) рд▓рдВрдмреЗ рдЕрдиреБрдХреНрд░рдореЛрдВ рдкрд░ рдЯреНрд░реЗрдирд┐рдВрдЧ рдХрд░рддреЗ рд╕рдордп Vanishing Gradient Problem рдХрд╛ рд╕рд╛рдордирд╛ рдХрд░рддреЗ рд╣реИрдВред рдЗрд╕ рд╕рдорд╕реНрдпрд╛ рдХреЗ рдХрд╛рд░рдг рдиреЗрдЯрд╡рд░реНрдХ рд▓рдВрдмреА рдЕрд╡рдзрд┐ рдХреЗ рдкреИрдЯрд░реНрди рд╕реАрдЦрдиреЗ рдореЗрдВ рдЕрд╕рдорд░реНрде рд╣реЛ рдЬрд╛рддрд╛ рд╣реИред Long Short-Term Memory (LSTM) рдиреЗрдЯрд╡рд░реНрдХреНрд╕ рдиреЗ рдЗрд╕ рд╕рдорд╕реНрдпрд╛ рдХрд╛ рд╕реНрдерд╛рдпреА рд╕рдорд╛рдзрд╛рди рдкреНрд░рджрд╛рди рдХрд┐рдпрд╛ред

ЁЯУШ Vanishing Gradient Problem рдХреНрдпрд╛ рд╣реИ?

рдЬрдм рд╣рдо Backpropagation рдХреЗ рдорд╛рдзреНрдпрдо рд╕реЗ рд╡реЗрдЯреНрд╕ рдЕрдкрдбреЗрдЯ рдХрд░рддреЗ рд╣реИрдВ, рддреЛ рдЧреНрд░реЗрдбрд┐рдПрдВрдЯреНрд╕ рд╣рд░ рд▓реЗрдпрд░ рдореЗрдВ рдЧреБрдгрд╛ рд╣реЛрддреЗ рдЬрд╛рддреЗ рд╣реИрдВред рдпрджрд┐ рдЗрди derivatives рдХреЗ рдорд╛рди рдмрд╣реБрдд рдЫреЛрдЯреЗ рд╣реИрдВ (рдЬреИрд╕реЗ 0.9 рдпрд╛ 0.5), рддреЛ рдмрд╣реБрдд рд╕рд╛рд░реА рд▓реЗрдпрд░реНрд╕ рдХреЗ рдмрд╛рдж рдЧреНрд░реЗрдбрд┐рдПрдВрдЯреНрд╕ тАЬvanishтАЭ рд╣реЛ рдЬрд╛рддреЗ рд╣реИрдВ тАФ рдпрд╛рдиреА рд╡реЗ рд▓рдЧрднрдЧ рд╢реВрдиреНрдп рдХреЗ рдмрд░рд╛рдмрд░ рд╣реЛ рдЬрд╛рддреЗ рд╣реИрдВред

рдЙрджрд╛рд╣рд░рдг:

Gradient тЙИ (0.9)^50 = 0.005

рдЗрд╕ рд╕реНрдерд┐рддрд┐ рдореЗрдВ рдиреЗрдЯрд╡рд░реНрдХ рдХреЗрд╡рд▓ рд╣рд╛рд▓ рдХреЗ рдЗрдирдкреБрдЯреНрд╕ рдкрд░ рдзреНрдпрд╛рди рджреЗрддрд╛ рд╣реИ рдФрд░ рдкреБрд░рд╛рдиреЗ рдЗрдирдкреБрдЯреНрд╕ рдХреЛ рднреВрд▓ рдЬрд╛рддрд╛ рд╣реИред

тЪЩя╕П LSTM рдХреИрд╕реЗ рдорджрдж рдХрд░рддрд╛ рд╣реИ?

LSTM рдХрд╛ рд╕рдмрд╕реЗ рдмрдбрд╝рд╛ рдпреЛрдЧрджрд╛рди рдпрд╣ рд╣реИ рдХрд┐ рдпрд╣ gradient flow рдХреЛ тАЬConstant Error Carousel (CEC)тАЭ рдХреЗ рдорд╛рдзреНрдпрдо рд╕реЗ рд╕реНрдерд┐рд░ рд░рдЦрддрд╛ рд╣реИред рдЗрд╕рд╕реЗ gradient рдирд╛ рддреЛ рдмрд╣реБрдд рдЫреЛрдЯрд╛ рд╣реЛрддрд╛ рд╣реИ рдФрд░ рдирд╛ рд╣реА explode рдХрд░рддрд╛ рд╣реИред

ЁЯза LSTM рдХреЗ рдкреНрд░рдореБрдЦ рдШрдЯрдХ рдЬреЛ Vanishing Gradient рд░реЛрдХрддреЗ рд╣реИрдВ:

1я╕ПтГг Cell State (CтВЬ):

рдпрд╣ рдПрдХ тАЬinformation highwayтАЭ рдХреА рддрд░рд╣ рдХрд╛рдо рдХрд░рддрд╛ рд╣реИ, рдЬреЛ gradients рдХреЛ рд▓рдВрдмреА рджреВрд░реА рддрдХ рдмрд┐рдирд╛ рдШрдЯреЗ рд╣реБрдП рдкреНрд░рд╡рд╛рд╣рд┐рдд рд╣реЛрдиреЗ рджреЗрддрд╛ рд╣реИред рдЗрд╕рдХреА linear рд╕рдВрд░рдЪрдирд╛ gradient decay рдХреЛ рд░реЛрдХрддреА рд╣реИред

2я╕ПтГг Forget Gate:

fтВЬ = ╧Г(W_f ┬╖ [hтВЬтВЛтВБ, xтВЬ] + b_f)

рдпрд╣ рддрдп рдХрд░рддрд╛ рд╣реИ рдХрд┐ рдХреМрди-рд╕реА рдкреБрд░рд╛рдиреА рдЬрд╛рдирдХрд╛рд░реА рд░рдЦрдиреА рд╣реИ рдФрд░ рдХреМрди-рд╕реА рд╣рдЯрд╛рдиреА рд╣реИ, рдЬрд┐рд╕рд╕реЗ рдиреЗрдЯрд╡рд░реНрдХ рдХреЗрд╡рд▓ рдЖрд╡рд╢реНрдпрдХ рдЬрд╛рдирдХрд╛рд░реА рдХреЛ рдЖрдЧреЗ рдмрдврд╝рд╛рддрд╛ рд╣реИред

3я╕ПтГг Input Gate:

рдпрд╣ рдирдИ рдЬрд╛рдирдХрд╛рд░реА рдЬреЛрдбрд╝рдиреЗ рдХреА рдорд╛рддреНрд░рд╛ рдХреЛ рдирд┐рдпрдВрддреНрд░рд┐рдд рдХрд░рддрд╛ рд╣реИ рддрд╛рдХрд┐ gradient рдмрд╣реБрдд рдЕрдзрд┐рдХ рди рдмрдврд╝реЗред

4я╕ПтГг Output Gate:

рдпрд╣ рдирд┐рдпрдВрддреНрд░рд┐рдд рдХрд░рддрд╛ рд╣реИ рдХрд┐ рдХрд┐рд╕ рдорд╛рддреНрд░рд╛ рдореЗрдВ рдЬрд╛рдирдХрд╛рд░реА рдЕрдЧрд▓реЗ рдЯрд╛рдЗрдо рд╕реНрдЯреЗрдк рддрдХ рдЬрд╛рдиреА рдЪрд╛рд╣рд┐рдПред рдпрд╣ рдЧреЗрдЯреНрд╕ gradient рдХреЛ explode рд╣реЛрдиреЗ рд╕реЗ рдмрдЪрд╛рддреЗ рд╣реИрдВред

ЁЯзо рдЧрдгрд┐рддреАрдп рд░реВрдк рд╕реЗ:

CтВЬ = fтВЬ * CтВЬтВЛтВБ + iтВЬ * C╠ГтВЬ
hтВЬ = oтВЬ * tanh(CтВЬ)

рдпрд╣ рд╕рдВрд░рдЪрдирд╛ gradient рдХреЛ рдПрдХ рд╕реНрдерд┐рд░ рдЪреИрдирд▓ рдореЗрдВ рдкреНрд░рд╡рд╛рд╣рд┐рдд рдХрд░рддреА рд╣реИ, рдЬрд┐рд╕рд╕реЗ рдпрд╣ рд╕рдордп рдХреЗ рд╕рд╛рде рдШрдЯрддрд╛ рдирд╣реАрдВ рд╣реИред

ЁЯУК Visualization:

рдЬрд╣рд╛рдБ рд╕рд╛рдорд╛рдиреНрдп RNN рдореЗрдВ gradient time рдХреЗ рд╕рд╛рде exponentially рдШрдЯрддрд╛ рд╣реИ, рд╡рд╣реАрдВ LSTM рдореЗрдВ рдпрд╣ рд╕реНрдерд┐рд░ рд░рд╣рддрд╛ рд╣реИ, рдЬрд┐рд╕рд╕реЗ long-term dependencies рдХреЛ рд╕реАрдЦрдирд╛ рд╕рдВрднрд╡ рд╣реЛрддрд╛ рд╣реИред

ЁЯЪА 2025 рдореЗрдВ рдЖрдзреБрдирд┐рдХ рд╕реБрдзрд╛рд░:

  • Peephole Connections: рдкреНрд░рддреНрдпреЗрдХ рдЧреЗрдЯ рдХреЛ cell state рддрдХ рдкрд╣реБрдБрдЪрдиреЗ рдХреА рдЕрдиреБрдорддрд┐ рджреЗрдХрд░ gradient flow рдмреЗрд╣рддрд░ рдмрдирд╛рддрд╛ рд╣реИред
  • Coupled Forget-Input Gates: Forget рдФрд░ Input рдЧреЗрдЯреНрд╕ рдХреЛ рдЬреЛрдбрд╝рдХрд░ gradient рдХреЛ рдФрд░ рд╕реНрдерд┐рд░ рдмрдирд╛рдирд╛ред
  • Layer Normalization LSTM: Gradient variance рдХреЛ normalize рдХрд░рдХреЗ training рд╕реНрдерд┐рд░ рдмрдирд╛рдирд╛ред

ЁЯУЧ Python рдЙрджрд╛рд╣рд░рдг:

from tensorflow.keras.models import Sequential
from tensorflow.keras.layers import LSTM, Dense

model = Sequential([
    LSTM(128, input_shape=(100, 64), return_sequences=True),
    Dense(1, activation='sigmoid')
])

ЁЯУЩ рдирд┐рд╖реНрдХрд░реНрд╖:

LSTM рдХреА рдЖрд░реНрдХрд┐рдЯреЗрдХреНрдЪрд░ рдиреЗ рдбреАрдк рд▓рд░реНрдирд┐рдВрдЧ рдХреЗ рдЗрддрд┐рд╣рд╛рд╕ рдореЗрдВ рдПрдХ рдХреНрд░рд╛рдВрддрд┐рдХрд╛рд░реА рдмрджрд▓рд╛рд╡ рдХрд┐рдпрд╛ред рдЗрд╕рдиреЗ Vanishing Gradient рдЬреИрд╕реА рдЬрдЯрд┐рд▓ рд╕рдорд╕реНрдпрд╛ рдХреЛ рджреВрд░ рдХрд░рдХреЗ RNNs рдХреЛ рд▓рдВрдмреА рдЕрд╡рдзрд┐ рддрдХ рд╕реАрдЦрдиреЗ рдореЗрдВ рд╕рдХреНрд╖рдо рдмрдирд╛рдпрд╛ред 2025 рдореЗрдВ, LSTMs рдЕрднреА рднреА Speech Recognition, Machine Translation, рдФрд░ Sequential Prediction рдХрд╛рд░реНрдпреЛрдВ рдХреЗ рд▓рд┐рдП рд╕рдмрд╕реЗ рд╡рд┐рд╢реНрд╡рд╕рдиреАрдп рдореЙрдбрд▓ рд╣реИрдВред

Related Articles

Applications of Deep Learning in Object Detection, Speech/Image Recognition, Video Analysis, NLP, and Medical Science | рдбреАрдк рд▓рд░реНрдирд┐рдВрдЧ рдХреЗ рдЕрдиреБрдкреНрд░рдпреЛрдЧ: рдСрдмреНрдЬреЗрдХреНрдЯ рдбрд┐рдЯреЗрдХреНрд╢рди, рд╕реНрдкреАрдЪ/рдЗрдореЗрдЬ рд░рд┐рдХрдЧреНрдирд┐рд╢рди, рд╡реАрдбрд┐рдпреЛ рдПрдирд╛рд▓рд┐рд╕рд┐рд╕, рдПрдирдПрд▓рдкреА рдФрд░ рдореЗрдбрд┐рдХрд▓ рд╕рд╛рдЗрдВрд╕

рдбреАрдк рд▓рд░реНрдирд┐рдВрдЧ рдХреЗ рдЕрдиреБрдкреНрд░рдпреЛрдЧ: рдСрдмреНрдЬреЗр...

Read More тЖТ

Generative Adversarial Networks (GANs): Concept, Architecture, and Applications | рдЬреЗрдирд░реЗрдЯрд┐рд╡ рдПрдбрд╡рд░реНрд╕реЗрд░рд┐рдпрд▓ рдиреЗрдЯрд╡рд░реНрдХ (GAN): рдЕрд╡рдзрд╛рд░рдгрд╛, рд╕рдВрд░рдЪрдирд╛ рдФрд░ рдЕрдиреБрдкреНрд░рдпреЛрдЧ

рдЬреЗрдирд░реЗрдЯрд┐рд╡ рдПрдбрд╡рд░реНрд╕реЗрд░рд┐рдпрд▓ рдиреЗрдЯрд╡рд░реНрдХ (GA...

Read More тЖТ

Auto-Regressive Models (NADE, MADE, PixelRNN): Concept, Architecture, and Deep Learning Applications | рдСрдЯреЛ-рд░реЗрдЧреНрд░реЗрд╕рд┐рд╡ рдореЙрдбрд▓реНрд╕ (NADE, MADE, PixelRNN): рдЕрд╡рдзрд╛рд░рдгрд╛, рд╕рдВрд░рдЪрдирд╛ рдФрд░ рдбреАрдк рд▓рд░реНрдирд┐рдВрдЧ рдореЗрдВ рдЕрдиреБрдкреНрд░рдпреЛрдЧ

рдСрдЯреЛ-рд░реЗрдЧреНрд░реЗрд╕рд┐рд╡ рдореЙрдбрд▓реНрд╕ (NADE, MADE, PixelRNN): рдЕ...

Read More тЖТ

Markov Chains: Concept, Transition Matrices, and Applications in Deep Learning | рдорд╛рд░реНрдХреЛрд╡ рдЪреЗрди: рдЕрд╡рдзрд╛рд░рдгрд╛, рдЯреНрд░рд╛рдВрдЬрд┐рд╢рди рдореИрдЯреНрд░рд┐рдХреНрд╕ рдФрд░ рдбреАрдк рд▓рд░реНрдирд┐рдВрдЧ рдореЗрдВ рдЕрдиреБрдкреНрд░рдпреЛрдЧ

рдорд╛рд░реНрдХреЛрд╡ рдЪреЗрди: рдЕрд╡рдзрд╛рд░рдгрд╛, рдЯреНрд░рд╛рдВрдЬрд┐рд╢рди ...

Read More тЖТ

Markov Networks (Markov Random Fields): Concept, Structure, and Applications | рдорд╛рд░реНрдХреЛрд╡ рдиреЗрдЯрд╡рд░реНрдХ (Markov Networks): рдЕрд╡рдзрд╛рд░рдгрд╛, рд╕рдВрд░рдЪрдирд╛ рдФрд░ рдЕрдиреБрдкреНрд░рдпреЛрдЧ

рдорд╛рд░реНрдХреЛрд╡ рдиреЗрдЯрд╡рд░реНрдХ (Markov Random Fields): рдЕрд╡рдзрд╛рд░р...

Read More тЖТ