Long Short-Term Memory (LSTM): Architecture, Gates, and Working Explained | рд▓реЙрдиреНрдЧ рд╢реЙрд░реНрдЯ-рдЯрд░реНрдо рдореЗрдореЛрд░реА (LSTM): рд╕рдВрд░рдЪрдирд╛, рдЧреЗрдЯреНрд╕ рдФрд░ рдХрд╛рд░реНрдпрдкреНрд░рдгрд╛рд▓реА

Long Short-Term Memory (LSTM): Architecture, Gates, and Working Explained | рд▓реЙрдиреНрдЧ рд╢реЙрд░реНрдЯ-рдЯрд░реНрдо рдореЗрдореЛрд░реА (LSTM): рд╕рдВрд░рдЪрдирд╛, рдЧреЗрдЯреНрд╕ рдФрд░ рдХрд╛рд░реНрдпрдкреНрд░рдгрд╛рд▓реА


рд▓реЙрдиреНрдЧ рд╢реЙрд░реНрдЯ-рдЯрд░реНрдо рдореЗрдореЛрд░реА (LSTM): рд╕рдВрд░рдЪрдирд╛, рдЧреЗрдЯреНрд╕ рдФрд░ рдХрд╛рд░реНрдпрдкреНрд░рдгрд╛рд▓реА

Long Short-Term Memory (LSTM) рдПрдХ рд╡рд┐рд╢реЗрд╖ рдкреНрд░рдХрд╛рд░ рдХрд╛ Recurrent Neural Network (RNN) рд╣реИ, рдЬрд┐рд╕реЗ 1997 рдореЗрдВ Hochreiter рдФрд░ Schmidhuber рдиреЗ рд╡рд┐рдХрд╕рд┐рдд рдХрд┐рдпрд╛ рдерд╛ред рдЗрд╕рдХрд╛ рдореБрдЦреНрдп рдЙрджреНрджреЗрд╢реНрдп RNNs рдореЗрдВ рдЖрдиреЗ рд╡рд╛рд▓реА Vanishing Gradient рд╕рдорд╕реНрдпрд╛ рдХреЛ рд╣рд▓ рдХрд░рдирд╛ рд╣реИред LSTM рдиреЗрдЯрд╡рд░реНрдХреНрд╕ рд▓рдореНрдмреЗ рд╕рдордп рддрдХ рдЬрд╛рдирдХрд╛рд░реА рдпрд╛рдж рд░рдЦ рд╕рдХрддреЗ рд╣реИрдВ, рдЬреЛ рдЙрдиреНрд╣реЗрдВ рдЕрдиреБрдХреНрд░рдо рдЖрдзрд╛рд░рд┐рдд рдХрд╛рд░реНрдпреЛрдВ рдЬреИрд╕реЗ рднрд╛рд╖рд╛ рдЕрдиреБрд╡рд╛рдж, рд╕реНрдкреАрдЪ рд░рд┐рдХрдЧреНрдирд┐рд╢рди, рдФрд░ рдЯрд╛рдЗрдо рд╕реАрд░реАрдЬрд╝ рдлреЛрд░рдХрд╛рд╕реНрдЯрд┐рдВрдЧ рдореЗрдВ рдЕрддреНрдпрдВрдд рдЙрдкрдпреЛрдЧреА рдмрдирд╛рддрд╛ рд╣реИред

ЁЯУШ LSTM рдХреНрдпрд╛ рд╣реИ?

LSTM рдПрдХ рдРрд╕рд╛ рдиреНрдпреВрд░рд▓ рдиреЗрдЯрд╡рд░реНрдХ рд╣реИ рдЬреЛ рдХрд┐рд╕реА рдЕрдиреБрдХреНрд░рдо (sequence) рдХреЗ рд▓рдВрдмреЗ рд╕рдордп рддрдХ рд╕рдВрдмрдВрдзреЛрдВ рдХреЛ рдпрд╛рдж рд░рдЦ рд╕рдХрддрд╛ рд╣реИред рдпрд╣ рдРрд╕рд╛ Memory Cell рдФрд░ Gating Mechanisms рдХрд╛ рдЙрдкрдпреЛрдЧ рдХрд░рдХреЗ рдХрд░рддрд╛ рд╣реИред

тЪЩя╕П LSTM рдХреА рд╕рдВрд░рдЪрдирд╛ (Architecture):

рдПрдХ LSTM рд╕реЗрд▓ рдореЗрдВ рддреАрди рдкреНрд░рдореБрдЦ рдЧреЗрдЯреНрд╕ рд╣реЛрддреЗ рд╣реИрдВ тАФ Forget Gate, Input Gate, рдФрд░ Output Gateред рдпреЗ рдЧреЗрдЯреНрд╕ рдпрд╣ рдирд┐рдпрдВрддреНрд░рд┐рдд рдХрд░рддреЗ рд╣реИрдВ рдХрд┐ рдХреМрди рд╕реА рдЬрд╛рдирдХрд╛рд░реА рдпрд╛рдж рд░рдЦрдиреА рд╣реИ рдФрд░ рдХреМрди рд╕реА рднреВрд▓рдиреА рд╣реИред

1я╕ПтГг Forget Gate (рднреВрд▓ рдЧреЗрдЯ):

рдпрд╣ рддрдп рдХрд░рддрд╛ рд╣реИ рдХрд┐ рдкрд┐рдЫрд▓реЗ рд╕реЗрд▓ рдХреА рдХреМрди рд╕реА рдЬрд╛рдирдХрд╛рд░реА рдХреЛ рд╣рдЯрд╛рдирд╛ рд╣реИред рдЗрд╕рдХрд╛ рд╕рдореАрдХрд░рдг рд╣реИ:

fтВЬ = ╧Г(W_f ┬╖ [hтВЬтВЛтВБ, xтВЬ] + b_f)

2я╕ПтГг Input Gate (рдЗрдирдкреБрдЯ рдЧреЗрдЯ):

рдпрд╣ рдирдИ рдЬрд╛рдирдХрд╛рд░реА рдЬреЛрдбрд╝рдиреЗ рдХреЗ рд▓рд┐рдП рдЬрд┐рдореНрдореЗрджрд╛рд░ рд╣реЛрддрд╛ рд╣реИред

iтВЬ = ╧Г(W_i ┬╖ [hтВЬтВЛтВБ, xтВЬ] + b_i)
C╠ГтВЬ = tanh(W_c ┬╖ [hтВЬтВЛтВБ, xтВЬ] + b_c)

3я╕ПтГг Output Gate (рдЖрдЙрдЯрдкреБрдЯ рдЧреЗрдЯ):

рдпрд╣ рддрдп рдХрд░рддрд╛ рд╣реИ рдХрд┐ рд╕реЗрд▓ рд╕реНрдЯреЗрдЯ рд╕реЗ рдХреМрди рд╕реА рдЬрд╛рдирдХрд╛рд░реА рдЖрдЙрдЯрдкреБрдЯ рдХрд░рдиреА рд╣реИред

oтВЬ = ╧Г(W_o ┬╖ [hтВЬтВЛтВБ, xтВЬ] + b_o)
hтВЬ = oтВЬ * tanh(CтВЬ)

ЁЯзо Cell State рдХрд╛ рдЕрдкрдбреЗрдЯ:

LSTM рдореЗрдВ рдЬрд╛рдирдХрд╛рд░реА рдХрд╛ рдореБрдЦреНрдп рдкреНрд░рд╡рд╛рд╣ Cell State (CтВЬ) рдХреЗ рдорд╛рдзреНрдпрдо рд╕реЗ рд╣реЛрддрд╛ рд╣реИред рдЗрд╕реЗ рдЕрдкрдбреЗрдЯ рдХрд░рдиреЗ рдХрд╛ рд╕рдореАрдХрд░рдг:

CтВЬ = fтВЬ * CтВЬтВЛтВБ + iтВЬ * C╠ГтВЬ

рдЗрд╕рд╕реЗ рдиреЗрдЯрд╡рд░реНрдХ рдкреБрд░рд╛рдиреА рдЬрд╛рдирдХрд╛рд░реА рдХрд╛ рдЖрд╡рд╢реНрдпрдХ рд╣рд┐рд╕реНрд╕рд╛ рдмрдирд╛рдП рд░рдЦрддрд╛ рд╣реИ рдФрд░ рдирдИ рдЬрд╛рдирдХрд╛рд░реА рдЬреЛрдбрд╝рддрд╛ рд╣реИред

ЁЯУЧ Python рдЙрджрд╛рд╣рд░рдг (Keras):

from tensorflow.keras.models import Sequential
from tensorflow.keras.layers import LSTM, Dense

model = Sequential([
    LSTM(128, input_shape=(100, 64)),
    Dense(1, activation='sigmoid')
])

ЁЯза LSTM рдХреА рд╡рд┐рд╢реЗрд╖рддрд╛рдПрдБ:

  • Vanishing Gradient рд╕рдорд╕реНрдпрд╛ рдХреЛ рд╣рд▓ рдХрд░рддрд╛ рд╣реИред
  • Long-term dependency рд╕реАрдЦ рд╕рдХрддрд╛ рд╣реИред
  • Sequential рдбреЗрдЯрд╛ рдХреЗ рд▓рд┐рдП рдЙрдкрдпреБрдХреНрддред
  • рдЧрд╣рд░рд╛рдИ рдореЗрдВ рд╕реНрдерд┐рд░ gradient propagationред

ЁЯЪА LSTM рдХреЗ рдЕрдиреБрдкреНрд░рдпреЛрдЧ:

  • рднрд╛рд╖рд╛ рдЕрдиреБрд╡рд╛рдж (Machine Translation)
  • рд╕реНрдкреАрдЪ рд░рд┐рдХрдЧреНрдирд┐рд╢рди
  • рдЯреЗрдХреНрд╕реНрдЯ рдЬрдирд░реЗрд╢рди
  • рдЯрд╛рдЗрдо-рд╕реАрд░реАрдЬрд╝ рдкреНрд░реЗрдбрд┐рдХреНрд╢рди
  • рд╡реАрдбрд┐рдпреЛ рдПрдирд╛рд▓рд┐рдЯрд┐рдХреНрд╕

тЪЦя╕П LSTM рдмрдирд╛рдо GRU:

рдкреИрд░рд╛рдореАрдЯрд░LSTMGRU
рдЧреЗрдЯреНрд╕ рдХреА рд╕рдВрдЦреНрдпрд╛32
Memory Cellрд╣реИрдирд╣реАрдВ
Computation TimeрдзреАрдорд╛рддреЗрдЬрд╝
AccuracyрдЕрдзрд┐рдХ рд╕реНрдерд┐рд░рдереЛрдбрд╝реА рдХрдо

ЁЯУЩ рдирд┐рд╖реНрдХрд░реНрд╖:

LSTM рдиреЗ рдбреАрдк рд▓рд░реНрдирд┐рдВрдЧ рдореЗрдВ рдЕрдиреБрдХреНрд░рдо рдбреЗрдЯрд╛ рдХреА рдХреНрд░рд╛рдВрддрд┐ рд▓рд╛ рджреАред рдпрд╣ рдореЙрдбрд▓ рд▓рдВрдмреА рдЕрд╡рдзрд┐ рдХреА рдирд┐рд░реНрднрд░рддрд╛рдУрдВ рдХреЛ рд╕реАрдЦрдиреЗ рдореЗрдВ рд╕рдХреНрд╖рдо рд╣реИ, рдЬреЛ рдкрд╛рд░рдВрдкрд░рд┐рдХ RNNs рдирд╣реАрдВ рдХрд░ рд╕рдХрддреЗ рдереЗред 2025 рдореЗрдВ, LSTM рдХрд╛ рдЙрдкрдпреЛрдЧ рдЕрднреА рднреА NLP, рдЯрд╛рдЗрдо-рд╕реАрд░реАрдЬрд╝ рдПрдирд╛рд▓рд┐рдЯрд┐рдХреНрд╕, рдФрд░ рдСрдбрд┐рдпреЛ рдкреНрд░реЛрд╕реЗрд╕рд┐рдВрдЧ рдореЗрдВ рд╡реНрдпрд╛рдкрдХ рд░реВрдк рд╕реЗ рдХрд┐рдпрд╛ рдЬрд╛ рд░рд╣рд╛ рд╣реИред рдпрд╣ GRU рдФрд░ Transformer architectures рдХрд╛ рдЖрдзрд╛рд░ рд╣реИред

Related Articles

Applications of Deep Learning in Object Detection, Speech/Image Recognition, Video Analysis, NLP, and Medical Science | рдбреАрдк рд▓рд░реНрдирд┐рдВрдЧ рдХреЗ рдЕрдиреБрдкреНрд░рдпреЛрдЧ: рдСрдмреНрдЬреЗрдХреНрдЯ рдбрд┐рдЯреЗрдХреНрд╢рди, рд╕реНрдкреАрдЪ/рдЗрдореЗрдЬ рд░рд┐рдХрдЧреНрдирд┐рд╢рди, рд╡реАрдбрд┐рдпреЛ рдПрдирд╛рд▓рд┐рд╕рд┐рд╕, рдПрдирдПрд▓рдкреА рдФрд░ рдореЗрдбрд┐рдХрд▓ рд╕рд╛рдЗрдВрд╕

рдбреАрдк рд▓рд░реНрдирд┐рдВрдЧ рдХреЗ рдЕрдиреБрдкреНрд░рдпреЛрдЧ: рдСрдмреНрдЬреЗр...

Read More тЖТ

Generative Adversarial Networks (GANs): Concept, Architecture, and Applications | рдЬреЗрдирд░реЗрдЯрд┐рд╡ рдПрдбрд╡рд░реНрд╕реЗрд░рд┐рдпрд▓ рдиреЗрдЯрд╡рд░реНрдХ (GAN): рдЕрд╡рдзрд╛рд░рдгрд╛, рд╕рдВрд░рдЪрдирд╛ рдФрд░ рдЕрдиреБрдкреНрд░рдпреЛрдЧ

рдЬреЗрдирд░реЗрдЯрд┐рд╡ рдПрдбрд╡рд░реНрд╕реЗрд░рд┐рдпрд▓ рдиреЗрдЯрд╡рд░реНрдХ (GA...

Read More тЖТ

Auto-Regressive Models (NADE, MADE, PixelRNN): Concept, Architecture, and Deep Learning Applications | рдСрдЯреЛ-рд░реЗрдЧреНрд░реЗрд╕рд┐рд╡ рдореЙрдбрд▓реНрд╕ (NADE, MADE, PixelRNN): рдЕрд╡рдзрд╛рд░рдгрд╛, рд╕рдВрд░рдЪрдирд╛ рдФрд░ рдбреАрдк рд▓рд░реНрдирд┐рдВрдЧ рдореЗрдВ рдЕрдиреБрдкреНрд░рдпреЛрдЧ

рдСрдЯреЛ-рд░реЗрдЧреНрд░реЗрд╕рд┐рд╡ рдореЙрдбрд▓реНрд╕ (NADE, MADE, PixelRNN): рдЕ...

Read More тЖТ

Markov Chains: Concept, Transition Matrices, and Applications in Deep Learning | рдорд╛рд░реНрдХреЛрд╡ рдЪреЗрди: рдЕрд╡рдзрд╛рд░рдгрд╛, рдЯреНрд░рд╛рдВрдЬрд┐рд╢рди рдореИрдЯреНрд░рд┐рдХреНрд╕ рдФрд░ рдбреАрдк рд▓рд░реНрдирд┐рдВрдЧ рдореЗрдВ рдЕрдиреБрдкреНрд░рдпреЛрдЧ

рдорд╛рд░реНрдХреЛрд╡ рдЪреЗрди: рдЕрд╡рдзрд╛рд░рдгрд╛, рдЯреНрд░рд╛рдВрдЬрд┐рд╢рди ...

Read More тЖТ

Markov Networks (Markov Random Fields): Concept, Structure, and Applications | рдорд╛рд░реНрдХреЛрд╡ рдиреЗрдЯрд╡рд░реНрдХ (Markov Networks): рдЕрд╡рдзрд╛рд░рдгрд╛, рд╕рдВрд░рдЪрдирд╛ рдФрд░ рдЕрдиреБрдкреНрд░рдпреЛрдЧ

рдорд╛рд░реНрдХреЛрд╡ рдиреЗрдЯрд╡рд░реНрдХ (Markov Random Fields): рдЕрд╡рдзрд╛рд░р...

Read More тЖТ