LSTM神经网络输入输出究竟是怎样的？

2024-05-19 23:03
1. LSTM神经网络输入输出究竟是怎样的？

输入输出都是向量，或者说是矩阵。LSTM用于分类的话，后面一般会接softmax层。个人浅薄理解，拿动作识别分类举例，每个动作帧放入LSTM中训练，还是根据task来训练每个LSTM单元的Weights。所以LSTM的单元数量跟输入和输出都没有关系，甚至还可以几层LSTM叠加起来用。分类的话，一般用最后一个单元接上softmax层。LSTM结构是传统的RNN结构扩展，解决了传统RNN梯度消失/爆炸的问题，从而使得深层次的网络更容易训练。从这个角度理解，可能会容易很多。今年的ResNet也是使传统的CNN更容易训练weights。看来deeplearning越来越深是趋势啊。如果说训练，就一个关键，所谓LSTMUnroll，将RNN展开成一个静态的“并行”网络，内部有“侧向连接”，实现长的短时记忆功能（状态“记忆”在LSTMCell里）。如果说预测，也就一个关键，要将Cell的h和C弄出来，作为当前状态（也就是所谓“记忆”）作为init参数输入，这样，携带了当前记忆状态的网络，预测得到的就是下一个输入了，所谓的recurrent了。那份代码里还包含了一个使用cudnn的实现（built-inRNNoperator），这是一个高性能的版本，可以真正干活的。原来我也尝试搞懂一些天书般的公式，很快发现从那里入手是个错误。强烈推荐：理解LSTM网络（翻译自UnderstandingLSTMNetworks）只要有一点点CNN基础+半个小时，就可以通过这篇文章理解LSTM的基础原理。回答你的问题：和神经元个数无关，不知道你是如何理解“神经元”这个概念的，输入输出层保证tensor的维数和输入输出一致就可以了。
LSTM神经网络输入输出究竟是怎样的？