# 6.5 循环神经网络的简洁实现

In [1]:
import time
import math
import numpy as np
import torch
from torch import nn,optim
import torch.nn.functional as F

import sys
sys.path.append("..")
import d2lzh_pytorch as d2l
device=torch.device('cuda'if torch.cuda.is_available()else 'cpu')

(corpus_indices,char_to_idx,idx_to_char,vocab_size)=d2l.load_data_jay_lyrics()

# corpus_indices 字符对应的索引列表
# char_to_idx 字符映射到索引构造的词典
# idx_to_char 字符集列表
# vocab_size 字符集列表的长度

## 6.5.1 定义模型

PyTorch中的nn模块提供了循环神经网络的实现。下面构造一个含单隐藏层、隐藏单元个数为256的循环神经网络层rnn_layer。

In [2]:
num_hiddens=256
rnn_layer=nn.RNN(input_size=vocab_size,hidden_size=num_hiddens)

与上一节中实现的循环神经网络不同，这里rnn_layer的输入形状为(时间步数, 批量大小, 输入个数)。其中输入个数即one-hot向量长度（词典大小）。此外，rnn_layer作为nn.RNN实例，在前向计算后会分别返回输出和隐藏状态h，其中输出指的是隐藏层在各个时间步上计算并输出的隐藏状态，它们通常作为后续输出层的输入。需要强调的是，该“输出”本身并不涉及输出层计算，形状为(时间步数, 批量大小, 隐藏单元个数)。而nn.RNN实例在前向计算返回的隐藏状态指的是隐藏层在最后时间步的隐藏状态：当隐藏层有多层时，每一层的隐藏状态都会记录在该变量中；对于像长短期记忆（LSTM），隐藏状态是一个元组(h, c)，即hidden state和cell state。我们会在本章的后面介绍长短期记忆和深度循环神经网络。关于循环神经网络（以LSTM为例）的输出，可以参考下图:

![Snipaste_2020-10-02_10-47-17.png](attachment:Snipaste_2020-10-02_10-47-17.png)

输出形状为(时间步数, 批量大小, 隐藏单元个数)，隐藏状态h的形状为(层数, 批量大小, 隐藏单元个数)。
PyTorch的nn.RNN实例在前向计算后会分别返回输出和隐藏状态。该前向计算并不涉及输出层计算。

https://zhuanlan.zhihu.com/p/71732459
    
https://blog.csdn.net/yyhaker/article/details/79156434
    
https://karpathy.github.io/2015/05/21/rnn-effectiveness/

In [4]:
num_steps=35
batch_size=2
state=None
X=torch.rand(num_steps,batch_size,vocab_size)
Y,state_new=rnn_layer(X,state)

print(Y.shape,len(state_new),state_new[0].shape)

torch.Size([35, 2, 256]) 1 torch.Size([2, 256])


如果rnn_layer是nn.LSTM实例，那么上面的输出是什么？

接下来继承Module类来定义一个完整的循环神经网络。它首先将输入数据使用one-hot向量表示后输入到rnn_layer中，然后使用全连接输出层得到输出。输出个数等于词典大小vocab_size。

In [5]:
class RNNModel(nn.Module):
    def __init__(self,rnn_layer,vocab_size):
        super(RNNModel,self).__init__()
        self.rnn=rnn_layer
        self.hidden_size=rnn_layer.hidden_size*(2 if rnn_layer.bidirectional else 1)
        self.vocab_size=vocab_size
        self.dense=nn.Linear(self.hidden_size,vocab_size)
        self.state=None
    
    def forward(self,inputs,state):#inputs:(batch_size,seq_len)
        #获取one-hot向量表示
        X=d2l.to_onehot(inputs,self.vocab_size)#X是个list
        Y,self.state=self.rnn(torch.stack(X),state)#torch.stack(X,dim=0)直接堆叠在一块
#         torch.stack()是将原来的几个tensor按照一定方式进行堆叠，然后在按照堆叠后的维度进行切分。
        # 全连接层会首先将Y的形状变成(num_steps * batch_size, num_hiddens)，它的输出
        # 形状为(num_steps * batch_size, vocab_size)
        output=self.dense(Y.view(-1,Y.shape[-1]))#全连接层
        return output,self.state
        

torch.stack详解：https://blog.csdn.net/mch2869253130/article/details/105339852?utm_medium=distribute.pc_relevant.none-task-blog-BlogCommendFromMachineLearnPai2-1.edu_weight&depth_1-utm_source=distribute.pc_relevant.none-task-blog-BlogCommendFromMachineLearnPai2-1.edu_weight

https://blog.csdn.net/m0_38026629/article/details/86519291?utm_medium=distribute.pc_relevant.none-task-blog-title-8&spm=1001.2101.3001.4242

## 6.5.2 训练模型

In [6]:
#定义预测函数，实现区别在于前向计算和初始化隐藏状态的函数接口

def predict_rnn_pytorch(prefix,num_chars,model,vocab_size,
                        device,idx_to_char,char_to_idx):
    state=None
    output=[char_to_idx[prefix[0]]]#output会记录prefix加上输出
    for t in range(num_chars+len(prefix)-1):
        X=torch.tensor([output[-1]],device=device).view(1,1)
        if state is not None:
            if isinstance(state,tuple):  #isinstance(object, classinfo) 判断实例是否是这个类或者object是变量
               # LSTM, state:(h, c) 
                state=(state[0].to(device),state[1].to(device))
            else:
                state=state.to(device)
        
        (Y,state)=model(X,state)
        if t<len(prefix)-1:
            output.append(char_to_idx[prefix[t+1]])
        else:
            output.append(int(Y.argmax(dim=1).item()))
    
    return ''.join([idx_to_char[i] for i in output])

#----------------------------------------------------------------
# 'sep'.join(seq)

# 参数说明
# sep：分隔符。可以为空
# seq：要连接的元素序列、字符串、元组、字典
# 上面的语法即：以sep作为分隔符，将seq所有的元素合并成一个新的字符串

# 返回值：返回一个以分隔符sep连接各个元素后生成的字符串

In [8]:
#使用权重为随机值的模型来预测一次

model=RNNModel(rnn_layer,vocab_size).to(device)
predict_rnn_pytorch('分开',10,model,vocab_size,device,idx_to_char,char_to_idx)

'分开简解坦金简除简换专雕'

In [9]:
#实现训练函数，使用相邻采样读取数据

def train_and_predict_rnn_pytorch(model,num_hiddens,vocab_size,device,
                                 corpus_indices,idx_to_char,char_to_idx,
                                 num_epochs,num_steps,lr,clipping_theta,
                                 batch_size,pred_period,pred_len,prefixes):
    #clipping_theta裁剪梯度为了应对梯度衰减或爆炸
    #pred_period 
    loss=nn.CrossEntropyLoss()
    optimizer=torch.optim.Adam(model.parameters(),lr=lr)
    model.to(device)
    state=None
    for epoch in range(num_epochs):
        l_sum,n,start=0.0,0,time.time()
        data_iter=d2l.data_iter_consecutive(corpus_indices,batch_size,num_steps,device)#相邻采样
        for X,Y in data_iter:
            if state is not None:
                # 使用detach函数从计算图分离隐藏状态, 这是为了
                # 使模型参数的梯度计算只依赖一次迭代读取的小批量序列(防止梯度计算开销太大)
                if isinstance(state,tuple):#LSTM,state:(h,c)
                    state=(state[0].detach(),state[1].detach())
                else:
                    state=state.detach()
                
            (output,state)=model(X,state)# output: 形状为(num_steps * batch_size, vocab_size)
            
            # Y的形状是(batch_size, num_steps)，转置后再变成长度为
            # batch * num_steps 的向量，这样跟输出的行一一对应
            y=torch.transpose(Y,0,1).contiguous().view(-1)#深拷贝
            l=loss(output,y.long())
            
            optimizer.zero_grad()
            l.backward()
            #梯度裁剪
            d2l.grad_clipping(model.parameters(),clipping_theta,device)
            optimizer.step()
            l_sum+=l.item()*y.shape[0]
            n+=y.shape[0]
            
            
        try:
            preplexity=math.exp(l_sum/n)
        except OverflowError:
            perplexity=float('inf')
        if(epoch+1)%pred_period==0:
            print('epoch %d, perplexity %f, time %.2f sec' % (
                epoch + 1, perplexity, time.time() - start))
            #预测
            for prefix in prefixes:
                print('-',predict_rnn_pytorch(
                    prefix,pred_len,model,vocab_size,
                    device,idx_to_char,char_to_idx))

https://blog.csdn.net/kdongyi/article/details/108180250

In [None]:
#训练模型
num_epochs,batch_size,lr,clipping_theta=250,32,1e-3,1e-2
pred_period,pred_len,prefixes=50,50,['分开','不分开']
train_and_predict_rnn_pytorch(model,num_hiddens,vocab_size,device,
                             corpus_indices,idx_to_char,char_to_idx,
                             num_epochs,num_steps,lr,clipping_theta,
                             batch_size,pred_period,pred_len,prefixes)