使用pytorch实现一个softmax回归模型

In [1]:
import torch
from torch import nn
from torch.nn import init
import numpy as np
import sys
import d2lzh_pytorch as d2l    

# 3.7.1 获取和读取数据
仍使用Fashion-MNIST数据集，批量大小为 256

In [2]:
batch_size = 256
train_iter, test_iter = d2l.load_data_fashion_mnist(batch_size)

# 3.7.2 定义和初始化模型
softmax回归的输出层是一个全连接层，我们用一个线性模块就可以了，因为前面我们数据返回的每个batch样本 x 的形状是(batch_size, 1, 28, 28)，所以先用 view() 将 x 的形状转换成(batch_size, 784)才送入全连接层。

In [3]:
num_inputs = 784
num_outputs = 10

class LinearNet(nn.Module):
    def __init__(self, num_inputs, num_outputs):
        super(LinearNet, self).__init__()
        self.linear = nn.Linear(num_inputs, num_outputs)
        
    def forward(self, x): # x shape：(batch, 1, 28, 28)
        y = self.linear(x.view(x.shape[0], -1))
        return y
    
net = LinearNet(num_inputs, num_outputs)

我们将对 x 的形状转换的这个功能自定义一个 FLattenLayer 并记录在 d2lzh_pytorch 中方便后面使用

In [4]:
# 本函数已保存在 d2lzh_pytorch 包中方便以后使用
class FlattenLayer(nn.Module):
    def __init__(self):
        super(FlattenLayer, self).__init__()
    def forward(self, x): # x shape: (batch, *, *, ...)
        return x.view(x.shape[0], -1)

这样我们就可以更方便的定义我们的模型了

In [5]:
from collections import OrderedDict

net = nn.Sequential(
    # FlattenLayer()
    # nn.Linear(num_inputs,num_outputs)
    OrderedDict([
        ('flatten', FlattenLayer()),
        ('linear', nn.Linear(num_inputs, num_outputs))
    ])
)

使用均值为 0、标准差为 0.01的正态分布随机初始化模型的权重参数

In [6]:
init.normal_(net.linear.weight, mean=0, std=0.01)
init.constant_(net.linear.bias, val=0)

Parameter containing:
tensor([0., 0., 0., 0., 0., 0., 0., 0., 0., 0.], requires_grad=True)