In [1]:
import torch
from torch import nn
from d2l import torch as d2l

In [2]:
batch_size = 256
train_iter, test_iter = d2l.load_data_fashion_mnist(batch_size)

In [3]:
# pytorch不会饮食的调整输入的形状
# 因此，我们定义了展平层（flatten layer），用于在线性层之前调整网络输入的形状
net = nn.Sequential(nn.Flatten(), nn.Linear(784, 10))

In [5]:
def init_weights(m):
    if type(m) == nn.Linear:
        nn.init.normal_(m.weight, std=0.1)

net.apply(init_weights)
# net.apply函数是PyTorch中的一个递归函数，它可以用来对神经网络中的每一层应用一个自定义函数，
# 使用该函数可以让用户自定义神经网络中每一层的行为

Sequential(
  (0): Flatten(start_dim=1, end_dim=-1)
  (1): Linear(in_features=784, out_features=10, bias=True)
)

In [6]:
# 定义loss损失函数cross_entropy
loss = nn.CrossEntropyLoss()

In [7]:
# 使用学习率为0.01的小批量随机梯度下降（lsgd）
# 小批量随机梯度下降（SGD）是一种优化算法，它在每次迭代中仅使用一小部分的训练样本来计算梯度，然后更新参数。
# 这种优化算法的优势在于，它可以高效地处理大规模数据集，因为它只需要计算一小部分数据的梯度，而不需要处理整个数据集。
trainer = torch.optim.SGD(net.parameters(), lr=0.1)

In [8]:
num_epochs = 10
d2l.train_ch3(net, train_iter, test_iter, loss, num_epochs, trainer)

: 

: 