一个 Decoder-only Transformer,做字符级语言模型。可以喂一段中文文本进去,模型模拟自动续写。
ts.mp4
├── new_ts.py # 主程序(训练 + 测试 + 文本生成)
├── 1.ipynb # Notebook 版本,方便一步步看过程
└── data_source/ # 训练文本(西游记、射雕英雄传等)
pip3 install torch torchvision --index-url https://download.pytorch.org/whl/cu132
pip install matplotlib
python new_ts.py训练完会自动保存权重,然后进入交互式续写模式,输入一段文字模型会接着往下写。
| 参数 | 值 |
|---|---|
| 架构 | Decoder-only Transformer |
| 注意力 | 6 头因果自注意力 |
| Embedding 维度 | 642 |
| Block 层数 | 2 |
| 上下文窗口 | 512 tokens |
| 训练轮数 | 1000 epochs |
- 多头自注意力:Q/K/V 线性变换 → 缩放点积 → 因果掩码 → Softmax → Dropout
- 前馈网络:两层 Linear + ReLU
- 残差连接 + LayerNorm(Pre-Norm)
- 自回归生成:逐 token 采样,支持上下文续写和用户输入生成
训练数据用的是中文小说文本,词表是字符级的(每个汉字/标点是一个 token)。只是模拟流程,效果不是很好。