GitHub

中文工程教程 · 二十章

从一个 token 出发,读懂文本、视觉、语音与实时交互。

沿着输入、张量、调用链和实验结果,走进 MiniMind、MiniMind-V 与 MiniMind-O。每一章都回答一个可以定位、运行和复核的问题。

✓ CPU 小实验已覆盖二十章;GPU 训练、语音质量与真实设备时延另行标注
一条可追踪的路径● LIVE
01token输入
→
04Q · K · V注意力
14pixels视觉
→
18codes音频
同一套阅读方法,连接四种模态
shapemaskcache
20章源码阅读
4条学习路线
2种出版格式
A → C分层实验

这本书写什么

把“看过源码”变成“能解释、能定位、能验证”。

不从宏大概念开始,而从一个可观察的输入开始:它在哪里被改形?谁消费了它?哪一个实验能证明我们的理解?

01
↳

沿着调用链

从命令入口追到数据集、模型、loss、采样和输出,关键调用边同时定位调用者与被调用者。

看章节 →
02
▦

每一步看 shape

用小数字例子补齐张量、广播、矩阵乘法和掩码,把抽象运算落到输入与输出的形状。

读第 01 章 ↗
03
✓

用实验验理解

A 层 CPU 教学例子、B 层真实源码接入、C 层训练评估分开记录,不把“跑通”写成“有效”。

查看实验 →

怎么读

先闭环,再选择方向。

第一次阅读建议完成 01~08,建立文本模型的完整路径;之后按兴趣进入后训练、视觉或音频实时交互。

01

第一篇 · 基础闭环

输入 → 模型 → 训练 → 评估

01—08:环境、token、注意力、缓存、数据、训练和评估。

进入基础篇 →
02

第二篇 · 后训练

路由、偏好与 Agent

09—13:MoE、LoRA、蒸馏、DPO、GRPO 与多轮工具反馈。

进入后训练 →
03

第三篇 · 视觉

图像怎样进入语言模型

14—15:图像预处理、patch、projector、冻结策略与视觉评估。

进入视觉篇 →
04

第四篇 · 音频与交互

从波形到可打断的会话

16—20:特征、Bridge、八路码本、训练流水线和实时播放队列。

进入音频篇 →

二十章目录

每章回答一个具体问题。

显示 20 章

配套材料

书稿、实验和发行文件,都在仓库里。

章节链接跟随仓库书稿;电子书下载固定为 v1.0.1,尚未包含 2026-10-08 的源码阅读勘误。

⌁离线友好:站点不依赖 CDN;书稿资源、字体与出版记录均在仓库中维护。查看出版说明 →

源码基线

三套仓库,三个固定版本。

书稿中的实现行为以锁定 commit 为准;上游更新不会自动改变当前章节结论。