14 notes / learn one at a time
LLM × CV
过去十年真正留下来的核心技术。每篇只解决一个相对完整的问题,并用最小例子、常见误解和自测把它讲到能复述。
14 篇独立文章
4 条主线
状态:初稿待学习
Part I · 序列模型与预训练
01序列地基
Token、Embedding 与自回归训练
原始信息怎样变成模型能计算的序列,next-token prediction 又到底优化了什么。
02统一骨架
Attention 与 Transformer
从 Q/K/V、缩放点积、mask 到多头注意力,理解 Transformer 的信息流。
03架构选择
GPT、BERT 与 T5
decoder-only、encoder-only 与 encoder-decoder 为什么形成不同的模型能力。
04规模化
Scaling Laws、Chinchilla 与 MoE
参数、数据和算力怎样配比,以及稀疏专家怎样扩大容量。
Part II · 视觉表示与多模态
05视觉骨架
ResNet、ViT 与 Swin
从卷积的局部先验,到图片 patch token,再到层级视觉 Transformer。
06无标签学习
SimCLR、MoCo、DINO 与 MAE
没有人工类别标签时,视觉监督信号从哪里来,以及怎样避免表示坍缩。
07跨模态对齐
CLIP 与多模态模型
图像和文字如何进入共同语义空间,以及视觉编码器怎样接入语言模型。
08视觉任务
检测、分割与 Promptable Vision
YOLO、DETR、U-Net、Mask R-CNN 和 SAM 的输出与设计选择。
Part III · 生成、三维与世界模型
09生成模型
VAE、GAN 与 Diffusion
似然、对抗学习和噪声预测分别在学习什么,为什么 diffusion 成为主流。
10空间与时间
NeRF、3DGS 与 World Model
从多视角图像恢复可渲染三维场景,再到预测可控制的未来。
Part IV · 后训练、推理与系统
11后训练
SFT、RLHF、DPO 与 RLVR
怎样把“会续写”的基础模型变成会遵循指令、偏好和可验证目标的模型。
12推理能力
Chain-of-Thought 与 Test-time Compute
中间推理、采样搜索和“想得更久”分别怎样改变正确率与成本。
13外部能力
RAG、Tool Use 与 Agent
模型如何检索、行动、观察结果,并把一次回答变成可持续执行的闭环。
14训练与部署
LoRA、量化、KV Cache 与分布式训练
从参数高效微调到 FlashAttention、vLLM、ZeRO/FSDP 与并行策略。