Learning series · first draft

14 notes / learn one at a time

LLM × CV

过去十年真正留下来的核心技术。每篇只解决一个相对完整的问题,并用最小例子、常见误解和自测把它讲到能复述。

14 篇独立文章 4 条主线 状态:初稿待学习

Part I · 序列模型与预训练

01序列地基

Token、Embedding 与自回归训练

原始信息怎样变成模型能计算的序列,next-token prediction 又到底优化了什么。

02统一骨架

Attention 与 Transformer

从 Q/K/V、缩放点积、mask 到多头注意力,理解 Transformer 的信息流。

03架构选择

GPT、BERT 与 T5

decoder-only、encoder-only 与 encoder-decoder 为什么形成不同的模型能力。

04规模化

Scaling Laws、Chinchilla 与 MoE

参数、数据和算力怎样配比,以及稀疏专家怎样扩大容量。

Part II · 视觉表示与多模态

05视觉骨架

ResNet、ViT 与 Swin

从卷积的局部先验,到图片 patch token,再到层级视觉 Transformer。

06无标签学习

SimCLR、MoCo、DINO 与 MAE

没有人工类别标签时,视觉监督信号从哪里来,以及怎样避免表示坍缩。

07跨模态对齐

CLIP 与多模态模型

图像和文字如何进入共同语义空间,以及视觉编码器怎样接入语言模型。

08视觉任务

检测、分割与 Promptable Vision

YOLO、DETR、U-Net、Mask R-CNN 和 SAM 的输出与设计选择。

Part III · 生成、三维与世界模型

09生成模型

VAE、GAN 与 Diffusion

似然、对抗学习和噪声预测分别在学习什么,为什么 diffusion 成为主流。

10空间与时间

NeRF、3DGS 与 World Model

从多视角图像恢复可渲染三维场景,再到预测可控制的未来。

Part IV · 后训练、推理与系统

11后训练

SFT、RLHF、DPO 与 RLVR

怎样把“会续写”的基础模型变成会遵循指令、偏好和可验证目标的模型。

12推理能力

Chain-of-Thought 与 Test-time Compute

中间推理、采样搜索和“想得更久”分别怎样改变正确率与成本。

13外部能力

RAG、Tool Use 与 Agent

模型如何检索、行动、观察结果,并把一次回答变成可持续执行的闭环。

14训练与部署

LoRA、量化、KV Cache 与分布式训练

从参数高效微调到 FlashAttention、vLLM、ZeRO/FSDP 与并行策略。