从主题开始阅读
GPU 架构与 CUDA
从 Attention 的实现,读到 Blackwell 的计算与低精度支持。
大模型训练与推理
从编译执行,读到分片训练与推理时的 KV Cache 搬运。
强化学习与 Coding Agent
从 RLHF 与 GRPO,读到代码任务怎样成为可训练的环境。
从 Attention 的实现,读到 Blackwell 的计算与低精度支持。
从编译执行,读到分片训练与推理时的 KV Cache 搬运。
从 RLHF 与 GRPO,读到代码任务怎样成为可训练的环境。