AI Infra、GPU 与大模型工程笔记
这里记录我对 AI Infra 与大模型工程的学习和梳理,重点关注 GPU、训练与推理系统,以及强化学习中的工程问题。从论文和源码出发,用公式、代码与图解解释实现细节。
从主题开始阅读
GPU 架构与 CUDA
从 Attention 的实现,读到 Blackwell 的计算与低精度支持。
大模型训练与推理
从编译执行,读到分片训练与推理时的 KV Cache 搬运。
强化学习与 Coding Agent
从 RLHF 与 GRPO,读到代码任务怎样成为可训练的环境。
最新文章
MiMo-V2.6-RL-oss:一条任务怎样成为 Agentic RL 环境
从 MiMo-V2.6-RL-oss 的具体任务出发,说明需求、容器环境与 verifier 如何组成 Agentic RL 任务,比较 Code、Cyber、Webdev、Music 和 General 的评分方式,并区分 Explorer 在线评分与训练奖励。
从 Anthropic 的网络安全报告看 GLM-5.3
读 Anthropic 在 2026 年 9 月 29 日发布的 GLM-5.3 网络安全报告,
报告标题可以直译为《GLM-5.3 与高级网络攻击能力的扩散》。它围绕 GLM-5.3 的网络安全能力、安全防护和能力扩散风险展开,评测是支撑这些讨论的一部分。
Anthropic 关注的更多是glm能力开放以后如何被滥用;从模型研究的角度,它也提供了一组观察复杂工程任务的材料
Anthropic 的报告说了什么
Anthropic 的核心判断是:GLM-5.3 已具备较强的端到端漏洞利用能力,其开放权重又使这些能力更容易被获取和修改。
报告同时指出,这类能力也能帮助防守方。主要结果如下。
Anthropic 的评测
GLM-5.3
...
Fast-WAM:Wan 预训练怎样变成动作策略
看到 Fast-WAM 的结构图,很容易把它理解成“Wan 负责视频,旁边接一个随机初始化的 action encoder”。但沿着官方代码往下看,事情更有意思:默认训练配置不仅加载 Wan 的 video DiT,还把 Wan 的权重缩到较小的 hidden dimension,用来初始化 action DiT 的主干。真正保留随机初始化的,是动作输入投影、动作输出投影,以及把机器人自身状态接入模型的 proprio encoder。初始化代码把这件事写得很明确。
另一个容易混淆的地方是名字里的 Fast。它主要省掉了推理阶段的未来视频生成,训练时仍然同时做视频建模和动作学习;推理时 action 也仍然需要去噪。论文所谓 single forward pass,指的是 video...
昇腾 950 的两种显存方案:白鹭、朱雀与 PD 分离
昇腾 950 有一个值得琢磨的地方:950PR 的显存容量上限是 128 GB、带宽是 1.6 TB/s;950DT 则是 144 GB、4 TB/s。容量只增加了 12.5%,带宽却变成了 2.5 倍。再看华为公开的封装结构,PR 使用 8 个显存模块,DT 反而只有 4 个。华为《昇腾 950 NPU 架构白皮书》第 3 章已经给出了这些信息。
这让问题从“华为有没有自研 HBM”,走到了“同一套计算架构,为什么要搭配两种差别这么大的显存”。两种方案的名字分别是 HiBL 1.0 和 HiZQ 2.0。外部中文文章把它们叫作“白鹭”和“朱雀”,名字颇有辨识度,但我更关心这两只“鸟”背后的工程取舍。
本文按 2026 年 9 月 30 日可访问的公开材料整理。官方规格、外部报道和...
MXFP8 与 SM120:硬件支持之后,软件还缺什么
解释 MXFP8 的块缩放格式与 GEMM 转置布局,结合 Transformer Engine v2.19 的 PyTorch 训练路径,分析 SM120 硬件支持之后仍存在的软件限制,并给出版本、可用性与训练路径的检查方法。
CodeMidas:从源代码构造 Coding Agent 的 RL 训练环境
沿着 CodeMidas 的任务构造管线,分析如何从开源仓库提取功能、移除实现、生成隐藏测试,再通过容器执行和 agent rollout 检查泄漏与评分可靠性,最终形成用于 GRPO 的训练环境。
从一行 print 看 torch.compile 的 Graph Break
从一行 print 引起的切图出发,说明 torch.compile 中 Dynamo 的捕获与恢复过程,区分 Graph Break、数据依赖分支、动态 shape 和重编译,并介绍 fullgraph、日志与 trace 的排查方法。
顺着 FlashAttention 看 SM120 的实现
从 FlashAttention 的 SM120 子类源码出发,解释它为何复用 SM80 的 warp-level MMA 主循环,以及 arch、共享内存容量和缓冲复用如何影响输出路径、tile 与 stage 配置,并区分显存容量与片上资源限制。
共计 196 篇文章,25 页。