AI Infra、GPU 与大模型工程笔记

这里记录我对 AI Infra 与大模型工程的学习和梳理,重点关注 GPU、训练与推理系统,以及强化学习中的工程问题。从论文和源码出发,用公式、代码与图解解释实现细节。

关于博客 · 全部文章与标签 · 订阅更新

从主题开始阅读

最新文章

从 Anthropic 的网络安全报告看 GLM-5.3

读 Anthropic 在 2026 年 9 月 29 日发布的 GLM-5.3 网络安全报告, 报告标题可以直译为《GLM-5.3 与高级网络攻击能力的扩散》。它围绕 GLM-5.3 的网络安全能力、安全防护和能力扩散风险展开,评测是支撑这些讨论的一部分。 Anthropic 关注的更多是glm能力开放以后如何被滥用;从模型研究的角度,它也提供了一组观察复杂工程任务的材料 Anthropic 的报告说了什么 Anthropic 的核心判断是:GLM-5.3 已具备较强的端到端漏洞利用能力,其开放权重又使这些能力更容易被获取和修改。 报告同时指出,这类能力也能帮助防守方。主要结果如下。 Anthropic 的评测 GLM-5.3 ...

阅读更多

Fast-WAM:Wan 预训练怎样变成动作策略

看到 Fast-WAM 的结构图,很容易把它理解成“Wan 负责视频,旁边接一个随机初始化的 action encoder”。但沿着官方代码往下看,事情更有意思:默认训练配置不仅加载 Wan 的 video DiT,还把 Wan 的权重缩到较小的 hidden dimension,用来初始化 action DiT 的主干。真正保留随机初始化的,是动作输入投影、动作输出投影,以及把机器人自身状态接入模型的 proprio encoder。初始化代码把这件事写得很明确。 另一个容易混淆的地方是名字里的 Fast。它主要省掉了推理阶段的未来视频生成,训练时仍然同时做视频建模和动作学习;推理时 action 也仍然需要去噪。论文所谓 single forward pass,指的是 video...

阅读更多

昇腾 950 的两种显存方案:白鹭、朱雀与 PD 分离

昇腾 950 有一个值得琢磨的地方:950PR 的显存容量上限是 128 GB、带宽是 1.6 TB/s;950DT 则是 144 GB、4 TB/s。容量只增加了 12.5%,带宽却变成了 2.5 倍。再看华为公开的封装结构,PR 使用 8 个显存模块,DT 反而只有 4 个。华为《昇腾 950 NPU 架构白皮书》第 3 章已经给出了这些信息。 这让问题从“华为有没有自研 HBM”,走到了“同一套计算架构,为什么要搭配两种差别这么大的显存”。两种方案的名字分别是 HiBL 1.0 和 HiZQ 2.0。外部中文文章把它们叫作“白鹭”和“朱雀”,名字颇有辨识度,但我更关心这两只“鸟”背后的工程取舍。 本文按 2026 年 9 月 30 日可访问的公开材料整理。官方规格、外部报道和...

阅读更多