所有标签
标签: "MLSys"
Autotune 全流程 · 从 Triton 到 FlyDSL
kernel autotune 在 Triton 里怎么设计、 在 aiter / quack / CuteDSL 里怎么用、 又怎么被 SGLang 这类推理引擎消费 —— 然后从这一切出发, 给 FlyDSL 设计一条真正的 autotune 路径。 配一份带 6 张手绘 SVG 图的 HTML 深读。
长序列 MoE RL 训练:从第一性原理到 MI300X
从第一性原理重新推导 Yan Bai 的长序列 MoE RL 优化(Path B 重计算、 linear cross-entropy、 FSDP2、 chunked expert-parallel overlap), 以及它们在 AMD MI300X / MI355X 上各自意味着什么。
从 Python 到硅片 · 给 ML 工程师的编译器与体系结构小科普
你可以把生产级 ML 系统写好几年, 都不知道 IR、 MLIR、 LLVM、 ISA、 FFI 这些词指什么。 这一篇是补丁 —— 写给本科 CS 念过、 但是 Compiler 和 Computer Arch 没好好上过的 ML 工程师。 配一份带 6 张 SVG 图、 中英双语的 HTML 深读。
注意力机制详解 — Full, Sparse, Linear, NSA & GLA
从 Full Attention 出发,拆解 Sparse 和 Linear 两条路线,直到 DeepSeek NSA 和 Gated Linear Attention
TritonForge:面向多轮 Agent 任务的 Server-based RL 训练与评测闭环
基于 slime + Megatron 的端到端 Server-based RL 框架,聚焦 Triton 内核生成,支持 NVIDIA 与 AMD 双生态
Transformer 详解 (数学 + 代码)
从数学原理、代码实现、逻辑结构三个维度拆解 Transformer 的 Self-Attention、LayerNorm 和 MLP