Richael
← 返回博客

2026-07-26

写下我的第一个 GPU Kernel

今天跟着官方教程写完了第一个 Triton kernel(向量加法)。正确性确认无误(与 PyTorch 的最大差值 = 0.0),在 T4 GPU 上的吞吐也几乎和 PyTorch 完全重合。

下一个:一个真正有空间超过基线的 kernel(softmax)。

折线图,比较 Triton 与 PyTorch 在 10^4 到 10^8 个元素的向量规模上的吞吐(GB/s),两条线基本重合,并在 240 GB/s 附近趋于平缓。