Hugging Face 工程师 @RisingSayak 介绍 🤗 Kernels(huggingface.co/docs/kernels):发现更快算子时不必重写模型,可直接替换支持层的 forward()。同一层可为推理与训练指定不同 kernel,也可按设备类型分流;选择写入全局或局部映射,验证负载后再保留有效方案。配套 Hub 动态加载与 kernels Python 包(需 torch≥2.5 与 CUDA),官方维护 kernels-community。

核心要点速览 (Key Takeaways)

  • 按层替换 forward() 即可换更快算子,无需改模型代码。
  • 可分别为推理/训练与不同设备指定 kernel,映射可全局或局部。
  • Hub 动态加载 + kernels 包(torch≥2.5/CUDA);文档与 kernels-community 已公开。
ADSponsored