TensorRT-LLM、FlashAttention 都已经 production level 了,学 CUDA 还有什么价值?
TensorRT-LLM、FlashAttention 都已经 production level 了,学 CUDA 还有什么价值?
答案:价值依然很大,只是角色不同。
大部分 AI 工程师不需要重写 CUDA kernel,但要懂 GPU 原理——
才能在这些场景做出正确决策:
• 用什么规格的 GPU?
• 部署 7B 还是 70B?
• Chatbot 还是 RAG 架构?
• 单用户还是多人并发?
这些直接影响 Batch Size、KV Cache、Precision、Continuous Batching 怎么配。
不是每个人都要写底层,但每个人都要看得懂底层在干什么。