Things I've built and explored.
- cuflash
从零手写的 CUDA FlashAttention 实现:标量内核到 WMMA Tensor Core 前向、FlashDecoding/Split-KV 与 Roofline 性能分析,支持 FP16/BF16/FP32 前反向,覆盖 sm_70–sm_90。
CUDA · C++ · FlashAttention · Tensor Core
- tiny-llm
CUDA/C++17 精简 LLM 推理运行时:GGUF 加载与反量化、W8A16 推理、显式与分页 KV Cache、tokenizer、采样,以及 CUDA Graphs 加速 decode。
CUDA · C++ · LLM Inference · KV Cache
- paged-serving
Rust 实现的 LLM Serving 控制面:Paged KV 调度、continuous batching、OpenAI 兼容 API 与 SSE,经 C ABI 接入 tiny-llm 真实 CUDA 后端。
Rust · LLM Serving · Systems
- trifuse
面向 Transformer 推理的可验证 Triton 融合算子:RMSNorm+RoPE、Gated MLP 与 FlashAttention 前向,经 torch.library 注册并附差分测试与 benchmark。
Triton · Python · GPU Ops
- cuda-foundations
系统性 CUDA 算子工程学习路径:从 SGEMM 优化阶梯到可复用 kernel 库、进阶 HPC 模式与轻量推理组件,四个模块含完整测试与文档。
CUDA · C++ · SGEMM · HPC
- cloud-bench
云服务器深度评测脚本与方法论:fio p99 长尾延迟、%steal 超售检测、物理核/线程拆分与指令集检查,原始产物全量保留可复核。
Shell · Benchmark · fio
- imshane.site
个人技术网站,将旧 Hugo 博客迁移至 Astro,并整合技术写作、项目展示和个人介绍。
Astro · TypeScript · Static Site