hgpu.org » nVidia L40
Kaixuan Zhang, Yunfan Cui, Shuhao Zhang, Chutong Ding, Shiyou Qian, Luping Wang, Jian Cao, Guangtao Xue, Cheng Huang, Guodong Yang, Liping Zhang
Tags: Computer science, CUDA, Heterogeneous systems, Machine learning, nVidia, nVidia A100, nVidia A40, nVidia H100, nVidia H20, nVidia H200, nVidia H800, nVidia L20, nVidia L40, nVidia RTX 6000 Ada, Performance, Triton
January 25, 2026 by hgpu
Recent source codes
* * *
Most viewed papers (last 30 days)
- UniCoder: Unified Visual-to-Code Generation via Symbolic Rewards and Reference-Guided Code Optimization
- Real FP4 Tensor-Core Code in Pure Rust on a Gaming GPU - with NVIDIA's Own Compiler
- CuFuzz: An API-Knowledge-Graph Coverage-Driven Fuzzing Framework for CUDA Libraries
- Enhancing the Performance Analysis of NCCL GPU Collectives
- Augmenting LLM Code Translation with Compiler Analysis for C to Triton Kernel Generation
- Compiler-Grounded Hierarchical Diagnosis for LLM-Based Triton Kernel Optimization
- Harness Engineering for LLM-Driven GPU Kernel Generation
- FlashPDE: A Drop-In Fused Triton Operator Library for Neural PDE Solvers
- NVIDIA-labs OO Agents: Native Python Object-Oriented Agents
- PortLBM: A Portable Lattice Boltzmann Tool Leveraging SYCL on AMD, NVIDIA, and Intel GPUs
* * *



