kirancodes.me
To Proof Maintenance & Beyond!
Venues / PPoPP /

PPoPP 2025

50 papers

  1. A General and Scalable GCN Training Framework on CPU Supercomputers · Chen Zhuang, Peng Chen, Xin Liu, Rio Yokota, Nikoli Dryden, Lingqi Zhang + 3 more
  2. AC-Cache: A Memory-Efficient Caching System for Small Objects via Exploiting Access Correlations · Fulin Nan, Ronglong Wu, Zhirong Shen, Jiahui Yang, Li Cheng, Zheng Chen + 2 more
  3. ATTNChecker: Highly-Optimized Fault Tolerant Attention for Large Language Model Training · Yuhang Liang, Xinyi Li, Jie Ren, Ang Li, Bo Fang, Jieyang Chen
  4. Acc-SpMM: Accelerating General-purpose Sparse Matrix-Matrix Multiplication with GPU Tensor Cores · Haisha Zhao, San Li, Jiaheng Wang, Chunbao Zhou, Jue Wang, Zhikuang Xin + 7 more
  5. Accelerating GNNs on GPU Sparse Tensor Cores through N: M Sparsity-Oriented Graph Reordering · Jou-An Chen, Hsin-Hsuan Sung, Ruifeng Zhang, Ang Li, Xipeng Shen
  6. Adaptive Parallel Training for Graph Neural Networks · Kaihao Ma, Renjie Liu, Xiao Yan, Zhenkun Cai, Xiang Song, Minjie Wang + 2 more
  7. Aggregating Funnels for Faster Fetch&Add and Queues · Younghun Roh, Yuanhao Wei, Eric Ruppert, Panagiota Fatourou, Siddhartha Jayanti, Julian Shun
  8. An AI-Enhanced 1km-Resolution Seamless Global Weather and Climate Model to Achieve Year-Scale Simulation Speed using 34 Million Cores · Xiaohui Duan, Yi Zhang, Kai Xu, Haohuan Fu, Bin Yang, Yiming Wang + 19 more
  9. Balanced Allocations over Efficient Queues: A Fast Relaxed FIFO Queue · Kåre von Geijer, Philippas Tsigas, Elias Johansson, Sebastian Hermansson
  10. BerryBees: Breadth First Search by Bit-Tensor-Cores · Yuyao Niu, Marc Casas
  11. Big Atomics and Fast Hash Tables · Daniel Anderson, Guy E. Blelloch, Siddhartha V. Jayanti
  12. Boost Lock-free Queue and Stack with Batching · Ao Li, Wenhai Li, Yuan Chen, Lingfeng Deng
  13. COMPSO: Optimizing Gradient Compression for Distributed Training with Second-Order Optimizers · Baixi Sun, Weijin Liu, J. Gregory Pauloski, Jiannan Tian, Jinda Jia, Daoce Wang + 10 more
  14. Crystality: A Programming Model for Smart Contracts on Parallel EVMs · Hao Wang, Minghao Pan, Jiaping Wang
  15. DORADD: Deterministic Parallel Execution in the Era of Microsecond-Scale Computing · Zhengqing Liu, Musa Unal, Matthew J. Parkinson, Marios Kogias
  16. EVeREST: An Effective and Versatile Runtime Energy Saving Tool for GPUs · Anna Yue, Pen-Chung Yew, Sanyam Mehta
  17. Effectively Virtual Page Prefetching via Spatial-Temporal Patterns for Memory-intensive Cloud Applications · Yun Wang, Liang Chen, Tianmai Deng, Ben Luo, Yibin Shen, Zhixiang Wei + 3 more
  18. Fairer and More Scalable Reader-Writer Locks by Optimizing Queue Management · Takashi Hoshino, Kenjiro Taura
  19. FastBWA: Practical and Cost-Efficient Genome Sequence Alignment Pipeline · Zhonghai Zhang, Yewen Li, Ke Meng, Chunming Zhang, Guangming Tan
  20. FlashFFTStencil: Bridging Fast Fourier Transforms to Memory-Efficient Stencil Computations on Tensor Core Units · Haozhi Han, Kun Li, Wei Cui, Donglin Bai, Yiwei Zhang, Liang Yuan + 4 more
  21. FlashSparse: Minimizing Computation Redundancy for Fast Sparse Matrix Multiplications on Tensor Cores · Jinliang Shi, Shigang Li, Youxuan Xu, Rongtian Fu, Xueying Wang, Tong Wu
  22. FlashTensor: Optimizing Tensor Programs by Leveraging Fine-grained Tensor Property · Runxin Zhong, Yuyang Jin, Chen Zhang, Kinman Lei, Shuangyu Li, Jidong Zhai
  23. Frontier-guided Graph Reordering · Xinmiao Zhang, Cheng Liu, Shengwen Liang, Chenwei Xiong, Yu Zhang, Lei Zhang + 2 more
  24. GLumin: Fast Connectivity Check Based on LUTs For Efficient Graph Pattern Mining · Weichen Cao, Ke Meng, Zhiheng Lin, Guangming Tan
  25. Harnessing Inter-GPU Shared Memory for Seamless MoE Communication-Computation Fusion · Hulin Wang, Yaqi Xia, Donglin Yang, Xiaobo Zhou, Dazhao Cheng
  26. Helios: Efficient Distributed Dynamic Graph Sampling for Online GNN Inference · Jie Sun, Zuocheng Shi, Li Su, Wenting Shen, Zeke Wang, Yong Li + 5 more
  27. High-performance Visual Semantics Compression for AI-Driven Science · Boyuan Zhang, Luanzheng Guo, Jiannan Tian, Jinyang Liu, Daoce Wang, Fanjiang Ye + 4 more
  28. Improving Tridiagonalization Performance on GPU Architectures · Hansheng Wang, Zhekai Duan, Zitian Zhao, Siqi Wu, Saiqi Zheng, Qiao Li + 2 more
  29. Jigsaw: Toward Conflict-free Vectorized Stencil Computation by Tessellating Swizzled Registers · Yiwei Zhang, Kun Li, Liang Yuan, Haozhi Han, Yunquan Zhang, Ting Cao + 1 more
  30. LibRTS: A Spatial Indexing Library by Ray Tracing · Liang Geng, Rubao Lee, Xiaodong Zhang
  31. MARLIN: Mixed-Precision Auto-Regressive Parallel Inference on Large Language Models · Elias Frantar, Roberto L. Castro, Jiale Chen, Torsten Hoefler, Dan Alistarh
  32. Magneto: Accelerating Parallel Structures in DNNs via Co-Optimization of Operators · Zhanyuan Di, Leping Wang, Ziyi Ren, En Shao, Jie Zhao, Siyuan Feng + 3 more
  33. Mario: Near Zero-cost Activation Checkpointing in Pipeline Parallelism · Weijian Liu, Mingzhen Li, Guangming Tan, Weile Jia
  34. Minimizing speculation overhead in a parallel recognizer for regular texts · Angelo Borsotti, Luca Breveglieri, Angelo Morzenti, Stefano Crespi Reghizzi
  35. PANNS: Enhancing Graph-based Approximate Nearest Neighbor Search through Recency-aware Construction and Parameterized Search · Xizhe Yin, Chao Gao, Zhijia Zhao, Rajiv Gupta
  36. Popcorn: Accelerating Kernel K-means on GPUs through Sparse Linear Algebra · Julian Bellavita, Thomas Pasquali, Laura Del Rio Martin, Flavio Vella, Giulia Guidi
  37. Publish on Ping: A Better Way to Publish Reservations in Memory Reclamation for Concurrent Data Structures · Ajay Singh, Trevor Brown
  38. RT-BarnesHut: Accelerating Barnes-Hut Using Ray-Tracing Hardware · Vani Nagarajan, Rohan Gangaraju, Kirshanthan Sundararajah, Artem Pelenitsyn, Milind Kulkarni
  39. Reciprocating Locks · Dave Dice, Alex Kogan
  40. SBMGT: Scaling Bayesian Multinomial Group Testing · Weicong Chen, Hao Qi, Curtis Tatsuoka, Xiaoyi Lu
  41. SGDRC: Software-Defined Dynamic Resource Control for Concurrent DNN Inference on NVIDIA GPUs · Yongkang Zhang, Haoxuan Yu, Chenxia Han, Cheng Wang, Baotong Lu, Yunzhe Li + 4 more
  42. Semi-StructMG: A Fast and Scalable Semi-Structured Algebraic Multigrid · Yi Zong, Chensong Zhang, Longjiang Mu, Jianchun Wang, Jian Sun, Xiaowen Xu + 3 more
  43. Setting a Course for Post-Moore Software Performance · Charles E. Leiserson
  44. Swift Unfolding of Communities: GPU-Accelerated Louvain Algorithm · Zhibin Wang, Xi Lin, Xue Li, Pinhuan Wang, Ziheng Meng, Hang Liu + 2 more
  45. TensorMD: Molecular Dynamics Simulation with Ab Initio Accuracy of 50 Billion Atoms · Yucheng Ouyang, Ying Liu, Honghui Shang, Zhenchuan Chen, Jiahao Shan, Huimin Cui + 8 more
  46. Transactional Data Structures with Orthogonal Metadata · Yaodong Sheng, Ahmed Hassan, Michael F. Spear
  47. Triangle Counting on Tensor Cores · YuAng Chen, Jeffrey Xu Yu
  48. TurboFFT: Co-Designed High-Performance and Fault-Tolerant Fast Fourier Transform on GPUs · Shixun Wu, Yujia Zhai, Jinyang Liu, Jiajun Huang, Zizhe Jian, Huangliang Dai + 3 more
  49. WaterWise: Co-optimizing Carbon- and Water-Footprint Toward Environmentally Sustainable Cloud Computing · Yankai Jiang, Rohan Basu Roy, Raghavendra Kanakagiri, Devesh Tiwari
  50. WeiPipe: Weight Pipeline Parallelism for Communication-Effective Long-Context Large Model Training · Junfeng Lin, Ziming Liu, Yang You, Jun Wang, Weihao Zhang, Rong Zhao