kirancodes.me
To Proof Maintenance & Beyond!
Venues / PPoPP /

PPoPP 2026

51 papers

  1. A Diagonal Block Memory-Aware Polynomial Preconditioner for Linear and Eigenvalue Solvers · Xiaojian Yang, Yuhui Ni, Fan Yuan, Shengguo Li, Dezun Dong, Chuanfu Xu + 2 more
  2. A Distributed Matrix-Block-Vector Multiplication in Presence of System Performance Variability · Yuchen Ma, Bin Ren, Andreas Stathopoulos
  3. APERTURE: Algorithm-System Co-optimization for Temporal Graph Network Inference · Yiqing Wang, Hailong Yang, Enze Yu, Qingxiao Sun, Kejie Ma, Kaige Zhang + 2 more
  4. ASM-SpMM: Unleashing the Potential of Arm SME for Sparse Matrix Multiplication Acceleration · Jiazhi Jiang, Xijia Yao, Jiayu Chen, Jinhui Wei, Dan Huang, Yutong Lu
  5. Accelerating Sparse Transformer Inference on GPU · Wenhao Dai, Haodong Deng, Mengfei Rong, Xinyu Yang, Hongyu Liu, Fangxin Liu + 3 more
  6. BEEMS: Boosting Machine Vision Efficiency via Computation Graph-Based Memory Smoothing · Hanjing Shen, Fangxin Liu, Jian Liu, Li Jiang, Haibing Guan
  7. Binary Compatible Critical Section Delegation · Junyao Zhang, Zhuo Wang, Zhe Zhou
  8. CCL-D: A High-Precision Diagnostic System for Slow and Hang Anomalies in Large-Scale Model Training · Yida Gu, Fakang Wang, Jianhao Fu, Zhenhang Sun, Qianyu Zhang, Hairui Zhao + 14 more
  9. COCCL: A Collective Communication Library Supporting Easy Integration and Configuration of Customized Compression for Scalable LLM Training · Xingchen Liu, Haoran Kong, Hairui Zhao, Shengkai Lyu, Zheng Wei, Man Liu + 8 more
  10. Cacheman: A Comprehensive Last-Level Cache Management System for Multi-tenant Clouds · Xiaokang Hu, Yuchao Cao, Naixuan Guan, Yifan Wu, Xishi Qiu, Shengdong Dai + 5 more
  11. Characterizing Matrix Multiplication Units across General Parallel Patterns in Scientific Computing · Yuechen Lu, Hongwei Zeng, Marc Casas, Weifeng Liu
  12. ChituDiffusion: A Data-Characteristic-Aware Serving System for Diffusion Models · Chengzhang Wu, Liyan Zheng, Haojie Wang, Kezhao Huang, Zixuan Ma, Dong Dong + 1 more
  13. Concurrent Balanced Augmented Trees · Evan Wrench, Ajay Singh, Younghun Roh, Panagiota Fatourou, Siddhartha Jayanti, Eric Ruppert + 1 more
  14. DTMiner: A Data-Centric System for Efficient Temporal Motif Mining · Yinbo Hou, Hao Qi, Ligang He, Jin Zhao, Yu Zhang, Hui Yu + 5 more
  15. DiggerBees: Depth First Search Leveraging Hierarchical Block-Level Stealing on GPUs · Yuyao Niu, Yuechen Lu, Weifeng Liu, Marc Casas
  16. Dynamic Detection of Inefficient Data Mapping Patterns in Heterogeneous OpenMP Applications · Luke Marzen, Junhyung Shim, Ali Jannesari
  17. ElasGNN: An Elastic Training Framework for Distributed GNN Training · Siqi Wang, Hailong Yang, Pengbo Wang, Hongliang Cao, Yufan Xu, Xuezhu Wang + 3 more
  18. Elastor: Elastic and Efficient Model Partitioning and Checkpointing for Fault-Tolerant Distributed Training · Xuanyu Wang, Fangcheng Fu, Haoyang Li, Hao Ge, Sheng Lin, Jiawen Niu + 1 more
  19. Exploiting Efficient Mapping and Pipelined Execution for Accelerating SpMV on Tensor Cores · Kaige Zhang, Hailong Yang, Xin You, Tianyu Feng, Yufan Xu, Zhongzhi Luan + 2 more
  20. Faster and Cheaper: Pushing the Sequence Alignment Throughput with Commercial CPUs · Zhonghai Zhang, Yewen Li, Ke Meng, Chunming Zhang, Guangming Tan
  21. Fixing Non-blocking Data Structures for Better Compatibility with Memory Reclamation Schemes · Md Amit Hasan Arovi, Ruslan Nikolaev
  22. FlashAttention-T: Towards Fully Tensorized Attention by Exploiting Tensor-Vector Parallelism · Jianxing Xu, Yuanbo Wen, Jun Bi, Ruibai Xu, Guanglin Xu, Rui Zhang + 5 more
  23. Hapax Locks: Scalable Value-Based Mutual Exclusion · Dave Dice, Alex Kogan
  24. HelixPipe: Efficient Distributed Training of Long Sequence Transformers with Attention Parallel Pipeline Parallelism · Geng Zhang, Shenggan Cheng, Xuanlei Zhao, Ziming Liu, Yang You
  25. HierCut: Enabling 16-bit Format Mixed Precision for Molecular Dynamics through Hierarchical Cutoff · Zeyu Song, Lin Gan, Xiaohui Duan, Zhengrui Li, Jiayu Fu, Yinuo Wang + 2 more
  26. High-Throughput Non-uniformly Quantized 3-bit LLM Inference · YuAng Chen, Wenqi Zeng, Jeffrey Xu Yu
  27. JanusQuant: Accurate and Efficient 2-bit KV Cache Quantization for Long-Context Inference · Chengyu Sun, Yaqi Xia, Hulin Wang, Donglin Yang, Xiaobo Zhou, Dazhao Cheng
  28. Laser: Unlocking Layer-Level Scheduling for Efficient Multi-SLO LLM Serving · Jianxiong Liao, Quanxing Dong, Yunkai Liang, Zhi Zhou, Xu Chen
  29. MetaAttention: A Unified and Performant Attention Framework across Hardware Backends · Feiyang Chen, Yu Cheng, Lei Wang, Yuqing Xia, Ziming Miao, Lingxiao Ma + 6 more
  30. MixFusion: A Patch-Level Parallel Serving System for Mixed-Resolution Diffusion Models · Desen Sun, Zepeng Zhao, Yuke Wang
  31. Multiverse: Transactional Memory with Dynamic Multiversioning · Gaetano Coccimiglio, Trevor Brown, Srivatsan Ravi
  32. PANA: A Fine-Grained Runtime-Adaptive Load Balancing for Parallel SpMV on Multicore CPUs · Haodong Bian, Youhui Zhang, Xiang Fei, Jianqiang Huang, Xiaoying Wang
  33. PIM-zd-tree: A Fast Space-Partitioning Index Leveraging Processing-in-Memory · Yiwei Zhao, Hongbo Kang, Ziyang Men, Yan Gu, Guy E. Blelloch, Laxman Dhulipala + 2 more
  34. PRISM: An Efficient GPU-Based Lossy Compression Framework for Progressive Data Retrieval with Multi-Level Interpolation · Bing Lu, Zedong Liu, Hairui Zhao, Dejun Luo, Wenjing Huang, Yida Gu + 3 more
  35. ParDiff: Efficiently Parallelizing Reverse-Mode Automatic Differentiation with Direct Indexing · Shuhong Huang, Shizhi Tang, Yuan Wen, Huanqi Cao, Ruibai Tang, Yidong Chen + 5 more
  36. Parallel Dynamic Spatial Indexes · Ziyang Men, Bo Huang, Yan Gu, Yihan Sun
  37. Pipelonk: Accelerating End-to-End Zero-Knowledge Proof Generation on GPUs for PLONK-Based Protocols · Zhiyuan Zhang, Yanxin Cai, Wenhao Yin, Xueyu Wu, Yi Wang, Lei Ju + 1 more
  38. ROME: Maximizing GPU Efficiency for All-Pairs Shortest Path via Taming Fine-Grained Irregularities · Weile Luo, Yuhan Chen, Xiangrui Yu, Qiang Wang, Ruibo Fan, Hongyuan Liu + 1 more
  39. Rethinking Thread Scheduling under Oversubscription: A User-Space Framework for Coordinating Multi-runtime and Multi-process Workloads · Aleix Roca, Vicenç Beltran
  40. RoMeo: Mitigating Dual-dimensional Outliers with Rotated Mixed Precision Quantization · Qihao Zhang, Mingliang Tang, Mingshu Zhai, Kinman Lei, Jidong Zhai
  41. Root-Down Exposure for Maximal Clique Enumeration on GPUs · Zhe Pan, Peng Qu, Youhui Zhang
  42. SPIDER: Unleashing Sparse Tensor Cores for Stencil Computation via Strided Swapping · Qiqi Gu, Chenpeng Wu, Heng Shi, Jianguo Yao
  43. Scaling GPU-to-CPU Migration for Efficient Distributed Execution on CPU Clusters · Ruobing Han, Hyesoon Kim
  44. Sharded Elimination and Combining for Highly-Efficient Concurrent Stacks · Ajay Singh, Nikos Metaxakis, Panagiota Fatourou
  45. TAC: Cache-Based System for Accelerating Billion-Scale GNN Training on Multi-GPU Platform · Zhiqiang Liang, Hongyu Gao, Jue Wang, Fang Liu, Xingguo Shi, Junyu Gu + 7 more
  46. Towards Singular Value Decomposition for Rank-Deficient Matrices: An Efficient and Accurate Algorithm on GPU Architectures · Lu Shi, Weiwei Xu, Shaoshuai Zhang
  47. Trojan Horse: Aggregate-and-Batch for Scaling Up Sparse Direct Solvers on GPU Clusters · Yida Li, Siwei Zhang, Yiduo Niu, Yang Du, Qingxiao Sun, Zhou Jin + 1 more
  48. UFO Trees: Practical and Provably-Efficient Parallel Batch-Dynamic Trees · Quinten De Man, Atharva Sharma, Kishen N. Gowda, Laxman Dhulipala
  49. VDHA: Vector-Driven Hash Aggregation for Sparse Matrix-Sparse Vector Multiplication on GPUs · Yuchen Li, Zhe Pan, Peng Qu, Youhui Zhang
  50. Waste-Efficient Work Stealing · Kyle Singer, Kunal Agrawal, Tao B. Schardl
  51. zBuffer: Zero-Copy and Metadata-Free Serialization for Fast RPC with Scatter-Gather Reflection · Xiangyu Liu, Huiba Li, Shun Gai, Youmin Chen, Yiming Zhang