kirancodes.me
To Proof Maintenance & Beyond!
Venues / PPoPP /

PPoPP 2024

45 papers

  1. A Holistic Approach to Automatic Mixed-Precision Code Generation and Tuning for Affine Programs · Jinchen Xu, Guanghui Song, Bei Zhou, Fei Li, Jiangwei Hao, Jie Zhao
  2. A Row Decomposition-based Approach for Sparse Matrix Multiplication on GPUs · Meng Pang, Xiang Fei, Peng Qu, Youhui Zhang, Zhaolin Li
  3. AGAThA: Fast and Efficient GPU Acceleration of Guided Sequence Alignment for Long Read Mapping · Seongyeon Park, Junguk Hong, Jaeyong Song, Hajin Kim, Youngsok Kim, Jinho Lee
  4. Are Your Epochs Too Epic? Batch Free Can Be Harmful · Daewoo Kim, Trevor Brown, Ajay Singh
  5. Arrow Matrix Decomposition: A Novel Approach for Communication-Efficient Sparse Matrix Multiplication · Lukas Gianinazzi, Alexandros Nikolaos Ziogas, Langwen Huang, Piotr Luczynski, Saleh Ashkboosh, Florian Scheidl + 6 more
  6. CPMA: An Efficient Batch-Parallel Compressed Set Without Pointers · Brian Wheatman, Randal C. Burns, Aydin Buluç, Helen Xu
  7. ConvStencil: Transform Stencil Computation to Matrix Multiplication on Tensor Cores · Yuetao Chen, Kun Li, Yuhao Wang, Donglin Bai, Lei Wang, Lingxiao Ma + 4 more
  8. Exploiting Fine-Grained Redundancy in Set-Centric Graph Pattern Mining · Zhiheng Lin, Ke Meng, Chaoyang Shui, Kewei Zhang, Junmin Xiao, Guangming Tan
  9. Extreme-scale Direct Numerical Simulation of Incompressible Turbulence on the Heterogeneous Many-core System · Jiabin Xie, Guangnan Feng, Han Huang, Junxuan Feng, Zhiguang Chen, Yutong Lu
  10. Fast American Option Pricing using Nonlinear Stencils · Zafar Ahmad, Reilly Browne, Rezaul Chowdhury, Rathish Das, Yushen Huang, Yimin Zhu
  11. Fast Kronecker Matrix-Matrix Multiplication on GPUs · Abhinav Jangda, Mohit Yadav
  12. FastFold: Optimizing AlphaFold Training and Inference on GPU Clusters · Shenggan Cheng, Xuanlei Zhao, Guangyang Lu, Jiarui Fang, Tian Zheng, Ruidong Wu + 3 more
  13. Gallatin: A General-Purpose GPU Memory Manager · Hunter McCoy, Prashant Pandey
  14. GraphCube: Interconnection Hierarchy-aware Graph Processing · Xinbiao Gan, Guang Wu, Shenghao Qiu, Feng Xiong, Jiaqi Si, Jianbin Fang + 4 more
  15. INFINEL: An efficient GPU-based processing method for unpredictable large output graph queries · Sungwoo Park, Seyeon Oh, Min-Soo Kim
  16. Language-Agnostic Static Deadlock Detection for Futures · Stefan K. Muller
  17. Liger: Interleaving Intra- and Inter-Operator Parallelism for Distributed Large Model Inference · Jiangsu Du, Jinhui Wei, Jiazhi Jiang, Shenggan Cheng, Dan Huang, Zhiguang Chen + 1 more
  18. Locks as a Resource: Fairly Scheduling Lock Occupation with CFL · Jonggyu Park, Young Ik Eom
  19. Memory Bounds for Concurrent Bounded Queues · Vitaly Aksenov, Nikita Koval, Petr Kuznetsov, Anton Paramonov
  20. OsirisBFT: Say No to Task Replication for Scalable Byzantine Fault Tolerant Analytics · Kasra Jamshidi, Keval Vora
  21. POSTER: Accelerating High-Precision Integer Multiplication used in Cryptosystems with GPUs · Zhuoran Ji, Zhaorui Zhang, Jiming Xu, Lei Ju
  22. POSTER: Enabling Extreme-Scale Phase Field Simulation with In-situ Feature Extraction · Zhichen Feng, Jialin Li, Yaqian Gao, Shaobo Tian, Huang Ye, Jian Zhang
  23. POSTER: FineCo: Fine-grained Heterogeneous Resource Management for Concurrent DNN Inferences · Lixian Ma, Haoruo Chen, En Shao, Leping Wang, Quan Chen, Guangming Tan
  24. POSTER: LLM-PQ: Serving LLM on Heterogeneous Clusters with Phase-Aware Partition and Adaptive Quantization · Juntao Zhao, Borui Wan, Chuan Wu, Yanghua Peng, Haibin Lin
  25. POSTER: OCToPus: Semantic-aware Concurrency Control for Blockchain Transactions · dePaul Miller, Henry F. Korth, Roberto Palmieri
  26. POSTER: Optimizing Collective Communications with Error-bounded Lossy Compression for GPU Clusters · Jiajun Huang, Sheng Di, Xiaodong Yu, Yujia Zhai, Jinyang Liu, Yafan Huang + 7 more
  27. POSTER: Optimizing Sparse Tensor Contraction with Revisiting Hash Table Design · Guofeng Feng, Weile Jia, Ninghui Sun, Guangming Tan, Jiajia Li
  28. POSTER: ParGNN: Efficient Training for Large-Scale Graph Neural Network on GPU Clusters · Shunde Li, Junyu Gu, Jue Wang, Tiechui Yao, Zhiqiang Liang, Yumeng Shi + 6 more
  29. POSTER: Pattern-Aware Sparse Communication for Scalable Recommendation Model Training · Jiaao He, Shengqi Chen, Jidong Zhai
  30. POSTER: RELAX: Durable Data Structures with Swift Recovery · Almog Zur, Nachshon Cohen, Michal Friedman, Erez Petrank
  31. POSTER: RadiK: Scalable Radix Top-K Selection on GPUs · Yifei Li, Bole Zhou, Jiejing Zhang, Xuechao Wei, Yinghan Li, Yingda Chen
  32. POSTER: StructMG: A Fast and Scalable Structured Multigrid · Yi Zong, Xinliang Wang, Haopeng Huang, Chensong Zhang, Xiaowen Xu, Jian Sun + 5 more
  33. Parallel Integer Sort: Theory and Practice · Xiaojun Dong, Laxman Dhulipala, Yan Gu, Yihan Sun
  34. Parallel k-Core Decomposition with Batched Updates and Asynchronous Reads · Quanquan C. Liu, Julian Shun, Igor Zablotchi
  35. ParlayANN: Scalable and Deterministic Parallel Graph-Based Approximate Nearest Neighbor Search Algorithms · Magdalen Dobson Manohar, Zheqi Shen, Guy E. Blelloch, Laxman Dhulipala, Yan Gu, Harsha Vardhan Simhadri + 1 more
  36. Practical Hardware Transactional vEB Trees · Mohammad Khalaji, Trevor Brown, Khuzaima Daudjee, Vitaly Aksenov
  37. Pure: Evolving Message Passing To Better Leverage Shared Memory Within Nodes · James Psota, Armando Solar-Lezama
  38. Recurrence Analysis for Automatic Parallelization of Subscripted Subscripts · Akshay Bhosale, Rudolf Eigenmann
  39. Scaling Up Transactions with Slower Clocks · Pedro Ramalhete, Andreia Correia
  40. Shared Memory-contention-aware Concurrent DNN Execution for Diversely Heterogeneous System-on-Chips · Ismet Dagli, Mehmet E. Belviranli
  41. Sparsity in Deep Neural Nets (Keynote) · Nir Shavit
  42. Tetris: Accelerating Sparse Convolution by Exploiting Memory Reuse on GPU · Xiaoyan Liu, Xuegui Zheng, Hailong Yang, Zhongzhi Luan, Depei Qian
  43. Towards Scalable Unstructured Mesh Computations on Shared Memory Many-Cores · Haozhong Qiu, Chuanfu Xu, Jianbin Fang, Liang Deng, Jian Zhang, Qingsong Wang + 5 more
  44. Training one DeePMD Model in Minutes: a Step towards Online Learning · Siyu Hu, Tong Zhao, Qiuchen Sha, Enji Li, Xiangyu Meng, Liping Liu + 3 more
  45. VERLIB: Concurrent Versioned Pointers · Guy E. Blelloch, Yuanhao Wei