kirancodes.me
To Proof Maintenance & Beyond!
Venues / PPoPP /

PPoPP 2018

50 papers

  1. A microbenchmark to study GPU performance models · Vasily Volkov
  2. A persistent lock-free queue for non-volatile memory · Michal Friedman, Maurice Herlihy, Virendra J. Marathe, Erez Petrank
  3. A predictable synchronisation algorithm · Stefan Reif, Wolfgang Schröder-Preikschat
  4. A scalable distance-1 vertex coloring algorithm for power-law graphs · Jesun Sahariar Firoz, Marcin Zalewski, Andrew Lumsdaine
  5. A scalable queue for work distribution on GPUs · Bernhard Kerbl, Joerg H. Mueller, Michael Kenzel, Dieter Schmalstieg, Markus Steinberger
  6. An effective fusion and tile size model for optimizing image processing pipelines · Abhinav Jangda, Uday Bondhugula
  7. Automated code acceleration targeting heterogeneous openCL devices · Heinrich Riebler, Gavin Vaz, Tobias Kenter, Christian Plessl
  8. Bridging the gap between deep learning and sparse matrix format selection · Yue Zhao, Jiajia Li, Chunhua Liao, Xipeng Shen
  9. Cache-tries: concurrent lock-free hash tries with constant-time operations · Aleksandar Prokopec
  10. Communication-avoiding parallel minimum cuts and connected components · Lukas Gianinazzi, Pavel Kalvoda, Alessandro De Palma, Maciej Besta, Torsten Hoefler
  11. Designing scalable FPGA architectures using high-level synthesis · Johannes de Fine Licht, Michaela Blott, Torsten Hoefler
  12. DisCVar: discovering critical variables using algorithmic differentiation for transient faults · Harshitha Menon, Kathryn Mohror
  13. Efficient parallel determinacy race detection for two-dimensional dags · Yifan Xu, I-Ting Angelina Lee, Kunal Agrawal
  14. Efficient shuffle management with SCache for DAG computing frameworks · Zhouwang Fu, Tao Song, Zhengwei Qi, Haibing Guan
  15. Featherlight on-the-fly false-sharing detection · Milind Chabbi, Shasha Wen, Xu Liu
  16. FlashR: parallelize and scale R for machine learning using SSDs · Da Zheng, Disa Mhembere, Joshua T. Vogelstein, Carey E. Priebe, Randal C. Burns
  17. Graph partitioning applied to DAG scheduling to reduce NUMA effects · Isaac Sánchez Barrera, Marc Casas, Miquel Moretó, Eduard Ayguadé, Jesús Labarta, Mateo Valero
  18. Griffin: uniting CPU and GPU in information retrieval systems for intra-query parallelism · Yang Liu, Jianguo Wang, Steven Swanson
  19. HPVM: heterogeneous parallel virtual machine · Maria Kotsifakou, Prakalp Srivastava, Matthew D. Sinclair, Rakesh Komuravelli, Vikram S. Adve, Sarita V. Adve
  20. Harnessing epoch-based reclamation for efficient range queries · Maya Arbel-Raviv, Trevor Brown
  21. Hierarchical memory management for mutable state · Adrien Guatto, Sam Westrick, Ram Raghunathan, Umut A. Acar, Matthew Fluet
  22. High-performance genomic analysis framework with in-memory computing · Xueqi Li, Guangming Tan, Bingchen Wang, Ninghui Sun
  23. Interval-based memory reclamation · Haosen Wen, Joseph Izraelevitz, Wentao Cai, H. Alan Beadle, Michael L. Scott
  24. Juggler: a dependence-aware task-based execution framework for GPUs · Mehmet E. Belviranli, Seyong Lee, Jeffrey S. Vetter, Laxmi N. Bhuyan
  25. Layrub: layer-centric GPU memory reuse and data migration in extreme-scale deep learning systems · Bo Liu, Wenbin Jiang, Hai Jin, Xuanhua Shi, Yang Ma
  26. Lazygraph: lazy data coherency for replicas in distributed graph-parallel computation · Lei Wang, Liangji Zhuang, Junhang Chen, Huimin Cui, Fang Lv, Ying Liu + 1 more
  27. Making pull-based graph processing performant · Samuel Grossman, Heiner Litz, Christos Kozyrakis
  28. Optimizing N-dimensional, winograd-based convolution for manycore CPUs · Zhen Jia, Aleksandar Zlateski, Frédo Durand, Kai Li
  29. PAM: parallel augmented maps · Yihan Sun, Daniel Ferizovic, Guy E. Blelloch
  30. Performance challenges in modular parallel programs · Umut A. Acar, Vitaly Aksenov, Arthur Charguéraud, Mike Rainey
  31. Performance modeling for GPUs using abstract kernel emulation · Changwan Hong, Aravind Sukumaran-Rajam, Jinsung Kim, Prashant Singh Rawat, Sriram Krishnamoorthy, Louis-Noël Pouchet + 2 more
  32. Practical concurrent traversals in search trees · Dana Drachsler-Cohen, Martin T. Vechev, Eran Yahav
  33. Quantifying and reducing execution variance in STM via model driven commit optimization · Girish Mururu, Ada Gavrilovska, Santosh Pande
  34. Reducing the burden of parallel loop schedulers for many-core processors · Mahwish Arif, Hans Vandierendonck
  35. Reducing transaction aborts by looking to the future · Nachshon Cohen, Erez Petrank, James R. Larus
  36. Register optimizations for stencils on GPUs · Prashant Singh Rawat, Fabrice Rastello, Aravind Sukumaran-Rajam, Louis-Noël Pouchet, Atanas Rountev, P. Sadayappan
  37. Register-based implementation of the sparse general matrix-matrix multiplication on GPUs · Junhong Liu, Xin He, Weifeng Liu, Guangming Tan
  38. Revealing parallel scans and reductions in sequential loops through function reconstruction · Peng Jiang, Gagan Agrawal
  39. SIMD code generation for stencils on brick decompositions · Tuowen Zhao, Mary W. Hall, Protonu Basu, Samuel Williams, Hans Johansen
  40. Safe privatization in transactional memory · Artem Khyzha, Hagit Attiya, Alexey Gotsman, Noam Rinetzky
  41. SecureMR: secure mapreduce using homomorphic encryption and program partitioning · Yao Dong, Ana L. Milanova, Julian Dolby
  42. Shared-memory parallelization of MTTKRP for dense tensors · Koby Hayashi, Grey Ballard, Yujie Jiang, Michael J. Tobia
  43. Stamp-it, amortized constant-time memory reclamation in comparison to five other schemes · Manuel Pöter, Jesper Larsson Träff
  44. Strong trylocks for reader-writer locks · Andreia Correia, Pedro Ramalhete
  45. Superneurons: dynamic GPU memory management for training deep neural networks · Linnan Wang, Jinmian Ye, Yiyang Zhao, Wei Wu, Ang Li, Shuaiwen Leon Song + 2 more
  46. Transparent GPU memory management for DNNs · Jung-Ho Park, Hyungmin Cho, Wookeun Jung, Jaejin Lee
  47. Two concurrent data structures for efficient datalog query processing · Herbert Jordan, Bernhard Scholz, Pavle Subotic
  48. VerifiedFT: a verified, high-performance precise dynamic race detector · James R. Wilcox, Cormac Flanagan, Stephen N. Freund
  49. swSpTRSV: a fast sparse triangular solve with sparse level tile layout on sunway architectures · Xinliang Wang, Weifeng Liu, Wei Xue, Li Wu
  50. vSensor: leveraging fixed-workload snippets of programs for performance variance detection · Xiongchao Tang, Jidong Zhai, Xuehai Qian, Bingsheng He, Wei Xue, Wenguang Chen