Skip to main contentVenues / PPoPP / PPoPP 2021
48 papers
- A fast work-efficient SSSP algorithm for GPUs · Kai Wang, Don Fussell, Calvin Lin
- A lock-free relaxed concurrent queue for fast work distribution · Giorgos Kappes, Stergios V. Anastasiadis
- A more pragmatic implementation of the lock-free, ordered, linked list · Jesper Larsson Träff, Manuel Pöter
- A novel memory-efficient deep learning training framework via error-bounded lossy compression · Sian Jin, Guanpeng Li, Shuaiwen Leon Song, Dingwen Tao
- Advanced synchronization techniques for task-based runtime systems · David Álvarez, Kevin Sala, Marcos Maroñas, Aleix Roca, Vicenç Beltran
- An efficient uncertain graph processing framework for heterogeneous architectures · Heng Zhang, Lingda Li, Donglin Zhuang, Rui Liu, Shuang Song, Dingwen Tao + 2 more
- An ownership policy and deadlock detector for promises · Caleb Voss, Vivek Sarkar
- ApproxTuner: a compiler and runtime system for adaptive approximations · Hashim Sharif, Yifan Zhao, Maria Kotsifakou, Akash Kothari, Ben Schreiber, Elizabeth Wang + 6 more
- Are dynamic memory managers on GPUs slow?: a survey and benchmarks · Martin Winter, Mathias Parger, Daniel Mlakar, Markus Steinberger
- Asynchrony versus bulk-synchrony for a generalized N-body problem from genomics · Marquita Ellis, Aydin Buluç, Katherine A. Yelick
- BiPart: a parallel and deterministic hypergraph partitioner · Sepideh Maleki, Udit Agarwal, Martin Burtscher, Keshav Pingali
- Bundled references: an abstraction for highly-concurrent linearizable range queries · Jacob Nelson, Ahmed Hassan, Roberto Palmieri
- Compiler support for near data computing · Mahmut Taylan Kandemir, Jihyun Ryoo, Xulong Tang, Mustafa Karaköy
- Constant-time snapshots with applications to concurrent data structures · Yuanhao Wei, Naama Ben-David, Guy E. Blelloch, Panagiota Fatourou, Eric Ruppert, Yihan Sun
- Corder: cache-aware reordering for optimizing graph analytics · YuAng Chen, Yeh-Ching Chung
- DAPPLE: a pipelined data parallel approach for training large models · Shiqing Fan, Yi Rong, Chen Meng, Zongyan Cao, Siyu Wang, Zhen Zheng + 7 more
- DFOGraph: an I/O- and communication-efficient system for distributed fully-out-of-core graph processing · Jiping Yu, Wei Qin, Xiaowei Zhu, Zhenbo Sun, Jianqiang Huang, Xiaohan Li + 1 more
- Dynamic scaling for low-precision learning · Ruobing Han, Min Si, James Demmel, Yang You
- EGEMM-TC: accelerating scientific computing on tensor cores with extended precision · Boyuan Feng, Yuke Wang, Guoyang Chen, Weifeng Zhang, Yuan Xie, Yufei Ding
- Efficient algorithms for persistent transactional memory · Pedro Ramalhete, Andreia Correia, Pascal Felber
- Efficiently reclaiming memory in concurrent search data structures while bounding wasted memory · Daniel Solomon, Adam Morrison
- Efficiently running SpMV on long vector architectures · Constantino Gómez, Filippo Mantovani, Erich Focht, Marc Casas
- Exploring deep reuse in winograd CNN inference · Ruofan Wu, Feng Zhang, Zhen Zheng, Xiaoyong Du, Xipeng Shen
- Extending MapReduce framework with locality keys · Yifeng Chen, Bei Wang, Xiaolin Wang
- Extracting clean performance models from tainted programs · Marcin Copik, Alexandru Calotoiu, Tobias Grosser, Nicolas Wicki, Felix Wolf, Torsten Hoefler
- FFT blitz: the tensor cores strike back · Sultan Durrani, Muhammad Saad Chughtai, Abdul Dakkak, Wen-Mei Hwu, Lawrence Rauchwerger
- GPTune: multitask learning for autotuning exascale applications · Yang Liu, Wissam M. Sid-Lakhdar, Osni Marques, Xinran Zhu, Chang Meng, James Weldon Demmel + 1 more
- I/O lower bounds for auto-tuning of convolutions in CNNs · Xiaoyang Zhang, Junmin Xiao, Guangming Tan
- Improving communication by optimizing on-node data movement with data layout · Tuowen Zhao, Mary W. Hall, Hans Johansen, Samuel Williams
- In-situ workflow auto-tuning through combining component models · Tong Shu, Yanfei Guo, Justin M. Wozniak, Xiaoning Ding, Ian T. Foster, Tahsin M. Kurç
- Investigating the semantics of futures in transactional memory systems · Jingna Zeng, Shady Issa, Paolo Romano, Luís E. T. Rodrigues, Seif Haridi
- Lightweight preemptive user-level threads · Shumpei Shiina, Shintaro Iwasaki, Kenjiro Taura, Pavan Balaji
- Modernizing parallel code with pattern analysis · Roberto Castañeda Lozano, Murray Cole, Björn Franke
- NBR: neutralization based reclamation · Ajay Singh, Trevor Brown, Ali José Mashtizadeh
- On group mutual exclusion for dynamic systems · Shreyas Gokhale, Sahil Dhoked, Neeraj Mittal
- On the parallel I/O optimality of linear algebra kernels: near-optimal LU factorization · Grzegorz Kwasniewski, Tal Ben-Nun, Alexandros Nikolaos Ziogas, Timo Schneider, Maciej Besta, Torsten Hoefler
- OrcGC: automatic lock-free memory reclamation · Andreia Correia, Pedro Ramalhete, Pascal Felber
- Parallel binary code analysis · Xiaozhu Meng, Jonathon M. Anderson, John M. Mellor-Crummey, Mark W. Krentel, Barton P. Miller, Srdan Milakovic
- Reasoning about recursive tree traversals · Yanjun Wang, Jinwei Liu, Dalin Zhang, Xiaokang Qiu
- Scaling implicit parallelism via dynamic control replication · Michael Bauer, Wonchan Lee, Elliott Slaughter, Zhihao Jia, Mario Di Renzo, Manolis Papadakis + 4 more
- ShadowVM: accelerating data plane for data analytics with bare metal CPUs and GPUs · Zhifang Li, Mingcong Han, Shangwei Wu, Chuliang Weng
- Simplifying low-level GPU programming with GAS · Da Yan, Wei Wang, Xiaowen Chu
- Sparta: high-performance, element-wise sparse tensor contraction on heterogeneous memory · Jiawen Liu, Jie Ren, Roberto Gioiosa, Dong Li, Jiajia Li
- Synthesizing optimal collective algorithms · Zixian Cai, Zhengyang Liu, Saeed Maleki, Madanlal Musuvathi, Todd Mytkowicz, Jacob Nelson + 1 more
- TurboTransformers: an efficient GPU serving system for transformer models · Jiarui Fang, Yang Yu, Chengduo Zhao, Jie Zhou
- Understanding a program's resiliency through error propagation · Zhimin Li, Harshitha Menon, Kathryn Mohror, Peer-Timo Bremer, Yarden Livnat, Valerio Pascucci
- Understanding and bridging the gaps in current GNN performance optimizations · Kezhao Huang, Jidong Zhai, Zhen Zheng, Youngmin Yi, Xipeng Shen
- Verifying C11-style weak memory libraries · Sadegh Dalvandi, Brijesh Dongol