PPoPP 2025
50 papers
- A General and Scalable GCN Training Framework on CPU Supercomputers
- AC-Cache: A Memory-Efficient Caching System for Small Objects via Exploiting Access Correlations
- ATTNChecker: Highly-Optimized Fault Tolerant Attention for Large Language Model Training
- Acc-SpMM: Accelerating General-purpose Sparse Matrix-Matrix Multiplication with GPU Tensor Cores
- Accelerating GNNs on GPU Sparse Tensor Cores through N: M Sparsity-Oriented Graph Reordering
- Adaptive Parallel Training for Graph Neural Networks
- Aggregating Funnels for Faster Fetch&Add and Queues
- An AI-Enhanced 1km-Resolution Seamless Global Weather and Climate Model to Achieve Year-Scale Simulation Speed using 34 Million Cores
- Balanced Allocations over Efficient Queues: A Fast Relaxed FIFO Queue
- BerryBees: Breadth First Search by Bit-Tensor-Cores
- Big Atomics and Fast Hash Tables
- Boost Lock-free Queue and Stack with Batching
- COMPSO: Optimizing Gradient Compression for Distributed Training with Second-Order Optimizers
- Crystality: A Programming Model for Smart Contracts on Parallel EVMs
- DORADD: Deterministic Parallel Execution in the Era of Microsecond-Scale Computing
- EVeREST: An Effective and Versatile Runtime Energy Saving Tool for GPUs
- Effectively Virtual Page Prefetching via Spatial-Temporal Patterns for Memory-intensive Cloud Applications
- Fairer and More Scalable Reader-Writer Locks by Optimizing Queue Management
- FastBWA: Practical and Cost-Efficient Genome Sequence Alignment Pipeline
- FlashFFTStencil: Bridging Fast Fourier Transforms to Memory-Efficient Stencil Computations on Tensor Core Units
- FlashSparse: Minimizing Computation Redundancy for Fast Sparse Matrix Multiplications on Tensor Cores
- FlashTensor: Optimizing Tensor Programs by Leveraging Fine-grained Tensor Property
- Frontier-guided Graph Reordering
- GLumin: Fast Connectivity Check Based on LUTs For Efficient Graph Pattern Mining
- Harnessing Inter-GPU Shared Memory for Seamless MoE Communication-Computation Fusion
- Helios: Efficient Distributed Dynamic Graph Sampling for Online GNN Inference
- High-performance Visual Semantics Compression for AI-Driven Science
- Improving Tridiagonalization Performance on GPU Architectures
- Jigsaw: Toward Conflict-free Vectorized Stencil Computation by Tessellating Swizzled Registers
- LibRTS: A Spatial Indexing Library by Ray Tracing
- MARLIN: Mixed-Precision Auto-Regressive Parallel Inference on Large Language Models
- Magneto: Accelerating Parallel Structures in DNNs via Co-Optimization of Operators
- Mario: Near Zero-cost Activation Checkpointing in Pipeline Parallelism
- Minimizing speculation overhead in a parallel recognizer for regular texts
- PANNS: Enhancing Graph-based Approximate Nearest Neighbor Search through Recency-aware Construction and Parameterized Search
- Popcorn: Accelerating Kernel K-means on GPUs through Sparse Linear Algebra
- Publish on Ping: A Better Way to Publish Reservations in Memory Reclamation for Concurrent Data Structures
- RT-BarnesHut: Accelerating Barnes-Hut Using Ray-Tracing Hardware
- Reciprocating Locks
- SBMGT: Scaling Bayesian Multinomial Group Testing
- SGDRC: Software-Defined Dynamic Resource Control for Concurrent DNN Inference on NVIDIA GPUs
- Semi-StructMG: A Fast and Scalable Semi-Structured Algebraic Multigrid
- Setting a Course for Post-Moore Software Performance
- Swift Unfolding of Communities: GPU-Accelerated Louvain Algorithm
- TensorMD: Molecular Dynamics Simulation with Ab Initio Accuracy of 50 Billion Atoms
- Transactional Data Structures with Orthogonal Metadata
- Triangle Counting on Tensor Cores
- TurboFFT: Co-Designed High-Performance and Fault-Tolerant Fast Fourier Transform on GPUs
- WaterWise: Co-optimizing Carbon- and Water-Footprint Toward Environmentally Sustainable Cloud Computing
- WeiPipe: Weight Pipeline Parallelism for Communication-Effective Long-Context Large Model Training