CGO 2026
56 papers
- A Reinforcement Learning Environment for Automatic Code Optimization in the MLIR Compiler
- Accelerating App Recompilation across Android System Updates by Code Reusing
- Automatic Data Enumeration for Fast Collections
- BIT: Empowering Binary Analysis through the LLVM Toolchain
- Binary Diffing via Library Signatures
- Compilation of Generalized Matrix Chains with Symbolic Sizes
- Compiler-Assisted Instruction Fusion
- Compiler-Runtime Co-operative Chain of Verification for LLM-Based Code Optimization
- Dependence-Driven, Scalable Quantum Circuit Mapping with Affine Abstractions
- Dr.avx: A Dynamic Compilation System for Seamlessly Executing Hardware-Unsupported Vectorization Instructions
- DyPARS: Dynamic-Shape DNN Optimization via Pareto-Aware MCTS for Graph Variants
- Eliminating Redundancy: Ultra-compact Code Generation for Programmable Dataflow Accelerators
- Ember: A Compiler for Embedding Operations on Decoupled Access-Execute Architectures
- Enabling Automatic Compiler-Driven Vectorization of Transformers
- Enabling Spill-Free Compilation via Affine-Based Live Range Reduction Optimization
- FHEFusion: Enabling Operator Fusion in FHE Compilers for Depth-Efficient DNN Inference
- FORTE: Online DataFrame Query Optimizer
- FRUGAL: Pushing GPU Applications beyond Memory Limits
- Fast Autoscheduling for Sparse ML Frameworks
- Flow-Graph-Aware Tiling and Rescheduling for Memory-Efficient On-Device Inference
- From Threads to Tiles: T2T, a Compiler for CUDA-to-NPU Translation via 2D Vectorization
- GRANII: Selection and Ordering of Primitives in GRAph Neural Networks using Input Inspection
- Hexcute: A Compiler Framework for Automating Layout Synthesis in GPU Programs
- LEGO: A Layout Expression Language for Code Generation of Hierarchical Mapping
- LLM-VeriOpt: Verification-Guided Reinforcement Learning for LLM-Based Compiler Optimization
- Multidirectional Propagation of Sparsity Information across Tensor Slices
- On the Precision of Dynamic Program Fingerprints Based on Performance Counters
- OpenQudit: Extensible and Accelerated Numerical Quantum Compilation via a JIT-Compiled DSL
- PASTA: A Modular Program Analysis Tool Framework for Accelerators
- PIP: Making Andersen's Points-to Analysis Sound and Practical for Incomplete C Programs
- Partial-Evaluation Templates: Accelerating Partial Evaluation with Pre-compiled Templates
- PolyUFC: Polyhedral Compilation Meets Roofline Analysis for Uncore Frequency Capping
- Practical: Are Abstract-Interpreter Baseline JITs Worth It? An Empirical Evaluation through Metacompilation
- PriTran: Privacy-Preserving Inference for Transformer-Based Language Models under Fully Homomorphic Encryption
- Progressive Low-Precision Approximation of Tensor Operators on GPUs: Enabling Greater Trade-Offs between Performance and Accuracy
- Proton: Towards Multi-level, Adaptive Profiling for Triton
- Pushing Tensor Accelerators beyond MatMul in a User-Schedulable Language
- Pyls: Enabling Python Hardware Synthesis with Dynamic Polymorphism via LCRS Encoding
- QIGen: A Kernel Generator for Inference on Nonuniformly Quantized Large Language Models
- SecSwift, a Compiler-Based Framework for Software Countermeasures in Cybersecurity
- Selene: Cross-Level Barrier-Free Pipelining for Irregular Nested Loops in High-Level Synthesis
- SkeleShare: Algorithmic Skeletons and Equality Saturation for Hardware Resource Sharing
- Space-Time Optimisations for Early Fault-Tolerant Quantum Computation
- SparseX: Synergizing GPU Libraries for Sparse Matrix Multiplication on Heterogeneous Processors
- Synthesizing Instruction Selection Back-Ends from ISA Specifications Made Practical
- Synthesizing Specialized Sparse Tensor Accelerators for FPGAs via High-Level Functional Abstractions
- TPDE: A Fast Adaptable Compiler Back-End Framework
- TRACE4J: A Lightweight, Flexible, and Insightful Performance Tracing Tool for Java
- Tawa: Automatic Warp Specialization for Modern GPUs with Asynchronous References
- Tensor Program Superoptimization through Cost-Guided Symbolic Program Synthesis
- The Parallel-Semantics Program Dependence Graph for Parallel Optimization
- Thinking Fast and Correct: Automated Rewriting of Numerical Code through Compiler Augmentation
- Towards Path-Aware Coverage-Guided Fuzzing
- Towards Threading the Needle of Debuggable Optimized Binaries
- Unlocking Python Multithreading Capabilities using OpenMP-Based Programming with OMP4Py
- VFlatten: Selective Value-Object Flattening using Hybrid Static and Dynamic Analysis