ASE 2025
389 papers
- "My productivity is boosted, but ..." Demystifying Users' Perception on AI Coding Assistants
- A Characterization Study of Bugs in LLM Agent Workflow Orchestration Frameworks
- A Large Scale Study of AI-based Binary Function Similarity Detection Techniques for Security Researchers and Practitioners
- A Large-Scale Evolvable Dataset for Model Context Protocol Ecosystem and Security Analysis
- A Multi-Modality Evaluation of the Reality Gap in Autonomous Driving Systems
- A Secure Mocking Approach towards Software Supply Chain Security
- ACTaint: Agent-Based Taint Analysis for Access Control Vulnerabilities in Smart Contracts
- ADPerf: Investigating and Testing Performance in Autonomous Driving Systems
- AMPLE: Fine-grained File Access Policies for Server Applications
- APIDA-Chat: Structured Synthesis of API Search Dialogues to Bootstrap Conversational Agents
- APKARMOR: Low-Cost Lightweight Anti-Decompilation Techniques for Android Apps
- ARG: Testing Query Rewriters via Abstract Rule Guided Fuzzing
- Acceleration of Automotive Software Development by Retrieval Augmented Integration Test Script Generation
- AdaptEval: A Benchmark for Evaluating Large Language Models on Code Snippet Adaptation
- Adaptive Performance Regression Detection Using A Semi-Supervised Siamese Network
- AdaptiveGuard: Towards Adaptive Runtime Safety for LLM-Powered Software
- Advancing Automated Ethical Profiling in SE: a Zero-Shot Evaluation of LLM Reasoning
- Advancing Binary Code Similarity Detection via Context-Content Fusion and LLM Verification
- AgentDroid: A Multi-Agent Tool for Detecting Fraudulent Android Applications
- Agentic Specification Generator for Move Programs
- Agents in the Sandbox: End-to-End Crash Bug Reproduction for Minecraft
- AlertGuardian: Intelligent Alert Life-Cycle Management for Large-scale Cloud Systems
- Algernon: A Flag-Guided Hybrid Fuzzer for Unlocking Hidden Program Paths
- AlignCoder: Aligning Retrieval with Target Intent for Repository-Level Code Completion
- Aligning LLMs to Fully Utilize the Cross-file Context in Repository-level Code Completion
- Altered Histories in Version Control System Repositories: Evidence from the Trenches
- Amur: Fixing Multi-Resource Leaks Guided by Resource Flow Analysis
- An Agent-based Evaluation Framework for Complex Code Generation
- An Empirical Study of Knowledge Transfer in AI Pair Programming
- An Empirical Study of Python Library Migration Using Large Language Models
- An Empirical Study on UI Overlap in OpenHarmony Applications
- An LLM-based multi-agent framework for agile effort estimation
- AndroFL: Evolutionary-Driven Fault Localization for Android Apps
- AppBDS: LLM-Powered Description Synthesis for Sensitive Behaviors in Mobile Apps
- Are We SOLID Yet? An Empirical Study on Prompting LLMs to Detect Design Principle Violations
- Argus: Resilience-Oriented Safety Assurance Framework for End-to-End ADSs
- AutoFid: Adaptive and Noise-Aware Fidelity Measurement for Quantum Programs via Circuit Graph Analysis
- AutoPLC: Generating Vendor-Aware Structured Text for Programmable Logic Controllers
- Automated Combinatorial Test Generation for Alloy
- Automated Detection of Web Application Navigation Barriers for Screen Reader Users
- Automated Generation of Issue-Reproducing Tests by Combining LLMs and Search-Based Testing
- Automated Inline Comment Smell Detection and Repair with Large Language Models
- Automated Insertion of Flushes and Fences for Persistency
- Automated Proactive Logging Quality Improvement for Large-Scale Codebases
- Automated Prompt Generation for Code Intelligence: An Empirical study and Experience in WeChat
- Automated Repair of Ambiguous Problem Descriptions for LLM-Based Code Generation
- Automated Repair of OpenID Connect Programs
- Automatic Fixing of Missing Dependency Errors
- Autonomous Agents for Accessibility: Simulating Visual Impairments in Web Interfaces
- BASHIRI: Learning Failure Oracles from Execution Features
- BCFuzz: Bytecode-Driven Fuzzing for JavaScript Engines
- Backdoors in Code Summarizers: How Bad Is It?
- Belief Propagation with Local Structure and Its Applications in Program Analysis
- BenGQL: An Extensible Benchmarking Framework for Automated GraphQL Testing
- Better Safe than Sorry: Preventing Policy Violations through Predictive Root-Cause-Analysis for IoT Systems
- Beyond Static GUI Agent: Evolving LLM-based GUI Testing via Dynamic Memory
- BinStruct: Binary Structure Recovery Combining Static Analysis and Semantics
- BitsAI-Fix: LLM-Driven Approach for Automated Lint Error Resolution in Practice
- Breaking the Traffic Barrier: Unveiling Multi-Format of Protocols via Autonomous Program Exploration
- Bridging Natural Language and Formal Specification-Automated Translation of Software Requirements to LTL via Hierarchical Semantics Decomposition Using LLMs
- Bridging Research and Practice in Simulation-based Testing of Industrial Robot Navigation Systems
- BuilDroid: A Self-Correcting LLM Agent for Automated Android Builds
- Can Mamba Be Better? An Experimental Evaluation of Mamba in Code Intelligence
- Characterizing Multi-Hunk Patches: Divergence, Proximity, and LLM Repair Challenges
- Characterizing and Repairing Color-Related Accessibility Issues in Android Apps
- Chrysalis: A Lightweight Logging and Replay Framework for Metamorphic Testing in Python
- Clara: A Developer's Companion for Code Comprehension and Analysis
- Clarifying Semantics of In-Context Examples for Unit Test Generation
- CoTune: Co-evolutionary Configuration Tuning
- Code-DiTing: Automatic Evaluation of Code Generation without References or Test Cases
- CodeACT-R: A Cognitive Simulation Framework for Human Attention in Code Reading
- CodeGenLink: A Tool to Find the Likely Origin and License of Automatically Generated Code
- Coding-Fuse: Efficient Fusion of Code Pre-Trained Models for Classification Tasks
- Comprehend, Imitate, and then Update: Unleashing the Power of LLMs in Test Suite Evolution
- ConfuseTaint: Exploiting Vulnerabilities to Bypass Dynamic Taint Analysis
- Context-Aware CodeLLM Eviction for AI-assisted Coding
- Context-Sensitive Pointer Analysis for ArkTS
- CoorLog: Efficient-Generalizable Log Anomaly Detection via Adaptive Coordinator in Software Evolution
- Coverage-Based Harmfulness Testing for LLM Code Transformation
- Cross2OH: Enabling Seamless Porting of C/C++ Software Libraries to OpenHarmony
- Cryptbara: Dependency-Guided Detection of Python Cryptographic API Misuses
- DALEQ - Explainable Equivalence for Java Bytecode
- DESIGNATOR: a Toolset for Automated GAN-enhanced Search-based Testing and Retraining of DNNs in Martian Environments
- DLBench: A Comprehensive Benchmark for SQL Translation with Large Language Models
- DNAFuzz: Descriptor-Aware Fuzzing for USB Drivers
- DRIFT: Debug-based Trace Inference for Firmware Testing
- DSBox: A Data Selection Framework for Efficient Deep Code Learning
- Data Dependency-Aware Code Generation from Enhanced UML Sequence Diagrams
- DebCovDiff: Differential Testing of Coverage Measurement Tools on Real-World Projects
- Debugging the Undebuggable: Why Multi-Fault Programs Break Debugging and Repair Tools
- Debun: Detecting Bundled JavaScript Libraries on Web using Property-Order Graphs
- DeepExploitor: LLM-Enhanced Automated Exploitation of DeepLink Attack in Hybrid Apps
- DeepTx: Real-Time Transaction Risk Analysis via Multi-Modal Features and LLM Reasoning
- Defects4C: Benchmarking Large Language Model Repair Capability with C/C++ Bugs
- Defects4Log: Benchmarking LLMs for Logging Code Defect Detection and Reasoning
- Democratizing the Cryptocurrency Ecosystem by Just-In-Time Transformation of Mining Programs
- Demystifying Cookie Sharing Risks in WebView-based Mobile App-in-app Ecosystems
- Demystifying Cross-Language C/C++ Binaries: A Robust Software Component Analysis Approach
- Demystifying OpenZeppelin's Own Vulnerabilities and Analyzing Their Propagation in Smart Contracts
- Demystifying the Evolution of Neural Networks with BOM Analysis: Insights from a Large-Scale Study of 55,997 GitHub Repositories
- Destabilizing Neurons to Generate Challenging Neural Network Verification Benchmarks
- Detecting Semantic Clones of Unseen Functionality
- Detecting Various DeFi Price Manipulations with LLM Reasoning
- Detecting Vulnerabilities from Issue Reports for Internet-of-Things
- Detecting and Mitigating Inconsistencies Between Code, Documentation and Tests
- Detecting and Repairing Incomplete Software Requirements with Multi-LLM Ensembles
- Diagnosing Performance Differences in Model Checkers via Runtime-Guided Problem Generation
- DiffFix: Incrementally Fixing AST Diffs via Context and Type Information
- Diplomatist: What Do Cross-language Dependencies Reflect Software Ecosystem Health?
- Do LLMs Generate Useful Test Oracles? An Empirical Study with an Unbiased Dataset
- Don't Mess with Bro's Cheese! An Empirical Study of Resource Conflict in Android Multi-window
- DrainCode: Stealthy Energy Consumption Attacks on Retrieval-Augmented Code Generation via Context Poisoning
- DualFuzz: Detecting Vulnerability in Wi-Fi NICs through Dual-Directional Fuzzing
- Dynamic Testing of GUI Exercises in Headless Environments
- EPSO: A Caching-Based Efficient Superoptimizer for BPF Bytecode
- EditFusion: Resolving Code Merge Conflicts via Edit Selection
- Effective Code Membership Inference for Code Completion Models via Adversarial Prompts
- Efficient Understanding of Machine Learning Model Mispredictions
- Efficient and Verifiable Proof Logging for MaxSAT Solving
- EfficientEdit: Accelerating Code Editing via Edit-Oriented Speculative Decoding
- Element-Aware Fine-Tuning of Vision-Language Models for Cost-Efficient GUI Testing in an Industrial Setting
- Enhancing LLM to Decompile Optimized PTX to Readable CUDA for Tensor Programs
- Enhancing LLM's Ability to Generate More Repository-Aware Unit Tests Through Precise Context Injection
- Enhancing LLMs with Staged Grouping and Dehallucination for Header File Decomposition
- Envisioning Intelligent Requirements Engineering via Knowledge-Guided Multi-Agent Collaboration
- ErrorPrism: Reconstructing Error Propagation Paths in Cloud Service Systems
- Evaluating Large Language Models for Functional and Maintainable Code in Industrial Settings: A Case Study at ASML
- Evaluating Large Language Models for Time Series Anomaly Detection in Aerospace Software
- Evaluating Program Coverage for Code-Model Training
- Evaluating and Improving Framework-based Parallel Code Completion with Large Language Models
- Evolution-Aware Heuristics for GR(1) Realizability Checking
- Exact Inference for Quantum Circuits: A Testing Oracle for Quantum Software Stacks
- Execution-Aware Program Reduction for WebAssembly via Record and Replay
- Explainable Fault Localization for Programming Assignments via LLM-Guided Annotation
- Exploring Autonomous Agents: A Closer Look at Why They Fail When Completing Tasks
- Exploring Static Taint Analysis in LLMs: A Dynamic Benchmarking Framework for Measurement and Enhancement
- EyeNav: Accessible Webpage Interaction and Testing using Eye-tracking and NLP
- FETT: Fault Injection as an Educational and Training Tool in Cybersecurity
- FGit: Fault-Guided Fine-Tuning for Code Generation
- Fact-Aligned and Template-Constrained Static Analyzer Rule Enhancement with LLMs
- FailMapper: Automated Generation of Unit Tests Guided by Failure Scenarios
- FastCoder: Accelerating Repository-level Code Generation via Efficient Retrieval and Verification
- Faster Runtime Verification during Testing via Feedback-Guided Selective Monitoring
- Fault Injection for Simulink-based CPS Models: Insights and Future Directions
- Faultseeker: LLM-Empowered Framework for Blockchain Transaction Fault Localization
- Finding Bugs in MLIR Compiler Infrastructure via Lowering Space Exploration
- Finding Bugs in WebAssembly Interface Type Binding Generators
- Finding Insecure State Dependency in DApps via Multi-Source Tracing and Semantic Enrichment
- FirmProj: Detecting Firmware Leakage in IoT Update Processes via Companion App Analysis
- First-Order Quantified Separator in Alloy Analyzer
- Fixing Broken Graphs: LLM-Powered Automatic Code Optimization for DNN Programs
- FlakyGuard: Automatically Fixing Flaky Tests at Industry Scale
- FlowStrider: Low-Friction Continuous Threat Modeling
- Forcrat: Automatic I/O API Translation from C to Rust via Origin and Capability Analysis
- From Characters to Structure: Rethinking Real-Time Collaborative Programming Models
- From Modules to Marketplaces: A Vision for Composable Capability Sharing Across Organizations
- From Redundancy to Efficiency: Exploiting Shared UI Interactions towards Efficient LLM-Based Testing
- From Sparse to Structured: A Diffusion-Enhanced and Feature-Aligned Framework for Coincidental Correctness Detection
- From Technical Excellence to Practical Adoption: Lessons Learned Building an ML-Enhanced Trace Analysis Tool
- Function Clustering-Based Fuzzing Termination: Toward Smarter Early Stopping
- GUI-ReRank: Enhancing GUI Retrieval with Multi-Modal LLM-based Reranking
- GUIFuzz++: Unleashing Grey-box Fuzzing on Desktop Graphical User Interfacing Applications
- Generating Failure-Based Oracles to Support Testing of Reported Bugs in Android Apps
- GlassWing: A Tailored Static Analysis Approach for Flutter Android Apps
- HFuzzer: Testing Large Language Models for Package Hallucinations via Phrase-based Fuzzing
- HarmoBridge: Bridging ArkTS and C/C++ for Cross-Language Static Analysis on HarmonyOS
- Have We Solved Access Control Vulnerability Detection in Smart Contracts? A Benchmark Study
- Hierarchical Knowledge Injection for Improving LLM-based Program Repair
- Hit The Bullseye On The First Shot: Improving LLMs Using Multi-Sample Self-Reward Feedback for Vulnerability Repair
- How Big is the Automaton? Certified Lower Bounds on the Size of Presburger DFAs
- How Can Infrastructure as Code Accelerate Data Center Bring-ups? A Case Study at ByteDance
- How Does ChatGPT Make Assumptions When Creating Erroneous Programs?
- Human-Centered Evaluation of REST API Fuzzing Tools: Bridging Academia and Industry
- Human-In-The-Loop Oracle Learning for Simulation-Based Testing
- HybridSIMD: A Super C++ SIMD Library with Integrated Auto-tuning Capabilities
- Hypergraph Neural Network-based Multi-Granular Root Cause Localization for Microservice Systems
- IDBFuzz: Web Storage DataBase Fuzzing with Controllable Semantics
- IMUFuzzer: Resilience-based Discovery of Signal Injection Attacks on Robotic Aerial Vehicles
- Improving LLM-based Log Parsing by Learning from Errors in Reasoning Traces
- Improving NLSAT for Nonlinear Real Arithmetic
- Improving Quality of LLM Code Generation in Low-Resource Programming Languages via Uncertainty Estimation
- Incremental Program Analysis in the Wild: An Empirical Study on Real-World Program Changes
- Industry Practice of LLM-Assisted Protocol Fuzzing for Commercial Communication Modules
- IntelliTopo: An IaC Generation Service for Industrial Network Topology Construction
- Interaction-Aware Patch Assessment for Multi-Fault Automated Program Repair
- Interaction2Code: Benchmarking MLLM-based Interactive Webpage Code Generation from Interactive Prototyping
- Interleaved Learning and Exploration: A Self-Adaptive Fuzz Testing Framework for MLIR
- Interpretable Vulnerability Detection Reports
- Is Measurement Enough? Rethinking Output Validation in Quantum Program Testing
- Issue Localization via LLM-Driven Iterative Code Graph Searching
- It's Not Easy Being Green: On the Energy Efficiency of Programming Languages
- JSidentify-V2: Leveraging Dynamic Memory Fingerprinting for Mini-Game Plagiarism Detection
- KAIOPS: A Platform Solution of End-to-End Multi-Modal AIOps for AI Training at Scale
- Kair: A Statistical and Causal Approach to Pinpointing Stragglers in Distributed Model Training
- LAURA: Enhancing Code Review Generation with Context-Enriched Retrieval-Augmented LLM
- LLM-Assisted Synthesis of High-Assurance C Programs
- LLM-Based Identification of Null Pointer Exception Patches
- LLM-Guided Genetic Improvement: Envisioning Semantic Aware Automated Software Evolution
- LLM-Powered Fully Automated Chaos Engineering: Towards Enabling Anyone to Build Resilient Software Systems at Low Cost
- LLM-Powered Multi-Agent Collaboration for Intelligent Industrial On-Call Automation
- LLM-assisted Industrial-Scale Differential Testing of Package Incompatibilities in Linux Distributions
- LLM-based Dynamic Differential Testing for Database Connectors with Reinforcement Learning-Guided Prompt Selection
- LLMPort: Cross-file Patch Porting via Task Decomposition and Self-correction
- LLMorph: Automated Metamorphic Testing of Large Language Models
- LLMs for Automated Unit Test Generation and Assessment in Java: The AgoneTest Framework
- LOSVER: Line-Level Modifiability Signal-Guided Vulnerability Detection and Classification
- Lares: LLM-driven Code Slice Semantic Search for Patch Presence Testing
- Latra: A Template-Based Language-Agnostic Transformation Framework for Effective Program Reduction
- Learning Project-wise Subsequent Code Edits via Interleaving Neural-based Induction and Tool-based Deduction
- Learning from the Past: Real-World Exploit Migration for Smart Contract PoC Generation
- Let the Code Speak: Incorporating Program Dynamic State for Better Method-Level Fault Localization
- Leveraging Mixture-of-Experts Framework for Smart Contract Vulnerability Repair with Large Language Model
- LineBreaker: Finding Token-Inconsistency Bugs with Large Language Models
- Linguistic Theories Coincide with Misformalization in Temporal Logic
- LitterBox+: An Extensible Framework for LLM-enhanced Scratch Static Code Analysis
- LogAction: Consistent Cross-system Anomaly Detection through Logs via Active Domain Adaptation
- LogMoE: Lightweight Expert Mixture for Cross-System Log Anomaly Detection
- LogPilot: Intent-aware and Scalable Alert Diagnosis for Large-scale Online Service Systems
- LogSage: An LLM-Based Framework for CI/CD Failure Detection and Remediation with Industrial Validation
- LongCodeZip: Compress Long Context for Code Language Models
- Loupe: End-to-End Learning of Loop Unrolling Heuristics for Abstract Interpretation
- LspFuzz: Hunting Bugs in Language Servers
- M2QCode: A Model-Driven Framework for Generating Multi-Platform Quantum Programs
- MCTS-Refined CoT: High-Quality Fine-Tuning Data for LLM-Based Repository Issue Resolution
- MIMIC: Integrating Diverse Personality Traits for Better Game Testing Using Large Language Model
- Measuring LLM Code Generation Stability via Structural Entropy
- Measuring Software Resilience Using Socially Aware Truck Factor Estimation
- Metamorphic Testing for Audio Content Moderation Software
- Metamorphic Testing of Deep Reinforcement Learning Agents with MDPMorph
- Metrics Driven Reengineering and Continuous Code Improvement at Meta
- Minuku: Detecting Diverse Display Issues in Mobile Apps with Small-scale Dataset
- Mixture-of-Experts Low-Rank Adaptation for Multilingual Code Summarization
- MobileUPReg: Identifying User-Perceived Performance Regressions in Mobile OS Versions
- Mockingbird: Efficient Excessive Data Exposures Detection via Dynamic Code Instrumentation
- Multi-Modal Requirements Data-based Acceptance Criteria Generation using LLMs
- Multi-dimensional Assessment of Crowdsourced Testing Reports via LLMs
- Multiple Schema-Conformant Declarative Code Generation
- NATE: A Network-Aware Testing Enhancer for Network-Related Fault Detection in Android Apps
- Navigating the Labyrinth: Path-Sensitive Unit Test Generation with Large Language Models
- Non-termination Witnesses and Their Validation
- Not Every Patch is an Island: LLM-Enhanced Identification of Multiple Vulnerability Patches
- NovaQ: Improving Quantum Program Testing through Diversity-Guided Test Case Generation
- ORFuzz: Fuzzing the "Other Side" of LLM Safety - Testing Over-Refusal
- ORMorpher: An Interactive Framework for ORM Translation and Optimization
- OSSPREY: AI-Driven Forecasting and Intervention for OSS Project Sustainability
- On Automating Configuration Dependency Validation via Retrieval-Augmented Generation
- On the (In)Security of Non-resettable Device Identifiers in Custom Android Systems
- On the Correctness of Software Merge
- On the Robustness Evaluation of 3D Obstacle Detection Against Specifications in Autonomous Driving
- Out of Distribution Detection in Self-adaptive Robots with AI-powered Digital Twins
- PALM: Synergizing Program Analysis and LLMs to Enhance Rust Unit Test Coverage
- PAT-Agent: Autoformalization for Model Checking
- PEACE: Towards Efficient Project-Level Efficiency Optimization via Hybrid Code Editing
- PROXiFY: A Bytecode Analysis Tool for Detecting and Classifying Proxy Contracts in Ethereum Smart Contracts
- PoliCond: Condition-Aware Ontology-Driven LLMs for Privacy Policy Contradiction Analysis
- Polyglot: An Extensible Framework to Benchmark Code Translation with LLMs
- Practical Escape of Exploration Tarpits for Mini-Game Testing in an Industrial Setting
- PrefGen: A Preference-Driven Methodology for Secure Yet Gas-Efficient Smart Contract Generation
- PrioTestCI: Efficient Test Case Prioritization in GitHub Workflows for CI Optimization
- ProfMal: Detecting Malicious NPM Packages by the Synergy between Static and Dynamic Analysis
- Profile Coverage: Using Android Compilation Profiles to Evaluate Dynamic Testing
- Programmers' Visual Attention on Function Call Graphs During Code Summarization
- PromFuzz: Leveraging LLM-Driven and Bug-Oriented Composite Analysis for Detecting Functional Bugs in Smart Contracts
- Prompt-with-Me: in-IDE Structured Prompt Management for LLM-Driven Software Engineering
- Propagation-Based Vulnerability Impact Assessment for Software Supply Chains
- Protecting Source Code Privacy When Hunting Memory Bugs
- Provable Fairness Repair for Deep Neural Networks
- PseudoFix: Refactoring Distorted Structures in Decompiled C Pseudocode
- PyGress: Tool for Analyzing the Progression of Code Proficiency in Python OSS Projects
- PyTrim: A Practical Tool for Reducing Python Dependency Bloat
- QuanBench: Benchmarking Quantum Code Generation with Large Language Models
- Quantum Machine Learning-based Test Oracle for Autonomous Mobile Robots
- Quirx: A Mutation-Based Framework for Evaluating Prompt Robustness in LLM-based Software
- R3-Bench: Reproducible Real-world Reverse Engineering Dataset for Symbol Recovery
- RAML: Toward Retrieval-Augmented Localization of Malicious Payloads in Android Apps
- RFCAudit: AI Agent for Auditing Protocol Implementations Against RFC Specifications
- RFCScope: Detecting Logical Ambiguities in Internet Protocol Specifications
- RPG: Linux Kernel Fuzzing Guided by Distribution-Specific Runtime Parameter Interfaces
- RSFuzz: A Robustness-Guided Swarm Fuzzing Framework Based on Behavioral Constraints
- ReFuzzer: Feedback-Driven Approach to Enhance Validity of LLM-Generated Test Programs
- RealisticCodeBench: Towards More Realistic Evaluation of Large Language Models for Code Generation
- Rechecking Recheck Requests in Continuous Integration: An Empirical Study of OpenStack
- Reflective Unit Test Generation for Precise Type Error Detection with Large Language Models
- Relia: Accelerating the Analysis of Cloud Access Control Policies
- Repairing Leaks in Resource Wrappers
- RepoMasterEval: Evaluating Code Completion via Real-World Repositories
- Requirements Development and Formalization for Reliable Code Generation: A Multi-Agent Vision
- Risk Estimation in Differential Fuzzing via Extreme Value Theory
- Root Cause Analysis of RISC-V Build Failures via LLM and MCTS Reasoning
- RustAssure: Differential Symbolic Testing for LLM-Transpiled C-to-Rust Code
- RustRepoTrans: Repository-level Context Code Translation Benchmark Targeting Rust
- SATORI: Static Test Oracle Generation for REST APIs
- SCOPE: Evaluating and Enhancing Permission Explanation Transparency in Mobile Apps
- SE-Jury: An LLM-as-Ensemble-Judge Metric for Narrowing the Gap with Human Evaluation in SE
- SGCR: A Specification-Grounded Framework for Trustworthy LLM Code Review
- SMTgazer: Learning to Schedule SMT Algorithms via Bayesian Optimization
- SPICE: An Automated SWE-Bench Labeling Pipeline for Issue Clarity, Test Coverage, and Effort Estimation
- SSR: Safeguarding Staking Rewards by Defining and Detecting Logical Defects in DeFi Staking
- STaint: Detecting Second-Order Vulnerabilities in PHP Applications with LLM-Assisted Bi-Directional Static Taint Analysis
- SateLight: A Satellite Application Update Framework for Satellite Computing
- ScaleCirc: Scaling the Analysis over Circom Circuits
- Secure Transaction Semantics: Analysis, Vulnerability Detection, and Attack Modeling
- Securing Millions of Decentralized Identities in Alipay Super App with End-to-End Formal Verification
- Securing Self-Managed Third-Party Libraries
- Security Debt in LLM Agent Applications: A Measurement Study of Vulnerabilities and Mitigation Trade-offs
- Seeing is Fixing: Cross-Modal Reasoning with Multimodal LLMs for Visual Software Issue Repair
- SemGuard: Real-Time Semantic Evaluator for Correcting LLM-Generated Code
- Should We Evaluate LLM Based Security Analysis Approaches on Open Source Systems?
- Shrunk, Yet Complete: Code Shrinking-Resilient Android Third-Party Library Detection
- Sifting Truth from Coincidences: A Two-Stage Positive and Unlabeled Learning Model for Coincidental Correctness Detection
- Simulated Interactive Debugging
- SolContractEval: A Benchmark for Evaluating Contract-Level Solidity Code Generation
- Soleker: Uncovering Vulnerabilities in Solana Smart Contracts
- Spec2Code: Mapping Protocol Specification to Function-Level Code Implementation
- Speculative Automated Refactoring of Imperative Deep Learning Programs to Graph Execution
- Spinner: Detecting Locking Violations in the eBPF Runtime
- StackPlagger: A System for Identifying AI-Code Plagiarism on Stack Overflow
- State Field Coverage: A Metric for Oracle Quality
- Streamlining Acceptance Test Generation for Mobile Applications Through Large Language Models: An Industrial Case Study
- Taming Uncertainty via Automation: Observing, Analyzing, and Optimizing Agentic AI Systems
- TensorGuard: Gradient-Based Model Fingerprinting for LLM Similarity Detection and Family Classification
- Tephra: Principled Discovery of Fuzzer Limitations
- Terminator: Enabling Efficient Fuzzing of Closed-Source GUI Programs by Automatic Coverage-Guided Termination
- Testing Autonomous Driving Systems Through Blind-Spot Guided Fuzzing
- Tether: A Personalized Support Assistant for Software Engineers with ADHD
- The Cost of Downgrading Build Systems : A Case Study of Kubernetes
- The Fault in our Stats
- The Future of Software Transparency: Bridging Understanding, Measurement, and Practice
- The Gold Digger in the Dark Forest: Industrial-Scale MEV Analysis in Ethereum
- Thinking Longer, Not Larger: Enhancing Software Engineering Agents via Scaling Test-Time Compute
- Token Sugar: Making Source Code Sweeter for LLMs through Token-Efficient Shorthand
- Towards Automated Governance: A DSL for Human-Agent Collaboration in Software Projects
- Towards Context-aware Mobile Privacy Notice: Implementation of A Deployable Contextual Privacy Policies Generator
- Towards Generalizable Instruction Vulnerability Prediction via LLM-Enhanced Code Representation
- Towards More Accurate Static Analysis for Taint-Style Bug Detection in Linux Kernel
- Towards Reliable LLM-based Exam Generation Lessons Learned and Open Challenges in an Industrial Project
- Training-Control-as-Code: Towards a declarative solution to control training
- TreeRanker: Fast and Model-Agnostic Ranking System for Code Suggestions in IDEs
- Triangle: Empowering Incident Triage with Multi-Agent
- TrioXpert: An Automated Incident Management Framework for Microservice System
- Tron: Fuzzing Linux Network Stack via Protocol-System Call Payload Synthesis
- TrustVis: A Multi-Dimensional Trustworthiness Evaluation Framework for Large Language Models
- Tuning LLM-based Code Optimization via Meta-Prompting: An Industrial Perspective
- Uncovering Discrimination Clusters: Quantifying and Explaining Systematic Fairness Violations
- Uncovering Prompt Elements: Cloning System Prompts from Behavioral Traces
- Uncovering Systematic Failures of LLMs in Verifying Code Against Natural Language Specifications
- Understanding Feature Request Practice on GitHub via a Large-Scale Empirical Study
- Understanding Resource Injection Vulnerabilities in Kubernetes Ecosystems
- Understanding Software Engineering Agents: A Study of Thought-Action-Result Trajectories
- Understanding Uncertainty In LLMs
- Unit Test Update through LLM-Driven Context Collection and Error-Type-Aware Refinement
- United We Stand: Towards End-to-End Log-based Fault Diagnosis via Interactive Multi-Task Learning
- Unlocking Reproducibility: Automating re-Build Process for Open-Source Software
- Unseen Data Detection using Routing Entropy in Mixture-of-Experts for Autonomous Vehicles
- Using Active Learning to Train Predictive Mutation Testing with Minimal Data
- Using Fourier Analysis and Mutant Clustering to Accelerate DNN Mutation Testing
- VERT: Polyglot Verified Equivalent Rust Transpilation with Large Language Models
- VRExplorer: A Model-based Approach for Semi-Automated Testing of Virtual Reality Scenes
- VRTestSniffer: Test Smell Detector for Virtual Reality (VR) Software Projects
- VUSC: An Extensible Research Platform for Java-Based Static Analysis
- VeriExploit: Automatic Bug Reproduction in Smart Contracts via LLMs and Formal Methods
- Verification and Classification of Exploits for Node.js Vulnerabilities
- Vessel: A Taxonomy of Reproducibility Issues for Container Images
- Vul-R2: A Reasoning LLM for Automated Vulnerability Repair
- Vulnerability-Affected Versions Identification: How Far Are We?
- WEST: Specification-Based Test Generation for WebAssembly
- WIBE: Watermarks for generated Images - Benchmarking & Evaluation
- Walk the Talk: Is Your Log-based Software Reliability Maintenance System Really Reliable?
- Watson: A Cognitive Observability Framework for the Reasoning of LLM-Powered Agents
- What Types of Code Review Comments Do Developers Most Frequently Resolve?
- What's DAT Smell? Untangling and Weaving the Disjoint Assertion Tangle Test Smell
- When Abstraction Breaks Physics: Rethinking Modular Design in Quantum Software
- When AllClose Fails: Round-Off Error Estimation for Deep Learning Programs
- When Autonomous Vehicle Meets V2X Cooperative Perception: How Far Are We?
- When Control Flows Deviate: Directed Grey-box Fuzzing with Probabilistic Reachability Analysis
- When Does Wasm Malware Detection Fail? A Systematic Analysis of Their Robustness to Evasion
- When Faster Isn't Greener: The Hidden Costs of LLM-Based Code Optimization
- Which Is Better For Reducing Outdated and Vulnerable Dependencies: Pinning or Floatingƒ
- Who's to Blame? Rethinking the Brittleness of Automated Web GUI Testing from a Pragmatic Perspective
- Why AI Agents Still Need You: Findings from Developer-Agent Collaborations in the Wild
- Why Is My Transaction Risky? Understanding Smart Contract Semantics and Interactions in the NFT Ecosystem
- WingMuzz: Blackbox Testing of IoT Protocols via Two-dimensional Fuzzing Schedule
- Wired for Reuse: Automating Context-Aware Code Adaptation in IDEs via LLM-Based Agent
- XRintTest: An Automated Framework for User Interaction Testing in Extended Reality Applications
- Your Build Scripts Stink: The State of Code Smells in Build Scripts
- ZendDiff: Differential Testing of PHP Interpreter
- evalSmarT: An LLM-Based Framework for Evaluating Smart Contract Generated Comments
- iCodeReviewer: Improving Secure Code Review with Mixture of Prompts
- iKnow: an Intent-Guided Chatbot for Cloud Operations with Retrieval-Augmented Generation