AIware 2026
Mon 6 - Tue 7 July 2026 Montreal, Canada
co-located with FSE 2026

Large Language Models (LLMs) for code generation risk memorizing and reproducing sensitive training data, including licensed code and proprietary information. We investigate memorization behavior in recent open-weight LLMs in code generation using a two-stage memorization evaluation pipeline, which combines a similarity-based extractability filter with a targeted data extraction attack. We evaluate four models (StarCoder2-3B, StarCoder2-7B, Llama3-8B, and DeepSeek-R1-distilled-Llama-8B) on a custom dataset of 30,000+ Python files. Our results reveal memorization rates of 42-64%, with code-specialized models exhibiting higher rates than general-purpose models. Categorical analysis shows that repetitive content (license headers, documentation) is memorized at rates up to 70%, while complex code exhibits lower susceptibility. Notably, realistic code completion scenarios trigger unintentional memorization in 13-14% of cases, posing practical risks for AI coding assistants. We demonstrate that knowledge distillation reduces extraction rates by approximately 19%, offering a cost-effective mitigation approach. Our findings confirm that memorization persists in modern LLMs and is influenced more by a complex interplay of training domain, dataset composition, architectural choices, and content characteristics, rather than parameter count alone.

Mon 6 Jul

Displayed time zone: Eastern Time (US & Canada) change

14:00 - 15:30
Trustworthy Code Generation, Reliability, and Engineering of AIware SystemsMain Track at MB 1.210
Chair(s): Zhijie Wang Concordia University
14:00
5m
Talk
VeriTrans: Fine-Tuned LLM-Assisted NL→PL Translation via a Deterministic Neuro-symbolic Pipeline
Main Track
Xuan Liu , Dheeraj Kodakandla Pennsylvania State University, US, Kushagra Srivastva Pennsylvania State University, US, Mahfuza Farooque Pennsylvania State University, US
DOI
14:05
5m
Talk
Kubernetes Misconfigurations in the Wild: Taxonomy, Evolution, and Automated Repair with Large Language Models
Main Track
GHORAB Mostafa Anouar Université Laval, CA, Ahmad Abdellatif University of Calgary, Mohamed Aymen saied Laval University
DOI
14:10
5m
Talk
Quality and Security Signals in AI-Generated Python Refactoring Pull RequestsAIware Honorable Mention Paper Award
Main Track
Mohamed Almukhtar University of Michigan-Flint, Anwar Ghammam University of Michigan - Dearborn, Hua Ming
DOI
14:15
5m
Talk
From Assistance to Agency: Rethinking Autonomy and Control in CI/CD Pipelines
Main Track
Marcus Barnes University of Toronto, Taher A. Ghaleb Trent University, Safwat Hassan University of Toronto
DOI Pre-print
14:20
5m
Talk
Beyond Translation Accuracy: Addressing False Failures in LLM-Based Code Translation
Main Track
Fazle Rabbi Concordia University, Soumit Kanti Saha Concordia University, CA, Jinqiu Yang Concordia University
DOI
14:25
5m
Talk
Executable but Unlearnable: Designing Code That Resists LLM-Based Learning
Main Track
Viraaji Mothukuri Kennesaw State University, Reza M. Parizi Kennesaw State University
DOI
14:30
5m
Talk
Detecting Unsoundness in Neural Network Verifiers via Concrete–Abstract Consistency
Main Track
Kaijie Liu University of New South Wales, Sydney, Yulei Sui University of New South Wales
DOI Pre-print
14:35
5m
Talk
From Correctness to Consistency: Redefining Reliability for the Agentware Era
Main Track
Xue Qin Villanova University, Mauricio Gouvea Gruppi
DOI
14:40
5m
Talk
A Preliminary Study on Explaining Risk of Code Changes using LLM-Based Prediction Models
Main Track
Yalin Liu Facebook, US, Kosay Jabre Meta Platforms, Inc., Rui Abreu Meta, Zachariah J Carmichael Facebook, US, Vijayaraghavan Murali Rice University, Akshay Patel Meta Platforms, Inc., Jun Ge Meta Platforms, Inc., Weiyan Sun Meta Platforms, Inc., Cong Zhang Southern Methodist University, Southern Methodist University, US, Audris Mockus The University of Tennessee, Knoxville / Vilnius University, David Khavari , Peter Rigby Concordia University; Meta, Nachiappan Nagappan Meta Platforms, Inc.
DOI
14:45
5m
Talk
When AI Coding Assistants Leak Training Data: A Study of LLM Memorization in Code GenerationAIware Honorable Mention Paper Award
Main Track
Xiaoyu Cheng , Kundi Yao Ontario Tech University, Pengyu Nie University of Waterloo, Weiyi Shang University of Waterloo
DOI
14:50
5m
Talk
Zombie Agents: Detecting Semantic Livelock in Long-Horizon Autonomous Software
Main Track
DOI
14:55
5m
Talk
Neural-Symbolic Multi-objective Optimization for Performance-Aware ORM Database Design
Main Track
Sasan Azizian Bellevue University, Ayoub Hazrati The Vanguard Group, Artin Azizian McGill University, School of Computer Science, Elham Rastegari Creighton University, Hamid Bagheri University of Nebraska-Lincoln, Juan Cui University of Nebraska, Lincoln, US
DOI
15:00
5m
Talk
TriORM: Workload-Aware Neural-Symbolic Multi-objective Optimization for ORM Mapping Design
Main Track
Sasan Azizian Bellevue University, Ayoub Hazrati The Vanguard Group, Artin Azizian McGill University, School of Computer Science, Elham Rastegari Creighton University
DOI
15:05
5m
Talk
Artifact Readiness Gates with Saturation Stop Rules and Host-Parity Admissibility for FM Release Evaluation
Main Track
Yanick Kanyiki InvarLock Inc., CA
DOI
15:10
5m
Talk
Towards Migrating Neural Network ImplementationsAIware Honorable Mention Paper Award
Main Track
Nadia Daoudi Luxembourg Institute of Science and Technology, Iván Alfonso Luxembourg Institute of Science and Technology, Jordi Cabot Luxembourg Institute of Science and Technology
DOI
15:15
5m
Talk
From Code Review to Spec-Driven Contracts: A Vision for Auditable AIWare Systems
Main Track
Mohammad Hamdaqa Polytechnique Montreal, Moataz Chouchen Concordia University
DOI
15:20
10m
Live Q&A
Joint Q&A
Main Track