Workshops and the main conference take place in Utrecht from 17 to 21 October 2026.
For the general agenda of a workshop or tutorial day, please visit the Workshops/Tutorials page.
Saturday 17 October
Workshops & Tutorial
Registration and walk-in
Strikkerhuis
YNLG: talks and discussion
All day
Restauratiezaal
AIWolfDial
Wachtkammer 3e Klasse
Industrial NLP
Wachtkammer 3e Klasse
Sunday 18 October
Workshops & Tutorial
Registration and walk-in
Strikkerhuis
YNLG: Hackathon
All day
Restauratiezaal
Tutorial
Wachtkammer 3e Klasse
Alternative architectures
Wachtkammer 3e Klasse
Monday 19 October
Main conference
Bedrijfsschool & foyer
Registration
Brief word of welcome
Oral session 1
long
Mid-Utterance Transition Control for Audio Commentary Generation
72Ryota Kawamatsu, Tatsuya Ishigaki, Hiroya Takamura
long
Token Distribution versus Data Volume: Domain Balancing in Multi-Domain Meeting Summarisation
148Ashima Sood, Bryan Gardiner, Joan Condell
long
Identifying Check-Worthy Claims by Generating the Implicit Content of Enthymemes
103Martial Pastor, Stefan Kok
long
Confident by Default: A Longitudinal Study of Style Drift and Convergence Across Large Language Model Providers
51Silas Rech, Tom Bäckström
long
Do as I Say, Not as You Do: Assessing Public Versus Practitioner Perspectives on the Development of Artificial Intelligence and Language Technologies
64Tyler Loakman, Chenghua Lin
long
Can LLM Coding Agents Reason About Time Series?
ARR-15Filip Rechtorík, Ondrej Dusek, Zdeněk Kasner
Coffee, sweets
Keynote: Malvina Nissim
Lunch
Poster & demo session
long
Language-Agnostic Latent Injection for Multilingual Hybrid Reasoning
128Đặng Phương Nam, Nguyen Van Hieu, Nguyen Nam Truong, Phan Duy Hung
non-archival
Reasoning Gets Harder for LLMs Inside A Dialogue
174Ivan Kartáč, Mateusz Lango, Ondrej Dusek
long
From Sounds to Symbols: A Survey of Phonetically and Phonologically Informed Language Generation
62Tyler Loakman, Joseph James, Chenghua Lin
short
Sleight of Word Benchmark: Can Language Models Notice If Their Own Output Was Tampered With?
37Alberto Cetoli
long
Towards Plug-and-Play Attribute Control Modules in Text Generation: An Exploratory Study of LoRA Portability Across Model Families
134Michela Lorandi, Anya Belz
long
ACA-Bot: Evaluating Pedagogical Dialogue Generation in a Spoken LLM-Based Oral Examiner
144Julie Bauer, Krist Shingjergji, Aki Härmä
long
Pop Quiz! Comparing Educational Assessment Methods for Evaluating Context Utilization vs. Pre-Trained Knowledge in Large Language Models
107Anura Deshpande, Suvaditya Mukherjee, Benjamin Nye, Ella Park, Russell Harral
long
Comparing Retrieval-Augmented Generation Pipelines for Energy-Aware Code Refactoring
160Youssef Oubelmouh, Pierre CHHIENG, Daoudi Amir Salah Eddine
long
NexusEngine: Ontology-Constrained, Provenance-Grounded, Multi-Modal Generation for Infrastructure Digital Twins
111Kanimozhi Uma, Merijn Vanalderweireldt
short
From Metrics to Meaning: Learning Qualitative Research Methods as a Community
120Adarsa Sivaprasad, Yujun Wang, Mengxuan Sun, David M Howcroft, Ehud Reiter
long
ViInfoSum: A Novel Dataset for Multimodal Summarization in Vietnamese
19Nguyen Khoi Tran, Binh Xuan Le, Nghia Hieu Nguyen, Khiem Vinh Tran, Ngan Luu-Thuy Nguyen
long
Augmenting Lecture Information via Redundancy-Filtered LLM Slide Descriptions for Blind and Low-Vision Students
25Katharina Anderer, Jan Niehues, Karin Müller, Matthias Wölfel
non-archival
Preliminary results on predicting bootstrapping NLG resources for low-resourced languages
182Phuthang Makhupane, Leruo Hillary Sharp, Zola Mahlaza, C. Maria Keet
non-archival
VISTA: Verification In Sequential Turn-based Assessment
168Ashley Lewis
long
Strategies for Span Labeling with Large Language Models
ARR-16Danil Semin, Ondrej Dusek, Zdeněk Kasner
long
Perspective-Diverse Utterance Candidate Generation via Input Variation for Race Game Commentary
105Mizuki Arai, Tatsuya Ishigaki, Yusuke Miyao, Hiroya Takamura, Ichiro Kobayashi
long
Chain-of-Thought Depth Modulates Performance by Task and Model: Evidence from Ablation Studies Across Five Model Families
8N.ANEESH.DUTT
non-archival
Ontology-Mediated Framework for Generating Answerable Questions and Feedback from Ontologies
180Toky Hajatiana Raboanary, C. Maria Keet
demo
A Tool for Collecting Validated Triple Sets for Data-to-Text Generation
80Mark Andrade, Simon Mille, Anya Belz, Brian Davis
Oral session 2
long
Beyond Natural Language Plans: Structure-Aware Agentic Planning for Query-Focused Table Summarization
98Weijia Zhang, Yifei Yuan, Songgaojun Deng, Evangelos Kanoulas
long
Probing the Communicative Efficiency of LLMs via Content Selection in Visually Uncommon Reference Games
113Simeon Junker, Manar Ali, Kristina Kobrock, Larissa Koch, Marika Sarzotti, Hendrik Buschmeier, Sina Zarrieß
long
Structured Critique Generation Mitigates Toxification in Self-Critique Alignment
70Takeru Mitsumori, Hiroya Takamura, Takashi Inui
long
TENOR: Tension-Enhanced Narrative Planning and Organization for Report Generation
108Aliah Gie Fajardo Zabala, Yi-Shin Chen
long
Effort and Confidence: Surface Markers in Reasoning Traces Predict Correctness on Insight Puzzles
78Richard A. J. Mann, Pranava Madhyastha
long
Are LLM Judges Language-Neutral? A Cross-Lingual Meta-Evaluation on Multilingual Summarization
114Mohammaderfan koupaei, Amir Esmaeili, Mahshid Khanali, Florian Mai, Patrícia Schmidtová
Coffee/Tea break
Poster & demo session
long
Graph Mapping and LLMs Thinking Speed
133Ramazan Ali Bahrami, Ramin Yahyapour
long
Probing, Measuring and Mitigating Activity-Level Gender Associations in Open-Ended Text Generation
135Xiangjue Dong, Yibo Wang, Philip S. Yu, James Caverlee
short
Heterographic Supervision for Direct Speech-to-Text Translation in Scriptless Tribal Languages
112Prashant Bannulmath, Swapnil Sontakke, Deepak K T
non-archival
DeScribe: Discourse-Driven Extraction and Structuring of Claim Verification for Better Faithfulness Evaluation
176Yang Zhong, Yang Janet Liu, Diane Litman
long
Refusal in the Tail: Surfacing Latent Abstention for Context-Refuted Queries
130Hansle Lee, Jaeeun Jang, sangmin kim
long
ADR-Control: Do LLM Coding Agents Follow Architectural Decisions? An Evaluation of ADR-Grounded Code Generation
9Pham The Phong, Phan Duy Hung
long
A Multi-Stage Agentic Framework for Effective Counter-Narrative Generation and Refinement
ARR-8Carmel Kronfeld, Sharva Gogawale, Tetsuro Kobayashi, Irad Ben Gal
long
A Multi-Faceted Analytical Framework for Text Quality Evaluation in Creative Open-Ended Generation
163Esteban Garces Arias
long
M$^{2}$Preserve: A Multidimensional Framework for Evaluating Meaning Preservation in Text Simplification
ARR-10Abdullah Barayan, Jose Camacho-Collados, Fernando Alva-Manchego
demo
TruthSplit: Interactive Generation of Multi-Perspective Reasoning Graphs for Contested Claims
81Lion Six, Adrien Zaradez, Thomas Huber, Christina Niklaus
long
Translating Classical Poetry into Modern Prose
40Chalamalasetti Kranti, Sowmya Vajjala
non-archival
Calculation Is Not Insight: Qualitative Reasoning for Data-to-Text Generation
192Kristýna Onderková
non-archival
DBpedia Triple Set Validation for Consistent NLG Inputs
187Mark Andrade, Simon Mille, Anya Belz, Brian Davis
short
Assessing Legal Argumentation in Generated Judgments: A Toulmin-Based Evaluation Framework
75Cor Steging, Tadeusz Zbiegień
long
In Vino Veritas and Vulnerabilities: Examining LLM Safety via Drunk Language Inducement
ARR-11Anudeex Shetty, Aditya Joshi, Salil S. Kanhere
long
Decomposed Entailment for Factuality Checking and Hallucination Detection
33Achir Oukelmoun, Nasredine Semmar, Gaël de Chalendar
demo
CAP: Contrastive Activation Patching for Locating, Comparing, and Steering Neurons in Multilingual LLMs
44Aleksandr Semenikhin
Tuesday 20 October
Main conference
Bedrijfsschool & foyer
Oral session 3
long
Persona as a Dynamical System: Attractor-Based Character Control for Neural Text Generation
87Yu-Yi Chang, HAOCHE CHIU, Hung-Yu Kao
short
A Cognitively Motivated Multidimensional Framework for Evaluating Metaphor Explanations
140Ana Naveriani, Jakob Suchan, Stefano Zoia, Mehul Bhatt, Antonio Lieto, Gian Luca Pozzato
long
Beyond Agreement: Compositional Validity in Multidimensional LLM Evaluation
104Savita Bhat, Vasudeva Varma
long
Controllable Lexical Alignment in Dialogue Systems
123Sumit Srivastava, Mariët Theune, Alejandro Catala
Poster & demo session
non-archival
Dual use issues in the field of Natural Language Generation
169Emiel van Miltenburg
long
Automating Multi-Hop RAG Evaluation via TRIAD: From Context Extraction to Validated Dataset Generation
ARR-13Lorenz Brehme, Adam Jatowt
non-archival
When Seekers Are Hard to Help: Evaluating Emotional Support Dialogue Systems in Worst-Case Interactions
178Jiajie Yang, Yangchun Li, Guanyi Chen, Rui Fan, Xin Bai, Tingting He
long
When More Extractive Summaries Receive Higher Automated Factuality Scores: Evidence from Distilled Scientific Summarization
126Joseph Moretto, Peter A. Beling, Tyler Cody
non-archival
Same Text, More Tokens: Layerwise Attention Distortion under Retokenization
184Baban Gain, Asif Ekbal
long
Large Language Models for Data Augmentation in Product Matching
86Kateřina Macková, Martin Pilát
long
Decoding Path Recovery in Number Generation: Shifting to Intermediate Layers and Top-$k$ Ranks
91Jasivan Alex Sivakumar, Nafise Sadat Moosavi
non-archival
When Wrong Answers Sound Coherent: Evaluating Answer-Conditioned Explanatory Generation in LLMs
181Göktuğ Aslanoğlu, Viswanadh Vadlamani
short
Example-Guided Prompting for Document-Level Text Simplification
34Marina Litvak, Ariel Perstin, Ilan Shtilman, Michael Färber
long
Rate-Resolved Text Evaluation with Masked Diffusion Language Models
ARR-1Yiqi Liu, Kun Zhao, Chenghua Lin, Nafise Sadat Moosavi
short
From Full Game State to Live Commentary: A Data-to-Text Pipeline and Corpus for Age of Empires II
115Siewart van Wingerden
long
Trust Stack for Mental Health AI: A Survey of Calibration across Human, Interaction, and AI Layers
82Xin Sun, Yue Su, Yifan Mo, Qingyu Meng, Yuxuan Li, Min Chen, Mengyuan Zhang, Saku Sugawara, Charlotte Gerritsen, Sander L. Koole, Koen Hindriks, Jiahuan Pei
non-archival
Compliance Assessment and Justification Generation for Journalistic Self-Regulation
183Aleksandra Gabryszak, Danylo Mysak, Shushen Manakhimova, Leonhard Hennig
non-archival
JudgeMoE: Distributional Aggregation for LLM-as-a-Judge
190Yiqi Liu, Joseph James, Yang Wang, Kun Zhao, Chenghao Xiao, Chenghua Lin
non-archival
Expert Disagreement as Signal: Evaluating Clinical NLG Without Reference Reports
186Yongxin Zhou, Fabien Ringeval, François Portet
short
When Diverse Paraphrases Do Not Help: LLM Data Augmentation for Portuguese Aspect-Based Sentiment Analysis
152Andrew Borges de Campos, Gabriel A. Gomes, Larissa Astrogildo de freitas, Ulisses Brisolara Corrêa
long
Do We Really Need So Many Tokens? The Performance-Efficiency Trade-off in Tibetan and Sanskrit
ARR-6Orr Meir Zwebner, Kai Golan Hashiloni, Guy Bilitski, Oded Hellman, Nir Marciano, Shai Fine, Kfir Bar
demo
PLeW-NLG: Interactive Exploration of Human Evaluation Data across NLG Tasks
77Fahime Same, Leonard W Sprague Jr, Francesco Cangemi
Coffee/tea break
Keynote: Marie-Catherine de Marneffe
Lunch
Oral session 4
4 papers
long
Can we use LLMs to generate data-driven patient narratives? A multi-method exploration in the oncology domain
3Nele Albers, Linwei He, Anouk Teunissen, Kelly M. de Ligt, Nadine Bol, Emiel Krahmer
long
A Constraint-Based Formalism for Controlled Text Generation
2Lionel Clément
long
Exploring the feasibility of ontology-based educational question generation with an LLM
137Franco Alberto Cardillo, C. Maria Keet, Zola Mahlaza
long
The Truncation Blind Spot: How Decoding Strategies Systematically Exclude Human-Like Token Choices
146Esteban Garces Arias, Nurzhan Sapargali, Christian Heumann, Matthias Aßenmacher
Keynote: Ehud Reiter
Coffee/tea break
Poster & demo session
long
FJ-Guard: Persistence-Guided Training-Free Defense for LLM-based Multi-Agent Systems
28Yudai Yamazaki, Kentaro Kita, Hiroya Kato, Kento Hasegawa, Seira Hidano
long
One Feedback System Does Not Fit All:Localising Data-to-Text Driver Coaching for the UK and Nigeria
121Iniakpokeikiye Peter Thompson, Jawwad Baig, Ehud Reiter, Dewei Yi
long
InduceGuard : Evaluating Induction Resistance of Large Language Models under Multi-turn Prohibited Keyword Elicitation
143Shunichi Yoneda, Yukitake Yoshioka, Yurai Takayanagi, Yumi Fukuda, Ryoma Obara, Yusuke Sakai, Hidetaka Kamigaito, Katsuhiko Hayashi, Shogo Matsuno
long
Dynamic Intent-Driven API Pruning for Tool Learning in Small Language Models
50Tzu-Hao Wang, Ting-Chun Yang, Sin-Syuan Wu, Yao-Chung Fan
long
Confabulation in a Caption-then-Generate Pipeline: Evaluating Vision–Language Generation of Adolescent Health Information
161Abigail Naa Amankwaa Abeo, Steven Smith, Hannah Goss, Michael Scriney
short
Do LLMs Make More Mistakes If They Do Not Believe the Input Data?
132Peter Kochelka, Aleš Manuel Papáček, Vojtěch Dvořák, Ondrej Dusek
non-archival
Modular Multilingual Language Models with Language-Specific Embeddings
185Nalin Kumar, Ondrej Dusek
short
Distractors for Multiple-choice Questions for Reading Comprehension: Automatic Generation and Evaluation
124Yixi Chen, Shunjie Wang, LI JIAYI, John Sie Yuen Lee
long
Automatic vs. Human Evaluation: Benchmarking 26 Automatic Metrics for Clinical Discharge Summaries
45Yu-Wen Chen, Anne de Hond, Laura Veerhoek, Ruben Peters, Karel GM Moons, Artuur Leeuwenberg
long
Beyond Fine-Tuning: In-Context Learning and Chain-of-Thought for Reasoned Distractor Generation
ARR-12Elaf Alhazmi, Quan Z. Sheng, Wei Emma Zhang
long
A Large-Scale Dataset for Cross-Lingual Multi-Jurisdiction Patent Drafting from Patent Cooperation Treaty Applications
100Trung Phuong Le, Hirofumi Nonaka, Koji Marusaki, Katsuhito Sudoh, Seiya Kawano
long
Hierarchical Experience Memory for Multi-Agent Task Planning and Subtask Guidance
47Marcus Lee
long
Metric Cards Make Blind Spots Legible
24Minh Anh Nguyen, Nils Feldhus
long
Retell, Reward, Repeat: Reinforcement Learning for Narrative Theory-Informed LLM Story Retelling
ARR-4David Y. Liu, Xanthe Muston, Dipankar Srirag, Aditya Joshi, Paul Dawson, Sebastian Sequoiah-Grayson
short
The Impact of Model Size on Detection of LLM Hallucinations
53Matt Boerio, Paul Groth
non-archival
Criterion Definitions, Not Criterion Names, Determine What an LLM Judge Measures
167Srinivas Harish
long
From Tables to Quantified Statements: Evaluating LLM Inference Generation through Executable Verification
23Mai Mohamed Eida, Gunjan Anand, Ayush Singh, Aleksandre Maskharashvili
non-archival
Beyond Single Gold Labels: Human Variability and Conceptualisation in Chinese Classifier Use
179Yongheng Peng, Guanyi Chen, Tingting He
non-archival
BikeCoach: A Demo System for Aspect-based Advice Generation Conditioned on Sport Training Protocols
54Matīss Rikters, Tatsuya Ishigaki, Masayuki Kawarada, Shota Kato, Sohei Washino, HirokiYamaguchi
Wednesday 21 October
Main conference
Bedrijfsschool & foyer
Oral session 5
3 papers
long
A Tale of Two Error Categories: Exploring Concealed Trade-Offs in the Errors of Automated Judges in Evaluation of Uncertainty Quantifiers
127Evgenia Ilia, Wilker Aziz
long
Retrieval-Augmented Generation Must Move Beyond Factual Grounding to Represent Diverse Opinions
14Aditya Agrawal, Alwarappan Nakkiran, Alex Karlsson, Aman Singh Thakur, Harsha Aduri
SIGGEN Business meeting
Coffee/tea break
Keynote: Seraphina Goldfarb-Tarrant
Lunch
Poster & demo session
non-archival
Justify your prompts!
171Eduardo Calò, David M Howcroft, Leo Leppänen, Saad Mahamood, Simon Mille, Patrícia Schmidtová, Emiel van Miltenburg
long
EuroAlpaca: Task-Preserving Localisation of Instruction Data for European Languages
71Aleix Sant, Jordi Luque, Carlos Escolano
long
A Writer–Editor–Critic Pipeline with Deterministic Fact Verification for Football Match Report Generation
147Luís Relvas, Sérgio Nunes, André Restivo
non-archival
A Comparative Evaluation of End-to-End and Pipeline Approaches for Summarisation
150Fahime Same, Saad Mahamood, Srinivas Ramesh Kamath
non-archival
ANVIL: Analogies and Videos for Lecturers
119Yuri Noviello, Anastasiia Birillo, Gosia Migut
long
Generating Critical Questions for Arguments: A Large-Scale Analysis of Prompting and Reranking Strategies
57Midhun Kanadan, Benno Stein
non-archival
Testing Associative Creativity in Humans and Multimodal LLMs with Difficult-to-Name Visual Stimuli
177Manar Ali, Lisa Gottschalk, Simeon Junker, Lisa Hudalla, Alon Fishman, Joana Cholin, Stefan Kopp, Hendrik Buschmeier, Sina Zarrieß
long
Cross-Lingual Activation Steering for Multilingual Language Models
96Rhitabrat Pokharel, Ameeta Agrawal, Tanay Nagar
long
PromptDistill: Query-based Selective Token Retention in Intermediate Layers for Efficient Large Language Model Inference
26Weisheng Jin, Maojia Song, Tej Deep Pala, Yew Ken Chia, Dorien Herremans, Soujanya Poria
long
What Did My Adapter Break? A Generation-Level Evaluation of Adaptation and Retention in PEFT-Adapted LLMs
36Guy Bilitski, Kfir Bar, Shai Fine
long
Towards Green Text Generation: Memory-Based Speculative Decoding
30Antal van den Bosch
long
Chain-of-Thought Faithfulness Under GRPO and DPO Fine-Tuning
79Hadi Mohammadi, Anastasia Giachanou
non-archival
Feedback as an Interface: Controlling Form and Detail in LLM Translation Refinement
189Yiqi Liu, Flavjo Tomori, Nafise Sadat Moosavi, Steffen Eger, Chenghua Lin
non-archival
VetScore: Risk-Weighted Fact Verification for Veterinary Long-Form QA with Citations
175Ivan Kartáč, Jan Tovarys, Mateusz Lango, Ondrej Dusek
long
More Than Rainfall: A Multi-Dimensional Analysis of LLM Flood Cause Multi-document Summarization for Disaster Risk Management
125Jane Arleth dela Cruz, Jarno Van Arkel, Iris Hendrickx, Martha Larson
long
Clarify, Abstain or Answer? Strategising in Conversation with Belief-Augmented Generation
99Joris Baan, Wilker Aziz, Barbara Plank, Raquel Fernández
non-archival
Never Truly Out of Fashion: A Retrospective Look at Evaluation in NLG
172Patrícia Schmidtová, Saad Mahamood, Ondrej Dusek
demo
SeanchlÓCR: A platform for Transformer-based transcription of Irish Gaelic Script
166Sháhín de Faoite Houshidari, Brady Meade, Ellen Rushe