Workshops and the main conference take place in Utrecht from 17 to 21 October 2026.

For the general agenda of a workshop or tutorial day, please visit the Workshops/Tutorials page.

Saturday 17 October

Workshops & Tutorial

Registration and walk-in

Strikkerhuis

YNLG: talks and discussion

All day
Restauratiezaal

AIWolfDial

Wachtkammer 3e Klasse

Industrial NLP

Wachtkammer 3e Klasse

Sunday 18 October

Workshops & Tutorial

Registration and walk-in

Strikkerhuis

YNLG: Hackathon

All day
Restauratiezaal

Tutorial

Wachtkammer 3e Klasse

Alternative architectures

Wachtkammer 3e Klasse

Monday 19 October

Main conference

Bedrijfsschool & foyer

Registration

Brief word of welcome

Oral session 1

  • long Mid-Utterance Transition Control for Audio Commentary Generation 72 Ryota Kawamatsu, Tatsuya Ishigaki, Hiroya Takamura
  • long Token Distribution versus Data Volume: Domain Balancing in Multi-Domain Meeting Summarisation 148 Ashima Sood, Bryan Gardiner, Joan Condell
  • long Identifying Check-Worthy Claims by Generating the Implicit Content of Enthymemes 103 Martial Pastor, Stefan Kok
  • long Confident by Default: A Longitudinal Study of Style Drift and Convergence Across Large Language Model Providers 51 Silas Rech, Tom Bäckström
  • long Do as I Say, Not as You Do: Assessing Public Versus Practitioner Perspectives on the Development of Artificial Intelligence and Language Technologies 64 Tyler Loakman, Chenghua Lin
  • long Can LLM Coding Agents Reason About Time Series? ARR-15 Filip Rechtorík, Ondrej Dusek, Zdeněk Kasner

Coffee, sweets

Keynote: Malvina Nissim

Lunch

Poster & demo session

  • long Language-Agnostic Latent Injection for Multilingual Hybrid Reasoning 128 Đặng Phương Nam, Nguyen Van Hieu, Nguyen Nam Truong, Phan Duy Hung
  • non-archival Reasoning Gets Harder for LLMs Inside A Dialogue 174 Ivan Kartáč, Mateusz Lango, Ondrej Dusek
  • long From Sounds to Symbols: A Survey of Phonetically and Phonologically Informed Language Generation 62 Tyler Loakman, Joseph James, Chenghua Lin
  • short Sleight of Word Benchmark: Can Language Models Notice If Their Own Output Was Tampered With? 37 Alberto Cetoli
  • long Towards Plug-and-Play Attribute Control Modules in Text Generation: An Exploratory Study of LoRA Portability Across Model Families 134 Michela Lorandi, Anya Belz
  • long ACA-Bot: Evaluating Pedagogical Dialogue Generation in a Spoken LLM-Based Oral Examiner 144 Julie Bauer, Krist Shingjergji, Aki Härmä
  • long Pop Quiz! Comparing Educational Assessment Methods for Evaluating Context Utilization vs. Pre-Trained Knowledge in Large Language Models 107 Anura Deshpande, Suvaditya Mukherjee, Benjamin Nye, Ella Park, Russell Harral
  • long Comparing Retrieval-Augmented Generation Pipelines for Energy-Aware Code Refactoring 160 Youssef Oubelmouh, Pierre CHHIENG, Daoudi Amir Salah Eddine
  • long NexusEngine: Ontology-Constrained, Provenance-Grounded, Multi-Modal Generation for Infrastructure Digital Twins 111 Kanimozhi Uma, Merijn Vanalderweireldt
  • short From Metrics to Meaning: Learning Qualitative Research Methods as a Community 120 Adarsa Sivaprasad, Yujun Wang, Mengxuan Sun, David M Howcroft, Ehud Reiter
  • long ViInfoSum: A Novel Dataset for Multimodal Summarization in Vietnamese 19 Nguyen Khoi Tran, Binh Xuan Le, Nghia Hieu Nguyen, Khiem Vinh Tran, Ngan Luu-Thuy Nguyen
  • long Augmenting Lecture Information via Redundancy-Filtered LLM Slide Descriptions for Blind and Low-Vision Students 25 Katharina Anderer, Jan Niehues, Karin Müller, Matthias Wölfel
  • non-archival Preliminary results on predicting bootstrapping NLG resources for low-resourced languages 182 Phuthang Makhupane, Leruo Hillary Sharp, Zola Mahlaza, C. Maria Keet
  • non-archival VISTA: Verification In Sequential Turn-based Assessment 168 Ashley Lewis
  • long Strategies for Span Labeling with Large Language Models ARR-16 Danil Semin, Ondrej Dusek, Zdeněk Kasner
  • long Perspective-Diverse Utterance Candidate Generation via Input Variation for Race Game Commentary 105 Mizuki Arai, Tatsuya Ishigaki, Yusuke Miyao, Hiroya Takamura, Ichiro Kobayashi
  • long Chain-of-Thought Depth Modulates Performance by Task and Model: Evidence from Ablation Studies Across Five Model Families 8 N.ANEESH.DUTT
  • non-archival Ontology-Mediated Framework for Generating Answerable Questions and Feedback from Ontologies 180 Toky Hajatiana Raboanary, C. Maria Keet
  • demo A Tool for Collecting Validated Triple Sets for Data-to-Text Generation 80 Mark Andrade, Simon Mille, Anya Belz, Brian Davis

Oral session 2

  • long Beyond Natural Language Plans: Structure-Aware Agentic Planning for Query-Focused Table Summarization 98 Weijia Zhang, Yifei Yuan, Songgaojun Deng, Evangelos Kanoulas
  • long Probing the Communicative Efficiency of LLMs via Content Selection in Visually Uncommon Reference Games 113 Simeon Junker, Manar Ali, Kristina Kobrock, Larissa Koch, Marika Sarzotti, Hendrik Buschmeier, Sina Zarrieß
  • long Structured Critique Generation Mitigates Toxification in Self-Critique Alignment 70 Takeru Mitsumori, Hiroya Takamura, Takashi Inui
  • long TENOR: Tension-Enhanced Narrative Planning and Organization for Report Generation 108 Aliah Gie Fajardo Zabala, Yi-Shin Chen
  • long Effort and Confidence: Surface Markers in Reasoning Traces Predict Correctness on Insight Puzzles 78 Richard A. J. Mann, Pranava Madhyastha
  • long Are LLM Judges Language-Neutral? A Cross-Lingual Meta-Evaluation on Multilingual Summarization 114 Mohammaderfan koupaei, Amir Esmaeili, Mahshid Khanali, Florian Mai, Patrícia Schmidtová

Coffee/Tea break

Poster & demo session

  • long Graph Mapping and LLMs Thinking Speed 133 Ramazan Ali Bahrami, Ramin Yahyapour
  • long Probing, Measuring and Mitigating Activity-Level Gender Associations in Open-Ended Text Generation 135 Xiangjue Dong, Yibo Wang, Philip S. Yu, James Caverlee
  • short Heterographic Supervision for Direct Speech-to-Text Translation in Scriptless Tribal Languages 112 Prashant Bannulmath, Swapnil Sontakke, Deepak K T
  • non-archival DeScribe: Discourse-Driven Extraction and Structuring of Claim Verification for Better Faithfulness Evaluation 176 Yang Zhong, Yang Janet Liu, Diane Litman
  • long Refusal in the Tail: Surfacing Latent Abstention for Context-Refuted Queries 130 Hansle Lee, Jaeeun Jang, sangmin kim
  • long ADR-Control: Do LLM Coding Agents Follow Architectural Decisions? An Evaluation of ADR-Grounded Code Generation 9 Pham The Phong, Phan Duy Hung
  • long A Multi-Stage Agentic Framework for Effective Counter-Narrative Generation and Refinement ARR-8 Carmel Kronfeld, Sharva Gogawale, Tetsuro Kobayashi, Irad Ben Gal
  • long A Multi-Faceted Analytical Framework for Text Quality Evaluation in Creative Open-Ended Generation 163 Esteban Garces Arias
  • long M$^{2}$Preserve: A Multidimensional Framework for Evaluating Meaning Preservation in Text Simplification ARR-10 Abdullah Barayan, Jose Camacho-Collados, Fernando Alva-Manchego
  • demo TruthSplit: Interactive Generation of Multi-Perspective Reasoning Graphs for Contested Claims 81 Lion Six, Adrien Zaradez, Thomas Huber, Christina Niklaus
  • long Translating Classical Poetry into Modern Prose 40 Chalamalasetti Kranti, Sowmya Vajjala
  • non-archival Calculation Is Not Insight: Qualitative Reasoning for Data-to-Text Generation 192 Kristýna Onderková
  • non-archival DBpedia Triple Set Validation for Consistent NLG Inputs 187 Mark Andrade, Simon Mille, Anya Belz, Brian Davis
  • short Assessing Legal Argumentation in Generated Judgments: A Toulmin-Based Evaluation Framework 75 Cor Steging, Tadeusz Zbiegień
  • non-archival AI-Assisted Length-Constrained Summarization in News Agency Workflows 173 Aleksandra Gabryszak, Damian Jaspar, Shushen Manakhimova, Leonhard Hennig
  • non-archival Knowledge Graph Prompting for Multi-hop Reasoning 89 Al Hasib Mahamud, Yllias Chali
  • long In Vino Veritas and Vulnerabilities: Examining LLM Safety via Drunk Language Inducement ARR-11 Anudeex Shetty, Aditya Joshi, Salil S. Kanhere
  • long Decomposed Entailment for Factuality Checking and Hallucination Detection 33 Achir Oukelmoun, Nasredine Semmar, Gaël de Chalendar
  • demo CAP: Contrastive Activation Patching for Locating, Comparing, and Steering Neurons in Multilingual LLMs 44 Aleksandr Semenikhin

Tuesday 20 October

Main conference

Bedrijfsschool & foyer

Oral session 3

  • long Persona as a Dynamical System: Attractor-Based Character Control for Neural Text Generation 87 Yu-Yi Chang, HAOCHE CHIU, Hung-Yu Kao
  • short A Cognitively Motivated Multidimensional Framework for Evaluating Metaphor Explanations 140 Ana Naveriani, Jakob Suchan, Stefano Zoia, Mehul Bhatt, Antonio Lieto, Gian Luca Pozzato
  • long Beyond Agreement: Compositional Validity in Multidimensional LLM Evaluation 104 Savita Bhat, Vasudeva Varma
  • long Controllable Lexical Alignment in Dialogue Systems 123 Sumit Srivastava, Mariët Theune, Alejandro Catala

Poster & demo session

  • non-archival Dual use issues in the field of Natural Language Generation 169 Emiel van Miltenburg
  • long Automating Multi-Hop RAG Evaluation via TRIAD: From Context Extraction to Validated Dataset Generation ARR-13 Lorenz Brehme, Adam Jatowt
  • non-archival When Seekers Are Hard to Help: Evaluating Emotional Support Dialogue Systems in Worst-Case Interactions 178 Jiajie Yang, Yangchun Li, Guanyi Chen, Rui Fan, Xin Bai, Tingting He
  • long When More Extractive Summaries Receive Higher Automated Factuality Scores: Evidence from Distilled Scientific Summarization 126 Joseph Moretto, Peter A. Beling, Tyler Cody
  • non-archival Same Text, More Tokens: Layerwise Attention Distortion under Retokenization 184 Baban Gain, Asif Ekbal
  • long Large Language Models for Data Augmentation in Product Matching 86 Kateřina Macková, Martin Pilát
  • long Decoding Path Recovery in Number Generation: Shifting to Intermediate Layers and Top-$k$ Ranks 91 Jasivan Alex Sivakumar, Nafise Sadat Moosavi
  • non-archival When Wrong Answers Sound Coherent: Evaluating Answer-Conditioned Explanatory Generation in LLMs 181 Göktuğ Aslanoğlu, Viswanadh Vadlamani
  • short Example-Guided Prompting for Document-Level Text Simplification 34 Marina Litvak, Ariel Perstin, Ilan Shtilman, Michael Färber
  • long Rate-Resolved Text Evaluation with Masked Diffusion Language Models ARR-1 Yiqi Liu, Kun Zhao, Chenghua Lin, Nafise Sadat Moosavi
  • short From Full Game State to Live Commentary: A Data-to-Text Pipeline and Corpus for Age of Empires II 115 Siewart van Wingerden
  • long Trust Stack for Mental Health AI: A Survey of Calibration across Human, Interaction, and AI Layers 82 Xin Sun, Yue Su, Yifan Mo, Qingyu Meng, Yuxuan Li, Min Chen, Mengyuan Zhang, Saku Sugawara, Charlotte Gerritsen, Sander L. Koole, Koen Hindriks, Jiahuan Pei
  • non-archival Compliance Assessment and Justification Generation for Journalistic Self-Regulation 183 Aleksandra Gabryszak, Danylo Mysak, Shushen Manakhimova, Leonhard Hennig
  • non-archival Stress Testing NLG Evaluation Metrics with Fine-Grained Semantic Contrasts 191 Lasha Abzianidze
  • non-archival JudgeMoE: Distributional Aggregation for LLM-as-a-Judge 190 Yiqi Liu, Joseph James, Yang Wang, Kun Zhao, Chenghao Xiao, Chenghua Lin
  • non-archival Expert Disagreement as Signal: Evaluating Clinical NLG Without Reference Reports 186 Yongxin Zhou, Fabien Ringeval, François Portet
  • short When Diverse Paraphrases Do Not Help: LLM Data Augmentation for Portuguese Aspect-Based Sentiment Analysis 152 Andrew Borges de Campos, Gabriel A. Gomes, Larissa Astrogildo de freitas, Ulisses Brisolara Corrêa
  • long Do We Really Need So Many Tokens? The Performance-Efficiency Trade-off in Tibetan and Sanskrit ARR-6 Orr Meir Zwebner, Kai Golan Hashiloni, Guy Bilitski, Oded Hellman, Nir Marciano, Shai Fine, Kfir Bar
  • demo PLeW-NLG: Interactive Exploration of Human Evaluation Data across NLG Tasks 77 Fahime Same, Leonard W Sprague Jr, Francesco Cangemi

Coffee/tea break

Keynote: Marie-Catherine de Marneffe

Lunch

Oral session 4

4 papers
  • long Can we use LLMs to generate data-driven patient narratives? A multi-method exploration in the oncology domain 3 Nele Albers, Linwei He, Anouk Teunissen, Kelly M. de Ligt, Nadine Bol, Emiel Krahmer
  • long A Constraint-Based Formalism for Controlled Text Generation 2 Lionel Clément
  • long Exploring the feasibility of ontology-based educational question generation with an LLM 137 Franco Alberto Cardillo, C. Maria Keet, Zola Mahlaza
  • long The Truncation Blind Spot: How Decoding Strategies Systematically Exclude Human-Like Token Choices 146 Esteban Garces Arias, Nurzhan Sapargali, Christian Heumann, Matthias Aßenmacher

Keynote: Ehud Reiter

Coffee/tea break

Poster & demo session

  • long FJ-Guard: Persistence-Guided Training-Free Defense for LLM-based Multi-Agent Systems 28 Yudai Yamazaki, Kentaro Kita, Hiroya Kato, Kento Hasegawa, Seira Hidano
  • long One Feedback System Does Not Fit All:Localising Data-to-Text Driver Coaching for the UK and Nigeria 121 Iniakpokeikiye Peter Thompson, Jawwad Baig, Ehud Reiter, Dewei Yi
  • long InduceGuard : Evaluating Induction Resistance of Large Language Models under Multi-turn Prohibited Keyword Elicitation 143 Shunichi Yoneda, Yukitake Yoshioka, Yurai Takayanagi, Yumi Fukuda, Ryoma Obara, Yusuke Sakai, Hidetaka Kamigaito, Katsuhiko Hayashi, Shogo Matsuno
  • long Dynamic Intent-Driven API Pruning for Tool Learning in Small Language Models 50 Tzu-Hao Wang, Ting-Chun Yang, Sin-Syuan Wu, Yao-Chung Fan
  • long Confabulation in a Caption-then-Generate Pipeline: Evaluating Vision–Language Generation of Adolescent Health Information 161 Abigail Naa Amankwaa Abeo, Steven Smith, Hannah Goss, Michael Scriney
  • short Do LLMs Make More Mistakes If They Do Not Believe the Input Data? 132 Peter Kochelka, Aleš Manuel Papáček, Vojtěch Dvořák, Ondrej Dusek
  • non-archival Modular Multilingual Language Models with Language-Specific Embeddings 185 Nalin Kumar, Ondrej Dusek
  • short Distractors for Multiple-choice Questions for Reading Comprehension: Automatic Generation and Evaluation 124 Yixi Chen, Shunjie Wang, LI JIAYI, John Sie Yuen Lee
  • long Automatic vs. Human Evaluation: Benchmarking 26 Automatic Metrics for Clinical Discharge Summaries 45 Yu-Wen Chen, Anne de Hond, Laura Veerhoek, Ruben Peters, Karel GM Moons, Artuur Leeuwenberg
  • long Beyond Fine-Tuning: In-Context Learning and Chain-of-Thought for Reasoned Distractor Generation ARR-12 Elaf Alhazmi, Quan Z. Sheng, Wei Emma Zhang
  • long A Large-Scale Dataset for Cross-Lingual Multi-Jurisdiction Patent Drafting from Patent Cooperation Treaty Applications 100 Trung Phuong Le, Hirofumi Nonaka, Koji Marusaki, Katsuhito Sudoh, Seiya Kawano
  • long Hierarchical Experience Memory for Multi-Agent Task Planning and Subtask Guidance 47 Marcus Lee
  • long Metric Cards Make Blind Spots Legible 24 Minh Anh Nguyen, Nils Feldhus
  • long Retell, Reward, Repeat: Reinforcement Learning for Narrative Theory-Informed LLM Story Retelling ARR-4 David Y. Liu, Xanthe Muston, Dipankar Srirag, Aditya Joshi, Paul Dawson, Sebastian Sequoiah-Grayson
  • short The Impact of Model Size on Detection of LLM Hallucinations 53 Matt Boerio, Paul Groth
  • non-archival Criterion Definitions, Not Criterion Names, Determine What an LLM Judge Measures 167 Srinivas Harish
  • long From Tables to Quantified Statements: Evaluating LLM Inference Generation through Executable Verification 23 Mai Mohamed Eida, Gunjan Anand, Ayush Singh, Aleksandre Maskharashvili
  • non-archival Beyond Single Gold Labels: Human Variability and Conceptualisation in Chinese Classifier Use 179 Yongheng Peng, Guanyi Chen, Tingting He
  • non-archival BikeCoach: A Demo System for Aspect-based Advice Generation Conditioned on Sport Training Protocols 54 Matīss Rikters, Tatsuya Ishigaki, Masayuki Kawarada, Shota Kato, Sohei Washino, HirokiYamaguchi

Wednesday 21 October

Main conference

Bedrijfsschool & foyer

Oral session 5

3 papers
  • long A Tale of Two Error Categories: Exploring Concealed Trade-Offs in the Errors of Automated Judges in Evaluation of Uncertainty Quantifiers 127 Evgenia Ilia, Wilker Aziz
  • long Retrieval-Augmented Generation Must Move Beyond Factual Grounding to Represent Diverse Opinions 14 Aditya Agrawal, Alwarappan Nakkiran, Alex Karlsson, Aman Singh Thakur, Harsha Aduri

SIGGEN Business meeting

Coffee/tea break

Keynote: Seraphina Goldfarb-Tarrant

Lunch

Poster & demo session

  • non-archival Justify your prompts! 171 Eduardo Calò, David M Howcroft, Leo Leppänen, Saad Mahamood, Simon Mille, Patrícia Schmidtová, Emiel van Miltenburg
  • long EuroAlpaca: Task-Preserving Localisation of Instruction Data for European Languages 71 Aleix Sant, Jordi Luque, Carlos Escolano
  • long A Writer–Editor–Critic Pipeline with Deterministic Fact Verification for Football Match Report Generation 147 Luís Relvas, Sérgio Nunes, André Restivo
  • non-archival A Comparative Evaluation of End-to-End and Pipeline Approaches for Summarisation 150 Fahime Same, Saad Mahamood, Srinivas Ramesh Kamath
  • non-archival ANVIL: Analogies and Videos for Lecturers 119 Yuri Noviello, Anastasiia Birillo, Gosia Migut
  • long Generating Critical Questions for Arguments: A Large-Scale Analysis of Prompting and Reranking Strategies 57 Midhun Kanadan, Benno Stein
  • non-archival Testing Associative Creativity in Humans and Multimodal LLMs with Difficult-to-Name Visual Stimuli 177 Manar Ali, Lisa Gottschalk, Simeon Junker, Lisa Hudalla, Alon Fishman, Joana Cholin, Stefan Kopp, Hendrik Buschmeier, Sina Zarrieß
  • long Cross-Lingual Activation Steering for Multilingual Language Models 96 Rhitabrat Pokharel, Ameeta Agrawal, Tanay Nagar
  • long PromptDistill: Query-based Selective Token Retention in Intermediate Layers for Efficient Large Language Model Inference 26 Weisheng Jin, Maojia Song, Tej Deep Pala, Yew Ken Chia, Dorien Herremans, Soujanya Poria
  • long What Did My Adapter Break? A Generation-Level Evaluation of Adaptation and Retention in PEFT-Adapted LLMs 36 Guy Bilitski, Kfir Bar, Shai Fine
  • long Towards Green Text Generation: Memory-Based Speculative Decoding 30 Antal van den Bosch
  • long Chain-of-Thought Faithfulness Under GRPO and DPO Fine-Tuning 79 Hadi Mohammadi, Anastasia Giachanou
  • non-archival Feedback as an Interface: Controlling Form and Detail in LLM Translation Refinement 189 Yiqi Liu, Flavjo Tomori, Nafise Sadat Moosavi, Steffen Eger, Chenghua Lin
  • non-archival VetScore: Risk-Weighted Fact Verification for Veterinary Long-Form QA with Citations 175 Ivan Kartáč, Jan Tovarys, Mateusz Lango, Ondrej Dusek
  • long More Than Rainfall: A Multi-Dimensional Analysis of LLM Flood Cause Multi-document Summarization for Disaster Risk Management 125 Jane Arleth dela Cruz, Jarno Van Arkel, Iris Hendrickx, Martha Larson
  • long Clarify, Abstain or Answer? Strategising in Conversation with Belief-Augmented Generation 99 Joris Baan, Wilker Aziz, Barbara Plank, Raquel Fernández
  • non-archival Never Truly Out of Fashion: A Retrospective Look at Evaluation in NLG 172 Patrícia Schmidtová, Saad Mahamood, Ondrej Dusek
  • demo SeanchlÓCR: A platform for Transformer-based transcription of Irish Gaelic Script 166 Sháhín de Faoite Houshidari, Brady Meade, Ellen Rushe

Generation Challenges (GenChal) session

Coffee break

Poster & demo session

Closing ceremony