Accepted Papers

Long papers

  • A Constraint-Based Formalism for Controlled Text Generation
    Lionel Clément
  • Can we use LLMs to generate data-driven patient narratives? A multi-method exploration in the oncology domain
    Nele Albers, Linwei He, Anouk Teunissen, Kelly M. de Ligt, Nadine Bol, Emiel Krahmer
  • Chain-of-Thought Depth Modulates Performance by Task and Model: Evidence from Ablation Studies Across Five Model Families
    N.ANEESH.DUTT
  • ADR-Control: Do LLM Coding Agents Follow Architectural Decisions? An Evaluation of ADR-Grounded Code Generation
    Pham The Phong, Phan Duy Hung
  • Not All Linguistic Capabilities Degrade Equally Under Quantization
    Arunabh Majumdar
  • Retrieval-Augmented Generation Must Move Beyond Factual Grounding to Represent Diverse Opinions
    Aditya Agrawal, Alwarappan Nakkiran, Alex Karlsson, Aman Singh Thakur, Harsha Aduri
  • ViInfoSum: A Novel Dataset for Multimodal Summarization in Vietnamese
    Nguyen Khoi Tran, Binh Xuan Le, Nghia Hieu Nguyen, Khiem Vinh Tran, Ngan Luu-Thuy Nguyen
  • From Tables to Quantified Statements: Evaluating LLM Inference Generation through Executable Verification
    Mai Mohamed Eida, Gunjan Anand, Ayush Singh, Aleksandre Maskharashvili
  • Metric Cards Make Blind Spots Legible
    Minh Anh Nguyen, Nils Feldhus
  • Augmenting Lecture Information via Redundancy-Filtered LLM Slide Descriptions for Blind and Low-Vision Students
    Katharina Anderer, Jan Niehues, Karin Müller, Matthias Wölfel
  • PromptDistill: Query-based Selective Token Retention in Intermediate Layers for Efficient Large Language Model Inference
    Weisheng Jin, Maojia Song, Tej Deep Pala, Yew Ken Chia, Dorien Herremans, Soujanya Poria
  • FJ-Guard: Persistence-Guided Training-Free Defense for LLM-based Multi-Agent Systems
    Yudai Yamazaki, Kentaro Kita, Hiroya Kato, Kento Hasegawa, Seira Hidano
  • CAAF: Confidence and Agreement-Aware Fusion for Multi-LLM Ensembles
    Momojit Biswas, Preethu Rose Anish
  • Towards Green Text Generation: Memory-Based Speculative Decoding
    Antal van den Bosch
  • Decomposed Entailment for Factuality Checking and Hallucination Detection
    Achir Oukelmoun, Nasredine Semmar, Gaël de Chalendar
  • What Did My Adapter Break? A Generation-Level Evaluation of Adaptation and Retention in PEFT-Adapted LLMs
    Guy Bilitski, Kfir Bar, Shai Fine
  • Translating Classical Poetry into Modern Prose
    Chalamalasetti Kranti, Sowmya Vajjala
  • Self-Verification is All You Need To Pass The Japanese Bar Examination
    Andrew Shin
  • Automatic vs. Human Evaluation: Benchmarking 26 Automatic Metrics for Clinical Discharge Summaries
    Yu-Wen Chen, Anne de Hond, Laura Veerhoek, Ruben Peters, Karel GM Moons, Artuur Leeuwenberg
  • Hierarchical Experience Memory for Multi-Agent Task Planning and Subtask Guidance
    Marcus Lee
  • Dynamic Intent-Driven API Pruning for Tool Learning in Small Language Models
    Tzu-Hao Wang, Ting-Chun Yang, Sin-Syuan Wu, Yao-Chung Fan
  • Confident by Default: A Longitudinal Study of Style Drift and Convergence Across Large Language Model Providers
    Silas Rech, Tom Bäckström
  • Generating Critical Questions for Arguments: A Large-Scale Analysis of Prompting and Reranking Strategies
    Midhun Kanadan, Benno Stein
  • From Sounds to Symbols: A Survey of Phonetically and Phonologically Informed Language Generation
    Tyler Loakman, Joseph James, Chenghua Lin
  • Do as I Say, Not as You Do: Assessing Public Versus Practitioner Perspectives on the Development of Artificial Intelligence and Language Technologies
    Tyler Loakman, Chenghua Lin
  • Structured Critique Generation Mitigates Toxification in Self-Critique Alignment
    Takeru Mitsumori, Hiroya Takamura, Takashi Inui
  • EuroAlpaca: Task-Preserving Localisation of Instruction Data for European Languages
    Aleix Sant, Jordi Luque, Carlos Escolano
  • Mid-Utterance Transition Control for Audio Commentary Generation
    Ryota Kawamatsu, Tatsuya Ishigaki, Hiroya Takamura
  • Effort and Confidence: Surface Markers in Reasoning Traces Predict Correctness on Insight Puzzles
    Richard A. J. Mann, Pranava Madhyastha
  • Chain-of-Thought Faithfulness Under GRPO and DPO Fine-Tuning
    Hadi Mohammadi, Anastasia Giachanou
  • Trust Stack for Mental Health AI: A Survey of Calibration across Human, Interaction, and AI Layers
    Xin Sun, Yue Su, Yifan Mo, Qingyu Meng, Yuxuan Li, Min Chen, Mengyuan Zhang, Saku Sugawara, Charlotte Gerritsen, Sander L. Koole, Koen Hindriks, Jiahuan Pei
  • Large Language Models for Data Augmentation in Product Matching
    Kateřina Macková, Martin Pilát
  • Persona as a Dynamical System: Attractor-Based Character Control for Neural Text Generation
    Yu-Yi Chang, HAOCHE CHIU, Hung-Yu Kao
  • Content Determination Is the Faithfulness Bottleneck: A Computable-Oracle Benchmark for Faithful LLM Explanations of Guardrail Decisions
    Arunkumar V
  • Decoding Path Recovery in Number Generation: Shifting to Intermediate Layers and Top-$k$ Ranks
    Jasivan Alex Sivakumar, Nafise Sadat Moosavi
  • Cross-Lingual Activation Steering for Multilingual Language Models
    Rhitabrat Pokharel, Ameeta Agrawal, Tanay Nagar
  • Beyond Natural Language Plans: Structure-Aware Agentic Planning for Query-Focused Table Summarization
    Weijia Zhang, Yifei Yuan, Songgaojun Deng, Evangelos Kanoulas
  • Clarify, Abstain or Answer? Strategising in Conversation with Belief-Augmented Generation
    Joris Baan, Wilker Aziz, Barbara Plank, Raquel Fernández
  • A Large-Scale Dataset for Cross-Lingual Multi-Jurisdiction Patent Drafting from Patent Cooperation Treaty Applications
    Trung Phuong Le, Hirofumi Nonaka, Koji Marusaki, Katsuhito Sudoh, Seiya Kawano
  • Identifying Check-Worthy Claims by Generating the Implicit Content of Enthymemes
    Martial Pastor, Stefan Kok
  • Beyond Agreement: Compositional Validity in Multidimensional LLM Evaluation
    Savita Bhat, Vasudeva Varma
  • Perspective-Diverse Utterance Candidate Generation via Input Variation for Race Game Commentary
    Mizuki Arai, Tatsuya Ishigaki, Yusuke Miyao, Hiroya Takamura, Ichiro Kobayashi
  • Revealing Current Performance of LLMs in Multi-Agent and Long Logical Context by Automatically Playing the Werewolf Game As a Contest
    Yoshinobu Kano, Yuya Harada, Yuto Sahashi, Daisuke Katagami, Kei Harada, Michimasa Inaba, Takeshi Ito, Hirotaka Osawa, Takashi OTSUKI, FUJIO TORIUMI
  • Pop Quiz! Comparing Educational Assessment Methods for Evaluating Context Utilization vs. Pre-Trained Knowledge in Large Language Models
    Anura Deshpande, Suvaditya Mukherjee, Benjamin Nye, Ella Park, Russell Harral
  • TENOR: Tension-Enhanced Narrative Planning and Organization for Report Generation
    Aliah Gie Fajardo Zabala, Yi-Shin Chen
  • NexusEngine: Ontology-Constrained, Provenance-Grounded, Multi-Modal Generation for Infrastructure Digital Twins
    Kanimozhi Uma, Merijn Vanalderweireldt
  • Probing the Communicative Efficiency of LLMs via Content Selection in Visually Uncommon Reference Games
    Simeon Junker, Manar Ali, Kristina Kobrock, Larissa Koch, Marika Sarzotti, Hendrik Buschmeier, Sina Zarrieß
  • Are LLM Judges Language-Neutral? A Cross-Lingual Meta-Evaluation on Multilingual Summarization
    Mohammaderfan Koupaei, Amir Esmaeili, Mahshid Khanali, Florian Mai, Patrícia Schmidtová
  • One Feedback System Does Not Fit All:Localising Data-to-Text Driver Coaching for the UK and Nigeria
    Iniakpokeikiye Peter Thompson, Jawwad Baig, Ehud Reiter, Dewei Yi
  • Controllable Lexical Alignment in Dialogue Systems
    Sumit Srivastava, Mariët Theune, Alejandro Catala
  • More Than Rainfall: A Multi-Dimensional Analysis of LLM Flood Cause Multi-document Summarization for Disaster Risk Management
    Jane Arleth dela Cruz, Jarno Van Arkel, Iris Hendrickx, Martha Larson
  • When More Extractive Summaries Receive Higher Automated Factuality Scores: Evidence from Distilled Scientific Summarization
    Joseph Moretto, Peter A. Beling, Tyler Cody
  • A Tale of Two Error Categories: Exploring Concealed Trade-Offs in the Errors of Automated Judges in Evaluation of Uncertainty Quantifiers
    Evgenia Ilia, Wilker Aziz
  • Language-Agnostic Latent Injection for Multilingual Hybrid Reasoning
    Đặng Phương Nam, Nguyen Van Hieu, Nguyen Nam Truong, Phan Duy Hung
  • Refusal in the Tail: Surfacing Latent Abstention for Context-Refuted Queries
    Hansle Lee, Jaeeun Jang, sangmin kim
  • Graph Mapping and LLMs Thinking Speed
    Ramazan Ali Bahrami, Ramin Yahyapour
  • Towards Plug-and-Play Attribute Control Modules in Text Generation: An Exploratory Study of LoRA Portability Across Model Families
    Michela Lorandi, Anya Belz
  • Probing, Measuring and Mitigating Activity-Level Gender Associations in Open-Ended Text Generation
    Xiangjue Dong, Yibo Wang, Philip S. Yu, James Caverlee
  • Exploring the feasibility of ontology-based educational question generation with an LLM
    Franco Alberto Cardillo, C. Maria Keet, Zola Mahlaza
  • AdTEx: Evaluating Large Language Models for Diverse Advertisement Template Expansion
    Hiroto Otake, Peinan Zhang, Yusuke Sakai, Hiroki Ouchi, Taro Watanabe
  • InduceGuard : Evaluating Induction Resistance of Large Language Models under Multi-turn Prohibited Keyword Elicitation
    Shunichi Yoneda, Yukitake Yoshioka, Yurai Takayanagi, Yumi Fukuda, Ryoma Obara, Yusuke Sakai, Hidetaka Kamigaito, Katsuhiko Hayashi, Shogo Matsuno
  • ACA-Bot: Evaluating Pedagogical Dialogue Generation in a Spoken LLM-Based Oral Examiner
    Julie Bauer, Krist Shingjergji, Aki Härmä
  • The Truncation Blind Spot: How Decoding Strategies Systematically Exclude Human-Like Token Choices
    Esteban Garces Arias, Nurzhan Sapargali, Christian Heumann, Matthias Aßenmacher
  • A Writer–Editor–Critic Pipeline with Deterministic Fact Verification for Football Match Report Generation
    Luís Relvas, Sérgio Nunes, André Restivo
  • Token Distribution versus Data Volume: Domain Balancing in Multi-Domain Meeting Summarisation
    Ashima Sood, Bryan Gardiner, Joan Condell
  • Frugal Source-Grounded Detection of Graded Omissions in LLM-Generated French Medical Summaries
    Benouaklil Hodhaifa, Nasredine Semmar, Achir Oukelmoun, Faiza BELBACHIR, Jaafer klila, Hassane Essafi
  • Comparing Retrieval-Augmented Generation Pipelines for Energy-Aware Code Refactoring
    Youssef Oubelmouh, Pierre CHHIENG, Daoudi Amir Salah Eddine
  • Confabulation in a Caption-then-Generate Pipeline: Evaluating Vision–Language Generation of Adolescent Health Information
    Abigail Naa Amankwaa Abeo, Steven Smith, Hannah Goss, Michael Scriney
  • A Multi-Faceted Analytical Framework for Text Quality Evaluation in Creative Open-Ended Generation
    Esteban Garces Arias
  • Rate-Resolved Text Evaluation with Masked Diffusion Language Models
    Yiqi Liu, Kun Zhao, Chenghua Lin, Nafise Sadat Moosavi
  • Feedback as an Interface: Controlling Form and Detail in LLM Translation Refinement
    Yiqi Liu, Flavjo Tomori, Nafise Sadat Moosavi, Steffen Eger, Chenghua Lin
  • JudgeMoE: Distributional Aggregation for LLM-as-a-Judge
    Yiqi Liu, Joseph James, Yang Wang, Kun Zhao, Chenghao Xiao, Chenghua Lin
  • Retell, Reward, Repeat: Reinforcement Learning for Narrative Theory-Informed LLM Story Retelling
    David Y. Liu, Xanthe Muston, Dipankar Srirag, Aditya Joshi, Paul Dawson, Sebastian Sequoiah-Grayson
  • Do We Really Need So Many Tokens? The Performance-Efficiency Trade-off in Tibetan and Sanskrit
    Orr Meir Zwebner, Kai Golan Hashiloni, Guy Bilitski, Oded Hellman, Nir Marciano, Shai Fine, Kfir Bar
  • A Multi-Stage Agentic Framework for Effective Counter-Narrative Generation and Refinement
    Carmel Kronfeld, Sharva Gogawale, Tetsuro Kobayashi, Irad Ben Gal
  • CAI-DLLM: Convergence Aware Inference for Diffusion Language Models
    Farhana Amin, Sabiha Afroz, Dimitrios S. Nikolopoulos
  • M$^{2}$Preserve: A Multidimensional Framework for Evaluating Meaning Preservation in Text Simplification
    Abdullah Barayan, Jose Camacho-Collados, Fernando Alva-Manchego
  • In Vino Veritas and Vulnerabilities: Examining LLM Safety via Drunk Language Inducement
    Anudeex Shetty, Aditya Joshi, Salil S. Kanhere
  • Beyond Fine-Tuning: In-Context Learning and Chain-of-Thought for Reasoned Distractor Generation
    Elaf Alhazmi, Quan Z. Sheng, Wei Emma Zhang
  • Automating Multi-Hop RAG Evaluation via TRIAD: From Context Extraction to Validated Dataset Generation
    Lorenz Brehme, Adam Jatowt
  • Can LLM Coding Agents Reason About Time Series?
    Filip Rechtorík, Ondrej Dusek, Zdeněk Kasner
  • Strategies for Span Labeling with Large Language Models
    Danil Semin, Ondrej Dusek, Zdeněk Kasner

Short papers

  • You Can't Prefer Emotions You Don't Sample: Intensity Undershoot in DPO-Tuned LLMs
    Hyunwoo Kim, Usama Khalid
  • Example-Guided Prompting for Document-Level Text Simplification
    Marina Litvak, Ariel Perstin, Ilan Shtilman, Michael Färber
  • Sleight of Word Benchmark: Can Language Models Notice If Their Own Output Was Tampered With?
    Alberto Cetoli
  • The Impact of Model Size on Detection of LLM Hallucinations
    Matt Boerio, Paul Groth
  • Assessing Legal Argumentation in Generated Judgments: A Toulmin-Based Evaluation Framework
    Cor Steging, Tadeusz Zbiegień
  • Heterographic Supervision for Direct Speech-to-Text Translation in Scriptless Tribal Languages
    Prashant Bannulmath, Swapnil Sontakke, Deepak K T
  • From Full Game State to Live Commentary: A Data-to-Text Pipeline and Corpus for Age of Empires II
    Siewart van Wingerden
  • From Metrics to Meaning: Learning Qualitative Research Methods as a Community
    Adarsa Sivaprasad, Yujun Wang, Mengxuan Sun, David M Howcroft, Ehud Reiter
  • Distractors for Multiple-choice Questions for Reading Comprehension: Automatic Generation and Evaluation
    Yixi Chen, Shunjie Wang, LI JIAYI, John Sie Yuen Lee
  • Do LLMs Make More Mistakes If They Do Not Believe the Input Data?
    Peter Kochelka, Aleš Manuel Papáček, Vojtěch Dvořák, Ondrej Dusek
  • A Cognitively Motivated Multidimensional Framework for Evaluating Metaphor Explanations
    Ana Naveriani, Jakob Suchan, Stefano Zoia, Mehul Bhatt, Antonio Lieto, Gian Luca Pozzato
  • When Diverse Paraphrases Do Not Help: LLM Data Augmentation for Portuguese Aspect-Based Sentiment Analysis
    Andrew Borges de Campos, Gabriel A. Gomes, Larissa Astrogildo de freitas, Ulisses Brisolara Corrêa
  • Evaluating Rationale-Grounded Responses for Meme Images via Self-Scoring-Based Selection
    Ryotaro Kanae, Yusuke Sakai, Hidetaka Kamigaito, Taro Watanabe

Demo papers

  • CAP: Contrastive Activation Patching for Locating, Comparing, and Steering Neurons in Multilingual LLMs
    Aleksandr Semenikhin
  • PLeW-NLG: Interactive Exploration of Human Evaluation Data across NLG Tasks
    Fahime Same, Leonard W Sprague Jr, Francesco Cangemi
  • A Tool for Collecting Validated Triple Sets for Data-to-Text Generation
    Mark Andrade, Simon Mille, Anya Belz, Brian Davis
  • TruthSplit: Interactive Generation of Multi-Perspective Reasoning Graphs for Contested Claims
    Lion Six, Adrien Zaradez, Thomas Huber, Christina Niklaus
  • SeanchlÓCR: A platform for Transformer-based transcription of Irish Gaelic Script
    Sháhín de Faoite Houshidari, Brady Meade, Ellen Rushe

Non-Archival submissions

Note: Presented during the INLG poster sessions and not included in the proceedings.

  • BikeCoach: A Demo System for Aspect-based Advice Generation Conditioned on Sport Training Protocols
    Matīss Rikters, Tatsuya Ishigaki, Masayuki Kawarada, Shota Kato, Sohei Washino, HirokiYamaguchi
  • Knowledge-Grounded Generation and Agentic Verification for Describing Swine Health Status from Farm Images
    Eunji Lee, Minseok Kim, Parkhyungwook
  • Knowledge Graph Prompting for Multi-hop Reasoning
    Al Hasib Mahamud, Yllias Chali
  • ANVIL: Analogies and Videos for Lecturers
    Yuri Noviello, Anastasiia Birillo, Gosia Migut
  • A Comparative Evaluation of End-to-End and Pipeline Approaches for Summarisation
    Fahime Same, Saad Mahamood, Srinivas Ramesh Kamath
  • Criterion Definitions, Not Criterion Names, Determine What an LLM Judge Measures
    Srinivas Harish
  • VISTA: Verification In Sequential Turn-based Assessment
    Ashley Lewis
  • Dual use issues in the field of Natural Language Generation
    Emiel van Miltenburg
  • Justify your prompts!
    Eduardo Calò, David M Howcroft, Leo Leppänen, Saad Mahamood, Simon Mille, Patrícia Schmidtová, Emiel van Miltenburg
  • Never Truly Out of Fashion: A Retrospective Look at Evaluation in NLG
    Patrícia Schmidtová, Saad Mahamood, Ondrej Dusek
  • AI-Assisted Length-Constrained Summarization in News Agency Workflows
    Aleksandra Gabryszak, Damian Jaspar, Shushen Manakhimova, Leonhard Hennig
  • Reasoning Gets Harder for LLMs Inside A Dialogue
    Ivan Kartáč, Mateusz Lango, Ondrej Dusek
  • VetScore: Risk-Weighted Fact Verification for Veterinary Long-Form QA with Citations
    Ivan Kartáč, Jan Tovarys, Mateusz Lango, Ondrej Dusek
  • DeScribe: Discourse-Driven Extraction and Structuring of Claim Verification for Better Faithfulness Evaluation
    Yang Zhong, Yang Janet Liu, Diane Litman
  • Testing Associative Creativity in Humans and Multimodal LLMs with Difficult-to-Name Visual Stimuli
    Manar Ali, Lisa Gottschalk, Simeon Junker, Lisa Hudalla, Alon Fishman, Joana Cholin, Stefan Kopp, Hendrik Buschmeier, Sina Zarrieß
  • When Seekers Are Hard to Help: Evaluating Emotional Support Dialogue Systems in Worst-Case Interactions
    Jiajie Yang, Yangchun Li, Guanyi Chen, Rui Fan, Xin Bai, Tingting He
  • Beyond Single Gold Labels: Human Variability and Conceptualisation in Chinese Classifier Use
    Yongheng Peng, Guanyi Chen, Tingting He
  • Ontology-Mediated Framework for Generating Answerable Questions and Feedback from Ontologies
    Toky Hajatiana Raboanary, C. Maria Keet
  • When Wrong Answers Sound Coherent: Evaluating Answer-Conditioned Explanatory Generation in LLMs
    Göktuğ Aslanoğlu, Viswanadh Vadlamani
  • Preliminary results on predicting bootstrapping NLG resources for low-resourced languages
    Phuthang Makhupane, Leruo Hillary Sharp, Zola Mahlaza, C. Maria Keet
  • Compliance Assessment and Justification Generation for Journalistic Self-Regulation
    Aleksandra Gabryszak, Danylo Mysak, Shushen Manakhimova, Leonhard Hennig
  • Same Text, More Tokens: Layerwise Attention Distortion under Retokenization
    Baban Gain, Asif Ekbal
  • Modular Multilingual Language Models with Language-Specific Embeddings
    Nalin Kumar, Ondrej Dusek
  • Expert Disagreement as Signal: Evaluating Clinical NLG Without Reference Reports
    Yongxin Zhou, Fabien Ringeval, François Portet
  • DBpedia Triple Set Validation for Consistent NLG Inputs
    Mark Andrade, Simon Mille, Anya Belz, Brian Davis
  • Stress Testing NLG Evaluation Metrics with Fine-Grained Semantic Contrasts
    Lasha Abzianidze
  • Calculation Is Not Insight: Qualitative Reasoning for Data-to-Text Generation
    Kristýna Onderková