MTRAG-UN: A Benchmark for Open Challenges in Multi-Turn RAG ConversationsSara RosenthalYannis Katsiset al.2026ACL 2026Short paper
SemEval-2026 Task 8: MTRAGEval: Evaluating Multi-Turn RAG ConversationsSara RosenthalYannis Katsiset al.2026ACL 2026Workshop
MTRAG: A Multi-Turn Conversational Benchmark for Evaluating Retrieval-Augmented Generation SystemsYannis KatsisSara Rosenthalet al.2025ACL 2025Conference paper
InspectorRAGet: An Introspection Platform for RAG EvaluationBenjamin SznajderKshitij Fadniset al.2025NAACL 2025Demo paper
Creating Conversational Datasets for Retrieval-Augmented Generation Applications is Hard: Challenges & Research OpportunitiesMaeda HanafiKshitij Fadniset al.2025CHI 2025Short paper
Machine-Assisted Error Discovery in Conversational AI SystemsMaeda HanafiFrederick Reisset al.2024CHI 2024Short paper
Zero-shot Topical Text Classification with LLMs - an Experimental StudyAvishai GretzAlon Halfonet al.2023EMNLP 2023Paper
Label Sleuth: From Unlabeled Text to a Classifier in a Few HoursEyal ShnarchAlon Halfonet al.2022EMNLP 2022Demo paper
Knowledge-augmented Risk Assessment (KaRA): a hybrid-intelligence framework for supporting knowledge-intensive risk assessment of prospect candidatesMaeda HanafiYannis Katsiset al.2022EMNLP 2022Workshop paper
InteractEva: A Simulation-Based Evaluation Framework for Interactive AI SystemsYannis KatsisMaeda Hanafiet al.2022AAAI 2022Demo paper