The Mighty ToRR: A Benchmark for Table Reasoning and Robustness in LLMsShir Ashury TahanYifan Maiet al.2026ACL 2026Workshop paper
CARES: Context-Aware Resolution Selector for VLMsMoshe KimhiNimrod Shabtayet al.2026ACL 2026Workshop paper
SemEval-2026 Task 8: MTRAGEval: Evaluating Multi-Turn RAG ConversationsSara RosenthalYannis Katsiset al.2026ACL 2026Workshop
Test-Time Verification for Text-to-SQL via Outcome Reward ModelsGaetano RossielloDario Di Palmaet al.2026ACL 2026Workshop