Locally Coherent Parallel Decoding in Diffusion Language ModelsMichael HerscheNicolas Menetet al.2026ICML 2026Conference paper
A foundation model with multi-variate parallel attention to generate neuronal activityFrancesco CarzanigaMichael Herscheet al.2026ICLR 2026Conference paper
THOMPSON SAMPLING VIA FINE-TUNING OF LLMSNicolas MenetAleksandar Terzicet al.2026ICLR 2026Conference paper
Scalable Evaluation and Neural Models for Compositional GeneralizationGiacomo CamposampieroPietro Barbieroet al.2025NeurIPS 2025Conference paper
Structured Sparse Transition Matrices to Enable State Tracking in State-Space ModelsAleksandar TerzicNicolas Menetet al.2025NeurIPS 2025Conference paper
I-RAVEN-X: Benchmarking Generalization and Robustness of Analogical and Mathematical Reasoning in Large Language and Reasoning ModelsGiacomo CamposampieroMichael Herscheet al.2025NeurIPS 2025Workshop paper
A foundation model with multi-variate parallel attention to generate neuronal activityFrancesco CarzanigaMichael Herscheet al.2025NeurIPS 2025Workshop paper
Practical Lessons on Vector-Symbolic Architectures in Deep Learning-Inspired EnvironmentsFrancesco CarzanigaMichael Herscheet al.2025NeSy 2025Conference paper
Can Large Reasoning Models do Analogical Reasoning under Perceptual Uncertainty?Giacomo CamposampieroMichael Herscheet al.2025NeSy 2025Conference paper