Similar Items: Automatic Reviewers Fail to Detect Faulty Reasoning in Research Papers: A New Counterfactual Evaluation Framework
- Automatic Machine Translation Detection Using a Surrogate Multilingual Translation Model
- Modelling Analogies and Analogical Reasoning: Connecting Cognitive Science Theory and NLP Research
- LLA MADRS: Evaluating Open-Source LLMs on Real Clinical Interviews—To Reason or Not to Reason?
- Automatic speech recognition for Armenian dialects
- Anankastic conditionals and the default theory of reasons
- RELIC: Evaluating Complex Reasoning via the Recognition of Languages In-Context