Similar Items: Anthropocentric Bias in Language Model Evaluation
- Scale Can’t Overcome Pragmatics: The Impact of Reporting Bias on Vision-Language Reasoning
- Can Language Models Learn Typologically Implausible Languages?
- A Principled Framework for Evaluating on Typologically Diverse Languages
- Accelerating Language Model Workflows with Prompt Choreography
- RELIC: Evaluating Complex Reasoning via the Recognition of Languages In-Context
- IssueBench: Millions of Realistic Prompts for Measuring Issue Bias in LLM Writing Assistance