When Chain-of-Thought Backfires: Evaluating Prompt Sensitivity in Medical Language Models
Published in 2nd International Conference on Applied Artificial Intelligence (2AI), 2026
We show how chain-of-thought prompting can paradoxically degrade the performance of medical language models, revealing unexpected prompt sensitivity in clinical reasoning tasks.
Recommended citation: Sadanandan, B., & Behzadan, V. (2026). When Chain-of-Thought Backfires: Evaluating Prompt Sensitivity in Medical Language Models. 2nd International Conference on Applied Artificial Intelligence (2AI).
Download Paper
