When Chain-of-Thought Backfires: Evaluating Prompt Sensitivity in Medical Language Models

Published in 2nd International Conference on Applied Artificial Intelligence (2AI), 2026

arXiv

We show how chain-of-thought prompting can paradoxically degrade the performance of medical language models, revealing unexpected prompt sensitivity in clinical reasoning tasks.

Recommended citation: Sadanandan, B., & Behzadan, V. (2026). When Chain-of-Thought Backfires: Evaluating Prompt Sensitivity in Medical Language Models. 2nd International Conference on Applied Artificial Intelligence (2AI).
Download Paper