When Chain-of-Thought Backfires: Evaluating Prompt Sensitivity in Medical Language Models
Published in 2AI Conference 2026, 2026
This companion study examines prompt sensitivity in text-only medical language models. It shows that chain-of-thought prompting can backfire, degrading answers on some clinical prompts where it was expected to help, and connects prompt-induced instability in language-only models to the dissertation’s paraphrase-sensitivity theme.
Recommended citation: Sadanandan, B., & Behzadan, V. (2026). When chain-of-thought backfires: Evaluating prompt sensitivity in medical language models. 2AI Conference 2026. arXiv:2603.25960.
Download Paper
