General-purpose models outperform medical-specialized ones (76.6% vs 51.3% hallucination-free). CoT cuts errors in 86.4% of cases; residual failures are mostly reasoning-based. 91.8% of clinicians encountered them. #MedicalAI #LLMHallucination #FoundationModels arxiv.org/abs/2503.05777
