Explainable Vision Transformers For Clinical Decision Support In Multimodal Medical Imaging

Authors

  • S. Poornima, Dr. S. Gopinathan

Keywords:

Explainable AI; vision transformers; multimodal medical imaging; clinical decision support; interpretability; attention visualization

Abstract

Artificial intelligence (AI) models have demonstrated remarkable performance in medical image interpretation; however, their black-box nature poses challenges in clinical adoption. This study proposes an Explainable Vision Transformer (X-ViT) architecture that integrates multimodal medical imaging data and generates interpretable visual explanations aligned with clinical reasoning. The framework combines self-attention mechanisms of vision transformers with explainability modules, allowing radiologists and clinicians to visualize attention maps and feature correlations across modalities such as CT, MRI, and dermoscopy. Experimental evaluations show that X-ViT achieves competitive diagnostic accuracy while offering transparent decision support. The results emphasize the importance of interpretable deep learning in improving trust, accountability, and collaboration between AI systems and healthcare professionals.

Downloads

Published

2025-10-28

How to Cite

S. Poornima, Dr. S. Gopinathan. (2025). Explainable Vision Transformers For Clinical Decision Support In Multimodal Medical Imaging. Acta Scientiae, 26(3), 154–159. Retrieved from https://www.periodicos.ulbra.org/index.php/acta/article/view/535

Issue

Section

Articles