Vision-language fusion for clinical image QA. Cross-attention BioViL-T + Mistral-7B QLoRA, MC Dropout confidence, Grad-CAM explainability, dual local/API inference. GPT-4o baseline: 56% on VQA-RAD with 41% abstention.
nextjs grad-cam pytorch medical-imaging uncertainty-quantification radiology mistral multimodal fastapi monte-carlo-dropout medical-vqa vision-language-model biovil vqa-rad
-
Updated
Aug 10, 2026 - Python