China University of Geosciences / Beijing Normal University (Zhao, Kang et al.)
Multimodal large language model for ECG medical-report generation and cardiology conversational question-answering. An ECG-CoCa encoder (contrastive ECG-report pretraining in the style of OpenCLIP) is paired with a LLaVA-style vision-language architecture and an LLM backbone, fine-tuned on a purpose-built 45k-example ECG-instruction dataset (19k diagnosis examples + 25k multi-turn dialogue examples) built from five public 12-lead ECG datasets. Produces free-text diagnostic reports and supports zero-shot ECG-report retrieval classification.
Architecture
Hybrid
ECG-CoCa contrastive ECG-text encoder feeding a LLaVA-style vision-language architecture with an LLM backbone, for report generation and multi-turn dialogue
Framework
PyTorch
Added to catalog
2026-08-10
12-lead ECG multi-label arrhythmia-classification dataset released for the 2018 China Physiological Signal Challenge.
45,152 12-lead, 10-second ECGs from Chapman University / Shaoxing People's Hospital / Ningbo First Hospital with arrhythmia diagnoses; ~56% male / 44% female.
800,035 12-lead ECG-report pairs from 161,352 subjects at Beth Israel Deaconess Medical Center.
52% male / 48% female; age range 0-95 (median ~62). 21,837 10-second 12-lead ECG records.
Large-scale, multi-label 12-lead ECG database with standardized diagnostic statements from Shandong Provincial Hospital.
Free-text ECG diagnostic report generation and multi-turn conversational QA
Zero-shot multi-label ECG diagnosis via ECG-report retrieval (CKEPE prompting)