University of Nevada Las Vegas / Concorde Career Colleges (Young & Matthews)
LoRA-adapted domain-specialized cardiology text embedding model built on MPNet-base (109M parameters), identified as Pareto-optimal for balanced accuracy/throughput deployment among 10 encoder- and decoder-style architectures benchmarked for cardiology semantic retrieval. LoRA fine-tuning on ~150,000 cardiology-textbook-derived sentence pairs raised its cardiology semantic-separation score from 0.175 (zero-shot) to 0.386, while delivering 228.8 embeddings/sec at a sub-1GB (0.73GB) memory footprint, making it suitable for consumer-GPU and general-purpose medical NLP deployment where full BioLinkBERT-level accuracy is not required.
Architecture
Transformer
MPNet-base (109M-parameter masked-and-permuted pretraining transformer encoder) adapted via LoRA (rank 16, attention query/value projections) with an InfoNCE contrastive objective on cardiology textbook sentence pairs
Framework
PyTorch
Added to catalog
2026-08-10
Apache 2.0
License for model weights only. Associated code may be licensed seperately, check code source for specific terms.
Cardiology Textbook Sentence-Pair Corpus (CardioEmbed family)
~150,000 anchor-positive sentence pairs derived from 7 cardiology textbooks; text corpus, not human-subject data
Domain-specialized cardiology text embedding for semantic retrieval and similarity search (balanced accuracy/throughput deployment)