Text datasets
26 datasets · 4,026,834 samples · 581.8 GB total - this page indexes every EyeDataHub resource tagged as containing text data. A resource can appear on more than one modality page.
| Name | Full name | Samples | Size | License | Backend |
|---|---|---|---|---|---|
fundus_cc_2_5m | Fundus-CC-2.5M Text Corpus | 2,500,000 | 5.0 GB | unknown | HuggingFace Hub |
ocular_chat_vqa | OcularChat-VQA: AREDS-Derived Patient-Physician Dialogue Dataset | 844,000 | 8.0 GB | cc-by-nc-sa | HuggingFace Hub |
ophora | Ophora-160K: Ophthalmic Surgical Video Instruction Dataset | 160,185 | 500.0 GB | unknown | HuggingFace Hub |
fundus_105k | Fundus-105K Text Dataset | 105,000 | 0.5 GB | unknown | HuggingFace Hub |
eyecare_100k | Eyecare-100K: Multimodal Ophthalmology VQA Corpus | 102,000 | 30.0 GB | unknown | HuggingFace Hub |
angioreport | AngioReport Fundus Angiography Report Dataset | 55,361 | Not reported | unknown | Manual (upstream-gated) |
ophthalmology_mcqa_v3 | Ophthalmology-MCQA-v3 | 51,745 | 0.1 GB | unknown | HuggingFace Hub |
ophthalmology_eqa_v3 | Ophthalmology-EQA-v3 | 49,300 | 0.1 GB | unknown | HuggingFace Hub |
ffa_ir | FFA-IR Medical Report Dataset | 47,247 | Not reported | unknown | PhysioNet |
ophthalmology_pubmed_corpus | Ophthalmology PubMed Corpus | 39,794 | 0.2 GB | unknown | HuggingFace Hub |
lmod_plus | LMOD+ Multimodal Ophthalmology Benchmark | 32,633 | Not reported | unknown | Manual (upstream-gated) |
x_pcr | X-PCR Ophthalmology Progressive Clinical Reasoning Benchmark | 18,700 | 5.0 GB | unknown | HuggingFace Hub |
deepeyenet | DeepEyeNet (DEN): Fundus Report Generation Dataset | 15,709 | 5.0 GB | research-only | Manual (upstream-gated) |
ru_medical_texts_ophthalmology | Ophthalmology Russian-English Medical Text Translations | 3,473 | 0.0 GB | cc-by | Kaggle |
belo | BELO Benchmark for Evaluating Language Models in Ophthalmology | 900 | Not reported | unknown | Manual (upstream-gated) |
fundus_report_dataset | Fundus Report Dataset | 422 | 0.5 GB | cc-by | HuggingFace Hub |
csdi | CSDI: Cataract Severity Diagnostic Image Dataset | 187 | 1.0 GB | cc-by | HuggingFace Hub |
soul_octa | SOUL: OCTA Human-Machine Collaborative Annotation Dataset | 178 | 0.1 GB | cc-by | Figshare |
mm_retinal_reason | MM-Retinal-Reason: Ophthalmology Multimodal Reasoning Dataset | Not reported | 15.0 GB | unknown | HuggingFace Hub |
fairvlmed | FairVLMed: Fair Vision-Language Medical Ophthalmic Dataset | Not reported | 10.0 GB | unknown | HuggingFace Hub |
dme_vqa | Diabetic Macular Edema Visual Question Answering Dataset | Not reported | 0.1 GB | cc-by | Zenodo |
dme_vqa_logical | DME VQA Dataset with Logical Relations | Not reported | 0.1 GB | cc-by | Zenodo |
ophtho_readability | Language and Readability Barriers in Ophthalmology Dataset | Not reported | 0.0 GB | cc-by | Zenodo |
ophthalvqa | OphthalVQA Dataset | Not reported | 0.0 GB | cc-by | Figshare |
ophthalwechat | OphthalWeChat Dataset | Not reported | 0.0 GB | cc-by | Figshare |
lmod_cataract_1k_cot | Cataract-1K Surgical Analysis Chain-of-Thought Dataset | Not reported | 1.0 GB | mit | HuggingFace Hub |