OncoTriad-QA: A Patient-Level Radiology-Pathology-Genomics Benchmark for Pan-Cancer Reasoning

OncoTriad-QA: A Patient-Level Radiology-Pathology-Genomics Benchmark for Pan-Cancer Reasoning

OncoTriad-QA:用于泛癌推理的患者级放射学-病理学-基因组学基准

Abstract: Cancer diagnosis and characterization require integrating complementary evidence from radiology, pathology, genomics, and clinical metadata. However, most medical large language model (LLM) and vision-language model (VLM) benchmarks focus on isolated modalities or narrow image-text tasks, leaving patient-level oncology assessment across multiple evidence streams largely untested. 摘要: 癌症的诊断与表征需要整合来自放射学、病理学、基因组学和临床元数据的互补证据。然而,大多数医学大语言模型(LLM)和视觉-语言模型(VLM)基准测试主要集中在单一模态或狭窄的图文任务上,导致跨多种证据流的患者级肿瘤学评估在很大程度上仍未得到充分验证。

We introduce OncoTriad-QA, a patient-level radiology-pathology-genomics benchmark for pan-cancer question answering. OncoTriad-QA contains 86.1k semantic questions across 9,281 TCGA patient cases from 32 cancer cohorts, aligning CT/MRI radiology, whole-slide histopathology, somatic mutations, copy-number alterations, DNA methylation, bulk RNA-seq, and clinical metadata. 我们推出了 OncoTriad-QA,这是一个用于泛癌问答的患者级放射学-病理学-基因组学基准。OncoTriad-QA 包含来自 32 个癌症队列的 9,281 例 TCGA 患者病例,涵盖 8.61 万个语义问题,并对齐了 CT/MRI 放射影像、全切片组织病理学、体细胞突变、拷贝数变异、DNA 甲基化、批量 RNA-seq 以及临床元数据。

Case-specific annotations are constructed through a source-grounded LLM-assisted pipeline using curated labels, diagnostic reports, molecular profiles, and modality-derived evidence as primary sources of truth, with automated consistency checks and clinician review. 病例特定的标注是通过一个基于源的 LLM 辅助流程构建的,该流程使用精选标签、诊断报告、分子图谱和模态衍生证据作为主要事实来源,并辅以自动一致性检查和临床医生审核。

We also introduce OncoVLM, a reference multimodal model that maps modality-native radiology, pathology, DNA methylation, and RNA-seq evidence into an LLM interface through learned projectors. Experiments show that existing general-purpose and medical LLMs remain limited on comprehensive pan-cancer QA, especially when questions require integrating imaging findings, tumor morphology, and molecular evidence. 我们还推出了 OncoVLM,这是一种参考多模态模型,通过学习到的投影器将模态原生的放射学、病理学、DNA 甲基化和 RNA-seq 证据映射到 LLM 接口中。实验表明,现有的通用和医学 LLM 在全面的泛癌问答方面仍然存在局限性,特别是在问题需要整合影像学发现、肿瘤形态学和分子证据时。

After fine-tuning on OncoTriad-QA, OncoVLM exceeds MedGemma-4B by an average of 10.7 points when using MCQ accuracy and BERTScore-F1, with consistent gains across multiple-choice and open-ended questions under radiology-only, pathology-only, and all-available settings. These results demonstrate the benchmark’s value for training and evaluating models for integrated cancer question answering. 在 OncoTriad-QA 上进行微调后,OncoVLM 在使用 MCQ 准确率和 BERTScore-F1 指标时,平均比 MedGemma-4B 高出 10.7 分,并且在仅放射学、仅病理学和全模态可用设置下的选择题和开放式问题中均表现出持续的性能提升。这些结果证明了该基准在训练和评估集成癌症问答模型方面的价值。