← 返回日报
🌐 机器翻译 · DeepSeek · ArXiv

ClinLens: Towards Long-Horizon Coding Agents for Longitudinal Multimodal Clinical Data Science


摘要: 临床数据科学智能体必须将异构的纵向记录转化为可审计的分析,然而现有基准大多局限于医学问答、结构化表格推理或通用科学数据库。我们推出了 CLINLENS,一个包含 200 个可执行任务的基准,涵盖五个相互关联的 MIMIC 数据资源,包括结构化电子健康记录、临床笔记、心电图、胸部X光片和超声心动图。一个 4×5 的分类体系将四种患者时间范围与五种分析能力交叉组合。程序优先的反向合成方法将每个有界半原始数据包与评估者私有的参考工作流配对,并检查所需产物、队列和时间语义以及最终答案。在固定的 126 个任务套件上,24 种标准化模型-脚手架配置中最强的配置达到了 56.3% 的范围宏平均 STRICTPASS,尽管 EXECSUCCESS 为 100%。作为参考,一个单独配置的编码智能体解决了 126 个任务中的 83 个,而五个适配到 GPT-4o-mini 的生物医学系统最多仅达到 2.9% 的范围宏平均 STRICTPASS。这些结果揭示了可运行提交与正确临床分析之间的巨大差距。

📖 阅读原文 →