← 返回日报
🌐 机器翻译 · DeepSeek · ArXiv

ClinLens: Towards Long-Horizon Coding Agents for Longitudinal Multimodal Clinical Data Science


摘要:临床数据科学智能体必须将异构的纵向记录转化为可审计的分析,然而现有基准测试大多局限于医学问答、结构化表格推理或通用科学数据库。我们提出 CLINLENS 基准,包含基于五个相互关联的 MIMIC 数据源的 200 个可执行任务,涵盖结构化电子健康记录、临床笔记、心电图、胸部X光片和超声心动图。一个 4×5 分类体系交叉了四种患者时间范围与五种分析能力。采用“程序优先反向合成”方法,将每个有界半原始数据包与评估者私有的参考工作流配对,并检查所需工件、队列及时序语义以及最终答案。在固定的 126 个任务集上,24 种标准化模型-脚手架配置中表现最强的方案实现了 56.3% 的范围宏观 STRICTPASS 指标,尽管 EXECSUCCESS 达到 100%。作为参考,一个单独配置的编码智能体解决了 126 个任务中的 83 个,而五个针对 GPT-4o-mini 适配的生物医学系统最多仅达到 2.9% 的范围宏观 STRICTPASS。这些结果揭示了可运行提交与正确临床分析之间的巨大差距。

📖 阅读原文 →