← 返回日报
🌐 机器翻译 · DeepSeek · ArXiv

GxP-Agent: Process-DAG Topology for Reliable Clinical Trial Programming with LLM Agents


摘要: 临床试验编程——根据CDISC标准将研究方案转换为可用于分析的数据集——是监管申报中的一个瓶颈,然而基于LLM的代码生成在此任务上严重失败:在五次前沿模型的11次单次尝试中,没有一次能生成有效的受试者水平分析数据集。我们提出了GxP-Agent,一个多智能体系统,将监管流程顺序编码为有向无环图(DAG),将庞大的数据集生成任务分解为15个由工作智能体执行的领域特定节点,这些智能体具备pharmaverse技能上下文、验证门控和条件重试机制。在CDISC-Bench(一个基于FDA试点申报CDISCPilot01构建的新型执行基准,包含254名受试者、49个真实ADSL变量)上,使用Claude Sonnet 4.6的GxP-Agent在三次独立运行中实现了100%的结构匹配(49/49个变量,254条正确记录),而最佳检索增强基线的匹配率为59.2%,所有单智能体和扁平多智能体方法的匹配率均为0%。DAG拓扑还使较弱的模型受益:GPT-4.1在相同DAG下实现了59.2%的平均结构匹配率,而在其他所有架构下其得分均为0%。该方法可推广至ADAE(不良事件;9节点分支DAG,55个变量,1,191条记录),并在首次尝试中即实现了100%的结构匹配。这些结果表明,将领域流程知识编码为图拓扑——而非仅依赖LLM推理——是实现可靠、符合GxP规范的临床试验编程的关键推动因素。

📖 阅读原文 →