← 返回日报
🌐 机器翻译 · DeepSeek · ArXiv

GuideSkill: Evolving Executable LLM Agent Skills for Guideline-Grounded Clinical Reasoning


摘要: 临床实践指南(CPGs)编码了诊断标准,但大语言模型(LLM)系统通常检索指南文本或通过训练吸收指南内容,而非执行其规则。我们提出了 GuideSkill,一个外部推理层,可将疾病特定标准编译为返回有序诊断支持分数的可执行函数。GuideSkill-Zero 从指南初始化,而 GuideSkill-Evo 使用病例-诊断对来优化覆盖的技能并补充缺失的诊断。在推理时,LLM 提出鉴别诊断,锚定每个匹配技能所需的特征,并将其排序与已执行技能得分相融合。在四个基准测试和四个基础模型上,GuideSkill-Zero 相较于指南 RAG 将宏平均准确率平均提升了 13.45%。GuideSkill-Evo 在每个基础模型上均取得了最高的宏平均值,相较于直接推理相对提升了 18.49%,并将金标准技能覆盖率从 56.5% 提升至 99.5%。在 Qwen3.5-9B 上,它还在不更新基础模型的情况下,比最强的参数更新基线高出 11.16%。专家评估进一步表明,GuideSkill 能产生临床合理且广泛可接受的技能,这表明其初始化和进化后的规则是可靠且具有实际意义的。这些结果支持将可执行技能作为一种与模型无关的机制,用于结合指南衍生的流程与病例衍生的诊断模式。

📖 阅读原文 →