Cura 1T: Specialized Model for Agentic Healthcare
arXiv · HuggingFace · ▲28
摘要(原文)
Healthcare spans high-stakes communication, expert reasoning, and workflow execution, yet specialized LLMs that cover these use cases together remain limited. A healthcare model must handle patient consultation, clinical reasoning over text and images, interactive diagnosis, and electronic health record (EHR) tool use. These capabilities fail in different ways, and a narrow update for one task can degrade another. We present Cura 1T, a healthcare-specialized LLM trained through a human-gated self-evolution loop. In each evolution round, a training agent plans a target capability, trains the model, evaluates benchmark trajectories, and refines the data mixture from observed failures. This data-centered loop improves the model through targeted synthetic and curated examples rather than a single generic medical-data update. Across the healthcare evaluation suite, Cura 1T ranks at or near the top among frontier baselines, while remaining competitive on out-of-domain reasoning and agentic benchmarks.
摘要(中译)
医疗保健涵盖了高风险沟通、专家推理和工作流程执行,然而能够同时覆盖这些使用场景的专业大语言模型(LLM)仍然有限。医疗保健模型必须处理患者咨询、基于文本和图像的临床推理、互动诊断以及电子健康记录(EHR)工具的使用。这些能力在不同方面存在不足,针对一项任务的狭隘更新可能会降低另一项任务的表现。我们推出了Cura 1T,这是一款通过人类门控自我进化循环训练的医疗保健专业大语言模型。在每一轮进化中,训练代理会规划目标能力,训练模型,评估基准轨迹,并根据观察到的失败情况优化数据混合。这个以数据为中心的循环通过有针对性的合成和精心挑选的示例来改进模型,而不是进行单一的通用医疗数据更新。在医疗保健评估套件中,Cura 1T在前沿基线中排名前列或接近前列,同时在域外推理和代理基准测试中保持竞争力。
背景剖析
背景剖析
1. 技术背景与真实需求
医疗领域需要兼顾高风险沟通、专业推理和流程执行的能力,例如医生与患者对话需遵循临床指南,诊断时需结合文本和影像分析,以及通过电子健康记录(EHR)工具完成长期诊疗任务。这些场景要求模型既能提供准确的临床建议,又能在多轮交互中保持逻辑一致性,同时避免错误决策(如漏诊或工具调用失败)。然而,现有模型往往只能单一优化某项任务,难以兼顾复杂场景下的综合表现。
2. 之前的问题与局限
尽管前沿语言模型在单独的医疗任务(如医学问答或影像分析)上取得进展,但实际部署中面临三大挑战:
- 任务冲突:针对某项任务优化的模型可能在其他任务中表现下降(例如,增强诊断能力可能导致工具调用格式错误)。
- 数据碎片化:医疗数据分散在指南、病历、影像和交互记录中,且高质量监督信号稀缺(如某些诊断结果无法简单验证)。
- 失败模式多样:不同任务的错误类型(如遗漏关键信息或推理脆弱性)需要不同的修复策略,单一数据更新难以平衡。
3. 本文的解法
论文提出Cura 1T,通过“人类门控自进化循环”解决上述问题。该框架让AI代理自主规划目标(如提升多轮诊断能力)、训练模型、评估结果,并从失败中迭代优化数据混合策略。例如,若模型在影像分析中漏诊,代理会针对性补充相关数据,而非全局调整。这种方法避免了传统“一刀切”式训练的缺陷,通过合成数据和真实案例的混合,逐步提升模型的综合能力。
4. 切入角度的关键差异
与先前工作不同,Cura 1T的核心创新在于:
- 任务协同优化:同时针对患者互动、临床推理和EHR工具使用设计训练流程,而非孤立优化单个任务。
- 数据驱动的迭代:依赖AI代理自动分析失败模式并生成改进方案,减少人工干预,提高效率。
- 泛化能力保留:在专注医疗能力的同时,确保模型在数学推理等非医疗基准测试中不损失性能,证明其训练策略的平衡性。
这一设计使Cura 1T在医疗基准测试中表现领先,同时为未来“通用+专业”的AI模型开发提供了新思路。



