摘要当前在健康食品政策领域使用大型语言模型进行信息提取的方法常常受到多种因素的阻碍包括由政策文档的结构多样性和不一致性所引发的错误信息具体表现为幻觉、错误分类和遗漏。为解决这些局限本研究提出了一种基于角色扮演的大型语言模型框架通过分配专门的角色来自动从非结构化政策数据中提取信息由担任政策分析师的大语言模型负责元数据和机制分类由担任法律策略专家的大语言模型负责识别复杂的法律方法由担任食品系统专家的大语言模型负责对食品系统各阶段进行分类。该框架通过将结构化的领域知识包括法律方法的明确定义和分类标准融入特定角色的提示词中模拟了专家的工作流程。我们使用健康食品政策项目数据库中608项健康食品政策对框架进行了评估并以Llama-3.3-70B模型为基座将其性能与零样本、少样本和思维链基线进行了比较。我们提出的框架在复杂推理任务中表现出优越的性能为从健康政策中自动化提取信息提供了一种可靠且透明的方法。关键词大型语言模型健康政策信息提取健康信息学1 引言美国的公共卫生政策制定工作正以前所未有的规模和复杂性运行[2]。每年联邦、州和地方各级都会颁布成千上万项与健康相关的政策[3]。这些政策代表着塑造人口健康结果的关键干预措施然而其庞大的数量和多样性给试图理解政策如何实施的研究人员带来了根本性的挑战[19]。大型语言模型的出现为应对这种规模化挑战提供了一个有前景的机遇。大型语言模型无需特定任务训练即可处理自然语言的能力使其对政策研究特别有吸引力因为在政策研究领域异构的文档格式和快速演变的领域限制了构建专用提取系统的可行性[8]。然而将大型语言模型直接应用于健康政策信息提取仍然充满挑战且相关研究尚不充分。与具有一致模式的标准数据集不同健康政策数据展现出的特性使其极易受到大型语言模型错误信息的影响[13]。首先政策涵盖多种法律机制例如法律、行政命令、行政法规和实质性类别需要特定领域的推理才能正确分类。其次数据收集自异构来源其格式、术语和详细程度各不相同常常需要量身定制的提取流程。第三准确的分类既需要解析正式的法律结构也需要解读政策意图——这些任务超出了通用提示词设计的能力范围。这些挑战表现为幻觉、错误分类和遗漏这可能会破坏下游的政策分析和决策[10, 14, 4]。当前改进基于大型语言模型提取的方法通常处于两个极端。一端是重量级解决方案例如微调或基于智能体的系统它们可以提升性能但需要大量的标注数据、工程开销和系统复杂性这限制了它们在快速演变的政策领域中的实用性。另一端是轻量级方法例如零样本、少样本或思维链提示这些方法易于部署但往往缺乏结构化推理无法可靠地处理多维分类任务。在本工作中我们将我们的方法定位为一个中间地带一种轻量级但结构化的基于大型语言模型的替代方案能够在无需承担完整系统重新设计成本的情况下提高信息提取的可靠性。我们提出了一种基于角色扮演的提示框架将政策提取分解为专门的分析角色。具体来说该框架为大型语言模型分配了三个互补的角色负责元数据和机制分类的政策分析师负责识别复杂法律方法的法律策略专家以及负责对食品系统内各阶段进行分类的食品系统专家。为了支持具有领域意识的推理我们将结构化的领域知识如政策分类方案、法律机制和分类标准直接融入了特定角色的提示词中。这种设计在一个纯粹的基于提示的架构中引入了模块化的任务分解能够在保持基于提示方法的灵活性和低运营成本的同时实现更一致和可解释的推理。通过弥合简单提示策略与资源密集型系统重新设计之间的差距我们的框架为可扩展的健康政策信息提取提供了一种高效且实用的解决方案。