2025_NIPS_LLM Meeting Decision Trees on Tabular Data
文章核心总结本文提出一种名为DeLTa的表格数据预测方法,通过逻辑决策树规则作为中介整合大语言模型(LLMs),解决现有LLM-based表格数据方法的数据序列化局限性与模型适配难题,在分类和回归任务的全数据及低数据场景下均实现最优性能。核心创新点中介机制创新:以决策树规则为中介连接LLMs与表格数据,避免将表格数据序列化为自然语言,既无需依赖特征名称,又保护样本级隐私。规则优化策略:利用LLMs的推理能力,将随机森林生成的多组决策树规则精炼为单一优化规则,提升叶节点内样本的统计一致性。误差校正框架:基于精炼规则构建梯度网络,学习样本特异性误差校正向量,将原始决策树预测向“误差减少”方向校准,无需微调LLM。场景适配性:支持全数据与低数据场景,兼容分类和回归任务,且计算效率高,仅需为每个数据集查询一次LLM生成精炼规则。翻译部分(Markdown格式)Abstract表格数据在医疗、金融等多个现实领域中发挥着关键作用。随着大型语言模型(LLMs)的近期成功,已有研究尝试将LLMs扩展至表格数据领域。这些基于LLM的方法通常先将表格数据序列化为自然语言描述,再对LLMs进行微调或直接基于序列化数据推理。然而,这些方法存在两个关键固有问题:(i)数据层面:现有